后训练入门:让大模型从「懂语言」到「会干活」
后训练(Post-training)入门教程:预训练 vs 后训练的区别、SFT/RLHF/DPO 三种主流方法、什么场景适合做后训练(配 6 个真实案例)、什么场景不该做、工具推荐与最小可跑案例,面向工程师的速查指南。
共 6 篇文章
后训练(Post-training)入门教程:预训练 vs 后训练的区别、SFT/RLHF/DPO 三种主流方法、什么场景适合做后训练(配 6 个真实案例)、什么场景不该做、工具推荐与最小可跑案例,面向工程师的速查指南。
347 份 Agent 岗位 JD 拆解出的六块硬核能力,以及有工程背景的转岗者最短的 4 周落地路线。
用菜谱、便利贴、缩略图这些生活化类比,讲清大模型里权重、激活、KV 缓存、量化与采样到底在做什么,以及一次生成请求背后的完整链路。
RAG 系统上线后,关键不在能不能答,而在什么时候答错、为什么答错、错得有没有边界。评估要拆开检索、证据、生成和拒答。
从工具链角度讨论:Cursor 能否参与长篇网文创作,工程化如何保证前后一致,上下文窗口与 token 成本怎么取舍,并给出一套仓库结构与日常流程。
当你需要用 LLM 给成千上万个实体自动打标签,朴素做法的成本可能高到离谱。这篇文章从一个真实的自动分类脚本出发,拆解六种可复用的优化手段:层级剪枝、继承传播、批量合并、增量跳过、祖先回填和 prompt 缓存。附成本对比和通用化思路。