预训练、SFT 和偏好对齐分别解决什么问题?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
这是一道边界题,用三句短话区分阶段即可:预训练建立知识与通用表征,SFT 教会指令和格式,偏好对齐在多个可行回答中调整行为倾向。随后补一句三者的数据与目标函数不同。
面试官若问“为什么不只做 DPO”,关键是说明后置对齐不能凭空补齐基础知识,还可能损伤原有能力。可以把三阶段理解成逐层改变模型,而不是三个彼此替代的训练菜单。
可以这样答:
预训练通过下一 Token 预测获得语言、知识和通用表征;SFT 用示范答案教模型理解指令、组织内容和遵守格式;偏好对齐再利用成对偏好或奖励信号,让回答更有帮助、更安全。三者解决的问题不同:DPO 不能凭空补回预训练没学到的事实,SFT 也不能替代大规模预训练;后续阶段还可能覆盖或削弱已有能力。
核心回答
以主流自回归 LLM 为例,预训练通过大规模语料上的下一 token 预测学习语言规律、知识和通用能力;监督微调(SFT)用“指令—理想回答”样本教模型按要求完成任务;偏好对齐再利用回答排序或反馈,让模型更符合有用性、安全性、风格等偏好。三者解决的是“会不会”“听不听指令”和“更偏好哪种回答”三个不同层面。
展开说明
典型流程是:
- 预训练得到 Base Model,数据规模大,但通常缺少显式的“指令—回答”监督。
- SFT把模型转成可对话、可遵循指令的模型,答案质量高度依赖示范数据。
- 偏好对齐使用 RLHF、DPO 等方法区分多个看似合理的回答,调整行为边界。
偏好对齐不能替代领域知识建设,SFT 也不适合作为频繁更新事实的数据库。若目标是补充最新、可追溯知识,通常应优先考虑 RAG。
工程实践
每个阶段都要保留独立评估集:预训练关注通用能力,SFT 关注任务成功和格式遵循,对齐关注偏好胜率、安全与拒答边界。只看一个总分,容易把风格变化误判成能力提升。
常见追问
- 指令微调和领域继续预训练有什么区别? 领域继续预训练仍用无标注文本做下一 Token 预测,主要吸收领域语言和知识;SFT 用指令—回答监督模型按任务格式作答。
- 为什么偏好对齐前通常先做 SFT? SFT 先把策略放到能稳定遵循指令、产生合格回答的区域,偏好优化再做相对选择会更稳定,也降低无效探索成本。
- 哪些需求不值得微调模型? 只是补充频繁变化的事实、需要逐条引用或样本很少时,优先使用 RAG、Prompt 和工具;微调更适合稳定行为模式。
一句话复习
预训练建立能力,SFT 教会按指令作答,偏好对齐决定什么样的回答更合适。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。