← 返回题库
第 183 题 · 训练与对齐 · 简单

预训练、SFT 和偏好对齐分别解决什么问题?

核心必会 这代表什么?
✓ 资料核验 来源说明:公开面经高频主题;答案依据论文和官方文档原创整理
预训练SFT对齐
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

这是一道边界题,用三句短话区分阶段即可:预训练建立知识与通用表征,SFT 教会指令和格式,偏好对齐在多个可行回答中调整行为倾向。随后补一句三者的数据与目标函数不同。

面试官若问“为什么不只做 DPO”,关键是说明后置对齐不能凭空补齐基础知识,还可能损伤原有能力。可以把三阶段理解成逐层改变模型,而不是三个彼此替代的训练菜单。

可以这样答:

预训练通过下一 Token 预测获得语言、知识和通用表征;SFT 用示范答案教模型理解指令、组织内容和遵守格式;偏好对齐再利用成对偏好或奖励信号,让回答更有帮助、更安全。三者解决的问题不同:DPO 不能凭空补回预训练没学到的事实,SFT 也不能替代大规模预训练;后续阶段还可能覆盖或削弱已有能力。

核心回答

以主流自回归 LLM 为例,预训练通过大规模语料上的下一 token 预测学习语言规律、知识和通用能力;监督微调(SFT)用“指令—理想回答”样本教模型按要求完成任务;偏好对齐再利用回答排序或反馈,让模型更符合有用性、安全性、风格等偏好。三者解决的是“会不会”“听不听指令”和“更偏好哪种回答”三个不同层面。

展开说明

典型流程是:

  1. 预训练得到 Base Model,数据规模大,但通常缺少显式的“指令—回答”监督。
  2. SFT把模型转成可对话、可遵循指令的模型,答案质量高度依赖示范数据。
  3. 偏好对齐使用 RLHF、DPO 等方法区分多个看似合理的回答,调整行为边界。

偏好对齐不能替代领域知识建设,SFT 也不适合作为频繁更新事实的数据库。若目标是补充最新、可追溯知识,通常应优先考虑 RAG。

工程实践

每个阶段都要保留独立评估集:预训练关注通用能力,SFT 关注任务成功和格式遵循,对齐关注偏好胜率、安全与拒答边界。只看一个总分,容易把风格变化误判成能力提升。

常见追问

  1. 指令微调和领域继续预训练有什么区别? 领域继续预训练仍用无标注文本做下一 Token 预测,主要吸收领域语言和知识;SFT 用指令—回答监督模型按任务格式作答。
  2. 为什么偏好对齐前通常先做 SFT? SFT 先把策略放到能稳定遵循指令、产生合格回答的区域,偏好优化再做相对选择会更稳定,也降低无效探索成本。
  3. 哪些需求不值得微调模型? 只是补充频繁变化的事实、需要逐条引用或样本很少时,优先使用 RAG、Prompt 和工具;微调更适合稳定行为模式。

一句话复习

预训练建立能力,SFT 教会按指令作答,偏好对齐决定什么样的回答更合适。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…