ORPO 如何把 SFT 与偏好优化合并为一个阶段?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
ORPO 的一句话定义是把 chosen 的 SFT 似然与 chosen/rejected 的 odds ratio 偏好项放在同一目标中,且不需要单独 Reference Model。随后说明它仍要学会生成好答案,不只是做二分类;单阶段省显存和流程,却让两个目标耦合并放大偏好噪声与长度偏差。
可以这样答:
ORPO 把 SFT 与偏好优化放在一个目标中:似然项提高 chosen 的生成概率,odds ratio 项拉开 chosen 和 rejected,而且不需要单独的 Reference Model。它仍然是在训练生成模型,不只是做偏好分类。好处是流程和显存更简单,代价是两个目标耦合,对偏好噪声、长度偏差和损失权重更敏感。
核心回答
ORPO 在一个目标中同时提高 chosen 回答的似然,并用 Odds Ratio 拉开 chosen 与 rejected。目标可概括为:
\[\begin{aligned} \mathcal{L}_{\mathrm{ORPO}} &= \mathcal{L}_{\mathrm{SFT}} + \lambda\mathcal{L}_{\mathrm{OR}}, \\ \mathcal{L}_{\mathrm{OR}} &= -\log \sigma\!\left( \log \operatorname{odds}_{\theta}(y_w \mid x) - \log \operatorname{odds}_{\theta}(y_l \mid x) \right), \\ \operatorname{odds}_{\theta}(y \mid x) &= \frac{p_{\theta}(y \mid x)}{1-p_{\theta}(y \mid x)} \end{aligned}\]其中 \(\mathcal{L}_{\mathrm{SFT}}\) 是 chosen 的负对数似然。
它不需要单独冻结 Reference Model,也不要求先完成 SFT 再启动一个 DPO 阶段,因此被称为 Monolithic Preference Optimization。这里的序列概率和归一化细节必须按论文实现;直接把许多 token 概率相乘会数值下溢,应在 log 空间计算。
展开说明
只做 chosen NLL 会提高正确回答概率,却不会直接压低同 Prompt 的 rejected;只做偏好差值又可能缺少稳定的语言建模锚点。ORPO 用 SFT 项维持 chosen 的生成学习,用 Odds Ratio 项惩罚 chosen 与 rejected 不可分,从一个 Pair 同时提取绝对和相对信号。
单阶段减少了检查点和 Reference 前向成本,但并非总比“两阶段 SFT+DPO”优越。分阶段方案便于分别使用大规模指令数据和较小偏好数据、独立调参及回滚;ORPO 更依赖 Pair 中 chosen 的绝对质量,若 chosen 文本本身较差,SFT 项会直接学习这些缺陷。
工程实践
计算 Odds 时使用稳定的 log 概率函数,并测试极低序列概率下没有 NaN。监控 SFT loss、OR loss、Pair accuracy、chosen/rejected log-prob、回答长度和通用能力。调 \(\lambda\) 时检查两项梯度量级;与两阶段基线比较要保持总 token 与初始化一致,不能只比较训练阶段数量。
常见追问
- ORPO 为什么还需要 SFT 项? 它保证 chosen 本身获得标准生成学习;Odds Ratio 主要负责相对区分,二者职责互补。
- ORPO 是 Reference-free 吗? 是,它不在损失中调用冻结 Reference Policy;但初始化模型仍对训练结果形成先验。
- 单阶段一定比 SFT 后接 DPO 更好吗? 不一定。单阶段更简洁,两阶段在数据规模不同、调参隔离和回滚方面更灵活。
一句话复习
ORPO 用 \(\text{chosen NLL} + \lambda \cdot \text{Odds-Ratio preference loss}\) 在一个阶段同时学习好回答并压开坏回答,无需独立 Reference Model。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。