← 返回题库
第 184 题 · 训练与对齐 · 简单

偏好数据中的 chosen / rejected 样本应该如何构造?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开真实面试问题汇总中的偏好数据与奖励模型题;答案依据 InstructGPT 与 DPO 论文原创整理
偏好数据Reward ModelDPO
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

偏好对必须在同一 Prompt 和同一 Rubric 下可比较,不能让模型靠长度、格式或固定措辞猜标签。说明候选难度、盲化来源、随机顺序、多标注者、平局和分歧如何处理,再谈语义去重、长度配平与时间切分;只留高度一致样本会丢掉真实主观差异。

可以这样答:

chosen 和 rejected 必须针对同一 Prompt、同一评价标准可比较,不能让模型只凭长度、格式或固定措辞猜标签。候选难度要接近,标注时隐藏来源并随机顺序,Rubric 要明确,同时保留平局与标注分歧。只保留高度一致样本虽然更干净,却会丢掉真实的主观偏好和长尾需求。

核心回答

一条偏好样本通常包含同一个 Prompt 下更受偏好的回答 chosen 和较差回答 rejected。关键不是让两者差异越大越好,而是依据明确 Rubric 比较有用性、正确性、安全性和风格,并避免长度、固定措辞或排版成为标签捷径。样本应覆盖真实请求、困难边界和模型当前容易混淆的回答;无法稳定判断的平局或低置信样本应单独处理,而不是强行二选一。

展开说明

偏好对可以来自人工比较、线上反馈或经人工复核的模型辅助标注。人工流程要随机交换候选顺序、隐藏模型身份,并测量标注者一致性。若 chosen 几乎总是更长,模型可能学会“越长越好”;若 rejected 都有明显语法错误,训练也学不到细粒度质量判断。

奖励模型把比较转成相对分数学习,标准离线 DPO 则直接利用策略对两条回答的相对对数概率。二者都依赖偏好覆盖范围:离线数据没有呈现的失败模式,不会因为更换算法自动得到解决。

工程实践

构建数据集时记录 Rubric 维度、标注者、置信度、候选生成模型和时间。按长度差、领域、安全类型和难度切片评估,并保留独立隐藏集。上线反馈不能直接当偏好标签,例如“没有点踩”可能只是用户没有继续操作,需要先定义可解释的反馈信号。

常见追问

  1. 成对比较为什么通常比绝对打分更容易标注? 标注者只需判断相对优劣,不必在不同人的绝对量表间校准;但仍需明确 Rubric 才能减少风格偏好。
  2. 如何检测和缓解偏好数据中的长度偏差? 比较 chosen/rejected 长度分布及长度条件下胜率,做配平、截断对照或显式长度控制,并抽检长答案是否真的更好。
  3. 平局和标注者分歧应该怎样进入训练流程? 保留为不确定信号、降权或用于校准,而不是强行随机选边;高风险样本可追加专家复审。

一句话复习

好的偏好对比较的是目标质量而非表面捷径,并要保存 Rubric、置信度和生成来源以便审计。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…