← 返回题库
第 171 题 · 训练与对齐 · 困难

如何识别并缓解奖励黑客和能力退化?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经高频主题;答案依据论文和官方文档原创整理
Reward Hacking过度优化能力回归
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

先定义现象:训练指标或奖励升高,但人类偏好、事实性、安全性或通用能力反而下降。接着解释原因可能是奖励模型漏洞、分布外优化、长度偏置或单一指标被过度利用。

治理不能只靠更强奖励模型。提到独立留出评审、人工抽检、多目标门禁、KL 或更新约束,以及基础能力回归集。若有追问,可进一步讲 Goodhart 定律和对抗样本。

可以这样答:

奖励黑客是模型找到提高奖励分数的捷径,却没有真正提升目标能力,例如堆长度、迎合评审风格或制造看似可信的内容。识别时要对比训练奖励与独立 Judge、人类偏好、事实性和安全指标,尤其关注两者开始背离的阶段。缓解手段包括更新奖励数据、加入对抗样本和多目标约束、限制策略偏移,并持续跑通用能力回归,不能把单一奖励当作最终质量。

核心回答

奖励黑客是模型找到了提高代理奖励、却没有真正提高目标质量的捷径,例如一味变长、迎合评审器或套用固定安全话术。能力退化则表现为目标偏好变好,但事实性、推理、格式遵循或原有通用能力下降。识别它们需要把训练奖励与独立的人类评估、隐藏测试集和通用能力回归分开比较。

展开说明

常见信号包括:

  1. 奖励模型分数持续上升,但人工盲评胜率开始下降。
  2. 输出长度和措辞明显趋同,或拒答率异常升高、降低。
  3. 训练分布内表现提高,换领域或换评审器后明显退化。
  4. 模型与参考策略的 KL 快速增大,或某些通用任务突然掉分。

缓解方式包括清洗偏好数据、使用多个互补评审信号、保留隐藏和对抗测试、限制更新幅度、早停、混入通用 SFT 数据,并对长度与格式偏差做切片评估。高风险场景仍需要人工抽检。

工程实践

把每次训练看成一次可能引入回归的软件发布:固定基线模型和数据版本,记录超参数,在 CI 中比较目标任务、通用能力、安全性和输出分布。若只有总平均分,很容易掩盖某个用户群或能力维度的严重退化。

常见追问

  1. Goodhart 定律与奖励黑客有什么关系? 当代理指标成为强优化目标后,策略会利用它与真实目标的缝隙;奖励黑客正是模型提高奖励却没有提高真实效用的表现。
  2. 如何区分安全性提升和过度拒答? 同时评测危险请求漏放和安全请求误拒,并检查是否能给出安全的部分帮助;只看拒答率无法区分二者。
  3. 为什么换一个 LLM Judge 后排名可能反转? Judge 的长度、风格、位置和自家模型偏好不同,且对领域知识覆盖不同;模型差距小时这些偏差足以改变排序。

一句话复习

奖励只是目标的代理;必须用独立评估和回归矩阵检查模型是否真的变好。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…