← 返回题库
第 047 题 · 训练与对齐 · 中等

过程监督与结果监督有什么区别?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
Process SupervisionReward Model推理
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

先用信用分配来解释差别:结果监督只评价终局,过程监督会评价中间步骤。然后结合数学、代码等可验证任务说明,结果标签便宜客观,过程标签则更容易找到首个错误位置。

被追问选哪个时,不必二选一。可以提出“可验证结果铺量、高价值难题补过程标注”的混合方案,并指出过程标签成本高、步骤定义也可能主观。

可以这样答:

结果监督只判断最终答案是否正确,标注便宜,数学验算和代码测试中尤其客观,但奖励稀疏,难以知道哪一步开始出错。过程监督逐步评价推理,信用分配更细,却需要昂贵且一致的步骤标注。两者不必二选一:可验证任务先用结果信号铺量,再在长推理和高价值难题上补过程标注,让更细的监督用在真正需要归因的地方。

核心回答

结果监督只根据最终答案是否正确给整条推理一个标签,Outcome Reward Model(ORM)学习 \(r(x,y)\);过程监督给中间步骤标注正确、错误或有效性,Process Reward Model(PRM)学习 \(r_t(x, y_{\le t})\)。PRM 能更早定位第一处错误,并在搜索时逐步筛选路径,通常提供更细的 Credit Assignment;代价是步骤标注昂贵、步骤边界和“正确过程”并不总是唯一。

在可验证数学任务上,过程监督被证明可显著改善推理选择,但不能直接推广为所有开放任务都优于结果监督。创意写作、对话帮助性或存在多条有效捷径的任务,很难给每一步定义可靠真值。

展开说明

ORM 可用最终正确性训练二元分类或排序,标签便宜,且不限制模型采用哪条路径;但一条长推理只有末尾奖励时,很难知道错误发生在哪一步,也可能把“错误过程碰巧答对”当正样本。PRM 对每个前缀输出分数,可把路径分数定义为各步最小值、乘积或累计值,具体聚合会影响对长路径的偏好。

PRM 也可能被利用:模型可拆出大量看似安全的小步骤、迎合标注模板,或因某种非标准但正确的推法被误判。过程标签应区分局部逻辑正确与最终任务贡献,并保留 ORM 或程序验证器等独立信号。

工程实践

先为“步骤”制定可重复的切分规范,统计标注者一致率和首错位置;对高分歧样本保留多标签或跳过。训练后分别测试 PRM 的逐步校准、Best-of-N 选择和对抗性过程。在线搜索中要核算每扩展一步调用 PRM 的成本,并检查长度偏差,不能只比较最终准确率。

常见追问

  1. PRM 为什么更利于 Credit Assignment? 它把反馈放到具体前缀,能指出哪一步后路径开始失效,而不必把终局奖励平均归因给全部 token。
  2. 过程监督一定比结果监督好吗? 不一定。它依赖可靠步骤定义和高质量标签;开放任务中 ORM 或可验证终局信号可能更客观。
  3. 最终答案正确但中间过程错误怎么标? ORM 可能给正分,PRM 应标出错误步骤;评测时可将答案正确性和推理可信性作为两个维度。

一句话复习

ORM 只评价终局,PRM 逐步评价推理前缀;后者信用分配更细,却需要更昂贵且更有争议的过程标签。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…