← 返回题库
第 055 题 · 评测与安全 · 困难

两个模型效果接近时,如何做成对评测与显著性检验?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
显著性检验Bootstrap成对评测
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

两个模型效果接近时,应让它们回答同一批题并对“逐题差值”做成对分析,而不是比较两个独立均值。连续分数可按题做 Paired Bootstrap,二元正确性可用 McNemar;同时报告效应量和置信区间,并预先定义最小有意义提升,显著不等于值得上线。

可以这样答:

两个模型应回答完全相同的问题,再对每题分数或盲评胜负做成对分析,这能消除题目难度带来的大量方差。连续指标可按题做 Paired Bootstrap 得到差值置信区间,二元正确性可用 McNemar。还要报告效应量并预先定义最小有意义提升,因为统计显著不等于业务上值得上线。

核心回答

模型比较应使用同一批样本和相同推理条件,分析每题的成对差值。Paired Bootstrap 从题目对中有放回重采样,多次计算模型差值,得到置信区间;若每题结果是两个模型各自正确或错误,可针对不一致 Pair 使用 McNemar 检验。开放生成可做匿名随机顺序的成对人工或 Judge 评审,并允许平局。

统计结论还要配合效应量、最小可接受提升和业务护栏。大量指标、模型和切片反复检验会增加假阳性,应预注册主指标或做多重比较校正。样本存在同一会话、用户或文档相关性时,应按簇重采样,而不是把每题当完全独立。

展开说明

成对设计的重点是保持请求、Prompt、工具和随机采样预算一致,只改变待比较模型。建议保存逐题结果而非只保存总分,从而分析 A 胜、B 胜、平局和共同失败。置信区间跨零表示现有样本不足以排除无差异;区间很窄但提升小于业务阈值,则统计上稳定也不值得切换。

工程实践

评测前冻结主指标、样本和解码配置;匿名化输出并随机左右顺序。对自动 Judge 先用人工子集验证一致率,做左右翻转与长度控制。报告中给逐题差值分布、Bootstrap 95% 区间、胜负平、样本量和最差切片,并保存重采样 Seed 便于复现。

常见追问

  1. 为什么成对评测比两组独立平均更有效? 同一道题对两个模型的难度相同,分析题内差值可抵消题间方差,通常需要更少样本检测同等提升。
  2. p 值很小是否说明应该换模型? 不一定。它不表示提升大小或经济价值,还要看效应量、置信区间、成本和护栏指标。
  3. 同一用户贡献多条请求时怎么处理? 这些请求并非独立,应按用户或会话做簇 Bootstrap,或先聚合到用户级再检验。

一句话复习

同题成对比较、报告差值区间和业务效应量,并控制 Judge 偏差与多重检验,才能判断小差异是否真实且值得。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…