两个模型效果接近时,如何做成对评测与显著性检验?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
两个模型效果接近时,应让它们回答同一批题并对“逐题差值”做成对分析,而不是比较两个独立均值。连续分数可按题做 Paired Bootstrap,二元正确性可用 McNemar;同时报告效应量和置信区间,并预先定义最小有意义提升,显著不等于值得上线。
可以这样答:
两个模型应回答完全相同的问题,再对每题分数或盲评胜负做成对分析,这能消除题目难度带来的大量方差。连续指标可按题做 Paired Bootstrap 得到差值置信区间,二元正确性可用 McNemar。还要报告效应量并预先定义最小有意义提升,因为统计显著不等于业务上值得上线。
核心回答
模型比较应使用同一批样本和相同推理条件,分析每题的成对差值。Paired Bootstrap 从题目对中有放回重采样,多次计算模型差值,得到置信区间;若每题结果是两个模型各自正确或错误,可针对不一致 Pair 使用 McNemar 检验。开放生成可做匿名随机顺序的成对人工或 Judge 评审,并允许平局。
统计结论还要配合效应量、最小可接受提升和业务护栏。大量指标、模型和切片反复检验会增加假阳性,应预注册主指标或做多重比较校正。样本存在同一会话、用户或文档相关性时,应按簇重采样,而不是把每题当完全独立。
展开说明
成对设计的重点是保持请求、Prompt、工具和随机采样预算一致,只改变待比较模型。建议保存逐题结果而非只保存总分,从而分析 A 胜、B 胜、平局和共同失败。置信区间跨零表示现有样本不足以排除无差异;区间很窄但提升小于业务阈值,则统计上稳定也不值得切换。
工程实践
评测前冻结主指标、样本和解码配置;匿名化输出并随机左右顺序。对自动 Judge 先用人工子集验证一致率,做左右翻转与长度控制。报告中给逐题差值分布、Bootstrap 95% 区间、胜负平、样本量和最差切片,并保存重采样 Seed 便于复现。
常见追问
- 为什么成对评测比两组独立平均更有效? 同一道题对两个模型的难度相同,分析题内差值可抵消题间方差,通常需要更少样本检测同等提升。
- p 值很小是否说明应该换模型? 不一定。它不表示提升大小或经济价值,还要看效应量、置信区间、成本和护栏指标。
- 同一用户贡献多条请求时怎么处理? 这些请求并非独立,应按用户或会话做簇 Bootstrap,或先聚合到用户级再检验。
一句话复习
同题成对比较、报告差值区间和业务效应量,并控制 Judge 偏差与多重检验,才能判断小差异是否真实且值得。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。