← 返回题库
第 096 题 · 评测与安全 · 困难

如何评估大模型置信度、校准误差与选择性回答能力?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
CalibrationUncertaintyAbstention
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

置信度题先说明 Token 概率并不等于整条答案正确率,再引出任务级校准。用可靠性图、ECE 或 Brier Score 解释“预测 80% 的样本是否约有 80% 正确”,随后讲拒答阈值带来的风险—覆盖率曲线;这比泛泛说“低分就拒答”更完整。

可以这样答:

模型 Token 概率高,不代表整条回答正确,所以置信度要在具体任务和分布上重新校准。我会用有标签验证集画可靠性图,计算 ECE 或 Brier Score,并考察拒答后剩余样本的选择性风险。还要权衡阈值越严格,错误率可能越低,但覆盖率和用户体验会下降。验证阶段要把模型特征、检索证据和规则信号输入校准器,按业务损失定阈值,持续监控覆盖率、选择性准确率、ECE 与人工转接率。

核心回答

校准要求“预测置信度约为 \(p\) 的样本中,长期约有 \(p\) 比例正确”。大模型的置信度可以来自选项概率、序列 Log Probability、对答案为真的自评概率,或对多次生成进行语义聚合后的不确定性;这些量含义不同,不能直接混用。生成概率高也可能只是措辞常见,不代表事实正确。

常见指标包括 ECE:把样本按置信度分桶,聚合每桶准确率与平均置信度之差;Brier Score:概率预测与二元结果的平方误差;选择性回答则看 Risk–Coverage:逐步提高拒答阈值后,剩余回答覆盖率与错误率如何变化。实际目标通常不是让模型多说“我不确定”,而是在固定覆盖率下降低风险,或在固定风险下最大化覆盖。

展开说明

开放式生成没有唯一 Token 序列。两个措辞不同的回答可能语义相同,直接比较整句概率会把语言变体误当成不同假设。语义不确定性方法尝试把多次生成聚类到相同含义后,再计算各语义答案的概率或熵。

口头置信度容易受提示和社会性表达影响,需要用独立标签校准。温度缩放等后处理只能在校准集与部署分布接近时可靠;领域、时间和输入语言变化会使阈值失效。

拒答也有代价。医疗或金融场景可能偏向低风险,客服检索则可能容忍部分不确定并展示来源。必须把错误成本、人工接管容量和用户体验纳入阈值选择。

工程实践

先明确可自动判定的正确性标签和置信度定义,再按领域、难度、语言和时间切片画 Reliability Diagram 与 Risk–Coverage 曲线。阈值只在留出的校准集上选择,在独立测试集报告结果。线上监控置信度分布、覆盖率、人工接管率和接管后的真实错误,分布漂移时重新校准;高风险任务把不确定输出路由到检索、工具或人工,而不是只换一句委婉措辞。

常见追问

  1. Token 概率高为什么不一定答案正确? 它反映该字符串在模型分布中的可能性,也受常见措辞影响,不是外部事实正确率。
  2. ECE 有什么局限? 它依赖分桶方式,整体平均还可能掩盖某些领域或置信区间的严重失准。
  3. 拒答越多是否越安全? 不一定。错误率可能下降,但覆盖和可用性也下降,应看完整 Risk–Coverage 权衡。
  4. 为什么上线后要重新校准? 数据分布、模型和工具变化会改变置信度与正确率的对应关系。

一句话复习

置信度要用真实正确率校准,并以 ECE、Brier 和 Risk–Coverage 同时衡量“相信多少”与“何时拒答”。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…