如何评估大模型置信度、校准误差与选择性回答能力?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
置信度题先说明 Token 概率并不等于整条答案正确率,再引出任务级校准。用可靠性图、ECE 或 Brier Score 解释“预测 80% 的样本是否约有 80% 正确”,随后讲拒答阈值带来的风险—覆盖率曲线;这比泛泛说“低分就拒答”更完整。
可以这样答:
模型 Token 概率高,不代表整条回答正确,所以置信度要在具体任务和分布上重新校准。我会用有标签验证集画可靠性图,计算 ECE 或 Brier Score,并考察拒答后剩余样本的选择性风险。还要权衡阈值越严格,错误率可能越低,但覆盖率和用户体验会下降。验证阶段要把模型特征、检索证据和规则信号输入校准器,按业务损失定阈值,持续监控覆盖率、选择性准确率、ECE 与人工转接率。
核心回答
校准要求“预测置信度约为 \(p\) 的样本中,长期约有 \(p\) 比例正确”。大模型的置信度可以来自选项概率、序列 Log Probability、对答案为真的自评概率,或对多次生成进行语义聚合后的不确定性;这些量含义不同,不能直接混用。生成概率高也可能只是措辞常见,不代表事实正确。
常见指标包括 ECE:把样本按置信度分桶,聚合每桶准确率与平均置信度之差;Brier Score:概率预测与二元结果的平方误差;选择性回答则看 Risk–Coverage:逐步提高拒答阈值后,剩余回答覆盖率与错误率如何变化。实际目标通常不是让模型多说“我不确定”,而是在固定覆盖率下降低风险,或在固定风险下最大化覆盖。
展开说明
开放式生成没有唯一 Token 序列。两个措辞不同的回答可能语义相同,直接比较整句概率会把语言变体误当成不同假设。语义不确定性方法尝试把多次生成聚类到相同含义后,再计算各语义答案的概率或熵。
口头置信度容易受提示和社会性表达影响,需要用独立标签校准。温度缩放等后处理只能在校准集与部署分布接近时可靠;领域、时间和输入语言变化会使阈值失效。
拒答也有代价。医疗或金融场景可能偏向低风险,客服检索则可能容忍部分不确定并展示来源。必须把错误成本、人工接管容量和用户体验纳入阈值选择。
工程实践
先明确可自动判定的正确性标签和置信度定义,再按领域、难度、语言和时间切片画 Reliability Diagram 与 Risk–Coverage 曲线。阈值只在留出的校准集上选择,在独立测试集报告结果。线上监控置信度分布、覆盖率、人工接管率和接管后的真实错误,分布漂移时重新校准;高风险任务把不确定输出路由到检索、工具或人工,而不是只换一句委婉措辞。
常见追问
- Token 概率高为什么不一定答案正确? 它反映该字符串在模型分布中的可能性,也受常见措辞影响,不是外部事实正确率。
- ECE 有什么局限? 它依赖分桶方式,整体平均还可能掩盖某些领域或置信区间的严重失准。
- 拒答越多是否越安全? 不一定。错误率可能下降,但覆盖和可用性也下降,应看完整 Risk–Coverage 权衡。
- 为什么上线后要重新校准? 数据分布、模型和工具变化会改变置信度与正确率的对应关系。
一句话复习
置信度要用真实正确率校准,并以 ECE、Brier 和 Risk–Coverage 同时衡量“相信多少”与“何时拒答”。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。