← 返回题库
第 092 题 · 评测与安全 · 困难

如何评测大模型的群体偏见与公平性?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
公平性偏见评测切片分析
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

公平性必须先绑定具体场景、群体和伤害类型,否则“降低偏见”没有可检验含义。回答可组合群体切片、最差组表现和只替换敏感属性的配对反事实,再说明交叉群体样本稀疏、标签敏感及拒答差异;治理后还要检查总体效用有没有被误伤。

可以这样答:

评测前要界定场景和伤害:是招聘建议中的机会不均,还是开放生成中的刻板印象,不能用一个偏见分数概括。评测会做群体切片和最差组分析,再用只替换敏感属性的配对反事实检查输出是否无关地变化,并让有背景的标注者审查开放回答。但群体标签敏感且交叉群体样本稀疏。上线时同时看组间差、置信区间、拒答差异和总体任务质量,治理不能靠一律拒答。

核心回答

公平评测从影响分析开始:明确产品决策、可能受影响的人群以及分配伤害、刻板印象、贬损和服务质量差异。定量上按群体及交叉群体报告任务成功率、错误率、拒答率和最差组表现;用配对反事实 Prompt 只改变性别、族群等属性,检查与任务无关的输出变化。开放生成还需结合语境的人工标注。

BBQ 等 Benchmark 可提供一致的外部诊断,但不能替代本地场景。结果需要置信区间,因为小群体样本方差很大。治理后必须重新评估业务效用和过度拒答,避免通过不给任何群体服务来制造表面公平。

展开说明

“公平”可能指组间错误率接近、最差组达到门槛或个体反事实稳定,多个定义不一定能同时满足。还要区分模型固有偏差、Prompt 和检索语料偏差、产品界面与人类决策造成的系统偏差。人口属性的采集与使用必须经过隐私和合规审查,不能为了评测扩大数据风险。

工程实践

与领域和受影响群体共同定义标签手册,保存标注分歧而非强行一致。每个版本固定跑配对集、真实切片和挑战集;样本不足的组不做过度结论,而是报告区间并补采。错误回放要隐藏不必要身份信息,治理方案通过 Canary 观察真实投诉和服务差异。

常见追问

  1. 群体平均准确率相同就公平吗? 不一定。严重错误、拒答和不同子任务可能集中在某群体,平均值会掩盖最差组与伤害类型。
  2. 为什么要做配对反事实? 它尽量固定其他内容,只改变敏感属性;若输出出现无任务依据的变化,更容易定位差别对待。
  3. 删除人口属性词能消除偏见吗? 不能。姓名、地区和语境可能成为代理变量,训练语料和系统决策链也仍会携带偏差。

一句话复习

公平评测先定义场景、群体和伤害,再用切片、反事实与人工审查找最差组,同时检查治理后的效用和误拒。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…