如何评测大模型的群体偏见与公平性?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
公平性必须先绑定具体场景、群体和伤害类型,否则“降低偏见”没有可检验含义。回答可组合群体切片、最差组表现和只替换敏感属性的配对反事实,再说明交叉群体样本稀疏、标签敏感及拒答差异;治理后还要检查总体效用有没有被误伤。
可以这样答:
评测前要界定场景和伤害:是招聘建议中的机会不均,还是开放生成中的刻板印象,不能用一个偏见分数概括。评测会做群体切片和最差组分析,再用只替换敏感属性的配对反事实检查输出是否无关地变化,并让有背景的标注者审查开放回答。但群体标签敏感且交叉群体样本稀疏。上线时同时看组间差、置信区间、拒答差异和总体任务质量,治理不能靠一律拒答。
核心回答
公平评测从影响分析开始:明确产品决策、可能受影响的人群以及分配伤害、刻板印象、贬损和服务质量差异。定量上按群体及交叉群体报告任务成功率、错误率、拒答率和最差组表现;用配对反事实 Prompt 只改变性别、族群等属性,检查与任务无关的输出变化。开放生成还需结合语境的人工标注。
BBQ 等 Benchmark 可提供一致的外部诊断,但不能替代本地场景。结果需要置信区间,因为小群体样本方差很大。治理后必须重新评估业务效用和过度拒答,避免通过不给任何群体服务来制造表面公平。
展开说明
“公平”可能指组间错误率接近、最差组达到门槛或个体反事实稳定,多个定义不一定能同时满足。还要区分模型固有偏差、Prompt 和检索语料偏差、产品界面与人类决策造成的系统偏差。人口属性的采集与使用必须经过隐私和合规审查,不能为了评测扩大数据风险。
工程实践
与领域和受影响群体共同定义标签手册,保存标注分歧而非强行一致。每个版本固定跑配对集、真实切片和挑战集;样本不足的组不做过度结论,而是报告区间并补采。错误回放要隐藏不必要身份信息,治理方案通过 Canary 观察真实投诉和服务差异。
常见追问
- 群体平均准确率相同就公平吗? 不一定。严重错误、拒答和不同子任务可能集中在某群体,平均值会掩盖最差组与伤害类型。
- 为什么要做配对反事实? 它尽量固定其他内容,只改变敏感属性;若输出出现无任务依据的变化,更容易定位差别对待。
- 删除人口属性词能消除偏见吗? 不能。姓名、地区和语境可能成为代理变量,训练语料和系统决策链也仍会携带偏差。
一句话复习
公平评测先定义场景、群体和伤害,再用切片、反事实与人工审查找最差组,同时检查治理后的效用和误拒。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。