← 返回题库
第 033 题 · 评测与安全 · 中等

安全模型如何平衡拒答与过度拒答,XSTest 评测什么?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
RefusalOverrefusalXSTest
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

把安全失败拆成两边:危险请求被错误放行,以及正常请求因表面敏感词被拒绝。XSTest 的重点正是后者,它用一组看似敏感但实际无害的提示,测试模型是否过度依赖关键词。

回答不能只说“调阈值”。应提到安全与正常样本的成对设计、细粒度风险分类、可提供的安全替代帮助,以及分别报告危险服从率和过度拒答率。

可以这样答:

安全模型既可能漏拒真正危险的请求,也可能把合法问题一概挡住。XSTest 主要评估过度拒答:题目表面含有敏感词或与危险请求相似,但实际用途是无害的,用来检查模型是否只靠关键词判断。优化时要细分意图和风险,允许回答安全部分并给出边界说明;评测必须同时覆盖有害请求的违规率、正常请求的误拒率和回答帮助度。

核心回答

安全对齐同时面对两类错误:对真正有害请求继续提供帮助是 Under-Refusal;对无害请求因出现“杀死进程”“破解谜题”等敏感词就拒绝,是 Over-Refusal。只提高总体拒答率会让第一类下降、第二类上升,因此应同时测有害请求的安全拒答和安全请求的正常完成。

XSTest 是识别夸大安全行为的测试集,构造了看似敏感但实际无害的请求,并与不安全请求形成对照,用于观察模型是否依赖表面关键词而非语义和上下文做拒答。它能测过度拒答的重要切面,但不是完整安全基准,也不覆盖所有领域、语言和新型攻击。

展开说明

安全请求可能讨论教育、新闻、医疗或防御性网络安全,也可能只是包含字面敏感词。模型若在后训练中把这些词与拒答强绑定,会损失有益能力。另一方面,为减少过度拒答而简单降低阈值,可能重新放开真正危险内容。

评测需要明确“完全拒绝、带安全边界的部分帮助、正常回答”三类,而不是只用一个拒答关键词。Judge 应理解请求语义和回答实际提供的能力,并用人工样本校准。对于允许高层解释但禁止可执行细节的政策,还要评估模型是否给出合适的安全替代。

阈值和策略依赖应用风险。儿童产品、医疗建议和代码助手可能采用不同的误拒与漏放成本;统一全局分数不能替代领域切片。

工程实践

建立成对回归:每个高风险主题同时包含真实有害请求、语义相近的安全请求和正常业务问题。统计有害遵循率、安全请求误拒率、部分帮助质量和人工升级率。检查不同语言、措辞、身份和长上下文,避免模板化拒答判断。策略或模型更新时保留历史误拒样本,并由安全和领域专家共同审查边界变化。

常见追问

  1. 拒答率越高是否越安全? 不是。高拒答率可能来自对大量安全请求误拒,安全需要同时看漏放和误拒。
  2. XSTest 主要测什么? 它主要测模型对表面敏感但实际安全请求的夸大安全行为,即过度拒答。
  3. 为什么关键词规则容易过度拒答? 相同词语在教育、比喻、系统管理和恶意请求中语义不同,脱离上下文无法可靠判断意图。
  4. 部分帮助应该怎样判分? 根据政策检查它是否避开禁止细节、仍提供安全且有用的替代信息,而不是简单归为拒答或通过。

一句话复习

安全对齐要同时控制有害请求漏放和安全请求误拒,XSTest 专门暴露模型因表面敏感词产生的过度拒答。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…