← 返回题库
第 090 题 · 评测与安全 · 困难

如何系统评估越狱攻击,并建立分层防御而不是只靠系统提示词?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
JailbreakRed TeamDefense in Depth
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

越狱评估应先给威胁模型:直接改写、编码混淆、多轮诱导、间接注入和工具滥用分别可能造成什么后果。把“输出违规文字”与“系统执行危险动作”分开统计,再讲输入检测、模型约束、最小工具权限和输出校验;同时承认拦截增强会带来过拒。

可以这样答:

越狱不能靠几条系统提示词解决,必须先定义威胁模型,再用输入、模型、工具权限和输出四层防御。我会覆盖直接改写、编码混淆、多轮诱导、间接 Prompt Injection 与工具滥用,并把“模型说了违规内容”和“系统真的执行高风险动作”分开统计。同时,拦截越严,正常请求过拒越高。做对照时要保留滚动红队集和隔离盲测,持续报告攻击成功率、有害完成率、正常任务通过率、过拒率与高风险工具触发数。

核心回答

越狱评测首先要定义威胁模型:攻击者是否知道系统提示、模型或防御细节,允许多少次查询,能否根据返回结果自适应,目标是输出有害内容还是触发真实工具副作用。若这些条件不同,攻击成功率不能直接比较。JailbreakBench 等工作尝试固定行为集合、模板、攻击产物和评分方式,使攻击与防御结果更可复现。

防御应是分层系统:模型训练降低有害遵循倾向;输入层识别已知与变体攻击;推理层约束上下文和权限;输出层分类、过滤或人工复核;工具层采用最小权限、参数验证和高风险确认。系统 Prompt 只是其中一层,模型仍会把系统指令和攻击文本放在同一推理上下文中处理,不能被当作不可绕过的安全边界。

展开说明

攻击成功率(ASR)的分母、重试和 Judge 必须明确。一次攻击生成多个候选时,是按请求还是按行为计成功,会产生不同数字。字符串拒答检测会把“先拒绝后给出细节”误判为安全,也可能把讨论安全研究的无害回答误判为攻击成功,因此高风险基准应有人类校准的语义 Judge。

只优化拒答率会造成过度拒答。评测至少同时包含有害行为集、语义相近的安全请求和正常效用集,报告攻击成功、误拒和任务能力。对于具有工具权限的 Agent,还要区分“模型说了危险内容”和“系统实际执行了危险动作”,后者需要独立权限测试。

越狱是持续适应的对抗问题。基于固定关键词的过滤可能在静态集有效,却被改写、多语言或编码绕过;生产需要版本化红队集、失败样本回流和安全回归,而不是一次通过后永久可信。

工程实践

建立不可用于训练调参的保留攻击集,按直接提示、多轮、改写、多语言和自适应预算切片。固定模型、系统提示、采样、重试与 Judge 版本,人工复核边界样本。网关对输入输出做风险评分,但真正副作用仍由确定性权限策略限制。安全日志脱敏保存攻击类别、判定和阻断层,模型升级时同时重测 ASR、误拒率与正常任务质量。

常见追问

  1. 为什么不同论文的 ASR 不能直接比? 威胁模型、查询预算、目标行为、重试次数和 Judge 口径可能不同。
  2. 系统 Prompt 为什么不是安全边界? 它仍是模型上下文中的自然语言指令,不能提供操作系统级隔离或确定性授权。
  3. 输出过滤是否足够? 不足。过滤器也可能失误,且工具动作可能在文本过滤前发生,必须限制权限与副作用。
  4. 怎样避免防御让模型什么都拒绝? 同时评测安全请求误拒率和正常任务效用,而不是只最小化攻击成功率。

一句话复习

越狱评测要固定威胁模型、预算和判分口径,防御则必须覆盖训练、输入、输出与工具权限,并同时控制过度拒答。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…