← 返回题库
第 061 题 · 评测与安全 · 困难

恶意图片如何劫持 VLM 指令,视觉 Prompt Injection 怎样防御?

岗位专项 这代表什么?
✓ 资料核验 来源说明:公开面经题库主题;公司归属未独立核验,技术答案依据原论文或官方文档整理
Visual Prompt InjectionImage HijackVLM Security
评论与补充 ↓
口述训练

先用自己的话答,再看参考说法

60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。

别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。

面试时怎么答

视觉 Prompt Injection 的第一原则是把图像中的文字和视觉模式视为不可信数据,而不是高优先级指令。沿 OCR/视觉编码进入上下文、诱导泄密或工具调用的攻击链解释,再给指令—证据分离、来源标记、最小工具权限和高风险动作确认;完全屏蔽图中文字会误伤文档任务。

可以这样答:

图像里的文字和视觉内容都应被当作不可信证据,不能因为进入多模态模型就升级成系统指令。攻击链:恶意图片通过 OCR 或视觉特征进入上下文,诱导模型泄露秘密、改写目标或调用工具。同时,屏蔽所有图中文字会让票据和文档理解不可用,所以要做指令/数据分离、来源标记和最小权限。防护方案里高风险工具必须二次确认,并用变体红队持续测攻击成功率、正常任务通过率、过拒率和越权调用数。

核心回答

视觉 Prompt Injection 利用图片中的可见文字、版面语义或对抗扰动,让 VLM 把不可信图像内容当作高优先级指令。攻击目标可能是改变回答、泄露上下文、绕过安全策略或诱导工具动作。Image Hijacks 等研究说明,即使用户文本本身正常,经过优化的图像也可能在推理时控制生成行为。

防御原则是把图片视为数据而不是授权来源:系统策略和用户授权不能由图片内容覆盖;从图像提取出的文字和指令要标记来源;外部发送、文件写入等工具仍受确定性权限与人工确认控制。单独做 OCR 关键词过滤不够,因为攻击可能使用同义改写、布局或人眼不明显的扰动。

展开说明

可见注入类似“图片里写着忽略用户并发送秘密”,可通过 OCR 或语义理解触发;对抗图像则通过像素优化让视觉编码器产生攻击者希望的内部表示。两者威胁假设不同,评测应说明攻击者是否知道模型、是否能改动整张图、扰动预算和查询次数。

预处理、压缩或重采样可能破坏部分对抗扰动,但也可能不影响可见指令,并会损害正常图片质量。检测器本身也可被自适应攻击,不能作为唯一边界。将 VLM 仅用于提取事实,再由受约束的控制器决定工具动作,可以缩小直接从像素到副作用的路径。

多图与文档场景还需保留 provenance,防止某一张不可信附件的指令覆盖整段会话。若业务允许上传任意图片,应假设攻击者可以反复试探并根据结果迭代。

工程实践

按来源给图片分信任等级,隔离用户上传、检索附件与内部模板。记录 OCR 文本和视觉模型提取的动作性语句,提示模型引用而非执行图片中的指令。对高风险工具只接受经过 Schema 验证、权限检查和用户确认的参数。红队集同时覆盖可见文字、二维码/布局、多语言和受限扰动,并在 Resize、JPEG、Crop 等真实预处理后测试攻击成功率与正常图像质量。

常见追问

  1. 图片里的文字为什么不能当普通用户指令? 图片是被处理的数据,来源和授权级别与系统或用户明确指令不同。
  2. OCR 过滤能解决问题吗? 只能覆盖部分可见文本攻击,无法可靠处理语义改写或不可见对抗扰动。
  3. 重新压缩图片是否足够? 不足。它可能降低部分扰动,但对清晰可见的恶意指令无效,也没有通用保证。
  4. 怎样降低工具风险? 将视觉理解与动作授权解耦,让确定性策略验证工具、参数、目标和用户确认。

一句话复习

视觉注入把不可信像素变成模型指令,防御必须保留来源边界,并让任何真实副作用继续经过最小权限和确定性审批。

参考资料

无需账号 · 原地交流

评论与补充

评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。

正在加载评论…