生产大模型应用如何防止 PII 泄露?
先用自己的话答,再看参考说法
60 秒是练习上限,不是必须凑满。原理题讲清因果,设计题讲清约束,项目题只讲真实证据。
别照着背。参考说法只用于对照;直接回答问题,简单题说清楚就收尾。项目题只用自己的经历和数字。
参考内容当前已显示;开始口述后会暂时隐藏。
面试时怎么答
PII 防护沿数据生命周期回答:入口尽量不收或脱敏,检索按租户和用户授权,第三方模型明确保留边界,输出阻断无授权回显,日志支持删除。正则与 NER 都会漏报和误报,因此高风险字段要组合规则、模型和人工流程;数据最小化比事后过滤更重要。
可以这样答:
PII 防护要贯穿输入、检索、模型、输出和日志,第一原则是数据最小化。入口先识别身份证、电话等字段并按任务做删除、掩码或令牌化;RAG 用租户和用户权限过滤,第三方模型明确保留策略;输出再扫描并阻断无授权回显。正则、NER 都会误判,所以高风险动作要人工或规则兜底。上线后监控敏感字段召回率、误报、越权必须为零、日志残留和删除 SLA。
核心回答
PII 防护应采用数据最小化与纵深防御。收集前明确目的和保留期;输入层组合校验规则、词典和实体识别发现敏感字段,按需要删除、掩码、哈希或可逆令牌化。检索层在召回前执行租户、用户和文档 ACL;模型供应链明确数据是否用于训练、保存地点和删除机制;输出层检测无授权敏感信息并阻断。
日志默认不保存完整 Prompt 和回答,对必须保留的内容做字段级加密、访问审计和自动过期。还要用 Canary PII、越权查询和提示注入做红队测试,并准备发现泄露后的吊销、删除、通知和取证流程。
展开说明
正则适合结构稳定的证件号,NER 适合姓名与地址,二者都不能理解所有授权语境。脱敏策略要匹配用途:分析只需统计时可泛化,客服核验可能需要保留后四位。训练数据还需考虑模型记忆和数据提取风险,去重、访问控制与隐私评测缺一不可。
工程实践
建立数据流图和字段清单,标明每个服务的用途、存储与责任人。网关在进入外部边界前做脱敏,敏感映射保存在独立 Vault;日志平台配置默认拒收和 DLP 扫描。用合成 PII 建立可重复测试集,真实数据只在隔离环境按最小权限抽检。
常见追问
- 为什么输出层扫描仍然必要? 输入脱敏无法覆盖模型参数记忆、被授权文档中的旁观者信息或工具返回,输出是最后一道可控边界。
- 哈希后的手机号就不算敏感了吗? 不一定。手机号空间有限且可被字典反推,稳定哈希还能跨记录关联;应使用带密钥令牌化或删除,并按威胁模型判断。
- PII 检测误报太高怎么办? 按字段和场景分阈值,使用上下文与授权状态二次判断,并为低风险可逆操作提供人工确认,不能简单关闭检测。
一句话复习
PII 安全靠数据最小化和全链路纵深防御:入口脱敏、权限检索、输出阻断、日志少存,并持续红队和审计。
参考资料
评论与补充
评论会直接显示在这道题下面。可以写自己的答法、继续追问或指出错误,不需要 GitHub 账号,也不会跳转到 Issue;内容会公开,请勿填写个人隐私、公司机密或受保密约束的材料。
正在连接站内评论服务…
正在加载评论…
还没有评论,你可以先写下自己的理解或追问。