ARTICLE / 2 MIN READ
AI 数据隐私工程:从脱敏到租户隔离的完整边界
面向企业 AI 应用设计 PII 识别、最小化、保留期限、供应商策略和审计闭环,避免数据在链路中失控。
企业接入大模型时,真正难的是数据边界:客服对话、合同和日志可能包含身份证号、手机号、商业秘密或跨租户信息。隐私方案不能只在网关加一个开关,而要贯穿采集、处理、存储、调用和删除。
先定义数据分级
把字段分成公开、内部、敏感和严格受限四级,分别定义允许的模型、区域、留存时间和操作人员。租户、部门、项目和用户权限都应成为请求上下文,写入 trace 和审计记录时使用哈希或脱敏标识。
脱敏要可逆、可控
手机号、邮箱、证件号等结构化 PII 使用确定性 token 替换,必要时在受控服务中短时还原;自由文本使用实体识别加规则双重检查。脱敏映射单独存放,密钥由 KMS 管理,模型侧永远拿不到原文映射表。
对外部模型做供应商策略
按数据等级配置可用供应商、区域、训练用途和留存策略。请求发送前做策略评估,拒绝不满足条件的路由;返回内容也要扫描敏感信息,避免模型复述系统提示或别的用户数据。供应商切换应有演练和降级模型,不能临时把受限数据发到未知端点。
用删除和审计证明边界
每份文档、向量、缓存和评测样本都带 retention_until,过期由定时任务删除并留下删除证明。审计记录包括谁在什么时间以什么策略访问了哪个数据类别。定期用跨租户查询、提示注入和日志检索做反向验证。
OWASP 的 LLM 风险清单把敏感信息泄露、提示注入和不安全输出列为重点风险。把它们转成可执行策略、测试用例和审计字段,隐私才不是一页制度。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。