ARTICLE / 2 MIN READ
AI Guardrails:把输入、输出和工具动作放进同一条安全链
组合内容策略、提示注入防护、输出校验和工具沙箱,降低开放式 AI 功能的越权风险。
单独做输入审核无法防止模型在工具返回值中遇到间接提示注入,也无法阻止输出包含内部数据。安全链要覆盖输入、检索内容、模型输出和动作执行四个位置。
输入策略
识别敏感实体、越权意图、危险代码和超长上下文,按风险决定拒绝、改写、脱敏或转人工。用户内容与系统策略隔离,不能因为用户要求就降低权限。
上下文和输出策略
检索文档、网页和工具返回值标记为不可信数据,禁止它们改变系统规则。生成结果做 Schema、PII、秘密、恶意链接和业务规则校验,必要时重写或拒答。
工具沙箱
工具按最小权限运行,限制网络、文件、数据范围、超时和输出大小。写操作需要幂等键、审批和审计,模型不能自选审批人或修改策略。
可观测和演练
记录策略命中、阻断原因、误报、漏放和每个工具动作。定期跑提示注入、多轮诱导、越权查询和数据外泄演练,发现绕过路径后把样本加入发布门禁。
GITHUB DISCUSSION
评论与回复
评论保存在 GitHub Discussions,登录 GitHub 后即可参与,发布和回复都在本页完成。
评论区进入视口后自动加载。