AI Guardrails 通常译作 AI 护栏,指围绕模型输入、上下文、工具调用和输出建立的约束与检测机制。它不等于一段禁止事项的系统提示词;真正可用的护栏要分层工作,并在被绕过时限制影响。
系统提示词为什么不是安全边界
提示词能告诉模型应当如何行动,却仍和用户输入、网页内容、文件文本处在同一套自然语言环境中。攻击者可以利用提示词注入、编码变形或多轮诱导改变模型判断。更关键的是,应用若仍给模型高权限工具,错误调用依然会造成真实后果。
提示词注入的风险说明了一个关键原则:安全控制必须放在模型之外,由确定性的程序和权限系统执行,不能要求模型自己监督自己。
一套护栏通常分成五层
- 输入层:检查文件类型、长度、恶意指令和敏感数据,明确哪些内容可进入模型。
- 上下文层:隔离系统规则、用户数据和外部检索内容,对来源与租户设置边界。
- 工具层:使用最小权限、参数校验、允许列表和人工审批,尤其限制支付、删除、发信等高影响操作。
- 输出层:检查隐私泄露、危险内容、格式约束和事实依据,必要时拒绝或转人工。
- 运行层:保存不含敏感凭据的审计记录,监控异常模式,持续红队测试并更新规则。
各层解决不同失效模式:输出过滤挡不住越权调用,输入拦截也不能防止模型编造事实。
护栏不是准确率插件
护栏会带来误拦截、漏检和额外延迟。规则太严,正常请求无法完成;规则太松,又只剩安全展示。团队应按业务风险设置强度:普通内容生成可以自动复核,高风险操作则应要求结构化参数、二次确认和可撤销机制。
上线前需要用真实攻击样本与正常边界样本做AI Evals,观察拦截率、误报率和事故影响。成熟的护栏不是承诺永不失败,而是在持续测试、权限隔离和快速恢复之间形成闭环。