AI 安全护栏
把安全交给模型自己守,等于没有守。护栏该分几层、提示词注入从哪些入口进来,以及为什么权限和审批必须放在模型之外由确定性程序执行,逐层拆开。
把安全交给模型自己守,等于没有守。护栏该分几层、提示词注入从哪些入口进来,以及为什么权限和审批必须放在模型之外由确定性程序执行,逐层拆开。
2026 年 9 月 11 日,Anthropic 发布《Detecting and countering misuse of AI: September 2026》威胁情报报告,披露其在 2025 年 12 月至 2026 年 8 月间识别并阻断的高风险活动。报告覆盖网络攻击、监控、影响行动、诈骗...
AI Guardrails 通常译作 AI 护栏,指围绕模型输入、上下文、工具调用和输出建立的约束与检测机制。它不等于一段禁止事项的系统提示词;真正可用的护栏要分层工作,并在被绕过时限制影响。 系统提示词为什么不是安全边界 提示词能告诉模型应当如何行动,却仍和用户输入、网页内容、文件文本处在同一套自...
提示词注入(Prompt Injection)指的是:攻击者把一段会影响模型行为的指令,偷偷塞进模型可能读取的内容里,让模型偏离原本该遵守的任务或规则。它不一定长得像“恶意代码”,很多时候只是混进网页正文、PDF 文档、知识库内容、表格备注,甚至一段看似普通的话。 为什么它不是传统意义上的漏洞 传统...
OpenAI 发布了一篇关于代理如何抵御 prompt injection 的技术文章,核心意思很直接:真正危险的不是多看了一段恶意文本,而是代理在被诱导后替用户执行了不该做的动作。对 Agent 产品来说,这让安全问题从内容过滤,升级成执行权限和数据边界的问题。 文章提到 ChatGPT 在代理工...
OpenAI 宣布将收购 Promptfoo,后者是一家面向企业的 AI 安全平台,主要帮助团队在开发阶段识别并修复 AI 系统中的漏洞。对正在把大模型接入生产系统的企业来说,这不是单纯的并购新闻,而是一个非常明确的产品信号:模型能力之外,安全测试链路正在被提前并内建到开发流程里。 从 OpenAI...
Anthropic于2026年1月9日发布研究文章与论文,推出“Next-generation Constitutional Classifiers”(又称Constitutional Classifiers++),用于提升大模型对“通用越狱”攻击的防护效率。官方称,新系统在生产环境部署中将额外算力...
12月22日晚快手直播间出现色情等违规内容,平台称系黑灰产攻击并已报警。对所有直播平台来说,这类事件本质是内容安全与对抗升级:黑灰产用自动化批量投放,逼迫平台在分钟级完成识别与处置。要稳住舆情与业务,核心抓手就是AI内容安全与风控联动。 一、事件要点与平台处置 1、快手直播间异常的核心信息 AI内容...
通义千问推出 Qwen3Guard 安全审查模型系列,主打跨语种、实时与可落地。该系列支持 119 种语言与方言,提供三档参数规模(0.6B、4B、8B)与两种形态: Qwen3Guard-Stream 面向低时延流式检测(实时对话、直播与联机应用), Qwen3Guard-Gen 面向全上下文安全...