Project Beacon 于 2026 年 10 月 9 日由 Baseten 在其官方博客宣布,合作方是 Goodfire AI,目标是把主动安全控制直接做进开放模型的推理环节。做法不是在输出之后再加一道文本过滤,而是在模型生成过程中读取其内部激活状态,用探针提前识别正在发生的风险事件,赶在内容到达用户或工具之前采取动作。
它盯的是四类风险
Baseten 列出的推理层风险包括:藏在文档或工具返回结果里的提示注入,试图把智能体带偏;智能体提出超出用户或组织授权的动作;客户或公司敏感信息出现在不该出现的位置;以及安全敏感工作流里的网络滥用苗头。每类风险需要的处置不同,所以 Beacon 把 Goodfire 针对具体行为开发的监测信号,接到 Baseten 决定应用如何响应的系统上:可以要求人工批准、拒绝、回退到其他方案,或只记录下来供管理员复查。
监测为什么要和生成并行
架构上,激活监测和文本监测同时对每个请求分类,两者意见不一致时才请前沿模型裁决;监测与生成并行运行,不阻塞回复。对企业客户,Baseten 计划提供一套可中央下发的安全基线、按工作负载调整的策略,以及被标记事件的完整处理记录;对开发者,安全事件和控制会走与推理相同的 API 和工具链。举的例子很具体:一个处理支付争议的智能体要读商家消息和账户记录,恶意内容可能把它带偏,错误动作可能泄露数据甚至动钱——靠另一个大模型逐步复查,成本和延迟都撑不住规模化。
接下来几个月,Beacon 的能力会先从选定模型和受监测行为开始,逐步扩展到企业控制和开发者侧,并先通过少量早期合作伙伴推向市场。对正在用开放模型搭智能体的团队,这条更新的信号是:安全检查正在从外挂过滤器变成推理基础设施的一部分,选推理平台时,监测信号能不能被自己的策略直接调用,会和价格、速度一样成为比较项。