Anthropic 于 2025 年 12 月 19 日发布 Bloom,并以开源形式提供下载与使用。Bloom 被定位为“自动化行为评估”的代理式框架:研究者先指定需要观测的单一行为特征,Bloom 再自动生成大量情境与对话回合,对目标模型在这些情境中的表现进行打分,输出诸如行为触发率与平均强度等指标,用于衡量该行为在模型中的出现频率与严重程度。
Bloom 被描述为对既有工具 Petri 的补充:Petri 更偏向在用户给定场景下,对多种行为维度进行扫描并发现可疑实例;Bloom 则围绕某一特定行为,自动扩展出更多可复现实验的场景组合,以便更快获得定量结论。官方示例基准涵盖“妄想式迎合”“受指令的长程破坏”“自我保护”“自我偏好”等对齐相关行为,并提供了从行为定义到评测输出的完整流程。
在机制上,Bloom 采用“理解—构思—执行—判定”的四阶段流水线,并通过“种子配置”记录行为描述、示例对话与关键参数,以便复现实验与对比不同模型或不同配置下的差异。由于此类评测依赖自动生成场景与判定模型,实际使用仍需注意评测配置、判定一致性与场景真实性等因素,避免把单次结果过度外推为模型在现实环境中的稳定表现。
常见问题
Q:Anthropic 的 Bloom 工具主要用来做什么?
A:Bloom 用于自动生成针对某一指定行为的评估场景,并量化该行为在模型中的出现频率与严重程度。
Q:Bloom 与 Petri 的核心区别是什么?
A:Bloom 聚焦单一行为并自动扩展大量场景做定量测量;Petri 更偏向在给定场景里覆盖多维度行为并发现异常实例。
Q:Bloom 的评估流程包含哪些关键环节?
A:Bloom 采用理解、构思、执行与判定四个阶段,最终输出触发率等汇总指标与评估报告。
Q:Bloom 的“种子配置”在评测中有什么作用?
A:种子配置用于记录行为定义与参数设置,便于复现实验并在不同模型之间做可比对的结果对照。
Q:研究者在使用 Bloom 结果时需要注意什么风险?
A:需要关注自动生成场景的真实性、判定模型的偏差以及配置差异对结果的影响,避免把评测结论直接等同于真实世界表现。