2025 年 11 月 13 日,OpenAI 发布研究与论文《Understanding neural networks through sparse circuits》,提出通过“权重稀疏 Transformer”来提高神经网络的机械可解释性。与事后在致密网络中“解纠缠”不同,这项工作直接在训练阶段约束绝大多数权重为零,使每个神经元只与少量通道相连,从而鼓励模型形成结构清晰的稀疏电路。研究团队在一组手工设计的简单任务上验证发现,在这些稀疏模型中,可以剪枝出体积很小、结构完整、足以独立完成任务的电路,并且这些电路中的节点往往对应直观概念,例如“检测字符串开头引号类型”等。
论文显示,在相同预训练损失下,权重稀疏模型中为完成同一任务所需的最小电路,规模相比致密模型可缩小约一个数量级以上,说明其内部计算更加“可拆解”。同时,沿着“稀疏度—能力”这条曲线,增加稀疏度会牺牲一定能力但提升可解释性,而在保持稀疏度不变的前提下扩大总参数量,则可以整体推动“能力—可解释性”边界向有利方向移动。研究还展示了更复杂行为(如变量绑定)的部分电路示例,虽然难以完全解释,但仍能给出对模型行为具有预测力的结构描述。
OpenAI 将这项工作定位为通往更可解释大模型的早期一步,并坦承当前权重稀疏模型规模远小于前沿系统,训练和部署效率也明显较低,不太可能直接成为最强生产模型。团队提出两条后续路线:一是继续扩大稀疏模型规模,丰富电路模式库,为理解更复杂推理行为打基础;二是尝试从现有致密模型中抽取稀疏电路,并通过“桥接”方法让稀疏模型对齐原模型表示,成为一个可解释的近似替身。OpenAI 也同步开源相关稀疏模型权重、剪枝电路与可视化代码,为后续复现和扩展研究提供基础。
常见问题
Q:所谓“稀疏电路”具体指什么?
A:在这项工作中,“稀疏电路”指的是从权重稀疏 Transformer 中剪枝得到的最小子网络,它包含完成某个具体任务所必需且足够的一小批节点与连接。节点可以是单个神经元、注意力头通道或残差通道,边则是对应的非零权重。
Q:这与一般说的“可解释 AI”有什么不同?
A:常见可解释方法多是对输入输出或中间激活做事后分析,而这里属于机械可解释性,目标是尽可能在最底层反向还原模型实现的“算法”。通过强制权重稀疏和剪枝,这项研究给出了可以画成完整框图、逐步追踪信息流的具体电路。
Q:这些结果能直接推广到 GPT 级别的大模型吗?
A:论文明确指出,目前的稀疏模型只有数千万级非零参数,离前沿大模型的规模和能力还有很大差距,且稀疏训练在算力和效率上都不划算,因此尚不能断言同样的方法在更大、更强模型上同样有效。作者将其定位为“有前景但早期”的探索。
Q:为什么要牺牲能力去换取可解释性?
A:在安全和可信赖部署场景中,完全不透明的高能力模型存在难以预警和纠错的风险。通过增加稀疏度,可以换来更小、更清晰的电路,从而更容易分析潜在有害行为的机理,再反过来为更强模型的审核、调试和对齐提供线索,这是一种主动在训练过程中为可解释性“预留空间”的思路。
Q:普通研究者能复现或基于这项工作继续做实验吗?
A:OpenAI 在论文附件中提供了所有稀疏模型的权重、剪枝得到的电路以及电路可视化代码仓库链接,有助于外部团队复现实验、测试更多任务或探索更高层次的行为模式,为机械可解释性社区提供了一个较系统的实验平台。