返回AI资讯
从黑箱到电路图:OpenAI 用权重稀疏 Transformer 提升神经网络可解释性

从黑箱到电路图:OpenAI 用权重稀疏 Transformer 提升神经网络可解释性

AI资讯 Admin 144 次浏览

2025 年 11 月 13 日,OpenAI 发布研究与论文《Understanding neural networks through sparse circuits》,提出通过“权重稀疏 Transformer”来提高神经网络的机械可解释性。与事后在致密网络中“解纠缠”不同,这项工作直接在训练阶段约束绝大多数权重为零,使每个神经元只与少量通道相连,从而鼓励模型形成结构清晰的稀疏电路。研究团队在一组手工设计的简单任务上验证发现,在这些稀疏模型中,可以剪枝出体积很小、结构完整、足以独立完成任务的电路,并且这些电路中的节点往往对应直观概念,例如“检测字符串开头引号类型”等。

论文显示,在相同预训练损失下,权重稀疏模型中为完成同一任务所需的最小电路,规模相比致密模型可缩小约一个数量级以上,说明其内部计算更加“可拆解”。同时,沿着“稀疏度—能力”这条曲线,增加稀疏度会牺牲一定能力但提升可解释性,而在保持稀疏度不变的前提下扩大总参数量,则可以整体推动“能力—可解释性”边界向有利方向移动。研究还展示了更复杂行为(如变量绑定)的部分电路示例,虽然难以完全解释,但仍能给出对模型行为具有预测力的结构描述。

OpenAI 将这项工作定位为通往更可解释大模型的早期一步,并坦承当前权重稀疏模型规模远小于前沿系统,训练和部署效率也明显较低,不太可能直接成为最强生产模型。团队提出两条后续路线:一是继续扩大稀疏模型规模,丰富电路模式库,为理解更复杂推理行为打基础;二是尝试从现有致密模型中抽取稀疏电路,并通过“桥接”方法让稀疏模型对齐原模型表示,成为一个可解释的近似替身。OpenAI 也同步开源相关稀疏模型权重、剪枝电路与可视化代码,为后续复现和扩展研究提供基础。

常见问题

Q:所谓“稀疏电路”具体指什么?

A:在这项工作中,“稀疏电路”指的是从权重稀疏 Transformer 中剪枝得到的最小子网络,它包含完成某个具体任务所必需且足够的一小批节点与连接。节点可以是单个神经元、注意力头通道或残差通道,边则是对应的非零权重。

Q:这与一般说的“可解释 AI”有什么不同?

A:常见可解释方法多是对输入输出或中间激活做事后分析,而这里属于机械可解释性,目标是尽可能在最底层反向还原模型实现的“算法”。通过强制权重稀疏和剪枝,这项研究给出了可以画成完整框图、逐步追踪信息流的具体电路。

Q:这些结果能直接推广到 GPT 级别的大模型吗?

A:论文明确指出,目前的稀疏模型只有数千万级非零参数,离前沿大模型的规模和能力还有很大差距,且稀疏训练在算力和效率上都不划算,因此尚不能断言同样的方法在更大、更强模型上同样有效。作者将其定位为“有前景但早期”的探索。

Q:为什么要牺牲能力去换取可解释性?

A:在安全和可信赖部署场景中,完全不透明的高能力模型存在难以预警和纠错的风险。通过增加稀疏度,可以换来更小、更清晰的电路,从而更容易分析潜在有害行为的机理,再反过来为更强模型的审核、调试和对齐提供线索,这是一种主动在训练过程中为可解释性“预留空间”的思路。

Q:普通研究者能复现或基于这项工作继续做实验吗?

A:OpenAI 在论文附件中提供了所有稀疏模型的权重、剪枝得到的电路以及电路可视化代码仓库链接,有助于外部团队复现实验、测试更多任务或探索更高层次的行为模式,为机械可解释性社区提供了一个较系统的实验平台。

OpenAI稀疏电路可解释性研究 权重稀疏Transformer提升机械可懂性 稀疏神经网络电路层级结构解析 通过训练阶段约束权重实现高稀疏 稀疏模型中剪枝得到最小可用电路 稀疏电路节点对应直观语义概念 稀疏网络最小电路规模对比致密模型 稀疏度与模型能力可解释性权衡曲线 扩大参数量在固定稀疏度下提升边界 稀疏Transformer揭示变量绑定电路结构 机械可解释性视角下神经网络算法还原 稀疏电路帮助预测模型复杂行为模式 稀疏训练牺牲部分能力换取透明度 用稀疏电路分析潜在有害行为机理 从致密模型中抽取对齐的稀疏替身网络 稀疏模型作为大模型安全审核工具设想 稀疏电路可视化代码与权重开源资源 OpenAI理解神经网络内部计算新路径 数千万非零参数稀疏模型能力局限讨论 稀疏电路方法能否推广到GPT级大模型 面向安全部署的高可解释性模型设计 稀疏度提升如何影响预训练损失表现 稀疏电路中注意力头与残差通道角色 稀疏网络在简单合成任务上的实验结果 剪枝后电路仍能独立完成任务的条件 稀疏电路框图级信息流追踪实践方法 机械可解释性与传统可解释AI差异 利用稀疏模型构建电路模式知识库 稀疏训练效率低下带来的算力挑战 通过桥接方法让稀疏模型对齐原表示 LLM安全对齐需要的底层电路级理解 稀疏电路视角下变量绑定行为案例 小体积稀疏电路如何提高人类直观理解 使用稀疏网络研究算法涌现的可能性 稀疏Transformer架构设计关键技术点 稀疏度能力可解释性三者综合优化思路 稀疏电路为后续复杂推理研究打基础 机械可解释性社区可复现实验平台 外部团队基于开源稀疏电路扩展工作 稀疏网络在安全关键场景中的应用前景 稀疏化约束对神经元连接拓扑的影响 稀疏模型帮助发现文本模式检测电路 基于稀疏电路的AI行为预测与审计 稀疏网络训练部署成本与收益评估 稀疏电路研究推动可信赖大模型发展 通过电路级分析减少黑箱模型风险 OpenAI机械可解释性长期研究路线 稀疏模型与对齐技术结合的新机会 从电路角度理解语言模型内部表示 稀疏电路方法在未来监管中的潜在作用

推荐工具

更多