2025 年 11 月 13 日、OpenAI は「スパース回路によるニューラル ネットワークの理解」と題する研究と論文を発表し、「重みスパース トランスフォーマー」を通じてニューラル ネットワークの機械的解釈可能性を向上させることを提案しました。 事後の高密度ネットワークでの「もつれの解き放つ」とは異なり、この作業はトレーニング段階で大部分の重みをゼロに直接制限するため、各ニューロンは少数のチャネルにのみ接続され、それによってモデルが明確な構造を持つまばらな回路を形成することを奨励します。 研究チームは、一連の単純な手作業で設計されたタスクで検証したところ、これらのスパースモデルでは、サイズが小さく、構造が完全で、タスクを完了するのに十分な回路を剪定でき、これらの回路のノードは「文字列の先頭にある引用符の種類を検出する」などの直感的な概念に対応することが多いことがわかりました。
この論文は、同じ事前トレーニング損失の下で、重みスパースモデルで同じタスクを完了するために必要な最小回路のスケールが、密モデルと比較して一桁以上小さくなる可能性があることを示しており、その内部計算がより「分解」されていることを示しています。 同時に、「スパース性-能力」曲線に沿って、スパース性を高めると一定の能力が犠牲になりますが、解釈可能性が向上しますが、スパース性を維持しながらパラメータの総数を拡大すると、「能力-説明可能性」の境界の全体的な動きが有利な方向に促進されます。 この研究では、変数結合など、より複雑な動作を持つ回路の例もいくつか示されており、完全に説明することは困難ですが、それでもモデルの動作の予測的な構造記述を与えることができます。
OpenAIは、この研究をより説明可能な大規模モデルに向けた初期段階として位置づけており、現在の重みスパースモデルは最先端システムのモデルよりもはるかに小さく、トレーニングと展開の効率が大幅に低いため、直接最強の本番モデルになる可能性は低いことを認めています。 チームは 2 つのフォローアップ ルートを提案しました: まず、スパース モデルのスケールを拡大し続け、回路パターン ライブラリを充実させ、より複雑な推論動作を理解するための基礎を築きます。 2つ目は、既存の高密度モデルからスパース回路を抽出し、「ブリッジング」手法を通じてスパースモデルを元のモデル表現と一致させ、解釈可能な近似代役にすることです。 OpenAI はまた、関連するスパース モデルの重み、剪定回路、視覚化コードをオープンソース化し、その後の再現と拡張の研究の基礎を提供します。
よくある質問
Q: 「スパース回路」とは具体的にどういう意味ですか?
A: 本研究における「スパース回路」とは、重み付けされたスパーストランスから剪定された最小のサブネットワークを指し、特定のタスクを達成するために必要かつ十分な少数のノードと接続が含まれています。 ノードは、個々のニューロン、アテンションヘッダーチャネル、または残差チャネルであり、エッジはゼロ以外の重みに対応します。
Q: これは、一般に「説明可能なAI」と呼ばれるものとどう違うのですか?
A: 一般的な解釈可能な方法は、入力、出力、または中間活性化の事後分析がほとんどですが、ここでは機械的な解釈可能性に属し、モデルによって実装される「アルゴリズム」を最下位レベルで可能な限り逆削減することが目標です。 この研究では、重量のまばらさと剪定を強制することにより、完全なブロック図に描画できる特定の回路を提供し、情報の流れを段階的に追跡します。
Q: これらの結果はGPTレベルの大規模モデルに直接一般化できますか?
A: この論文では、現在のスパース モデルには数千万の非ゼロ パラメータしかなく、最先端の大規模モデルの規模と能力にはまだ程遠いこと、およびスパース トレーニングは計算能力と効率の点で費用対効果が低いため、同じ方法がより大規模で強力なモデルでも同等に効果的であるとは断言できないことを明確に指摘しています。 著者らは、これを「有望だが初期の」探求として位置づけている。
Q: なぜ説明可能性のために能力を犠牲にするのですか?
A: 安全で信頼できる展開シナリオでは、完全に不透明な高機能モデルを警告して修正することが困難になるリスクがあります。 スパース性を高めることで、より小さく、より明確な回路を交換して、潜在的に有害な動作のメカニズムを簡単に分析できるようになり、その結果、より強力なモデルのレビュー、デバッグ、アライメントの手がかりが得られ、これはトレーニング中に解釈可能性のための積極的な「スペースを確保する」アイデアです。
Q: 一般の研究者は、この研究に基づいて実験を再現したり、継続したりすることはできますか?
A: OpenAIは、すべてのスパースモデルの重み、プルーニングされた回路、および回路視覚化コードリポジトリへのリンクを論文の添付ファイルに提供しており、外部チームが実験を再現したり、より多くのタスクをテストしたり、より高いレベルの動作パターンを探索したりするのに役立ち、メカニズム解釈可能性コミュニティにより体系的な実験プラットフォームを提供します。