Mixture of Experts(MoE)は「毎回全体を組み立てるわけではない」モデルアーキテクチャです。 最も重要な特徴は、モデルの一部層が複数のエキスパートモジュールに分割され、ルーターが現在のトークンに割り当てるべきエキスパートを決定することです。 このようにして、モデルの総パラメータを非常に大きくできますが、一度に計算に参加するパラメータはそれほど大きくないため、多くの人気モデルには数十から数百のBパラメータが書かれていますが、実際の活性化パラメータははるかに小さいのです。
通常の高密度モデルを全従業員会議を開催する会社と考えると、MoEは「まず問題がどの部署に属しているかを確認し、それから関連する専門家を会議室に呼ぶ」というものです。 すべての専門家がすべての入力を処理するわけではありません。 モデルの場合、容量は拡大可能だが、単一の推論の計算が必ずしも線形に急上昇するわけではない。
これが過去2年間MoEが熱い理由でもあります。 誰もがモデルを大きくし、知識容量やタスクの上限を増やしたいと望みますが、推論コストが制御不能になるのは避けたいとも思っています。 MoEは中間ルートを提供します。パラメータスケールを拡大し、活性化計算をできるだけ近づけます。 ミックストラルのようなモデルがMoEの議論を牽引できる理由は、「総パラメータ」と「アクティブパラメータ」が同じものではないことをより多くの人に理解させるからです。
しかし、MoEは無駄にパフォーマンスを与えることを意味しません。 最大の難しさはルーティングにあります。 ルーターは各トークンごとにどのエキスティビネットを見つけるかを決める必要があります。これはエキスパートが自分の専門性を形成できるようにだけでなく、毎日数人のエキスパートが満員で他のエキスパートが使えない状況を防ぐためでもあります。 この不均衡を避けるために、トレーニング中に負荷バランスがしばしば加えられます。 多くのMoEモデルの本当の難しさはコンセプトではなく、訓練の安定性や工学的効率にあります。
MoEが誤解されやすいもう一つの点は、主に「起動ごとに計算」を節約し、展開の難易度を節約しない点です。 専門家が増えるにつれて、メモリ占有、分散通信、推論スケジューリングはより複雑になるでしょう。 特にマルチカード環境では、専門家がどのように削減、同期、通信負荷を削減するかによって、MoEが効率向上か混雑を増やすかが決定されることが多いです。
ですから、MoEと表示されたモデルを見たときは、パラメータ番号だけを見つめないでください。 より価値のあることが三つあります。各トークンは複数のエキスパートを起動します。 訓練と推論が安定しているかどうか、 チームには対応するインフラがありますか? これらの条件がなければ、教育省の口座はカウントされない可能性があります。
MoEは神格化にも適していません。 これは「トランスより進んだ」一方通行の代替ではなく、トランスフォーマーシステムにおけるスケーリング戦略です。 多くのモデルは一部の層でMoEを使い、残りは依然として従来型の構造です。 言い換えれば、これは大規模モデル時代におけるスケーラビリティとコストの矛盾を解決するための工学的な答えに近いのです。
MoEが今なお話題のキーワードである理由は、多くの論文があるからだけでなく、誰もがついに推論コストや導入効果を真剣に計算し始めたからです。 モデルが大きくなり、計算能力がますます高価になるにつれて、「どのパラメータが本当にこの計算に参加するのか」という問題自体が最も現実的な問題となります。