創発能力とは、小さなモデルではほとんどできなかった課題が、規模がある閾値を超えた途端に突然できるようになる能力のことです。これは普通の緩やかな上達ではなく、無から有への跳躍に見える変化です。モデルが小さいうちは、多段階の計算はほぼ全滅し、例をいくつか示しても新しい形式を学べません。ところが規模が一定の水準に達すると、同じ問題が突然解けるようになり、複雑な推論を一歩ずつ進め、例を見て新しい課題をその場で学べるようになります。例から学ぶこの能力は文脈内学習と呼ばれ、創発の例として最もよく挙げられます。
全体の進歩は滑らかなのに、個別の能力が跳ねる理由
創発を語るにはスケーリング則が欠かせません。スケーリング則とは、パラメータ数、データ量、計算量が増えるにつれて、大量のテキストに対するモデル全体の予測損失が滑らかに、予測可能な形で下がっていくという法則です。ただし、全体の損失が滑らかでも、個々の課題の成績が滑らかに伸びるとは限りません。選択式問題や多段階の文章題のような課題は、一連の手順がすべて正しくなければならず、一つ間違えれば答えは不正解になります。小さなモデルも実は少しずつ近づいているのですが、完全な正解まであと数歩の段階では、成績表にはゼロしか並びません。各段階の正確さが臨界点を超えた途端、問題全体が突然解けるようになり、曲線の上では跳躍として現れます。
論争:創発の一部は評価方法が生んだ錯覚かもしれない
創発がモデルの内部で本当に質的な変化が起きたことを意味するのかについては、今も議論が続いています。一部の研究は、報告された跳躍の多くが評価指標の選び方と結びついていると指摘します。最終的な答えが合っているかどうかという二者択一の指標だけを見れば、進歩は階段状に圧縮されてしまいます。各トークンの予測がどれだけ近かったかを見たり、正しい手順に部分点を与えたりするような、より連続的な指標に変えると、同じモデルの曲線はかなり滑らかになり、跳躍感は大きく弱まります。つまり、能力が突然現れたように見えても、モデルの内部で質的変化が起きたと直ちに結論づけることはできず、測定方法が効果を増幅している可能性があります。とはいえ、これは創発の否定ではありません。モデルの変化と指標の変化を区別する必要があるということです。
境界:正確には予測できず、パラメータだけが変数ではない
創発の最も実務的な境界は、正確に予測できないことです。どの能力がどの規模で現れるかを事前に計算できる人はいません。モデルを訓練して測定した後で、振り返って確認することしかできません。また、すべての能力が創発するわけでもありません。規模を大きくしてもゆっくりとしか改善しない課題もあれば、ずっと苦手なままの課題もあります。パラメータ数だけが変数でもありません。データの質、データの構成、訓練方法も能力が現れる時期を変え、パラメータ数が近いモデル同士でも性能は大きく異なることがあります。したがって、規模が創発の門であると言うことはできても、パラメータを積み増せば特定の能力が必ず手に入ると言うことはできません。
よくある二つの誤解もはっきりさせておく必要があります。創発は意識の目覚めではありません。創発が述べているのは課題の成績の変化であり、測定でき再現できる現象です。モデルに主観的な体験があるかどうかとは別の話です。また、創発は大きければ万能という意味でもありません。跳躍が起きるのは一部の課題だけで、同じモデルが他の課題では頻繁に間違えることもあります。創発を、規模がもたらす限定的で完全には制御できない能力の変化と理解する方が、神秘的な目覚めと想像するよりも、研究における実際の意味に近いのです。