困惑度(パープレキシティ)とは、言語モデルが次の単語についてどれほど迷っているかを示す数字です。文を続ける場面で、実際に現れた単語にモデルが驚くほど数値は高く、当然に感じるほど低くなります。メーカーは新モデルの仕様表に好んで載せますが、これはモデルの賢さの成績表ではありません。答えている問いはとても狭いものだと理解することが大切です。
計算の直感だけを押さえる
モデルは単語を書くたびに、語彙の候補へ確率を割り当てます。自信があるほど、少数の候補に高い確率を集中させます。テストでは、訓練に使っていないテキストを与え、実際に現れた単語へどれだけ高い確率を付けたかを見ます。実単語が高い確率を得続ければ、その種のテキストに習熟しており、困惑度は低くなります。訓練で使う交差エントロピー損失とは同じ事柄の別表現です。式は要りません。困惑度とは、一歩ごとに平均して何個のもっともらしい選択肢の間で迷っているか、というイメージで十分です。
前提も重要です。困惑度は固定したテキスト上で測らなければ意味がありません。小説とコードでは試験が違い、整った反復の多い文章ほど数字は見栄えが良くなります。
低い数値が示すこと、示さないこと
示すのは、その種のテキストの言語パターンへの適合が良く、ありふれた表現を安定して続けられることです。同じモデルの訓練前後で比べれば、低下は習熟の証拠になります。
示さないのは、質問に答える力です。困惑度は推論も、事実の正しさも、自信ありげに作り話をすることも測りません。言葉が滑らかで確率的にもっともらしい文章が、内容としては完全に間違っていることはあります。決まり文句が得意なモデルは良い数字を出しても、検証や計算や判断が必要な課題では失敗します。
正答率やベンチマークとは別物
正答率は答えが決まった問題の正誤を数え、ベンチマークは数学やコードなどの具体的な課題の成績を見ます。困惑度が見ているのは言語レベルの驚きだけです。教科書を滑らかに暗唱できる生徒と、試験で高得点を取る生徒は関連しますが、代わりにはなりません。
よくある三つの誤解
一つ目は、困惑度が低いほど賢いという誤解です。成り立つのは測ったテキストの範囲だけで、分野が変われば数字は変わります。二つ目は、異なるモデルの困惑度を直接比べられるという誤解です。分割方法、テスト文、文脈長が違えば比較になりません。8と12の差は、受けた試験の違いかもしれません。三つ目は、困惑度が低いと答えが信頼できるという誤解です。流暢さは正しさではありません。広く流布した誤りを、データに多く含まれるがゆえに低い困惑度で安定して出すことさえあります。
公表数字の見方
何のテキストで測ったか、誰と比べたか、条件は同じか。この三つを聞いてください。同じテスト集合で自社の前世代と比べた低下にこそ参考価値があります。メーカー横断の順位表は疑ってかかり、実際の課題での実績を見ましょう。多くの人にとって困惑度は訓練品質の傍証であり、購入や選定の決め手ではありません。結局は自分の質問で試すのが一番です。