プレトレーニングは大規模言語モデルの最初の訓練段階です。会話やコーディングを覚える前に、モデルは大量のテキストで「次の単語を当てる」ことだけを繰り返します。この段階では礼儀も指示への従順さも教えず、言語の統計的パターン、事実の結びつき、表現の癖をパラメータに刻み込むだけです。おなじみの会話能力や推論スタイルは、すべてこの土台の上に成り立っています。
練習は一つだけ:次の単語当て
課題は驚くほど素朴です。テキストを渡し、続く単語を隠して当てさせる。外れたらパラメータを調整し、当たれば強化する。何兆回ものこうした練習の中で、モデルは文法、常識、専門用語のつながりを少しずつ身につけていきます。
これは自己教師あり学習と呼ばれます。答えはテキスト自体の中に隠れているため、人手による逐一のラベル付けが要りません。だからこそプレトレーニングは大規模化でき、ウェブページ、書籍、論文、コードリポジトリが、クリーニングを経て格好の教材になります。
量より「何を読むか」が品質を決める
教材の質が上限を決めます。各社の手法は大同小異で、公開ウェブ、書籍、百科事典、コードなどから生コーパスを集め、重複除去、低品質コンテンツの除去、個人情報の除去といった洗浄を行います。近年の明確な傾向は「少なく、精密に」です。ウェブ全体のノイズを投入するより、教科書的データやコードの比率を高める方向に進んでいます。
したがってモデルを見るとき、「何トークンで訓練したか」は規模の指標にすぎず、水準そのものではありません。パラメータ規模が近いモデルでも、データの配合が違えば、コーディングや数学の性能に一段の差がつくことがあります。
プレトレーニングとポストトレーニングの分担
プレトレーニングを終えたものは基盤モデルと呼ばれます。知識量は膨大ですが、性質は「続き書きマシン」です。質問しても、答える代わりに問答文を創作して続けてしまうことがあります。今日のような、質問に答え、不適切な依頼を断れるアシスタントにするには、人手の模範で指示従順を教える教師あり微調整と、人間の好みによるアライメントという、さらに二つの工程が必要です。
覚えやすい分担はこうです。プレトレーニングが「どれだけ知っているか、土台の厚み」を決め、ポストトレーニングが「人との付き合い方」を決める。同じ基盤モデルでも、ポストトレーニングのレシピを変えれば、性格の異なるアシスタントに仕上がります。
よくある三つの誤解
第一に、プレトレーニングは原文をデータベースに丸暗記することではありません。モデルが保持するのはパラメータ化された統計的パターンであり、検索可能なテキスト庫ではありません。名文をよどみなく暗唱できるのは、コーパスに何度も登場するからであって、原ファイルを保存しているからではありません。これは、もっともらしく間違える理由の一つでもあります。生成しているのは「らしい言い方」であって、検索した事実ではないのです。
第二に、プレトレーニングが終われば訓練完了ではありません。基盤モデルをそのままチャット製品にすると、体験はたいてい悪くなります。ベンダーが発表する「モデル」には、通常、ポストトレーニング一式が含まれています。
第三に、プレトレーニングは一度きりの生涯教育ではありません。主要ベンダーは新しいデータで訓練を続け、新バージョンを出し続けています。モデルが「賢くなった」と感じるとき、その多くは新しいプレトレーニング用データと配合の成果であり、単なるパラメータ調整ではありません。