ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI百科事典
プレトレーニングとは?モデルが会話を覚える前に、ネットの大半を読み込む段階

プレトレーニングとは?モデルが会話を覚える前に、ネットの大半を読み込む段階

AI百科事典 • Admin • • 9 回閲覧

プレトレーニングは大規模言語モデルの最初の訓練段階です。会話やコーディングを覚える前に、モデルは大量のテキストで「次の単語を当てる」ことだけを繰り返します。この段階では礼儀も指示への従順さも教えず、言語の統計的パターン、事実の結びつき、表現の癖をパラメータに刻み込むだけです。おなじみの会話能力や推論スタイルは、すべてこの土台の上に成り立っています。

練習は一つだけ:次の単語当て

課題は驚くほど素朴です。テキストを渡し、続く単語を隠して当てさせる。外れたらパラメータを調整し、当たれば強化する。何兆回ものこうした練習の中で、モデルは文法、常識、専門用語のつながりを少しずつ身につけていきます。

これは自己教師あり学習と呼ばれます。答えはテキスト自体の中に隠れているため、人手による逐一のラベル付けが要りません。だからこそプレトレーニングは大規模化でき、ウェブページ、書籍、論文、コードリポジトリが、クリーニングを経て格好の教材になります。

量より「何を読むか」が品質を決める

教材の質が上限を決めます。各社の手法は大同小異で、公開ウェブ、書籍、百科事典、コードなどから生コーパスを集め、重複除去、低品質コンテンツの除去、個人情報の除去といった洗浄を行います。近年の明確な傾向は「少なく、精密に」です。ウェブ全体のノイズを投入するより、教科書的データやコードの比率を高める方向に進んでいます。

したがってモデルを見るとき、「何トークンで訓練したか」は規模の指標にすぎず、水準そのものではありません。パラメータ規模が近いモデルでも、データの配合が違えば、コーディングや数学の性能に一段の差がつくことがあります。

プレトレーニングとポストトレーニングの分担

プレトレーニングを終えたものは基盤モデルと呼ばれます。知識量は膨大ですが、性質は「続き書きマシン」です。質問しても、答える代わりに問答文を創作して続けてしまうことがあります。今日のような、質問に答え、不適切な依頼を断れるアシスタントにするには、人手の模範で指示従順を教える教師あり微調整と、人間の好みによるアライメントという、さらに二つの工程が必要です。

覚えやすい分担はこうです。プレトレーニングが「どれだけ知っているか、土台の厚み」を決め、ポストトレーニングが「人との付き合い方」を決める。同じ基盤モデルでも、ポストトレーニングのレシピを変えれば、性格の異なるアシスタントに仕上がります。

よくある三つの誤解

第一に、プレトレーニングは原文をデータベースに丸暗記することではありません。モデルが保持するのはパラメータ化された統計的パターンであり、検索可能なテキスト庫ではありません。名文をよどみなく暗唱できるのは、コーパスに何度も登場するからであって、原ファイルを保存しているからではありません。これは、もっともらしく間違える理由の一つでもあります。生成しているのは「らしい言い方」であって、検索した事実ではないのです。

第二に、プレトレーニングが終われば訓練完了ではありません。基盤モデルをそのままチャット製品にすると、体験はたいてい悪くなります。ベンダーが発表する「モデル」には、通常、ポストトレーニング一式が含まれています。

第三に、プレトレーニングは一度きりの生涯教育ではありません。主要ベンダーは新しいデータで訓練を続け、新バージョンを出し続けています。モデルが「賢くなった」と感じるとき、その多くは新しいプレトレーニング用データと配合の成果であり、単なるパラメータ調整ではありません。

関連記事

Yandex のデータセンターが 2 日連続で被弾、AI スーパーコンピューターのある拠点も停止

Yandex のデータセンターが 2 日連続で被弾、AI スーパーコンピューターのある拠点も停止

Yandex は 2026 年 10 月 9 日、ロシアのカルーガ州にある同社のデータセンターがドローン攻撃を受け、複数のモジュールが完全に使用不能になったと確認した。同社のデータセンターが被弾するの...

AIデータ分析ツールの選び方:一般職、ビジネス職、データ職で最適解は違う

AIデータ分析ツールの選び方:一般職、ビジネス職、データ職で最適解は違う

AIデータ分析ツールを選ぶときは、まず機能一覧ではなく、自分がどの席に座っているかを見てください。毎日Excelと向き合う一般職、データで報告するビジネス職、もともとコードが書けるデータ職では、必要な...

自己回帰とは?大規模モデルが一語ずつ文字を吐き出す理由

自己回帰とは?大規模モデルが一語ずつ文字を吐き出す理由

自己回帰とは、大規模モデルが文章を生成するときに使う基本的な方式のことです。すでに現れたトークンをもとに、次に来る可能性が最も高いトークンを予測し、新しく生成したトークンを入力の末尾に付け足して、さら...

壊滅的忘却とは?新しい技能を覚えたモデルが、古い技能を落とす理由

壊滅的忘却とは?新しい技能を覚えたモデルが、古い技能を落とす理由

壊滅的忘却とは、ニューラルネットワークが複数の課題を順番に学ぶとき、後の課題を身につける代わりに、前に覚えたことを広範囲に忘れてしまう現象です。出来上がったモデルへ新しい分野のデータで追加の微調整を行...

おすすめツール

もっと見る