AIアライメントとは、事前学習の完了後に、人間の意図・価値観・安全要件に沿って大規模言語モデルに応答させるための訓練・評価手法の総称である。事前学習はモデルに「話すこと」だけを教える。「上手に話す」ことを教えるのがアライメントだ。
アライメントは事前学習でもファインチューニングでもない
事前学習:膨大なテキストで学習させ、言語の規則や世界の知識を身につけさせる。この段階のモデルは単なる「テキストの続きを書く機械」にすぎない。
ファインチューニング(SFT、教師ありファインチューニング):Q&Aのペアで「対話形式で答える」ことを教える。いわば新人研修だ。
アライメント:SFTのさらに先。人間の好みを使ってモデルを訓練し、能力そのものは変えずに、人間の期待により沿った選択をさせる。
たとえるなら、事前学習は「すべての本を読んだ学生」、SFTは「試験の解答形式を学んだ学生」、アライメントは「言っていいこと・悪いことをわきまえた学生」だ。
アライメントの3つの主な手法:RLHF・RLAIF・DPO
RLHF(人間のフィードバックからの強化学習):人間がモデルの回答に順位をつけ(どちらが良いか)、その好みを模倣する「報酬モデル」を作り、強化学習でモデルを高得点の方向へ最適化する。初期のChatGPTで有名になった手法で、効果は高いが、大量の人手アノテーションが必要でコストが高い。
RLAIF(AIのフィードバックからの強化学習):「人間の採点」を「AIの採点」に置き換え、より強いモデルが定められた原則に沿って回答に順位をつける。高速で安いが、採点AI自体に偏りがあれば偏りが増幅される。
DPO(直接選好最適化):報酬モデルを作らず、「良い回答 vs 悪い回答」の対比データを使って、良い回答を選びやすくなるようモデルのパラメータを直接調整する。シンプルで効率が良く、現在オープンソースコミュニティで最もよく使われるアライメント手法の一つだ。
アライメントにできないこと
≠ モデルを賢くすること。アライメントは知識も能力も増やさない。振る舞いを調整するだけだ。アライメントされたモデルが事前学習時より「物知り」になるわけではない。
≠ ハルシネーションをなくすこと。モデルは今でも自信満々にでたらめを言う。アライメントは作話の頻度を下げられるが、「自分が何を知っているかわからない」という根本問題は解決しない。
≠ 一度やれば終わり。新しい攻撃手法(プロンプトインジェクションなど)はアライメントをすり抜けるため、継続的な保守と更新が必要だ。
よくある3つの誤解
誤解1:アライメントは「言ってはいけないこと」のブラックリストだ。ブラックリストは安全ガードレール(デプロイ時のフィルタ)であり、アライメントは訓練時の形成だ。「言ってから止められる」のではなく「言いたくならない」ようにする。
誤解2:アライメントされたモデルは安全だ。アライメントはリスクを下げるが安全を保証しない。敵対的入力や脱獄プロンプトは今でも回避できる。
誤解3:アライメントは大企業だけのものだ。モデルをユーザーに使わせる場面には何らかのアライメントが必要で、オープンソースコミュニティも行っている(DPOでオープンモデルを調整するなど)。
アライメントが働いているのを感じる瞬間
「爆弾の作り方」を聞いて、モデルが丁寧に断り、安全な代替案を提示する——それがアライメントだ。議論のある質問に、片方に肩入れせず複数の視点を示す——それもアライメントだ。回答の中で「確信がありません」「私の知識は○年までです」と自ら断る——それもアライメントだ。
アライメントは目立たないが、あなたが毎日話しかける大規模言語モデルが「頼れる助手」なのか「話せても信用できない機械」なのかを決めている。