ToolNavs AIツールナビ
ツール投稿 ログイン
戻るAI百科事典
推測的復号とは何か?なぜ小さなモデルが先にドラフトを書くのに、大きなモデルはより速くなるのか?

推測的復号とは何か?なぜ小さなモデルが先にドラフトを書くのに、大きなモデルはより速くなるのか?

AI百科事典 Admin 2 回閲覧

推測的復号は大規模モデル推論加速手法です。まず、より軽量で高速なドラフトモデルが複数の候補トークンを連続して提案し、その後ターゲットの大規模モデルが並列チェックを行います。候補が受け入れられると、ターゲットモデルは単一の順位計算で複数の順位を前進させることができます。未確定な部分はターゲットモデルによって修正されます。単に2つのモデルの回答をつなぎ合わせるのではなく、生成待ち時間を最適化します。

スローダウンは各トークンによって生成されます

自己回帰モデルは通常、最初のトークンとして形成されてから2番目のトークンを進める必要があります。強力なGPU計算能力があっても、このシリアル依存性は復号時に頻繁にショートフォワード計算を引き起こし、ハードウェアが十分に活用されない可能性があります。復号はまず次の内容を下書きし、それを大規模モデルに提出してバッチ採点を行い、対象モデルへの呼び出し数を減らすと推測されています。

このプロセスは4つのステップに分かれます。

  1. この草案モデルは、現在の文脈に基づく短い候補配列の列を提案しています。
  2. ターゲットモデルはこれらの位置の確率を並行して計算します。
  3. 候補者は受け入れ規則に従って留まり、ポジションが一致しなければ受け入れは停止されます。
  4. ターゲットモデルは次のドラフトラウンド開始前に正しい部門を補完します。

標準的なアルゴリズムは、対象モデルの元のサンプリング分布を維持するために、受容および補正ルールを支持します。大規模モデルを密かに小型モデルに置き換えることも、ターゲットモデルの再学習も必要ありません。

なぜいつも速くならないのでしょうか?

重要な指標は候補者の受け入れ率です。ドラフトモデルが弱すぎると、最初の数トークンで却下されることが多く、追加のドラフト作成がオーバーヘッドとなります。ドラフトモデルが大きすぎると、「安価な生成」という意味を失います。テキストの予測可能性、ラウンドあたりの候補者の長さ、ハードウェア並列性、バッチサイズはすべて収益に影響を与えます。コードや固定フォーマットのような強い連続性のあるコンテンツは、大きく異なる作成よりも長いドラフトを受け入れやすい傾向があります。

これは問題を解決する他の加速法とは異なります

量子化は主に重みサイズと計算コストを削減し、KVキャッシュは計算された過去の注意状態を再利用します。投機的復号は、単一のターゲットモデルでより多くのトークンを確認できるようにする方法に焦点を当てています。これらの手法は組み合わせることも可能ですが、総じてメモリを消費し、スケジューリングの複雑さを増します。

採用する価値があるかどうか判断するには、デモの速度だけを見るのではなく、デプロイチームは、プロンプトの長さ、出力長、並行処理量、ハードウェアの初トークン時間、トークンごとの遅延、スループット、メモリ使用量を比較し、加速が安定性の低下を伴わないことを確認する必要があります。

関連記事

世界ヒューマノイドロボットゲームズ開幕:自律競争がパフォーマンスからストレステストへと移行

世界ヒューマノイドロボットゲームズ開幕:自律競争がパフォーマンスからストレステストへと移行

2026年8月22日の夜、第2回世界ヒューマノイドロボットゲームズが北京のナショナルスピードスケートオーバルの「アイスリボン」で開幕しました。 公式イベント情報およびIT Homeの現地報告によると、...

連続バッチ処理とは何ですか? なぜ大規模モデルサービスは生成ステップごとにリクエストをスケジューリングするのでしょうか?

連続バッチ処理とは何ですか? なぜ大規模モデルサービスは生成ステップごとにリクエストをスケジューリングするのでしょうか?

連続バッチ処理は、大規模モデルのサーバー側で行われる動的スケジューリング手法です。システムは同じバッチ内のすべてのリクエストが生成されるのを待つことなく、次のバッチを置き換えます。代わりに、各生成ステ...

GraphRAGとは何ですか? なぜ文書全体にわたる問いに答えるのが得意なのか

GraphRAGとは何ですか? なぜ文書全体にわたる問いに答えるのが得意なのか

GraphRAGは、知識グラフと検索拡張生成を組み合わせた手法です。 まずドキュメントの集合からエンティティ、関係性、イベントを抽出して接続可能なグラフを形成し、その後グラフ内のコミュニティや階層別に...

AIガードレールとは何か?なぜセキュリティガードレールはシステムプロンプトだけに頼れないのか

AIガードレールとは何か?なぜセキュリティガードレールはシステムプロンプトだけに頼れないのか

AIガードレール(一般的にAIガードレールと訳される)は、モデルの入力、コンテキスト、ツール呼び出し、出力の周囲に設けられた制約や検出メカニズムを指します。これらは禁止品に対するシステムのプロンプトと...

おすすめツール

もっと見る