ToolNavs 便利なAIツールを発見
ツール投稿 ログイン

LLM 推論最適化

要求の並べ方を変えるだけで、同じ GPU の処理量は数倍変わります。連続バッチ処理、投機的デコード、KV キャッシュ、コンテキストキャッシュがそれぞれどの段階の負荷を減らすのか、カーネルライブラリやスパース構造でどこまで詰められるのかを整理します。

連続バッチ処理は単位を生成一步に縮め、投機的デコードは小さなモデルの下書きを大きなモデルがまとめて検証します。KV キャッシュは注意状態を再利用し、コンテキストキャッシュは繰り返し送る長文の結果を保持します。MoE は少数の専門家だけを動かし、Kimi Linear は百万コンテキストの KV キャッシュを約 75% 削ります。効果は用途次第で、コードは長い下書きに向き、自由な創作はそうでもありません。
連続バッチ処理とは何ですか? なぜ大規模モデルサービスは生成ステップごとにリクエストをスケジューリングするのでしょうか?

連続バッチ処理とは何ですか? なぜ大規模モデルサービスは生成ステップごとにリクエストをスケジューリングするのでしょうか?

連続バッチ処理は、大規模モデルのサーバー側で行われる動的スケジューリング手法です。システムは同じバッチ内のすべてのリクエストが生成されるのを待つことなく、次のバッチを置き換えます。代わりに、各生成ステップが終了した後に完了したリクエストを削除し、新しいリクエストを追加します。 主にGPU利用率と全体...

Admin
143
推測的復号とは何か?なぜ小さなモデルが先にドラフトを書くのに、大きなモデルはより速くなるのか?

推測的復号とは何か?なぜ小さなモデルが先にドラフトを書くのに、大きなモデルはより速くなるのか?

推測的復号は大規模モデル推論加速手法です。まず、より軽量で高速なドラフトモデルが複数の候補トークンを連続して提案し、その後ターゲットの大規模モデルが並列チェックを行います。候補が受け入れられると、ターゲットモデルは単一の順位計算で複数の順位を前進させることができます。未確定な部分はターゲットモデルに...

Admin
142
コンテキストキャッシングとは何か? なぜ長期文脈商品のコストキーワードになりつつあるのか

コンテキストキャッシングとは何か? なぜ長期文脈商品のコストキーワードになりつつあるのか

コンテキストキャッシュとは、モデルに繰り返し送信されるコンテキストをキャッシュし、その後のリクエストをできるだけ再利用することであり、毎回再処理するのを避けます。 最近熱くなっているのは、非常に現実的な理由があります。長期コンテキストの製品が増えているにもかかわらず、誰も同じ大きな文書やルール、コー...

Admin
129
ハイブリッドエキスパート(MoE)とは何ですか? なぜ多くの人気モデルはパラメータが大きいのに、起動量はそれほど大きくないのでしょうか?

ハイブリッドエキスパート(MoE)とは何ですか? なぜ多くの人気モデルはパラメータが大きいのに、起動量はそれほど大きくないのでしょうか?

Mixture of Experts(MoE)は「毎回全体を組み立てるわけではない」モデルアーキテクチャです。 最も重要な特徴は、モデルの一部層が複数のエキスパートモジュールに分割され、ルーターが現在のトークンに割り当てるべきエキスパートを決定することです。 このようにして、モデルの総パラメータを非...

Admin
123
KVキャッシュとは何ですか? なぜ大規模モデル推論の加速や長い対話のコストについて話すときに必ず言及されるのでしょうか?

KVキャッシュとは何ですか? なぜ大規模モデル推論の加速や長い対話のコストについて話すときに必ず言及されるのでしょうか?

KVキャッシュは、トランスフォーマーの推論段階における非常に重要なキャッシュ層です。 簡単に言えば、モデルがすでに計算したキーや値を最初に保存し、生成を続けるたびに直接再利用し、毎回一から再計算するのではなく、 そのため、KVキャッシュは長い会話、長い文脈、推論速度に関してほぼ常に存在します。 なぜ...

Admin
124
スパースアテンションとは何か? なぜ長い文脈や推論コストの問題がいつもそれについて語るのか

スパースアテンションとは何か? なぜ長い文脈や推論コストの問題がいつもそれについて語るのか

スパースアテンションは単純に、各トークンがすべてのトークンを見るのではなく、選択的に一部のトークンだけを見るということです。 この用語は、長い文脈と推論コストの議論で繰り返し登場します。なぜなら、標準的な全注意は強力ですが、文脈が特に長くなると計算コストやビデオメモリのコストが急速に増加するためです...

Admin
124
HPC-Opsのオープンソース解釈:騰訊のHunyuan本番用LLM推論オペレーターライブラリがH20のような推論カードの性能をいかに絞り出すか

HPC-Opsのオープンソース解釈:騰訊のHunyuan本番用LLM推論オペレーターライブラリがH20のような推論カードの性能をいかに絞り出すか

1. 要旨 HPC-Opsは、騰訊のHunyuan AI Infraチームによるオープンソースの実用グレードLLM推論オペレーターライブラリであり、主流の推論カード(特にNVIDIA Hopper/SM90、例えばH20)をハードウェアの利用率に近づけることを目的としています。 このプロジェクトは、...

Admin
241
Kimi Linearの技術レポートが公開されました: 複数のシナリオで線形アテンションが完全アテンションを上回る、オープンKDAカーネルとvLLMの統合

Kimi Linearの技術レポートが公開されました: 複数のシナリオで線形アテンションが完全アテンションを上回る、オープンKDAカーネルとvLLMの統合

Moonshot AIは、Kimi Linearの技術レポートとオープンウェイトの公開を発表しました。このレポートでは、その中核コンポーネントであるKimi Delta Attention(KDA)線形アテンションモジュールと、線形アテンションとフルアテンション(MLA)を組み合わせた階層型ハイブリ...

Admin
286