推論エンジンはAIエージェントがゼロから書き上げ、成熟した汎用フレームワークを上回れるのか。2026年10月2日に更新されたBasetenのエンジニアリングブログが、その実測結果を公開した。エンジニアはMetaInfer論文を参考に、Claude Code(Fable 5)にQwen-3.6-35B-A3B向けのカスタム推論エンジンをゼロから構築させ、NVFP4精度、単一のNVIDIA B200で動作させ、VibeQwenと名付けた。MetaInferはskills-onlyフレームワークを採用し、モデルの事後学習は不要だ。
主要データ:単一ストリームで90%高速、初回トークン遅延は半分以下に
VibeQwenの単一ストリームデコードは1792 TPSに達し、チューニング済みのvLLM 0.25.1の943 TPSより90%高速だった。初回トークン遅延は12ms対28msで、2.33倍の改善に相当する。同時実行数32では出力スループット10307 TPSを記録し、vLLMの6030 TPSを71%上回った。比較対象がデフォルト設定ではなくチューニング済みのvLLMである点が重要だ。
目標は、全指標でvLLMを20%上回り、かつ精度を落とさないことであり、精度の基準はBF16とされた。Claudeは約1週間ほぼ自律的に作業し、約17億トークン(大半はキャッシュ入力)と約200時間のB200を消費し、最初の数日でvLLMに追いついた。精度にわずかな数値差が出た場合は、人間の承認が必要だった。
第二の実験Sammie:知識ベースの再利用でより速く、より安く
Basetenは続いて第二の実験Sammieを実施した。画像セグメンテーションモデルSAM 3.1向けの推論サービスを構築し、単一のH100で毎秒91枚を達成、Meta公式のリファレンスサーバーよりスループットが50%高かった。期間はわずか数日、トークン消費は約2億だった。速く安く済んだのは、最初の実験で蓄積した知識ベースを再利用できたからだ。コストはSammieの数百ドルからVibeQwenの数千ドルまで幅がある。経験を再利用できるこの性質は、単発の成績以上に注目に値する。
限界と前提:まだ実験段階であり、精度制約を先に固定すべき
両エンジンとも現時点では実験段階にあり、本番トラフィックは処理していない。Basetenによれば、実験ではエージェントがvLLMやTensorRT-LLMの既存カーネルを参照することを許可しており、原論文のようにソースコードから完全に隔離していたわけではない。こうした自動最適化が成立する前提は二つある。推論指標が定量化でき、正しさを全精度のリファレンス実装と数値的に検証できること。そして精度制約を事前に固定すること。さもなければ、エージェントは同じ文字だけを出力して指標を稼ぐような抜け道を見つけてしまう。
汎用エンジンの弱点こそ、カスタム最適化の出番
vLLM、SGLang、TensorRT-LLMは汎用性と使いやすさで勝るが、特定の「モデル+ハードウェア+負荷」の組み合わせでは通常最適ではない。推論への支出規模は巨大で、1桁台のパーセント改善でも大規模展開では数百万ドルに相当する。専用エンジンの居場所はまさにそこにある。