戻るAIはオープンソースです
HPC-Opsのオープンソース解釈:騰訊のHunyuan本番用LLM推論オペレーターライブラリがH20のような推論カードの性能をいかに絞り出すか

HPC-Opsのオープンソース解釈:騰訊のHunyuan本番用LLM推論オペレーターライブラリがH20のような推論カードの性能をいかに絞り出すか

AIはオープンソースです Admin 124 回閲覧

1. 要旨

HPC-Opsは、騰訊のHunyuan AI Infraチームによるオープンソースの実用グレードLLM推論オペレーターライブラリであり、主流の推論カード(特にNVIDIA Hopper/SM90、例えばH20)をハードウェアの利用率に近づけることを目的としています。 このプロジェクトは、SOTAカーネルをゼロユースCUDA + CuTe/CUTLASSから磨き上げることに焦点を当てており、vLLMやSGLangなどの推論フレームワークへの比較的クリーンな統合を提供します。また、BF16/FP8のような多精度推論シナリオに適しています。

2. コア機能

1. 生産における最終性能:推論クリティカルパスの詳細な最適化のために、Attention / GroupGEMM / FusedMoEの公式最大観測加速度比(最大2.22倍)が示されています。

2. 主要な演算子カバレッジ:注意(プリフィル/デコード、ページ付き注意を含む)、グループ化GEMM、融合MoEおよびその他の推論高周波演算子を含む。

3. 多重精度および量子化サポート:BF16およびFP8をネイティブにサポートし、ブロック単位やテンソルごとの異なる量子化スケーリング手法をカバーしています。

4. 統合の容易さと可読性:「クリーンな抽象化+カスタマイズ性」を強調しつつ、カーネル実装を現代的なCUDA学習サンプルにまとめて二次開発の閾値を下げること。

3. 設置

1. 環境要件:NVIDIA SM90 アーキテクチャのGPU; Python 3.8+; C++17をサポートするコンパイラ; CUDA Toolkit 12.8+

  1. ソースコードのインストール(ビルドホイール):
  • git clone https://github.com/Tencent/hpc-ops.git
  • cd hpc-ops
  • make wheel
  • python3 -m pip install dist/*.whl
  • 3. 依存関係の提案:リポジトリのrequirements-dev.txtに応じて開発・テスト依存関係を準備し、実行中のユースケースやバージョンの整合を容易にします。

4. 典型的なユースケース

1. MoEモデル推論加速:FusedMoE / GroupGEMMを用いて、エキスパートルーティング後のGEMMおよび融合オーバーヘッドを削減し、QPS/QPMを向上させます。

2. 長いコンテキストと高同時実行サービス:注意(ページ付き注意を含む)はプリフィル/デコードのスループットや遅延により敏感であり、高負荷時にGPUを圧縮するのに適しています。

3. 推論フレームワークの二次統合:vLLM、SGLangなどのキーオペレーターを置き換え・拡張し、「ローカルカーネルの置き換えと全体的な利益」というエンジニアリングパスを実現します。

4. カーネルの研究開発と教育:CuTe/CUTLASSのエンジニアリング実装は、チームトレーニングや新規オペレーターの反復のための読みやすいサンプルとして使用されます。

5. 生態系と競合製品

  1. 生態学的配置:HPC-Opsは「高性能オペレーターベース」のようなものであり、推論フレームワーク(vLLM、SGLang)と組み合わせて使用することに適しており、完全な推論エンジンの直接的な代替ではありません。
  2. 競合他社/ベンチマーク:注意方向の共通比較 FlashAttention/FlashInfer/TensorRT-LLM; MoEおよびGEMMの方向は、一般的にTensorRT-LLM、DeepGEMMなどと比較されます。 HPC-Opsの違いは、特定のハードウェアや本番ワークロードのより積極的なマイクロアーキテクチャ最適化とエンジニアリング抽象化にあります。

6. 制限事項と注意事項

1. ハードウェアの閾値:現在SM90(ホッパー)GPUが明確に必要です。 他のアーキテクチャの利用可能性や利点は、それ自体で検証する必要があります。

2. バージョン結合:CUDAのバージョン、コンパイラ、依存関係に敏感であり、リポジトリの指示に従って環境を厳密にロックすることが推奨されます。

3. 「最大観測加速比」は安定したリターンとは等しくありません。バッチ数、シーケンス長、並行性や演算子融合法の違いによってリターンに差が生じ、自身のワークロードをベンチマークする必要があります。

4. 統合コスト:演算子を既存の推論スタックに置き換える際は、数値の整合性、精度戦略(BF16/FP8)、およびフォールバックパスに注意を払い、オンライン制御不能なリスクを回避すべきです。

7. プロジェクトアドレス

https://github.com/Tencent/hpc-ops

8. よくある質問

Q: HPC-Opsとは何で、どのような用途に適していますか?

A: これは、vLLM/SGLangのようなフレームワークで主要な演算子を置き換え、スループットとGPU利用率を向上させるのに適した高性能なLLM推論演算子ライブラリです。

Q: HPC-OpsはどのGPUおよびCUDAバージョンをサポートしていますか?

A: NVIDIA SM90(Hopper)アーキテクチャGPUは公式に必須で、CUDA Toolkitは12.8以上が必要です。

Q: HPC-Opsのコアオペレーターはどのような推論リンクをカバーしていますか?

A: Attention(プリフィル/デコード、ページ付き注意を含む)、Grouped GEMM、Fused MoEなどの推論クリティカルパス演算子をカバーします。

Q: HPC-OpsのFP8量子化/スケーリング手法はどのように選べますか?

A: まずリポジトリが提供するインターフェースとテストケースを実行し、その後、精度目標やパフォーマンス指標に基づいてブロック単位やテンソル単位などのスケーリング戦略を選択し、エンドツーエンド回帰を行います。

Q: 自分のモデルやビジネスにおけるHPC-Opsの利点をどのように評価すればよいですか?

A: 実際のリクエスト分布(シーケンス長、バッチ、並行性、MoE構成)をA/Bベンチマークとして使い、プリフィル、デコード、エンドツーエンドのスループット/レイテンシをそれぞれ測定します。

HPC-Opsオープンソース解釈:騰訊渾源AIインフラの高性能LLM推論オペレーターライブラリ H20/SM90の推論計算能力を消費する方法:HPC-Opsの包括的な分析 HPC-OpsとFlashAttention:注意カーネル加速ポイントと適用シナリオ HPC-OpsとFlashInfer:Attentionのパフォーマンスは本番推論でどのように比較されるのか? HPC-OpsとTensorRT-LLM:FusedMoEとInference Stackの統合の違い HPC-OpsとDeepGEMM:GroupGEMMにおけるFP8の性能とエンジニアリングコストの比較 HPC-Ops入門ガイド:ソースコードのコンパイル、メイクホイール、インストールプロセス HPC-Ops環境要件の詳細な説明:SM90、CUDA 12.8、C++17 BF16/FP8のHPC-Opsサポート:定量的スケーリング戦略の選択方法 HPC-Opsの注意(プリフィル/デコード)最適化アイデア:なぜ高速なのか HPC-OpsによるQPM強化:オペレーターのボトルネックからシステムスループットへ MoE推論におけるHPC-Opsの価値:fusedMoEがオーバーヘッドを削減する方法 HPC-Ops GroupGEMMの典型的な使い方:PyTorchコールの例と注釈 HPC-Opsテストとベンチマーク:回帰分析のためのTestsディレクトリの使い方 HPC-Ops 統合型vLLM:演算子層を置き換える一般的な道筋 HPC-Ops統合SGLang:オペレーター適応とパフォーマンス検証 なぜHPC-Opsは「最大観測加速度比」を重視するのか:データの正しい解釈方法 本番環境ではHPC-Opsチェックリスト(安定性、精度、ロールバック)が導入されます CuTe/CUTLASSスタイルのHPCオペレーションコード:現代的なCUDA学習パス HPC-Opsの注意は実際の戦闘を加速させる:KVキャッシュとページ化された注意は関連しています。 HPC-Ops FP8推論実装:スループット向上と数値誤差制御 量子化グループ HPC-Ops向けGEM:ブロックによるスケーリングとテンソルによるスケーリング HPCオペレーションのための融合MOEの定量化:FP8のための専門的な重み付けエンジニアリングの詳細 HPC-Opsと主流の推論ライブラリの分業:フレームワークのスケジューリングと基盤となる演算子の違い RooflineのHPCオペレーションズ:コンピューティングパワーのボトルネックと帯域幅のボトルネックの判断方法 FlashAttentionが十分に速くないとき:なぜHPC-Opsのようなカスタムライブラリを使うのか? HPC-Opsが適しているモデル:ハイブリッドとDeepSeekなどの推論ワークロード解析 HPC-Opsパフォーマンスレプリケーションガイド:入力形態、シーケンス長、コンパイルパラメータ HPC-Opsインストールのトラブル:CUDAバージョンとコンパイラ互換性 コンテナ環境におけるHPC-Ops展開:ビルドイメージとドライバのマッチング推奨 HPC-OpsがA/Bベンチマークを行う方法:レイテンシ、スループット、ビデオメモリ マルチマシンマルチカード推論におけるHPCオペレーションの位置:オペレーターと通信の境界 HPC-Opsのロードマップ解説:スパースな注意と拡張されたクオンツサポートの違い HPC-Opsによる長文脈推論の最適化:疎アテンションの意味 HPC-OpsとFP16/BF16:FP8への切り替え時期 HPC-OpsのAPI設計:統合とカスタマイズ方法 HPC-Ops貢献ガイド:高インパクトのPRとパフォーマンス改善の提出方法 HPC-Opsは新しいアーキテクチャの焦点に適応しています。SM90からGPUのアップデートまで HPC-Opsの生産効果を評価する方法:QPS/QPMと原価計算の違い HPC-Opsオペレーターのカバレッジリスト:注意、GEMM、MoEの概要 HPC-Opsによる推論加速:最小実用的統合(MVP)ステップ HPC-OpsとTritonコア:制御性とピークパフォーマンスの違い HPC-Ops向けのCMake/Makefileの構築方法:構造解析のエンジニアリング HPC-Opsのセキュリティと安定性:基盤となるオペレーターをオンラインで置き換えることのリスクポイント HPC-Ops精度受容法:出力、公差、回帰セットの整合 大規模推論サービスにおけるHPC-Opsの実践:モニタリングとグレースケール HPC-Opsに関するFAQ概要:ハードウェアの閾値、バージョン要件、パフォーマンスの変動 HPC-Opsはあなたに合っていますか?Business Bottlenecksからの選択推奨

関連記事

DeepSeek-OCR 2リリース:ビジュアル・インコーズフローにより文書や図の認識がより「人間らしく」

DeepSeek-OCR 2リリース:ビジュアル・インコーズフローにより文書や図の認識がより「人間らしく」

1. 要旨 DeepSeek-OCR 2は、DeepSeekのオープンソースOCR/ドキュメント理解モデルのアップグレード版であり、「DeepSeek-OCR 2: Visual Causal Flo...

Kimi Code オープンソースリリース:Apache 2.0プロトコルに基づくフル機能のインテリジェントプログラミングエージェント

Kimi Code オープンソースリリース:Apache 2.0プロトコルに基づくフル機能のインテリジェントプログラミングエージェント

- 要旨 Kimi CodeはMoonshot AIがApache 2.0ライセンスを用いてリリースしたオープンソースのコーディングエージェントで、透明性、セキュリティ、スケーラビリティを重視していま...

Mem0はエージェントと統合する価値がありますか? 長期記憶は役立ちますが、境界線を管理する必要があります

Mem0はエージェントと統合する価値がありますか? 長期記憶は役立ちますが、境界線を管理する必要があります

Mem0は、AIアプリケーションやエージェント向けのオープンソースメモリ層プロジェクトで、アプリのユーザーの好み、歴史的事実、長期的な文脈を記憶するのを支援することを目的としています。 パーソナライズ...

ヘイスタックはどのようなチームに適しているのでしょうか? むしろコンポジタブルなRAGエンジニアリングフレームワークのようなものです

ヘイスタックはどのようなチームに適しているのでしょうか? むしろコンポジタブルなRAGエンジニアリングフレームワークのようなものです

HaystackはDeepSetが保守するオープンソースのAIアプリケーションフレームワークで、RAG構築、ドキュメントQ&A、検索パイプライン、LLMワークフローの構築に一般的に使用されています。 ...

おすすめツール

もっと見る