アリババトンイー千文は Qwen3.8-Flashをリリースし、低コスト推論と次世代アーキテクチャプレビューを同時に提供しました。このモデルはマルチモーダルMoEアプローチを採用しており、メインモデルは125Bパラメータを持ち、各トークンは6Bのみを有効化します。次回バージョンでは Qwen4 アーキテクチャ設計を事前に導入し、長期コンテキスト効率と単位推論コストを目指しています。
125Bモデルは毎回6Bしか作動しません
Qwen3.8-Flash-Nextは、125Bパラメータのメインモデルと追加の51BのNグラム埋め込みで構成されています。Nグラム埋め込みはローカルコンテキストに基づいてテーブルを検索でき、モデル容量を増加させつつ、追加の計算負荷を低レベルに削減します。
各トークンは6Bパラメータのみを有効化しており、これはこの MoEモデル の重要な指標です。公式には、トレーニングコストはQwen3.7-Plusの約9分の1ですが、プログラミングやオフィス業務の能力向上とともに、モデルの競争は「大規模化」から「通話あたりの効率化」へと移行しています。
Qwen4アーキテクチャは早期に明らかになりました
Qwen3.8-Flash-Nextは完全なQwen4ではなく、次世代アーキテクチャの初期プレビューです。AttentionはGDNとQSAのハイブリッド設計を採用しています。GDNは過去の情報を圧縮し、QSAはより重要なコンテキストをフィルタリングして長シーケンス計算やKVキャッシュアクセス圧力を軽減します。
残留構造もゲート残留にアップグレードされ、ホストメモリにオフロード可能なNグラム埋め込みが施されています。このモデルはネイティブで262,144トークンコンテキストをサポートし、YaRNを通じて100万トークンに拡張可能です。長期コンテキスト効率化がこのアーキテクチャ調整の中心目標となっています。
Flashは大規模なAIアプリケーションをターゲットにしています
Qwen3.8-Flashの本番バージョンはQwenCloud向けに設計されており、デフォルトで1Mコンテキストをサポートしています。この製品ポジショニングは、 AIプログラミング、ドキュメント処理、エージェント、高頻度API呼び出しにより適しており、これらのシナリオは長いコンテキストを必要とし、推論コストやスループットに非常に敏感です。
Qwenチームは、Qwen4ファミリー全体よりも先にNextアーキテクチャを公開することを選び、オープンソースエコシステムに適応期間を与えました。推論フレームワーク、量子化ツール、展開計画は新しい構造に合わせて事前に調整可能であり、次世代モデルが正式にリリースされた際の移行コストを削減できます。
Qwen 3.8-Flashは明確な方向性を示しています。次回の大規模モデル競争はパラメータやベンチマークだけに焦点を当てるわけではありません。より少ないアクティベーションパラメータとメモリ負荷を抑え、より長距離のコンテキストを扱える人が、真に高周波AIアプリケーションに参入する可能性が高くなるでしょう。