2026年9月30日、アント・グループ傘下のInclusionAI(百灵)は公式WeChatアカウントを通じて次世代言語モデル「Ling-3.1-flash」を発表した。総パラメータ数5600億、推論ごとにアクティブ化されるのは約250億パラメータのみで、エージェントタスク、検索、オフィスソフト、専門アプリケーションを主戦場とする。flashシリーズがパラメータ規模を5000億クラスに引き上げたのは今回が初めてだ。
パラメータは約5倍、それでも「flash」は効率を語る
前世代のLing-3.0-flashは「小さく速い」路線だった。総パラメータ数1240億、アクティブ化51億、ハイブリッドアテンションアーキテクチャによりBlackwell 4枚で単一リクエスト606トークン/秒のスループットを記録し、MITライセンスでオープンソース化され、多くの開発者がセルフホストしてきた。一方Ling-3.1-flashは総パラメータ数5600億、アクティブ化250億へと一気に引き上げ、前世代の約5倍の規模となった。
アクティブ化パラメータは総パラメータの約20分の1にすぎない——これは混合エキスパート(MoE)アーキテクチャの論理そのものだ。モデル内に大量の「エキスパート」モジュールを持ち、推論ごとに最も関連性の高いものだけを呼び出すことで、知識容量と推論コストを切り離す。「パラメータは巨大、アクティブ化は控えめ」の仕組みについてはこちらの解説を参照:混合エキスパート(MoE)とは?人気モデルのパラメータが大きいのにアクティブ化が小さい理由。
100万トークンが目標、試用期間はまず25.6万から
公式発表によれば、Ling-3.1-flashは最大100万トークンのコンテキストウィンドウを設計目標とし、「現実世界の長尺タスク」を狙う。ただし現在実施中の2週間無料トライアルではコンテキスト上限は25.6万トークン。トライアル終了後に大きなウィンドウを開放し、モデルをオープンソース化する計画だ。
この進め方は百灵の定番だ。まず無料トライアルで実際の利用シーンのフィードバックを集め、その後にオープンソース化する。これまでのLingシリーズの多くがMITライセンスで公開されてきたことを考えると、「トライアル後のオープンソース化」という約束には十分な信憑性がある。
位置づけの順序が意図を物語る:チャットから「仕事」へ
発表で最も注目すべきは位置づけの順序だ——エージェントタスクが筆頭に置かれ、続いて検索、オフィスソフト、専門アプリケーションが並ぶ。つまりLing-3.1-flashは汎用チャット向けに最適化されたモデルではなく、「一つの仕事を完遂する」ような長い連鎖のタスクのために設計されている。複数回にわたるツール呼び出し、長文ドキュメントの処理、アプリ横断の連携——こうした場面こそコンテキスト長と安定性が物を言う。
長尺タスクの戦線:百灵が狙うもの
「小さく速い」から「大きく充実した」へ——百灵の製品転換は、業界全体の重心移動を映している。2026年の競争はもはやチャット品質の勝負ではなく、現実のタスクを安定的に完遂できるモデルがどれか、という勝負だ。エージェントの場面では、モデルは数十回に及ぶやり取りで目標をぶらさず、ツールを正しく呼び出し、超長文の入力を処理しなければならない——大パラメータと長コンテキストの組み合わせが解こうとしているのはまさにこの問題だ。
開発者にとって今いちばん現実的なアクションは、この2週間の無料トライアルを活用することだ。25.6万トークンのコンテキストがあれば、ほとんどの長尺タスクのワークフローを検証できる。そしてトライアル後のオープンソース版がMITライセンスを継承すれば、企業はライセンスコストゼロで5600億パラメータ級の長尺タスクモデルをセルフホストできる——国産モデルでは稀有なことだ。前世代モデルの実測性能はこちら:Ling 3.0 Flashのデコード高速化:Blackwell 4枚で単一リクエスト606トークン/秒。