ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Ant Group dévoile Ling-3.1-flash : 560 milliards de paramètres pour agents et longues tâches

Ant Group dévoile Ling-3.1-flash : 560 milliards de paramètres pour agents et longues tâches

Informations sur l’IA • Admin • • 6 vues

Le 30 septembre 2026, InclusionAI (Ling), la filiale IA du groupe Ant, a annoncé via son compte WeChat officiel son modèle de langage de nouvelle génération : Ling-3.1-flash. 560 milliards de paramètres au total, dont seulement environ 25 milliards activés par inférence, ciblant les tâches d'agents, la recherche, les logiciels bureautiques et les applications spécialisées. C'est la première fois que la gamme Flash porte son échelle de paramètres dans la classe des 500 milliards.

Près de cinq fois plus de paramètres — et « Flash » rime toujours avec efficacité

La génération précédente, Ling-3.0-flash, jouait la carte du « petit et rapide » : 124 milliards de paramètres au total, 5,1 milliards activés, 606 tokens par seconde sur une requête unique avec quatre cartes Blackwell grâce à son architecture d'attention hybride, publié sous licence MIT et auto-hébergé par de nombreux développeurs. Ling-3.1-flash hisse la barre à 560 milliards de paramètres au total et 25 milliards activés — près de cinq fois son prédécesseur.

Les paramètres activés ne représentent qu'environ un vingtième du total — c'est exactement la logique de l'architecture mixture-of-experts (MoE) : le modèle stocke un grand nombre de modules « experts » et n'appelle à chaque inférence que les plus pertinents, découplant ainsi capacité de connaissance et coût d'inférence. Pour comprendre le mécanisme derrière « des paramètres gigantesques, une activation modeste », voir cet éclairage : Qu'est-ce que le Mixture-of-Experts (MoE) ? Pourquoi les modèles populaires affichent d'énormes paramètres mais une activation modeste.

Un million de tokens comme objectif ; la phase d'essai démarre à 256K

Selon l'annonce officielle, Ling-3.1-flash est conçu pour une fenêtre de contexte allant jusqu'à un million de tokens, visant les « longues tâches du monde réel ». Mais la phase d'essai gratuit de deux semaines en cours plafonne le contexte à 256 000 tokens ; après l'essai, InclusionAI prévoit d'ouvrir la fenêtre élargie et de publier le modèle en open source.

Ce calendrier suit le schéma habituel de Ling : d'abord un essai gratuit pour recueillir les retours de scénarios réels, puis l'open source. Plusieurs modèles Ling précédents ayant été publiés sous licence MIT, la promesse d'une « open source après l'essai » est tout à fait crédible.

L'ordre des priorités révèle l'intention : du bavardage au travail

Le détail le plus révélateur de l'annonce est l'ordre de positionnement — les tâches d'agents viennent en premier, suivies de la recherche, des logiciels bureautiques et des applications spécialisées. Ling-3.1-flash n'est donc pas un modèle optimisé pour le chat généraliste, mais conçu pour de longues chaînes de travail du type « mener une tâche à son terme » : appels d'outils en plusieurs rounds, traitement de longs documents, collaboration entre applications — précisément là où longueur de contexte et stabilité comptent le plus.

Le front des longues tâches : ce que Ling vise

Le passage du « petit et rapide » au « grand et complet » reflète le déplacement du centre de gravité de toute l'industrie : en 2026, la compétition ne porte plus seulement sur la qualité du chat, mais sur le modèle capable de mener à bien une tâche réelle de façon fiable. Dans les scénarios d'agents, un modèle doit maintenir son objectif sur des dizaines de rounds d'interaction, appeler correctement les outils et digérer des entrées extrêmement longues — c'est exactement le problème que la combinaison grands paramètres plus long contexte est censée résoudre.

Pour les développeurs, la démarche la plus pragmatique est de profiter des deux semaines d'essai gratuit : 256 000 tokens de contexte suffisent pour valider la plupart des workflows de longues tâches, et si la version open source après l'essai conserve la licence MIT, les entreprises disposeront d'un modèle de classe 560 milliards de paramètres pour longues tâches, auto-hébergeable sans coût de licence — une rareté parmi les modèles développés en Chine. Pour les performances mesurées de la génération précédente, voir : Ling 3.0 Flash accélère le décodage : 606 tok/s sur une requête unique avec quatre cartes Blackwell.

Outils Recommandés

Plus