Alibaba Tongyi Qianwen a publié Qwen3.8-Flash, intégrant l’inférence à faible coût et l’aperçu d’architecture de nouvelle génération dans la même mise à jour. Ce modèle adopte une approche multimodale MoE, avec le modèle principal disposant de 125 milliards de paramètres, et chaque jeton n’active que 6 Ko ; Sa prochaine version introduit à l’avance la conception de l’architecture Qwen4 , visant l’efficacité à long contexte et le coût d’inférence unitaire.
Le modèle 125B n’active que la 6B à chaque fois
Qwen3.8-Flash-Next se compose d’un modèle principal de 125B paramètres et d’un Embedding N-gram supplémentaire de 51B. L’Embedding N-gramme peut consulter des tables en fonction du contexte local, augmentant la capacité du modèle tout en réduisant la charge de calcul supplémentaire à un niveau inférieur.
Chaque jeton n’active que 6 milliards de paramètres, qui constituent une métrique clé pour ce modèle MoE . Officiellement, son coût d’entraînement est environ un neuvième de celui de Qwen3.7-Plus ; tout en améliorant les capacités en programmation et en tâches de bureau, la concurrence des modèles est passée d’une « plus grande échelle » à une « plus efficace par appel ».
L’architecture Qwen4 a été révélée tôt
Qwen3.8-Flash-Next n’est pas le Qwen4 complet, mais un aperçu précoce de l’architecture de nouvelle génération. Attention utilise une conception hybride de GDN et QSA : GDN compresse les informations historiques, tandis que QSA filtre les contextes plus importants pour réduire le calcul sur les longues séquences et la pression d’accès au cache KV.
La structure résiduelle a également été mise à niveau vers le résidu gateté, avec un embedding N-gram pouvant être transféré à la mémoire hôte. Le modèle prend en charge nativement 262 144 contextes de jetons et peut être étendu à 1M de jetons via YaRN. L’efficacité du long contexte est devenue l’objectif principal de cet ajustement architectural.
Flash vise les applications d’IA à grande échelle
La version de production de Qwen3.8-Flash est conçue pour QwenCloud et prend en charge par défaut le contexte 1M. Ce positionnement produit est mieux adapté à la programmation IA, au traitement de documents, aux agents et aux appels API à haute fréquence, car ces scénarios nécessitent de longs contextes et sont très sensibles au coût d’inférence et au débit.
L’équipe Qwen a choisi de publier publiquement l’architecture Next avant l’ensemble de la famille Qwen4, offrant ainsi ainsi à l’écosystème open source une période d’adaptation. Les cadres d’inférence, les outils de quantification et les plans de déploiement peuvent être ajustés à l’avance autour de la nouvelle structure, réduisant ainsi les coûts de migration lors de la sortie officielle du modèle de nouvelle génération.
Qwen 3.8-Flash révèle clairement une direction claire : la prochaine phase de compétition de grands modèles ne se concentrera pas uniquement sur les paramètres et benchmarks. Celui qui sera capable de gérer des contextes plus longs avec moins de paramètres d’activation et une surcharge mémoire moindre sera plus susceptible d’entrer dans des applications d’IA véritablement à haute fréquence.