ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
NaiveAI publie le modèle 309B N0.5-Flash en open source : zéro couche de full attention, 1M de contexte natif

NaiveAI publie le modèle 309B N0.5-Flash en open source : zéro couche de full attention, 1M de contexte natif

Informations sur l’IA • Admin • • 9 vues

Le 27 septembre 2026, NaiveAI a publié le modèle à poids ouverts Naive-N0.5-Flash : un modèle mixture-of-experts (MoE) de 309B paramètres au total, dont seulement 15,5B actifs par token, avec une fenêtre de contexte native d'un million de tokens, publié sur Hugging Face sous licence MIT. C'est la démonstration d'ingénierie la plus audacieuse à ce jour de l'approche « sans full attention » — sur les 48 couches du réseau, aucune n'utilise l'attention complète conventionnelle.

48 couches, pas une seule en full attention

Le modèle découpe son Transformer de 48 couches en huit modules de six couches ; chaque module combine cinq couches d'attention à fenêtre glissante et une couche légère de DeepSeek Sparse Attention (DSA) — soit 39 couches à fenêtre glissante et 9 couches éparses au total. La fenêtre glissante ne couvre que 128 tokens ; chaque couche éparse sélectionne les 2 048 tokens les plus importants pour l'attention de base, avec une attention à requêtes groupées sur 4 groupes KV. La fiche officielle du modèle le dit sans détour : tout le réseau reste local ou épars — aucune couche de full attention — tout en offrant un contexte natif d'1M de tokens.

3,25T tokens d'entraînement, sur la base du modèle ouvert de Xiaomi

L'entraînement a utilisé 3,25T tokens au total, le tout à la longueur de contexte native d'1M : 50B tokens de préchauffage pour l'indexeur épars, 3T tokens d'entraînement en attention éparse, puis 200B tokens de décroissance du taux d'apprentissage. La base est le modèle à poids ouverts MiMo-V2.5 de Xiaomi — la continuité de la même famille que MiMo-V2.6, précédemment publié en open source par Xiaomi ; les remerciements citent aussi l'équipe de conception de la sparse attention de DeepSeek et le framework d'inférence SGLang. L'architecture cœur HySparse2 de MiMo-V3, dévoilée ensuite par Xiaomi, suit la même direction de sparsification — « se passer de la full attention » devient une tendance explicite parmi les modèles ouverts chinois.

« L'IA construit l'IA » : le pipeline de recherche fait partie du message

Plus remarquable que le nombre de paramètres, la méthode de construction. Dans son blog technique d'accompagnement, NaiveAI écrit que le pipeline de recherche et d'ingénierie a été « substantiellement exécuté par des systèmes d'IA » : les modèles ont écrit du code, mené des expériences, surveillé les résultats et proposé l'itération suivante, tandis que les chercheurs humains fixaient objectifs, contraintes et critères d'évaluation et prenaient les décisions clés. Le rapport technique s'intitule « Naive-N0.5-Flash: Building Frontier AI with AI ». NaiveAI a été fondée à Pékin en février dernier par le professeur Jifeng Dai de Tsinghua — il y a sept mois à peine — ; ce modèle est en quelque sorte le premier bulletin de sa méthodologie « l'IA développe l'IA ».

Des chiffres de vitesse impressionnants — tous auto-déclarés

Le modèle arrive avec la pile d'inférence maison NaiveRT : fusion de méga-kernels, Programmatic Dependent Launch, décodage spéculatif et précision mixte FP8. L'entreprise annonce 50 tokens/s par utilisateur en mode standard et jusqu'à 2 000 tokens/s en mode Ultrafast. Des observateurs indépendants préviennent déjà : ce sont des chiffres de vitesse de décodage au sens étroit, pas des mesures de bout en bout, et la tenue de la précision sur de longs contextes reste à vérifier. L'API hébergée coûte 0,10 dollar par million de tokens d'entrée, 0,40 dollar par million de tokens de sortie et 0,01 dollar par million de lectures de cache — clairement positionnée pour le code et la R&D en IA.

Pourquoi cela mérite l'attention, à deux niveaux. D'abord, « la sparse attention peut-elle remplacer entièrement la full attention ? » passe d'un débat d'articles à un fait d'ingénierie téléchargeable et vérifiable : si 1M de contexte tient vraiment la route sans aucune couche de full attention, cela réécrit l'équation des coûts des modèles à long contexte. Ensuite, la licence MIT supprime toute barrière à l'usage commercial, et le ratio 309B au total pour 15,5B actifs ramène le coût réel de déploiement au niveau d'un modèle dense de taille moyenne — une nouvelle option pour les équipes qui construisent des agents de code et du RAG sur documents longs. Le bémol : tous ces beaux chiffres sont pour l'instant auto-déclarés par l'entreprise, et les performances réelles attendent les tests de la communauté — ce qui est précisément l'intérêt des poids ouverts. En cas de doute, il suffit de le lancer soi-même et de vérifier.

Outils Recommandés

Plus