ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Mellum2.1 est sorti : JetBrains transforme un modèle ouvert de 12B en agent de code grâce à l'apprentissage par renforcement

Mellum2.1 est sorti : JetBrains transforme un modèle ouvert de 12B en agent de code grâce à l'apprentissage par renforcement

Informations sur l’IA • Admin • • 6 vues

Mellum2.1, publié par JetBrains le 8 octobre 2026, est un modèle de code open source pensé comme un ouvrier au sein des agents de programmation : il explore une base de code, modifie des fichiers et vérifie ses propres changements. Il est disponible sur Hugging Face sous licence Apache 2.0. L'intérêt de cette version n'est pas le nombre de paramètres, mais le fait que JetBrains a consacré l'été à l'apprentissage par renforcement, en pariant qu'un petit modèle peut régler les problèmes de coût et de latence qui rendent les grands modèles malcommodes comme travailleurs quotidiens.

L'architecture n'a pas bougé ; tout s'est joué après le pré-entraînement

Mellum2.1 conserve l'architecture de Mellum2 : un modèle à mélange d'experts de 12 milliards de paramètres, dont 2,5 milliards activés par token. Dans son article officiel, JetBrains explique que la version précédente était rapide mais incapable de travailler dans un dépôt réel au niveau souhaité, et que les gains de cette version viennent presque entièrement de l'après-entraînement. L'apprentissage par renforcement est passé d'une courte phase finale à la partie principale de l'entraînement, avec des milliers d'environnements construits en interne et des millions d'exécutions en bac à sable. Les nouvelles tâches couvrent les mathématiques, la programmation compétitive, les sciences, l'usage d'outils et l'ingénierie logicielle, et les données ouvertes ont été filtrées avant l'entraînement pour écarter tests défectueux, réponses invérifiables et tâches déséquilibrées.

Comment lire les scores : des forces nettes, des limites visibles

Dans l'évaluation publiée par JetBrains, Mellum2.1 dépasse son prédécesseur sur 15 des 17 benchmarks listés, avec la plus forte progression en programmation agentique. Il obtient 82,0 sur LiveCodeBench v6, devant le comparable Qwen3.5-9B à 75,4 ; mais sur Terminal-Bench 2.1, qui éprouve l'exécution de tâches de bout en bout, il n'atteint que 17,4, sous les 21,7 de Qwen3.5-9B. L'argument de la vitesse est plus solide : l'architecture est inchangée, l'après-entraînement n'a pas ralenti l'inférence, et la prédiction multi-token rend les requêtes individuelles environ 1,6 fois plus rapides ; dans les tests de JetBrains sur un seul H200, son débit sous forte charge est presque le double de celui de Qwen3.5-9B. En résumé, il gagne sur la vitesse et le coût, et reste derrière sur les tâches longues les plus difficiles.

Pour qui c'est fait, et qui devrait passer son tour

Le meilleur usage est celui d'un travailleur dans un système d'agents : identifier la cause d'un test en échec, rédiger un correctif et vérifier le changement sont précisément les tâches bornées sur lesquelles il a été entraîné. Le second usage pertinent est le déploiement privé auto-hébergé, où code et données restent sur votre infrastructure — plus facile à justifier, pour les équipes aux exigences de conformité strictes, que l'appel à un grand modèle externe. Les builds GGUF pour llama.cpp, Ollama et LM Studio, ainsi que le composant de prédiction multi-token, sont annoncés comme prochains ; pour l'instant, les poids se récupèrent sur Hugging Face pour un hébergement maison. Les attentes à éviter sont tout aussi claires : ne comptez pas sur lui pour porter seul l'ingénierie logicielle de bout en bout la plus complexe, ni pour être l'assistant généraliste au savoir le plus large — le score Terminal-Bench le dit déjà.

Outils Recommandés

Plus