ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Mellum2.1 veröffentlicht: JetBrains macht aus einem offenen 12B-Modell per Reinforcement Learning einen Coding-Agenten

Mellum2.1 veröffentlicht: JetBrains macht aus einem offenen 12B-Modell per Reinforcement Learning einen Coding-Agenten

KI-Informationen • Admin • • 6 Aufrufe

Mellum2.1, am 8. Oktober 2026 von JetBrains veröffentlicht, ist ein quelloffenes Coding-Modell, das als Arbeiter innerhalb von Coding-Agenten positioniert ist: Es erkundet eine Codebasis, bearbeitet Dateien und prüft seine eigenen Änderungen. Es steht auf Hugging Face unter der Apache-2.0-Lizenz bereit. Das Bemerkenswerte an dieser Version ist nicht die Parameterzahl, sondern dass JetBrains den Sommer ins Reinforcement Learning investiert hat — mit dem Ziel, die Kosten- und Latenzprobleme großer Modelle mit einem kleinen Modell zu lösen.

Die Architektur blieb, der Aufwand steckt im Post-Training

Mellum2.1 nutzt unverändert die Architektur von Mellum2: ein Mixture-of-Experts-Modell mit 12 Milliarden Parametern, von denen pro Token 2,5 Milliarden aktiv sind. Im offiziellen Blog schreibt JetBrains, die Vorgängerversion sei schnell gewesen, habe aber in einem echten Repository nicht auf dem gewünschten Niveau arbeiten können; die Veränderungen dieser Version liegen fast vollständig im Post-Training. Reinforcement Learning wurde von einer kurzen Schlussphase zum Hauptteil des Trainings, gestützt auf Tausende selbst gebauter RL-Umgebungen und Millionen von Sandbox-Läufen. Neue RL-Aufgaben decken Mathematik, kompetitives Programmieren, Naturwissenschaften, Werkzeugnutzung und Software-Engineering ab; offene Datensätze wurden vor dem Training von defekten Tests, nicht überprüfbaren Antworten und unausgewogenen Aufgaben bereinigt.

Die Werte richtig lesen: klare Stärken, sichtbare Grenzen

In JetBrains' eigener Auswertung schlägt Mellum2.1 den Vorgänger in 15 von 17 aufgeführten Benchmarks, am stärksten im agentischen Coding. Auf LiveCodeBench v6 erreicht es 82,0 und liegt damit vor dem vergleichbaren Qwen3.5-9B mit 75,4; auf Terminal-Bench 2.1, das die durchgängige Aufgabenbearbeitung prüft, kommt es dagegen nur auf 17,4 und liegt unter den 21,7 von Qwen3.5-9B. Belastbarer ist die Geschwindigkeitsaussage: Die Architektur ist unverändert, das Post-Training hat die Inferenz nicht verlangsamt, und Multi-Token-Vorhersage macht einzelne Anfragen rund 1,6-mal schneller; in JetBrains' Tests auf einer einzelnen H200 liegt der Durchsatz unter hoher Last fast doppelt so hoch wie bei Qwen3.5-9B. Kurz gesagt: Es gewinnt bei Tempo und Kosten und liegt bei den härtesten Langzeitaufgaben noch zurück.

Für wen es passt — und für wen nicht

Am besten passt es als Arbeiter in einem Agentensystem: die Ursache eines fehlschlagenden Tests finden, einen Fix entwerfen und die Änderung verifizieren — genau die abgegrenzten Aufgaben, auf die es trainiert wurde. Der zweite passende Einsatz ist der private Selbstbetrieb, bei dem Code und Daten auf eigener Infrastruktur bleiben, was für Teams mit strengen Compliance-Anforderungen leichter zu vertreten ist als der Aufruf eines externen Großmodells. GGUF-Builds für llama.cpp, Ollama und LM Studio sowie die Komponente zur Multi-Token-Vorhersage sind als „in Kürze verfügbar" angekündigt; derzeit bezieht man die Gewichte von Hugging Face und betreibt das Modell selbst. Ebenso klar ist, was man nicht erwarten sollte: dass es die komplexeste durchgängige Softwareentwicklung allein trägt oder der Universalassistent mit dem breitesten Wissen ist — der Terminal-Bench-Wert sagt das bereits.

Empfohlene Tools

Mehr