Am 22. September 2026 hat China Telecom AI (TeleAI) per Pressemitteilung Xing4.0-29B-A4B vorgestellt — positioniert als leichtes Agenten-Sprachmodell der nächsten Generation. Die Kernspezifikationen sind unkompliziert: 29 Milliarden Gesamtparameter, nur 4 Milliarden aktivierte Parameter pro Token, Mixture-of-Experts-Architektur, 256K-Token-Kontextfenster. Mit Low-Bit-Quantisierung und Speicheroptimierung genügen 15 GB VRAM — eine einzelne Consumer-GPU reicht für den lokalen Betrieb.
Jenseits der Specs: ein Agenten-Modell, das schon in Produktion ist
Anders als viele Releases, die bei Benchmarks stehen bleiben, stellte TeleAI die Einführung in den Vordergrund. Xing4.0-29B-A4B ist in China Telecoms konzernweite Kundenservice-Plattform integriert und bearbeitet komplexe Anfragen per mehrstufigem Reasoning und Tool-Calls; es läuft zudem in „Mid-Screen"-Interaktionsszenarien und assistiert in Echtzeit in Heimservice-Umgebungen. Offizielle Lesart: In diesen echten Geschäftsprozessen seien First-Contact-Resolution und Bearbeitungseffizienz nachweislich gestiegen.
Benchmarkseitig nennt die Mitteilung 75,0 Punkte auf SWE-bench Verified — angeblich Spitze in seiner Parameterklasse. Funktional zielt es auf „Ausführung" statt „Frage-Antwort": autonome Planung mehrstufiger Aufgabenpfade, Aufruf externer Tools, Verarbeitung langer Kontexte, strukturierte Ergebnisse — für Engineering-Szenarien wie Codeentwicklung, Datenanalyse und Dokumentenverarbeitung.
Offenes Ökosystem: zeitgleicher Release auf GitHub und Hugging Face
Das Modell erscheint parallel auf GitHub und Hugging Face (Org: XingChen-AGI), kompatibel mit gängigen Trainings-, Inferenz- und Agenten-Entwicklungsframeworks und validiert auf mehreren heimischen und etablierten KI-Chipplattformen. TeleAI kündigt für die kommenden Monate größere Modelle der Xing4.0-Serie an.
Einordnung: Leichtgewichts-Agenten werden zur eigenen Spur
Auf der aktuellen Branchenkarte ist der Trend klar: In derselben Woche veröffentlichte Xiaomi die MiMo-V2.6-Full-Modality-Doppelversion — ebenfalls mit Fokus auf die Agenten-Ausführungsschicht (Xiaomi veröffentlicht MiMo-V2.6-Full-Modality-Duo: die Agenten-Ausführungsschicht bis zum Äußersten (/zh/article/2026-xiao-mi-fa-bu-mimo-v-2-6-quan-mo-tai-shuang-ban-ben-ba-agent-zhi-xing-ceng-zuo-j)). Auch NVIDIAs Nemotron 3.5 Lightning folgt der 30B-gesamt / ~3B-aktiv-Logik. Die Anbieter konvergieren auf dieselbe Einsicht: Hochfrequente Ausführungsschritte eines Agenten müssen nicht jedes Mal alle Parameter wecken — „kleine Aktivierung, große Gesamtzahl" wird zur Standardantwort.
TeleAIs Differenzierung liegt nicht in den Parametern, sondern in der Identität: Für einen Telekommunikationsbetreiber, der Modelle baut, ist die größte Karte die vorhandene Produktionsszene. Eine Kundenservice-Plattform, die täglich enorme reale Ticketmengen bewältigt, ist eine Validierung, die kein Laborbenchmark liefert. Während andere über Benchmarks sprechen, spricht TeleAI über „läuft bei uns schon eine Weile im eigenen Geschäft" — überzeugender für Unternehmenskunden, die Private Deployment erwägen.
Für Entwickler und KMU liegt der direkteste Wert in den Kosten: eine Consumer-GPU, Daten verlassen nie das Intranet — und man betreibt eine Agenten-Basis, die Code-Repos liest, Tools aufruft und 256K-Token-Kontexte verarbeitet. Wie viel von den 75,0 SWE-bench-Punkten sich in echter Engineering-Arbeit materialisiert, müssen Community-Messungen zeigen.