ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Ant Group stellt Ling-3.1-flash vor: 560 Milliarden Parameter für Agenten und Langzeitaufgaben

Ant Group stellt Ling-3.1-flash vor: 560 Milliarden Parameter für Agenten und Langzeitaufgaben

KI-Informationen • Admin • • 3 Aufrufe

Am 30. September 2026 hat InclusionAI (Ling), die KI-Tochter der Ant Group, über ihren offiziellen WeChat-Account das Sprachmodell der nächsten Generation vorgestellt: Ling-3.1-flash. 560 Milliarden Parameter insgesamt, von denen pro Inferenz nur rund 25 Milliarden aktiviert werden, ausgerichtet auf Agenten-Aufgaben, Suche, Bürosoftware und Spezialanwendungen. Es ist das erste Mal, dass die Flash-Reihe die Parameterzahl in die 500-Milliarden-Klasse hebt.

Fast fünfmal so viele Parameter — und „Flash" steht weiter für Effizienz

Die Vorgängergeneration Ling-3.0-flash setzte auf die Route „klein und schnell": 124 Milliarden Parameter insgesamt, 5,1 Milliarden aktiviert, mit hybrider Attention-Architektur 606 Token pro Sekunde bei einer einzelnen Anfrage auf vier Blackwell-Karten, unter MIT-Lizenz als Open Source veröffentlicht und von vielen Entwicklern selbst gehostet. Ling-3.1-flash hebt das Niveau auf 560 Milliarden Parameter insgesamt und 25 Milliarden aktiviert — fast das Fünffache seines Vorgängers.

Die aktivierten Parameter machen nur etwa ein Zwanzigstel des Ganzen aus — genau die Logik der Mixture-of-Experts(MoE)-Architektur: Das Modell speichert eine große Zahl von „Experten"-Modulen und ruft pro Inferenz nur die relevantesten auf, wodurch Wissenskapazität und Inferenzkosten entkoppelt werden. Zum Mechanismus hinter „riesige Parameter, bescheidene Aktivierung" siehe diese Erklärung: Was ist Mixture-of-Experts (MoE)? Warum beliebte Modelle riesige Parameterzahlen, aber bescheidene Aktivierung haben.

Eine Million Token ist das Ziel, die Testphase startet bei 256K

Laut offizieller Ankündigung ist Ling-3.1-flash für ein Kontextfenster von bis zu einer Million Token ausgelegt und zielt auf „lang andauernde Aufgaben in der realen Welt". In der laufenden zweiwöchigen kostenlosen Testphase liegt die Obergrenze jedoch bei 256.000 Token; nach der Testphase plant InclusionAI, das größere Fenster freizuschalten und das Modell als Open Source zu veröffentlichen.

Dieser Ablauf folgt Lings bewährtem Drehbuch: erst eine kostenlose Testphase, um Feedback aus realen Szenarien zu sammeln, dann Open Source. Da mehrere frühere Ling-Modelle unter MIT-Lizenz erschienen sind, ist das Versprechen „Open Source nach der Testphase" durchaus glaubwürdig.

Die Prioritätenreihenfolge verrät die Absicht: vom Chatten zum Arbeiten

Das aufschlussreichste Detail der Ankündigung ist die Reihenfolge der Positionierung — Agenten-Aufgaben stehen an erster Stelle, gefolgt von Suche, Bürosoftware und Spezialanwendungen. Ling-3.1-flash ist also kein für allgemeinen Chat optimiertes Modell, sondern für lange Arbeitsketten des Typs „eine Aufgabe zu Ende bringen" konzipiert: mehrstufige Tool-Aufrufe, Verarbeitung langer Dokumente, Zusammenarbeit über Anwendungen hinweg — genau dort zählen Kontextlänge und Stabilität am meisten.

Die Langzeitaufgaben-Front: Worauf Ling zielt

Der Wandel von „klein und schnell" zu „groß und leistungsstark" spiegelt die Schwerpunktverlagerung der gesamten Branche: 2026 geht es nicht mehr nur um Chat-Qualität, sondern darum, welches Modell eine reale Aufgabe zuverlässig zu Ende bringt. In Agenten-Szenarien muss ein Modell über Dutzende von Interaktionsrunden das Ziel stabil halten, Tools korrekt aufrufen und extrem lange Eingaben verarbeiten — genau das Problem soll die Kombination aus vielen Parametern und langem Kontext lösen.

Für Entwickler ist der praktischste Schritt, die zweiwöchige kostenlose Testphase zu nutzen: 256.000 Token Kontext reichen aus, um die meisten Langzeitaufgaben-Workflows zu validieren, und wenn die Open-Source-Version nach der Testphase die MIT-Lizenz behält, erhalten Unternehmen ein 560-Milliarden-Parameter-Modell für Langzeitaufgaben, das sie lizenzkostenfrei selbst hosten können — eine Seltenheit unter in China entwickelten Modellen. Zur gemessenen Leistung der Vorgängergeneration siehe: Ling 3.0 Flash beschleunigt Dekodierung: 606 Token/s bei einer Anfrage auf vier Blackwell-Karten.

Empfohlene Tools

Mehr