ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
NaiveAI veröffentlicht 309B-Modell N0.5-Flash als Open Source: Keine einzige Full-Attention-Schicht, nativ 1M Kontext

NaiveAI veröffentlicht 309B-Modell N0.5-Flash als Open Source: Keine einzige Full-Attention-Schicht, nativ 1M Kontext

KI-Informationen • Admin • • 9 Aufrufe

NaiveAI hat am 27. September 2026 das Open-Weights-Modell Naive-N0.5-Flash veröffentlicht: ein Mixture-of-Experts-Modell (MoE) mit 309B Parametern insgesamt und nur 15,5B aktiven Parametern pro Token, mit nativem Kontextfenster von einer Million Tokens, publiziert auf Hugging Face unter MIT-Lizenz. Es ist die bislang mutigste ingenieurtechnische Bewährungsprobe für den Ansatz „keine Full Attention“ — in allen 48 Schichten des Netzwerks kommt keine einzige konventionelle Full-Attention-Schicht zum Einsatz.

48 Schichten, keine einzige davon Full Attention

Das Modell teilt seinen 48-schichtigen Transformer in acht Module zu je sechs Schichten; jedes Modul kombiniert fünf Sliding-Window-Attention-Schichten mit einer schlanken DeepSeek Sparse Attention (DSA) — insgesamt 39 Sliding-Window- und 9 Sparse-Schichten. Das Sliding Window umfasst nur 128 Tokens; jede Sparse-Schicht wählt die Top-2048-Tokens für die Backbone-Attention aus, kombiniert mit Grouped-Query Attention über 4 KV-Gruppen. Die offizielle Model Card formuliert es unverblümt: Das gesamte Netz bleibt lokal oder sparsam — keine Full-Attention-Schichten — und liefert dennoch nativen 1M-Kontext.

3,25T Tokens Training, Basis ist Xiaomis offenes Modell

Trainiert wurde mit insgesamt 3,25T Tokens, durchgehend bei nativer 1M-Kontextlänge: 50B Tokens Warmup für den Sparse-Indexer, 3T Tokens Sparse-Attention-Training, danach 200B Tokens Learning-Rate-Decay. Die Basis ist Xiaomis Open-Weights-Modell MiMo-V2.5 — eine Fortsetzung derselben Modellfamilie wie MiMo-V2.6, das Xiaomi zuvor als Open Source veröffentlichte; in den Danksagungen stehen zudem das DeepSeek-Sparse-Attention-Designteam und das SGLang-Inferenz-Framework. Die HySparse2-Kernarchitektur von MiMo-V3, die Xiaomi später vorstellte, folgt derselben Sparsifizierungsrichtung — „Full Attention streichen“ wird zu einer sichtbaren Strömung unter Chinas Open Models.

„KI baut KI“: Die Forschungspipeline ist Teil des Angebots

Bemerkenswerter als die Parameterzahl ist die Bauweise. In seinem begleitenden Technik-Blog schreibt NaiveAI, die Forschungs- und Engineering-Pipeline sei „im Wesentlichen von KI-Systemen ausgeführt“ worden: Modelle schrieben Code, führten Experimente durch, überwachten Ergebnisse und schlugen die nächste Iteration vor, während menschliche Forscher Ziele, Randbedingungen und Bewertungsstandards festlegten und die Schlüsselentscheidungen trafen. Der technische Bericht trägt den Titel „Naive-N0.5-Flash: Building Frontier AI with AI“. NaiveAI wurde im Februar dieses Jahres in Peking von Tsinghua-Professor Jifeng Dai gegründet — gerade einmal sieben Monate alt —; dieses Modell ist gewissermaßen das erste Zeugnis seiner „KI entwickelt KI“-Methodik.

Beeindruckende Geschwindigkeitszahlen — alle selbst berichtet

Mit dem Modell erscheint auch der hauseigene Inferenz-Stack NaiveRT: Mega-Kernel-Fusion, Programmatic Dependent Launch, Speculative Decoding und FP8-Mixed-Precision. Das Unternehmen nennt 50 Tokens/s pro Nutzer im Standardmodus und bis zu 2.000 Tokens/s im Ultrafast-Modus. Unabhängige Beobachter mahnen bereits: Das sind eng gefasste Decode-Geschwindigkeiten, keine End-to-End-Messungen, und auch die Genauigkeit über lange Kontexte ist unverifiziert. Die gehostete API kostet 0,10 US-Dollar pro Million Input-Tokens, 0,40 US-Dollar pro Million Output-Tokens und 0,01 US-Dollar pro Million Cache-Reads — klar positioniert für Coding und KI-Forschung.

Warum das Beachtung verdient, hat zwei Ebenen. Erstens wird „Kann Sparse Attention Full Attention vollständig ersetzen?“ von einer Papierdebatte zu einer herunterladbaren ingenieurtechnischen Tatsache: Wenn 1M Kontext ohne eine einzige Full-Attention-Schicht wirklich stabil läuft, schreibt das die Kostenrechnung für Long-Context-Modelle neu. Zweitens beseitigt die MIT-Lizenz jede Hürde für die kommerzielle Nutzung, und das Verhältnis 309B gesamt zu 15,5B aktiv drückt die realen Deploy-Kosten auf das Niveau eines mittelgroßen dichten Modells — eine neue Option für Teams, die Coding-Agenten und Long-Document-RAG bauen. Die nüchterne Seite: Alle glänzenden Zahlen sind vorerst Selbstauskünfte des Unternehmens; die wahre Leistung wartet auf Community-Tests — und genau darin liegt der Sinn von Open Weights. Wer zweifelt, kann es einfach selbst laufen lassen und nachprüfen.

Empfohlene Tools

Mehr