DeepSeek veröffentlichte offiziell DeepSeek-V4.1-Flash. Offiziell definiert als das kleinste Modell der neuen Architekturreihe, das native multimodales visuelles Verständnis unterstützt, mit den Kernzielen einer höheren Kapazitätsobergrenze, schnellerer Inferenz, höherem Durchsatz und Skalierung auf größere Modelle. Flash ist nicht mehr nur eine "billige Version", sondern wird zum ersten Ort für Architekturen der nächsten Generation.
Die neue Architektur wird zunächst in kleinen Modellen implementiert
In offiziellen Benchmarks erreichte V4.1 Flash GPQA Diamond 90,9, Codeforces 3471, Terminal-Bench 2.1 90,6 und DeepSWE v1.1 74,2. Vision-bezogenes BabyVision (mit Werkzeugen) erreichte 89,6 und Chartography (mit Werkzeugen) 78,9.
Diese Ergebnisse stammen aus den offiziellen Tests von DeepSeek und können nicht direkt mit unabhängiger Unabhängigkeitsvalidierung durch Dritte gleichgesetzt werden. Doch die Richtung ist klar: DeepSeek versucht, Inferenz, Code, Agenten und Visionsfähigkeiten in ein einziges Hochdurchsatzmodell zu packen, anstatt weiterhin mehrere dedizierte Einstiegspunkte aufzuteilen.
Flash begann, Pros Aufgaben zu übernehmen
DeepSeek V4.1 Flash hat nun seine API gestartet, und die Modellnamen wurden in deepseek-flash geändert. Die vorherige Generation V4 Flash und V4 Flash Vision Exp wurden eingestellt; die alten Modellnamen bleiben vorerst kompatibel, und das Routing ist auf V4.1 Flash einheitlich.
Noch wichtiger ist die Pro-Reihe. DeepSeek erklärte, dass V4.1 Flash nach umfangreichen Tests V4.1 Pro in Leistung, Kosten, Geschwindigkeit und Gesamtzeit übertrifft. Ab 12:00 Uhr am 14. September, vor der Version von V4.1 Pro, werden deepseek-v4-pro Anfragen von V4.1 Flash bearbeitet und zu Flash-Preisen berechnet.
Die Kosten der Schlussfolgerung sinken weiterhin.
API-Spezifikationen spiegeln auch die Priorität der KI-Inferenzeffizienz wider: V4.1 Flash unterstützt 1M Kontext, bis zu 384K Ausgabe, und hat ein API-Nebenläufigkeitslimit von 2500; Zum Vergleich: Das aktuelle V4 Pro hat ein Nebenzeitlimit von 500.
Während Nebenzeiten beträgt der Eingabepreis pro Million gecachte Token 0,003 $, der verpasste Cache 0,15 $, der Output 0,6 $ und der Preis verdoppelt sich in Spitzenzeiten. Die Funktionalität nähert sich dem Pro, und die Preise bleiben auf der Flash-Stufe – dies sind die direktesten kommerziellen Signale für dieses Upgrade.
V4.1 Flash ist eher eine Pionierversion der neuen Architektur von DeepSeek: Zunächst werden kleine Modelle verwendet, um native Vision, hohen Durchsatz und Inferenzeffizienz zu überprüfen, dann skaliert man auf größere Modelle. Der Schlüssel als Nächstes ist, wie sehr V4.1 Pro die oberen Grenzen der Fähigkeiten dieser Architektur erweitern wird.