ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Qwen 3.8-Omni-Flash veröffentlicht: Vollmodale KI beginnt, Audio- und Videoaufgaben direkt auszuführen

Qwen 3.8-Omni-Flash veröffentlicht: Vollmodale KI beginnt, Audio- und Videoaufgaben direkt auszuführen

KI-Informationen Admin 6 Aufrufe

Qwen veröffentlichte Qwen 3.8-Omni-Flash und definierte es als das erste vollmodale Modell, das auf Agentenfähigkeiten basiert. Es verarbeitet nicht nur Text, Bilder, Audio und Video, sondern integriert auch Verständnis, Argumentation, Planung und Werkzeugaufrufe in einem einzigen Workflow, mit dem Ziel, Audio- und Video-KI vom "Inhaltsverständnis" bis zum "Aufgabenabschluss" zu entwickeln.

Vom Verständnis von Videos bis zur Ausführung von Aufgaben

Früher konzentrierten sich vollmodale Modelle hauptsächlich auf Erkennung, Fragen und Antworten und Zusammenfassungen, aber Qwen 3.8-Omni-Flash verlagert den Fokus auf die Ausführung. Offizielle Szenarien umfassen automatisches Videoprotokoll, kurze Videoübersetzung, Erstellung von Filmzusammenfassungen und kontinuierliche Werkzeugaufrufe zur Durchführung von mehrstufigen Aufgaben rund um lange Videos.

Die Alibaba-Cloud-Dokumentation zeigt, dass das Modell Function Calling, Web Search und den Standard-Inferenzmodus unterstützt, wobei die Eingabe Text, Bilder, Audio und Video abdeckt und als Text ausgibt. Für Entwickler bedeutet das, dass Audio- und Videoinhalte direkt als Aufgabenkontext des Agenten dienen können, anstatt als separate Materialanhänge.

1 Million Token werden nicht einfach "noch mehr eingepackt".

Qwen3.8-Omni-Flash bietet 1 Million Token-Kontext. Eine noch wichtigere Änderung ist das "Proxy Viewing": Bei langen Videos kann das Modell zunächst grobe Suchangriffe durchführen und dann aktiv die Segmente identifizieren, die sorgfältig untersucht werden müssen, anstatt das gesamte Segment von Anfang bis Ende zu verarbeiten.

Qwens veröffentlichte OmniVideoBench-Daten zeigen, dass diese Methode die Genauigkeit verbessert und gleichzeitig den Tokenverbrauch deutlich reduziert. Der offizielle Bericht stellt außerdem fest, dass sie gegenüber der vorherigen Generation erhebliche Verbesserungen in WildClawBench-MM, UniClawBench und anderen Proxy-Tests erzielt hat, wobei Audio- und Videofähigkeiten nahe an Gemini 3.8 Flash heranreichen, obwohl diese Ergebnisse hauptsächlich auf Herstellertests basieren.

Die Kosten sinken, und Plugins beginnen, das Ökosystem zu füllen.

Der Preis könnte einen größeren Einfluss auf die Umsetzung haben als die Rankings. Qwen erklärte, dass Qwen 3.8-Omni-Flash im Vergleich zu Qwen 3.5-Omni-Plus die Videoeingabekosten deutlich senkt, was es für Konferenzanalysen, Langform-Videoabrufe und dauerhafte Audio-Video-Agenten erleichtert, von Demos zu Hochfrequenzanrufen zu wechseln.

Die Open-Source-Qwen-MM-Plugins decken nun Video-to-Note, Langform-Videospeicher, Videobearbeitung und Omni Skill Creator ab und unterstützen Agent Harnesses wie Claude Code, Codex, Gemini CLI, OpenClaw und Qwen Code. Qwen-Live Harness setzt weiterhin auf Echtzeit-Audio-Video-Interaktion und Aufgabenorchestrierung.

Was Qwen3.8-Omni-Flash wirklich verdient, ist nicht "ein weiteres stärkeres multimodales Modell", sondern seine Fähigkeit, Audio-Video-Verständnis in nachhaltige Agentenanrufe umzuwandeln. Die nächste Wettbewerbsrunde wird sich wahrscheinlich von der Frage, wer genauer sehen kann, und wer längere, komplexere reale Aufgaben kostengünstiger erledigen kann, verschieben.

Empfohlene Tools

Mehr