ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Sortie de Qwen 3.8-Omni-Flash : L’IA entièrement modale commence à exécuter directement des tâches audio et vidéo

Sortie de Qwen 3.8-Omni-Flash : L’IA entièrement modale commence à exécuter directement des tâches audio et vidéo

Informations sur l’IA Admin 6 vues

Qwen a publié Qwen 3.8-Omni-Flash, le définissant comme le premier modèle entièrement modal construit autour des capacités d’agents. Il gère non seulement le texte, les images, l’audio et la vidéo, mais intègre également la compréhension, le raisonnement, la planification et les appels d’outils dans un seul flux de travail, visant à faire progresser l’IA audio et vidéo de la « compréhension du contenu » à l'« accomplissement de tâches ».

De la compréhension de la vidéo à l’exécution de tâches

Par le passé, les modèles entièrement modaux se concentraient principalement sur la reconnaissance, les questions-réponses et le résumé, mais Qwen 3.8-Omni-Flash déplace l’attention vers l’exécution. Les scénarios officiels incluent l’enregistrement automatique des vidéos, la traduction courte des vidéos, la génération de résumés de vidéos courtes, et des appels d’outils continus pour effectuer des tâches en plusieurs étapes autour de longues vidéos.

La documentation Alibaba Cloud montre que le modèle prend en charge l’appel de fonctions, la recherche Web et le mode d’inférence par défaut, avec des entrées couvrant le texte, les images, l’audio et la vidéo, et la sortie sous forme de texte. Pour les développeurs, cela signifie que le contenu audio et vidéo peut directement servir de contexte de tâche à l’Agent, plutôt que de pièces jointes distinctes.

1 million de jetons n’est pas juste « en avoir plus »

Qwen3.8-Omni-Flash fournit un contexte d’un million de jetons. Un changement plus critique est le « visionnage par procuration » : pour les vidéos longues, le modèle peut d’abord effectuer des recherches grossières, puis identifier activement les segments à examiner soigneusement, plutôt que de traiter l’intégralité du segment du début à la fin.

Les données publiées par Qwen sur OmniVideoBench montrent que cette méthode améliore la précision tout en réduisant significativement la consommation de jetons. Le rapport officiel indique également qu’elle a apporté des améliorations significatives par rapport à la génération précédente dans les tests WildClawBench-MM, UniClawBench et autres proxys, avec des capacités audio et vidéo proches de Gemini 3.8 Flash, bien que ces résultats soient encore principalement basés sur des tests du fabricant.

Les coûts diminuent, et les plugins commencent à remplir l’écosystème

Le prix peut avoir un impact plus important sur la mise en œuvre que les classements. Qwen a déclaré que comparé au Qwen 3.5-Omni-Plus, le Qwen 3.8-Omni-Flash réduit significativement les coûts d’entrée vidéo, facilitant l’analyse de conférence, la récupération vidéo longue durée et la transition des agents audio-vidéo persistants des démos aux appels haute fréquence.

Les plugins Qwen-MM open source couvrent désormais la vidéo à note, la mémoire vidéo longue, le montage vidéo et Omni Skill Creator, et prennent en charge les Agent Harnesses tels que Claude Code, Codex, Gemini CLI, OpenClaw et Qwen Code. Qwen-Live Harness continue de cibler l’interaction audio-vidéo en temps réel et l’orchestration des tâches.

Ce que Qwen3.8-Omni-Flash mérite vraiment d’être pris en compte, ce n’est pas « un autre modèle multimodal plus fort », mais sa capacité à transformer la compréhension audio-vidéo en appels Agent durables. La prochaine compétition évoluera probablement entre qui peut voir avec plus de précision et qui peut accomplir des tâches réelles plus longues et complexes à moindre coût.

Outils Recommandés

Plus