ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
Qwen 3.8-Omni-Flashリリース:フルモーダルAIが音声および映像タスクを直接実行開始

Qwen 3.8-Omni-Flashリリース:フルモーダルAIが音声および映像タスクを直接実行開始

AI情報 Admin 6 回閲覧

Qwenは Qwen 3.8-Omni-Flashをリリースし、エージェント機能を中心に構築された初のフルモーダルモデルと定義しました。テキスト、画像、音声、動画だけでなく、理解、推論、計画、ツール呼び出しを一つのワークフローに統合し、音声・映像AIを「コンテンツの理解」から「タスク完了」へと進化させることを目指しています。

動画の理解からタスクの実行まで

過去には、フルモーダルモデルは主に認識、Q&A、要約に焦点を当てていましたが、Qwen 3.8-Omni-Flashは実行に重点を移しました。公式なシナリオには、自動ビデオログ、短い動画翻訳、映画の要約生成、長い動画を多段階で行うための連続ツール呼び出しなどがあります。

Alibaba Cloudのドキュメントによると、モデルは関数呼び出し、ウェブ検索、デフォルトの推論モードをサポートしており、入力はテキスト、画像、音声、動画をカバーし、出力はテキストとして行われます。開発者にとっては、音声と映像コンテンツが個別の素材の添付ファイルではなく、直接エージェントのタスクコンテキストとして機能することを意味します。

100万トークンは単に「もっと詰め込まれた」だけではありません。

Qwen3.8-Omni-Flashは 100万トークンコンテキストを提供します。より重要な変更点は「プロキシビューイング」です。長尺動画の場合、モデルはまず粗粒度の検索を行い、その後慎重に検証すべきセグメントを積極的に特定でき、全体を最初から最後まで処理するのではなく、慎重に検証する必要があります。

Qwenが公開したOmniVideoBenchのデータによると、この方法は精度を向上させつつトークン消費を大幅に減らします。公式レポートでは、WildClawBench-MM、UniClawBench、その他のプロキシテストにおいて前世代に比べて大幅な改善が見られ、音声・映像機能はGemini 3.8 Flashに近づいていますが、これらの結果は主にメーカーのテストに基づいています。

コストは下がり、プラグインがエコシステムを埋め始めています

価格はランキングよりも実装に大きな影響を与える可能性があります。Qwenは、Qwen 3.5-Omni-Plusと比較してQwen 3.8-Omni-Flashはビデオ入力コストを大幅に削減し、会議分析、長尺ビデオ検索、持続的なオーディオビデオエージェントがデモから高周波通話へ移行しやすくすると述べています。

オープンソースの Qwen-MMプラグイン は現在、ビデオ・トゥ・ノート、長尺ビデオメモリ、ビデオ編集、Omni Skill Creatorをカバーし、Claude Code、Codex、Gemini CLI、OpenClaw、Qwen Codeなどのエージェントハーネスをサポートしています。Qwen-Live Harnessはリアルタイムの音声・映像インタラクションおよびタスクオーケストレーションを引き続きターゲットにしています。

Qwen3.8-Omni-Flashが本当に注目に値するのは「もう一つの強力なマルチモーダルモデル」ではなく、音声・映像の理解を持続可能なエージェント通話に変える能力です。次の競争は、より正確に見ることができるか、より長く複雑な実務作業を低コストで完了できるかという点に移る可能性が高いです。

おすすめツール

もっと見る