ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
アリババ Qwen、Qwen-Audio-3.1 を発表:音声モデル5種を一挙投入、ASRは95%値下げ

アリババ Qwen、Qwen-Audio-3.1 を発表:音声モデル5種を一挙投入、ASRは95%値下げ

AI情報 Admin 3 回閲覧

2026年9月23日、アリババのQwenチームは音声大規模モデルシリーズ「Qwen-Audio-3.1」を正式発表した。自動音声認識(ASR)、音声合成(TTS)、リアルタイム音声対話(Realtime)をカバーする5つの新モデルを一挙に投入し、さらに全く新しい「Next」シリーズ2種——Qwen-Audio-3.1-ASR-NextとQwen-Audio-3.1-TTS-Nextも追加された。モデルと同時に発表されたのは、異例の大幅な音声API値下げだ。TTSが約70%、Realtimeが約85%、ASRは最大95%の値下げとなる。APIはQwen AIプラットフォームですでに利用可能で、ASR-Nextは後日公開予定だ。

5つのモデルはそれぞれ何を担うのか

  • Qwen-Audio-3.1-ASR:音声認識のベースモデル。多言語・方言の認識、文脈理解、書き起こしの自動整形を強みとする。
  • Qwen-Audio-3.1-TTS:音声合成のベースモデル。テキストを自然な音声に変換する。
  • Qwen-Audio-3.1-Realtime:リアルタイム音声対話モデル。音声アシスタントや電話カスタマーサポートなど、低遅延の対話シーンを想定。
  • Qwen-Audio-3.1-ASR-Next:音声理解方向の新モデル。ASRの先を行き、「書き起こす」だけでなく「理解する」ことを目指す。
  • Qwen-Audio-3.1-TTS-Next:最も注目すべき一本。公式の位置づけは「音声クリエイションモデル」で、テキストの台本を渡すと、セリフと環境音をワンパスで合成し、映画級の完全なサウンドスケープを生成する。オーディオブック、映画の吹き替え、ポッドキャスト、ゲームといったプロの制作現場を狙っている。

値下げ幅の計算

今回の値下げは象徴的な1割引きではない。TTSが約70%下がれば、1時間分のオーディオブック収録コストは3分の1以下に。Realtimeが約85%下がれば、トークンを大量消費するリアルタイム音声対話も手の届く範囲に。ASRが95%下がれば、音声書き起こしの限界コストはほぼ底値だ。議事録作成、通話の品質検査、大量の音声アーカイブなど「量で勝負する」業務では、採算が一気に取りやすくなった。

なぜこの値下げが重要なのか

値下げしているのは音声だけではないからだ。9月22日、OpenAIはGPT-6 SolとLunaのAPI価格を半額に引き下げた(OpenAI、GPT-6 SolとLunaを発表:日常業務向けにAPI価格を半額に (/article/2042-openai-launches-gpt-6-sol-and-luna-api-prices-cut-in-half-for-everyday-work))。同日発表のAnthropicのClaude Opus 5.5も、前世代より約4割安く動かせる。Qwenは同じ戦法を音声に持ち込み、モデルの値下げ競争がテキスト推論から音声フルスタックへ広がったことを宣言した。コストを先に下げた者が、音声エージェント、リアルタイム翻訳、AIカスタマーサポートといった領域の入場券を先に手にする。

2つの注意点

第一に、TTS-Nextの「ワンパスで完全な音景を合成」は、単なる音質向上ではなく、制作ツールの形態そのものの変化だ。オーディオブックやショートドラマ、ポッドキャストの制作工程を短縮する。セリフ録音、環境音の選定、ミックスを別々にやっていた作業が、一度の生成で済む可能性がある。ただしその分、プロンプトの要求水準は上がる。「音」をどう描写するかを知らなければならない。

第二に、ASR-Nextはまだ公開されておらず、値下げの対象はAPI利用であってオープンウェイトではない。自前でデプロイして推論を回したい開発者は、今回は恩恵を受けられず、後続のリリースを待つ必要がある。

総じて、Qwen-Audio-3.1の発表ロジックは明確だ。「聞く・話す・リアルタイムで話す・創る」の4工程を、一度のモデル投入で全て押さえ、値下げで敷居を打ち破る。音声APIはテキストAPIと同じくらい安いインフラになりつつあり、音声プロダクトを作るチームにとっては、コスト計算をやり直すタイミングだ。

関連記事

おすすめツール

もっと見る