ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
MAI-Transcribe-2-Streaming 発表:聞きながら書き起こす Microsoft の音声モデル

MAI-Transcribe-2-Streaming 発表:聞きながら書き起こす Microsoft の音声モデル

AI情報 • Admin • • 5 回閲覧

MAI-Transcribe-2-Streaming は 2026 年 10 月 1 日、Microsoft AI が公式ブログで発表した音声モデルで、音声合成モデルの MAI-Voice-2.1 と高速版 MAI-Voice-2.1-Flash も同時に登場しました。3 モデルは音声エージェント向けのセットで、聞く役と話す役を分け、間の推論モデルに残す時間を意図的に圧縮しています。

聞きながら書き起こし、文が終わる前に動き出す

MAI-Transcribe-2-Streaming は Microsoft 初のストリーミング書き起こしモデルです。文全体を待たず、連続した音声から 100 ミリ秒強で最初の仮の書き起こしを返し、文脈が増えるたびに修正して、発話が終わった瞬間に最終テキストを確定します。Microsoft の評価では、リアルタイムの音声入力や字幕の場面で、文字が現れる速さは最も近い競合の約 2 倍で、Artificial Analysis の最終・仮の両方の正確さ順位で 1 位でした。60 言語に対応し、話している言語を自動で検出し続けます。価格は 2026 年末まで音声 1 時間あたり 0.54 ドルの導入価格です。

一つの声で 23 言語を話す

MAI-Voice-2.1 は Microsoft 現行最強の多言語音声合成モデルで、23 言語・26 ロケールに対応し、100 万文字あたり 22 ドルです。目玉は言語をまたいでも声の同一性を保つ点で、英語、中国語、ドイツ語を話しても同じ人物に聞こえ、各言語の自然なアクセントが付きます。Flash 版は同じ言語に対応し、45 秒の音声を約 150 ミリ秒の遅延で生成、推論は 55% 高速で 100 万文字あたり 15 ドルです。両モデルとも数秒の参照音声で声をクローンでき、悪用を防ぐ同意確認の仕組みを内蔵しています。

なぜ Microsoft は耳と口を自作したのか

音声エージェントは、聞く、理解する、判断する、話すという循環を、人間同士の会話のリズムの中で回す必要があります。聞くと話すの両方で数百ミリ秒ずつ縮めれば、間の推論やツール呼び出しに使える時間が増えます。カスタマーサービスのエージェントは発信者が言い終える前に要望の判別を始められ、多言語アシスタントは言語を検出して同じ声で返答でき、教育製品も言語ごとに先生を替える必要がなくなります。ただし 100 ミリ秒強という数字はモデルが仮の結果を返すまでの時間で、ネットワークや上位アプリを含む音声チェーン全体の応答速度ではありません。

おすすめツール

もっと見る