ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
Google、Gemini 3.8 Flash TTSを発表:ひと言の説明で声をデザイン

Google、Gemini 3.8 Flash TTSを発表:ひと言の説明で声をデザイン

AI情報 Admin 4 回閲覧

2026年9月23日、Google DeepMindは公式ブログでGemini 3.8 Flash TTSとFlash-Lite TTSを発表した。これまでで最も表現力の高い音声生成モデルだという。新モデルは、自然言語のプロンプトでゼロから声をデザインしたり、30秒のサンプルから声を再現したりできるほか、行ごとの演技指導、長尺音声の生成、2人の話者による対話の演出にも対応し、100以上の言語をカバーする。

まず、従来の音声モデルとの違いを押さえよう。従来のTTSは「声を選ぶ」ものだった。プリセットの音色ライブラリから1つ選び、速度や抑揚を調整する。新モデルは「声を造る」そして「演技を演出する」ものだ。「温かみがあり、少しハスキーな深夜ラジオの声」と書けばそのまま生成される。30秒の録音を渡せば誰かの声を再現できる。長文の朗読では行ごとに感情を指定でき、2人対話のシーンでは話者の交代もモデルが演出する。Flash-Liteはより軽量なバージョンで、低遅延・低コストを売りにし、リアルタイム性が求められる場面に向く。

どこで使えて、誰が先に恩恵を受けるか

2つのモデルはGoogle AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsで同時に利用できる。最初に恩恵を受けるのは3つの層だ。ポッドキャストやオーディオブックの制作者——長尺生成と行ごとの演技指導は彼らの制作フローに直結する。動画クリエイター——Google Vids内のナレーションをカスタムボイスに差し替えられる。企業研修やサポート部門——2人話者の演出は対話型の教材コンテンツに向く。興味深いことに同日、アリババのQwenも音声モデルファミリーQwen-Audio-3.1を発表しており(関連記事 (/article/2056-a-li-qwen-fa-bu-qwen-audio-3-1-yi-kou-qi-wu-kuan-yu-yin-mo-xing-asr-jiang-jia-9))、音声分野の競争は今週明らかに加速している。

能力が強いほど、境界線は先に明確に

30秒で声を再現できる能力を前に、まず考えるべきはリスクだ。本人の同意なしに声を再現することは、多くの法域で声や肖像に関する権利に触れる。商用利用の前には権利処理のチェーンを確認しなければならない。また「過去最高の表現力」は公式の主張であり、実際の品質は多言語での検証を待つ必要がある。特に中国語の長文でリズムや間が自然に聞こえるかどうか——こうした細部は、開発者が実際に触ってみて初めて見えてくることが多い。

おすすめツール

もっと見る