Googleは公式ブログで、Gemini 2.5 FlashおよびGemini 2.5 Proのテキスト読み上げ(TTS)プレビューモデルに重要なアップグレードを加えたと発表しました。 このアップデートは、感情やトーンの多様性の向上、スタイル指示の遵守、複数キャラクターの会話シナリオにおける一貫性に焦点を当てており、合成音声のスタイルや聴き手感をより細かくコントロールできるようにすることを目指しています。
リズム制御に関しては、新バージョンではテキスト内容に基づいて文脈認識音声で話の速度を調整でき、複雑な内容の説明時に自動的に速度を落としたり、緊張感のある段落や高エネルギー段落ではテンポを速くしたり、明確なリズムや一時停止コマンドの実行が改善されます。 マルチスピーカー対応も強化され、ポッドキャスト、バーチャルインタビュー、ナレーションなどのシナリオで異なるキャラクターのトーン、トーン、ムードを維持し、モデルがすでにサポートしている24言語間で一貫したパフォーマンスを維持できます。
現在、Gemini 2.5 Flash TTS(低遅延重視)と2.5 Pro TTS(音質と表現力重視)が、今年5月にリリースされた以前のTTS版に代わるGemini APIを通じてGoogle AI Studioで開発者向けに開放されています。 業界は、この高度に制御可能なTTS技術がオーディオブック、オンライン教育、ローカライズマーケティング、クリエイターコンテンツ制作の自動化をさらに進めると期待していますが、同時に著作権遵守や音声合成の悪用防止に対する要求も高まると期待しています。
よくある質問
:今回のGemini 2.5 FlashとPro TTSで主にアップデートされた機能は何ですか?
A: このアップデートは、感情やトーンの変化、文脈を意識したスピードとリズムのコントロール、そして複数話し手や複数キャラクターの会話における声の一貫性と安定性の向上に焦点を当てています。
Q: Gemini 2.5 Flash TTSと2.5 Pro TTSはどのようなユースケースに適していますか?
A: フラッシュTTSは、アシスタント会話やインタラクティブアプリケーションなど、低遅延のインタラクションシナリオを対象としています。 Pro TTSは、オーディオブック、プロットナレーション、マーケティング動画など、高品質で強い表現力を追求するコンテンツ制作により適しています。
Q: 現在、Gemini 2.5 TTSでサポートされている言語や地域は何ですか?
A: Gemini 2.5 FlashおよびPro TTSは、Gemini API上でプレビューモデルとして開発者に提供されており、24の対応言語をカバーしています。特定の言語や地域については、関連ドキュメントで確認できます。
Q: 開発者はどのようにしてこのアップデートのTTS機能に製品でアクセスできますか?
A: 開発者はGemini APIを通じてGoogle AI StudioでTTS機能付きの2.5 Flashまたは2.5 Proモデルを選択し、プレイグラウンドやサンプルコードでボイススタイル、テンポ、マルチスピーカーのパラメータを設定し、自分のアプリケーションに統合できます。
Q: 以前のGemini TTSモデルは引き続き使用できますか?
A: Googleは、Gemini 2.5 FlashおよびPro TTSの新バージョンが今年5月に発売された旧TTSモデルに代わることを明確にしており、その後の機能の導入は新モデルを基にすることになります。開発者はできるだけ早く設定と呼び出しロジックを移行することを推奨しています。