ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
SunoがSpeechベータを公開:朗読音声とオリジナルBGMを1テイクで一体化生成

SunoがSpeechベータを公開:朗読音声とオリジナルBGMを1テイクで一体化生成

AI情報 • Admin • • 5 回閲覧

2026年10月1日、AI音楽企業のSunoの最高製品責任者ジャック・ブロディは公式ブログで、新しい音声オーディオモデル「Speech(ベータ)」が1か月間の小規模テストを終え、全ユーザーに開放されたと発表した。Sunoはこれを「音声と音楽を一つのまとまったトラックとして共に生成する初のオーディオモデル」(the first audio model that generates voice and music together as one cohesive track)と呼んでいる。

ワンテイクで:音声とBGMはもう二段階ではない

Speechの使い方はシンプルだ。Sunoにテキストを入力する——アイデアでも、詩でも、すでに書き上げた文章でもよい——そして希望する声と音楽スタイルを説明すると、モデルが朗読音声にオリジナルのBGMをつけて、一つの統一されたオーディオトラックとして出力する。

これまで「BGM付きの朗読」を作るには通常三つの手順が必要だった。まず音声合成でナレーションの素音を作り、次に合うBGMを探し、最後にミックスして位置を合わせる。Speechはこの三つを一度の生成に圧縮する。声と音楽は生成の最初から一緒に育つため、理論上はつなぎがより自然になり、ライセンス音楽探しやミックス調整の手間も省ける。

「歌う」から「話す」へ:Sunoはもう一枚のキャンバスを広げている

Speechを理解するには、今年のSunoの製品ロードマップの中に置いてみるといい。同社はAI音楽生成から出発し、今年3月にはv5.5モデルとともに音声クローン機能「Voices」を投入した。Speechはその領域を「歌う」から「話す」へ広げるものだ。ブロディはブログで、音楽は依然としてSunoの中核だが、会社の視野は人間の表現の他の形へ広がっていると書き、Speechをコミュニティの創作のための「もう一枚のキャンバス」(another canvas)と呼んだ。

公式の例はとても身近だ。友人のSMSを「過剰に作り込んだ劇的な朗読」に仕立てる、普通のボイスメモに「不必要に壮大なBGM」をつける、といった遊び心のある使い方から、瞑想ガイド、詩の朗読、激励メッセージ、子ども向けの寝かしつけストーリーといった実用的な用途まで。Sunoはこうした需要を「クリエイティブ・エンターテインメント」(creative entertainment)と総称し、それが次世代のコンシューマーテクノロジーを定義すると考えている。

誰が最初に使い始めるか

最初に恩恵を受けるのはおそらく二つの層だ。一つはポッドキャストや音声コンテンツの制作者で、これまでオープニングや転換、エンディングのナレーションとBGMを別々に用意していたものが、一つのモデルで一度に作れるようになる。もう一つはショート動画やSNSのクリエイターで、「劇的な朗読」のようなネタ系コンテンツは拡散のために生まれたようなものだ。もちろん前提は生成品質の安定で——Suno自身もブログで予防線を張っている。

公式発表が触れなかった三つのこと

公式ブログが触れなかったことが三つある。第一に価格とプランだ。本文はSpeechがどのプランで使えるのか、無料ユーザーがどれだけ使えるのかを説明していない。第二にプラットフォームで、ウェブ版とモバイル版の利用差異にも触れていない。第三に、音声モデルにとって最も重要な点として、音声の利用許諾とコンテンツ審査ポリシーについて何も書かれていない。生成される声がどこから来るのか、誰の声を真似できるのか、どんな利用制限があるのかは一切触れられておらず、あるのは「イギリス英語のアクセントが時々オーストラリアに行って戻ってくる」というベータ版の免責ジョークだけだ。

これらの空白が問題を意味するとは限らない。ベータ段階で機能を先行させ、ポリシーは後から整えるのはよくある進め方だ。ただ、Speechを本番コンテンツに使おうと考えている制作者にとっては、いきなり使い始めるより、最新のリリースノートとコミュニティガイドラインに目を通してからの方が堅実だ。

おすすめツール

もっと見る