AI ボイスエージェント
遅延が百ミリ秒台まで落ちて、音声は初めて会話らしくなります。ASR から TTS までの工程を、音声から音声への一貫処理がどこで省くのか、順番管理とツール呼び出しがどう「話す」から「済ませる」へ進めるのかを説明します。
遅延が百ミリ秒台まで落ちて、音声は初めて会話らしくなります。ASR から TTS までの工程を、音声から音声への一貫処理がどこで省くのか、順番管理とツール呼び出しがどう「話す」から「済ませる」へ進めるのかを説明します。
ボイスエージェントは「声をメインエントランスとするエージェント」と理解できます。 単に言葉をテキストに変換してモデルの返答を読み上げるだけでなく、聞くこと、理解すること、遮ること、質問すること、ツールを呼び出すこと、タスクを実行する能力をリアルタイムで同じインタラクティブなクローズドループにまとめま...
音声から音声への変換は、まず音声をテキストに変換し、その後言語モデルに渡し、最後に音声に変換するのではなく、音声入力から音声出力までモデルを直接理解し生成するモデルを指します。 この方法は実際の人間会話に近く、トーンや間、感情、話し方を保持しやすいため、ますます熱くなっています。 従来の音声リンクと...
- 要旨 Chroma 1.0は、FlashLabsによって訓練され、完全にオープンソース化されたエンドツーエンドのリアルタイム音声間モデルで、パーソナライズされた音声クローン作成を可能にします。 このモデルは従来のASR→LLM→TTSパイプラインを不要にし、エンドツーエンドの応答を約150msで...
Step-Audio-R1.1が発表され、Artificial Analysisの音声推論リストで1位にランクされました。 BigBench Audioテストでは約96.4%の精度を達成し、リアルタイムの会話シーンでは約1.51秒の初フレーム音声出力を達成しました。 プロジェクトチームは、このモデル...
1. 要旨 Fun-Audio-Chat-8Bは、FunAudioLLMチームによるオープンソースの「大規模音声言語モデル」で、より自然で低遅延の音声交流を目指しています。 「デュアル解像度音声表現」(5Hzの共有バックボーン+25Hzの精錬ヘッド)を用いて計算負荷を削減しつつ、Core-Cockt...
最近、複数のユーザーがソーシャルメディアで、OpenAIがiOSアプリの音声モードで新しいインターフェースをテストしているとシェアしました。このインターフェースには初めて「プロンプトサジェスト」機能が搭載され、ユーザーは会話を始める前に素早く質問を選択したり、質問したりすることができます。既存のフィ...
FlowithはiOS 2.0を発表しました。これは、アクションを実行する前にコンテキストをリッスンするインタラクションパスを重視した「プロアクティブ音声エージェント」を搭載し、ユーザーのクリックや切り替えコストの削減を目指しています。公式資料によると、iOS 26のLiquid Glassビジュア...