ToolNavs 便利なAIツールを発見
ツール投稿 ログイン

AI ボイスエージェント

遅延が百ミリ秒台まで落ちて、音声は初めて会話らしくなります。ASR から TTS までの工程を、音声から音声への一貫処理がどこで省くのか、順番管理とツール呼び出しがどう「話す」から「済ませる」へ進めるのかを説明します。

従来は文字起こし、推論、読み上げの順で、遅く、遮られると崩れ、状態も続きません。音声から音声までを一貫で扱えば、Chroma 1.0 は 150 ミリ秒以内に応答し、Step-Audio-R1.1 は推論の深さを保ったまま初回音声を約 1.51 秒に縮めます。体験を決めるのは順番管理、つまり応答するか聞き続けるかの判断と、検索や予約へ進めるツール呼び出しです。評価軸は声の人らしさから、用が済んだかへ移ります。
ボイスエージェントとは何ですか? なぜAI音声アシスタントが「話す」から「行動」へと移行し始めているのか

ボイスエージェントとは何ですか? なぜAI音声アシスタントが「話す」から「行動」へと移行し始めているのか

ボイスエージェントは「声をメインエントランスとするエージェント」と理解できます。 単に言葉をテキストに変換してモデルの返答を読み上げるだけでなく、聞くこと、理解すること、遮ること、質問すること、ツールを呼び出すこと、タスクを実行する能力をリアルタイムで同じインタラクティブなクローズドループにまとめま...

Admin
110
スピーチ・トゥ・スピーチとは何ですか? なぜ「音声再放送」よりも自然な会話に近いと考えられるのか

スピーチ・トゥ・スピーチとは何ですか? なぜ「音声再放送」よりも自然な会話に近いと考えられるのか

音声から音声への変換は、まず音声をテキストに変換し、その後言語モデルに渡し、最後に音声に変換するのではなく、音声入力から音声出力までモデルを直接理解し生成するモデルを指します。 この方法は実際の人間会話に近く、トーンや間、感情、話し方を保持しやすいため、ますます熱くなっています。 従来の音声リンクと...

Admin
126
Chroma 1.0 リリース:世界初のオープンソースのエンドツーエンドリアルタイム音声間モデル

Chroma 1.0 リリース:世界初のオープンソースのエンドツーエンドリアルタイム音声間モデル

- 要旨 Chroma 1.0は、FlashLabsによって訓練され、完全にオープンソース化されたエンドツーエンドのリアルタイム音声間モデルで、パーソナライズされた音声クローン作成を可能にします。 このモデルは従来のASR→LLM→TTSパイプラインを不要にし、エンドツーエンドの応答を約150msで...

Admin
149
Step-Audio-R1.1は、ディープ推論とリアルタイムの両方を考慮したスピーチ推論ランキングで優勝しています

Step-Audio-R1.1は、ディープ推論とリアルタイムの両方を考慮したスピーチ推論ランキングで優勝しています

Step-Audio-R1.1が発表され、Artificial Analysisの音声推論リストで1位にランクされました。 BigBench Audioテストでは約96.4%の精度を達成し、リアルタイムの会話シーンでは約1.51秒の初フレーム音声出力を達成しました。 プロジェクトチームは、このモデル...

Admin
122
OpenAIがiOSで新しい音声モードインターフェースをテスト、プロンプトを追加

OpenAIがiOSで新しい音声モードインターフェースをテスト、プロンプトを追加

最近、複数のユーザーがソーシャルメディアで、OpenAIがiOSアプリの音声モードで新しいインターフェースをテストしているとシェアしました。このインターフェースには初めて「プロンプトサジェスト」機能が搭載され、ユーザーは会話を始める前に素早く質問を選択したり、質問したりすることができます。既存のフィ...

Admin
144
Flowith iOS 2.0 リリース: 最初に聞き、後で行動し、タップ操作を不要にする「初のプロアクティブ音声エージェント」と謳われている

Flowith iOS 2.0 リリース: 最初に聞き、後で行動し、タップ操作を不要にする「初のプロアクティブ音声エージェント」と謳われている

FlowithはiOS 2.0を発表しました。これは、アクションを実行する前にコンテキストをリッスンするインタラクションパスを重視した「プロアクティブ音声エージェント」を搭載し、ユーザーのクリックや切り替えコストの削減を目指しています。公式資料によると、iOS 26のLiquid Glassビジュア...

Admin
108