GoogleがGemini 2.5 Flash Liveネイティブオーディオプレビューをリリース、音声会話がより自然になる
Googleは開発者向けアップデートで、 Gemini 2.5 FlashネイティブオーディオLive のプレビューを公開しました。これはGemini Liveモデルの最新版であり、関数呼び出しの信頼性と会話の自然さの向上に重点を置いています。このモデルはネイティブオーディオを使用して入出力を処理す...
Googleは開発者向けアップデートで、 Gemini 2.5 FlashネイティブオーディオLive のプレビューを公開しました。これはGemini Liveモデルの最新版であり、関数呼び出しの信頼性と会話の自然さの向上に重点を置いています。このモデルはネイティブオーディオを使用して入出力を処理す...
Qwenは、Qwen Chat内にトラベルプランナーをリリースすることを発表しました。AmapとFliggyの検索機能を活用し、ホテルや交通機関のおすすめ、観光スポット、時間計画などを含む毎日の旅程を自動生成します。公式ユーザーデモでは、興味、ペース、予算に基づいた柔軟な対応力を強調し、都市のアイデ...
Microsoftは、近々導入されるプロキシブラウジング機能の準備として、既に発表されているCopilotモードに加え、EdgeでCopilotの「ブラウザアクション」機能をテストしています。テストインターフェースには、Copilotのプライバシー設定にあるスイッチが表示されており、Copilotが...
Qwenチームは、Qwen-Image-Editの月例リデザインであるQwen-Image-Edit-2509をリリースしました。これは、複数画像編集と単一画像における一貫性に重点を置いたものです。複数画像モードでは、「人物 + 製品」や「人物 + 風景」など、最大1~3枚の参照画像をドラッグしてモ...
Alibaba Tongyiチームは、次世代の音声合成モデルである Qwen3-TTS ( Qwen3-TTS-Flash 版を含む)のリリースを発表しました。このモデルは、マルチ音色、マルチ言語、マルチ方言合成を特徴とし、より自然で表現力豊かな音声出力を実現します。公式デモとブログ記事では、英語と...
OpenAIは「Responses APIを構築した理由」を公開し、その設計方針を説明しています。Responsesは、単一ターンの対話をステートフルな「推論-行動-フィードバック」ループに置き換えます。これにより、モデルは複数ターンにわたって内部推論状態を保持し、複数の「アイテム」(メッセージ、関...