구글, 제미니 2.5 플래시 라이브 네이티브 오디오 미리보기 출시…음성 대화 더욱 자연스럽게
Google은 개발자 업데이트를 통해 Gemini 2.5 Flash 네이티브 오디오 Live 의 프리뷰를 공개했습니다. 이는 Gemini Live 모델의 최신 버전이며, 함수 호출 안정성과 자연스러운 대화 품질 향상에 중점을 두고 있습니다. 이 모델은 네이티브 오디오를...
Google은 개발자 업데이트를 통해 Gemini 2.5 Flash 네이티브 오디오 Live 의 프리뷰를 공개했습니다. 이는 Gemini Live 모델의 최신 버전이며, 함수 호출 안정성과 자연스러운 대화 품질 향상에 중점을 두고 있습니다. 이 모델은 네이티브 오디오를...
Qwen은 Qwen Chat에 여행 플래너를 출시한다고 발표했습니다. Amap과 Fliggy의 검색 기능을 활용하여 이 앱은 호텔 및 교통편 추천, 명승지, 시간 계획을 포함한 일일 일정을 자동으로 생성합니다. 공식 사용자 데모에서는 관심사, 속도, 예산에 따른 적응성...
Microsoft는 곧 출시될 프록시 브라우징 기능에 대비하여 이미 발표된 Copilot 모드와 함께 Edge에서 Copilot의 "브라우저 동작" 기능을 테스트하고 있습니다. 테스트 인터페이스에는 Copilot의 개인 정보 설정에 있는 스위치가 표시되어 있으며, 이는...
Qwen 팀은 다중 이미지 편집과 단일 이미지 일관성에 중점을 둔 Qwen-Image-Edit의 월별 리디자인 버전인 Qwen-Image-Edit-2509를 출시했습니다. 다중 이미지 모드를 사용하면 "인물 + 제품" 또는 "인물 + 장면"과 같이 최대 1~3개의 참조...
알리바바 통이(Alibaba Tongyi) 팀은 차세대 텍스트 음성 변환 모델인 Qwen3-TTS ( Qwen3-TTS-Flash 버전 포함) 출시를 발표했습니다. 이 모델은 다중 음색, 다중 언어 및 다중 방언 합성 기능을 제공하여 더욱 자연스럽고 풍부한 음성 출력을...
OpenAI는 "Responses API를 구축한 이유"를 공개하며 설계 방향을 설명했습니다. Responses는 단일 턴 대화를 상태 기반 "이유-행동-피드백" 루프로 대체합니다. 이를 통해 모델은 여러 턴에 걸쳐 내부 추론 상태를 유지하고 여러 "항목"(메시지, 함...