구글은 공식 블로그를 통해 Gemini 2.5 플래시와 Gemini 2.5 Pro 텍스트-음성(TTS) 미리보기 모델에 중요한 업그레이드를 했다고 발표했습니다. 이번 업데이트는 감정과 톤의 다양성 향상, 스타일 지침 준수, 다중 캐릭터 대화 시나리오의 일관성을 높이는 데 중점을 두어 개발자가 합성 음성의 스타일과 청취 느낌을 더 세밀하게 제어할 수 있도록 하는 것을 목표로 합니다.
리듬 제어 측면에서, 새 버전은 텍스트 내용에 따라 문맥 인식 음성 속도를 조절할 수 있는데, 복잡한 내용을 설명할 때 자동으로 속도를 늦추고, 긴장되거나 에너지가 많은 단락에서는 속도를 높이며, 명확한 리듬과 일시정지 명령을 더 잘 실행하는 것이 있습니다. 다중 화자 기능도 강화되어 팟캐스트, 가상 인터뷰, 내레이션 등 다양한 상황에서 다양한 캐릭터의 톤, 톤, 분위기를 유지하고, 모델이 이미 지원하는 24개 언어 전반에 걸쳐 일관된 성능을 유지합니다.
현재 Gemini 2.5 Flash TTS(저지연 강조)와 2.5 Pro TTS(음질과 표현력 강조)는 Google AI Studio의 Gemini API를 통해 개발자들에게 개방되어 있으며, 올해 5월에 출시된 이전 TTS 버전을 대체합니다. 업계는 이 매우 제어가 쉬운 TTS 기술이 오디오북, 온라인 교육, 현지화 마케팅, 크리에이터 콘텐츠 제작을 더욱 자동화할 것으로 기대하지만, 동시에 저작권 준수와 음성 합성 남용 방지에 대한 요구도 더 높아집니다.
FAQ
Q: 이번에는 Gemini 2.5 Flash와 Pro TTS에서 주로 어떤 기능들이 업데이트되었나요?
A: 이번 업데이트는 감정과 톤의 다양성, 맥락 인식 속도와 리듬 제어, 다중 화자 및 다중 캐릭터 대화 시 음성 일관성과 안정성 향상에 중점을 둡니다.
Q: Gemini 2.5 Flash TTS와 2.5 Pro TTS는 어떤 용도에 적합한가요?
A: 플래시 TTS는 어시스턴트 대화나 인터랙티브 애플리케이션 등 저지연 상호작용 시나리오를 목표로 합니다; Pro TTS는 오디오북, 줄거리 내레이션, 마케팅 영상과 같은 고품질 음질과 강한 표현력을 추구하는 콘텐츠 제작에 더 적합합니다.
Q: 현재 Gemini 2.5 TTS에서 지원되는 언어와 지역은 무엇인가요?
A: Gemini 2.5 플래시와 Pro TTS는 Gemini API에서 24개 지원 언어를 포괄하는 미리보기 모델로 개발자들에게 제공되며, 관련 문서에서 특정 언어와 지역을 확인할 수 있습니다.
Q: 개발자들은 이 업데이트의 TTS 기능을 어떻게 활용할 수 있나요?
A: 개발자는 Gemini API를 통해 Google AI Studio에서 TTS 기능이 있는 2.5 Flash 또는 2.5 Pro 모델을 선택하고, 플레이그라운드나 샘플 코드에서 음성 스타일, 템포, 다중 스피커 파라미터를 설정하여 자신의 애플리케이션에 통합할 수 있습니다.
Q: 이전 Gemini TTS 모델을 여전히 사용할 수 있나요?
답변: 구글은 올해 5월에 출시된 기존 TTS 모델을 대체하는 Gemini 2.5 플래시 및 Pro TTS의 신버전이 될 것임을 분명히 밝혔으며, 이후 기능 개선은 신모델을 기반으로 할 것이므로, 개발자들이 가능한 한 빨리 설정 및 통화 로직을 이전할 것을 권장합니다.