2026년 9월 23일, Google DeepMind는 공식 블로그에서 Gemini 3.8 Flash TTS와 Flash-Lite TTS를 발표했다. 지금까지 가장 표현력이 뛰어난 오디오 생성 모델이라는 설명이다. 새 모델은 자연어 프롬프트로 목소리를 처음부터 디자인하거나, 30초 샘플로 목소리를 복제할 수 있고, 행별 연기 디렉션, 장시간 오디오 생성, 2인 대화 연출까지 지원하며 100개가 넘는 언어를 커버한다.
먼저 이전 세대 음성 모델과의 차이를 짚어보자. 기존 TTS는 '목소리 고르기'였다. 프리셋 음색 라이브러리에서 하나를 고르고 속도와 억양을 조절하는 방식이다. 새 모델은 '목소리 만들기'에 '연기 디렉션'까지 더한 것이다. "따뜻하고 살짝 쉰 심야 라디오 목소리"라고 쓰면 그대로 생성된다. 30초 녹음을 주면 누군가의 목소리를 복제할 수 있다. 긴 글 읽기에서는 행마다 감정을 지정할 수 있고, 2인 대화 장면에서는 화자 전환도 모델이 연출한다. Flash-Lite는 더 가벼운 버전으로 저지연·저비용이 강점이며 실시간성이 중요한 장면에 맞는다.
어디에 적용되고, 누가 먼저 혜택을 보는가
두 모델은 Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, Google Vids에서 동시에 이용할 수 있다. 가장 먼저 혜택을 볼 세 부류는 이렇다. 팟캐스트와 오디오북 제작자——장시간 생성과 행별 연기 디렉션은 이들의 제작 흐름에 바로 맞닿아 있다. 영상 크리에이터——Google Vids 안의 내레이션을 커스텀 목소리로 교체할 수 있다. 기업 교육과 고객지원 부서——2인 화자 연출은 대화형 교육 콘텐츠에 어울린다. 흥미롭게도 같은 날 알리바바 Qwen도 음성 모델 패밀리 Qwen-Audio-3.1을 발표했고(관련 기사 (/article/2056-a-li-qwen-fa-bu-qwen-audio-3-1-yi-kou-qi-wu-kuan-yu-yin-mo-xing-asr-jiang-jia-9)), 음성 분야 경쟁은 이번 주 들어 확연히 가속하고 있다.
능력이 강할수록 경계는 먼저 분명히
30초 만에 목소리를 복제하는 능력을 앞두고 가장 먼저 떠올려야 할 것은 리스크다. 본인 동의 없이 목소리를 복제하는 것은 다수 관할권에서 목소리·초상 관련 권리에 닿는다. 상용 전에는 권리 처리 체인을 반드시 확인해야 한다. 또한 '역대 최고 표현력'은 공식 주장일 뿐, 실제 품질은 다언어 검증이 필요하다. 특히 중국어 장문에서 리듬과 쉼이 자연스럽게 들리는지——이런 디테일은 개발자가 직접 써봐야 비로소 드러나는 경우가 많다.