2026년 10월 1일, AI 음악 기업 Suno의 최고제품책임자 잭 브로디는 공식 블로그를 통해 새로운 음성 오디오 모델 Speech(베타)가 한 달간의 소규모 테스트를 마치고 모든 사용자에게 개방됐다고 발표했다. Suno는 이를 "음성과 음악을 하나의 응집된 트랙으로 함께 생성하는 최초의 오디오 모델"(the first audio model that generates voice and music together as one cohesive track)이라고 부른다.
한 번의 생성: 음성과 BGM은 더 이상 두 단계가 아니다
Speech의 사용법은 간단하다. Suno에 텍스트를 입력한다—아이디어도, 시도, 이미 써둔 어떤 글이든 된다—그리고 원하는 목소리와 음악 스타일을 설명하면, 모델이 낭독 음성에 오리지널 배경음악을 입혀 하나의 통일된 오디오 트랙으로 출력한다.
지금까지 'BGM이 깔린 낭독'을 만들려면 보통 세 단계가 필요했다. 먼저 음성 합성으로 드라이한 내레이션을 만들고, 어울리는 BGM을 찾은 뒤, 믹싱하고 타이밍을 맞추는 식이다. Speech는 이 세 단계를 한 번의 생성으로 압축한다. 음성과 음악이 생성의 처음부터 함께 자라나기 때문에 이론상 연결이 더 자연스러워지고, 라이선스 음악을 찾거나 믹싱을 조정하는 수고도 덜 수 있다.
'노래'에서 '말'로: Suno는 또 하나의 캔버스를 펼치고 있다
Speech를 이해하려면 올해 Suno의 제품 로드맵 안에 놓고 봐야 한다. 이 회사는 AI 음악 생성으로 출발해 올해 3월 v5.5 모델과 함께 음성 클로닝 기능 Voices를 내놨다. Speech는 그 영역을 '노래'에서 '말'로 확장하는 것이다. 브로디는 블로그에서 음악은 여전히 Suno의 핵심이지만 회사의 시야는 인간 표현의 다른 형태로 넓어지고 있다며, Speech를 커뮤니티 창작을 위한 '또 하나의 캔버스'(another canvas)라고 불렀다.
공식 예시는 무척 생활 밀착형이다. 친구의 문자 메시지를 '지나치게 공들인 극적인 낭독'으로 만들기, 평범한 음성 메모에 '불필요하게 장대한 BGM' 입히기 같은 장난기 어린 쓰임새부터, 명상 가이드, 시 낭독, 응원 메시지, 아이들을 위한 잠자리 이야기 같은 실용적인 용도까지. Suno는 이런 수요를 '크리에이티브 엔터테인먼트'(creative entertainment)로 묶어 부르며, 그것이 차세대 컨슈머 기술의 물결을 정의할 것이라고 본다.
누가 먼저 쓰게 될까
가장 먼저 혜택을 볼 층은 아마 두 부류다. 하나는 팟캐스트와 오디오 콘텐츠 크리에이터로, 지금까지 오프닝·전환·엔딩의 내레이션과 BGM을 따로 구해야 했던 것을 이제 하나의 모델에서 한 번에 만들 수 있다. 다른 하나는 숏폼과 소셜미디어 크리에이터로, '극적인 낭독' 같은 밈형 콘텐츠는 확산을 위해 태어난 것이나 다름없다. 물론 전제는 생성 품질의 안정—Suno 스스로도 블로그에 예방선을 쳐뒀다.
공식 발표가 다루지 않은 세 가지
공식 블로그가 다루지 않은 것이 세 가지 있다. 첫째, 가격과 요금제다. 본문은 Speech를 어떤 플랜에서 쓸 수 있는지, 무료 사용자가 얼마나 쓸 수 있는지 설명하지 않았다. 둘째, 플랫폼으로, 웹과 모바일의 사용 차이에 대해서도 언급이 없다. 셋째, 음성 모델에 가장 중요한 점으로서, 음성 이용 허가와 콘텐츠 심사 정책에 대해 아무것도 밝히지 않았다. 생성되는 목소리가 어디서 오는지, 누구의 목소리를 모방할 수 있는지, 어떤 이용 제한이 있는지는 전혀 언급되지 않았고, "영국식 억양이 가끔 호주에 갔다 돌아온다"는 베타 면책 농담만 있을 뿐이다.
이런 공백이 곧 문제를 의미하지는 않는다. 베타 단계에서 기능을 먼저 내놓고 정책은 나중에 채우는 것은 흔한 리듬이다. 다만 Speech를 실제 콘텐츠에 쓰려는 크리에이터라면, 바로 뛰어들기보다 최신 릴리스 노트와 커뮤니티 가이드라인을 먼저 확인하는 편이 안전하다.