ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
알리바바 Qwen, Qwen-Audio-3.1 출시: 음성 모델 5종 동시 공개, ASR 가격 95% 인하

알리바바 Qwen, Qwen-Audio-3.1 출시: 음성 모델 5종 동시 공개, ASR 가격 95% 인하

AI 정보 Admin 2 회 조회

2026년 9월 23일, 알리바바 Qwen 팀이 음성 대형 모델 시리즈 'Qwen-Audio-3.1'을 공식 출시했다. 자동 음성 인식(ASR), 음성 합성(TTS), 실시간 음성 상호작용(Realtime)을 아우르는 5개 신모델을 한 번에 내놓았고, 완전히 새로운 'Next' 시리즈 2종—Qwen-Audio-3.1-ASR-Next와 Qwen-Audio-3.1-TTS-Next도 추가됐다. 모델과 함께 발표된 것은 이례적인 대폭 가격 인하 소식이다. TTS 약 70%, Realtime 약 85%, ASR는 최대 95% 인하됐다. API는 Qwen AI 플랫폼에서 이미 이용 가능하며, ASR-Next는 추후 공개 예정이다.

다섯 모델이 각각 맡는 역할

  • Qwen-Audio-3.1-ASR: 음성 인식 기본 모델. 다국어·방언 인식, 문맥 이해, 전사 자동 다듬기를 강점으로 한다.
  • Qwen-Audio-3.1-TTS: 음성 합성 기본 모델. 텍스트를 자연스러운 음성으로 변환한다.
  • Qwen-Audio-3.1-Realtime: 실시간 음성 상호작용 모델. 음성 비서, 전화 고객 상담 등 저지연 대화 시나리오를 겨냥했다.
  • Qwen-Audio-3.1-ASR-Next: 오디오 이해 방향의 신모델. ASR을 넘어 '받아쓰기'가 아닌 '이해'를 목표로 한다.
  • Qwen-Audio-3.1-TTS-Next: 가장 주목할 만한 모델. 공식 포지셔닝은 '오디오 창작 모델'로, 텍스트 대본을 주면 대사와 환경음을 한 번에 합성해 영화급 완성도의 사운드스케이프를 만들어낸다. 오디오북, 영화 더빙, 팟캐스트, 게임 등 전문 창작 현장을 겨냥하고 있다.

인하 폭 계산해 보기

이번 인하는 상징적인 수준이 아니다. TTS가 약 70% 내려가면 1시간 분량 오디오북 녹음 비용은 3분의 1 이하로 떨어진다. Realtime이 약 85% 내려가면 토큰을 많이 쓰는 실시간 음성 대화도 부담 가능한 영역으로 들어온다. ASR가 95% 내려가면 음성 전사의 한계 비용은 사실상 바닥 수준이다. 회의록 작성, 통화 품질 검사, 대량의 음성 아카이브 같은 '물량으로 승부하는' 업무에서는 수지가 한결 맞게 됐다.

이번 인하가 중요한 이유

인하되는 것이 음성만이 아니기 때문이다. 9월 22일 OpenAI는 GPT-6 Sol과 Luna의 API 가격을 절반으로 낮췄고(OpenAI, 일상 업무용 GPT-6 Sol·Luna 출시: API 가격 절반으로 (/article/2042-openai-launches-gpt-6-sol-and-luna-api-prices-cut-in-half-for-everyday-work)), 같은 날 발표된 Anthropic의 Claude Opus 5.5도 전 세대보다 약 40% 저렴하게 구동된다. Qwen이 같은 전략을 음성으로 가져오면서, 모델 가격 전쟁이 텍스트 추론에서 음성 풀스택으로 번졌음을 선언한 셈이다. 비용을 먼저 낮춘 쪽이 음성 에이전트, 실시간 번역, AI 고객 상담 같은 영역의 입장권을 먼저 거머쥔다.

두 가지 유의점

첫째, TTS-Next의 '한 번에 완성된 음향 풍경 합성'은 단순한 음질 향상이 아니라 창작 도구의 형태 자체가 바뀌는 것이다. 오디오북, 숏드라마, 팟캐스트의 제작 공정을 단축시킨다. 대사 녹음, 환경음 선정, 믹싱을 따로 하던 일이 한 번의 생성으로 끝날 수 있다. 대신 프롬프트 요구 수준은 올라간다. '소리'를 어떻게 묘사할지 알아야 한다.

둘째, ASR-Next는 아직 공개되지 않았고, 인하 대상은 API 호출이지 오픈 웨이트가 아니다. 직접 배포해 추론을 돌리고 싶은 개발자는 이번에는 혜택을 못 받고 후속 릴리스를 기다려야 한다.

정리하면 Qwen-Audio-3.1 출시의 논리는 명확하다. '듣기·말하기·실시간 대화·창작' 네 고리를 한 번의 모델 투입으로 모두 장악하고, 가격 인하로 문턱을 무너뜨리는 것. 음성 API는 텍스트 API만큼 저렴한 인프라가 되어가고 있고, 음성 제품을 만드는 팀이라면 원가 계산을 다시 해볼 때다.

추천 도구

더보기