MAI-Transcribe-2-Streaming은 2026년 10월 1일 Microsoft AI가 공식 블로그를 통해 발표한 음성 모델로, 음성 합성 모델 MAI-Voice-2.1과 더 빠른 MAI-Voice-2.1-Flash도 함께 공개됐습니다. Microsoft는 세 모델을 음성 에이전트용 세트로 묶었습니다. 하나는 듣고, 하나는 말하며, 중간 추론 모델에 남는 시간은 의도적으로 줄였습니다.
들으면서 받아쓰고, 문장이 끝나기 전에 움직인다
MAI-Transcribe-2-Streaming은 Microsoft의 첫 스트리밍 전사 모델입니다. 문장 전체를 기다리지 않고 연속 오디오에서 100밀리초 남짓 만에 첫 임시 전사 결과를 내놓고, 맥락이 쌓일수록 수정하다가 발화가 끝나면 최종 텍스트를 확정합니다. Microsoft 평가에서 실시간 받아쓰기와 자막 장면의 텍스트 표시 속도는 가장 가까운 경쟁 모델의 약 2배였고, Artificial Analysis에서는 최종 전사와 임시 전사 정확도 순위 모두 1위를 차지했습니다. 60개 언어를 지원하고 사용 언어를 자동으로 계속 감지하며, 가격은 2026년 말까지 오디오 시간당 0.54달러의 도입 요금입니다.
하나의 목소리로 23개 언어를 말한다
MAI-Voice-2.1은 Microsoft의 현행 최강 다국어 음성 합성 모델로 23개 언어와 26개 지역 변형을 지원하고 100만 자당 22달러입니다. 핵심은 언어를 바꿔도 목소리 정체성을 유지한다는 점으로, 영어, 중국어, 독일어를 말해도 같은 사람으로 들리고 각 언어의 자연스러운 억양이 붙습니다. Flash 버전은 같은 언어를 지원하고 45초 오디오를 약 150밀리초 지연으로 생성하며 추론 속도가 55% 빠르고 100만 자당 15달러입니다. 두 모델 모두 몇 초 분량의 참조 오디오로 목소리를 복제할 수 있고, 오용을 막는 동의 확인 장치를 내장했습니다.
왜 Microsoft는 귀와 입을 직접 만들었나
음성 에이전트는 듣고, 이해하고, 판단하고, 말하는 순환을 자연스러운 대화 리듬 안에서 마쳐야 합니다. 듣기와 말하기에서 각각 수백 밀리초를 줄이면 중간 추론과 도구 호출에 쓸 시간 예산이 늘어납니다. 고객 서비스 에이전트는 발신자가 말을 마치기 전에 요청을 파악하기 시작할 수 있고, 다국어 비서는 언어를 감지해 같은 목소리로 답할 수 있으며, 교육 제품은 언어마다 선생님을 바꿀 필요가 없어집니다. 다만 100밀리초 남짓이라는 수치는 모델이 임시 결과를 내놓는 시간일 뿐, 네트워크와 상위 앱까지 포함한 전체 음성 체인의 응답 속도는 아닙니다.