1. 초록
MOSS-TTS-Nano는 OpenMOSS와 MOSI의 비교 버전입니다. AI가 공개한 오픈소스 다국어 음성 생성 모델은 "소형 크기, 저지연, 배포 가능"으로 포지셔닝되어 있습니다. 약 0.1B 파라미터를 갖추고 있으며, 실시간 음성 생성과 음성 복제를 지원하고, CPU 친화적성과 로컬 통합을 강조하며, 경량 데모, 브라우저 서비스, 임베디드 제품 프로토타이핑에 적합합니다.
2. 핵심 특징
- 다국어 지원: 공개 정보에 따르면 현재 중국어, 영어, 일본어, 한국어, 프랑스어, 독일어, 아랍어 등 20개 언어를 포함하고 있습니다.
- 경량 배포: 주요 기능은 GPU 없이도 실행할 수 있으며, 스트리밍 생성은 4코어 CPU에서 수행할 수 있습니다.
- 음성 생성 기능: 참조 오디오를 기반으로 한 텍스트 음성 변환 및 음성 복제 지원.
4. 간단한 추론 링크: infer.py, app.py, CLI를 제공하여 현지 테스트 및 포장 서비스에 적합합니다.
- 오디오 측 설계: Audio Tokenizer + LLM을 기반으로 한 순수 자기회귀 파이프라인으로, 출력 사양은 48kHz 바이노럴입니다.
3. 설치
- Python 3.12 환경을 만들고 저장소를 복제합니다.
2. pip install -r requirements.txt 및 pip install -e . 구현.
3. WeTextProcessing 설치가 실패할 경우, 공식 지침에 따라 pynini와 해당 의존성을 설치해야 합니다.
4. python infer.py를 사용해 로컬에서 생성하거나, python app.py나 moss-tts-nano serve를 사용해 웹 프레젠테이션을 시작할 수 있습니다.
4. 일반적인 사용 사례
- 로컬 음성 비서 또는 에이전트의 음성 출력.
- 소형 음성 복제 데모와 개인 맞춤형 방송.
- 저렴한 다국어 콘텐츠 독서.
- HTTP 서비스의 음성 생성 기능에 빠르게 접근해야 합니다.
5. 생태와 경쟁 제품
- 생태학적으로 MOSS-TTS-Nano는 MOSS-TTS 계열에 속하며 MOSS-Audio-Tokenizer에 의존합니다.
- 대형 매개변수 TTS와 비교할 때, 배포 임계값과 극단적인 표현력보다는 실시간 표현력을 강조합니다.
- GPT-SoVITS, CosyVoice, Bark와 같은 솔루션과 비교할 때, 차이점은 더 작은 매개변수, CPU 친화성, 그리고 통합된 가족 경로입니다. 하지만 구체적인 효과는 여전히 언어, 음색, 지연 요구사항에 따라 달라져야 합니다.
6. 제한 및 주의사항
- 경량 모델은 보통 상한선이 제한적이며, 복잡한 감정, 강한 표현력, 극도로 높은 충실도가 지배적이지 않을 수 있습니다.
- 다국어 이용 가능성이 모든 언어가 똑같이 성숙하다는 뜻은 아니며, 긴 텍스트와 작은 언어를 먼저 검증하는 것이 권장됩니다.
- 음성 복제는 초상화 및 음성 권리를 포함하며, 상업적 사용 전에 승인 및 준수를 반드시 확인해야 합니다.
- 저장소는 비교적 새롭게 만들어졌으며, 인터페이스, 의존성 및 라이선스 세부 사항이 계속 개선될 수 있습니다.
7. 프로젝트 주소
https://modelscope.cn/models/openmoss/MOSS-TTS-Nano
8. 자주 묻는 질문
Q: MOSS-TTS-Nano가 중국어 음성 복제를 지원하나요?
A: 네, 공식 예시에서는 참조 오디오를 기반으로 한 음성 복제 과정을 보여줍니다.
Q: MOSS-TTS-Nano는 GPU를 사용해야 하나요?
A: 아니요. 핵심 판매 포인트 중 하나는 CPU에서 실행할 수 있어 경량 배포에 적합하다는 점입니다.
Q: MOSS-TTS-Nano는 생산 환경에 적합한가요?
A: 프로토타입, 내부 테스트, 경량 서비스 시나리오에 적합하며; 정식 제작에서는 안정성, 지연, 음질을 평가하는 것이 여전히 권장됩니다.
Q: MOSS-TTS-NAO는 몇 개의 언어를 지원하나요?
답변: 공개 정보에 따르면 현재 20개 언어가 지원되고 있으나, 각 언어의 실제 효과는 별도로 테스트해야 합니다.