Zhipu AI는 신세대 음성 인식 제품군인 GLM-ASR을 출시했으며, 동시에 음성 인식과 대형 모델 기능을 깊이 통합하여 "말하고 지시하는 방식"에 중점을 둔 데스크톱 "Zhipu AI 입력법"을 출시했습니다. GLM-ASR 시리즈는 GLM-ASR-2512 클라우드 사이드 모델과 GLM-ASR-Nano-2512 디바이스 사이드 모델을 포함하며, 서버부터 노트북, 휴대폰에 이르기까지 다양한 운영 환경을 포괄합니다.
보도에 따르면 GLM-ASR-2512는 클라우드에 배포되어 있으며, 문자 오류율은 0.0717이고, 중국어, 영어 및 일부 방언을 지원하며, 소음이 많은 환경에 최적화되어 있어 높은 정확도가 요구되는 온라인 서비스 시나리오에 적합합니다. GLM-ASR-Nano-2512는 약 15억 개의 매개변수를 갖추고 있으며, 노트북이나 휴대폰과 같은 최종 기기에서 로컬에서 실행될 수 있어 낮은 지연 시간과 실시간 상호작용 경험을 강조합니다. 모델 가중치와 추론 코드는 오픈소스이며, 클라우드 버전은 API를 통해 제공됩니다.
"Zhipu AI 입력법"은 데스크톱 사용자를 대상으로 하며, GLM-ASR과 대형 모델을 결합하여 음성 입력, 애플리케이션 제어, 명령 발급을 지원합니다. 이 제품은 낮은 음량이나 호흡에서도 음성 인식을 제공하는 '속삭임 모드'를 도입해 조용한 환경에서도 쉽게 사용할 수 있게 합니다. 음성 입력 및 연속 모니터링 기능을 사용할 때는 마이크 권한과 데이터 업로드 범위를 주의 깊게 고려하고, 자신의 개인정보 보호 및 보안 요구사항과 함께 설정해야 한다는 공식 안내입니다.
FAQ
Q: GLM-ASR이란 무엇인가요?
답변: GLM-ASR은 Zhipu AI가 출시한 음성 인식 모델 시리즈로, 클라우드 및 기기 측 버전을 포함한 음성 인식 및 음성 제어 시나리오에 적합합니다.
Q: GLM-ASR-2512와 GLM-ASR-Nano-2512의 차이점은 무엇인가요?
A: 전자는 클라우드에 더 높은 정확도로 배포되며 API를 통해 호출됩니다; 후자는 파라미터가 작고 노트북, 휴대폰 등에서 로컬에서 실행할 수 있으며, 낮은 지연 시간과 오프라인 가용성에 중점을 둡니다.
Q: GLM-ASR-Nano는 오픈 소스인가요?
A: GLM-ASR-NANO-2512는 오픈 소스 가중치와 추론 코드를 제공하여 개발자들이 로컬 또는 자체 환경에서 통합하고 개발할 수 있도록 편리하게 합니다.
Q: "Zhipu AI 입력법"은 무엇을 할 수 있나요?
답변: 이 입력 방식은 음성 인식과 대형 모델을 결합하고, 음성 입력 텍스트, 음성 시스템 명령 발령을 지원하며, 낮은 볼륨과 프라이버시 상황에 적응할 수 있는 속삭임 모드를 제공합니다.
Q: 이러한 음성 제품을 사용할 때 주의해야 할 위험은 무엇인가요?
A: 음성 인식은 마이크 수집과 데이터 업로드를 포함하며, 사용자는 앱 권한을 확인하고, 데이터 사용 규칙을 이해하며, 민감한 정보가 관련될 경우 클라우드 서비스를 활성화할지 장시간 청취할지 신중히 선택해야 합니다.