Zhipu AI a lancé une nouvelle génération de produits de reconnaissance vocale GLM-ASR, et a simultanément lancé la méthode de bureau « Zhipu AI Input Method », qui intègre profondément la reconnaissance vocale avec les capacités de grands modèles, en se concentrant sur la méthode d’interaction homme-machine de « parler et donner des instructions ». La série GLM-ASR inclut le modèle côté cloud GLM-ASR-2512 et le modèle côté appareil GLM-ASR-Nano-2512, couvrant un large éventail d’environnements opérationnels, des serveurs aux ordinateurs portables et aux téléphones mobiles.
Selon les rapports, GLM-ASR-2512 est déployé dans le cloud, avec un taux d’erreur de caractères de 0,0717, prend en charge le chinois, l’anglais et certains dialectes, et est optimisé pour des environnements bruyants, adapté aux scénarios de service en ligne avec des exigences de précision élevées. GLM-ASR-Nano-2512 possède environ 1,5 milliard de paramètres et peut fonctionner localement sur des appareils du côté terminal tels que les ordinateurs portables et les téléphones mobiles, mettant l’accent sur une faible latence et une expérience interactive en temps réel, les poids des modèles et le code d’inférence sont open source, et la version cloud est fournie via des API.
La « méthode d’entrée IA Zhipu » est destinée aux utilisateurs de bureau, combinant GLM-ASR avec de grands modèles pour prendre en charge la saisie de texte, le contrôle d’applications et l’émission de commandes par voix. Le produit introduit un « mode chuchotement » qui reconnaît la parole même à faible volume ou la respiration, ce qui le rend facile à utiliser dans des environnements calmes. Rappel officiel : lorsqu’ils utilisent des fonctions d’entrée vocale et de surveillance continue, les utilisateurs doivent prêter attention aux permissions des microphones et à la portée de téléchargement des données, et les configurer en fonction de leurs propres exigences en matière de confidentialité et de sécurité.
FAQ
Q : Qu’est-ce que GLM-ASR ?
R : GLM-ASR est une série de modèles de reconnaissance vocale lancée par Zhipu AI, adaptée aux scénarios de reconnaissance vocale et de contrôle vocal, y compris les versions cloud et côté appareil.
Q : Quelle est la différence entre le GLM-ASR-2512 et le GLM-ASR-Nano-2512 ?
R : Le premier est déployé dans le cloud, avec une précision plus élevée, et est appelé via API ; Ce dernier a des paramètres plus petits et peut tourner localement sur ordinateurs portables, téléphones portables, etc., en se concentrant sur une faible latence et une disponibilité hors ligne.
Q : Le GLM-ASR-Nano est-il open source ?
R : GLM-ASR-NANO-2512 fournit du code open source de pondération et d’inférence, ce qui facilite l’intégration et le développement dans leur propre environnement, localement ou dans leur propre environnement.
Q : Que peut faire la « méthode d’entrée IA Zhipu » ?
R : Cette méthode d’entrée combine la reconnaissance vocale avec de grands modèles, prend en charge le texte vocal, l’émission vocale des instructions système, et offre un mode chuchotement pour s’adapter à des situations de faible volume et de confidentialité.
Q : Quels sont les risques à surveiller lors de l’utilisation de ces produits vocaux ?
R : La reconnaissance vocale implique la collecte de microphones et le téléversement possible de données, et les utilisateurs doivent vérifier les permissions des applications, comprendre les règles d’utilisation des données et choisir soigneusement s’ils activent les services cloud ou écoutent longtemps lorsque des informations sensibles sont impliquées.