Zhipu AI brachte eine neue Generation der Spracherkennungsproduktreihe GLM-ASR heraus und brachte gleichzeitig die Desktop-"Zhipu AI Input Method" auf den Markt, die Spracherkennung tiefgreifend mit großen Modellfunktionen integriert und sich auf die Mensch-Computer-Interaktionsmethode des "Sprechens und Geben von Anweisungen" konzentriert. Die GLM-ASR-Serie umfasst das Cloud-Side-Modell GLM-ASR-2512 und das GLM-ASR-Nano-2512-Gerät und deckt eine breite Palette von Betriebsumgebungen ab, von Servern über Notebooks bis hin zu Mobiltelefonen.
Berichten zufolge wird GLM-ASR-2512 in der Cloud bereitgestellt, mit einer Zeichenfehlerrate von 0,0717, unterstützt Chinesisch, Englisch und einige Dialekte und ist für verrauschte Umgebungen optimiert, geeignet für Online-Service-Szenarien mit hohen Genauigkeitsanforderungen. GLM-ASR-Nano-2512 verfügt über etwa 1,5 Milliarden Parameter und kann lokal auf Endgeräten wie Laptops und Mobiltelefonen ausgeführt werden, wobei niedrige Latenz und Echtzeit-Interaktivität betont werden, Modellgewichte und Inferenzcode sind Open Source, und die Cloud-Version wird über APIs bereitgestellt.
Die "Zhipu AI Input Method" richtet sich an Desktop-Nutzer und kombiniert GLM-ASR mit großen Modellen, um Texteingabe, Anwendungssteuerung und Befehlsausgabe per Sprache zu unterstützen. Das Produkt führt einen "Whisper Mode" ein, der Sprache auch bei leiserer Lautstärke oder Atem erkennt, was die Nutzung in ruhigen Umgebungen erleichtert. Offizielle Erinnerung, dass Nutzer bei der Nutzung von Spracheingabe- und kontinuierlichen Überwachungsfunktionen auf Mikrofonberechtigungen und Datenreichweite achten und diese in Kombination mit ihren eigenen Datenschutz- und Sicherheitsanforderungen konfigurieren sollten.
FAQs
F: Was ist GLM-ASR?
A: GLM-ASR ist eine Spracherkennungsmodellserie, die von Zhipu AI eingeführt wurde und sich für Sprach-zu-Text- und Sprachsteuerungsszenarien eignet, einschließlich Cloud- und geräteseitiger Versionen.
F: Was ist der Unterschied zwischen der GLM-ASR-2512 und der GLM-ASR-Nano-2512?
A: Ersteres wird in der Cloud bereitgestellt, mit höherer Genauigkeit, und wird über die API aufgerufen; Letzteres hat kleinere Parameter und kann lokal auf Laptops, Mobiltelefonen usw. laufen, wobei er sich auf niedrige Latenz und Offline-Verfügbarkeit konzentriert.
F: Ist das GLM-ASR-Nano Open Source?
A: GLM-ASR-NANO-2512 bietet Open-Source-Gewichtungs- und Inferenzcode, was es Entwicklern bequem macht, lokal oder in ihrer eigenen Umgebung zu integrieren und zu entwickeln.
F: Was kann die "Zhipu AI Input Method" tun?
A: Diese Eingabemethode kombiniert Spracherkennung mit großen Modellen, unterstützt Spracheingabetext, Sprachausgabe von Systembefehlen und bietet einen Flüstermodus, um sich an niedrige Lautstärke und Datenschutzszenarien anzupassen.
F: Welche Risiken sollte man bei der Nutzung dieser Sprachprodukte beachten?
A: Spracherkennung beinhaltet das Sammeln von Mikrofonen und möglichen Datenhochladen, und Nutzer sollten App-Berechtigungen prüfen, die Datennutzungsregeln verstehen und sorgfältig entscheiden, ob sie Cloud-Dienste aktivieren oder lange zuhören, wenn sensible Informationen betroffen sind.