Zhipu AIは新世代の音声認識製品シリーズであるGLM-ASRをリリースし、同時にデスクトップ版の「Zhipu AI Input Method」を発表しました。これは音声認識と大規模モデル機能を深く統合し、「話しかけて指示を出す」という人間とコンピュータの相互作用手法に焦点を当てています。 GLM-ASRシリーズにはGLM-ASR-2512クラウドサイドモデルとGLM-ASR-Nano-2512デバイスサイドモデルが含まれ、サーバーからノートパソコン、携帯電話まで幅広い運用環境に対応しています。
報告によると、GLM-ASR-2512はクラウド上で展開されており、文字誤差率は0.0717、中国語、英語、いくつかの方言に対応し、ノイズの多い環境に最適化されており、高精度が求められるオンラインサービスシナリオに適しています。 GLM-ASR-Nano-2512は約15億のパラメータを持ち、ノートパソコンや携帯電話などのエンドサイドデバイス上でローカルで動作可能で、低遅延とリアルタイムのインタラクティブ体験を強調しています。モデルの重み付けと推論コードはオープンソースで、クラウド版はAPIを通じて提供されています。
「Zhipu AI Input Method」はデスクトップユーザーを対象としており、GLM-ASRと大規模モデルを組み合わせてテキスト入力、アプリケーション制御、音声によるコマンド発行をサポートします。 この製品は「ウィスパーモード」を導入し、音量や呼吸が低い場合でも音声を認識し、静かな環境でも使いやすいです。 音声入力や継続監視機能を使用する際は、マイクの権限やデータアップロード範囲に注意を払い、自身のプライバシーやセキュリティ要件と組み合わせて設定することを公式にお知らせします。
よくある質問
Q: GLM-ASRとは何ですか?
A: GLM-ASRはZhipu AIが発売した音声認識モデルシリーズで、クラウドやデバイス側バージョンを含む音声入力や音声制御のシナリオに適しています。
Q: GLM-ASR-2512とGLM-ASR-Nano-2512の違いは何ですか?
A: 前者はクラウド上でより高精度に展開され、API経由で呼び出されます。 後者はパラメータが小さく、ノートパソコンや携帯電話などでローカルで動作可能で、低遅延とオフラインでの利用可能性に重点を置いています。
Q: GLM-ASR-Nanoはオープンソースですか?
A: GLM-ASR-NANO-2512はオープンソースの重み付けと推論コードを提供しており、開発者がローカルまたは自社環境で統合・開発を便利にしています。
Q: 「Zhipu AI Input Method」は何ができるのでしょうか?
A: この入力方式は音声認識と大型モデルを組み合わせ、音声入力テキスト、システム命令の音声発行をサポートし、低音量やプライバシー環境に適応するためのささやきモードを提供します。
Q: これらの音声製品を使用する際に注意すべきリスクは何ですか?
A: 音声認識はマイクの収集やデータアップロードを含み、ユーザーはアプリの許可を確認し、データ使用ルールを理解し、機密情報が関わる場合はクラウドサービスを有効にするか長時間聞くか慎重に選ぶべきです。