Z.ai マルチモーダルOCRモデルGLM-OCRをリリースし、Hugging Faceの重みを開放し、オンライン体験とAPIコール方式を提供します。 公式には約9億パラメータしか含まれていませんが、式認識、テーブル認識、キー情報抽出などのシナリオをカバーする複雑な文書理解タスクでリード的な性能を達成しています。
APIの使用面では、GLM-OCRはPDFと画像(JPG/PNG)の入力をサポートしており、1枚の画像は最大10MB、PDFは最大50MB、最大100ページです。 出力には、ドキュメント解析、データ入力、RAG文書前処理のためのMarkdown結果やレイアウト詳細を含めることができます。 実際の効果はスキャン品質、フォントの混合、シールの遮蔽、レイアウトの複雑さに影響されるため、生産環境でサンプリング評価とプライバシー遵守チェックを行うことが推奨されます。
よくある質問
Q: GLM-OCRは主にどのような問題を解決しますか?
A: GLM-OCRはOCRや複雑な文書の理解に適しており、テキスト、表、数式、情報抽出をカバーします。
Q: GLM-OCRはどのような入力とサイズ制限をサポートしていますか?
A: GLM-OCRはPDFおよびJPG/PNGに対応しており、画像≤10MB、PDF≤50MB、最大100ページまで対応しています。
Q: GLM-OCRの出力結果にはどのような形がありますか?
A: GLM-OCRはMarkdownテキストの結果を出力でき、レイアウトに関連する構造化情報を返すことができます。
Q: GLM-OCRはオンライン体験とAPIを提供していますか?
A: Z.ai オンライン体験ページでAPIインターフェースの説明や開発者ドキュメントを提供しています。