ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
GLM-OCRオンライン体験 Z.ai 開始:PDFおよび画像レイアウト解析をサポート

GLM-OCRオンライン体験 Z.ai 開始:PDFおよび画像レイアウト解析をサポート

AI情報 Admin 444 回閲覧

Z.ai マルチモーダルOCRモデルGLM-OCRをリリースし、Hugging Faceの重みを開放し、オンライン体験とAPIコール方式を提供します。 公式には約9億パラメータしか含まれていませんが、式認識、テーブル認識、キー情報抽出などのシナリオをカバーする複雑な文書理解タスクでリード的な性能を達成しています。

APIの使用面では、GLM-OCRはPDFと画像(JPG/PNG)の入力をサポートしており、1枚の画像は最大10MB、PDFは最大50MB、最大100ページです。 出力には、ドキュメント解析、データ入力、RAG文書前処理のためのMarkdown結果やレイアウト詳細を含めることができます。 実際の効果はスキャン品質、フォントの混合、シールの遮蔽、レイアウトの複雑さに影響されるため、生産環境でサンプリング評価とプライバシー遵守チェックを行うことが推奨されます。

よくある質問

Q: GLM-OCRは主にどのような問題を解決しますか?

A: GLM-OCRはOCRや複雑な文書の理解に適しており、テキスト、表、数式、情報抽出をカバーします。

Q: GLM-OCRはどのような入力とサイズ制限をサポートしていますか?

A: GLM-OCRはPDFおよびJPG/PNGに対応しており、画像≤10MB、PDF≤50MB、最大100ページまで対応しています。

Q: GLM-OCRの出力結果にはどのような形がありますか?

A: GLM-OCRはMarkdownテキストの結果を出力でき、レイアウトに関連する構造化情報を返すことができます。

Q: GLM-OCRはオンライン体験とAPIを提供していますか?

A: Z.ai オンライン体験ページでAPIインターフェースの説明や開発者ドキュメントを提供しています。

おすすめツール

もっと見る