ToolNavs AIツールナビ
ツール投稿 ログイン
戻るAI情報
GLM-OCRオンライン体験 Z.ai 開始:PDFおよび画像レイアウト解析をサポート

GLM-OCRオンライン体験 Z.ai 開始:PDFおよび画像レイアウト解析をサポート

AI情報 Admin 417 回閲覧

Z.ai マルチモーダルOCRモデルGLM-OCRをリリースし、Hugging Faceの重みを開放し、オンライン体験とAPIコール方式を提供します。 公式には約9億パラメータしか含まれていませんが、式認識、テーブル認識、キー情報抽出などのシナリオをカバーする複雑な文書理解タスクでリード的な性能を達成しています。

APIの使用面では、GLM-OCRはPDFと画像(JPG/PNG)の入力をサポートしており、1枚の画像は最大10MB、PDFは最大50MB、最大100ページです。 出力には、ドキュメント解析、データ入力、RAG文書前処理のためのMarkdown結果やレイアウト詳細を含めることができます。 実際の効果はスキャン品質、フォントの混合、シールの遮蔽、レイアウトの複雑さに影響されるため、生産環境でサンプリング評価とプライバシー遵守チェックを行うことが推奨されます。

よくある質問

Q: GLM-OCRは主にどのような問題を解決しますか?

A: GLM-OCRはOCRや複雑な文書の理解に適しており、テキスト、表、数式、情報抽出をカバーします。

Q: GLM-OCRはどのような入力とサイズ制限をサポートしていますか?

A: GLM-OCRはPDFおよびJPG/PNGに対応しており、画像≤10MB、PDF≤50MB、最大100ページまで対応しています。

Q: GLM-OCRの出力結果にはどのような形がありますか?

A: GLM-OCRはMarkdownテキストの結果を出力でき、レイアウトに関連する構造化情報を返すことができます。

Q: GLM-OCRはオンライン体験とAPIを提供していますか?

A: Z.ai オンライン体験ページでAPIインターフェースの説明や開発者ドキュメントを提供しています。

関連記事

OpenAIがCodexアプリケーションをローンチ:macOSが起動、マルチエージェントによる並列コラボレーションが「コマンドセンター」に移行

OpenAIがCodexアプリケーションをローンチ:macOSが起動、マルチエージェントによる並列コラボレーションが「コマンドセンター」に移行

OpenAIはCodexアプリケーションをリリースし、macOSでダウンロード可能にしました。これにより「エージェント構築コマンドセンター」として位置づけられ、複数のエージェントを同時に管理して長期的...

Qwen3-coder-Next 包括的解釈:80B/3B 超スパースオープンソース重みモデルによるコーディングエージェント

Qwen3-coder-Next 包括的解釈:80B/3B 超スパースオープンソース重みモデルによるコーディングエージェント

1. 要旨 Qwen3-Coder-Nextは、Qwen Teamがリリースしたオープンソースの重み付きコードモデルで、コーディングエージェントやローカル開発シナリオに適しています。 その核心的な考え...

OpenAIは11月にCursorのモデル供給契約を終了し、プラットフォームレベルのモデル統合も停止する予定です

OpenAIは11月にCursorのモデル供給契約を終了し、プラットフォームレベルのモデル統合も停止する予定です

OpenAI は、 Cursor に直接カスタムモデルを提供する契約を終了する計画を発表し、このパートナーシップは2026年11月12日に終了する予定です。トリガーは製品性能ではなく、CursorがS...

騰訊 Hunyuan Hy4 プレビュー オープンソース:770B パラメータ、100万コンテキスト リアル生産性をターゲットに

騰訊 Hunyuan Hy4 プレビュー オープンソース:770B パラメータ、100万コンテキスト リアル生産性をターゲットに

騰訊環源は Hy4プレビュー をリリースし、オープンソース化しました。この新世代の旗艦MoE大型モデルは、総パラメータが770B、トークン1回あたり49B、ネイティブコンテキスト長が1MBに延長されて...

おすすめツール

もっと見る