1. 要旨
DeepSeek-OCR 2は、DeepSeekのオープンソースOCR/ドキュメント理解モデルのアップグレード版であり、「DeepSeek-OCR 2: Visual Causal Flow」をテーマに、より人間に優しい視覚コーディング手法を強調し、複雑なレイアウト(ドキュメント、チャート、混合ページなど)に対してより強力な構造抽出と理解能力を提供します。 公式リポジトリとモデルカードは、TransformersとvLLMの2つの推論パスを提供し、「ドキュメントをMarkdownに変換する」「画像OCR」「ターゲットポジショニング」などのプロンプトテンプレートも提供しています。
2. コア機能
- 視覚因果フロー方向:公式にはより「人間味のある」視覚符号化と説明されています。 一部の解釈では、これを意味論的・タイポグラフィ論理により沿った視覚的トークン組織としてまとめるものもあります(具体的なアルゴリズムの詳細はリポジトリに付属する論文のPDFを読むことをお勧めします)。
- 動的解像度とトークン予算:動的解像度に対応しており、デフォルトの構成例は768×768+1024×1ブロックの複数ブロックの組み合わせで、固定されたビジュアルトークン予算(公式例は約256トークン)に対応しています。これは速度、ビデオメモリ、精度のトレードオフに便利です。
- 文書の構造化出力:組み込みのプロンプト例は「Convert the document to markdown」をサポートしており、PDFや画像文書を編集可能なテキストや軽量な構造に変換するのに適しています。
- 位置づくりと一般的な理解:プロンプト例にはrec(参照オブジェクトの特定)と一般的な説明が含まれており、単なる「単語読み」だけでなく、グラフィックスとテキストが混在する状況での理解や検索にも利用できます。
3. 設置
- 環境の提案:公式のテスト環境はCUDA 11.8 + PyTorch 2.6.0、Python 3.12.9です。
2. トランスフォーマー推論:Hugging Faceから直接deepseek-ai/DeepSeek-OCR-2読み込み、bfloat16推論でFlashAttention(例flash-attn==2.7.3)を有効にすることを推奨します。
- vLLM推論:リポジトリは、画像ストリーミング出力、PDF同時処理、ベンチマークバッチ評価スクリプトを含むvLLM関連の命令やスクリプトを提供します。 入出力パスなどのパラメータは設定ファイルによって修正する必要があります。
4. 典型的なユースケース
- DocumentからMarkdownへ:スキャンしたコピー、論文、マニュアル、その他の写真やページをワンクリックでエクスポートし、二次編集と取得が可能です。
- 複雑なレイアウトOCR:従来のOCRが混乱しやすい場合(表、グラフィックとテキストの混合、フローチャート注釈など)では、「レイアウト/グラウンディング付き」プロンプトを使ってより安定した構造を得るようにしましょう。
- 図解および図解分析:文書内の図を別途分析し、ナレッジベース構築やレポート自動化に適しています。
- ターゲットの位置付けと引用:位置指示を使って図内の要素(ラベル、ボタン、領域など)を見つけ、文書レビュー、データ注釈、自動品質検査を行います。
5. 生態系と競合製品
- 生態学:モデルの重みはHugging Faceで公開されており、リポジトリは推論スクリプトやPDF同時処理エントリーを提供しているため、オフラインパイプラインやサービス指向展開へのアクセスに便利です。
- 競合製品/参考文献:Vary、GOT-OCR2.0、MinerU、PaddleOCRなどのプロジェクトは公式の承認リンクやベンチマークリンクに掲載されており、「速度、レイアウト復元、オープンソースの制御可能性、デプロイコスト」の側面での比較対象として利用できます。
- 選択の提案:「Document Structured Output (Markdown) + Concurrent Batch Processing (PDF) + Unified Multimodal Prompt」に注目すると、DeepSeek-OCR 2のプロジェクト入口は組立ラインに近い位置にあります。 従来のOCRエンジンやルール後処理を好むなら、PaddleOCRやMinerUのようなエコシステムの方が成熟しています。
6. 制限事項と注意事項
- 論文の詳細を確認する必要があります:データベースは論文のPDFを提供しますが、モデルカードやREADMEはアルゴリズムの詳細を控えめに記述しています。 「視覚的因果フロー/動的組織化」といった重要なメカニズムを含み、論文やコードの実装を参照することが推奨されます。
- ビデオメモリとスループット:動的解像度とビジュアルトークンバジェットはビデオメモリの使用量と速度に直接影響するため、並行処理前に小規模バッチ検証を推奨します。
- 品質依存のプロンプト出力:同じドキュメントにおいて、「Free OCR」、「Markdown Conversion with Grounding」、「figure parsing」は異なる細分度の結果が得られ、プロンプトテンプレートと評価セットをビジネス向けに固めることが推奨されます。
- 複雑な文書は依然として校正が必要です。数学式、極端な組版、低精細スキャンの場合は、手動で確認するか二次検証プロセスを導入することが推奨されます。
7. プロジェクトアドレス
https://github.com/deepseek-ai/DeepSeek-OCR-2
8. よくある質問
Q: DeepSeek-OCR 2のコアキーワードは何ですか? 視覚因果の流れとは具体的に何を意味するのでしょうか?
A: 公式には、より「人間らしい」視覚符号化の方向性と説明されています。 より具体的な仕組みについては、リポジトリの紙のPDFとコード実装が優先されます。
Q: DeepSeek-OCR 2は画像文書をどのようにMarkdownに変換しますか?
A: プロンプトの例<image>\n<|grounding|>Convert the document to markdown.を使い、指定されたディレクトリへの出力としてmodel.infer(...)を呼び出します。
Q: DeepSeek-OCR 2はPDFのバッチ実行に対応していますか?
A: はい。 リポジトリはvLLMにPDFの並行スクリプトエントリと、設定ファイルの入出力パスなどのパラメータを変更するプロンプトを提供します。
Q: DeepSeek-OCR 2のオープンソースライセンスとは何ですか? 商業化は可能でしょうか?
A: リポジトリとモデルカードはApache-2.0とマークされています。配布方法や依存関係に基づいてライセンスリストを一度確認することが推奨されます。
Q: 動的解像度とビジュアルトークンバジェットはパフォーマンスにどのような影響を与えますか?
A: 高解像度やチャンク化が多いほど複雑なレイアウトに適していますが、メモリ消費や速度が遅くなります。 最終決定前に、文書タイプを「スピード・精度」で比較する曲線テストを行うことが推奨されます。