1. Zusammenfassung
DeepSeek-OCR 2 ist ein Upgrade des Open-Source-OCR/Dokumentverständnismodells von DeepSeek, mit dem Thema "DeepSeek-OCR 2: Visual Causal Flow", mit Schwerpunkt auf einer menschenfreundlicheren visuellen Codierungsmethode und stärkeren strukturierten Extraktions- und Verständnismöglichkeiten für komplexe Layouts (Dokumente, Diagramme, gemischte Seiten usw.). Das offizielle Repository und die Modellkarte bieten zwei Inferenzpfade, Transformers und vLLM, und bieten Prompt-Vorlagen wie "Dokumente zu Markdown umwandeln", "Bild-OCR" und "Zielpositionierung".
2. Kernmerkmale
- Visuell-kausale Flussrichtung: offiziell als eine stärker "vermenschlichte" visuelle Codierung beschrieben; Einige Interpretationen fassen dies als eine visuelle Token-Organisation zusammen, die eher der semantischen/typografischen Logik entspricht (spezifische Algorithmusdetails werden empfohlen, um das PDF des beiliegenden Artikels im Repository zu lesen).
- Dynamische Auflösung und Token-Budget: Dynamische Auflösung wird unterstützt, und das Standardkonfigurationsbeispiel ist eine Kombination mehrerer Blöcke von 768×768 + 1 Block von 1024×1024, entsprechend einem festen visuellen Token-Budget (das offizielle Beispiel beträgt etwa 256 Token), was praktisch ist, um Kompromisse zwischen Geschwindigkeit, Videospeicher und Genauigkeit zu treffen.
- Strukturierte Ausgabe für Dokumente: Das eingebaute Prompt-Beispiel unterstützt "Das Dokument in Markdown umwandeln", was sich eignet für die Umwandlung von PDF-/Bilddokumenten in editierbaren Text und eine leichte Struktur.
- Positionierung und allgemeines Verständnis: Das Prompt-Beispiel enthält rec (Lokalisierung eines Referenzobjekts) und eine allgemeine Beschreibung, was bedeutet, dass es nicht nur "Wortlesen" ist, sondern auch zum Verständnis und Abruf in gemischten Grafik- und Textszenarien verwendet werden kann.
3. Installation
- Umgebungsvorschläge: Die offizielle Testumgebung ist CUDA 11.8 + PyTorch 2.6.0, Python 3.12.9.
2. Transformator-Inferenz: Laden Sie deepseek-ai/DeepSeek-OCR-2 direkt von Hugging Face und empfehlen, FlashAttention (Beispiel ist flash-attn==2.7.3) mit bfloat16-Inferenz zu aktivieren.
- vLLM-Inferenz: Das Repository stellt vLLM-bezogene Anweisungen und Skripte bereit, einschließlich Bildstreaming-Ausgaben, gleichzeitiger PDF-Verarbeitung und Benchmark-Batch-Evaluationsskripte. Parameter wie Ein-/Ausgabepfade müssen per Konfigurationsdatei modifiziert werden.
4. Typische Anwendungsfälle
- Dokument zum Markdown: Gescannte Kopien, Papiere, Handbücher und andere Bilder/Seiten, Ein-Klick-Export von Markdown für sekundäre Bearbeitung und Abruf.
- Komplexes Layout-OCR: Für Szenarien, in denen traditionelle OCR zu Unordnung neigt, wie Tabellen, gemischte Grafiken und Texte sowie Flussdiagrammannotationen, versuchen Sie, die Eingabeaufforderungen "mit Layout/Erdung" zu verwenden, um eine stabilere Struktur zu erhalten.
- Diagramm- und Illustrationsanalyse: Separate Analyse von Abbildungen in Dokumenten, geeignet für den Aufbau von Wissensbasen und die Automatisierung von Berichten.
- Zielpositionierung und Zitierung: Verwenden Sie Positionierungshinweise, um Elemente (wie ein Etikett, einen Button oder einen Bereich) im Diagramm für Dokumentenprüfung, Datenannotation und automatische Qualitätskontrolle zu finden.
5. Ökologie und konkurrierende Produkte
- Ökologie: Modellgewichte werden auf Hugging Face veröffentlicht, und das Repository bietet Inferenzskripte und PDF-Eingänge zur gleichzeitigen Verarbeitung, was für den Zugriff auf Offline-Pipelines oder eine dienstorientierte Bereitstellung praktisch ist.
- Konkurrierende Produkte/Referenzen: Projekte wie Vary, GOT-OCR2.0, MinerU und PaddleOCR erscheinen in den offiziellen Bestätigungs- und Benchmarking-Links, die als Vergleichsobjekte in den Maßen "Geschwindigkeit, Layoutwiederherstellung, Open-Source-Steuerung und Bereitstellungskosten" verwendet werden können.
- Auswahlvorschläge: Wenn Sie auf "Document Structured Output (Markdown) + Concurrent Batch Processing (PDF) + Unified Multimodal Prompt" achten, liegt der Projekteintritt von DeepSeek-OCR 2 näher am Fließband. Wenn du traditionelle OCR-Engines und Regel-Postprocessing bevorzugst, sind Ökosysteme wie PaddleOCR/MinerU ausgereifter.
6. Einschränkungen und Vorsichtsmaßnahmen
- Die Details des Artikels müssen überprüft werden: Die Datenbank stellt ein PDF des Artikels bereit, aber die Modellkarte/README ist bei der Beschreibung der Details des Algorithmus zurückhaltender. Es umfasst zentrale Mechanismen wie "visuellen kausalen Fluss/dynamische Organisation" und es wird empfohlen, auf das Paper und die Code-Implementierung zu verweisen.
- Videospeicher und Durchsatz: Dynamische Auflösung und visuelles Token-Budget beeinflussen direkt den Videospeicherverbrauch und die Geschwindigkeit, daher wird empfohlen, vor der Nebenwahl eine kleine Batch-Verifikation durchzuführen.
- Ausgabequalitätsabhängige Prompts: Für dasselbe Dokument liefern "Free OCR", "Markdown Conversion with Grounding" und "Figure Parsing" Ergebnisse unterschiedlicher Granularität, und es wird empfohlen, die Prompt-Vorlage und das Bewertungsset für das Unternehmen festzulegen.
- Komplexe Dokumente müssen weiterhin Korrektur gelesen werden: Für mathematische Formeln, extreme Satzweise und niedrig aufgelöste Scans wird weiterhin empfohlen, manuell zu prüfen oder einen sekundären Verifikationsprozess einzuführen.
7. Projektadresse
https://github.com/deepseek-ai/DeepSeek-OCR-2
8. Häufig gestellte Fragen
F: Was sind die zentralen Schlüsselwörter von DeepSeek-OCR 2? Was genau bedeutet visueller kausaler Fluss?
A: Offiziell wird es als eine eher "menschliche" Richtung des visuellen Codings beschrieben; Für spezifischere Mechanismen haben die PDF- und Code-Implementierung im Repository Vorrang.
F: Wie wandelt DeepSeek-OCR 2 Bilddokumente in Markdown um?
A: Verwenden Sie das Prompt-Beispiel <image>\n<|grounding|>Convert the document to markdown. und rufen Sie model.infer(...) auf, da das Beispiel an das angegebene Verzeichnis ausgibt.
F: Unterstützt DeepSeek-OCR 2 das Batch-Ausführen von PDFs?
A: Ja. Das Repository gibt dem vLLM einen PDF-Nebenläufigkeitsskript-Eintrag und fordert auf, Parameter wie Eingabe-/Ausgabepfade in der Konfigurationsdatei zu ändern.
F: Was ist die Open-Source-Lizenz für DeepSeek-OCR 2? Kann es kommerzialisiert werden?
A: Das Repository und die Modellkarte sind als Apache-2.0 gekennzeichnet; Es wird dennoch empfohlen, die Lizenzliste einmal basierend auf Ihrer Vertriebsmethode und Ihren Abhängigkeiten zu überprüfen.
F: Wie beeinflussen dynamische Auflösung und das visuelle Token-Budget die Leistung?
A: Höhere Auflösung oder mehr Chunking sind in der Regel förderlicher für komplexe Layouts, aber auch speicherintensiver und langsamer; Es wird empfohlen, vor der Finalisierung einen "Geschwindigkeits-Präzisions"-Kurventest rund um den Dokumenttyp durchzuführen.