ToolNavs KI-Tool-Verzeichnis
Tool einreichen Anmelden
Zurück zu KI ist Open Source
DeepSeek-OCR 2 veröffentlicht: Visueller kausaler Fluss macht Dokument- und Diagrammerkennung "menschlicher"

DeepSeek-OCR 2 veröffentlicht: Visueller kausaler Fluss macht Dokument- und Diagrammerkennung "menschlicher"

KI ist Open Source Admin 222 Aufrufe

1. Zusammenfassung

DeepSeek-OCR 2 ist ein Upgrade des Open-Source-OCR/Dokumentverständnismodells von DeepSeek, mit dem Thema "DeepSeek-OCR 2: Visual Causal Flow", mit Schwerpunkt auf einer menschenfreundlicheren visuellen Codierungsmethode und stärkeren strukturierten Extraktions- und Verständnismöglichkeiten für komplexe Layouts (Dokumente, Diagramme, gemischte Seiten usw.). Das offizielle Repository und die Modellkarte bieten zwei Inferenzpfade, Transformers und vLLM, und bieten Prompt-Vorlagen wie "Dokumente zu Markdown umwandeln", "Bild-OCR" und "Zielpositionierung".

2. Kernmerkmale

  1. Visuell-kausale Flussrichtung: offiziell als eine stärker "vermenschlichte" visuelle Codierung beschrieben; Einige Interpretationen fassen dies als eine visuelle Token-Organisation zusammen, die eher der semantischen/typografischen Logik entspricht (spezifische Algorithmusdetails werden empfohlen, um das PDF des beiliegenden Artikels im Repository zu lesen).
  2. Dynamische Auflösung und Token-Budget: Dynamische Auflösung wird unterstützt, und das Standardkonfigurationsbeispiel ist eine Kombination mehrerer Blöcke von 768×768 + 1 Block von 1024×1024, entsprechend einem festen visuellen Token-Budget (das offizielle Beispiel beträgt etwa 256 Token), was praktisch ist, um Kompromisse zwischen Geschwindigkeit, Videospeicher und Genauigkeit zu treffen.
  3. Strukturierte Ausgabe für Dokumente: Das eingebaute Prompt-Beispiel unterstützt "Das Dokument in Markdown umwandeln", was sich eignet für die Umwandlung von PDF-/Bilddokumenten in editierbaren Text und eine leichte Struktur.
  4. Positionierung und allgemeines Verständnis: Das Prompt-Beispiel enthält rec (Lokalisierung eines Referenzobjekts) und eine allgemeine Beschreibung, was bedeutet, dass es nicht nur "Wortlesen" ist, sondern auch zum Verständnis und Abruf in gemischten Grafik- und Textszenarien verwendet werden kann.

3. Installation

  1. Umgebungsvorschläge: Die offizielle Testumgebung ist CUDA 11.8 + PyTorch 2.6.0, Python 3.12.9.

2. Transformator-Inferenz: Laden Sie deepseek-ai/DeepSeek-OCR-2 direkt von Hugging Face und empfehlen, FlashAttention (Beispiel ist flash-attn==2.7.3) mit bfloat16-Inferenz zu aktivieren.

  1. vLLM-Inferenz: Das Repository stellt vLLM-bezogene Anweisungen und Skripte bereit, einschließlich Bildstreaming-Ausgaben, gleichzeitiger PDF-Verarbeitung und Benchmark-Batch-Evaluationsskripte. Parameter wie Ein-/Ausgabepfade müssen per Konfigurationsdatei modifiziert werden.

4. Typische Anwendungsfälle

  1. Dokument zum Markdown: Gescannte Kopien, Papiere, Handbücher und andere Bilder/Seiten, Ein-Klick-Export von Markdown für sekundäre Bearbeitung und Abruf.
  2. Komplexes Layout-OCR: Für Szenarien, in denen traditionelle OCR zu Unordnung neigt, wie Tabellen, gemischte Grafiken und Texte sowie Flussdiagrammannotationen, versuchen Sie, die Eingabeaufforderungen "mit Layout/Erdung" zu verwenden, um eine stabilere Struktur zu erhalten.
  3. Diagramm- und Illustrationsanalyse: Separate Analyse von Abbildungen in Dokumenten, geeignet für den Aufbau von Wissensbasen und die Automatisierung von Berichten.
  4. Zielpositionierung und Zitierung: Verwenden Sie Positionierungshinweise, um Elemente (wie ein Etikett, einen Button oder einen Bereich) im Diagramm für Dokumentenprüfung, Datenannotation und automatische Qualitätskontrolle zu finden.

5. Ökologie und konkurrierende Produkte

  1. Ökologie: Modellgewichte werden auf Hugging Face veröffentlicht, und das Repository bietet Inferenzskripte und PDF-Eingänge zur gleichzeitigen Verarbeitung, was für den Zugriff auf Offline-Pipelines oder eine dienstorientierte Bereitstellung praktisch ist.
  2. Konkurrierende Produkte/Referenzen: Projekte wie Vary, GOT-OCR2.0, MinerU und PaddleOCR erscheinen in den offiziellen Bestätigungs- und Benchmarking-Links, die als Vergleichsobjekte in den Maßen "Geschwindigkeit, Layoutwiederherstellung, Open-Source-Steuerung und Bereitstellungskosten" verwendet werden können.
  3. Auswahlvorschläge: Wenn Sie auf "Document Structured Output (Markdown) + Concurrent Batch Processing (PDF) + Unified Multimodal Prompt" achten, liegt der Projekteintritt von DeepSeek-OCR 2 näher am Fließband. Wenn du traditionelle OCR-Engines und Regel-Postprocessing bevorzugst, sind Ökosysteme wie PaddleOCR/MinerU ausgereifter.

6. Einschränkungen und Vorsichtsmaßnahmen

  1. Die Details des Artikels müssen überprüft werden: Die Datenbank stellt ein PDF des Artikels bereit, aber die Modellkarte/README ist bei der Beschreibung der Details des Algorithmus zurückhaltender. Es umfasst zentrale Mechanismen wie "visuellen kausalen Fluss/dynamische Organisation" und es wird empfohlen, auf das Paper und die Code-Implementierung zu verweisen.
  2. Videospeicher und Durchsatz: Dynamische Auflösung und visuelles Token-Budget beeinflussen direkt den Videospeicherverbrauch und die Geschwindigkeit, daher wird empfohlen, vor der Nebenwahl eine kleine Batch-Verifikation durchzuführen.
  3. Ausgabequalitätsabhängige Prompts: Für dasselbe Dokument liefern "Free OCR", "Markdown Conversion with Grounding" und "Figure Parsing" Ergebnisse unterschiedlicher Granularität, und es wird empfohlen, die Prompt-Vorlage und das Bewertungsset für das Unternehmen festzulegen.
  4. Komplexe Dokumente müssen weiterhin Korrektur gelesen werden: Für mathematische Formeln, extreme Satzweise und niedrig aufgelöste Scans wird weiterhin empfohlen, manuell zu prüfen oder einen sekundären Verifikationsprozess einzuführen.

7. Projektadresse

https://github.com/deepseek-ai/DeepSeek-OCR-2

8. Häufig gestellte Fragen

F: Was sind die zentralen Schlüsselwörter von DeepSeek-OCR 2? Was genau bedeutet visueller kausaler Fluss?

A: Offiziell wird es als eine eher "menschliche" Richtung des visuellen Codings beschrieben; Für spezifischere Mechanismen haben die PDF- und Code-Implementierung im Repository Vorrang.

F: Wie wandelt DeepSeek-OCR 2 Bilddokumente in Markdown um?

A: Verwenden Sie das Prompt-Beispiel <image>\n<|grounding|>Convert the document to markdown. und rufen Sie model.infer(...) auf, da das Beispiel an das angegebene Verzeichnis ausgibt.

F: Unterstützt DeepSeek-OCR 2 das Batch-Ausführen von PDFs?

A: Ja. Das Repository gibt dem vLLM einen PDF-Nebenläufigkeitsskript-Eintrag und fordert auf, Parameter wie Eingabe-/Ausgabepfade in der Konfigurationsdatei zu ändern.

F: Was ist die Open-Source-Lizenz für DeepSeek-OCR 2? Kann es kommerzialisiert werden?

A: Das Repository und die Modellkarte sind als Apache-2.0 gekennzeichnet; Es wird dennoch empfohlen, die Lizenzliste einmal basierend auf Ihrer Vertriebsmethode und Ihren Abhängigkeiten zu überprüfen.

F: Wie beeinflussen dynamische Auflösung und das visuelle Token-Budget die Leistung?

A: Höhere Auflösung oder mehr Chunking sind in der Regel förderlicher für komplexe Layouts, aber auch speicherintensiver und langsamer; Es wird empfohlen, vor der Finalisierung einen "Geschwindigkeits-Präzisions"-Kurventest rund um den Dokumenttyp durchzuführen.

Empfohlene Tools

Mehr