Zurück zu KI ist Open Source
DeepSeek-OCR 2 veröffentlicht: Visueller kausaler Fluss macht Dokument- und Diagrammerkennung "menschlicher"

DeepSeek-OCR 2 veröffentlicht: Visueller kausaler Fluss macht Dokument- und Diagrammerkennung "menschlicher"

KI ist Open Source Admin 198 Aufrufe

1. Zusammenfassung

DeepSeek-OCR 2 ist ein Upgrade des Open-Source-OCR/Dokumentverständnismodells von DeepSeek, mit dem Thema "DeepSeek-OCR 2: Visual Causal Flow", mit Schwerpunkt auf einer menschenfreundlicheren visuellen Codierungsmethode und stärkeren strukturierten Extraktions- und Verständnismöglichkeiten für komplexe Layouts (Dokumente, Diagramme, gemischte Seiten usw.). Das offizielle Repository und die Modellkarte bieten zwei Inferenzpfade, Transformers und vLLM, und bieten Prompt-Vorlagen wie "Dokumente zu Markdown umwandeln", "Bild-OCR" und "Zielpositionierung".

2. Kernmerkmale

  1. Visuell-kausale Flussrichtung: offiziell als eine stärker "vermenschlichte" visuelle Codierung beschrieben; Einige Interpretationen fassen dies als eine visuelle Token-Organisation zusammen, die eher der semantischen/typografischen Logik entspricht (spezifische Algorithmusdetails werden empfohlen, um das PDF des beiliegenden Artikels im Repository zu lesen).
  2. Dynamische Auflösung und Token-Budget: Dynamische Auflösung wird unterstützt, und das Standardkonfigurationsbeispiel ist eine Kombination mehrerer Blöcke von 768×768 + 1 Block von 1024×1024, entsprechend einem festen visuellen Token-Budget (das offizielle Beispiel beträgt etwa 256 Token), was praktisch ist, um Kompromisse zwischen Geschwindigkeit, Videospeicher und Genauigkeit zu treffen.
  3. Strukturierte Ausgabe für Dokumente: Das eingebaute Prompt-Beispiel unterstützt "Das Dokument in Markdown umwandeln", was sich eignet für die Umwandlung von PDF-/Bilddokumenten in editierbaren Text und eine leichte Struktur.
  4. Positionierung und allgemeines Verständnis: Das Prompt-Beispiel enthält rec (Lokalisierung eines Referenzobjekts) und eine allgemeine Beschreibung, was bedeutet, dass es nicht nur "Wortlesen" ist, sondern auch zum Verständnis und Abruf in gemischten Grafik- und Textszenarien verwendet werden kann.

3. Installation

  1. Umgebungsvorschläge: Die offizielle Testumgebung ist CUDA 11.8 + PyTorch 2.6.0, Python 3.12.9.

2. Transformator-Inferenz: Laden Sie deepseek-ai/DeepSeek-OCR-2 direkt von Hugging Face und empfehlen, FlashAttention (Beispiel ist flash-attn==2.7.3) mit bfloat16-Inferenz zu aktivieren.

  1. vLLM-Inferenz: Das Repository stellt vLLM-bezogene Anweisungen und Skripte bereit, einschließlich Bildstreaming-Ausgaben, gleichzeitiger PDF-Verarbeitung und Benchmark-Batch-Evaluationsskripte. Parameter wie Ein-/Ausgabepfade müssen per Konfigurationsdatei modifiziert werden.

4. Typische Anwendungsfälle

  1. Dokument zum Markdown: Gescannte Kopien, Papiere, Handbücher und andere Bilder/Seiten, Ein-Klick-Export von Markdown für sekundäre Bearbeitung und Abruf.
  2. Komplexes Layout-OCR: Für Szenarien, in denen traditionelle OCR zu Unordnung neigt, wie Tabellen, gemischte Grafiken und Texte sowie Flussdiagrammannotationen, versuchen Sie, die Eingabeaufforderungen "mit Layout/Erdung" zu verwenden, um eine stabilere Struktur zu erhalten.
  3. Diagramm- und Illustrationsanalyse: Separate Analyse von Abbildungen in Dokumenten, geeignet für den Aufbau von Wissensbasen und die Automatisierung von Berichten.
  4. Zielpositionierung und Zitierung: Verwenden Sie Positionierungshinweise, um Elemente (wie ein Etikett, einen Button oder einen Bereich) im Diagramm für Dokumentenprüfung, Datenannotation und automatische Qualitätskontrolle zu finden.

5. Ökologie und konkurrierende Produkte

  1. Ökologie: Modellgewichte werden auf Hugging Face veröffentlicht, und das Repository bietet Inferenzskripte und PDF-Eingänge zur gleichzeitigen Verarbeitung, was für den Zugriff auf Offline-Pipelines oder eine dienstorientierte Bereitstellung praktisch ist.
  2. Konkurrierende Produkte/Referenzen: Projekte wie Vary, GOT-OCR2.0, MinerU und PaddleOCR erscheinen in den offiziellen Bestätigungs- und Benchmarking-Links, die als Vergleichsobjekte in den Maßen "Geschwindigkeit, Layoutwiederherstellung, Open-Source-Steuerung und Bereitstellungskosten" verwendet werden können.
  3. Auswahlvorschläge: Wenn Sie auf "Document Structured Output (Markdown) + Concurrent Batch Processing (PDF) + Unified Multimodal Prompt" achten, liegt der Projekteintritt von DeepSeek-OCR 2 näher am Fließband. Wenn du traditionelle OCR-Engines und Regel-Postprocessing bevorzugst, sind Ökosysteme wie PaddleOCR/MinerU ausgereifter.

6. Einschränkungen und Vorsichtsmaßnahmen

  1. Die Details des Artikels müssen überprüft werden: Die Datenbank stellt ein PDF des Artikels bereit, aber die Modellkarte/README ist bei der Beschreibung der Details des Algorithmus zurückhaltender. Es umfasst zentrale Mechanismen wie "visuellen kausalen Fluss/dynamische Organisation" und es wird empfohlen, auf das Paper und die Code-Implementierung zu verweisen.
  2. Videospeicher und Durchsatz: Dynamische Auflösung und visuelles Token-Budget beeinflussen direkt den Videospeicherverbrauch und die Geschwindigkeit, daher wird empfohlen, vor der Nebenwahl eine kleine Batch-Verifikation durchzuführen.
  3. Ausgabequalitätsabhängige Prompts: Für dasselbe Dokument liefern "Free OCR", "Markdown Conversion with Grounding" und "Figure Parsing" Ergebnisse unterschiedlicher Granularität, und es wird empfohlen, die Prompt-Vorlage und das Bewertungsset für das Unternehmen festzulegen.
  4. Komplexe Dokumente müssen weiterhin Korrektur gelesen werden: Für mathematische Formeln, extreme Satzweise und niedrig aufgelöste Scans wird weiterhin empfohlen, manuell zu prüfen oder einen sekundären Verifikationsprozess einzuführen.

7. Projektadresse

https://github.com/deepseek-ai/DeepSeek-OCR-2

8. Häufig gestellte Fragen

F: Was sind die zentralen Schlüsselwörter von DeepSeek-OCR 2? Was genau bedeutet visueller kausaler Fluss?

A: Offiziell wird es als eine eher "menschliche" Richtung des visuellen Codings beschrieben; Für spezifischere Mechanismen haben die PDF- und Code-Implementierung im Repository Vorrang.

F: Wie wandelt DeepSeek-OCR 2 Bilddokumente in Markdown um?

A: Verwenden Sie das Prompt-Beispiel <image>\n<|grounding|>Convert the document to markdown. und rufen Sie model.infer(...) auf, da das Beispiel an das angegebene Verzeichnis ausgibt.

F: Unterstützt DeepSeek-OCR 2 das Batch-Ausführen von PDFs?

A: Ja. Das Repository gibt dem vLLM einen PDF-Nebenläufigkeitsskript-Eintrag und fordert auf, Parameter wie Eingabe-/Ausgabepfade in der Konfigurationsdatei zu ändern.

F: Was ist die Open-Source-Lizenz für DeepSeek-OCR 2? Kann es kommerzialisiert werden?

A: Das Repository und die Modellkarte sind als Apache-2.0 gekennzeichnet; Es wird dennoch empfohlen, die Lizenzliste einmal basierend auf Ihrer Vertriebsmethode und Ihren Abhängigkeiten zu überprüfen.

F: Wie beeinflussen dynamische Auflösung und das visuelle Token-Budget die Leistung?

A: Höhere Auflösung oder mehr Chunking sind in der Regel förderlicher für komplexe Layouts, aber auch speicherintensiver und langsamer; Es wird empfohlen, vor der Finalisierung einen "Geschwindigkeits-Präzisions"-Kurventest rund um den Dokumenttyp durchzuführen.

DeepSeek Open-Source DeepSeek-OCR 2 Upgrade: Visual Causal Flow verbessert das Dokumentenverständnis DeepSeek-OCR 2 veröffentlicht: Strukturierte Extraktionsmöglichkeiten für komplexe Layouts wurden erheblich verbessert DeepSeek-OCR 2 Erklärt: Warum visueller kausaler Fluss eher menschlicher visueller Codierung ähnelt DeepSeek-OCR 2 unterstützt Dokument-zu-Markdown: PDF-Bilder können mit einem Klick bearbeitet werden DeepSeek-OCR 2 startet dynamische Auflösung: Wie man Geschwindigkeit und Speichergenauigkeit ausbalanciert DeepSeek-OCR 2 gibt ein Beispiel für ein Budget von 256 visuellen Tokens: Wie hoch sind die Kosten für einen erhöhten Durchsatz? DeepSeek-OCR 2 bietet zwei Schlusswege: Transformer und vLLMs: flexiblere Bereitstellung DeepSeek-OCR 2 vLLM-Skripte unterstützen gleichzeitige PDF-Verarbeitung: Pipeline-Batch-OCR ist unkomplizierter DeepSeek-OCR 2 fügt die Positionsempfehlung hinzu: Nicht nur Wörter lesen, sondern auch Ziele finden DeepSeek-OCR 2 passt Diagramme und Mischseiten an: Die Schmerzpunkte traditioneller OCR außerhalb der Reihenfolge werden gezielt angesprochen DeepSeek-OCR 2 Modellkarten-Ankündigungsvorlage: Erdung macht die Struktur stabiler DeepSeek-OCR 2 Engineering Highlights: Vollständige Bildstreaming-Ausgabe und Batch-Evaluationsskripte DeepSeek-OCR 2 Installationsumgebung: CUDA 11.8 + PyTorch 2.6.0 ist die empfohlene Kombination DeepSeek-OCR 2 empfiehlt, FlashAttention: Inference zu beschleunigen, aber sei vorsichtig bei der Kompatibilität. DeepSeek-OCR 2 verwendet bfloat16, um zu argumentieren: Der Videospeicherdruck sinkt, aber wie effektiv ist es DeepSeek-OCR 2 wandelt Scans in Markdowns um: Wie sich die Effizienz der Wissensdatenbank verbessert DeepSeek-OCR 2 Komplexe Tabellen-OCR: Kann strukturierte Ausgabe die Nachbearbeitung reduzieren? DeepSeek-OCR 2 Flussdiagramm- und Annotationsanalyse: Das Dokumentenverständnis wechselt vom Text zum Layout DeepSeek-OCR 2 Figur separate Parsing: ein neuer Einstiegspunkt für die Berichterstattungsautomatisierung DeepSeek-OCR 2 Targeting und Zitation: Dokumentenprüfung und Qualitätsprüfung sind besser kontrollierbar DeepSeek-OCR 2 Open Source Apache-2.0: Kommerzielle Compliance erfordert weiterhin eine Lizenzliste DeepSeek-OCR 2 Paper-PDF wird mit dem Repository bereitgestellt: Algorithmusdetails unterliegen dem Code Kontroverse um den DeepSeek-OCR 2 Algorithmus: Beschreibung der README-Einschränkung und reproduzierbare Detaillücken DeepSeek-OCR 2 dynamisches Würfeln 768x768+1024x1024: Wird die falsche Konfiguration sich umkehren? DeepSeek-OCR 2 Prompt bestimmt die Ausgabequalität: Was ist der Unterschied zwischen Free OCR und Erdung? Die Ausgabe von DeepSeek-OCR 2 muss noch Korrektur gelesen werden: Extremes Formelsatz-Low-Definition-Scannen ist schwierig DeepSeek-OCR 2 Throughput Evaluation Guide: Das Hochladen von PDFs in kleinen Chargen ist für Nebenwirkung stabiler DeepSeek-OCR 2 eignet sich für Offline-Pipelines: strukturierte Markdown- + Batch-Verarbeitungsintegration Wichtige Punkte der dienstbasierten Bereitstellung von DeepSeek-OCR 2: Ignorieren Sie Pfadkonfiguration und Berechtigungsisolation nicht DeepSeek-OCR 2 vs. PaddleOCR: Wer ist stärker in der Reife der Regelmaschine und Strukturfähigkeit? DeepSeek-OCR 2 vs. MinerU: Wie man Open-Source-Steuer- und Bereitstellungskosten wählt DeepSeek-OCR 2 Benchmarks GOT-OCR2.0 und Vary: Wo liegt der Unterschied in der Layout-Wiederherstellungsroute? DeepSeek-OCR 2 Ökosystem-Inventar: Umarmend Gesichtsgewicht + GitHub-Skript schnell implementiert DeepSeek-OCR 2 Prompt-Beispiel öffentlich: Wie man das Dokument in Markdown umwandelt DeepSeek-OCR 2 Laden von deepseek-ai/DeepSeek-OCR-2 mit Transformers: Leichter zu starten DeepSeek-OCR 2 vLLM Concurrent PDF: Wie man den Ein- und Ausgabepfad der Konfigurationsdatei ändert DeepSeek-OCR 2 Bildstreaming-Ausgabe: Was Echtzeit-OCR für interaktive Produkte bedeutet DeepSeek-OCR 2 Structured Extraction Targeting Mixing: Document RAG Data Cleaning ist leichter DeepSeek-OCR 2 Positionierungsfähigkeitsempfehlung: effizientere Datenannotation und automatische Qualitätskontrolle DeepSeek-OCR 2 Visual Token Budget Controllable: Wie man die Kostenkurve zeichnet DeepSeek-OCR 2 humanisiert visuelles Codieren: Warum das Verständnis komplexer Typografie wichtig ist DeepSeek-OCR 2 verwandelt OCR in Dokumentenverständnis: von der Anerkennung zu strukturierten Upgrade-Punkten DeepSeek-OCR 2 Übungsempfehlung: Beheben Sie die Prompt-Template und das Evaluationsset, um Drift zu vermeiden DeepSeek-OCR 2 Risikowarnung: Gleichzeitige Fehlerversuche sollten zuerst mit dem Log-System kombiniert werden DeepSeek-OCR 2 Bereitstellungskosten: Wie man Speicherbandbreite und Durchsatz schätzt Liste der anwendbaren Szenarien für DeepSeek-OCR 2: Papierspezifikationen und gescannte Kopien in editierbaren Text umwandeln DeepSeek-OCR 2 Chart-Interpretationsfähigkeit: Ein wesentlicher Bestandteil der Erstellung von Wissensdatenbanken und Berichten Hinter dem Open-Source-Update DeepSeek-OCR 2: Strukturierte Ausgabe von Dokumenten wird zu einem neuen Schlachtfeld Starten Sie mit DeepSeek-OCR 2: Drei Prompts behandeln OCR Markdown und Positionierung DeepSeek-OCR 2 Vollständige Analyse: Visual Causal Causal Flow Dynamic Resolution Engineering Script und Einschränkungen

Empfohlene Tools

Mehr