OCR-Texterkennung
Bevor ein Modell eine gescannte Seite beantworten kann, müssen die Zeichen darauf richtig gelesen sein. Hier geht es um Layoutanalyse, mehrsprachige Erkennung, strukturierte PDF-Ausgaben und die Unterschiede zwischen PaddleOCR und HunyuanOCR.
OCR ist längst mehr als reine Zeichenerkennung: Titel und Tabellengrenzen müssen gefunden werden, zweispaltige Seiten brauchen eine Lesereihenfolge, und ein Fehler lässt die nachgelagerte QA Fußnoten zu plausibel klingendem Unsinn verweben. PaddleOCRs PP-StructureV3 übernimmt Layout und Tabellen, HunyuanOCR deckt mit etwa einer Milliarde Parametern Straßenszenen und Handschrift ab, DeepSeek-OCR komprimiert die ganze Seite in visuelle Token und spart Kontext.