Docling löst die am meisten unterschätzte Hürde, bevor ein PDF an ein großes Modell geht: das Layout. Gewöhnliche Extraktion wirft ein PDF in Zeichenreihenfolge aus, sodass Zweispalter quer gelesen werden, Tabellen zu Trümmern zerfallen und Überschriften im Fließtext verschwinden; wie klug das Modell dahinter auch ist, es kann aus verwürfeltem Text nur raten. Docling versteht zuerst den Seitenaufbau und gibt dann sauberes Markdown oder JSON aus. Auf GitHub hat das Projekt über 60.000 Sterne gesammelt und gehört zu den meistbeachteten Open-Source-Projekten der Dokumentenanalyse.
Angaben zum offiziellen Repository
Die Plattform ist GitHub, die Organisation heißt docling-project, das Projekt docling. Es begann bei einem Team von IBM Research in Zürich, liegt heute unter der LF AI & Data Foundation und steht unter der MIT-Lizenz. Die Bibliothek ist in Python geschrieben, verlangt Python 3.10 oder neuer, lässt sich mit einem einzigen pip-Befehl installieren und bringt eine Kommandozeile sowie fertige Anbindungen an gängige Frameworks für Dokumentenfragen mit.
Seine Stärken, und warum es sich verbreitete
Erstens das Layoutverständnis: Eigene Layoutmodelle bestimmen Leserichtung, Überschriftenebenen, Absätze, Listen, Codeblöcke und Formeln, und ein Tabellenmodell baut Zeilen und Spalten wieder auf, statt Zellen nach Koordinaten zusammenzukleben. Zweitens die Formatbreite: PDF, DOCX, PPTX, XLSX, HTML, Bilder und sogar Audio werden in eine einzige interne Dokumentstruktur überführt und einheitlich als Markdown, HTML oder JSON ausgegeben; der Code dahinter sieht nur noch ein Format. Drittens der Weg für Scans: Die eingebaute OCR verarbeitet gescannte PDFs, genau die Sorte, die in Firmenarchiven am häufigsten ist und einfache Parser am ehesten stürzen lässt. Zusammen sitzt das exakt am Eingang einer Pipeline für Retrieval-Augmented Generation: Vor dem Zerteilen werden Dokumente zu strukturierten Daten, und Suche wie Antwortqualität profitieren dahinter.
Einsatzkosten, drei Rechnungen
Installieren ist billig; teuer wird der Lauf, weil Layout- und Tabellenmodelle geladen werden müssen. Der erste Start lädt Modellgewichte herunter. Ein normaler Laptop schafft kleine Mengen gut, aber erwarten Sie nicht das Tempo reiner Textextraktion: Komplexe PDFs mit Tabellen und Abbildungen kosten pro Seite. Für Stapelverarbeitung in Produktion braucht es meist eine GPU-Maschine oder einen eigenen Analysedienst; große Scanmengen über die CPU zu zwingen baut eine sehr sichtbare Warteschlange. Die dritte Rechnung ist die Integration: Die Ausgabe ist ein strukturiertes Dokument, kein fertiges Frage-Antwort-Produkt. Vom DoclingDocument bis zu Zerteilung, Vektorisierung und Ablage bleibt Verdrahtung zu leisten, die seine Konnektoren zu gängigen Frameworks verkürzen.
Die echten Fallen, die auf der Startseite fehlen
Komplexe Tabellen gelingen weiterhin nicht immer: seitenübergreifende Tabellen, Finanzblätter voller verbundener Zellen und rahmenlose Tabellen können falsch herauskommen, darum brauchen wichtige Geschäftsdokumente eine stichprobenartige menschliche Kontrolle. Schlechte Scans reichen OCR-Fehler bis ans Ende weiter; Stempel, handschriftliche Notizen und niedrige Auflösung sind die schlimmsten Fälle. Schnelle Veröffentlichungszyklen schneiden in beide Richtungen: Schnittstellen und Standardmodelle ändern sich laufend, Versionsfestlegung und Regressionstests sind keine verzichtbare Disziplin. Und eine Warnung vor Überdimensionierung: Für einfache Dokumente ist das Werkzeug ein Vorschlaghammer. Reines Markdown und saubere, digital erzeugte PDFs bedienen leichtere Tools schneller und billiger.
Für wen es passt, für wen nicht
Es passt zu Teams, die Firmen-Wissensbasen, Dokumentenfragen oder große Literaturpipelines bauen und unter Tabellen und Zweispaltern gelitten haben, sowie zu compliance-sensiblen Umgebungen, in denen Dokumente lokal analysiert werden müssen und das Netz nicht verlassen dürfen. Es passt nicht zu Gelegenheitsnutzern, die ein, zwei einfache Dateien umwandeln; ein Onlinedienst ist bequemer. Es passt auch nicht zu der Erwartung, nach der Installation ein Frage-Antwort-System zu besitzen; Docling läuft nur die erste Etappe der Pipeline. Der direkte Test: die zehn Dateien mit dem schlimmsten Layout durchjagen, und nur wenn Tabellen und Leserichtung bestehen, gehört es in die echte Pipeline.