Dass eine KI-Bilderkennung Text falsch liest, liegt meist nicht daran, dass das Modell zu dumm ist, sondern dass der Bildtyp nicht zur Verarbeitungsweise passt. Bevor du das Modell wechselst, teile deine Bilder in drei Fälle ein — Foto, Screenshot und Scan — und behandle jeden richtig. Die Erkennungsgenauigkeit steigt sofort deutlich.
Fall 1: Fotos (abfotografierte Dokumente, Whiteboards, Speisekarten)
Das häufigste Problem bei Fotos: schief, unscharf, Reflexionen und perspektivische Verzerrung. Bevor du die KI fragst, bereite das Bild auf: Papier gerade hinlegen, mit gutem Licht und ohne Schatten oder Spiegelungen neu aufnehmen; irrelevante Hintergründe wegschneiden und nur den Textbereich behalten; pro Anfrage nur einen Bereich eines Bildes fragen, nicht den ganzen Schreibtisch. Viele „Lesefehler" sind in Wahrheit nur unscharfe Fotos, bei denen die KI raten muss.
Fall 2: Screenshots (Handy-Screenshots, Webseiten, Chatverläufe)
Screenshot-Text ist meist klein und komprimiert. Zoome die Seite vor der Aufnahme auf 100 %, damit die Zeichen möglichst groß sind; quetsche einen langen Screenshot nicht zu einem dünnen Streifen — teile ihn absatzweise auf und frage mehrfach; bei Pop-ups oder Wasserzeichen such lieber die Originalseite, statt dich durchzukämpfen. Denk dran: Die Schärfe des Screenshots bestimmt die Obergrenze der KI-Erkennung.
Fall 3: Scans und PDFs (Verträge, Papers, Berichte)
Solche Bilder haben viel Text, komplexes Layout, zwei Spalten und Tabellen — die KI direkt aufs Bild zu schicken führt leicht zu übersprungenen Zeilen und vermischten Spalten. Sicherer ist es, den Text zuerst mit einem OCR-Tool (z. B. PaddleOCR) zu extrahieren und den Text dann der KI zum Verstehen zu geben. Bilder sind der Flaschenhals der Eingabe; Text ist die Komfortzone der KI.
Anders gefragt, doppelte Genauigkeit
Auch die Frageweise zählt. Statt „Fass dieses Bild zusammen", bitte die KI: „Transkribiere den Text im Bild Zeile für Zeile"; frage danach: „Wie viele Textzeilen sind es insgesamt?", um zu bestätigen, dass sie alles gesehen hat, bevor es ums Verstehen geht. Erst transkribieren, dann fragen — dieser Zwei-Schritte-Ansatz vermeidet viele seltsame Lesefehler.
Grenzen: Diese Fälle nicht erzwingen
Handschrift, künstlerische Schriftarten und dichte Tabellen sind die drei Härtefälle der KI-Bilderkennung. Wundere dich nicht über Fehler und gleiche wichtige Informationen immer mit dem Originalbild ab. Lade außerdem keine vertraulichen Verträge oder Ausweise in Cloud-Modelle hoch — ein falsch gelesenes Zeichen ist ein kleines Problem, ein Datenleck ein großes. Und es gibt die Möglichkeit der Modell-Halluzination — die KI erfindet selbstbewusst Zeichen, die gar nicht im Bild sind. Bei kritischen Informationen wie Beträgen, Daten und Namen also immer Zeichen für Zeichen mit dem Originalbild abgleichen.