Si l'IA lit mal le texte sur les images, ce n'est le plus souvent pas parce que le modèle est stupide, mais parce que le type d'image ne correspond pas à la façon de le traiter. Avant de changer de modèle, répartissez vos images en trois cas — photo, capture d'écran, document scanné — et traitez chacun correctement. La précision de reconnaissance grimpera aussitôt nettement.
Cas 1: Photo (document, tableau blanc, menu photographiés)
Les problèmes les plus fréquents des photos: cadrage penché, flou, reflets et déformation en perspective. Avant d'interroger l'IA, préparez l'image: remettez le papier droit et reprenez la photo avec un bon éclairage, sans ombres ni reflets; recadrez les arrière-plans inutiles pour ne garder que la zone de texte; posez une question par zone d'une seule image, au lieu de lui jeter le bureau entier. Beaucoup de « mauvaises lectures » ne sont en réalité que des photos floues qui forcent l'IA à deviner.
Cas 2: Capture d'écran (capture de téléphone, de page web, de conversation)
Le texte des captures d'écran est souvent petit et compressé. Avant de demander, agrandissez la page à 100 % puis capturez pour que les caractères soient le plus grands possible; n'écrasez pas une longue capture en une fine bande — découpez par paragraphe et interrogez en plusieurs fois; si des pop-ups ou des filigranes masquent le texte, retrouvez la page d'origine plutôt que de forcer. Retenez ceci: la netteté de la capture fixe le plafond de la reconnaissance par l'IA.
Cas 3: Documents scannés et PDF (contrats, articles, rapports)
Ces images contiennent beaucoup de texte, une mise en page complexe, deux colonnes et des tableaux; forcer l'IA à lire l'image directement provoque facilement des lignes sautées et des colonnes mélangées. La méthode la plus sûre consiste à extraire d'abord le texte avec un outil OCR (par exemple PaddleOCR), puis à donner ce texte à l'IA pour la compréhension. L'image est le goulot d'étranglement de l'entrée; le texte est le terrain confortable de l'IA.
Changez de formulation, doublez la précision
La formulation compte aussi. Au lieu de « résume cette image », demandez à l'IA de « transcrire le texte de l'image ligne par ligne »; après la transcription, demandez « combien de lignes de texte y a-t-il au total » pour vérifier qu'elle a tout vu avant de parler du sens. Transcrire d'abord, questionner ensuite — ce processus en deux étapes évite bien des erreurs de lecture étranges.
Limites: ne forcez pas ces cas
L'écriture manuscrite, les polices artistiques et les tableaux denses sont les trois cas difficiles de la reconnaissance d'image par l'IA. Ne soyez pas surpris des erreurs, et vérifiez toujours les informations clés par rapport à l'image d'origine. De plus, ne téléversez jamais de contrats confidentiels ni de pièces d'identité sur un modèle cloud — un caractère mal lu est un petit problème, une fuite de données un gros. Il y a aussi la possibilité d'hallucination du modèle — il peut inventer avec aplomb des caractères absents de l'image. Pour les informations critiques comme les montants, les dates et les noms, vérifiez donc toujours caractère par caractère avec l'image d'origine.