Le PDF paraît parfaitement lisible. Cela ne garantit pas que l’outil a reçu le même texte : une page numérisée peut être une image, et un tableau perdre ses relations lors de l’extraction.
Examinez une page représentative
Essayez de sélectionner ou de rechercher une expression distinctive. Si elle reste introuvable, une reconnaissance optique de caractères, ou OCR, peut être nécessaire. C’est un indice, pas un diagnostic complet : un PDF peut mélanger texte, images et couches de reconnaissance imparfaites.
Adobe explique comment obtenir du texte à partir d’un scan. Les petits caractères et les zones dégradées méritent ensuite une comparaison avec l’image de la page.
Testez d’abord la difficulté
Choisissez une page comportant ce dont vous avez besoin : tableau, note ou texte sur deux colonnes. Demandez un renseignement précis avec sa page, puis comparez vous-même.
Dans un tableau, contrôlez la ligne, l’en-tête de colonne, l’unité et les notes. Un chiffre correctement lu dans la mauvaise colonne donne tout de même une mauvaise réponse. Une explication fluide n’y change rien.
Gardez les preuves accessibles
Demandez des références de page et de courts passages justificatifs, puis ouvrez-les. Si une valeur influence une décision, recopiez-la directement dans la source après vérification. Une meilleure extraction réduit un type d’erreur ; elle ne garantit pas la justesse de l’interprétation de l’outil.