OCR

Pourquoi je ne peux pas faire de recherche dans mon PDF scanné ?

Parce qu'un scan est une image, pas du texte. Pour ton appareil, cette page est une photographie ; il n'y a aucun mot à chercher. L'OCR — reconnaissance optique de caractères — analyse l'image, identifie les lettres et ajoute une couche de texte invisible derrière. La page a le même aspect, mais devient consultable et copiable.

De quoi dépend la précision

De la résolution et du contraste, bien plus que du logiciel. 300 ppp est le seuil où l'OCR fonctionne bien ; sous 200, les erreurs se multiplient. Une photo prise de travers avec une ombre donne de moins bons résultats qu'un scan médiocre mais droit.

Redresser la page avant traitement améliore davantage le résultat que changer d'outil.

Là où il échoue systématiquement

L'écriture manuscrite, les polices décoratives, le texte sur fond à motifs et les tableaux très quadrillés. Les documents multilingues aussi : si le moteur est réglé sur une seule langue, les mots de l'autre ressortent mal reconnus.

Les chiffres sont le cas le plus délicat. Un 0 lu comme un O dans un montant ne saute pas aux yeux et change le sens. Pour un document comptable ou juridique, vérifie les chiffres à la main.

Le texte reconnu ne remplace pas l'original

La couche OCR est une aide à la recherche, pas une transcription certifiée. Pour une démarche officielle, ce qui compte est le scan, pas ce qu'un logiciel a cru lire.

PDF Studio – Reader & Tools

Notre app iOS pour exactement ça. Elle tourne sur ton appareil — sans compte et sans suivi.

Voir l'app →