OCR

¿Por qué no puedo buscar dentro de mi PDF escaneado?

Porque un escaneo es una imagen, no texto. Para tu dispositivo esa página es una fotografía; no hay palabras que buscar. El OCR — reconocimiento óptico de caracteres — analiza la imagen, identifica las letras y añade una capa de texto invisible detrás. La página se ve igual, pero ya se puede buscar y copiar.

De qué depende la precisión

De la resolución y del contraste, mucho más que del programa. 300 ppp es el punto donde el OCR funciona bien; por debajo de 200 los errores se multiplican. Una foto tomada con el teléfono en diagonal y con sombra da peores resultados que un escaneo mediocre pero recto.

Enderezar la página antes de procesarla mejora el resultado más que cambiar de herramienta.

Dónde falla siempre

Escritura a mano, tipografías decorativas, texto sobre fondos con dibujos y tablas con muchas líneas. También los documentos en varios idiomas: si el motor está configurado en un solo idioma, las palabras del otro salen mal reconocidas.

Los números son el caso más delicado. Un 0 leído como O en un importe no salta a la vista y sí cambia el sentido. Si el documento es contable o legal, verifica las cifras a mano.

El texto reconocido no reemplaza al original

La capa de OCR es una ayuda de búsqueda, no una transcripción certificada. Para trámites oficiales lo que vale es el escaneo, no el texto que un programa creyó leer.

PDF Studio – Reader & Tools

Nuestra app de iOS para justo esto. Funciona en tu dispositivo: sin cuenta y sin seguimiento.

Ver la app →