OCR

Por que não consigo pesquisar dentro do meu PDF digitalizado?

Porque uma digitalização é imagem, não texto. Pro seu aparelho aquela página é uma fotografia; não existem palavras pra procurar. O OCR — reconhecimento óptico de caracteres — analisa a imagem, identifica as letras e coloca uma camada de texto invisível atrás. A página fica igual, mas passa a ser pesquisável e copiável.

Do que depende a precisão

Da resolução e do contraste, muito mais do que do programa. 300 dpi é o ponto em que o OCR funciona bem; abaixo de 200 os erros se multiplicam. Uma foto tirada torta e com sombra dá resultado pior que uma digitalização mediana, porém reta.

Endireitar a página antes de processar melhora mais o resultado do que trocar de ferramenta.

Onde ele sempre falha

Letra à mão, fontes decorativas, texto sobre fundo estampado e tabelas cheias de linhas. Documentos em mais de um idioma também: se o motor está configurado num idioma só, as palavras do outro saem erradas.

Números são o caso mais delicado. Um 0 lido como O num valor não salta aos olhos e muda o sentido. Se o documento é contábil ou jurídico, confira os números na mão.

O texto reconhecido não substitui o original

A camada de OCR é ajuda de busca, não transcrição com fé pública. Pra qualquer trâmite oficial vale a digitalização, não o que um programa achou que leu.

PDF Studio – Reader & Tools

Nosso app de iOS exatamente pra isso. Roda no seu aparelho — sem conta e sem rastreamento.

Ver o app →