Warum kann ich in meinem gescannten PDF nicht suchen?
Wovon die Genauigkeit abhängt
Von Auflösung und Kontrast — viel mehr als vom Programm. 300 dpi ist der Punkt, ab dem OCR gut funktioniert; unter 200 dpi vervielfachen sich die Fehler. Ein schräg mit Schatten abfotografiertes Blatt liefert schlechtere Ergebnisse als ein mittelmäßiger, aber gerader Scan.
Die Seite vor der Verarbeitung geradezurücken bringt mehr als ein Werkzeugwechsel.
Wo es zuverlässig scheitert
Handschrift, Zierschriften, Text auf gemusterten Hintergründen und Tabellen mit vielen Linien. Auch mehrsprachige Dokumente: ist die Erkennung auf eine Sprache eingestellt, kommen die Wörter der anderen fehlerhaft heraus.
Am heikelsten sind Zahlen. Eine als O gelesene 0 in einem Betrag fällt nicht auf und ändert die Bedeutung. Bei buchhalterischen oder juristischen Dokumenten die Zahlen von Hand prüfen.
Der erkannte Text ersetzt nicht das Original
Die OCR-Ebene ist eine Suchhilfe, keine beglaubigte Abschrift. Für Behörden zählt der Scan — nicht das, was ein Programm zu lesen glaubte.
Unsere iOS-App genau dafür. Läuft auf deinem Gerät — kein Konto, kein Tracking.