Text aus einem gescannten PDF auslesen
Eine PDF kann auswählbaren Text oder nur Seitenbilder enthalten. Entscheidend ist, welches Ergebnis Sie brauchen.
Lässt sich Text auswählen?
Markieren Sie einen Satz oder suchen Sie ihn im PDF-Viewer. Scans benötigen eventuell OCR; auch auswählbarer Text kann in falscher Reihenfolge kopiert werden.
Text, durchsuchbare PDF oder Tabelle?
OCR liefert bearbeitbaren Text; eine durchsuchbare PDF macht Scans durchsuchbar. Tabellen lassen sich als CSV oder XLSX extrahieren. Gescannte Tabellen und verbundene Zellen werden nicht automatisch rekonstruiert.
Warum stehen im TXT Buchstaben und Zahlen?
Base64 stellt Bilddaten dar und erkennt keine Wörter. Nutzen Sie dafür OCR und prüfen Sie Namen, Daten und Beträge. Beim ersten Start werden Erkennungsmodul und Sprachdateien heruntergeladen.