Ein gescanntes PDF enthält häufig Bilder von Seiten anstelle von auswählbarem Text. Eine durchsuchbare PDF-Datei enthält eine Textebene, die von der Software durchsucht, ausgewählt, kopiert oder indiziert werden kann. OCR kann erkannten Text zu einem gescannten PDF hinzufügen und dabei das sichtbare Seitenbild beibehalten, die erkannten Wörter können jedoch Fehler enthalten.
Nur Bild-, native und durchsuchbare gescannte PDFs
| Funktion | Nur-Bild-Scan | Natives digitales PDF | OCR/durchsuchbarer Scan |
|---|---|---|---|
| Wählbarer Text | Normalerweise keine. | Normalerweise verfügbar, wenn Text barrierefrei codiert ist. | Verfügbar, wo erkannter Text hinzugefügt wurde. |
| Suchen | Die abgebildeten Wörter können nicht als Text durchsucht werden. | Durchsucht normalerweise gespeicherten Text. | Durchsucht den erkannten Text, einschließlich seiner Fehler. |
| Aussehen | Ein Seitenbild. | Text, Vektoren, Bilder oder eine Mischung. | Oft das gleiche Seitenbild mit einer versteckten Textebene. |
| OCR erforderlich | Ja, um die abgebildeten Wörter zu erkennen. | Normalerweise nicht für lesbaren nativen Text. | Bereits durchgeführt, obwohl ein schlechtes Ergebnis möglicherweise einen weiteren Versuch erfordert. |
| Erkennungsfehler | Noch keine Erkennungsschicht. | Keine OCR-Fehler im nativen Text; Bei der Extraktion kann es immer noch zu Problemen kommen. | Möglich, auch wenn der sichtbare Scan korrekt aussieht. |
Ein PDF kann diese Typen vermischen: Ein digitaler Bericht kann einen gescannten Anhang enthalten. Versuchen Sie, nach einem markanten sichtbaren Wort zu suchen und einen Satz von mehreren Seiten zu kopieren. Eine fehlgeschlagene Suche allein ist kein endgültiger Beweis für einen Nur-Bild-Scan; Textkodierung, Berechtigungen oder eine schlechte OCR-Ebene können ebenfalls störend sein.
Wie funktioniert eine unsichtbare Textebene?
OCR – optische Zeichenerkennung – schätzt Zeichen aus einem Bild. Ein PDF-Exporter kann die erkannten Wörter unsichtbar speichern, während der Scan sichtbar bleibt. Die Suche verwendet dann diese gespeicherten Wörter und nicht ein neues Lesen der Pixel. Durch eine gute Ausrichtung werden die verborgenen Wörter über den passenden Bildpositionen platziert, sodass sich Auswahl und Hervorhebung natürlich anfühlen.
Beispielsweise könnte ein Scan, der die Rechnungsnummer 1080 sichtbar zeigt, 1O8O in seiner OCR-Ebene enthalten. Die Suche nach der richtigen Nummer kann fehlschlagen, obwohl das Seitenbild unverändert ist. Das Kopieren der Nummer in eine Tabellenkalkulation führt zu einem Erkennungsfehler.
Warum macht OCR Fehler?
- Bei niedriger Auflösung gehen Zeichendetails verloren. Das Vergrößern eines verschwommenen Scans kann die fehlenden Striche nicht wiederherstellen.
- Schräge, Bewegungsunschärfe, Schatten, Rauschen und Komprimierungsartefakte erschweren die Trennung von Buchstabenformen.
- Eine ungeeignete Erkennungssprache kann die falschen Wörter oder Zeichen erzeugen.
- Handschrift und ungewöhnliche Schriftarten sind weniger vorhersehbar als klarer gedruckter Text.
- Spalten, Tabellen, Fußnoten und gedrehte Beschriftungen können die Lesereihenfolge verwirren, selbst wenn einzelne Buchstaben erkannt werden.
Ein durchsuchbares PDF ist nicht automatisch ein gut strukturiertes oder zugängliches Dokument. Das Erkennen von Wörtern führt nicht unbedingt zu korrekten Überschriften, Tabellenbeziehungen, Lesereihenfolge oder Dokument-Tags. OCR stellt auch nicht die ursprüngliche Word-Quelle wieder her.
Was Sie von SoraFiles PDF OCR erwarten können
Der Strom PDF-OCR-Tool führt die Erkennung lokal aus. Es speichert Seiten mit erkanntem lesbarem nativen Text und erkennt gescannte Seiten. Die Wahl der richtigen Sprache und die Bereitstellung einer klaren, klaren Sprache verbessern die Voraussetzungen für die Erkennung; Die Genauigkeit muss noch überprüft werden.
Diese Exportbeschränkungen gelten unabhängig davon, ob die OCR-Engine den Text erkannt hat. Ein nützliches Textergebnis kann immer noch zu einer unvollständigen durchsuchbaren PDF-Datei führen. Seiten mit vorhandenem nativem Text unterliegen nicht in gleicher Weise dieser Add-Text-Kodierung, benötigen aber dennoch eine praktische Such- und Kopierprüfung.
Überprüfen Sie das Ergebnis, bevor Sie sich darauf verlassen
- Suchen Sie auf verschiedenen Seiten nach mehreren eindeutigen Wörtern und Zahlen.
- Kopieren Sie einen Absatz in einen Nur-Text-Editor, um die Zeichen und die Lesereihenfolge zu überprüfen.
- Vergleichen Sie Namen, Daten, Summen und Kennungen mit dem Originalbild.
- Überprüfen Sie Seiten mit Spalten, Tabellen, Handschrift und eventuellen Sprachänderungen separat.
- Bewahren Sie den Originalscan neben dem OCR-Ergebnis auf, damit unsicherer Text später überprüft werden kann.
Für ein klareres Startbild verwenden Sie Dokumentenscanner um die Dokumentenerfassung anzupassen. Wenn Sie bearbeitbare Absätze benötigen, vergleichen Sie PDF zu Word mit dem visuelle und bearbeitbare Konvertierungskompromisse bevor Sie einen Ausgang auswählen.
Referenzen
- Adobe: Text in gescannten Dokumenten erkennen (External link, opens in a new tab)
- Tesseract: Verbesserung der Erkennungsqualität (External link, opens in a new tab)
- Tesseract: Häufig gestellte Fragen (External link, opens in a new tab)
- SoraFiles: PDF OCR