Отсканированный PDF-файл часто содержит изображения страниц, а не текст, который можно выделить. PDF-файл с возможностью поиска содержит текстовый слой, который программное обеспечение может искать, выбирать, копировать или индексировать. OCR может добавить распознанный текст в отсканированный PDF-файл, сохраняя при этом видимое изображение страницы, но распознанные слова могут содержать ошибки.
Отсканированные PDF-файлы только с изображениями, в собственном коде и с возможностью поиска.
| Особенность | Сканирование только изображений | Собственный цифровой PDF-файл | OCR/сканирование с возможностью поиска |
|---|---|---|---|
| Выбираемый текст | Обычно нет. | Обычно доступен, когда текст доступен для кодирования. | Доступно там, где был добавлен распознанный текст. |
| Поиск | Невозможно найти слова с изображениями в виде текста. | Обычно ищет сохраненный текст. | Ищет распознанный текст, включая его ошибки. |
| Внешний вид | Изображение страницы. | Текст, векторы, изображения или смесь. | Часто одно и то же изображение страницы со скрытым текстовым слоем. |
| Требуется распознавание текста | Да, распознавать слова на картинках. | Обычно не для читаемого собственного текста. | Уже выполнено, хотя при плохом результате может потребоваться еще одна попытка. |
| Ошибки распознавания | Слоя распознавания пока нет. | Отсутствие ошибок оптического распознавания текста в исходном тексте; при извлечении все еще могут возникнуть проблемы. | Возможно, даже если видимый скан выглядит правильно. |
PDF-файл может сочетать эти типы: цифровой отчет может включать отсканированное приложение. Попробуйте найти отличительное видимое слово и скопировать предложение с нескольких страниц. Сам по себе неудачный поиск не является окончательным доказательством сканирования только изображения; кодировка текста, разрешения или плохой уровень распознавания также могут мешать.
Как работает невидимый текстовый слой?
OCR — оптическое распознавание символов — оценивает символы на изображении. Программа экспорта PDF может незаметно сохранять распознанные слова, оставляя отсканированные изображения видимыми. Затем поиск использует эти сохраненные слова, а не новое считывание пикселей. Хорошее выравнивание помещает скрытые слова в соответствующие места на изображении, поэтому выделение и выделение кажутся естественными.
Например, скан, на котором явно виден номер счета-фактуры 1080, может иметь 1O8O в слое OCR. Поиск правильного номера может оказаться неудачным, даже если изображение страницы не изменилось. Копирование числа в электронную таблицу влечет за собой ошибку распознавания.
Почему OCR допускает ошибки?
- При низком разрешении теряется детализация персонажей; увеличение размытого сканирования не может восстановить недостающие штрихи.
- Перекос, размытие в движении, тени, шум и артефакты сжатия затрудняют разделение форм букв.
- Неподходящий язык распознавания может создавать неправильные слова или символы.
- Почерк и необычные шрифты менее предсказуемы, чем четкий печатный текст.
- Столбцы, таблицы, сноски и повернутые метки могут сбить с толку порядок чтения, даже если отдельные буквы распознаются.
PDF-файл с возможностью поиска автоматически не является хорошо структурированным или доступным документом. Распознавание слов не обязательно приводит к созданию правильных заголовков, связей между таблицами, порядка чтения или тегов документа. OCR также не воссоздает исходный источник Word.
Чего ожидать от SoraFiles PDF OCR
Текущий Инструмент распознавания PDF-файлов выполняет распознавание локально. Он сохраняет страницы с обнаруженным читаемым собственным текстом и распознает отсканированные страницы. Выбор подходящего языка и обеспечение четкого и прямого сканирования улучшают условия распознавания; точность еще нуждается в проверке.
Эти ограничения экспорта не зависят от того, распознал ли текст механизм OCR. Полезный текстовый результат все равно может создать неполный PDF-файл с возможностью поиска. Страницы с существующим собственным текстом не подвергаются такому же кодированию добавленного текста, но они все равно нуждаются в практическом поиске и проверке копирования.
Проверьте результат, прежде чем полагаться на него
- Найдите несколько отличительных слов и цифр на разных страницах.
- Скопируйте абзац в текстовый редактор, чтобы проверить символы и порядок чтения.
- Сравните имена, даты, итоговые значения и идентификаторы с исходным изображением.
- Отдельно проверяйте страницы со столбцами, таблицами, почерком и изменениями языка.
- Сохраняйте исходное сканирование вместе с результатом оптического распознавания символов, чтобы позже можно было проверить неопределенный текст.
Для более четкого начального изображения используйте Сканер документов настроить захват документа. Если вам нужны редактируемые абзацы, сравните PDF в Word с визуальные и редактируемые компромиссы по конверсии перед выбором выхода.
Ссылки
- Adobe: распознавание текста в отсканированных документах (External link, opens in a new tab)
- Тессеракт: улучшение качества распознавания (External link, opens in a new tab)
- Тессеракт: Часто задаваемые вопросы (External link, opens in a new tab)
- SoraFiles: PDF OCR