Un PDF escaneado suele contener imágenes de páginas en lugar de texto seleccionable. Un PDF con capacidad de búsqueda contiene una capa de texto que el software puede buscar, seleccionar, copiar o indexar. OCR puede agregar texto reconocido a un PDF escaneado mientras conserva la imagen de la página visible, pero las palabras reconocidas pueden contener errores.
Archivos PDF escaneados con solo imágenes, nativos y con capacidad de búsqueda
| Característica | Escaneo de solo imagen | PDF digital nativo | OCR/escaneo con capacidad de búsqueda |
|---|---|---|---|
| Texto seleccionable | Generalmente ninguno. | Generalmente está disponible cuando el texto está codificado de manera accesible. | Disponible donde se agregó texto reconocido. |
| Buscar | No se pueden buscar las palabras ilustradas como texto. | Generalmente busca texto almacenado. | Busca el texto reconocido, incluidos sus errores. |
| Apariencia | Una imagen de página. | Texto, vectores, imágenes o una mezcla. | A menudo, la misma imagen de página con una capa de texto oculta. |
| Se requiere OCR | Sí, para reconocer las palabras representadas. | Por lo general, no es para texto nativo legible. | Ya se ha realizado, aunque un mal resultado puede requerir otro intento. |
| Errores de reconocimiento | Aún no hay capa de reconocimiento. | Sin errores de OCR en texto nativo; La extracción aún puede tener problemas. | Posible incluso cuando el escaneo visible parece correcto. |
Un PDF puede combinar estos tipos: un informe digital puede incluir un apéndice escaneado. Intente buscar una palabra visible distintiva y copiar una oración de varias páginas. Una búsqueda fallida por sí sola no es una prueba definitiva de un escaneo de sólo imágenes; La codificación de texto, los permisos o una capa de OCR deficiente también pueden interferir.
¿Cómo funciona una capa de texto invisible?
OCR (reconocimiento óptico de caracteres) estima los caracteres de una imagen. Un exportador de PDF puede almacenar las palabras reconocidas de forma invisible mientras deja visible el escaneo. Luego, la búsqueda utiliza esas palabras almacenadas, no una nueva lectura de los píxeles. Una buena alineación coloca las palabras ocultas sobre las ubicaciones de las imágenes correspondientes para que la selección y el resaltado se sientan naturales.
Por ejemplo, un escaneo que muestre visiblemente el número de factura 1080 podría tener 1O8O en su capa OCR. La búsqueda del número correcto puede fallar aunque la imagen de la página no haya cambiado. Copiar el número en una hoja de cálculo conlleva el error de reconocimiento.
¿Por qué el OCR comete errores?
- La baja resolución pierde detalles de los personajes; ampliar un escaneo borroso no puede recuperar los trazos faltantes.
- La inclinación, el desenfoque de movimiento, las sombras, el ruido y los artefactos de compresión hacen que las formas de las letras sean más difíciles de separar.
- Un lenguaje de reconocimiento inadecuado puede producir palabras o caracteres incorrectos.
- La escritura a mano y las fuentes inusuales son menos predecibles que el texto impreso claro.
- Las columnas, tablas, notas al pie y etiquetas rotadas pueden confundir el orden de lectura incluso cuando se reconocen letras individuales.
Un PDF con capacidad de búsqueda no es automáticamente un documento bien estructurado o accesible. Reconocer palabras no necesariamente crea títulos, relaciones de tablas, orden de lectura o etiquetas de documentos adecuados. OCR tampoco recrea la fuente original de Word.
Qué esperar de SoraFiles PDF OCR
la corriente Herramienta de OCR de PDF ejecuta el reconocimiento localmente. Mantiene páginas con texto nativo legible detectado y reconoce páginas escaneadas. Elegir el lenguaje apropiado y proporcionar un escaneo claro y directo mejora las condiciones de reconocimiento; La precisión aún necesita ser comprobada.
Estos límites de exportación son independientes de si el motor de OCR reconoció el texto. Un resultado de texto útil aún puede producir un PDF con capacidad de búsqueda incompleto. Las páginas con texto nativo existente no están sujetas a esa codificación de texto agregado de la misma manera, pero aún así necesitan una búsqueda práctica y una verificación de copia.
Comprueba el resultado antes de confiar en él.
- Busque varias palabras y números distintivos de diferentes páginas.
- Copie un párrafo en un editor de texto sin formato para inspeccionar los caracteres y el orden de lectura.
- Compare nombres, fechas, totales e identificadores con la imagen original.
- Consulte las páginas con columnas, tablas, escritura a mano y cualquier cambio de idioma por separado.
- Guarde el escaneo original junto con el resultado del OCR para poder verificar el texto incierto más adelante.
Para obtener una imagen inicial más clara, utilice Escáner de documentos para ajustar la captura del documento. Si necesita párrafos editables, compare PDF a Word con el compensaciones de conversión visuales y editables antes de elegir una salida.
Referencias
- Adobe: reconocer texto en documentos escaneados (External link, opens in a new tab)
- Tesseract: mejorando la calidad del reconocimiento (External link, opens in a new tab)
- Teseracto: Preguntas frecuentes (External link, opens in a new tab)
- SoraFiles: PDF OCR