PDF

PDF numérisé et PDF consultable : quelle est la différence ?

Par Sora Labs · Publié 10 septembre 2026

Un PDF numérisé contient souvent des images de pages plutôt que du texte sélectionnable. Un PDF consultable contient une couche de texte que le logiciel peut rechercher, sélectionner, copier ou indexer. L'OCR peut ajouter du texte reconnu à un PDF numérisé tout en préservant l'image de la page visible, mais les mots reconnus peuvent contenir des erreurs.

PDF numérisés contenant uniquement des images, natifs et consultables

En quoi les trois types de PDF diffèrent
CaractéristiqueNumérisation d'images uniquementPDF numérique natifOCR/analyse consultable
Texte sélectionnableGénéralement aucun.Généralement disponible lorsque le texte est codé de manière accessible.Disponible là où du texte reconnu a été ajouté.
RechercherImpossible de rechercher les mots illustrés sous forme de texte.Recherche généralement le texte stocké.Recherche le texte reconnu, y compris ses erreurs.
ApparenceUne image de page.Texte, vecteurs, images ou un mélange.Souvent la même image de page avec un calque de texte masqué.
ROC requisOui, pour reconnaître les mots illustrés.Généralement pas pour le texte natif lisible.Déjà effectué, même si un mauvais résultat peut nécessiter une autre tentative.
Erreurs de reconnaissancePas encore de couche de reconnaissance.Aucune erreur OCR dans le texte natif ; l'extraction peut encore avoir des problèmes.Possible même lorsque le scan visible semble correct.

Un PDF peut mélanger ces types : un rapport numérique peut inclure une annexe numérisée. Essayez de rechercher un mot visible distinctif et de copier une phrase de plusieurs pages. Un échec de recherche ne constitue pas à lui seul une preuve définitive d’une analyse d’images uniquement ; l'encodage du texte, les autorisations ou une mauvaise couche OCR peuvent également interférer.

Comment fonctionne un calque de texte invisible ?

OCR (reconnaissance optique de caractères) estime les caractères d'une image. Un exportateur PDF peut stocker les mots reconnus de manière invisible tout en laissant la numérisation visible. La recherche utilise ensuite ces mots stockés, et non une nouvelle lecture des pixels. Un bon alignement place les mots cachés sur leurs emplacements d'image correspondants afin que la sélection et la mise en surbrillance semblent naturelles.

Par exemple, un scan montrant visiblement le numéro de facture 1080 peut avoir 1O8O dans sa couche OCR. La recherche du numéro correct peut échouer même si l'image de la page reste inchangée. Copier le numéro dans une feuille de calcul entraîne l’erreur de reconnaissance.

Pourquoi l'OCR fait-il des erreurs ?

  • La basse résolution perd les détails des personnages ; l'agrandissement d'une numérisation floue ne peut pas récupérer les traits manquants.
  • L'inclinaison, le flou de mouvement, les ombres, le bruit et les artefacts de compression rendent les formes de lettres plus difficiles à séparer.
  • Un langage de reconnaissance inapproprié peut produire des mots ou des caractères erronés.
  • L’écriture manuscrite et les polices inhabituelles sont moins prévisibles qu’un texte clair imprimé.
  • Les colonnes, les tableaux, les notes de bas de page et les étiquettes pivotées peuvent perturber l'ordre de lecture, même lorsque des lettres individuelles sont reconnues.

Un PDF consultable n’est pas automatiquement un document bien structuré ou accessible. La reconnaissance des mots ne crée pas nécessairement des titres, des relations entre les tableaux, un ordre de lecture ou des balises de document appropriés. L'OCR ne recrée pas non plus la source Word originale.

À quoi s'attendre de SoraFiles PDF OCR

Le courant Outil d'OCR pour PDF exécute la reconnaissance localement. Il conserve les pages contenant du texte natif lisible détecté et reconnaît les pages numérisées. Choisir la langue appropriée et fournir un scan clair et direct améliore les conditions de reconnaissance ; la précision doit encore être vérifiée.

Ces limites d'exportation sont distinctes de la reconnaissance du texte par le moteur OCR. Un résultat textuel utile peut toujours produire un PDF consultable incomplet. Les pages contenant du texte natif existant ne sont pas soumises à cet encodage de texte ajouté de la même manière, mais elles nécessitent néanmoins une recherche pratique et une vérification de copie.

Vérifiez le résultat avant de vous y fier

  • Recherchez plusieurs mots et chiffres distinctifs sur différentes pages.
  • Copiez un paragraphe dans un éditeur de texte brut pour inspecter les caractères et l'ordre de lecture.
  • Comparez les noms, les dates, les totaux et les identifiants avec l'image originale.
  • Vérifiez séparément les pages avec des colonnes, des tableaux, l'écriture manuscrite et tout changement de langue.
  • Conservez la numérisation originale à côté du résultat OCR afin que le texte incertain puisse être vérifié ultérieurement.

Pour une image de départ plus claire, utilisez Scanner de documents pour ajuster la capture du document. Si vous avez besoin de paragraphes modifiables, comparez PDF vers Word avec le compromis de conversion visuels et modifiables avant de choisir une sortie.

Références

Utiliser l'OCR PDF