PDF

スキャンされた PDF と検索可能な PDF: 違いは何ですか?

作成者: Sora Labs · 発行済み 2026年9月10日

スキャンされた PDF には、選択可能なテキストではなくページの画像が含まれることがよくあります。検索可能な PDF には、ソフトウェアが検索、選択、コピー、またはインデックスを作成できるテキスト レイヤーが含まれています。 OCR は、表示されているページ画像を維持しながら、認識されたテキストをスキャンした PDF に追加できますが、認識された単語には間違いが含まれる可能性があります。

画像のみ、ネイティブ、検索可能なスキャン PDF

3 種類の PDF の違い
特徴画像のみのスキャンネイティブデジタル PDFOCR/検索可能スキャン
選択可能なテキスト通常は何もありません。通常、テキストがアクセス可能にエンコードされている場合に使用できます。認識されたテキストが追加された場合に使用できます。
検索写真の単語をテキストとして検索することはできません。通常、保存されたテキストを検索します。認識されたテキストをエラーも含めて検索します。
外観ページ画像。テキスト、ベクター、画像、またはそれらの混合。多くの場合、同じページ画像に非表示のテキスト レイヤーが含まれます。
OCRが必要ですはい、絵に描かれた単語を認識するためです。通常、読みやすいネイティブ テキストには適していません。すでに実行されていますが、結果が悪い場合は再度試行する必要がある可能性があります。
認識エラー認識層はまだありません。ネイティブ テキストでは OCR エラーは発生しません。抽出にはまだ問題が発生する可能性があります。目に見えるスキャンが正しく見える場合でも可能です。

PDF にはこれらのタイプを混在させることができます。デジタル レポートには、スキャンした付録が含まれる場合があります。目に見える特徴的な単語を検索し、複数のページから文をコピーしてみてください。検索が失敗しただけでは、画像のみのスキャンの決定的な証拠にはなりません。テキスト エンコーディング、権限、または不十分な OCR レイヤーも干渉する可能性があります。

非表示のテキストレイヤーはどのように機能しますか?

OCR (光学式文字認識) は、画像から文字を推定します。 PDF エクスポーターは、スキャンを表示したままにして、認識した単語を非表示に保存できます。検索では、ピクセルを新たに読み取ったものではなく、それらの保存された単語が使用されます。適切に配置すると、隠された単語が一致する画像の位置の上に配置されるため、選択と強調表示が自然に感じられます。

たとえば、請求書番号 1080 を表示するスキャンでは、OCR レイヤーに 1080 が含まれている可能性があります。ページ画像が変更されていない場合でも、正しい番号の検索に失敗する場合があります。数値をスプレッドシートにコピーすると、認識エラーが発生します。

OCR がミスをするのはなぜですか?

  • 解像度が低いと文字のディテールが失われます。ぼやけたスキャンを拡大しても、失われたストロークを回復することはできません。
  • スキュー、モーションブラー、影、ノイズ、圧縮アーティファクトにより、文字の形状を分離することが困難になります。
  • 認識言語が不適切だと、間違った単語や文字が生成される可能性があります。
  • 手書きや珍しいフォントは、鮮明に印刷されたテキストよりも予測しにくくなります。
  • 列、表、脚注、回転されたラベルは、個々の文字が認識されていても、読み上げ順序を混乱させる可能性があります。

検索可能な PDF は、自動的に適切に構造化され、アクセスしやすい文書になるわけではありません。単語を認識しても、適切な見出し、表の関係、読み上げ順序、文書タグが作成されるとは限りません。 OCR は、元の Word ソースを再作成しません。

SoraFiles PDF OCR に期待できること

現在の PDF OCRツール ローカルで認識を実行します。検出された読み取り可能なネイティブ テキストを含むページを保持し、スキャンされたページを認識します。適切な言語を選択し、明確でまっすぐなスキャンを提供すると、認識条件が向上します。精度はまだ確認が必要です。

これらのエクスポート制限は、OCR エンジンがテキストを認識したかどうかとは別のものです。有用なテキスト結果であっても、不完全な検索可能な PDF が生成される可能性があります。既存のネイティブ テキストを含むページは、同様に追加テキスト エンコーディングの対象にはなりませんが、それでも実際の検索とコピー チェックが必要です。

結果に依存する前に結果を確認してください

  • さまざまなページからいくつかの特徴的な単語や数字を検索します。
  • 段落をプレーンテキストエディタにコピーして、文字と読み上げ順序を検査します。
  • 名前、日付、合計、識別子を元の画像と比較します。
  • 列、表、手書き、および言語の変更が含まれるページを個別に確認します。
  • 不確かなテキストを後で確認できるように、元のスキャンを OCR 結果と一緒に保管してください。

より鮮明な開始イメージを得るには、次を使用します。 ドキュメントスキャナー ドキュメントのキャプチャを調整します。編集可能な段落が必要な場合は、比較してください PDFからWordへ と 視覚的で編集可能な変換のトレードオフ 出力を選択する前に。

参考文献

PDF OCRを使用する