スキャンされた PDF には、選択可能なテキストではなくページの画像が含まれることがよくあります。検索可能な PDF には、ソフトウェアが検索、選択、コピー、またはインデックスを作成できるテキスト レイヤーが含まれています。 OCR は、表示されているページ画像を維持しながら、認識されたテキストをスキャンした PDF に追加できますが、認識された単語には間違いが含まれる可能性があります。
画像のみ、ネイティブ、検索可能なスキャン PDF
| 特徴 | 画像のみのスキャン | ネイティブデジタル PDF | OCR/検索可能スキャン |
|---|---|---|---|
| 選択可能なテキスト | 通常は何もありません。 | 通常、テキストがアクセス可能にエンコードされている場合に使用できます。 | 認識されたテキストが追加された場合に使用できます。 |
| 検索 | 写真の単語をテキストとして検索することはできません。 | 通常、保存されたテキストを検索します。 | 認識されたテキストをエラーも含めて検索します。 |
| 外観 | ページ画像。 | テキスト、ベクター、画像、またはそれらの混合。 | 多くの場合、同じページ画像に非表示のテキスト レイヤーが含まれます。 |
| OCRが必要です | はい、絵に描かれた単語を認識するためです。 | 通常、読みやすいネイティブ テキストには適していません。 | すでに実行されていますが、結果が悪い場合は再度試行する必要がある可能性があります。 |
| 認識エラー | 認識層はまだありません。 | ネイティブ テキストでは OCR エラーは発生しません。抽出にはまだ問題が発生する可能性があります。 | 目に見えるスキャンが正しく見える場合でも可能です。 |
PDF にはこれらのタイプを混在させることができます。デジタル レポートには、スキャンした付録が含まれる場合があります。目に見える特徴的な単語を検索し、複数のページから文をコピーしてみてください。検索が失敗しただけでは、画像のみのスキャンの決定的な証拠にはなりません。テキスト エンコーディング、権限、または不十分な OCR レイヤーも干渉する可能性があります。
非表示のテキストレイヤーはどのように機能しますか?
OCR (光学式文字認識) は、画像から文字を推定します。 PDF エクスポーターは、スキャンを表示したままにして、認識した単語を非表示に保存できます。検索では、ピクセルを新たに読み取ったものではなく、それらの保存された単語が使用されます。適切に配置すると、隠された単語が一致する画像の位置の上に配置されるため、選択と強調表示が自然に感じられます。
たとえば、請求書番号 1080 を表示するスキャンでは、OCR レイヤーに 1080 が含まれている可能性があります。ページ画像が変更されていない場合でも、正しい番号の検索に失敗する場合があります。数値をスプレッドシートにコピーすると、認識エラーが発生します。
OCR がミスをするのはなぜですか?
- 解像度が低いと文字のディテールが失われます。ぼやけたスキャンを拡大しても、失われたストロークを回復することはできません。
- スキュー、モーションブラー、影、ノイズ、圧縮アーティファクトにより、文字の形状を分離することが困難になります。
- 認識言語が不適切だと、間違った単語や文字が生成される可能性があります。
- 手書きや珍しいフォントは、鮮明に印刷されたテキストよりも予測しにくくなります。
- 列、表、脚注、回転されたラベルは、個々の文字が認識されていても、読み上げ順序を混乱させる可能性があります。
検索可能な PDF は、自動的に適切に構造化され、アクセスしやすい文書になるわけではありません。単語を認識しても、適切な見出し、表の関係、読み上げ順序、文書タグが作成されるとは限りません。 OCR は、元の Word ソースを再作成しません。
SoraFiles PDF OCR に期待できること
現在の PDF OCRツール ローカルで認識を実行します。検出された読み取り可能なネイティブ テキストを含むページを保持し、スキャンされたページを認識します。適切な言語を選択し、明確でまっすぐなスキャンを提供すると、認識条件が向上します。精度はまだ確認が必要です。
これらのエクスポート制限は、OCR エンジンがテキストを認識したかどうかとは別のものです。有用なテキスト結果であっても、不完全な検索可能な PDF が生成される可能性があります。既存のネイティブ テキストを含むページは、同様に追加テキスト エンコーディングの対象にはなりませんが、それでも実際の検索とコピー チェックが必要です。
結果に依存する前に結果を確認してください
- さまざまなページからいくつかの特徴的な単語や数字を検索します。
- 段落をプレーンテキストエディタにコピーして、文字と読み上げ順序を検査します。
- 名前、日付、合計、識別子を元の画像と比較します。
- 列、表、手書き、および言語の変更が含まれるページを個別に確認します。
- 不確かなテキストを後で確認できるように、元のスキャンを OCR 結果と一緒に保管してください。
より鮮明な開始イメージを得るには、次を使用します。 ドキュメントスキャナー ドキュメントのキャプチャを調整します。編集可能な段落が必要な場合は、比較してください PDFからWordへ と 視覚的で編集可能な変換のトレードオフ 出力を選択する前に。
参考文献
- Adobe: スキャンした文書内のテキストを認識する (External link, opens in a new tab)
- Tesseract: 認識品質の向上 (External link, opens in a new tab)
- Tesseract: よくある質問 (External link, opens in a new tab)
- SoraFiles: PDF OCR