스캔한 PDF에는 선택 가능한 텍스트 대신 페이지 그림이 포함되는 경우가 많습니다. 검색 가능한 PDF에는 소프트웨어가 검색, 선택, 복사 또는 색인을 생성할 수 있는 텍스트 레이어가 포함되어 있습니다. OCR은 보이는 페이지 이미지를 유지하면서 스캔한 PDF에 인식된 텍스트를 추가할 수 있지만 인식된 단어에 실수가 포함될 수 있습니다.
이미지 전용, 기본 및 검색 가능한 스캔 PDF
| 특징 | 이미지만 스캔 | 기본 디지털 PDF | OCR/검색 가능한 스캔 |
|---|---|---|---|
| 선택 가능한 텍스트 | 일반적으로 없음. | 일반적으로 텍스트가 액세스 가능하게 인코딩된 경우 사용할 수 있습니다. | 인식된 텍스트가 추가된 경우 사용할 수 있습니다. |
| 검색 | 그림에 있는 단어를 텍스트로 검색할 수 없습니다. | 일반적으로 저장된 텍스트를 검색합니다. | 오류를 포함하여 인식된 텍스트를 검색합니다. |
| 외관 | 페이지 이미지입니다. | 텍스트, 벡터, 이미지 또는 혼합. | 숨겨진 텍스트 레이어가 있는 동일한 페이지 이미지인 경우가 많습니다. |
| OCR 필요 | 네, 그림에 있는 단어를 인식하기 위해서입니다. | 일반적으로 읽을 수 있는 기본 텍스트에는 적합하지 않습니다. | 이미 수행되었지만 결과가 좋지 않으면 다시 시도해야 할 수도 있습니다. |
| 인식 오류 | 아직 인식 레이어가 없습니다. | 기본 텍스트에는 OCR 오류가 없습니다. 추출에는 여전히 문제가 있을 수 있습니다. | 눈에 보이는 스캔이 정확해 보이는 경우에도 가능합니다. |
PDF에는 이러한 유형이 혼합될 수 있습니다. 디지털 보고서에는 스캔된 부록이 포함될 수 있습니다. 눈에 띄는 눈에 띄는 단어를 검색해 보고 여러 페이지의 문장을 복사해 보세요. 실패한 검색만으로는 이미지 전용 스캔에 대한 확실한 증거가 될 수 없습니다. 텍스트 인코딩, 권한 또는 열악한 OCR 레이어도 방해가 될 수 있습니다.
보이지 않는 텍스트 레이어는 어떻게 작동하나요?
OCR(광학 문자 인식)은 이미지에서 문자를 추정합니다. PDF 내보내기는 인식된 단어를 눈에 보이지 않게 저장할 수 있으며 스캔 내용은 표시됩니다. 그런 다음 검색에서는 픽셀을 새로 읽는 것이 아니라 저장된 단어를 사용합니다. 잘 정렬되면 일치하는 이미지 위치 위에 숨겨진 단어가 배치되므로 선택 및 강조 표시가 자연스럽게 느껴집니다.
예를 들어 송장 번호 1080을 시각적으로 표시하는 스캔의 OCR 레이어에는 1O8O가 있을 수 있습니다. 페이지 이미지가 변경되지 않은 경우에도 올바른 번호를 검색하지 못할 수 있습니다. 번호를 스프레드시트에 복사하면 인식 오류가 발생합니다.
OCR은 왜 실수를 합니까?
- 낮은 해상도는 문자의 디테일을 잃습니다. 흐릿한 스캔을 확대해도 누락된 획을 복구할 수 없습니다.
- 기울어짐, 모션 블러, 그림자, 노이즈 및 압축 아티팩트로 인해 문자 모양을 분리하기가 더 어려워집니다.
- 부적절한 인식 언어는 잘못된 단어나 문자를 생성할 수 있습니다.
- 손글씨와 특이한 글꼴은 선명한 인쇄된 텍스트보다 예측하기 어렵습니다.
- 열, 표, 각주 및 회전된 레이블은 개별 문자를 인식하더라도 읽기 순서를 혼동할 수 있습니다.
검색 가능한 PDF는 자동으로 잘 구조화되었거나 액세스 가능한 문서가 아닙니다. 단어를 인식한다고 해서 반드시 적절한 제목, 표 관계, 읽기 순서 또는 문서 태그가 생성되는 것은 아닙니다. OCR은 또한 원본 Word 소스를 다시 생성하지 않습니다.
SoraFiles PDF OCR에서 기대할 수 있는 것
현재 PDF OCR 도구 로컬에서 인식을 실행합니다. 읽을 수 있는 기본 텍스트가 감지된 페이지를 유지하고 스캔한 페이지를 인식합니다. 적절한 언어를 선택하고 명확하고 직접적인 스캔을 제공하면 인식 조건이 향상됩니다. 정확성은 아직 확인이 필요합니다.
이러한 내보내기 제한은 OCR 엔진이 텍스트를 인식했는지 여부와 별개입니다. 유용한 텍스트 결과가 여전히 불완전한 검색 가능한 PDF를 생성할 수 있습니다. 기존 기본 텍스트가 있는 페이지에는 동일한 방식으로 추가된 텍스트 인코딩이 적용되지 않지만 여전히 실용적인 검색 및 복사 확인이 필요합니다.
의지하기 전에 결과를 확인하세요
- 여러 페이지에서 여러 고유한 단어와 숫자를 검색하세요.
- 문자와 읽기 순서를 검사하려면 단락을 일반 텍스트 편집기에 복사하세요.
- 이름, 날짜, 합계, 식별자를 원본 이미지와 비교합니다.
- 열, 표, 손글씨, 언어 변경 사항이 있는 페이지를 별도로 확인하세요.
- 나중에 불확실한 텍스트를 확인할 수 있도록 원본 스캔을 OCR 결과와 함께 보관하세요.
더 선명한 시작 이미지를 얻으려면 다음을 사용하세요. 문서 스캐너 문서 캡처를 조정합니다. 편집 가능한 단락이 필요한 경우 비교하십시오. PDF를 워드로 와 함께 시각적 및 편집 가능한 전환 장단점 출력을 선택하기 전에
참고자료
- Adobe: 스캔한 문서에서 텍스트 인식 (External link, opens in a new tab)
- Tesseract: 인식 품질 향상 (External link, opens in a new tab)
- Tesseract: 자주 묻는 질문 (External link, opens in a new tab)
- 소라파일: PDF OCR