PDF

PDF được quét và PDF có thể tìm kiếm: Sự khác biệt là gì?

Bởi phòng thí nghiệm Sora · Đã xuất bản 10 tháng 9, 2026

Tệp PDF được quét thường chứa hình ảnh của các trang thay vì văn bản có thể chọn. Tệp PDF có thể tìm kiếm chứa một lớp văn bản mà phần mềm có thể tìm kiếm, chọn, sao chép hoặc lập chỉ mục. OCR có thể thêm văn bản được nhận dạng vào bản PDF được quét trong khi vẫn giữ hình ảnh trang hiển thị nhưng các từ được nhận dạng có thể có lỗi.

Các tệp PDF được quét chỉ có hình ảnh, gốc và có thể tìm kiếm

Ba loại PDF khác nhau như thế nào
tính năngQuét chỉ hình ảnhPDF kỹ thuật số gốcOCR/quét có thể tìm kiếm
Văn bản có thể lựa chọnThường thì không.Thường có sẵn khi văn bản được mã hóa có thể truy cập được.Có sẵn ở nơi văn bản được nhận dạng đã được thêm vào.
Tìm kiếmKhông thể tìm kiếm các từ trong hình dưới dạng văn bản.Thường tìm kiếm văn bản được lưu trữ.Tìm kiếm văn bản được nhận dạng, bao gồm cả lỗi của nó.
Ngoại hìnhMột hình ảnh trang.Văn bản, vectơ, hình ảnh hoặc hỗn hợp.Thường thì cùng một hình ảnh trang có một lớp văn bản ẩn.
Yêu cầu OCRVâng, để nhận ra các từ trong hình.Thông thường không dành cho văn bản gốc có thể đọc được.Đã được thực hiện, mặc dù kết quả kém có thể cần một nỗ lực khác.
Lỗi nhận dạngChưa có lớp nhận dạng nào.Không có lỗi OCR trong văn bản gốc; việc khai thác vẫn có thể gặp vấn đề.Có thể ngay cả khi quá trình quét hiển thị có vẻ chính xác.

Tệp PDF có thể kết hợp các loại này: báo cáo kỹ thuật số có thể bao gồm phụ lục được quét. Hãy thử tìm kiếm một từ có thể nhìn thấy rõ ràng và sao chép một câu từ nhiều trang. Chỉ tìm kiếm thất bại không phải là bằng chứng chắc chắn về việc quét chỉ có hình ảnh; mã hóa văn bản, quyền hoặc lớp OCR kém cũng có thể gây trở ngại.

Lớp văn bản vô hình hoạt động như thế nào?

OCR—nhận dạng ký tự quang học—ước tính các ký tự từ một hình ảnh. Trình xuất PDF có thể lưu trữ các từ được nhận dạng một cách ẩn trong khi vẫn hiển thị bản quét. Sau đó, tìm kiếm sẽ sử dụng những từ được lưu trữ đó chứ không phải cách đọc pixel mới. Căn chỉnh tốt sẽ đặt các từ ẩn lên vị trí hình ảnh phù hợp của chúng để việc lựa chọn và làm nổi bật mang lại cảm giác tự nhiên.

Ví dụ: bản quét hiển thị rõ ràng số hóa đơn 1080 có thể có 1O8O trong lớp OCR của nó. Việc tìm kiếm số chính xác có thể không thành công ngay cả khi hình ảnh trang không thay đổi. Việc sao chép số vào bảng tính sẽ gây ra lỗi nhận dạng.

Tại sao OCR lại mắc lỗi?

  • Độ phân giải thấp làm mất chi tiết ký tự; phóng to bản quét bị mờ không thể phục hồi các nét bị thiếu.
  • Các hiện tượng nghiêng, mờ chuyển động, bóng, nhiễu và nén làm cho hình dạng chữ cái khó phân tách hơn.
  • Ngôn ngữ nhận dạng không phù hợp có thể tạo ra các từ hoặc ký tự sai.
  • Chữ viết tay và phông chữ khác thường khó dự đoán hơn văn bản in rõ ràng.
  • Cột, bảng, chú thích cuối trang và nhãn bị xoay có thể gây nhầm lẫn thứ tự đọc ngay cả khi nhận dạng được từng chữ cái.

Một tệp PDF có thể tìm kiếm tự động không phải là một tài liệu có cấu trúc tốt hoặc có thể truy cập được. Việc nhận dạng các từ không nhất thiết phải tạo ra các tiêu đề, mối quan hệ bảng, thứ tự đọc hoặc thẻ tài liệu phù hợp. OCR cũng không tạo lại nguồn Word gốc.

Những gì mong đợi từ SoraFiles PDF OCR

hiện tại Công cụ PDF OCR chạy nhận dạng cục bộ. Nó giữ các trang có văn bản gốc có thể đọc được được phát hiện và nhận dạng các trang được quét. Việc chọn ngôn ngữ thích hợp và cung cấp bản quét rõ ràng, thẳng thắn sẽ cải thiện các điều kiện để nhận dạng; độ chính xác vẫn cần kiểm tra.

Các giới hạn xuất này tách biệt với việc công cụ OCR có nhận dạng văn bản hay không. Một kết quả văn bản hữu ích vẫn có thể tạo ra một bản PDF không thể tìm kiếm được. Các trang có văn bản gốc hiện tại không phải tuân theo cách mã hóa văn bản bổ sung đó theo cách tương tự, nhưng chúng vẫn cần kiểm tra bản sao và tìm kiếm thực tế.

Kiểm tra kết quả trước khi dựa vào nó

  • Tìm kiếm một số từ và số đặc biệt từ các trang khác nhau.
  • Sao chép một đoạn văn vào trình soạn thảo văn bản thuần túy để kiểm tra các ký tự và thứ tự đọc.
  • So sánh tên, ngày tháng, tổng số và số nhận dạng với hình ảnh gốc.
  • Kiểm tra các trang có cột, bảng, chữ viết tay và bất kỳ thay đổi ngôn ngữ nào một cách riêng biệt.
  • Giữ bản quét gốc cùng với kết quả OCR để có thể kiểm tra văn bản không chắc chắn sau này.

Để có hình ảnh bắt đầu rõ ràng hơn, hãy sử dụng Máy quét tài liệu để điều chỉnh việc chụp tài liệu. Nếu bạn cần những đoạn văn có thể chỉnh sửa được, hãy so sánh PDF sang Word với sự cân bằng chuyển đổi trực quan và có thể chỉnh sửa trước khi chọn đầu ra.

Tài liệu tham khảo

Sử dụng PDF OCR