PDF

PDF ที่สแกนกับ PDF ที่ค้นหาได้: อะไรคือความแตกต่าง?

โดยโซราแล็บส์ · เผยแพร่แล้ว 10 กันยายน 2569

PDF ที่สแกนมักจะมีรูปภาพของหน้าต่างๆ แทนที่จะเป็นข้อความที่เลือกได้ PDF ที่ค้นหาได้ประกอบด้วยเลเยอร์ข้อความที่ซอฟต์แวร์สามารถค้นหา เลือก คัดลอก หรือจัดทำดัชนีได้ OCR สามารถเพิ่มข้อความที่รู้จักลงใน PDF ที่สแกนในขณะที่ยังคงรักษารูปภาพหน้าที่มองเห็นได้ แต่คำที่รู้จักอาจมีข้อผิดพลาด

PDF ที่สแกนเฉพาะรูปภาพ เนทิฟ และค้นหาได้

PDF ทั้ง 3 ประเภทแตกต่างกันอย่างไร
คุณสมบัติสแกนเฉพาะรูปภาพPDF ดิจิทัลเนทิฟOCR/การสแกนแบบค้นหาได้
ข้อความที่เลือกได้ปกติไม่มีเลยโดยปกติจะใช้งานได้เมื่อมีการเข้ารหัสข้อความในการเข้าถึงใช้งานได้เมื่อมีการเพิ่มข้อความที่รู้จัก
ค้นหาไม่สามารถค้นหาคำในภาพเป็นข้อความได้มักจะค้นหาข้อความที่เก็บไว้ค้นหาข้อความที่รู้จัก รวมถึงข้อผิดพลาดด้วย
ลักษณะที่ปรากฏรูปภาพหน้าข้อความ เวกเตอร์ รูปภาพ หรือส่วนผสมมักเป็นรูปภาพหน้าเดียวกันกับเลเยอร์ข้อความที่ซ่อนอยู่
ต้องใช้โอซีอาร์ใช่เพื่อจดจำคำศัพท์ในภาพโดยปกติแล้วจะไม่ใช้สำหรับข้อความดั้งเดิมที่อ่านได้ดำเนินการไปแล้ว แม้ว่าผลลัพธ์ที่ได้ไม่ดีอาจต้องพยายามอีกครั้ง
ข้อผิดพลาดในการรับรู้ยังไม่มีเลเยอร์การรับรู้ไม่มีข้อผิดพลาด OCR ในข้อความดั้งเดิม การสกัดยังคงมีปัญหาอยู่เป็นไปได้แม้ว่าการสแกนที่มองเห็นจะดูถูกต้องก็ตาม

PDF สามารถผสมประเภทเหล่านี้ได้: รายงานดิจิทัลอาจมีภาคผนวกที่สแกนไว้ด้วย ลองค้นหาคำที่มองเห็นได้ชัดเจนและคัดลอกประโยคจากหลายๆ หน้า การค้นหาที่ล้มเหลวเพียงอย่างเดียวไม่ใช่ข้อพิสูจน์ที่แน่ชัดของการสแกนเฉพาะรูปภาพ การเข้ารหัสข้อความ การอนุญาต หรือเลเยอร์ OCR ที่ไม่ดีก็สามารถรบกวนได้เช่นกัน

เลเยอร์ข้อความที่มองไม่เห็นทำงานอย่างไร

OCR—การรู้จำอักขระด้วยแสง—ประมาณอักขระจากรูปภาพ ผู้ส่งออก PDF สามารถจัดเก็บคำที่จดจำได้โดยไม่สามารถมองเห็นได้ในขณะที่ยังคงมองเห็นการสแกนได้ จากนั้นการค้นหาจะใช้คำที่เก็บไว้ ไม่ใช่การอ่านพิกเซลใหม่ การจัดตำแหน่งที่ดีจะวางคำที่ซ่อนอยู่ไว้เหนือตำแหน่งรูปภาพที่ตรงกัน ดังนั้นการเลือกและการไฮไลต์จึงให้ความรู้สึกเป็นธรรมชาติ

ตัวอย่างเช่น การสแกนที่แสดงหมายเลขใบแจ้งหนี้ 1080 อย่างเห็นได้ชัด อาจมี 1O8O อยู่ในเลเยอร์ OCR การค้นหาหมายเลขที่ถูกต้องอาจล้มเหลวแม้ว่ารูปภาพของหน้าจะไม่เปลี่ยนแปลงก็ตาม การคัดลอกตัวเลขลงในสเปรดชีตจะทำให้เกิดข้อผิดพลาดในการรู้จำด้วย

เหตุใด OCR จึงทำผิดพลาด

  • ความละเอียดต่ำสูญเสียรายละเอียดของอักขระ การขยายการสแกนที่พร่ามัวไม่สามารถกู้คืนเส้นที่หายไปได้
  • การเอียง ภาพเบลอจากการเคลื่อนไหว เงา สัญญาณรบกวน และการบีบอัดทำให้รูปร่างตัวอักษรแยกได้ยากขึ้น
  • ภาษาการจดจำที่ไม่เหมาะสมสามารถสร้างคำหรืออักขระที่ไม่ถูกต้องได้
  • ลายมือและแบบอักษรที่ผิดปกติคาดเดาได้น้อยกว่าข้อความที่พิมพ์ชัดเจน
  • คอลัมน์ ตาราง เชิงอรรถ และป้ายกำกับที่หมุนอาจทำให้ลำดับการอ่านสับสนได้ แม้ว่าจะจดจำตัวอักษรแต่ละตัวได้แล้วก็ตาม

PDF ที่ค้นหาได้ไม่ใช่เอกสารที่มีโครงสร้างดีหรือเข้าถึงได้โดยอัตโนมัติ การจดจำคำไม่จำเป็นต้องสร้างส่วนหัว ความสัมพันธ์ของตาราง ลำดับการอ่าน หรือแท็กเอกสารที่ถูกต้อง OCR จะไม่สร้างต้นฉบับ Word ต้นฉบับขึ้นมาใหม่

สิ่งที่คาดหวังจาก SoraFiles PDF OCR

ปัจจุบัน เครื่องมือ PDF OCR ดำเนินการจดจำในพื้นที่ โดยจะเก็บหน้าที่มีข้อความเนทีฟที่ตรวจพบและจดจำหน้าที่สแกนได้ การเลือกภาษาที่เหมาะสมและการจัดหาการสแกนที่ชัดเจนและตรงไปตรงมาจะช่วยปรับปรุงเงื่อนไขในการจดจำ ความถูกต้องยังต้องมีการตรวจสอบ

ขีดจำกัดการส่งออกเหล่านี้จะแยกออกจากว่ากลไก OCR รู้จักข้อความหรือไม่ ผลลัพธ์ข้อความที่มีประโยชน์ยังคงสามารถสร้าง PDF ที่สามารถค้นหาได้ไม่สมบูรณ์ หน้าที่มีข้อความเนทิฟอยู่แล้วจะไม่ได้รับการเข้ารหัสข้อความเพิ่มเติมในลักษณะเดียวกัน แต่ยังต้องมีการค้นหาที่เป็นประโยชน์และการตรวจสอบการคัดลอก

เช็คผลก่อนวางใจ

  • ค้นหาคำและตัวเลขที่โดดเด่นหลายคำจากหน้าต่างๆ
  • คัดลอกย่อหน้าลงในโปรแกรมแก้ไขข้อความธรรมดาเพื่อตรวจสอบอักขระและลำดับการอ่าน
  • เปรียบเทียบชื่อ วันที่ ผลรวม และตัวระบุกับรูปภาพต้นฉบับ
  • ตรวจสอบหน้าที่มีคอลัมน์ ตาราง ลายมือ และการเปลี่ยนแปลงภาษาแยกกัน
  • เก็บการสแกนต้นฉบับไว้ข้างผลลัพธ์ OCR เพื่อให้สามารถตรวจสอบข้อความที่ไม่แน่นอนได้ในภายหลัง

เพื่อให้ภาพเริ่มต้นชัดเจนขึ้น ให้ใช้ เครื่องสแกนเอกสาร เพื่อปรับการจับเอกสาร หากคุณต้องการย่อหน้าที่แก้ไขได้ ให้เปรียบเทียบ PDF เป็น Word กับ การแลกเปลี่ยนการแปลงแบบภาพและแบบแก้ไขได้ ก่อนที่จะเลือกเอาท์พุต

อ้างอิง

ใช้ PDF OCR