PDF ที่สแกนมักจะมีรูปภาพของหน้าต่างๆ แทนที่จะเป็นข้อความที่เลือกได้ PDF ที่ค้นหาได้ประกอบด้วยเลเยอร์ข้อความที่ซอฟต์แวร์สามารถค้นหา เลือก คัดลอก หรือจัดทำดัชนีได้ OCR สามารถเพิ่มข้อความที่รู้จักลงใน PDF ที่สแกนในขณะที่ยังคงรักษารูปภาพหน้าที่มองเห็นได้ แต่คำที่รู้จักอาจมีข้อผิดพลาด
PDF ที่สแกนเฉพาะรูปภาพ เนทิฟ และค้นหาได้
| คุณสมบัติ | สแกนเฉพาะรูปภาพ | PDF ดิจิทัลเนทิฟ | OCR/การสแกนแบบค้นหาได้ |
|---|---|---|---|
| ข้อความที่เลือกได้ | ปกติไม่มีเลย | โดยปกติจะใช้งานได้เมื่อมีการเข้ารหัสข้อความในการเข้าถึง | ใช้งานได้เมื่อมีการเพิ่มข้อความที่รู้จัก |
| ค้นหา | ไม่สามารถค้นหาคำในภาพเป็นข้อความได้ | มักจะค้นหาข้อความที่เก็บไว้ | ค้นหาข้อความที่รู้จัก รวมถึงข้อผิดพลาดด้วย |
| ลักษณะที่ปรากฏ | รูปภาพหน้า | ข้อความ เวกเตอร์ รูปภาพ หรือส่วนผสม | มักเป็นรูปภาพหน้าเดียวกันกับเลเยอร์ข้อความที่ซ่อนอยู่ |
| ต้องใช้โอซีอาร์ | ใช่เพื่อจดจำคำศัพท์ในภาพ | โดยปกติแล้วจะไม่ใช้สำหรับข้อความดั้งเดิมที่อ่านได้ | ดำเนินการไปแล้ว แม้ว่าผลลัพธ์ที่ได้ไม่ดีอาจต้องพยายามอีกครั้ง |
| ข้อผิดพลาดในการรับรู้ | ยังไม่มีเลเยอร์การรับรู้ | ไม่มีข้อผิดพลาด OCR ในข้อความดั้งเดิม การสกัดยังคงมีปัญหาอยู่ | เป็นไปได้แม้ว่าการสแกนที่มองเห็นจะดูถูกต้องก็ตาม |
PDF สามารถผสมประเภทเหล่านี้ได้: รายงานดิจิทัลอาจมีภาคผนวกที่สแกนไว้ด้วย ลองค้นหาคำที่มองเห็นได้ชัดเจนและคัดลอกประโยคจากหลายๆ หน้า การค้นหาที่ล้มเหลวเพียงอย่างเดียวไม่ใช่ข้อพิสูจน์ที่แน่ชัดของการสแกนเฉพาะรูปภาพ การเข้ารหัสข้อความ การอนุญาต หรือเลเยอร์ OCR ที่ไม่ดีก็สามารถรบกวนได้เช่นกัน
เลเยอร์ข้อความที่มองไม่เห็นทำงานอย่างไร
OCR—การรู้จำอักขระด้วยแสง—ประมาณอักขระจากรูปภาพ ผู้ส่งออก PDF สามารถจัดเก็บคำที่จดจำได้โดยไม่สามารถมองเห็นได้ในขณะที่ยังคงมองเห็นการสแกนได้ จากนั้นการค้นหาจะใช้คำที่เก็บไว้ ไม่ใช่การอ่านพิกเซลใหม่ การจัดตำแหน่งที่ดีจะวางคำที่ซ่อนอยู่ไว้เหนือตำแหน่งรูปภาพที่ตรงกัน ดังนั้นการเลือกและการไฮไลต์จึงให้ความรู้สึกเป็นธรรมชาติ
ตัวอย่างเช่น การสแกนที่แสดงหมายเลขใบแจ้งหนี้ 1080 อย่างเห็นได้ชัด อาจมี 1O8O อยู่ในเลเยอร์ OCR การค้นหาหมายเลขที่ถูกต้องอาจล้มเหลวแม้ว่ารูปภาพของหน้าจะไม่เปลี่ยนแปลงก็ตาม การคัดลอกตัวเลขลงในสเปรดชีตจะทำให้เกิดข้อผิดพลาดในการรู้จำด้วย
เหตุใด OCR จึงทำผิดพลาด
- ความละเอียดต่ำสูญเสียรายละเอียดของอักขระ การขยายการสแกนที่พร่ามัวไม่สามารถกู้คืนเส้นที่หายไปได้
- การเอียง ภาพเบลอจากการเคลื่อนไหว เงา สัญญาณรบกวน และการบีบอัดทำให้รูปร่างตัวอักษรแยกได้ยากขึ้น
- ภาษาการจดจำที่ไม่เหมาะสมสามารถสร้างคำหรืออักขระที่ไม่ถูกต้องได้
- ลายมือและแบบอักษรที่ผิดปกติคาดเดาได้น้อยกว่าข้อความที่พิมพ์ชัดเจน
- คอลัมน์ ตาราง เชิงอรรถ และป้ายกำกับที่หมุนอาจทำให้ลำดับการอ่านสับสนได้ แม้ว่าจะจดจำตัวอักษรแต่ละตัวได้แล้วก็ตาม
PDF ที่ค้นหาได้ไม่ใช่เอกสารที่มีโครงสร้างดีหรือเข้าถึงได้โดยอัตโนมัติ การจดจำคำไม่จำเป็นต้องสร้างส่วนหัว ความสัมพันธ์ของตาราง ลำดับการอ่าน หรือแท็กเอกสารที่ถูกต้อง OCR จะไม่สร้างต้นฉบับ Word ต้นฉบับขึ้นมาใหม่
สิ่งที่คาดหวังจาก SoraFiles PDF OCR
ปัจจุบัน เครื่องมือ PDF OCR ดำเนินการจดจำในพื้นที่ โดยจะเก็บหน้าที่มีข้อความเนทีฟที่ตรวจพบและจดจำหน้าที่สแกนได้ การเลือกภาษาที่เหมาะสมและการจัดหาการสแกนที่ชัดเจนและตรงไปตรงมาจะช่วยปรับปรุงเงื่อนไขในการจดจำ ความถูกต้องยังต้องมีการตรวจสอบ
ขีดจำกัดการส่งออกเหล่านี้จะแยกออกจากว่ากลไก OCR รู้จักข้อความหรือไม่ ผลลัพธ์ข้อความที่มีประโยชน์ยังคงสามารถสร้าง PDF ที่สามารถค้นหาได้ไม่สมบูรณ์ หน้าที่มีข้อความเนทิฟอยู่แล้วจะไม่ได้รับการเข้ารหัสข้อความเพิ่มเติมในลักษณะเดียวกัน แต่ยังต้องมีการค้นหาที่เป็นประโยชน์และการตรวจสอบการคัดลอก
เช็คผลก่อนวางใจ
- ค้นหาคำและตัวเลขที่โดดเด่นหลายคำจากหน้าต่างๆ
- คัดลอกย่อหน้าลงในโปรแกรมแก้ไขข้อความธรรมดาเพื่อตรวจสอบอักขระและลำดับการอ่าน
- เปรียบเทียบชื่อ วันที่ ผลรวม และตัวระบุกับรูปภาพต้นฉบับ
- ตรวจสอบหน้าที่มีคอลัมน์ ตาราง ลายมือ และการเปลี่ยนแปลงภาษาแยกกัน
- เก็บการสแกนต้นฉบับไว้ข้างผลลัพธ์ OCR เพื่อให้สามารถตรวจสอบข้อความที่ไม่แน่นอนได้ในภายหลัง
เพื่อให้ภาพเริ่มต้นชัดเจนขึ้น ให้ใช้ เครื่องสแกนเอกสาร เพื่อปรับการจับเอกสาร หากคุณต้องการย่อหน้าที่แก้ไขได้ ให้เปรียบเทียบ PDF เป็น Word กับ การแลกเปลี่ยนการแปลงแบบภาพและแบบแก้ไขได้ ก่อนที่จะเลือกเอาท์พุต
อ้างอิง
- Adobe: จดจำข้อความในเอกสารที่สแกน (External link, opens in a new tab)
- Tesseract: การปรับปรุงคุณภาพการจดจำ (External link, opens in a new tab)
- Tesseract: คำถามที่พบบ่อย (External link, opens in a new tab)
- SoraFiles: PDF OCR