การจัดรูปแบบ PDF เป็น Word เปลี่ยนแปลงเนื่องจาก PDF อธิบายหน้าภาพที่ตายตัว ในขณะที่เอกสาร Word อธิบายเนื้อหาที่แก้ไขได้ซึ่งสามารถไหลและจัดวางอีกครั้ง ตัวแปลงมักจะต้องอนุมานย่อหน้า คอลัมน์ และตารางจากข้อความที่อยู่ในตำแหน่ง PDF อาจมีข้อมูลไม่เพียงพอที่จะสร้างโครงสร้างของเอกสารต้นฉบับใหม่
เหตุใดหน้าที่ดูเหมาะสมจึงสามารถแปลงได้ไม่ดี
ใน PDF คุณสามารถวาดข้อความแยกส่วนตามพิกัดเฉพาะได้ มนุษย์มองเห็นหนึ่งย่อหน้าหรือสองคอลัมน์ แต่การดำเนินการที่เก็บไว้ไม่จำเป็นต้องระบุความสัมพันธ์นั้น WordprocessingML ซึ่งเป็นรูปแบบเอกสารภายใน DOCX แสดงถึงโครงสร้าง เช่น ย่อหน้า การเรียกใช้ข้อความ และตาราง การแปลงระหว่างแบบจำลองเหล่านี้เกี่ยวข้องกับการตีความ
ตัวอย่างเช่น จดหมายข่าวแบบสองคอลัมน์อาจจัดเก็บส่วนของข้อความตามลำดับที่แตกต่างจากลำดับการอ่านปกติ ตัวแปลงสามารถรวมประโยคจากคอลัมน์ด้านซ้ายเข้ากับส่วนหัวของคอลัมน์ด้านขวาโดยไม่ตั้งใจ ในทำนองเดียวกัน ตัวเลขที่จัดชิดให้ดูเหมือนตารางอาจไม่มีโครงสร้างตารางจริงให้กู้คืน
เหตุใดแบบอักษรและตัวแบ่งบรรทัดจึงเปลี่ยนไป
PDF อาจฝังแบบอักษรหรือเฉพาะชุดย่อยของอักขระเท่านั้น ซึ่งไม่ได้รับประกันว่าจะมีแบบอักษรที่ใช้งานได้เหมือนกันในเอกสาร Word ที่แปลงแล้ว การแทนที่แบบอักษร ความกว้างอักขระ ระยะห่างย่อหน้า และระยะขอบหน้าสามารถเปลี่ยนการตัดบรรทัดได้ ความแตกต่างเล็กน้อยในช่วงเริ่มต้นสามารถย้ายเนื้อหาไปยังหน้าอื่นได้
การเก็บรักษาภาพเทียบกับการแปลงที่แก้ไขได้
| แนวทาง | สิ่งที่คุณได้รับ | การแลกเปลี่ยนหลัก |
|---|---|---|
| การอนุรักษ์สายตา | รูปภาพที่แสดงผลของแต่ละหน้า PDF ที่วางอยู่ใน DOCX | หน้าเว็บอาจดูคล้ายกัน แต่ข้อความในหน้าเว็บไม่ใช่ข้อความ Word ที่แก้ไขได้ทั่วไป |
| การสร้างใหม่แบบแก้ไขได้ | ข้อความที่รู้จักหรือแยกออกมาสร้างใหม่เป็นเนื้อหา Word | คุณสามารถแก้ไขข้อความได้ แต่เค้าโครงและโครงสร้างเอกสารอาจมีการเปลี่ยนแปลง |
เอกสารรูปภาพหน้าจะมีประโยชน์เมื่อผู้รับต้องการ DOCX ที่มีหน้าภาพโดยเฉพาะ มักจะเป็นตัวเลือกที่ไม่ดีสำหรับการเขียนย่อหน้าใหม่ การสร้างใหม่แบบแก้ไขได้เหมาะสมกับการแก้ไขข้อความ โดยคุณต้องเผื่อเวลาในการตรวจสอบหัวข้อ รายการ ตาราง และลำดับการอ่าน ทั้งสองวิธีไม่สามารถกู้คืนไฟล์ต้นฉบับได้อย่างสมบูรณ์
จะมีการเปลี่ยนแปลงอะไรบ้างเมื่อสแกน PDF
การสแกนเฉพาะรูปภาพไม่มีข้อความที่ใช้งานได้สำหรับโปรแกรมแยกข้อความปกติ OCR ประมาณอักขระจากพิกเซล มันสามารถอ่านค่าศูนย์ผิดเหมือนตัวอักษร O หรือรวมคอลัมน์ที่อยู่ติดกัน และการจดจำคำเหล่านั้นไม่สามารถกู้คืนสไตล์และโครงสร้างเอกสารดั้งเดิมได้ เรียนรู้วิธีการ การสแกนที่ค้นหาได้จะแตกต่างจาก PDF ดั้งเดิม.
เลือกเอาต์พุต SoraFiles ที่เหมาะสม
ปัจจุบัน เครื่องมือ SoraFiles PDF เป็น Word เสนอเอาท์พุตที่แก้ไขได้และเป็นภาพ การแปลงที่แก้ไขได้จะแยกข้อความที่มีอยู่ ใช้ OCR เมื่อจำเป็น และสร้างย่อหน้า Word ด้วยส่วนหัว รายการ และตารางแบบง่ายที่อนุมาน ไม่สัญญาว่าจะสร้างเค้าโครงดั้งเดิมหรือเนื้อหากราฟิกทั้งหมดขึ้นมาใหม่ เอาต์พุตภาพทำให้หน้า PDF ที่แสดงผลลงใน DOCX เป็นรูปภาพ
เลือกผลลัพธ์ที่สามารถแก้ไขได้หากการเปลี่ยนถ้อยคำมีความสำคัญมากที่สุด เลือกการแสดงภาพหากการรักษาการจัดเรียงที่มองเห็นได้ของหน้ามีความสำคัญมากกว่าการแก้ไขข้อความ ตรวจสอบตัวเลือกผลลัพธ์ที่เลือกก่อนการแปลง และตรวจสอบหน้าที่ซับซ้อนก่อนที่จะอาศัยเอกสารทั้งหมด
วิธีลดความประหลาดใจ
- สอบถาม DOCX ต้นฉบับว่ามีให้ใช้งานหรือไม่ เป็นแหล่งแก้ไขที่ดีกว่า PDF ที่แปลงแล้ว
- ตรวจสอบหน้าแรก หน้าที่หนาแน่น และทุกตารางที่ซับซ้อนก่อนที่จะแก้ไขไฟล์ทั้งหมด
- เปรียบเทียบลำดับการอ่านคอลัมน์ รายการที่เรียงลำดับเลข ส่วนหัว เชิงอรรถ และตัวแบ่งหน้า
- ตรวจสอบชื่อ วันที่ ผลรวม และตัวระบุหลัง OCR คำที่ดูน่าเชื่อถือก็ยังอาจผิดได้
- หลังจากแก้ไขแล้ว ให้สร้าง PDF และเปรียบเทียบหน้าสุดท้ายอีกครั้งก่อนแชร์
หากคุณต้องการค้นหาหรือแยกข้อความที่สแกนเท่านั้น PDF OCR อาจจะเพียงพอ หลังจากแก้ไข DOCX แล้ว ให้ใช้ คำเป็น PDF เพื่อเตรียมสำเนาหน้าคงที่ จากนั้นตรวจสอบในโปรแกรมดู PDF
อ้างอิง
- Microsoft: การเปิด PDF ใน Word (External link, opens in a new tab)
- Microsoft: โครงสร้างของเอกสาร WordprocessingML (External link, opens in a new tab)
- Adobe: การจัดการแบบอักษรในการแปลง PDF (External link, opens in a new tab)
- SoraFiles: PDF เป็น Word