PDF

PDF yang Dipindai vs PDF yang Dapat Dicari: Apa Bedanya?

Oleh Sora Labs · Diterbitkan 10 September 2026

PDF yang dipindai sering kali berisi gambar halaman, bukan teks yang dapat dipilih. PDF yang dapat dicari berisi lapisan teks yang dapat dicari, dipilih, disalin, atau diindeks oleh perangkat lunak. OCR dapat menambahkan teks yang dikenali ke PDF yang dipindai sambil mempertahankan gambar halaman yang terlihat, namun kata-kata yang dikenali mungkin mengandung kesalahan.

PDF pindaian yang hanya berupa gambar, asli, dan dapat dicari

Perbedaan ketiga jenis PDF
FiturPemindaian hanya gambarPDF digital asliOCR/pemindaian yang dapat dicari
Teks yang dapat dipilihBiasanya tidak ada.Biasanya tersedia ketika teks dikodekan dengan mudah diakses.Tersedia jika teks yang dikenali telah ditambahkan.
CariTidak dapat mencari kata-kata dalam gambar sebagai teks.Biasanya mencari teks yang disimpan.Mencari teks yang dikenali, termasuk kesalahannya.
PenampilanGambar halaman.Teks, vektor, gambar, atau campuran.Seringkali gambar halaman yang sama dengan lapisan teks tersembunyi.
Diperlukan OCRYa, untuk mengenali kata-kata yang digambarkan.Biasanya tidak untuk teks asli yang dapat dibaca.Sudah dilakukan, meskipun hasil yang buruk mungkin memerlukan upaya lagi.
Kesalahan pengenalanBelum ada lapisan pengenalan.Tidak ada kesalahan OCR dalam teks asli; ekstraksi masih dapat mengalami masalah.Mungkin bahkan ketika pemindaian yang terlihat terlihat benar.

PDF dapat menggabungkan jenis-jenis berikut: laporan digital mungkin menyertakan lampiran yang dipindai. Coba cari kata khas yang terlihat dan salin kalimat dari beberapa halaman. Pencarian yang gagal saja bukanlah bukti pasti bahwa pemindaian hanya berupa gambar; pengkodean teks, izin, atau lapisan OCR yang buruk juga dapat mengganggu.

Bagaimana cara kerja lapisan teks yang tidak terlihat?

OCR—pengenalan karakter optik—memperkirakan karakter dari suatu gambar. Pengekspor PDF dapat menyimpan kata-kata yang dikenali secara tidak terlihat dan membiarkan pindaian tetap terlihat. Pencarian kemudian menggunakan kata-kata yang disimpan tersebut, bukan pembacaan piksel yang baru. Penyelarasan yang baik menempatkan kata-kata tersembunyi di atas lokasi gambar yang cocok sehingga pemilihan dan penyorotan terasa alami.

Misalnya, pemindaian yang menunjukkan nomor faktur 1080 mungkin memiliki 1O8O di lapisan OCR-nya. Pencarian nomor yang benar bisa gagal meskipun gambar halaman tidak berubah. Menyalin nomor tersebut ke dalam spreadsheet membawa kesalahan pengenalan.

Mengapa OCR melakukan kesalahan?

  • Resolusi rendah kehilangan detail karakter; memperbesar pemindaian yang buram tidak dapat memulihkan guratan yang hilang.
  • Kemiringan, gerakan kabur, bayangan, noise, dan artefak kompresi membuat bentuk huruf lebih sulit dipisahkan.
  • Bahasa pengenalan yang tidak tepat dapat menghasilkan kata atau karakter yang salah.
  • Tulisan tangan dan font yang tidak biasa kurang dapat diprediksi dibandingkan teks cetakan yang jelas.
  • Kolom, tabel, catatan kaki, dan label yang diputar dapat membingungkan urutan pembacaan meskipun setiap huruf dapat dikenali.

PDF yang dapat dicari tidak secara otomatis merupakan dokumen yang terstruktur dengan baik atau dapat diakses. Mengenali kata-kata tidak serta merta menghasilkan judul, hubungan tabel, urutan bacaan, atau tag dokumen yang tepat. OCR juga tidak membuat ulang sumber Word asli.

Apa yang diharapkan dari SoraFiles PDF OCR

Saat ini Alat OCR PDF menjalankan pengakuan secara lokal. Itu menjaga halaman dengan teks asli yang terdeteksi dapat dibaca dan mengenali halaman yang dipindai. Memilih bahasa yang sesuai dan memberikan pemindaian yang jelas dan lurus akan meningkatkan kondisi pengenalan; keakuratannya masih perlu diperiksa.

Batas ekspor ini terpisah dari apakah mesin OCR mengenali teks tersebut. Hasil teks yang berguna masih dapat menghasilkan PDF yang tidak lengkap dan dapat dicari. Halaman dengan teks asli yang ada tidak tunduk pada pengkodean teks tambahan dengan cara yang sama, namun halaman tersebut masih memerlukan pencarian praktis dan pemeriksaan penyalinan.

Periksa hasilnya sebelum mengandalkannya

  • Cari beberapa kata dan angka yang berbeda dari halaman berbeda.
  • Salin paragraf ke editor teks biasa untuk memeriksa karakter dan urutan bacaan.
  • Bandingkan nama, tanggal, total, dan pengenal dengan gambar aslinya.
  • Periksa halaman dengan kolom, tabel, tulisan tangan, dan perubahan bahasa apa pun secara terpisah.
  • Simpan pindaian asli di samping hasil OCR sehingga teks yang tidak pasti dapat diperiksa nanti.

Untuk gambar awal yang lebih jelas, gunakan Pemindai Dokumen untuk menyesuaikan pengambilan dokumen. Jika Anda memerlukan paragraf yang dapat diedit, bandingkan PDF ke Word dengan pengorbanan konversi yang visual dan dapat diedit sebelum memilih output.

Referensi

Gunakan PDF OCR