OCR — jadikan dapat dibaca
Hasil pindai Anda menjadi teks — analisis tetap di perangkat Anda.
Berkas Anda tidak pernah keluar dari perangkat AndaLetakkan PDF atau gambar di sini
PDF hasil pindai atau foto — JPG, PNG
Cara mengenali teks dari PDF hasil pindai, langkah demi langkah
OCR mengubah hasil pindai menjadi teks yang dapat digunakan, dengan memuat mesin pengenalan langsung di peramban Anda: dokumen tidak pernah dikirim secara daring.
Unggah PDF hasil pindai atau sebuah foto
Seret PDF atau gambar JPG/PNG ke area unggah, atau klik untuk menelusurinya.
Pilih bahasa dokumen
Pilih pada «Bahasa dokumen»: bahasa-bahasa situs ini berada di bagian atas, lalu lebih dari seratus bahasa lainnya, yang modelnya diunduh saat pertama kali digunakan. Pengenalan jauh lebih tidak akurat jika bahasa yang dipilih tidak sesuai dengan teks sesungguhnya; «Bahasa kedua» digunakan untuk dokumen dwibahasa.
Batasi rentang halaman, jika berkasnya PDF
Kolom ini menerima rentang seperti «1-3, 5, 8-10»; jika dibiarkan kosong, semua halaman dianalisis.
Klik «Mulai pengenalan»
Mesin pengenalan (sekitar 4 MB) diunduh satu kali dari server kami, bersama model bahasanya; untuk bahasa yang tidak disertakan, ukuran modelnya diumumkan sebelum dimulai. Analisis itu sendiri kemudian berlangsung sepenuhnya di perangkat Anda.
Baca hasil dan tingkat keyakinannya
Teks yang dikenali ditampilkan dengan jumlah kata dan keyakinan rata-rata; keyakinan yang rendah menandakan pindaian yang mungkin miring atau berkualitas buruk.
Unduh teks atau PDF yang dapat dicari
Berkas .txt berisi teks mentah; PDF yang dapat dicari mempertahankan tata letak asli dengan lapisan teks tak terlihat di atasnya, yang membuat dokumen dapat dipilih dan dicari berdasarkan kata kunci.
Pada PDF yang dapat dicari, halaman hasil pindai mempertahankan gambar aslinya dan menerima lapisan teks tak terlihat yang berlaku untuk semua aksara, termasuk Yunani, Sirilik, Arab, atau Tionghoa; halaman yang sudah memiliki teks disusun ulang menjadi gambar agar tidak membawa dua lapisan.
Pertanyaan yang sering diajukan
Apakah OCR VellumPDF menerima PDF maupun foto?
Ya, Anda dapat mengunggah PDF hasil pindai atau langsung gambar berformat JPG atau PNG. Dalam kedua kasus, alat ini menghasilkan PDF yang dapat dicari, yang teksnya dapat dipilih dan disalin.
Dalam bahasa apa saja pengenalan teks berfungsi?
Lebih dari seratus bahasa. Bahasa-bahasa situs ini termasuk dan dilayani oleh VellumPDF; bahasa lainnya (Ceko, Yunani, Rusia, Ukraina, Arab, Ibrani, Tionghoa, Jepang, Korea…) dipilih dari daftar «Bahasa dokumen» yang sama, dan modelnya diunduh sekali, saat pertama kali digunakan. «Bahasa kedua» menangani dokumen dwibahasa. Memilih bahasa yang tepat meningkatkan keandalan hasil secara signifikan.
Apakah dokumen hasil pindai saya dikirim ke layanan kecerdasan buatan daring?
Tidak. Mesin pengenalan berjalan di peramban Anda. Untuk bahasa-bahasa situs ini, berkasnya berasal dari domain VellumPDF; untuk bahasa lain, hanya modelnya yang diunduh dari raw.githubusercontent.com, repositori publik proyek Tesseract, setelah ada pemberitahuan di layar. Unduhan ini hanya satu arah: dokumen tidak meninggalkan perangkat Anda dan tidak ada layanan kecerdasan buatan yang dipanggil.
Apakah model pengenalan diunduh setiap kali digunakan, dan berapa ukurannya?
Setiap bahasa memiliki modelnya sendiri. Untuk bahasa-bahasa situs ini, dihosting oleh VellumPDF: 0,4 hingga 3 MB terkompresi tergantung bahasanya (sekitar 700 KB untuk bahasa Prancis, hampir 3 MB untuk bahasa Inggris); tembolok peramban biasa menghindari pengunduhan ulang. Untuk bahasa lain, antara 0,4 dan 12 MB tergantung bahasa, ukurannya ditampilkan sebelum dimulai; setelah diunduh, model disimpan oleh peramban dan penggunaan kedua tidak mengunduh apa pun lagi.
Bagaimana cara mengetahui apakah hasilnya dapat diandalkan, misalnya pada pindaian yang miring atau berkualitas buruk?
Persentase keyakinan rata-rata ditampilkan bersama hasil, dihitung dari seluruh kata yang dikenali. Di bawah 70 %, sebuah peringatan menandakan bahwa pengenalan tidak pasti dan pindaian mungkin miring atau berkualitas rendah — inilah sinyal untuk memindai ulang alih-alih memercayai teks yang diperoleh.
Apa yang terjadi jika saya mengunggah PDF yang dilindungi kata sandi?
Pengenalan langsung ditolak, dengan pesan yang menjelaskan bahwa PDF terenkripsi tidak dapat di-OCR. Anda perlu menghapus perlindungan dokumen terlebih dahulu sebelum mengunggahnya di sini.
Bisakah OCR dilakukan pada beberapa dokumen sekaligus?
Tidak, alat ini memproses satu berkas pada satu waktu — PDF hasil pindai atau gambar. Untuk beberapa dokumen, ulangi operasi untuk masing-masing.