Ambil teks dari gambar dan PDF (OCR)
Tesseract yang dikompilasi ke WebAssembly, berjalan di komputer Anda. Lepaskan foto atau sebuah PDF hasil pindai, lalu keluarkan teksnya — atau sebuah PDF yang bisa dicari dan tampak identik dengan aslinya.
- Berjalan sepenuhnya di peramban Anda
- Berfungsi tanpa koneksi
- Tanpa unggah
- Tanpa pendaftaran
- Tanpa watermark
Memuat alat…
Cara kerjanya
- Lepaskan gambar atau sebuah PDF.
- Centang bahasa yang ada di dalam dokumennya — makin sedikit, makin cepat dan makin akurat.
- Jalankan OCR-nya, lalu salin teksnya atau unduh PDF yang bisa dicari.
Kenapa tidak ada yang diunggah
Semua yang dikerjakan halaman ini dijalankan oleh kode di dalam tab peramban Anda, memakai mesin yang sama dengan yang menampilkan halaman web. File dibaca dari disk ke memori tab Anda, diolah di sana, lalu ditulis kembali sebagai unduhan. File itu tidak pernah dikirim ke mana pun — tidak ke kami, tidak ke pihak ketiga.
Buktikan sendiri
- Buka alat pengembang peramban Anda (F12) lalu pilih tab “Network” (Jaringan).
- Muat file Anda dan jalankan alatnya.
- Permintaan yang akan Anda lihat hanya mengambil kode alat itu sendiri — dan, pada beberapa alat berat, mesin sumber terbukanya dari CDN publik — ditambah satu ping kunjungan halaman yang kecil ke loreatec.jp (alamat dan judul halaman, tidak lebih). Tidak satu pun membawa file Anda.
Pertanyaan yang sering diajukan
Apakah alat ini menangani tulisan Jepang menurun?
Ya, dengan model khusus teks menurun. Pilih model itu sendirian, jangan bersama model mendatar: menjalankan keduanya mengacaukan analisis tata letaknya dan barisnya keluar berselang-seling.
Apa itu PDF yang bisa dicari?
Gambar halaman aslinya dengan lapisan teks tak terlihat yang diletakkan di belakangnya. Dokumennya tampak persis seperti semula, tetapi bisa Anda cari, teksnya bisa diseleksi dan disalin. Itu keluaran standar sebuah pemindai dokumen, yang di sini dihasilkan tanpa pemindai.
Seberapa akurat hasilnya?
Pada teks cetak yang bersih di 300 DPI, sangat baik. Pada foto ponsel dengan bayangan melintang di halaman, sedang-sedang saja. Pada tulisan tangan, buruk — mesin OCR-nya memang tidak dirancang untuk itu, dan pengaturan sebanyak apa pun tidak akan memperbaikinya. Resolusi dan pencahayaan yang merata lebih menentukan daripada opsi mana pun di sini.
Dari mana data bahasanya berasal?
Dari CDN data publik milik mesin OCR-nya, beberapa megabyte per bahasa, yang disimpan di cache setelah pemakaian pertama. Gambarnya sendiri tidak pernah dikirim ke mana pun: di alat inilah hal itu paling penting, karena dokumen yang dipindai biasanya justru yang bersifat rahasia.