Görsellerden ve PDF’lerden metin çıkarın (OCR)

WebAssembly’ye derlenmiş Tesseract, sizin makinenizde çalışıyor. Fotoğrafları ya da taranmış bir PDF’i bırakın, metni alın — ya da orijinaliyle birebir aynı görünen, içinde arama yapılabilen bir PDF alın.

Araç yükleniyor…

Nasıl çalışır

  1. Görselleri ya da bir PDF’i bırakın.
  2. Belgede bulunan dilleri işaretleyin — az dil daha hızlı ve daha isabetlidir.
  3. OCR’ı çalıştırın, sonra metni kopyalayın ya da içinde arama yapılabilen PDF’i indirin.

Neden hiçbir şey yüklenmiyor

Bu sayfadaki her işlem, web sayfalarını çizen aynı motoru kullanarak tarayıcı sekmenizin içinde çalışan kodla yapılır. Dosya diskten sekmenizin belleğine okunur, orada dönüştürülür ve indirilecek dosya olarak geri yazılır. Hiçbir yere gönderilmez: ne bize, ne üçüncü bir tarafa.

Kendiniz doğrulayın

  1. Tarayıcınızın geliştirici araçlarını açın (F12) ve Ağ (Network) sekmesini seçin.
  2. Dosyanızı araca ekleyin ve aracı çalıştırın.
  3. Göreceğiniz tek istekler aracın kendi kodunu indirir — birkaç ağır araçta ayrıca açık kaynaklı motorunu kamuya açık bir CDN’den — artı loreatec.jp adresine giden küçük bir sayfa görüntüleme bildirimi (sayfanın adresi ve başlığı, başka bir şey değil). Hiçbiri dosyanızı taşımaz.

Cihazınızda kaldığının kanıtı →

Sıkça sorulan sorular

Dikey Japoncayı tanıyor mu?

Evet, dikey metne özel modelle. Onu yatay modelle birlikte değil, tek başına seçin: ikisini birden çalıştırmak sayfa düzeni çözümlemesini şaşırtır ve satırlar iç içe geçer.

İçinde arama yapılabilen PDF nedir?

Sayfanın özgün görüntüsü ve arkasına yerleştirilmiş görünmez bir metin katmanı. Belge tıpatıp eskisi gibi görünür, ama içinde arama yapabilir, metni seçebilir ve kopyalayabilirsiniz. Bir belge tarayıcısının standart çıktısıdır; burada tarayıcı olmadan üretilir.

Ne kadar isabetli?

300 DPI’de temiz basılı metinde çok iyi. Sayfanın üzerine gölge düşmüş bir telefon fotoğrafında orta. El yazısında kötü — OCR motoru bunun için tasarlanmadı ve hiçbir ayar bunu düzeltmez. Çözünürlük ve eşit aydınlatma, buradaki her seçenekten daha çok fark yaratır.

Dil verileri nereden geliyor?

OCR motorunun kamuya açık veri CDN’inden; dil başına birkaç megabayt, ilk kullanımdan sonra önbelleğe alınır. Görsellerin kendisi hiçbir yere gönderilmez: bunun en çok önem taşıdığı araç budur, çünkü taranan belgeler genellikle gizli olanlardır.