Testua atera irudietatik eta PDFetatik (OCR)

Tesseract WebAssembly formatura konpilatuta, zure makinan bertan. Ekarri argazkiak edo eskaneatutako PDF bat eta atera testua, edo jatorrizkoaren berdin-berdina den PDF bilagarri bat.

Tresna kargatzen…

Nola dabilen

  1. Ekarri irudiak edo PDF bat.
  2. Markatu dokumentuan dauden hizkuntzak: gutxiago izanda, azkarragoa eta zehatzagoa da.
  3. Abiarazi OCRa, eta gero kopiatu testua edo deskargatu PDF bilagarri bat.

Zergatik ez den ezer igotzen

Orri honek egiten duen guztia zure nabigatzailearen fitxa barruan dabilen kodeak egiten du, web-orriak marrazten dituen motor berarekin. Fitxategia diskotik fitxaren memoriara irakurtzen da, hor eraldatzen da, eta deskarga gisa idazten da berriro. Ez da inora bidaltzen: ez guregana, ez beste inorengana.

Egiaztatu zeuk

  1. Ireki nabigatzailearen garatzaile-tresnak (F12) eta hautatu sarearen fitxa («Network»).
  2. Kargatu zure fitxategia eta abiarazi tresna.
  3. Ikusiko dituzun eskaera bakarrak tresnaren beraren kodea ekartzen dutenak dira —eta, tresna astun gutxi batzuetan, haien kode irekiko motorra CDN publiko batetik—, eta loreatec.jp helbidera doan bisita-abisu txiki bat (orriaren helbidea eta izenburua, besterik ez). Bat bakarrak ere ez darama zure fitxategia.

Egiaztatu zeuk →

Ohiko galderak

Japoniera bertikala onartzen du?

Bai, testu bertikalerako eredu bereziarekin. Hautatu bera bakarrik, horizontalarekin batera beharrean: biak batera erabiltzeak diseinuaren analisia nahasten du eta lerroak tartekatuta ateratzen dira.

Zer da PDF bilagarri bat?

Jatorrizko orrialdearen irudia, atzean kokatutako testu-geruza ikusezin batekin. Dokumentuak lehen-lehen bezalaxe ematen du, baina bilatu, testua hautatu eta kopiatu egin dezakezu. Dokumentu-eskaner baten irteera estandarra da, hemen eskanerrik gabe sortua.

Zenbateraino da zehatza?

300 DPIko testu inprimatu garbian, oso ona. Orrialdean itzala duen mugikorreko argazki batean, kaskarra. Eskuz idatzitakoan, txarra: OCR motorra ez zen horretarako egin, eta ezarpenek ez dute hori konponduko. Bereizmenak eta argi uniformeak hemengo edozein aukerak baino gehiago axola dute.

Nondik datoz hizkuntzen datuak?

OCR motorraren datu-CDN publikotik, megabyte gutxi batzuk hizkuntzako, lehen erabileraren ondoren gordeta. Irudiak berak ez dira inora bidaltzen: tresna honetan axola du horrek gehien, eskaneatutako dokumentuak izan ohi baitira konfidentzialak.