Estrarre il testo da immagini e PDF (OCR)
Tesseract compilato in WebAssembly, che gira sulla tua macchina. Trascina delle foto o un PDF scansionato e tirane fuori il testo — oppure un PDF ricercabile identico all’originale.
- Funziona interamente nel tuo browser
- Funziona offline
- Niente upload
- Niente registrazione
- Niente filigrana
Caricamento dello strumento…
Come funziona
- Trascina immagini o un PDF.
- Spunta le lingue presenti nel documento: meno sono, più è veloce e preciso.
- Avvia l’OCR, poi copia il testo o scarica un PDF ricercabile.
Perché non viene caricato nulla
Ogni operazione di questa pagina la esegue codice che gira dentro la scheda del tuo browser, con lo stesso motore che disegna le pagine web. Il file viene letto dal disco alla memoria della scheda, trasformato lì e riscritto come download. Non viene mai inviato da nessuna parte: né a noi, né a terzi.
Verificalo tu stesso
- Apri gli strumenti per sviluppatori del browser (F12) e scegli la scheda «Rete».
- Carica il tuo file e avvia lo strumento.
- Le uniche richieste che vedrai scaricano il codice dello strumento stesso — e, in pochi strumenti pesanti, il loro motore open source da una CDN pubblica — più un piccolo segnale di visita verso loreatec.jp (indirizzo e titolo della pagina, nulla di più). Nessuna di esse porta con sé il tuo file.
Domande frequenti
Gestisce il giapponese verticale?
Sì, con il modello dedicato al testo verticale. Selezionalo da solo, non insieme a quello orizzontale: usarli entrambi confonde l’analisi dell’impaginazione e le righe escono mescolate.
Che cos’è un PDF ricercabile?
L’immagine originale della pagina con dietro un livello di testo invisibile, messo al punto giusto. Il documento si vede esattamente come prima, ma puoi cercarci dentro, selezionare il testo e copiarlo. È il risultato tipico di uno scanner da ufficio, ottenuto qui senza scanner.
Quanto è preciso?
Su testo stampato pulito a 300 DPI, molto buono. Su una foto scattata col telefono con un’ombra che attraversa la pagina, mediocre. Sulla scrittura a mano, scarso: il motore OCR non è stato pensato per quello, e nessuna impostazione lo risolve. La risoluzione e una luce uniforme contano più di qualsiasi opzione presente qui.
Da dove arrivano i dati delle lingue?
Dalla CDN pubblica dei dati del motore OCR, qualche megabyte per lingua, tenuti in cache dopo il primo uso. Le immagini non vengono mai inviate da nessuna parte: qui è lo strumento in cui conta di più, perché i documenti scansionati di solito sono proprio quelli riservati.