Tekst uit afbeeldingen en PDF’s halen (OCR)

Tesseract gecompileerd naar WebAssembly, draaiend op jouw machine. Sleep er foto’s of een gescande PDF in en haal de tekst eruit — of een doorzoekbare PDF die er precies zo uitziet als het origineel.

De tool wordt geladen…

Hoe het werkt

  1. Sleep afbeeldingen of een PDF erin.
  2. Vink de talen aan die in het document voorkomen — hoe minder, hoe sneller en nauwkeuriger.
  3. Start de OCR en kopieer daarna de tekst, of download een doorzoekbare PDF.

Waarom er niets wordt geüpload

Alles wat deze pagina doet, doet code die in je browsertabblad draait, met dezelfde engine die ook webpagina’s tekent. Je bestand wordt van schijf naar het geheugen van dat tabblad gelezen, daar bewerkt en weer weggeschreven als download. Het wordt nergens naartoe gestuurd — niet naar ons, en niet naar een derde partij.

Controleer het zelf

  1. Open de ontwikkelaarstools van je browser (F12) en kies het tabblad Netwerk.
  2. Laad je bestand en start de tool.
  3. De enige verzoeken die je ziet, halen de code van de tool zelf op — en bij een paar zware tools hun opensource-engine van een openbare CDN — plus één kleine bezoekmelding aan loreatec.jp (adres en titel van de pagina, meer niet). In geen van die verzoeken zit jouw bestand.

Bewijs dat het lokaal blijft →

Veelgestelde vragen

Kan hij overweg met verticaal Japans?

Ja, met het speciale model voor verticale tekst. Kies dat model apart en niet naast het horizontale: allebei tegelijk brengt de lay-outanalyse in de war en dan raken de regels door elkaar.

Wat is een doorzoekbare PDF?

De oorspronkelijke pagina-afbeelding met daarachter een onzichtbare tekstlaag op de juiste plek. Het document ziet er precies zo uit als eerst, maar je kunt erin zoeken, tekst selecteren en eruit kopiëren. Het is de standaarduitvoer van een documentscanner, hier gemaakt zonder scanner.

Hoe nauwkeurig is het?

Bij schone gedrukte tekst op 300 dpi heel goed. Bij een telefoonfoto met een schaduw over de pagina matig. Bij handschrift slecht — de OCR-engine is er niet voor gemaakt, en geen enkele instelling verhelpt dat. Resolutie en gelijkmatig licht doen meer dan welke optie hier ook.

Waar komen de taalgegevens vandaan?

Van de openbare data-CDN van de OCR-engine, een paar megabyte per taal, na de eerste keer bewaard in je browser. De afbeeldingen zelf worden nooit ergens heen gestuurd: juist bij deze tool telt dat het zwaarst, want gescande documenten zijn meestal de vertrouwelijke.