Text aus Bildern und PDFs herausholen (OCR)

Tesseract, nach WebAssembly übersetzt und auf deinem Rechner laufend. Leg Fotos oder ein gescanntes PDF ab und hol den Text heraus — oder ein durchsuchbares PDF, das genauso aussieht wie das Original.

Werkzeug wird geladen…

So funktioniert es

  1. Zieh Bilder oder ein PDF herein.
  2. Hak die Sprachen an, die im Dokument vorkommen — weniger ist schneller und genauer.
  3. Starte die OCR und kopiere danach den Text oder lade ein durchsuchbares PDF herunter.

Warum nichts hochgeladen wird

Alles, was auf dieser Seite passiert, erledigt Code, der im Tab deines Browsers läuft — mit derselben Engine, die auch Webseiten darstellt. Die Datei wird von der Festplatte in den Speicher des Tabs gelesen, dort umgewandelt und als Download wieder herausgeschrieben. Sie wird nirgendwohin geschickt — weder zu uns noch zu Dritten.

Prüf es selbst nach

  1. Öffne die Entwicklerwerkzeuge deines Browsers (F12) und wähle den Tab „Netzwerk“.
  2. Lade deine Datei und starte das Werkzeug.
  3. Die einzigen Anfragen, die du siehst, holen den Code des Werkzeugs selbst — und bei ein paar schweren Werkzeugen dessen Open-Source-Engine von einem öffentlichen CDN — dazu ein kleines Seitenaufruf-Signal an loreatec.jp (Adresse und Titel der Seite, mehr nicht). Keine davon trägt deine Datei.

Beweis, dass alles lokal bleibt →

Häufige Fragen

Kommt es mit senkrechtem Japanisch zurecht?

Ja, mit dem eigenen Modell für senkrechten Text. Wähle es allein aus und nicht zusätzlich zum waagerechten: Beide zusammen bringen die Layout-Analyse durcheinander, und die Zeilen kommen ineinander verschachtelt heraus.

Was ist ein durchsuchbares PDF?

Das ursprüngliche Seitenbild mit einer unsichtbaren Textebene dahinter. Das Dokument sieht genau aus wie vorher, aber du kannst darin suchen, Text markieren und daraus kopieren. Es ist die Standardausgabe eines Dokumentenscanners, hier ohne Scanner erzeugt.

Wie genau ist es?

Bei sauberem gedrucktem Text mit 300 DPI sehr gut. Bei einem Handyfoto mit einem Schatten über der Seite mittelmäßig. Bei Handschrift schlecht — dafür wurde die OCR-Engine nicht gebaut, und keine Einstellung ändert daran etwas. Auflösung und gleichmäßiges Licht zählen mehr als jede Option hier.

Woher kommen die Sprachdaten?

Vom öffentlichen Daten-CDN der OCR-Engine, ein paar Megabyte pro Sprache, nach der ersten Nutzung im Cache. Die Bilder selbst werden nie irgendwohin geschickt: Hier zählt das am meisten, denn gescannte Dokumente sind meist die vertraulichen.