Eine Tabelle aus einem PDF holen

Die Zahlen stehen dort auf der Seite, und beim Abtippen schleichen sich die Fehler ein. Das Werkzeug liest, wo jedes Textstück auf der Seite sitzt, und baut daraus das Raster wieder auf.

Werkzeug wird geladen…

So funktioniert es

  1. Zieh das PDF herein — jede Seite mit erkennbarem Raster erscheint in der Seitenliste.
  2. Vergleiche die Vorschau mit dem Original.
  3. Lade die CSV herunter, oder kopiere die Tabelle als Markdown.

Warum nichts hochgeladen wird

Alles, was auf dieser Seite passiert, erledigt Code, der im Tab deines Browsers läuft — mit derselben Engine, die auch Webseiten darstellt. Die Datei wird von der Festplatte in den Speicher des Tabs gelesen, dort umgewandelt und als Download wieder herausgeschrieben. Sie wird nirgendwohin geschickt — weder zu uns noch zu Dritten.

Prüf es selbst nach

  1. Öffne die Entwicklerwerkzeuge deines Browsers (F12) und wähle den Tab „Netzwerk“.
  2. Lade deine Datei und starte das Werkzeug.
  3. Die einzigen Anfragen, die du siehst, holen den Code des Werkzeugs selbst — und bei ein paar schweren Werkzeugen dessen Open-Source-Engine von einem öffentlichen CDN — dazu ein kleines Seitenaufruf-Signal an loreatec.jp (Adresse und Titel der Seite, mehr nicht). Keine davon trägt deine Datei.

Beweis, dass alles lokal bleibt →

Häufige Fragen

Wie findet es die Tabelle, ohne die Linien zu sehen?

Es ignoriert die gezeichneten Linien vollständig und arbeitet mit dem Text selbst, jener unsichtbaren Ebene, die du markieren und kopieren kannst: Zeichen, die auf derselben Höhe liegen, werden zu Zeilen, und gleichmäßige waagerechte Abstände zu Spaltengrenzen. Deshalb kommt ein sauberes Raster gut heraus und ein künstlerisches Layout nicht.

Warum findet mein gescanntes PDF nichts?

Ein Scan hat keine Textebene — jede Seite ist eine einzige Fotografie. Schick ihn zuerst durch das OCR-Werkzeug (Texterkennung); sobald es echte Zeichen mit Positionen gibt, hat dieses Werkzeug etwas, womit es arbeiten kann.

Die Spalten sind leicht verrutscht. Was kann ich tun?

Verbundene Zellen, Umbrüche innerhalb einer Zelle und eng stehende Spalten sind allein aus Koordinaten wirklich mehrdeutig — das steht hier vorher da und nicht erst hinterher. Meist braucht die Ausgabe eine Minute Nacharbeit in der Tabellenkalkulation, und das schlägt das Abtippen immer noch.

Wird das PDF hochgeladen?

Nein. Bilanzen und Preislisten sind genau die Tabellen, die Menschen herausziehen — das Lesen passiert in diesem Tab, und das PDF geht nirgendwohin.