Een tabel uit een PDF halen
De cijfers staan gewoon op de pagina, en ze overtypen is hoe fouten erin sluipen. Dit leest waar elk stukje tekst op de pagina staat en bouwt het raster opnieuw op.
- Draait volledig in je browser
- Werkt offline
- Geen upload
- Geen registratie
- Geen watermerk
De tool wordt geladen…
Hoe het werkt
- Sleep de PDF erin — elke pagina met een herkenbaar raster verschijnt in de paginalijst.
- Vergelijk het voorbeeld met het origineel.
- Download de CSV, of kopieer de tabel als Markdown.
Waarom er niets wordt geüpload
Alles wat deze pagina doet, doet code die in je browsertabblad draait, met dezelfde engine die ook webpagina’s tekent. Je bestand wordt van schijf naar het geheugen van dat tabblad gelezen, daar bewerkt en weer weggeschreven als download. Het wordt nergens naartoe gestuurd — niet naar ons, en niet naar een derde partij.
Controleer het zelf
- Open de ontwikkelaarstools van je browser (F12) en kies het tabblad Netwerk.
- Laad je bestand en start de tool.
- De enige verzoeken die je ziet, halen de code van de tool zelf op — en bij een paar zware tools hun opensource-engine van een openbare CDN — plus één kleine bezoekmelding aan loreatec.jp (adres en titel van de pagina, meer niet). In geen van die verzoeken zit jouw bestand.
Veelgestelde vragen
Hoe vindt hij de tabel zonder lijnen te zien?
De getekende lijnen worden volledig genegeerd; de tool werkt vanuit de tekst zelf, de onzichtbare laag die je kunt selecteren en kopiëren: tekens die verticaal op één lijn staan worden rijen, en consistente horizontale tussenruimtes worden kolomgrenzen. Daarom wordt een net raster goed geëxtraheerd en een artistieke lay-out niet.
Waarom vindt hij niets in mijn gescande PDF?
Een scan heeft geen tekstlaag — elke pagina is één foto. Haal hem eerst door de OCR-tool (tekstherkenning); zodra er echte tekens met posities zijn, heeft deze tool iets om mee te werken.
De kolommen kwamen er net niet goed uit. Wat kan ik doen?
Samengevoegde cellen, tekst die binnen een cel afbreekt en dicht opeengepakte kolommen zijn puur op basis van coördinaten echt dubbelzinnig — dat wordt hier vooraf gezegd in plaats van achteraf ontdekt. Meestal is een minuutje opschonen in een spreadsheet genoeg, en dat is nog steeds sneller dan de hele tabel overtypen.
Wordt de PDF geüpload?
Nee. Jaarrekeningen en prijslijsten zijn nu precies de tabellen die mensen willen extraheren — het lezen gebeurt in dit tabblad en de PDF gaat nergens heen.