从 PDF 里提取表格
数字明明就印在页面上,重新敲一遍反而是出错的地方。这个工具读取每个字在页面上的位置,把网格重新拼出来。
- 完全在你的浏览器里运行
- 断网也能用
- 不上传
- 不用注册
- 没有水印
正在加载工具……
工作原理
- 拖入 PDF —— 每一页只要能识别出网格,就会出现在页面列表里。
- 对照原文核对预览效果。
- 下载 CSV,或者把表格复制成 Markdown。
为什么什么都不用上传
这个页面上的每一步操作,都由运行在你浏览器标签页里的代码完成,用的就是渲染网页的那套引擎。文件从磁盘读进标签页的内存,在那里被处理,再作为下载写回去。它不会被送到任何地方 —— 不会送给我们,也不会送给第三方。
自己动手验证
- 打开浏览器的开发者工具(F12),选择“网络”(Network)面板。
- 载入你的文件,运行这个工具。
- 你能看到的请求只有这些:工具自己的代码 —— 少数几个重型工具还会从公共 CDN 取它们的开源引擎 —— 外加一条发往 loreatec.jp 的小小访问记录(页面地址和标题,仅此而已)。没有一条带着你的文件。
常见问题
看不到线条,它是怎么找到表格的?
它完全不看画出来的线条,靠的是文字本身 —— 就是你能选中、复制的那层看不见的文字:竖直方向对齐的字符变成行,间距一致的水平空隙变成列的分界。这也是为什么一张干净的网格能提取得很好,而有设计感的版面不行。
扫描的 PDF 为什么什么都提取不出来?
扫描件没有文字层 —— 每一页其实都是一张照片。先用 OCR(文字识别)工具处理一遍;有了带位置信息的真实字符之后,这个工具才有东西可以处理。
列对得不太准,能怎么办?
合并单元格、单元格内的自动换行、挤得很紧的列,光靠坐标确实分不清楚 —— 这一点提前说明,而不是等你用了才发现。通常结果只需要在表格软件里花一分钟清理一下,这也还是比重新敲一遍表格划算。
PDF 会被上传吗?
不会。财务报表和价目表正是大家最想提取的那种表格 —— 读取过程就在这个标签页里完成,PDF 不会去任何地方。