从 PDF 里提取表格

数字明明就印在页面上,重新敲一遍反而是出错的地方。这个工具读取每个字在页面上的位置,把网格重新拼出来。

正在加载工具……

工作原理

  1. 拖入 PDF —— 每一页只要能识别出网格,就会出现在页面列表里。
  2. 对照原文核对预览效果。
  3. 下载 CSV,或者把表格复制成 Markdown。

为什么什么都不用上传

这个页面上的每一步操作,都由运行在你浏览器标签页里的代码完成,用的就是渲染网页的那套引擎。文件从磁盘读进标签页的内存,在那里被处理,再作为下载写回去。它不会被送到任何地方 —— 不会送给我们,也不会送给第三方。

自己动手验证

  1. 打开浏览器的开发者工具(F12),选择“网络”(Network)面板。
  2. 载入你的文件,运行这个工具。
  3. 你能看到的请求只有这些:工具自己的代码 —— 少数几个重型工具还会从公共 CDN 取它们的开源引擎 —— 外加一条发往 loreatec.jp 的小小访问记录(页面地址和标题,仅此而已)。没有一条带着你的文件。

文件不外传的证明 →

常见问题

看不到线条,它是怎么找到表格的?

它完全不看画出来的线条,靠的是文字本身 —— 就是你能选中、复制的那层看不见的文字:竖直方向对齐的字符变成行,间距一致的水平空隙变成列的分界。这也是为什么一张干净的网格能提取得很好,而有设计感的版面不行。

扫描的 PDF 为什么什么都提取不出来?

扫描件没有文字层 —— 每一页其实都是一张照片。先用 OCR(文字识别)工具处理一遍;有了带位置信息的真实字符之后,这个工具才有东西可以处理。

列对得不太准,能怎么办?

合并单元格、单元格内的自动换行、挤得很紧的列,光靠坐标确实分不清楚 —— 这一点提前说明,而不是等你用了才发现。通常结果只需要在表格软件里花一分钟清理一下,这也还是比重新敲一遍表格划算。

PDF 会被上传吗?

不会。财务报表和价目表正是大家最想提取的那种表格 —— 读取过程就在这个标签页里完成,PDF 不会去任何地方。