从图片和 PDF 中提取文字(OCR)

编译成 WebAssembly 的 Tesseract,跑在你自己的机器上。拖入照片或扫描版 PDF,把文字取出来 —— 或者得到一份看起来和原件一模一样、但可以搜索的 PDF。

正在加载工具……

工作原理

  1. 把图片或 PDF 拖进来。
  2. 勾选文档里实际出现的语言 —— 勾得越少,越快也越准。
  3. 运行 OCR,然后复制文字,或者下载可搜索的 PDF。

为什么什么都不用上传

这个页面上的每一步操作,都由运行在你浏览器标签页里的代码完成,用的就是渲染网页的那套引擎。文件从磁盘读进标签页的内存,在那里被处理,再作为下载写回去。它不会被送到任何地方 —— 不会送给我们,也不会送给第三方。

自己动手验证

  1. 打开浏览器的开发者工具(F12),选择“网络”(Network)面板。
  2. 载入你的文件,运行这个工具。
  3. 你能看到的请求只有这些:工具自己的代码 —— 少数几个重型工具还会从公共 CDN 取它们的开源引擎 —— 外加一条发往 loreatec.jp 的小小访问记录(页面地址和标题,仅此而已)。没有一条带着你的文件。

文件不外传的证明 →

常见问题

能处理竖排日文吗?

可以,用专门的竖排文字模型。请单独选它,不要和横排模型一起选:两个一起跑会打乱版面分析,行与行会交错在一起。

什么是可搜索的 PDF?

就是原来的页面图像,后面垫着一层看不见的文字。文档看上去和之前完全一样,但可以搜索、选中和复制文字。这是文档扫描仪的标准输出,这里不用扫描仪也能做出来。

准确率如何?

300 DPI 的干净印刷文字,非常好。页面上横着一道阴影的手机照片,一般。手写体,很差 —— OCR 引擎本来就不是为它设计的,怎么调设置都救不回来。分辨率和均匀的光线,比这里任何一个选项都更重要。

语言数据从哪里来?

来自 OCR 引擎的公开数据 CDN,每种语言几 MB,第一次用过之后会被缓存。图片本身不会被送到任何地方:这一点在这个工具上最要紧,因为扫描件往往正是机密文件。