Извлечение текста из изображений и PDF (OCR)

Tesseract, скомпилированный в WebAssembly и работающий на вашей машине. Перетащите фотографии или отсканированный PDF и достаньте текст — или получите PDF с поиском, выглядящий точно как оригинал.

Загружаем инструмент…

Как это работает

  1. Перетащите изображения или PDF.
  2. Отметьте языки, которые есть в документе, — чем их меньше, тем быстрее и точнее.
  3. Запустите OCR, затем скопируйте текст или скачайте PDF с поиском.

Почему ничего не отправляется на сервер

Всё, что делает эта страница, выполняет код внутри вкладки вашего браузера — тем же движком, который рисует веб-страницы. Файл читается с диска в память вкладки, преобразуется там и записывается обратно как загружаемый файл. Он никуда не отправляется — ни нам, ни третьей стороне.

Проверьте сами

  1. Откройте инструменты разработчика в браузере (F12) и перейдите на вкладку «Сеть» (Network).
  2. Загрузите свой файл и запустите инструмент.
  3. Единственные запросы, которые вы увидите, — это код самого инструмента, а у нескольких тяжёлых инструментов ещё и их открытый движок из публичного CDN, плюс один небольшой сигнал о просмотре страницы на loreatec.jp (адрес и заголовок страницы, больше ничего). Ни один из них не несёт ваш файл.

Проверьте, что файлы не уходят →

Частые вопросы

Справляется ли он с вертикальным японским?

Да, со специальной моделью для вертикального текста. Выбирайте её отдельно, а не вместе с горизонтальной: если включить обе, разбор вёрстки сбивается и строки идут вперемешку.

Что такое PDF с поиском?

Это исходное изображение страницы с невидимым текстовым слоем, размещённым под ним. Документ выглядит ровно так же, как раньше, но в нём можно искать, выделять и копировать текст. Так обычно выдаёт документ офисный сканер — здесь то же самое получается без сканера.

Насколько это точно?

На чистом печатном тексте в 300 DPI — очень хорошо. На снятой телефоном странице с тенью поперёк — посредственно. На рукописном тексте — плохо: движок OCR для этого не создавался, и никакие настройки этого не исправят. Разрешение и ровный свет здесь важнее любой опции.

Откуда берутся языковые данные?

С публичного CDN с данными движка OCR, по несколько мегабайт на язык; после первого раза они остаются в кэше. Сами изображения никуда не отправляются: именно здесь это важнее всего, потому что сканируют обычно как раз конфиденциальное.