Извлечение текста из изображений и PDF (OCR)
Tesseract, скомпилированный в WebAssembly и работающий на вашей машине. Перетащите фотографии или отсканированный PDF и достаньте текст — или получите PDF с поиском, выглядящий точно как оригинал.
- Работает целиком в вашем браузере
- Работает без интернета
- Без отправки файлов
- Без регистрации
- Без водяных знаков
Загружаем инструмент…
Как это работает
- Перетащите изображения или PDF.
- Отметьте языки, которые есть в документе, — чем их меньше, тем быстрее и точнее.
- Запустите OCR, затем скопируйте текст или скачайте PDF с поиском.
Почему ничего не отправляется на сервер
Всё, что делает эта страница, выполняет код внутри вкладки вашего браузера — тем же движком, который рисует веб-страницы. Файл читается с диска в память вкладки, преобразуется там и записывается обратно как загружаемый файл. Он никуда не отправляется — ни нам, ни третьей стороне.
Проверьте сами
- Откройте инструменты разработчика в браузере (F12) и перейдите на вкладку «Сеть» (Network).
- Загрузите свой файл и запустите инструмент.
- Единственные запросы, которые вы увидите, — это код самого инструмента, а у нескольких тяжёлых инструментов ещё и их открытый движок из публичного CDN, плюс один небольшой сигнал о просмотре страницы на loreatec.jp (адрес и заголовок страницы, больше ничего). Ни один из них не несёт ваш файл.
Частые вопросы
Справляется ли он с вертикальным японским?
Да, со специальной моделью для вертикального текста. Выбирайте её отдельно, а не вместе с горизонтальной: если включить обе, разбор вёрстки сбивается и строки идут вперемешку.
Что такое PDF с поиском?
Это исходное изображение страницы с невидимым текстовым слоем, размещённым под ним. Документ выглядит ровно так же, как раньше, но в нём можно искать, выделять и копировать текст. Так обычно выдаёт документ офисный сканер — здесь то же самое получается без сканера.
Насколько это точно?
На чистом печатном тексте в 300 DPI — очень хорошо. На снятой телефоном странице с тенью поперёк — посредственно. На рукописном тексте — плохо: движок OCR для этого не создавался, и никакие настройки этого не исправят. Разрешение и ровный свет здесь важнее любой опции.
Откуда берутся языковые данные?
С публичного CDN с данными движка OCR, по несколько мегабайт на язык; после первого раза они остаются в кэше. Сами изображения никуда не отправляются: именно здесь это важнее всего, потому что сканируют обычно как раз конфиденциальное.