Извлечь таблицу из PDF
Цифры уже есть на странице, и именно перепечатывание их вручную — источник ошибок. Инструмент читает, где на странице стоит каждый кусочек текста, и по этому восстанавливает сетку таблицы.
- Работает целиком в вашем браузере
- Работает без интернета
- Без отправки файлов
- Без регистрации
- Без водяных знаков
Загружаем инструмент…
Как это работает
- Перетащите PDF — каждая страница с распознаваемой сеткой появится в списке страниц.
- Сверьте предпросмотр с оригиналом.
- Скачайте CSV или скопируйте таблицу как Markdown.
Почему ничего не отправляется на сервер
Всё, что делает эта страница, выполняет код внутри вкладки вашего браузера — тем же движком, который рисует веб-страницы. Файл читается с диска в память вкладки, преобразуется там и записывается обратно как загружаемый файл. Он никуда не отправляется — ни нам, ни третьей стороне.
Проверьте сами
- Откройте инструменты разработчика в браузере (F12) и перейдите на вкладку «Сеть» (Network).
- Загрузите свой файл и запустите инструмент.
- Единственные запросы, которые вы увидите, — это код самого инструмента, а у нескольких тяжёлых инструментов ещё и их открытый движок из публичного CDN, плюс один небольшой сигнал о просмотре страницы на loreatec.jp (адрес и заголовок страницы, больше ничего). Ни один из них не несёт ваш файл.
Частые вопросы
Как он находит таблицу, не видя линий?
Он вообще не учитывает нарисованные линии и работает с самим текстом — невидимым слоем, который можно выделить и скопировать: символы, выровненные по вертикали, становятся строками, а равномерные промежутки по горизонтали — границами столбцов. Именно поэтому аккуратная сетка извлекается хорошо, а художественная вёрстка — нет.
Почему по моему сканированному PDF ничего не находится?
У скана нет текстового слоя — каждая страница это просто фотография. Сначала прогоните файл через инструмент OCR (распознавание текста); когда появятся настоящие символы с координатами, этому инструменту будет с чем работать.
Столбцы получились немного не такими. Что делать?
Объединённые ячейки, перенос текста внутри ячейки и плотно расположенные столбцы — это по-настоящему неоднозначные случаи, если судить только по координатам; об этом сказано сразу, а не обнаруживается потом. Обычно результат требует минуту правки в табличном редакторе — и это всё равно быстрее, чем перепечатывать таблицу вручную.
PDF отправляется на сервер?
Нет. Финансовые отчёты и прайс-листы — это и есть те самые таблицы, которые обычно извлекают, — чтение происходит в этой вкладке, и PDF никуда не уходит.