Извлечь таблицу из PDF

Цифры уже есть на странице, и именно перепечатывание их вручную — источник ошибок. Инструмент читает, где на странице стоит каждый кусочек текста, и по этому восстанавливает сетку таблицы.

Загружаем инструмент…

Как это работает

  1. Перетащите PDF — каждая страница с распознаваемой сеткой появится в списке страниц.
  2. Сверьте предпросмотр с оригиналом.
  3. Скачайте CSV или скопируйте таблицу как Markdown.

Почему ничего не отправляется на сервер

Всё, что делает эта страница, выполняет код внутри вкладки вашего браузера — тем же движком, который рисует веб-страницы. Файл читается с диска в память вкладки, преобразуется там и записывается обратно как загружаемый файл. Он никуда не отправляется — ни нам, ни третьей стороне.

Проверьте сами

  1. Откройте инструменты разработчика в браузере (F12) и перейдите на вкладку «Сеть» (Network).
  2. Загрузите свой файл и запустите инструмент.
  3. Единственные запросы, которые вы увидите, — это код самого инструмента, а у нескольких тяжёлых инструментов ещё и их открытый движок из публичного CDN, плюс один небольшой сигнал о просмотре страницы на loreatec.jp (адрес и заголовок страницы, больше ничего). Ни один из них не несёт ваш файл.

Проверьте, что файлы не уходят →

Частые вопросы

Как он находит таблицу, не видя линий?

Он вообще не учитывает нарисованные линии и работает с самим текстом — невидимым слоем, который можно выделить и скопировать: символы, выровненные по вертикали, становятся строками, а равномерные промежутки по горизонтали — границами столбцов. Именно поэтому аккуратная сетка извлекается хорошо, а художественная вёрстка — нет.

Почему по моему сканированному PDF ничего не находится?

У скана нет текстового слоя — каждая страница это просто фотография. Сначала прогоните файл через инструмент OCR (распознавание текста); когда появятся настоящие символы с координатами, этому инструменту будет с чем работать.

Столбцы получились немного не такими. Что делать?

Объединённые ячейки, перенос текста внутри ячейки и плотно расположенные столбцы — это по-настоящему неоднозначные случаи, если судить только по координатам; об этом сказано сразу, а не обнаруживается потом. Обычно результат требует минуту правки в табличном редакторе — и это всё равно быстрее, чем перепечатывать таблицу вручную.

PDF отправляется на сервер?

Нет. Финансовые отчёты и прайс-листы — это и есть те самые таблицы, которые обычно извлекают, — чтение происходит в этой вкладке, и PDF никуда не уходит.