PDFから表を取り出す

数字はページの上に見えているのに、手で打ち直せば間違いが混ざります。各文字の位置情報を読んで、格子を組み立て直します。

ツールを読み込み中…

使い方

  1. PDFをドロップします。格子を検出できたページが一覧に並びます。
  2. プレビューを原本と見比べます。
  3. CSVをダウンロードするか、Markdownとしてコピーします。

アップロードが不要な理由

このページの処理はすべて、ブラウザのタブ内で動くコードが行います。ファイルはディスクからタブのメモリに読み込まれ、その場で変換され、ダウンロードとして書き出されます。当社にも第三者にも送信されません。

ご自身で確認する方法

  1. ブラウザの開発者ツール(F12)を開き、「ネットワーク」タブを選びます。
  2. ファイルを読み込んでツールを実行します。
  3. 表示されるのは、ツール自身のコードの読み込みと、一部の重いツールでは公開CDNからのエンジン取得、それに loreatec.jp への小さなアクセス集計(ページのアドレスとタイトルだけ)です。あなたのファイルを運ぶ通信は1つもありません。

外部送信ゼロの確認方法 →

よくある質問

罫線を見ずにどうやって表を見つけるのですか?

描かれた線は完全に無視し、文字そのもの(選択・コピーできる不可視のテキスト層)だけを使います。縦に揃った文字が行になり、一貫した横の隙間が列の境界になります。整った格子がきれいに抽出でき、装飾的なレイアウトがうまくいかないのは、その仕組みゆえです。

スキャンしたPDFで何も見つからないのはなぜですか?

スキャンにはテキスト層がなく、各ページは1枚の写真だからです。先にOCR(文字認識)ツールにかけてください。位置情報を持つ実際の文字ができれば、このツールにも扱える材料ができます。

列が少しずれました。どうすればいいですか?

結合セル、セル内の折り返し、詰まった列は、座標だけからは本当に曖昧です。後で気づかせるより先に言っておきます。たいていは表計算ソフトで1分の手直しが要りますが、それでも全部打ち直すよりは速いはずです。

PDFはアップロードされますか?

されません。人が抽出したがる表はまさに決算書や価格表です。解析はこのタブ内で行われ、PDFはどこにも行きません。