PDFから表を取り出す
数字はページの上に見えているのに、手で打ち直せば間違いが混ざります。各文字の位置情報を読んで、格子を組み立て直します。
- すべてブラウザ内で処理
- オフライン対応
- アップロードなし
- 登録不要
- 透かしなし
ツールを読み込み中…
使い方
- PDFをドロップします。格子を検出できたページが一覧に並びます。
- プレビューを原本と見比べます。
- CSVをダウンロードするか、Markdownとしてコピーします。
アップロードが不要な理由
このページの処理はすべて、ブラウザのタブ内で動くコードが行います。ファイルはディスクからタブのメモリに読み込まれ、その場で変換され、ダウンロードとして書き出されます。当社にも第三者にも送信されません。
ご自身で確認する方法
- ブラウザの開発者ツール(F12)を開き、「ネットワーク」タブを選びます。
- ファイルを読み込んでツールを実行します。
- 表示されるのは、ツール自身のコードの読み込みと、一部の重いツールでは公開CDNからのエンジン取得、それに loreatec.jp への小さなアクセス集計(ページのアドレスとタイトルだけ)です。あなたのファイルを運ぶ通信は1つもありません。
よくある質問
罫線を見ずにどうやって表を見つけるのですか?
描かれた線は完全に無視し、文字そのもの(選択・コピーできる不可視のテキスト層)だけを使います。縦に揃った文字が行になり、一貫した横の隙間が列の境界になります。整った格子がきれいに抽出でき、装飾的なレイアウトがうまくいかないのは、その仕組みゆえです。
スキャンしたPDFで何も見つからないのはなぜですか?
スキャンにはテキスト層がなく、各ページは1枚の写真だからです。先にOCR(文字認識)ツールにかけてください。位置情報を持つ実際の文字ができれば、このツールにも扱える材料ができます。
列が少しずれました。どうすればいいですか?
結合セル、セル内の折り返し、詰まった列は、座標だけからは本当に曖昧です。後で気づかせるより先に言っておきます。たいていは表計算ソフトで1分の手直しが要りますが、それでも全部打ち直すよりは速いはずです。
PDFはアップロードされますか?
されません。人が抽出したがる表はまさに決算書や価格表です。解析はこのタブ内で行われ、PDFはどこにも行きません。