PDFからテキストを安全に抽出 — すべてブラウザ内で動作
PDFを選ぶと、各ページのテキストレイヤーがブラウザ内でローカルに抽出され、ダウンロード可能なテキストファイルとして提供されます。アップロードはありません。
Quick answer
What it does PDFを選ぶと、各ページのテキストレイヤーがブラウザ内でローカルに抽出され、ダウンロード可能なテキストファイルとして提供されます。アップロードはありません。
Free? Yes — 100% free, no account or sign-up.
Files uploaded? No — everything is processed in your browser.
Works offline? Yes — once the page has loaded.
Best for 固定レイアウトPDFから契約条件をテキストエディタにコピーしてレビューや比較を行う。
Good to know 本ツールが抽出できるのは、PDFにテキストレイヤーとして埋め込まれているテキストだけです。スキャンしたPDFや画像だけのPDFにはテキストレイヤーがないため、テキストは抽出されません。
How it works
ファイル選択ボタンから、端末内のPDFファイルを選びます。
ファイルはブラウザのメモリに読み込まれます。データがブラウザの外へ出ることはありません。
pdf.jsがWeb Worker内で文書を読み込み、各ページで getTextContent() を呼び出して、埋め込まれたテキストレイヤーを取得します。
全ページから抽出したテキストを順番にまとめ、ダウンロード可能な .txt ファイルとして提供します。
ダウンロードが完了すると、一時的なデータはメモリから解放されます。
When to use this tool
固定レイアウトPDFから契約条件をテキストエディタにコピーしてレビューや比較を行う。
研究論文PDFから本文テキストを取り出し、翻訳や要約ツールに貼り付ける。
PDFから請求書の明細データを取り出し、スプレッドシートへのインポートの第一歩とする。
注:テキストレイヤーが埋め込まれたPDFにのみ対応 — スキャンまたは画像のみのPDFからはテキストを抽出できません。
Frequently asked questions
ほかのオンラインPDFツールと何が違いますか?
多くのオンラインPDFツールは、処理のためにファイルをリモートサーバーへ送信します。本ツールはクライアントサイドのJavaScriptを使い、すべての処理をブラウザ内で完結させます。ファイルがサーバーに送信されることはなく、書類の内容は手元から離れません。
PDFファイルはアップロードされますか?
いいえ。ファイルはブラウザが直接読み込みます。ファイルがネットワーク経由で送信されることはありません。本ツールは開いているブラウザのタブ内だけで動作します。
ファイルがアップロードされていないことを自分で確認できますか?
はい。ブラウザの開発者ツール(F12)を開いてネットワークタブを表示し、ツールの使用中に外部への通信が発生しないかを確認できます。ファイルのデータがブラウザの外へ出ていかないことが分かります。サイトが匿名のページビュー数を記録する場合がありますが、ファイルの内容は含まれず、無効にすることもできます。
オフラインでも使えますか?
はい。ページの読み込みが終われば、ファイルの処理はすべてブラウザ内で行われます。ツールの機能にネットワーク接続は必要ありません。インターネットを切断したまま使い続けられます。
ページを再読み込みするとどうなりますか?
サーバーには何も保存されないため、ページを再読み込みすると現在の作業内容はリセットされます。選択していたファイルは選び直す必要があります。
このツールはファイルを保存しますか?
いいえ。ファイルはページを開いている間だけブラウザのメモリ上に保持されます。ページを閉じたり再読み込みしたりすると破棄されます。ツールがディスクに書き込むことはなく、サーバーへ送信されることもありません。
パスワード付きPDFのロックを解除できますか?
いいえ。本ツールはPDFのパスワード保護を解除したり回避したりはしません。パスワードが分かっている場合は、本サイトの「PDFのパスワード解除」ツールでローカルにパスワードを取り除いてから、本ツールで処理できます。
このツールはどんな技術を使っていますか?
本ツールは、Mozillaのクライアントサイド向けPDFエンジンであるpdf.jsをWeb Worker内で動かし、ブラウザ内で各ページに埋め込まれたテキストレイヤーを読み取ります。ファイルがブラウザの外に出ることはありません。
このツールはWebAssemblyを使っていますか?
いいえ。pdf.jsは純粋なJavaScriptライブラリで、WebAssemblyは使いません。PDFのテキスト抽出はすべて、ブラウザ内のクライアントサイドJavaScriptで行われます。
PDFからテキストを抽出するにはどうすればよいですか?
ファイル選択ボタンでPDFを選び、抽出ボタンを押します。各ページのテキストはブラウザ内でローカルに読み込まれ、プレビュー欄に表示され、.txtファイルとして保存できます。
スキャンしたPDFからテキストが返ってこなかったのはなぜですか?
本ツールはPDFが保持している埋め込みテキストレイヤーを読み取りますが、スキャンした書類や画像のみの書類にはそのレイヤーがないため、何も取り出せません。その場合は通知が表示され、テキストファイルは提供されません。OCRなしでは復元できる文字データがないためです。
抽出したテキストがページの見た目のレイアウトと一致しないのはなぜですか?
本ツールは各ページについてpdf.jsが報告するテキスト項目をたどり、その改行を保持しますが、段組みのリフローは行わないため、複数段組みのページ、表、複雑なレイアウトは画面の見た目と揃わないことがあります。ページは空行で連結され、また独特なフォントエンコーディングやカスタムフォントエンコーディングのPDFは、ページの見た目に問題がなくても文字化けが生じることがあります。
Extract Text from PDF の使用に費用はかかりますか?
Extract Text from PDF は完全に無料です。アカウント不要、サインアップ不要、処理するPDFの数に制限もなく、今後もずっと無料です。PDFは pdf.js を使用してお使いのブラウザが直接読み込み、埋め込まれたテキスト層をページごとに抽出してプレーンな .txt ファイルとして提供します。ファイル自体はブラウザのメモリ内に完全にとどまり、どこにも送信されることはありません。
Related tools