PDFからテキストを安全に抽出 — すべてブラウザ内で動作

PDFを選ぶと、各ページのテキストレイヤーがブラウザ内でローカルに抽出され、ダウンロード可能なテキストファイルとして提供されます。アップロードはありません。

Quick answer

What it does
PDFを選ぶと、各ページのテキストレイヤーがブラウザ内でローカルに抽出され、ダウンロード可能なテキストファイルとして提供されます。アップロードはありません。
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
固定レイアウトPDFから契約条件をテキストエディタにコピーしてレビューや比較を行う。
Good to know
本ツールが抽出できるのは、PDFにテキストレイヤーとして埋め込まれているテキストだけです。スキャンしたPDFや画像だけのPDFにはテキストレイヤーがないため、テキストは抽出されません。

How it works

  1. ファイル選択ボタンから、端末内のPDFファイルを選びます。
  2. ファイルはブラウザのメモリに読み込まれます。データがブラウザの外へ出ることはありません。
  3. pdf.jsがWeb Worker内で文書を読み込み、各ページで getTextContent() を呼び出して、埋め込まれたテキストレイヤーを取得します。
  4. 全ページから抽出したテキストを順番にまとめ、ダウンロード可能な .txt ファイルとして提供します。
  5. ダウンロードが完了すると、一時的なデータはメモリから解放されます。

When to use this tool

  • 固定レイアウトPDFから契約条件をテキストエディタにコピーしてレビューや比較を行う。
  • 研究論文PDFから本文テキストを取り出し、翻訳や要約ツールに貼り付ける。
  • PDFから請求書の明細データを取り出し、スプレッドシートへのインポートの第一歩とする。
  • 注:テキストレイヤーが埋め込まれたPDFにのみ対応 — スキャンまたは画像のみのPDFからはテキストを抽出できません。

Frequently asked questions

ほかのオンラインPDFツールと何が違いますか?
多くのオンラインPDFツールは、処理のためにファイルをリモートサーバーへ送信します。本ツールはクライアントサイドのJavaScriptを使い、すべての処理をブラウザ内で完結させます。ファイルがサーバーに送信されることはなく、書類の内容は手元から離れません。
PDFファイルはアップロードされますか?
いいえ。ファイルはブラウザが直接読み込みます。ファイルがネットワーク経由で送信されることはありません。本ツールは開いているブラウザのタブ内だけで動作します。
ファイルがアップロードされていないことを自分で確認できますか?
はい。ブラウザの開発者ツール(F12)を開いてネットワークタブを表示し、ツールの使用中に外部への通信が発生しないかを確認できます。ファイルのデータがブラウザの外へ出ていかないことが分かります。サイトが匿名のページビュー数を記録する場合がありますが、ファイルの内容は含まれず、無効にすることもできます。
オフラインでも使えますか?
はい。ページの読み込みが終われば、ファイルの処理はすべてブラウザ内で行われます。ツールの機能にネットワーク接続は必要ありません。インターネットを切断したまま使い続けられます。
ページを再読み込みするとどうなりますか?
サーバーには何も保存されないため、ページを再読み込みすると現在の作業内容はリセットされます。選択していたファイルは選び直す必要があります。
このツールはファイルを保存しますか?
いいえ。ファイルはページを開いている間だけブラウザのメモリ上に保持されます。ページを閉じたり再読み込みしたりすると破棄されます。ツールがディスクに書き込むことはなく、サーバーへ送信されることもありません。
パスワード付きPDFのロックを解除できますか?
いいえ。本ツールはPDFのパスワード保護を解除したり回避したりはしません。パスワードが分かっている場合は、本サイトの「PDFのパスワード解除」ツールでローカルにパスワードを取り除いてから、本ツールで処理できます。
このツールはどんな技術を使っていますか?
本ツールは、Mozillaのクライアントサイド向けPDFエンジンであるpdf.jsをWeb Worker内で動かし、ブラウザ内で各ページに埋め込まれたテキストレイヤーを読み取ります。ファイルがブラウザの外に出ることはありません。
このツールはWebAssemblyを使っていますか?
いいえ。pdf.jsは純粋なJavaScriptライブラリで、WebAssemblyは使いません。PDFのテキスト抽出はすべて、ブラウザ内のクライアントサイドJavaScriptで行われます。
PDFからテキストを抽出するにはどうすればよいですか?
ファイル選択ボタンでPDFを選び、抽出ボタンを押します。各ページのテキストはブラウザ内でローカルに読み込まれ、プレビュー欄に表示され、.txtファイルとして保存できます。
スキャンしたPDFからテキストが返ってこなかったのはなぜですか?
本ツールはPDFが保持している埋め込みテキストレイヤーを読み取りますが、スキャンした書類や画像のみの書類にはそのレイヤーがないため、何も取り出せません。その場合は通知が表示され、テキストファイルは提供されません。OCRなしでは復元できる文字データがないためです。
抽出したテキストがページの見た目のレイアウトと一致しないのはなぜですか?
本ツールは各ページについてpdf.jsが報告するテキスト項目をたどり、その改行を保持しますが、段組みのリフローは行わないため、複数段組みのページ、表、複雑なレイアウトは画面の見た目と揃わないことがあります。ページは空行で連結され、また独特なフォントエンコーディングやカスタムフォントエンコーディングのPDFは、ページの見た目に問題がなくても文字化けが生じることがあります。
Extract Text from PDF の使用に費用はかかりますか?
Extract Text from PDF は完全に無料です。アカウント不要、サインアップ不要、処理するPDFの数に制限もなく、今後もずっと無料です。PDFは pdf.js を使用してお使いのブラウザが直接読み込み、埋め込まれたテキスト層をページごとに抽出してプレーンな .txt ファイルとして提供します。ファイル自体はブラウザのメモリ内に完全にとどまり、どこにも送信されることはありません。

Related tools

  • PDF を画像に変換
  • PDF を分割
  • ページを整理
  • 画像を PDF に変換
  • オールインワン PDF エディター
  • ホーム
  • オールインワン PDF エディター
  • PDF を結合
  • PDF を分割
  • PDF を回転
  • 透かしを追加
  • 画像を PDF に変換
  • PDF を画像に変換
  • ページ番号
  • PDF を圧縮
  • テキストを抽出
  • メタデータを編集
  • ページを整理
  • 空白ページを挿入
  • ページを抽出
  • N-up (1 枚あたりのページ数)
  • PDF をグレースケール化
  • PDF をトリミング
  • ページを逆順に
  • リサイズ (A4/Letter)
  • ヘッダーとフッターを追加
  • フォームをフラット化
  • N ページごとに分割
  • PDF 情報とメタデータ
  • 画像/署名をスタンプ
  • ページを削除
  • タイル状の透かし
  • 小冊子
  • ページを複製
  • ファイルを添付
  • パーセントで拡大縮小
  • 空白ページを削除
  • 交互に結合
  • ページ枠線を追加
  • 奇数/偶数ページを抽出
  • PDF を縦長画像に変換
  • ページを半分に分割
  • 余白を追加
  • PDF に署名
  • PDF を比較
  • ポスター分割
  • 文字数カウント
  • PDF を修復
  • PDF フォームに入力
  • しおりで分割
  • 検索と強調表示
  • 画像を抽出
  • PDF を黒塗り
  • OCR (スキャンをテキスト化)
  • PDF を保護
  • PDF のロックを解除
  • サイトについて
  • プライバシーポリシー
  • お問い合わせ
  • 仕組みを見る
  • ローカル vs オンラインPDFツール
  • オンラインPDFツールは安全?