スキャンしたPDFを安全にOCR — ブラウザ内で文字を認識

スキャンしたPDFと言語を選ぶと、各ページが描画され、Tesseract(WebAssemblyにコンパイル)によってローカルで認識され、認識されたテキストが表示されて .txt ファイルとしてダウンロードできます。

Quick answer

What it does
スキャンしたPDFと言語を選ぶと、各ページが描画され、Tesseract(WebAssemblyにコンパイル)によってローカルで認識され、認識されたテキストが表示されて .txt ファイルとしてダウンロードできます。
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
経理担当者がスキャンした請求書にOCRを適用して再入力せずに明細金額をスプレッドシートにコピーする。
Good to know
このバージョンで対応しているのは英語と繁体字中国語です。

How it works

  1. 端末からスキャンしたPDFを選び、文書の言語を選びます。
  2. ファイルはブラウザのメモリに読み込まれます。データがブラウザの外へ出ることはありません。
  3. pdf.jsがWeb Worker内で各ページを画像に描画します。
  4. WebAssemblyにコンパイルされ本サイトから配信されるTesseract OCRが、各ページの文字をローカルで認識します。言語モデルも第三者のCDNではなく本サイトから読み込まれます。
  5. 認識されたテキストがページごとに表示され、.txt ファイルとしてダウンロードできます。

When to use this tool

  • 経理担当者がスキャンした請求書にOCRを適用して再入力せずに明細金額をスプレッドシートにコピーする。
  • 学生がスキャンした講義配布資料にOCRを適用してノート用の検索・コピー可能なテキストを取得する。
  • アーキビストがスキャンした繁体字中国語文書をデジタルライブラリ用の検索可能なテキストに変換する。
  • OCRの精度はスキャン品質に依存します — ぼやけた、傾いた、または低解像度のページではエラーが生じる場合があります。出力はベストエフォートの下書きとして扱ってください。

Frequently asked questions

ほかのオンラインPDFツールと何が違いますか?
多くのオンラインPDFツールは、処理のためにファイルをリモートサーバーへ送信します。本ツールはクライアントサイドのJavaScriptを使い、すべての処理をブラウザ内で完結させます。ファイルがサーバーに送信されることはなく、書類の内容は手元から離れません。
PDFファイルはアップロードされますか?
いいえ。ファイルはブラウザが直接読み込みます。ファイルがネットワーク経由で送信されることはありません。本ツールは開いているブラウザのタブ内だけで動作します。
ファイルがアップロードされていないことを自分で確認できますか?
はい。ブラウザの開発者ツール(F12)を開いてネットワークタブを表示し、ツールの使用中に外部への通信が発生しないかを確認できます。ファイルのデータがブラウザの外へ出ていかないことが分かります。サイトが匿名のページビュー数を記録する場合がありますが、ファイルの内容は含まれず、無効にすることもできます。
オフラインでも使えますか?
はい。ページの読み込みが終われば、ファイルの処理はすべてブラウザ内で行われます。ツールの機能にネットワーク接続は必要ありません。インターネットを切断したまま使い続けられます。
ページを再読み込みするとどうなりますか?
サーバーには何も保存されないため、ページを再読み込みすると現在の作業内容はリセットされます。選択していたファイルは選び直す必要があります。
このツールはファイルを保存しますか?
いいえ。ファイルはページを開いている間だけブラウザのメモリ上に保持されます。ページを閉じたり再読み込みしたりすると破棄されます。ツールがディスクに書き込むことはなく、サーバーへ送信されることもありません。
パスワード付きPDFのロックを解除できますか?
いいえ。本ツールはPDFのパスワード保護を解除したり回避したりはしません。パスワードが分かっている場合は、本サイトの「PDFのパスワード解除」ツールでローカルにパスワードを取り除いてから、本ツールで処理できます。
このツールはどんな技術を使っていますか?
本ツールは、pdf.jsでページを描画し、WebAssemblyにコンパイルされたTesseract OCRエンジン(tesseract.js)を同一オリジンのWeb Worker内で動かします。ファイルはブラウザの外に出ません。
このツールはWebAssemblyを使っていますか?
はい。本サイトでWebAssemblyを使う数少ないツールのひとつです。Tesseract OCRエンジンはWebAssemblyにコンパイルされたC++で、ブラウザ内で動作します。.wasmバイナリは本サイトから配信され、データがどこかへ送信されることはありません。
最初の実行が次回以降より遅いのはなぜですか?
初回利用時に、ブラウザがOCRエンジンと言語モデル(数メガバイト)を本サイトから読み込み、コンパイルします。その後はキャッシュされるため、次回以降の起動はずっと速くなります。
ここでスキャンしたPDFをOCRするにはどうすればよいですか?
端末内からスキャンしたPDFを選び、書類の言語(英語または繁体字中国語)を指定して、「認識」を選びます。各ページがローカルでレンダリングされ読み取られ、終わるとテキストをプレビューして.txtファイルとして保存できます。
認識したテキストが、検索可能なPDFではなく.txtファイルになるのはなぜですか?
本ツールは、認識した文字を見えないテキストレイヤーとしてPDFに書き戻すのではなく、プレーンテキストとして出力します。そのため、元のスキャンしたPDFは変更されません。文字をページの中に入れたい場合は、保存した.txtか、ページごとにテキストを一覧表示する画面上のプレビューからコピーすることになります。
同じ書類で2つの言語を処理できますか。また、間違った言語を選んだ場合はどうなりますか?
認識の前に書類全体で1つの言語を選ぶため、英語と繁体字中国語が混在するファイルでは、選んだほうの言語が優先されます。認識の精度はスキャン自体にも左右されるため、傾いていたり、低解像度だったり、手書きのページは、言語にかかわらず結果が悪くなりがちです。
OCR PDFツールは有料ですか?
OCR PDFツールは完全無料です。アカウントも登録も不要で、何件のスキャンPDFを処理しても上限はなく、これからもずっと無料です。各ページはWebAssemblyにコンパイルされたTesseract OCRエンジンを使ってブラウザ内で直接認識されるため、契約書・身分証明書・医療記録などを含むスキャン済みドキュメントがどこかに送信されることは一切ありません。

Related tools

  • テキストを抽出
  • 文字数カウント
  • PDF を画像に変換
  • PDF を圧縮
  • オールインワン PDF エディター
  • ホーム
  • オールインワン PDF エディター
  • PDF を結合
  • PDF を分割
  • PDF を回転
  • 透かしを追加
  • 画像を PDF に変換
  • PDF を画像に変換
  • ページ番号
  • PDF を圧縮
  • テキストを抽出
  • メタデータを編集
  • ページを整理
  • 空白ページを挿入
  • ページを抽出
  • N-up (1 枚あたりのページ数)
  • PDF をグレースケール化
  • PDF をトリミング
  • ページを逆順に
  • リサイズ (A4/Letter)
  • ヘッダーとフッターを追加
  • フォームをフラット化
  • N ページごとに分割
  • PDF 情報とメタデータ
  • 画像/署名をスタンプ
  • ページを削除
  • タイル状の透かし
  • 小冊子
  • ページを複製
  • ファイルを添付
  • パーセントで拡大縮小
  • 空白ページを削除
  • 交互に結合
  • ページ枠線を追加
  • 奇数/偶数ページを抽出
  • PDF を縦長画像に変換
  • ページを半分に分割
  • 余白を追加
  • PDF に署名
  • PDF を比較
  • ポスター分割
  • 文字数カウント
  • PDF を修復
  • PDF フォームに入力
  • しおりで分割
  • 検索と強調表示
  • 画像を抽出
  • PDF を黒塗り
  • OCR (スキャンをテキスト化)
  • PDF を保護
  • PDF のロックを解除
  • サイトについて
  • プライバシーポリシー
  • お問い合わせ
  • 仕組みを見る
  • ローカル vs オンラインPDFツール
  • オンラインPDFツールは安全?