スキャンしたPDFを安全にOCR — ブラウザ内で文字を認識
スキャンしたPDFと言語を選ぶと、各ページが描画され、Tesseract(WebAssemblyにコンパイル)によってローカルで認識され、認識されたテキストが表示されて .txt ファイルとしてダウンロードできます。
Quick answer
- What it does
- スキャンしたPDFと言語を選ぶと、各ページが描画され、Tesseract(WebAssemblyにコンパイル)によってローカルで認識され、認識されたテキストが表示されて .txt ファイルとしてダウンロードできます。
- Free?
- Yes — 100% free, no account or sign-up.
- Files uploaded?
- No — everything is processed in your browser.
- Works offline?
- Yes — once the page has loaded.
- Best for
- 経理担当者がスキャンした請求書にOCRを適用して再入力せずに明細金額をスプレッドシートにコピーする。
- Good to know
- このバージョンで対応しているのは英語と繁体字中国語です。
How it works
- 端末からスキャンしたPDFを選び、文書の言語を選びます。
- ファイルはブラウザのメモリに読み込まれます。データがブラウザの外へ出ることはありません。
- pdf.jsがWeb Worker内で各ページを画像に描画します。
- WebAssemblyにコンパイルされ本サイトから配信されるTesseract OCRが、各ページの文字をローカルで認識します。言語モデルも第三者のCDNではなく本サイトから読み込まれます。
- 認識されたテキストがページごとに表示され、.txt ファイルとしてダウンロードできます。
When to use this tool
- 経理担当者がスキャンした請求書にOCRを適用して再入力せずに明細金額をスプレッドシートにコピーする。
- 学生がスキャンした講義配布資料にOCRを適用してノート用の検索・コピー可能なテキストを取得する。
- アーキビストがスキャンした繁体字中国語文書をデジタルライブラリ用の検索可能なテキストに変換する。
- OCRの精度はスキャン品質に依存します — ぼやけた、傾いた、または低解像度のページではエラーが生じる場合があります。出力はベストエフォートの下書きとして扱ってください。
Frequently asked questions
- ほかのオンラインPDFツールと何が違いますか?
- 多くのオンラインPDFツールは、処理のためにファイルをリモートサーバーへ送信します。本ツールはクライアントサイドのJavaScriptを使い、すべての処理をブラウザ内で完結させます。ファイルがサーバーに送信されることはなく、書類の内容は手元から離れません。
- PDFファイルはアップロードされますか?
- いいえ。ファイルはブラウザが直接読み込みます。ファイルがネットワーク経由で送信されることはありません。本ツールは開いているブラウザのタブ内だけで動作します。
- ファイルがアップロードされていないことを自分で確認できますか?
- はい。ブラウザの開発者ツール(F12)を開いてネットワークタブを表示し、ツールの使用中に外部への通信が発生しないかを確認できます。ファイルのデータがブラウザの外へ出ていかないことが分かります。サイトが匿名のページビュー数を記録する場合がありますが、ファイルの内容は含まれず、無効にすることもできます。
- オフラインでも使えますか?
- はい。ページの読み込みが終われば、ファイルの処理はすべてブラウザ内で行われます。ツールの機能にネットワーク接続は必要ありません。インターネットを切断したまま使い続けられます。
- ページを再読み込みするとどうなりますか?
- サーバーには何も保存されないため、ページを再読み込みすると現在の作業内容はリセットされます。選択していたファイルは選び直す必要があります。
- このツールはファイルを保存しますか?
- いいえ。ファイルはページを開いている間だけブラウザのメモリ上に保持されます。ページを閉じたり再読み込みしたりすると破棄されます。ツールがディスクに書き込むことはなく、サーバーへ送信されることもありません。
- パスワード付きPDFのロックを解除できますか?
- いいえ。本ツールはPDFのパスワード保護を解除したり回避したりはしません。パスワードが分かっている場合は、本サイトの「PDFのパスワード解除」ツールでローカルにパスワードを取り除いてから、本ツールで処理できます。
- このツールはどんな技術を使っていますか?
- 本ツールは、pdf.jsでページを描画し、WebAssemblyにコンパイルされたTesseract OCRエンジン(tesseract.js)を同一オリジンのWeb Worker内で動かします。ファイルはブラウザの外に出ません。
- このツールはWebAssemblyを使っていますか?
- はい。本サイトでWebAssemblyを使う数少ないツールのひとつです。Tesseract OCRエンジンはWebAssemblyにコンパイルされたC++で、ブラウザ内で動作します。.wasmバイナリは本サイトから配信され、データがどこかへ送信されることはありません。
- 最初の実行が次回以降より遅いのはなぜですか?
- 初回利用時に、ブラウザがOCRエンジンと言語モデル(数メガバイト)を本サイトから読み込み、コンパイルします。その後はキャッシュされるため、次回以降の起動はずっと速くなります。
- ここでスキャンしたPDFをOCRするにはどうすればよいですか?
- 端末内からスキャンしたPDFを選び、書類の言語(英語または繁体字中国語)を指定して、「認識」を選びます。各ページがローカルでレンダリングされ読み取られ、終わるとテキストをプレビューして.txtファイルとして保存できます。
- 認識したテキストが、検索可能なPDFではなく.txtファイルになるのはなぜですか?
- 本ツールは、認識した文字を見えないテキストレイヤーとしてPDFに書き戻すのではなく、プレーンテキストとして出力します。そのため、元のスキャンしたPDFは変更されません。文字をページの中に入れたい場合は、保存した.txtか、ページごとにテキストを一覧表示する画面上のプレビューからコピーすることになります。
- 同じ書類で2つの言語を処理できますか。また、間違った言語を選んだ場合はどうなりますか?
- 認識の前に書類全体で1つの言語を選ぶため、英語と繁体字中国語が混在するファイルでは、選んだほうの言語が優先されます。認識の精度はスキャン自体にも左右されるため、傾いていたり、低解像度だったり、手書きのページは、言語にかかわらず結果が悪くなりがちです。
- OCR PDFツールは有料ですか?
- OCR PDFツールは完全無料です。アカウントも登録も不要で、何件のスキャンPDFを処理しても上限はなく、これからもずっと無料です。各ページはWebAssemblyにコンパイルされたTesseract OCRエンジンを使ってブラウザ内で直接認識されるため、契約書・身分証明書・医療記録などを含むスキャン済みドキュメントがどこかに送信されることは一切ありません。
Related tools