OCR PDF yang Diimbas Secara Peribadi — Cam Teks dalam Pelayar Anda

Pilih PDF yang diimbas dan satu bahasa; setiap halaman dipaparkan dan dicam secara setempat oleh Tesseract (dikompil kepada WebAssembly), dan teks yang dicam ditunjukkan serta boleh dimuat turun sebagai fail .txt.

Quick answer

What it does
Pilih PDF yang diimbas dan satu bahasa; setiap halaman dipaparkan dan dicam secara setempat oleh Tesseract (dikompil kepada WebAssembly), dan teks yang dicam ditunjukkan serta boleh dimuat turun sebagai fail .txt.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Seorang akauntan menjalankan OCR pada invois yang diimbas untuk menyalin jumlah item baris ke dalam hamparan tanpa menaip semula.
Good to know
Bahasa Inggeris dan Cina Tradisional disokong dalam versi ini.

How it works

  1. Pilih PDF yang diimbas daripada peranti anda dan pilih bahasa dokumen.
  2. Fail dibaca ke dalam memori pelayar — tiada data keluar daripada pelayar anda.
  3. pdf.js memaparkan setiap halaman ke imej dalam Web Worker.
  4. OCR Tesseract — dikompil kepada WebAssembly dan disajikan daripada laman ini — mencam teks setiap halaman secara setempat; model bahasa juga dimuatkan daripada laman ini, bukan CDN pihak ketiga.
  5. Teks yang dicam ditunjukkan bagi setiap halaman dan ditawarkan sebagai muat turun .txt.

When to use this tool

  • Seorang akauntan menjalankan OCR pada invois yang diimbas untuk menyalin jumlah item baris ke dalam hamparan tanpa menaip semula.
  • Seorang pelajar menjalankan OCR pada edaran kursus yang diimbas untuk mendapatkan teks yang boleh dicari dan disalin bagi nota mereka.
  • Seorang arkibis menukar dokumen Cina Tradisional yang diimbas kepada teks yang boleh dicari untuk perpustakaan digital.
  • Ketepatan OCR bergantung pada kualiti imbasan — halaman kabur, senget, atau resolusi rendah mungkin menghasilkan ralat; anggap output sebagai draf usaha terbaik.

Frequently asked questions

Apa bezanya alat ini dengan alat PDF dalam talian yang lain?
Kebanyakan alat PDF dalam talian menghantar fail anda ke pelayan jauh untuk diproses. Alat ini memproses segala-galanya secara setempat dalam pelayar anda menggunakan JavaScript sisi pelanggan. Fail anda tidak pernah dihantar ke mana-mana pelayan, jadi kandungan dokumen anda kekal sepenuhnya di bawah kawalan anda.
Adakah fail PDF saya dimuat naik?
Tidak. Fail anda dibaca terus oleh pelayar anda. Fail anda tidak pernah dihantar melalui rangkaian. Alat ini berfungsi sepenuhnya dalam tab pelayar yang anda buka.
Bolehkah saya sahkan bahawa fail tidak dimuat naik?
Boleh. Buka alat pembangun pelayar anda (F12), pergi ke tab Network, dan perhatikan jika ada sebarang permintaan keluar semasa menggunakan alat ini. Anda akan dapati tiada data fail keluar daripada pelayar anda. Laman ini mungkin merekod kiraan paparan halaman tanpa nama, yang tidak pernah menyertakan fail anda dan boleh dilumpuhkan.
Adakah alat ini berfungsi secara luar talian?
Ya. Sebaik sahaja halaman selesai dimuatkan, alat ini memproses fail anda sepenuhnya dalam pelayar anda; fungsi alat tidak memerlukan sebarang sambungan rangkaian. Anda boleh memutuskan sambungan internet dan terus menggunakannya.
Apa yang berlaku apabila saya muat semula halaman?
Oleh sebab tiada apa-apa disimpan pada pelayan, memuat semula halaman akan mengosongkan sesi semasa anda. Fail yang telah anda pilih perlu dipilih semula.
Adakah alat ini menyimpan fail saya?
Tidak. Fail disimpan dalam memori pelayar hanya selagi halaman dibuka. Menutup atau memuat semula halaman akan membuangnya. Alat ini tidak menulis apa-apa ke cakera, dan tiada apa-apa dihantar ke pelayan.
Bolehkah alat ini membuka kunci PDF yang dilindungi kata laluan?
Tidak. Alat ini tidak cuba membuang atau memintas perlindungan kata laluan PDF. Jika anda tahu kata laluannya, alat Buka Kunci PDF di laman ini boleh membuangnya secara setempat; selepas itu alat ini boleh memproses fail tersebut.
Teknologi apa yang digunakan oleh alat ini?
Alat ini menggunakan pdf.js untuk memaparkan halaman dan enjin OCR Tesseract yang dikompil kepada WebAssembly (tesseract.js) yang berjalan dalam Web Worker asal-sama — fail anda tidak pernah keluar daripada pelayar anda.
Adakah alat ini menggunakan WebAssembly?
Ya — ini ialah salah satu daripada beberapa alat di sini yang menggunakannya. Enjin OCR Tesseract ialah kod C++ yang dikompil kepada WebAssembly dan berjalan di dalam pelayar anda; binari .wasm disajikan daripada laman ini dan tiada apa-apa dihantar ke mana-mana.
Mengapa larian pertama lebih perlahan berbanding larian seterusnya?
Pada penggunaan pertama, pelayar anda memuat turun enjin OCR dan model bahasa daripada laman ini (beberapa megabait) dan mengkompilnya. Selepas itu ia disimpan dalam cache, jadi larian seterusnya bermula jauh lebih pantas.
Bagaimanakah cara saya melakukan OCR pada PDF terimbas di sini?
Pilih PDF terimbas daripada peranti anda, pilih bahasa dokumen (Bahasa Inggeris atau Bahasa Cina Tradisional), kemudian pilih Cam (Recognise). Setiap halaman dipaparkan dan dibaca secara setempat, dan setelah selesai anda boleh pratonton teks dan menyimpannya sebagai fail .txt.
Mengapakah teks yang dicam hanyalah fail .txt dan bukannya PDF yang boleh dicari?
Alat ini mengeluarkan perkataan yang dicam sebagai teks biasa dan bukannya menulis lapisan teks halimunan kembali ke dalam PDF, jadi PDF terimbas asal anda kekal tidak berubah. Jika anda perlukan perkataan itu di dalam halaman, anda perlu menyalinnya daripada .txt yang disimpan atau pratonton pada skrin, yang menyenaraikan teks halaman demi halaman.
Bolehkah saya menjalankan dua bahasa dalam dokumen yang sama, dan bagaimana jika saya pilih yang salah?
Anda memilih satu bahasa untuk keseluruhan dokumen sebelum mengecam, jadi fail yang mencampurkan Bahasa Inggeris dan Bahasa Cina Tradisional akan mengutamakan mana-mana yang anda pilih. Kualiti pengecaman juga bergantung pada imbasan itu sendiri, jadi halaman yang senget, beresolusi rendah, atau ditulis tangan cenderung terhasil dengan buruk tanpa mengira bahasa.
Adakah alat OCR PDF dikenakan sebarang bayaran?
Alat OCR PDF adalah percuma sepenuhnya — tiada akaun, tiada pendaftaran, dan tiada had pada bilangan PDF yang diimbas yang anda proses, dan ia akan sentiasa begitu. Setiap halaman dikenali terus di dalam pelayar anda menggunakan enjin Tesseract OCR yang dikompil ke WebAssembly, jadi dokumen yang diimbas anda — sama ada ia mengandungi kontrak, kad pengenalan, atau rekod perubatan — tidak pernah dihantar ke mana-mana.

Related tools

  • Ekstrak Teks
  • Kiraan Perkataan
  • PDF kepada Imej
  • Mampatkan PDF
  • Penyunting PDF Serba Boleh
  • Laman Utama
  • Penyunting PDF Serba Boleh
  • Gabungkan PDF
  • Pisahkan PDF
  • Putar PDF
  • Tambah Tera Air
  • Imej kepada PDF
  • PDF kepada Imej
  • Nombor Halaman
  • Mampatkan PDF
  • Ekstrak Teks
  • Edit Metadata
  • Susun Halaman
  • Sisip Halaman Kosong
  • Ekstrak Halaman
  • N-up (Halaman setiap Helai)
  • PDF Skala Kelabu
  • Pangkas PDF
  • Songsangkan Halaman
  • Ubah Saiz (A4/Letter)
  • Tambah Pengepala & Pengaki
  • Leperkan Borang
  • Pisah Setiap N Halaman
  • Maklumat & Metadata PDF
  • Cop Imej / Tandatangan
  • Buang Halaman
  • Tera Air Berjubin
  • Buku Kecil
  • Duplikasi Halaman
  • Lampirkan Fail
  • Skala mengikut Peratus
  • Buang Halaman Kosong
  • Gabung Selang-seli
  • Tambah Sempadan Halaman
  • Ekstrak Halaman Ganjil / Genap
  • PDF kepada Imej Panjang
  • Pisahkan Halaman kepada Separuh
  • Tambah Margin
  • Tandatangan PDF
  • Bandingkan PDF
  • Pecahan Poster
  • Kiraan Perkataan
  • Baiki PDF
  • Isi Borang PDF
  • Pisah mengikut Penanda Buku
  • Cari & Serlahkan
  • Ekstrak Imej
  • Tapis PDF
  • OCR (Imbasan kepada Teks)
  • Lindungi PDF
  • Buka Kunci PDF
  • Tentang Kami
  • Dasar Privasi
  • Hubungi Kami
  • Cara Ia Berfungsi
  • Alat PDF Tempatan vs Dalam Talian
  • Adakah Alat PDF Dalam Talian Selamat?