Veiciet skenēta PDF OCR privāti — atpaziniet tekstu jūsu pārlūkprogrammā

Atlasiet skenētu PDF un valodu; katra lapa tiek renderēta un atpazīta lokāli ar Tesseract (kompilētu WebAssembly formātā), un atpazītais teksts tiek parādīts un ir lejupielādējams kā .txt fails.

Quick answer

What it does
Atlasiet skenētu PDF un valodu; katra lapa tiek renderēta un atpazīta lokāli ar Tesseract (kompilētu WebAssembly formātā), un atpazītais teksts tiek parādīts un ir lejupielādējams kā .txt fails.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Grāmatvedis veic OCR skenētam rēķinam, lai kopētu rindu summas izklājlapā bez atkārtotas ievadīšanas.
Good to know
Šajā versijā tiek atbalstīta angļu un tradicionālā ķīniešu valoda.

How it works

  1. Atlasiet skenētu PDF no savas ierīces un izvēlieties dokumenta valodu.
  2. Fails tiek ielasīts pārlūkprogrammas atmiņā — neviens dati neatstāj jūsu pārlūkprogrammu.
  3. pdf.js renderē katru lapu kā attēlu Web Worker.
  4. Tesseract OCR — kompilēts WebAssembly formātā un piegādāts no šīs vietnes — atpazīst katras lapas tekstu lokāli; valodas modelis arī tiek ielādēts no šīs vietnes, nevis no trešās puses CDN.
  5. Atpazītais teksts tiek parādīts pa lapām un piedāvāts lejupielādei kā .txt fails.

When to use this tool

  • Grāmatvedis veic OCR skenētam rēķinam, lai kopētu rindu summas izklājlapā bez atkārtotas ievadīšanas.
  • Students veic OCR skenētam kursa izdalāmajam materiālam, lai iegūtu meklējamu un kopējamu tekstu savām piezīmēm.
  • Arhivārs pārvērš skenētus tradicionālā ķīniešu valodas dokumentus meklējamā tekstā digitālajai bibliotēkai.
  • OCR precizitāte ir atkarīga no skenēšanas kvalitātes — izplūdušas, slīpas vai zemas izšķirtspējas lapas var radīt kļūdas; uzskatiet izvadu par labākā mēģinājuma melnrakstu.

Frequently asked questions

Ar ko tas atšķiras no citiem tiešsaistes PDF rīkiem?
Lielākā daļa tiešsaistes PDF rīku nosūta jūsu failus apstrādei attālā serverī. Šis rīks visu apstrādā lokāli jūsu pārlūkprogrammā, izmantojot klienta puses JavaScript. Jūsu faili netiek pārsūtīti uz nevienu serveri, kas nozīmē, ka jūsu dokumentu saturs pilnībā paliek jūsu kontrolē.
Vai mani PDF faili tiek augšupielādēti?
Nē. Jūsu failus tieši nolasa jūsu pārlūkprogramma. Jūsu faili nekad netiek pārsūtīti pa tīklu. Rīks darbojas pilnībā atvērtajā pārlūkprogrammas cilnē.
Vai es varu pārbaudīt, ka faili netiek augšupielādēti?
Jā. Atveriet pārlūkprogrammas izstrādātāja rīkus (F12), dodieties uz cilni Network un, lietojot rīku, vērojiet izejošos pieprasījumus. Redzēsiet, ka neviens failu dati neatstāj jūsu pārlūkprogrammu. Vietne var reģistrēt anonīmu lapas skatījumu skaitu, kas nekad neietver jūsu failus un ko var atspējot.
Vai šis rīks darbojas bezsaistē?
Jā, tiklīdz lapa ir ielādēta, rīks apstrādā jūsu failus pilnībā jūsu pārlūkprogrammā; rīka funkcionalitātei nav nepieciešams tīkla savienojums. Varat atvienoties no interneta un turpināt to lietot.
Kas notiek, kad atsvaidzinu lapu?
Tā kā nekas netiek glabāts serverī, lapas atsvaidzināšana notīra jūsu pašreizējo sesiju. Visi atlasītie faili būs jāatlasa atkārtoti.
Vai šis rīks glabā manus failus?
Nē. Faili tiek glabāti pārlūkprogrammas atmiņā tikai tik ilgi, kamēr lapa ir atvērta. Lapas aizvēršana vai atsvaidzināšana tos atmet. Rīks neko neraksta diskā un neko nesūta uz serveri.
Vai šis rīks var atbloķēt ar paroli aizsargātus PDF?
Nē. Šis rīks nemēģina noņemt vai apiet PDF paroles aizsardzību. Ja zināt paroli, šajā vietnē pieejamais rīks Atbloķēt PDF var to noņemt lokāli; pēc tam šis rīks var apstrādāt failu.
Kādas tehnoloģijas izmanto šis rīks?
Šis rīks izmanto pdf.js, lai renderētu lapas, un Tesseract OCR dzinēju, kas kompilēts WebAssembly formātā (tesseract.js) un darbojas viena izcelsmes (same-origin) Web Worker — jūsu faili nekad neatstāj jūsu pārlūkprogrammu.
Vai šis rīks izmanto WebAssembly?
Jā — šis ir viens no nedaudzajiem rīkiem šeit, kas to dara. Tesseract OCR dzinējs ir C++, kas kompilēts WebAssembly formātā un darbojas jūsu pārlūkprogrammā; .wasm binārais fails tiek piegādāts no šīs vietnes un nekas netiek nekur nosūtīts.
Kāpēc pirmā palaišana ir lēnāka par nākamajām?
Pirmajā lietošanas reizē jūsu pārlūkprogramma no šīs vietnes lejupielādē OCR dzinēju un valodas modeli (dažus megabaitus) un tos kompilē. Pēc tam tie tiek saglabāti kešatmiņā, tāpēc vēlākās palaišanas sākas daudz ātrāk.
Kā šeit veikt OCR skenētam PDF?
Izvēlieties skenētu PDF no savas ierīces, izvēlieties dokumenta valodu (angļu vai tradicionālo ķīniešu), pēc tam atlasiet Atpazīt. Katra lapa tiek renderēta un nolasīta lokāli, un, tiklīdz process ir pabeigts, varat priekšskatīt tekstu un saglabāt to kā .txt failu.
Kāpēc atpazītais teksts ir tikai .txt fails, nevis meklējams PDF?
Šis rīks izvada atpazītos vārdus kā vienkāršu tekstu, nevis ieraksta neredzamu teksta slāni atpakaļ PDF, tāpēc jūsu oriģinālais skenētais PDF paliek nemainīgs. Ja jums vārdi nepieciešami lapā, jūs tos kopētu no saglabātā .txt vai ekrāna priekšskatījuma, kas uzskaita tekstu pa lapām.
Vai es varu vienā dokumentā darbināt divas valodas, un kas notiek, ja izvēlos nepareizo?
Pirms atpazīšanas jūs izvēlaties vienu valodu visam dokumentam, tāpēc fails, kas sajauc angļu un tradicionālo ķīniešu, dos priekšroku tai, kuru izvēlējāties. Atpazīšanas kvalitāte ir atkarīga arī no paša skenējuma, tāpēc sašķiebtas, zemas izšķirtspējas vai ar roku rakstītas lapas mēdz iznākt slikti neatkarīgi no valodas.
Vai OCR PDF rīks ir maksas?
OCR PDF rīks ir pilnīgi bezmaksas — nav nepieciešams konts, reģistrācija vai ierobežojums tam, cik daudz skenētu PDF failu varat apstrādāt, un tas vienmēr būs bezmaksas. Katra lapa tiek atpazīta tieši jūsu pārlūkprogrammā, izmantojot Tesseract OCR dzinēju, kas kompilēts uz WebAssembly, tāpēc jūsu skenētie dokumenti — neatkarīgi no tā, vai tajos ir līgumi, personu apliecinoši dokumenti vai medicīniskie ieraksti — nekad netiek nosūtīti nekur.

Related tools

  • Izvilkt tekstu
  • Vārdu skaits
  • PDF uz attēliem
  • Saspiest PDF
  • Universālais PDF redaktors
  • Sākums
  • Universālais PDF redaktors
  • Apvienot PDF
  • Sadalīt PDF
  • Pagriezt PDF
  • Pievienot ūdenszīmi
  • Attēli uz PDF
  • PDF uz attēliem
  • Lapu numuri
  • Saspiest PDF
  • Izvilkt tekstu
  • Rediģēt metadatus
  • Kārtot lapas
  • Ievietot tukšas lapas
  • Izvilkt lapas
  • N-up (lapas vienā loksnē)
  • Pelēktoņu PDF
  • Apgriezt PDF
  • Apgriezt lapas
  • Mainīt izmēru (A4/Letter)
  • Pievienot galveni un kājeni
  • Saplacināt veidlapu
  • Sadalīt ik pēc N lapām
  • PDF info un metadati
  • Uzspiest attēlu / parakstu
  • Noņemt lapas
  • Mozaīkas ūdenszīme
  • Buklets
  • Dublēt lapas
  • Pievienot failu
  • Mērogot procentos
  • Noņemt tukšas lapas
  • Savijot apvienot
  • Pievienot lapas apmali
  • Izvilkt nepāra / pāra lapas
  • PDF uz garu attēlu
  • Sadalīt lapas uz pusēm
  • Pievienot malas
  • Parakstīt PDF
  • Salīdzināt PDF
  • Plakāta sadalīšana
  • Vārdu skaits
  • Labot PDF
  • Aizpildīt PDF veidlapu
  • Sadalīt pēc grāmatzīmēm
  • Meklēt un izcelt
  • Izvilkt attēlus
  • Aizklāt PDF
  • OCR (skenēts uz tekstu)
  • Aizsargāt PDF
  • Atbloķēt PDF
  • Par mums
  • Privātuma politika
  • Kontakti
  • Kā tas darbojas
  • Lokālie pret tiešsaistes PDF rīkiem
  • Vai tiešsaistes PDF rīki ir droši?