Izvedite OCR skeniranega PDF zasebno — prepoznajte besedilo v vašem brskalniku

Izberite skeniran PDF in jezik; vsaka stran se izriše in lokalno prepozna s Tesseract (prevedenim v WebAssembly), prepoznano besedilo pa se prikaže in je na voljo za prenos kot datoteka .txt.

Quick answer

What it does
Izberite skeniran PDF in jezik; vsaka stran se izriše in lokalno prepozna s Tesseract (prevedenim v WebAssembly), prepoznano besedilo pa se prikaže in je na voljo za prenos kot datoteka .txt.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Računovodja OCR-ira skenirani račun, da skopira zneske postavk v preglednico brez ponovnega vtipkavanja.
Good to know
V tej različici sta podprti angleščina in tradicionalna kitajščina.

How it works

  1. Iz svoje naprave izberite skeniran PDF in izberite jezik dokumenta.
  2. Datoteka se prebere v pomnilnik brskalnika — noben podatek ne zapusti vašega brskalnika.
  3. pdf.js v Web Worker izriše vsako stran v sliko.
  4. Tesseract OCR — preveden v WebAssembly in postrežen s te strani — lokalno prepozna besedilo vsake strani; jezikovni model se prav tako naloži s te strani, ne s tretjeosebnega omrežja CDN.
  5. Prepoznano besedilo se prikaže po straneh in ponudi za prenos kot datoteka .txt.

When to use this tool

  • Računovodja OCR-ira skenirani račun, da skopira zneske postavk v preglednico brez ponovnega vtipkavanja.
  • Študent OCR-ira skenirano gradivo tečaja, da dobi iskalno in kopirljivo besedilo za svoje zapiske.
  • Arhivar pretvori skenirane dokumente tradicionalne kitajščine v iskalno besedilo za digitalno knjižnico.
  • Natančnost OCR je odvisna od kakovosti skeniranja — zamegljene, poševne ali nizkoločljivostne strani lahko povzročijo napake; z izpisom ravnajte kot z osnutkom po najboljšem trudu.

Frequently asked questions

V čem se ta orodja razlikujejo od drugih spletnih orodij za PDF?
Večina spletnih orodij za PDF vaše datoteke pošlje v obdelavo na oddaljeni strežnik. To orodje vse obdela lokalno v vašem brskalniku z uporabo JavaScripta na strani odjemalca. Vaše datoteke se ne prenašajo na noben strežnik, kar pomeni, da vsebina dokumenta v celoti ostane pod vašim nadzorom.
Ali se moje datoteke PDF prenesejo v oblak?
Ne. Vaše datoteke prebere neposredno vaš brskalnik. Vaše datoteke se nikoli ne prenesejo po omrežju. Orodje deluje v celoti znotraj zavihka brskalnika, ki ga imate odprtega.
Lahko preverim, da se datoteke ne prenašajo nikamor?
Da. Odprite razvijalska orodja brskalnika (F12), pojdite na zavihek Network (Omrežje) in med uporabo orodja opazujte morebitne izhodne zahteve. Videli boste, da nobeni podatki o datoteki ne zapustijo vašega brskalnika. Spletno mesto lahko zabeleži anonimno število ogledov strani, ki nikoli ne vključuje vaših datotek in ga je mogoče onemogočiti.
Ali orodje deluje brez povezave?
Da. Ko se stran enkrat naloži, orodje obdela vaše datoteke v celoti v vašem brskalniku; za delovanje orodja ni potrebna omrežna povezava. Lahko se odklopite od interneta in z uporabo nadaljujete.
Kaj se zgodi, ko osvežim stran?
Ker se na strežniku ne shranjuje nič, osvežitev strani počisti vašo trenutno sejo. Datoteke, ki ste jih izbrali, boste morali izbrati znova.
Ali orodje shranjuje moje datoteke?
Ne. Datoteke ostanejo v pomnilniku brskalnika le toliko časa, dokler je stran odprta. Ob zaprtju ali osvežitvi strani se zavržejo. Orodje ničesar ne zapiše na disk in ničesar ne pošlje na strežnik.
Ali to orodje odklene s geslom zaščitene datoteke PDF?
Ne. To orodje ne poskuša odstraniti ali zaobiti zaščite PDF z geslom. Če geslo poznate, ga lahko orodje Odkleni PDF na tej strani odstrani lokalno; nato lahko datoteko obdelate s tem orodjem.
Katere tehnologije uporablja to orodje?
To orodje uporablja pdf.js za izris strani in pogon Tesseract OCR, preveden v WebAssembly (tesseract.js), ki teče v Web Worker iste izvorne domene — vaše datoteke nikoli ne zapustijo vašega brskalnika.
Ali to orodje uporablja WebAssembly?
Da — to je eno redkih orodij tukaj, ki ga. Pogon Tesseract OCR je C++, preveden v WebAssembly, in teče znotraj vašega brskalnika; binarni .wasm se postreže s te strani in nič se ne pošlje nikamor.
Zakaj je prvi zagon počasnejši od naslednjih?
Ob prvi uporabi vaš brskalnik s te strani prenese pogon OCR in jezikovni model (nekaj megabajtov) ter ju prevede. Pozneje sta predpomnjena, zato se kasnejši zagoni začnejo veliko hitreje.
Kako tukaj izvedem OCR skeniranega PDF-ja?
Izberite skeniran PDF iz svoje naprave, izberite jezik dokumenta (angleščino ali tradicionalno kitajščino), nato izberite Prepoznaj. Vsaka stran se upodobi in prebere lokalno, ko pa je končano, lahko besedilo predogledate in ga shranite kot datoteko .txt.
Zakaj je prepoznano besedilo le datoteka .txt namesto PDF-ja, po katerem je mogoče iskati?
To orodje prepoznane besede izpiše kot golo besedilo, namesto da bi v PDF zapisalo nevidno besedilno plast, zato vaš izvirni skenirani PDF ostane nespremenjen. Če potrebujete besede znotraj strani, jih kopirate iz shranjene datoteke .txt ali iz predogleda na zaslonu, ki navaja besedilo stran za stranjo.
Ali lahko v istem dokumentu uporabim dva jezika in kaj če izberem napačnega?
Pred prepoznavanjem za celoten dokument izberete en sam jezik, zato bo datoteka, ki meša angleščino in tradicionalno kitajščino, dajala prednost tistemu, ki ste ga izbrali. Kakovost prepoznavanja je odvisna tudi od samega skeniranja, zato poševne strani, strani z nizko ločljivostjo ali rokopisne strani običajno izpadejo slabo, ne glede na jezik.
Ali je orodje OCR PDF brezplačno?
Orodje OCR PDF je popolnoma brezplačno — brez računa, brez registracije in brez omejitev glede števila skeniranih PDF-jev, ki jih obdelate, in vedno bo tako. Vsaka stran se prepozna neposredno v vašem brskalniku s pomočjo mehanizma za optično prepoznavanje znakov Tesseract, prevedenega v WebAssembly, zato vaši skenirani dokumenti — ne glede na to, ali vsebujejo pogodbe, osebne izkaznice ali zdravstvene kartone — nikoli niso poslani nikamor.

Related tools

  • Izvleci besedilo
  • Štetje besed
  • PDF v slike
  • Stisni PDF
  • Vsestranski urejevalnik PDF
  • Domov
  • Vsestranski urejevalnik PDF
  • Združi PDF
  • Razdeli PDF
  • Zavrti PDF
  • Dodaj vodni žig
  • Slike v PDF
  • PDF v slike
  • Številke strani
  • Stisni PDF
  • Izvleci besedilo
  • Uredi metapodatke
  • Organiziraj strani
  • Vstavi prazne strani
  • Izvleci strani
  • Več strani na list
  • PDF v sivinski lestvici
  • Obreži PDF
  • Obrni strani
  • Spremeni velikost (A4/Letter)
  • Dodaj glavo in nogo
  • Sploči obrazec
  • Razdeli vsakih N strani
  • Informacije in metapodatki PDF
  • Odtisni sliko / podpis
  • Odstrani strani
  • Tlakovan vodni žig
  • Knjižica
  • Podvoji strani
  • Pripni datoteko
  • Spremeni merilo v odstotkih
  • Odstrani prazne strani
  • Prepleteno združevanje
  • Dodaj obrobo strani
  • Izvleci lihe / sode strani
  • PDF v dolgo sliko
  • Razdeli strani na pol
  • Dodaj robove
  • Podpiši PDF
  • Primerjaj PDF-je
  • Razdelitev plakata
  • Štetje besed
  • Popravi PDF
  • Izpolni obrazec PDF
  • Razdeli po zaznamkih
  • Išči in označi
  • Izvleci slike
  • Prekrij PDF
  • OCR (skenirano v besedilo)
  • Zaščiti PDF
  • Odkleni PDF
  • O nas
  • Pravilnik o zasebnosti
  • Kontakt
  • Kako deluje
  • Lokalna ali spletna orodja za PDF
  • Ali so spletna orodja za PDF varna?