OCR skeniranog PDF-a uz privatnost — prepoznajte tekst u vašem pregledaču
Izaberite skenirani PDF i jezik; svaka stranica se renderuje i prepoznaje lokalno pomoću Tesseract-a (kompajliranog u WebAssembly), a prepoznati tekst se prikazuje i može preuzeti kao .txt fajl.
Quick answer
What it does
Izaberite skenirani PDF i jezik; svaka stranica se renderuje i prepoznaje lokalno pomoću Tesseract-a (kompajliranog u WebAssembly), a prepoznati tekst se prikazuje i može preuzeti kao .txt fajl.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Računovođa primenjuje OCR na skeniranu fakturu da kopira iznose stavki u tabelu bez ponovnog kucanja.
Good to know
U ovoj verziji podržani su engleski i tradicionalni kineski.
How it works
Izaberite skenirani PDF sa svog uređaja i izaberite jezik dokumenta.
Fajl se učitava u memoriju pregledača — nijedan podatak ne napušta vaš pregledač.
pdf.js renderuje svaku stranicu u sliku u Web Worker-u.
Tesseract OCR — kompajliran u WebAssembly i posluživan sa ovog sajta — prepoznaje tekst svake stranice lokalno; jezički model se takođe učitava sa ovog sajta, a ne sa CDN-a treće strane.
Prepoznati tekst se prikazuje po stranici i nudi kao .txt za preuzimanje.
When to use this tool
Računovođa primenjuje OCR na skeniranu fakturu da kopira iznose stavki u tabelu bez ponovnog kucanja.
Student primenjuje OCR na skenirani materijal kursa da dobije pretraživi, kopirabilni tekst za beleške.
Arhivar konvertuje skenirane dokumente na tradicionalnom kineskom u pretraživi tekst za digitalnu biblioteku.
Tačnost OCR-a zavisi od kvaliteta skeniranja — mutne, nakrivljene ili stranice niske rezolucije mogu imati greške; tretirajte izlaz kao nacrt po principu najboljeg truda.
Frequently asked questions
Po čemu se ovo razlikuje od drugih onlajn PDF alata?
Većina onlajn PDF alata šalje vaše fajlove na udaljeni server radi obrade. Ovaj alat sve obrađuje lokalno u vašem pregledaču pomoću JavaScript-a na strani klijenta. Vaši fajlovi se ne prenose ni na jedan server, pa sadržaj dokumenta u potpunosti ostaje pod vašom kontrolom.
Da li se moji PDF fajlovi otpremaju?
Ne. Vaše fajlove čita direktno vaš pregledač. Vaši fajlovi nikada se ne prenose preko mreže. Alat radi u potpunosti unutar kartice pregledača koju imate otvorenu.
Mogu li da proverim da se fajlovi ne otpremaju?
Da. Otvorite alatke za programere u pregledaču (F12), pređite na karticu Network (Mreža) i pratite da li tokom korišćenja alata ima odlaznih zahteva. Videćete da nikakvi podaci o fajlu ne napuštaju vaš pregledač. Sajt može da beleži anonimni broj pregleda stranica, koji nikada ne uključuje vaše fajlove i može se onemogućiti.
Da li ovaj alat radi van mreže?
Da, kada se stranica jednom učita, alat obrađuje vaše fajlove u potpunosti u vašem pregledaču; funkcionalnost alata ne zahteva mrežnu vezu. Možete se isključiti sa interneta i nastaviti da ga koristite.
Šta se dešava kada osvežim stranicu?
Pošto se ništa ne čuva na serveru, osvežavanje stranice briše vašu trenutnu sesiju. Sve fajlove koje ste izabrali biće potrebno ponovo izabrati.
Da li ovaj alat čuva moje fajlove?
Ne. Fajlovi se drže u memoriji pregledača samo dok je stranica otvorena. Zatvaranje ili osvežavanje stranice ih odbacuje. Alat ništa ne upisuje na disk i ništa ne šalje na server.
Da li ovaj alat može da otključa PDF-ove zaštićene lozinkom?
Ne. Ovaj alat ne pokušava da ukloni niti zaobiđe zaštitu PDF-a lozinkom. Ako znate lozinku, alat Otključaj PDF na ovom sajtu može da je ukloni lokalno; nakon toga ovaj alat može da obradi fajl.
Koje tehnologije ovaj alat koristi?
Ovaj alat koristi pdf.js da renderuje stranice i Tesseract OCR mehanizam kompajliran u WebAssembly (tesseract.js) koji radi u Web Worker-u istog porekla — vaši fajlovi nikada ne napuštaju vaš pregledač.
Da li ovaj alat koristi WebAssembly?
Da — ovo je jedan od retkih alata ovde koji ga koristi. Tesseract OCR mehanizam je C++ kompajliran u WebAssembly i radi unutar vašeg pregledača; .wasm binarni fajl se posluživa sa ovog sajta i ništa se ne šalje nigde.
Zašto je prvo pokretanje sporije od narednih?
Pri prvom korišćenju vaš pregledač preuzima OCR mehanizam i jezički model sa ovog sajta (nekoliko megabajta) i kompajlira ih. Nakon toga se keširaju, pa kasnija pokretanja počinju mnogo brže.
Kako da ovde uradim OCR skeniranog PDF-a?
Izaberite skenirani PDF sa svog uređaja, izaberite jezik dokumenta (engleski ili tradicionalni kineski), a zatim izaberite Prepoznaj. Svaka stranica se iscrtava i čita lokalno, a kada se završi možete pregledati tekst i sačuvati ga kao .txt fajl.
Zašto je prepoznati tekst samo .txt fajl umesto pretraživog PDF-a?
Ovaj alat ispisuje prepoznate reči kao običan tekst umesto da upisuje nevidljiv tekstualni sloj nazad u PDF, pa vaš originalni skenirani PDF ostaje nepromenjen. Ako su vam reči potrebne unutar stranice, kopirali biste ih iz sačuvanog .txt fajla ili iz pregleda na ekranu, koji prikazuje tekst stranicu po stranicu.
Mogu li da pokrenem dva jezika u istom dokumentu i šta ako izaberem pogrešan?
Birate jedan jezik za ceo dokument pre prepoznavanja, pa će fajl koji meša engleski i tradicionalni kineski davati prednost onom koji ste izabrali. Kvalitet prepoznavanja zavisi i od samog skena, pa nakošene stranice, stranice niske rezolucije ili rukom pisane stranice obično ispadaju loše bez obzira na jezik.
Da li alat OCR PDF košta nešto za korišćenje?
OCR PDF je potpuno besplatan — nije potreban nalog niti registracija, i nema ograničenja na broj skeniranih PDF-ova koje možete obraditi, i uvek će tako ostati. Svaka stranica se prepoznaje direktno unutar vašeg pregledača koristeći Tesseract OCR engine kompajliran u WebAssembly, tako da vaši skenirani dokumenti — bez obzira da li sadrže ugovore, lična dokumenta ili medicinske kartone — nikad nisu nigde poslati.