Beolvasott PDF OCR-je bizalmasan – ismerd fel a szöveget a böngésződben
Válassz ki egy beolvasott PDF-et és egy nyelvet; minden oldal helyben renderelődik és felismerésre kerül a Tesseract (WebAssemblyre fordítva) segítségével, a felismert szöveg pedig megjelenik, és letölthető .txt fájlként.
Quick answer
What it does
Válassz ki egy beolvasott PDF-et és egy nyelvet; minden oldal helyben renderelődik és felismerésre kerül a Tesseract (WebAssemblyre fordítva) segítségével, a felismert szöveg pedig megjelenik, és letölthető .txt fájlként.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Egy könyvelő OCR-rel dolgoz fel egy beolvasott számlát, hogy a sortételek összegeit gépelés nélkül másolja táblázatba.
Good to know
Ebben a verzióban az angol és a hagyományos kínai nyelv támogatott.
How it works
Válassz ki egy beolvasott PDF-et az eszközödről, és add meg a dokumentum nyelvét.
A fájl a böngésző memóriájába kerül – semmilyen adat nem hagyja el a böngésződet.
A pdf.js minden oldalt képpé renderel egy Web Workerben.
A Tesseract OCR – WebAssemblyre fordítva és erről az oldalról kiszolgálva – helyben felismeri minden oldal szövegét; a nyelvi modell szintén erről az oldalról töltődik be, nem egy harmadik fél CDN-jéről.
A felismert szöveg oldalanként jelenik meg, és .txt fájlként letölthető.
When to use this tool
Egy könyvelő OCR-rel dolgoz fel egy beolvasott számlát, hogy a sortételek összegeit gépelés nélkül másolja táblázatba.
Egy diák OCR-rel dolgoz fel egy beolvasott tanfolyami handout-ot, hogy kereshető, másolható szöveget kapjon a jegyzeteihez.
Egy levéltáros hagyományos kínai beolvasott dokumentumokat alakít át kereshető szöveggé egy digitális könyvtárhoz.
Az OCR pontossága a beolvasás minőségétől függ — homályos, dőlt vagy kis felbontású oldalak hibákat okozhatnak; a kimenetet legjobb erőfeszítésen alapuló vázlatként kezelje.
Frequently asked questions
Miben különbözik ez a többi online PDF eszköztől?
A legtöbb online PDF eszköz a fájljaidat egy távoli szerverre küldi feldolgozásra. Ez az eszköz mindent helyben, a böngésződben dolgoz fel, kliensoldali JavaScript segítségével. A fájljaid soha nem kerülnek átküldésre semmilyen szerverre, vagyis a dokumentumod tartalma teljes mértékben a te ellenőrzésed alatt marad.
Feltöltődnek a PDF fájljaim?
Nem. A fájljaidat közvetlenül a böngésződ olvassa be. A fájljaid soha nem kerülnek átküldésre a hálózaton. Az eszköz teljes egészében a megnyitott böngészőfülön belül működik.
Ellenőrizhetem, hogy a fájlok nem töltődnek fel?
Igen. Nyisd meg a böngésződ fejlesztői eszközeit (F12), válts a Network (Hálózat) fülre, és figyeld a kimenő kéréseket, miközben az eszközt használod. Nem fogsz látni fájladatokat kilépni a böngésződből. Az oldal rögzíthet egy névtelen oldalmegtekintési számlálót, amely soha nem tartalmazza a fájljaidat, és letiltható.
Működik ez az eszköz offline módban?
Igen, miután az oldal betöltődött, az eszköz teljes egészében a böngésződben dolgozza fel a fájljaidat; az eszköz funkcionalitásához nincs szükség hálózati kapcsolatra. Lekapcsolódhatsz az internetről, és folytathatod a használatát.
Mi történik, ha frissítem az oldalt?
Mivel semmi nem tárolódik szerveren, az oldal frissítése törli az aktuális munkamenetet. A korábban kiválasztott fájlokat újra ki kell majd választanod.
Tárolja ez az eszköz a fájljaimat?
Nem. A fájlok csak addig maradnak a böngésző memóriájában, amíg az oldal nyitva van. Az oldal bezárása vagy frissítése eldobja őket. Az eszköz semmit nem ír a lemezre, és semmit nem küld szerverre.
Fel tudja oldani ez az eszköz a jelszóval védett PDF-eket?
Nem. Ez az eszköz nem próbálja eltávolítani vagy megkerülni a PDF jelszavas védelmét. Ha ismered a jelszót, az ezen az oldalon található PDF-feloldó eszköz helyben el tudja távolítani; ezután ez az eszköz fel tudja dolgozni a fájlt.
Milyen technológiákat használ ez az eszköz?
Ez az eszköz a pdf.js-t használja az oldalak rendereléséhez, és a WebAssemblyre fordított Tesseract OCR-motort (tesseract.js), amely egy azonos eredetű (same-origin) Web Workerben fut – a fájljaid soha nem hagyják el a böngésződet.
Használ ez az eszköz WebAssemblyt?
Igen – ez egyike azon kevés itteni eszköznek, amely használja. A Tesseract OCR-motor C++ nyelven íródott, WebAssemblyre fordítva, és a böngésződben fut; a .wasm bináris erről az oldalról kerül kiszolgálásra, és semmi nem küldődik sehová.
Miért lassabb az első futtatás a következőknél?
Az első használatkor a böngésződ letölti az OCR-motort és a nyelvi modellt erről az oldalról (néhány megabájt), és lefordítja őket. Ezt követően gyorsítótárba kerülnek, így a későbbi futtatások sokkal gyorsabban indulnak.
Hogyan futtathatok OCR-t egy beolvasott PDF-en itt?
Válassz ki egy beolvasott PDF-et az eszközödről, válaszd ki a dokumentum nyelvét (angol vagy hagyományos kínai), majd válaszd a Felismerés gombot. Minden oldalt a rendszer helyben renderel és olvas be, és amint elkészül, megnézheted a szöveget előnézetben, és elmentheted .txt fájlként.
Miért csak egy .txt fájl a felismert szöveg, és nem egy kereshető PDF?
Ez az eszköz a felismert szavakat sima szövegként adja ki, ahelyett hogy egy láthatatlan szövegréteget írna vissza a PDF-be, így az eredeti beolvasott PDF változatlan marad. Ha a szavakra az oldalon belül van szükséged, a mentett .txt fájlból vagy a képernyőn megjelenő előnézetből másolhatod ki őket, amely oldalanként sorolja fel a szöveget.
Futtathatok két nyelvet ugyanabban a dokumentumban, és mi van, ha rosszat választok?
A felismerés előtt egyetlen nyelvet választasz az egész dokumentumhoz, így egy angolt és hagyományos kínait keverő fájl azt a nyelvet fogja előnyben részesíteni, amelyiket kiválasztottad. A felismerés minősége magától a beolvasástól is függ, így a ferde, alacsony felbontású vagy kézzel írott oldalak nyelvtől függetlenül általában rosszul jönnek ki.
Kerül valamibe az OCR PDF eszköz használata?
Az OCR PDF eszköz teljesen ingyenes — nincs szükség fiókra vagy regisztrációra, és nincs korlát arra, hány szkennelt PDF-et futtatasz rajta, és mindig is ingyenes marad. Minden oldal felismerése közvetlenül a böngésződben zajlik a WebAssembly-re fordított Tesseract OCR motorral, így a szkennelt dokumentumaid — legyenek azok szerződések, személyi igazolványok vagy orvosi iratok — soha nem kerülnek sehova.