Beolvasott PDF OCR-je bizalmasan – ismerd fel a szöveget a böngésződben

Válassz ki egy beolvasott PDF-et és egy nyelvet; minden oldal helyben renderelődik és felismerésre kerül a Tesseract (WebAssemblyre fordítva) segítségével, a felismert szöveg pedig megjelenik, és letölthető .txt fájlként.

Quick answer

What it does
Válassz ki egy beolvasott PDF-et és egy nyelvet; minden oldal helyben renderelődik és felismerésre kerül a Tesseract (WebAssemblyre fordítva) segítségével, a felismert szöveg pedig megjelenik, és letölthető .txt fájlként.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Egy könyvelő OCR-rel dolgoz fel egy beolvasott számlát, hogy a sortételek összegeit gépelés nélkül másolja táblázatba.
Good to know
Ebben a verzióban az angol és a hagyományos kínai nyelv támogatott.

How it works

  1. Válassz ki egy beolvasott PDF-et az eszközödről, és add meg a dokumentum nyelvét.
  2. A fájl a böngésző memóriájába kerül – semmilyen adat nem hagyja el a böngésződet.
  3. A pdf.js minden oldalt képpé renderel egy Web Workerben.
  4. A Tesseract OCR – WebAssemblyre fordítva és erről az oldalról kiszolgálva – helyben felismeri minden oldal szövegét; a nyelvi modell szintén erről az oldalról töltődik be, nem egy harmadik fél CDN-jéről.
  5. A felismert szöveg oldalanként jelenik meg, és .txt fájlként letölthető.

When to use this tool

  • Egy könyvelő OCR-rel dolgoz fel egy beolvasott számlát, hogy a sortételek összegeit gépelés nélkül másolja táblázatba.
  • Egy diák OCR-rel dolgoz fel egy beolvasott tanfolyami handout-ot, hogy kereshető, másolható szöveget kapjon a jegyzeteihez.
  • Egy levéltáros hagyományos kínai beolvasott dokumentumokat alakít át kereshető szöveggé egy digitális könyvtárhoz.
  • Az OCR pontossága a beolvasás minőségétől függ — homályos, dőlt vagy kis felbontású oldalak hibákat okozhatnak; a kimenetet legjobb erőfeszítésen alapuló vázlatként kezelje.

Frequently asked questions

Miben különbözik ez a többi online PDF eszköztől?
A legtöbb online PDF eszköz a fájljaidat egy távoli szerverre küldi feldolgozásra. Ez az eszköz mindent helyben, a böngésződben dolgoz fel, kliensoldali JavaScript segítségével. A fájljaid soha nem kerülnek átküldésre semmilyen szerverre, vagyis a dokumentumod tartalma teljes mértékben a te ellenőrzésed alatt marad.
Feltöltődnek a PDF fájljaim?
Nem. A fájljaidat közvetlenül a böngésződ olvassa be. A fájljaid soha nem kerülnek átküldésre a hálózaton. Az eszköz teljes egészében a megnyitott böngészőfülön belül működik.
Ellenőrizhetem, hogy a fájlok nem töltődnek fel?
Igen. Nyisd meg a böngésződ fejlesztői eszközeit (F12), válts a Network (Hálózat) fülre, és figyeld a kimenő kéréseket, miközben az eszközt használod. Nem fogsz látni fájladatokat kilépni a böngésződből. Az oldal rögzíthet egy névtelen oldalmegtekintési számlálót, amely soha nem tartalmazza a fájljaidat, és letiltható.
Működik ez az eszköz offline módban?
Igen, miután az oldal betöltődött, az eszköz teljes egészében a böngésződben dolgozza fel a fájljaidat; az eszköz funkcionalitásához nincs szükség hálózati kapcsolatra. Lekapcsolódhatsz az internetről, és folytathatod a használatát.
Mi történik, ha frissítem az oldalt?
Mivel semmi nem tárolódik szerveren, az oldal frissítése törli az aktuális munkamenetet. A korábban kiválasztott fájlokat újra ki kell majd választanod.
Tárolja ez az eszköz a fájljaimat?
Nem. A fájlok csak addig maradnak a böngésző memóriájában, amíg az oldal nyitva van. Az oldal bezárása vagy frissítése eldobja őket. Az eszköz semmit nem ír a lemezre, és semmit nem küld szerverre.
Fel tudja oldani ez az eszköz a jelszóval védett PDF-eket?
Nem. Ez az eszköz nem próbálja eltávolítani vagy megkerülni a PDF jelszavas védelmét. Ha ismered a jelszót, az ezen az oldalon található PDF-feloldó eszköz helyben el tudja távolítani; ezután ez az eszköz fel tudja dolgozni a fájlt.
Milyen technológiákat használ ez az eszköz?
Ez az eszköz a pdf.js-t használja az oldalak rendereléséhez, és a WebAssemblyre fordított Tesseract OCR-motort (tesseract.js), amely egy azonos eredetű (same-origin) Web Workerben fut – a fájljaid soha nem hagyják el a böngésződet.
Használ ez az eszköz WebAssemblyt?
Igen – ez egyike azon kevés itteni eszköznek, amely használja. A Tesseract OCR-motor C++ nyelven íródott, WebAssemblyre fordítva, és a böngésződben fut; a .wasm bináris erről az oldalról kerül kiszolgálásra, és semmi nem küldődik sehová.
Miért lassabb az első futtatás a következőknél?
Az első használatkor a böngésződ letölti az OCR-motort és a nyelvi modellt erről az oldalról (néhány megabájt), és lefordítja őket. Ezt követően gyorsítótárba kerülnek, így a későbbi futtatások sokkal gyorsabban indulnak.
Hogyan futtathatok OCR-t egy beolvasott PDF-en itt?
Válassz ki egy beolvasott PDF-et az eszközödről, válaszd ki a dokumentum nyelvét (angol vagy hagyományos kínai), majd válaszd a Felismerés gombot. Minden oldalt a rendszer helyben renderel és olvas be, és amint elkészül, megnézheted a szöveget előnézetben, és elmentheted .txt fájlként.
Miért csak egy .txt fájl a felismert szöveg, és nem egy kereshető PDF?
Ez az eszköz a felismert szavakat sima szövegként adja ki, ahelyett hogy egy láthatatlan szövegréteget írna vissza a PDF-be, így az eredeti beolvasott PDF változatlan marad. Ha a szavakra az oldalon belül van szükséged, a mentett .txt fájlból vagy a képernyőn megjelenő előnézetből másolhatod ki őket, amely oldalanként sorolja fel a szöveget.
Futtathatok két nyelvet ugyanabban a dokumentumban, és mi van, ha rosszat választok?
A felismerés előtt egyetlen nyelvet választasz az egész dokumentumhoz, így egy angolt és hagyományos kínait keverő fájl azt a nyelvet fogja előnyben részesíteni, amelyiket kiválasztottad. A felismerés minősége magától a beolvasástól is függ, így a ferde, alacsony felbontású vagy kézzel írott oldalak nyelvtől függetlenül általában rosszul jönnek ki.
Kerül valamibe az OCR PDF eszköz használata?
Az OCR PDF eszköz teljesen ingyenes — nincs szükség fiókra vagy regisztrációra, és nincs korlát arra, hány szkennelt PDF-et futtatasz rajta, és mindig is ingyenes marad. Minden oldal felismerése közvetlenül a böngésződben zajlik a WebAssembly-re fordított Tesseract OCR motorral, így a szkennelt dokumentumaid — legyenek azok szerződések, személyi igazolványok vagy orvosi iratok — soha nem kerülnek sehova.

Related tools

  • Szöveg kinyerése
  • Szószámlálás
  • PDF képekké
  • PDF tömörítése
  • Mindenes PDF-szerkesztő
  • Kezdőlap
  • Mindenes PDF-szerkesztő
  • PDF egyesítése
  • PDF felosztása
  • PDF forgatása
  • Vízjel hozzáadása
  • Képek PDF-be
  • PDF képekké
  • Oldalszámok
  • PDF tömörítése
  • Szöveg kinyerése
  • Metaadatok szerkesztése
  • Oldalak rendezése
  • Üres oldalak beszúrása
  • Oldalak kinyerése
  • N-up (oldal laponként)
  • PDF szürkeárnyalatossá alakítása
  • PDF körbevágása
  • Oldalak megfordítása
  • Átméretezés (A4/Letter)
  • Fejléc és lábléc hozzáadása
  • Űrlap lapítása
  • Felosztás minden N oldalanként
  • PDF-infó és metaadatok
  • Kép / aláírás bélyegzése
  • Oldalak eltávolítása
  • Mintázott vízjel
  • Füzet
  • Oldalak megkettőzése
  • Fájl csatolása
  • Méretezés százalékkal
  • Üres oldalak eltávolítása
  • Összefűző egyesítés
  • Oldalszegély hozzáadása
  • Páratlan / páros oldalak kinyerése
  • PDF hosszú képpé
  • Oldalak felezése
  • Margók hozzáadása
  • PDF aláírása
  • PDF-ek összehasonlítása
  • Poszterfelosztás
  • Szószámlálás
  • PDF javítása
  • PDF-űrlap kitöltése
  • Felosztás könyvjelzők szerint
  • Keresés és kiemelés
  • Képek kinyerése
  • PDF szerkesztése (kitakarás)
  • OCR (beolvasottból szöveg)
  • PDF védelme
  • PDF feloldása
  • Rólunk
  • Adatvédelmi szabályzat
  • Kapcsolat
  • Hogyan működik
  • Helyi és online PDF-eszközök
  • Biztonságosak-e az online PDF-eszközök?