Tee OCR skannatulle PDF:lle yksityisesti – tunnista teksti selaimessasi
Valitse skannattu PDF ja kieli; jokainen sivu renderöidään ja tunnistetaan paikallisesti Tesseractilla (käännetty WebAssemblyksi), ja tunnistettu teksti näytetään ja on ladattavissa .txt-tiedostona.
Quick answer
What it does
Valitse skannattu PDF ja kieli; jokainen sivu renderöidään ja tunnistetaan paikallisesti Tesseractilla (käännetty WebAssemblyksi), ja tunnistettu teksti näytetään ja on ladattavissa .txt-tiedostona.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Kirjanpitäjä suorittaa OCR:n skannatulle laskulle kopioidakseen rivien summat taulukkolaskentaan ilman uudelleenkirjoittamista.
Good to know
Englanti ja perinteinen kiina ovat tuettuja tässä versiossa.
How it works
Valitse skannattu PDF laitteeltasi ja valitse asiakirjan kieli.
Tiedosto luetaan selaimen muistiin – mitään dataa ei poistu selaimestasi.
pdf.js renderöi jokaisen sivun kuvaksi Web Workerissa.
Tesseract OCR – käännetty WebAssemblyksi ja tarjottu tältä sivustolta – tunnistaa kunkin sivun tekstin paikallisesti; kielimalli ladataan myös tältä sivustolta, ei kolmannen osapuolen CDN:stä.
Tunnistettu teksti näytetään sivukohtaisesti ja tarjotaan .txt-latauksena.
When to use this tool
Kirjanpitäjä suorittaa OCR:n skannatulle laskulle kopioidakseen rivien summat taulukkolaskentaan ilman uudelleenkirjoittamista.
Opiskelija suorittaa OCR:n skannatulle kurssimonistelle saadakseen hakukelpoista ja kopioitavaa tekstiä muistiinpanoihinsa.
OCR-tarkkuus riippuu skannauslaadusta — epätarkat, vinossa olevat tai matalaerotteluiset sivut saattavat tuottaa virheitä; käsittele tulostus parhaan yrityksen luonnoksena.
Frequently asked questions
Miten tämä eroaa muista online-PDF-työkaluista?
Useimmat online-PDF-työkalut lähettävät tiedostosi etäpalvelimelle käsiteltäväksi. Tämä työkalu käsittelee kaiken paikallisesti selaimessasi selainpuolen JavaScriptillä. Tiedostojasi ei koskaan lähetetä mihinkään palvelimelle, joten asiakirjojesi sisältö pysyy kokonaan sinun hallinnassasi.
Lähetetäänkö PDF-tiedostoni palvelimelle?
Ei. Tiedostosi luetaan suoraan selaimessasi. Tiedostojasi ei koskaan lähetetä verkon yli. Työkalu toimii kokonaan avaamassasi selainvälilehdessä.
Voinko varmistaa, ettei tiedostoja lähetetä?
Kyllä. Avaa selaimesi kehittäjätyökalut (F12), siirry Network-välilehdelle ja tarkkaile lähteviä pyyntöjä työkalua käyttäessäsi. Et näe minkään tiedostodatan poistuvan selaimestasi. Sivusto saattaa tallentaa anonyymin sivunäyttömäärän, joka ei koskaan sisällä tiedostojasi ja jonka voi poistaa käytöstä.
Toimiiko tämä työkalu offline-tilassa?
Kyllä, kun sivu on kerran latautunut, työkalu käsittelee tiedostosi kokonaan selaimessasi; työkalun toiminnallisuus ei tarvitse verkkoyhteyttä. Voit katkaista internetyhteyden ja jatkaa sen käyttöä.
Mitä tapahtuu, kun päivitän sivun?
Koska mitään ei tallenneta palvelimelle, sivun päivittäminen tyhjentää nykyisen istuntosi. Mahdolliset valitsemasi tiedostot on valittava uudelleen.
Tallentaako tämä työkalu tiedostoni?
Ei. Tiedostot säilyvät selaimen muistissa vain niin kauan kuin sivu on auki. Sivun sulkeminen tai päivittäminen hävittää ne. Työkalu ei kirjoita mitään levylle, eikä mitään lähetetä palvelimelle.
Voiko tämä työkalu avata salasanalla suojattuja PDF-tiedostoja?
Ei. Tämä työkalu ei yritä poistaa tai ohittaa PDF-tiedoston salasanasuojausta. Jos tiedät salasanan, tämän sivuston Avaa PDF -työkalu voi poistaa sen paikallisesti; sen jälkeen tämä työkalu voi käsitellä tiedoston.
Mitä tekniikoita tämä työkalu käyttää?
Tämä työkalu käyttää pdf.js:ää sivujen renderöintiin ja WebAssemblyksi käännettyä Tesseract OCR -moottoria (tesseract.js), joka toimii samaan alkuperään kuuluvassa Web Workerissa – tiedostosi eivät koskaan poistu selaimestasi.
Käyttääkö tämä työkalu WebAssemblya?
Kyllä – tämä on yksi harvoista täällä olevista työkaluista, jotka käyttävät sitä. Tesseract OCR -moottori on C++:aa, joka on käännetty WebAssemblyksi ja toimii selaimessasi; .wasm-binääri tarjotaan tältä sivustolta eikä mitään lähetetä mihinkään.
Miksi ensimmäinen suorituskerta on hitaampi kuin seuraavat?
Ensimmäisellä käyttökerralla selaimesi lataa OCR-moottorin ja kielimallin tältä sivustolta (muutama megatavu) ja kääntää ne. Ne tallennetaan välimuistiin sen jälkeen, joten myöhemmät suorituskerrat alkavat paljon nopeammin.
Miten suoritan OCR:n skannatulle PDF:lle täällä?
Valitse skannattu PDF laitteeltasi, valitse asiakirjan kieli (englanti tai perinteinen kiina) ja valitse sitten Tunnista. Jokainen sivu hahmonnetaan ja luetaan paikallisesti, ja kun se on valmis, voit esikatsella tekstiä ja tallentaa sen .txt-tiedostona.
Miksi tunnistettu teksti on vain .txt-tiedosto eikä haettava PDF?
Tämä työkalu tulostaa tunnistetut sanat pelkkänä tekstinä sen sijaan, että se kirjoittaisi näkymättömän tekstikerroksen takaisin PDF:ään, joten alkuperäinen skannattu PDF:si pysyy muuttumattomana. Jos tarvitset sanat sivun sisälle, kopioisit ne tallennetusta .txt-tiedostosta tai näytöllä olevasta esikatselusta, joka luettelee tekstin sivu sivulta.
Voinko käyttää kahta kieltä samassa asiakirjassa, ja mitä jos valitsen väärän?
Valitset yhden kielen koko asiakirjalle ennen tunnistusta, joten tiedosto, jossa on sekaisin englantia ja perinteistä kiinaa, suosii sitä kieltä, jonka valitsit. Tunnistuksen laatu riippuu myös itse skannauksesta, joten vinot, matalaresoluutioiset tai käsinkirjoitetut sivut tulevat yleensä huonosti kielestä riippumatta.
Onko OCR PDF -työkalu ilmainen käyttää?
OCR PDF -työkalu on täysin ilmainen — ei tiliä, ei rekisteröitymistä eikä rajoitusta käsiteltävien skannattujen PDF:ien määrään, ja se tulee aina olemaan ilmaista. Jokainen sivu tunnistetaan suoraan selaimessasi WebAssembly-muodossa käännetyn Tesseract OCR -moottorin avulla, joten skannattuja dokumenttejasi — olivatpa ne sopimuksia, henkilöllisyystodistuksia tai lääkärintodistuksia — ei koskaan lähetetä minnekään.