Esegui l'OCR di un PDF scansionato in privato: riconosci il testo nel browser
Seleziona un PDF scansionato e una lingua; ogni pagina viene renderizzata e riconosciuta in locale da Tesseract (compilato in WebAssembly) e il testo riconosciuto viene mostrato e scaricabile come file .txt.
Quick answer
What it does
Seleziona un PDF scansionato e una lingua; ogni pagina viene renderizzata e riconosciuta in locale da Tesseract (compilato in WebAssembly) e il testo riconosciuto viene mostrato e scaricabile come file .txt.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Un contabile applica l'OCR a una fattura scansionata per copiare gli importi delle voci in un foglio di calcolo senza riscrivere.
Good to know
In questa versione sono supportati l'inglese e il cinese tradizionale.
How it works
Seleziona un PDF scansionato dal tuo dispositivo e scegli la lingua del documento.
Il file viene letto nella memoria del browser: nessun dato lascia il browser.
pdf.js renderizza ogni pagina come immagine in un Web Worker.
Tesseract OCR — compilato in WebAssembly e servito da questo sito — riconosce in locale il testo di ogni pagina; anche il modello linguistico viene caricato da questo sito, non da una CDN di terze parti.
Il testo riconosciuto viene mostrato pagina per pagina e proposto come download .txt.
When to use this tool
Un contabile applica l'OCR a una fattura scansionata per copiare gli importi delle voci in un foglio di calcolo senza riscrivere.
Uno studente applica l'OCR a una dispensa scansionata per ottenere testo ricercabile e copiabile per i propri appunti.
Un archivista converte documenti in cinese tradizionale scansionati in testo ricercabile per una biblioteca digitale.
L'accuratezza dell'OCR dipende dalla qualità della scansione — le pagine sfocate, inclinate o a bassa risoluzione possono produrre errori; tratta l'output come una bozza approssimativa.
Frequently asked questions
In cosa si differenzia dagli altri strumenti PDF online?
La maggior parte degli strumenti PDF online invia i tuoi file a un server remoto per l'elaborazione. Questo strumento elabora tutto in locale nel browser tramite JavaScript lato client. I tuoi file non vengono trasmessi ad alcun server, quindi il contenuto dei documenti resta interamente sotto il tuo controllo.
I miei file PDF vengono caricati su un server?
No. I tuoi file vengono letti direttamente dal browser. I tuoi file non vengono mai trasmessi in rete. Lo strumento funziona interamente all'interno della scheda del browser che hai aperto.
Posso verificare che i file non vengano caricati?
Sì. Apri gli strumenti per sviluppatori del browser (F12), vai alla scheda Rete e osserva se ci sono richieste in uscita mentre usi lo strumento. Vedrai che nessun dato dei file lascia il browser. Il sito potrebbe registrare un conteggio anonimo delle visualizzazioni di pagina, che non include mai i tuoi file e può essere disabilitato.
Questo strumento funziona offline?
Sì: una volta caricata la pagina, lo strumento elabora i tuoi file interamente nel browser; la funzionalità dello strumento non richiede alcuna connessione di rete. Puoi disconnetterti da internet e continuare a usarlo.
Cosa succede se aggiorno la pagina?
Poiché nulla viene salvato su un server, aggiornando la pagina la sessione corrente si azzera. Dovrai selezionare di nuovo gli eventuali file che avevi scelto.
Questo strumento conserva i miei file?
No. I file restano nella memoria del browser solo finché la pagina è aperta. Chiudendo o aggiornando la pagina vengono eliminati. Lo strumento non scrive nulla su disco e non invia nulla a un server.
Questo strumento può sbloccare i PDF protetti da password?
No. Questo strumento non tenta di rimuovere né di aggirare la protezione con password dei PDF. Se conosci la password, lo strumento Sblocca PDF di questo sito può rimuoverla in locale; dopodiché questo strumento potrà elaborare il file.
Quali tecnologie utilizza questo strumento?
Questo strumento utilizza pdf.js per renderizzare le pagine e il motore OCR Tesseract compilato in WebAssembly (tesseract.js) in esecuzione in un Web Worker della stessa origine: i tuoi file non lasciano mai il browser.
Questo strumento usa WebAssembly?
Sì: questo è uno dei pochi strumenti qui che lo fa. Il motore OCR Tesseract è C++ compilato in WebAssembly e funziona all'interno del browser; il binario .wasm viene servito da questo sito e nulla viene inviato altrove.
Perché la prima esecuzione è più lenta di quelle successive?
Al primo utilizzo il browser scarica da questo sito il motore OCR e il modello linguistico (alcuni megabyte) e li compila. Successivamente vengono memorizzati nella cache, quindi le esecuzioni successive partono molto più velocemente.
Come eseguo l'OCR di un PDF scansionato qui?
Scegli un PDF scansionato dal tuo dispositivo, seleziona la lingua del documento (inglese o cinese tradizionale), poi seleziona Riconosci. Ogni pagina viene renderizzata e letta in locale e, una volta terminato, puoi visualizzare in anteprima il testo e salvarlo come file .txt.
Perché il testo riconosciuto è solo un file .txt invece di un PDF ricercabile?
Questo strumento restituisce le parole riconosciute come testo semplice anziché riscrivere un livello di testo invisibile nel PDF, quindi il tuo PDF scansionato originale resta invariato. Se ti servono le parole all'interno della pagina, dovresti copiarle dal file .txt salvato o dall'anteprima a schermo, che elenca il testo pagina per pagina.
Posso usare due lingue nello stesso documento e cosa succede se scelgo quella sbagliata?
Selezioni una sola lingua per l'intero documento prima del riconoscimento, quindi un file che mescola inglese e cinese tradizionale favorirà quella che hai scelto. La qualità del riconoscimento dipende anche dalla scansione stessa, quindi le pagine distorte, a bassa risoluzione o scritte a mano tendono a risultare di scarsa qualità indipendentemente dalla lingua.
Lo strumento OCR PDF ha un costo?
Lo strumento OCR PDF è completamente gratuito — nessun account, nessuna registrazione e nessun limite al numero di PDF scansionati che puoi elaborare, e lo sarà sempre. Ogni pagina viene riconosciuta direttamente nel tuo browser usando il motore OCR Tesseract compilato in WebAssembly, quindi i tuoi documenti scansionati — che contengano contratti, documenti d'identità o cartelle cliniche — non vengono mai inviati da nessuna parte.