Fazer OCR de um PDF Digitalizado de Forma Privada — Reconhecer Texto no Seu Navegador
Selecione um PDF digitalizado e uma língua; cada página é renderizada e reconhecida localmente pelo Tesseract (compilado para WebAssembly), e o texto reconhecido é apresentado e pode ser descarregado como ficheiro .txt.
Quick answer
What it does
Selecione um PDF digitalizado e uma língua; cada página é renderizada e reconhecida localmente pelo Tesseract (compilado para WebAssembly), e o texto reconhecido é apresentado e pode ser descarregado como ficheiro .txt.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Um contabilista faz OCR a uma fatura digitalizada para copiar os valores de itens para uma folha de cálculo sem redigitar.
Good to know
Nesta versão são suportados o inglês e o chinês tradicional.
How it works
Selecione um PDF digitalizado do seu dispositivo e escolha a língua do documento.
O ficheiro é lido para a memória do navegador — nenhum dado sai do navegador.
O pdf.js renderiza cada página para uma imagem num Web Worker.
O OCR Tesseract — compilado para WebAssembly e fornecido a partir deste site — reconhece o texto de cada página localmente; o modelo de língua também é carregado a partir deste site, e não de uma CDN de terceiros.
O texto reconhecido é apresentado por página e disponibilizado como descarregamento .txt.
When to use this tool
Um contabilista faz OCR a uma fatura digitalizada para copiar os valores de itens para uma folha de cálculo sem redigitar.
Um estudante faz OCR a um folheto de curso digitalizado para obter texto pesquisável e copiável para as suas notas.
Um arquivista converte documentos digitalizados em Chinês Tradicional em texto pesquisável para uma biblioteca digital.
A precisão do OCR depende da qualidade da digitalização — páginas desfocadas, inclinadas ou de baixa resolução podem produzir erros; trate o resultado como um rascunho de melhor esforço.
Frequently asked questions
Em que é diferente de outras ferramentas de PDF online?
A maioria das ferramentas de PDF online envia os seus ficheiros para um servidor remoto para processamento. Esta ferramenta processa tudo localmente no seu navegador, usando JavaScript do lado do cliente. Os seus ficheiros não são transmitidos para nenhum servidor, o que significa que o conteúdo dos seus documentos permanece sob o seu controlo.
Os meus ficheiros PDF são carregados para algum servidor?
Não. Os seus ficheiros são lidos diretamente pelo navegador. Os seus ficheiros nunca são transmitidos pela rede. A ferramenta funciona inteiramente dentro do separador do navegador que tem aberto.
Posso confirmar que os ficheiros não são carregados?
Sim. Abra as ferramentas de programador do navegador (F12), vá ao separador Rede (Network) e observe os pedidos de saída enquanto utiliza a ferramenta. Não verá quaisquer dados de ficheiros a sair do navegador. O site pode registar uma contagem anónima de visualizações de página, que nunca inclui os seus ficheiros e pode ser desativada.
Esta ferramenta funciona sem ligação à Internet?
Sim. Depois de a página carregar, a ferramenta processa os seus ficheiros inteiramente no navegador; a funcionalidade da ferramenta não necessita de ligação de rede. Pode desligar-se da Internet e continuar a utilizá-la.
O que acontece quando atualizo a página?
Como nada é guardado num servidor, atualizar a página limpa a sessão atual. Os ficheiros que tinha selecionado terão de ser selecionados novamente.
Esta ferramenta guarda os meus ficheiros?
Não. Os ficheiros são mantidos na memória do navegador apenas enquanto a página estiver aberta. Fechar ou atualizar a página descarta-os. A ferramenta não grava nada no disco e nada é enviado para um servidor.
Esta ferramenta consegue desbloquear PDFs protegidos por palavra-passe?
Não. Esta ferramenta não tenta remover nem contornar a proteção por palavra-passe dos PDF. Se souber a palavra-passe, a ferramenta Desbloquear PDF deste site pode removê-la localmente; depois disso, esta ferramenta consegue processar o ficheiro.
Que tecnologias utiliza esta ferramenta?
Esta ferramenta usa o pdf.js para renderizar as páginas e o motor de OCR Tesseract compilado para WebAssembly (tesseract.js) a correr num Web Worker da mesma origem — os seus ficheiros nunca saem do navegador.
Esta ferramenta utiliza WebAssembly?
Sim — é uma das poucas ferramentas aqui que o faz. O motor de OCR Tesseract é C++ compilado para WebAssembly e corre dentro do navegador; o binário .wasm é fornecido a partir deste site e nada é enviado para fora.
Porque é que a primeira utilização é mais lenta do que as seguintes?
Na primeira utilização, o navegador transfere o motor de OCR e o modelo de língua a partir deste site (alguns megabytes) e compila-os. Ficam em cache depois disso, pelo que as utilizações seguintes começam muito mais depressa.
Como faço OCR de um PDF digitalizado aqui?
Escolha um PDF digitalizado do seu dispositivo, selecione o idioma do documento (inglês ou chinês tradicional) e depois selecione Reconhecer. Cada página é composta e lida localmente e, quando terminar, pode pré-visualizar o texto e guardá-lo como ficheiro .txt.
Porque é que o texto reconhecido é apenas um ficheiro .txt em vez de um PDF pesquisável?
Esta ferramenta produz as palavras reconhecidas como texto simples, em vez de escrever uma camada de texto invisível de volta no PDF, por isso o seu PDF digitalizado original mantém-se inalterado. Se precisar das palavras dentro da página, copiá-las-ia do ficheiro .txt guardado ou da pré-visualização no ecrã, que apresenta o texto página a página.
Posso usar dois idiomas no mesmo documento e o que acontece se escolher o errado?
Seleciona um único idioma para todo o documento antes de reconhecer, por isso um ficheiro que misture inglês e chinês tradicional favorecerá aquele que escolheu. A qualidade do reconhecimento também depende da própria digitalização, por isso páginas inclinadas, de baixa resolução ou manuscritas tendem a sair mal, independentemente do idioma.
A ferramenta OCR PDF tem algum custo?
A ferramenta OCR PDF é completamente gratuita — sem conta, sem cadastro e sem limite na quantidade de PDFs digitalizados processados, e sempre será assim. Cada página é reconhecida diretamente no seu navegador usando o mecanismo Tesseract OCR compilado para WebAssembly, então os seus documentos digitalizados — sejam contratos, documentos de identidade ou registros médicos — nunca são enviados a nenhum lugar.