Extrair Texto de um PDF de Forma Privada — Corre Inteiramente no Seu Navegador
Selecione um PDF e a camada de texto de cada página é extraída localmente no navegador e disponibilizada como ficheiro de texto para descarregar — sem carregamento.
Quick answer
What it does
Selecione um PDF e a camada de texto de cada página é extraída localmente no navegador e disponibilizada como ficheiro de texto para descarregar — sem carregamento.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Copiar os termos de um contrato de um PDF com layout fixo para um editor de texto para revisão ou comparação.
Good to know
Esta ferramenta só consegue extrair texto que esteja incorporado como camada de texto no PDF. PDFs digitalizados e PDFs apenas com imagens não têm camada de texto, pelo que não será extraído qualquer texto.
How it works
Selecione um ficheiro PDF do seu dispositivo através do seletor de ficheiros.
O ficheiro é lido para a memória do navegador — nenhum dado sai do navegador.
O pdf.js carrega o documento num Web Worker e chama getTextContent() para cada página, de modo a obter a camada de texto incorporada.
O texto extraído de todas as páginas é combinado por ordem e disponibilizado como ficheiro .txt para descarregar.
Todos os dados temporários são libertados da memória assim que o descarregamento termina.
When to use this tool
Copiar os termos de um contrato de um PDF com layout fixo para um editor de texto para revisão ou comparação.
Extrair o texto principal de um PDF de artigo científico para colar numa ferramenta de tradução ou resumo.
Recolher dados de itens de linha de uma fatura em PDF como primeiro passo antes de importar para uma folha de cálculo.
Nota: funciona apenas em PDFs com uma camada de texto incorporada — PDFs digitalizados ou apenas de imagem não têm texto para extrair.
Frequently asked questions
Em que é diferente de outras ferramentas de PDF online?
A maioria das ferramentas de PDF online envia os seus ficheiros para um servidor remoto para processamento. Esta ferramenta processa tudo localmente no seu navegador, usando JavaScript do lado do cliente. Os seus ficheiros não são transmitidos para nenhum servidor, o que significa que o conteúdo dos seus documentos permanece sob o seu controlo.
Os meus ficheiros PDF são carregados para algum servidor?
Não. Os seus ficheiros são lidos diretamente pelo navegador. Os seus ficheiros nunca são transmitidos pela rede. A ferramenta funciona inteiramente dentro do separador do navegador que tem aberto.
Posso confirmar que os ficheiros não são carregados?
Sim. Abra as ferramentas de programador do navegador (F12), vá ao separador Rede (Network) e observe os pedidos de saída enquanto utiliza a ferramenta. Não verá quaisquer dados de ficheiros a sair do navegador. O site pode registar uma contagem anónima de visualizações de página, que nunca inclui os seus ficheiros e pode ser desativada.
Esta ferramenta funciona sem ligação à Internet?
Sim. Depois de a página carregar, a ferramenta processa os seus ficheiros inteiramente no navegador; a funcionalidade da ferramenta não necessita de ligação de rede. Pode desligar-se da Internet e continuar a utilizá-la.
O que acontece quando atualizo a página?
Como nada é guardado num servidor, atualizar a página limpa a sessão atual. Os ficheiros que tinha selecionado terão de ser selecionados novamente.
Esta ferramenta guarda os meus ficheiros?
Não. Os ficheiros são mantidos na memória do navegador apenas enquanto a página estiver aberta. Fechar ou atualizar a página descarta-os. A ferramenta não grava nada no disco e nada é enviado para um servidor.
Esta ferramenta consegue desbloquear PDFs protegidos por palavra-passe?
Não. Esta ferramenta não tenta remover nem contornar a proteção por palavra-passe dos PDF. Se souber a palavra-passe, a ferramenta Desbloquear PDF deste site pode removê-la localmente; depois disso, esta ferramenta consegue processar o ficheiro.
Que tecnologias utiliza esta ferramenta?
Esta ferramenta usa o pdf.js (o motor de PDF do lado do cliente da Mozilla) num Web Worker para ler a camada de texto incorporada de cada página do PDF, dentro do navegador. Os seus ficheiros nunca saem do navegador.
Esta ferramenta utiliza WebAssembly?
Não. O pdf.js é uma biblioteca de JavaScript puro — não usa WebAssembly. Toda a extração de texto do PDF acontece em JavaScript do lado do cliente, dentro do navegador.
Como extraio o texto do meu PDF?
Escolha um PDF com o seletor de ficheiros e depois prima o botão de extrair. O texto de cada página é lido localmente no seu navegador, mostrado numa caixa de pré-visualização, e pode guardá-lo como ficheiro .txt.
Porque é que o meu PDF digitalizado voltou sem texto?
Esta ferramenta lê a camada de texto incorporada que um PDF guarda, e documentos digitalizados ou apenas com imagens não têm essa camada, por isso nada pode ser extraído. Quando isso acontece, verá um aviso e não é disponibilizado nenhum ficheiro de texto, porque não há dados de caracteres para recuperar sem OCR.
Porque é que o texto extraído não corresponde à disposição visual da página?
A ferramenta percorre os itens de texto que o pdf.js reporta para cada página e mantém as quebras de linha, mas não reorganiza colunas, por isso páginas com várias colunas, tabelas e disposições complexas podem não coincidir com o que vê no ecrã. As páginas são unidas com linhas em branco, e PDFs com codificações de tipo de letra invulgares ou personalizadas também podem produzir caracteres ilegíveis mesmo quando a página parece correta.
O Extract Text from PDF tem algum custo de utilização?
O Extract Text from PDF é completamente gratuito — sem conta, sem registo e sem limite de PDFs processados, e sempre será assim. O seu PDF é lido diretamente pelo browser com pdf.js, que extrai a camada de texto incorporada página a página e entrega um ficheiro .txt simples; o próprio ficheiro permanece na memória do browser durante todo o processo e nunca é transmitido para lado nenhum.