Extraer texto de un PDF de forma privada: se ejecuta por completo en tu navegador
Selecciona un PDF y la capa de texto de cada página se extrae localmente en tu navegador y se ofrece como archivo de texto descargable, sin subidas.
Quick answer
What it does
Selecciona un PDF y la capa de texto de cada página se extrae localmente en tu navegador y se ofrece como archivo de texto descargable, sin subidas.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Copiar los términos de un contrato de un PDF de maquetación fija a un editor de texto para revisión o comparación.
Good to know
Esta herramienta solo puede extraer el texto incrustado como capa de texto en el PDF. Los PDF escaneados y los PDF de solo imagen no tienen capa de texto, así que no se extraerá texto.
How it works
Selecciona un archivo PDF de tu dispositivo con el selector de archivos.
El archivo se lee en la memoria del navegador: ningún dato sale de tu navegador.
pdf.js carga el documento en un Web Worker y llama a getTextContent() en cada página para recuperar la capa de texto incrustada.
El texto extraído de todas las páginas se combina en orden y se ofrece como archivo .txt descargable.
Todos los datos temporales se liberan de la memoria una vez completada la descarga.
When to use this tool
Copiar los términos de un contrato de un PDF de maquetación fija a un editor de texto para revisión o comparación.
Extraer el texto principal de un artículo de investigación en PDF para pegarlo en una herramienta de traducción o resumen.
Raspar datos de líneas de factura de un PDF como primer paso antes de importarlos a una hoja de cálculo.
Nota: solo funciona en PDF con una capa de texto incrustada — los PDF escaneados o solo con imágenes no tienen texto que extraer.
Frequently asked questions
¿En qué se diferencia de otras herramientas PDF online?
La mayoría de las herramientas PDF online envían tus archivos a un servidor remoto para procesarlos. Esta herramienta procesa todo localmente en tu navegador mediante JavaScript del lado del cliente. Tus archivos no se transmiten a ningún servidor, de modo que el contenido de tus documentos permanece bajo tu control.
¿Se suben mis archivos PDF?
No. Tu navegador lee los archivos directamente. Tus archivos nunca se transmiten por la red. La herramienta funciona por completo dentro de la pestaña del navegador que tienes abierta.
¿Puedo comprobar que los archivos no se suben?
Sí. Abre las herramientas de desarrollo de tu navegador (F12), ve a la pestaña Red (Network) y observa si hay alguna solicitud saliente mientras usas la herramienta. No verás salir ningún dato de archivo de tu navegador. El sitio puede registrar un conteo anónimo de visitas a la página, que nunca incluye tus archivos y se puede desactivar.
¿Funciona esta herramienta sin conexión?
Sí. Una vez cargada la página, la herramienta procesa tus archivos por completo en tu navegador; la funcionalidad de la herramienta no necesita conexión de red. Puedes desconectarte de internet y seguir usándola.
¿Qué ocurre cuando actualizo la página?
Como no se almacena nada en un servidor, al actualizar la página se borra la sesión actual. Tendrás que volver a seleccionar los archivos que tuvieras elegidos.
¿Guarda esta herramienta mis archivos?
No. Los archivos se mantienen en la memoria del navegador solo mientras la página está abierta. Al cerrarla o actualizarla se descartan. La herramienta no escribe nada en disco ni envía nada a un servidor.
¿Puede esta herramienta desbloquear PDF protegidos con contraseña?
No. Esta herramienta no intenta eliminar ni eludir la protección con contraseña de un PDF. Si conoces la contraseña, la herramienta Desbloquear PDF de este sitio puede quitarla localmente; después, esta herramienta podrá procesar el archivo.
¿Qué tecnologías utiliza esta herramienta?
Esta herramienta utiliza pdf.js (el motor de PDF del lado del cliente de Mozilla) en un Web Worker para leer la capa de texto incrustada de cada página del PDF dentro de tu navegador. Tus archivos nunca salen de tu navegador.
¿Usa esta herramienta WebAssembly?
No. pdf.js es una biblioteca de JavaScript pura: no utiliza WebAssembly. Toda la extracción de texto del PDF se realiza con JavaScript del lado del cliente dentro de tu navegador.
¿Cómo extraigo el texto de mi PDF?
Selecciona un PDF con el selector de archivos y luego pulsa el botón de extraer. El texto de cada página se lee localmente en tu navegador, se muestra en un cuadro de vista previa y puedes guardarlo como un archivo .txt.
¿Por qué mi PDF escaneado volvió sin texto?
Esta herramienta lee la capa de texto incrustada que almacena un PDF, y los documentos escaneados o solo de imagen no tienen esa capa, así que no se puede extraer nada. Cuando eso ocurre verás un aviso y no se ofrece ningún archivo de texto, porque no hay datos de caracteres que recuperar sin OCR.
¿Por qué el texto extraído no coincide con la disposición visual de la página?
La herramienta recorre los elementos de texto que pdf.js informa para cada página y conserva sus saltos de línea, pero no reorganiza las columnas, así que las páginas a varias columnas, las tablas y los diseños complejos pueden no coincidir con lo que ves en pantalla. Las páginas se unen con líneas en blanco, y los PDF con codificaciones de fuente inusuales o personalizadas también pueden producir caracteres ilegibles aunque la página se vea bien.
¿El uso de Extract Text from PDF tiene algún coste?
Extract Text from PDF es completamente gratuito: sin cuenta, sin registro y sin límite en cuántos PDF procesas, y así será siempre. Tu PDF es leído directamente por tu navegador usando pdf.js, que extrae la capa de texto incrustada página a página y te entrega un archivo .txt plano; el archivo en sí permanece en la memoria del navegador en todo momento y nunca se transmite a ningún lugar.