Aplicar OCR a un PDF escaneado de forma privada: reconoce texto en tu navegador
Selecciona un PDF escaneado y un idioma; cada página se representa y se reconoce localmente con Tesseract (compilado a WebAssembly), y el texto reconocido se muestra y se puede descargar como archivo .txt.
Quick answer
What it does
Selecciona un PDF escaneado y un idioma; cada página se representa y se reconoce localmente con Tesseract (compilado a WebAssembly), y el texto reconocido se muestra y se puede descargar como archivo .txt.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Un contable aplica OCR a una factura escaneada para copiar los importes de línea en una hoja de cálculo sin volver a teclearlos.
Good to know
En esta versión se admiten inglés y chino tradicional.
How it works
Selecciona un PDF escaneado de tu dispositivo y elige el idioma del documento.
El archivo se lee en la memoria del navegador: ningún dato sale de tu navegador.
pdf.js representa cada página como imagen en un Web Worker.
Tesseract OCR —compilado a WebAssembly y servido desde este sitio— reconoce el texto de cada página localmente; el modelo de idioma también se carga desde este sitio, no desde una CDN de terceros.
El texto reconocido se muestra por página y se ofrece para descargar como archivo .txt.
When to use this tool
Un contable aplica OCR a una factura escaneada para copiar los importes de línea en una hoja de cálculo sin volver a teclearlos.
Un estudiante aplica OCR a un apunte de curso escaneado para obtener texto buscable y copiable para sus notas.
Un archivero convierte documentos escaneados en chino tradicional en texto buscable para una biblioteca digital.
La precisión del OCR depende de la calidad del escaneo — las páginas borrosas, torcidas o de baja resolución pueden producir errores; trata el resultado como un borrador de mejor esfuerzo.
Frequently asked questions
¿En qué se diferencia de otras herramientas PDF online?
La mayoría de las herramientas PDF online envían tus archivos a un servidor remoto para procesarlos. Esta herramienta procesa todo localmente en tu navegador mediante JavaScript del lado del cliente. Tus archivos no se transmiten a ningún servidor, de modo que el contenido de tus documentos permanece bajo tu control.
¿Se suben mis archivos PDF?
No. Tu navegador lee los archivos directamente. Tus archivos nunca se transmiten por la red. La herramienta funciona por completo dentro de la pestaña del navegador que tienes abierta.
¿Puedo comprobar que los archivos no se suben?
Sí. Abre las herramientas de desarrollo de tu navegador (F12), ve a la pestaña Red (Network) y observa si hay alguna solicitud saliente mientras usas la herramienta. No verás salir ningún dato de archivo de tu navegador. El sitio puede registrar un conteo anónimo de visitas a la página, que nunca incluye tus archivos y se puede desactivar.
¿Funciona esta herramienta sin conexión?
Sí. Una vez cargada la página, la herramienta procesa tus archivos por completo en tu navegador; la funcionalidad de la herramienta no necesita conexión de red. Puedes desconectarte de internet y seguir usándola.
¿Qué ocurre cuando actualizo la página?
Como no se almacena nada en un servidor, al actualizar la página se borra la sesión actual. Tendrás que volver a seleccionar los archivos que tuvieras elegidos.
¿Guarda esta herramienta mis archivos?
No. Los archivos se mantienen en la memoria del navegador solo mientras la página está abierta. Al cerrarla o actualizarla se descartan. La herramienta no escribe nada en disco ni envía nada a un servidor.
¿Puede esta herramienta desbloquear PDF protegidos con contraseña?
No. Esta herramienta no intenta eliminar ni eludir la protección con contraseña de un PDF. Si conoces la contraseña, la herramienta Desbloquear PDF de este sitio puede quitarla localmente; después, esta herramienta podrá procesar el archivo.
¿Qué tecnologías utiliza esta herramienta?
Esta herramienta utiliza pdf.js para representar las páginas y el motor de OCR Tesseract compilado a WebAssembly (tesseract.js) ejecutándose en un Web Worker del mismo origen. Tus archivos nunca salen de tu navegador.
¿Usa esta herramienta WebAssembly?
Sí: esta es una de las pocas herramientas aquí que lo usa. El motor de OCR Tesseract es código C++ compilado a WebAssembly y se ejecuta dentro de tu navegador; el binario .wasm se sirve desde este sitio y no se envía nada a ningún sitio.
¿Por qué la primera ejecución es más lenta que las siguientes?
En el primer uso, tu navegador descarga el motor de OCR y el modelo de idioma desde este sitio (unos pocos megabytes) y los compila. Después quedan en caché, por lo que las ejecuciones posteriores empiezan mucho más rápido.
¿Cómo aplico OCR a un PDF escaneado aquí?
Elige un PDF escaneado de tu dispositivo, selecciona el idioma del documento (inglés o chino tradicional) y luego pulsa Reconocer. Cada página se renderiza y se lee localmente y, una vez terminado, puedes previsualizar el texto y guardarlo como un archivo .txt.
¿Por qué el texto reconocido es solo un archivo .txt en lugar de un PDF con texto buscable?
Esta herramienta genera las palabras reconocidas como texto sin formato en lugar de escribir una capa de texto invisible de vuelta en el PDF, así que tu PDF escaneado original permanece sin cambios. Si necesitas las palabras dentro de la página, las copiarías del .txt guardado o de la vista previa en pantalla, que enumera el texto página por página.
¿Puedo procesar dos idiomas en el mismo documento, y qué pasa si elijo el equivocado?
Seleccionas un único idioma para todo el documento antes de reconocer, así que un archivo que mezcle inglés y chino tradicional favorecerá el que hayas elegido. La calidad del reconocimiento también depende del propio escaneo, así que las páginas torcidas, de baja resolución o manuscritas tienden a salir mal independientemente del idioma.
¿La herramienta OCR PDF tiene algún coste?
La herramienta OCR PDF es completamente gratuita: sin cuenta, sin registro y sin límite en la cantidad de PDFs escaneados que procesas, y siempre lo será. Cada página se reconoce directamente en tu navegador usando el motor Tesseract OCR compilado a WebAssembly, por lo que tus documentos escaneados —ya sean contratos, documentos de identidad o registros médicos— nunca se envían a ningún lugar.