OCR отсканированного PDF без передачи данных — распознавайте текст в браузере

Выберите отсканированный PDF и язык; каждая страница рендерится и распознаётся локально движком Tesseract (скомпилированным в WebAssembly), а распознанный текст показывается и доступен для скачивания в виде файла .txt.

Quick answer

What it does
Выберите отсканированный PDF и язык; каждая страница рендерится и распознаётся локально движком Tesseract (скомпилированным в WebAssembly), а распознанный текст показывается и доступен для скачивания в виде файла .txt.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Бухгалтер применяет OCR к отсканированному счёту, чтобы скопировать суммы строк в таблицу без повторного ввода.
Good to know
В этой версии поддерживаются английский и традиционный китайский.

How it works

  1. Выберите на устройстве отсканированный PDF и выберите язык документа.
  2. Файл считывается в память браузера — данные не покидают браузер.
  3. pdf.js рендерит каждую страницу в изображение в Web Worker.
  4. Движок Tesseract OCR — скомпилированный в WebAssembly и обслуживаемый с этого сайта — распознаёт текст каждой страницы локально; языковая модель также загружается с этого сайта, а не из стороннего CDN.
  5. Распознанный текст показывается постранично и предлагается для скачивания в виде файла .txt.

When to use this tool

  • Бухгалтер применяет OCR к отсканированному счёту, чтобы скопировать суммы строк в таблицу без повторного ввода.
  • Студент применяет OCR к отсканированному учебному раздаточному материалу, чтобы получить доступный для поиска и копирования текст для заметок.
  • Архивариус конвертирует отсканированные документы на традиционном китайском языке в доступный для поиска текст для цифровой библиотеки.
  • Точность OCR зависит от качества сканирования — размытые, перекошенные или низкоразрешённые страницы могут содержать ошибки; относитесь к результату как к черновику, сделанному по мере возможности.

Frequently asked questions

Чем это отличается от других онлайн-сервисов для работы с PDF?
Большинство онлайн-сервисов для PDF отправляют ваши файлы на удалённый сервер для обработки. Этот инструмент выполняет все операции локально, в вашем браузере, с помощью клиентского JavaScript. Ваши файлы не передаются ни на какой сервер, поэтому содержимое документа остаётся полностью под вашим контролем.
Загружаются ли мои PDF-файлы куда-либо?
Нет. Ваши файлы читаются непосредственно браузером. Ваши файлы никогда не передаются по сети. Инструмент работает целиком в открытой вкладке браузера.
Могу ли я убедиться, что файлы не загружаются?
Да. Откройте инструменты разработчика в браузере (F12), перейдите на вкладку Network (Сеть) и следите за исходящими запросами во время работы. Вы увидите, что данные файла не покидают браузер. Сайт может записывать анонимный счётчик просмотров страниц, который никогда не включает ваши файлы и может быть отключён.
Работает ли инструмент офлайн?
Да: после загрузки страницы инструмент обрабатывает ваши файлы полностью в браузере; для работы инструмента подключение к сети не требуется. Можно отключиться от интернета и продолжать пользоваться им.
Что произойдёт, если обновить страницу?
Поскольку на сервере ничего не хранится, обновление страницы сбрасывает текущую сессию. Выбранные файлы придётся выбрать заново.
Хранит ли инструмент мои файлы?
Нет. Файлы находятся в памяти браузера только пока открыта страница. При закрытии или обновлении страницы они удаляются. Инструмент ничего не записывает на диск и ничего не отправляет на сервер.
Может ли этот инструмент снять защиту с PDF, защищённого паролем?
Нет. Этот инструмент не пытается снять или обойти парольную защиту PDF. Если вы знаете пароль, инструмент «Снять пароль» на этом сайте может удалить его локально; после этого данный инструмент сможет обработать файл.
Какие технологии использует инструмент?
Этот инструмент использует pdf.js, чтобы рендерить страницы, и движок Tesseract OCR, скомпилированный в WebAssembly (tesseract.js), работающий в Web Worker того же источника — ваши файлы никогда не покидают ваш браузер.
Использует ли инструмент WebAssembly?
Да — это один из немногих инструментов здесь, который его использует. Движок Tesseract OCR — это код на C++, скомпилированный в WebAssembly, и работает он внутри вашего браузера; бинарный файл .wasm обслуживается с этого сайта, и никуда ничего не отправляется.
Почему первый запуск медленнее последующих?
При первом использовании браузер загружает движок OCR и языковую модель с этого сайта (несколько мегабайт) и компилирует их. Затем они кешируются, поэтому последующие запуски стартуют гораздо быстрее.
Как распознать текст (OCR) в отсканированном PDF здесь?
Выберите отсканированный PDF на устройстве, укажите язык документа (английский или традиционный китайский), затем нажмите «Распознать». Каждая страница отрисовывается и считывается локально, и по завершении вы можете посмотреть текст в предпросмотре и сохранить его как файл .txt.
Почему распознанный текст — это просто файл .txt, а не PDF с возможностью поиска?
Этот инструмент выводит распознанные слова в виде обычного текста, а не записывает невидимый текстовый слой обратно в PDF, поэтому ваш исходный отсканированный PDF остаётся неизменным. Если вам нужны слова внутри страницы, вы можете скопировать их из сохранённого .txt или из предпросмотра на экране, где текст приводится постранично.
Можно ли распознать два языка в одном документе, и что будет, если выбрать не тот?
Перед распознаванием вы выбираете один язык для всего документа, поэтому в файле, где смешаны английский и традиционный китайский, предпочтение будет отдано тому языку, который вы выбрали. Качество распознавания также зависит от самого скана, поэтому перекошенные, низкого разрешения или рукописные страницы, как правило, выходят плохо вне зависимости от языка.
Инструмент OCR PDF платный?
Инструмент OCR PDF полностью бесплатен — без регистрации, без создания аккаунта, без ограничений на количество обрабатываемых отсканированных PDF-файлов, и так будет всегда. Каждая страница распознаётся прямо в браузере с помощью движка Tesseract OCR, скомпилированного в WebAssembly, поэтому ваши отсканированные документы — будь то контракты, удостоверения личности или медицинские записи — никуда не отправляются.

Related tools

  • Извлечь текст
  • Подсчёт слов
  • PDF в изображения
  • Сжать PDF
  • Универсальный PDF-редактор
  • Главная
  • Универсальный PDF-редактор
  • Объединить PDF
  • Разделить PDF
  • Повернуть PDF
  • Добавить водяной знак
  • Изображения в PDF
  • PDF в изображения
  • Нумерация страниц
  • Сжать PDF
  • Извлечь текст
  • Изменить метаданные
  • Упорядочить страницы
  • Вставить пустые страницы
  • Извлечь страницы
  • N-up (страниц на лист)
  • PDF в оттенках серого
  • Обрезать PDF
  • Развернуть страницы
  • Изменить размер (A4/Letter)
  • Добавить колонтитулы
  • Свести форму
  • Разделить каждые N страниц
  • Сведения и метаданные PDF
  • Штамп изображения / подписи
  • Удалить страницы
  • Мозаичный водяной знак
  • Буклет
  • Дублировать страницы
  • Прикрепить файл
  • Масштаб в процентах
  • Удалить пустые страницы
  • Чередующее объединение
  • Добавить рамку страницы
  • Извлечь чётные / нечётные страницы
  • PDF в длинное изображение
  • Разделить страницы пополам
  • Добавить поля
  • Подписать PDF
  • Сравнить PDF
  • Разбивка на плакат
  • Подсчёт слов
  • Восстановить PDF
  • Заполнить форму PDF
  • Разделить по закладкам
  • Поиск и выделение
  • Извлечь изображения
  • Скрытие данных в PDF
  • OCR (скан в текст)
  • Защитить PDF
  • Разблокировать PDF
  • О проекте
  • Политика конфиденциальности
  • Контакты
  • Как это работает
  • Локальные и онлайн-инструменты для PDF
  • Безопасны ли онлайн-инструменты для PDF?