Извлечение текста из PDF без передачи данных — всё работает в вашем браузере
Выберите PDF — текстовый слой каждой страницы извлекается локально в браузере и предлагается для скачивания в виде текстового файла, без загрузки.
Quick answer
What it does
Выберите PDF — текстовый слой каждой страницы извлекается локально в браузере и предлагается для скачивания в виде текстового файла, без загрузки.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Копирование условий договора из PDF с фиксированным макетом в текстовый редактор для проверки или сравнения.
Good to know
Инструмент извлекает только текст, который встроен в PDF в виде текстового слоя. У отсканированных и состоящих только из изображений PDF текстового слоя нет, поэтому текст не будет извлечён.
How it works
Выберите PDF-файл на устройстве через окно выбора файлов.
Файл считывается в память браузера — данные не покидают браузер.
pdf.js загружает документ в Web Worker и вызывает getTextContent() для каждой страницы, чтобы получить встроенный текстовый слой.
Извлечённый текст со всех страниц объединяется по порядку и предлагается для скачивания в виде файла .txt.
Все временные данные освобождаются из памяти после завершения скачивания.
When to use this tool
Копирование условий договора из PDF с фиксированным макетом в текстовый редактор для проверки или сравнения.
Извлечение основного текста из PDF научной статьи для вставки в инструмент перевода или реферирования.
Извлечение данных строк из PDF-счёта в качестве первого шага перед импортом в таблицу.
Примечание: работает только с PDF с встроенным текстовым слоем — у отсканированных PDF или PDF только с изображениями нет текста для извлечения.
Frequently asked questions
Чем это отличается от других онлайн-сервисов для работы с PDF?
Большинство онлайн-сервисов для PDF отправляют ваши файлы на удалённый сервер для обработки. Этот инструмент выполняет все операции локально, в вашем браузере, с помощью клиентского JavaScript. Ваши файлы не передаются ни на какой сервер, поэтому содержимое документа остаётся полностью под вашим контролем.
Загружаются ли мои PDF-файлы куда-либо?
Нет. Ваши файлы читаются непосредственно браузером. Ваши файлы никогда не передаются по сети. Инструмент работает целиком в открытой вкладке браузера.
Могу ли я убедиться, что файлы не загружаются?
Да. Откройте инструменты разработчика в браузере (F12), перейдите на вкладку Network (Сеть) и следите за исходящими запросами во время работы. Вы увидите, что данные файла не покидают браузер. Сайт может записывать анонимный счётчик просмотров страниц, который никогда не включает ваши файлы и может быть отключён.
Работает ли инструмент офлайн?
Да: после загрузки страницы инструмент обрабатывает ваши файлы полностью в браузере; для работы инструмента подключение к сети не требуется. Можно отключиться от интернета и продолжать пользоваться им.
Что произойдёт, если обновить страницу?
Поскольку на сервере ничего не хранится, обновление страницы сбрасывает текущую сессию. Выбранные файлы придётся выбрать заново.
Хранит ли инструмент мои файлы?
Нет. Файлы находятся в памяти браузера только пока открыта страница. При закрытии или обновлении страницы они удаляются. Инструмент ничего не записывает на диск и ничего не отправляет на сервер.
Может ли этот инструмент снять защиту с PDF, защищённого паролем?
Нет. Этот инструмент не пытается снять или обойти парольную защиту PDF. Если вы знаете пароль, инструмент «Снять пароль» на этом сайте может удалить его локально; после этого данный инструмент сможет обработать файл.
Какие технологии использует инструмент?
Этот инструмент использует pdf.js (клиентский PDF-движок от Mozilla) в Web Worker, чтобы считывать встроенный текстовый слой с каждой страницы PDF внутри вашего браузера. Ваши файлы никогда не покидают ваш браузер.
Использует ли инструмент WebAssembly?
Нет. pdf.js — это обычная JavaScript-библиотека, она не использует WebAssembly. Всё извлечение текста из PDF выполняется в клиентском JavaScript в вашем браузере.
Как извлечь текст из моего PDF?
Выберите PDF через окно выбора файлов, затем нажмите кнопку извлечения. Текст с каждой страницы считывается локально в вашем браузере, отображается в области предпросмотра, и вы можете сохранить его как файл .txt.
Почему мой отсканированный PDF вернулся без текста?
Этот инструмент читает встроенный текстовый слой, который хранит PDF, а у отсканированных документов или документов только из изображений такого слоя нет, поэтому извлечь нечего. В этом случае вы увидите уведомление, и текстовый файл не предлагается, потому что без OCR нет символьных данных для восстановления.
Почему извлечённый текст не соответствует визуальной разметке страницы?
Инструмент проходит по текстовым элементам, которые pdf.js сообщает для каждой страницы, и сохраняет их переносы строк, но не переформатирует колонки, поэтому многоколоночные страницы, таблицы и сложные макеты могут не совпадать с тем, что вы видите на экране. Страницы соединяются пустыми строками, а PDF с необычными или нестандартными кодировками шрифтов также могут давать искажённые символы, даже если страница выглядит нормально.
Extract Text from PDF — платный инструмент?
Extract Text from PDF абсолютно бесплатен — никакой регистрации, никакого входа в аккаунт, никаких ограничений на количество обрабатываемых PDF, и так будет всегда. Ваш PDF читается непосредственно браузером с помощью pdf.js, который извлекает встроенный текстовый слой постранично и передаёт вам готовый файл .txt; сам файл всё это время находится в памяти браузера и никуда не передаётся.