Извличане на текст от PDF поверително — работи изцяло в браузъра ви
Изберете PDF и текстовият слой от всяка страница се извлича локално в браузъра ви и се предлага като текстов файл за изтегляне — без качване.
Quick answer
What it does
Изберете PDF и текстовият слой от всяка страница се извлича локално в браузъра ви и се предлага като текстов файл за изтегляне — без качване.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Копиране на клаузи от договор от PDF с фиксирано оформление в текстов редактор за преглед или сравнение.
Good to know
Този инструмент може да извлича само текст, който е вграден като текстов слой в PDF. Сканираните PDF файлове и PDF файловете само с изображения нямат текстов слой, така че няма да бъде извлечен текст.
How it works
Изберете PDF файл от устройството си чрез избора на файлове.
Файлът се чете в паметта на браузъра — никакви данни не напускат браузъра ви.
pdf.js зарежда документа в Web Worker и извиква getTextContent() за всяка страница, за да извлече вградения текстов слой.
Извлеченият текст от всички страници се комбинира по ред и се предлага като .txt файл за изтегляне.
Всички временни данни се освобождават от паметта, след като изтеглянето приключи.
When to use this tool
Копиране на клаузи от договор от PDF с фиксирано оформление в текстов редактор за преглед или сравнение.
Извличане на основния текст от PDF на научна статия за поставяне в инструмент за превод или резюмиране.
Извличане на данни от редове на фактура от PDF като първа стъпка преди импортиране в таблица.
Забележка: работи само с PDF файлове с вграден текстов слой — сканираните или само с изображения PDF файлове нямат текст за извличане.
Frequently asked questions
С какво това се различава от другите онлайн PDF инструменти?
Повечето онлайн PDF инструменти изпращат файловете ви към отдалечен сървър за обработка. Този инструмент обработва всичко локално в браузъра ви чрез JavaScript от страна на клиента. Файловете ви не се предават към никакъв сървър, което означава, че съдържанието на документа остава изцяло под ваш контрол.
Файловете ми PDF качват ли се някъде?
Не. Файловете ви се четат директно от браузъра. Файловете ви никога не се предават по мрежата. Инструментът работи изцяло в рамките на отворения от вас раздел на браузъра.
Мога ли да проверя, че файловете не се качват?
Да. Отворете инструментите за разработчици на браузъра (F12), отидете в раздела Network и следете за изходящи заявки, докато използвате инструмента. Няма да видите данни от файла да напускат браузъра ви. Сайтът може да записва анонимен брой посещения, който никога не включва вашите файлове и може да бъде деактивиран.
Работи ли този инструмент офлайн?
Да, след като страницата се зареди, инструментът обработва файловете ви изцяло в браузъра ви; функционалността на инструмента не се нуждае от мрежова връзка. Може да изключите интернет и да продължите да го използвате.
Какво се случва, когато презаредя страницата?
Тъй като нищо не се съхранява на сървър, презареждането на страницата изчиства текущата ви сесия. Всички файлове, които сте избрали, ще трябва да бъдат избрани отново.
Този инструмент съхранява ли файловете ми?
Не. Файловете се пазят в паметта на браузъра само докато страницата е отворена. Затварянето или презареждането на страницата ги премахва. Инструментът не записва нищо на диска и не изпраща нищо към сървър.
Може ли този инструмент да отключва защитени с парола PDF файлове?
Не. Този инструмент не се опитва да премахне или заобиколи защитата с парола на PDF. Ако знаете паролата, инструментът Отключване на PDF на този сайт може да я премахне локално; след това този инструмент може да обработи файла.
Какви технологии използва този инструмент?
Този инструмент използва pdf.js (PDF механизмът на Mozilla от страна на клиента) в Web Worker, за да прочете вградения текстов слой от всяка страница на PDF в браузъра ви. Файловете ви никога не напускат браузъра ви.
Този инструмент използва ли WebAssembly?
Не. pdf.js е обикновена JavaScript библиотека — не използва WebAssembly. Цялото извличане на текст от PDF се извършва чрез JavaScript от страна на клиента в браузъра ви.
Как да извлека текста от моя PDF?
Изберете PDF чрез избора на файлове, след което натиснете бутона за извличане. Текстът от всяка страница се чете локално в браузъра ви, показва се в поле за преглед и можете да го запазите като .txt файл.
Защо моят сканиран PDF се върна без текст?
Този инструмент чете вградения текстов слой, който PDF съхранява, а сканираните документи или такива само с изображения нямат такъв слой, така че нищо не може да бъде извлечено. Когато това се случи, ще видите известие и не се предлага текстов файл, защото няма символни данни за възстановяване без OCR.
Защо извлеченият текст не съвпада с визуалното оформление на страницата?
Инструментът обхожда текстовите елементи, които pdf.js докладва за всяка страница, и запазва техните нови редове, но не преподрежда колоните, така че многоколонни страници, таблици и сложни оформления може да не съвпаднат с това, което виждате на екрана. Страниците се съединяват с празни редове, а PDF файлове с необичайни или потребителски кодировки на шрифтове също могат да дадат разкривени символи, дори когато страницата изглежда добре.
Струва ли нещо използването на Extract Text from PDF?
Extract Text from PDF е напълно безплатен — без акаунт, без регистрация и без ограничение колко PDF файла обработвате, и така ще бъде завинаги. Вашият PDF се чете директно от браузъра ви с помощта на pdf.js, който извлича вградения текстов слой страница по страница и ви предоставя обикновен .txt файл; самият файл остава в паметта на браузъра ви през цялото време и никога не се предава никъде.