OCR на сканиран PDF поверително — разпознаване на текст в браузъра ви
Изберете сканиран PDF и език; всяка страница се визуализира и разпознава локално от Tesseract (компилиран до WebAssembly), а разпознатият текст се показва и може да се изтегли като .txt файл.
Quick answer
What it does
Изберете сканиран PDF и език; всяка страница се визуализира и разпознава локално от Tesseract (компилиран до WebAssembly), а разпознатият текст се показва и може да се изтегли като .txt файл.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Счетоводител прилага OCR към сканирана фактура, за да копира сумите по редове в таблица без повторно въвеждане.
Good to know
В тази версия се поддържат английски и традиционен китайски.
How it works
Изберете сканиран PDF от устройството си и изберете езика на документа.
Файлът се чете в паметта на браузъра — никакви данни не напускат браузъра ви.
pdf.js визуализира всяка страница като изображение в Web Worker.
Tesseract OCR — компилиран до WebAssembly и обслужван от този сайт — разпознава текста на всяка страница локално; езиковият модел също се зарежда от този сайт, а не от CDN на трета страна.
Разпознатият текст се показва за всяка страница и се предлага като .txt за изтегляне.
When to use this tool
Счетоводител прилага OCR към сканирана фактура, за да копира сумите по редове в таблица без повторно въвеждане.
Студент прилага OCR към сканирано учебно раздавано за получаване на търсим и копируем текст за бележки.
Архивист конвертира сканирани документи на традиционен китайски в търсим текст за цифрова библиотека.
Точността на OCR зависи от качеството на сканиране — замъглените, изкривените или нискорезолюционните страници може да съдържат грешки; третирайте изходния файл като чернова с най-добри усилия.
Frequently asked questions
С какво това се различава от другите онлайн PDF инструменти?
Повечето онлайн PDF инструменти изпращат файловете ви към отдалечен сървър за обработка. Този инструмент обработва всичко локално в браузъра ви чрез JavaScript от страна на клиента. Файловете ви не се предават към никакъв сървър, което означава, че съдържанието на документа остава изцяло под ваш контрол.
Файловете ми PDF качват ли се някъде?
Не. Файловете ви се четат директно от браузъра. Файловете ви никога не се предават по мрежата. Инструментът работи изцяло в рамките на отворения от вас раздел на браузъра.
Мога ли да проверя, че файловете не се качват?
Да. Отворете инструментите за разработчици на браузъра (F12), отидете в раздела Network и следете за изходящи заявки, докато използвате инструмента. Няма да видите данни от файла да напускат браузъра ви. Сайтът може да записва анонимен брой посещения, който никога не включва вашите файлове и може да бъде деактивиран.
Работи ли този инструмент офлайн?
Да, след като страницата се зареди, инструментът обработва файловете ви изцяло в браузъра ви; функционалността на инструмента не се нуждае от мрежова връзка. Може да изключите интернет и да продължите да го използвате.
Какво се случва, когато презаредя страницата?
Тъй като нищо не се съхранява на сървър, презареждането на страницата изчиства текущата ви сесия. Всички файлове, които сте избрали, ще трябва да бъдат избрани отново.
Този инструмент съхранява ли файловете ми?
Не. Файловете се пазят в паметта на браузъра само докато страницата е отворена. Затварянето или презареждането на страницата ги премахва. Инструментът не записва нищо на диска и не изпраща нищо към сървър.
Може ли този инструмент да отключва защитени с парола PDF файлове?
Не. Този инструмент не се опитва да премахне или заобиколи защитата с парола на PDF. Ако знаете паролата, инструментът Отключване на PDF на този сайт може да я премахне локално; след това този инструмент може да обработи файла.
Какви технологии използва този инструмент?
Този инструмент използва pdf.js, за да визуализира страниците, и OCR механизма Tesseract, компилиран до WebAssembly (tesseract.js), който работи в Web Worker от същия източник (same-origin) — файловете ви никога не напускат браузъра ви.
Този инструмент използва ли WebAssembly?
Да — това е един от малкото инструменти тук, които използват. OCR механизмът Tesseract е C++, компилиран до WebAssembly, и работи вътре в браузъра ви; .wasm двоичният файл се обслужва от този сайт и нищо не се изпраща никъде.
Защо първото изпълнение е по-бавно от следващите?
При първа употреба браузърът ви изтегля OCR механизма и езиковия модел от този сайт (няколко мегабайта) и ги компилира. След това те се кешират, така че по-късните изпълнения започват много по-бързо.
Как да направя OCR на сканиран PDF тук?
Изберете сканиран PDF от устройството си, изберете езика на документа (английски или традиционен китайски), след което изберете Разпознаване. Всяка страница се рендира и разчита локално, а когато приключи, можете да прегледате текста и да го запазите като .txt файл.
Защо разпознатият текст е просто .txt файл вместо PDF с възможност за търсене?
Този инструмент извежда разпознатите думи като обикновен текст, вместо да записва невидим текстов слой обратно в PDF, така че оригиналният ви сканиран PDF остава непроменен. Ако ви трябват думите в самата страница, бихте ги копирали от запазения .txt файл или от прегледа на екрана, който изброява текста страница по страница.
Мога ли да обработя два езика в един и същ документ и какво става, ако избера грешния?
Избирате един-единствен език за целия документ преди разпознаването, така че файл, който смесва английски и традиционен китайски, ще предпочете този, който сте избрали. Качеството на разпознаването зависи и от самото сканиране, така че изкривени, нискокачествени или ръкописни страници обикновено излизат лошо независимо от езика.
Инструментът OCR PDF безплатен ли е за ползване?
Инструментът OCR PDF е напълно безплатен — без акаунт, без регистрация и без ограничение на броя сканирани PDF файлове, които обработвате, и винаги ще бъде така. Всяка страница се разпознава директно в браузъра ви с помощта на OCR машината Tesseract, компилирана до WebAssembly, така че сканираните ви документи — независимо дали съдържат договори, документи за самоличност или медицински записи — никога не се изпращат никъде.