OCR сканованого PDF приватно — розпізнавайте текст у браузері

Виберіть сканований PDF і мову; кожна сторінка відмальовується й розпізнається локально за допомогою Tesseract (скомпільованого у WebAssembly), а розпізнаний текст показується й доступний для завантаження як файл .txt.

Quick answer

What it does
Виберіть сканований PDF і мову; кожна сторінка відмальовується й розпізнається локально за допомогою Tesseract (скомпільованого у WebAssembly), а розпізнаний текст показується й доступний для завантаження як файл .txt.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Бухгалтер застосовує OCR до відсканованого рахунку-фактури, щоб скопіювати суми рядків у електронну таблицю без повторного введення.
Good to know
У цій версії підтримуються англійська й традиційна китайська.

How it works

  1. Виберіть на пристрої сканований PDF і виберіть мову документа.
  2. Файл зчитується в пам'ять браузера — жодні дані не залишають ваш браузер.
  3. pdf.js відмальовує кожну сторінку як зображення у Web Worker.
  4. Tesseract OCR — скомпільований у WebAssembly й поданий із цього сайту — розпізнає текст кожної сторінки локально; мовна модель також завантажується з цього сайту, а не зі стороннього CDN.
  5. Розпізнаний текст показується посторінково й пропонується для завантаження як файл .txt.

When to use this tool

  • Бухгалтер застосовує OCR до відсканованого рахунку-фактури, щоб скопіювати суми рядків у електронну таблицю без повторного введення.
  • Студент застосовує OCR до відсканованого роздаткового матеріалу курсу для отримання доступного для пошуку та копіювання тексту для нотаток.
  • Архіваріус конвертує відскановані документи традиційною китайською мовою в текст, доступний для пошуку, для цифрової бібліотеки.
  • Точність OCR залежить від якості сканування — розмиті, перекошені або низькороздільні сторінки можуть містити помилки; ставтеся до результату як до чернетки, отриманої за максимальних зусиль.

Frequently asked questions

Чим це відрізняється від інших онлайн-сервісів для PDF?
Більшість онлайн-сервісів для роботи з PDF надсилають ваші файли на віддалений сервер для обробки. Цей інструмент виконує всі дії локально у вашому браузері за допомогою JavaScript на боці клієнта. Ваші файли не передаються на жоден сервер, тож вміст ваших документів залишається повністю під вашим контролем.
Чи завантажуються мої PDF-файли на сервер?
Ні. Ваші файли зчитуються безпосередньо браузером. Ваші файли ніколи не передаються мережею. Інструмент працює повністю у відкритій вкладці браузера.
Чи можу я переконатися, що файли не завантажуються?
Так. Відкрийте інструменти розробника у браузері (F12), перейдіть на вкладку Network (Мережа) і простежте за вихідними запитами під час роботи з інструментом. Ви побачите, що жодні дані файлів не залишають ваш браузер. Сайт може фіксувати анонімний лічильник переглядів сторінок, що ніколи не включає ваші файли й може бути вимкнений.
Чи працює цей інструмент офлайн?
Так. Щойно сторінка завантажилася, інструмент обробляє ваші файли повністю у браузері; для роботи інструменту мережеве підключення не потрібне. Ви можете від'єднатися від інтернету й продовжувати ним користуватися.
Що станеться, якщо я оновлю сторінку?
Оскільки на сервері нічого не зберігається, оновлення сторінки очищає поточний сеанс. Файли, які ви вибрали, доведеться вибрати знову.
Чи зберігає цей інструмент мої файли?
Ні. Файли зберігаються в пам'яті браузера лише доти, доки відкрита сторінка. Закриття чи оновлення сторінки видаляє їх. Інструмент нічого не записує на диск і нічого не надсилає на сервер.
Чи може цей інструмент знімати пароль із захищених PDF?
Ні. Цей інструмент не намагається зняти чи обійти захист PDF паролем. Якщо ви знаєте пароль, інструмент Зняти пароль з PDF на цьому сайті може видалити його локально, після чого цей інструмент зможе обробити файл.
Які технології використовує цей інструмент?
Інструмент використовує pdf.js для відмальовування сторінок та рушій OCR Tesseract, скомпільований у WebAssembly (tesseract.js), що працює в Web Worker того самого джерела — ваші файли ніколи не залишають ваш браузер.
Чи використовує цей інструмент WebAssembly?
Так — це один із небагатьох інструментів тут, які його використовують. Рушій OCR Tesseract — це C++, скомпільований у WebAssembly, що працює у вашому браузері; двійковий файл .wasm подається з цього сайту, і нічого нікуди не надсилається.
Чому перший запуск повільніший за наступні?
Під час першого використання браузер завантажує рушій OCR і мовну модель із цього сайту (кілька мегабайтів) і компілює їх. Згодом вони кешуються, тож наступні запуски стартують значно швидше.
Як виконати OCR відсканованого PDF тут?
Виберіть на пристрої відсканований PDF, оберіть мову документа (англійську або традиційну китайську), потім натисніть «Розпізнати». Кожна сторінка візуалізується й зчитується локально, а коли процес завершиться, ви зможете переглянути текст і зберегти його як файл .txt.
Чому розпізнаний текст є лише файлом .txt, а не PDF із можливістю пошуку?
Цей інструмент виводить розпізнані слова як простий текст, а не записує невидимий текстовий шар назад у PDF, тож ваш оригінальний відсканований PDF лишається незмінним. Якщо вам потрібні слова всередині сторінки, ви скопіюєте їх зі збереженого .txt або з екранного попереднього перегляду, який перелічує текст посторінково.
Чи можу я використати дві мови в одному документі, і що буде, якщо я обрав не ту?
Ви обираєте одну мову для всього документа перед розпізнаванням, тож у файлі, що змішує англійську й традиційну китайську, перевага надаватиметься тій, яку ви обрали. Якість розпізнавання також залежить від самого скана, тож перекошені, низької роздільної здатності чи рукописні сторінки зазвичай виходять погано незалежно від мови.
Чи коштує використання інструменту OCR PDF?
Інструмент OCR PDF абсолютно безкоштовний — без облікового запису, без реєстрації та без обмежень на кількість відсканованих PDF-файлів, які ви обробляєте. Так буде завжди. Кожна сторінка розпізнається безпосередньо у вашому браузері за допомогою рушія Tesseract OCR, скомпільованого у WebAssembly, тому ваші відскановані документи — будь то контракти, посвідчення особи чи медичні записи — ніколи нікуди не надсилаються.

Related tools

  • Видобути текст
  • Підрахунок слів
  • PDF у зображення
  • Стиснути PDF
  • Універсальний PDF-редактор
  • Головна
  • Універсальний PDF-редактор
  • Об’єднати PDF
  • Розділити PDF
  • Обернути PDF
  • Додати водяний знак
  • Зображення у PDF
  • PDF у зображення
  • Номери сторінок
  • Стиснути PDF
  • Видобути текст
  • Редагувати метадані
  • Упорядкувати сторінки
  • Вставити порожні сторінки
  • Видобути сторінки
  • N-up (сторінок на аркуш)
  • PDF у відтінках сірого
  • Обрізати PDF
  • Перевернути сторінки
  • Змінити розмір (A4/Letter)
  • Додати колонтитули
  • Звести форму
  • Розділяти кожні N сторінок
  • Інформація та метадані PDF
  • Штамп зображення / підпис
  • Видалити сторінки
  • Мозаїчний водяний знак
  • Брошура
  • Дублювати сторінки
  • Прикріпити файл
  • Масштабувати у відсотках
  • Видалити порожні сторінки
  • Чергувальне об’єднання
  • Додати рамку сторінки
  • Видобути непарні / парні сторінки
  • PDF у довге зображення
  • Розділити сторінки навпіл
  • Додати поля
  • Підписати PDF
  • Порівняти PDF
  • Розбивка на постер
  • Підрахунок слів
  • Відновити PDF
  • Заповнити форму PDF
  • Розділити за закладками
  • Пошук і виділення
  • Видобути зображення
  • Відредагувати PDF
  • OCR (скан у текст)
  • Захистити PDF
  • Розблокувати PDF
  • Про нас
  • Політика конфіденційності
  • Контакти
  • Як це працює
  • Локальні та онлайнові PDF-інструменти
  • Чи безпечні онлайнові PDF-інструменти?