OCR zeskanowanego PDF z poszanowaniem prywatności — rozpoznawaj tekst w przeglądarce
Wybierz zeskanowany plik PDF i język; każda strona jest renderowana i rozpoznawana lokalnie przez Tesseract (skompilowany do WebAssembly), a rozpoznany tekst jest wyświetlany i można go pobrać jako plik .txt.
Quick answer
What it does
Wybierz zeskanowany plik PDF i język; każda strona jest renderowana i rozpoznawana lokalnie przez Tesseract (skompilowany do WebAssembly), a rozpoznany tekst jest wyświetlany i można go pobrać jako plik .txt.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Księgowy stosuje OCR na zeskanowanej fakturze, aby skopiować kwoty pozycji do arkusza kalkulacyjnego bez przepisywania.
Good to know
W tej wersji obsługiwane są angielski i chiński tradycyjny.
How it works
Wybierz zeskanowany plik PDF z urządzenia i wybierz język dokumentu.
Plik jest wczytywany do pamięci przeglądarki — żadne dane nie opuszczają przeglądarki.
pdf.js renderuje każdą stronę do obrazu w Web Workerze.
Tesseract OCR — skompilowany do WebAssembly i udostępniany z tej witryny — rozpoznaje tekst każdej strony lokalnie; model językowy również jest wczytywany z tej witryny, a nie z zewnętrznego CDN.
Rozpoznany tekst jest wyświetlany dla każdej strony i udostępniany do pobrania jako plik .txt.
When to use this tool
Księgowy stosuje OCR na zeskanowanej fakturze, aby skopiować kwoty pozycji do arkusza kalkulacyjnego bez przepisywania.
Student stosuje OCR na zeskanowanych materiałach kursu, aby uzyskać przeszukiwalny i kopiowalny tekst do notatek.
Archiwista konwertuje zeskanowane dokumenty w języku tradycyjnego chińskiego na przeszukiwalny tekst dla biblioteki cyfrowej.
Dokładność OCR zależy od jakości skanu — rozmazane, przekrzywione lub niskorozdzielcze strony mogą powodować błędy; traktuj wynik jako wersję roboczą z najlepszym możliwym efektem.
Frequently asked questions
Czym ten serwis różni się od innych narzędzi PDF online?
Większość internetowych narzędzi PDF wysyła Twoje pliki na zdalny serwer w celu przetworzenia. To narzędzie przetwarza wszystko lokalnie w Twojej przeglądarce, korzystając z JavaScriptu działającego po stronie klienta. Twoje pliki nie są przesyłane na żaden serwer, więc zawartość dokumentów pozostaje całkowicie pod Twoją kontrolą.
Czy moje pliki PDF są wysyłane na serwer?
Nie. Twoje pliki są odczytywane bezpośrednio przez przeglądarkę. Twoje pliki nigdy nie są przesyłane przez sieć. Narzędzie działa w całości w otwartej karcie przeglądarki.
Czy mogę sprawdzić, że pliki nie są wysyłane?
Tak. Otwórz narzędzia deweloperskie przeglądarki (F12), przejdź do zakładki Sieć (Network) i obserwuj wychodzące żądania podczas korzystania z narzędzia. Zobaczysz, że żadne dane plików nie opuszczają przeglądarki. Witryna może rejestrować anonimową liczbę odsłon, która nigdy nie zawiera Twoich plików i można ją wyłączyć.
Czy narzędzie działa offline?
Tak. Po wczytaniu strony narzędzie przetwarza Twoje pliki w całości w przeglądarce; funkcjonalność narzędzia nie wymaga połączenia z siecią. Możesz odłączyć się od internetu i nadal z niego korzystać.
Co się stanie, gdy odświeżę stronę?
Ponieważ nic nie jest zapisywane na serwerze, odświeżenie strony kończy bieżącą sesję. Wybrane wcześniej pliki trzeba będzie wybrać ponownie.
Czy narzędzie przechowuje moje pliki?
Nie. Pliki znajdują się w pamięci przeglądarki tylko tak długo, jak długo strona jest otwarta. Zamknięcie lub odświeżenie strony je usuwa. Narzędzie nie zapisuje niczego na dysku ani nie wysyła niczego na serwer.
Czy to narzędzie może odblokować pliki PDF chronione hasłem?
Nie. To narzędzie nie usuwa ani nie omija ochrony hasłem w plikach PDF. Jeśli znasz hasło, narzędzie Odblokuj PDF na tej stronie może je usunąć lokalnie, a wtedy to narzędzie przetworzy plik.
Z jakich technologii korzysta to narzędzie?
To narzędzie korzysta z pdf.js do renderowania stron oraz z silnika Tesseract OCR skompilowanego do WebAssembly (tesseract.js) działającego w Web Workerze tego samego pochodzenia (same-origin) — Twoje pliki nigdy nie opuszczają przeglądarki.
Czy narzędzie korzysta z WebAssembly?
Tak — to jedno z nielicznych narzędzi tutaj, które tego używa. Silnik Tesseract OCR to kod C++ skompilowany do WebAssembly i działający w Twojej przeglądarce; plik binarny .wasm jest udostępniany z tej witryny i nic nie jest nigdzie wysyłane.
Dlaczego pierwsze uruchomienie jest wolniejsze niż kolejne?
Przy pierwszym użyciu przeglądarka pobiera z tej witryny silnik OCR i model językowy (kilka megabajtów) oraz je kompiluje. Są one potem zapisywane w pamięci podręcznej, więc kolejne uruchomienia startują znacznie szybciej.
Jak wykonać tutaj OCR zeskanowanego pliku PDF?
Wybierz zeskanowany plik PDF z urządzenia, wybierz język dokumentu (angielski lub chiński tradycyjny), a następnie wybierz Rozpoznaj. Każda strona jest renderowana i odczytywana lokalnie, a po zakończeniu możesz wyświetlić podgląd tekstu i zapisać go jako plik .txt.
Dlaczego rozpoznany tekst to tylko plik .txt zamiast przeszukiwalnego pliku PDF?
To narzędzie zapisuje rozpoznane słowa jako zwykły tekst, zamiast zapisywać niewidoczną warstwę tekstową z powrotem do pliku PDF, więc Twój oryginalny zeskanowany plik PDF pozostaje niezmieniony. Jeśli potrzebujesz słów wewnątrz strony, skopiowałbyś je z zapisanego pliku .txt lub z podglądu na ekranie, który wyświetla tekst strona po stronie.
Czy mogę używać dwóch języków w tym samym dokumencie i co się stanie, jeśli wybiorę zły?
Wybierasz jeden język dla całego dokumentu przed rozpoznawaniem, więc plik mieszający angielski i chiński tradycyjny będzie faworyzował ten, który wybrałeś. Jakość rozpoznawania zależy także od samego skanu, więc strony przekrzywione, o niskiej rozdzielczości lub odręczne zwykle wypadają słabo niezależnie od języka.
Czy narzędzie OCR PDF jest płatne?
Narzędzie OCR PDF jest całkowicie bezpłatne — bez konta, bez rejestracji i bez ograniczeń co do liczby skanowanych plików PDF, które możesz przez nie przepuścić, i zawsze tak będzie. Każda strona jest rozpoznawana bezpośrednio wewnątrz Twojej przeglądarki przy użyciu silnika Tesseract OCR skompilowanego do WebAssembly, więc Twoje zeskanowane dokumenty — niezależnie od tego, czy zawierają umowy, dokumenty tożsamości czy dokumentację medyczną — nigdy nie są nigdzie wysyłane.