스캔된 PDF와 언어를 선택하면 각 페이지가 Tesseract(WebAssembly로 컴파일됨)에 의해 로컬에서 렌더링·인식되고, 인식된 텍스트가 표시되며 .txt 파일로 내려받을 수 있습니다.
Quick answer
What it does
스캔된 PDF와 언어를 선택하면 각 페이지가 Tesseract(WebAssembly로 컴파일됨)에 의해 로컬에서 렌더링·인식되고, 인식된 텍스트가 표시되며 .txt 파일로 내려받을 수 있습니다.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
회계사가 재입력 없이 스프레드시트에 항목별 금액을 복사하기 위해 스캔된 청구서에 OCR 실행하기.
Good to know
이 버전에서는 영어와 번체 중국어가 지원됩니다.
How it works
기기에서 스캔된 PDF를 선택하고 문서 언어를 고릅니다.
파일은 브라우저 메모리에 읽어 들입니다 — 데이터는 브라우저 밖으로 나가지 않습니다.
pdf.js가 Web Worker에서 각 페이지를 이미지로 렌더링합니다.
Tesseract OCR — WebAssembly로 컴파일되어 이 사이트에서 제공됨 — 가 각 페이지의 텍스트를 로컬에서 인식합니다. 언어 모델도 제3자 CDN이 아니라 이 사이트에서 불러옵니다.
인식된 텍스트가 페이지별로 표시되며 .txt 파일로 내려받을 수 있도록 제공됩니다.
When to use this tool
회계사가 재입력 없이 스프레드시트에 항목별 금액을 복사하기 위해 스캔된 청구서에 OCR 실행하기.
학생이 노트를 위한 검색 및 복사 가능한 텍스트를 얻기 위해 스캔된 수업 유인물에 OCR 실행하기.
기록 담당자가 디지털 도서관을 위해 스캔된 번체 중국어 문서를 검색 가능한 텍스트로 변환하기.
OCR 정확도는 스캔 품질에 따라 다릅니다. 흐리거나 기울어지거나 저해상도 페이지는 오류가 발생할 수 있습니다. 출력 결과를 최선 시도 초안으로 취급하세요.
Frequently asked questions
다른 온라인 PDF 도구와 무엇이 다른가요?
대부분의 온라인 PDF 도구는 처리를 위해 파일을 원격 서버로 전송합니다. 이 도구는 클라이언트 측 JavaScript를 사용해 모든 작업을 브라우저 안에서 로컬로 처리합니다. 파일이 어떤 서버로도 전송되지 않으므로 문서 내용이 온전히 사용자의 통제 아래에 남습니다.
제 PDF 파일이 업로드되나요?
아니요. 파일은 브라우저가 직접 읽습니다. 파일은 네트워크로 전송되지 않습니다. 이 도구는 사용자가 열어 둔 브라우저 탭 안에서만 동작합니다.
파일이 업로드되지 않는다는 것을 확인할 수 있나요?
예. 브라우저 개발자 도구(F12)를 열고 네트워크 탭으로 이동한 뒤, 도구를 사용하는 동안 외부로 나가는 요청이 있는지 지켜보세요. 파일 데이터가 브라우저 밖으로 나가지 않는 것을 확인할 수 있습니다. 사이트는 익명 페이지 조회 수를 기록할 수 있으며, 이는 파일을 포함하지 않고 비활성화할 수 있습니다.
이 도구는 오프라인에서도 작동하나요?
예. 페이지가 한 번 로드되면 도구는 파일을 브라우저 안에서 전부 처리하며, 도구 기능에는 네트워크 연결이 필요 없습니다. 인터넷 연결을 끊은 상태에서도 계속 사용할 수 있습니다.
페이지를 새로고침하면 어떻게 되나요?
서버에 저장되는 것이 없기 때문에 페이지를 새로고침하면 현재 세션이 초기화됩니다. 선택해 두었던 파일은 다시 선택해야 합니다.
이 도구가 제 파일을 저장하나요?
아니요. 파일은 페이지가 열려 있는 동안에만 브라우저 메모리에 보관됩니다. 페이지를 닫거나 새로고침하면 사라집니다. 이 도구는 디스크에 아무것도 기록하지 않으며, 서버로도 아무것도 전송하지 않습니다.
이 도구로 비밀번호가 걸린 PDF를 해제할 수 있나요?
아니요. 이 도구는 PDF의 비밀번호 보호를 제거하거나 우회하려 시도하지 않습니다. 비밀번호를 알고 있다면 이 사이트의 PDF 잠금 해제 도구로 로컬에서 비밀번호를 제거한 뒤, 이 도구로 해당 파일을 처리할 수 있습니다.
이 도구는 어떤 기술을 사용하나요?
이 도구는 pdf.js로 페이지를 렌더링하고, 동일 출처 Web Worker에서 실행되는 WebAssembly로 컴파일된 Tesseract OCR 엔진(tesseract.js)을 사용합니다 — 파일이 브라우저 밖으로 나가지 않습니다.
이 도구는 WebAssembly를 사용하나요?
예 — 이 도구는 여기서 WebAssembly를 사용하는 몇 안 되는 도구 중 하나입니다. Tesseract OCR 엔진은 WebAssembly로 컴파일된 C++로 브라우저 안에서 실행됩니다. .wasm 바이너리는 이 사이트에서 제공되며 어디로도 전송되는 것은 없습니다.
왜 처음 실행이 다음번보다 느린가요?
처음 사용할 때 브라우저가 이 사이트에서 OCR 엔진과 언어 모델(수 메가바이트)을 내려받아 컴파일합니다. 이후에는 캐시되므로 다음 실행은 훨씬 빠르게 시작됩니다.
여기서 스캔한 PDF를 어떻게 OCR하나요?
기기에서 스캔한 PDF를 고르고, 문서 언어(영어 또는 번체 중국어)를 선택한 다음 인식을 선택하세요. 각 페이지를 로컬에서 렌더링해 읽어 들이며, 작업이 끝나면 텍스트를 미리 보고 .txt 파일로 저장할 수 있습니다.
왜 인식된 텍스트가 검색 가능한 PDF가 아니라 그냥 .txt 파일인가요?
이 도구는 인식된 단어를 PDF에 보이지 않는 텍스트 레이어로 다시 기록하는 대신 일반 텍스트로 출력하므로, 원본 스캔 PDF는 변경되지 않은 채 유지됩니다. 단어를 페이지 안에 넣어야 한다면, 저장된 .txt나 페이지별로 텍스트를 나열하는 화면 미리 보기에서 복사하면 됩니다.
같은 문서에서 두 언어를 실행할 수 있나요? 잘못된 언어를 고르면 어떻게 되나요?
인식하기 전에 문서 전체에 대해 하나의 언어를 선택하므로, 영어와 번체 중국어가 섞인 파일은 고른 쪽으로 치우치게 됩니다. 인식 품질은 스캔 자체에도 좌우되므로, 기울어졌거나 저해상도이거나 손으로 쓴 페이지는 언어와 관계없이 결과가 나쁘게 나오는 경향이 있습니다.
OCR PDF 도구는 유료인가요?
OCR PDF 도구는 완전히 무료입니다. 계정이나 회원가입이 필요 없고, 처리하는 스캔 PDF 수에도 제한이 없으며, 앞으로도 항상 무료입니다. 모든 페이지가 WebAssembly로 컴파일된 Tesseract OCR 엔진을 사용해 브라우저 안에서 직접 인식되므로 계약서, 신분증, 의료 기록 등 어떤 스캔 문서도 어디에도 전송되지 않습니다.