OCR một PDF được quét riêng tư — nhận dạng văn bản trong trình duyệt
Chọn một PDF được quét và một ngôn ngữ; mỗi trang được kết xuất và nhận dạng cục bộ bằng Tesseract (biên dịch sang WebAssembly), và văn bản nhận dạng được được hiển thị và có thể tải về dưới dạng tệp .txt.
Quick answer
What it does
Chọn một PDF được quét và một ngôn ngữ; mỗi trang được kết xuất và nhận dạng cục bộ bằng Tesseract (biên dịch sang WebAssembly), và văn bản nhận dạng được được hiển thị và có thể tải về dưới dạng tệp .txt.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Kế toán viên OCR hóa đơn quét để sao chép số tiền từng dòng vào bảng tính mà không cần gõ lại.
Good to know
Phiên bản này hỗ trợ tiếng Anh và tiếng Trung phồn thể.
How it works
Chọn một PDF được quét từ thiết bị của bạn và chọn ngôn ngữ tài liệu.
Tệp được đọc vào bộ nhớ trình duyệt — không có dữ liệu nào rời khỏi trình duyệt của bạn.
pdf.js kết xuất từng trang thành ảnh trong một Web Worker.
Tesseract OCR — được biên dịch sang WebAssembly và phục vụ từ chính trang này — nhận dạng văn bản của từng trang cục bộ; mô hình ngôn ngữ cũng được tải từ chính trang này, không phải từ CDN bên thứ ba.
Văn bản nhận dạng được hiển thị theo từng trang và đưa ra để tải về dưới dạng tệp .txt.
When to use this tool
Kế toán viên OCR hóa đơn quét để sao chép số tiền từng dòng vào bảng tính mà không cần gõ lại.
Học sinh OCR tài liệu phát khóa học quét để có văn bản có thể tìm kiếm và sao chép cho ghi chú của mình.
Nhân viên lưu trữ chuyển đổi tài liệu chữ Hán truyền thống quét thành văn bản có thể tìm kiếm cho thư viện số.
Độ chính xác OCR phụ thuộc vào chất lượng quét — các trang mờ, nghiêng hoặc độ phân giải thấp có thể tạo ra lỗi; coi đầu ra là bản nháp cố gắng tốt nhất.
Frequently asked questions
Công cụ này khác gì so với các công cụ PDF trực tuyến khác?
Phần lớn các công cụ PDF trực tuyến gửi tệp của bạn lên máy chủ từ xa để xử lý. Công cụ này xử lý mọi thứ ngay trong trình duyệt của bạn bằng JavaScript phía máy khách. Tệp của bạn không được gửi tới bất kỳ máy chủ nào, nghĩa là nội dung tài liệu hoàn toàn nằm trong tầm kiểm soát của bạn.
Tệp PDF của tôi có bị tải lên không?
Không. Tệp được trình duyệt của bạn đọc trực tiếp. Tệp của bạn không bao giờ được gửi qua mạng. Công cụ hoạt động hoàn toàn trong thẻ trình duyệt mà bạn đang mở.
Tôi có thể kiểm chứng rằng tệp không bị tải lên không?
Có. Mở công cụ dành cho nhà phát triển của trình duyệt (F12), chuyển sang tab Network và theo dõi các yêu cầu gửi đi trong khi dùng công cụ. Bạn sẽ thấy không có dữ liệu tệp nào rời khỏi trình duyệt. Trang web có thể ghi lại số lượt xem trang ẩn danh, thông tin này không bao gồm tệp của bạn và có thể tắt đi.
Công cụ này có hoạt động ngoại tuyến không?
Có. Sau khi trang đã tải xong, công cụ xử lý tệp của bạn hoàn toàn trong trình duyệt; chức năng công cụ không cần kết nối mạng. Bạn có thể ngắt kết nối internet và tiếp tục sử dụng.
Điều gì xảy ra khi tôi tải lại trang?
Vì không có gì được lưu trên máy chủ, việc tải lại trang sẽ xóa phiên làm việc hiện tại. Bạn sẽ cần chọn lại bất kỳ tệp nào đã chọn trước đó.
Công cụ này có lưu trữ tệp của tôi không?
Không. Tệp chỉ được giữ trong bộ nhớ trình duyệt trong thời gian trang còn mở. Đóng hoặc tải lại trang sẽ xóa chúng. Công cụ không ghi gì ra ổ đĩa và không gửi gì lên máy chủ.
Công cụ này có mở khóa được PDF bảo vệ bằng mật khẩu không?
Không. Công cụ này không cố gỡ bỏ hay vượt qua bảo vệ mật khẩu của PDF. Nếu bạn biết mật khẩu, công cụ Unlock PDF trên trang này có thể gỡ mật khẩu cục bộ; sau đó công cụ này mới xử lý được tệp.
Công cụ này dùng những công nghệ gì?
Công cụ này dùng pdf.js để kết xuất các trang và bộ máy Tesseract OCR được biên dịch sang WebAssembly (tesseract.js) chạy trong một Web Worker cùng nguồn gốc — các tệp của bạn không bao giờ rời khỏi trình duyệt.
Công cụ này có dùng WebAssembly không?
Có — đây là một trong số ít công cụ ở đây có dùng. Bộ máy Tesseract OCR là mã C++ được biên dịch sang WebAssembly và chạy bên trong trình duyệt của bạn; tệp .wasm được phục vụ từ chính trang này và không có gì được gửi đi đâu cả.
Tại sao lần chạy đầu tiên chậm hơn các lần sau?
Trong lần dùng đầu tiên, trình duyệt của bạn tải bộ máy OCR và mô hình ngôn ngữ từ chính trang này (vài megabyte) và biên dịch chúng. Sau đó chúng được lưu vào bộ nhớ đệm, nên các lần chạy sau khởi động nhanh hơn nhiều.
Làm thế nào để chạy OCR cho một tệp PDF đã quét tại đây?
Chọn một tệp PDF đã quét từ thiết bị của bạn, chọn ngôn ngữ của tài liệu (tiếng Anh hoặc tiếng Trung phồn thể), rồi chọn Nhận dạng. Mỗi trang được kết xuất và đọc cục bộ, và khi hoàn tất, bạn có thể xem trước văn bản và lưu nó dưới dạng tệp .txt.
Tại sao văn bản nhận dạng được chỉ là một tệp .txt thay vì một PDF có thể tìm kiếm?
Công cụ này xuất các từ nhận dạng được dưới dạng văn bản thuần túy chứ không ghi một lớp văn bản vô hình trở lại vào PDF, nên tệp PDF đã quét gốc của bạn vẫn giữ nguyên. Nếu bạn cần các từ nằm bên trong trang, bạn sẽ sao chép chúng từ tệp .txt đã lưu hoặc từ bản xem trước trên màn hình, vốn liệt kê văn bản theo từng trang.
Tôi có thể chạy hai ngôn ngữ trong cùng một tài liệu không, và nếu tôi chọn nhầm thì sao?
Bạn chọn một ngôn ngữ duy nhất cho toàn bộ tài liệu trước khi nhận dạng, nên một tệp pha trộn tiếng Anh và tiếng Trung phồn thể sẽ thiên về ngôn ngữ bạn đã chọn. Chất lượng nhận dạng còn phụ thuộc vào chính bản quét, nên các trang bị nghiêng, độ phân giải thấp hoặc viết tay thường cho kết quả kém bất kể ngôn ngữ nào.
Công cụ OCR PDF có mất phí không?
Công cụ OCR PDF hoàn toàn miễn phí — không cần tài khoản, không cần đăng ký, và không giới hạn số lượng PDF được quét bạn xử lý. Sẽ luôn luôn miễn phí như vậy. Mọi trang đều được nhận dạng ngay trong trình duyệt của bạn bằng engine Tesseract OCR được biên dịch thành WebAssembly, nên các tài liệu được quét của bạn — dù là hợp đồng, giấy tờ tùy thân hay hồ sơ y tế — đều không bao giờ được gửi đi đâu cả.