OCR cho PDF

Chọn PDF đã quét

Chỉ PDF · 20 MB · 40 trang

hoặc thả một PDF vào đây

Dùng công cụ này khi PDF chứa hình ảnh trang quét thay vì văn bản có thể chọn. Công cụ kết xuất các trang và chạy nhận dạng ký tự quang học (OCR) trong trình duyệt, sau đó hiển thị văn bản thuần đã nhận dạng để bạn kiểm tra, sao chép hoặc lưu thành tệp .txt. PDF nguồn vẫn ở trên thiết bị của bạn. Công cụ không tạo PDF có thể tìm kiếm, không giữ bố cục trang và kết quả OCR có thể có lỗi.

Cách trích xuất văn bản từ PDF quét

  1. 1

    Chọn ngôn ngữ của tài liệu

    Chọn ngôn ngữ chính của phần chữ in. Lựa chọn này quyết định mô hình OCR mà trình duyệt sử dụng.

  2. 2

    Mở PDF

    Chọn PDF tối đa 20 MB và 40 trang. Tệp nguồn vẫn nằm trong trình duyệt và không được gửi đến máy chủ của chúng tôi.

  3. 3

    Chờ nhận dạng

    Trình duyệt kết xuất từng trang và đọc bằng mô hình OCR đã chọn. Các tệp mô hình có thể cần được tải xuống trước khi bắt đầu nhận dạng.

  4. 4

    Kiểm tra kết quả

    Đối chiếu tên, số và các đoạn quan trọng với trang gốc. Hãy xem kết quả OCR là bản nháp và kiểm tra lại theo bản gốc.

  5. 5

    Sao chép hoặc tải văn bản xuống

    Sao chép giữ kết quả trong trình duyệt. Tải TXT xuống máy lưu tệp văn bản thuần mà không tải lên máy chủ. Tạo trang tải xuống được bảo vệ là một thao tác riêng và không bắt buộc.

Công cụ này tạo ra nội dung gì

Kết quả là văn bản thuần, có dấu trang đứng trước phần chữ được nhận dạng từ mỗi trang. Công cụ không:

  • thêm lớp văn bản ẩn vào PDF
  • dựng lại cột, bảng, biểu mẫu hoặc kiểu chữ gốc
  • giữ nguyên bố cục trực quan của trang
  • dịch tài liệu
  • xác minh văn bản nhận dạng có chính xác hay không

Nếu cần một PDF giữ nguyên các trang quét và thêm văn bản có thể tìm kiếm phía sau, hãy dùng ứng dụng chuyên tạo PDF có thể tìm kiếm hoặc phần mềm OCR trên máy tính.

Tài liệu cho kết quả tốt

OCR dành cho văn bản in. Bản quét thẳng, rõ và có độ tương phản dễ đọc sẽ dễ nhận dạng hơn ảnh bị mờ, bản fax phai màu hoặc trang bị hỏng. Phông chữ trang trí, chữ viết tay, ký hiệu toán học, các cột đặt sát nhau và bảng phức tạp có thể tạo ra văn bản sai hoặc lộn thứ tự.

Công cụ nhận PDF tối đa 20 MB và 40 trang. Việc nhận dạng diễn ra theo từng trang và có thể dùng nhiều bộ nhớ, nhất là với trang lớn hoặc có độ phân giải cao. Nếu trình duyệt thiếu bộ nhớ, hãy chia PDF thành các phần nhỏ hơn và xử lý riêng.

Ngôn ngữ OCR được hỗ trợ

Bạn có thể chọn tiếng Anh, Tây Ban Nha, Pháp, Đức, Ý, Bồ Đào Nha, Hà Lan, Nga, Nhật, Trung Quốc giản thể, Hàn hoặc Ả Rập.

Hãy chọn ngôn ngữ chính của tài liệu trước khi mở tệp. Trang có nhiều ngôn ngữ hoặc hệ chữ có thể cần được xử lý riêng theo từng ngôn ngữ, và kết quả vẫn có thể nhầm những ký tự có hình dạng giống nhau.

Kiểm tra văn bản đã nhận dạng

Luôn đối chiếu kết quả với PDF gốc trước khi sử dụng. Đặc biệt chú ý:

  • tên, địa chỉ và số định danh
  • ngày tháng, số tiền, dấu thập phân và dấu âm
  • hướng dẫn pháp lý, y tế, tài chính hoặc an toàn
  • ngắt trang và thứ tự đọc trong tài liệu nhiều cột

Không nên xem kết quả OCR là bản sao có thẩm quyền của một tài liệu quan trọng.

Cách xử lý tệp và tải xuống

PDF nguồn được đọc cục bộ trong trình duyệt. Tệp không được đưa vào URL thao tác và không được gửi đến máy chủ của chúng tôi. Trình duyệt có thể tải qua mạng các thư viện kết xuất PDF và OCR, cùng mô hình ngôn ngữ đã chọn.

Sao chép giữ văn bản đã nhận dạng trong trình duyệt và ghi vào bảng nhớ tạm. Tải TXT xuống máy tạo tệp .txt dẫn xuất và lưu mà không tải lên máy chủ. Nếu bạn chọn Tạo trang tải xuống, công cụ chỉ tải tệp văn bản đó lên để tạo liên kết kết quả được bảo vệ, nơi tệp có thể được lưu tối đa 7 ngày. Nếu lần tải lên không bắt buộc này thất bại, bạn vẫn có thể tải tệp xuống máy.

Câu hỏi thường gặp

Không. PDF nguồn vẫn nằm trong trình duyệt khi các trang được kết xuất và nhận dạng. Trình duyệt có thể tải xuống các thư viện cần thiết để kết xuất PDF, chạy OCR và mô hình ngôn ngữ đã chọn. Sao chép và Tải TXT xuống máy không tải văn bản đã nhận dạng lên. Chỉ thao tác riêng Tạo trang tải xuống mới tải tệp văn bản thuần dẫn xuất lên.

Không. Kết quả là văn bản thuần được nhóm theo trang. Công cụ không sửa PDF gốc, không thêm lớp văn bản ẩn và không giữ bố cục của tài liệu.

Bạn nên đối chiếu với các trang gốc. OCR có thể nhầm ký tự, bỏ sót văn bản hoặc thay đổi thứ tự đọc. Hãy kiểm tra mọi chi tiết trước khi dùng kết quả cho công việc pháp lý, y tế, tài chính, an toàn hoặc công việc quan trọng khác.

Công cụ được thiết kế cho văn bản in. Chữ viết tay, phương trình và phông chữ trang trí có thể không đáng tin cậy. Ký tự trong bảng có thể được nhận dạng, nhưng cấu trúc hàng và cột không được giữ trong kết quả văn bản thuần.

Tiếng Anh, Tây Ban Nha, Pháp, Đức, Ý, Bồ Đào Nha, Hà Lan, Nga, Nhật, Trung Quốc giản thể, Hàn và Ả Rập. Chọn ngôn ngữ chính trước khi mở PDF.

PDF có thể lớn tối đa 20 MB và dài tối đa 40 trang. Trang lớn hoặc nhiều chi tiết vẫn có thể vượt quá bộ nhớ hiện có của trình duyệt, vì vậy chia tài liệu khó thành các tệp nhỏ hơn có thể giúp xử lý tốt hơn.

Tải TXT xuống máy tạo tệp .txt từ văn bản đã nhận dạng và lưu mà không tải lên máy chủ. Nếu chọn Tạo trang tải xuống, tệp dẫn xuất sẽ được tải lên một liên kết kết quả được bảo vệ và có thể được lưu tối đa 7 ngày. Nếu lần tải lên không bắt buộc này thất bại, bạn vẫn có thể tải tệp xuống máy.

Công cụ liên quan