Trình tạo PDF tìm kiếm được

Chọn PDF đã quét

Chỉ PDF · 10 MB

Chỉ PDF, tối đa 10 MB và 10 trang

Một PDF đã quét thực chất chỉ là một chồng ảnh gói trong hộp chứa PDF, nên bạn không thể tô sáng, sao chép hay tìm kiếm chữ. Công cụ này chạy nhận dạng ký tự quang học (OCR) trên từng trang ngay trong trình duyệt của bạn và thêm kết quả dưới dạng lớp văn bản vô hình khớp với trang gốc. Nội dung hình ảnh của trang gốc vẫn được giữ lại, còn Ctrl+F và thao tác chọn văn bản có thể dùng các từ đã nhận dạng. Việc nhận dạng có thể sai, và kết quả này không phải PDF trợ năng có gắn thẻ, vì vậy hãy đối chiếu phần chữ quan trọng với bản quét.

Cách OCR một PDF đã quét

  1. 1

    Tải lên bản quét

    Kéo vào một PDF đã quét (hợp đồng, hóa đơn, báo cáo lưu trữ). Chữ in cho kết quả tốt nhất; chữ viết tay thì không.

  2. 2

    Chọn ngôn ngữ

    Chọn ngôn ngữ của tài liệu (tiếng Anh, Tây Ban Nha, Pháp, Đức, Ý, Bồ Đào Nha hoặc Hà Lan) để bộ máy OCR nạp đúng mô hình ký tự.

  3. 3

    Chạy nhận dạng

    Mỗi trang được kết xuất ở độ phân giải cao trong trình duyệt của bạn rồi chuyển cho bộ máy OCR. Tài liệu dài có thể mất vài phút.

  4. 4

    Nhúng lớp văn bản

    Các từ được nhận dạng được đặt trong một lớp vô hình khớp với trang gốc, nên mỗi trang trông không đổi.

  5. 5

    Tải PDF mới về

    Nhận một PDF vẫn giữ nguyên bản quét gốc và giờ có thể tìm kiếm trong mọi trình đọc hiện đại.

Khi nào OCR hoạt động tốt (và khi nào không)

Chất lượng OCR phụ thuộc vào bản quét. Hãy luôn đối chiếu tên, số liệu và câu chữ pháp lý quan trọng với trang gốc.

Đầu vào Điều có thể mong đợi
Bản quét chữ in sạch Thường cho kết quả tốt, nhưng hãy soát lại chữ quan trọng.
Ảnh chụp trang in Kết quả phụ thuộc vào lấy nét, ánh sáng và góc của trang.
Sách cũ hoặc chữ máy đánh chữ đã phai Hãy kiểm tra kỹ văn bản đã nhận dạng.
Chữ viết tay hoặc chữ nối Không được hỗ trợ một cách đáng tin cậy.
Hóa đơn hoặc bản in từ máy in nhiệt Hãy kiểm tra kỹ số và ký tự nhạt.
Chữ bị thấu mạnh từ mặt sau Kết quả có thể không đầy đủ hoặc không chính xác.

PDF tìm kiếm được so với PDF chỉ có ảnh

  • PDF chỉ có ảnh: bitmap thuần, không có chữ. Đây là thứ máy quét của bạn tạo ra theo mặc định.
  • PDF tìm kiếm được: bitmap cộng thêm một lớp văn bản vô hình (kết quả của công cụ này). Trông y hệt, Ctrl+F dùng được.
  • PDF/A: một tập con của PDF dùng cho lưu trữ, nhúng phông chữ của chính nó và cấm tài nguyên bên ngoài, thường được tòa án và cơ quan lưu trữ yêu cầu. Công cụ này tạo một PDF tìm kiếm được thông thường, không phải PDF/A đã chứng nhận; hãy chuyển đổi và kiểm định bằng một công cụ PDF/A chuyên dụng nếu quy trình của bạn yêu cầu.

Mẹo để có kết quả tốt nhất

  • Bắt đầu ở khoảng 300 DPI. Đây thường là mức cân bằng hữu ích giữa chi tiết đọc được và thời gian xử lý. Độ phân giải cao hơn dùng nhiều thời gian và bộ nhớ hơn.
  • Chỉnh thẳng trước khi OCR. Hầu hết máy quét đều có xoay tự động; chỉ một độ nghiêng nhỏ cũng có thể làm giảm chất lượng nhận dạng.
  • Mỗi lần chạy một ngôn ngữ. Bộ máy chỉ nhận dạng một ngôn ngữ mỗi lần, nên hãy chọn ngôn ngữ chủ đạo. Với tài liệu song ngữ, chạy một lần cho mỗi ngôn ngữ rồi giữ kết quả tốt hơn.
  • Luôn giữ bản gốc. OCR gây ra vài lỗi nhỏ; lớp vô hình là tiện lợi, không phải bằng chứng.

Câu hỏi thường gặp

Nội dung trang gốc được giữ nguyên. Văn bản nhận dạng được thêm như một lớp vô hình khớp với nội dung đó, vì vậy diện mạo của trang không nên thay đổi. Hãy kiểm tra kết quả nếu độ trung thực hình ảnh tuyệt đối là quan trọng.

Bảy ngôn ngữ chữ Latinh: tiếng Anh, Tây Ban Nha, Pháp, Đức, Ý, Bồ Đào Nha và Hà Lan. Hãy chọn ngôn ngữ khớp với tài liệu của bạn. Các hệ chữ như Kirin, Ả Rập và CJK (Trung, Nhật, Hàn) không có trong công cụ này.

Không đáng tin cậy. Công cụ này dành cho chữ in. Nhận dạng chữ viết tay là một công nghệ khác, vì vậy hãy kiểm tra hoặc chép lại riêng tài liệu viết tay.

Không. Kết quả là một PDF tìm kiếm được thông thường: ảnh trang gốc của bạn cộng một lớp văn bản OCR vô hình. Nó không phải tệp PDF/A lưu trữ đã chứng nhận. Nếu quy trình của bạn yêu cầu PDF/A, hãy chuyển đổi và kiểm định kết quả bằng một công cụ PDF/A chuyên dụng.

OCR chạy hoàn toàn trong trình duyệt của bạn, nên PDF nguồn không được gửi đến máy chủ để nhận dạng. Bản tải xuống cục bộ thông thường vẫn ở trên thiết bị của bạn. Chỉ khi bạn chọn Tạo trang tải xuống, PDF tìm kiếm được đã hoàn tất mới được tải lên máy chủ của chúng tôi. PDF nguồn vẫn ở cục bộ và kết quả đã tải lên được lưu tối đa 7 ngày.

Công cụ liên quan