Công cụ chuyển PDF sang văn bản

Tiếp theo: xem lại

Cách nhanh nhất để lấy chữ ra khỏi một tệp PDF. Công cụ này đọc lớp văn bản đã được lưu sẵn trong tệp PDF, từng trang một, và trả về văn bản thuần túy mà bạn có thể sao chép hoặc lưu thành tệp .txt. Mọi thứ chạy trong trình duyệt của bạn, nên tài liệu của bạn không bao giờ được tải lên. Có một điều cần biết ngay từ đầu: công cụ đọc phần văn bản đã có sẵn trong tệp, nên một tài liệu được quét hoặc chụp ảnh (một hình ảnh không có lớp văn bản) sẽ ra kết quả trống. Với những trường hợp đó, hãy dùng công cụ OCR thay thế.

Cách trích xuất văn bản từ tệp PDF

  1. 1

    Tải tệp PDF lên

    Kéo tệp vào hoặc nhấp để chọn. Tệp ở lại trên thiết bị của bạn và không bao giờ được gửi đến máy chủ.

  2. 2

    Trích xuất văn bản

    Công cụ đọc lớp văn bản của từng trang rồi ghép lại, đặt một dấu phân trang trước mỗi trang.

  3. 3

    Xem lại kết quả

    Văn bản trích xuất hiện trong một khung, hết trang này đến trang khác, sẵn sàng để bạn kiểm tra.

  4. 4

    Sao chép hoặc tải xuống

    Sao chép vào bộ nhớ tạm hoặc lưu thành tệp .txt để dùng lại ở nơi khác.

Công cụ này đọc được gì và không đọc được gì

Loại PDF Kết quả
Xuất từ Word, Google Docs, một trình duyệt hoặc một công cụ thiết kế Toàn bộ văn bản, sạch và đầy đủ
Một tệp PDF số có lớp văn bản đúng nghĩa Trích xuất văn bản từng trang một
Một bản quét hoặc ảnh chụp lưu thành PDF (chỉ có hình ảnh) Trống hoặc gần như trống: không có văn bản để đọc
Một tệp PDF được bảo vệ bằng mật khẩu Không thể đọc cho đến khi bạn mở khóa trước

Không có OCR ở đây: dùng đúng công cụ cho bản quét

Công cụ trích xuất này không chạy OCR (nhận dạng ký tự quang học). Nó sao chép phần văn bản đã có sẵn bên trong tệp PDF, nó không đọc điểm ảnh. Nếu tệp của bạn là bản quét và không nhận được gì, hãy cho nó qua một công cụ OCR trước; công cụ này biến hình ảnh thành một lớp văn bản thực sự mà sau đó bạn có thể trích xuất.

Cách văn bản được sắp xếp

Mỗi trang được ngăn cách bằng dấu --- Page N ---, để bạn thấy trang này kết thúc ở đâu và trang kế tiếp bắt đầu ở đâu. Văn bản được lấy ra theo thứ tự nó được lưu trong tệp PDF. Hầu hết tài liệu đọc lên tự nhiên; một số ít có bố cục nhiều cột khác thường có thể xen kẽ các cột, vì công cụ đi theo thứ tự đã lưu trong tệp PDF thay vì đoán một lối đọc.

Các cách dùng phổ biến

  • Đưa vào một mô hình AI. Các mô hình ngôn ngữ nhận văn bản thuần túy, không nhận tệp PDF. Trích xuất trước giúp mọi thứ nhanh hơn và dễ đoán hơn.
  • Trích dẫn và tìm kiếm. Sao chép một đoạn mà không phải vật lộn với thao tác chọn của trình xem PDF.
  • Tái sử dụng nội dung. Chuyển văn bản sang một tài liệu, một email hoặc một ghi chú mà không phải gõ lại.

Câu hỏi thường gặp

Không. Nó đọc lớp văn bản được nhúng, còn bản quét chỉ là một hình ảnh không có lớp văn bản, nên kết quả trả về trống. Hãy dùng công cụ OCR cho tài liệu quét hoặc chụp ảnh, rồi sau đó trích xuất văn bản.

Không. Việc trích xuất chạy hoàn toàn trong trình duyệt của bạn, trên chính thiết bị của bạn. Tệp PDF không bao giờ được gửi đến máy chủ và không có gì được lưu lại.

Một số tệp PDF, nhất là bố cục nhiều cột, lưu văn bản theo thứ tự khác với cách bạn đọc. Công cụ đi theo thứ tự đã lưu trong tệp PDF, nên các cột có thể xen kẽ nhau. Tài liệu xuất từ trình soạn thảo văn bản thì gần như luôn ra đúng.

Không, khi chúng còn bị khóa. Hãy gỡ mật khẩu trước bằng một công cụ mở khóa PDF, rồi sau đó trích xuất văn bản.

Công cụ liên quan

Công cụ này có phiên bản bằng các ngôn ngữ khác