Công cụ chuyển PDF sang văn bản
Cách nhanh nhất để lấy chữ ra khỏi một tệp PDF. Công cụ này đọc lớp văn bản đã được lưu sẵn trong tệp PDF, từng trang một, và trả về văn bản thuần túy mà bạn có thể sao chép hoặc lưu thành tệp .txt. Mọi thứ chạy trong trình duyệt của bạn, nên tài liệu của bạn không bao giờ được tải lên. Có một điều cần biết ngay từ đầu: công cụ đọc phần văn bản đã có sẵn trong tệp, nên một tài liệu được quét hoặc chụp ảnh (một hình ảnh không có lớp văn bản) sẽ ra kết quả trống. Với những trường hợp đó, hãy dùng công cụ OCR thay thế.
Cách trích xuất văn bản từ tệp PDF
-
1
Tải tệp PDF lên
Kéo tệp vào hoặc nhấp để chọn. Tệp ở lại trên thiết bị của bạn và không bao giờ được gửi đến máy chủ.
-
2
Trích xuất văn bản
Công cụ đọc lớp văn bản của từng trang rồi ghép lại, đặt một dấu phân trang trước mỗi trang.
-
3
Xem lại kết quả
Văn bản trích xuất hiện trong một khung, hết trang này đến trang khác, sẵn sàng để bạn kiểm tra.
-
4
Sao chép hoặc tải xuống
Sao chép vào bộ nhớ tạm hoặc lưu thành tệp .txt để dùng lại ở nơi khác.
Công cụ này đọc được gì và không đọc được gì
| Loại PDF | Kết quả |
|---|---|
| Xuất từ Word, Google Docs, một trình duyệt hoặc một công cụ thiết kế | Toàn bộ văn bản, sạch và đầy đủ |
| Một tệp PDF số có lớp văn bản đúng nghĩa | Trích xuất văn bản từng trang một |
| Một bản quét hoặc ảnh chụp lưu thành PDF (chỉ có hình ảnh) | Trống hoặc gần như trống: không có văn bản để đọc |
| Một tệp PDF được bảo vệ bằng mật khẩu | Không thể đọc cho đến khi bạn mở khóa trước |
Không có OCR ở đây: dùng đúng công cụ cho bản quét
Công cụ trích xuất này không chạy OCR (nhận dạng ký tự quang học). Nó sao chép phần văn bản đã có sẵn bên trong tệp PDF, nó không đọc điểm ảnh. Nếu tệp của bạn là bản quét và không nhận được gì, hãy cho nó qua một công cụ OCR trước; công cụ này biến hình ảnh thành một lớp văn bản thực sự mà sau đó bạn có thể trích xuất.
Cách văn bản được sắp xếp
Mỗi trang được ngăn cách bằng dấu --- Page N ---, để bạn thấy trang này kết thúc ở đâu và trang kế tiếp bắt đầu ở đâu. Văn bản được lấy ra theo thứ tự nó được lưu trong tệp PDF. Hầu hết tài liệu đọc lên tự nhiên; một số ít có bố cục nhiều cột khác thường có thể xen kẽ các cột, vì công cụ đi theo thứ tự đã lưu trong tệp PDF thay vì đoán một lối đọc.
Các cách dùng phổ biến
- Đưa vào một mô hình AI. Các mô hình ngôn ngữ nhận văn bản thuần túy, không nhận tệp PDF. Trích xuất trước giúp mọi thứ nhanh hơn và dễ đoán hơn.
- Trích dẫn và tìm kiếm. Sao chép một đoạn mà không phải vật lộn với thao tác chọn của trình xem PDF.
- Tái sử dụng nội dung. Chuyển văn bản sang một tài liệu, một email hoặc một ghi chú mà không phải gõ lại.
Câu hỏi thường gặp
Không. Nó đọc lớp văn bản được nhúng, còn bản quét chỉ là một hình ảnh không có lớp văn bản, nên kết quả trả về trống. Hãy dùng công cụ OCR cho tài liệu quét hoặc chụp ảnh, rồi sau đó trích xuất văn bản.
Không. Việc trích xuất chạy hoàn toàn trong trình duyệt của bạn, trên chính thiết bị của bạn. Tệp PDF không bao giờ được gửi đến máy chủ và không có gì được lưu lại.
Một số tệp PDF, nhất là bố cục nhiều cột, lưu văn bản theo thứ tự khác với cách bạn đọc. Công cụ đi theo thứ tự đã lưu trong tệp PDF, nên các cột có thể xen kẽ nhau. Tài liệu xuất từ trình soạn thảo văn bản thì gần như luôn ra đúng.
Không, khi chúng còn bị khóa. Hãy gỡ mật khẩu trước bằng một công cụ mở khóa PDF, rồi sau đó trích xuất văn bản.
Công cụ liên quan
OCR cho PDF
Trích xuất văn bản thuần từ bản in quét trong PDF bằng OCR trên trình duyệt. Hỗ trợ 12 ngôn ngữ, tệp tối đa 20 MB và tài liệu tối đa 40 trang.
Sắp xếp lại trang PDF
Sắp xếp, bỏ hoặc lặp trang PDF bằng dãy số chính xác cách nhau bằng dấu phẩy. Xử lý tệp tối đa 20 MiB và 200 trang trên trình duyệt.
Trình tạo PDF tìm kiếm được
Biến một PDF đã quét thành tài liệu tìm kiếm và chọn được chữ bằng cách thêm lớp văn bản OCR vô hình. Hoàn toàn trong trình duyệt; 7 ngôn ngữ chữ Latinh.
Lấy hình ảnh từ tệp PDF
Trích xuất từng hình ảnh được chứa trong tệp PDF và tải chúng ra riêng lẻ hoặc dưới dạng một tệp ZIP duy nhất, đồng thời giữ nguyên độ phân giải gốc.
Trình chuyển HEIC sang PDF
Ghép tối đa 20 ảnh HEIC hoặc HEIF vào một tệp PDF khổ A4 hoặc US Letter. Mọi thao tác đều diễn ra trong trình duyệt.
Biểu mẫu PDF
Điền cục bộ các trường AcroForm có sẵn, giữ nguyên dữ liệu điền trước và tải xuống bản tương tác hoặc bản làm phẳng được chọn rõ ràng.
Công cụ này có phiên bản bằng các ngôn ngữ khác
- PDF 텍스트 변환기 [KO]
- PDF till text-konverterare [SV]
- محوّل PDF إلى نص [AR]
- Konwerter PDF na tekst [PL]
- PDF-zu-Text-Konverter [DE]
- Convertisseur PDF en texte [FR]
- ตัวแปลง PDF เป็นข้อความ [TH]
- Konverter PDF ke Teks [ID]
- PDF-naar-tekst-converter [NL]
- PDF テキスト変換ツール [JA]
- Conversor de PDF para texto [PT]
- Conversor de PDF a texto [ES]
- PDF to Text Converter [EN]
- Convertitore da PDF a testo [IT]
- PDF 转文本转换器 [ZH]
- Конвертер PDF в текст [RU]
- PDF'den Metne Dönüştürücü [TR]