Chuyển đổi PDF sang HTML

Chuyển sang HTML
Tiếp theo

Công cụ chuyển đổi này đọc văn bản trong tệp PDF của bạn và bọc nó trong một tệp HTML gọn gàng, tối giản: mỗi trang một <section>, một tiêu đề trang <h2> và các đoạn văn <p>. Nó chạy hoàn toàn trong trình duyệt của bạn bằng PDF.js, nên tệp không bao giờ được tải lên. Kết quả là HTML đơn giản chỉ gồm văn bản, mà bạn có thể mở, chỉnh sửa hoặc dán vào một CMS rồi tạo kiểu bằng CSS của riêng mình. Nó được tạo ra để đưa văn bản của PDF lên web, chứ không phải để tái tạo một trang đã được thiết kế.

Cách chuyển đổi PDF sang HTML

  1. 1

    Chọn tệp PDF của bạn

    Kéo một tệp PDF dạng văn bản vào ô hoặc nhấp để duyệt tìm. Mọi thứ đều ở lại trong trình duyệt của bạn.

  2. 2

    Chuyển đổi sang HTML

    PDF.js đọc từng trang và trích xuất văn bản của nó, nhóm các dòng thành đoạn văn.

  3. 3

    Xem lại HTML

    Mã đánh dấu được tạo ra sẽ hiện trong ô xem trước để bạn kiểm tra kết quả.

  4. 4

    Tải tệp về

    Lưu một tệp `.html` duy nhất, mỗi trang một phần, sẵn sàng để chỉnh sửa hoặc tạo kiểu lại.

Kết quả trông như thế nào

Công cụ chuyển đổi tạo ra một tệp HTML5 hợp lệ với cấu trúc tối giản:

Phần tử Đến từ đâu
Khung <!DOCTYPE html> Một lớp bọc HTML5 chuẩn với bộ ký tự UTF-8
<title> Tên tệp PDF của bạn
<section data-page> Một khối cho mỗi trang PDF
<h2>Trang N</h2> Một tiêu đề đánh dấu điểm bắt đầu của mỗi trang
<p> Các dòng văn bản được nhóm thành đoạn theo khoảng cách dọc

Những gì nó không làm

Đây là công cụ trích xuất văn bản, không phải công cụ dàn trang. Một cách có chủ đích, kết quả không bao gồm:

  • Hình ảnh, logo hay hình vẽ minh họa từ PDF.
  • Bảng, danh sách dấu đầu dòng hay danh sách đánh số dưới dạng <table>/<ul>/<ol> của HTML.
  • Phông chữ, màu sắc, cột hay cách bố trí gốc.
  • Bất kỳ CSS hay kiểu nội tuyến nào.

Bạn nhận được các từ theo thứ tự đọc, được bọc trong những đoạn văn có ngữ nghĩa, và không có gì khác. Hãy thêm CSS của riêng bạn sau đó.

Kết quả tốt nhất

  • Hãy dùng một PDF dạng văn bản (loại mà bạn có thể chọn văn bản trong trình đọc). PDF được quét hoặc chỉ gồm hình ảnh không có lớp văn bản; ở đây không có OCR, nên kết quả của những trang đó sẽ trống.
  • Chạy tệp qua prettier --parser html hoặc một trình định dạng để dọn dẹp khoảng trắng trước khi commit.
  • Đang chuyển sang WordPress? Hãy dán HTML vào khối mã/HTML, chứ không phải trình soạn thảo trực quan, vì nó sẽ bọc lại mã.

Không phải công cụ dàn trang

Đừng mong HTML trông giống PDF. Web thì linh hoạt, còn một trang PDF thì cố định. Hãy dùng công cụ này khi bạn muốn đưa nội dung lên web, rồi tạo kiểu lại bằng CSS của chính trang web của bạn.

Câu hỏi thường gặp

Không. Công cụ trích xuất văn bản và đưa vào các đoạn văn đơn giản. Phông chữ, màu sắc, cột và cách bố trí không được tái tạo. Hãy tạo kiểu cho kết quả bằng CSS của riêng bạn.

Không. Chỉ văn bản được trích xuất. Hình ảnh, logo và hình vẽ minh họa không được chuyển sang HTML.

Chỉ khi PDF có một lớp văn bản thực sự. Các trang được quét hoặc chụp ảnh là hình ảnh không có văn bản chọn được, và ở đây không có OCR, nên những trang đó không tạo ra văn bản nào.

Không. Toàn bộ quá trình chuyển đổi chạy trong trình duyệt của bạn bằng PDF.js. Tệp PDF không bao giờ rời khỏi thiết bị của bạn, nên nó an toàn cho các tài liệu mật.

Công cụ liên quan

Công cụ này có phiên bản bằng các ngôn ngữ khác