Công cụ tóm tắt PDF

Bước 1 trên 3

Đang mở phiên tóm tắt riêng tư...

Chọn PDF có lớp văn bản

Dùng một PDF tối đa 20 MiB và 150 trang. Công cụ đọc lớp văn bản có sẵn; trang quét cần được OCR trước.

hoặc thả một PDF vào đây

Đang tải...

Tài liệu lớn có thể mất một lúc. Bạn có thể dừng an toàn mà không giữ lại kết quả chưa hoàn chỉnh.

trang

Công cụ đọc lớp văn bản được nhúng trong PDF, xếp hạng câu dựa trên những từ lặp lại rồi hiển thị các câu đã chọn theo thứ tự trích xuất. Công cụ không dùng AI, không viết lại và không kiểm chứng thông tin. Tệp cùng văn bản trích xuất vẫn nằm trong trình duyệt, vì vậy kết quả phù hợp để xem nhanh ban đầu chứ không thay thế việc đọc nguồn.

Cách tóm tắt PDF

  1. 1

    Chọn PDF có lớp văn bản

    Chọn một PDF hợp lệ, tối đa 20 MiB và 150 trang. Tài liệu quét hoặc chỉ có hình ảnh cần được OCR trước.

  2. 2

    Trích xuất văn bản trong trình duyệt

    Công cụ đọc văn bản nhúng ngay trên thiết bị và dừng nếu trích xuất quá 2.000.000 ký tự. Tệp có mật khẩu, bị hỏng hoặc không đọc được sẽ bị từ chối.

  3. 3

    Đặt độ dài bản tóm tắt

    Chọn từ 3 đến 20 câu. Nếu tài liệu ngắn hơn, công cụ hiển thị mọi câu hiện có mà không tạo thêm nội dung.

  4. 4

    Đối chiếu và sao chép

    So sánh các câu được chọn và từ thường gặp với PDF gốc trước khi sao chép bản tóm tắt.

Bản tóm tắt trích rút thực sự làm gì?

Bản tóm tắt trích rút giữ lại câu từ nguồn thay vì soạn nội dung mới. Công cụ đếm những từ hữu ích, tăng nhẹ trọng số cho các câu đầu, chọn câu có điểm cao rồi đưa chúng về thứ tự trích xuất.

Ví dụ đơn giản

Giả sử bản tóm lược dự án gồm bốn câu:

  1. Chương trình thử nghiệm đã giảm thời gian chờ hỗ trợ trung bình.
  2. Nhóm cũng thiết kế lại sổ tay đào tạo.
  3. Thời gian chờ tiếp tục giảm sau đợt triển khai thứ hai.
  4. Báo cáo khuyến nghị theo dõi thời gian chờ hằng tháng.

Vì cụm từ thời gian chờ xuất hiện nhiều lần, câu 1, 3 và 4 có thể được xếp cao hơn câu 2. Khi đặt độ dài là ba câu, kết quả giữ các câu đó theo thứ tự 1, 3, 4. Công cụ không viết kết luận mới và cũng không xác định báo cáo có đúng hay không.

Cách xử lý

Giai đoạn Hoạt động thực tế
Đọc PDF Đọc lớp văn bản nhúng bằng PDF.js, không thực hiện OCR
Tách câu Dùng Intl.Segmenter theo ngôn ngữ của trang khi có, kèm phương án dự phòng dựa trên dấu câu Unicode
Tách từ Dùng quy tắc tách theo ngôn ngữ khi được hỗ trợ và lọc một danh sách nhỏ các từ thông dụng
Xếp hạng Chấm điểm câu từ mức độ lặp từ và một phần tăng nhẹ cho vị trí đầu
Kết quả Giữ câu đã chọn theo thứ tự trích xuất và liệt kê tối đa 12 từ thường gặp

Những giới hạn quan trọng

  • Cột, bảng, đầu trang, chân trang và mã hóa phông chữ khác thường có thể tạo thứ tự trích xuất khác với thứ tự đọc trên màn hình.
  • Việc tách câu và từ dựa vào ngôn ngữ của trang; công cụ không tự nhận diện ngôn ngữ của toàn bộ PDF.
  • Một câu được sao chép đúng từ nguồn vẫn có thể mất ngữ cảnh của đoạn văn hoặc bảng xung quanh.
  • Công cụ không kiểm chứng dữ kiện, giải quyết mâu thuẫn hay đánh giá bằng chứng.
  • Giới hạn là 20 MiB, 150 trang và 2.000.000 ký tự trích xuất.

Quyền riêng tư trong quy trình ba bước

PDF nguồn và văn bản trích xuất nằm trong bộ nhớ trình duyệt. ID khó đoán trong URL chỉ trỏ đến bản ghi cục bộ, bản ghi này hết hạn sau 30 phút. Trang và thư viện PDF vẫn tải các tài nguyên thông thường, nhưng những yêu cầu đó không mang theo PDF của bạn; tệp cũng không được gửi qua máy chủ của chúng tôi hay đến dịch vụ chuyển đổi.

Câu hỏi thường gặp

Không. Công cụ chọn câu bằng cách chấm điểm tần suất từ theo quy tắc cố định. Nó không diễn đạt lại nguồn, tạo tuyên bố mới hay kiểm chứng dữ kiện.

Không trực tiếp. Bản quét chỉ có hình ảnh không có lớp văn bản để đọc. Hãy chạy OCR trước rồi dùng PDF có thể tìm kiếm được tạo ra.

PDF lưu văn bản theo vị trí thay vì đoạn văn thông thường. Cột, bảng, đầu trang, chân trang và phông chữ khác thường có thể làm thay đổi thứ tự trích xuất.

Trình duyệt được yêu cầu tách câu và từ theo ngôn ngữ của trang, kể cả ngôn ngữ không cách mọi từ bằng dấu cách. Có phương án dự phòng Unicode nhưng ngôn ngữ PDF không được tự phát hiện.

Dùng một PDF tối đa 20 MiB, 150 trang và 2.000.000 ký tự trích xuất. Tệp có mật khẩu, bị hỏng hoặc không đọc được sẽ bị từ chối.

Không. PDF và văn bản vẫn ở trong trình duyệt. Bản ghi cục bộ riêng tư của quy trình ba bước tồn tại tối đa 30 phút và URL chỉ chứa ID khó đoán.

Công cụ liên quan