Trích xuất URL từ văn bản

Dán nhật ký trò chuyện, tài liệu Markdown, chuỗi email hoặc bản HTML thô, bạn sẽ nhận được danh sách sạch gồm mọi liên kết http://https:// có trong đó. Công cụ bỏ dấu câu cuối, xử lý cú pháp liên kết Markdown và HTML, đồng thời loại bỏ các bản trùng lặp chính xác, để bạn có thể chuyển thẳng danh sách vào trình thu thập dữ liệu hoặc công cụ lưu trữ.

Cách trích xuất URL

  1. 1

    Dán nguồn

    Nhập văn bản hoặc HTML. Dấu ngoặc kép, dấu ngoặc góc, cú pháp liên kết Markdown và dấu câu cuối được xử lý tự động.

  2. 2

    Chạy quét

    Mọi liên kết `http://` và `https://` được tìm thấy, dấu câu cuối được bỏ đi và các bản trùng lặp chính xác bị loại bỏ.

  3. 3

    Xem lại số lượng

    Bạn thấy có bao nhiêu URL duy nhất được tìm thấy cùng danh sách đầy đủ.

  4. 4

    Sao chép hoặc xuất

    Mỗi dòng một URL, sẵn sàng dùng với `curl -I`, công cụ lưu trữ, dịch vụ chụp màn hình hoặc danh sách hạt giống Screaming Frog.

Điều gì được coi là URL?

Việc phát hiện URL khó hơn vẻ bề ngoài, và công cụ này cố tình tuân theo một quy tắc an toàn duy nhất: nó chỉ nhận các liên kết đầy đủ dạng http://https://. Mọi thứ khác vẫn nằm lại trong văn bản của bạn.

Các dạng được nhận diện

Dạng Ví dụ
HTTPS tuyệt đối https://example.com/path?q=1
HTTP tuyệt đối http://example.com
Đích của liên kết Markdown [text](https://example.com)
href tuyệt đối trong HTML href="https://example.com"

Quy tắc cắt bỏ

Dấu câu cuối bị bỏ đi, nên (https://example.com). trở thành https://example.com. Khoảng trắng, dấu ngoặc kép, dấu ngoặc góc, dấu ngoặc tròn, dấu ngoặc vuông, dấu phẩy và dấu chấm phẩy đều dừng việc tìm kiếm. URL chứa dấu ngoặc sẽ bị cắt tại dấu ngoặc mở đầu tiên, nên một tiêu đề kiểu Wikipedia chỉ được lấy đến dấu ngoặc mở mà thôi.

Những gì bị bỏ qua

  • mailto:, tel:, ftp: và mọi giao thức khác không phải http hoặc https.
  • Liên kết tương đối theo giao thức như //cdn.example.com/asset.js.
  • Tên miền trần và địa chỉ có tiền tố www. nhưng không có giao thức, như example.com/docs/intro hoặc www.example.com/page.
  • Các đoạn chỉ có neo như #section và URL giả kiểu JavaScript.

Cách xử lý bản trùng lặp

Các bản trùng lặp chính xác bị loại bỏ: https://example.com chỉ tính một lần dù xuất hiện bao nhiêu lần, còn Example.comexample.com vẫn là hai mục riêng biệt. Danh sách giữ thứ tự xuất hiện đầu tiên của mỗi URL.

Mẹo xử lý hậu kỳ

  • Chuyển về chữ thường để khử trùng lặp chuẩn. Nếu muốn Example.comexample.com tính là một máy chủ, hãy chuyển kết quả về chữ thường rồi khử trùng lặp lại.
  • Loại bỏ tham số theo dõi bằng công cụ dọn UTM trước khi lưu trữ, nếu không bạn sẽ có hàng chục bản gần giống nhau.
  • Kiểm tra trạng thái. Đưa danh sách qua công cụ kiểm tra liên kết hỏng để loại bỏ lỗi 404 trước khi chốt danh sách.

Câu hỏi thường gặp

Chỉ khi liên kết rút gọn được viết kèm giao thức đầy đủ. Riêng bit.ly/xyz sẽ không được nhận, nhưng https://bit.ly/xyz được xử lý như một URL thông thường. Công cụ không theo các chuyển hướng; hãy xử lý riêng nếu bạn cần đích cuối cùng.

Có, khi href là một URL http:// hoặc https:// đầy đủ. Giá trị được trích ra sạch sẽ mà không có thẻ bao quanh; href tương đối không được nhận.

Chúng được giữ nguyên văn. Nếu muốn loại bỏ utm_* và các tham số theo dõi tương tự, hãy dùng công cụ lọc URL sau khi trích xuất.

Không. Văn bản được xử lý trong yêu cầu và nội dung không được lưu trữ hay ghi nhật ký.

Công cụ liên quan

Công cụ này có phiên bản bằng các ngôn ngữ khác