Trích xuất URL từ văn bản
Dán nhật ký trò chuyện, tài liệu Markdown, chuỗi email hoặc bản HTML thô, bạn sẽ nhận được danh sách sạch gồm mọi liên kết http:// và https:// có trong đó. Công cụ bỏ dấu câu cuối, xử lý cú pháp liên kết Markdown và HTML, đồng thời loại bỏ các bản trùng lặp chính xác, để bạn có thể chuyển thẳng danh sách vào trình thu thập dữ liệu hoặc công cụ lưu trữ.
Cách trích xuất URL
-
1
Dán nguồn
Nhập văn bản hoặc HTML. Dấu ngoặc kép, dấu ngoặc góc, cú pháp liên kết Markdown và dấu câu cuối được xử lý tự động.
-
2
Chạy quét
Mọi liên kết `http://` và `https://` được tìm thấy, dấu câu cuối được bỏ đi và các bản trùng lặp chính xác bị loại bỏ.
-
3
Xem lại số lượng
Bạn thấy có bao nhiêu URL duy nhất được tìm thấy cùng danh sách đầy đủ.
-
4
Sao chép hoặc xuất
Mỗi dòng một URL, sẵn sàng dùng với `curl -I`, công cụ lưu trữ, dịch vụ chụp màn hình hoặc danh sách hạt giống Screaming Frog.
Điều gì được coi là URL?
Việc phát hiện URL khó hơn vẻ bề ngoài, và công cụ này cố tình tuân theo một quy tắc an toàn duy nhất: nó chỉ nhận các liên kết đầy đủ dạng http:// và https://. Mọi thứ khác vẫn nằm lại trong văn bản của bạn.
Các dạng được nhận diện
| Dạng | Ví dụ |
|---|---|
| HTTPS tuyệt đối | https://example.com/path?q=1 |
| HTTP tuyệt đối | http://example.com |
| Đích của liên kết Markdown | [text](https://example.com) |
| href tuyệt đối trong HTML | href="https://example.com" |
Quy tắc cắt bỏ
Dấu câu cuối bị bỏ đi, nên (https://example.com). trở thành https://example.com. Khoảng trắng, dấu ngoặc kép, dấu ngoặc góc, dấu ngoặc tròn, dấu ngoặc vuông, dấu phẩy và dấu chấm phẩy đều dừng việc tìm kiếm. URL chứa dấu ngoặc sẽ bị cắt tại dấu ngoặc mở đầu tiên, nên một tiêu đề kiểu Wikipedia chỉ được lấy đến dấu ngoặc mở mà thôi.
Những gì bị bỏ qua
mailto:,tel:,ftp:và mọi giao thức khác không phảihttphoặchttps.- Liên kết tương đối theo giao thức như
//cdn.example.com/asset.js. - Tên miền trần và địa chỉ có tiền tố
www.nhưng không có giao thức, nhưexample.com/docs/introhoặcwww.example.com/page. - Các đoạn chỉ có neo như
#sectionvà URL giả kiểu JavaScript.
Cách xử lý bản trùng lặp
Các bản trùng lặp chính xác bị loại bỏ: https://example.com chỉ tính một lần dù xuất hiện bao nhiêu lần, còn Example.com và example.com vẫn là hai mục riêng biệt. Danh sách giữ thứ tự xuất hiện đầu tiên của mỗi URL.
Mẹo xử lý hậu kỳ
- Chuyển về chữ thường để khử trùng lặp chuẩn. Nếu muốn
Example.comvàexample.comtính là một máy chủ, hãy chuyển kết quả về chữ thường rồi khử trùng lặp lại. - Loại bỏ tham số theo dõi bằng công cụ dọn UTM trước khi lưu trữ, nếu không bạn sẽ có hàng chục bản gần giống nhau.
- Kiểm tra trạng thái. Đưa danh sách qua công cụ kiểm tra liên kết hỏng để loại bỏ lỗi 404 trước khi chốt danh sách.
Câu hỏi thường gặp
Chỉ khi liên kết rút gọn được viết kèm giao thức đầy đủ. Riêng bit.ly/xyz sẽ không được nhận, nhưng https://bit.ly/xyz được xử lý như một URL thông thường. Công cụ không theo các chuyển hướng; hãy xử lý riêng nếu bạn cần đích cuối cùng.
Có, khi href là một URL http:// hoặc https:// đầy đủ. Giá trị được trích ra sạch sẽ mà không có thẻ bao quanh; href tương đối không được nhận.
Chúng được giữ nguyên văn. Nếu muốn loại bỏ utm_* và các tham số theo dõi tương tự, hãy dùng công cụ lọc URL sau khi trích xuất.
Không. Văn bản được xử lý trong yêu cầu và nội dung không được lưu trữ hay ghi nhật ký.
Công cụ liên quan
Công cụ đếm từ
Đếm số từ, ký tự, câu và đoạn văn kèm thời gian đọc, thời gian nói, mật độ từ khóa và điểm dễ đọc Flesch cho bài luận, bài đăng, chú thích và meta description.
Ký hiệu mũi tên để sao chép
Sao chép các mũi tên Unicode phổ biến chỉ với một lần nhấp: thẳng, đôi, chéo, móc, vòng và tam giác cho tài liệu, chat và thiết kế.
Ký hiệu nhỏ hơn hoặc bằng
Sao chép ký hiệu ≤ cùng các ký hiệu so sánh toán học liên quan. Bao gồm Unicode, thực thể HTML và cú pháp LaTeX cho bảng tính, tài liệu nghiên cứu và trang web.
Trình dịch chữ nổi Braille
Dịch văn bản sang chữ nổi Braille Unicode cấp 1 và giải mã Braille trở lại thành chữ cái. Xử lý chữ hoa, chữ số và dấu câu.
Trình giải đảo chữ
Nhập tối đa 10 chữ cái để xem mọi cách sắp xếp duy nhất của chúng, với các hoán vị trùng lặp bị loại bỏ và danh sách giới hạn ở 200 kết quả.
Trình tạo chữ meme
Thêm chú thích meme cổ điển vào mẫu có sẵn hoặc ảnh của bạn. Nhập chữ trên và dưới, chỉnh phông, màu, viền rồi tải xuống hoặc sao chép PNG.
Công cụ này có phiên bản bằng các ngôn ngữ khác
- Extraire des URL du texte [FR]
- 텍스트에서 URL을 추출합니다 [KO]
- استخراج عناوين URL من النص [AR]
- Extrahera URL:er från text [SV]
- URLs aus Text extrahieren [DE]
- Extraer URLs del Texto [ES]
- ดึง URL จากข้อความ [TH]
- Ekstrak URL dari Teks [ID]
- テキストからURL抽出 [JA]
- URL's extraheren uit tekst [NL]
- Wydobywanie URL-ów z tekstu [PL]
- Extrair URLs do Texto [PT]
- Extract URLs from Text [EN]
- Estrai URL dal testo [IT]
- Извлечение URL из текста [RU]
- Metinden URL'leri Çıkarma [TR]
- 从文本中提取 URL [ZH]