Lấy email từ văn bản
Hãy dán một bản sao toàn bộ tin nhắn, một cột dữ liệu CSV, một chủ đề diễn đàn hoặc một đoạn HTML; công cụ trích xuất sẽ tự động thu thập mọi địa chỉ email mà nó có thể nhận diện được. Kết quả đầu ra đã được loại bỏ dữ liệu trùng lặp và sẵn sàng để nhập vào hệ thống quản lý mối quan hệ khách hàng (CRM) hoặc các công cụ kiểm tra thư không trả lời. Phương pháp khớp này áp dụng đúng với tập hợp thực tế của RFC 5322 (bao gồm địa chỉ dạng thêm dấu phẩy, dấu chấm trong phần địa chỉ cục bộ và dấu gạch nối trong tên miền), đồng thời tránh được các kết quả dương tính giả do các biểu thức chính quy đơn giản như a@b gây ra.
Cách trích xuất email từ văn bản
-
1
Dán nguồn của bạn
Chỉ cần thêm văn bản tự do, nhật ký, một trang HTML hoặc danh sách liên hệ đã xuất, bất kỳ nội dung nào chứa các mẫu `local@domain.tld`.
-
2
Thực thi công cụ trích xuất
regex sẽ quét các địa chỉ đầy đủ và bỏ qua dấu câu xung quanh chúng.
-
3
Xem lại số lượng
Bạn sẽ nhận được số lượng địa chỉ duy nhất được tìm thấy cùng với danh sách đầy đủ.
-
4
Sao chép danh sách
Sao chép vào bảng nhớ dưới dạng danh sách được phân tách bằng dòng mới, hoặc dán trực tiếp vào một cột trong bảng tính.
Điều gì được coi là một email hợp lệ?
Bộ trích xuất này tuân theo cấu trúc email thực tế thay vì tuân theo toàn bộ quy tắc ngữ pháp của RFC 5322, bởi vì quy tắc ngữ pháp đầy đủ cho phép sử dụng các địa chỉ mà không một hệ thống quản lý thư điện tử (MTA) hiện đại nào cũng chấp nhận (ví dụ: địa chỉ địa phương được đặt trong ngoặc kép kèm khoảng trắng, hoặc các bình luận trong ngoặc đơn). Dưới đây là phạm vi mà bộ khớp bao gồm:
| Thành phần mẫu | Được chấp nhận | Bị từ chối |
|---|---|---|
| Phần cục bộ | a-z 0-9 . _ % + - |
khoảng trắng, chuỗi trong dấu ngoặc kép, dấu ngoặc nhọn |
| Domain | a-z 0-9 . - |
nhãn có dấu chấm cuối và dấu gạch dưới |
| TLD | từ 2 chữ cái ASCII trở lên | TLD chỉ gồm số |
Các đầu vào bẩn phổ biến mà hệ thống xử lý
- Các địa chỉ được nối tiếp bởi
.hoặc,trong câu – dấu câu không được ghi lại. - Các email nằm trong các liên kết
mailto:, cấu trúc của chúng sẽ được tự động loại bỏ. - Các thực thể HTML như
@không được giải mã, vì vậy địa chỉ viết dưới dạnginfo@example.comsẽ không được nhận diện. - Các địa chỉ được bao trong
<dấu ngoặc nhọn>từ tiêu đề email.
Làm gì với kết quả đầu ra
- Kiểm tra khả năng gửi. Trước khi nhập danh sách, hãy chạy danh sách này qua một dịch vụ kiểm tra thư trả về, các danh sách thu thập thường chứa khoảng 10% địa chỉ không còn hoạt động.
- Sự đồng thuận: Việc một địa chỉ xuất hiện trong tài liệu không có nghĩa là người đó đã đồng ý cho phép liên hệ với họ. Hãy kiểm tra quy định của GDPR hoặc luật địa phương trước khi thực hiện bất kỳ hành động liên hệ nào.
- Loại bỏ trùng lặp cả ở phần cục bộ.
john@gmail.comvàj.ohn@gmail.comđều đến cùng một hộp thư trên Gmail; hãy chuẩn hóa các dấu chấm nếu bạn cần những danh tính thực sự duy nhất.
Câu hỏi thường gặp
Không. Bộ trích xuất nhắm đến các địa chỉ thực tế và có thể phân tích được. Hãy giải mã các dạng dữ liệu bị ẩn trước tiên, hoặc xử lý trước văn bản để thay thế [at] bằng @ và [dot] bằng ..
Không. Quá trình khớp chỉ đọc các chữ cái Latinh cơ bản, vì vậy müller@straße.de không được nhận diện. Hãy chuyển địa chỉ sang dạng ASCII punycode, ví dụ user@xn--strae-oqa.de, trước khi chạy bộ trích xuất.
Không, không có tùy chọn giữ lại các bản sao trùng nhau. Kết quả đầu ra đã được loại bỏ trùng lặp và giữ nguyên thứ tự xuất hiện đầu tiên. Nếu cần đếm số lần xuất hiện, hãy đếm trong văn bản nguồn.
Không. Văn bản được xử lý cho yêu cầu của bạn, không được lưu vào cơ sở dữ liệu, không được ghi vào nhật ký và không được thêm vào liên kết trang.
Công cụ liên quan
Công cụ đếm từ
Đếm số từ, ký tự, câu và đoạn văn kèm thời gian đọc, thời gian nói, mật độ từ khóa và điểm dễ đọc Flesch cho bài luận, bài đăng, chú thích và meta description.
Ký hiệu mũi tên để sao chép
Sao chép các mũi tên Unicode phổ biến chỉ với một lần nhấp: thẳng, đôi, chéo, móc, vòng và tam giác cho tài liệu, chat và thiết kế.
Ký hiệu nhỏ hơn hoặc bằng
Sao chép ký hiệu ≤ cùng các ký hiệu so sánh toán học liên quan. Bao gồm Unicode, thực thể HTML và cú pháp LaTeX cho bảng tính, tài liệu nghiên cứu và trang web.
Trình dịch chữ nổi Braille
Dịch văn bản sang chữ nổi Braille Unicode cấp 1 và giải mã Braille trở lại thành chữ cái. Xử lý chữ hoa, chữ số và dấu câu.
Trình giải đảo chữ
Nhập tối đa 10 chữ cái để xem mọi cách sắp xếp duy nhất của chúng, với các hoán vị trùng lặp bị loại bỏ và danh sách giới hạn ở 200 kết quả.
Trình tạo chữ meme
Thêm chú thích meme cổ điển vào mẫu có sẵn hoặc ảnh của bạn. Nhập chữ trên và dưới, chỉnh phông, màu, viền rồi tải xuống hoặc sao chép PNG.
Công cụ này có phiên bản bằng các ngôn ngữ khác
- Ekstrak email dari teks [ID]
- ดึงอีเมลจากข้อความ [TH]
- Extrahera e-postadresser från text [SV]
- Extraer correos electrónicos del texto [ES]
- E-Mails aus Text extrahieren [DE]
- E-mails uit tekst halen [NL]
- 텍스트에서 이메일 추출 [KO]
- Wyodrębnianie adresów e-mail z tekstu [PL]
- Metinden E-posta Çıkarma [TR]
- استخراج الرسائل الإلكترونية من النص [AR]
- Extraire des e-mails à partir de texte [FR]
- テキストからメールアドレスを抽出 [JA]
- Extrair Emails do Texto [PT]
- 从文本中提取电子邮件 [ZH]
- Extract Emails from Text [EN]
- Estrai Email dal Testo [IT]
- Извлечение email из текста [RU]