Lấy email từ văn bản

Hãy dán một bản sao toàn bộ tin nhắn, một cột dữ liệu CSV, một chủ đề diễn đàn hoặc một đoạn HTML; công cụ trích xuất sẽ tự động thu thập mọi địa chỉ email mà nó có thể nhận diện được. Kết quả đầu ra đã được loại bỏ dữ liệu trùng lặp và sẵn sàng để nhập vào hệ thống quản lý mối quan hệ khách hàng (CRM) hoặc các công cụ kiểm tra thư không trả lời. Phương pháp khớp này áp dụng đúng với tập hợp thực tế của RFC 5322 (bao gồm địa chỉ dạng thêm dấu phẩy, dấu chấm trong phần địa chỉ cục bộ và dấu gạch nối trong tên miền), đồng thời tránh được các kết quả dương tính giả do các biểu thức chính quy đơn giản như a@b gây ra.

Cách trích xuất email từ văn bản

  1. 1

    Dán nguồn của bạn

    Chỉ cần thêm văn bản tự do, nhật ký, một trang HTML hoặc danh sách liên hệ đã xuất, bất kỳ nội dung nào chứa các mẫu `local@domain.tld`.

  2. 2

    Thực thi công cụ trích xuất

    regex sẽ quét các địa chỉ đầy đủ và bỏ qua dấu câu xung quanh chúng.

  3. 3

    Xem lại số lượng

    Bạn sẽ nhận được số lượng địa chỉ duy nhất được tìm thấy cùng với danh sách đầy đủ.

  4. 4

    Sao chép danh sách

    Sao chép vào bảng nhớ dưới dạng danh sách được phân tách bằng dòng mới, hoặc dán trực tiếp vào một cột trong bảng tính.

Điều gì được coi là một email hợp lệ?

Bộ trích xuất này tuân theo cấu trúc email thực tế thay vì tuân theo toàn bộ quy tắc ngữ pháp của RFC 5322, bởi vì quy tắc ngữ pháp đầy đủ cho phép sử dụng các địa chỉ mà không một hệ thống quản lý thư điện tử (MTA) hiện đại nào cũng chấp nhận (ví dụ: địa chỉ địa phương được đặt trong ngoặc kép kèm khoảng trắng, hoặc các bình luận trong ngoặc đơn). Dưới đây là phạm vi mà bộ khớp bao gồm:

Thành phần mẫu Được chấp nhận Bị từ chối
Phần cục bộ a-z 0-9 . _ % + - khoảng trắng, chuỗi trong dấu ngoặc kép, dấu ngoặc nhọn
Domain a-z 0-9 . - nhãn có dấu chấm cuối và dấu gạch dưới
TLD từ 2 chữ cái ASCII trở lên TLD chỉ gồm số

Các đầu vào bẩn phổ biến mà hệ thống xử lý

  • Các địa chỉ được nối tiếp bởi . hoặc , trong câu – dấu câu không được ghi lại.
  • Các email nằm trong các liên kết mailto:, cấu trúc của chúng sẽ được tự động loại bỏ.
  • Các thực thể HTML như @ không được giải mã, vì vậy địa chỉ viết dưới dạng info@example.com sẽ không được nhận diện.
  • Các địa chỉ được bao trong <dấu ngoặc nhọn> từ tiêu đề email.

Làm gì với kết quả đầu ra

  • Kiểm tra khả năng gửi. Trước khi nhập danh sách, hãy chạy danh sách này qua một dịch vụ kiểm tra thư trả về, các danh sách thu thập thường chứa khoảng 10% địa chỉ không còn hoạt động.
  • Sự đồng thuận: Việc một địa chỉ xuất hiện trong tài liệu không có nghĩa là người đó đã đồng ý cho phép liên hệ với họ. Hãy kiểm tra quy định của GDPR hoặc luật địa phương trước khi thực hiện bất kỳ hành động liên hệ nào.
  • Loại bỏ trùng lặp cả ở phần cục bộ. john@gmail.comj.ohn@gmail.com đều đến cùng một hộp thư trên Gmail; hãy chuẩn hóa các dấu chấm nếu bạn cần những danh tính thực sự duy nhất.

Câu hỏi thường gặp

Không. Bộ trích xuất nhắm đến các địa chỉ thực tế và có thể phân tích được. Hãy giải mã các dạng dữ liệu bị ẩn trước tiên, hoặc xử lý trước văn bản để thay thế [at] bằng @[dot] bằng ..

Không. Quá trình khớp chỉ đọc các chữ cái Latinh cơ bản, vì vậy müller@straße.de không được nhận diện. Hãy chuyển địa chỉ sang dạng ASCII punycode, ví dụ user@xn--strae-oqa.de, trước khi chạy bộ trích xuất.

Không, không có tùy chọn giữ lại các bản sao trùng nhau. Kết quả đầu ra đã được loại bỏ trùng lặp và giữ nguyên thứ tự xuất hiện đầu tiên. Nếu cần đếm số lần xuất hiện, hãy đếm trong văn bản nguồn.

Không. Văn bản được xử lý cho yêu cầu của bạn, không được lưu vào cơ sở dữ liệu, không được ghi vào nhật ký và không được thêm vào liên kết trang.

Công cụ liên quan

Công cụ này có phiên bản bằng các ngôn ngữ khác