Trình loại trùng dữ liệu CSV

Các bản sao trùng lặp có thể xuất hiện trong các tệp CSV theo những cách gây phiền toái: việc gửi dữ liệu qua webhook nhiều lần, hai báo cáo được nối lại thủ công, hoặc một phép kết hợp khiến các hàng bị phân tán theo cách không mong muốn. Công cụ loại bỏ bản sao này sẽ tạo mã hash cho mỗi hàng dữ liệu và chỉ giữ lại lần xuất hiện đầu tiên, nhờ đó kết quả đầu ra vẫn giữ đúng thứ tự các hàng ban đầu mà không hiển thị các bản sao thừa. Hàng tiêu đề là tùy chọn – hãy bật hoặc tắt tùy chọn này nếu tệp của bạn bắt đầu ngay từ phần dữ liệu.

Cách thức hoạt động của chức năng loại bỏ dữ liệu trùng lặp

  1. 1

    Dán tệp CSV

    Hãy chọn hoặc loại bỏ hàng tiêu đề; sử dụng ô đánh dấu để chỉ định cho công cụ biết điều này.

  2. 2

    Mỗi hàng đều được tạo bản mã hóa (hash).

    Các hàng được chuyển đổi thành mảng, và giá trị MD5 của biểu diễn JSON tương ứng được sử dụng làm khóa duy nhất.

  3. 3

    Lần xuất hiện đầu tiên được giữ lại

    Dòng đầu tiên có giá trị hash nhất định sẽ được giữ lại; các dòng tiếp theo có cùng nội dung sẽ bị bỏ qua một cách tự động.

  4. 4

    Tiêu đề được giữ nguyên

    Nếu chế độ tiêu đề được bật, hàng thứ 1 luôn được truyền qua mà không bị loại bỏ dữ liệu trùng lặp so với các dữ liệu khác.

Điều gì được coi là bản sao?

Bộ loại bỏ dữ liệu trùng lặp sử dụng nguyên tắc bằng nhau giữa toàn bộ các hàng. Hai hàng được coi là trùng nhau khi mọi ô trong chúng đều trùng khớp với nhau từng vị trí sau khi phân tích định dạng CSV tiêu chuẩn.

Những điều vẫn được coi là khác biệt

Dãy A Dãy B Xem như
Alice,30,Paris Alice, 30, Paris Khác nhau (có thêm khoảng trắng)
Bob,25 Bob,25, Khác nhau (ô trống ở cuối)
"Jane Smith",42 Jane Smith,42 Giống nhau (việc trích dẫn được xử lý ở cấp độ phân tích)
TRUE,1 true,1 Khác nhau (phân biệt chữ hoa chữ thường)

Khi việc loại bỏ dữ liệu trùng lặp ở cấp độ cột phù hợp hơn

Việc khớp toàn bộ hàng rất nghiêm ngặt – điều này thường là yêu cầu mong muốn; tuy nhiên, đôi khi bạn thực sự cần “một hàng cho mỗi email, bất kể các cột khác”. Trong trường hợp đó, hãy sử dụng công cụ Trích Xuất Cột CSV để rút gọn tệp chỉ còn cột khóa, loại bỏ dữ liệu trùng lặp, sau đó dùng kết quả làm cơ sở tra cứu. Hoặc bạn có thể sử dụng các truy vấn SQL như SELECT DISTINCT ON (email) * FROM users ORDER BY email, created_at DESC; trong PostgreSQL, hoặc GROUP BY kết hợp với các giá trị tổng hợp từ MIN() ở những vị trí khác.

Những mẹo thực tế

  • Hãy chuẩn hóa dữ liệu trước khi thực hiện loại bỏ dữ liệu trùng lặp: Trước tiên, hãy cắt bỏ các khoảng trắng và thống nhất cách viết chữ hoa/chữ thường ở các cột chính; nếu không, cả hai giá trị ALICE@EXAMPLE.COMalice@example.com đều sẽ còn tồn tại.
  • Sắp xếp dữ liệu sau đó loại bỏ bản sao trùng để thu được kết quả có thể kiểm toán được. Nếu cần biết bản sao nào đã được lưu lại, hãy sắp xếp tệp CSV theo tiêu chí phân biệt ưu tiên của bạn (thời điểm ghi nhận gần nhất hoặc mã định danh thấp nhất) trước khi chạy công cụ loại bỏ bản sao trùng.
  • Kiểm tra số hàng: Sử dụng công cụ đếm hàng trong tệp CSV trên cả tệp gốc và tệp đầu ra để xác nhận đã loại bỏ bao nhiêu bản sao trùng.

Câu hỏi thường gặp

Không, công cụ này thực hiện xử lý hash trên toàn bộ các hàng đã được phân tích. Để đảm bảo tính duy nhất ở từng cột riêng biệt, hãy trước tiên thu hẹp dữ liệu CSV chỉ còn cột đó bằng công cụ Trích Xuất Cột CSV, sau đó mới chạy công cụ loại bỏ dữ liệu trùng lặp.

Lần xuất hiện đầu tiên trong tệp. Hãy sắp xếp các bản ghi CSV trước khi thực hiện nếu bạn muốn lựa chọn bản sao cụ thể (bản ghi mới nhất, bản ghi có ID thấp nhất, v.v.).

Đúng vậy. Các hàng được xử lý theo các quy tắc CSV tiêu chuẩn; do đó, "Jane, Smith" vẫn là một ô duy nhất và được so sánh như vậy.

Tệp CSV được gửi đến máy chủ của chúng tôi để tính toán việc loại bỏ dữ liệu trùng lặp. Dữ liệu không được lưu trữ hay chia sẻ và không được thêm vào liên kết trang.

Công cụ liên quan

Công cụ này có phiên bản bằng các ngôn ngữ khác