Thiết bị lọc CSV

Đôi khi bạn chỉ cần các dòng thuộc một quốc gia, một trạng thái hoặc một khách hàng cụ thể – chứ không phải toàn bộ dữ liệu xuất khẩu. Bộ lọc này sẽ đọc tệp CSV của bạn, nhận một chỉ số cột và một đoạn văn bản, sau đó chỉ trả về những dòng chứa đúng đoạn văn bản đó (khớp chuỗi con, không phân biệt chữ hoa chữ thường). Dòng tiêu đề vẫn được giữ nguyên, do đó kết quả đầu ra vẫn là một tệp CSV hợp lệ có thể dán trực tiếp vào bảng tính hoặc các công cụ khác.

Cách lọc tệp CSV

  1. 1

    Dán tệp CSV

    Hãy sử dụng ô chọn để chỉ cho bộ lọc biết hàng thứ 1 là tiêu đề hay hàng dữ liệu đầu tiên.

  2. 2

    Chọn cột

    Chỉ số dựa trên giá trị 1 của cột cần so khớp; ví dụ: `3` cho cột thứ ba.

  3. 3

    Nhập văn bản khớp

    Phép so sánh chuỗi hoàn toàn, không phân biệt chữ hoa và chữ thường. Nếu chuỗi trống thì tất cả các hàng sẽ được truyền qua mà không thay đổi.

  4. 4

    Chạy bộ lọc

    Các hàng trùng khớp được hiển thị theo thứ tự ban đầu; các hàng không trùng khớp sẽ bị loại bỏ. Phần tiêu đề (nếu có) luôn được giữ nguyên.

Chiến lược ghép nối và các ví dụ thực tiễn

Bộ lọc dùng hàm str_contains không phân biệt chữ hoa chữ thường trên cột mục tiêu, còn hàng tiêu đề thì luôn được giữ nguyên. Thiết kế này cố ý đơn giản – chỉ một toán tử, một cột, một chuỗi cần tìm – để kết quả vẫn dễ đoán ngay cả với những tệp xuất lộn xộn.

Ví dụ: lọc đơn hàng theo quốc gia

order_id customer country total
1001 Alice FR 42.00
1002 Bob DE 18.50
1003 Carla fr 91.75
1004 Dan ES 30.00

Lọc cột 3 với fr sẽ trả về các hàng 1001 và 1003, việc so khớp không phân biệt chữ hoa chữ thường, nên cả FR lẫn fr đều được giữ lại.

Mẹo nhỏ

  • Hãy chuẩn hóa trước nếu có thể. Chạy toLowerCase trên dữ liệu nguồn, hoặc cho dữ liệu đi qua một script làm sạch, để bộ lọc luôn có một cột nhất quán để xử lý.
  • Lọc nhiều lần nối tiếp. Bạn có thể chạy bộ lọc, sao chép kết quả, rồi lọc lại trên một cột khác để nối các điều kiện với nhau.
  • Với logic phức tạp, hãy chuyển sang SQL hoặc bảng tính. Công cụ này mạnh về việc cắt lát dữ liệu nhanh; các điều kiện ghép (country = FR AND total > 50) sẽ dễ xử lý hơn với bộ lọc của SQL hoặc Excel.

Các trường hợp đặc biệt

  • Những hàng có cột mục tiêu ngắn hơn dự kiến (CSV thiếu cột) sẽ được coi là trống ở cột đó, nên không khớp với giá trị khác rỗng.
  • Việc so khớp dựa trên chuỗi con: US sẽ khớp với United States, plusmusical. Nếu quá rộng, hãy dùng một chuỗi tìm kiếm cụ thể hơn hoặc chọn cột khác.
  • Dấu phẩy nằm trong ô có dấu ngoặc kép được giữ nguyên; trình phân tích sẽ phân tích trọn vẹn toàn bộ CSV trước khi kiểm tra cột mục tiêu.

Câu hỏi thường gặp

Không phải trực tiếp, bộ lọc thực hiện việc so sánh các chuỗi con trong văn bản. Đối với các khoảng giá trị, hãy mở tệp CSV trong bảng tính hoặc thực hiện truy vấn bằng SQL và sử dụng các toán tử so sánh phù hợp.

Không. Cả giá trị trong ô và văn bản tìm kiếm đều được viết hoa nhỏ trước khi so sánh; do đó, các giá trị FR, frFr đều khớp với cùng một hàng.

Hiện tại, bộ lọc chỉ hoạt động theo nguyên tắc bao gồm (giữ các dòng trùng khớp và loại bỏ các dòng còn lại). Để thực hiện loại trừ, hãy sử dụng công cụ hỗ trợ biểu thức regex hoặc biểu thức tương tự SQL, hoặc dùng kết quả từ chức năng “keep-matches” làm danh sách đen để loại bỏ những dòng này khỏi dữ liệu gốc.

Tệp CSV được gửi đến máy chủ của chúng tôi để chạy bộ lọc. Dữ liệu không được lưu trữ hay chia sẻ và không được thêm vào liên kết trang.

Công cụ liên quan

Công cụ này có phiên bản bằng các ngôn ngữ khác