Product Management
Đăng nhập
ESC

Nhập từ khóa để tìm kiếm

↑↓ Di chuyển
Enter Mở
ESC Đóng

Bài 5 — Dữ liệu bẩn: kẻ giết dự án thầm lặng

Sự thật phũ phàng

70% thời gian của một dự án AI doanh nghiệp không nằm ở việc train model — nó nằm ở việc tìm, làm sạch và hiểu dữ liệu khách hàng. Khách thường tin dữ liệu của họ "sạch và đầy đủ". Gần như không bao giờ đúng. Nhiệm vụ của AI Solutions PM là phát hiện điều này trước khi cam kết, không phải sau khi model cho kết quả tệ.

Bảy loại bẩn thường gặp

  • Thiếu (missing): field trống, bản ghi rỗng.
  • Sai định dạng: ngày tháng lẫn lộn dd/mm và mm/dd, số điện thoại đủ kiểu.
  • Trùng lặp (duplicate): một khách hàng ba bản ghi khác tên.
  • Không nhất quán: "HCM", "TP.HCM", "Sài Gòn", "Hồ Chí Minh" là cùng một nơi.
  • Nhãn sai (label noise): dữ liệu huấn luyện được gán nhãn ẩu — độc hại nhất, vì model học điều sai.
  • Lệch phân phối (bias/skew): 95% mẫu là một loại, model mù với phần còn lại.
  • Rò rỉ nhãn (data leakage): field vô tình chứa đáp án, làm POC đẹp giả tạo rồi sập ở production.

Khung "Data Readiness" — chấm điểm trước khi nhận dự án

Chấm 5 trục, mỗi trục 1–3 điểm:

  • Availability: dữ liệu có tồn tại và truy cập được không?
  • Volume: đủ lượng để học mẫu không? (bài toán khác nhau cần lượng khác nhau)
  • Quality: mức độ bẩn ước lượng?
  • Labeling: đã có nhãn đúng chưa, hay phải gán mới?
  • Access rights: có quyền hợp pháp để dùng dữ liệu này train model không?
Tổng thấp = đỏ. Đừng ký production, hãy đề xuất một giai đoạn khảo sát dữ liệu (data assessment) có tính phí trước.

Ví dụ cụ thể

Khách viễn thông muốn "AI dự đoán khách rời mạng (churn)". Khảo sát dữ liệu phát hiện:

  • Nhãn "đã rời mạng" chỉ được cập nhật thủ công, trễ 2 tháng → nhãn nhiễu.
  • Field "lý do rời" có 40% giá trị "khác" → gần vô dụng.
  • Có một field "ngày hủy hợp đồng" → rò rỉ nhãn kinh điển: nếu có ngày hủy nghĩa là đã churn, model "đoán" 100% nhưng vô nghĩa khi dự báo tương lai.
Phát hiện sớm ba điều này cứu dự án khỏi thất bại và giúp báo giá đúng công sức làm sạch.

Chiến lược xử lý

  • Đưa data assessment thành giai đoạn tính phí riêng. Bạn không làm miễn phí phần chiếm 70% công sức.
  • Yêu cầu SME của khách ngồi cùng để giải nghĩa field và xác nhận nhãn.
  • Xây pipeline làm sạch tái sử dụng được (chuẩn hóa địa danh, ngày tháng) — biến việc bẩn thành tài sản chuẩn hóa (nối lại bài 2).
  • Kiểm tra rò rỉ nhãn bằng cách hỏi: "Field này có tồn tại tại thời điểm cần dự đoán không?" Nếu không → loại bỏ.
  • Thiết lập vòng phản hồi: dữ liệu bẩn được sửa dần khi model chạy thật (data flywheel).

Checklist thẩm định dữ liệu

  • [ ] Đã xem MẪU dữ liệu thật, không chỉ nghe mô tả?
  • [ ] Đã chấm 5 trục Data Readiness?
  • [ ] Đã kiểm tra rò rỉ nhãn?
  • [ ] Nhãn có đáng tin, ai gán và khi nào?
  • [ ] Có quyền pháp lý dùng dữ liệu để train?
  • [ ] Data assessment đã được tính vào báo giá?

Sai lầm thường gặp

  • Tin lời khách 'dữ liệu em sạch lắm' mà không xem mẫu thật.
  • Bỏ qua rò rỉ nhãn, để POC đẹp giả rồi production sập.
  • Làm sạch dữ liệu miễn phí, ăn mòn lợi nhuận và thời gian.
  • Không kéo SME vào, dẫn tới hiểu sai ý nghĩa field và nhãn.
  • Coi nhãn ẩu là 'chấp nhận được' — model học từ nhãn sai sẽ sai một cách tự tin.
Dữ liệu sạch rồi vẫn còn một lớp phải lo: ai được thấy dữ liệu, ai sở hữu model — bài 6.

Học xong bài này rồi? Tạo tài khoản miễn phí để lưu lại — lần sau vào là biết ngay đang dở ở đâu, và học hết khóa thì có chứng chỉ. Lưu tiến độ của tôi