An toàn không phải tính năng phụ
Sản phẩm multimodal mở ra bề mặt rủi ro lớn hơn nhiều so với text: người dùng có thể tải lên hình ảnh độc hại, giọng nói giả mạo, hoặc dùng ảnh để "vượt rào" (jailbreak) các quy tắc mà bộ lọc text bỏ sót. Một chỉ dẫn nguy hiểm giấu trong ảnh (prompt injection qua hình) có thể qua mặt kiểm duyệt nếu bạn chỉ lọc text. An toàn là yêu cầu bắt buộc, không phải "nice to have".
Kiểm duyệt nhiều lớp (defense in depth)
Một hệ kiểm duyệt tốt có nhiều lớp:
- Lọc đầu vào (input moderation): quét ảnh, audio, text người dùng gửi lên trước khi vào mô hình chính - phát hiện nội dung khiêu dâm, bạo lực, thông tin cá nhân nhạy cảm (PII).
- Ràng buộc mô hình (system prompt + policy): hướng dẫn mô hình từ chối yêu cầu vi phạm.
- Lọc đầu ra (output moderation): quét kết quả mô hình sinh ra (kể cả ảnh/audio sinh) trước khi hiển thị.
- Con người trong vòng lặp (human-in-the-loop): với ca rủi ro cao hoặc mô hình không chắc chắn, chuyển cho người duyệt.
PII và quyền riêng tư
Ảnh và audio thường vô tình chứa dữ liệu nhạy cảm: khuôn mặt người ngoài, biển số xe, số căn cước, giọng nói định danh. PM cần:
- Quy định rõ lưu gì, lưu bao lâu, ai truy cập được.
- Che (redact) PII khi hiển thị hoặc lưu log.
- Xin đồng ý (consent) rõ ràng khi thu thập giọng nói/khuôn mặt.
- Tuân thủ pháp lý (như quy định bảo vệ dữ liệu cá nhân).
Fairness: công bằng giữa các nhóm người dùng
Mô hình multimodal dễ thiên vị (bias) vì dữ liệu huấn luyện không cân bằng:
- Vision: nhận diện kém hơn với một số tông màu da hoặc bối cảnh.
- Audio: WER cao hơn với accent vùng miền, giọng nữ/nam, người lớn tuổi.
- Text: liên tưởng khuôn mẫu (stereotype) theo giới, vùng miền.
- Xác định nhóm nhạy cảm liên quan đến sản phẩm (giới tính, vùng miền/accent, độ tuổi, tông da...).
- Đo hiệu năng theo từng nhóm (nối với eval theo slice ở Bài 3) - không chỉ nhìn số trung bình.
- Đặt ngưỡng chênh lệch chấp nhận được giữa nhóm tốt nhất và tệ nhất.
- Hành động khi lệch: bổ sung dữ liệu nhóm yếu, điều chỉnh tiền xử lý, hoặc thu hẹp phạm vi ra mắt.
Ví dụ cụ thể
App điểm danh bằng nhận diện khuôn mặt hoạt động tốt tổng thể (98%) nhưng khi PM chia slice, phát hiện tỷ lệ nhận sai cao hơn hẳn với người dùng lớn tuổi và trong điều kiện thiếu sáng. Hành động: bổ sung dữ liệu đa dạng hơn, thêm hướng dẫn ánh sáng, và luôn có phương án dự phòng (nhập mã) để không ai bị khóa ngoài chỉ vì bias. Đây là fairness thực tế, không phải khẩu hiệu.
Checklist an toàn và fairness
- [ ] Có lọc đầu vào và đầu ra cho MỌI modality (không chỉ text) chưa?
- [ ] Có xử lý PII trong ảnh/audio (redact, consent, chính sách lưu trữ) chưa?
- [ ] Đã xác định nhóm nhạy cảm và đo hiệu năng theo nhóm chưa?
- [ ] Có ngưỡng chênh lệch fairness và kế hoạch hành động khi vượt ngưỡng không?
- [ ] Có phương án dự phòng để không ai bị chặn oan do lỗi mô hình?
- [ ] Có kênh cho người dùng khiếu nại/báo cáo kết quả sai không?
Sai lầm thường gặp
- Chỉ lọc text: bỏ qua rủi ro giấu trong ảnh/audio (prompt injection qua hình, nội dung độc trong ảnh).
- Chỉ nhìn accuracy trung bình: bỏ sót nhóm bị phục vụ tệ - đây là gốc rễ của bất công.
- Xem fairness là việc cuối cùng: chỉ kiểm tra khi bị báo chí/khách hàng phản ánh, lúc đó đã muộn.
- Không có fallback: khi mô hình từ chối hoặc nhận sai, người dùng bị kẹt hoàn toàn.
- Thu thập PII không consent: rủi ro pháp lý và mất niềm tin nghiêm trọng.
Tổng kết
An toàn và fairness là trách nhiệm cốt lõi của AI PM, càng quan trọng với multimodal vì bề mặt rủi ro rộng. Hãy kiểm duyệt nhiều lớp cho mọi modality, bảo vệ PII, đo fairness theo nhóm và luôn có fallback để không ai bị tổn hại vì lỗi mô hình.