Vì sao chỉ số cũ không còn đủ
Với chatbot, người ta đo "độ chính xác câu trả lời". Với agent, thứ đó gần như vô nghĩa — vì agent phải hoàn thành cả một tác vụ nhiều bước. Một agent có thể trả lời đúng ở mỗi bước nhưng vẫn không hoàn thành việc. Agentic AI PM phải đo kết quả cuối (outcome), không phải từng câu chữ.
Chỉ số Bắc Đẩu: Task Completion Rate
Task Completion Rate (TCR) = số tác vụ hoàn thành đúng end-to-end / tổng số tác vụ giao. Đây là chỉ số quan trọng nhất. Nhưng "hoàn thành đúng" phải được định nghĩa cụ thể và kiểm chứng được:
- Với "đặt lịch họp": xong = sự kiện được tạo, đúng người, đúng giờ, các bên nhận lời mời.
- Với "phân loại ticket": xong = ticket được gán đúng nhãn theo chuẩn của con người.
Bộ chỉ số cân bằng cho agent
Chỉ nhìn TCR là chưa đủ. Một agent có thể hoàn thành 95% nhưng đốt tiền và làm khách ức chế. Hãy theo dõi 5 nhóm:
- Chất lượng: TCR, tỷ lệ đúng (accuracy), tỷ lệ cần con người sửa (intervention rate).
- Hiệu quả: số bước/tool trung bình mỗi tác vụ, độ trễ end-to-end.
- Chi phí: token/tiền trên mỗi tác vụ hoàn thành (không phải trên mỗi lời gọi).
- An toàn: tỷ lệ hành động sai nghiêm trọng, tỷ lệ escalate đúng lúc.
- Niềm tin người dùng: tỷ lệ chấp nhận đề xuất, CSAT, tỷ lệ quay lại dùng.
Đo quá trình, không chỉ kết quả
Khi agent làm sai, bạn cần biết sai ở bước nào. Hãy log trace đầy đủ: mỗi bước suy luận, tool được gọi, tham số, kết quả trả về. Trace giúp bạn:
- Tìm bước hay gãy (ví dụ 60% lỗi nằm ở bước tra cứu đơn).
- Phân biệt lỗi model (suy luận sai) vs lỗi tool (API hỏng) vs lỗi dữ liệu (input bẩn).
- Xây dashboard "funnel" xem tác vụ rụng ở đâu trong chuỗi.
Ví dụ đọc số như một PM
Agent hỗ trợ có TCR 82%. Bóc tách:
- 10% rụng ở bước xác minh danh tính (tool KYC chậm/timeout) → lỗi tool, sửa hạ tầng.
- 5% agent hiểu sai ý khách → lỗi model, cần cải thiện prompt/ví dụ.
- 3% khách bỏ giữa chừng → vấn đề trải nghiệm, không phải năng lực agent.
Khung "đo lường trước khi mở rộng"
- Đã định nghĩa "xong đúng" kiểm chứng được chưa?
- Có golden set để chấm điểm hồi quy khi cập nhật model không?
- Đang đo chi phí trên mỗi tác vụ hoàn thành chưa (không phải mỗi call)?
- Có trace đầy đủ để bóc tách nguyên nhân lỗi không?
- Có baseline con người để so sánh không?
Sai lầm thường gặp
- Đo accuracy từng câu thay vì task completion end-to-end.
- Quên chi phí và độ trễ, chỉ khoe tỷ lệ hoàn thành.
- Không log trace, khi lỗi thì mò kim đáy bể.
- Không có golden set, cập nhật model xong không biết tốt lên hay tệ đi.
- Thiếu baseline con người, không biết agent thật sự có đáng dùng không.
Checklist kết bài
- [ ] Tôi định nghĩa "xong đúng" một cách kiểm chứng được.
- [ ] Tôi theo dõi bộ chỉ số cân bằng: chất lượng, hiệu quả, chi phí, an toàn, niềm tin.
- [ ] Tôi đo chi phí trên mỗi tác vụ hoàn thành.
- [ ] Tôi log trace để bóc tách lỗi model / tool / dữ liệu.