Product Management
Đăng nhập
ESC

Nhập từ khóa để tìm kiếm

↑↓ Di chuyển
Enter Mở
ESC Đóng

Bài 5 — Đo lường: Task Completion và các chỉ số agent thật sự cần

Vì sao chỉ số cũ không còn đủ

Với chatbot, người ta đo "độ chính xác câu trả lời". Với agent, thứ đó gần như vô nghĩa — vì agent phải hoàn thành cả một tác vụ nhiều bước. Một agent có thể trả lời đúng ở mỗi bước nhưng vẫn không hoàn thành việc. Agentic AI PM phải đo kết quả cuối (outcome), không phải từng câu chữ.

Chỉ số Bắc Đẩu: Task Completion Rate

Task Completion Rate (TCR) = số tác vụ hoàn thành đúng end-to-end / tổng số tác vụ giao. Đây là chỉ số quan trọng nhất. Nhưng "hoàn thành đúng" phải được định nghĩa cụ thể và kiểm chứng được:

  • Với "đặt lịch họp": xong = sự kiện được tạo, đúng người, đúng giờ, các bên nhận lời mời.
  • Với "phân loại ticket": xong = ticket được gán đúng nhãn theo chuẩn của con người.
Mẹo PM: định nghĩa "xong" trước khi xây, và tạo bộ test cases (golden set) để chấm điểm tự động lẫn thủ công.

Bộ chỉ số cân bằng cho agent

Chỉ nhìn TCR là chưa đủ. Một agent có thể hoàn thành 95% nhưng đốt tiền và làm khách ức chế. Hãy theo dõi 5 nhóm:

  • Chất lượng: TCR, tỷ lệ đúng (accuracy), tỷ lệ cần con người sửa (intervention rate).
  • Hiệu quả: số bước/tool trung bình mỗi tác vụ, độ trễ end-to-end.
  • Chi phí: token/tiền trên mỗi tác vụ hoàn thành (không phải trên mỗi lời gọi).
  • An toàn: tỷ lệ hành động sai nghiêm trọng, tỷ lệ escalate đúng lúc.
  • Niềm tin người dùng: tỷ lệ chấp nhận đề xuất, CSAT, tỷ lệ quay lại dùng.
Một agent "tốt" là điểm cân bằng, không phải tối đa một chỉ số. TCR 99% nhưng chi phí gấp 10 lần con người thì sản phẩm thất bại.

Đo quá trình, không chỉ kết quả

Khi agent làm sai, bạn cần biết sai ở bước nào. Hãy log trace đầy đủ: mỗi bước suy luận, tool được gọi, tham số, kết quả trả về. Trace giúp bạn:

  • Tìm bước hay gãy (ví dụ 60% lỗi nằm ở bước tra cứu đơn).
  • Phân biệt lỗi model (suy luận sai) vs lỗi tool (API hỏng) vs lỗi dữ liệu (input bẩn).
  • Xây dashboard "funnel" xem tác vụ rụng ở đâu trong chuỗi.

Ví dụ đọc số như một PM

Agent hỗ trợ có TCR 82%. Bóc tách:

  • 10% rụng ở bước xác minh danh tính (tool KYC chậm/timeout) → lỗi tool, sửa hạ tầng.
  • 5% agent hiểu sai ý khách → lỗi model, cần cải thiện prompt/ví dụ.
  • 3% khách bỏ giữa chừng → vấn đề trải nghiệm, không phải năng lực agent.
Cùng một con số 82% nhưng ba nguyên nhân này đòi ba hành động hoàn toàn khác. Đây là giá trị của PM biết đọc trace.

Khung "đo lường trước khi mở rộng"

  • Đã định nghĩa "xong đúng" kiểm chứng được chưa?
  • golden set để chấm điểm hồi quy khi cập nhật model không?
  • Đang đo chi phí trên mỗi tác vụ hoàn thành chưa (không phải mỗi call)?
  • trace đầy đủ để bóc tách nguyên nhân lỗi không?
  • baseline con người để so sánh không?

Sai lầm thường gặp

  • Đo accuracy từng câu thay vì task completion end-to-end.
  • Quên chi phí và độ trễ, chỉ khoe tỷ lệ hoàn thành.
  • Không log trace, khi lỗi thì mò kim đáy bể.
  • Không có golden set, cập nhật model xong không biết tốt lên hay tệ đi.
  • Thiếu baseline con người, không biết agent thật sự có đáng dùng không.

Checklist kết bài

  • [ ] Tôi định nghĩa "xong đúng" một cách kiểm chứng được.
  • [ ] Tôi theo dõi bộ chỉ số cân bằng: chất lượng, hiệu quả, chi phí, an toàn, niềm tin.
  • [ ] Tôi đo chi phí trên mỗi tác vụ hoàn thành.
  • [ ] Tôi log trace để bóc tách lỗi model / tool / dữ liệu.
Học xong bài này rồi? Tạo tài khoản miễn phí để lưu lại — lần sau vào là biết ngay đang dở ở đâu, và học hết khóa thì có chứng chỉ. Lưu tiến độ của tôi