Product Management
Đăng nhập
ESC

Nhập từ khóa để tìm kiếm

↑↓ Di chuyển
Enter Mở
ESC Đóng

Bài 4 — Eval Pipeline: đo lường thay vì đoán mò

Điểm khác biệt lớn nhất giữa một đội LLM nghiệp dư và chuyên nghiệp là eval. Không có eval, mỗi lần đổi prompt hay mô hình là một canh bạc: bạn sửa được một ca nhưng phá ba ca khác mà không hề hay biết. Eval biến "cảm giác nó hay hơn" thành "số liệu chứng minh nó tốt hơn".

Golden set — nền móng của mọi eval

Golden set là tập câu hỏi kèm câu trả lời/tiêu chí mong muốn, đại diện cho input thật. Nguyên tắc:

  • Lấy từ log người dùng thật, không phải tự nghĩ ra ca dễ.
  • Bao gồm cả ca khó, ca biên, ca độc hại (adversarial), không chỉ ca đẹp.
  • Bắt đầu nhỏ (30–50 ca) còn hơn không có gì; mở rộng dần.
  • Version hóa: khi phát hiện lỗi mới ngoài production, thêm ca đó vào golden set ("eval-driven development").

Các cách chấm điểm

  • Exact/rule-based: so khớp chính xác, regex, kiểm tra JSON hợp lệ. Rẻ, chắc chắn, dùng cho định dạng và dữ kiện cứng.
  • LLM-as-judge: dùng một mô hình khác chấm câu trả lời theo rubric (đúng ngữ cảnh? đủ ý? giọng phù hợp?). Rẻ và co giãn, nhưng bản thân judge cũng có sai số — cần calibrate với người thật.
  • Human eval: người chấm, chuẩn vàng nhưng chậm và đắt. Dùng để hiệu chỉnh judge và cho các quyết định quan trọng.

Các metric hay dùng

  • Accuracy/correctness: đúng hay sai.
  • Faithfulness/groundedness: có bám ngữ cảnh RAG không (đo bịa).
  • Relevance: có trả lời đúng câu hỏi không.
  • Format validity: JSON/schema hợp lệ bao nhiêu %.
  • Refusal rate: tỷ lệ từ chối đúng lúc (an toàn) và sai lúc (khó chịu).

Ví dụ cụ thể

Bạn muốn nâng cấp từ mô hình A lên mô hình B rẻ hơn. Thay vì thử vài câu rồi "thấy ổn", bạn chạy cả hai qua golden set 100 câu:

  • Correctness: A 88% vs B 84%.
  • Chi phí: B rẻ 60%.
  • Faithfulness: A 91% vs B 79%.
Giờ đây quyết định là dữ liệu: nếu use case nhạy cảm về bịa, chênh 12% faithfulness là dealbreaker dù rẻ hơn.

Khung tư duy: eval là vòng lặp, không phải một lần

  • Thu golden set → 2. Chạy eval trên baseline → 3. Thay đổi (prompt/RAG/model) → 4. Chạy lại, so sánh → 5. Ship nếu tốt hơn → 6. Giám sát production → 7. Ca lỗi mới bổ sung vào golden set.

Checklist eval

  • [ ] Có golden set từ dữ liệu thật, gồm ca biên và adversarial.
  • [ ] Có ít nhất một metric rule-based (rẻ, ổn định) làm bảo vệ.
  • [ ] Nếu dùng LLM-judge, đã calibrate với vài chục nhãn của người.
  • [ ] Chạy eval tự động trước mỗi lần đổi prompt/model (regression test).
  • [ ] Theo dõi cả chất lượng, chi phí và độ trễ cùng lúc.
  • [ ] Có cơ chế nạp ca lỗi từ production ngược lại golden set.

Sai lầm thường gặp

  • Không có golden set → mọi quyết định là cảm tính.
  • Golden set toàn ca dễ → điểm cao giả tạo, sập ở production.
  • Tin LLM-judge tuyệt đối mà không calibrate — judge cũng thiên vị (thích câu dài, thích giọng tự tin).
  • Chỉ đo accuracy, bỏ qua faithfulness → không phát hiện bịa.
  • Eval một lần rồi quên, không biến thành regression test tự động.
Eval cho bạn thước đo. Nhưng đo xong vẫn cần chặn những lỗi nguy hiểm ngay tại thời điểm chạy — đó là guardrails và chống hallucination, Bài 5.

Học xong bài này rồi? Tạo tài khoản miễn phí để lưu lại — lần sau vào là biết ngay đang dở ở đâu, và học hết khóa thì có chứng chỉ. Lưu tiến độ của tôi