Product Management
Đăng nhập
ESC

Nhập từ khóa để tìm kiếm

↑↓ Di chuyển
Enter Mở
ESC Đóng
Technical OpenAI, Anthropic, Google, Cohere

Bạn thiết kế pipeline đánh giá (eval) cho một tính năng LLM như thế nào khi không có 'đáp án đúng' duy nhất?

Gợi ý: Golden set, LLM-as-judge, đánh giá của con người, kết hợp offline và online.

0câu trả lời
17lượt xem
Bạn sẽ trả lời thế nào?

Tạo tài khoản miễn phí để viết câu trả lời và được AI chấm điểm — và để lưu lại những câu bạn đã luyện.

Đăng ký miễn phí Đăng nhập

0 câu trả lời

Chưa ai trả lời câu này. Bạn mở màn nhé — câu trả lời đầu tiên thường là câu được đọc nhiều nhất.

Thảo luận

Chưa có thảo luận nào. Bạn mở màn nhé — không cần viết dài, một góc nhìn cũng được.

Đăng ký để thảo luận