Vì sao chi phí là bài toán của PM, không chỉ của kỹ thuật
Sản phẩm AI multimodal có thể ngốn ngân sách rất nhanh. Một ảnh độ phân giải cao tiêu tốn hàng nghìn token; một phút audio phải xử lý qua nhiều mô hình. Nếu PM không hiểu cấu trúc chi phí, bạn sẽ ra một sản phẩm tốt nhưng lỗ trên mỗi giao dịch - unit economics âm - và không thể mở rộng (scale).
Chi phí ảnh hưởng trực tiếp đến định giá, gói dịch vụ và quyết định feature. Đây là bài toán PM.
Các nguồn chi phí chính
- Chi phí suy luận (inference): tính theo token đầu vào + đầu ra. Ảnh và audio quy đổi ra rất nhiều token.
- Chi phí tiền xử lý: OCR, khử nhiễu audio, nén ảnh - chạy trên server của bạn.
- Chi phí lưu trữ: ảnh/audio/video nặng, lưu lâu dài tốn kém, nhất là khi cần giữ để audit.
- Chi phí độ trễ ẩn: latency cao khiến người dùng rời bỏ - một dạng chi phí gián tiếp.
Khung tư duy: "Cost per successful task"
Đừng chỉ nhìn chi phí mỗi lần gọi mô hình (cost per call). Hãy đo chi phí trên mỗi tác vụ thành công (cost per successful task). Vì sao? Nếu mô hình rẻ nhưng sai nhiều, người dùng phải thử lại 3 lần → chi phí thật cao gấp 3 và trải nghiệm tệ. Một mô hình đắt hơn nhưng đúng ngay lần đầu có thể rẻ hơn về tổng thể.
Công thức tư duy: Chi phí thật = (chi phí mỗi lần gọi × số lần thử trung bình) + chi phí xử lý lỗi/khiếu nại.
Các đòn bẩy tối ưu chi phí
- Right-sizing mô hình: dùng mô hình nhỏ/rẻ cho tác vụ đơn giản, chỉ escalate lên mô hình lớn khi cần (routing theo độ khó).
- Nén và giảm độ phân giải đầu vào: gửi ảnh ở độ phân giải vừa đủ để mô hình đọc đúng, không gửi ảnh gốc 12MP.
- Caching: lưu kết quả cho đầu vào trùng lặp; cache prompt hệ thống dài.
- Tiền lọc rẻ tiền: dùng bộ lọc nhẹ (phát hiện ảnh mờ, audio trống) để loại đầu vào rác TRƯỚC khi gọi mô hình đắt.
- Batch xử lý: gom các yêu cầu không cần realtime để xử lý theo lô, giá rẻ hơn.
- Cắt bước thừa: nếu 80% case chỉ cần text, đừng bắt mọi request đi qua pipeline vision.
Ví dụ cụ thể
App trợ lý giọng nói ban đầu gửi mọi câu nói qua mô hình lớn nhất, chi phí 8 cent/lượt, 1 triệu lượt/tháng = 80.000 USD. PM phân tích: 70% câu hỏi là FAQ đơn giản. Giải pháp: định tuyến câu đơn giản sang mô hình nhỏ (0,5 cent) và cache câu lặp. Kết quả: chi phí trung bình giảm còn ~3 cent/lượt, tiết kiệm hơn 60% mà chất lượng gần như không đổi (được xác nhận bằng eval ở Bài 3).
Checklist kiểm soát chi phí
- [ ] Đã tính cost per successful task (không chỉ cost per call) chưa?
- [ ] Có routing theo độ khó để dùng mô hình rẻ khi có thể không?
- [ ] Ảnh/audio đã được nén/giảm độ phân giải hợp lý chưa?
- [ ] Có caching cho đầu vào lặp và prompt hệ thống không?
- [ ] Có bộ lọc rẻ để loại đầu vào rác trước khi gọi mô hình đắt?
- [ ] Unit economics (doanh thu vs chi phí mỗi user) có dương không?
Sai lầm thường gặp
- Chỉ tối ưu cost per call: chọn mô hình rẻ nhưng sai nhiều, người dùng thử lại nhiều lần, tổng chi phí tăng.
- Gửi đầu vào chưa nén: ảnh gốc siêu nét cho tác vụ chỉ cần đọc chữ - lãng phí token.
- Không caching: xử lý lại cùng một câu hỏi phổ biến hàng nghìn lần.
- Bỏ qua chi phí lưu trữ và latency: chỉ nhìn hóa đơn API mà quên storage phình to và người dùng rời bỏ vì chậm.
- Tối ưu mù không đo lại chất lượng: cắt giảm để rẻ nhưng làm rớt accuracy dưới ngưỡng - phải luôn eval sau tối ưu.
Tổng kết
Chi phí hạ tầng quyết định sản phẩm AI có sống được không. PM giỏi tư duy theo cost per successful task, dùng routing - caching - nén - tiền lọc để tối ưu, và luôn kiểm tra lại chất lượng sau mỗi lần cắt giảm. Rẻ mà sai thì không rẻ.