Vì sao GPU đắt và khó tính toán
GPU là trái tim của inference AI. Nhưng không như CPU truyền thống, hiệu quả GPU phụ thuộc mạnh vào cách bạn nhồi công việc vào nó. Một GPU H100 thuê ~3 USD/giờ; nếu bạn chỉ dùng 15% công suất, bạn vẫn trả đủ tiền — đó là lãng phí thầm lặng lớn nhất trong hạ tầng AI.
Chỉ số quan trọng nhất bạn phải theo dõi là GPU utilization (mức tận dụng). Utilization thấp = tiền đổ sông đổ biển. Mục tiêu thực tế thường là 60–80% ở giờ cao điểm; 100% liên tục nghĩa là bạn không còn dư địa cho đỉnh tải.
Ba đơn vị chi phí bạn phải nói trôi chảy
- Cost per 1K tokens (LLM) — chuẩn để so sánh giữa các mô hình/nhà cung cấp.
- Cost per request — hữu ích khi request có kích thước đồng đều.
- Cost per GPU-hour — đơn vị gốc để quy hoạch capacity.
Chi phí mỗi request ≈ (giá GPU-giờ) / (throughput request mỗi giờ)
Vậy để giảm chi phí mỗi request, bạn có hai cần gạt: giảm giá GPU-giờ (dùng chip rẻ hơn, spot instance, tự host) hoặc tăng throughput (batching, quantization, tối ưu mô hình). Tăng throughput thường là đòn bẩy mạnh nhất.
Latency: đừng chỉ nhìn trung bình
Trung bình (mean) che giấu nỗi đau. Nếu 95% request nhanh nhưng 5% cực chậm, người dùng nhớ 5% đó. Vì vậy luôn dùng percentile:
- p50 — trải nghiệm điển hình.
- p95 / p99 — trải nghiệm tệ nhất mà đa số vẫn gặp; đây là con số để đặt SLO.
- TTFT (Time To First Token) — thời gian tới token đầu tiên, quyết định cảm giác "nhanh" của chatbot.
- TPOT / inter-token latency — thời gian giữa các token, quyết định tốc độ chữ chạy ra.
Đánh đổi kinh điển: throughput vs latency
Đây là căng thẳng trung tâm. Gom nhiều request vào một batch lớn → GPU chạy hiệu quả hơn → throughput cao, chi phí/request thấp. Nhưng mỗi request phải chờ batch đầy → độ trễ tăng.
- Workload real-time → batch nhỏ, ưu tiên độ trễ, chấp nhận chi phí cao hơn.
- Workload batch/offline → batch khổng lồ, ép chi phí xuống đáy, mặc kệ độ trễ.
Ví dụ tính nhanh
Giả sử GPU 3 USD/giờ = 0,00083 USD/giây. Nếu cấu hình A xử lý 20 request/giây, chi phí/request ≈ 0,0000417 USD. Nếu bạn bật batching tốt hơn, nâng lên 50 request/giây, chi phí/request tụt còn 0,0000167 USD — rẻ hơn 60% mà không đổi phần cứng. Đó là sức mạnh của việc tối ưu throughput.
Khung tư duy: "đơn vị kinh tế" (unit economics)
Trước khi mở rộng bất cứ hệ thống nào, hãy chốt được một request tốn bao nhiêu và sinh ra bao nhiêu giá trị. Nếu một request AI tốn 0,02 USD nhưng chỉ mang lại 0,01 USD giá trị, bạn càng scale càng lỗ. AI Infra PM giỏi luôn có bảng unit economics cập nhật.
Checklist chi phí GPU
- [ ] Biết cost per 1K token / per request hiện tại của mỗi workload.
- [ ] Theo dõi GPU utilization trung bình và giờ cao điểm.
- [ ] Đặt SLO độ trễ theo p95/p99, không theo trung bình.
- [ ] Tách TTFT và TPOT cho workload sinh văn bản.
- [ ] Có bảng unit economics: chi phí vs giá trị mỗi request.
Sai lầm thường gặp
- Đo latency bằng trung bình. Bỏ lỡ đuôi p99 nơi người dùng khổ sở nhất.
- Quên GPU utilization. Trả tiền cho GPU chạy không tải.
- Chỉ so giá GPU-giờ. Chip rẻ nhưng throughput thấp có thể đắt hơn tính trên mỗi request.
- Scale trước khi có unit economics. Nhân rộng một mô hình lỗ = nhân rộng thua lỗ.