Product Management
Đăng nhập
ESC

Nhập từ khóa để tìm kiếm

↑↓ Di chuyển
Enter Mở
ESC Đóng

Bài 1 — Multimodal AI là gì và vì sao PM cần hiểu nó

Multimodal nghĩa là gì?

"Modality" (phương thức) là một loại dữ liệu đầu vào hoặc đầu ra: văn bản (text), hình ảnh (image), âm thanh (audio), video, thậm chí dữ liệu cảm biến. Một mô hình unimodal chỉ xử lý một loại - ví dụ mô hình chỉ nhận text và trả text. Một mô hình multimodal có thể nhận và/hoặc sinh ra nhiều loại cùng lúc: bạn đưa vào một tấm ảnh hóa đơn kèm câu hỏi bằng chữ, mô hình đọc ảnh + hiểu câu hỏi + trả lời bằng text.

Ví dụ sản phẩm thực tế:

  • Chăm sóc khách hàng bằng giọng nói: khách nói (audio) → mô hình chuyển thành text, hiểu ý định, trả lời bằng text rồi đọc lên (audio).
  • Kiểm tra bảo hiểm xe: khách chụp ảnh vết móp (image) + mô tả sự cố (text) → mô hình ước lượng mức độ hư hại.
  • Trợ lý học tập: học viên chụp đề toán (image) → mô hình giải và giải thích (text).

Vì sao PM phải hiểu bản chất kỹ thuật?

Bạn không cần code, nhưng bạn phải hiểu giới hạn của từng modality để không hứa những gì mô hình không làm được. Ví dụ, mô hình vision rất giỏi nhận diện vật thể nhưng dễ sai khi đọc số liệu nhỏ trong bảng biểu; mô hình audio dễ nhầm với accent vùng miền hoặc tiếng ồn nền. Nếu PM không biết điều này, roadmap sẽ đầy những feature "trông có vẻ dễ" nhưng thực tế đội kỹ thuật không đạt được độ chính xác chấp nhận được.

Khung tư duy: "Modality-to-Value"

Khi đánh giá một ý tưởng multimodal, hãy trả lời 4 câu hỏi:

  • Modality nào thực sự cần thiết? Đừng thêm ảnh chỉ vì "nghe hay". Nếu vấn đề giải được bằng text thì multimodal chỉ làm tăng chi phí và rủi ro.
  • Modality nào tạo ra giá trị mới? Ví dụ: cho phép khách chụp ảnh thay vì gõ mô tả dài giúp giảm ma sát (friction) - đó là giá trị thật.
  • Chất lượng dữ liệu đầu vào ra sao? Ảnh chụp bằng điện thoại cũ, thiếu sáng, audio có tiếng ồn - đầu vào tệ thì đầu ra tệ.
  • Chi phí xử lý mỗi modality? Xử lý ảnh và audio tốn nhiều token/compute hơn text rất nhiều.

Checklist trước khi đề xuất một feature multimodal

  • [ ] Đã xác định rõ modality đầu vào và đầu ra chưa?
  • [ ] Có bằng chứng người dùng thực sự muốn dùng modality đó (không phải giả định)?
  • [ ] Đã ước lượng sơ bộ độ chính xác kỳ vọng và ngưỡng chấp nhận?
  • [ ] Đã tính đến trường hợp đầu vào kém chất lượng?
  • [ ] Có phương án fallback khi mô hình từ chối hoặc trả sai không?

Sai lầm thường gặp

  • "Multimodal cho sang": thêm ảnh/audio mà không có lý do nghiệp vụ rõ ràng, khiến sản phẩm phức tạp và đắt đỏ mà không tăng giá trị.
  • Đánh đồng năng lực các modality: giả định mô hình đọc ảnh giỏi như đọc text. Thực tế mỗi modality có điểm mạnh/yếu riêng.
  • Bỏ qua chất lượng đầu vào: demo đẹp với ảnh chuẩn studio, nhưng người dùng thật chụp ảnh mờ, nghiêng, thiếu sáng.
  • Không có fallback: khi mô hình không đọc được ảnh, sản phẩm treo cứng thay vì hướng dẫn người dùng chụp lại.

Tổng kết

Multimodal AI mở ra nhiều trải nghiệm mới, nhưng PM giỏi là người biết khi nào KHÔNG dùng multimodal. Hãy luôn bắt đầu từ vấn đề người dùng và giá trị, rồi mới chọn modality - không phải ngược lại. Ở các bài sau, chúng ta sẽ đi sâu vào cách kết hợp các modality, đo lường chất lượng (eval), kiểm soát chi phí và đảm bảo an toàn - fairness.

Học xong bài này rồi? Tạo tài khoản miễn phí để lưu lại — lần sau vào là biết ngay đang dở ở đâu, và học hết khóa thì có chứng chỉ. Lưu tiến độ của tôi