AI và Tự động hóa

Gemini 3.8 Flash giữ giá mỗi token, nhưng chi phí mỗi tác vụ tăng 45% trong thử nghiệm

|Tác giả: Ban biên tập QUASA|5 phút đọc| 2
Gemini 3.8 Flash giữ giá mỗi token, nhưng chi phí mỗi tác vụ tăng 45% trong thử nghiệm

Gemini 3.8 Flash có thể tốn nhiều hơn cho mỗi tác vụ dù đơn giá token không thay đổi. Theo phép đo của Artificial Analysis ở mức suy luận high, chi phí trung bình trên mỗi tác vụ Intelligence Index tăng từ 0,40 USD với 3.7 Flash lên 0,58 USD với 3.8 Flash; lấy mức chênh 0,18 USD chia cho 0,40 USD cho kết quả tăng 45%.

Trong thông báo phát hành ngày 2/9/2026, Google đặt giá giới thiệu của Gemini 3.8 Flash ở mức 0,75 USD cho một triệu token đầu vào và 3,75 USD cho một triệu token đầu ra, bằng 3.7 Flash. Câu trả lời ngắn cho nhóm đang cân nhắc chuyển model là: 3.8 mạnh hơn chủ yếu ở tác vụ nhiều bước, nhưng không nên suy đơn giá bằng nhau thành chi phí và độ trễ bằng nhau.

Giá token giữ nguyên, lượng công việc bên trong có thể tăng

Google định vị Gemini 3.8 Flash cho lập trình dài hạn, tác nhân tự chủ và suy luận nhiều bước. Hãng cũng lưu ý model có thể thực hiện thêm bước suy luận, gọi công cụ lặp lại và dùng nhiều token hơn khi chạy ở mức effort cao; 3.7 Flash vẫn được hỗ trợ cho workload ưu tiên hiệu quả tính toán.

Điểm cần phân biệt là đơn giá token với chi phí để hoàn thành tác vụ. Nếu model tạo thêm token suy luận hoặc đi qua nhiều vòng công cụ, hóa đơn cho một lần chạy có thể tăng ngay cả khi bảng giá đầu vào và đầu ra không đổi.

Phần xử lý bổ sung chỉ tạo lợi ích kinh tế khi nó nâng đủ tỷ lệ đầu ra được chấp nhận hoặc giảm số lần phải chạy lại. Với yêu cầu ngắn, ổn định và ít phụ thuộc công cụ, model làm nhiều hơn chưa chắc tạo ra giá trị tương ứng.

Con số 45% chỉ thuộc cấu hình thử nghiệm high

Gemini 3.8 Flash thực hiện nhiều bước tác nhân và dùng nhiều token hơn 3.7 Flash trên DeepSWE v1.1

Mức tăng trong tiêu đề không phải thay đổi giá Gemini API và không thể áp dụng cho mọi ứng dụng. Nó là kết quả số học từ hai mức chi phí trung bình của Artificial Analysis trên cùng bộ Intelligence Index, với cả hai model chạy ở mức suy luận high.

Artificial Analysis mô tả mức tăng đã làm tròn là khoảng 40%, đồng thời cho rằng nguyên nhân đến từ lượng token đầu ra trung bình cao hơn và số lượt xử lý tác nhân tăng. Sai khác giữa cách viết khoảng 40% và phép tính 45% không phản ánh hai kết quả thử khác nhau: 45% là tỷ lệ chính xác khi tính trực tiếp từ 0,40 lên 0,58 USD.

Đây cũng là lý do không nên dùng riêng chỉ số tốc độ sinh token để dự báo trải nghiệm. Một model có thể tạo token nhanh nhưng vẫn mất nhiều thời gian hoàn tất hơn nếu tạo thêm token hoặc thực hiện nhiều vòng suy luận và gọi công cụ.

DeepSWE cho thấy tác vụ dài có thể bù chi phí mỗi lượt chạy

Phân tích GoML công bố ngày 4/9/2026 ghi nhận trên DeepSWE v1.1, với cùng mini-swe-agent harness, 3.8 Flash dùng khoảng 143.000 token đầu ra và 166 bước tác nhân mỗi lượt, so với 107.000 token và 125 bước của 3.7 Flash; chi phí trung bình mỗi lượt tăng từ 2,18 lên 2,36 USD, nhưng tỷ lệ đạt tăng từ khoảng 65% lên 74%.

Khi quy đổi theo lượt thành công, GoML tính chi phí giảm từ khoảng 3,35 xuống 3,19 USD. Kết quả này không mâu thuẫn với phép đo Intelligence Index: một bên đo chi phí trung bình trên tập tác vụ rộng, bên kia tính hiệu quả của tác nhân giải bài toán phần mềm dài hạn.

Hai bộ số liệu cùng dẫn đến một ranh giới quyết định rõ hơn. Gemini 3.8 Flash đáng thử cho sửa mã ở quy mô kho nguồn, tự động hóa terminal và quy trình tác nhân thường dừng trước khi hoàn thành; 3.7 Flash vẫn có lợi thế tiềm năng ở phân loại, trích xuất, định tuyến hoặc phản hồi ngắn nhạy với độ trễ.

Thay model ID cần qua canary theo từng nhóm workload

Canary so sánh Gemini 3.8 Flash và 3.7 Flash theo tỷ lệ thành công, token, tool call, độ trễ và chi phí

Việc thay toàn bộ lưu lượng cùng lúc sẽ làm khó việc xác định nguyên nhân nếu chi phí, độ trễ hoặc chất lượng thay đổi. Một phép thử canary nên giữ nguyên yêu cầu, prompt, công cụ, giới hạn token, chính sách retry và bộ chấm kết quả, sau đó chỉ thay model trên một phần lưu lượng hoặc shadow traffic.

  1. Tách yêu cầu theo độ dài, số công cụ cần dùng và mức nhạy với độ trễ.
  2. Ghi tỷ lệ thành công, token suy luận, token hiển thị, số tool call, retry, time-to-first-token và tổng thời gian.
  3. Tính cả chi phí mỗi lượt chạy lẫn chi phí trên mỗi kết quả được chấp nhận.
  4. Chỉ mở rộng lưu lượng ở nhóm tác vụ mà cải thiện chất lượng bù được phần token, công cụ và thời gian bổ sung.

Điều đã được xác lập là Gemini 3.8 Flash giữ đơn giá giới thiệu của 3.7 Flash nhưng có xu hướng làm nhiều việc hơn trên tác vụ phức tạp. Điều chưa thể suy ra từ các benchmark công khai là mức chênh chi phí trong từng hệ thống sản xuất; quyết định chuyển đổi còn phụ thuộc vào phân bố workload, cấu hình suy luận, giới hạn công cụ và tiêu chuẩn chấp nhận đầu ra của chính hệ thống đó.

Đọc thêm:

Chia sẻ:

Đăng ký bản tin

Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.

0