AI và Tự động hóa

Gemini 3.8 Flash giữ giá cũ, nhưng an toàn đa ngôn ngữ lại giảm

|Tác giả: Ban biên tập QUASA|7 phút đọc| 3
Gemini 3.8 Flash giữ giá cũ, nhưng an toàn đa ngôn ngữ lại giảm

Google phát hành Gemini 3.8 Flash ngày 2/9/2026 và đưa mô hình vào Gemini API, Google AI Studio cùng các sản phẩm Gemini. Bản tin của 9to5Google xác nhận giá giới thiệu vẫn là 0,75 USD cho một triệu token đầu vào và 3,75 USD cho một triệu token đầu ra, ngang Gemini 3.7 Flash.

Cùng ngày, model card của Google DeepMind ghi nhận Multilingual Safety kém hơn 3.7 Flash 5,4 điểm phần trăm trong đánh giá chính sách an toàn tự động. Đây là tín hiệu cần chú ý với ứng dụng tiếng Việt, nhưng chưa phải bằng chứng rằng mô hình giảm an toàn đúng mức đó trong mọi cuộc hội thoại hoặc riêng đối với tiếng Việt.

Giá giữ nguyên, tổng chi phí chưa chắc giữ nguyên

Chi phí đơn vị của Gemini 3.8 Flash ngang 3.7 Flash, trong khi mức effort cao có thể làm tăng số bước và token sử dụng.

Mức giá bằng 3.7 Flash chỉ áp dụng trong giai đoạn giới thiệu, đến hết ngày 31/12/2026. Từ ngày 1/1/2027, đơn giá dự kiến chuyển thành 1,50 USD cho một triệu token đầu vào và 7,50 USD cho đầu ra. Vì vậy, “giữ giá cũ” mô tả đúng mức giá khi phát hành, không phải cam kết giá dài hạn.

Ngay trong thời gian giá token bằng nhau, chi phí hoàn thành một tác vụ vẫn có thể khác. Thông báo sản phẩm của Google cho biết 3.8 Flash có thể thực hiện thêm bước suy luận, gọi công cụ lặp lại và dùng nhiều token hơn ở tác vụ phức tạp, nhất là khi đặt effort cao. Nhà phát triển có thể hạ effort hoặc tiếp tục dùng 3.7 Flash, phiên bản vẫn được hỗ trợ cho tải ưu tiên hiệu quả tính toán.

Do đó, so sánh chi phí không nên dừng ở bảng đơn giá. Hai phiên bản cần được đo trên cùng khối lượng công việc, với cùng prompt, công cụ và cấu hình effort; chỉ số có ý nghĩa hơn là số token và thời gian cần để hoàn thành một yêu cầu đạt chất lượng chấp nhận được.

Hồi quy đa ngôn ngữ chưa thể quy riêng cho tiếng Việt

Đánh giá cùng câu lệnh tiếng Việt cho thấy Gemini 3.8 Flash có nhiều trường hợp an toàn đa ngôn ngữ bất lợi hơn bản 3.7.

Trong thước đo Multilingual Safety, giá trị thấp hơn được xem là tốt hơn. Mức tăng được công bố vì thế được Google đánh dấu là hồi quy. Ở các phép đo cùng nhóm, Text-to-Text Safety cải thiện nhẹ, Image-to-Text Safety không đổi, còn tỷ lệ từ chối không có căn cứ chuyển theo hướng bất lợi.

Phạm vi của kết quả này hẹp hơn cách diễn đạt “mô hình kém an toàn hơn” nói chung. Đây là so sánh tương đối bằng hệ thống đánh giá tự động, không phải tỷ lệ lỗi tuyệt đối, thử nghiệm người dùng hay kết quả red-team thủ công. Tài liệu công khai cũng không tách điểm theo từng ngôn ngữ, nhóm chính sách hoặc loại nội dung, nên không thể suy ra mức suy giảm cụ thể cho tiếng Việt.

Google cho biết quá trình xem xét thủ công những trường hợp bị gắn cờ nhận thấy phần lớn tổn thất là dương tính giả hoặc nội dung không nghiêm trọng. Mô hình cũng vượt các ngưỡng phát hành về an toàn trẻ em, còn hoạt động red teaming không tìm thấy vấn đề nghiêm trọng. Những dữ kiện này làm rõ giới hạn của cảnh báo, nhưng không xóa hồi quy đã xuất hiện trong phép đo tự động.

Với sản phẩm tiếng Việt, rủi ro thực tế có thể nằm ở cả hai hướng: nội dung nguy hiểm không bị chặn hoặc yêu cầu hợp lệ bị từ chối. Vì chưa có phân rã theo ngôn ngữ, dữ liệu công khai hiện không cho biết hướng lỗi nào chiếm ưu thế trong tiếng Việt, cũng không chứng minh rằng mọi ứng dụng đa ngôn ngữ sẽ chịu tác động như nhau.

Năng lực API phù hợp hơn với tác nhân nhiều bước

Gemini 3.8 Flash nhận văn bản, hình ảnh, âm thanh và video, có cửa sổ ngữ cảnh tới một triệu token và tạo đầu ra văn bản tối đa 64.000 token. Mô hình được phân phối qua Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, Gemini app, AI Mode và Google Antigravity.

Trọng tâm của bản phát hành là kỹ nghệ phần mềm, tác nhân và quy trình tri thức phức tạp. Các mức effort cho phép điều chỉnh sự đánh đổi giữa chất lượng, chi phí và độ trễ; tuy nhiên, effort cao có thể làm tăng thời gian chờ token đầu tiên, lượng token tính phí và nguy cơ chậm hoặc timeout. Cửa sổ ngữ cảnh lớn vì thế không bảo đảm một chuỗi tác nhân dài sẽ luôn nhanh hoặc rẻ.

Khả năng gọi công cụ và grounding có thể hữu ích khi ứng dụng cần tìm dữ liệu bên ngoài hoặc thực hiện nhiều bước có kiểm soát. Chúng không thay thế lớp chính sách an toàn: grounding hỗ trợ căn cứ thông tin, trong khi việc phát hiện yêu cầu nguy hiểm, từ chối phù hợp và kiểm soát đầu ra là một bài toán khác.

Khi nào sản phẩm tiếng Việt nên chuyển phiên bản

Quy trình chuyển đổi có điều kiện sang Gemini 3.8 Flash, giữ các tác vụ tiếng Việt nhạy cảm ở bản 3.7 để kiểm thử thêm.

Quyết định nâng cấp phụ thuộc vào lợi ích của năng lực tác nhân so với độ nhạy của nội dung. Với dữ liệu hiện có, có thể chia lựa chọn triển khai thành bốn trường hợp:

  • Thử nghiệm sớm: tác vụ coding, phân tích tài liệu dài hoặc quy trình nhiều bước, nếu sản phẩm đã có bộ đánh giá tiếng Việt và cơ chế kiểm soát đầu ra.
  • Chuyển có điều kiện: chatbot hỗ trợ hoặc tìm kiếm có grounding, sau khi chạy song song hai phiên bản trên cùng tập câu hỏi và theo dõi cả nội dung nguy hiểm bị bỏ lọt lẫn câu trả lời hợp lệ bị từ chối.
  • Tạm hoãn: sản phẩm liên quan trẻ em, sức khỏe, tài chính, pháp lý hoặc kiểm duyệt nội dung khi chưa có tập kiểm thử an toàn tiếng Việt đại diện cho lưu lượng thực tế.
  • Giữ 3.7 Flash: tải đã tối ưu chặt độ trễ và ngân sách token, trong khi lợi ích từ suy luận hoặc gọi công cụ nhiều bước chưa được chứng minh ở cấp tác vụ.

Phép so sánh có giá trị cần giữ nguyên prompt hệ thống, dữ liệu grounding, công cụ, mức effort và cấu hình lọc. Tập tiếng Việt nên bao gồm câu có dấu và không dấu, cách nói gián tiếp, câu pha tiếng Anh và ngữ cảnh địa phương; đây là phạm vi kiểm định hợp lý trước hồi quy đa ngôn ngữ, không phải khẳng định rằng 3.8 Flash đã thất bại ở từng dạng đầu vào đó.

Ở thời điểm phát hành, giá giới thiệu và các kênh truy cập đã rõ, nhưng chưa có điểm an toàn tuyệt đối cho tiếng Việt, kích thước từng tập đánh giá hoặc phân bố lỗi theo chính sách. Vì vậy, dữ liệu công khai chưa đủ để biện minh cho việc chuyển toàn bộ lưu lượng tiếng Việt chỉ dựa trên giá và benchmark; điều còn phải chờ là phân rã đánh giá chi tiết hơn hoặc bằng chứng rằng hồi quy đã được khắc phục trong bản cập nhật sau.

Đọc thêm:

Chia sẻ:

Đăng ký bản tin

Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.

0