AI và Tự động hóa

DeepSeek V4.1 Flash thay thế bản Pro: rẻ hơn nhưng đừng đọc sai benchmark

|Tác giả: Ban biên tập QUASA|5 phút đọc| 1
DeepSeek V4.1 Flash thay thế bản Pro: rẻ hơn nhưng đừng đọc sai benchmark

DeepSeek đã đảo ngược kế hoạch chuyển toàn bộ yêu cầu mang mã deepseek-v4-pro sang V4.1 Flash từ 04:00 UTC ngày 14/09/2026. Nhật ký thay đổi API của DeepSeek hiện xác nhận V4 Pro sẽ tiếp tục hoạt động sau mốc này với cách tính phí không đổi.

Vì vậy, phần “thay thế bản Pro” trong tiêu đề chỉ còn phản ánh kế hoạch đã được công bố rồi rút lại, không phải trạng thái API sắp có hiệu lực. V4.1 Flash vẫn là model mới, rẻ hơn V4 Pro và đã có trên API dưới mã deepseek-flash, nhưng hai model sẽ tiếp tục tồn tại riêng sau ngày 14/09.

Alias Pro không còn chuyển sang Flash ngày 14/09

Kế hoạch chuyển alias V4 Pro được thay bằng trạng thái tiếp tục cung cấp dịch vụ

Thông báo phát hành ngày 10/09 từng đặt lịch cho mọi yêu cầu tới deepseek-v4-pro được định tuyến sang V4.1 Flash và tính theo giá Flash. Một ngày sau, DeepSeek bổ sung quyết định giữ V4 Pro theo nhu cầu của người dùng; bản tin ngày 11/09 của IT之家 xác nhận dịch vụ Pro tiếp tục sau ngày 14/09 và giữ nguyên cách tính phí.

Trạng thái alias vì thế cần được tách thành ba trường hợp:

  • deepseek-v4-pro: tiếp tục gọi V4 Pro; lịch chuyển sang V4.1 Flash đã bị hủy.
  • deepseek-flash: mã chính thức để gọi V4.1 Flash.
  • deepseek-v4-flashdeepseek-v4-flash-vision-exp: hai model cũ đã ngừng, còn tên API tạm thời được định tuyến tới V4.1 Flash để duy trì tương thích.

Điểm khác biệt quan trọng là chỉ các alias Flash cũ đã đổi model phía sau. Người dùng V4 Pro không bị chuyển tự động vào ngày 14/09 theo kế hoạch ban đầu, nên không thể dự tính hóa đơn hoặc kết quả đầu ra dựa trên giả định rằng alias Pro sắp nhận giá và hành vi của Flash.

Flash rẻ hơn Pro, nhưng mức tiết kiệm phụ thuộc loại token

V4 Pro và V4.1 Flash tiếp tục là hai đích API riêng biệt

Bảng giá được tính trên một triệu token và chia theo cache hit, cache miss, đầu ra, giờ cao điểm và thấp điểm. Với V4.1 Flash, giá thấp điểm lần lượt là 0,02 nhân dân tệ cho đầu vào trúng cache, 1 nhân dân tệ cho đầu vào trượt cache và 4 nhân dân tệ cho đầu ra; giá cao điểm tương ứng là 0,04, 2 và 8 nhân dân tệ.

V4 Pro giữ mức thấp điểm 0,15 nhân dân tệ cho cache hit, 4,5 nhân dân tệ cho cache miss và 13,5 nhân dân tệ cho đầu ra; ở giờ cao điểm, các mức này tăng lên 0,30, 9 và 27 nhân dân tệ. Như vậy, nhận định Flash rẻ hơn Pro được bảng giá xác nhận ở cả ba loại token, nhưng không thể rút gọn thành một tỷ lệ tiết kiệm duy nhất.

Chi phí thực tế còn phụ thuộc tỷ lệ trúng cache và thời điểm chạy workload. Một tác vụ có phần lớn đầu vào lặp lại sẽ hưởng nhiều hơn từ giá cache hit rất thấp, trong khi tác vụ sinh đầu ra dài vẫn chịu phần chi phí đầu ra lớn. Giá thấp điểm bằng một nửa giá cao điểm, nên hai workload có cùng số token vẫn có thể tạo hóa đơn chênh gấp đôi chỉ vì khung giờ.

Benchmark của hãng không nói Flash thắng Pro ở mọi tác vụ

Benchmark V4.1 Flash và V4 Pro được phân tách theo tác vụ và nguồn công bố

V4.1 Flash là mô hình MoE 552 tỷ tham số với kiến trúc encoder–decoder bất đối xứng, kích hoạt khoảng 8 tỷ tham số khi xử lý đầu vào và 16 tỷ khi tạo đầu ra. Đối chiếu kỹ thuật của PacketNebula ghi nhận Flash đạt 90,6 so với 87,9 của V4 Pro trên Terminal-Bench 2.1 và 74,2 so với 62,7 trên DeepSWE v1.1, nhưng thấp hơn Pro trên GPQA Diamond: 90,9 so với 92,4.

Những số này là kết quả trong bảng do DeepSeek công bố, không phải một phép đo độc lập của PacketNebula hay Quasa Media. Chúng cũng không đo cùng một năng lực: Terminal-Bench và DeepSWE tập trung nhiều hơn vào tác vụ agent và phần mềm, còn GPQA Diamond kiểm tra câu hỏi khoa học khó. Một model dẫn ở nhóm coding không mặc nhiên dẫn ở bài kiểm tra tri thức và suy luận khác.

Điều kiện chạy cũng giới hạn cách diễn giải. DeepSeek sử dụng mức effort tối đa cho các phép thử và áp dụng DeepSeek Harness ở chế độ minimal cho các hàng code-agent; thay harness, mức effort, giới hạn token hoặc bộ công cụ có thể làm kết quả thay đổi. Vì thế, tuyên bố “nhanh hơn, rẻ hơn và tốt hơn” không nên được chuyển thành kết luận rằng Flash thay thế hoàn toàn chất lượng của Pro trong mọi workload.

Trạng thái đã xác nhận hiện nay là V4.1 Flash hoạt động dưới mã deepseek-flash, còn deepseek-v4-pro tiếp tục phục vụ và giữ cách tính phí riêng sau ngày 14/09. DeepSeek chưa đưa ra lịch thay thế mới; hãng chỉ cho biết sẽ thông báo thêm nếu dịch vụ Pro có thay đổi.

Đọc thêm:

Chia sẻ:

Đăng ký bản tin

Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.

0