Muse Spark 1.3 dùng ít hơn 25% token, nhưng điểm số vẫn do Meta tự đo

Meta phát hành Muse Spark 1.3 ngày 2/9/2026 cho Muse Code và Meta Model API, tập trung vào lập trình và tác vụ tác nhân dài hạn. Trong so sánh do kỹ sư Meta thực hiện, phiên bản mới dùng ít hơn khoảng 20% lượt gọi công cụ và 25% token so với Muse Spark 1.2; đây chưa phải kết quả được tái lập độc lập trên cùng một bộ tác vụ.
Điểm mới đáng chú ý là khả năng duy trì nhiều luồng công việc trong một hội thoại dài, tự bổ sung ngữ cảnh bằng công cụ, giữ các ràng buộc nhiều bước và hỏi lại trước hành động quan trọng. Mô hình đã được triển khai, nhưng mức tiết kiệm tài nguyên và các điểm trong bảng đánh giá ra mắt vẫn cần được tách khỏi những phép đo độc lập bên ngoài.
Đã phát hành: mô hình mới cho Muse Code và Meta Model API
Thông báo ra mắt của Meta ghi ngày 2/9, xác nhận Muse Spark 1.3 có trong Muse Code và Meta Model API, đồng thời nêu kết quả nội bộ khoảng 20% lượt gọi công cụ và 25% token ít hơn phiên bản 1.2 trong công việc lập trình. Phạm vi của con số này là so sánh giữa các kỹ sư của hãng, không phải cam kết rằng mọi yêu cầu API đều giảm lượng token tương ứng.
Meta cho biết mô hình được huấn luyện thêm cho tác vụ lập trình kéo dài, giảm những lượt trao đổi không cần thiết và tạo mã gọn hơn. Với tác vụ tác nhân, hãng mô tả khả năng theo dõi nhiều luồng việc trong một hội thoại, thu thập ngữ cảnh từ nguồn lộn xộn hoặc mâu thuẫn, phát hiện khoảng trống trong kế hoạch và giữ lại các yêu cầu chi tiết qua nhiều bước.
Một thay đổi khác nằm ở cách mô hình phối hợp với người dùng: hỏi để làm rõ yêu cầu mơ hồ, báo khi gặp trở ngại và xin xác nhận trước thao tác có hậu quả đáng kể. Đây là các mục tiêu huấn luyện do Meta mô tả, chưa đủ để kết luận rằng mô hình sẽ luôn hoàn thành chính xác hơn hoặc tránh được mọi hành động khó đảo ngược.
Giảm 25% token không bảo đảm hóa đơn giảm 25%

Con số 25% chỉ chuyển thành mức giảm chi phí tương đương khi khối lượng công việc, tỷ lệ token đầu vào và đầu ra, mức suy luận, bộ nhớ đệm, số lần thử lại và chất lượng kết quả đều không đổi. Nếu một lượt chạy dùng 1 triệu token, phép tính đơn thuần cho mức giảm 25% sẽ còn 750.000 token; đó là kịch bản giả định, không phải dự báo hóa đơn.
Tương tự, nếu 100 lượt gọi công cụ giảm 20% thì còn khoảng 80 lượt. Điều này có thể giảm độ trễ hoặc phí của trình duyệt, môi trường thực thi và API bên thứ ba, nhưng lợi ích chỉ tồn tại nếu tác nhân vẫn hoàn thành cùng công việc, không bỏ qua bước kiểm tra và không tạo thêm vòng sửa lỗi.
Axios cho biết giá của Muse Spark 1.3 được giữ ngang phiên bản trước. Vì vậy, lập luận tiết kiệm của Meta dựa vào lượng tài nguyên có thể giảm trong một quy trình, không phải việc hãng hạ đơn giá API.
Điểm ra mắt có phương pháp công bố, nhưng không phải một phép đối chứng độc lập

Báo cáo phương pháp của Meta cho thấy hãng tạo kết quả Muse Spark 1.3 qua Meta Model API và dùng mức suy luận max trong các so sánh chính. Tùy bài kiểm tra, Meta sử dụng bộ công cụ của đơn vị cung cấp benchmark hoặc khung đánh giá nội bộ; điểm đối thủ có thể đến từ lần chạy của Meta, bảng xếp hạng chính thức hoặc số liệu do chính nhà cung cấp đối thủ công bố.
Cách tổng hợp đó không khiến benchmark mất giá trị, bởi một số bài có tập tác vụ công khai và bộ chấm thực thi. Tuy nhiên, các điểm trong gói ra mắt vẫn do Meta lựa chọn cấu hình, vận hành hoặc tập hợp từ nhiều nguồn không hoàn toàn đồng nhất, nên không thể coi toàn bộ bảng là thử nghiệm đối chứng độc lập trên cùng hạ tầng.
Phân tích của VentureBeat cũng tách điểm do Meta công bố khỏi phép đo của Artificial Analysis: bảng độc lập này đã chấm cấu hình xhigh và bản max trong preview giới hạn, nhưng không trực tiếp tái lập tuyên bố giảm 25% token trên quy trình lập trình của Meta. Vì hai phép đo khác nhau về tác vụ, cấu hình và phương pháp, chúng không thể được dùng để xác nhận hoặc bác bỏ trực tiếp lẫn nhau.
Trạng thái max reasoning cũng thay đổi sau thời điểm phát hành. Ngày 2/9, Meta và Axios nói chế độ này sẽ đến sau khi hoàn tất kiểm tra an toàn bổ sung; trang ra mắt hiện ghi max reasoning đã có trong Muse Code và Meta Model API nhưng không nêu ngày cập nhật. Do đó, kết quả ở mức max không nên được mặc định là đại diện cho mọi chế độ suy luận.
Ba trạng thái cần tách khỏi nhau
- Đã phát hành: Muse Spark 1.3 có trong Muse Code và Meta Model API, hướng tới lập trình, sử dụng công cụ và các luồng tác nhân kéo dài.
- Do Meta tuyên bố: khoảng 20% lượt gọi công cụ và 25% token ít hơn Muse Spark 1.2 trong so sánh nội bộ; đơn giá không giảm so với thế hệ trước.
- Chưa được xác nhận độc lập: mức giảm tài nguyên có tái lập trên cùng kho mã, giữ nguyên tỷ lệ hoàn thành và làm tổng chi phí giảm tương ứng hay không.
Điều còn thiếu không phải là thêm một điểm tổng hợp, mà là phép thử đặt hai phiên bản vào cùng kho mã, cùng yêu cầu, quyền công cụ, giới hạn thời gian và tiêu chí hoàn thành. Những đại lượng quyết định giá trị triển khai gồm tỷ lệ vượt kiểm thử, token đầu vào và đầu ra, số lượt gọi công cụ, số vòng sửa lại, độ trễ, tổng chi phí và các hành động không thể hoàn tác.
Như vậy, Muse Spark 1.3 đã đến tay nhà phát triển và có những thay đổi cụ thể cho quy trình lập trình dài hạn. Nhưng tiêu đề “ít hơn 25% token” vẫn phải được hiểu đúng là kết quả nội bộ của Meta trên công việc lập trình; bằng chứng độc lập hiện có đánh giá năng lực và chi phí bằng phương pháp khác, chưa xác nhận chính con số tiết kiệm này.
Đọc thêm:
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.