
Claude Sonnet 5.5 rẻ nửa Opus: benchmark độc lập cho thấy đổi chỗ ở đâu

Theo thông số Claude Platform, Anthropic phát hành Claude Sonnet 5.5 ngày 28/9/2026 và đang cung cấp mẫu này qua API với giá 2 USD cho một triệu token đầu vào, 10 USD cho một triệu token đầu ra; Claude Opus 5.5 có giá tương ứng 4 USD và 20 USD. Với cùng lượng token đầu vào và đầu ra, Sonnet có đơn giá bằng một nửa Opus. Điều đó mở ra khả năng chuyển các công việc có phạm vi rõ sang mẫu rẻ hơn, nhưng chi phí hoàn thành một công việc còn phụ thuộc vào lượng token và số lần gọi thực tế.
Trong đánh giá của Vals công bố ngày 28/9/2026, Sonnet 5.5 đứng thứ hai trong 66 mẫu trên Vals Index với 69,22%, gần Opus 5.5 ở mức 69,69%; chi phí mỗi bài thử lần lượt là 20,80 USD và 32,77 USD. Bảng động hiện hiển thị Sonnet ở mức 67,04%, thứ hai trong 43 mẫu, với chi phí 21,34 USD mỗi bài thử. Bản công bố và bảng động có nhóm so sánh khác nhau, nên các con số cần được giữ đúng thời điểm thay vì ghép thành một kết quả.
Giá giảm một nửa chuyển thành chi phí công việc thế nào?
Giá API là giá trên token được tính phí, không phải giá trọn gói cho một yêu cầu hay một đầu ra đạt chuẩn. Ba phép tính dưới đây là ví dụ giả định, dùng cùng lượng token cho Sonnet và Opus để thấy tác động trực tiếp của bảng giá. Chúng chưa tính token đọc từ bộ nhớ đệm, xử lý theo lô, lượt chạy lại hoặc token phát sinh khi dùng công cụ.
- Một yêu cầu có 50.000 token đầu vào và 5.000 token đầu ra tốn 0,15 USD với Sonnet, so với 0,30 USD với Opus.
- Một quy trình nhiều lượt gọi dùng tổng cộng 200.000 token đầu vào và 100.000 token đầu ra tốn 1,40 USD với Sonnet, so với 2,80 USD với Opus.
- Một khối lượng theo tháng dùng 10 triệu token đầu vào và một triệu token đầu ra tốn 30 USD với Sonnet, so với 60 USD với Opus.
Khoảng cách này chỉ giữ nguyên khi hai mẫu tiêu thụ cùng lượng token. Nếu Sonnet cần thêm nhiều lượt gọi, tạo đầu ra dài hơn hoặc phải chạy lại để đạt cùng chất lượng, khoản tiết kiệm sẽ thu hẹp. Với cơ cấu đầu vào và đầu ra giữ nguyên, mức giá bằng một nửa có nghĩa là Sonnet vẫn rẻ hơn về token khi lượng sử dụng của nó chưa tới gấp đôi Opus; tỷ lệ hoàn thành mới quyết định so sánh đó có ích hay không.
Token đọc từ bộ nhớ đệm là một ngoại lệ quan trọng: cả hai mẫu cùng có giá 0,20 USD cho một triệu token đọc, nên phần hóa đơn này không giảm khi đổi sang Sonnet. Chi phí 20,80 USD mỗi bài thử trong bản công bố của Vals cũng phản ánh cách chạy bộ đánh giá của họ. Nó không phải mức phí cố định cho một yêu cầu API của doanh nghiệp và không nên dùng thay cho phép tính từ token của ứng dụng.
Điểm Vals gần Opus, kết quả theo nhiệm vụ cách xa
Khoảng cách 0,47 điểm phần trăm trên Vals Index lúc công bố khiến Sonnet đáng chú ý đối với nhóm đang dùng Opus. Song các bài đo thành phần cho thấy nơi đổi mẫu có thể hợp lý khác với nơi cần giữ lại mẫu đắt hơn. Sonnet đạt 69,83% và đứng đầu bảng Code Migration hiện hiển thị, trong khi ở Harvey’s Legal Agent Benchmark, mẫu này đạt 2,92% và đứng thứ 40 trong 74 mẫu. Một vị trí cao trên chỉ số tổng hợp vì vậy không chuyển nguyên vẹn sang từng loại tác vụ.
Ngay cả cùng tên một bài đo, điều kiện chạy cũng quan trọng. Vals dùng mức nỗ lực tính toán tối đa cho phần lớn đánh giá và cấu hình Sonnet 5.5 có cơ chế chuyển sang Sonnet 5 ở phía máy chủ trong một số trường hợp bị từ chối. Nếu tính những lượt được mẫu dự phòng hỗ trợ là thất bại, Vals Index trong bản cập nhật ban đầu giảm từ 69,22% xuống 68,89%. Kết quả đó mô tả cấu hình đã được chạy, gồm cả cơ chế dự phòng, thay vì chỉ riêng khả năng của Sonnet 5.5.
Với công việc chuyển đổi mã có tiêu chí chấp nhận rõ, kết quả Code Migration tạo cơ sở để cân nhắc Sonnet trước Opus. Bài đo về tác nhân pháp lý cho thấy quyết định tương tự không thể suy ra từ điểm tổng hợp. Hai bộ đo kiểm tra các nhiệm vụ khác nhau; không có lý do để coi chênh lệch của chúng là mâu thuẫn hoặc lấy một điểm số làm cam kết chất lượng cho hệ thống sản xuất.
Giới hạn API ảnh hưởng đến việc chuyển mẫu
Sonnet 5.5 có trạng thái hoạt động trên Claude API; tài liệu nền tảng cũng liệt kê Amazon Bedrock, Google Cloud, Microsoft Foundry và Claude Platform on AWS. Cửa sổ ngữ cảnh đạt một triệu token, còn đầu ra thông thường tối đa 128.000 token cho mỗi lượt gọi. Vì vậy, ví dụ khối lượng theo tháng ở trên là tổng của nhiều lượt gọi, không phải một yêu cầu duy nhất. Giới hạn đầu vào dài cũng không tự làm cho một quy trình nhiều bước hoàn thành với ít lượt gọi hơn.
Việc chuyển từ mã mẫu cũ sang Sonnet 5.5 có thể cần sửa cách ứng dụng gọi API. Suy luận thích ứng được bật theo mặc định; tùy chọn between_tools tắt phần suy luận trước lượt gọi công cụ ở những mức nỗ lực được hỗ trợ. Yêu cầu ép sử dụng công cụ sẽ trả lỗi, còn giá trị khác mặc định cho temperature, top_p hoặc top_k dẫn đến lỗi 400. Một hệ thống đang phụ thuộc vào các thiết lập ấy có thể phải thay đổi luồng xử lý trước khi khoản tiết kiệm từ giá token xuất hiện trên hóa đơn.
Ranh giới chuyển từ Opus sang Sonnet
Nhóm phát triển có cơ sở chuyển trước những việc mà đầu ra và điều kiện đạt yêu cầu đã được xác định: chẳng hạn sửa lỗi có bài kiểm tra, chuyển đổi mã theo tiêu chí cụ thể hoặc tạo tài liệu theo khuôn. Đây là cách diễn giải kết hợp mức giá với kết quả theo nhiệm vụ, không phải bảo đảm Sonnet sẽ hoàn thành mọi việc như Opus. Với tác vụ mở, nhiều bước hoặc cần phán đoán kéo dài, mức chênh giá mỗi token có thể không đủ bù cho lượt chạy lại và đầu ra không đạt yêu cầu.
Một đơn vị thử nghiệm đã mô tả hướng chuyển có chọn lọc. Trên trang ra mắt của Anthropic, David Loker, Phó chủ tịch phụ trách AI tại CodeRabbit, nói: “We plan to move simple and moderate reviews over now, and more in the coming weeks.” Đó là kế hoạch chuyển các lượt đánh giá mã đơn giản và vừa phải của CodeRabbit, không phải kết quả triển khai chung cho mọi doanh nghiệp.
Ranh giới kinh tế thực tế nằm ở chi phí cho mỗi đầu ra đạt chuẩn: tiền token, số lượt chạy lại và tỷ lệ hoàn thành phải được tính trên cùng loại việc. Nếu Sonnet giữ được chất lượng ở khối lượng có tiêu chí rõ, đơn giá thấp hơn có thể chuyển thành tiết kiệm. Nếu công việc cần Opus để giảm lỗi hoặc giảm số lần thử, thứ hạng gần nhau trên Vals Index không quyết định được hóa đơn cuối cùng.
Đọc thêm:
Bài viết liên quan


Anthropic nới rào sinh học cho Claude, nhưng chỉ qua xác minh

Chi tiêu AI của nhóm doanh nghiệp dẫn đầu giảm 9,7% trong tháng 8

Claude lọt ra Internet lần thứ tư: 481 triệu transcript mới tìm thấy

ChatGPT, Claude và Grok cùng gián đoạn, nhưng chưa có bằng chứng lỗi chung

Claude mở quyền sinh học rủi ro cao, đổi lại dữ liệu bị giữ 30 ngày
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.