Claude Fable 5.1 giảm 75% phí đọc cache, giá đầu ra vẫn 50 USD

|Tác giả: Ban biên tập QUASA|6 phút đọc| 1
Claude Fable 5.1 giảm 75% phí đọc cache, giá đầu ra vẫn 50 USD

Anthropic phát hành Claude Fable 5.1 ngày 1/9/2026 và cung cấp rộng rãi mô hình này. Bản tin Axios về đợt phát hành cho biết giá cơ bản vẫn là 10 USD cho một triệu token input và 50 USD cho một triệu token output, còn phí đọc dữ liệu đã xử lý từ cache giảm 75%.

Hồ sơ Claude Fable 5.1 trên Claude Platform niêm yết cache read ở mức 0,25 USD/MTok, cache write 5 phút ở 12,50 USD/MTok và cache write một giờ ở 20 USD/MTok; đồng thời ghi trạng thái Active từ ngày 1/9/2026 trên Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và Claude Platform on AWS.

Bảng giá chỉ thay đổi ở cache read

Bảng phí Claude Fable 5.1 tách input, output, ghi cache và đọc cache 0,25 USD mỗi triệu token

Câu trả lời ngắn cho câu hỏi Claude Fable 5.1 giá bao nhiêu là: mỗi triệu token input mới có giá 10 USD, còn mỗi triệu token output có giá 50 USD. Nếu sử dụng prompt caching, lần ghi cache được tính riêng theo thời hạn, còn mỗi triệu token được đọc lại từ cache có giá 0,25 USD.

  • Input cơ bản: 10 USD/MTok, không đổi so với Fable 5.
  • Output: 50 USD/MTok, không đổi.
  • Cache write 5 phút: 12,50 USD/MTok.
  • Cache write một giờ: 20 USD/MTok.
  • Cache read: 0,25 USD/MTok, thay cho 1 USD/MTok của Fable 5.

Mức giảm 75% vì thế chỉ mô tả chênh lệch từ 1 USD xuống 0,25 USD ở dòng cache read. Nó không áp dụng cho input chưa được cache, dữ liệu được ghi vào cache hay token do mô hình tạo ra.

Vì sao tổng hóa đơn không giảm 75%

Tổng hóa đơn Claude Fable 5.1 chỉ giảm ở phần đọc cache, còn input, ghi cache và output giữ nguyên

Tổng phí API là tổng của input mới, cache write, cache read và output. Fable 5.1 chỉ giảm đơn giá của thành phần thứ ba; nếu ứng dụng không dùng prompt caching và lượng token không đổi, chi phí cơ bản khi chuyển từ Fable 5 sang Fable 5.1 cũng không đổi.

Giả sử cache read chiếm 20% hóa đơn Fable 5, giảm 75% riêng thành phần này sẽ làm tổng phí giảm 15%. Đây là phép tính theo tỷ trọng — 20% nhân 75% — chứ không phải mức tiết kiệm mặc định cho mọi yêu cầu.

Output còn là khoản dễ lấn át lợi ích từ cache: một triệu token đầu ra có giá gấp năm lần một triệu token input cơ bản và gấp 200 lần một triệu token cache read. Workload tạo câu trả lời dài vì thế có thể chỉ giảm nhẹ tổng phí, ngay cả khi tái sử dụng được nhiều ngữ cảnh.

Ba hóa đơn mẫu cho chatbot, RAG và agent

Agent nhiều bước Claude Fable 5.1 tái đọc ngữ cảnh đã lưu để giảm phí cache nhưng vẫn trả đủ phí output

Các trường hợp dưới đây là ví dụ giả định trong một kỳ thanh toán. Lượng token được giữ giống nhau giữa hai phiên bản nhằm tách riêng tác động của giá cache read; các con số không phải dự báo cho một hệ thống cụ thể.

Chatbot không dùng cache: với 200.000 token input mới và 50.000 token output, tiền input là 2 USD, tiền output là 2,50 USD, tổng cộng 4,50 USD. Không có cache read nên hóa đơn Fable 5.1 bằng Fable 5.

RAG tái sử dụng ngữ cảnh: giả sử hệ thống dùng 100.000 token input mới, ghi 400.000 token vào cache 5 phút, đọc lại 4 triệu token và tạo 200.000 token output. Trên Fable 5, bốn khoản tương ứng là 1 USD, 5 USD, 4 USD và 10 USD, tổng cộng 20 USD; trên Fable 5.1, phí đọc còn 1 USD và tổng phí giảm xuống 17 USD, tương đương 15%.

Agent nhiều bước: giả sử tác vụ dùng 100.000 token input mới, ghi một triệu token vào cache một giờ, đọc lại 30 triệu token qua nhiều vòng và tạo 200.000 token output. Hóa đơn Fable 5 là 61 USD, gồm 1 USD input, 20 USD cache write, 30 USD cache read và 10 USD output; với Fable 5.1, phí đọc còn 7,50 USD, đưa tổng xuống 38,50 USD — giảm khoảng 36,9%.

Ba ví dụ cho kết quả từ 0% đến khoảng 36,9%, dù đơn giá cache read trong mọi trường hợp đều giảm 75%. Yếu tố quyết định là cache read từng chiếm bao nhiêu trong hóa đơn cũ, không phải chỉ riêng mức giảm của dòng giá này.

Workload hưởng lợi phải đọc lại ngữ cảnh nhiều lần

Lợi ích rõ nhất xuất hiện khi một khối nội dung ổn định được dùng lại qua nhiều yêu cầu: chỉ dẫn hệ thống dài, định nghĩa công cụ của agent, tài liệu nền trong RAG hoặc trạng thái nhiệm vụ mà các bước sau tiếp tục tham chiếu. Số lần đọc lại càng lớn, cache read càng chiếm tỷ trọng cao và mức giảm trên tổng hóa đơn càng tiến gần mức giảm của riêng thành phần đó.

Agent chạy dài thường có điều kiện hưởng lợi hơn chatbot một lượt vì cùng chỉ dẫn, bộ công cụ và ngữ cảnh có thể được gọi lại qua nhiều vòng. RAG cũng hưởng lợi nếu nhiều yêu cầu dùng chung một khối tài liệu; khi nội dung truy xuất thay đổi liên tục, cache hit ít hơn và khoản tiết kiệm thu hẹp.

Cache write tạo ra một chi phí ban đầu cao hơn input cơ bản. Với một triệu token, cache 5 phút có tổng chi phí thấp hơn xử lý hai lần như input mới nếu có một lần đọc lại trong thời hạn; cache một giờ cần ít nhất hai lần đọc lại để thấp hơn chi phí xử lý ba lần như input mới.

Nền tảng hỗ trợ và phần chi phí còn phụ thuộc triển khai

Mã mô hình trên Claude API là claude-fable-5-1. Ngoài các nền tảng trong hồ sơ Claude, thông báo ra mắt của AWS nêu rõ Fable 5.1 có mặt trên Amazon Bedrock qua US Geo CRIS và Global CRIS, trên các endpoint tại AWS GovCloud (US), cũng như Claude Platform on AWS ở Bắc Mỹ.

Đối với khách hàng Việt Nam thanh toán API bằng USD, mức phí cuối cùng còn có thể chịu tác động của tỷ giá, thuế và bảng giá của nền tảng triển khai. Ở thời điểm phát hành, điều có thể kết luận là giá input và output cơ bản của Fable 5.1 không đổi so với Fable 5; mức tiết kiệm thực tế phải được tính từ lượng cache read, cache write và output của từng workload.

Đọc thêm:

Chia sẻ:

Đăng ký bản tin

Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.

0