Claude Fable 5.1 giảm 75% giá đọc cache, nhưng có ba thay đổi phá vỡ

Anthropic phát hành Claude Fable 5.1 ngày 1/9/2026 và cung cấp model rộng rãi qua Claude API cùng các nền tảng đối tác. Axios xác nhận đợt phát hành giữ giá cơ bản ở mức 10 USD cho một triệu token đầu vào và 50 USD cho đầu ra, đồng thời giảm 75% chi phí đọc nội dung đã lưu trong prompt cache.
Trong đợt phát hành ngày 1/9/2026, Claude Fable 5.1 có model ID claude-fable-5-1, cửa sổ ngữ cảnh một triệu token và đầu ra tối đa 128.000 token. Tuy nhiên, tài liệu kỹ thuật của Claude Platform nêu ba thay đổi gây mất tương thích khi chuyển từ Fable 5: không hỗ trợ ép gọi công cụ, model cũ không đọc được thinking blocks của 5.1 và việc sửa phần lịch sử trước một thinking block có thể làm block đó mất hiệu lực.
Cache read rẻ hơn, nhưng giá nền không đổi

Giá đọc cache của Fable 5.1 là 0,25 USD cho mỗi triệu token, bằng một phần tư mức 1 USD của Fable 5. Giá ghi cache trong năm phút vẫn là 12,50 USD, ghi trong một giờ là 20 USD; giá input và output cũng không đổi. Như vậy, con số 75% trong đợt phát hành chỉ áp dụng cho cache read, không phải toàn bộ hóa đơn API.
Thay đổi này có lợi nhất cho tác nhân chạy dài, nơi cùng một tiền tố ổn định — gồm system prompt, định nghĩa công cụ, tài liệu tham chiếu hoặc phần lịch sử không đổi — được đọc lại qua nhiều lượt. Trong một ví dụ điều kiện, một triệu token cache được đọc mười lần sẽ tốn 2,50 USD thay vì 10 USD; phần input mới, cache write và output vẫn được tính riêng.
Mức tiết kiệm tổng thể vì thế phụ thuộc vào tỷ trọng cache read trong workload. Nếu ứng dụng thường xuyên thay đổi tiền tố, tạo nhiều token đầu ra hoặc khiến cache không khớp, phần giảm trên hóa đơn sẽ thấp hơn đáng kể so với 75%.
Nâng cấp nhắm vào tác nhân chạy dài

Fable 5.1 được định vị cho lập trình tác nhân kéo dài nhiều giờ, nghiên cứu nhiều bước, xử lý tài liệu, bảng tính và slide. Model cũng duy trì adaptive thinking luôn bật, cho phép điều chỉnh mức effort và làm việc trên toàn bộ cửa sổ ngữ cảnh một triệu token.
Bản tin của ITPro ghi nhận model đã có trên API và một số nền tảng đám mây, đồng thời dẫn ước tính của Anthropic rằng workload thông thường có thể rẻ hơn khoảng 25%, còn tác vụ mang tính tác nhân có thể tiết kiệm tới khoảng 45%. Đây là ước tính của nhà cung cấp, không phải mức giảm được bảo đảm cho mọi hệ thống.
Khả năng tốt hơn cũng không đồng nghĩa hành vi hoàn toàn giống Fable 5. Trong vòng lặp tác nhân, Fable 5.1 có thể thực hiện một tool call mỗi lượt ở những tình huống mà phiên bản trước từng gom nhiều lệnh độc lập; điều đó có thể làm tăng số vòng, độ trễ và lượng token. Các đội đang dựa vào cách gọi song song cần đưa hành vi này vào tập đánh giá trước khi chuyển.
Ba điểm mất tương thích nằm ở tool use và thinking blocks

Thứ nhất, forced tool use không còn được hỗ trợ. Request đặt tool_choice thành any hoặc chỉ định một công cụ cụ thể sẽ nhận lỗi 400 invalid_request_error. Hai chế độ auto và none vẫn hoạt động; nếu cần đầu ra đúng schema, ứng dụng có thể kết hợp auto với strict tool use hoặc chuyển schema sang structured outputs.
Thứ hai, thinking blocks chỉ tương thích theo một chiều. Fable 5.1 đọc được block do model Claude cũ tạo, nhưng Fable 5, Opus 5 và các model trước đó không đọc được block của Fable 5.1. Khi router hoặc cơ chế fallback đưa một cuộc hội thoại trở lại model cũ, API loại block không tương thích trước khi model nhận request; block bị loại không được tính vào input token, nhưng trạng thái suy luận tương ứng cũng không còn.
Thứ ba, sửa tiền tố hội thoại có thể vô hiệu hóa thinking blocks phía sau. Thay đổi system prompt, danh sách tools hoặc một lượt trước đó trong khi vẫn giữ block về sau có thể khiến request kế tiếp bị từ chối với lỗi 400. Rủi ro xuất hiện ở những agent tự dựng lại mảng messages, chèn rồi xóa lời nhắc theo lượt hoặc tải lại một tài liệu có cùng URL nhưng nội dung byte đã đổi.
Cách an toàn là coi lịch sử chứa thinking blocks như dữ liệu chỉ được nối thêm. Nếu hệ thống buộc phải sửa hoặc tóm tắt lịch sử ở phía client, nó cần bỏ các thinking blocks không còn hợp lệ và bắt đầu phần tiếp theo từ bản tóm tắt văn bản đã được kiểm tra.
Checklist hồi quy trước khi đổi model ID
- Tạo cấu hình thử nghiệm với claude-fable-5-1 nhưng giữ nguyên prompt, tool schema và chính sách cắt lịch sử, để kết quả không bị lẫn với những thay đổi khác.
- Quét request để tìm tool_choice loại any hoặc tool. Chuyển sang auto cùng strict schema hoặc structured outputs, rồi thử cả trường hợp phải gọi công cụ và trường hợp được phép trả lời bằng văn bản.
- Chạy phiên nhiều lượt có tool call, compaction, tóm tắt phía client và thay đổi effort. Kiểm tra rằng lịch sử được nối thêm, thinking blocks được gửi trả nguyên trạng và lỗi liên quan đến tiền tố được ghi lại.
- Thử router theo cả hai chiều. Khi fallback từ Fable 5.1 về model cũ, không giả định thinking blocks của 5.1 còn dùng được; nếu cần duy trì nhiệm vụ, tạo nhánh hội thoại mới từ một bản tóm tắt văn bản.
- Đo riêng cache write, cache read, input mới, output, số lượt gọi công cụ và độ trễ. So sánh tổng chi phí thay vì áp mức giảm 75% của cache read cho toàn workload.
- Chỉ đổi model ID trong môi trường sản xuất sau khi tập eval đạt ngưỡng hiện hành. Kịch bản rollback phải khôi phục cả model lẫn lịch sử tương thích, không chỉ thay tên model trong một phiên đã chứa thinking blocks của 5.1.
Điều đã rõ sau đợt phát hành
Claude Fable 5.1 đã được phát hành rộng rãi với giá input và output giữ nguyên, còn lợi ích chi phí tập trung vào các hệ thống tái sử dụng cache ổn định. Ba thay đổi phá vỡ đều có hậu quả cụ thể ở tầng tích hợp API, vì vậy việc thay model ID đơn thuần không đủ với ứng dụng dùng forced tool choice, fallback giữa các model hoặc chỉnh sửa lịch sử hội thoại.
Điều chưa thể xác định từ bảng giá là một ứng dụng cụ thể sẽ tiết kiệm bao nhiêu và có phát sinh thêm bao nhiêu lượt gọi công cụ. Hai kết quả này phụ thuộc vào cache hit, cấu trúc hội thoại và hành vi của agent trên lưu lượng thực tế; chúng chỉ rõ sau khi đội vận hành chạy lại eval và thử đầy đủ đường rollback.
Đọc thêm:
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.