Claude Fable 5.1 memangkas biaya cache 75%—API lama bisa kena error 400

Catatan rilis Claude Platform menyatakan bahwa Anthropic meluncurkan Claude Fable 5.1 pada 1 September 2026 dengan cache read US$0,25 per juta token, 75% lebih murah dibandingkan tarif model sebelumnya, serta memperingatkan bahwa tool_choice jenis any dan tool menghasilkan error 400.
Model tersebut sudah tersedia melalui Claude API dan sejumlah platform cloud. Laporan Axios pada hari peluncuran mencatat ketersediaan umum Fable 5.1, harga dasar US$10 per juta token input dan US$50 per juta token output, serta pembatasan Mythos 5.1 bagi mitra yang telah diverifikasi.
Diskon 75% hanya berlaku untuk cache read

Spesifikasi resmi Claude Fable 5.1 mencantumkan model ID claude-fable-5-1, context window satu juta token, keluaran maksimum 128.000 token, dan adaptive thinking yang selalu aktif. Halaman yang sama menetapkan cache write lima menit seharga US$12,50 per juta token, cache write satu jam US$20, serta status model aktif di Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry, dan Claude Platform on AWS.
Artinya, angka 75% tidak dapat diterapkan langsung pada seluruh tagihan. Tarif input baru, output, dan penulisan cache tidak memperoleh potongan yang sama; besar penghematan akhirnya bergantung pada berapa banyak konteks yang benar-benar dibaca kembali dari cache.
Sebagai contoh bersyarat, anggap satu putaran percakapan membaca ulang 500.000 token cache dan menambahkan 50.000 token input baru. Dengan tarif model sebelumnya, cache read bernilai US$0,50 dan input baru US$0,50, sehingga komponen input berjumlah US$1.
Pada Fable 5.1, cache read dalam contoh itu turun menjadi US$0,125, sedangkan input baru tetap US$0,50. Total komponen input menjadi US$0,625 atau 37,5% lebih rendah. Biaya output, cache write, cache miss, dan percobaan ulang masih harus ditambahkan, sehingga beban dengan sedikit cache hit akan memperoleh penghematan total yang lebih kecil.
Konfigurasi tool lama dapat langsung ditolak

Perubahan kompatibilitas paling tegas menyangkut pemilihan tool secara paksa. Permintaan yang mengirim tool_choice dengan tipe any atau tool tidak dijalankan oleh Fable 5.1, melainkan ditolak dengan HTTP 400. Tipe auto dan none tetap didukung.
Perubahan ini penting bagi aplikasi yang selama ini memaksa model memilih sebuah fungsi atau fungsi tertentu. Mengganti ID model tanpa mengubah payload dapat membuat jalur tersebut berhenti sebelum inferensi berlangsung. Jika aplikasi membutuhkan argumen yang mengikuti skema, dokumentasi Anthropic mengarahkan pengembang ke strict tool use atau structured outputs, tetapi perilakunya tetap perlu diuji terhadap kebutuhan aplikasi.
Thinking block juga tidak kompatibel sepenuhnya ke arah model lama. Fable 5.1 dapat menerima blok dari Fable 5, Opus 5, Mythos 5, dan model Claude terdahulu, sedangkan model yang lebih lama tidak dapat membaca blok yang dibuat Fable 5.1. Saat blok baru diputar ulang ke model lama, API dapat membuangnya; karena itu, jalur fallback perlu diuji terpisah dari migrasi utama.
Untuk akun yang dibuat pada atau setelah 31 Agustus 2026, perubahan pada system prompt, definisi tools, atau pesan sebelumnya juga dapat membuat thinking block yang diputar ulang ditolak dengan error 400. Kasus ini berbeda dari downgrade model: penolakan terjadi karena riwayat sebelum blok tidak lagi identik.
Checklist migrasi sebelum trafik produksi dipindahkan

Pemeriksaan migrasi perlu menggunakan payload dan riwayat percakapan yang benar-benar muncul di produksi. Lima langkah berikut memisahkan risiko validitas request, kesinambungan percakapan, dan perubahan biaya:
- Ganti model ID di lingkungan uji menjadi claude-fable-5-1, lalu periksa pemetaan ID untuk setiap penyedia cloud yang digunakan.
- Telusuri semua nilai tool_choice. Hapus tipe any dan tool, kemudian pastikan penggantinya tetap menghasilkan alur pemanggilan tool yang diperlukan aplikasi.
- Putar ulang riwayat yang memuat thinking block, termasuk percakapan dari model sebelumnya, fallback setelah respons Fable 5.1, dan riwayat yang system prompt, tools, atau pesan terdahulunya pernah diubah.
- Verifikasi cache hit pada beban nyata. Catat cache creation, cache read, input baru, dan output secara terpisah agar diskon cache tidak dilaporkan sebagai penghematan seluruh permintaan.
- Hitung ulang biaya percakapan panjang dengan distribusi token produksi, masa berlaku cache, cache miss, batas output aplikasi, serta retry akibat request yang ditolak.
Peluncuran bertahap dapat membatasi dampak konfigurasi lama yang belum terdeteksi. Tim dapat memantau respons 400 menurut bentuk request, jumlah token cache yang dibuat dan dibaca, total token input-output, retry, serta keberhasilan pemanggilan tool sebelum memperbesar porsi trafik.
Status migrasi setelah peluncuran
Fable 5.1 telah aktif dan tersedia luas, tetapi manfaat ekonominya tidak seragam untuk semua aplikasi. Beban percakapan panjang dengan konteks stabil dan cache hit tinggi berpeluang merasakan penurunan lebih besar daripada alur yang sering mengubah prompt atau jarang menggunakan ulang konteks.
Sebelum migrasi penuh, hasil pengujian perlu memperlihatkan bahwa ID model sudah benar, payload tidak lagi memakai pemilihan tool yang ditolak, thinking block tetap dapat digunakan pada seluruh jalur yang direncanakan, dan proyeksi biaya memasukkan cache write, cache read, input baru, serta output. Yang masih harus ditentukan oleh tiap tim bukan ketersediaan model, melainkan kompatibilitas riwayat dan penghematan riil pada pola trafiknya sendiri.
Baca juga:
Berlangganan buletin kami
Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.