Claude Opus 5.5 aynı işi daha az kodla yapıyor; maliyet yüzde 40 düşüyor

|Yazar: QUASA Editör Ekibi|5 dk okuma| 3
Claude Opus 5.5 aynı işi daha az kodla yapıyor; maliyet yüzde 40 düşüyor

Anthropic’in 22 Eylül 2026 tarihli ürün açıklamasına göre Claude Opus 5.5 kullanıma açıldı; Opus 5’e kıyasla tokenla faturalandırılan tipik işlerde tahmini görev maliyeti yüzde 40 düşüyor, standart API’de milyon giriş tokenı 4 dolar, milyon çıkış tokenı 20 dolar. Türkiye’de Claude API veya Claude Code kullanan ekipler için bu, yeni bir model ve daha düşük birim fiyat anlamına geliyor; her görevin faturasında aynı indirimi garanti etmiyor.

Sonar’ın Java değerlendirmesinde Opus 5.5 High, Opus 5 Thinking’e karşı aynı 4.444 görevde 916.813 yerine 664.890 satır kod üreterek kod miktarını yüzde 27,5 ve çıktı tokenlarını yüzde 40 azalttı; çalıştırılabilir testleri bulunan 544 görevde geçme oranı ise yüzde 87,68 ile önceki sürümün yüzde 88,6 sonucunun altında kaldı. Çıktı tokenlarındaki düşüş, üreticinin görev başına dolar hesabıyla aynı ölçü değil.

Token tarifesi ile görev maliyeti nasıl ayrılıyor?

Giriş ve çıkış tokenlarının fiyatı, her isteğin birim tarifesidir. Görev maliyeti ise tamamlanmış iş boyunca gönderilen bağlamı, üretilen yanıtı ve varsa önbellekten okunan veriyi kapsayan faturadır. Bir kodlama ajanı aynı talep için daha az çıktı üretirse veya daha az yinelemeye ihtiyaç duyarsa, toplam gider yalnızca tarife indiriminden fazla düşebilir. Bu mekanizma, üreticinin tipik iş yükleri için verdiği maliyet tahmininin temelidir.

Önbellek okumaları da özellikle uzun süren ajan oturumlarında önem taşır: daha önce işlenmiş bağlam yeniden kullanıldığında farklı bir fiyat kalemi devreye girer. Bu kalemdeki indirim, normal giriş ve çıkış tokenlarındaki indirimden daha büyüktür. Dolayısıyla önbelleği yoğun kullanan bir iş ile her seferinde yeni bağlam gönderen işin tasarrufu aynı olmaz. Tarifedeki değişim sabittir; işin tüketim bileşimi ise görevden göreve değişir.

Claude Code oturumunun veya API üzerinden yürütülen bir işlemin gerçek faturası, araç çağrıları ve düzeltme turlarıyla da şekillenir. Kısa bir ilk yanıtın ardından başarısız kodu yeniden üretmek gerekiyorsa, yalnızca ilk yanıtın ucuzlaması tamamlanan işi ucuzlatmayabilir. Abonelik bedeli ve kullanım sınırları da token tarifesinden ayrı kavramlardır. Başlıktaki tasarruf, üreticinin tokenla faturalandırılan tipik görevleri için verdiği tahmindir; tüm planların ücretine uygulanacak genel bir indirim değildir.

Üreticinin kodlama ve mesleki iş testleri ne söylüyor?

Anthropic’in yayımladığı karşılaştırmada Opus 5.5, çok adımlı kodlama testi Terminal-Bench 4.0’da yüzde 66,4, Opus 5 yüzde 52,3 sonuç aldı; mesleki bilgi işi ölçümü GDPval-AA v2.1’de puanlar sırasıyla 1846 ve 1708 oldu. Bu sayılar, üreticinin yayımladığı değerlendirme ortamlarında yeni modelin üstünlüğünü gösteriyor. Bu testler tamamlanan ajan görevlerini veya değerlendirilen iş çıktısını ölçüyor; kısa Java çözümlerinin test geçme oranını değil.

Terminal üzerinden yürüyen çok adımlı bir kodlama işinde model yalnızca kod yazmaz. Araçları çağırır, aldığı sonuçlara göre planını değiştirebilir ve hatayı gidermek için yeniden deneyebilir. Bu yüzden yüksek görev tamamlama puanı, her tekil kod parçasının daha az hatalı olduğunu kanıtlamaz. Mesleki iş puanı da Java kodunun doğruluğuna çevrilemez; değerlendirilen çıktı türü ve başarı ölçütü başkadır.

Duyurudaki bazı karşılaştırmalarda modelin düşünme düzeyleri de aynı tutulmuyor; yüksek çaba ayarındaki sonuçları varsayılan ayarda oluşan maliyetle tek bir performans ve fiyat oranına dönüştürmek yanıltıcı olur. Duyuru, kıyaslamalardaki küçük farkların gerçek kullanım farkını her zaman güvenilir biçimde yansıtmayabileceğini de belirtiyor. Bu çekince, maliyet iddiasını geçersiz kılmıyor; iddianın kapsamını tipik, tokenla faturalandırılan işlerle sınırlıyor.

Bağımsız Java testi neden daha temkinli bir tablo çiziyor?

Bağımsız ölçümde kod hacmi ile işlevsel başarı farklı görev kapsamlarından geliyor. HumanEval ve MBPP içindeki çalıştırılabilir testli çözümler geçme oranına girerken ComplexCodeEval çıktıları kod analizine katılıyor, fakat o orana girmiyor. Böylece daha az toplam satır üretilmesi ile test başarısının artmaması aynı anda mümkün. Kod miktarı tüm görevlerin toplu sonucu; her tekil görevde yeni sürümün daha kısa yanıt verdiği iddiası değil.

Statik analiz de tek yönde ilerlemiyor. Daha kısa çıktı üzerinde toplam bulgu sayısı ve güvenlik açığı yoğunluğu azalırken, satır başına hata yoğunluğu yükseliyor. Toplam bulgu, bir ekibin inceleyeceği olası sorun yükünü anlatır; yoğunluk ise yazılan kodun birim başına profilini gösterir. Bunların hiçbiri çalıştırılabilir testlerin yerine geçmez. Kodun kısa olması okuma yükünü azaltabilir, fakat doğru çalıştığını veya bakımı kolaylaştırdığını kendi başına kanıtlamaz.

Ölçümün kurulumu da sonucun sınırıdır. Yeni sürümün High ayarı, önceki sürümün Thinking ayarıyla karşılaştırıldı ve dil Java idi. Ayrıca rakamlar piyasaya çıkmadan önce sağlanan bir derlemeden elde edildi. Bu nedenle sonuç, genel kullanıma açılmış sürümün bütün programlama dillerindeki davranışı ya da her Claude Code iş akışının faturası olarak okunamaz. Yine de aynı Java görev havuzunda daha kısa çıktı ile biraz daha düşük test geçme oranının birlikte görülmesi, maliyet ve doğruluğu ayrı değerlendirmek için somut bir karşılaştırma sunuyor.

Şu anda hangi sonuç kesin, hangisi açık?

Claude Opus 5.5 yayımlandı ve standart token tarifesi önceki Opus sürümünden düşük. Üreticinin tipik görevler için açıkladığı maliyet azalması bir tahmin; bağımsız Java değerlendirmesi ise aynı görev kümesinde kod hacminin düştüğünü, test geçme oranının yükselmediğini gösteriyor. Bunlar çelişkili sonuçlar değil, farklı paydaları olan ölçümler. Java çalışmasındaki çıktı tokenı verisi maliyet mekanizmasını desteklese de tek başına tam fatura veya kabul edilmiş iş başına gider hesabı vermiyor.

Açık kalan nokta, yayımlanmış sürümün gerçek ekip işlerinde aynı anda ne kadar harcama ve ne kadar kabul edilebilir çıktı ürettiği. Ön sürümle yapılan Java ölçümünün genel kullanımdaki modelle yenilenmesi bu boşluğun bir bölümünü doldurabilir; mesleki işler içinse görev başına bedel ve kabul oranının birlikte raporlanması gerekir. Eldeki kanıt, daha az kod ile daha düşük tipik maliyet vaadini destekliyor, fakat bunlardan daha yüksek işlevsel doğruluk sonucu çıkarmıyor.

Ayrıca okuyun:

Paylaş:

Bültenimize abone olun

En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.

0