
Claude, Anthropic Ar-Ge’sinin yüzde 26’sını uçtan uca yürütüyor

Anthropic’in 17 Eylül 2026’da açıkladığı şirket içi ölçüme göre Claude, model araştırma ve geliştirme işlerinin ağırlıklı yüzde 26’sında yüksek seviyeli bir istemden başlayarak görevin çoğunu uçtan uca yürütüyor. Associated Press’in 18 Eylül tarihli haberi, insan gözetiminin bu görevlerde sürdüğünü ve Claude’un ölçülen hiçbir Ar-Ge alanında tamamen özerk çalışmadığını aktarıyor.
Bu nedenle Claude, Anthropic’in sonraki modellerinin geliştirilmesine doğrudan katılıyor; ancak araştırma hedeflerini tek başına seçip sonuçları bağımsız olarak onaylayan ve ardıl modeli kendi başına geliştiren kapalı bir döngü kurmuş değil. 18 Eylül itibarıyla doğrulanan durum, görevlerin büyüyen bir bölümünün Claude’a devredildiği, araştırma yönü ile son kararların ise insanlarda kaldığı.
Yüzde 26, tam özerklik değil “liderlik” düzeyi
R&D Automation Index, otomasyonu AL0’dan AL5’e uzanan altı düzeyde sınıflandırıyor. AL3’te Claude yakın insan yönlendirmesi altında işin büyük parçalarını yapıyor; AL4’te yüksek seviyeli bir istemden sonra görevin çoğunu baştan sona tamamlıyor, fakat insan süreci gözetiyor. AL5 ise döngüde insan bulunmayan tam özerkliği ifade ediyor.
Anthropic’in ölçüm ve yöntem açıklaması, Ağustos 2026’da işlerin yüzde 26’sının AL4 düzeyinde olduğunu, yüzde 90’dan fazlasının en az AL3’e ulaştığını ve hiçbir ölçülen alt kümenin AL5 sayılmadığını belirtiyor. Dolayısıyla başlıktaki “uçtan uca”, belirlenmiş bir görevin yürütülmesini anlatıyor; bütün araştırma programının Claude tarafından bağımsız yönetildiğini değil.
Yüzde 26’nın paydası tüm şirket faaliyetleri, çalışanların yüzde 26’sı veya kod deposunun yüzde 26’sı değil. Endeks, model geliştirme döngüsündeki Ar-Ge görevlerini kapsayan ve bu görevlere ayrıldığı tahmin edilen çalışan zamanına göre ağırlıklandırılan bir iş sepetini ölçüyor. “Anthropic’in dörtte biri insansız çalışıyor” sonucu bu veriden çıkarılamaz.
Yüzde 26, yüzde 90 ve yüzde 80 farklı paydalara sahip
Haberdeki üç oran aynı ilerlemeyi ölçmüyor. Yüzde 26, Claude’un insan gözetiminde görevin çoğunu uçtan uca yürüttüğü AL4 sınıfının ağırlıklı payı. Yüzde 90’dan fazla ise AL3 ve üzerindeki bütün görevleri kapsıyor; dolayısıyla yakın insan yönlendirmesiyle yürütülen çalışmalar ile yüzde 26’lık AL4 kümesini birlikte içeriyor.
Yüzde 80’den fazla olan üçüncü oran ise görev otomasyonuna değil, kod satırlarına ilişkin. Anthropic’in öz-gelişim değerlendirmesine göre Mayıs 2026 itibarıyla üretime birleştirilen ve atıf sistemi tarafından Claude’a bağlanan kod satırlarının yüzde 80’den fazlası model tarafından yazıldı; şirket aynı metinde satır sayısının kalite yerine miktarı ölçtüğünü ve gerçek üretkenlik artışını olduğundan büyük gösterebileceğini kabul ediyor.
- Yüzde 26: Çalışan zamanıyla ağırlıklandırılmış Ar-Ge görevlerinde, insan gözetimi altındaki AL4 “liderlik” payı.
- Yüzde 90’dan fazla: Yakın insan yönlendirmesinin de dahil olduğu AL3 “iş birliği” düzeyi ve üzerindeki görevlerin payı.
- Yüzde 80’den fazla: Mayıs 2026’da üretime birleştirilen ve Claude’a atfedilebilen kod satırlarının payı.
Bu ayrım önemli: çok kod üretmek, doğru araştırma sorusunu seçmek veya yeni bir modelin güvenli ve yayıma hazır olduğuna karar vermekle aynı şey değil. Görev otomasyonu ile kod hacmi, birbirinin yerine kullanılabilecek verim ölçüleri değil.
Endeks şirket içi kayıtlardan üretildi
Endeksin iş sepeti, Temmuz 2026’nın her haftasında model Ar-Ge döngüsündeki bölümlerin çalışanlarından rastgele yüzde 20’lik örnekler alınarak oluşturuldu. Claude ajanları Slack ve iç dokümanlardan yaklaşık 15 bin ayrıntılı görev çıkardı; görevler 542 düğümlü bir hiyerarşide toplandı ve kategoriler tahmini çalışan zamanına göre ağırlıklandırıldı.
Otomasyon derecesini belirlemek için bir Claude ajanı her görev kategorisine ilişkin kanıtları derledi, ayrı bir Claude hakem ise altı düzeyden birini atadı. Alan sahipleri de modelin kanıtlarını ve kararını görmeden değerlendirme yaptı. Model ile insanın tam düzey uyumu yüzde 59, iki insan değerlendiricinin kendi arasındaki tam uyumu yüzde 35 oldu; model ve insan kararlarının yüzde 97’si en fazla bir düzey farklıydı.
Bu karşılaştırma sınırdaki sınıflandırmaları görünür kılıyor, fakat ölçümü bağımsız bir kıyaslamaya dönüştürmüyor. Görev sepetini kuran, iç kayıtlara erişen ve değerlendirme modelini çalıştıran taraf Anthropic. Ayrıca aynı model ailesinin kendi kullanımını değerlendirmesi, benzer hataların hem işi yapan hem de puanlayan sistemde tekrarlanması riskini taşıyor.
İnsanlar yönü, ölçütleri ve son kararı belirliyor
AL4 görevlerinde insanın rolü yalnızca sonucu beklemek değil. İnsan araştırmacılar yüksek seviyeli istemi veriyor, yürütmeyi gözetiyor ve ortaya çıkan sonucu değerlendiriyor. Hangi problemin araştırılacağı, hangi bulgunun güvenilir sayılacağı, başarısız bir yaklaşımın ne zaman bırakılacağı ve bir modelin kullanıma hazır olup olmadığı da insan muhakemesine bağlı kalıyor.
Claude’un uygulama, kodlama veya deney döngüsünün uzun bir bölümünü tamamlaması bu ayrımı ortadan kaldırmıyor. Model, kendisine verilen hedef doğrultusunda yöntemi seçebilir ve sonuç üretebilir; mevcut veriler, araştırma gündemini bütünüyle kendisinin kurduğunu ya da çıktısını bağımsız biçimde doğruladığını göstermiyor.
Bağımsız doğrulama henüz yok
Şirket içi zaman serisi, AL4 düzeyindeki payın Şubat 2026’da yüzde 1’in altındayken Ağustos’ta yüzde 26’ya çıktığını gösteriyor. Ancak ortak bir yöntem bulunmadığı ve başka laboratuvarlardan karşılaştırılabilir sonuçlar yayımlanmadığı için bu veri sektör çapında bir sıralama olarak kullanılamaz.
Mevcut tablo, Claude’un Anthropic’in gelecekteki modellerini geliştiren süreçte büyük ve hızla artan bir operasyonel rol üstlendiğini gösteriyor. Bunun Claude’un kendi ardılını bağımsız biçimde geliştirdiği anlamına gelmesi için araştırma yönünün seçimi, sonuçların doğrulanması ve yeni model üzerindeki nihai karar gibi aşamaların da insanlardan devralındığını gösteren, dışarıdan yeniden üretilebilir kanıtlar gerekiyor; yayımlanan ölçüm henüz bu eşiği karşılamıyor.
Ayrıca okuyun:
İlgili makaleler


Claude, Fermat teoremini 11 günde resmileştirdi; yeni ispat bulmadı

Claude, Fermat teoremini Lean’de doğruladı: yeni bir ispat değil

Claude’un ticaret ajanı şablonu açık: Sepet yetkisi sınırlandırılabiliyor

Beeline MCP açıldı: taşeron iş gücü verisine tek denetimli kapı

Claude’un kötüye kullanımı yedi alana yayıldı: Anthropic hesapları kapattı
Bültenimize abone olun
En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.