Claude Ar-Ge işlerinin yüzde 26’sını yönetiyor; özerklik hâlâ insan gözetiminde

|Yazar: QUASA Editör Ekibi|4 dk okuma
Claude Ar-Ge işlerinin yüzde 26’sını yönetiyor; özerklik hâlâ insan gözetiminde

Anthropic’in 17 Eylül 2026’da yayımladığı şirket içi ölçüme göre Claude, ağustosta yapay zekâ Ar-Ge işlerinin yüzde 26’sını AL4 düzeyinde yönetti. Bu düzey, modelin yüksek seviyeli bir komutla görevin çoğunu uçtan uca yürütmesini ifade ediyor; insan denetimi ve uygulama kararı devam ediyor.

Associated Press’in 18 Eylül tarihli haberi de yüzde 26’lık payı insan gözetimi altında yürütülen işler olarak aktarıyor ve Claude’un tamamen özerk çalışmadığını belirtiyor. Kısa yanıt şu: Claude, kendisinden sonraki modellerin geliştirilmesine kayda değer ölçüde katılıyor, fakat halefini bağımsız biçimde tasarlayıp devreye alan bir sistem değil.

Yüzde 26 yönetmeyi, yüzde 90 iş birliğini ölçüyor

İki oran aynı özerklik eşiğine ait değil. Kullanılan altı basamaklı ölçekte AL0, yapay zekânın göreve hiç katılmadığı durumu; AL5 ise döngüde zorunlu bir insan olmadan tam özerk çalışmayı gösteriyor. AL3 “iş birliği”, AL4 ise “yönetme” olarak adlandırılıyor.

AL3 düzeyinde model, yakın insan yönlendirmesi altında işin büyük parçalarını üstlenebiliyor. İnsan görevin bağlamını veriyor, olası sorunu tarif ediyor ve beklenmedik bir engelde nasıl ilerlenmesi gerektiğine karar veriyor. Ağustosta ölçülen işlerin yüzde 90’dan fazlası en az bu düzeydeydi; bu oran, Claude’un işlerin yüzde 90’ını tek başına tamamladığı anlamına gelmiyor.

AL4’te insanın sürekli yönlendirmesi azalıyor. Model yüksek seviyeli komutu aldıktan sonra görevin çoğunu yürütebiliyor, ara sorunları çözebiliyor ve sonucu incelemeye hazırlayabiliyor. Yine de nihai değişikliği kabul etme, üretime alma veya araştırmanın yönünü değiştirme yetkisi insanda kalıyor; başlıktaki yüzde 26 bu daha yüksek eşiğe ulaşan ağırlıklandırılmış iş payını anlatıyor.

AL5’in farkı yalnızca daha uzun süre çalışmak değil. Tam özerklik düzeyinde sistemin sorunu kendisinin fark etmesi, görevi tanımlaması, çözümü uygulaması ve insanın zorunlu müdahalesi olmadan devreye alması gerekiyor. Ağustos ölçümünde hiçbir Ar-Ge iş grubu bu düzeye ulaşmadı.

Şubattan ağustosa sıçrama var, fakat yetki devri yok

Claude’un AL4 düzeyinde yönettiği ağırlıklandırılmış iş payı Şubat 2026’da yüzde 1’in altındayken ağustosta yüzde 26’ya yükseldi. Değişim, modelin yalnızca öneri üreten bir yardımcı olmaktan çıkıp bazı araştırma ve mühendislik görevlerinin büyük bölümünü sürdürebildiğini gösteriyor.

Bu artış, kurumsal hedeflerin Claude tarafından belirlendiği anlamına gelmiyor. Hangi problemin ele alınacağı, hangi modelin geliştirileceği, elde edilen sonucun yeterli sayılıp sayılmayacağı ve bir değişikliğin gerçek sistemlere uygulanıp uygulanmayacağı insan kararına bağlı. “Yönetme” burada kurumsal otoriteyi değil, sınırları insan tarafından çizilmiş bir görevin icrasındaki rolü tanımlıyor.

“Kendi kendini geliştirme” ifadesinin iki anlamı da bu nedenle ayrılmalı. Geniş anlamda Claude, gelecek modelleri ortaya çıkaran kodlama, deney ve altyapı çalışmalarına katkı sağlıyor. Özyinelemeli ve tam özerk gelişim ise bir modelin halefini insan müdahalesi olmadan üretmesini ve süreci yeni sistemle yinelemesini gerektiriyor; açıklanan ölçümler bu eşiğin aşıldığını göstermiyor.

Endeks şirket içi kayıtları Claude ile sınıflandırıyor

Endeks, model Ar-Ge döngüsündeki iş türlerinin haritalanması, her türün otomasyon düzeyinin puanlanması ve çalışanların ayırdığı zamana göre ağırlıklandırılmasıyla oluşturuldu. Görev listesi, Temmuz 2026 boyunca ilgili bölümlerdeki çalışanların haftalık rastgele örneklerinden; Slack kayıtları ve kurum içi belgeler incelenerek çıkarıldı.

Değerlendirme zincirinde Claude da yer aldı. Bir Claude araştırma ajanı iş türlerinin nasıl yürütüldüğüne ilişkin kanıt topladı, ayrı bir Claude hakem ise bunları altı otomasyon düzeyinden biriyle sınıflandırdı. İlgili alanlardan sorumlu çalışanlar da modelin kanıtlarını ve puanını görmeden kendi değerlendirmelerini yaptı.

Model ile insan değerlendirmelerinin aynı düzeyde buluşma oranı yüzde 59, iki insan değerlendirici arasındaki tam eşleşme yüzde 35 oldu; değerlendirmelerin yüzde 97’si en fazla bir basamak ayrıştı. Bu sonuç, sınıflandırmanın bütünüyle mekanik olmadığını gösteriyor: özellikle AL3 ile AL4 arasındaki sınır, benzer bir iş için farklı değerlendiricilerce ayrı yorumlanabiliyor.

Endeks ayrıca Temmuz 2026’daki iş dağılımına dayanan sabit bir görev sepeti kullanıyor. Bu tercih zaman içindeki değişimi karşılaştırılabilir kılıyor, ancak daha sonra ortaya çıkan yeni iş türlerini otomatik olarak kapsadığı anlamına gelmiyor. Dolayısıyla yüzde 26, şirketin bütün araştırma faaliyetlerinin tartışmasız ve doğrudan sayımı değil; tanımlanmış sepet üzerinden hesaplanan ağırlıklandırılmış bir otomasyon göstergesi.

Bağımsız doğrulama henüz yapılmadı

MIXED’in yöntem incelemesi, yüzde 26 ve yüzde 90’dan yüksek oranların Anthropic tarafından Claude’un yardımıyla üretildiğini ve bağımsız biçimde doğrulanmadığını vurguluyor. Başka laboratuvarlar aynı yöntemle karşılaştırılabilir sonuçlar yayımlamadığı için veriler, Claude’un rakip sistemlere göre konumunu da göstermiyor.

Yöntemin temel zayıflıklarından biri, aynı model ailesinin hem işlere katılması hem de otomasyon düzeylerinin belirlenmesine yardım etmesi. Hakem model, değerlendirdiği sistemle benzer hataları tekrarlayabilir. İnsan puanlaması bu riski görünür kılıyor, fakat dışarıdan yürütülmüş bağımsız bir denetimin yerini tutmuyor.

Planlanan sonraki adım, kurum içi süreçlere ve verilere erişebilen bağımsız üçüncü taraf değerlendiricilerin ölçümleri izlemesi. Bu çalışma henüz tamamlanmış bir dış doğrulama değil. Şimdilik doğrulanabilen sonuç, Claude’un tanımlı Ar-Ge görevlerinin önemli bir bölümünü insan incelemesine kadar taşıyabildiği; tam özerkliğin ise ölçülen hiçbir alanda gösterilmediği.

Ayrıca okuyun:

Paylaş:

Bültenimize abone olun

En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.

0