Claude memimpin 26% R&D Anthropic—belum sepenuhnya mandiri

|Penulis: Tim Redaksi QUASA|5 mnt baca| 4
Claude memimpin 26% R&D Anthropic—belum sepenuhnya mandiri

Pada 17 September 2026, pengukuran resmi Anthropic menyatakan bahwa Claude “memimpin” 26% pekerjaan riset dan pengembangan AI yang diukur per Agustus. Lebih dari 90% pekerjaan mencapai setidaknya tingkat kolaborasi dengan AI, tetapi tidak satu pun bagian yang diukur telah berjalan sepenuhnya otonom.

Associated Press pada 18 September menggambarkan temuan itu sebagai Claude yang membantu Anthropic mengembangkan versi berikutnya. Klaim tersebut benar dalam arti Claude mengerjakan bagian nyata dari proses R&D, tetapi manusia masih menetapkan tujuan, mengawasi hasil, dan memegang keputusan akhir.

“Memimpin” tetap mencakup pengawasan manusia

Angka 26% berasal dari Anthropic R&D Automation Index, sebuah indeks prototipe yang menilai pekerjaan pada enam tingkat, AL0 hingga AL5. AL0 berarti tidak ada keterlibatan AI, sedangkan AL5 berarti AI bekerja sepenuhnya secara otonom tanpa manusia di dalam rangkaian kerja.

Pada AL3, atau AI berkolaborasi, Claude dapat mengerjakan bagian besar suatu tugas di bawah arahan dekat manusia. Karena lebih dari 90% pekerjaan berada pada AL3 atau lebih tinggi, angka itu menunjukkan luasnya keterlibatan Claude—bukan bahwa model menyelesaikan lebih dari 90% pekerjaan seorang diri.

Angka 26% merujuk pada AL4, atau AI memimpin. Pada tingkat ini, Claude dapat menyelesaikan sebagian besar tugas dari awal hingga akhir setelah menerima instruksi tingkat tinggi, sementara manusia tetap mengawasi. Contoh yang diberikan Anthropic menunjukkan bahwa model dapat menyelidiki dan menguji perbaikan perangkat lunak, tetapi keputusan untuk menerapkannya tetap berada pada insinyur.

Perbedaan dengan AL5 karena itu bersifat substantif. Sistem yang sepenuhnya otonom tidak perlu menunggu manusia menemukan masalah, menentukan ruang lingkup tugas, atau menyetujui penerapan hasilnya; Anthropic menyatakan belum ada bagian R&D terukur yang mencapai tingkat tersebut.

Denominatornya adalah keranjang tugas berbobot waktu

Persentase tersebut tidak dihitung dari jumlah baris kode, percakapan dengan Claude, atau seluruh kegiatan Anthropic. Untuk membangun keranjang pekerjaan, perusahaan mengambil sampel acak 20% staf dari setiap departemen dalam lingkar pengembangan model pada setiap pekan selama Juli 2026, lalu menelaah catatan Slack dan dokumentasi internal mereka.

Proses itu menghasilkan sekitar 15.000 tugas granular. Claude menyusunnya menjadi pohon dengan 542 simpul, termasuk 378 kategori paling rinci seperti diagnosis masalah platform evaluasi, kebijakan jaringan bagi lingkungan reinforcement learning, dan evaluasi insiden layanan. Keranjang tersebut kemudian dibekukan agar pengukuran bulanan membandingkan jenis pekerjaan yang sama.

Agen Claude meneliti bagaimana setiap kategori dikerjakan, lalu model Claude lain menilai tingkat otomatisasinya. Bobot setiap tugas didasarkan pada perkiraan waktu manusia: setiap orang memperoleh satu unit bobot per pekan yang dibagi rata di antara tugas yang mereka kerjakan. Dengan demikian, 26% berarti 26% dari keranjang pekerjaan R&D AI berbobot waktu manusia mencapai AL4—bukan 26% dari seluruh proses penciptaan satu model.

Metode ini juga memakai Claude untuk menilai pekerjaan Claude, sehingga kesalahan kedua model dapat berkorelasi. Dalam pemeriksaan internal, kesepakatan tepat antara penilai model dan manusia mencapai 59%, dibandingkan 35% antarmanusia; penilaian model dan manusia terpaut paling banyak satu tingkat dalam 97% kasus. Hasil itu menunjukkan konsistensi relatif, tetapi batas antara “berkolaborasi” dan “memimpin” tetap mengandung pertimbangan subjektif.

Tiga metrik tidak mengukur hal yang sama

Automation Index hanya satu dari tiga kelompok pengukuran yang diperkenalkan Anthropic. Kelompok kedua menilai pengawasan agen melalui cakupan pemantauan, jeda waktu peninjauan, serta tingkat tindakan yang diblokir atau diteruskan kepada pemeriksa manusia. Metrik ini mengukur kemampuan intervensi, bukan persentase pekerjaan R&D yang diotomatisasi.

Kelompok ketiga melacak alokasi komputasi. Anthropic memeriksa penggunaan komputasi selama 13–20 Juli 2026 dan mengklasifikasikan pekerjaan keselamatan serta R&D AI lainnya. Sampelnya hanya satu pekan; perusahaan sendiri menyatakan periode itu cukup untuk menunjukkan bahwa pengukuran dapat dilakukan, tetapi belum cukup untuk memperlihatkan tren yang bermakna.

Ketiga denominator itu tidak dapat digabungkan. Angka 26% berasal dari kategori tugas berbobot waktu manusia, lebih dari 90% menunjukkan bagian keranjang tugas yang mencapai minimal AL3, sedangkan metrik komputasi mengukur penggunaan akselerator selama satu pekan. Tidak satu pun dengan sendirinya mengukur seberapa dekat Claude dengan kemandirian penuh.

Belum membuktikan recursive self-improvement

Recursive self-improvement dalam kerangka yang digunakan Anthropic berarti model dapat membangun penerusnya secara sepenuhnya otonom. Data yang dipublikasikan baru menunjukkan otomasi sebagian proses R&D: Claude dapat menangani tugas substansial, tetapi manusia masih memberi sasaran, mengawasi pekerjaan, dan mengambil keputusan yang menentukan.

laporan Reuters pada 17 September juga mencatat angka 26%, kolaborasi pada lebih dari 90% pekerjaan, dan ketiadaan otonomi penuh pada bagian yang diukur. Karena itu, ungkapan bahwa Claude “membangun penerusnya” paling tepat dipahami sebagai ringkasan kontribusinya di dalam proses Anthropic, bukan bukti bahwa model telah mengambil alih seluruh siklus pengembangan.

Angka berikutnya harus menunjukkan tren yang dapat diverifikasi

Anthropic berencana menerbitkan pengukuran ini secara berkala dan mengakui dua hambatan untuk membandingkan hasil antarlaboratorium: belum ada metodologi bersama dan perusahaan menggunakan modelnya sendiri sebagai penilai. Keranjang tugas yang dibekukan juga dapat tertinggal apabila manusia beralih ke jenis pekerjaan baru yang tidak terwakili dalam baseline.

Untuk saat ini, kesimpulannya terbatas tetapi jelas: per Agustus 2026, Claude memimpin 26% keranjang pekerjaan R&D AI Anthropic yang diukur dan terlibat setidaknya sebagai kolaborator pada lebih dari 90%, tanpa satu pun bagian mencapai AL5. Publikasi berkala, pembaruan keranjang tugas, dan pemeriksaan pihak ketiga diperlukan sebelum angka tersebut dapat dibaca sebagai tren universal—apalagi sebagai bukti recursive self-improvement.

Baca juga:

Bagikan:

Berlangganan buletin kami

Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.

0