AI dan Otomatisasi

Claude memimpin 26% R&D Anthropic—otonomi penuh belum tercapai

|Penulis: Tim Redaksi QUASA|5 mnt baca| 1
Claude memimpin 26% R&D Anthropic—otonomi penuh belum tercapai

Pada 17 September 2026, Anthropic menerbitkan pengukuran internal untuk Agustus yang menyatakan Claude “memimpin” 26% pekerjaan R&D AI berbobot; lebih dari 90% berada pada tingkat “berkolaborasi” atau lebih tinggi, tetapi tidak ada bagian terukur yang sepenuhnya otonom, sebagaimana dirangkum dalam laporan Reuters. Jadi, angka utama itu menunjukkan besarnya peran operasional Claude dalam pengembangan model Anthropic, bukan perpindahan kendali dari manusia ke AI.

Sehari setelah publikasi tersebut, Associated Press mengonfirmasi bahwa Claude membantu mengembangkan versi penerusnya, tetapi pekerjaan yang “dipimpin” AI tetap dimulai dari instruksi tingkat tinggi dan berlangsung di bawah supervisi manusia. Dengan kata lain, manusia masih menetapkan tujuan, menilai keluaran, dan berada di dalam alur kerja.

“Memimpin” adalah tingkat otomasi, bukan jabatan pengambil keputusan

Istilah itu berasal dari skala Automation Level yang diadaptasi Anthropic dari kerangka Epoch AI. Skala tersebut membedakan enam keadaan, dari tanpa keterlibatan AI hingga operasi mandiri tanpa manusia di dalam alur kerja.

Untuk memahami hasilnya, tiga kategori di bagian atas skala perlu dipisahkan:

  • Membantu: AI mengerjakan bagian tertentu, sementara manusia menjalankan mayoritas proses.
  • Berkolaborasi: AI menangani bagian besar pekerjaan dengan arahan manusia yang dekat.
  • Memimpin: AI menyelesaikan sebagian besar tugas dari awal sampai akhir berdasarkan instruksi tingkat tinggi, sementara manusia tetap mengawasi.

Otonomi penuh berada satu tingkat di atas “memimpin” dan mensyaratkan tidak adanya manusia di dalam alur kerja. Karena kategori tersebut tidak ditemukan pada bagian R&D yang diukur, kata “memimpin” dalam pengumuman ini tidak dapat dibaca sebagai kewenangan Claude untuk menentukan sendiri arah riset atau menyetujui penerusnya.

Mengapa angka kolaborasi jauh lebih besar

Porsi pekerjaan pada tingkat “berkolaborasi atau lebih tinggi” mencakup kategori “memimpin” sebagai bagiannya. Karena itu, kedua angka dalam pengumuman tersebut mengukur ambang yang berbeda: angka yang lebih besar menunjukkan seberapa luas Claude terlibat secara substansial, sedangkan angka yang lebih kecil menunjukkan pekerjaan yang sebagian besar dapat diselesaikannya dari instruksi tingkat tinggi.

Perbedaan ini juga mencegah kesimpulan bahwa hampir seluruh R&D telah diserahkan kepada Claude. Sebagian besar pekerjaan memang telah melibatkan AI dalam kapasitas yang berarti, tetapi banyak di antaranya masih membutuhkan pengarahan manusia yang dekat. Bahkan pada tingkat tertinggi yang benar-benar tercatat, supervisi manusia tetap menjadi bagian dari definisi.

Indeks mengukur waktu kerja, bukan nilai ilmiah

Metodologi resmi Anthropic menjelaskan bahwa indeks disusun dari sampel acak 20% staf pada setiap departemen dalam siklus R&D model untuk tiap pekan selama Juli 2026; Claude mengubah catatan kerja dan dokumentasi internal menjadi sekitar 15.000 tugas, mengelompokkannya dalam pohon berisi 542 simpul—termasuk 378 kategori paling spesifik—lalu memberi bobot menurut perkiraan porsi waktu staf, sementara jendela 13–20 Juli hanya dipakai untuk pengukuran komputasi yang terpisah.

Konsekuensinya, hasil indeks tidak menyatakan bahwa Claude menghasilkan bagian yang sama besar dari kode, kualitas model, keputusan strategis, atau penemuan ilmiah. Pekerjaan rutin yang memakan banyak waktu bisa memperoleh bobot lebih besar daripada keputusan singkat yang sangat menentukan. Indeks ini lebih tepat dibaca sebagai perkiraan perubahan pembagian kerja manusia dan AI.

Pemisahan dari data komputasi juga penting. Jendela satu pekan tidak menjadi dasar angka otomasi R&D: data otomasi memakai keranjang tugas dari sampel mingguan sepanjang Juli dan menilai keadaan pada Agustus. Metrik komputasi menjawab pertanyaan tentang penggunaan sumber daya, bukan tentang siapa yang memegang kendali atas proses pengembangan.

Penilaian internal masih memiliki batas

Claude bukan hanya objek pengukuran. Agen Claude digunakan untuk menyusun daftar dan struktur tugas, sementara model Claude lain menjadi penilai tingkat otomasi berdasarkan bukti internal. Staf yang bertanggung jawab atas area kerja terkait turut memberikan penilaian pembanding tanpa melihat bukti atau keputusan model sebelumnya.

Perbandingan itu menunjukkan bahwa penilaian model dan manusia umumnya berdekatan, tetapi batas antarkategori tetap memerlukan pertimbangan. Menentukan apakah suatu pekerjaan masih berupa kolaborasi erat atau sudah dipimpin AI bukanlah pengukuran mekanis seperti menghitung baris kode. Hal ini menambah ketidakpastian pada angka agregat, terutama untuk tugas yang berada di perbatasan dua kategori.

Keranjang tugas juga dibekukan agar perubahan dapat dibandingkan terhadap dasar yang sama. Pilihan ini membantu melacak otomasi atas pekerjaan yang sudah dikenal, tetapi tidak dengan sendirinya menangkap jenis pekerjaan baru yang muncul ketika proses R&D berubah. Anthropic menyatakan keranjang itu akan dibangun ulang secara berkala dan hasilnya akan diberi versi yang sesuai.

Belum ada bukti perbaikan diri otonom

Perbaikan diri otonom menuntut lebih dari kemampuan menuntaskan tugas teknis. Sistem perlu memilih arah riset, merancang dan menjalankan eksperimen, mengevaluasi kegagalan, mengubah pendekatan, serta menghasilkan penerus tanpa manusia tetap menjadi pengarah atau pengawas. Pengukuran yang dipublikasikan belum menunjukkan rangkaian kemampuan mandiri tersebut.

Yang sudah dapat disimpulkan adalah bahwa Claude mengambil peran operasional besar dalam R&D model Anthropic dan mampu memimpin sebagian pekerjaan yang sebelumnya lebih banyak ditangani manusia. Yang belum dapat disimpulkan ialah bahwa Claude mengendalikan pengembangan penerusnya atau telah memasuki siklus perbaikan diri tanpa campur tangan manusia.

Anthropic berencana melibatkan penilai independen dari beberapa organisasi dengan akses ke proses, sistem, dan data internal yang sebanding dengan tim penilaian risikonya. Sampai verifikasi tersebut tersedia dan metodologi serupa diterapkan oleh laboratorium lain, hasil ini tetap merupakan potret internal yang berguna, tetapi belum menjadi audit eksternal atau ukuran yang dapat dibandingkan langsung antarperusahaan.

Baca juga:

Bagikan:

Berlangganan buletin kami

Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.

0