AI dan Otomatisasi

AIRA3 finis kedelapan dari 4.000 tim—sistemnya belum dirilis

|Penulis: Tim Redaksi QUASA|4 mnt baca| 1
AIRA3 finis kedelapan dari 4.000 tim—sistemnya belum dirilis

Utas AI at Meta tertanggal 5 September 2026 menyatakan bahwa AIRA3 finis kedelapan dari sekitar 4.000 tim dan memperoleh medali emas dalam kompetisi NVIDIA di Kaggle pada Juni. Peserta ditugaskan menyempurnakan kemampuan penalaran model Nemotron berparameter 30 miliar, dengan hasil ditentukan melalui set pengujian privat.

Entri langsung tersebut bukan hasil satu model: konfigurasinya menggabungkan GPT 5.5 dengan OpenCode serta Claude 4.8 dengan ClaudeCode. Analisis AlphaSignal mengenai AIRA3 mencatat bahwa generasi sistem ini belum dirilis, sehingga hasil kompetisinya belum dapat direproduksi melalui implementasi yang tersedia bagi publik.

Peringkat kedelapan termasuk emas, tetapi bukan kemenangan mutlak

Hasil evaluasi privat menempatkan entri yang dikelola AIRA3 di peringkat kedelapan dari sekitar 4.000 tim.

Istilah “emas” dalam hasil tersebut menunjukkan kelompok medali, bukan posisi pertama. AIRA3 berada di urutan kedelapan; karena itu, judul yang menyebut sistem tersebut “mengalahkan 4.000 tim” tanpa menyertakan peringkatnya dapat memberi kesan bahwa entri Meta menjadi juara keseluruhan.

Halaman resmi NVIDIA Nemotron Model Reasoning Challenge mencatat kompetisi berlangsung dari 16 Maret hingga 15 Juni 2026, dengan 4.182 tim, 5.223 peserta, dan 71.743 kiriman. Dengan demikian, angka 4.000 pada pengumuman dan judul merupakan pembulatan dari jumlah tim yang tercatat di Kaggle.

Nilai pembanding kompetisi ini terletak pada tugas dan mekanisme evaluasi yang sama bagi peserta. Penilaian menggunakan set privat di luar Meta, sehingga hasilnya lebih kuat daripada skor yang seluruh rancangan dan pengukurannya dikendalikan oleh pembuat sistem sendiri. Namun, bukti itu tetap terbatas pada tugas menyempurnakan Nemotron dalam kompetisi tersebut.

AIRA3 mengoordinasikan agen melalui forum dan sistem berkas

Agen AIRA3 berkoordinasi secara asinkron melalui forum dan sistem berkas bersama tanpa pengendali pusat.

AIRA3 berfungsi sebagai lapisan koordinasi, bukan model bahasa tunggal yang mengerjakan seluruh eksperimen. Sistem menjalankan banyak agen berdurasi panjang; setiap agen memasangkan sebuah model dengan coding harness dan bekerja di lingkungan terisolasi.

Tidak ada satu pengendali pusat yang menentukan seluruh urutan eksperimen. Agen berkoordinasi secara asinkron melalui forum bersama untuk hipotesis dan temuan, serta sistem berkas bersama untuk menyimpan artefak solusi. Agen lain kemudian dapat memilih temuan yang akan diperiksa atau dikembangkan lebih lanjut.

Alur koordinasinya dapat diringkas sebagai berikut:

  1. Agen menyusun atau memilih hipotesis untuk meningkatkan model sasaran.
  2. Pasangan model dan coding harness menjalankan eksperimen dalam lingkungan terpisah.
  3. Hipotesis serta temuan ditempatkan di forum bersama, sedangkan kode dan artefak solusi masuk ke sistem berkas bersama.
  4. Agen lain menggunakan hasil yang tersedia untuk menentukan eksperimen lanjutan.
  5. Kandidat yang dihasilkan masuk ke proses evaluasi kompetisi.

Susunan ini juga menjelaskan mengapa hasil akhir tidak tepat dikreditkan kepada GPT 5.5 atau Claude 4.8 secara terpisah. Peringkat kompetisi melekat pada ansambel, coding harness, mekanisme berbagi temuan, dan proses pemilihan kandidat secara keseluruhan.

Hasil langsung berbeda dari pengujian setelah kompetisi

Posisi kedelapan hanya berlaku untuk ansambel GPT 5.5–OpenCode dan Claude 4.8–ClaudeCode yang dipakai dalam kompetisi langsung. Pasangan lain diuji setelah kompetisi berakhir pada set privat yang sama: Muse Spark 1.2 dengan MuseCode mencapai tingkat medali emas, sementara Muse Spark 1.1 dengan OpenCode dan GLM 5.2 dengan OpenCode mencapai tingkat medali perak.

Pengujian lanjutan itu berguna untuk melihat apakah pola koordinasi AIRA3 dapat bekerja dengan susunan model dan alat yang berbeda. Statusnya tetap tidak sama dengan hasil kompetisi langsung: konfigurasi Muse dan GLM tidak ikut menghasilkan posisi kedelapan ketika leaderboard masih aktif.

Pemisahan tersebut penting karena “diuji pada set yang sama” tidak berarti “mengikuti kompetisi dalam kondisi yang sama”. Evaluasi setelah penutupan tidak menghadapi batas waktu, keputusan eksperimen, dan risiko kompetitif yang identik dengan kiriman langsung, meskipun mekanisme penilaiannya menggunakan set privat yang sama.

Bukti eksternal tersedia, reproduksi publik belum memungkinkan

Hasil kompetisi AIRA3 dapat diperiksa, tetapi implementasi sistem untuk reproduksi publik belum tersedia.

Hasil Kaggle memberi bukti langsung bahwa konfigurasi AIRA3 mampu menghasilkan entri kompetitif pada satu tugas yang terdefinisi. Bukti itu belum cukup untuk menyimpulkan bahwa sistem dapat menyamai peneliti manusia di seluruh bidang riset AI, sebab model sasaran, format kiriman, data, dan ukuran keberhasilan kompetisi bersifat khusus.

Klaim generalisasi juga perlu dipisahkan menurut jenis buktinya. Hasil Nemotron berasal dari kompetisi eksternal; hasil konfigurasi alternatif berasal dari pengujian setelah kompetisi; sementara pengurangan latensi kernel GPU yang turut disebut dalam pengumuman merupakan benchmark internal. Ketiganya tidak memiliki bobot verifikasi yang sama.

Kendala audit paling mendasar adalah ketiadaan rilis AIRA3. Belum tersedia implementasi generasi ketiga yang memungkinkan pihak luar memeriksa kode koordinasi, konfigurasi lengkap entri langsung, kebutuhan komputasi, pemilihan eksperimen, dan proses pembentukan kandidat akhir.

Pada 8 September 2026, bagian yang dapat diperiksa publik mencakup keberadaan kompetisi, aturan dasarnya, skala peserta, serta penjelasan Meta mengenai arsitektur dan konfigurasi entri. Verifikasi menyeluruh masih menunggu rilis sistem, dokumentasi reproduksi, dan identitas entri yang dapat dicocokkan langsung dengan leaderboard.

Baca juga:

Bagikan:

Berlangganan buletin kami

Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.

0