Satu model AI hanya menemukan 40% celah—Palo Alto memilih pendekatan gabungan

|Penulis: Tim Redaksi QUASA|5 mnt baca| 1
Satu model AI hanya menemukan 40% celah—Palo Alto memilih pendekatan gabungan

Dalam pengumuman Palo Alto Networks pada 22 September 2026 dari Santa Clara, perusahaan memperkenalkan Unit 42 Continuous Frontier AI Defense sebagai layanan pengujian keamanan berkelanjutan yang tersedia secara global melalui langganan tahunan. Layanan ini menggabungkan Claude Mythos 5 dari Anthropic, GPT-5.6-Cyber dari OpenAI, dan model berbobot terbuka untuk mencari paparan keamanan, menguji kemungkinan eksploitasi, serta membantu penyusunan perbaikan.

Dalam laporan Axios, hasil pengujian Palo Alto Networks menunjukkan bahwa tak satu pun model menemukan lebih dari 40% kerentanan pada lingkungan perusahaan yang kompleks, sementara temuan Mythos 5 dan GPT-5.6-Cyber bertumpang tindih kurang dari 10%; CEO Nikesh Arora mengaitkan perbedaan keluaran antarmodel dengan data pelatihan yang berlainan. Angka tersebut menjelaskan alasan perusahaan memilih gabungan model, tetapi belum menjadi ukuran keberhasilan yang teruji secara independen di lingkungan pelanggan.

Mengapa temuan antarmodel berbeda

Tumpang tindih yang kecil berarti kedua model dalam evaluasi perusahaan lebih sering mengangkat kelemahan yang berbeda daripada kelemahan yang sama. Bagi pemilik aplikasi, akibatnya cukup nyata: memilih satu model saja dapat membuat sebagian paparan yang terlihat oleh model lain tetap tidak ditemukan. Ini alasan untuk memperluas pemeriksaan, tetapi bukan bukti bahwa semua celah akan terlihat setelah beberapa model digabungkan.

Unit 42 memakai perangkat orkestrasi yang mengarahkan tugas pengujian kepada model yang dianggap paling cocok. Pemilihan tugas menjadi bagian dari rancangan layanan, bersama intelijen ancaman dan keahlian pengujian ofensif Unit 42. Klaim cakupan yang lebih baik bergantung pada ketepatan pembagian tugas tersebut, mutu data masukan, dan keberhasilan memeriksa temuan yang dihasilkan.

Persentase temuan antarmodel tidak boleh dijumlahkan begitu saja untuk memperkirakan cakupan gabungan. Angka tumpang tindih tidak menjelaskan berapa banyak kerentanan yang luput dari keduanya, sedangkan ringkasan publik tidak memaparkan ukuran himpunan pembanding, cara memilih lingkungan uji, atau definisi rinci tentang temuan yang dianggap sama. Kesimpulan yang dapat ditarik masih terbatas pada pengamatan perusahaan bahwa model tunggal memiliki celah cakupan dalam evaluasinya.

Alur dari pemindaian hingga rekomendasi

Layanan dimulai dengan pemindaian dasar terhadap lingkungan pelanggan, kemudian melanjutkan pengujian ketika lingkungan itu berubah. Aset yang disebut mencakup aplikasi web buatan sendiri dan dari pihak ketiga, API, infrastruktur cloud, repositori kode sumber, serta aset jaringan. Rancangan berkelanjutan ini menempatkan perubahan aplikasi dan infrastruktur sebagai alasan untuk menguji ulang, karena temuan pada satu titik waktu bisa kehilangan relevansi setelah sistem diperbarui.

Setelah kelemahan ditemukan, layanan berupaya membuktikan apakah celah dapat dieksploitasi dan apakah beberapa celah membentuk jalur serangan menyeluruh. Urutan ini memisahkan sinyal awal dari paparan yang dapat dipakai untuk mencapai aset lain. Perbedaan itu penting bagi tim keamanan yang harus memilih perbaikan: daftar temuan mentah belum menunjukkan hubungan antarkelemahan atau dampak jika jalurnya berhasil dilalui.

Dalam penjelasan teknis Unit 42, perusahaan menyebut pengujian mencakup basis kode dan lingkungan aktif; perusahaan juga mengklaim arsitektur Zero Data Retention menjaga agar kode sumber dan telemetri pelanggan tidak disimpan atau dipakai untuk melatih model publik. Perlindungan data ini relevan karena pengujian atas kode dan telemetri memerlukan akses ke bahan yang sensitif. Rincian pelaksanaan klaim tersebut untuk setiap konfigurasi pelanggan belum dijelaskan dalam materi publik itu.

Keluaran sesudah validasi berupa perbaikan yang diprioritaskan, panduan pada tingkat kode, dan rekomendasi tambalan virtual. Pelanggan dapat memasangkan layanan dengan Frontier Virtual Patching untuk memasang mitigasi sementara sebelum tambalan resmi tersedia. Rekomendasi dari layanan utama dan penerapan tambalan melalui produk pendamping adalah tahapan yang berbeda; pengumuman tidak menyatakan bahwa setiap saran akan otomatis mengubah sistem pelanggan.

Di mana keputusan manusia tetap diperlukan

Model membantu menemukan paparan, sedangkan Unit 42 menggabungkan temuannya dengan intelijen ancaman dan pengalaman pengujian ofensif untuk menilai jalur serangan. Hasil validasi membuat prioritas lebih jelas, tetapi tidak menentukan sendiri kapan perubahan pada aplikasi produksi dapat diterapkan. Pemilik sistem tetap perlu menyetujui perubahan kode, mitigasi sementara, atau penutupan akses sesuai dampaknya pada layanan yang berjalan.

Menutup titik masuk, memasang tambalan virtual, dan memperbaiki kode sumber memiliki konsekuensi operasional yang berbeda. Mitigasi sementara dapat mengurangi paparan sebelum perbaikan permanen siap, tetapi tidak membuktikan bahwa akar kelemahan sudah hilang. Karena itu, keluaran validasi perlu dibedakan dari keputusan menerapkan perubahan dan dari hasil setelah perubahan tersebut selesai.

Peran manusia juga penting untuk memeriksa temuan yang dinilai paling mendesak. Validasi oleh layanan dapat membantu memilah alarm, tetapi pemilik aplikasi mengetahui ketergantungan bisnis dan konsekuensi perubahan yang mungkin tidak tampak dalam keluaran pemindaian. Materi peluncuran menjelaskan jenis keluaran layanan, namun tidak menetapkan siapa yang memberi persetujuan akhir untuk setiap tindakan di lingkungan pelanggan atau bagaimana tanggung jawab itu dibagi.

Apa yang telah terbukti dan yang belum

Status komersial layanan sudah jelas: pelanggan dapat berlangganan secara global, dengan pilihan yang bergantung pada model yang dipakai. Layanan baru dirancang untuk menguji ulang aset ketika lingkungan berubah, berbeda dari analisis paparan sesaat yang mendahuluinya. Ketersediaan itu tidak berarti hasil pengujian internal otomatis berlaku bagi setiap perusahaan, karena komposisi aplikasi, hak akses, dan keadaan sistem menentukan celah yang mungkin ditemukan.

Belum tersedia ukuran publik yang memungkinkan pembaca menghitung cakupan gabungan untuk lingkungan pelanggan tertentu atau menilai hasil perbandingan model secara independen. Pengumuman dan uraian teknis menggambarkan cara mencari, memvalidasi, dan merekomendasikan perbaikan; keduanya belum menunjukkan tingkat keberhasilan penutupan celah setelah pelanggan menerima rekomendasi. Pertanyaan yang masih terbuka adalah seberapa konsisten hasil layanan pada lingkungan yang berbeda dan berapa banyak jalur serangan tervalidasi yang akhirnya ditutup.

Baca juga:

Bagikan:

Berlangganan buletin kami

Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.

0