CrowdStrike saldıran ve savunan iki AI modeli kurdu: ölçüm hâlâ kapalı

CrowdStrike, 1 Eylül 2026’da Las Vegas’taki Fal.Con 2026 kapsamında Cyber Superintelligence Lab’i duyurdu. Şirket aynı gün yayımladığı SafeMind açıklamasında, saldırı odaklı Red Tempest ile savunma odaklı Blue Solano’yu çalışma katmanları üzerinden aynı döngüde işleten sistemi tanıttı.
SafeMind, iki uzmanlaşmış modeli uzun süreli güvenlik görevlerinde yöneten bir yapay zekâ sistemi: Red Tempest saldırı yolu arıyor, Blue Solano bu yolu kapatacak korumayı üretip deniyor, ardından saldırı yeniden sınanıyor. Ancak SiliconANGLE’ın incelemesi, şirketin yüzde 29 daha yüksek tespit, altı kat daha hızlı uçtan uca iyileştirme ve yüzde 99 maliyet tasarrufu iddialarına rağmen karşılaştırılan modelleri ve test yöntemini açıklamadığını belirtiyor. Bu yüzden rakamlar bağımsız ve tekrarlanabilir bir benchmark değil, CrowdStrike’ın kendi değerlendirmesidir.
SafeMind’in asıl ürünü kapalı çalışma döngüsü

SafeMind’i yalnızca iki dil modeli olarak tanımlamak eksik kalıyor. Sistemde modellerin yanında bağlam, bellek, araçlar, izinler, model yönlendirme, güvenlik kontrolleri ve geri bildirim sağlayan çalışma katmanları bulunuyor. Bu katmanlar farklı görevlerin hangi modele verileceğini ve üretilen sonucun döngünün bir sonraki aşamasına nasıl taşınacağını belirliyor.
Red Tempest kontrollü bir siber ortamda erişilebilir bir saldırı yolu arıyor. Blue Solano aynı bulguya karşı bir koruma geliştirip sınadıktan sonra Red Tempest değişen ortamı yeniden yokluyor. CrowdStrike’ın “adversarial coevolution” adını verdiği yaklaşımın ayırt edici yanı, saldırı tespiti ile savunma üretimini birbirinden kopuk çıktılar olmaktan çıkarıp yinelemeli bir teste dönüştürmesi.
Modeller NVIDIA Nemotron açık modelleri temel alınarak geliştirildi; CoreWeave altyapısı eğitim ve çıkarım programında yer alıyor. Çalışma katmanlarının başka frontier ve açık kaynak modellerle de çalışabilmesi planlanıyor. Dolayısıyla açıklanan sonuçlar tek başına Red Tempest’in ya da Blue Solano’nun değil, modeller ile onları yöneten katmanların birlikte oluşturduğu sisteme ait.
Red Tempest buluyor, Blue Solano savunmayı sınıyor

Red Tempest, gelişmiş saldırı senaryolarını canlandırmak ve olası ilerleme yollarını ortaya çıkarmak üzere konumlandırılan ofansif model. Blue Solano ise kurumsal varlıkları korumaya yönelik önlemler üretmek için tasarlanan defansif model. Buradaki saldırı-savunma karşılaşmasının yüksek gerçeklikli fakat üretimden ayrılmış siber test ortamlarında yürütülmesi amaçlanıyor.
Bu mimari, bir saldırı yolu bulmak ile üretim sisteminde değişiklik yapmak arasındaki önemli ayrımı ortadan kaldırmıyor. Kamuya açık bilgiler, Blue Solano’nun önerdiği veya denediği hangi önlemlerin gerçek müşteri ortamına insan onayı olmadan taşınabileceğini açıklamıyor. Yetki kapsamı, geri alma mekanizması ve üretim değişikliklerinin denetim izi de henüz ayrıntılandırılmış değil.
Bu nedenle “otonom” ifadesi şimdilik sınırsız üretim erişimi olarak okunamaz. Doğrulanabilen işlev, iki modelin kontrollü ortamda birbirinin çıktısını sınadığı döngüdür. Gerçek kurum sistemlerinde hangi görevlerin baştan sona insansız yürütülebileceği ise ayrı bir erişim ve yönetişim sorusu olarak açık kalıyor.
Laboratuvar veri ile test ortamını bir araya getiriyor
Cyber Superintelligence Lab, SafeMind’in geliştirildiği kurumsal araştırma yapısı. Bartley Richardson’ın yönettiği laboratuvar; CrowdStrike’ın yapay zekâ araştırmacılarını, ofansif güvenlik uzmanlarını ve olay müdahale ekiplerini tek bir çalışma çatısı altında topluyor. SafeMind böylece bağımsız bir deneyden çok, laboratuvarın araştırmasını Falcon ekosistemine taşıyan ilk somut sistem olarak konumlanıyor.
Eğitim girdileri arasında Falcon sensör telemetrisi, tehdit istihbaratı, Falcon Complete MDR ekiplerinin olay açıklamaları ve olay müdahale çalışmalarından gelen bilgi bulunuyor. Bunlar SafeMind’in genel amaçlı modellerden farklılaşma iddiasının dayanağı. Buna karşılık veri kümesinin bileşimi, örnek seçimi, eğitim ile test verilerinin ayrımı ve hata dağılımı dışarıdan incelenebilecek ayrıntıda yayımlanmadı.
Yüksek gerçeklikli siber ortamlar da laboratuvarın temel bileşenlerinden biri. Uç noktalar, kimlik sistemleri, bulut iş yükleri ve veri katmanları burada üretimi riske atmadan temsil edilebiliyor. Yine de açıklamalar, müşteriye özgü bir ortamın ne ölçüde doğru kopyalanacağını veya simülasyonda başarılı olan korumanın üretime aktarılmadan önce hangi insan kontrollerinden geçeceğini göstermiyor.
Üç performans iddiası var, doğrulanabilir benchmark yok

CrowdStrike’ın açıkladığı üç sonuç farklı ölçülere dayanıyor: tespit oranı, uçtan uca iyileştirme hızı ve tespit ile iyileştirmenin maliyeti. Fakat yayımlanan materyallerde bu sonuçların hangi modeller, sürümler, görevler ve donanım koşulları karşısında elde edildiği belirtilmiyor. “Önde gelen frontier modeller” ve “açık kaynak taban çizgileri” ifadeleri, doğrudan karşılaştırma yapmaya yetecek kadar kesin değil.
Sonuçları yeniden üretmek için en azından görev setinin kapsamı ve örnek sayısı, doğru ve yanlış pozitiflerin tanımı, hız ölçümünün başlangıç ile bitiş noktaları, insan müdahalesinin payı ve maliyet hesabına katılan kalemler bilinmeli. Ham sonuçlar, değişkenlik aralıkları ve üçüncü tarafların aynı deneyi tekrarlayabileceği bir protokol de yayımlanmış değil.
Bu eksikler, şirketin sonuçlarının yanlış olduğunu göstermiyor; hangi koşullarda geçerli olduklarının doğrulanmasını engelliyor. Türkiye’de güvenlik yatırımı değerlendiren bir kurum açısından oranlar, SafeMind’in araştırma hedeflerini anlatabilir ancak mevcut güvenlik araçlarıyla karşılaştırılabilecek satın alma ölçütleri olarak kullanılamaz.
Tanıtım tamamlandı, genel erişimin sınırları belirsiz
SafeMind tanıtılmış durumda, fakat duyuru genel kullanıma açık ve tamamlanmış bir ürün dağıtımını doğrulamıyor. CrowdStrike sistemin Falcon platformunda yerel olarak çalışacağını, bağımsız modellere ve çalışma katmanlarına güvenilir erişimin ise Project QuiltWorks kapsamında sağlanacağını belirtiyor. Laboratuvar sayfasında erken erişim kaydı alınması da erişimin henüz herkese açık olmadığını gösteriyor.
Hikâyenin bundan sonraki doğrulama noktaları; erişim takvimi, gerçek müşteri ortamındaki yetki sınırları, insan onay mekanizmaları ve model güncellemelerinin nasıl denetleneceği olacak. Performans tarafında ise karşılaştırılan modeller ile test protokolü açıklanmadıkça SafeMind’in ölçülen üstünlüğü bağımsız biçimde sınanamayacak. Şimdilik güçlü biçimde doğrulanan yenilik, saldıran ve savunan iki modelin ortak çalışma döngüsü; açık kalan bölüm ise bu döngünün üretimdeki etkisi ve ölçümünün tekrarlanabilirliği.
Ayrıca okuyun:
Bültenimize abone olun
En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.