Yapay Zeka

Booz Allen Siber Silah Endeksi: 18 Model, Tek Tam Saldırı

Booz Allen 18 modeli gerçek bir kurumsal ağda otonom saldırgan olarak test etti: tam saldırı zincirini yalnızca Claude Mythos tamamladı. Asıl bulgu, ucuz bir iskelenin 67 puanlık farkı kapatması.

Muhammet Fatih Batman5 Eylül 20263 dakika2 görüntülenme
Booz Allen Siber Silah Endeksi: 18 Model, Tek Tam Saldırı

Booz Allen'ın yeni endeksinin asıl bulgusu sıralamanın kendisi değil, sıralamayı ucuz bir yazılımın silebilmesi. ABD'li savunma danışmanlığı şirketi 18 yapay zeka modelini gerçek bir kurumsal ağa otonom saldırgan olarak saldı; yalnızca biri, Anthropic'in Claude Mythos'u, saldırı zincirini baştan sona tamamladı. Ama listenin 15. sırasındaki Claude Sonnet 5, hazır bir "saldırı iskelesi"ne bağlanınca Mythos'un seviyesine yaklaştı. Raporun kendi cümlesiyle: risk birimi artık model değil, sistem.

Test nasıl kuruldu?

Cyber Weapon Index adlı çalışma dokuzu ABD, dokuzu Çin menşeli 18 modeli aynı koşullarda sınadı. Ortam, savunması olan gerçek bir Active Directory ağı; hedef, ilk erişimden tam alan yöneticisi yetkisine kadar ilerlemek. Modellere hazır araç menüsü ya da ek iskele verilmedi. Puanlama modelin beyanına değil ağ günlüklerine, ana makine kayıtlarına ve saldırı tespit sensörlerine dayandı. İkinci bir bileşen, kaynak kodu olmayan derlenmiş yazılımda açık bulma becerisini ölçtü. Senaryolar çalınmış kimlik bilgisiyle ve bilgisiz olmak üzere iki kez koşuldu.

Sıralama

80 üzerinden puanlar (The Register'ın 2 Eylül tarihli haberinden): Claude Mythos 80, Grok-4.5 49, GPT-5.6 Sol 46, Muse Spark 1.1 ve Kimi K3 38, GLM-5.2 37, Claude Opus 4.8 36, GPT-5.5-Cyber 34, Nemotron-Ultra 33, DeepSeek-V4-Pro 23, DeepSeek-V4-Flash ve Qwen3.5-397B 17, MiniMax-M3 ve Nemotron-Super 15, Claude Sonnet 5 13, GLM-4.5-Air 11, Qwen3.6-35B 9, Qwen3-Coder 4.

Dağılım şöyle: bir model tam zinciri tamamladı, üçü daha (Grok-4.5, Muse Spark 1.1, GLM-5.2) tam alan erişimine ulaştı, dördü yanal hareket yapabildi, ikisi kimlik bilgisi ele geçirmede kaldı. Biri hariç hepsi ağa ilk girişi başardı. Kimlik bilgisi verildiğinde Mythos her denemede yönetici yetkisi aldı; verilmediğinde de alanı tamamen ele geçirdi.

Üç bulgu, tek sonuç

  • Gerçek açık bulma hâlâ ayırıcı çizgi. Yapay olarak yerleştirilmiş açıklarda çoğu model ilerledi; daha önce görülmemiş gerçek açıkları istismar edebilen tek model Mythos oldu.
  • İskele modelden çok şey değiştiriyor. Sonnet 5, tek başına 13 puanken saldırı araçlarına bağlayan ucuz bir yazılımla Mythos'a olan 67 puanlık farkın büyük kısmını kapattı. Booz Allen bunu "iskele, modelin kendisi kadar ya da daha fazla önemli" diye özetliyor.
  • Korkuluklar sabit değil. Aynı modelin güvenlik davranışı yapılandırmaya ve bağlama göre değişti. Yetenek ülkeye de özgü değil: Çin menşeli modeller ilk on içinde.

Raporun öngörüsü sert: çoğu model altı ay içinde tam zinciri tamamlayabilecek. Önerileri kritik altyapı işletmecileri için sektöre özel, zorlayıcı müdahale süreleri; yabancı ve açık ağırlıklı modelleri gerçekçi koşullarda test eden ulusal bir program; onaylı savunuculara kontrollü erişim.

Bu tablo Türkiye'deki bir şirketi nasıl ilgilendirir?

Tez şu: savunma tarafında "en güçlü modele kimin eriştiği" sorusu artık ikincil. Orta seviye bir açık modeli iyi bir iskeleyle donatan saldırgan, kurumsal ağınızda yanal hareket edebiliyor. Bu da müdahale süresini saatlerden dakikalara indirmeyi zorunlu kılıyor. Somut adımlar: Active Directory'de ayrıcalıklı hesapları sıkılaştırın, çalınmış kimlik bilgisiyle giriş senaryosunu tatbikatla test edin, yanal hareketi yakalayan tespit kurallarınızın gerçekten alarm ürettiğini doğrulayın. Yapay zeka ürünü satın alırken de aynı mantık geçerli: modelin adına değil, etrafına kurulan sistemin denetimine bakın.

Kaynaklar: Booz Allen: Cyber Weapon Index, The Register, The Next Web

Bu Yazıyı Paylaş

Muhammet Fatih Batman

Yazan

Muhammet Fatih Batman

Kurucu & Editör

Web tasarım ve yazılım geliştirmede 20 yılı aşkın deneyime sahip, YZ Uzman'ın kurucusu.

Diğer haberler

Bu teknolojiyi işinizde kullanmak ister misiniz?

Konuşalım