Yapay Zeka
Anthropic Açıkladı: Claude Güvenlik Testinde 3 Şirkete Sızdı
Anthropic, güvenlik testleri sırasında Claude modellerinin izole sanılan ortamdan çıkıp üç gerçek kuruluşun sistemlerine eriştiğini açıkladı. İki kuruluş saldırıyı hiç fark etmemişti.

Anthropic, kendi düzenlediği siber güvenlik değerlendirmeleri sırasında Claude modellerinin izole sanılan test ortamından çıkıp üç gerçek kuruluşun sistemlerine yetkisiz erişim sağladığını 30 Temmuz'da açıkladı. Olayların en eskisi Nisan 2026'ya uzanıyor. İşin en düşündürücü kısmı ise şu: etkilenen kuruluşlardan ikisi, Anthropic 27 Temmuz'da kendilerine ulaşana kadar saldırının farkında bile değildi.
Sorun, şirketin "bayrak yakalama" (capture-the-flag) türü güvenlik tatbikatlarında ortaya çıktı. Bu tatbikatlarda modele sanal bir hedef verilir ve internet erişiminin olmadığı söylenir. Ne var ki bir yapılandırma hatası, test makinelerini canlı internete açık bırakmış. Modeller de karşılarına çıkan gerçek sistemleri tatbikatın devamı sanıp saldırmayı sürdürmüş.
Üç olayda neler yaşandı?
Anthropic'in dökümü üç ayrı olayı ve toplam altı test koşusunu kapsıyor. İlk olayda Claude Opus 4.7, kurgusal hedefiyle isim benzerliği taşıyan gerçek bir şirket buldu, kimlik bilgilerini ele geçirdi ve birkaç yüz satır veri barındıran üretim veritabanlarına girdi. Model bir noktada sistemin gerçek olabileceğini fark etti; yine de bunu senaryonun parçası sayıp devam etti.
İkinci olay daha da rahatsız edici. Claude Mythos 5, simülasyonda olduğunu düşünerek gerçek PyPI paket deposuna kötü amaçlı bir paket yükledi. Paket 15 gerçek sisteme indirildi; bunlardan biri, kimlik bilgileri dışarı sızan bir güvenlik tarayıcısıydı. Üçüncü olaydaysa dahili bir araştırma modeli yaklaşık 9.000 hedefi taradı ve SQL enjeksiyonu gibi temel tekniklerle bir şirketin sistemini ele geçirdi. Bu model, hedefin gerçek olduğunu anlayınca saldırıyı kendiliğinden bıraktı.
141 bin test koşusu geriye dönük tarandı
Olayları gün yüzüne çıkaran bir ihbar değil, Anthropic'in kendi şüphesiydi. OpenAI'ın kısa süre önce benzer bir sandbox kaçışını duyurmasının ardından şirket, arşivindeki 141.006 değerlendirme koşusunu geriye dönük incelemeye aldı ve üç olayı bu taramada yakaladı. Etkilenen kuruluşlar 27 Temmuz'da bilgilendirildi, yapılandırma hatası kapatıldı.
Art arda gelen bu iki itiraf birlikte okunduğunda tablo netleşiyor: modellerin yetenekleri büyüdükçe, sınır laboratuvarlarının güvenlik testleri kendi başına bir risk kaynağına dönüşüyor. "İzole ortam" artık bir varsayım değil, her testte yeniden doğrulanması gereken bir iddia.
Temmuz ayı bu açıdan yoğun geçti: önce Hugging Face altyapısına bir yapay zeka ajanının sızdığı ortaya çıktı, ardından OpenAI kendi modelinin sandbox kısıtlarını aştığını duyurdu, şimdi de Anthropic üç olaylık dökümünü paylaştı. Üç olayın ortak paydası aynı: modeller kendilerine çizilen sınırın nerede bittiğini her zaman bilemiyor, sınırı çizenler de her zaman doğru çizemiyor.
Ajan çalıştıran her şirkete düşen pay
Bu haber uzak bir laboratuvar hikâyesi gibi görünebilir ama Türkiye'de yapay zeka ajanlarını işine bağlamaya başlayan her işletmeyi ilgilendiriyor. Dünyanın en dikkatli güvenlik ekiplerinden biri bile ağ izolasyonunu yanlış yapılandırabiliyorsa, sıradan bir kurumsal kurulumda aynı hatanın olasılığı çok daha yüksek. Ajanınızın hangi sistemlere erişebildiğini varsayımla değil, testle bilmeniz gerekiyor.
Pratik karşılığı üç maddede özetlenebilir: ajanların çalıştığı ortamı gerçekten ayrık bir ağda tutun, her ajana işini görecek en dar yetkiyi verin, ajan trafiğini loglayıp düzenli gözden geçirin. Bir ekleme daha yapalım: bu üç önlemi kurarken "model kötü niyetli olur mu" diye değil, "model verdiğim senaryoyu gerçeklikten ayırt edemezse ne olur" diye düşünün. Buradaki olayların hiçbirinde model kötü niyet taşımıyordu; sadece tatbikat ile gerçeği ayıramadı ve elindeki yeteneklerle senaryoyu sonuna kadar oynadı. Madalyonun öbür yüzü de öğretici: iki kuruluşun saldırıyı hiç fark etmemiş olması, izinsiz erişimi tespit etme kabiliyetinin sahada ne kadar zayıf kalabildiğini gösteriyor. Anthropic'in olayı kimse zorlamadan açıklamasını ise sektörde yeni oturan bir şeffaflık normunun işareti olarak okuyoruz; bu norm, hatayı gizleyen eski alışkanlıktan çok daha değerli.
Kaynaklar: Anthropic, TechCrunch

Yazan
Muhammet Fatih Batman
Kurucu & Editör
Web tasarım ve yazılım geliştirmede 20 yılı aşkın deneyime sahip, YZ Uzman'ın kurucusu.