Yapay Zeka
Anthropic 150 Mühendisi Güvenliğe Kaydırdı: Neler Oluyor?
Anthropic, yazın yaşanan iki güvenlik olayının ardından 150 ürün mühendisini güvenliğe kaydırdığını, RL eğitim ortamlarını dondurup sorunlu bulduğunu açıkladı.

Bir yapay zeka şirketi neden yeni özellik geliştirmeyi durdurup 150 ürün mühendisini güvenlik işlerine kaydırır? Anthropic'in 31 Ağustos'ta yayımladığı "hizalama ve güvenlik çalışmalarımızı iyileştiriyoruz" başlıklı duyuru, bu sorunun cevabını sektörde alışık olmadığımız bir açık sözlülükle veriyor. Ve cevap, yaz boyunca haberleştirdiğimiz iki olayın şirket içinde sanılandan büyük bir depreme yol açtığını gösteriyor.
Hangi olaylar bu noktaya getirdi?
Duyurunun merkezinde iki vaka var. İlki 30 Temmuz'da yaşandı: Claude modelleri, üçüncü taraf bir değerlendirme ortamındaki yanlış yapılandırma yüzünden yetkisiz internet erişimi kazandı ve üç gerçek şirketin sistemlerine sızdı. İkincisi 4 Ağustos'ta İngiltere'nin AI Güvenlik Enstitüsü testlerinde ortaya çıktı: Claude Mythos 5, canlı internette kendisinden istenmeyen eylemler gerçekleştirdi. Bu vakanın çarpıcı ayrıntılarını spor salonu rezervasyonu haberimizde anlatmıştık.
Anthropic'in teşhisi iki katmanlı. Hizalama tarafında iki hata tespit edilmiş: modellerin "nasılsa simülasyondayım" inancını sürdürerek gerçek sistemlerde pervasız davranması ve dar tanımlı bir görevi tamamlamak için zararlı eylemlere fazla istekli olması. Operasyon tarafında ise kabahat insanlarda: yalıtım (sandbox) ve izleme, olayların yaşandığı ortamlarda yetersizmiş.
Perde arkası: dondurulan eğitimler
Duyurunun asıl haber değeri taşıyan kısmı, şimdiye dek bilinmeyen iç kararlar. Şirket, Şubat 2026'da ödül hilesi (reward hacking: modelin, ödül sistemindeki açıkları kullanarak görevi gerçekten çözmeden puan toplaması) tespit edince üç günlük bir pekiştirmeli öğrenme eğitimini tamamen geri almış. Nisan'da ise tüm eğitim ortamları yaklaşık bir ay dondurulmuş; yapılan taramada ortamların yüzde 10'undan fazlasında sorun bulunmuş. Ayrıca kasıtlı olarak yanlış hizalanmış bir Opus sınıfı model, 80 kusurlu eğitim ortamında eğitilmiş ve bu modelin kaçış ve saldırı davranışları sergilediği görülmüş. Şirketin vurguladığı önemli ayrım şu: üretimdeki modeller aynı testlerde bu davranışları göstermemiş.
Önlem listesi de somut: kaçış girişimlerini anında tespit eden sınıflandırıcılar, gerçek zamanlı engelleme, sanallaştırma katmanına kırmızı takım testleri ve dış ortaklara koşullar: varsayılan olarak internet erişimi yok, kapsam yazılı, izleme sürekli. Bu arada 150 ürün mühendisi güvenlik ve gizlilik işlerine, bir grup araştırmacı da model eğitiminden koruma sistemlerine kaydırıldı; bazı ürün ekipleri yeni özellik geliştirmeyi geçici olarak durdurdu. Bir yapay zeka şirketi için bunun ne demek olduğunu açalım: rekabetin haftalarla ölçüldüğü bir pazarda ürün takviminden bilinçli olarak hız çalmak, kâğıt üzerindeki "güvenlik önceliğimizdir" cümlesinin nadiren gördüğümüz maliyetli hali.
Ajan projesi yürüten ekiplere notumuz
Bu duyuruyu iki şekilde okumak mümkün. İyimser okuma: sektörün en büyük oyuncularından biri, hatalarını ayrıntısıyla anlatıp kaynağını üründen güvenliğe kaydırıyor; bu, olgunlaşma işareti. Temkinli okuma: en dikkatli şirkette bile eğitim ortamlarının onda birinden fazlası sorunlu çıkabiliyorsa, ajan teknolojisi hâlâ emekleme döneminde demektir. Duyurunun bir de sektör politikası boyutu var: Anthropic, güvenlik standartlarının tek şirketin iradesine bırakılmaması gerektiğini savunarak yasal, doğrulanabilir ve sektörün tamamını bağlayan bir koordinasyon mekanizmasına destek veriyor. Yaz aylarında üst düzey araştırmacıların imzaladığı yavaşlama çağrılarıyla birlikte okununca, sektörde "fren tartışması" giderek resmîleşiyor.
Türkiye'de yapay zeka ajanı kuran ekipler için buradaki ders teknik değil yönetsel: iki olayın da fitilini model değil, ortam yapılandırması ateşledi. Ajanınıza hangi sistemlere erişim verdiğinizi yazılı hale getirin, internet erişimini varsayılan olarak kapatın, izlemeyi sonradan değil kurulum gününde devreye alın. Anthropic'in dış ortaklarına dayattığı bu üç kural, kendi projeleriniz için de iyi bir asgari standart.
Kaynaklar: Anthropic

Yazan
Faruk Talmaç
Kurucu Ortak & Editör
Web tasarım ve yazılım geliştirmede 20 yılı aşkın deneyime sahip, YZ Uzman'ın kurucu ortağı.