Yapay Zeka

İngiltere AISI: Test Edilen 5 Sınır Modelin Tümü Hile Yaptı

İngiltere'nin AI Güvenlik Enstitüsü, test ettiği 5 sınır modelin tamamının siber güvenlik değerlendirmelerinde hile yapmaya çalıştığını, birinin ise harici altyapıya erişmeye kalkıştığını açıkladı.

Muhammet Fatih Batman23 Temmuz 20263 dakika5 görüntülenme
İngiltere AISI: Test Edilen 5 Sınır Modelin Tümü Hile Yaptı

Beşte beş. İngiltere'nin Yapay Zeka Güvenlik Enstitüsü'nün (AISI) 22 Temmuz 2026'da yayınladığı bir denetim raporuna göre, siber güvenlik değerlendirmesine soktuğu beş sınır (frontier) modelin tamamı, testler sırasında hile yapmaya çalıştı. Modellerden biri ise bir adım daha ileri giderek harici bir sunucu üzerinden kod çalıştırıp enstitünün değerlendirme altyapısına erişmeye kalkıştı.

AISI, OpenAI'nin GPT-5.4, GPT-5.5 ve GPT-5.6 Sol modelleriyle Anthropic'in Claude Opus 4.7 ve Claude Mythos Preview modellerini kapsamlı siber güvenlik senaryolarında test etti. Bu tür değerlendirmeler, bir modelin gerçek dünyada saldırı/savunma görevlerinde ne kadar güvenilir olduğunu ölçmek için tasarlanıyor; modelin görevi "doğru yoldan" mı yoksa kestirmeden mi çözdüğü de değerlendirmenin parçası. Kurumun tanımına göre "hile", modelin öngörülen çözüm yolunu izlemek yerine kestirme yol, açık geçici çözüm ya da açıkça yasaklanmış bir eylem kullanması anlamına geliyor.

Rakamlar ne diyor?

Test koşularının yüzdesel dökümü şöyle: GPT-5.4, 475 test koşusunun 67'sinde (yüzde 14,1) hileye başvurdu; GPT-5.6 Sol yüzde 12,6, GPT-5.5 yüzde 11,4 ile onu izledi. Anthropic tarafında ise Claude Opus 4.7 yüzde 9,1, Claude Mythos Preview ise yüzde 7,8 hile oranıyla listenin en düşük ucunda yer aldı.

Modellerin başvurduğu yöntemler arasında çözüme dair internette arama yapmak, değerlendirme hedefinin dışındaki sistemlere (modeli barındıran sunucu dahil) saldırmak ve değerlendirme yazılımını cevapları çıkarmak için sondalamak sayılıyor. Özellikle Claude modellerinde sandbox (izole test ortamı) kısıtlamalarını aşma girişimleri öne çıktı.

En dikkat çekici vaka: dışarıdan sisteme sızma denemesi

Raporun en çarpıcı bulgusu, test edilen modellerden birinin yanlışlıkla hatalı yapılandırılmış ve çözülemez hale gelmiş bir görev sırasında, açık internette harici bir servis üzerinde kod yazıp çalıştırarak AISI'nin değerlendirme altyapısına erişmeye çalışmasıydı. Bu girişim bir güvenlik alarmını tetikledi. AISI, altyapısı daha az güvenli olsaydı bu denemenin işe yarayabileceğini belirtiyor.

Bir diğer endişe verici ayrıntı ise modellerin sorgulandığında hile yaptıklarını genellikle kabul etmemesi ve akıl yürütme (reasoning) izlerinde herhangi bir kural ihlali farkındalığı göstermemesiydi. GPT-5.6 Sol'un ise eylemin kuralları ihlal edip etmediğini açıkça değerlendirdiği ama yine de devam ettiği kayıtlara geçti. AISI, hile davranışının modelin eğitim şeklinden (hizalama eğitimi dahil) doğrudan etkilendiğini, dolayısıyla oranların şirketten şirkete ve sürümden sürüme değişebileceğini vurguluyor.

Sahadan bakış

Bizce bu rapor, "model daha yetenekli hale geldikçe daha güvenli davranır" varsayımını çürütüyor. AISI'nin de vurguladığı gibi hile oranı sabit kalsa bile modeller daha yetenekli hale geldikçe olası zarar büyüyebilir; çünkü daha yetenekli bir model, tespit edilmesi daha zor hileler bulabilir. Türkiye'de yapay zekayı üretim ortamına (özellikle kod çalıştırma, dosya erişimi, otomasyon yetkisi olan ajan sistemlerine) entegre eden şirketler için mesaj net: bir modelin "iyi niyetli" davrandığını varsaymak yerine, ajan tabanlı sistemlerde katmanlı izin kontrolü, sandbox izolasyonu ve dış ağ erişimi kısıtlaması olmadan üretime çıkmamak gerekiyor. Bu risk tek bir sağlayıcıya özgü değil; rapor, hem OpenAI hem Anthropic modellerinde farklı oranlarda da olsa aynı eğilimi gösteriyor, dolayısıyla sektörün genelinde izlenmesi gereken bir konu.

Kaynaklar: The Decoder

Bu Yazıyı Paylaş

Muhammet Fatih Batman

Yazan

Muhammet Fatih Batman

Kurucu & Editör

Web tasarım ve yazılım geliştirmede 20 yılı aşkın deneyime sahip, YZ Uzman'ın kurucusu.

Diğer haberler

Bu teknolojiyi işinizde kullanmak ister misiniz?

Konuşalım