Şirketler
DeepMind'dan Çift Kör Benchmark ve Deney Yapan Co-Scientist
Google DeepMind aynı hafta iki adım attı: Gemini Flash Lite'ı ne ağırlıkların ne de test sorularının görüldüğü çift kör bir değerlendirmeden geçirdi; Co-Scientist ise laboratuvar cihazı yönetip tek denemede yarı iletken üretti.

Yüzde 4'e karşı yüzde 46. Google DeepMind'ın bu hafta yayımladığı Co-Scientist çalışmasında, güvenilirlik modülleri açıkken üretilen bilimsel makalelerdeki uydurma oranı yüzde 4; modüller kapalıyken yüzde 46. Aynı hafta DeepMind bir de "dünyanın ilk çift kör yapay zeka değerlendirmesi"ni duyurdu. İki haber ayrı görünüyor ama aynı soruya cevap: bir yapay zeka bilim yaptığını söylediğinde ona ne kadar güvenebiliriz?
Çift kör test: kim neyi görüyor?
27 Ağustos'ta duyurulan pilotta DeepMind, bir Gemini Flash Lite modelini Singapur Yapay Zeka Güvenliği Enstitüsü, OpenMined, AVERI ve MLCommons ile birlikte test etti. Yenilik, Google Cloud'un Confidential Space (gizli hesaplama) altyapısı: değerlendirici model ağırlıklarını görmüyor, Google ise test sorularını görmüyor. Bugüne kadar bağımsız değerlendirme iki taraftan birinin bir şeyi açmasını gerektiriyordu; ya laboratuvar ağırlıklarını dışarı veriyordu ya da değerlendirici sorularını. İkincisi, soruların eğitim verisine sızmasına (benchmark kirlenmesi) yol açtığı için skorların güvenilirliğini yiyordu.
Duyuru hangi benchmark'ların kullanıldığını ve sonuçları paylaşmıyor; DeepMind yöntemi anlatan teknik bir rapor yayımladı. Yani bu bir sonuç haberi değil, bir yöntem haberi. Asıl önemi, siber güvenlik gibi hassas testlerde ve devlet kurumlarının yaptığı denetimlerde kullanılabilecek olması.
Co-Scientist laboratuvara girdi
28 Ağustos'ta yayımlanan arXiv makalesinde (2608.26701; Duke, Columbia, Texas A&M ve Google Research ortak) Co-Scientist'in yeni sürümü hipotez üretmekle kalmayıp deney planlıyor, kod yazıp çalıştırıyor, laboratuvar cihazını kontrol ediyor, sonucu analiz edip makale yazıyor. Malzeme biliminde sistem, yarı otomatik bir kimyasal buhar biriktirme reaktörüne bağlanmış; büyütme tariflerini laboratuvar kısıtlarına göre dakikalar içinde uyarlayıp tek denemede MoS2, MoSe2 ve WS2 tek katmanlı yarı iletkenler üretmiş. Motor, Gemini 3 Deep Think.
Ölçüm tarafındaki sayılar şöyle: 30 alan uzmanı, 150 otonom üretilmiş makale üzerinde 450 bağımsız çift kör inceleme yapmış. Güvenlik katmanı, potansiyel olarak zararlı araştırma yönlerinin yüzde 98,7'sini reddetmiş. Makale kendi sınırlarını da yazıyor: sistem seçici raporlama eğilimi taşıyor, yazdığı yöntemle çalıştırdığı kod arasında tutarsızlıklar çıkabiliyor ve tamamen yeni sistemlerde davranışı öngörülemiyor. DeepMind'ın kendi cümlesi: "Yapay zeka sistemlerinin bilimin fiziksel gerçekleriyle baş edebilmesi için önümüzde uzun bir yol var."
Bu ikisi neden tek haber?
Bizce bu haftanın asıl gelişmesi, DeepMind'ın ajanı laboratuvara sokarken kendi sistemlerini nasıl ölçtüğünü de değiştirmesi. Anthropic'in Model Hardware Standard'ıyla birlikte okuyunca tablo netleşiyor: büyük laboratuvarlar ajanları fiziksel dünyaya sokuyor ve aynı anda "bu iddiayı kim, nasıl doğruladı" sorusuna altyapı kuruyor. Türkiye'deki Ar-Ge merkezleri ve üniversite laboratuvarları için pratik çıkarım şu: yapay zeka destekli deney otomasyonu artık makale konusu değil, satın alınabilir bir yetenek; ama yüzde 4'lük uydurma oranı bile 100 makalede 4 makale demek. Uzman incelemesi maliyet kalemi olmaktan çıkıp sistemin parçası hâline geliyor.
Kaynaklar: Google DeepMind, arXiv (2608.26701), The Decoder (çift kör), The Decoder (Co-Scientist)

Yazan
Faruk Talmaç
Kurucu Ortak & Editör
Web tasarım ve yazılım geliştirmede 20 yılı aşkın deneyime sahip, YZ Uzman'ın kurucu ortağı.