Avrupa'nın en büyük yapay zeka şirketi "Çin dışındaki en güçlü açık ağırlıklı model" diyor. Bağımsız bir endeks ise aynı modeli Çinli rakipleriyle aynı hizaya koyuyor. İkisi de doğru olabilir mi?

Mistral, 6 Ekim'de Mistral Large 4'ü herkese açık önizleme olarak yayınladı. Şirket içi takma adı "le Chonk". Toplam yaklaşık 1 trilyon parametre, bunların 52 milyarı her istekte aktif (uzmanlar karışımı, yani MoE mimarisi). Metin ve görüntü girdisi alıyor, 160'tan fazla dilde eğitilmiş, AB'nin tüm resmi dilleri dahil. Mistral'in vurguladığı asıl nokta altyapı: model, şirketin kendi Avrupa veri merkezlerinde 3.800 Nvidia Grace Blackwell GPU ile sıfırdan eğitildi ve yine Avrupa'dan sunuluyor.

Rakamlar ne söylüyor, ne söylemiyor?

Mistral'in öne çıkardığı alan siber güvenlik. Şirketin kendi ölçümüne göre model, zafiyeti yeniden üretip yama yazma testinde yüzde 82 başarı alıyor ve Cybench görevlerinin yüzde 93'ünü çözüyor. Duyuruda Claude Opus 5.5 ve GPT-6 Astra'nın bu testte "sıfıra yakın" puan aldığı yazıyor, ama gerekçe açık: o modeller bu tür istekleri reddediyor. Yani kıyas, yetenek farkından çok politika farkını ölçüyor.

Kodlamada tablo daha mütevazı. DeepSWE v1.1'de yüzde 61,7, Terminal-Bench 4'te yüzde 28,3. Surge AI'nin kör insan değerlendirmesinde 5 üzerinden 3,74 ile Claude Opus 5'in (4,22) gerisinde ikinci sırada. Mistral'in kendi grafiklerinde bile Kimi K3, GLM-5.3 ve DeepSeek'in kodlama puanları Large 4'ün önünde.

Bağımsız ölçüm daha serin. Artificial Analysis'in Intelligence Index'inde Large 4 Preview 38 puan alıyor: GPT-6 Luna ve DeepSeek V4.1 Flash'ın (39) hemen altında, Claude Opus 5.5 (58), Sonnet 5.5 (56) ve GPT-6 Astra'nın (53) ise epey gerisinde. Bir ayrıntı daha: aynı endeksi koşmak için yaklaşık 200 milyon token harcıyor, medyan 81 milyon. Konuşkan bir model; etiket fiyatı düşük görünse de görev başına maliyet beklediğinizden yüksek çıkabilir.

Fiyat ve erişim

Milyon girdi token'ı 1,36 dolar, çıktı 4,18 dolar. Şu an yalnızca Mistral Studio üzerinden API ile kullanılıyor; Le Chat, Azure veya Bedrock'ta sunulduğuna dair duyuruda bir ifade yok. Bağlam penceresi de duyuruda yazmıyor; üçüncü taraf kaynaklar 524 bin ile 1 milyon arasında farklı rakamlar veriyor, bu yüzden doğrulanmış sayılmaz.

Asıl söz açık ağırlıklar: Mistral, model ağırlıklarını ay sonuna kadar yayınlayacağını söylüyor. Lisans adı henüz açıklanmadı. Ağırlıklar çıkınca modeli kendi sunucunuzda ya da özel bulutta çalıştırmak mümkün olacak; Mistral bunu özellikle siber güvenlik ekipleri için öneriyor. Simon Willison gibi gözlemciler, Aralık 2025'teki Large 3'ün 9 puanlık endeks skorundan 38'e çıkışı "büyük bir sıçrama" diye niteliyor. Eleştiri ise iki noktada toplanıyor: pazarlama dili ile bağımsız skor arasındaki mesafe ve zafiyet bulma yeteneğinin çift kullanımlı doğası.

Bize göre asıl mesele

Türkiye'de düzenlemeye tabi sektörlerde (finans, sağlık, kamu tedarikçileri) çalışan ekiplerin yapay zekaya en sık itirazı veri egemenliği: veri ülke ya da en azından kıta dışına çıkmasın. Large 4'ün değer önerisi tam burada. Avrupa'da eğitilmiş, Avrupa'dan sunulan ve yakında kendi sunucunuza kurabileceğiniz bir model, bu itirazı masadan kaldırmanın en kısa yolu olabilir.

Ama endeks skoru dürüst bir uyarı. Genel zekâ işlerinde Large 4, Opus 5.5 veya Astra'nın yerine geçmiyor. Doğru kullanım, onu belirli bir işe odaklamak: kurum içi belge sorgulama, siber güvenlik analizi, veri dışarı çıkmaması gereken sınıflandırma görevleri. Bizim tavsiyemiz, ağırlıklar ve lisans netleşinceye kadar API önizlemesini kendi iş yükünüzle test etmek, maliyeti etiket fiyatından değil görev başına harcanan token'dan hesaplamak. Ay sonunda ağırlıklar ve lisans gelirse, o zaman kendi altyapıda çalıştırma kararı için elinizde gerçek ölçüm olur.

Kaynaklar: Mistral, Large 4 duyurusu, Simon Willison, le Chonk notu, Slashdot