Modeller
Çin'den Aynı Gün İki Açık Model: GLM-5.3-Flash ve Qwen
Z.ai'nin GLM-5.3-Flash'ı ve Alibaba'nın Qwen3.8-Flash-Next'i aynı gün açık ağırlıkla çıktı. Ox Alpha'nın kimliği, benchmark tabloları ve 15 sentlik fiyat bandı haberde.

Toplam 445 milyar parametre, iki laboratuvar, tek gün. 26 Ağustos'ta Z.ai GLM-5.3-Flash'ı, Alibaba'nın Qwen ekibi Qwen3.8-Flash-Next'i birkaç saat arayla açık ağırlıklarla yayımladı. Hacker News'te iki duyuru birlikte 1.600'ün üzerinde puan topladı; Çin'in açık model temposu bir kez daha tek güne iki sürüm sığdırdı.
GLM-5.3-Flash: Ox Alpha maskesini çıkardı
GLM-5.3-Flash, 320 milyar toplam ve token başına 18 milyar aktif parametreli bir uzman karışımı (MoE) modeli. Doğuştan çok modlu: görüntü ve video girdisini destekliyor, bağlam penceresi 1 milyon token. Ağırlıklar MIT lisansıyla Hugging Face'te; API fiyatı milyon token başına 0,15 dolar girdi, 0,50 dolar çıktı. Mimaride iki dikkat çekici tercih var: her token 288 uzmandan 8'ine yönlendiriliyor ve IndexPool adlı sıkıştırma tekniği dikkat hesabını yaklaşık 3 kat, önbellek yükünü 4,4 kat azaltıyor. Z.ai'nin paylaştığı ölçümlerde model, Terminal-Bench 2.1'de 84,3 puanla Opus 4.8'in 85,0'ının hemen altında; ajan tabanlı kodlama testi DeepSWE'de 63,4 ile bir önceki sürümün 46,2'sini geride bırakıyor. Her lansman tablosunda olduğu gibi bu skorların da üreticinin kendi ölçümü olduğunu, bağımsız testlerin genellikle birkaç puan aşağıda kaldığını not edelim.
İşin renkli tarafı modelin geçmişinde: Bloomberg'in doğruladığına göre GLM-5.3-Flash, ilk haftasını OpenRouter ve OpenCode üzerinde "Ox Alpha" takma adıyla, kimliği gizli şekilde geçirdi. Üstelik bu süreçte tamamen Çin üretimi çiplerde servis edildi. Geçen hafta GLM-5.3'ün ağırlık yayınının ertelendiğini yazmıştık; amiral gemisi hâlâ beklemede ama Flash sürümü açık çıktı.
Qwen3.8-Flash-Next: Qwen4'ün ön izlemesi
Alibaba cephesindeki model daha küçük ama iddiası büyük: 125 milyar toplam, token başına yalnızca 6 milyar aktif parametre. En ilginç mimari tercih, 51 milyar parametrelik n-gram gömme katmanının GPU belleği yerine sistem RAM'inde tutulması. Ekip, Qwen3.7-Plus'tan daha iyi sonuçları kabaca dokuzda bir eğitim maliyetiyle aldığını söylüyor ve modeli açıkça Qwen4 mimarisinin ön izlemesi olarak konumluyor. Kodlama tarafındaki iddiası da küçümsenecek gibi görünmüyor: SWE-bench Pro'da 62,5, LiveCodeBench v6'da 91,9 puan bildiriliyor (yine üreticinin kendi tablosu). Bağlam 262 bin token, YaRN tekniğiyle 1 milyona uzatılabiliyor. API fiyatı GLM ile neredeyse aynı bantta: 0,16 dolar girdi, 0,47 dolar çıktı. Ağustos ortasında 17 GB'a sığan Qwen 3.8 27B ile başlayan seri, iki haftada üçüncü açık sürümüne ulaştı.
Bu yarıştan işletmelere düşen pay
İki modelin ortak mesajı fiyat: milyon token başına 15-16 sent, batı sağlayıcılarının amiral gemisi fiyatlarının çok altında. Yüksek hacimli, orta zorlukta işler (belge özetleme, sınıflandırma, müşteri yanıtı taslağı) için bu bant, maliyet tablosunu yeniden yazdırıyor. Kendi sunucusunda çalıştırmak isteyenler için gerçekçi olalım: GLM-5.3-Flash'ın FP8 kontrol noktası 306 GiB ve en az 8 GPU'luk bir düğüm istiyor; KOBİ ölçeğinde mantıklı yol API ya da bulut barındırma. Veri hangi ülkede işleniyor sorusunu da sözleşmeye yazdırmayı unutmayın; ucuz token, mevzuat yükümlülüğünü ortadan kaldırmıyor.
Kaynaklar: Z.ai, The Decoder, MarkTechPost

Yazan
Faruk Talmaç
Kurucu Ortak & Editör
Web tasarım ve yazılım geliştirmede 20 yılı aşkın deneyime sahip, YZ Uzman'ın kurucu ortağı.