Şirketler

ChatGPT, Claude ve Grok Aynı Sabah Çöktü: Ortak Neden Yok

3 Eylül'de Claude 3 saat, Grok saatlerce, ChatGPT 34 dakika kesildi. Şirketler farklı nedenler verdi, Cloudflare ve bulutlar temiz çıktı. Çok sağlayıcılı yedekleme neden yetmedi?

Muhammet Fatih Batman5 Eylül 20263 dakika2 görüntülenme
ChatGPT, Claude ve Grok Aynı Sabah Çöktü: Ortak Neden Yok

Şöyle bir sahne düşünün: İstanbul'da bir e-ticaret şirketinin destek ekibi, 3 Eylül Perşembe Türkiye saatiyle 16:26'da kör kalıyor. Müşteri mesajlarını sınıflandıran ajan Claude üzerinde çalışıyor; yedeği ChatGPT'ye bağlı. Önce birincisi hata vermeye başlıyor, bir saat on yedi dakika sonra ikincisi de. Aynı dakikalarda Grok da erişilemiyor. Bu sahne kurgu ama saatler gerçek. Üç şirketin üçü de farklı bir açıklama yaptı ve hiçbiri ortak bir nedene işaret etmedi.

Saat saat ne oldu?

Anthropic'in durum sayfasına göre "birden fazla modelde yükselen hata oranları" olayı 13:26 UTC'de (Türkiye saatiyle 16:26) açıldı ve 16:16 UTC'de bitti: 3 saat 6 dakika. Etkilenenler claude.ai, Claude API, Claude Code ve Claude Cowork; modeller Mythos 5.1, Fable 5.1, Opus 5, Opus 4.8 ve Opus 4.6. Kök neden "tespit edildi" dendi ama kamuya açıklanmadı; şirketin açıklaması "bir altyapı sorunu" ile sınırlı.

xAI, Grok için 13:30 UTC civarında inceleme başlattı. Sonradan gelen açıklama daha somuttu: "Bu sabah Memphis hesaplama merkezimizdeki bir kesintinin ardından Grok'ta yaşadığınız sorunlar için özür dileriz." Açıklamada "etkilenen hesaplama ortaklarımız"dan da özür dilendi. Bu ifade dikkat çekti, çünkü Anthropic mayıs ayında Memphis'teki Colossus 1 tesisinin tüm kapasitesini kiralamıştı. İki kesintinin aynı tesise bağlı olup olmadığını ne Anthropic ne xAI doğruladı.

OpenAI en kısa süreli olandı: 14:43 UTC'de başlayan bir "yönlendirme hatası" ChatGPT ve Codex'i bazı kullanıcılar için erişilemez yaptı, 15:17'de çözüldü. Toplam 34 dakika. Bir OpenAI altyapı mühendisi Hacker News'te bunun kendi altyapılarındaki bir hata olduğunu yazdı.

Neyin suçu değil?

Cloudflare'in teknoloji direktörü açıkça reddetti: "Şu anda önemli bir hizmet kesintisi yaşamıyoruz." AWS, Google Cloud ve Azure'un durum sayfalarında da ilgili bir kayıt yok. Wired 4 Eylül'de "kimse nedenini söylemiyor" başlığıyla yazdı; Hacker News'teki ortak neden teorileri ise şimdilik teori.

Bir BT yöneticisinin gördüğü

Sahadan bakınca üç şeyi görüyorsunuz. Birincisi, "iki sağlayıcıya bağlıyım, güvendeyim" varsayımı bir saat on yedi dakika dayandı. İkincisi, kesintiler eşzamanlı olmasa bile üst üste binebiliyor ve o pencerede ajanlarınız kuyruğa alınmış işleri sessizce düşürebiliyor. Üçüncüsü, hiçbir sağlayıcı size kök nedeni zamanında söylemiyor; Anthropic'in sayfasında "kök neden tespit edildi" satırı hâlâ içeriksiz.

Forrester analisti Charlie Dai'nin ITPro'ya söylediği cümle özetliyor: işletmeler yapay zeka erişilebilirliğini bir dayanıklılık meselesi olarak ele almalı, "öncü modellerin her zaman ayakta olacağını varsaymak yerine çok modelli stratejiler, yedek iş akışları ve iş sürekliliği planları" kurmalı.

Türkiye'deki ekiplere pratik liste

  • Yedek sağlayıcınızın aynı fiziksel altyapıyı paylaşmadığını sorun; Memphis örneği bunun teorik olmadığını gösterdi.
  • Ajan akışlarında "model yanıt vermezse ne olur" dalını yazın: kuyrukta beklet, insana yönlendir, ama sessizce düşürme.
  • Durum sayfalarına abone olun ve alarmı sağlayıcının duyurusuna değil kendi hata oranınıza bağlayın; OpenAI'ın 34 dakikası bazı kullanıcılar için resmî kayda geçmeden bitti.
  • Sözleşmelerde SLA yoksa kesintinin maliyetini kendiniz hesaplayıp yedek maliyetiyle karşılaştırın. Çoğu ekipte ikinci bir API anahtarı ilk kesintiden ucuzdur.

Kaynaklar: The Register, Anthropic durum sayfası, ITPro: Forrester yorumu, Hacker News tartışması

Bu Yazıyı Paylaş

Muhammet Fatih Batman

Yazan

Muhammet Fatih Batman

Kurucu & Editör

Web tasarım ve yazılım geliştirmede 20 yılı aşkın deneyime sahip, YZ Uzman'ın kurucusu.

Diğer haberler

Bu teknolojiyi işinizde kullanmak ister misiniz?

Konuşalım