OpenAI'ın 6 Ekim'de yaptığı matematik hamlesi, yapay zekanın bilim üretme biçimi hakkında şimdiye kadarki en sert tartışmayı açtı. Şirket, adını vermediği bir iç model ile yaklaşık 370 açık probleme ilişkin 720 civarı makale yayınladı. Ertesi gün bunların üçü geri çekildi. Bir hafta içinde bir matematikçi grubu meslektaşlarını OpenAI ile çalışmayı bırakmaya çağırdı.

Ne yayınlandı?

OpenAI'ın "Sharing AI progress in mathematics" başlıklı duyurusunda sonuçların "şirket içi bir sınır model" tarafından üretildiği yazıyor; model adı hiçbir yerde geçmiyor. Pakette açık problemler üzerine makaleler, bunların bir kısmının Lean dilinde biçimsel doğrulaması (bilgisayarın kanıtı adım adım denetlediği yöntem), modelin akıl yürütmesini özetleyen 10 metin ve hesaplama maliyeti tahminleri var. OpenAI ortalama bir sonucun ChatGPT Pro düzeyinde yaklaşık 3 saatlik düşünmeye denk geldiğini söylüyor. The Decoder'ın aktardığı, OpenAI'ın doğrulamadığı rakama göre yaklaşık 8 bin problem denendi ve yüzde 5 civarı başarı elde edildi.

Biçimsel doğrulama oranı önemli: GitHub'daki güncel kayda göre 719 ana sonucun 300'ü, yani yüzde 42'si Lean ile doğrulanmış. Geri kalan yüzde 58, insan hakemliği bekleyen doğal dilde yazılmış metin.

Neden üç makale geri çekildi?

7 Ekim'de OpenAI, depoda tuttuğu değişiklik günlüğüne üç geri çekme işledi. Üçü de cebirsel geometri alanında: bölünmüş abelyen sekizli katlar üzerinde Weil sınıflarının cebirselliği, K3 yüzeyleri için Kuga-Satake karşılıkları ve K3 yüzeylerinin çarpımları için rasyonel Hodge varsayımı. Gerekçe tek cümle: bir işaret hatası, bir sadeleştirme argümanını geçersiz kılıyor ve ona dayanan iki makalenin inşasını da çökertiyor. Aynı güncellemede 14 makale düzeltildi, 13'ünün atıfları güncellendi, 6 yeni biçimsel doğrulama eklendi.

Kendi başına üç geri çekme, 720 makalede küçük bir oran. Tartışmayı büyüten şey, hatanın yayından sonra ve topluluk tarafından bulunmuş olması.

Matematikçiler ne diyor?

En sert tepki, Terence Tao'nun blogunda konuk yazı olarak yayınlanan Association for Human Mathematics bildirisi. Bildiri, OpenAI'ın bilimsel araştırmanın temel normlarını çiğnediğini, bağımsız danışma grubu AGMAI'nin "açık problemleri kapalı modellerle test etmeyin" çağrısını görmezden geldiğini söylüyor; yayını ilerleme değil "güç gösterisi" olarak niteliyor ve matematikçileri OpenAI ile çalışmayı kesmeye çağırıyor. Çağrıya kaç kişinin katıldığına dair bir rakam yok.

Tao'nun kendi görüşü daha nüanslı. Problemlerin "çıktıyı tartışacak kadar anlamayan istem yazıcıları" tarafından çözüldüğünü söylüyor ve hasarın geri alınamaz olduğunu ekliyor: bir problem çözüldüğünde çözülmemiş hale getirilemez, çözümün varlığını bilmek bile başka yolları aramayı zehirler. Harvard'dan Melanie Wood: "Yayın anında bu sonuçların insan tarafından anlaşılması yok; iş şimdi başlıyor." Scott Aaronson olayı "Mathocalypse" diye adlandırdı. Unique Games Varsayımı üzerine çalışan Dana Moshkovitz, ilgili makalenin "yapay zeka yardımı olmadan okunamayacak kadar kötü yazıldığını" söyledi.

Cambridge ve King's College London'dan araştırmacıların arXiv'e koyduğu bir çalışma da teknik bir uyarı veriyor: Navier-Stokes'tan türetilmiş bir problemde, OpenAI'ın doğal dildeki kanıtı ile Lean kodu arasında en az iki tutarsızlık buldular ve bu kanıtların hakem denetimi olmadan "peşinen güvenilir sayılmaması" gerektiği sonucuna vardılar.

Bu tartışma neden matematikçilerle sınırlı değil?

Olay, yapay zeka çıktısını üretenle doğrulayan arasındaki dengesizliği netleştiriyor. Bir model üç saatte 720 makale yazabiliyor; bir hakemin tek makaleyi okuması haftalar alıyor. Biçimsel doğrulama yüzde 42'de kalıyorsa geri kalanı kimin, ne zaman okuyacağı sorusu açıkta.

Aynı denklem işletmelerde de geçerli. Bir yapay zeka sisteminin ürettiği sözleşme taslağı, finansal rapor ya da kod, ancak üretim hızına yakın bir hızla doğrulanabiliyorsa işe yarar. OpenAI örneğinde doğrulamanın bir kısmı makineyle (Lean) yapıldı ve hata bir günde yakalandı; doğal dilde kalan kısım ise hâlâ bekliyor. Bize göre ders açık: yapay zekayı hangi işe sokuyorsanız, çıktının nasıl denetleneceğini de aynı anda tasarlayın. Denetim mekanizması olmayan üretim, hız değil birikmiş risk demektir.

Kaynaklar: OpenAI, matematik deposu değişiklik günlüğü, TechCrunch, The Decoder, Retraction Watch