Derin Bakış

LLM Test Etme Rehberi: Chatbot'unuz İyi Çalışıyor mu?

LLM test etme (evals) rehberi: golden set kaç örnek ister, RAG metrikleri ne ölçer, yapay zeka hakemin önyargıları nasıl kalibre edilir, regresyon kapısı ve canlı izleme kaça mal olur.

Faruk Talmaç6 Eylül 20269 dakika6 görüntülenme
LLM Test Etme Rehberi: Chatbot'unuz İyi Çalışıyor mu?

Demoda çalışan chatbot ile üretimde çalışan chatbot arasındaki fark bir test setidir. Bu iddiayı baştan koyuyoruz, çünkü sahada gördüğümüz her başarısız chatbot projesinin ortak noktası aynı: kimse "iyi çalışıyor" cümlesini bir sayıya bağlamamış. Satıcı beş soruyla demo yapmış, ekip "güzel cevap veriyor" demiş, sistem canlıya alınmış. Üç hafta sonra bir müşteri iade politikasını yanlış öğrenmiş.

Bu yazı, LLM test etme (sektör diliyle "evals") konusunu karar verici ve teknik ekip için birlikte anlatıyor: kaç örnek gerekir, hangi metrikler ölçülür, bir yapay zekanın başka bir yapay zekayı puanlamasına ne kadar güvenilir, canlıda izleme nasıl kurulur ve bunların hepsi kaça mal olur. Altyapı kararlarının genel haritası için yapay zeka altyapısı yazımıza bakabilirsiniz; burada yalnızca ölçüm katmanını ele alıyoruz.

Neden şimdi? Çünkü 2026'da yayımlanan bir akademik çalışma, genel "iyi uygulama" diye bilinen prompt iyileştirmelerinin ölçüm yapılmadan uygulandığında performansı düşürebildiğini gösterdi. Yani ölçmeden yapılan her "iyileştirme" bir yazı-tura. Test seti olmayan ekip, chatbot'unu her değiştirdiğinde iyileştirdiğini varsayıyor; oysa bazen bozuyor ve bunu müşteriden öğreniyor.

LLM test etme neden klasik yazılım testinden farklı?

Klasik yazılımda aynı girdi her zaman aynı çıktıyı verir; test, "beklenen çıktıyla eşleşiyor mu" sorusudur. Dil modelinde aynı soru her seferinde farklı cümlelerle cevaplanabilir ve cevap doğru olmasa bile akıcıdır. Bu yüzden LLM testi eşleşme değil, değerlendirme ister: cevap doğru mu, kaynağa dayanıyor mu, soruyla ilgili mi, güvenli mi, kaça mal oldu.

İkinci fark: model testi ile uygulama testi ayrı şeylerdir. Bir modelin genel kıyaslama (benchmark) skorunun yüksek olması, sizin iade politikanızı doğru anlattığı anlamına gelmez. Sizi ilgilendiren sistem düzeyi test: doğru belge bulundu mu, doğru araç çağrıldı mı, görev tamamlandı mı. Bir chatbot'un "akıcı ama yanlış, dayanaksız, güvensiz ya da pahalı" cevap vermesi ana risk; benchmark bunların hiçbirini ölçmez.

Üçüncü fark: test bir kez yapılıp bitmez. Prompt değişir, model sürümü değişir, belge arşivi büyür; her değişiklik testin yeniden koşmasını gerektirir. Bu yüzden eval, her değişiklikte otomatik çalışan bir kapıdır; bir kez yazılıp rafa kalkan belge olarak düşünmeyin.

Golden set nedir, kaç örnek gerekir?

Golden set, gerçek kullanıcı sorularından ve uç durumlardan derlenmiş, her biri için beklenen cevabın ya da kabul kriterinin yazıldığı, sürüm numarası verilen bir test koleksiyonudur. Başlangıç için 50 civarı, hedef 200 ve üzeri çeşitlendirilmiş örnek. Sayıdan çok çeşitlilik önemli: 20 dar örnekte yüzde 95 geçiş, 200 çeşitli örnekte yüzde 88'den daha az şey söyler.

Bu "20'de yüzde 95, 200'de yüzde 88" karşılaştırması DeepEval dokümanından; satıcı kaynağı ama mantığı sağlam. 200 örnekteki 10 hata size hangi soru türünde zayıf olduğunuzu gösterir; 20 örnekteki 2 hata hiçbir şey göstermez. Anthropic'in yayımladığı eval desenlerini uygulayan açık kaynak bir depo da 50 örnekli golden setle başlıyor; "ilk hafta 50" pratik bir başlangıç noktası.

Her örnekte şunlar bulunur: soru, varsa bağlam (RAG sistemlerinde hangi belgenin bulunması gerektiği), beklenen cevap ya da kabul kriteri, etiket (soru türü, zorluk, hassasiyet). Örnekleri nereden toplarsınız? Canlıya çıkmadan önce çalışanların soracağı sorulardan; canlıdan sonra gerçek konuşma kayıtlarından, özellikle kullanıcının "hayır, öyle değil" dediği yerlerden. Canlıda yakalanan her hata golden sete geri döner; set böyle büyür.

RAG sistemlerinde hangi metrikler ölçülür?

Şirket belgelerine dayanan bir chatbot (RAG) için üç temel metrik var: sadakat (faithfulness: cevap bulunan belgeye dayanıyor mu, yoksa uyduruyor mu), cevap ilgililiği (answer relevancy: cevap soruya karşılık geliyor mu) ve bağlam isabeti (context precision: bulunan belgeler soruyla ilgili mi, ilgili olanlar üstte mi). Üçü birlikte "RAG üçlüsü" diye anılır ve ayrı ayrı düşebilir.

Ayrı ayrı düşmesi önemli. Cevap belgeye sadık ama soruya ilgisiz olabilir: doğru bir paragrafı yanlış soruya yapıştırmıştır. Cevap soruya ilgili ama belgeye sadakatsiz olabilir: modelin kendi bilgisinden uydurmuştur, ki en tehlikelisi budur. Bağlam isabeti düşükse sorun modelde değil arama katmanındadır; bu durumda prompt değiştirmek işe yaramaz, gömme (embedding) ve arama tarafı düzeltilir. Metrik, hatanın hangi katmanda olduğunu söyler; tek bir "doğruluk yüzdesi" bunu söyleyemez.

Bir uyarı: Ragas ve DeepEval gibi araçlar aynı adlı metriği farklı hesaplar. Ragas sadakati cümle cümle iddiaların belgeden çıkarılabilirliğine bakarak, DeepEval ise çıktı ile belge arasındaki çelişkilere odaklanarak ölçüyor. İki aracın 0,9 sadakat skoru aynı şey değildir; kendi içinizde tek araç seçin ve zaman içindeki değişimi izleyin, araçlar arası kıyaslama yapmayın. RAG'ın kendisini patron özeti yazımızda anlatmıştık; halüsinasyonun engellenmesi için de ayrı bir rehber var.

LLM'in LLM'i puanlaması güvenilir mi?

Kısmen. Bir dil modelini hakem (LLM-as-a-judge) olarak kullanmak ölçeklenebilir tek yöntem, ama hakemin üç bilinen önyargısı var: sıra önyargısı (karşılaştırmada belirli sıradaki cevabı kayırma), uzunluk önyargısı (uzun cevabı daha iyi sanma) ve kendini kayırma (modelin kendi ürettiği metne yüksek puan vermesi). Bunlar azaltılabilir, sıfırlanamaz.

Akademik literatür bu üç önyargıyı tutarlı biçimde raporluyor; 2026 tarihli bir çalışma hakem güvenilirliğini "yazı-tura hakem" başlığıyla sorgulayacak kadar ileri gidiyor. Hafifletme yöntemleri belli: karşılaştırmalarda cevap sırasını rastgeleleştirip iki yönde de puanlatmak, hakem olarak değerlendirilen modelden farklı bir model kullanmak, uzunluğa açık ceza koymak, hakeme "adil ol" yazmak yerine somut bir rubrik vermek.

Asıl güvence ise kalibrasyon: golden setin bir alt kümesini (örneğin 40 örnek) insan etiketler, hakemin puanlarıyla uyum ölçülür. Uyum düşükse rubrik düzeltilir; hakem de test edilir. Bu adımı atlayan ekip, güvenilirliği bilinmeyen bir hakemin sayılarına bakarak karar veriyor demektir. Bir de mantıklı iş bölümü var: kesin kuralları (yasak ifade, biçim, uzunluk, JSON şeması) deterministik kontroller ölçer, hakeme bırakılmaz; hakem yalnızca yargı gerektiren boyutlara (doğruluk, ton, eksiksizlik) bakar.

Regresyon kapısı ve canlıda izleme nasıl kurulur?

Eval, iki yerde çalışır: canlıya çıkmadan önce her değişiklikte otomatik koşan regresyon kapısı ve canlıda gerçek trafiğin örneklenmiş kısmını puanlayan izleme. Kapı, eşik altındaki değişikliğin canlıya çıkmasını engeller; izleme, golden sette olmayan yeni hata türlerini yakalar.

Regresyon kapısı yazılımcıların bildiği sürekli entegrasyon mantığıyla çalışır: prompt, model ya da arama katmanında bir değişiklik yapıldığında golden set otomatik koşar, metrikler eşiğin altındaysa değişiklik birleştirilmez. Eşik nasıl seçilir? Bunun için 2024 tarihli bir akademik çalışma var; pratikte ekipler başlangıç ölçümünün biraz üstünü eşik alıp zamanla yükseltiyor. Önemli olan eşiğin yazılı ve değişikliğin önünde olması.

Canlıda her cevabı puanlamak gerekmez ve pahalıdır. Konuşmaların bir yüzdesi örneklenir, hakem puanlar, düşük puanlı konuşmalar kümelenip yeni hata desenleri aranır. Bunun yanına üç ucuz sinyal eklenir: kullanıcının beğen/beğenme tıklaması, insana devretme (eskalasyon) oranı ve "bilmiyorum" cevabı oranı. Yeni sürüm çıkarken A/B testi ya da gölge test (yeni sürüm paralel çalışır, kullanıcı görmez) eski sürümle kıyaslama verir.

Araçlar ve maliyet: Ragas, DeepEval, Promptfoo, LangSmith, Braintrust

Açık kaynak tarafta Ragas ve DeepEval RAG metriklerini, Promptfoo ise yapılandırma dosyasıyla tanımlanan ve sürekli entegrasyona uygun test akışlarını sunar; hepsi ücretsiz, maliyet yalnızca hakem modelin token ücreti. Platform tarafında LangSmith iz (trace) başına, Braintrust ise puanlama başına ücretlendiriyor; her ikisinde de küçük ekipler için ücretsiz kota var.

Fiyat ayrıntısı tek bir üçüncü taraf kaynağa dayanıyor, resmi sayfadan doğrulamadık: LangSmith 5 bin iz ücretsiz, sonrası bin iz başına 2,50 dolar; Braintrust 10 bin puan ücretsiz, sonrası bin puan başına 2,50 dolar. Tutarları imzalamadan önce resmi fiyat sayfasından okuyun. Bunların yanında Langfuse ve Arize Phoenix gözlemlenebilirlik tarafında anılıyor. Anthropic'in konsolundaki değerlendirme aracı ilk golden seti kurmak için en düşük eşikli başlangıç.

Asıl maliyet kalemi hakem çağrısı ve insan etiketi; araç ücreti bunun yanında küçük. 200 örnekli golden setin her koşusu, örnek başına bir iki hakem çağrısıyla, günümüz fiyatlarında birkaç dolar; günde birkaç kez koşsa ayda on dolarlar mertebesi. İnsan kalibrasyonu ise 40 örnek için bir çalışanın yarım günü. Yani ölçüm katmanı, chatbot projesinin toplam bütçesinde yüzde birkaç; ölçüm olmadan yaşanan tek bir müşteri krizinden ucuz.

Air Canada dersi: test edilmeyen chatbot mahkemede

Şubat 2024'te Kanada'da bir tüketici mahkemesi Air Canada'yı, chatbot'unun verdiği yanlış bilgiden sorumlu tuttu. Chatbot bir yolcuya "normal bilet alın, 90 gün içinde vefat indirimi için başvurun" demişti; gerçek politika geriye dönük başvuruya izin vermiyordu. Şirketin "chatbot ayrı bir tüzel varlıktır" savunması reddedildi; mahkeme "bilginin statik bir sayfadan mı chatbot'tan mı geldiği fark etmez" dedi.

Tutar küçüktü, yaklaşık 812 Kanada doları. Ders büyük: chatbot'un politika beyanları (iade, fiyat, süre, koşul) şirketin beyanıdır. Eval açısından bu, golden sette özel bir kategori demek: politika soruları. Her iade, fiyat ve süre kuralı için en az bir test örneği, sadakat metriğinde "belge dışına çıkma" alarmı ve bu kategoride sıfır tolerans eşiği. Türkiye'de benzer bir emsal karar bu turda bulamadık; ama tüketici hakem heyetinin bir web sayfasındaki beyanı nasıl değerlendirdiğini düşünürseniz, yönü tahmin etmek zor değil. Bunu bir risk notu olarak okuyun, hukuki görüş olarak değil.

Türkçe golden set: İstanbul'da bir e-ticaret iade asistanı

Sahadan bir örnek; şirket anonim, rakamlar yuvarlanmış. İstanbul'da 60 kişilik bir e-ticaret şirketi, iade ve kargo sorularını cevaplayan bir asistan kurdu. İlk golden set 120 Türkçe sorudan oluştu: 70'i gerçek destek kayıtlarından, 30'u politika soruları (iade süresi, kargo ücreti, hasarlı ürün), 20'si uç durum ("ürünü açtım ama kullanmadım", "kampanyalı üründe iade").

İlk ölçüm: sadakat 0,81, cevap ilgililiği 0,88, politika sorularında hata 30'da 4. Sorun modelde değil aramadaydı: kampanya koşulları ayrı bir belgedeydi ve bulunmuyordu. Belge birleştirilip arama düzeltildi; sadakat 0,93'e çıktı, politika hatası sıfıra indi. Prompt'a tek kelime dokunulmadı. Hakem kalibrasyonu için 40 örnek bir destek çalışanı tarafından etiketlendi; hakemle uyum ilk turda yüzde 78'di, rubrik Türkçe nezaket ifadelerini "eksik cevap" sanıyordu, düzeltilince yüzde 90'a çıktı. Bu ayrıntı Türkçe için genel bir uyarı: hazır rubrikler ve metrik prompt'ları İngilizce yazılmış; Türkçe golden set ve Türkçe rubrik olmadan hakem, dili değil sizin chatbot'unuzu puanladığını sanır.

Sık sorulan sorular

Chatbot'u test etmek için kaç örnek gerekir?

Başlangıç 50, hedef 200 ve üzeri, çeşitlendirilmiş. Küçük setteki yüksek yüzdeye güvenmeyin; 20 örnekte yüzde 95, 200 örnekte yüzde 88'den az bilgi verir.

Sadakat ile cevap ilgililiği arasındaki fark ne?

Sadakat, cevabın bulunan belgeye dayanıp dayanmadığı; ilgililik, cevabın soruya karşılık gelip gelmediği. Biri düşük, diğeri yüksek olabilir ve her biri farklı katmanı işaret eder.

Yapay zekanın yapay zekayı puanlaması güvenilir mi?

Kalibre edilirse kullanılabilir. Sıra, uzunluk ve kendini kayırma önyargıları bilinir; farklı hakem modeli, rastgele sıra ve 40 örneklik insan etiketiyle uyum ölçümü şart.

Eval kaça mal olur?

Araçlar büyük ölçüde açık kaynak; asıl kalem hakem çağrısı (200 örnek için koşu başına birkaç dolar) ve insan etiketi (yarım gün). Proje bütçesinin yüzde birkaçı.

Canlıda her cevabı puanlamalı mıyım?

Hayır. Örnekleme, kullanıcı geri bildirimi, eskalasyon ve "bilmiyorum" oranı yeterli; yakalanan hatalar golden sete eklenir.

Chatbot yanlış bilgi verirse şirket sorumlu mu?

Air Canada kararında evet: statik sayfadan farkı yok. Politika soruları için ayrı test kategorisi ve sıfır tolerans eşiği kurun.

Peki siz ne yapmalısınız?

  • İlk hafta 50 örneklik golden set yazın; gerçek sorulardan, politika sorularını ayrı etiketleyin.
  • Üç RAG metriğini ayrı ayrı ölçün; hangi katmanın bozuk olduğunu tek bir doğruluk yüzdesi söylemez.
  • Hakemi kalibre edin: 40 örnek insan etiketi, farklı hakem modeli, rastgele sıra, uzunluk cezası.
  • Regresyon kapısını kurun: her değişiklikte otomatik koşan set ve yazılı eşik; eşik altı canlıya çıkmaz.
  • Canlıda örnekleyin, hataları sete geri besleyin. Golden set canlı bir belge, bir kez yazılan bir dosya değil.

Test seti olmayan chatbot, iyi çalıştığına inanılan bir chatbot'tur; test seti olan chatbot, iyi çalıştığı bilinen bir chatbot. İkisi arasındaki fark ilk hafta 50 soru ve yarım günlük bir etiketleme. Chatbot'unuz canlıdaysa ve hâlâ bir golden setiniz yoksa, en son on destek kaydınızdan başlamak bugün öğleden sonra yapılabilecek bir iş. Etiketleme rubriğinde takılırsanız ilk 40 örneği nasıl puanladığımızı göstermekten memnun oluruz.

Bu Yazıyı Paylaş

Faruk Talmaç

Yazan

Faruk Talmaç

Kurucu Ortak & Editör

Web tasarım ve yazılım geliştirmede 20 yılı aşkın deneyime sahip, YZ Uzman'ın kurucu ortağı.

Yorumlar

Yorum Yaz

Yorum yapmak için giriş yapmalısınız.

Giriş Yap

Henüz yorum yapılmamış. İlk yorumu sen yap!

Okuduğunuz fikri gerçek bir ürüne dönüştürelim.

Projeyi konuşalım