Başarı oranı, test birimi ve örnekleme planı açıklanmadan yorumlanamaz. Tek sorunun tekrarları bağımsız yeni sorular gibi sayılırsa belirsizlik olduğundan küçük görünebilir.
benchmark sınırı: mmlu %89 ne kanıtlar?
Her vendor sunumunda aynı slayt: modelin MMLU, GPQA, HumanEval gibi public benchmark skorları, rakiplerle kıyaslı. Bu skorlar işe yarar — model seçiminin ilk elemesinde. Ama validasyon sorusu farklıdır: "bu sistem, bizim kullanıcılarımızın, bizim dokümanlarımızla, bizim dilimizde sorduğu sorulara güvenilir cevap veriyor mu?" Public benchmark bu soruya cevap vermez. Karşılaştır:
Public benchmark
Ne ölçer?Modelin genel yeteneğini: bilgi, akıl yürütme, kod. Görev, ilgili görevin değil.
Dil ve alanAğırlıkla İngilizce ve genel alan. Türkçe bankacılık mevzuatı performansına dair sinyali zayıf.
Kirlilik riskiBenchmark soruları eğitim verisine sızmış olabilir (contamination) — skor, ezberin ölçüsü haline gelir.
Sistem kapsamıÇıplak modeli ölçer. Değerlendirilen sistem prompt + RAG + guardrail bileşkesidir (Modül 02) — o hiç ölçülmemiştir.
Use-case eval
Ne ölçer?Değerlendirilen sistemin, ilgili görev tanımındaki davranışını: groundedness, talimat uyumu, reddetme kalitesi.
Dil ve alanGerçek kullanıcı sorularından (loglardan) örneklenmiş; kurumun dili, jargonu, yazım pratiği içinde.
Kirlilik riskiKuruma özel sorular eğitim verisinde yoktur — ama kendi eval setin de sisteme "sızabilir" (prompt'a örnek olarak girerse). Set hijyeni ilgili sorumluluğunda.
Sistem kapsamıUçtan uca sistemi ölçer — retrieval dahil, guardrail dahil. Onay kararının dayanağı budur.
Kural olarak yaz: public benchmark model seçiminin, use-case eval sistem onayının kanıtıdır. İkisinin yer değiştirmesi — vendor benchmark'ıyla sistem onaylamak — Modül 11'deki "ilgisiz kanıt" sınıfının en yaygın örneğidir ve evidence review'da otomatik yetersizlik almalıdır.
eval set tasarımı: dört boyut
İyi eval seti dört boyutta bilinçli tasarlanır. (1) Temsiliyet: sorular gerçek trafik dağılımından örneklenir — konu, uzunluk, dil, format, yazım kalitesi (Modül 06'nın robustness dersi: temiz el yapımı sorular sahayı temsil etmez). (2) Katmanlılık: set tek blok değildir; dilimlere ayrılır — kolay/zor, sık/nadir, güvenli/riskli, konu bazlı. Toplam skor değil, dilim skorları raporlanır: %94 ortalama, kritik dilimde %70'i gizleyebilir. (3) Zorlayıcılık: sete bilinçli olarak tuzaklar eklenir — cevabı dokümanda olmayan sorular ("bilmiyorum" demeli), karışmaya aday ürün çiftleri (Modül 06'nın bağlam karıştırması), counterfactual çiftler (Modül 07'nin fairness testi), injection denemeleri. (4) Yaşam döngüsü: set statik değildir — üretimdeki yeni hata tipleri sete eklenir, sızma şüphesi olan sorular emekli edilir, referans cevaplar doküman değişince güncellenir.
Sette mutlaka olması gerekenler
Gerçek loglardan örneklenmiş çekirdek (ağırlığı en büyük dilim)
"Cevap yok" soruları — abstention testi
Parafraz aileleri — aynı sorunun 3-5 kılığı
Riskli dilim: ücret, koşul, mevzuat gibi hata maliyeti yüksek sorular
Her referans, kaynak dokümana bağlanır (hangi doküman, hangi bölüm)
Çift bağımsız etiketleme + uyuşmazlık çözüm kaydı (kritik dilimde)
"Kabul edilebilir cevap aralığı" tanımı — tek doğru cümle değil
Doküman güncellenince etkilenen referansların otomatik işaretlenmesi
Set versiyonlama — hangi koşum hangi set versiyonuyla
Golden set'in görünmez maliyeti bakımdır (Modül 13'te değindik): referans cevaplar da eskir. Doküman değişti, referans değişmedi → sistem doğru cevap verir, eval yanlış der. Bu "false regression" alarmları, bakımsız setin tipik belirtisidir ve ekibin eval'a güvenini eritir. Set bakımı için sahip ve takvim tanımla — envanterdeki her sistemin golden set'i de bir varlıktır.
örneklem ve güven aralığı: kaç soru yeter?
Gözlenen başarı oranı, seçilmiş test birimlerinden hesaplanan bir tahmindir. Güven aralığı yöntemi bu tahminin örnekleme belirsizliğini ifade eder. Örneklem büyüklüğü ve başarı sayısı değiştiğinde nokta tahmini ile aralık birlikte izlenebilir.
eval sonucu güven aralığı hesaplayıcı (%95, wilson)
Eval seti büyüklüğü (n)
100
Hedeflenen örnek oran (%)
%92
Örnek kabul eşiği
%90
%0%95 Wilson aralığı · eşik: kırmızı%100
—
alt sınır
—
üst sınır
—
bant genişliği
Hesaplayıcının öğrettiği üç ders. Birincisi: 50 soruluk setle %92 gözlemek, gerçek oranın %81 olabileceğini dışlamaz — küçük set, geniş bant demektir ve "eşiği geçtik" iddiası bantla birlikte değerlendirilir. İkincisi: karar kuralı net yazılmalı: muhafazakâr kural "alt sınır eşiğin üstünde olmalı"dır; "nokta tahmin eşik üstünde" kuralı, bandın yarısı eşiğin altındayken onay vermek demektir. Üçüncüsü: dilim bazlı raporlama örneklemi böler — 500 soruluk set, 10 dilime bölününce dilim başına 50 soru kalır ve dilim sonuçları geniş bantlıdır. Kritik dilimlere ekstra örnek yığ.
Tekrarların yapısı: Aynı sorunun farklı koşumları, yeni bağımsız sorular gibi değerlendirilmez. Soru içi değişkenlik ile sorular arası değişkenlik ayrı ele alınır; birleşik belirsizlik için bu yapıya uygun yöntem seçilir. İki ayrı “±” değeri doğrudan toplamak veya tekrar sayısıyla örneklemi çarpmak doğru değildir.
Başarı sayısı k = yuvarla(n × seçilen oran); gösterilen gerçek oran k/n’dir. Wilson aralığı, bağımsız ve aynı başarı olasılığına sahip ikili sonuç varsayar. Soru tekrarları, ağırlıklı dilimler ve bağımlı gözlemler için örnekleme tasarımına uygun yöntem gerekir. %95, bu yöntemle tekrarlanan örneklemelerdeki kapsama özelliğini ifade eder; belirli parametreye sonradan atanmış olasılık değildir.
llm-as-judge: değerlendiriciyi değerlendir
Binlerce cevabı insanla değerlendirmek ölçeklenmez; pratik çözüm, değerlendirmeyi de bir LLM'e yaptırmaktır (LLM-as-judge): judge modele soru + cevap + referans verilir, "doğru mu, kaynaklı mı?" diye sorulur. Bu meşru ve yaygın bir tekniktir — ama judge da bir modeldir ve kendi sistematik hatalarını ölçüme taşır. Bilinen bias'lara tıkla:
Pozisyon bias'ı — sunum sırası kararı etkiler
Uzunluk/üslup bias'ı — akıcı ve uzun olan kazanır
Self-preference — judge, kendi ailesinin üslubunu sever
Yüzeysellik — biçim doğruysa içerik hatası kaçar
Judge drift — judge modeli güncellenince metrik kayar
Çözüm çerçevesi üç katmandır. Kalibrasyon: judge, insan etiketli bir altın örneklemle (200-500 örnek) karşılaştırılır; uyum (agreement) ve hata yönü ölçülür — judge insandan sistematik olarak cömertse, tüm metrikler şişiktir. Tasarım kontrolleri: ikili kıyasta pozisyon rastgeleleştirilir, rubrik ayrıntılı yazılır (ne "doğru" sayılır), judge'a "bilmiyorum" seçeneği verilir, mümkünse cevabı üreten model ailesinden farklı judge kullanılır. Sürekli doğrulama: insan örneklem denetimi kalıcı bir kota olarak devam eder (ör. judge kararlarının %5'i) ve judge-insan uyumu bir izleme metriği olur — düşerse eval hattı durur.
Governance açısından kritik nokta: judge kullanıyorsan, ölçüm sistemin de envantere girer. Judge modeli + rubrik + kalibrasyon sonucu, validasyon altyapısının bir parçasıdır ve kendi mini-validasyonunu ister. "Metrikleri kim ölçüyor?" sorusunun cevabı bir model ise, o model de gözetimsiz kalamaz — bu, denetçinin er geç soracağı sorudur.
Ölçüm belirsizliği
Başarı oranı, test birimi ve örnekleme planı açıklanmadan yorumlanamaz. Tek sorunun tekrarları bağımsız yeni sorular gibi sayılırsa belirsizlik olduğundan küçük görünebilir.
Güven aralığı örnekleme belirsizliğini ele alır; yanlış referans cevap, değerlendirici yanlılığı ve eksik kullanım kapsamını düzeltmez. Kabul ölçütü değerlendirme başlamadan tanımlanır.
anahtar çıkarımlar
benchmark model seçer, eval sistem onaylar
Public benchmark genel yeteneği ölçer — İngilizce, genel alan, çıplak model, kirlilik riskiyle. Onay kararının kanıtı, kendi trafiğinden örneklenmiş uçtan uca use-case eval'dır.
küçük set, geniş bant: karar alt sınırla verilir
50 soruyla %92, gerçek oranın %81 olabileceğini dışlamaz. Kabul kuralı: güven aralığının alt sınırı eşiğin üstünde. Dilim raporlaması örneklemi böler — kritik dilimlere örnek yığ.
eval seti yaşayan bir varlıktır
Temsiliyet + katmanlılık + tuzaklar + bakım. Referans cevaplar da eskir; bakımsız set false alarm üretir ve güveni eritir. Set sahibi ve takvimi tanımlanır, set versiyonlanır.
judge da bir modeldir — envantere girer
Pozisyon, uzunluk, self-preference bias'ları ölçümü sistematik çarpıtır. İnsan kalibrasyonu, tasarım kontrolleri ve sürekli örneklem denetimi olmadan judge metriği tek başına yeterli kanıt değildir.
Uygulama örneği · kurgusal vaka
karar masası: 100 örnek, tek koşum
Senaryo: Ekip 100 kolay soruyu bir kez çalıştırıp %96 doğru diyor. Örnekler üretimi temsil etmiyor, kritik dilim yok, LLM judge’ın insan uyumu ölçülmemiş.
Örnek değerlendirmeyi aç
DeğerlendirmeKanıtı üretim için yetersiz say. Örneklem, tekrar koşumu, risk-ağırlıklı dilimler ve değerlendirici kalibrasyonu tanımlanmadan tek oranı kabul etme.
Gerekli kanıtZarar taksonomisi; üretim/edge örneklemi; önceden rubrik; n/güven aralığı; çoklu koşum; insan–judge kör kodlama; kritik hata; başarısız vakalar.
Karar kaydıEval acceptance standardı: ana/guardrail metrikleri, kritik kapılar, belirsizlik, minimum n, tekrar protokolü, judge eşiği ve baseline.