AI Risk & Validation Framework · 15

RAG Validasyonu

RAG sisteminde doğru belgenin getirilmesi ve yanıtın o belgeyi doğru kullanması ayrı aşamalardır. Retrieval başarısı düşükse yalnız yanıt istemini iyileştirmek yeterli olmayabilir.

Görsellerdeki sayılar, dağılımlar ve senaryolar kavramları açıklamak için oluşturulmuştur. Gerçek bir ürünün performans ölçümü veya bir kurumun test sonucu değildir.

katman ilkesi: rag iki ayrı sınavdır

RAG'li bir sistemin cevabı iki aşamanın ürünüdür: retrieval (doğru parçaları bul) ve generation (bulunanlara sadık kalarak cevapla). Bu ikisini tek "sistem skoru"yla ölçmek, teşhis gücünü öldürür — Modül 02'nin dersi: hata doğduğu yerde değil, göründüğü yerde raporlanır. Uçtan uca %85 gören ekip, sorunun modelde mi retrieval'da mı olduğunu bilmeden model değiştirmeye kalkar; oysa çoğu zaman sorun, LLM'e hiç ulaşmayan doğru dokümandır.

Katmanlı test ilkesi basit: retrieval, LLM olmadan test edilir. Her eval sorusu için "hangi doküman parçaları ilgili?" bilgisi (relevance etiketi) hazırlanır; retriever'ın getirdikleri bu etiketle karşılaştırılır. Bu, deterministik ve ucuz bir testtir — LLM çağrısı yok, olasılık yok, klasik bilgi erişimi (information retrieval) metrikleriyle ölçülür. Generation ise ayrı test edilir: doğru parçalar verildiğinde model sadık cevap üretiyor mu (Modül 06'nın groundedness'ı)? İki katman ayrı geçer notu aldığında uçtan uca test, entegrasyonu doğrular.

Terminoloji hızlandırıcısı: recall@k = ilgili parçaların ne kadarı ilk k sonuçta geldi (kaçırma ölçüsü). Precision@k = gelen k parçanın ne kadarı gerçekten ilgili (gürültü ölçüsü). MRR = ilk ilgili sonucun sıralamadaki yeri (ne kadar üstte). Retrieval için "AUC/KS" neyse bunlar odur — klasik validasyoncu için yeni metrik, eski disiplin.

retrieval simülatörü: k'yı kaydır, trade-off'u gör

Aşağıda bir sorgu ve doküman tabanından 12 parça var; 4'ü gerçekten ilgili (etiketli). İki retriever profili arasında geçiş yap ve k'yı (LLM'e verilecek parça sayısı) kaydır:

retrieval testi — tek sorgu örneği
sorgu"Esnek Hesap'ta limit artışı nasıl yapılır, koşulları neler?"
k (LLM'e verilen parça sayısı)
4
recall@k
precision@k
bağlamdaki gürültü

Simülatörün gösterdiği gerilim gerçektir: k'yı büyütmek recall'ü kurtarır ama bağlamı gürültüyle doldurur. Gürültülü bağlam masum değildir — ilgisiz parçalar modeli yanlış yöne çeker (Modül 06'nın bağlam karıştırması), uzun bağlam talimat sadakatini düşürür ve maliyeti artırır. Zayıf retriever'ı büyük k ile telafi etmek, çöp yığınını büyüterek iğneyi arattırmaktır. Doğru sıra: önce retriever'ı düzelt (embedding, chunking, reranker), sonra k'yı küçült.

Validasyon lensi: Tek sorgu örnektir; gerçek test, eval setindeki tüm sorgular üzerinden dağılımdır: ortalama recall@k değil, recall dağılımı — sorguların yüzde kaçında recall sıfır? "Ortalama %88 recall", sorguların %10'unda hiçbir ilgili dokümanın gelmediğini gizleyebilir; o %10'da sistem yapısal olarak halüsinasyona itilir (bağlamda cevap yokken cevap üretmeye çalışır — abstention testiyle birleştir).

tasarım kararları: her satıra tıkla

Retrieval kalitesi, altı tasarım kararının bileşkesidir. Her biri challenge konusudur — "neden bu değer?" sorusunun cevabı dokümante olmalı (Modül 03'ün gerekçe disiplini):

Chunk boyutu ve bölme stratejisi
Embedding modeli
Arama stratejisi: vektör / anahtar kelime / hibrit
Reranker (ikinci aşama sıralayıcı)
Metadata ve güncellik filtreleri
Erişim kontrolü (kim hangi dokümanı görebilir)

hata kadranı: sorun hangi katmanda?

Uçtan uca bir hata gördüğünde teşhis iki soruyla başlar: retrieval doğru parçaları getirdi mi? Model, getirilene sadık kaldı mı? Dört kadrana tıkla:

retrieval × generation kadranı
generation: sadık ← → sadakatsiz
✓ Doğru cevap
Retrieval iyi + generation sadık. Hedef kadran — ama nasıl ölçtüğünü bil.
Sadakatsizlik
Retrieval iyi + model çarpıttı. Generation katmanı bulgusu.
Yanlış hammadde
Retrieval kötü + model sadık. En aldatıcı kadran: cevap "kaynaklı" ama yanlış.
Çifte hata
Retrieval kötü + model de uydurdu. Genelde sistemik sorun işareti.
retrieval: iyi ← → kötü
En tehlikeli kadran sağ üst değil, sol alttır: yanlış hammadde + sadık model. Cevap kaynak gösterir, güven verir, biçimsel her kontrolü geçer — ama kaynağın kendisi yanlış dokümandır (eski versiyon, benzer ürün, yetkisiz erişim). Groundedness metriği bile bunu kaçırabilir: cevap gösterilen kaynağa gerçekten sadıktır. Yakalayan test: retrieval'ın bağımsız relevance değerlendirmesi — cevabın kaynağa değil, kaynağın soruya uygunluğu.

İki aşamalı değerlendirme

RAG sisteminde doğru belgenin getirilmesi ve yanıtın o belgeyi doğru kullanması ayrı aşamalardır. Retrieval başarısı düşükse yalnız yanıt istemini iyileştirmek yeterli olmayabilir.

Belge güncelliği, erişim yetkisi, kaynak atfı ve cevapsız bırakma davranışı birlikte test edilir. Bir kaynağın bulunması, kullanıcının o kaynağa erişmeye yetkili olduğu anlamına gelmez.

anahtar çıkarımlar

retrieval, llm olmadan test edilir
Relevance etiketli eval setiyle, deterministik ve ucuz: recall@k, precision@k, MRR. İki katman ayrı geçer not almadan uçtan uca skor yorumlanamaz.
k bir yara bandı değildir
Büyük k recall'ü kurtarır ama bağlamı gürültüyle doldurur: karıştırma riski, talimat sadakati kaybı, maliyet. Önce retriever düzelir, sonra k küçülür.
ortalama recall kuyruğu gizler
Sıfır-recall sorgular halüsinasyonun beslenme alanıdır: bağlamda cevap yokken sistem cevap üretmeye itilir. Kuyruk oranı + abstention testi birlikte raporlanır.
en aldatıcı hata: yanlış hammaddeye sadık cevap
Kaynak gösteren, biçimsel kontrolleri geçen ama yanlış dokümana dayanan cevap. Yakalayan şey groundedness değil, kaynağın soruya uygunluğunun bağımsız değerlendirmesidir.
Uygulama örneği · kurgusal vaka

karar masası: Uçtan uca skor istisnayı gizliyor

Senaryo: RAG toplam doğrulukta hedefi geçti; fakat politika istisnalarını retrieval top-k’ya getiremiyor. Generator benzer genel maddeyle ikna edici cevap üretiyor.
Örnek değerlendirmeyi aç
DeğerlendirmeUçtan uca skoru tek kapı sayma. Kritik istisna retrieval’ı ayrı kapı olsun; kaynak bulunmadığında abstention ve citation doğruluğu kanıtlanana kadar kapsamı daralt.
Gerekli kanıtRecall@k/MRR; kritik istisna seti; chunk/metadata; indeks tazeliği; context logu; groundedness; citation entailment; no-answer; query varyasyonu.
Karar kaydıKatman bazlı bulgu: retrieval/generation/kontrol sahibi, kritik kapı, düzeltme, hedefli test ve canlı sinyal.