Bir yanıtın belgelerle desteklenmesi, belgelerin doğru veya güncel olduğunu garanti etmez. Kaynağa bağlılık, doğruluk ve soruya yeterli cevap verme ayrı ölçülür.
Görsellerdeki sayılar, dağılımlar ve senaryolar kavramları açıklamak için oluşturulmuştur. Gerçek bir ürünün performans ölçümü veya bir kurumun test sonucu değildir.
tanım: yanlışlık değil, temelsizlik
Halüsinasyonu "modelin yanlış cevap vermesi" diye tanımlamak eksiktir. Daha keskin tanım: modelin, dayanağı olmayan içeriği, dayanağı varmış gibi üretmesi. İki bileşen kritik: temelsizlik (içerik ne eğitim verisinde ne verilen bağlamda desteklenir) ve epistemik maskeleme (çıktı, güvenli bilgiyle aynı üslup ve akıcılıkta gelir — model tereddüt sinyali vermez).
İkinci bileşen, riskin asıl kaynağıdır. İnsan uzman yanılabilir ama genellikle tereddüdünü belli eder: "emin değilim ama sanırım…" Model bu sinyali vermez, çünkü eğitimi ona kararlı üslubu öğretmiştir (Modül 04'teki RLHF yan etkisi). Sonuç: kullanıcının hata tespit mekanizması devre dışıdır. Yanlış bilginin maliyeti, yanlışlığından çok yakalanamazlığından gelir.
Terminoloji notu: literatür bazen ikiye ayırır — factuality (dünya gerçeklerine uygunluk) ve faithfulness (verilen kaynağa sadakat). RAG'li kurumsal sistemlerde asıl ölçülen ikincisidir: "cevap, getirilen dokümanla destekleniyor mu?" Bu ayrımı yapmak validasyon tasarımını doğrudan etkiler — birazdan göreceksin.
neden uydurur: mimarinin dürüst itirafı
LLM bir bilgi bankası değil, olasılık makinesidir: her adımda "bir sonraki token ne olmalı?" dağılımından örnekler. Model "bilmiyorum" kavramına mimari düzeyde sahip değildir — her koşulda bir dağılım üretir ve o dağılımdan bir şey seçer. Aşağıda iki soru tipi için basitleştirilmiş dağılımları karşılaştır:
sonraki token dağılımı — iki soru, iki profil
model şu metni tamamlıyor"Türkiye'nin başkenti ..."
Fark budur: bildiği konuda dağılım tek noktada yoğunlaşır; bilmediği konuda düzleşir ama kaybolmaz. Model yine örnekler, yine akıcı cümle kurar — sadece artık hangi seçeneğin geleceği neredeyse rastgeledir. Uydurma, dağılımın düz olduğu yerde örneklemeye devam etmenin doğal sonucudur. Bu yüzden halüsinasyon giderilecek bir bug değil, yönetilecek bir mimari özelliktir: azaltılır (RAG, prompt, kalibrasyon), sıfırlanmaz.
Validasyon lensi: Geliştirici "halüsinasyonu çözdük" derse bu bir kırmızı bayraktır. Doğru iddia biçimi: "şu use-case'te, şu test setiyle, groundedness hata oranını %X'e düşürdük ve şu izleme eşiğini koyduk." Yapısal bir özellik için ancak oran, kapsam ve eşik konuşulabilir — mutlak çözüm değil.
halüsinasyon tipleri: her satıra tıkla
"Halüsinasyon" tek bir şey değildir; tipine göre hem riski hem tespit yöntemi değişir. Banka bağlamındaki beş ana tip:
Olgusal uydurma — var olmayan gerçek
Kaynağa ihanet — doküman var, cevap dokümanı çarpıtıyor
Atıf uydurma — var olmayan kaynak, madde, içtihat
Sayısal/zamansal kayma — doğru bilgi, yanlış sayı veya tarih
Bağlam karıştırma — iki gerçeğin yanlış birleştirilmesi
En sinsi tipler 4 ve 5'tir: cevabın %95'i doğrudur, yanlışlık tek bir sayıya veya iki gerçeğin birleştirilme biçimine gömülüdür. Yüzeysel okuma bunları yakalayamaz — insan inceleyicilerin gözünden en çok kaçan tipler de bunlardır. Test tasarımında "tamamen yanlış cevap" senaryosu kadar "%95 doğru cevap" senaryosu da olmalı.
uydurmayı bul: groundedness değerlendirmesi
Şimdi bir groundedness değerlendiricisinin işini yap. Aşağıda kaynak doküman (bankanın ürün koşulları) ve RAG'li asistanın ürettiği cevaptan alınmış altı iddia var. Her iddia için karar ver: kaynakla destekleniyor mu, yoksa temelsiz mi?
kaynak doküman + altı iddia
Kaynak: "Esnek Hesap ürün koşulları (v2.3)"
"Esnek Hesap, vadesiz hesaba bağlı kredili mevduat ürünüdür. Faiz, yalnızca kullanılan tutar ve kullanım günü üzerinden aylık olarak tahakkuk eder. Limit, müşteri skoruna göre 5.000 TL ile 50.000 TL arasında belirlenir. Limit artış talebi şubeden veya mobil uygulamadan yapılabilir; artış, güncel skor değerlendirmesine tabidir. Ürün, maaş müşterilerine otomatik tanımlanmaz; müşteri onayı gerekir. Kullanılmayan limit için ücret alınmaz."
Asistanın cevabından çıkarılan iddialar (kaynağı yukarıda — başka bilgin yok):
Bu egzersizin ölçekli hali, LLM validasyonunun temel tekniklerinden biridir: cevabı atomik iddialara böl, her iddiayı kaynakla eşleştir, desteklenmeyen iddia oranını ölç. Elle yapılan bu iş, üretimde otomatikleştirilir (NLI modelleri veya LLM-as-judge ile) — ama otomasyonun kendisi de validasyon gerektirir; bu döngüyü Modül 14'te açacağız.
robustness: aynı soru, farklı kılıklar
Robustness, sistemin anlamı değişmeyen girdi varyasyonlarına karşı davranışını koruyabilmesidir. Kullanıcılar aynı soruyu bin türlü sorar: kısaltmayla, yazım hatasıyla, yarı İngilizce, imalı… Kırılgan sistem her kılığa farklı cevap verir. İki sistemi karşılaştır:
parafraz tutarlılık testi — "kullanılmayan limit için ücret var mı?"
Tutarlılık
—
Robustness testi ucuz ve etkilidir: golden set'teki her soruya 3–5 parafraz üret (bunu da LLM yapabilir), cevapların anlamsal tutarlılığını ölç. Tutarsızlık iki şeyden birini gösterir: ya retrieval parafraza duyarlı (embedding sorunu) ya model kararsız (dağılım düz — yani aslında bilmiyor). İkisi de bulgudur. Ayrıca tutarsızlık, halüsinasyonun pratik bir dedektörüdür: model bildiği şeyde tutarlı, uydurduğu şeyde tutarsızdır — aynı soruyu beş kez sorup cevapların çelişmesine bakmak (self-consistency) üretimde bile kullanılan bir tekniktir.
Robustness'ın ikinci boyutu format ve bağlam gürültüsüdür: soru uzun bir e-postanın içine gömüldüğünde, tablo olarak geldiğinde, konuşmanın 15. mesajında sorulduğunda davranış korunuyor mu? Test setleri neredeyse hep "temiz, tek cümlelik soru" içerir; üretim trafiği öyle değildir. Test evreni ile üretim evreni arasındaki bu fark, "testte iyi, sahada kötü" şikâyetinin en yaygın kaynağıdır.
Doğruluk ve kaynağa bağlılık
Bir yanıtın belgelerle desteklenmesi, belgelerin doğru veya güncel olduğunu garanti etmez. Kaynağa bağlılık, doğruluk ve soruya yeterli cevap verme ayrı ölçülür.
Sağlamlık testleri anlamı koruyan değişiklikleri ve gerçekten farklı görevleri ayırır. Kritik yanlışlar, genel başarı oranının içinde görünmez bırakılmaz.
anahtar çıkarımlar
halüsinasyon bug değil, mimari özelliktir
Model her koşulda bir dağılımdan örnekler; "bilmiyorum" mimari bir kavram değildir. Azaltılır, ölçülür, izlenir — "çözüldü" iddiası kırmızı bayraktır.
risk, yanlışlıktan çok yakalanamazlıktan gelir
Uydurma, doğru bilgiyle aynı akıcılıkta ve özgüvende gelir; kullanıcının hata dedektörü çalışmaz. En sinsi tipler %95 doğru cevabın içine gömülü olanlardır.
ölçüm birimi: atomik iddia
Cevap iddialara bölünür, her iddia kaynakla eşleştirilir, desteklenmeyen oran ölçülür. Factuality (dünya) ile faithfulness (kaynak) ayrımı test tasarımını belirler.
tutarsızlık, ucuz bir halüsinasyon dedektörüdür
Model bildiğinde tutarlı, uydurduğunda tutarsızdır. Parafraz ve self-consistency testleri hem robustness'ı hem halüsinasyonu aynı anda yoklar.
Uygulama örneği · kurgusal vaka
karar masası: Yeşil ortalama, kırmızı kritik dilim
Senaryo: Politika asistanı groundedness’ta %94 ile %93 hedefini geçti. Ancak 12 hatanın beşi ücret, vade ve istisnalarda; parafraz testinde çelişkili cevaplar var.
Örnek değerlendirmeyi aç
DeğerlendirmeToplam ortalamayla onay önerme. Kritik finansal dilime ayrı kapı koy; kaynak-zorunlu/abstention ve tutarlılık kapanana kadar görüşü beklet veya kapsamı daralt.
Gerekli kanıtHata şiddeti; kritik dilim ve güven aralığı; parafraz/bozuk girdi; kaynak yokken abstention; iş akışına sızma; insan kontrolü; canlı izleme.
Karar kaydıKısıtlı görüş: başarısız kapı, zarar bağlantısı, çözüm, yeniden test, canlı eşik ve askıya alma sahibi.