Örneklem ayrımı, veri sızıntısı, ayrım gücü ve kalibrasyon klasik ML ile üretken AI değerlendirmesi arasında yararlı köprülerdir. Ancak açık uçlu yanıtlar için etiket ve başarı tanımı ayrıca tasarlanır.
köprü mantığı: sıfırdan başlamıyorsun
Bu serinin en pratik iyi haberi şu: AI validasyonu, klasik validasyonun reddi değil, tercümesidir. Yirmi yıllık model risk pratiğinin geliştirdiği tekniklerin her biri — benchmarking, backtesting, duyarlılık, stabilite, kalibrasyon, açıklanabilirlik — LLM dünyasında bir karşılığa sahip. Değişen şey tekniğin mantığı değil; uygulandığı nesne (katsayı yerine davranış), kanıt formu (kesin sayı yerine güven aralığı) ve tekrarlama sıklığı (yıllık yerine sürekli).
Klasik validasyon deneyimi, AI sistemlerinin değerlendirilmesi için bir başlangıç sağlar. Bunun yanında açık uçlu çıktıların puanlanması, istem güvenliği ve araç kullanımının kontrolü gibi yeni yöntemler gerekir. İki alan arasındaki geçiş, benzer kavramların kapsam sınırlarını koruyarak kurulmalıdır.
Köprünün sınırını da dürüstçe çiz: tercüme edilemeyen şeyler var. Injection direnci, jailbreak testi, tool yetki analizi gibi güvenlik kökenli teknikler (Modül 08) klasik dünyada karşılıksızdır — bunlar %30'luk yeni beceri setidir ve güvenlik disiplininden ödünç alınır. Köprü, her şeyi eskiye benzetme bahanesi değildir.
altı teknik: klasikten llm'e — her satıra tıkla
Benchmarking / challenger model
kıyas
Backtesting
geçmişe karşı test
Duyarlılık ve stres analizi
girdiyi oynat
Stabilite / PSI
popülasyon kayması
Kalibrasyon
tahmin vs gerçekleşme
Açıklanabilirlik
neden bu çıktı?
Validasyon lensi: Bu altı tercümenin ortak deseni: klasik dünyada teknik bir kez uygulanır ve raporlanırdı; LLM dünyasında hepsi sürekli çalışan altyapıya dönüşüyor. Backtesting → her değişiklikte koşan golden set; PSI → günlük drift izleme; kalibrasyon → üretimde sürekli örneklem. Validasyon planında bu tekniklere "test" değil "boru hattı" (pipeline) olarak bütçe ayır — kurulum maliyeti bir kere, işletme maliyeti sürekli.
eşleştirme: klasik kavram → llm karşılığı
Köprüyü içselleştirmenin testi: soldan bir klasik kavram seç, sağdan LLM dünyasındaki karşılığını bul. Yanlış eşleşme kırmızı yanar; doğru eşleşme kilitlenir.
kavram eşleştirme
Önce soldan bir kavrama tıkla, sonra sağdan karşılığına.
Klasik dünya
LLM dünyası
diğer serilere köprüler
Bu modülün derinliği bilinçli olarak sınırlı — çünkü klasik tekniklerin her biri bu sitede zaten ayrıntısıyla işlendi. AI lensiyle yeniden okuman için en kritik durakları işaretledim:
Okuma stratejisi önerisi: bu sayfalara dönerken tek soruyla oku — "bu tekniğin LLM tercümesinde ne kırılıyor?" Örnek: PSI'da değişken dağılımını izlersin; embedding drift'inde ise dağılımın kendisi yüksek boyutlu ve doğrudan gözlenemez — izlediğin şey vekil metriklerdir (kümeleme kayması, benzerlik skorları). Kırılma noktalarını fark etmek, tercümeyi mekanik kopyadan ayıran şeydir.
Klasik ML ile bağlantı
Örneklem ayrımı, veri sızıntısı, ayrım gücü ve kalibrasyon klasik ML ile üretken AI değerlendirmesi arasında yararlı köprülerdir. Ancak açık uçlu yanıtlar için etiket ve başarı tanımı ayrıca tasarlanır.
Bir metrik başka bir göreve aynı anlamla taşınmaz. Kredi sıralamasında yararlı bir ayrım gücü ölçüsü, yanıtın kaynakla desteklenip desteklenmediğini göstermez.
anahtar çıkarımlar
ai validasyonu tercümedir, sıfırdan inşa değil
Altı klasik tekniğin altısı da LLM karşılığına sahip. Değişen: nesne (davranış), kanıt formu (istatistiksel) ve sıklık (sürekli). Tercüme edilemeyen %30 ise güvenlik disiplininden ödünç alınır.
test değil, boru hattı
Klasikte teknik bir kez uygulanırdı; LLM'de hepsi sürekli altyapıya dönüşür: golden set her değişiklikte, drift izleme her gün, kalibrasyon örneklemi sürekli. Bütçeyi buna göre iste.
tercümenin kırılma noktalarını bil
PSI→drift tercümesinde dağılım artık doğrudan gözlenemez; backtesting→golden set tercümesinde "gerçekleşme" yerine "referans cevap" var — o da bir üretimdir. Kırılmayı bilmeyen tercüme, mekanik kopyadır.
İstatistiksel şüphecilik ve challenge refleksi zor öğretilir; eval tasarımı ve injection bilgisi öğretilebilir. Ekip stratejini bu asimetriye kur.
Uygulama örneği · kurgusal vaka
karar masası: Ekibin ilk LLM dosyası
Senaryo: Kredi model validatorları ilk RAG asistanını inceleyecek. İstatistik ve governance güçlü; injection, retrieval ve LLM judge kalibrasyonu deneyimi sınırlı. Yönetim tamamını dışarı vermek istiyor.
Örnek değerlendirmeyi aç
DeğerlendirmeKlasik omurgayı koru; AI boşluklarına hedefli köprü kur. Bağımsız görüş sahipliğini ekipte tut, güvenlik/eval derinliğini uzman protokolüne bağla.
Gerekli kanıtYetkinlik matrisi; klasik testlerin yeniden kullanımı; AI boşlukları; uzman bağımsızlığı; ortak test planı; judge insan uyumu; bilgi transferi.
Karar kaydıkurulum aşamalarılük capability plan: görüş sahibi, uzman rolleri, eğitim/lab, pilot kapıları, dış destek teslimatı ve kuruma kalacak varlıklar.