Validasyonda Baktığımız Testler
testler neyi garanti eder?
Validasyon testleri "model iyi mi?" sorusunu yanıtlamaya çalışır. Ama hiçbir test tek başına yeterli değildir. Her test modelin farklı bir boyutunu sorgular — biri discrimination'ı, diğeri kalibrasyonu, bir başkası stabilitesini.
Bu sayfadaki test kataloğu bir PD modeli için geçerlidir; LGD ve EAD modellerinde bazı testler farklılaşır. Genel prensip aynıdır: bağımsız, tekrarlanabilir, belgelenmiş.
Aşağıda her teste tıkla — ne sorar, ne arar, hangi metriği kullanır, red flag nedir ve validatörün o testte sorduğu sorular nelerdir.
test kataloğu
istatistiksel testler — hangi test neyi söyler
Katalog neye bakılacağını söyler; bu bölüm hangi testle bakılacağını. Testler üç aileye ayrılır: sıralamayı ölçenler, büyüklüğü ölçenler ve dağılım kaymasını ölçenler. Bir modeli reddetmek ya da onaylamak için üçünden de kanıt gerekir.
binom testi hesaplayıcı — aynı sapma, farklı örneklem
Bu araç tek bir rating bandını sorgular. Oranı sabit tutup örneklemi büyüt — aynı yüzde sapmanın küçük bantta anlamsız, büyük bantta reddedilebilir hale geldiğini gör. Validasyondaki en sık hata, bu farkı görmeden "tahmin tuttu / tutmadı" demektir.
hangi testin tuzağı nedir?
| Test | Ne ölçer | Tuzağı |
|---|---|---|
| Gini / AUC | Sıralama gücü, bütün eşikler üzerinden | Evrensel eşik yoktur; temerrüt sıklığına ve örnekleme duyarlıdır. Farklı portföylerin Gini'si doğrudan kıyaslanmaz. |
| KS | Tek eşikteki en büyük ayrım | Ayrımın nerede oluştuğunu söylemez; o nokta kullanılan karar eşiği olmayabilir. |
| Binom testi | Tek bir bandın PD'si tuttu mu | Bağımsızlık varsayımı; korelasyon nedeniyle fazla sık reddeder. Çoklu bant testinde yanlış pozitif birikir. |
| Jeffreys aralığı | Bant PD'si, k = 0 dahil | Aynı bağımsızlık varsayımı. Tek taraflı mı iki taraflı mı olduğu politikada sabitlenmemişse sonuç tartışmalı kalır. |
| Hosmer–Lemeshow | Bütün bantların birlikte uyumu | Büyük örneklemde neredeyse her zaman reddeder; grup sayısı ve grup sınırı seçimine duyarlıdır. |
| Spiegelhalter | Birey düzeyinde kalibrasyon | Yine bağımsızlık varsayar; bant bazlı testlerle aynı sonucu vermeyebilir, ikisi birlikte raporlanır. |
| PSI | Girdi/skor dağılımının kayması | Etiket kullanmaz — performansı ölçmez. Kayma varken performans korunabilir, kayma yokken bozulabilir. |
backtesting simülatörü
Sabit veri deseniyle çalışır: aynı girdiler aynı grafiği üretir. ±%20 bant istatistiksel güven aralığı değildir. Küçük örneklem, az temerrüt ve bağımlı gözlemler ayrıca ele alınmalıdır.
Model PD tahmini ile gerçekleşen temerrüt oranını karşılaştırıyoruz. Sistematik sapmayı değiştir — kalibrasyon testinin nasıl tepki verdiğini gör.
PSI — skor dağılımı kayıyor mu?
Population Stability Index (PSI), modelin geliştirme dönemindeki skor dağılımı ile canlı dönemdeki skor dağılımını karşılaştırır. Portföy bileşimi kayarsa PSI yükselir — bu modelin yeniden değerlendirilmesi gerektiğinin işareti.
validasyon checklist
Bu liste PD validasyonu için örnek kapsamdır; modelin amacına göre uyarlanır. Her satıra tıklayarak test sonucunu işaretle — özet otomatik güncelleniyor.