İçeriğe geç
Banking Foundations · 17

Validasyonda Baktığımız Testler

FAZ 5 / 6 · Modeli sorgula
Bu sayfanın sonunda metrik ile karar eşiğini, dağılım kayması ile model performansını ve replikasyon ile bağımsız yeniden geliştirmeyi ayırabilmelisin.

testler neyi garanti eder?

Validasyon testleri "model iyi mi?" sorusunu yanıtlamaya çalışır. Ama hiçbir test tek başına yeterli değildir. Her test modelin farklı bir boyutunu sorgular — biri discrimination'ı, diğeri kalibrasyonu, bir başkası stabilitesini.

Bu sayfadaki test kataloğu bir PD modeli için geçerlidir; LGD ve EAD modellerinde bazı testler farklılaşır. Genel prensip aynıdır: bağımsız, tekrarlanabilir, belgelenmiş.

Aşağıda her teste tıkla — ne sorar, ne arar, hangi metriği kullanır, red flag nedir ve validatörün o testte sorduğu sorular nelerdir.

test kataloğu

istatistiksel testler — hangi test neyi söyler

Katalog neye bakılacağını söyler; bu bölüm hangi testle bakılacağını. Testler üç aileye ayrılır: sıralamayı ölçenler, büyüklüğü ölçenler ve dağılım kaymasını ölçenler. Bir modeli reddetmek ya da onaylamak için üçünden de kanıt gerekir.

Aile 1 — sıralama gücü
AUC = P(skortemerrüt > skortemerrütsüz) + ½ · P(skorlar eşit)
Gini = 2 × AUC − 1  ·  ikili sonuçta Somers' D ile aynı sayı
KS = maxs | Ftemerrütsüz(s) − Ftemerrüt(s) |
AUC bütün eşiklerin ortalama ayrımını, KS tek bir eşikteki en büyük ayrımı ölçer. KS yüksek ama AUC düşükse ayrım skor dağılımının tek bir bölgesinde toplanmıştır — ve o bölge bankanın gerçekte karar verdiği eşik olmayabilir. Validasyonda KS'in nerede oluştuğu, değerinin kendisi kadar önemlidir.
Aile 2 — kalibrasyon (tahmin doğru büyüklükte mi?)
Tek taraflı binom testi — p = P(X ≥ k | n, PD) = Σi≥k C(n,i) · PDi · (1−PD)n−i
Normal yaklaşım — z = (DR − PD) / √( PD(1−PD) / n )
Jeffreys üst sınırı — Beta(k + ½, n − k + ½) dağılımının 1−α kuantili
Hosmer–Lemeshow — χ² = Σg (Og − Eg)² / [ Eg(1 − Eg/ng) ],  sd = g − 2
Binom testi tek bir rating bandını sorgular; Hosmer–Lemeshow bütün bantların birlikte uyumunu. Jeffreys yaklaşımı k = 0 durumunda da çalıştığı için düşük temerrütlü bantlarda tercih edilir — normal yaklaşım orada çöker.

binom testi hesaplayıcı — aynı sapma, farklı örneklem

Bu araç tek bir rating bandını sorgular. Oranı sabit tutup örneklemi büyüt — aynı yüzde sapmanın küçük bantta anlamsız, büyük bantta reddedilebilir hale geldiğini gör. Validasyondaki en sık hata, bu farkı görmeden "tahmin tuttu / tutmadı" demektir.

1.000
%2,0
1,50×
Gözlenen temerrüt
30
Gerçekleşen DR
%3,00
Tek taraflı p-değeri
0,0169
%3,05Jeffreys %95 üst sınırı — tahmin edilen PD bu sınırın altındaysa bant sorgulanır
2,13Normal yaklaşım z — bant küçüldükçe veya PD düştükçe güvenilirliği azalır
sarıÖğretim bandı: p ≥ 0,05 yeşil · 0,01–0,05 sarı · < 0,01 kırmızı
Bu bantlar öğretim içindir, kabul kriteri değildir. Bankanın onaylı model politikası hangi anlamlılık düzeyinin, kaç dönem üst üste, hangi bantlarda tetikleyici sayılacağını tanımlar — ve testin sonucu bulgunun kendisi değil, gerekçesidir.
Hepsinin ortak zayıflığı. Yukarıdaki testler temerrütlerin birbirinden bağımsız olduğunu varsayar. Gerçek portföyde ortak bir makro faktör vardır; bu, gerçekleşen temerrüt oranının varyansını binom varsayımının öngördüğünün üstüne çıkarır. Sonuç: test sık sık "model bozuk" der, oysa sapmanın kaynağı döngüdür. Bu yüzden tek bir p-değeriyle model reddedilmez — çok dönemli sonuç, sapmanın bantlar arasındaki deseni (hepsi aynı yönde mi, yoksa dağınık mı?) ve makro bağlam birlikte okunur. Aynı yönde sistematik sapma kalibrasyon sorunudur; dağınık sapma çoğunlukla gürültüdür.

hangi testin tuzağı nedir?

TestNe ölçerTuzağı
Gini / AUCSıralama gücü, bütün eşikler üzerindenEvrensel eşik yoktur; temerrüt sıklığına ve örnekleme duyarlıdır. Farklı portföylerin Gini'si doğrudan kıyaslanmaz.
KSTek eşikteki en büyük ayrımAyrımın nerede oluştuğunu söylemez; o nokta kullanılan karar eşiği olmayabilir.
Binom testiTek bir bandın PD'si tuttu muBağımsızlık varsayımı; korelasyon nedeniyle fazla sık reddeder. Çoklu bant testinde yanlış pozitif birikir.
Jeffreys aralığıBant PD'si, k = 0 dahilAynı bağımsızlık varsayımı. Tek taraflı mı iki taraflı mı olduğu politikada sabitlenmemişse sonuç tartışmalı kalır.
Hosmer–LemeshowBütün bantların birlikte uyumuBüyük örneklemde neredeyse her zaman reddeder; grup sayısı ve grup sınırı seçimine duyarlıdır.
SpiegelhalterBirey düzeyinde kalibrasyonYine bağımsızlık varsayar; bant bazlı testlerle aynı sonucu vermeyebilir, ikisi birlikte raporlanır.
PSIGirdi/skor dağılımının kaymasıEtiket kullanmaz — performansı ölçmez. Kayma varken performans korunabilir, kayma yokken bozulabilir.
Sıra önemlidir: önce replikasyon (aynı sayıyı üretebiliyor muyum?), sonra sıralama, sonra büyüklük, en sonda kayma. Replikasyon tutmuyorsa diğer üçünün sonucu zaten tartışmalıdır.

backtesting simülatörü

Sabit veri deseniyle çalışır: aynı girdiler aynı grafiği üretir. ±%20 bant istatistiksel güven aralığı değildir. Küçük örneklem, az temerrüt ve bağımlı gözlemler ayrıca ele alınmalıdır.

Model PD tahmini ile gerçekleşen temerrüt oranını karşılaştırıyoruz. Sistematik sapmayı değiştir — kalibrasyon testinin nasıl tepki verdiğini gör.

%2.0
1.00×
%15
Tahmin edilen PD
Gerçekleşen DR
±%20 öğretim bandı (güven aralığı değil)
Ort. Tahmin PD
%2.00
Ort. Gerçekleşen DR
%2.00
Kalibrasyon
İyi
Tahmin ve gerçekleşen yakın — kalibrasyon iyi. Bias çarpanını değiştir ve modelin sistematik sapmasını simüle et.

PSI — skor dağılımı kayıyor mu?

Population Stability Index (PSI), modelin geliştirme dönemindeki skor dağılımı ile canlı dönemdeki skor dağılımını karşılaştırır. Portföy bileşimi kayarsa PSI yükselir — bu modelin yeniden değerlendirilmesi gerektiğinin işareti.

Orta
PSI 0,08 — yaygın öğretim eşiğine göre düşük; neden ve performans ayrıca incelenmeli.
Yaygın örnek: PSI < 0,10 — düşük kayma sinyali.
0,10–0,25 — neden analizi ve yakın izleme.
>0,25 — politika tetikleyicisi olabilir; otomatik evrensel kural değildir.

validasyon checklist

Bu liste PD validasyonu için örnek kapsamdır; modelin amacına göre uyarlanır. Her satıra tıklayarak test sonucunu işaretle — özet otomatik güncelleniyor.

bu sayfadan götürülecekler

hiçbir test tek başına yeterli değil
Discrimination iyi ama kalibrasyon kötü, ya da kalibrasyon iyi ama stabil değil — her kombinasyon farklı bir risk. Testler birbirini tamamlar.
OoT backtesting gerçek sınav
Zaman dışında performans önemli bir kanıttır. Düşüş; aşırı uyum, dönem/segment farkı, tanım değişimi veya veri sorunundan gelebilir.
PSI bir sinyaldir
Yeniden validasyon tetikleyicisi bankanın onaylı politikasında tanımlanır. PSI; performans, segment ve değişim nedeni ile birlikte okunur.
replikasyon kritik
Validatör aynı veriyle aynı sonuca ulaşabilmelidir. Fark; veri sürümü, dönüşüm, bağımlılık, rassallık veya uygulama hatasından gelebilir. Açıklanamayan farkın maddi etkisi bulgu olarak değerlendirilir.
Sıradaki adım: Bu testlerin çalışmadığı yer — düşük temerrütlü portföylerde az veriyle ne söylenebilir, muhafazakârlık payı nasıl kurulur?