B6 Kredi Riski · VALIDATION · ~3h

Kredi Model Validasyonu — Test Seti

PD, LGD ve EAD modellerini değerlendirmek için kullanılan istatistiksel testlerin tam seti. Ayırt edicilik (discriminatory power) ile kalibrasyon (calibration) birbirinden bağımsız boyutlardır — ikisini de ayrı ayrı test etmek zorundasın.

Bu modülden çıkman gerekenler

01 · İki Temel Boyut

Ayırt Edicilik (Discrimination)
Model, yüksek riskli borçluları düşük riskli borçlulardan doğru sıralıyor mu? Mutlak PD değeri önemli değil — sadece sıralama.
Gini / AUC ROC Eğrisi KS Testi
Kalibrasyon (Calibration)
Mutlak PD değerleri doğru mu? Tahmin edilen PD gerçekleşen temerrüt oranına yakın mı? Sıralama iyi olsa bile kalibrasyon bozuk olabilir.
Binomial Spiegelhalter Hosmer-Lemeshow Chi-Square
İyi Ayrıştırıcı ama Kötü Kalibre — Mümkün mü?

Evet — ve oldukça yaygın. Bir model yüksek riskli/düşük riskli borçluları mükemmel sıralayabilir (Gini=%80) ama sistematik olarak gerçek PD'nin 2 katını tahmin edebilir. Sermaye hesabı veya ECL bağlamında bu, gerçek riski yanlış ölçer. Tersi de mümkün: iyi kalibre ama zayıf ayrıştıran model (Gini=%30) — sıralama gücü yok ama ortalama tahmin doğru. Her ikisi de ciddi sorunlar.

02 · Ayırt Edicilik — Gini, AUC, ROC

Temel Metrikler
AUC = P(scoredefaulter > scorenon-defaulter)    Gini = 2·AUC − 1
KS = maxt |FD(t) − FND(t)|
AUC = Area Under ROC Curve  ·  AUC=0.5 → random  ·  AUC=1 → mükemmel  ·  FD(t) = defaulterların skor CDF'i  ·  FND(t) = non-defaulterların skor CDF'i  ·  KS: iki dağılım arasındaki maksimum dikey mesafe  ·  Bivariate normal model: AUC = Φ(Δμ / √2) — burada Δμ = ortalama skor farkı
İnteraktif · ROC Eğrisi & Lorenz Eğrisi (Gini)
Model Güç Parametresi Δμ (skor ayrışması)1.50
Portföy PD (%)5.0
AUC
Gini Katsayısı
KS İstatistiği
Model Sınıfı
Gini AralığıAUC AralığıSınıfEBA / Sektör Değerlendirmesi
> %70> 0.85MükemmelGüçlü ayrıştırma — ender
%50–%700.75–0.85Güçlü ayırt edicilikÖrnek iç değerlendirme; EBA evrensel kabul bandı değildir
%30–%500.65–0.75OrtaKabul edilebilir, iyileştirme gerekebilir
%15–%300.575–0.65ZayıfModel gözden geçirilmeli
< %15< 0.575Kabul EdilemezIRB onayı verilmemeli

03 · Kalibrasyon — Binomial Testi & Trafik Işığı

Binomial Test
z = (d − n·p̂) / √(n·p̂·(1−p̂))    H₀: Gerçek PD = p̂
d = gözlemlenen temerrüt sayısı  ·  n = portföy büyüklüğü  ·  p̂ = tahmin edilen PD  ·  H₀ altında z ~ N(0,1)  ·  Tek taraflı test (çok az temerrüt): H₁: Gerçek PD < p̂, kritik değer = −1.645  ·  Çift taraflı: kritik ±1.96 (%5) veya ±2.576 (%1)  ·  Sınırlama: büyük portföylerde küçük sapmalarda bile red — pratik anlamlılık ayrı değerlendirilmeli
İleri Nokta · Küçük Örneklemde Jeffreys Aralığı

Normal-yaklaşım binomial test pedagojik olarak yararlıdır; küçük veya az temerrütlü grade’lerde Jeffreys Beta(½,½) aralığı daha iyi sonlu-örneklem davranışı sağlayan destekleyici bir yöntemdir. Jeffreys yaklaşımında tek-taraflı gösterge = BetaCDF(PD; D + ½, N − D + ½) — yani posterior Beta(D+0.5, N−D+0.5) dağılımının PD tahminindeki kümülatif değeri (Jeffreys önseli Beta(½,½)). Küçük p → gerçek PD büyük olasılıkla tahminin üzerinde → kalibrasyon yetersiz. Sıfır temerrüt gözlendiğinde bile anlamlı bir sonuç verir, normal yaklaşımın aksine. Validatör için: düşük-PD/düşük-temerrüt portföylerde normal yaklaşımın küçük örneklem hatası kontrol ediliyor mu ve exact/Jeffreys gibi sağlamlık analizleri raporlanıyor mu? EBA çerçevesi validasyonu tek bir evrensel teste indirgemez; yöntem seçimi portföy ve örneklemle gerekçelendirilir. Bu, özellikle düşük temerrütlü portföylerde (LDP) sonucu tersine çevirebilir.

İnteraktif · Binomial Kalibrasyon Testi & Trafik Işığı
Portföy Verileri
Portföy Büyüklüğü n500
Tahmin Edilen PD (%)3.00
Gözlemlenen Temerrüt d21
z-istatistiği
p-değeri (çift taraflı)

04 · Spiegelhalter Testi

Spiegelhalter (1986), bireysel tahminlerin kalibrasyon kalitesini ölçer. Binomial testten farkı: portföy düzeyinde tek bir ortalama PD yerine her borçlu için farklı PD kullanır — heterojen portföylerde daha güçlüdür.

Spiegelhalter Testi (Bireysel Skorlar)
T = Σi(di − pi)(1 − 2pi) / √[Σi pi(1−pi)(1−2pi)²]
di = borçlu i için temerrüt göstergesi (0 veya 1)  ·  pi = modelin tahmin ettiği bireysel PD  ·  H₀ altında T ~ N(0,1)  ·  (1 − 2pi) faktörü: yüksek PD borçlularda temerrüt habercisi farklı ağırlıklanır  ·  pi = 0.5 → (1−2pi) = 0 → o borçlu testi etkilemez  ·  Sınırlama: pi yakın p değerlerinde binomiale dönüşür; güç düşer
ÖzellikBinomialSpiegelhalter
GirdiPortföy toplam: n, d, p̂Bireysel: dᵢ, pᵢ her borçlu için
Güçlü Olduğu DurumHomojen segment, büyük nHeterojen PD dağılımı
SınırlamaTek ortak PD varsayımı; heterojen segmentte zayıfBireysel skorlar gerekli
Regülatör kullanımıTest setinin bir parçasıDestekleyici test

05 · Hosmer-Lemeshow Testi

Borçlular tahmin edilen PD'ye göre 10 gruba (ondalıklara) ayrılır. Her grupta beklenen temerrüt sayısı gerçekleşenle karşılaştırılır. Binomial testinin tüm portföy için tek değer üretmesine karşılık, HL testi kalibrasyonun hangi PD aralığında bozulduğunu gösterir.

Hosmer-Lemeshow İstatistiği
HL = Σg=1G (Og − Eg)² / [Eg · (1 − Eg/ng)]
G = grup sayısı (genellikle 10)  ·  Og = g. grupta gözlemlenen temerrüt  ·  Eg = g. grupta beklenen temerrüt = Σi∈g pi  ·  ng = g. gruptaki borçlu sayısı  ·  H₀ altında HL ~ χ²(G−2)  ·  Kritik değer (α=%5, G=10): χ²(8) = 15.51
İnteraktif · Hosmer-Lemeshow — Ondalık Görselleştirme
Model Sapma Türü
Genel Bias (%)0
Düşük Uç Sapma0
Yüksek Uç Sapma0
HL istatistiği
p-değeri (χ²(8), kritik=15.51)

06 · LGD & EAD Validasyonu

TestLGD ValidasyonuEAD / CCF Validasyonu
Merkezi Eğilim Ortalama LGD tahmini vs gerçekleşen — t-testi veya Wilcoxon Ortalama CCF tahmini vs gerçekleşen — t-testi
Rank Order LGD yüksek tahmin edilen → gerçekten yüksek mi? Spearman ρ Yüksek CCF tahmin → yüksek gerçekleşen? (Zayıf ilişki beklenir)
Dağılım Testi Tahmin vs gerçekleşen LGD dağılımı — KS veya Anderson-Darling Tahmin vs gerçekleşen EAD dağılımı
Segment Testi Her teminat tipi için ayrı kalibrasyon — HL benzeri grup testi Her ürün tipi için ayrı CCF testi — binom veya t-testi
Downturn Testi LGDDT ≥ LGDLR sağlanıyor mu? Stres dönem verisi var mı? CCFDT ≥ CCFLR her segment için sağlanıyor mu?

07 · Validasyon Bulgu Sınıflaması

Bulgu Seviyeleri — Sektör Pratiği (ECB denetim beklentileriyle uyumlu)

Kritik (Red): Model kullanılamaz haldedir. Örnek: tüm ondalıklarda sistematik bias, binomial testte p < 1%, negatif marginal PD. Acil düzeltme veya kullanım kısıtlaması gerekir.

Önemli (Amber): Model çalışıyor ama belirli bir boyutta sapma var. Örnek: belirli segmentte zayıf Gini, tek ondalıkta HL aykırılığı. İyileştirme planı ve takip yeterli.

Bilgi (Green): Gözlem, iyileştirme önerisi veya minor nokta. Mevcut sınır içinde. Dönemsel izlem yeterli.

Sık Karşılaşılan Pitfall'lar

Discriminasyon iyi ≠ Kalibrasyon iyi: Modeli sadece Gini ile "onaylamak" yaygın hata. Gini=%65 bile kötü kalibre modelde EL %50 hatalı olabilir.

Test gücü (power) ihmal edilmesi: Küçük portföylerde binomial testi reject etmesi güçtür. p-değeri 0.12 ise "geçti" değil, "testin yeterli gücü yok" demek olabilir. Güç analizi yapılmalı.

Multiple testing sorunu: 10 segment, 5 yıl verisi = 50 test. %5 anlamlılıkta ~2.5 yanlış red beklenir. Bonferroni veya FDR düzeltmesi gerekli.

Kendini kontrol et

Yüksek Gini iyi kalibrasyon kanıtı mıdır?

Hayır; Gini sıralama gücünü, kalibrasyon ise mutlak olasılık doğruluğunu ölçer.

HL testinin temel zayıflığı nedir?

Sonuç gruplama seçimine ve örneklem büyüklüğüne duyarlıdır.

Az temerrütlü grade’de ne yapılır?

Exact/Bayesian aralıklar, pooling, uzun dönem kanıtı ve uzman değerlendirmesi birlikte kullanılır; tek p-değerine dayanılmaz.

Birincil kaynaklar ve güncellik

Son içerik kontrolü: 13 Temmuz 2026. Düzenleyici kapsam ve yürürlük tarihi kurumun yargı alanına göre ayrıca doğrulanmalıdır.

← B5 · Portföy B7 · Model Risk →