Sayısal Temeller · Faz IX — Model Validasyonu

Modül 37 — Kalibrasyon ve Backtesting

temel fikir

Ayrımcı güç sıralamayı, kalibrasyon olasılık seviyesini ölçer. Piyasa riski backtesting’i de tahmin ile gerçekleşme arasındaki uyumu sınar; ancak kredi PD kalibrasyonuyla aynı istatistiksel problem değildir. Güncel FRTB sermaye ölçüsü ES iken backtesting bir günlük VaR üzerinden sürer.

Gruplanmış Pearson Testi
HL = ∑k (Ok − Ek)² / [Ek(1 − Ek/nk)]
O: gözlenen, E: beklenen temerrüt · p-değeri: binom sıfır hipotezi simülasyonu · Binom testi: gruba özel kalibrasyon · Büyük X² → model PD’lerinden daha büyük sapma
Kupiec POF Testi
LR = −2 ln{[(1−p)N−xpx] / [(1−x/N)N−x(x/N)x]}
x: aşım sayısı, N: gün, p: 1−güven · LR ~ χ²(1), krit %5 = 3.84 · Basel trafik ışığı: yeşil/sarı/kırmızı

Kalibrasyon panelinde 10 sabit PD için bağımsız binom sayımları üretilir. Çubuklar noktasal %95 binom tahmin bantlarıdır; 10 grubun birlikte kapsama garantisi değildir. Gruplanmış Pearson istatistiğinin p-değeri 999 sıfır hipotezi tekrarından hesaplanır. Aynı veride tahmin edilmiş lojistik model için Hosmer–Lemeshow’un g−2 yaklaşımı bu deneye doğrudan taşınmaz.

Validasyon Test Merkezi

10 derecelendirme grubu. x: tahmin edilen PD, y: gözlenen temerrüt oranı. Diyagonal: tahmin ile gözlem eşitliği. Çubuklar: noktasal %95 binom tahmin bandı.

Kalibrasyon sapması (gerçek/tahmin)
×1.00 (kalibre)
Grup başına gözlem n
n = 500
Tahmin = gözlem
Gözlem bant içinde
Gözlem bant dışında
Grafik sonuçları aşağıdaki metin ve sayısal göstergelerle birlikte okunmalıdır.
Pearson X²
Simülasyon p-değeri
Bant dışı grup
Ort. tahmin / gözlem PD

ayrımcı güç ≠ kalibrasyon

Bu iki kavramı ayırmak validasyonun en sık karıştırılan noktasıdır. Bir model yüksek Gini'ye sahip olup (iyi sıralama) tamamen yanlış kalibre olabilir — örneğin tüm PD'leri sistematik olarak iki katına çıkarırsanız sıralama (ve dolayısıyla AUC/Gini) hiç değişmez, ama kalibrasyon tamamen bozulur. Tersi de mümkün: zayıf ayrımcı güçlü ama ortalaması doğru bir model. IFRS 9 ECL ve IRB sermaye hesabı kalibrasyona, kredi onay kararları ise ayrımcı güce daha duyarlıdır. İkisini de ayrı ayrı test etmek zorunludur.

kalibrasyon sonucunu değerlendirmek

Kalibrasyon değerlendirmesi, test istatistiğinin yanı sıra örneklem büyüklüğünü, bağımlılık yapısını, ekonomik sapmanın boyutunu ve kullanım amacını içerir.

Önce portföy düzeyindeki tahmin ve gerçekleşme farkı, ardından gruplar arası yapı incelenir. Küçük beklenen temerrüt sayılarında test gücü düşük olabilir. Buradaki gruplu Pearson testi, aynı veri üzerinde eğitilmiş bir lojistik modele uygulanan klasik Hosmer–Lemeshow testiyle aynı deney değildir.

IRB ↔ IFRS 9 hedef ayrımı: Basel IRB PD, derece/havuz için bir yıllık temerrüt oranlarının uzun dönem ortalamasını yansıtmalıdır; rating felsefesi PIT/TTC duyarlılığı ayrıca tasarlanır. IFRS 9 ECL ise raporlama tarihindeki ileriye dönük, olasılık-ağırlıklı bilgiyi kullanır. Bu nedenle aynı skorun kalibrasyon hedefleri özdeş değildir.

FRTB backtesting: Bank-wide bir günlük %99 VaR, actual ve hypothetical P&L’ye karşı 250 gün üzerinden sınanır. Güncel Basel tablosunda çarpan 0–4 aşımda 1,50; 5–9 aşımda 1,70–1,92; 10+ aşımda 2,00’dır. Kupiec kapsama sayısını, Christoffersen bağımsızlığı sınar; düzenleyici istisna sayımı ve sonuçları MAR32’ye göre ayrıca uygulanır.

Düzeltme seçimi: Yüksek ayrımcı güç ve bozuk kalibrasyonda yeniden ölçekleme bir seçenek olabilir; fakat veri kayması, tanım değişikliği veya model formu hatası varsa yeniden geliştirme gerekebilir. MoC, bilinen veri/yöntem eksikliğine karşı muhafazakârlıktır; mekanik kalibrasyon tamiri değildir.

Bu serinin son modülü. Bir testin “geçti/kaldı” sonucu tek başına güvenilirlik kararı değildir: veri kapsamı, varsayım, belirsizlik, kullanım amacı ve yönetişim birlikte değerlendirilir. Basel, EBA, Fed ve BDDK referansları aynı yargı alanı değildir; raporda hangisinin uygulandığı açıkça belirtilmelidir.

Yöntemler ve birincil referanslar: Sözlük ve kaynaklar.