D3 ML for Risk · VALIDATION · ~2.5h

ML Validasyon — OOT, Fairness & Üretim İzleme

Bir ML modelinin teknik başarısı yalnızca geliştirme setindeki Gini değildir. Zamansal sağlamlık (OOT), grup adalet metrikleri, üretimde bozunma hızı ve hangi koşulda yeniden eğitim gerektiği — bunların tamamı validasyon kapsamında.

Bu modülden çıkman gerekenler

01 · Out-of-Time Validasyon & Learning Curves

ML modeli geliştirme setinde (in-time) yüksek Gini gösterse de bu yeterli değildir. Gelecekteki veride —üretim ortamında— aynı performansı sergileyip sergilemeyeceğini test etmek için out-of-time (OOT) ayrımı güçlü bir kanıttır; yöntem ve örneklem modelin kullanım amacı ile düzenleyici kapsamına göre belirlenir.

OOT Validasyon Tasarımı
ΔGini = GiniOOT − Giniin-time    ← kurumun portföy bazlı toleransıyla karşılaştır
Eğitim: T₀–T₁ dönemi verisi  ·  OOT: T₁–T₂ dönemi verisi (gelecek)  ·  Örtüşme yok — ayrım kritik  ·  Örnek alarm: OOT Gini’de 10 puan düşüş; evrensel kural değildir  ·  K-fold cross-validation zamansal sızıntıya karşı korumaz — OOT yerine kullanılamaz
İnteraktif · Learning Curve — Veri Boyutu vs Gini
Model Parametreleri
Model KarmaşıklığıOrta
Regularizasyon λ1.0
Sinyal/Gürültü OranıOrta
Tanı: —

02 · Fairness — Grup Adalet Metrikleri

Üç Temel Fairness Metriği
Demographic Parity: P(Ŷ=1|A=0) = P(Ŷ=1|A=1)
Equal Opportunity: P(Ŷ=1|Y=1,A=0) = P(Ŷ=1|Y=1,A=1)     [TPR eşitliği]
Calibration: P(Y=1|Ŷ=p,A=0) = P(Y=1|Ŷ=p,A=1)
A = korunan özellik (grup üyeliği)  ·  Ŷ = model kararı  ·  Y = gerçek sonuç  ·  Disparate Impact Ratio = AR_minority / AR_majority  ·  ABD’deki %80 kuralı istihdam bağlamından gelen bir tarama göstergesidir; kredi için otomatik hukukî güvenli liman değildir  ·  Equal Opportunity Diff = TPR_A − TPR_B  ·  |EOD| için tolerans kullanım, zarar ve hukuk bağlamında belirlenir
Chouldechova İmkansızlık Teoremi (2017)

Grupların base rate’leri farklıysa ve tahmin kusursuz değilse, gruplar içinde kalibrasyon ile bazı hata-oranı eşitliği ölçütleri aynı anda sağlanamaz. Chouldechova sonucu “demographic parity + equal opportunity + calibration” biçiminde evrensel üçlü yasa değildir. Kurum, geçerli hukuk ve zarar modeli ışığında hangi metriklerin neden seçildiğini belgelemelidir.

İnteraktif · Fairness Analiz Paneli — İki Grup Karşılaştırması
Grup A (Çoğunluk)
Temerrüt Oranı DR_A (%)4.0
Grup B (Azınlık)
Temerrüt Oranı DR_B (%)7.0
Model & Karar
Model Gini (%)55
Red Eşiği (skor yüzdelik)25
KriterEşikKredi Riskinde ÖncelikGerekçe
Disparate Impact%80 yalnızca örnek taramaBağlama bağlıİstihdam kökenli gösterge; kredi hukukunda otomatik güvenli eşik değil
Equal OpportunityÖrnek tarama: |EOD| < 5ppBağlama bağlıZarar tanımı, örneklem gücü ve hukukla birlikte yorumlanır
CalibrationGrup bazlı calibration curve / hataÖnemliHL tek seçenek değildir; örneklem gücü ayrıca değerlendirilir
Demographic ParityAynı onay oranıDüşükFarklı DR → farklı onay oranı kaçınılmaz; zorunlu kriter değil

03 · Üretim İzleme & Model Yaşam Döngüsü

İnteraktif · Üretim Monitöring — Gini & PSI Zaman Serisi
Bozunma Parametreleri
Başlangıç Gini (%)62
Konsept Drift HızıOrta
Veri Drift HızıYavaş
Yeniden Kalibrasyon Zamanı (ay)12

Aşağıdaki bantlar eğitim amaçlı örnek alarm düzeyleridir; portföyün örneklem belirsizliği, ekonomik önemlilik ve model risk iştahına göre kalibre edilmelidir.

DurumGiniPSIAksiyon
StabilBaşlangıcın %5 içinde< 0.10Rutin izleme — model kullanımda
Hafif Kayma5-10pp düşüş0.10–0.25İzleme sıklığı artır, nedenini araştır
Yeniden Kalibrasyon10-15pp düşüş> 0.25 (score)Katsayıları güncelle, LRA'yı yeniden kalibre et
Yeniden Eğitim>15pp düşüş> 0.25 (feature)Yeni veriyle model yeniden eğit
Yeniden GeliştirmeYeniden eğitim de yetmediYapısal değişimModel mimarisini sıfırdan gözden geçir

04 · ML Validasyon Özet Kontrol Listesi

Geliştirme Aşaması

Veri sızıntısı kontrolü: Hedef değişken (temerrüt) ile bağlantılı bilgi modele girdi olarak girmiş mi? Temerrüt tarihi sonrasındaki bilgi eğitim verisine sızmış mı? Veri sızıntısı yapay yüksek Gini'nin en yaygın nedenidir.

OOT ayrımı: Eğitim, validasyon ve OOT setlerinde zaman örtüşmesi yok mu? Her sette yeterli temerrüt vakası var mı (önceden belirlenmiş güç analiziyle yeterli temerrüt)?

Hiperparametre optimizasyonu sızıntısı: Hiperparametre seçimi OOT seti kullanılarak yapıldıysa o seti gerçek OOT olarak kullanmak geçersizleşir. Hiperparametre tuning yalnızca validasyon setiyle yapılmalı.

Üretim Aşaması

Model kartı (Model Card): Her ML modeli için üretim ortamına alındığında model kartı oluşturulmalı: hangi veriyle eğitildi, performans metrikleri, kapsam sınırları, fairness analizi özeti, yeniden eğitim koşulları. SR 26-2 risk bazlı dokümantasyon ve yönetişim beklentisi getirir; “model card” bunu karşılayan iyi bir uygulama olabilir.

Shadow mode (gölge mod): Yeni model devreye alınmadan önce üretim verisinde paralel çalıştırılıp mevcut model ile karşılaştırılmalı. Challenger → champion geçişinde risk bazlı güçlü bir uygulamadır; her yargı alanında sabit bir zorunluluk değildir.

Kademeli devreye alma (canary deployment): Yeni model tüm portföyde değil önce %5-10 segmentte test edilebilir. Beklenmedik davranış varsa geri çekilmesi kolay olur.

Fairness & Etik

Proxy ayrımcılık testi: Model korunan özelliği (cinsiyet, etnik köken) doğrudan kullanmasa bile yüksek korelasyonlu değişkenler (posta kodu, ad örüntüleri) ayrımcı etki yaratabilir. SHAP değerleri üzerinden gruplar arası karşılaştırma yapılmalı.

Counterfactual erişilebilirlik: Her borçlunun kararını değiştirmek için en küçük değişim nedir? (Counterfactual explanation) "DTI'nizi %3 düşürürseniz onaylanırsınız" — bu değişim borçlu için makul ve erişilebilir mi? Aşırı maliyetli değişimler önermek fairness sorunu yaratır.

İleri Nokta · EU AI Act — Validasyonun Yeni Çıktıları (Post-Market Monitoring)

AI Act kapsamı ve geçiş takvimi uygulanabilir olduğunda, yüksek-riskli sistemler validasyon fonksiyonuna somut ve sürekli kanıt görevleri ekler: (1) post-market monitoring planı; (2) düzenlemedeki kapsam ve saklama şartlarına uygun otomatik loglama; (3) insan gözetiminin fiilen çalıştığının testi; (4) yalnızca düzenlemede sayılan deployer’lar için FRIA (Fundamental Rights Impact Assessment). Annex III kurallarının 2 Aralık 2027 uygulama takvimi ve kurumun rolü yürürlük öncesinde yeniden kontrol edilmelidir.

🎓 Tüm Risk Learning Track Tamamlandı
23 modül · 4 track · Market Risk → Credit Risk → Capital & Stress → ML for Risk
Piyasa riskinden makine öğrenmesine, Basel IV'ten GDPR açıklama hakkına kadar tam kapsamlı bir risk validasyon perspektifi.
Track A — Market Risk (9 modül) Track B — Credit Risk (7 modül) Track C — Capital & Stress (4 modül) Track D — ML for Risk (3 modül)

Kendini kontrol et

K-fold CV neden OOT yerine geçmez?

Rastgele fold’lar aynı zaman rejimini paylaşabilir ve gelecekteki rejim değişimini sınamaz.

Fairness metrikleri neden birlikte çatışabilir?

Grupların base rate’leri farklı olduğunda calibration ile eşit hata oranlarının bazı kombinasyonları kusursuz tahmin dışında aynı anda sağlanamaz.

Recalibrate ile retrain farkı nedir?

Recalibration sıralamayı koruyup olasılık ölçeğini düzeltir; retraining model ilişkilerini ve parametrelerini yeniden öğrenir.

Birincil kaynaklar ve güncellik

Son içerik kontrolü: 13 Temmuz 2026. Düzenleyici kapsam ve yürürlük tarihi kurumun yargı alanına göre ayrıca doğrulanmalıdır.

← D2 · SHAP / XAI Risk Track Ana Sayfa →