ML Validasyon — OOT, Fairness & Üretim İzleme
Bir ML modelinin teknik başarısı yalnızca geliştirme setindeki Gini değildir. Zamansal sağlamlık (OOT), grup adalet metrikleri, üretimde bozunma hızı ve hangi koşulda yeniden eğitim gerektiği — bunların tamamı validasyon kapsamında.
- Out-of-time validasyonun neden cross-validation'dan farklı ve neden ayrı bir zamansal kanıt sağladığını açıklamak
- Learning curve'den underfitting/overfitting/veri ihtiyacını teşhis etmek
- Demographic parity, equal opportunity ve calibration fairness'ı formülle yazmak
- Chouldechova imkansızlık teoremini ve pratikte ne anlama geldiğini açıklamak
- Üretim monitöring için hangi metriklerin hangi eşiklerle izleneceğini bilmek
- Model lifecycle kararlarını (recalibrate vs retrain vs rebuild) hangi kriterlere göre verileceğini bilmek
01 · Out-of-Time Validasyon & Learning Curves
ML modeli geliştirme setinde (in-time) yüksek Gini gösterse de bu yeterli değildir. Gelecekteki veride —üretim ortamında— aynı performansı sergileyip sergilemeyeceğini test etmek için out-of-time (OOT) ayrımı güçlü bir kanıttır; yöntem ve örneklem modelin kullanım amacı ile düzenleyici kapsamına göre belirlenir.
02 · Fairness — Grup Adalet Metrikleri
Grupların base rate’leri farklıysa ve tahmin kusursuz değilse, gruplar içinde kalibrasyon ile bazı hata-oranı eşitliği ölçütleri aynı anda sağlanamaz. Chouldechova sonucu “demographic parity + equal opportunity + calibration” biçiminde evrensel üçlü yasa değildir. Kurum, geçerli hukuk ve zarar modeli ışığında hangi metriklerin neden seçildiğini belgelemelidir.
| Kriter | Eşik | Kredi Riskinde Öncelik | Gerekçe |
|---|---|---|---|
| Disparate Impact | %80 yalnızca örnek tarama | Bağlama bağlı | İstihdam kökenli gösterge; kredi hukukunda otomatik güvenli eşik değil |
| Equal Opportunity | Örnek tarama: |EOD| < 5pp | Bağlama bağlı | Zarar tanımı, örneklem gücü ve hukukla birlikte yorumlanır |
| Calibration | Grup bazlı calibration curve / hata | Önemli | HL tek seçenek değildir; örneklem gücü ayrıca değerlendirilir |
| Demographic Parity | Aynı onay oranı | Düşük | Farklı DR → farklı onay oranı kaçınılmaz; zorunlu kriter değil |
03 · Üretim İzleme & Model Yaşam Döngüsü
Aşağıdaki bantlar eğitim amaçlı örnek alarm düzeyleridir; portföyün örneklem belirsizliği, ekonomik önemlilik ve model risk iştahına göre kalibre edilmelidir.
| Durum | Gini | PSI | Aksiyon |
|---|---|---|---|
| Stabil | Başlangıcın %5 içinde | < 0.10 | Rutin izleme — model kullanımda |
| Hafif Kayma | 5-10pp düşüş | 0.10–0.25 | İzleme sıklığı artır, nedenini araştır |
| Yeniden Kalibrasyon | 10-15pp düşüş | > 0.25 (score) | Katsayıları güncelle, LRA'yı yeniden kalibre et |
| Yeniden Eğitim | >15pp düşüş | > 0.25 (feature) | Yeni veriyle model yeniden eğit |
| Yeniden Geliştirme | Yeniden eğitim de yetmedi | Yapısal değişim | Model mimarisini sıfırdan gözden geçir |
04 · ML Validasyon Özet Kontrol Listesi
Veri sızıntısı kontrolü: Hedef değişken (temerrüt) ile bağlantılı bilgi modele girdi olarak girmiş mi? Temerrüt tarihi sonrasındaki bilgi eğitim verisine sızmış mı? Veri sızıntısı yapay yüksek Gini'nin en yaygın nedenidir.
OOT ayrımı: Eğitim, validasyon ve OOT setlerinde zaman örtüşmesi yok mu? Her sette yeterli temerrüt vakası var mı (önceden belirlenmiş güç analiziyle yeterli temerrüt)?
Hiperparametre optimizasyonu sızıntısı: Hiperparametre seçimi OOT seti kullanılarak yapıldıysa o seti gerçek OOT olarak kullanmak geçersizleşir. Hiperparametre tuning yalnızca validasyon setiyle yapılmalı.
Model kartı (Model Card): Her ML modeli için üretim ortamına alındığında model kartı oluşturulmalı: hangi veriyle eğitildi, performans metrikleri, kapsam sınırları, fairness analizi özeti, yeniden eğitim koşulları. SR 26-2 risk bazlı dokümantasyon ve yönetişim beklentisi getirir; “model card” bunu karşılayan iyi bir uygulama olabilir.
Shadow mode (gölge mod): Yeni model devreye alınmadan önce üretim verisinde paralel çalıştırılıp mevcut model ile karşılaştırılmalı. Challenger → champion geçişinde risk bazlı güçlü bir uygulamadır; her yargı alanında sabit bir zorunluluk değildir.
Kademeli devreye alma (canary deployment): Yeni model tüm portföyde değil önce %5-10 segmentte test edilebilir. Beklenmedik davranış varsa geri çekilmesi kolay olur.
Proxy ayrımcılık testi: Model korunan özelliği (cinsiyet, etnik köken) doğrudan kullanmasa bile yüksek korelasyonlu değişkenler (posta kodu, ad örüntüleri) ayrımcı etki yaratabilir. SHAP değerleri üzerinden gruplar arası karşılaştırma yapılmalı.
Counterfactual erişilebilirlik: Her borçlunun kararını değiştirmek için en küçük değişim nedir? (Counterfactual explanation) "DTI'nizi %3 düşürürseniz onaylanırsınız" — bu değişim borçlu için makul ve erişilebilir mi? Aşırı maliyetli değişimler önermek fairness sorunu yaratır.
AI Act kapsamı ve geçiş takvimi uygulanabilir olduğunda, yüksek-riskli sistemler validasyon fonksiyonuna somut ve sürekli kanıt görevleri ekler: (1) post-market monitoring planı; (2) düzenlemedeki kapsam ve saklama şartlarına uygun otomatik loglama; (3) insan gözetiminin fiilen çalıştığının testi; (4) yalnızca düzenlemede sayılan deployer’lar için FRIA (Fundamental Rights Impact Assessment). Annex III kurallarının 2 Aralık 2027 uygulama takvimi ve kurumun rolü yürürlük öncesinde yeniden kontrol edilmelidir.
Piyasa riskinden makine öğrenmesine, Basel IV'ten GDPR açıklama hakkına kadar tam kapsamlı bir risk validasyon perspektifi.
Kendini kontrol et
K-fold CV neden OOT yerine geçmez?
Rastgele fold’lar aynı zaman rejimini paylaşabilir ve gelecekteki rejim değişimini sınamaz.
Fairness metrikleri neden birlikte çatışabilir?
Grupların base rate’leri farklı olduğunda calibration ile eşit hata oranlarının bazı kombinasyonları kusursuz tahmin dışında aynı anda sağlanamaz.
Recalibrate ile retrain farkı nedir?
Recalibration sıralamayı koruyup olasılık ölçeğini düzeltir; retraining model ilişkilerini ve parametrelerini yeniden öğrenir.
Birincil kaynaklar ve güncellik
Son içerik kontrolü: 13 Temmuz 2026. Düzenleyici kapsam ve yürürlük tarihi kurumun yargı alanına göre ayrıca doğrulanmalıdır.