Sayısal Temeller · Faz VIII — Makine Öğrenmesi Temelleri

Modül 34 — Düzenlileştirme ve Çapraz Doğrulama

temel fikir

Karmaşık modeller eğitim verisini ezberler (düşük bias, yüksek varyans); basit modeller örüntüyü kaçırır (yüksek bias, düşük varyans). Düzenlileştirme, katsayılara ceza ekleyerek bu dengeyi ayarlar — modeli "küçülmeye" zorlar. Çapraz doğrulama ise hangi ceza seviyesinin (λ) en iyi genelleme yaptığını veri-sızıntısı olmadan seçer. İkisi birlikte aşırı uyumla mücadelenin standart araç setidir.

Ridge (L2) ve Lasso (L1)
min ∑(y−Xβ)² + λ∑βj²  |  +λ∑|βj|
L2: düzgün küçültme, korelasyonu paylaştırır · L1: seyreklik (sparsity), katsayıları tam sıfıra çeker · Elastic Net: ikisinin karışımı
k-Katlı Çapraz Doğrulama
CV(λ) = (1/k)∑i=1k MSEkat-i(λ)
Veriyi k parçaya böl, her parça bir kez test · Optimal λ: CV eğrisinin minimumu · "Bir-standart-hata" kuralı: daha basit model

Ön işleme, değişken seçimi ve hiperparametre araması her eğitim katlamasının içinde yapılmalıdır. Zaman serilerinde rastgele katlama gelecek bilgisi sızdırabilir; geçmişten geleceğe ayrım ve gerektiğinde zaman boşluğu kullanılır.

Düzenlileştirme Merkezi

Yüksek dereceli polinom gürültülü veriye uyduruluyor. Sol: veri + tahmin + gerçek fonksiyon. Sağ: eğitim/test hatası λ'ya göre. λ küçük: aşırı uyum (dalgalı); λ büyük: yetersiz uyum (düz).

Düzenlileştirme log₁₀(λ)
logλ = −3.0
Gürültü seviyesi
σ = 0.20
Eğitim verisi
Polinom tahmini
Gerçek f(x)
Grafik sonuçları aşağıdaki metin ve sayısal göstergelerle birlikte okunmalıdır.
Eğitim hatası (MSE)
Test hatası (ayrılmış 200 gözlem)
Test-minimum logλ*
Rejim

Test hatası, eğitim verisiyle aynı süreci izleyen ayrılmış 200 gözlemde ölçülür; etiketler gerçek fonksiyon değil, gürültülü gözlemlerdir. Bu yüzden eğrinin tabanı sıfıra değil σ²’ye yaklaşır — grafikte kesik yatay çizgi. λ ne kadar iyi seçilirse seçilsin indirgenemez gürültü aşılamaz. Buradaki logλ* tek bir test setinin minimumudur; üretimde bu seçim test setine hiç bakılmadan, ikinci sekmedeki çapraz doğrulamayla yapılır.

bias-variance ayrışımı

Test hatası üç bileşene ayrılır: bias² + varyans + indirgenemez gürültü. Düzenlileştirme bias'ı artırırken varyansı düşürür — toplam hatayı minimize eden bir λ noktası vardır. Bu yüzden test hatası eğrisi U-şeklindedir. Soldaki dik kenar (düşük λ) varyans baskın bölge (aşırı uyum); sağdaki yükseliş (yüksek λ) bias baskın bölge (yetersiz uyum). Çapraz doğrulamanın işi bu U'nun dibini güvenilir biçimde bulmaktır.

PD modeli geliştirmede düzenlileştirme: yüzlerce aday değişkenden anlamlı bir altküme seçmek için Lasso güçlü bir araçtır — gereksiz değişkenlerin katsayısını tam sıfıra çeker, böylece otomatik değişken seçimi yapar. Ancak BDDK/EBA validasyonunda dikkat: Lasso korelasyonlu değişkenlerden keyfi olarak birini seçebilir; bu, ekonomik gerekçeyle çelişebilir. Bu yüzden uygulamada genellikle düzenlileştirme + uzman değerlendirmesi birlikte kullanılır. Çapraz doğrulama out-of-time örneklemle desteklenmeli — finansal verilerde zaman bağımlılığı i.i.d. varsayımını bozar.

Yöntemler ve birincil referanslar: Sözlük ve kaynaklar.