Sayısal Temeller · Faz VIII — Makine Öğrenmesi Temelleri

Modül 32 — Lojistik Regresyon

temel fikir

Lineer regresyon sınırsız bir çıktı üretir; ama olasılık [0,1] aralığında olmalı. Lojistik regresyon, lineer bir skoru (β₀ + β₁x₁ + ...) sigmoid fonksiyonuyla olasılığa sıkıştırır. Bankacılıkta bu, PD modellerinin standart algoritmasıdır: borçlu özelliklerinden temerrüt olasılığı tahmini. Parametreler maksimum olabilirlik (cross-entropy minimizasyonu) ile, çoğunlukla gradient descent (Modül 20) veya Newton-IRLS ile tahmin edilir.

Sigmoid ve Olasılık
p = σ(z) = 1/(1+e−z)
z = β₀ + β₁x₁ + β₂x₂ + ... · logit(p) = ln(p/(1−p)) = z · Karar sınırı: p = 0.5 ↔ z = 0
Cross-Entropy Kaybı
L = −∑[y ln p + (1−y) ln(1−p)]
MLE'ye eşdeğer · Gradyan: ∂L/∂βⱼ = Σ(pᵢ−yᵢ)xᵢⱼ · Konveks → tek global minimum · L2 ile düzenlileştirilir
Lojistik Regresyon Merkezi

İki özellik (x₁, x₂), iki sınıf (temerrüt/temiz). Arka plan: P(temerrüt) ısı haritası. Beyaz çizgi: karar sınırı (p=0.5). Model gradient descent ile canlı eğitiliyor.

Sınıf ayrımı
d = 2.0
Gürültü (örtüşme)
σ = 1.0
L2 düzenlileştirme λ
λ = 0.0
P(temiz)
P(temerrüt) çizgi: p=0.5
Temiz (y=0)
Temerrüt (y=1)
Grafik sonuçları aşağıdaki metin ve sayısal göstergelerle birlikte okunmalıdır.
Doğruluk (örneklem-içi)
AUC (örneklem-içi · bkz. M36)
Son cross-entropy
||β|| (katsayı normu)

logit, odds ve yorumlama

Lojistik katsayı βⱼ, diğer girdiler sabitken xⱼ bir birim arttığında log-odds değişimidir; eβⱼ odds oranıdır. Bu yorum denetlenebilirliği kolaylaştırır, ancak BDDK/EBA’nın tüm IRB modellerinde lojistiği diğer yöntemlere karşı genel olarak “tercih ettiği” sonucu çıkarılamaz. Uygunluk; veri, performans, açıklanabilirlik ve yönetişimle gösterilir.

WoE dönüşümü ve lojistik regresyon skorkartlarda yaygındır; fakat monotonluk ancak binleme/kısıt tasarımıyla sağlanır, WoE tek başına garanti etmez. Ayrımcı güç ve kalibrasyon ayrı doğrulanmalı; ayrışma ve örneklem kayması kontrol edilmelidir.

Yöntemler ve birincil referanslar: Sözlük ve kaynaklar.