Sayısal Temeller · Faz V — Türev ve Optimizasyon

Modül 19 — Çok Değişkenli Kalkulüs ve Gradyan

temel fikir

Tek değişkenli türev, fonksiyonun bir yöndeki değişim hızını verir. Çok değişkenli durumda bu bilgi bir vektöre genişler: gradyan. ∇f(x,y), her bileşeni o yöndeki kısmi türev olan bir vektördür ve f'nin en hızlı arttığı yönü gösterir. Optimizasyon algoritmalarının (ve dolayısıyla makine öğrenmesi eğitiminin) çoğu, gradyanı hesaplayıp negatif yönde adım atarak çalışır.

Gradyan Vektörü
f = [∂f/∂x,  ∂f/∂y]T
En dik çıkış yönü · |∇f| = o noktadaki maksimum değişim hızı · ∇f = 0 → kritik nokta (min, max veya eyer)
Hessian Matrisi
Hij = ∂²f / ∂xixj
İkinci türev bilgisi · Simetrik (Schwarz teoremi) · det(H) > 0 ve H₁₁ > 0 → min · det(H) < 0 → eyer
Gradyan ve Hessian Merkezi

Arka plan: f(x,y) değer ısı haritası (mavi=düşük, kırmızı=yüksek). Oklar: ∇f yönü. Büyük ok: seçilen noktadaki gradyan.

Nokta x koordinatı
x = 1.00
Nokta y koordinatı
y = 0.50
∇f (en dik çıkış)
−∇f (en dik iniş / gradient descent)
Gradyan alanı
Grafik sonuçları aşağıdaki metin ve sayısal göstergelerle birlikte okunmalıdır.
f(x,y)
∇f = [∂f/∂x, ∂f/∂y]
|∇f| (değişim hızı)
Gradient Descent yönü

yön türevi ve gradyanın önemi

Herhangi bir u birim vektör yönündeki türev: Duf = ∇f · u. Bu, bir dağ yamacında farklı yönlere yürüdüğünüzde aldığınız eğimi ölçer. Maksimum eğim: u = ∇f / |∇f| yönünde, değeri |∇f|. Minimum eğim (en dik iniş): −∇f yönünde. Optimizasyon algoritmalarının çoğu bu basit gerçeği kullanır: her adımda −∇f yönüne gidersen f azalır.

Lojistik regresyon eğitiminde gradyan: Negatif log-likelihood L(β)=−Σ[yᵢlog p̂ᵢ+(1−yᵢ)log(1−p̂ᵢ)] için ∂L/∂βⱼ=Σ(p̂ᵢ−yᵢ)xᵢⱼ’dir. Bu adım katsayı tahminidir; elde edilen olasılıkların hedef portföy ve dönem için kalibrasyonu ayrıca test edilir.

Yöntemler ve birincil referanslar: Sözlük ve kaynaklar.