Sayısal Temeller · Faz III — İstatistiksel Çıkarım

Modül 10 — Örnekleme Teorisi ve Merkezi Limit Teoremi

temel fikir

Bir bankanın tüm müşterileri hakkında tam bilgiye sahip değilsiniz; bir örneklem alırsınız. Bu örneklemden hesaplanan istatistikler (ortalama, varyans) gerçek popülasyon parametrelerine ne kadar yakındır? Örneklem büyüklüğü arttıkça ne olur? Merkezi Limit Teoremi bu soruların cevabıdır — ve istatistiksel çıkarımın neredeyse tüm araçlarının altında yatar.

Klasik merkezi limit teoremi, bağımsız ve aynı dağılımlı gözlemlerde sonlu, pozitif varyans koşuluyla standartlaştırılmış örneklem ortalamasının dağılımının normale yakınsadığını söyler. Ham ortalama ise beklenti etrafında yoğunlaşır. Bağımlılık veya sonsuz varyans altında aynı sonuç koşulsuz kullanılamaz.

Örneklem Ortalaması
= (1/n) ∑i=1n Xi
E[X̅] = μ · Var[X̅] = σ² / n · Sapması azalır ama elimine olmaz
Standart Hata (SE)
SE = σ / √n
n 4 katına çıkınca SE yarıya iner · "Daha iyi tahmin" için maliyeti artan n
Merkezi Limit Teoremi
n ( − μ) / σ  ⟶d  N(0, 1)   (n → ∞)
X_i bağımsız, aynı dağılımlı, E[X] = μ, Var[X] = σ² < ∞ · Dağılımın şekline bakılmaksızın · n ≥ 30 çoğu dağılım için yeterli
CLT ve Örnekleme Keşfedici

Herhangi bir dağılımdan n örnekli 2000 set alındı. Üst grafik: tek gözlem dağılımı. Alt grafik: örneklem ortalamalarının dağılımı. Kesik mavi: N(μ, σ²/n) teorik referans.

Örneklem büyüklüğü n
n = 1
SE = σ
n=1: ortalama = orijinal gözlem
Grafik sonuçları aşağıdaki metin ve sayısal göstergelerle birlikte okunmalıdır.

CLT'nin sınırları

CLT her koşulda aynı biçimde çalışmaz. Klasik i.i.d. sürüm sonlu varyans ister; Pareto’da α≤2 iken varyans sonsuzdur ve normal limit yerine kararlı dağılımlar gündeme gelebilir. Bağımsızlık gerekli tek yol değildir: uygun karıştırma/zayıf bağımlılık koşullarında zaman serileri için de CLT vardır. Güçlü bağımlılıkta ise standart hata uzun dönem varyansını içermelidir.

CLT animatöründe Pareto dağılımını seçip n'yi artırın: alt histogramın normalleşmesi çok daha yavaş gerçekleşir. Bu, kalın kuyruklu dağılımlarda "n≥30 yeterli" kuralının geçersiz olduğunu doğrudan gösterir.

bootstrap ile parametresiz örnekleme

Popülasyon dağılımı bilinmese de ortalama için s/√n gibi tahminler kullanılabilir; karmaşık istatistiklerde bootstrap örnekleme dağılımını yaklaşıklar. Bağımlı veride sıradan yeniden örnekleme bağımlılığı bozar, bu nedenle blok veya zaman serisi bootstrap gerekir. Modül 12’de kapsama ve yöntem seçimini ayrıntılandıracağız.

Bankacılık validasyonunda CLT nasıl görünür? PD modelinin kalibrasyonunu test ederken "1000 firmalı bir portföyde gözlemlenen temerrüt oranı ile model tahmininin farkı anlamlı mı?" sorusunu sormak CLT uygulamasıdır. Örneklem ortalama fark istatistiği N(0, SE²) ile değerlendirilir; SE = √(p(1−p)/n). Ama bu SE temerrütlerin bağımsız olduğunu varsayar. Ortak bir makro faktör varsa gerçek değişkenlik çok daha büyüktür: PD=%1, n=1.000 ve Basel kurumsal varlık korelasyonu ρ=0,12 ile tek faktörlü Vasicek altında gerçek standart sapma ≈%1,13’tür — binom SE’si olan %0,31’in yaklaşık 3,6 katı. Binom SE’siyle yapılan kalibrasyon testi nominal %5 anlamlılıkta çok daha sık ret verir; gerçek uygulamada SE ya tek faktörlü modelden ya da yıllar arası gözlenen oran varyansından tahmin edilir (Modül 09 ve 37).

Yöntemler ve birincil referanslar: Sözlük ve kaynaklar.