Modül 10 — Örnekleme Teorisi ve Merkezi Limit Teoremi
temel fikir
Bir bankanın tüm müşterileri hakkında tam bilgiye sahip değilsiniz; bir örneklem alırsınız. Bu örneklemden hesaplanan istatistikler (ortalama, varyans) gerçek popülasyon parametrelerine ne kadar yakındır? Örneklem büyüklüğü arttıkça ne olur? Merkezi Limit Teoremi bu soruların cevabıdır — ve istatistiksel çıkarımın neredeyse tüm araçlarının altında yatar.
Klasik merkezi limit teoremi, bağımsız ve aynı dağılımlı gözlemlerde sonlu, pozitif varyans koşuluyla standartlaştırılmış örneklem ortalamasının dağılımının normale yakınsadığını söyler. Ham ortalama ise beklenti etrafında yoğunlaşır. Bağımlılık veya sonsuz varyans altında aynı sonuç koşulsuz kullanılamaz.
Herhangi bir dağılımdan n örnekli 2000 set alındı. Üst grafik: tek gözlem dağılımı. Alt grafik: örneklem ortalamalarının dağılımı. Kesik mavi: N(μ, σ²/n) teorik referans.
CLT'nin sınırları
CLT her koşulda aynı biçimde çalışmaz. Klasik i.i.d. sürüm sonlu varyans ister; Pareto’da α≤2 iken varyans sonsuzdur ve normal limit yerine kararlı dağılımlar gündeme gelebilir. Bağımsızlık gerekli tek yol değildir: uygun karıştırma/zayıf bağımlılık koşullarında zaman serileri için de CLT vardır. Güçlü bağımlılıkta ise standart hata uzun dönem varyansını içermelidir.
CLT animatöründe Pareto dağılımını seçip n'yi artırın: alt histogramın normalleşmesi çok daha yavaş gerçekleşir. Bu, kalın kuyruklu dağılımlarda "n≥30 yeterli" kuralının geçersiz olduğunu doğrudan gösterir.
bootstrap ile parametresiz örnekleme
Popülasyon dağılımı bilinmese de ortalama için s/√n gibi tahminler kullanılabilir; karmaşık istatistiklerde bootstrap örnekleme dağılımını yaklaşıklar. Bağımlı veride sıradan yeniden örnekleme bağımlılığı bozar, bu nedenle blok veya zaman serisi bootstrap gerekir. Modül 12’de kapsama ve yöntem seçimini ayrıntılandıracağız.
Yöntemler ve birincil referanslar: Sözlük ve kaynaklar.