Modül 12 — Güven Aralıkları ve Bootstrap
temel fikir ve yorum
Bir parametre için tek bir nokta tahmini genellikle yeterli değildir; belirsizliği de ölçmek gerekir. Güven aralığı bu belirsizliği nicelleştirir — ama yaygın yorum hatası şudur: "%95 güven aralığı, parametrenin %95 olasılıkla bu aralıkta olduğu anlamına gelmez." Parametre sabit, aralık rastgeledir. Doğru yorum: bu yöntemi binlerce kez uygulasaydık, aralıkların %95'i gerçek parametreyi kapsardı.
Güven aralığındaki %95, aynı yöntemle tekrar tekrar kurulan aralıkların uzun dönem kapsama oranıdır. Ekrandaki sonlu sayıda tekrarın tam %95 kapsaması beklenmez. Student-t kritik değerleri sayısal dağılım fonksiyonundan hesaplanır; bootstrap yüzdelik aralığı küçük veya çarpık örneklemde tam kapsama garantisi vermez.
Her yatay çubuk bir simülasyondan hesaplanan güven aralığını temsil eder. Yeşil: gerçek μ = 0 kapsanıyor. Kırmızı: kapsanmıyor. Teorik olarak kırmızı oran = 1 − güven düzeyi.
bootstrap algoritması
Bootstrap yönteminin özü basittir: elimizdeki örneklemi popülasyonun en iyi tahmini olarak kabul et ve bu örneklemden yerine koyarak (with replacement) B kez yeniden örnekleme yap. Her tekrarda istatistiği hesapla. Bu B değerin dağılımı, istatistiğin örnekleme dağılımının ampirik tahminidir. CI için: bootstrap dağılımının %2.5 ve %97.5 yüzdelikleri aralık sınırlarını verir.
Bootstrap parametrik dağılım varsayımını azaltır, fakat “her istatistikte otomatik geçerli” değildir. Yüzdelik aralık sapmalı olabilir; uç kuantiller, sınır parametreleri, çok küçük örneklem ve bağımlı veri özel yöntem ister. Temel örneklemin hedef popülasyonu temsil etmesi şarttır.
Yöntemler ve birincil referanslar: Sözlük ve kaynaklar.