Sayısal Temeller · Faz III — İstatistiksel Çıkarım

Modül 13 — Hipotez Testleri

temel fikir

Veri görülenüzde şüphe duyduğunuz bir iddiayı test etmek istiyorsunuz. Hipotez testi bu şüpheyi sayıya döker: "Eğer iddia (H₀) doğru olsaydı, bu veriyi gözlemlemek ne kadar olası olurdu?" Cevap çok düşükse — p-değeri α'dan küçükse — H₀'ı reddedersiniz. Ama bu "H₀ kesinlikle yanlış" demek değildir; "bu veri H₀ ile tutarsız" demektir. Bu ince ayrım pek çok yanlış yorumun kaynağıdır.

Test İstatistiği (z)
z = ( − μ0) / (σ / √n)
H₀: μ = μ₀ altında N(0,1) · σ bilinmiyorsa t dağılımı ve s kullanılır
p-Değeri (çift kuyruk)
p = 2 × P(Z > |zobs|)
H₀ doğruyken gözlemlediğimiz kadar veya daha aşırı bir sonuç alma olasılığı
p-değeri yanılgısı (p-hacking): "p < 0.05 buldum, sonuç kesindir" denilemez. p-değeri H₀'ın doğru olma olasılığı değildir; veri-hipotez uyumsuzluğunun bir ölçüsüdür. Ayrıca çok sayıda test yapıldığında (birden fazla hipotez) Bonferroni düzeltmesi veya FDR kontrolü gerekmektedir.
Hipotez Testi Görselleştirici
Test türü
Anlamlılık düzeyi α
Test istatistiği zobs
z = 0.00
Grafik sonuçları aşağıdaki metin ve sayısal göstergelerle birlikte okunmalıdır.
Kritik Değer
±1.960
p-Değeri
1.000
|z| vs z_krit
Karar

tip I ve tip II hata dengesi

Her hipotez testi iki tür hata arasında bir denge kurar. Tip I hata (yanlış alarm): H₀ doğruyken reddedilir. Olasılığı = α (anlamlılık düzeyi). Tip II hata (kaçırma): H₁ doğruyken H₀ reddedilmez. Olasılığı = β. Sabit n'de α'yı küçülttüğünüzde β büyür — yanlış alarmı azaltırken kaçırma riskini artırırsınız. Güç analizinde istediğiniz güce (1−β = 0.80 genellikle) ulaşmak için gereken n hesaplanır.

Model validasyonunda α seçimi yanlış alarmın yönetişim maliyeti ile gerçek bozulmayı kaçırma maliyetini dengeler. %5 sık kullanılan akademik bir başlangıçtır, ancak evrensel düzenleyici geçme eşiği değildir; örneklem büyüklüğü, test gücü, çoklu karşılaştırma ve ekonomik önemle birlikte önceden belirlenmelidir.

p-değeri hakkında doğru yorum

p-değeri, H₀ doğru olduğu varsayımıyla, gözlemlenen veya daha aşırı bir test istatistiğinin olasılığıdır. Ne değildir: H₀'ın doğru olma olasılığı değildir. H₁'in doğru olma olasılığı değildir. Etki büyüklüğünün ölçüsü değildir. "Anlamlı" sonuç "önemli" demek değildir — büyük n'lerde küçük, anlamsız farklar da anlamlı çıkabilir. İstatistiksel anlamlılık ile pratik/ekonomik önem birlikte değerlendirilmelidir.

Yöntemler ve birincil referanslar: Sözlük ve kaynaklar.