Souhrnná odchylka - Pooled variance

Ve statistikách je sdružený rozptyl (také známý jako kombinovaný rozptyl , složený rozptyl nebo celkový rozptyl a psaný ) metodou pro odhad rozptylu několika různých populací, kdy průměr každé populace může být odlišný, ale lze předpokládat, že rozptyl každá populace je stejná. Numerický odhad vyplývající z použití této metody se také nazývá sdružená rozptyl.

Za předpokladu stejných odchylek populace poskytuje rozptyl sdruženého vzorku vyšší přesnost odhadu rozptylu než rozptyly jednotlivých vzorků. Tato vyšší přesnost může vést ke zvýšení statistického výkonu při použití ve statistických testech, které porovnávají populace, jako je t -test .

Druhá odmocnina sloučeného odhadce rozptylu je známý jako směsné standardní odchylka (také známý jako kombinovanou standardní odchylka , kompozitního standardní odchylky , nebo celková směrodatná odchylka ).

Motivace

V statistik , mnohokrát, údaje jsou shromažďovány pro závislou proměnnou , y , v rozmezí hodnot pro nezávislé proměnné , x . Sledování spotřeby paliva může být například studováno jako funkce otáček motoru, zatímco je zatížení motoru udržováno konstantní. Pokud je za účelem dosažení malé odchylky v y vyžadováno mnoho opakovaných testů při každé hodnotě x , náklady na testování se mohou stát neúnosnými. Rozumné odhady rozptylu lze určit pomocí principu sdružené odchylky po opakování každého testu v určitém x pouze několikrát.

Definice a výpočet

Definice

Sdružená rozptyl je odhad pevné společné odchylky u různých populací, které mají různé prostředky.

Výpočet

Pokud jsou populace indexovány , pak lze sdružené rozptyly vypočítat váženým průměrem

kde je velikost vzorku populace a jaké jsou odchylky vzorku

= .

Použití váhových faktorů místo toho pochází z Besselovy korekce .

Varianty

Objektivní odhad nejmenších čtverců (jak je uvedeno výše),

a odhad zkreslené maximální pravděpodobnosti

se používají v různých kontextech. První může poskytnout nezaujatý odhad, když obě skupiny sdílejí stejný populační rozptyl. Ten druhý může poskytnout efektivnější odhad , i když podléhá zkreslení. Všimněte si, že množství na pravé straně obou rovnic jsou nezaujaté odhady.

Příklad

Zvažte následující sadu dat pro y získanou na různých úrovních nezávislé proměnné  x .

X y
1 31, 30, 29
2 42, 41, 40, 39
3 31, 28
4 23, 22, 21, 19, 18
5 21, 20, 19, 18,17

Počet pokusů, průměr, rozptyl a standardní odchylka jsou uvedeny v následující tabulce.

X n y myslíš s i 2 s i
1 3 30.0 1,0 1,0
2 4 40,5 1,67 1.29
3 2 29.5 4.5 2.12
4 5 20.6 4.3 2,07
5 5 19.0 2.5 1,58

Tyto statistiky představují rozptyl a standardní odchylku pro každou podmnožinu dat na různých úrovních x . Pokud můžeme předpokládat, že stejné jevy generují náhodné chyby na každé úrovni x , výše uvedená data lze „shromáždit“ pro vyjádření jediného odhadu rozptylu a standardní odchylky. V jistém smyslu to naznačuje nalezení střední odchylky nebo standardní odchylky mezi pěti výše uvedenými výsledky. Tato průměrná odchylka se vypočítá vážením jednotlivých hodnot s velikostí podmnožiny pro každou úroveň x . Sdružená odchylka je tedy definována pomocí

kde n 1 , n 2 ,. . ., n k jsou velikosti datových podskupin na každé úrovni proměnné x , a s 1 2 , s 2 2 ,. . ., s k 2 jsou jejich příslušné odchylky.

Souhrnná rozptyl výše uvedených údajů je tedy:

Vliv na přesnost

Souhrnná rozptyl je odhad, pokud existuje korelace mezi sdruženými datovými sadami nebo průměr datových sad není identický. Souhrnná variace je méně přesná, čím více nenulová je korelace nebo vzdálené průměry mezi soubory dat.

Variace dat pro nepřekrývající se datové sady je:

Kde je průměr definován jako:

Vzhledem k předpojaté maximální pravděpodobnosti definované jako:

Pak chyba v předpojatém odhadu maximální pravděpodobnosti je:

Za předpokladu, že N je velký tak, že:

Poté se chyba v odhadu sníží na:

Nebo alternativně:

Agregace údajů o standardní odchylce

Spíše než odhadovat sdruženou směrodatnou odchylku, je následující způsob, jak přesně agregovat směrodatnou odchylku, když je k dispozici více statistických informací.

Statistiky založené na populaci

Populace množin, které se mohou překrývat, lze vypočítat jednoduše takto:

Populace množin, které se nepřekrývají, lze vypočítat jednoduše takto:

Standardní odchylky nepřekrývajících se ( XY = ∅ ) dílčích populací lze agregovat následujícím způsobem, pokud je známa velikost (skutečná nebo relativní vůči sobě navzájem) a prostředky každé z nich:

Předpokládejme například, že je známo, že průměrný Američan má průměrnou výšku 70 palců se směrodatnou odchylkou tři palce a že průměrná Američanka má průměrnou výšku 65 palců se směrodatnou odchylkou dva palce. Předpokládejme také, že počet mužů, N , se rovná počtu žen. Potom průměr a standardní odchylka výšek dospělých Američanů lze vypočítat jako

V obecnějším případě M nepřekrývajících se skupin obyvatelstva, X 1X M , a celkovým počtem obyvatel ,

,

kde

Pokud je velikost (skutečná nebo relativní vůči sobě), průměrná a standardní odchylka dvou překrývajících se populací známá pro populace stejně jako jejich průsečík, pak standardní odchylku celkové populace lze stále vypočítat následovně:

Pokud jsou dva nebo více souborů dat sčítány dohromady datový bod datovým bodem, lze standardní odchylku výsledku vypočítat, pokud je známa standardní odchylka každé datové sady a kovariance mezi každou dvojicí datových sad:

Ve zvláštním případě, kdy neexistuje žádná korelace mezi jakoukoli dvojicí datových sad, pak se vztah sníží na kořenový součet čtverců:

Statistiky založené na vzorcích

Standardní odchylky nepřekrývajících se ( XY = ∅ ) dílčích vzorků lze agregovat následujícím způsobem, pokud je známa skutečná velikost a průměr každého z nich:

Pro obecnější případ M nepřekrývajících se datových sad, X 1X M , a agregované datové sady ,

kde

Pokud je pro vzorky známa velikost, průměr a standardní odchylka dvou překrývajících se vzorků a také jejich průsečík, pak lze standardní odchylku agregovaného vzorku ještě vypočítat. Obecně,

Viz také

Reference

  • Killeen PR (květen 2005). „Alternativa k testům významnosti nulových hypotéz“ . Psychol Sci . 16 (5): 345–53. doi : 10.1111/j.0956-7976.2005.01538.x . PMC  1473027 . PMID  15869691 .

externí odkazy