Bayes-optimal klassificeringsfejlsandsynlighed og diskrimineringsindeks for to univariate normalfordelinger med ulige afvigelser (øverst) og to bivariate normalfordelinger med ulige kovariansmatriser (nederst, ellipser er 1 sd fejlelipser). Klassifikationsgrænsen er i sort. Disse beregnes ved hjælp af numeriske metoder.

Den følsomhed indeks eller discriminability indeks eller detekterbarhed indeks er en dimensionsløs statistik anvendes i signaldetektering teori . Et højere indeks angiver, at signalet lettere kan detekteres.
Definition
Diskrimineringsindekset er adskillelsen mellem midlerne til to fordelinger (typisk signalet og støjfordelingerne) i enheder af standardafvigelsen.
Lige afvigelser/kovarianser
For to univariate distributioner og med samme standardafvigelse betegnes det med ('dee-prime'):



-
.
I højere dimensioner, dvs. med to multivariate fordelinger med samme varians-kovariansmatrix , (hvis symmetriske kvadratrod, standardafvigelsesmatricen er ), generaliserer dette til Mahalanobis-afstanden mellem de to fordelinger:


-
,
hvor er 1d -skiven af sd langs enhedsvektoren gennem midlerne, dvs. lig med 1d -skiven gennem midlerne.




Dette anslås også som .

Ulige forskelle/kovarianser
Når de to fordelinger har forskellige standardafvigelser (eller i generelle dimensioner, forskellige kovariansmatriser), findes der flere modstridende indekser, som alle reduceres til for lige varians/kovarians.

Bayes diskrimineringsindeks
Dette er det maksimale (Bayes-optimale) diskrimineringsindeks for to fordelinger, baseret på mængden af deres overlapning, det vil sige den optimale (Bayes) klassificeringsfejl ved en ideel observatør eller dens komplement, den optimale nøjagtighed :


-
,
hvor er den inverse kumulative fordelingsfunktion for standardnormalen. Bayes -diskrimineringen mellem univariate eller multivariate normalfordelinger kan beregnes numerisk ( Matlab -kode ) og kan også bruges som en tilnærmelse, når distributionerne er tæt på det normale.

er en positiv-bestemt statistisk afstandsmåling, der er fri for antagelser om fordelingen, ligesom Kullback-Leibler-divergensen . er asymmetrisk, hvorimod den er symmetrisk for de to fordelinger. Imidlertid tilfredsstiller trekantens ulighed ikke, så det er ikke en fuld metrik.




Især for en ja/nej-opgave mellem to univariate normalfordelinger med midler og afvigelser er de Bayes-optimale klassificeringsnøjagtigheder:


-
,
hvor betegner den ikke-centrale chi i anden-fordeling , og . Bayes diskriminering


kan også beregnes ud fra ROC -kurven for en ja/nej -opgave mellem to univariate normalfordelinger med et enkelt skiftende kriterium. Det kan også beregnes ud fra ROC-kurven for to fordelinger (i et vilkårligt antal variabler) med et forskydende sandsynlighedsforhold ved at lokalisere det punkt på ROC-kurven, der er længst fra diagonalen.
For en to-interval opgave mellem disse fordelinger er den optimale nøjagtighed ( betegner den generaliserede chi-kvadratiske fordeling ), hvor
. Bayes diskriminering .




RMS sd diskrimineringsindeks
Et almindeligt omtrentligt (dvs. suboptimalt) diskrimineringsindeks, der har en lukket form, er at tage gennemsnittet af afvigelserne, dvs. rms af de to standardafvigelser: (også betegnet med ). Det er gange -score for området under modtagerens driftskarakteristikkurve (AUC) for en enkelt -kriterieobservatør. Dette indeks udvides til generelle dimensioner som Mahalanobis -afstanden ved hjælp af den samlede kovarians, dvs. med som den fælles sd -matrix.




![{\ displaystyle \ mathbf {S} _ {\ text {rms}} = \ venstre [\ venstre (\ mathbf {\ Sigma} _ {a}+\ mathbf {\ Sigma} _ {b} \ højre)/2 \ højre]^{\ frac {1} {2}}}](/criselda-https-wikimedia.org/api/rest_v1/media/math/render/svg/751c0effb8334352548839baaa59734cd99d3170)
Gennemsnitligt sd diskrimineringsindeks
Et andet indeks udvides til generelle dimensioner, der bruges som den fælles sd -matrix.


Sammenligning af indekserne
Det er blevet vist, at for to univariate normalfordelinger , og for multivariate normalfordelinger, stadig.


Således, og undervurdere den maksimale discriminability af univariate normalfordelinger. maksimalt kan undervurdere cirka 30%. Ved grænsen for høj forskelsbehandling for univariate normalfordelinger, konvergerer til . Disse resultater gælder ofte i højere dimensioner, men ikke altid. Simpson og Fitter blev fremmet som det bedste indeks, især for to-interval opgaver, men Das og Geisler har vist, at det er den optimale forskelsbehandling i alle tilfælde, og er ofte en bedre tilnærmelse til lukket form end , selv for to-interval opgaver.











Det omtrentlige indeks , der bruger det geometriske middel af sd'erne, er mindre end ved lille forskelsbehandling, men større ved stor forskelsbehandling.


Se også
Referencer
eksterne links