F-skóre - F-score

Image
Přesnost a odvolání

Ve statistické analýze binární klasifikace je F-skóre nebo F-míra měřítkem přesnosti testu . Vypočítává se z přesnosti a odvolání testu, kde přesnost je počet skutečně pozitivních výsledků děleno počtem všech pozitivních výsledků, včetně těch, které nebyly správně identifikovány, a vyvolání je počet skutečných pozitivních výsledků děleno počet všech vzorků, které měly být identifikovány jako pozitivní. Přesnost je také známá jako pozitivní prediktivní hodnota a odvolání je také známé jako citlivost v diagnostické binární klasifikaci.

F 1 skóre je harmonický průměr o přesnost a úplnost. Obecnější skóre aplikuje další váhy, hodnotí jedno z přesnosti nebo si pamatují více než druhé.

Nejvyšší možná hodnota F-skóre je 1,0, což naznačuje dokonalou přesnost a vyvolání, a nejnižší možná hodnota je 0, pokud je přesnost nebo vyvolání nulové. Skóre F 1 je také známé jako koeficient Sørensen – Dice nebo koeficient podobnosti kostek (DSC).

Etymologie

Předpokládá se, že název F-measure je pojmenován po jiné funkci F v knize Van Rijsbergena, když byl představen na konferenci o porozumění čtvrté zprávě (MUC-4, 1992).

Definice

Tradiční F-opatření nebo dáno F-skóre ( F 1 skóre ) je harmonická střední přesnosti a stažení:

.

Obecnější skóre F , které používá pozitivní reálný faktor β, kde β je zvoleno tak, že vyvolání je považováno za β krát stejně důležité jako přesnost, je:

.

Pokud jde o chyby typu I a typu II, stane se toto:

.

Dvě běžně používané hodnoty pro β jsou 2, což váží vyvolání vyšší než přesnost, a 0,5, které váží vyvolání nižší než přesnost.

F-míra byla odvozena tak, že „měří efektivitu vyhledávání s ohledem na uživatele, který připisuje β krát větší důležitost k vyvolání jako přesnost“. Je založen na měřítku účinnosti Van Rijsbergena

.

Jejich vztah je kde .

Diagnostické testování

To souvisí s oblastí binární klasifikace, kde se odvolání často nazývá „citlivost“.

Předpokládaný stav Zdroje:
Celková populace = P + N Předpokládaný stav
pozitivní (PP)
Předpovídaná podmínka
negativní (PN)
Informovanost, informovanost bookmakera (BM) = TPR + TNR - 1 Prahová hodnota prevalence (PT) = TPR · FPR  - FPR/TPR - FPR
Aktuální stav
Skutečný stav
pozitivní (P)
True positive (TP) ,
hit
Falešně negativní (FN) , chyba typu II ,
chybět, podcenění
Skutečná kladná rychlost (TPR), vyvolání , citlivost (SEN), pravděpodobnost detekce, rychlost zásahu, síla =TP/P = 1 - FNR Falešná záporná sazba (FNR), míra chyb =FN/P = 1 - TPR
Skutečný stav
negativní (N)
Falešně pozitivní (FP) , chyba typu I ,
falešný poplach, nadhodnocení
Pravda záporná (TN) ,
správné odmítnutí
Falešná kladná sazba (FPR), pravděpodobnost falešného poplachu, výpadek =FP/N = 1 - TNR Skutečná záporná míra (TNR), specificita (SPC), selektivita =TN/N = 1 - FPR
Prevalence =P/P + N Pozitivní prediktivní hodnota (PPV), přesnost =TP/PP = 1 - FDR Míra chybného opomenutí (FOR) =FN/PN = 1 - NPV Poměr pozitivní pravděpodobnosti (LR +) =TPR/FPR Poměr záporné pravděpodobnosti (LR−) =FNR/TNR
Přesnost (ACC) =TP + TN/P + N Falešná míra objevení (FDR) =FP/PP = 1 - PPV Negativní prediktivní hodnota (NPV) =TN/PN = 1 - PRO Označení (MK), deltaP (Δp) = PPV + NPV - 1 Poměr diagnostických šancí (DOR) =LR +/LR−
Vyvážená přesnost (BA) =TPR + TNR/2 F 1 skóre =2 · PPV · TPR/PPV + TPR = 2TP/2TP + FP + FN Fowlkes – Index slézů (FM) = PPV · TPR Matthewsův korelační koeficient (MCC) =
TPR · TNR · PPV · NPV - FNR · FPR · FOR · FDR
Skóre ohrožení (TS), kritický index úspěchu (CSI) =TP/TP + FN + FP
Image
Normalizovaný střední harmonický graf, kde x je přesnost, y je vyvolána a svislá osa je skóre F 1 , v procentních bodech

Závislost F-skóre na nevyváženosti třídy

Williams ukázal explicitní závislost křivky precizního vyvolání, a tedy skóre, na poměru pozitivních a negativních testovacích případů. To znamená, že srovnání F-skóre mezi různými problémy s různými poměry tříd je problematické. Jedním ze způsobů, jak tento problém vyřešit (viz např. Siblini et al, 2020), je při takovém srovnání použít standardní poměr tříd .

Aplikace

F-skóre se často používá v oblasti vyhledávání informací pro měření výkonu vyhledávání , klasifikace dokumentů a klasifikace dotazů . Dřívější práce se zaměřovaly především na skóre F 1 , ale s rozšířením rozsáhlých vyhledávačů se výkonnostní cíle změnily tak, aby kladly větší důraz buď na přesnost, nebo na odvolání, což je vidět v široké aplikaci.

F-skóre se také používá ve strojovém učení . F-opatření však nezohledňují skutečná negativa, proto mohou být pro hodnocení výkonu binárního klasifikátoru preferována opatření jako Matthewsův korelační koeficient , informovanost nebo Cohenova kappa .

F-skóre bylo široce používáno v literatuře pro zpracování přirozeného jazyka, například při hodnocení rozpoznávání pojmenovaných entit a segmentaci slov .

Kritika

David Hand a další kritizují rozšířené používání skóre F 1, protože dává stejnou důležitost přesnosti a odvolání. V praxi způsobují různé typy nesprávné klasifikace různé náklady. Jinými slovy, relativní důležitost přesnosti a odvolání je aspektem problému.

Podle Davide Chicca a Giuseppe Jurmana je skóre F 1 méně pravdivé a informativní než Matthewsův korelační koeficient (MCC) v klasifikaci binárního hodnocení.

David Powers poukázal na to, že F 1 ignoruje Pravé negativy, a je tedy zavádějící pro nevyvážené třídy, zatímco kappa a korelační míry jsou symetrické a hodnotí oba směry předvídatelnosti - klasifikátor předpovídající pravou třídu a skutečná třída předpovídající předpovědi klasifikátoru, navrhuje samostatná multiklasová opatření Informovanost a Značnost pro oba směry s tím, že jejich geometrický průměr je korelace.

Rozdíl od indexu Fowlkes – Mallows

Zatímco F-míra je harmonickým průměrem odvolání a přesnosti, Fowlkes-Mallowův index je jejich geometrickým průměrem .

Rozšíření klasifikace více tříd

F-skóre se také používá k hodnocení klasifikačních problémů s více než dvěma třídami ( klasifikace více tříd ). V tomto nastavení je konečné skóre získáno mikroprůměrováním (ovlivněno frekvencí třídy) nebo makroprůměrováním (přičemž všechny třídy jsou stejně důležité). Pro makroprůměrování uchazeči použili dva různé vzorce: F-skóre (aritmetické) třídní přesnosti a vyvolávacího prostředku nebo aritmetický průměr třídních F-skóre, kde druhý vykazuje žádoucí vlastnosti.

Viz také

Reference