F-skóre - F-score
Ve statistické analýze binární klasifikace je F-skóre nebo F-míra měřítkem přesnosti testu . Vypočítává se z přesnosti a odvolání testu, kde přesnost je počet skutečně pozitivních výsledků děleno počtem všech pozitivních výsledků, včetně těch, které nebyly správně identifikovány, a vyvolání je počet skutečných pozitivních výsledků děleno počet všech vzorků, které měly být identifikovány jako pozitivní. Přesnost je také známá jako pozitivní prediktivní hodnota a odvolání je také známé jako citlivost v diagnostické binární klasifikaci.
F 1 skóre je harmonický průměr o přesnost a úplnost. Obecnější skóre aplikuje další váhy, hodnotí jedno z přesnosti nebo si pamatují více než druhé.
Nejvyšší možná hodnota F-skóre je 1,0, což naznačuje dokonalou přesnost a vyvolání, a nejnižší možná hodnota je 0, pokud je přesnost nebo vyvolání nulové. Skóre F 1 je také známé jako koeficient Sørensen – Dice nebo koeficient podobnosti kostek (DSC).
Etymologie
Předpokládá se, že název F-measure je pojmenován po jiné funkci F v knize Van Rijsbergena, když byl představen na konferenci o porozumění čtvrté zprávě (MUC-4, 1992).
Definice
Tradiční F-opatření nebo dáno F-skóre ( F 1 skóre ) je harmonická střední přesnosti a stažení:
- .
Obecnější skóre F , které používá pozitivní reálný faktor β, kde β je zvoleno tak, že vyvolání je považováno za β krát stejně důležité jako přesnost, je:
- .
Pokud jde o chyby typu I a typu II, stane se toto:
- .
Dvě běžně používané hodnoty pro β jsou 2, což váží vyvolání vyšší než přesnost, a 0,5, které váží vyvolání nižší než přesnost.
F-míra byla odvozena tak, že „měří efektivitu vyhledávání s ohledem na uživatele, který připisuje β krát větší důležitost k vyvolání jako přesnost“. Je založen na měřítku účinnosti Van Rijsbergena
- .
Jejich vztah je kde .
Diagnostické testování
To souvisí s oblastí binární klasifikace, kde se odvolání často nazývá „citlivost“.
| Předpokládaný stav | Zdroje: | |||||
| Celková populace = P + N | Předpokládaný stav pozitivní (PP) |
Předpovídaná podmínka negativní (PN) |
Informovanost, informovanost bookmakera (BM) = TPR + TNR - 1 | Prahová hodnota prevalence (PT) = √ TPR · FPR - FPR/TPR - FPR | ||
| Skutečný stav pozitivní (P) |
True positive (TP) , hit |
Falešně negativní (FN) , chyba typu II , chybět, podcenění |
Skutečná kladná rychlost (TPR), vyvolání , citlivost (SEN), pravděpodobnost detekce, rychlost zásahu, síla =TP/P = 1 - FNR | Falešná záporná sazba (FNR), míra chyb =FN/P = 1 - TPR | ||
| Skutečný stav negativní (N) |
Falešně pozitivní (FP) , chyba typu I , falešný poplach, nadhodnocení |
Pravda záporná (TN) , správné odmítnutí |
Falešná kladná sazba (FPR), pravděpodobnost falešného poplachu, výpadek =FP/N = 1 - TNR | Skutečná záporná míra (TNR), specificita (SPC), selektivita =TN/N = 1 - FPR | ||
| Prevalence =P/P + N | Pozitivní prediktivní hodnota (PPV), přesnost =TP/PP = 1 - FDR | Míra chybného opomenutí (FOR) =FN/PN = 1 - NPV | Poměr pozitivní pravděpodobnosti (LR +) =TPR/FPR | Poměr záporné pravděpodobnosti (LR−) =FNR/TNR | ||
| Přesnost (ACC) =TP + TN/P + N | Falešná míra objevení (FDR) =FP/PP = 1 - PPV | Negativní prediktivní hodnota (NPV) =TN/PN = 1 - PRO | Označení (MK), deltaP (Δp) = PPV + NPV - 1 | Poměr diagnostických šancí (DOR) =LR +/LR− | ||
| Vyvážená přesnost (BA) =TPR + TNR/2 | F 1 skóre =2 · PPV · TPR/PPV + TPR = 2TP/2TP + FP + FN | Fowlkes – Index slézů (FM) = √ PPV · TPR |
Matthewsův korelační koeficient (MCC) = √ TPR · TNR · PPV · NPV - √ FNR · FPR · FOR · FDR |
Skóre ohrožení (TS), kritický index úspěchu (CSI) =TP/TP + FN + FP | ||
Závislost F-skóre na nevyváženosti třídy
Williams ukázal explicitní závislost křivky precizního vyvolání, a tedy skóre, na poměru pozitivních a negativních testovacích případů. To znamená, že srovnání F-skóre mezi různými problémy s různými poměry tříd je problematické. Jedním ze způsobů, jak tento problém vyřešit (viz např. Siblini et al, 2020), je při takovém srovnání použít standardní poměr tříd .
Aplikace
F-skóre se často používá v oblasti vyhledávání informací pro měření výkonu vyhledávání , klasifikace dokumentů a klasifikace dotazů . Dřívější práce se zaměřovaly především na skóre F 1 , ale s rozšířením rozsáhlých vyhledávačů se výkonnostní cíle změnily tak, aby kladly větší důraz buď na přesnost, nebo na odvolání, což je vidět v široké aplikaci.
F-skóre se také používá ve strojovém učení . F-opatření však nezohledňují skutečná negativa, proto mohou být pro hodnocení výkonu binárního klasifikátoru preferována opatření jako Matthewsův korelační koeficient , informovanost nebo Cohenova kappa .
F-skóre bylo široce používáno v literatuře pro zpracování přirozeného jazyka, například při hodnocení rozpoznávání pojmenovaných entit a segmentaci slov .
Kritika
David Hand a další kritizují rozšířené používání skóre F 1, protože dává stejnou důležitost přesnosti a odvolání. V praxi způsobují různé typy nesprávné klasifikace různé náklady. Jinými slovy, relativní důležitost přesnosti a odvolání je aspektem problému.
Podle Davide Chicca a Giuseppe Jurmana je skóre F 1 méně pravdivé a informativní než Matthewsův korelační koeficient (MCC) v klasifikaci binárního hodnocení.
David Powers poukázal na to, že F 1 ignoruje Pravé negativy, a je tedy zavádějící pro nevyvážené třídy, zatímco kappa a korelační míry jsou symetrické a hodnotí oba směry předvídatelnosti - klasifikátor předpovídající pravou třídu a skutečná třída předpovídající předpovědi klasifikátoru, navrhuje samostatná multiklasová opatření Informovanost a Značnost pro oba směry s tím, že jejich geometrický průměr je korelace.
Rozdíl od indexu Fowlkes – Mallows
Zatímco F-míra je harmonickým průměrem odvolání a přesnosti, Fowlkes-Mallowův index je jejich geometrickým průměrem .
Rozšíření klasifikace více tříd
F-skóre se také používá k hodnocení klasifikačních problémů s více než dvěma třídami ( klasifikace více tříd ). V tomto nastavení je konečné skóre získáno mikroprůměrováním (ovlivněno frekvencí třídy) nebo makroprůměrováním (přičemž všechny třídy jsou stejně důležité). Pro makroprůměrování uchazeči použili dva různé vzorce: F-skóre (aritmetické) třídní přesnosti a vyvolávacího prostředku nebo aritmetický průměr třídních F-skóre, kde druhý vykazuje žádoucí vlastnosti.
Viz také
- BLEU
- Matice zmatku
- Testy hypotéz na přesnost
- METEOR
- NIST (metrické)
- Provozní charakteristika přijímače
- ROUGE (metrický)
- Koeficient nejistoty , aka Znalost
- Míra chyb slov
- LEPOR