Manglende data - Missing data
I statistikken , manglende data eller manglende værdier , opstår, når der ikke data værdi er gemt for variablen i en observation . Manglende data er en almindelig forekomst og kan have en betydelig effekt på de konklusioner, der kan drages af dataene.
Manglende data kan forekomme på grund af manglende svar: Der gives ikke oplysninger om et eller flere emner eller for en hel enhed ("emne"). Nogle poster genererer mere tilbagemelding end andre: for eksempel emner om private emner som f.eks. Indkomst. Slid er en form for mangel, der kan forekomme i langsgående undersøgelser - for eksempel at studere udvikling, hvor en måling gentages efter et bestemt tidsrum. Manglende opstår, når deltagerne falder ud, inden testen slutter, og en eller flere målinger mangler.
Data mangler ofte i forskning inden for økonomi , sociologi og statsvidenskab, fordi regeringer eller private enheder vælger ikke at eller ikke rapporterer kritisk statistik, eller fordi oplysningerne ikke er tilgængelige. Nogle gange skyldes forskeren manglende værdier - for eksempel når dataindsamling foretages forkert, eller der begås fejl i dataindtastning.
Disse former for mangel er forskellige typer med forskellige indvirkninger på validiteten af konklusioner fra forskning: Mangler helt tilfældigt, mangler tilfældigt og mangler ikke tilfældigt. Manglende data kan håndteres på samme måde som censurerede data .
Typer
Det er vigtigt at forstå årsagerne til, at data mangler, for at håndtere de resterende data korrekt. Hvis værdier mangler helt tilfældigt, er dataprøven sandsynligvis stadig repræsentativ for befolkningen. Men hvis værdierne systematisk mangler, kan analysen være forudindtaget. For eksempel i en undersøgelse af forholdet mellem IQ og indkomst, hvis deltagere med en IQ over gennemsnittet har en tendens til at springe over spørgsmålet 'Hvad er din løn?', Analyserer analyser, der ikke tager højde for dette tilfældigt (MAR-mønster ( se nedenfor)) kan fejlagtigt undlade at finde en positiv sammenhæng mellem IQ og løn. På grund af disse problemer råder metodologer rutinemæssigt forskere til at designe undersøgelser for at minimere forekomsten af manglende værdier. Grafiske modeller kan bruges til at beskrive den manglende datamekanisme i detaljer.
Mangler helt tilfældigt
Værdier i et datasæt mangler helt tilfældigt (MCAR), hvis de hændelser, der fører til, at et bestemt dataelement mangler, er uafhængige af både observerbare variabler og ikke-observerbare parametre af interesse og forekommer helt tilfældigt. Når data er MCAR, er analysen udført på dataene upartiske; data er dog sjældent MCAR.
I tilfælde af MCAR er manglen på data ikke relateret til nogen undersøgelsesvariabel: deltagerne med fuldstændigt observerede data er således i virkeligheden en tilfældig stikprøve af alle deltagerne, der er tildelt en bestemt intervention. Med MCAR antages tilfældig tildeling af behandlinger at blive bevaret, men det er normalt en urealistisk stærk antagelse i praksis.
Mangler tilfældigt
Tilfældigt savnet (MAR) opstår, når manglen ikke er tilfældig, men hvor manglen fuldt ud kan redegøres for variabler, hvor der er fuldstændig information. Da MAR er en antagelse, der er umulig at verificere statistisk, må vi stole på dens materielle rimelighed. Et eksempel er, at mænd er mindre tilbøjelige til at udfylde en undersøgelsesundersøgelse, men dette har intet at gøre med deres depression, efter at have taget højde for mandlighed. Afhængigt af analysemetoden kan disse data stadig fremkalde parameter bias i analyser på grund af kontingent tomhed i celler (mandlig, meget høj depression kan have nul poster). Men hvis parameteren estimeres med fuld information maksimal sandsynlighed, vil MAR give asymptotisk upartiske estimater.
Mangler ikke tilfældigt
Mangler ikke tilfældigt (MNAR) (også kendt som nonignorable nonresponse) er data, der hverken er MAR eller MCAR (dvs. værdien af den variabel, der mangler, er relateret til årsagen til, at den mangler). For at udvide det foregående eksempel ville dette ske, hvis mænd ikke kunne udfylde en undersøgelsesundersøgelse på grund af deres depression.
Teknikker til håndtering af manglende data
Manglende data reducerer stikprøvens repræsentativitet og kan derfor fordreje slutninger om befolkningen. Generelt er der tre hovedmetoder til håndtering af manglende data: (1) Imputation - hvor værdier udfyldes i stedet for manglende data, (2) udeladelse - hvor prøver med ugyldige data kasseres fra yderligere analyse og (3) analyse - ved direkte at anvende metoder, der ikke påvirkes af de manglende værdier. En systematisk gennemgang vedrørende forebyggelse og håndtering af manglende data til patientcentreret resultatforskning identificerede 10 standarder som nødvendige for forebyggelse og håndtering af manglende data. Disse inkluderer standarder for undersøgelsesdesign, undersøgelsesadfærd, analyse og rapportering.
I en eller anden praktisk anvendelse kan eksperimenterne kontrollere niveauet af mangel og forhindre manglende værdier, før de indsamler dataene. For eksempel i computer spørgeskemaer er det ofte ikke muligt at springe et spørgsmål over. Et spørgsmål skal besvares, ellers kan man ikke fortsætte til det næste. Så manglende værdier på grund af deltageren elimineres ved denne form for spørgeskema, selvom denne metode muligvis ikke er tilladt af et etisk udvalg, der fører tilsyn med forskningen. I undersøgelsesundersøgelser er det almindeligt at gøre flere bestræbelser på at kontakte hver enkelt i prøven og ofte sende breve for at forsøge at overtale dem, der har besluttet ikke at deltage i at ændre mening. Sådanne teknikker kan imidlertid enten hjælpe eller gøre ondt med hensyn til at reducere de negative inferentielle virkninger af manglende data, fordi den slags mennesker, der er villige til at blive overtalt til at deltage efter i første omgang at nægte eller ikke var hjemme, sandsynligvis vil være væsentligt forskellige fra slagsen af mennesker, der stadig vil nægte eller forblive utilgængelige efter yderligere indsats.
I situationer, hvor der sandsynligvis vil forekomme manglende værdier, rådes forskeren ofte til at planlægge at bruge metoder til dataanalysemetoder, der er robuste over for mangler. En analyse er robust, når vi er overbeviste om, at milde til moderate krænkelser af teknikkens vigtigste antagelser vil give lidt eller ingen skævhed eller forvrængning i konklusionerne om befolkningen.
Imputation
Nogle dataanalyseteknikker er ikke robuste over for mangel og kræver at "udfylde" eller tilregne de manglende data. Rubin (1987) argumenterede for, at gentagelse af imputation selv et par gange (5 eller mindre) forbedrer estimeringens kvalitet enormt. For mange praktiske formål fanger 2 eller 3 imputationer det meste af den relative effektivitet, der kunne fanges med et større antal imputationer. Imidlertid kan et for lille antal tilregninger føre til et betydeligt tab af statistisk magt , og nogle forskere anbefaler nu 20 til 100 eller mere. Enhver multipliceret tilregnet dataanalyse skal gentages for hvert af de tilregnede datasæt, og i nogle tilfælde skal den relevante statistik kombineres på en relativt kompliceret måde.
Den forventning-maksimering algoritme er en tilgang, hvor værdierne af de statistikker, som ville blive beregnet, hvis en komplet datasæt var tilgængelige anslås (imputeret), under hensyntagen til mønstret i manglende data. I denne fremgangsmåde beregnes normalt ikke værdier for individuelle manglende dataelementer.
Interpolation
I det matematiske felt for numerisk analyse er interpolation en metode til at konstruere nye datapunkter inden for området af et diskret sæt kendte datapunkter.
I sammenligningen af to parrede prøver med manglende data er en teststatistik, der bruger alle tilgængelige data uden behov for imputation, den delvis overlappende prøve t-test. Dette er gyldigt under normalitet og under forudsætning af MCAR
Delvis sletning
Metoder, der involverer at reducere de data, der er tilgængelige for et datasæt, der ikke mangler værdier, omfatter:
- Sletning på sigt /sletning i sagen
- Sletning parvis
Fuld analyse
Metoder, der fuldt ud tager højde for alle tilgængelige oplysninger, uden at forvrængningen skyldes brug af tilregnede værdier, som om de faktisk blev observeret:
- Generative tilgange:
- Den forventning-maksimering algoritme
- fuldstændige oplysninger maksimal sandsynlighed estimering
- Diskriminerende tilgange:
- Max-margin klassificering af data med fraværende funktioner
Delvis identifikationsmetoder kan også anvendes.
Modelbaserede teknikker
Modelbaserede teknikker, der ofte bruger grafer, tilbyder yderligere værktøjer til test af manglende datatyper (MCAR, MAR, MNAR) og til estimering af parametre under manglende dataforhold. For eksempel lyder en test for at tilbagevise MAR/MCAR som følger:
For alle tre variable X, Y , og Z , hvor Z er fuldt observerede og X og Y delvist observeret, bør dataene opfylder: .
Med ord, den observerede del af X skal være uafhængig af missingness status Y, betinget af hver værdi af Z . Manglende opfyldelse af denne betingelse indikerer, at problemet tilhører MNAR -kategorien.
(Bemærk: Disse tests er nødvendige for variabelbaseret MAR, som er en lille variation af hændelsesbaseret MAR.)
Når data falder ind i MNAR -kategori, er teknikker tilgængelige til konsekvent at estimere parametre, når visse betingelser holder i modellen. For eksempel, hvis Y forklarer årsagen til mangel i X og Y selv har manglende værdier, kan den fælles sandsynlighedsfordeling af X og Y stadig estimeres, hvis manglen på Y er tilfældig. Estimatet i dette tilfælde vil være:
hvor og betegne de observerede dele af deres respektive variabler.
Forskellige modelstrukturer kan give forskellige estimater og forskellige estimeringsprocedurer, når konsistent estimering er mulig. De foregående estimand opfordrer til første estimere fra komplette data og multiplicere det med estimeret ud fra tilfælde, hvor Y observeres uanset status for X . For at opnå et konsistent skøn er det desuden afgørende, at det første udtryk er i modsætning til .
I mange tilfælde gør modelbaserede teknikker det muligt for modelstrukturen at gennemgå modbevisningstest. Enhver model, som indebærer uafhængighed mellem en delvist observeret variabel X og missingness indikator for en anden variabel Y (dvs. ), betinget af, kan indsendes til følgende gendrivelse test: .
Endelig er de estimater, der stammer fra disse teknikker, afledt i lukket form og kræver ikke iterative procedurer, f.eks. Forventningsmaksimering, der er modtagelige for lokale optima.
En særlig klasse problemer opstår, når sandsynligheden for manglen afhænger af tid. For eksempel afhænger traumedatabaserne sandsynligheden for at miste data om traumeudfaldet på dagen efter traumer. I disse tilfælde anvendes forskellige ikke-stationære Markov - kædemodeller .
Se også
Referencer
Yderligere læsning
- Acock AC (2005), "Working with missing values" , Journal of Marriage and Family , 67 (4): 1012–28, doi : 10.1111/j.1741-3737.2005.00191.x , arkiveret fra originalen 2013-01 -05
- Allison, Paul D. (2001), Missing Data , SAGE Publishing
- Bouza-Herrera, Carlos N. (2013), Håndtering af manglende data i rangeret sætprøveudtagning , Springer
- Enders, Craig K. (2010), Applied Missing Data Analysis , Guilford Press
- Graham, John W. (2012), Missing Data , Springer
- Molenberghs, Geert; Fitzmaurice, Garrett; Kenward, Michael G .; Tsiatis, Anastasios; Verbeke, Geert, red. (2015), Handbook of Missing Data Methodology , Chapman & Hall
- Raghunathan, Trivellore (2016), Manglende dataanalyse i praksis , Chapman & Hall
- Lille, Roderick JA; Rubin, Donald B. (2002), Statistical Analysis with Missing Data (2. udgave), Wiley
- Tsiatis, Anastasios A. (2006), Semiparametrisk teori og manglende data , Springer
- Van den Broeck J, Cunningham SA, Eeckels R, Herbst K (2005), "Datarensning: opdagelse, diagnosticering og redigering af dataabnormiteter ", PLOS Medicine , 2 (10): e267, doi : 10.1371/journal.pmed.0020267 , PMC 1198040 , PMID 16138788 , S2CID 5667073
- Zarate LE, Nogueira BM, Santos TR, Song MA (2006). "Teknikker til gendannelse af manglende værdi i ubalancerede databaser: Ansøgning i en marketingdatabase med massivt manglende data". IEEE International Conference on Systems, Man and Cybernetics, 2006. SMC '06 . 3 . s. 2658–2664. doi : 10.1109/ICSMC.2006.385265 .
eksterne links
Baggrund
- Mangler værdier-forestilling
- psychwiki.com: Manglende værdier , identifikation af manglende værdier og håndtering af manglende værdier
- missingdata.org.uk , Institut for Medicinsk Statistik, London School of Hygiene & Tropical Medicine
- Rumlig og tidsmæssig trendanalyse af nedbørsrekorder på lang sigt i datafattige opland med manglende data, et casestudie af Lower Shire-flodsletten i Malawi for perioden 1953–2010. https://www.hydrol-earth-syst-sci-discuss.net/hess-2017-601/hess-2017-601.pdf
- R-miss-tastic , En samlet platform for metoder og arbejdsgange, der mangler værdier.