Sampling af omvendt transformation - Inverse transform sampling
Inverse transform-sampling (også kendt som inversion-sampling , den inverse sandsynlighedsintegrale transformation , den inverse transformationsmetode , Smirnov- transformation eller den gyldne regel ) er en grundlæggende metode til stikprøve af pseudo-tilfældigt tal , dvs. til generering af stikprøvenumre tilfældigt fra enhver sandsynlighedsfordeling givet dens kumulative fordelingsfunktion .
Inverse transformation sampling tager ensartede prøver af et tal mellem 0 og 1, fortolket som en sandsynlighed, og returnerer derefter det største antal fra fordelingsdomænet, således at . For eksempel forestille sig, at er standard normal fordeling med middelværdi nul og standardafvigelse én. Nedenstående tabel viser prøver taget fra den ensartede fordeling og deres repræsentation på den normale normalfordeling.
| .5 | 0 |
| .975 | 1.95996 |
| .995 | 2,5758 |
| .999999 | 4,75342 |
| 1-2 -52 | 8.12589 |
Vi vælger tilfældigt en andel af arealet under kurven og returnerer nummeret i domænet, så nøjagtigt denne andel af området forekommer til venstre for dette nummer. Intuitivt er det usandsynligt, at vi vælger et tal i den fjerne ende af halerne, fordi der er meget lille område i dem, der kræver valg af et tal meget tæt på nul eller et.
Beregningsmæssigt involverer denne metode beregning af den kvantile funktion af fordelingen - med andre ord, beregning af den kumulative fordelingsfunktion (CDF) af fordelingen (som kortlægger et tal i domænet med en sandsynlighed mellem 0 og 1) og derefter inverterer denne funktion. Dette er kilden til udtrykket "invers" eller "inversion" i de fleste navne til denne metode. Bemærk, at for en diskret distribution er beregning af CDF generelt ikke for vanskelig: vi tilføjer simpelthen de individuelle sandsynligheder for de forskellige punkter i fordelingen. For en kontinuerlig distribution er vi dog nødt til at integrere distributionens sandsynlighedsdensitetsfunktion (PDF), hvilket er umuligt at foretage analytisk for de fleste distributioner (inklusive normalfordelingen ). Som et resultat kan denne metode være beregningsmæssigt ineffektiv for mange distributioner, og andre metoder foretrækkes; det er imidlertid en nyttig metode til at opbygge mere generelt anvendelige prøveudtagere, såsom dem, der er baseret på afvisningssampling .
For normalfordelingen betyder manglen på et analytisk udtryk for den tilsvarende kvantile funktion, at andre metoder (f.eks. Box – Muller-transformationen ) kan foretrækkes beregningsmæssigt. Det er ofte tilfældet, at selv for enkle distributioner kan den omvendte transformationssamplingsmetode forbedres på: se for eksempel ziggurat-algoritmen og afvisningssampling . På den anden side er det muligt at tilnærme den kvantile funktion af normalfordelingen ekstremt nøjagtigt ved hjælp af polynomier med moderat grad, og faktisk er metoden til at gøre dette hurtig nok til, at inversionssampling nu er standardmetoden til sampling fra en normalfordeling i den statistiske pakke R .
Definition
Den sandsynlighed integraltransformation bestemmer, at hvis en kontinuerlig tilfældig variabel med kumulative fordelingsfunktion , så den stokastiske variabel har en ensartet fordeling på [0, 1]. Den inverse sandsynlighedsintegrale transformation er bare den inverse af dette: specifikt hvis har en ensartet fordeling på [0, 1] og hvis har en kumulativ fordeling , så har den tilfældige variabel den samme fordeling som .
Intuition
Fra , vi ønsker at generere med CDF Vi antager at være en strengt stigende funktion, som giver god intuition.
Vi vil se, om vi kan finde en streng monoton transformation , sådan at . Vi vil have
hvor det sidste trin bruges, hvornår er ensartet .
Så vi må være den omvendte funktion af eller ækvivalent
Derfor kan vi generere fra
Metoden
Problemet, som den omvendte transformationssamplingsmetode løser, er som følger:
- Lad være en tilfældig variabel, hvis fordeling kan beskrives af den kumulative fordelingsfunktion .
- Vi ønsker at generere værdier, som fordeles i henhold til denne fordeling.
Den inverse transform-prøvetagningsmetode fungerer som følger:
- Generer et tilfældigt tal ud fra den standard ensartede fordeling i intervallet , f.eks. Fra
- Find det omvendte af den ønskede CDF, f.eks .
- Beregn . Den beregnede tilfældige variabel har fordeling .
Udtrykt forskelligt, givet en kontinuerlig ensartet variabel i og en inverterbar kumulativ fordelingsfunktion , har den tilfældige variabel fordeling (eller er fordelt ).
En behandling af sådanne inverse funktioner som objekter, der opfylder differentialligninger, kan gives. Nogle sådanne differentialligninger tillader eksplicitte power series-løsninger på trods af deres ikke-linearitet.
Eksempler
- Antag som et eksempel, at vi har en tilfældig variabel og en kumulativ fordelingsfunktion
- For at udføre en inversion, vi ønsker at løse for
- Herfra ville vi udføre trin et, to og tre.
- Som et andet eksempel bruger vi den eksponentielle fordeling med for x ≥ 0 (og ellers 0). Ved at løse y = F (x) opnår vi den inverse funktion
- Det betyder, at hvis vi trækker nogle fra a og beregner, har dette eksponentiel fordeling.
- Ideen er illustreret i følgende graf:
Tilfældige tal y i genereres fra en ensartet fordeling mellem 0 og 1, dvs. Y ~ U (0, 1). De er tegnet som farvede punkter på y-aksen. Hver af punkterne kortlægges i henhold til x = F −1 (y), som er vist med grå pile for to eksempler. I dette eksempel har vi brugt en eksponentiel fordeling. Derfor er sandsynlighedstætheden for x ≥ 0, og den kumulative fordelingsfunktion er . Derfor . Vi kan se, at ved hjælp af denne metode ender mange punkter tæt på 0, og kun få punkter ender med høje x-værdier - ligesom det forventes for en eksponentiel fordeling.- Bemærk, at fordelingen ikke ændres, hvis vi starter med 1-y i stedet for y. Til beregningsformål er det derfor tilstrækkeligt at generere tilfældige tal y i [0, 1] og derefter blot beregne
Bevis for rigtighed
Lad F være en kontinuerlig kumulativ fordelingsfunktion , og lad F -1 være dens inverse funktion (ved hjælp af infimumet, fordi CDF'er er svagt monotone og højre-kontinuerlige ):
Krav: Hvis U er en ensartet tilfældig variabel på (0, 1), har F som CDF.
Bevis:
Afkortet fordeling
Inverse transform-sampling kan simpelthen udvides til tilfælde af trunkerede distributioner i intervallet uden omkostningerne ved afvisningssampling: den samme algoritme kan følges, men i stedet for at generere et tilfældigt tal jævnt fordelt mellem 0 og 1, generere ensartet fordelt mellem og , og så tag igen .
Reduktion af antallet af inversioner
For at opnå et stort antal prøver skal man udføre det samme antal inversioner af fordelingen. En mulig måde at reducere antallet af inversioner, mens der opnås et stort antal prøver, er anvendelsen af den såkaldte Stochastic Collocation Monte Carlo sampler (SCMC sampler) inden for en polynomisk kaosudvidelsesramme . Dette giver os mulighed for at generere et vilkårligt antal Monte Carlo-prøver med kun et par inversioner af den oprindelige distribution med uafhængige prøver af en variabel, for hvilken inversionerne er analytisk tilgængelige, for eksempel den normale normale variabel.
Se også
- Sandsynlighed integreret transformation
- Copula , defineret ved hjælp af sandsynlighedsintegral transformation.
- Kvantilfunktion til eksplicit konstruktion af inverse CDF'er.
- Invers fordelingsfunktion til en præcis matematisk definition for distributioner med diskrete komponenter.
Referencer
- ^ Aalto University, N. Hyvönen, Computational metoder in inverse problems. Tolvte forelæsning https://noppa.tkk.fi/noppa/kurssi/mat-1.3626/luennot/Mat-1_3626_lecture12.pdf
- ^ Luc Devroye (1986). Ikke-ensartet generering af tilfældig variation (PDF) . New York: Springer-Verlag.
- ^ https://stat.ethz.ch/R-manual/R-devel/library/base/html/Random.html
- ^ Steinbrecher, G., Shaw, WT (2008). Kvantemekanik. European Journal of Applied Mathematics 19 (2): 87-112.
- ^ Luc Devroye (1986). "Afsnit 2.2. Inversion ved numerisk opløsning af F ( X ) = U " (PDF) . Ikke-ensartet generering af tilfældig variation . New York: Springer-Verlag.
- ^ LA Grzelak, JAS Witteveen, M. Suarez og CW Oosterlee. Den stokastiske samlokalisering af Monte Carlo-sampleren: Meget effektiv prøveudtagning fra "dyre" distributioner. https://ssrn.com/abstrakt=2529691
