carta topografica generativa - Generative topographic map

Mappa topografica generativa ( GTM ) è un machine learning metodo che è una controparte probabilistica della mappa auto-organizzante (SOM), è probabilmente convergenti e non richiede un restringimento quartiere o di una dimensione di fase decrescente. Si tratta di un modello generativo : i dati vengono considerati provenienti dal primo probabilisticamente selezionando un punto in uno spazio dimensionale ridotto, mappando il punto di spazio di ingresso osservato altamente dimensionale (tramite una funzione regolare), poi l'aggiunta di rumore in quello spazio. I parametri della distribuzione di probabilità a bassa dimensionalità, la mappa liscia e il rumore sono tutte apprese dai dati di training utilizzando l' aspettativa massimizzazione algoritmo (EM). GTM è stato introdotto nel 1996, in un articolo di Christopher Bishop , Markus Svensen, e Christopher Williams KI.

Dettagli dell'algoritmo

L'approccio è fortemente correlato reti densità che utilizzano campionamento importanza e un percettrone multi-strato per formare un non-lineare modello a variabili latenti . Nel GTM spazio latente è una griglia discreta di punti che si presume essere non lineare proiettato nello spazio di dati. Un rumore gaussiano assunzione viene poi fatto nello spazio dati in modo che il modello diventa vincolata miscela di gaussiane . Poi probabilità del modello può essere massimizzata da EM.

In teoria, un arbitrario lineare deformazione parametrica potrebbe essere utilizzato. I parametri ottimali possono essere trovati discesa del gradiente, etc.

L'approccio proposto per la mappatura lineare consiste nell'utilizzare una funzione di rete a base radiale (RBF) per creare una mappatura lineare tra lo spazio latente e lo spazio di dati. I nodi della rete RBF poi formano uno spazio funzione e la mappatura non lineare possono quindi essere presi come trasformazione lineare di questo spazio funzione. Questo approccio ha il vantaggio rispetto all'approccio rete densità suggerito che può essere ottimizzato analiticamente.

usi

Nell'analisi dei dati, GTMS sono come una versione non lineare di analisi delle componenti principali , che consente ai dati di alta dimensionali per essere modellati come risultante dalla gaussiana rumore aggiunto alle fonti nello spazio latente basso-dimensionale. Ad esempio, per individuare le scorte nello spazio 2D stampabili in base alle loro forme di serie temporali hi-D. Altre applicazioni potrebbero voler avere un minor numero di fonti diverse, punti di dati per i modelli ad esempio miscela.

In generativa modellazione deformante , gli spazi latenti e dati hanno le stesse dimensioni, per esempio, immagini 2D o 1 onde sonore audio. Dimensioni extra 'vuote' sono aggiunti alla sorgente (noto come 'modello' in questa forma di modellazione), ad esempio localizzare l'onda sonora 1D nello spazio 2D. Ulteriori dimensioni lineari sono poi aggiunti, prodotta combinando le dimensioni originali. Lo spazio latente ingrandita viene poi proiettato indietro nello spazio dati 1D. La probabilità di un dato proiezione è, come prima, data dal prodotto della probabilità dei dati secondo il modello rumore gaussiano previo sul parametro deformazione. A differenza dei tradizionali modellazione deformazione primavera-based, ciò ha il vantaggio di essere analiticamente ottimizzabili. Lo svantaggio è che si tratta di un approccio 'data mining', cioè la forma della deformazione prima è improbabile che sia significativo come una spiegazione delle possibili deformazioni, in quanto si basa su un altissimo, e artificial- arbitrariamente costruito latente non lineare spazio. Per questo motivo la prima si apprende dai dati piuttosto che creati da un esperto umano, come è possibile per i modelli primavera-based.

Il confronto con le mappe auto-organizzanti di Kohonen

Mentre nodi nella mappa auto-organizzante (SOM) possono andare in giro a volontà, i nodi GTM sono vincolati dalle trasformazioni ammissibili e le loro probabilità. Se le deformazioni si comportano bene-è conservata la topologia dello spazio latente.

La SOM è stato creato come un modello biologico di neuroni ed è un algoritmo euristico. Al contrario, il GTM non ha nulla a che fare con le neuroscienze e cognizione ed è un modello probabilistico di principio. Pertanto, esso ha un certo numero di vantaggi rispetto SOM, vale a dire:

  • esso formula esplicitamente un modello di densità sui dati.
  • utilizza una funzione di costo che quantifica quanto bene la mappa è addestrato.
  • utilizza una procedura di ottimizzazione del suono ( EM algoritmo).

GTM è stato introdotto dal vescovo, Svensen e Williams nella loro relazione tecnica nel 1997 (rapporto tecnico NCRG / 96/015, Università di Aston, UK) ha pubblicato più avanti in Neural Computation. E 'stato anche descritto nel dottorato di ricerca tesi di Markus Svensen (Aston, 1998).

applicazioni

Guarda anche

link esterno