IndoWordNet - IndoWordNet
IndoWordNet è una base di conoscenza lessicale collegata di wordnet di 18 lingue programmate dell'India , vale a dire, Assamese, Bangla, Bodo, Gujarati, Hindi, Kannada, Kashmiri, Konkani, Malayalam, Meitei (Manipuri), Marathi, Nepalese, Odia, Punjabi, Sanscrito, tamil, telugu e urdu.
Dravidian WordNet è un WordNet per le lingue dravidiche.
sfondo
All'inizio degli anni '90, il wordnet per l'inglese - chiamato Princeton WordNet - è stato creato all'università di Princeton da George Miller e Christiane Fellbaum che hanno ottenuto il prestigioso Zampoli Prize nel 2006. Poi è seguito l' EuroWordNet , il conglomerato di wordnet delle lingue europee creato nel 1998. Le reti di parole sono ora risorse essenziali per l' elaborazione del linguaggio naturale , l' estrazione di informazioni , la disambiguazione del senso di parole e altri calcoli che coinvolgono il testo.
Importanza delle lingue indiane
Le lingue indiane costituiscono una componente molto significativa del panorama linguistico del mondo. Ci sono 4 flussi di tipologie linguistiche operative nel subcontinente indiano: indoeuropeo, dravidico, tibeto burmano e austro asiatico. Molte lingue si collocano tra le prime 10 al mondo in termini di popolazione che le parla, ad esempio, 5 ° hindi-urdu, 7 ° bengalese, 12 ° marathi e così via secondo l' elenco delle lingue per numero di madrelingua . La creazione di reti di parole delle lingue indiane è quindi un progetto tecnico-scientifico e linguistico molto importante.
Genesi delle reti di parole in lingua indiana
Tale progetto è infatti decollato nel 2000 con la creazione di Hindi WordNet da parte del gruppo Natural Language Processing presso il Center for Indian Language Technology (CFILT) presso il Dipartimento di Informatica e Ingegneria dell'IIT Bombay . È stato reso disponibile al pubblico nel 2006 con la licenza GNU. Hindi WordNet è stato creato con il supporto del progetto TDIL del Ministero delle comunicazioni e della tecnologia dell'informazione, India e anche parzialmente dal Ministero per lo sviluppo delle risorse umane, India.
Le reti di parole di altre lingue dell'India hanno poi seguito l'esempio. Il grande progetto a livello nazionale di costruire reti di parole in lingua indiana è stato chiamato progetto IndoWordNet. IndoWordNet è una base di conoscenza lessicale collegata di wordnet di 18 lingue programmate dell'India , vale a dire, Assamese, Bangla, Bodo, Gujarati, Hindi, Kannada, Kashmiri, Konkani, Malayalam, Meitei, Marathi, Nepalese, Oriya, Punjabi, Sanscrito, Tamil , Telugu e urdu. I wordnet vengono creati utilizzando l' approccio di espansione di Hindi WordNet. Hindi WordNet è stato creato dai primi principi (menzionati di seguito) ed è stato il primo wordnet per una lingua indiana. Il metodo adottato è stato lo stesso del Princeton WordNet per l'inglese.
WordNet polacco viene mappato a Princeton WordNet in base alla strategia seguita da IndoWordNet.
Principi di costruzione di wordnet
I wordnet seguono i principi di minimalità, copertura e sostituibilità per i synset. Ciò significa che dovrebbe esserci almeno un insieme 'core' di lessemi nel synset che fornisce in modo univoco il concetto rappresentato dal synset (minimalità), ad esempio, {casa, famiglia} sta per il concetto di 'famiglia' ("lei è da una casa nobiliare "). Quindi il synset dovrebbe coprire TUTTE le parole che rappresentano il concetto nella lingua (copertura), ad esempio, la parola 'menage' dovrà apparire nel synset 'famiglia', sebbene, verso la fine del synset, poiché il suo utilizzo è raro . Infine, le parole verso l'inizio del synset dovrebbero essere in grado di sostituirsi a vicenda in una quantità ragionevole di corpora (sostituibilità), ad esempio, 'casa' e 'famiglia' possono sostituirsi a vicenda nella frase "lei è di una casa nobile" .
Statistiche di wordnet in lingua indiana
Il numero di synset (ad agosto 2014) nelle lingue e gli istituti che creano la lingua WordNets sono i seguenti:
Sommario
IndoWordNet è molto simile a EuroWordNet . Tuttavia, la lingua pivot è l'hindi che, ovviamente, è collegato all'inglese WordNet. Anche i fenomeni tipici della lingua indiana come predicati complessi e verbi causali vengono catturati in IndoWordNet.
IndoWordNet è pubblicamente sfogliabile. Gli sforzi di costruzione di wordnet in lingua indiana che formano i sottocomponenti del progetto IndoWordNet sono: il progetto North East WordNet, il progetto Dravidian WordNet e il progetto Indradhanush, tutti finanziati dal progetto TDIL.