IndoWordNet - IndoWordNet

IndoWordNet è una base di conoscenza lessicale collegata di wordnet di 18 lingue programmate dell'India , vale a dire, Assamese, Bangla, Bodo, Gujarati, Hindi, Kannada, Kashmiri, Konkani, Malayalam, Meitei (Manipuri), Marathi, Nepalese, Odia, Punjabi, Sanscrito, tamil, telugu e urdu.

Dravidian WordNet è un WordNet per le lingue dravidiche.

sfondo

All'inizio degli anni '90, il wordnet per l'inglese - chiamato Princeton WordNet - è stato creato all'università di Princeton da George Miller e Christiane Fellbaum che hanno ottenuto il prestigioso Zampoli Prize nel 2006. Poi è seguito l' EuroWordNet , il conglomerato di wordnet delle lingue europee creato nel 1998. Le reti di parole sono ora risorse essenziali per l' elaborazione del linguaggio naturale , l' estrazione di informazioni , la disambiguazione del senso di parole e altri calcoli che coinvolgono il testo.

Importanza delle lingue indiane

Le lingue indiane costituiscono una componente molto significativa del panorama linguistico del mondo. Ci sono 4 flussi di tipologie linguistiche operative nel subcontinente indiano: indoeuropeo, dravidico, tibeto burmano e austro asiatico. Molte lingue si collocano tra le prime 10 al mondo in termini di popolazione che le parla, ad esempio, 5 ° hindi-urdu, 7 ° bengalese, 12 ° marathi e così via secondo l' elenco delle lingue per numero di madrelingua . La creazione di reti di parole delle lingue indiane è quindi un progetto tecnico-scientifico e linguistico molto importante.

Genesi delle reti di parole in lingua indiana

Tale progetto è infatti decollato nel 2000 con la creazione di Hindi WordNet da parte del gruppo Natural Language Processing presso il Center for Indian Language Technology (CFILT) presso il Dipartimento di Informatica e Ingegneria dell'IIT Bombay . È stato reso disponibile al pubblico nel 2006 con la licenza GNU. Hindi WordNet è stato creato con il supporto del progetto TDIL del Ministero delle comunicazioni e della tecnologia dell'informazione, India e anche parzialmente dal Ministero per lo sviluppo delle risorse umane, India.

Le reti di parole di altre lingue dell'India hanno poi seguito l'esempio. Il grande progetto a livello nazionale di costruire reti di parole in lingua indiana è stato chiamato progetto IndoWordNet. IndoWordNet è una base di conoscenza lessicale collegata di wordnet di 18 lingue programmate dell'India , vale a dire, Assamese, Bangla, Bodo, Gujarati, Hindi, Kannada, Kashmiri, Konkani, Malayalam, Meitei, Marathi, Nepalese, Oriya, Punjabi, Sanscrito, Tamil , Telugu e urdu. I wordnet vengono creati utilizzando l' approccio di espansione di Hindi WordNet. Hindi WordNet è stato creato dai primi principi (menzionati di seguito) ed è stato il primo wordnet per una lingua indiana. Il metodo adottato è stato lo stesso del Princeton WordNet per l'inglese.

WordNet polacco viene mappato a Princeton WordNet in base alla strategia seguita da IndoWordNet.

Principi di costruzione di wordnet

I wordnet seguono i principi di minimalità, copertura e sostituibilità per i synset. Ciò significa che dovrebbe esserci almeno un insieme 'core' di lessemi nel synset che fornisce in modo univoco il concetto rappresentato dal synset (minimalità), ad esempio, {casa, famiglia} sta per il concetto di 'famiglia' ("lei è da una casa nobiliare "). Quindi il synset dovrebbe coprire TUTTE le parole che rappresentano il concetto nella lingua (copertura), ad esempio, la parola 'menage' dovrà apparire nel synset 'famiglia', sebbene, verso la fine del synset, poiché il suo utilizzo è raro . Infine, le parole verso l'inizio del synset dovrebbero essere in grado di sostituirsi a vicenda in una quantità ragionevole di corpora (sostituibilità), ad esempio, 'casa' e 'famiglia' possono sostituirsi a vicenda nella frase "lei è di una casa nobile" .

Statistiche di wordnet in lingua indiana

Il numero di synset (ad agosto 2014) nelle lingue e gli istituti che creano la lingua WordNets sono i seguenti:

linguaggio Synsets Istituto
Assamese 14958 Università di Guwahati , Guwahati , Assam
bengalese 36346 Indian Statistical Institute , Calcutta , Bengala occidentale
Bodo 15785 Università di Guwahati , Guwahati , Assam
Gujarati 35599 Università Dharamsinh Desai , Nadiad , Gujarat
hindi 38607 IIT Bombay , Mumbai , Maharashtra
Kannada 20033 Mysore University , Mysore , Karnataka
Kashmir 29469 Università del Kashmir , Srinagar , Jammu e Kashmir
Konkani 32370 Università di Goa , Taleigao , Goa
Malayalam 30060 Università Amrita , Coimbatore , Tamil Nadu
Marathi 29674 IIT Bombay , Mumbai , Maharashtra
Meitei 16351 Università di Manipur , Imphal , Manipur
Nepalese 11713 Assam University , Silchar , Assam
Oriya 35284 Università centrale di Hyderabad , Hyderabad , Andhra Pradesh
Punjabi 32364 Thapar University e Punjabi University , Patiala , Punjab
sanscrito 23140 IIT Bombay , Mumbai , Maharashtra
Tamil 25431 Tamil University , Thanjavur , Tamil Nadu
Telugu 21925 Università dravidica , Kuppam , Andhra Pradesh
Urdu 34280 Università Jawaharlal Nehru , Nuova Delhi

Sommario

IndoWordNet è molto simile a EuroWordNet . Tuttavia, la lingua pivot è l'hindi che, ovviamente, è collegato all'inglese WordNet. Anche i fenomeni tipici della lingua indiana come predicati complessi e verbi causali vengono catturati in IndoWordNet.

IndoWordNet è pubblicamente sfogliabile. Gli sforzi di costruzione di wordnet in lingua indiana che formano i sottocomponenti del progetto IndoWordNet sono: il progetto North East WordNet, il progetto Dravidian WordNet e il progetto Indradhanush, tutti finanziati dal progetto TDIL.

Riferimenti

link esterno