IndoWordNet - IndoWordNet
IndoWordNet é uma base de conhecimento lexical vinculada de wordnets de 18 idiomas programados da Índia , viz., Assamese, Bangla, Bodo, Gujarati, Hindi, Kannada, Kashmiri, Konkani, Malayalam, Meitei (Manipuri), Marathi, Nepali, Odia, Punjabi, Sânscrito, Tamil, Telugu e Urdu.
Dravidian WordNet é um WordNet para idiomas dravidianos.
Fundo
No início dos anos 90, a wordnet para o inglês - chamada Princeton WordNet - foi criada na Universidade de Princeton por George Miller e Christiane Fellbaum, que recebeu o prestigioso Prêmio Zampoli em 2006. Depois veio a EuroWordNet - o conglomerado de redes de palavras de línguas europeias - que recebeu criado em 1998. Wordnets são agora recursos essenciais para processamento de linguagem natural , extração de informações , desambiguação de sentido de palavras e outros cálculos envolvendo texto.
Importância das línguas indianas
As línguas indianas constituem um componente muito significativo da paisagem das línguas do mundo. Existem 4 correntes de tipologia de linguagem operando no subcontinente indiano - Indo Europeu, Dravidiano, Tibeto Burman e Austro Asiático. Muitos idiomas estão entre os 10 primeiros no mundo em termos de população que os fala, por exemplo, Hindi-Urdu 5º, Bangla 7º, Marathi 12º e assim por diante, de acordo com a Lista de idiomas por número de falantes nativos . A criação de redes de palavras de línguas indianas é, portanto, um projeto técnico-científico e lingüístico muito importante.
Gênese das redes de palavras da língua indiana
Esse projeto realmente decolou em 2000 com o Hindi WordNet sendo criado pelo grupo de Processamento de Linguagem Natural no Centro de Tecnologia de Linguagem Indiana (CFILT) no Departamento de Engenharia e Ciência da Computação no IIT Bombay . Foi disponibilizado publicamente em 2006 sob a licença GNU. O Hindi WordNet foi criado com o apoio do projeto TDIL do Ministério da Comunicação e Tecnologia da Informação da Índia e também parcialmente do Ministério do Desenvolvimento de Recursos Humanos da Índia.
Os Wordnets de outras línguas da Índia seguiram o exemplo. O grande projeto nacional de construção de redes de palavras em idiomas indianos foi chamado de projeto IndoWordNet. IndoWordNet é uma base de conhecimento lexical ligada de wordnets de 18 idiomas programados da Índia , viz., Assamese, Bangla, Bodo, Gujarati, Hindi, Kannada, Kashmiri, Konkani, Malayalam, Meitei, Marathi, Nepali, Oriya, Punjabi, Sânscrito, Tamil , Telugu e Urdu. As redes de palavras estão sendo criadas usando a abordagem de expansão da Hindi WordNet. O Hindi WordNet foi criado a partir dos primeiros princípios (mencionados abaixo) e foi o primeiro wordnet para uma língua indiana. O método adotado foi o mesmo do Princeton WordNet para inglês.
O WordNet polonês está sendo mapeado para o Princeton WordNet com base na estratégia seguida pelo IndoWordNet.
Princípios de construção wordnet
As wordnets seguem os princípios de minimalidade, cobertura e substituibilidade para os synsets. Isso significa que deve haver pelo menos um conjunto 'central' de lexemas no synset que fornecem exclusivamente o conceito representado pelo synset (minimalidade), por exemplo, {casa, família} representando o conceito de 'família' ("ela é de uma casa nobre "). Em seguida, o synset deve abranger TODAS as palavras que representam o conceito no idioma (cobertura), por exemplo, a palavra 'menage' terá que aparecer no synset 'família', embora, no final do synset, uma vez que seu uso é raro . Finalmente, as palavras no início do synset devem ser capazes de substituir uma a outra em uma quantidade razoável de corpora (substituibilidade), por exemplo, 'casa' e 'família' podem substituir uma a outra na frase "ela é de uma casa nobre" .
Estatísticas de wordnets de língua indiana
O número de synsets (em agosto de 2014) nos idiomas e os institutos que criam o idioma WordNets são os seguintes:
Resumo
IndoWordNet é muito semelhante ao EuroWordNet . No entanto, o idioma principal é o hindi, que, claro, está vinculado ao WordNet em inglês. Também fenômenos típicos da língua indiana, como predicados complexos e verbos causais, são capturados no IndoWordNet.
IndoWordNet é publicamente navegável. Os esforços de construção de wordnet em língua indiana que formam os subcomponentes do projeto IndoWordNet são: projeto North East WordNet, Projeto Dravidian WordNet e projeto Indradhanush, todos financiados pelo projeto TDIL.