WordNet - WordNet
|
Un instantaneu al definiției WordNet despre sine.
| |
| Dezvoltatori | Universitatea Princeton |
|---|---|
| Eliberarea inițială | mijlocul anilor 1980 |
| Versiune stabila | 3.1 / iunie 2011
|
| Scris in | Prolog |
| Sistem de operare | Unix, Linux, Solaris, Windows |
| mărimea | 16 MB (incluzând 155.327 de cuvinte organizate în 175.979 de seturi de sinteze pentru un total de 207.016 perechi cuvânt-sens) |
| Disponibil in | Peste 200 de limbi |
| Tip | Baza de date lexicală |
| Licență | Asemănător BSD |
| Site-ul web | wordnet |
WordNet este o bază de date lexicală a relațiilor semantice între cuvinte în mai mult de 200 de limbi. WordNet leagă cuvintele în relații semantice, inclusiv sinonime , hiponime și meronime . Sinonimele sunt grupate în synsets cu definiții scurte și exemple de utilizare. WordNet poate fi astfel văzut ca o combinație și extensie a unui dicționar și a unui tezaur . Deși este accesibil utilizatorilor umani printr-un browser web , utilizarea sa principală este în analiza automată a textului și aplicații de inteligență artificială . WordNet a fost creat pentru prima dată în limba engleză, iar baza de date și instrumentele software WordNet în limba engleză au fost lansate sub o licență în stil BSD și sunt disponibile gratuit pentru descărcare de pe site-ul web WordNet respectiv.
Istorie și membri ai echipei
WordNet a fost creat pentru prima dată în limba engleză numai în Laboratorul de Științe Cognitive al Universității Princeton sub conducerea profesorului de psihologie George Armitage Miller începând cu 1985 și a fost dirijat în ultimii ani de Christiane Fellbaum . Proiectul a fost inițial finanțat de Biroul de Cercetări Navale al SUA și mai târziu și de alte agenții guvernamentale din SUA, inclusiv DARPA , National Science Foundation , Disruptive Technology Office (fostul Advanced Research and Development Activity) și REFLEX. George Miller și Christiane Fellbaum au primit Premiul Antonio Zampolli din 2006 pentru munca lor cu WordNet.
Asociația Globală WordNet este o organizație necomercială care oferă o platformă pentru discutarea, partajarea și conectarea WordNets pentru toate limbile din lume și are Christiane Fellbaum și Piek Th.JM Vossen și în calitate de copreședinți.
Conținutul bazei de date
Baza de date conține 155 327 de cuvinte organizate în 175 979 de seturi de sinteze pentru un total de 207 016 perechi cuvânt-sens; în formă comprimată , are o dimensiune de aproximativ 12 megaocteți .
WordNet include categoriile lexicale substantive , verbe , adjective și adverbe, dar ignoră prepozițiile , determinanții și alte cuvinte funcționale.
Cuvintele din aceeași categorie lexicală care sunt aproximativ sinonime sunt grupate în synsets . Synset-urile includ cuvinte simple, precum și colocații precum „mâncați afară” și „piscină auto”. Diferitele sensuri ale unei forme de cuvinte polisemice sunt atribuite diferitelor seturi de sinteze. Semnificația unui set de sinteze este clarificată în continuare cu un luciu scurt care definește și unul sau mai multe exemple de utilizare. Un exemplu de sinteză adjectivală este:
- bun, corect, copt - (cel mai potrivit sau cel mai potrivit pentru un anumit scop; „un moment bun pentru a planta roșiile”; „momentul potrivit pentru a acționa”; „timpul este potrivit pentru mari schimbări sociologice”)
Toate synseturile sunt conectate la alte synsets prin intermediul relațiilor semantice. Aceste relații, care nu sunt toate împărtășite de toate categoriile lexicale, includ:
-
Substantive
- hipernimi : Y este un hipernim al lui X dacă fiecare X este un (fel de) Y ( caninul este un hipernim al câinelui )
- hiponime : Y este un hiponim al lui X dacă fiecare Y este un (fel de) X ( câinele este un hiponim al caninului )
- termenii coordonate : Y este un termen coordonat al lui X dacă X și Y au un hipernim ( lupul este un termen coordonat al câinelui , iar câinele este un termen coordonat al lupului )
- meronim : Y este un meronim al lui X dacă Y face parte din X ( fereastra este un meronim al clădirii )
- holonim : Y este un holonim al lui X dacă X face parte din Y ( clădirea este un holonim al ferestrei )
-
Verbe
- hipernim : verbul Y este un hipernim al verbului X dacă activitatea X este un (fel de) Y ( a percepe este un hipernim de a asculta )
- troponim : verbul Y este un troponim al verbului X dacă activitatea Y face X într-un fel ( a lisp este un troponim al a vorbi )
- implicare : verbul Y este implicat de X dacă făcând X trebuie să faci Y ( a dormi este implicat de a sforăi )
- termeni coordonați : acele verbe care împărtășesc un hiperim comun ( a lisp și a țipa )
Aceste relații semantice se țin între toți membrii seturilor de syns legate. Membrii synset individuali (cuvinte) pot fi, de asemenea, conectați cu relații lexicale. De exemplu, (un sens al) substantivului „director” este legat de (un sens al) verbului „direct” din care este derivat printr-o legătură „morfosemantică”.
Funcțiile de morfologie ale software-ului distribuit cu baza de date încearcă să deducă lema sau forma stem a unui cuvânt din intrarea utilizatorului. Formele neregulate sunt stocate într-o listă, iar căutarea „mâncat” va întoarce „mânca”, de exemplu.
Structura cunoașterii
Atât substantivele, cât și verbele sunt organizate în ierarhii, definite prin relații hipernime sau IS A. De exemplu, un sens al cuvântului câine se găsește în urma ierarhiei hiperimilor; cuvintele de la același nivel reprezintă membrii synset. Fiecare set de sinonime are un index unic.
- câine, câine domestic, Canis familiaris
- canin, canid
- carnivor
- mamifer placentar, placentar, mamifer eutherian, eutherian
- mamifer
- vertebrat, craniat
- acordat
- animal, ființă animată, fiară, brută, creatură, faună
- ...
- animal, ființă animată, fiară, brută, creatură, faună
- acordat
- vertebrat, craniat
- mamifer
- mamifer placentar, placentar, mamifer eutherian, eutherian
- carnivor
- canin, canid
La nivelul superior, aceste ierarhii sunt organizate în 25 de „copaci” pentru începători pentru substantive și 15 pentru verbe (numite fișiere lexicografice la un nivel de întreținere). Toate sunt legate de un set unic de începători, „entitate”. Ierarhiile substantivelor sunt mult mai profunde decât ierarhiile verbelor
Adjectivele nu sunt organizate în arbori ierarhici. În schimb, două antonime „centrale”, cum ar fi „fierbinte” și „rece” formează poli binari, în timp ce sinonimele „satelit” precum „abur” și „rece” se conectează la polii lor respectivi printr-o relație de „asemănare”. Adjectivele pot fi vizualizate în acest fel mai degrabă ca „gantere” decât ca „copaci”.
Aspecte psiholingvistice
Scopul inițial al proiectului WordNet a fost de a construi o bază de date lexicală care să fie în concordanță cu teoriile memoriei semantice umane dezvoltate la sfârșitul anilor 1960. Experimentele psihologice au indicat faptul că vorbitorii și-au organizat cunoașterea conceptelor într-un mod economic, ierarhic. Timpul de recuperare necesar pentru a accesa cunoștințele conceptuale părea să fie direct legat de numărul de ierarhii de care vorbitorul avea nevoie să „traverseze” pentru a accesa cunoștințele. Astfel, vorbitorii ar putea verifica mai repede că canarii pot cânta, deoarece un canar este o pasăre cântătoare, dar au necesitat puțin mai mult timp pentru a verifica dacă canarii pot zbura (unde au trebuit să acceseze conceptul „pasăre” la nivelul superordonat) și chiar mai mult timp pentru verificați că canarii au pielea (necesită căutare pe mai multe niveluri de hiponimie, până la „animal”). În timp ce astfel de experimente psiholingvistice și teoriile de bază au fost supuse criticilor, o parte din organizația WordNet este în concordanță cu dovezile experimentale. De exemplu, afazia anomică afectează selectiv capacitatea vorbitorilor de a produce cuvinte dintr-o anumită categorie semantică, o ierarhie WordNet. Adjectivele antonime (adjectivele centrale ale WordNet în structura cu gantere) se găsesc mult mai frecvent decât întâmplarea, fapt care s-a dovedit a fi valabil pentru multe limbi.
Ca ontologie lexicală
WordNet este uneori numit o ontologie, o afirmație persistentă pe care creatorii săi nu o fac. Relațiile hipernim / hiponim dintre substantivele substantivelor pot fi interpretate ca relații de specializare între categoriile conceptuale. Cu alte cuvinte, WordNet poate fi interpretat și utilizat ca ontologie lexicală în sensul informaticii . Cu toate acestea, o astfel de ontologie ar trebui corectată înainte de a fi utilizată, deoarece conține sute de inconsecvențe semantice de bază; de exemplu, există (i) specializări comune pentru categorii exclusive și (ii) concedieri în ierarhia specializărilor. Mai mult, transformarea WordNet într-o ontologie lexicală utilizabilă pentru reprezentarea cunoștințelor ar trebui să presupună în mod normal (i) distincția relațiilor de specializare în relații subtipOf și instanceOf și (ii) asocierea identificatorilor unici intuitivi fiecărei categorii. Deși astfel de corecții și transformări au fost efectuate și documentate ca parte a integrării WordNet 1.7 în baza de cunoștințe actualizabilă în cooperare a WebKB-2, majoritatea proiectelor care pretind că reutilizează WordNet pentru aplicații bazate pe cunoaștere (de obicei, recuperarea informațiilor orientată spre cunoaștere ) pur și simplu reutilizați-l direct.
WordNet a fost, de asemenea, transformat într-o specificație formală, prin intermediul unei metodologii hibride de jos în sus pentru a extrage automat relațiile de asociere din WordNet și a interpreta aceste asociații în termenii unui set de relații conceptuale, definite formal în ontologia fundamentală DOLCE .
În majoritatea lucrărilor care pretind că au integrat WordNet în ontologii, conținutul WordNet nu a fost pur și simplu corectat atunci când părea necesar; în schimb, WordNet a fost puternic reinterpretat și actualizat ori de câte ori este adecvat. Acesta a fost cazul când, de exemplu, ontologia de nivel superior a WordNet a fost re-structurată conform abordării bazate pe OntoClean sau când WordNet a fost folosit ca sursă primară pentru construirea claselor inferioare ale ontologiei SENSUS.
Limitări
Cea mai discutată limitare a WordNet (și a resurselor conexe, cum ar fi ImageNet ) este că unele dintre relațiile semantice sunt mai potrivite pentru concepte concrete decât pentru concepte abstracte. De exemplu, este ușor să creați relații hiponime / hipernime pentru a surprinde că o „ coniferă ” este un tip de „ copac ”, un „copac” este un tip de „ plantă ”, iar o „plantă” este un tip de „ organism ” ", dar este dificil să se clasifice emoții precum" frică "sau" fericire "în relații la fel de profunde și bine definite de hiponime / hiperim.
Multe dintre conceptele din WordNet sunt specifice anumitor limbi și cea mai precisă mapare raportată între limbi este de 94%. Sinonimele, hiponimele, meronimele și antonimele apar în toate limbile cu un WordNet până acum, dar alte relații semantice sunt specifice limbii. Acest lucru limitează interoperabilitatea între limbi. Cu toate acestea, face din WordNet o resursă pentru evidențierea și studierea diferențelor dintre limbi, deci nu este neapărat o limitare pentru toate cazurile de utilizare.
WordNet nu include informații despre etimologie sau pronunția cuvintelor și conține doar informații limitate despre utilizare. WordNet își propune să acopere majoritatea cuvintelor de zi cu zi și nu include o terminologie specifică domeniului.
WordNet este cel mai des utilizat lexicon de calcul al englezei pentru dezambiguizarea sensului de cuvinte (WSD), o sarcină care vizează atribuirea sensurilor adecvate contextului (adică membrii synset) cuvintelor dintr-un text. Cu toate acestea, s-a susținut că WordNet codifică diferențele de sens care sunt prea fine. Această problemă împiedică sistemele WSD să atingă un nivel de performanță comparabil cu cel al oamenilor, care nu sunt întotdeauna de acord atunci când se confruntă cu sarcina de a selecta un sens dintr-un dicționar care se potrivește cu un cuvânt într-un context. Problema granularității a fost abordată prin propunerea metodelor de grupare care grupează automat simțuri similare ale aceluiași cuvânt.
Conținut jignitor
WordNet include cuvinte care pot fi percepute ca peiorative sau jignitoare. Interpretarea unui cuvânt se poate schimba în timp și între grupurile sociale , deci nu este întotdeauna posibil ca WordNet să definească un cuvânt ca „ peiorativ ” sau „ofensator” în mod izolat. Prin urmare, persoanele care utilizează WordNet trebuie să aplice propriile metode pentru a identifica cuvinte jignitoare sau peiorative.
Cu toate acestea, această limitare este valabilă pentru alte resurse lexicale precum dicționarele și tezaururile , care conțin și cuvinte peiorative și jignitoare. Unele dicționare indică cuvinte care sunt peiorative , dar nu includ toate contextele în care cuvintele ar putea fi acceptabile sau jignitoare pentru diferite grupuri sociale. Prin urmare, persoanele care folosesc dicționare trebuie să aplice propriile metode pentru a identifica toate cuvintele jignitoare.
Licențiat vs. Open WordNets
Unele wordnets au fost ulterior create pentru alte limbi. Un sondaj din 2012 enumeră rețelele și disponibilitatea acestora. Într-un efort de propagare a utilizării WordNets, comunitatea globală WordNet a fost licențiată încet WordNets pentru un domeniu deschis în care cercetătorii și dezvoltatorii pot accesa și utiliza cu ușurință WordNets ca resurse lingvistice pentru a furniza cunoștințe ontologice și lexicale în sarcinile de procesare a limbajului natural. .
Open Multilingual WordNet oferă acces la rețelele Word cu licență deschisă într-o varietate de limbi, toate legate de Princeton Wordnet of English (PWN). Scopul este de a facilita utilizarea wordnet-urilor în mai multe limbi.
Aplicații
WordNet a fost folosit pentru o serie de scopuri în sistemele de informații, inclusiv dezambiguizare cuvânt-sens , regăsire a informațiilor , clasificarea automată a textului , sumarizarea automată a textului , de traducere automată chiar și generarea de cuvinte încrucișate puzzle automată.
O utilizare obișnuită a WordNet este de a determina asemănarea dintre cuvinte. Au fost propuși diferiți algoritmi, inclusiv măsurarea distanței dintre cuvinte și synsets în structura grafică WordNet, cum ar fi prin numărarea numărului de muchii dintre synsets. Intuiția este că, cu cât cele două cuvinte sau sintetizări sunt mai apropiate, cu atât semnificația lor este mai apropiată. Un număr de algoritmi de similaritate a cuvintelor bazate pe WordNet sunt implementați într-un pachet Perl numit WordNet :: Similarity și într-un pachet Python numit NLTK . Alte tehnici de similitudine bazate pe WordNet mai sofisticate includ ADW, a cărui implementare este disponibilă în Java . WordNet poate fi, de asemenea, utilizat pentru a interconecta alte vocabulare.
Interfețe
Princeton menține o listă de proiecte conexe, care include link-uri către unele dintre interfețele de programare a aplicațiilor utilizate pe scară largă , disponibile pentru accesarea WordNet utilizând diverse limbaje de programare și medii.
Proiecte și extensii conexe
WordNet este conectat la mai multe baze de date ale Semantic Web . WordNet este, de asemenea, reutilizat în mod obișnuit prin mapări între seturile sintetice WordNet și categoriile din ontologii. Cel mai adesea, sunt mapate doar categoriile de nivel superior ale WordNet.
Asociația globală WordNet
Asociația Globală WordNet (GWA) este o organizație publică și necomercială care oferă o platformă pentru discutarea, partajarea și conectarea rețelelor de cuvinte pentru toate limbile din lume. GWA promovează, de asemenea, standardizarea rețelelor de cuvinte în mai multe limbi, pentru a asigura uniformitatea acesteia în enumerarea seturilor de sinteze în limbile umane. GWA păstrează o listă de wordnets dezvoltate în întreaga lume.
Alte limbi
- WordNet arab : WordNet pentru limba arabă.
- Ontologia arabă , o ontologie lingvistică care are aceeași structură ca wordnet și mapată la aceasta.
- Proiectul BalkaNet a produs WordNets pentru șase limbi europene (bulgară, cehă, greacă, română, turcă și sârbă). Pentru acest proiect, a fost dezvoltat un editor WordNet bazat pe XML disponibil gratuit. Acest editor - VisDic - nu mai este în dezvoltare activă, dar este încă folosit pentru crearea diverselor WordNets. Succesorul său, DEBVisDic, este aplicație client-server și este utilizat în prezent pentru editarea mai multor WordNets (proiectul olandez în Cornetto, poloneză, maghiară, mai multe limbi africane, chineză).
- BulNet este o versiune bulgară a WordNet dezvoltată la Departamentul de Lingvistică Computațională al Institutului pentru Limba Bulgară, Academia Bulgară de Științe.
- CWN (Chinese Wordnet sau 中文 詞彙 網路) susținut de Universitatea Națională din Taiwan .
- Proiectul EuroWordNet a produs WordNets pentru mai multe limbi europene și le-a legat; acestea nu sunt însă disponibile în mod liber. Proiectul Global Wordnet încearcă să coordoneze producerea și conectarea „wordnetelor” pentru toate limbile. Oxford University Press , editorul Oxford English Dictionary , și-a exprimat planurile de a-și produce propriul concurent online pentru WordNet.
- FinnWordNet este o versiune finlandeză a WordNet în care au fost traduse toate intrările din WordNet original în limba engleză.
- GermaNet este o versiune germană a WordNet dezvoltată de Universitatea din Tübingen.
- IndoWordNet este o bază de cunoștințe lexicale legate de wordnets de 18 limbi programate ale Indiei adică, Asameză , Bangla , Bodo , Gujarati , hindi , kannada , Kashmir , Konkani , malayala , Meitei (manipuri), marathi , nepaleză , Odia , Punjabi , Sanscrită , tamilă , teluguă și urdu .
- JAWS (Just Another WordNet Subset), o altă versiune franceză a WordNet construită folosind Wiktionary și spațiile semantice
- WordNet Bahasa : WordNet pentru limba malaeză și indoneziană, dezvoltat de Universitatea de Tehnologie Nanyang .
- Malayalam WordNet , dezvoltat de Universitatea de Știință și Tehnologie Cochin .
- Depozitul central multilingv (MCR) integrează în același cadru EuroWordNet rețele de cuvinte din spaniolă, catalană, bască, galiciană și portugheză plăcute în engleză.
- Proiectul MultiWordNet, un WordNet multilingv menit să producă un WordNet italian puternic aliniat cu Princeton WordNet.
- OpenDutchWordNet, este o bază de date semantică lexicală olandeză.
- OpenWN-PT este o versiune portugheză braziliană a WordNet original disponibil gratuit pentru descărcare sub licența CC-BY-SA.
- plWordNet este o versiune în limba poloneză a WordNet dezvoltată de Wrocław University of Technology .
- PolNet este o versiune în limba poloneză a WordNet dezvoltată de Universitatea Adam Mickiewicz din Poznań (distribuită sub licența CC BY-NC-ND 3.0).
Proiecte precum BalkaNet și EuroWordNet au făcut fezabilă crearea de wordnets independente legate de cea originală. Unul dintre astfel de proiecte a fost WordNet rus, patronat de Universitatea de Stat din Petersburg pentru Mijloace de Comunicare condusă de SA Yablonsky sau Russnet de Universitatea de Stat din Sankt Petersburg.
- UWN este o bază de cunoștințe lexicale multilingve construită automat, care extinde WordNet pentru a acoperi peste un milion de cuvinte în multe limbi diferite.
- LUP (WordNet Libre du Français), o versiune franceză a WordNet.
Date legate
- BabelNet , o rețea semantică multilingvă foarte mare , cu milioane de concepte obținute prin integrarea WordNet și Wikipedia utilizând un algoritm de mapare automată.
- SUMO Ontologia a produs o mapare între toate synset - uri WordNet (inclusiv substantive, verbe, adjective și adverbe) și clasele SUMO . Cea mai recentă adăugare a mapărilor oferă legături către toți termenii mai specifici ai Ontologiei MId-Level (MILO), care extinde SUMO.
- OpenCyc , o ontologie deschisă și o bază de cunoștințe a cunoașterii de zi cu zi a bunului simț, are 12.000 de termeni legați de seturi de sinonime WordNet.
- DOLCE , este primul modul al WonderWeb Foundational Ontologies Library (WFOL). Această ontologie superioară a fost dezvoltată în lumina unor principii ontologice riguroase inspirate de tradiția filosofică, cu o orientare clară spre limbaj și cunoaștere. OntoWordNet este rezultatul alinierii experimentale a nivelului superior WordNet cu DOLCE. Se sugerează că o astfel de aliniere ar putea duce la un WordNet „îndulcit ontologic”, menit să fie din punct de vedere conceptual mai riguros, transparent cognitiv și eficient exploatabil în mai multe aplicații.
- DBpedia , o bază de date cu informații structurate, este legată de WordNet.
- EXtended WordNet este un proiect de la Universitatea din Texas din Dallas , care are ca scop îmbunătățirea WordNet prin parsarea glosele semantic, făcând astfel informațiile cuprinse în aceste definiții sunt disponibile pentru sistemele automate de procesare a cunoștințelor. Este disponibil gratuit sub o licență similară cu cea a WordNet.
- Proiectul GCIDE a produs un dicționar prin combinarea unui dicționar Webster din domeniul public din 1913 cu unele definiții WordNet și materiale furnizate de voluntari. A fost lansat sub licența copyleft GPL .
- ImageNet este o bază de date de imagini organizată în funcție de ierarhia WordNet (în prezent doar substantivele), în care fiecare nod al ierarhiei este reprezentat de sute și mii de imagini. În prezent, are peste 500 de imagini pe nod în medie.
- BioWordnet, o extensie biomedicală a wordnet a fost abandonată din cauza problemelor legate de stabilitate față de versiuni.
- WikiTax2WordNet, o mapare între sineturile WordNet și categoriile Wikipedia .
- WordNet ++, o resursă care include peste milioane de margini semantice recoltate de pe Wikipedia și care conectează perechi de seturi de WordNet.
- SentiWordNet, o resursă pentru susținerea aplicațiilor de extragere a opiniei obținute prin etichetarea tuturor seturilor de synset WordNet 3.0 în funcție de gradele lor estimate de pozitivitate, negativitate și neutralitate.
- ColorDict, este o aplicație Android pentru telefoane mobile care utilizează baza de date Wordnet și altele, cum ar fi Wikipedia.
- UBY-LMF o bază de date cu 10 resurse, inclusiv WordNet.
Proiecte asociate
- FrameNet este o bază de date lexicală care împărtășește unele asemănări cu și se referă la WordNet.
- Cadrul de marcare lexicală (LMF) este un standard ISO specificat în ISO / TC37 pentru a defini un cadru standardizat comun pentru construirea lexiconelor, inclusiv WordNet. Subsetul LMF pentru Wordnet se numește Wordnet-LMF. O instanțiere a fost făcută în cadrul proiectului KYOTO.
- Programul UNL este un proiect sub auspiciile UNO care vizează consolidarea datelor lexico-semantice ale multor limbi pentru a fi utilizate în traducerea automată și în sistemele de extragere a informațiilor .
- Semnificația Monkey este un dicționar online gratuit bazat pe baza de date WordNet.
Distribuții
Baza de date WordNet este distribuită ca pachet de dicționar (de obicei un singur fișier) pentru următorul software:
Vezi si
- Cadrul de marcare lexicală
- Dicționar care poate fi citit automat
- Sinonim Inel
- Taxonomie
- ThoughtTreasure
Referințe
linkuri externe
- Site oficial
- „Malayalam WordNet” . Informatică . Universitatea de Știință și Tehnologie Cochin.
- Pilato, Maria. "Adjective, intensificatoare, negații (AIN) Thesaurus" . Sentimentul italian .