UBY - UBY

UBY
Versie 1.7
Kader Java
Type Meertalige woordsemantiek resource
Licentie Gratis licenties voor de software, mix van licenties voor de opgenomen middelen
Website https://www.ukp.tu-darmstadt.de/data/lexical-resources/uby

UBY is een grootschalige lexicale-semantische bron voor natuurlijke taalverwerking (NLP) ontwikkeld aan de Ubiquitous Kennis Processing Lab (UKP) in het departement Informatica van de Technische Universität Darmstadt . UBY is gebaseerd op de ISO-norm lexicale Markup Framework (LMF) en combineert informatie uit verschillende expert-gebouwd en gezamenlijk gebouwd middelen voor Engels en Duits.

UBY past een woord zin alignment benadering (deelgebied van de woordbetekenis ondubbelzinnig maken ) voor het combineren van informatie over zelfstandige naamwoorden en werkwoorden. Op dit moment, UBY bevat 12 geïntegreerde middelen in het Engels en Duits.

Inclusief middelen

Formaat

UBY-LMF is een indeling voor het standaardiseren van lexicale middelen voor Natural Language Processing (NLP). UBY-LMF voldoet aan de ISO-standaard voor lexicons: LMF , ontworpen binnen de ISO-TC37 , en vormt een zogenaamde rangschikking van deze abstracte standaard. In overeenstemming met de LMF, alle attributen en andere taalkundig geïntroduceerd in UBY-LMF verwijzen naar gestandaardiseerde beschrijvingen van hun betekenis in ISOCat .

Beschikbaarheid en versies

UBY is beschikbaar als onderdeel van de open bron repository DKPro. DKPro UBY is een Java framework voor het creëren van en de toegang tot-sense verbonden lexicale middelen in overeenstemming met de UBY-LMF lexicon model. Terwijl de code van UBY is gelicenseerd onder een mix van vrije licenties zoals de GPL en CC by SA , een deel van de opgenomen middelen onder verschillende licenties zoals alleen academisch gebruik .

Er is ook een Semantic Web versie van UBY genoemd lemonUby. lemonUby is gebaseerd op de citroen model zoals voorgesteld in het Monnet project. citroen is een model voor het modelleren lexicon en machine leesbare woordenboeken en gekoppeld aan de Semantic Web en de Linked Data cloud.

UBY vs. BabelNet

BabelNet is een automatisch woordsemantiek bron die verbindt Wikipedia om de meest populaire computationele lexicons zoals WordNet . Op het eerste gezicht, UBY en BabelNet lijken identiek en concurrerende projecten; echter, volg dan de twee middelen verschillende filosofieën. In een vroeg stadium werd BabelNet voornamelijk gebaseerd op de uitlijning van WordNet en Wikipedia, die door de aard van Wikipedia een sterke focus op zelfstandige naamwoorden, en in het bijzonder de naam entiteiten geïmpliceerd. Later werd de focus van BabelNet meer verschoven naar andere delen van meningsuiting. UBY werd echter gericht vanaf het allereerste begin op werkwoord informatie, met name, syntactische informatie, die is opgenomen in de middelen, zoals VerbNet of FrameNet . Een ander belangrijk verschil is dat UBY modellen andere hulpmiddelen volledig en onafhankelijk van elkaar, zodat UBY kan worden toegepast als geheel vervangen van elk van de aanwezige middelen. Een collectieve toegang tot meerdere bronnen wordt verstrekt door de beschikbare resource uitlijning. Bovendien is de LMF model in UBY maakt uniforme manier toegang voor iedereen en individuele middelen. Ondertussen BabelNet volgen een soortgelijke aanpak WordNet en bakt geselecteerde soorten informatie in zogenaamde Babel Synsets. Dit maakt de toegang en verwerking van de kennis handiger, maar het vervaagt de lijnen tussen de gekoppelde kennisbanken. Daarnaast BabelNet verrijkt de originele middelen, bijvoorbeeld door middel van automatisch aangemaakt vertalingen voor concepten die niet gelexicaliseerd in een bepaalde taal. Hoewel dit biedt een geweldige boost van de dekking voor meertalige toepassingen, de automatische gevolgtrekking van de informatie is altijd gevoelig voor een zekere mate van fouten.

Samengevat, als gevolg van de reeds genoemde verschillen tussen de twee middelen, het gebruik van de ene of de andere zou de voorkeur hebben, afhankelijk van de specifieke toepassing scenario. In feite kunnen de twee middelen worden gebruikt om uitgebreide lexicografische kennis, vooral als ze met elkaar verbonden zijn. De open en goed gedocumenteerde structuur van de twee middelen zorgen voor een grote stap gezet om dit doel te bereiken.

toepassingen

UBY is met succes gebruikt in verschillende NLP taken zoals Word Sense Disambiguation , Word Sense Clustering, Verb Sense etikettering en tekst Classificatie . UBY inspireerde ook andere projecten op de automatische bouw van woordsemantiek middelen. Verder lemonUby besteed aan het verbeteren machine translation resultaten, in het bijzonder, het vinden van vertalingen voor onbekende woorden.

Zie ook

Externe links

Referenties