Konsept gruvedrift - Concept mining

Konseptgruvedrift er en aktivitet som resulterer i utvinning av konsepter fra gjenstander . Løsninger på oppgaven involverer vanligvis aspekter av kunstig intelligens og statistikk , for eksempel data mining og tekst mining . Fordi gjenstander vanligvis er en løst strukturert sekvens av ord og andre symboler (i stedet for begreper), er problemet ikke viktig , men det kan gi kraftig innsikt i betydningen, herkomst og likhet med dokumenter.

Metoder

Tradisjonelt har konvertering av ord til begreper blitt utført ved hjelp av en synonymordbok , og for beregningsteknikker er tendensen til å gjøre det samme. Synonymordbøkene er enten laget spesielt for oppgaven, eller en eksisterende språkmodell, vanligvis relatert til Princetons WordNet .

Kartleggingen av ord til begreper er ofte tvetydig . Vanligvis vil hvert ord på et gitt språk forholde seg til flere mulige begreper. Mennesker bruker kontekst for å tydeliggjøre de forskjellige betydningene av et gitt stykke tekst, der tilgjengelige maskinoversettelsessystemer ikke lett kan utlede kontekst.

I forbindelse med konseptutvinning har disse tvetydighetene en tendens til å være mindre viktige enn de er med maskinoversettelse, for i store dokumenter har tvetydighetene en tendens til å jevne seg ut, akkurat som tilfellet er med tekstutvinning.

Det er mange teknikker for tvetydighet som kan brukes. Eksempler er språklig analyse av teksten og bruk av frekvensinformasjon for ord og begrepssammenheng som kan utledes fra store tekstkorporaer. Nylig har teknikker som bygger på semantisk likhet mellom mulige begreper og kontekst dukket opp og fått interesse for det vitenskapelige samfunnet.

applikasjoner

Oppdage og indeksere lignende dokumenter i store korpora

En av de ringvirkninger for beregning av dokumentstatistikk i begrepet domene, snarere enn ordet domene, er at begrepene danner naturlige trestrukturer basert på hypernymy og meronym . Disse strukturene kan brukes til å generere enkel statistikk for tremedlemskap, som kan brukes til å finne ethvert dokument i et euklidisk konseptrom . Hvis størrelsen på et dokument også betraktes som en annen dimensjon i dette rommet, kan det opprettes et ekstremt effektivt indekseringssystem. Denne teknikken er for tiden i kommersiell bruk og finner lignende juridiske dokumenter i et 2,5 millioner dokumentkorpus.

Klynging av dokumenter etter emne

Standard numeriske klyngeteknikker kan brukes i "konseptrom" som beskrevet ovenfor for å lokalisere og indeksere dokumenter etter det avledede emnet. Disse er numerisk langt mer effektive enn deres kusiner for tekstutvinning , og har en tendens til å oppføre seg mer intuitivt ved å kartlegge bedre de likhetstiltak et menneske ville generere.

Se også

Referanser

  1. ^ Yuen-Hsien Tseng, Chun-Yen Chang, Shu-Nu Chang Rundgren og Carl-Johan Rundgren, " Mining Concept Maps from News Stories for Measuring Civic Scientific Literacy in Media ", Computers and Education, Vol. 55, nr. 1, august 2010, s. 165-177.
  2. ^ Yuen-Hsien Tseng, " Automatic Thesaurus Generation for Chinese Documents ", Journal of the American Society for Information Science and Technology, Vol. 53, nr. 13, november 2002, s. 1130-1138.
  3. ^ Yuen-Hsien Tseng, " Generic Title Labelling for Clustered Documents ", Expert Systems With Applications, Vol. 37, nr. 3, 15. mars 2010, s. 2247-2254.