Wydobywanie koncepcji - Concept mining
Eksploracja pojęć to czynność, która powoduje wyodrębnianie pojęć z artefaktów . Rozwiązania tego zadania zazwyczaj obejmują aspekty sztucznej inteligencji i statystyki , takie jak eksploracja danych i eksploracja tekstów . Ponieważ artefakty są zwykle luźno uporządkowaną sekwencją słów i innych symboli (a nie pojęć), problem jest nietrywialny , ale może zapewnić potężny wgląd w znaczenie, pochodzenie i podobieństwo dokumentów.
Metody
Tradycyjnie konwersja słów na pojęcia odbywa się za pomocą tezaurusa , a w przypadku technik obliczeniowych tendencja jest taka sama. Słowników wykorzystywane są albo specjalnie stworzone do tego zadania, albo wcześniej istniejącego modelu języka, zwykle związanej z Princeton WordNet .
Odwzorowania słów na pojęcia są często niejednoznaczne . Zazwyczaj każde słowo w danym języku będzie się odnosić do kilku możliwych pojęć. Ludzie używają kontekstu do ujednoznaczniania różnych znaczeń danego fragmentu tekstu, gdzie dostępne systemy tłumaczenia maszynowego nie mogą łatwo wywnioskować kontekstu.
Jednak dla celów eksploracji pojęć te niejasności wydają się być mniej ważne niż w przypadku tłumaczenia maszynowego, ponieważ w dużych dokumentach niejasności zwykle się wyrównują, podobnie jak w przypadku eksploracji tekstów.
Istnieje wiele technik ujednoznaczniania, których można użyć. Przykładami są analiza językowa tekstu oraz użycie informacji o częstotliwości skojarzeń słów i pojęć, które można wywnioskować z dużych korpusów tekstowych. Ostatnio pojawiły się i zainteresowały środowisko naukowe techniki, które opierają się na semantycznym podobieństwie między możliwymi koncepcjami a kontekstem.
Aplikacje
Wykrywanie i indeksowanie podobnych dokumentów w dużych korporacjach
Jedną z firm odpryskowych obliczania statystyki dokumentu w domenie koncepcji, raczej niż domena słowo, jest to, że koncepcja utworzenia naturalnych struktur drzewo oparte na hypernymy i meronimia . Struktury te mogą być używane do generowania prostych statystyk przynależności do drzew, które mogą być używane do lokalizowania dowolnego dokumentu w przestrzeni koncepcyjnej Euklidesa . Jeśli rozmiar dokumentu jest również traktowany jako inny wymiar tej przestrzeni, można stworzyć niezwykle wydajny system indeksowania. Technika ta jest obecnie wykorzystywana komercyjnie, lokalizując podobne dokumenty prawne w korpusie 2,5 miliona dokumentów.
Grupowanie dokumentów według tematu
Standardowe techniki numerycznego grupowania mogą być stosowane w „przestrzeni pojęciowej”, jak opisano powyżej, do lokalizowania i indeksowania dokumentów według wywnioskowanego tematu. Są one znacznie bardziej wydajne liczbowo niż ich kuzyni eksplorujący tekst i zachowują się bardziej intuicyjnie, ponieważ lepiej odwzorowują miary podobieństwa, które wygenerowałby człowiek.
Zobacz też
Bibliografia
- ^ Yuen-Hsien Tseng, Chun-Yen Chang, Shu-Nu Chang Rundgren i Carl-Johan Rundgren, „ Mining Concept Maps from News Stories for Measuring Civic Scientific Literacy in Media ”, Computers and Education, Vol. 55, nr 1, sierpień 2010, ss. 165-177.
- ^ Yuen-Hsien Tseng, „ Automatic Thesaurus Generation for Chinese Documents ”, Journal of the American Society for Information Science and Technology, tom. 53, nr 13, listopad 2002, str. 1130-1138.
- ^ Yuen-Hsien Tseng, „ Generic Title Labeling for Clustered Documents ”, Expert Systems With Applications, tom. 37, nr 3, 15 marca 2010, ss. 2247-2254.