Extrakce textu

Extrakci textu ( anglicky extrakci textu také anglicky keyphrase extrakci ) nebo extrakci textu je metoda pro automatické shrnutí textu pomocí počítačových jazykových technik. Části textu - například věty nebo celé části - jsou hodnoceny z hlediska jejich důležitosti nebo relevance pomocí statistických a / nebo heuristických metod. Tato skóre důležitosti slouží jako základ pro rozhodování o tom, které části („klíčové fráze“) se extrahují a zkombinují do kratšího textu, který pak poskytuje přehled obsahu původního textu a obvykle se označuje jako extrakt nebo abstrakt .

Podle Karen Spärck Jonesové (1999) mají souhrny vytvořené pomocí této metody tu nevýhodu, že jsou většinou málo koherentní, a proto obtížně čitelné a v některých případech dokonce nepochopitelné. Na druhou stranu je tato metoda a její varianty pravděpodobně snadnější modelovat v automatických systémech. Příkladem jsou systémy Luhna (1959) a Edmundsona (1969) a přístupy Rath et al. (1961) a Brandow et al. (1995).

bibliografie

  • Mani, I./Maybury, M. (1999): Pokroky v automatické sumarizaci textu. Massachusetts Institute of Technology
  • Brandow, R./Mitze, K./Rau, LF (1995): Automatická kondenzace elektronických publikací podle výběru vět.
  • Rath, GJ / Resnick, A./Savage, TR (1961): Formování abstraktů výběrem vět.
  • Sparck Jones, K. (1999): Automatic Summarizing: Factors and Directions.
  • In: Mani / Maybury 1999, s. 1–14 (úvod)