Извлечение текста

Извлечение текста ( английский извлечение текста также английский ключевой фразы экстракция ) или извлечение текста представляет собой способ автоматического резюме текста с помощью компьютерных лингвистических методов. Части текста - например, предложения или целые разделы - оцениваются на предмет их важности или релевантности с использованием статистических и / или эвристических методов. Эти оценки важности служат основой для решения, какие части («ключевые фразы») извлекаются и объединяются в более короткий текст, который затем обеспечивает обзор содержания исходного текста и обычно называется отрывком или рефератом .

По словам Карен Спэрк Джонс (1999), сводки, составленные с использованием этого метода, имеют недостаток, заключающийся в том, что они в основном не очень связны и поэтому трудны для чтения, а в некоторых случаях даже непонятны. С другой стороны, этот метод и его варианты, вероятно, легче моделировать в автоматических системах. Примерами этого являются системы Луна (1959) и Эдмундсона (1969) и подходы Рата и др. (1961) и Brandow et al. (1995).

Библиография

  • Мани, И. / Мэйбери, М. (1999): Достижения в области автоматического обобщения текста. Массачусетский Технологический Институт
  • Брандо, Р. / Митце, К. / Рау, Л. Ф. (1995): Автоматическое сжатие электронных публикаций путем выбора предложения.
  • Рат, Г.Дж. / Резник, А. / Сэвидж, Т.Р. (1961): формирование рефератов путем выбора предложений.
  • Спарк Джонс, К. (1999): Автоматическое обобщение: факторы и направления.
  • В: Mani / Maybury 1999, стр. 1–14 (введение).