Генерация текста

Когда генерация текста (включая генерацию естественного языка ; English Natural Language Generation , NLG ) называется автоматическим воспроизведением естественного языка машиной. В рамках компьютерной лингвистики создание текстов - это особая форма искусственного интеллекта .

Процесс генерации

Для процесса генерации существуют различные модели описания и технические термины, в зависимости от используемого метода и точки зрения, без необходимости противоречить друг другу в принципе.

По словам Эхуда Рейтера , архитектура для генерации сегодня состоит из планировщика текста, планировщика предложений и средства реализации поверхности в стандартной комплектации. Что касается отношений между сегментами текста, теория риторических структур, RST , используется для формирования дискурсивных отношений. Текст является связным, если он может быть представлен деревом риторических отношений и элементарных текстовых единиц (RST: Mann, Thompson): следующие ссылки применяются как отношения между основным и подчиненным предложениями: ПРИЧИНА, РЕЗУЛЬТАТ, УСТАНОВКА, КОНТРАСТ, ПОСЛЕДОВАТЕЛЬНОСТЬ, СПИСОК , КОНЦЕССИЯ и другие.

По словам М. Хесса, для генерации нужны две составляющие.

  • Стратегическая составляющая, о чем следует сказать: отбор информации, отбор содержания, планирование территории. Этот компонент обычно использует стратегии поиска и планирования с искусственным интеллектом.
  • Тактическая составляющая, как следует сказать: планирование языковой формы. Часто используется грамматика, адаптированная к аспекту генерации.

Ульрих Гауденц Мюллер вместе с германистом и компьютерным лингвистом Раймундом Древеком с 1981 по 1999 год разработал систему для генерации текста, которая получила название SARA (генератор случайных предложений).

Генерация текста из баз знаний

«Предпосылкой для любого типа генерации является то, что информация, которая будет генерироваться в виде текста, доступна в виде формальной информации, которая может быть обработана компьютерной лингвистикой, например B. Информация из баз данных или представлений знаний ".

Генерация текста из таких баз знаний доступна в вариантах для разных задач.

  • Интерфейс к экспертным системам
  • Изготовление технической документации на нескольких языках из базы знаний
  • Автоматическая генерация (направлений, прогнозов погоды и отчетов фондового рынка)
  • Компонент генерации диалоговых систем
  • Генерация из языковых моделей на основе преобразователя (например, с использованием GPT2 / 3 )

области применения

Роботизированная журналистика

Термин «роботизированная журналистика», придуманный средствами массовой информации, относится к алгоритмам, которые могут генерировать готовые тексты новостей из баз данных и столбцов. В этом процессе основное внимание уделяется спасению и сосредоточению внимания на гуманных журналистах . Уменьшая нагрузку на машину, редакторы могут получать более качественные новостные продукты с меньшим количеством сотрудников, потому что они более тщательно исследуются. С другой стороны, они могут публиковать отчеты, которые не удалось написать из-за нехватки времени или недостаточного интереса. Использование программного обеспечения в журналистике по-прежнему вызывает споры; в основном обсуждается, чем журналист-человек превосходит программное обеспечение. Кроме того, остается без ответа вопрос о том, в какой степени автоматически сгенерированные тексты подпадают под действие закона об авторском праве. Алгоритмы, специально адаптированные к входным данным, непрерывно вычисляют значения и составляют отчеты по ним либо через определенные промежутки времени (например, ежедневные отчеты о погоде), либо при значительном изменении значений (например, предупреждение о землетрясении). Особенно частые области применения «роботов-журналистов» - это ниши, такие как спортивные отчеты подклассов, прогнозы погоды и тикеры фондовых рынков. Но создание автоматизированного контента для отчетов по местным темам на основе данных уже используется.

Чат-боты

В текстовых диалоговых системах, таких как чат-боты , генерация текста используется для общения с пользователем. Известный исторический пример - программа ELIZA .

Часть коммуникации с высокоразвитыми интеллектуальными виртуальными агентами основана на этом принципе, при этом качество диалога зависит, среди прочего, от связи между агентом и базами знаний. Диалог человека с различными интерфейсами может быть облегчен, если агент генерирует текст, продуктивно отвечающий на вопросы:

  • При получении информационного предложения, в том числе в качестве агента презентации для веб-сайта (также называемого «онлайн-модератором»).
  • В случае языковой программы для выбора консультанта (часто используется для предварительной сортировки клиентов по телефону)
  • В диалогах с персонажами компьютерных игр

Контент-маркетинг

Согласно исследованию, индустрия маркетинга - это отрасль, на которую искусственный интеллект окажет наибольшее влияние. Ожидается, что к 2022 году более 30% цифрового контента будет создаваться с использованием технологии искусственного интеллекта. В маркетинге используются различные инструменты для создания контента, например Б. создание рекламного экземпляра, создание строк темы информационного бюллетеня и проверка результатов, созданных с помощью искусственного интеллекта.

Генерация текста как творческий процесс

Генерация текста может быть составной частью творческих процессов в искусстве и литературе. Для более длинных произведений полностью сгенерированные текстовые тела, независимо от того, были ли они созданы осмысленно или снабжены смыслом посредством постобработки, не предлагают какого-либо литературного качества. Однако некоторые художественные процессы цифровой поэзии, которые были важны в искусстве прошлого века и в современном искусстве, связаны с генерацией текста.

Процессы и приложения в изобразительном искусстве и литературе

  • Вмешательства в генерирующее программное обеспечение или базу знаний (художественные и литературные эксперименты). Пример (по Рейнхарду Дёлю ): Макс Бенс и его группа из Штутгарта использовали Zuse Z22 в 1959 году для «синтеза и вывода текстов с помощью введенного словаря и ряда синтаксических правил».
  • Постобработка или интеграция сгенерированного авторами текста (литературы).
  • Диалог с аудиторией (например, в арт-инсталляциях ). Пример: Дэвид Линк, Poetry Machine.

Генерация текста фразовой молотилкой

Молотилки для фраз или генераторы чуши (англ. Генераторы чуши , также генераторы модных слов ) существовали как механические устройства до того, как были реализованы в программном обеспечении. Первые фразы молотьбы вероятно разработаны как программное обеспечение было LoveLetters_1.0 программируются с 1952 года Кристофером Стрейчей в Университете Манчестера для Ferranti Mark I . Подобные генераторы можно найти во многих более разработанных версиях в Интернете.

Такие программы работают в соответствии с простыми концепциями, которые используются в более сложных процессах генерации текста: термины или части предложений берутся из списков, объединяются и корректируются грамматически правильно (грамматическая реализация). Для этого часто используется метод генерации с помощью цепей Маркова . Результатом является синтаксически правильный текст, который может иметь значимый эффект, но на самом деле это чушь собачья, потому что машины для обмолота фраз не имеют доступа к информации о значении используемых частиц. Например, пустую риторику из специальной литературы можно в шутку высмеять .

история

Помимо механических фразовых молотилок в качестве предшественников и помимо самых ранних попыток создания текстов с помощью программного обеспечения, первая фаза генерации естественного языка начинается с программ, которые схематически обращаются к знаниям, которые уже хранятся в текстовой форме, для генерации текста. Так с 1963 года работали BASEBALL, интерфейс к бейсбольным данным Американской бейсбольной лиги, и SAD SAM, интерфейс для установления семейных отношений, которые уже отвечали на вопросы. После нескольких других работ в этом направлении в 1966 году появилась ELIZA, запрограммированная Йозефом Вейценбаумом . На втором этапе знания кодируются в фактах и ​​правилах: LUNAR, 1972, является интерфейсом к базе данных по сбору лунных образцов миссии Apollo 11. Пэрри, 1975, имитирует параноидального разговора с психиатром. ROBOT, 1977, является первой коммерческой системой вопросов и ответов. VIE-LANG, 1982, автор Эрнст Бухбергер, представляет собой диалоговую систему на немецком языке, которая генерирует предложения из семантической сети. HAM-ANS, 1983, автор: Wolfgang Hoeppner, - это диалоговая система на немецком языке, которая имитирует, например, менеджера отеля.

литература

  • Эхуд Рейтер, Роберт Дейл: Создание систем генерации естественного языка . Издательство Кембриджского университета, Кембридж 2000, ISBN 0-521-62036-8 .
  • Хельмут Горачек: Создание текста в: Кай-Уве Карстенсен, Ральф Клабунде и др. (Ред.): Компьютерная лингвистика и языковые технологии . Гейдельберг: Spektrum Akademischer Verlag, 3-е издание, 2010 г., ISBN 978-3827420237 , стр. 436-465
  • Джон Бейтман: Прикладная генерация естественного языка и информационные системы в: Ralf Klabunde et al. (Ред.): Компьютерная лингвистика и языковые технологии . см. Heidelberg 2010, стр. 633–641
  • Рико Шванк: Анализ концепций и методов создания текстов на естественном языке из формальных данных, дипломная работа. Университет Отто фон Герике, Магдебург, факультет компьютерных наук
  • Патрик Райхельт: Введение в роботизированную журналистику: угроза или возможность? Tectum Wissenschaftsverlag, Баден-Баден, 2017 г., ISBN 978-3828840591 .
  • Стефан Вебер: Робот-журналистика, чат-боты и др.: Как алгоритмы создают контент и влияют на наше мышление. Heise Medien, Ганновер 2018, ISBN 978-3957881045 .

веб ссылки

Индивидуальные доказательства

  1. Эхуд Рейтер: Появилась ли консенсусная архитектура поколения NL и является ли это психологически правдоподобным? в: Материалы 7-го. Международный семинар по созданию естественного языка (INLGW '94). (PDF) McDonald, D. и Meteer, M., 1994, стр. 163-170 , по состоянию на 26 марта 2010 г. (на английском языке).
  2. Проект КИТ-МАРКЕР. Технический университет Берлина, 1999, стр. 1,3 , архивировано с оригинала ; Проверено 13 марта 2010 года .
  3. Майкл Хесс: Введение в компьютерную лингвистику (I). (PDF) (больше не доступны в Интернете.) Университет Цюриха, Институт вычислительной лингвистики, 2005, стр 44,4 ф. , Архивируются с оригинала на 31 марта 2007 года ; Проверено 26 марта 2010 года . Информация: ссылка на архив вставлена ​​автоматически и еще не проверена. Пожалуйста, проверьте исходную и архивную ссылку в соответствии с инструкциями, а затем удалите это уведомление.  @ 1@ 2Шаблон: Webachiv / IABot / www.ifi.unizh.ch
  4. ^ A b c Вибке Рамм и Клаудиа Виллигер: создание научных текстов и специализированная область . Лингвистическая реализация научного содержания в различных специализированных дисциплинах и их компьютерное лингвистическое моделирование. В: Knorr, Dagmar / Jakobs, Eva-Maria (ed.): Производство текстов в электронной среде . Производство текстов и медиа Том 2. Lang Verlag, Франкфурт-на-Майне 1997, ISBN 3-631-30970-8 , стр. 214.2 ( rwth-aachen.de [PDF; дата обращения 15 марта 2010 г.]).
  5. Susanne Göpferich, Dr. phil., Dipl.-Übers .: Технический редактор как глобальный игрок: Профессиональный опыт и требования к будущему обучению. Торговый журнал Technische Documentation 2000/05, 19 декабря 2003 г., стр. 1,7 , доступ 14 марта 2010 г . : «Многоязычная система генерации, оснащенная соответствующими правилами текстовых сообщений для конкретных типов текста, может создавать эти разные типы текста. для одного и того же продукта из единого Создайте базу знаний ".
  6. Статистика Обезьяны. (Больше не доступны в Интернете.) Интеллектуальная информационная лаборатория - Северо - западный университет, 2009, архивируются с оригинала на 16 ноября 2010 года ; по состоянию на 24 марта 2010 г. (на английском языке). Информация: ссылка на архив вставлена ​​автоматически и еще не проверена. Пожалуйста, проверьте исходную и архивную ссылку в соответствии с инструкциями, а затем удалите это уведомление. @ 1@ 2Шаблон: Webachiv / IABot / infolab.northwestern.edu
  7. Алек Рэдфорд и др. : Языковые модели - это многозадачные учащиеся без учителя, 2018 г.
  8. http://www.text-gold.de/fundstuecke/roboterjournalismus-haben-und-schreiben/ , по состоянию на 29 октября 2014 г.
  9. Произведения, созданные автономно компьютерами: достойны защиты авторских прав? Проверено 8 ноября 2018 года .
  10. Джулиан Майтра: СМИ: Роботы-журналисты уже среди нас. В: welt.de . 15 мая 2014, доступ к 7 октября 2018 .
  11. ^ Андреас Грефе: Руководство по автоматизированной журналистике . Columbia Journalism Review, Нью-Йорк, 2016 г. (по состоянию на 14 февраля 2018 г.).
  12. Роботы-журналисты спасают местную прессу. Кто нас от этого спасет? Проверено 20 ноября, 2018 (на немецком языке).
  13. Йозеф Карнер: Майлюфтерл, Аль Хорезми и искусственный интеллект: беседа с пионером компьютеров Хайнцем Земанеком. Telepolis, 8 августа 1999, стр . 1 , в архиве с оригинала января 22, 2005 ; доступ 20 марта 2010 г. (вопрос 20 и далее): «Вейценбаум не создавал интеллект или даже сознание, но показал простые средства, с помощью которых можно заставить зрителя поверить в то, что он имеет дело с интеллектом».
  14. ^ Оценка потенциальной ценности ИИ и расширенной аналитики | McKinsey. Проверено 26 мая 2021 года .
  15. Gartner Predicts 2019: В поисках баланса в маркетинге. Проверено 26 мая 2021 года .
  16. Почему маркетинговые команды должны использовать создание AI-контента. В: нейрофлэш. 10 мая 2021 г., по состоянию на 26 мая 2021 г. (немецкий).
  17. ^ Роберто Симановски: Автоматическое письмо. XCULT, доступ 15 марта 2010 г. (презентация на симпозиуме «Повествования в медиаискусстве»).
  18. Райнхард Дёль: Круг вокруг Макса Бенсе. Проверено 16 марта 2010 г. (искусственная поэзия, раздел 5).
  19. Райнхард Дёль: Круг вокруг Макса Бенсе. Проверено 16 марта 2010 г. (искусственная поэзия, раздел 6).
  20. Мириам Штюрнер: Дэвид Линк, Poetry Machine (версия 1.0), 2001-2002 гг. (Больше не доступны в Интернете.) ZKM, Центр искусства и средств массовой информации в Карлсруэ, архивируются с оригинала на 20 ноября 2010 года ; Проверено 15 марта 2010 года . Информация: ссылка на архив вставлена ​​автоматически и еще не проверена. Пожалуйста, проверьте исходную и архивную ссылку в соответствии с инструкциями, а затем удалите это уведомление. @ 1@ 2Шаблон: Webachiv / IABot / www.zkm.de
  21. Дэвид Линк: LoveLetters_1.0. MUC = Воскрешение. Мемориал. (Больше не доступны в Интернете.) Архивировано из оригинала на 28 марта 2010 года ; Проверено 15 марта 2010 года . Информация: ссылка на архив вставлена ​​автоматически и еще не проверена. Пожалуйста, проверьте исходную и архивную ссылку в соответствии с инструкциями, а затем удалите это уведомление. @ 1@ 2Шаблон: Webachiv / IABot / www.alpha60.de
  22. Андреас Штульмюллер: тексты с Марковым. (Больше не доступны в Интернете.) 14 февраля 2005, в архиве с оригинала на 17 июня 2010 года ; Проверено 24 марта 2010 года . Информация: ссылка на архив вставлена ​​автоматически и еще не проверена. Пожалуйста, проверьте исходную и архивную ссылку в соответствии с инструкциями, а затем удалите это уведомление. @ 1@ 2Шаблон: Webachiv / IABot / www.aiplayground.org
  23. VIE-GEN. Гульденов Systems Wiki, 17 ноября 2009, доступ к 15 марта 2010 .
  24. Йорг Рот :: Введение в создание текста на естественном языке. 1989, доступ к 14 марта 2010 .
  25. Рико Шванк: Анализ методов генерации текстов на естественном языке из формальных данных. Отто фон Герике университета Магдебурга, доступ к 13 марта 2010 года .