Generazione del testo

Quando la generazione del testo (inclusa la generazione del linguaggio naturale ; English Natural Language Generation , NLG ) è chiamata la produzione automatica del linguaggio naturale da parte di una macchina. Nell'ambito della linguistica computazionale, la generazione di testi è una forma speciale di intelligenza artificiale .

Processo di generazione

Per il processo di generazione esistono diversi modelli descrittivi e termini tecnici, a seconda del metodo e della prospettiva utilizzati, senza doversi contraddire in linea di principio.

Secondo Ehud Reiter , l'architettura per la generazione odierna consiste in un pianificatore di testi, un pianificatore di frasi e un'interfaccia utente standard. Per la relazione tra segmenti di testo, la teoria delle strutture retoriche, RST , viene utilizzata per modellare le relazioni del discorso. Un testo è coerente se può essere rappresentato da un albero di relazioni retoriche e unità testuali elementari (RST: Mann, Thompson): Come relazioni tra proposizioni principali e subordinate valgono i seguenti collegamenti: CAUSA, RISULTATO, ELABORAZIONE, CONTRASTO, SEQUENZA, LISTA , CONCESSIONE e altri.

Secondo M. Hess, la generazione richiede due componenti.

  • La componente strategica, cosa va detto: selezione delle informazioni, selezione dei contenuti, pianificazione del territorio. Questo componente di solito utilizza strategie di ricerca e pianificazione dell'intelligenza artificiale.
  • La componente tattica, come va detto: La progettazione della forma linguistica. Viene spesso utilizzata una grammatica adattata all'aspetto generazionale.

Ulrich Gaudenz Müller ha sviluppato insieme al germanista e linguista informatico Raimund Drewek dal 1981 al 1999 un sistema per la generazione di testi, che è stato chiamato SARA (generatore di frasi casuali).

Generazione di testi da basi di conoscenza

"Il prerequisito per qualsiasi tipo di generazione è che le informazioni da generare come testo siano disponibili come informazioni formali che possono essere elaborate dalla linguistica informatica, come B. Informazioni da banche dati o rappresentazioni della conoscenza. "

La generazione di testo da tali basi di conoscenza è disponibile in varianti per diverse attività.

  • Interfaccia con sistemi esperti
  • Produzione di documenti tecnici in più lingue da una base di conoscenza
  • Generazione automatica (di indicazioni stradali, bollettini meteorologici e rapporti di borsa)
  • Componente di generazione dei sistemi di dialogo
  • Generazione da modelli linguistici basati su trasformatori (ad es. utilizzando GPT2 / 3 )

aree di applicazione

giornalismo robotico

Il termine "giornalismo robotico", coniato dai media, si riferisce ad algoritmi in grado di generare testi di notizie già pronti da database e colonne. In questo processo, l'obiettivo è salvare e concentrarsi su giornalisti umani . Con un minor numero di dipendenti, le redazioni possono ottenere prodotti di notizie di maggiore qualità e ricerca più elaborata grazie al rilievo della macchina. D'altra parte, possono pubblicare rapporti che non possono essere scritti per mancanza di tempo o interesse insufficiente. L'uso del software nel giornalismo è ancora controverso; si discute principalmente in che modo il giornalista umano sia superiore al software. Inoltre, rimane senza risposta la questione della misura in cui i testi generati automaticamente sono soggetti alla legge sul diritto d'autore. Gli algoritmi, appositamente adattati ai dati di input, calcolano continuamente i valori e scrivono report su di essi, a intervalli di tempo specifici (ad es. bollettini meteorologici giornalieri) o quando i valori cambiano in modo significativo (ad es. allerta terremoto). Aree di applicazione particolarmente frequenti per i "giornalisti robot" sono nicchie come i rapporti sportivi di sottoclasse, i bollettini meteorologici e i ticker di borsa. Ma la creazione basata sui dati di contenuti automatizzati per la reportistica su argomenti locali è già in uso.

Chatbot

Nei sistemi di dialogo basati su testo come i chatbot , la generazione di testo viene utilizzata per comunicare con l'utente. Un noto esempio storico è il programma ELIZA .

Parte della comunicazione con agenti virtuali intelligenti altamente sviluppati si basa su questo principio, per cui la qualità del dialogo dipende, tra l'altro, dal legame tra l'agente e le basi di conoscenza. Il dialogo di una persona con diverse interfacce può essere facilitato se un agente genera un testo che risponde in modo produttivo alle domande:

  • Quando si recupera un'offerta di informazioni, tra l'altro come agente di presentazione per un sito Web (chiamato anche "moderatore online")
  • Nel caso di un programma linguistico per la scelta di un consulente (spesso utilizzato per presmistare i clienti per telefono)
  • Nei dialoghi con i personaggi dei giochi per computer

Marketing dei contenuti

Secondo uno studio, l'industria del marketing è l'industria su cui l'intelligenza artificiale avrà il maggiore impatto. Entro il 2022, si prevede che oltre il 30% dei contenuti digitali verrà creato utilizzando la tecnologia AI. Vari strumenti vengono utilizzati nel marketing per generare contenuti, come ad esempio B. la creazione di una copia pubblicitaria, la generazione dell'oggetto della newsletter e la convalida dei risultati generati dall'IA.

La generazione del testo come processo creativo

La generazione del testo può essere una componente dei processi creativi nell'arte e nella letteratura. Per le opere più lunghe, i corpi di testo completamente generati, generati in modo significativo o forniti di significato attraverso la post-elaborazione, non offrono alcuna qualità letteraria. Tuttavia, alcuni dei processi artistici della poesia digitale importanti nell'arte del secolo precedente e nell'arte contemporanea sono legati alla generazione del testo.

Processi e applicazioni nelle arti visive e nella letteratura

  • Interventi nel software di generazione o nella base di conoscenza (esperimenti artistici e letterari). Esempio (secondo Reinhard Döhl ): Max Bense e il suo gruppo di Stoccarda usarono uno Zuse Z22 nel 1959 per "sintetizzare e produrre testi con l'aiuto di un lessico immesso e un certo numero di regole sintattiche".
  • Post-elaborazione o integrazione del testo generato dagli autori (letteratura).
  • Dialogo con il pubblico (ad esempio nelle installazioni artistiche ). Esempio: David Link, Poetry Machine

Generazione di testo tramite trebbiatrice di frasi

Macchine trebbiatrici frase o generatori di stronzate (inglese generatori stronzate , anche generatori di moda ) esistevano come dispositivi meccanici prima di essere implementate in software. Le prime frasi trebbiatura probabilmente concepito come un software era LoveLetters_1.0 programmato dal 1952 Christopher Strachey presso l'Università di Manchester per la Ferranti Mark I . Generatori simili possono essere trovati in molte versioni più sviluppate sul WWW.

Tali programmi funzionano secondo concetti semplici che vengono utilizzati nei processi di generazione del testo più complessi: termini o parti di frasi sono presi da elenchi, messi insieme e corretti grammaticalmente corretti (realizzazione grammaticale). Un metodo spesso usato per questo è la generazione con catene di Markov . Il risultato è un testo sintatticamente corretto che può avere un effetto significativo, ma in realtà è una stronzata perché le macchine per la trebbiatura delle frasi non accedono alla conoscenza del significato delle particelle utilizzate. Ad esempio, la retorica vuota della letteratura specialistica può essere scherzosamente presa in giro .

storia

A parte le macchine trebbiatrici di frasi meccaniche come precursori e a parte i primi tentativi di generare testi utilizzando il software, la prima fase della generazione del linguaggio naturale inizia con programmi che accedono schematicamente alla conoscenza che è già memorizzata in forma di testo per generare testo. Ecco come funzionavano dal 1963 BASEBALL, un'interfaccia per i dati del baseball della lega americana di baseball, e SAD SAM, un'interfaccia per l'inserimento delle relazioni familiari che già rispondeva alle domande. Dopo diversi altri lavori in questa direzione, ELIZA apparve nel 1966, programmata da Joseph Weizenbaum . Nella seconda fase, la conoscenza è codificata in fatti e regole: LUNAR, 1972, è l'interfaccia al database per la raccolta dei campioni lunari della missione Apollo 11. PARRY, 1975, simula un paranoico che parla con uno psichiatra. ROBOT, 1977, è il primo sistema commerciale di domande e risposte. VIE-LANG, 1982, di Ernst Buchberger, è un sistema di dialogo in tedesco che genera frasi da una rete semantica. HAM-ANS, 1983, di Wolfgang Hoeppner, è un sistema di dialogo in tedesco che simula, ad esempio, un direttore d'albergo.

letteratura

  • Ehud Reiter, Robert Dale: Costruire sistemi di generazione del linguaggio naturale . Cambridge University Press, Cambridge 2000, ISBN 0-521-62036-8 .
  • Helmut Horacek: Generazione di testi in: Kai-Uwe Carstensen, Ralf Klabunde et al. (Ed.): Linguistica computazionale e tecnologia del linguaggio . Heidelberg: Spektrum Akademischer Verlag, 3a edizione, 2010, ISBN 978-3827420237 , pp. 436-465
  • John Bateman: Generazione del linguaggio naturale e sistemi informativi applicati in: Ralf Klabunde et al. (Ed.): Linguistica computazionale e tecnologia del linguaggio . vedi Heidelberg 2010 pp. 633–641
  • Rico Schwank: Analisi di concetti e metodi per generare testi in linguaggio naturale da dati formali Tesi di diploma. Otto von Guericke University Magdeburg, Facoltà di informatica
  • Patrick Reichelt: Introduzione al giornalismo robotico: minaccia o opportunità?. Tectum Wissenschaftsverlag, Baden-Baden 2017, ISBN 978-3828840591 .
  • Stefan Weber: Giornalismo robotico, chatbot & Co.: Come gli algoritmi producono contenuti e influenzano il nostro pensiero. Heise Medien, Hannover 2018, ISBN 978-3957881045 .

link internet

Evidenze individuali

  1. Ehud Reiter: È apparsa un'architettura di generazione NL consensuale ed è psicologicamente plausibile? in: Atti del 7°. Workshop internazionale sulla generazione del linguaggio naturale (INLGW '94). (PDF) McDonald, D. e Metereer, M., 1994, pp. 163-170 , consultato il 26 marzo 2010 (inglese).
  2. Progetto KIT-MARKER. Technische Universität Berlin, 1999, p 1,3 , archiviato dall'originale ; Estratto il 13 marzo 2010 .
  3. Michael Hess: Introduzione alla linguistica computazionale (I). (PDF) (non più disponibile online.) Università di Zurigo, Institute for Computational Linguistics, 2005, pp. 44.4 f , archiviato dall'originale il 31 marzo 2007 ; Estratto il 26 marzo 2010 . Info: Il collegamento all'archivio è stato inserito automaticamente e non è stato ancora verificato. Si prega di controllare il collegamento originale e archivio secondo le istruzioni e quindi rimuovere questo avviso.  @1@ 2Modello: Webachiv / IABot / www.ifi.unizh.ch
  4. ^ A b c Wiebke Ramm e Claudia Villiger: produzione di testi scientifici e dominio specialistico . Realizzazione linguistica di contenuti scientifici in varie discipline specialistiche e loro modellazione linguistica computazionale. In: Knorr, Dagmar / Jakobs, Eva-Maria (Ed.): Produzione di testi in ambienti elettronici . Produzione di testi e media Vol. 2. Lang Verlag, Frankfurt / Main 1997, ISBN 3-631-30970-8 , p. 214,2 ( rwth-aachen.de [PDF; letta il 15 marzo, 2010]).
  5. Susanne Göpferich, Dr. phil., Dipl.-Übers .: L'editore tecnico come attore globale: esperienza professionale e requisiti per la formazione futura. Rivista commerciale Technische Documentation 2000/05, 19 dicembre 2003, pagina 1,7 , consultata il 14 marzo 2010 : "Un sistema di generazione multilingue dotato delle corrispondenti regole di testo specifiche per tipo di testo può creare questi diversi tipi di testo per lo stesso prodotto da un unico Genera base di conoscenza. "
  6. Statistiche Scimmia. (Non più disponibile online.) Intelligent Information Laboratory - Northwestern University, 2009, archiviato dall'originale il 16 novembre 2010 ; accesso il 24 marzo 2010 (inglese). Info: Il collegamento all'archivio è stato inserito automaticamente e non è stato ancora verificato. Si prega di controllare il collegamento originale e archivio secondo le istruzioni e quindi rimuovere questo avviso. @1@ 2Modello: Webachiv / IABot / infolab.northwestern.edu
  7. Alec Radford et al. : I modelli linguistici sono studenti multitasking senza supervisione 2018
  8. http://www.text-gold.de/fundstuecke/roboterjournalismus-haben-und-schreiben/ , consultato il 29 ottobre 2014
  9. Opere create autonomamente da computer: meritevoli di tutela del diritto d'autore? Estratto l'8 novembre 2018 .
  10. Julian Maitra: Media: I giornalisti robot sono già tra noi. In: welt.de . 15 maggio 2014, consultato il 7 ottobre 2018 .
  11. ^ Andreas Graefe: Guida al giornalismo automatizzato . Columbia Journalism Review, New York City 2016 (consultato il 14 febbraio 2018).
  12. I giornalisti robot salvano la stampa locale. Chi ci salverà da questo? Estratto il 20 novembre 2018 (tedesco).
  13. Josef Karner: Mailüfterl, Al Chorezmi e l'intelligenza artificiale: una conversazione con il pioniere dei computer Heinz Zemanek. Telepolis, 8 agosto 1999, pagina 1 , archiviata dall'originale il 22 gennaio 2005 ; accesso il 20 marzo 2010 (domanda 20 ss): "Weizenbaum non ha creato l'intelligenza e nemmeno la coscienza, ma ha mostrato i mezzi semplici con cui si può far credere a uno spettatore di avere a che fare con l'intelligenza".
  14. ^ Dimensionamento del valore potenziale dell'intelligenza artificiale e dell'analisi avanzata | McKinsey. Estratto il 26 maggio 2021 .
  15. Gartner prevede il 2019: alla ricerca dell'equilibrio nel marketing. Estratto il 26 maggio 2021 .
  16. Perché i team di marketing dovrebbero utilizzare la generazione di contenuti AI. In: neuroflash. 10 maggio 2021, accesso 26 maggio 2021 (tedesco).
  17. ^ Roberto Simanowski: Scrittura automatica. XCULT, consultato il 15 marzo 2010 (presentazione al simposio Narrations in Media Art).
  18. Reinhard Doehl: Il cerchio intorno a Max Bense. Estratto il 16 marzo 2010 (sezione di poesia artificiale 5).
  19. Reinhard Doehl: Il cerchio intorno a Max Bense. Estratto il 16 marzo 2010 (sezione di poesia artificiale 6).
  20. ^ Miriam Stürner: David Link, Poetry Machine (versione 1.0), 2001-2002. (Non più disponibile online.) ZKM, Center for Art and Media Karlsruhe, archiviato dall'originale il 20 novembre 2010 ; Estratto il 15 marzo 2010 . Info: Il collegamento all'archivio è stato inserito automaticamente e non è stato ancora verificato. Si prega di controllare il collegamento originale e archivio secondo le istruzioni e quindi rimuovere questo avviso. @1@ 2Modello: Webachiv / IABot / www.zkm.de
  21. David Link: LoveLetters_1.0. MUC = Resurrezione. Un memoriale. (Non più disponibile online.) Archiviato dall'originale il 28 marzo 2010 ; Estratto il 15 marzo 2010 . Info: Il collegamento all'archivio è stato inserito automaticamente e non è stato ancora verificato. Si prega di controllare il collegamento originale e archivio secondo le istruzioni e quindi rimuovere questo avviso. @1@ 2Modello: Webachiv / IABot / www.alpha60.de
  22. Andreas Stuhlmüller: testi con Markov. (Non più disponibile online.) 14 febbraio 2005, archiviato dall'originale il 17 giugno 2010 ; Estratto il 24 marzo 2010 . Info: Il collegamento all'archivio è stato inserito automaticamente e non è stato ancora verificato. Si prega di controllare il collegamento originale e archivio secondo le istruzioni e quindi rimuovere questo avviso. @1@ 2Modello: Webachiv / IABot / www.aiplayground.org
  23. VIE-GEN. Wiki di NLG Systems, 17 novembre 2009, consultato il 15 marzo 2010 .
  24. Jörg Roth :: Introduzione alla generazione di testi in linguaggio naturale. 1989, consultato il 14 marzo 2010 .
  25. Rico Schwank: Analisi dei metodi per generare testi in linguaggio naturale da dati formali. Otto von Guericke University Magdeburg, consultato il 13 marzo 2010 .