Estrazione di informazioni - Information extraction

L'estrazione delle informazioni ( IE ) è il compito di estrarre automaticamente informazioni strutturate da documenti non strutturati e/o semi-strutturati leggibili da una macchina e da altre fonti rappresentate elettronicamente. Nella maggior parte dei casi questa attività riguarda l'elaborazione di testi in linguaggio umano mediante l'elaborazione del linguaggio naturale (PNL). Le attività recenti nell'elaborazione di documenti multimediali come l'annotazione automatica e l'estrazione di contenuti da immagini/audio/video/documenti potrebbero essere viste come estrazione di informazioni

A causa della difficoltà del problema, gli attuali approcci a IE si concentrano su domini ristretti. Un esempio è l'estrazione da notiziari di fusioni societarie, come indicato dalla relazione formale:

,

da una frase di notizie online come:

"Ieri, la Foo Inc. con sede a New York ha annunciato l'acquisizione di Bar Corp."

Un obiettivo generale di IE è consentire l'esecuzione di calcoli sui dati precedentemente non strutturati. Un obiettivo più specifico è consentire al ragionamento logico di trarre inferenze basate sul contenuto logico dei dati di input. I dati strutturati sono dati semanticamente ben definiti da un dominio target scelto, interpretati rispetto alla categoria e al contesto .

L'estrazione delle informazioni è la parte di un puzzle più grande che affronta il problema di escogitare metodi automatici per la gestione del testo, al di là della sua trasmissione, memorizzazione e visualizzazione. La disciplina del recupero delle informazioni (IR) ha sviluppato metodi automatici, tipicamente di tipo statistico, per l'indicizzazione di grandi raccolte di documenti e la classificazione dei documenti. Un altro approccio complementare è quello dell'elaborazione del linguaggio naturale (PNL) che ha risolto il problema della modellazione dell'elaborazione del linguaggio umano con notevole successo, tenendo conto dell'entità del compito. In termini sia di difficoltà che di enfasi, IE si occupa di compiti tra IR e PNL. In termini di input, IE presuppone l'esistenza di un insieme di documenti in cui ogni documento segue un modello, ovvero descrive una o più entità o eventi in modo simile a quelli di altri documenti ma diversi nei dettagli. Un esempio, si consideri un gruppo di articoli giornalistici sul terrorismo latinoamericano, ciascuno dei quali si presume basato su uno o più atti terroristici. Definiamo anche per ogni dato compito di IE un modello, che è un (o un insieme di) case frame per contenere le informazioni contenute in un singolo documento. Per l'esempio del terrorismo, un modello avrebbe slot corrispondenti all'autore, alla vittima e all'arma dell'atto terroristico e alla data in cui si è verificato l'evento. Un sistema IE per questo problema è necessario per "capire" un articolo di attacco solo quanto basta per trovare i dati corrispondenti agli slot in questo modello.

Storia

L'estrazione delle informazioni risale alla fine degli anni '70 nei primi giorni della PNL. Un primo sistema commerciale della metà degli anni '80 fu JASPER costruito per Reuters dal Carnegie Group Inc con l'obiettivo di fornire notizie finanziarie in tempo reale agli operatori finanziari.

A partire dal 1987, IE è stata stimolata da una serie di Conferenze sulla comprensione dei messaggi . MUC è una conferenza basata sulla competizione che si è concentrata sui seguenti domini:

  • MUC-1 (1987), MUC-2 (1989): messaggi di operazioni navali.
  • MUC-3 (1991), MUC-4 (1992): Terrorismo nei paesi dell'America Latina.
  • MUC-5 (1993): Joint ventures e dominio della microelettronica.
  • MUC-6 (1995): Articoli di notizie sui cambiamenti di gestione.
  • MUC-7 (1998): Rapporti di lancio del satellite.

Un notevole sostegno è arrivato dall'Agenzia per i progetti di ricerca avanzata della difesa degli Stati Uniti ( DARPA ), che desiderava automatizzare le attività banali svolte dagli analisti del governo, come la scansione dei giornali per possibili collegamenti al terrorismo.

significato attuale

L'attuale significato di IE riguarda la crescente quantità di informazioni disponibili in forma non strutturata. Tim Berners-Lee , inventore del world wide web , si riferisce all'Internet esistente come alla rete di documenti e sostiene che una maggior parte dei contenuti sia resa disponibile come una rete di dati . Fino a quando ciò non accadrà, il web è costituito in gran parte da documenti non strutturati privi di metadati semantici . La conoscenza contenuta in questi documenti può essere resa più accessibile per l'elaborazione automatica mediante trasformazione in forma relazionale o marcatura con tag XML . Un agente intelligente che monitora un feed di dati di notizie richiede che IE trasformi i dati non strutturati in qualcosa con cui è possibile ragionare. Una tipica applicazione di IE è quella di scansionare un insieme di documenti scritti in un linguaggio naturale e popolare un database con le informazioni estratte.

Compiti e sottocompiti

L'applicazione dell'estrazione delle informazioni al testo è legata al problema della semplificazione del testo al fine di creare una vista strutturata delle informazioni presenti nel testo libero. L'obiettivo generale è creare un testo più facilmente leggibile dalla macchina per elaborare le frasi. Le attività e le sottoattività tipiche di IE includono:

  • Compilazione del modello: estrazione di un insieme fisso di campi da un documento, ad es. estrazione di autori, vittime, ora, ecc. da un articolo di giornale su un attacco terroristico.
    • Estrazione di eventi: dato un documento di input, output di zero o più modelli di eventi. Ad esempio, un articolo di giornale potrebbe descrivere più attacchi terroristici.
  • Popolazione della base di conoscenza : riempire un database di fatti data una serie di documenti. Tipicamente il database è sotto forma di triplette, (entità 1, relazione, entità 2), ad esempio ( Barack Obama , Spouse, Michelle Obama )
    • Chiamato riconoscimento dell'entità : riconoscimento dei nomi noti di entità (per le persone e le organizzazioni), nomi di luoghi, espressioni temporali, e alcuni tipi di espressioni numeriche, utilizzando le conoscenze esistenti del dominio o informazioni estratte da altre frasi. In genere l'attività di riconoscimento comporta l'assegnazione di un identificatore univoco all'entità estratta. Un'attività più semplice è denominata rilevamento di entità , che mira a rilevare le entità senza avere alcuna conoscenza esistente sulle istanze dell'entità. Ad esempio, nell'elaborazione della frase "M. Smith piace pescare", il rilevamento di entità denominate denota il rilevamento che la frase "M. Smith" si riferisce a una persona, ma senza necessariamente avere (o utilizzare) alcuna conoscenza di un certo M. Smith che è (o, "potrebbe essere") la persona specifica di cui sta parlando quella frase.
    • Coreference Risoluzione: rilevamento di coreference e anaforiche collegamenti tra entità di testo. Nelle attività di IE, questo è in genere limitato alla ricerca di collegamenti tra entità denominate estratte in precedenza. Ad esempio, "International Business Machines" e "IBM" si riferiscono alla stessa entità del mondo reale. Se prendiamo le due frasi "M. Smith ama pescare. Ma non gli piace andare in bicicletta", sarebbe utile rilevare che "lui" si riferisce alla persona precedentemente rilevata "M. Smith".
    • Estrazione delle relazioni: identificazione delle relazioni tra entità, quali:
      • PERSON lavora per l'ORGANIZZAZIONE (estratto dalla frase "Bill lavora per IBM.")
      • PERSONA situata in LOCATION (estratto dalla frase "Bill is in France.")
  • Estrazione di informazioni semi-strutturate che può fare riferimento a qualsiasi IE che cerca di ripristinare un qualche tipo di struttura informativa che è stata persa durante la pubblicazione, come ad esempio:
    • Estrazione di tabelle: ricerca ed estrazione di tabelle dai documenti.
    • Estrazione delle informazioni dalle tabelle: estrazione delle informazioni in modo strutturato dalle tabelle. Questo è un compito più complesso dell'estrazione della tabella, poiché l'estrazione della tabella è solo il primo passaggio, mentre comprendere i ruoli delle celle, righe, colonne, collegare le informazioni all'interno della tabella e comprendere le informazioni presentate nella tabella sono attività aggiuntive necessarie per la tabella estrazione di informazioni.
    • Estrazione dei commenti: estrazione dei commenti dal contenuto effettivo dell'articolo al fine di ripristinare il collegamento tra l'autore di ogni frase
  • Analisi della lingua e del vocabolario
  • Estrazione audio
    • Estrazione musicale basata su template: trovare caratteristiche rilevanti in un segnale audio tratto da un dato repertorio; ad esempio si possono estrarre indici temporali di occorrenze di suoni percussivi in ​​modo da rappresentare la componente ritmica essenziale di un brano musicale.

Si noti che questo elenco non è esaustivo e che il significato esatto delle attività di IE non è comunemente accettato e che molti approcci combinano più sotto-compiti di IE per raggiungere un obiettivo più ampio. In IE vengono spesso utilizzati l'apprendimento automatico, l'analisi statistica e/o l'elaborazione del linguaggio naturale.

IE sui documenti non testuali sta diventando un argomento di ricerca sempre più interessante e le informazioni estratte dai documenti multimediali possono ora essere espresse in una struttura di alto livello come avviene sul testo. Questo porta naturalmente alla fusione delle informazioni estratte da più tipi di documenti e fonti.

Applicazioni World Wide Web

IE è stato al centro delle conferenze MUC. La proliferazione del Web , tuttavia, ha intensificato la necessità di sviluppare sistemi di IE che aiutino le persone a far fronte all'enorme quantità di dati disponibili online. I sistemi che eseguono IE da testo online dovrebbero soddisfare i requisiti di basso costo, flessibilità nello sviluppo e facile adattamento a nuovi domini. I sistemi MUC non soddisfano tali criteri. Inoltre, l'analisi linguistica eseguita per il testo non strutturato non sfrutta i tag HTML/ XML e i formati di layout disponibili nei testi online. Di conseguenza, sono stati sviluppati approcci meno intensivi dal punto di vista linguistico per IE sul Web utilizzando i wrapper , che sono insiemi di regole altamente accurate che estraggono il contenuto di una particolare pagina. Lo sviluppo manuale dei wrapper si è rivelato un'attività dispendiosa in termini di tempo, che richiede un alto livello di competenza. Tecniche di apprendimento automatico , supervisionate o non supervisionate , sono state utilizzate per indurre automaticamente tali regole.

I wrapper in genere gestiscono raccolte altamente strutturate di pagine Web, come cataloghi di prodotti ed elenchi telefonici. Falliscono, tuttavia, quando il tipo di testo è meno strutturato, cosa comune anche sul Web. I recenti sforzi sull'estrazione adattiva delle informazioni motivano lo sviluppo di sistemi IE in grado di gestire diversi tipi di testo, dal testo ben strutturato a quello quasi libero, dove i wrapper comuni falliscono, compresi i tipi misti. Tali sistemi possono sfruttare una conoscenza superficiale del linguaggio naturale e quindi possono essere applicati anche a testi meno strutturati.

Uno sviluppo recente è Visual Information Extraction, che si basa sul rendering di una pagina Web in un browser e sulla creazione di regole basate sulla vicinanza delle regioni nella pagina Web sottoposta a rendering. Ciò aiuta nell'estrazione di entità da pagine Web complesse che possono presentare uno schema visivo, ma mancano di uno schema riconoscibile nel codice sorgente HTML.

approcci

I seguenti approcci standard sono ora ampiamente accettati:

Esistono numerosi altri approcci per IE, inclusi approcci ibridi che combinano alcuni degli approcci standard elencati in precedenza.

Software e servizi gratuiti o open source

Guarda anche

Riferimenti

  1. ^ FREITAG, DAYNE. "Apprendimento automatico per l'estrazione di informazioni in domini informali" (PDF) . 2000 Editori accademici Kluwer. Stampato nei Paesi Bassi .
  2. ^ Andersen, Peggy M.; Hayes, Philip J.; Huettner, Alison K.; Schmandt, Linda M.; Nirenburg, Irene B.; Weinstein, Steven P. (1992). "Estrazione automatica di fatti dai comunicati stampa per generare notizie" . Atti della terza conferenza sull'elaborazione applicata del linguaggio naturale - . pp. 170-177. CiteSeerX  10.1.1.14.7943 . doi : 10.3115/974499.974531 . S2CID  14746386 .
  3. ^ Cowie, Jim; Wilks, Yorick (1996). Estrazione di informazioni (PDF) . P. 3. CiteSeerX  10.1.1.61.6480 . S2CID  10237124 . Archiviato dall'originale (PDF) il 20/02/2019.
  4. ^ Marco Costantino, Paolo Coletti, Information Extraction in Finance, Wit Press, 2008. ISBN  978-1-84564-146-7
  5. ^ "Dati collegati - La storia finora" (PDF) .
  6. ^ "Tim Berners-Lee sul prossimo Web" .
  7. ^ RK Srihari , W. Li, C. Niu e T. Cornell, "InfoXtract: A Customizable Intermediate Level Information Extraction Engine", Journal of Natural Language Engineering , Cambridge U. Press, 14(1), 2008, pp.33- 69.
  8. ^ a b Dat Quoc Nguyen e Karin Verspoor (2019). "Estrazione delle relazioni neurali end-to-end utilizzando l'attenzione biaffine profonda". Atti della 41a Conferenza europea sul recupero delle informazioni (ECIR) . arXiv : 1812.11275 . doi : 10.1007/978-3-030-15712-8_47 .
  9. ^ Milosevic N, Gregson C, Hernandez R, Nenadic G (febbraio 2019). "Un quadro per l'estrazione di informazioni dalle tabelle nella letteratura biomedica". Rivista internazionale sull'analisi e il riconoscimento dei documenti (IJDAR) . 22 (1): 55-78. arXiv : 1902.10031 . Bibcode : 2019arXiv190210031M . doi : 10.1007/s10032-019-00317-0 . S2CID  62880746 .
  10. ^ Milosevic, Nikola (2018). Un approccio multilivello all'estrazione di informazioni dalle tabelle nei documenti biomedici (PDF) (PhD). Università di Manchester.
  11. ^ Milosevic N, Gregson C, Hernandez R, Nenadic G (febbraio 2019). "Un quadro per l'estrazione di informazioni dalle tabelle nella letteratura biomedica". Rivista internazionale sull'analisi e il riconoscimento dei documenti (IJDAR) . 22 (1): 55-78. arXiv : 1902.10031 . Bibcode : 2019arXiv190210031M . doi : 10.1007/s10032-019-00317-0 . S2CID  62880746 .
  12. ^ Milosevic N, Gregson C, Hernandez R, Nenadic G (giugno 2016). "Districare la struttura delle tabelle nella letteratura scientifica" . 21a Conferenza Internazionale sulle Applicazioni del Linguaggio Naturale ai Sistemi Informativi . Appunti delle lezioni di Informatica. 21 : 162-174. doi : 10.1007/978-3-319-41754-7_14 . ISBN 978-3-319-41753-0.
  13. ^ Milosevic, Nikola (2018). Un approccio multilivello all'estrazione di informazioni dalle tabelle nei documenti biomedici (PDF) (PhD). Università di Manchester.
  14. ^ A.Zils, F.Pachet, O.Delerue e F. Gouyon, Estrazione automatica di tracce di batteria da segnali musicali polifonici , Atti di WedelMusic, Darmstadt, Germania, 2002.
  15. ^ Chenthamarakshan, Vijil; Despande, Prasad M; Krishnapuram, Raghu; Varadarajan, Ramakrishnan; Stolze, Knut (2015). "WYSIWYE: un'algebra per esprimere regole spaziali e testuali per l'estrazione di informazioni". arXiv : 1506.08454 [ cs.CL ].
  16. ^ Baumgartner, Robert; Flesca, Sergio; Gottlob, Georg (2001). "Estrazione di informazioni sul Web visivo con Lixto": 119-128. CiteSeerX  10.1.1.1.21.8236 . Citare il diario richiede |journal=( aiuto )
  17. ^ Peng, F.; McCallum, A. (2006). "Estrazione di informazioni da documenti di ricerca utilizzando campi casuali condizionali☆". Elaborazione e gestione delle informazioni . 42 (4): 963. doi : 10.1016/j.ipm.2005.09.002 .
  18. ^ Shimizu, Nobuyuki; Hass, Andrew (2006). "Estrazione della rappresentazione della conoscenza basata su frame dalle istruzioni di percorso" (PDF) . Archiviato dall'originale (PDF) il 01-09-2006 . Estratto il 27/03/2010 .

link esterno