Esempi di data mining - Examples of data mining

Il data mining , il processo di scoperta di modelli in grandi set di dati , è stato utilizzato in molte applicazioni.

Giochi

Dall'inizio degli anni '60, con la disponibilità di oracoli per alcuni giochi combinatori , chiamati anche tablebase (ad es. per scacchi 3x3) con qualsiasi configurazione iniziale, puntini e riquadri a scacchiera, esadecimale a scacchiera e alcuni finali negli scacchi , punti e riquadri ed esadecimale; è stata aperta una nuova area per il data mining. Questa è l'estrazione di strategie utilizzabili dall'uomo da questi oracoli. Gli attuali approcci di riconoscimento dei modelli non sembrano acquisire completamente l'alto livello di astrazione necessario per essere applicati con successo. Invece, un'ampia sperimentazione con i tablebase - combinata con uno studio intensivo delle risposte dei tablebase a problemi ben progettati, e con la conoscenza dell'arte precedente (ad esempio, la conoscenza pre-tablebase) - viene utilizzata per produrre modelli perspicaci. Berlekamp (in punti e riquadri, ecc.) e John Nunn (nei finali di scacchi ) sono notevoli esempi di ricercatori che hanno svolto questo lavoro, sebbene non fossero – e non siano – coinvolti nella generazione di tablebase.

Attività commerciale

Nel mondo degli affari, il data mining è l'analisi delle attività aziendali storiche, archiviate come dati statici in database di data warehouse. L'obiettivo è rivelare modelli e tendenze nascosti. Il software di data mining utilizza algoritmi avanzati di riconoscimento dei modelli per setacciare grandi quantità di dati per aiutare a scoprire informazioni strategiche aziendali precedentemente sconosciute. Esempi di ciò per cui le aziende utilizzano il data mining includono l'esecuzione di analisi di mercato per identificare nuovi pacchetti di prodotti, trovare la causa principale dei problemi di produzione, prevenire l'attrito dei clienti e acquisire nuovi clienti, vendita incrociata ai clienti esistenti e profilare i clienti con maggiore precisione .

  • Nel mondo di oggi i dati grezzi vengono raccolti dalle aziende a un ritmo esplosivo. Ad esempio, Walmart elabora ogni giorno oltre 20 milioni di transazioni presso i punti vendita. Queste informazioni sono archiviate in un database centralizzato, ma sarebbero inutili senza un qualche tipo di software di data mining per analizzarle. Se Walmart analizzasse i dati del punto vendita con tecniche di data mining, sarebbe in grado di determinare le tendenze di vendita, sviluppare campagne di marketing e prevedere in modo più accurato la fedeltà dei clienti.
  • La categorizzazione degli articoli disponibili nel sito e-commerce è un problema fondamentale. Un corretto sistema di categorizzazione degli articoli è essenziale per l'esperienza dell'utente in quanto aiuta a determinare gli elementi per lui rilevanti per la ricerca e la navigazione. La categorizzazione degli elementi può essere formulata come un problema di classificazione supervisionato nel data mining in cui le categorie sono le classi di destinazione e le caratteristiche sono le parole che compongono una descrizione testuale degli elementi. Uno degli approcci è trovare inizialmente gruppi simili e metterli insieme in un gruppo latente. Ora dato un nuovo elemento, prima classificare in un gruppo latente che è chiamato classificazione di livello grossolano. Quindi, esegui un secondo giro di classificazione per trovare la categoria a cui appartiene l'elemento.
  • Ogni volta che si utilizza una carta di credito o una carta fedeltà del negozio o si compila una carta di garanzia, vengono raccolti dati sul comportamento dell'utente. Molte persone trovano inquietante la quantità di informazioni memorizzate su di noi da aziende come Google, Facebook e Amazon e sono preoccupate per la privacy. Sebbene esista la possibilità che i nostri dati personali vengano utilizzati in modi dannosi o indesiderati, vengono utilizzati anche per migliorare la nostra vita. Ad esempio, Ford e Audi sperano di raccogliere un giorno informazioni sui modelli di guida dei clienti in modo da poter consigliare percorsi più sicuri e avvisare i conducenti delle condizioni stradali pericolose.
  • Il data mining nelle applicazioni di gestione delle relazioni con i clienti può contribuire in modo significativo ai profitti. Anziché contattare casualmente un potenziale cliente o un cliente tramite un call center o inviare posta, un'azienda può concentrare i propri sforzi sui potenziali clienti che si prevede abbiano un'elevata probabilità di rispondere a un'offerta. Metodi più sofisticati possono essere utilizzati per ottimizzare le risorse attraverso le campagne in modo che si possa prevedere a quale canale e a quale offerta un individuo risponde con maggiore probabilità (tra tutte le potenziali offerte). Inoltre, applicazioni sofisticate potrebbero essere utilizzate per automatizzare la posta. Una volta determinati i risultati del data mining (potenziale cliente/prospetto e canale/offerta), questa "applicazione sofisticata" può inviare automaticamente un'e-mail o una posta ordinaria. Infine, nei casi in cui molte persone intraprendono un'azione senza un'offerta, è possibile utilizzare il " modello uplift " per determinare quali persone hanno il maggior aumento di risposta se ricevono un'offerta. La modellazione uplift consente quindi ai professionisti del marketing di concentrare gli invii e le offerte su persone persuasibili e di non inviare offerte a persone che acquisteranno il prodotto senza un'offerta. Il clustering di dati può essere utilizzato anche per scoprire automaticamente i segmenti oi gruppi all'interno di un set di dati del cliente.
  • Le aziende che utilizzano il data mining possono vedere un ritorno sull'investimento, ma riconoscono anche che il numero di modelli predittivi può diventare rapidamente molto grande. Ad esempio, invece di utilizzare un modello per prevedere quanti clienti abbandoneranno , un'azienda può scegliere di creare un modello separato per ogni regione e tipo di cliente. In situazioni in cui è necessario mantenere un gran numero di modelli, alcune aziende si rivolgono a metodologie di data mining più automatizzate.
  • Il data mining può essere utile ai reparti delle risorse umane (HR) nell'identificare le caratteristiche dei loro dipendenti di maggior successo. Le informazioni ottenute, come le università frequentate da dipendenti di grande successo, possono aiutare le risorse umane a focalizzare di conseguenza gli sforzi di reclutamento. Inoltre, le applicazioni di Strategic Enterprise Management aiutano un'azienda a tradurre gli obiettivi a livello aziendale, come obiettivi di quota di profitto e margine, in decisioni operative, come piani di produzione e livelli di forza lavoro.
  • L'analisi del paniere di mercato è stata utilizzata per identificare i modelli di acquisto dell'Alpha Consumer . L'analisi dei dati raccolti su questo tipo di utenza ha consentito alle aziende di prevedere i futuri trend di acquisto e prevedere le richieste di fornitura.
  • Il data mining è uno strumento molto efficace nel settore del marketing del catalogo. I catalogatori hanno un ricco database di cronologia delle transazioni dei loro clienti per milioni di clienti che risalgono a diversi anni. Gli strumenti di data mining possono identificare i modelli tra i clienti e aiutare a identificare i clienti più propensi a rispondere alle prossime campagne di mailing.
  • Il data mining per le applicazioni aziendali può essere integrato in un complesso processo decisionale e di modellazione. LIONsolver utilizza la business intelligence reattiva (RBI) per sostenere un approccio "olistico" che integri data mining, modellazione e visualizzazione interattiva in un processo di scoperta end-to-end e innovazione continua alimentato dall'apprendimento umano e automatizzato.
  • Nell'area del processo decisionale , l'approccio RBI è stato utilizzato per estrarre la conoscenza che viene progressivamente acquisita dal decisore e quindi autoregolare il metodo decisionale di conseguenza. La relazione tra la qualità di un sistema di data mining e la quantità di investimento che il decisore è disposto a fare è stata formalizzata fornendo una prospettiva economica sul valore della "conoscenza estratta" in termini di payoff per l'organizzazione. Il quadro di classificazione è stato applicato a una linea di produzione di wafer di semiconduttori del mondo reale, in cui sono state sviluppate regole decisionali per monitorare e controllare efficacemente la linea di fabbricazione di wafer di semiconduttori.
  • Un esempio di data mining relativo a una linea di produzione di circuiti integrati (IC) è descritto nel documento "Mining IC Test Data to Optimize VLSI Testing". In questo articolo viene descritta l'applicazione del data mining e dell'analisi decisionale al problema dei test funzionali a livello di stampo. Gli esperimenti citati dimostrano la capacità di applicare un sistema di estrazione dei dati storici dei test di stampo per creare un modello probabilistico di modelli di guasto dello stampo. Questi modelli vengono quindi utilizzati per decidere, in tempo reale, quale muore sottoporre a test e quando interrompere il test. È stato dimostrato che questo sistema, sulla base di esperimenti con dati di test storici, ha il potenziale per migliorare i profitti sui prodotti IC maturi. Altri esempi dell'applicazione di metodologie di data mining in ambienti di produzione di semiconduttori suggeriscono che le metodologie di data mining possono essere particolarmente utili quando i dati sono scarsi e i vari parametri fisici e chimici che influenzano il processo mostrano interazioni altamente complesse. Un'altra implicazione è che il monitoraggio in linea del processo di produzione dei semiconduttori utilizzando il data mining può essere molto efficace.

Scienza e ingegneria

Negli ultimi anni, il data mining è stato ampiamente utilizzato nei settori della scienza e dell'ingegneria, come la bioinformatica , la genetica , la medicina , l' istruzione e l' ingegneria dell'energia elettrica .

  • Nello studio della genetica umana, l' estrazione di sequenze aiuta ad affrontare l'importante obiettivo di comprendere la relazione di mappatura tra le variazioni interindividuali nella sequenza del DNA umano e la variabilità nella suscettibilità alle malattie. In parole povere, mira a scoprire come i cambiamenti nella sequenza del DNA di un individuo influenzino i rischi di sviluppare malattie comuni come il cancro , che è di grande importanza per migliorare i metodi di diagnosi, prevenzione e trattamento di queste malattie. Un metodo di data mining utilizzato per eseguire questa attività è noto come riduzione della dimensionalità multifattoriale .
  • Nell'area dell'ingegneria dell'energia elettrica, i metodi di data mining sono stati ampiamente utilizzati per il monitoraggio delle condizioni delle apparecchiature elettriche ad alta tensione. Lo scopo del monitoraggio delle condizioni è ottenere informazioni preziose, ad esempio, sullo stato dell'isolamento (o su altri importanti parametri relativi alla sicurezza). Le tecniche di clustering dei dati , come la mappa auto-organizzata (SOM), sono state applicate al monitoraggio delle vibrazioni e all'analisi dei commutatori sotto carico del trasformatore (OLTCS). Utilizzando il monitoraggio delle vibrazioni, si può osservare che ogni operazione di cambio di presa genera un segnale che contiene informazioni sulla condizione dei contatti del commutatore di presa e dei meccanismi di azionamento. Ovviamente, diverse posizioni di presa genereranno segnali diversi. Tuttavia, c'era una notevole variabilità tra i segnali di condizione normale per esattamente la stessa posizione di presa. SOM è stato applicato per rilevare condizioni anomale e per ipotizzare la natura delle anomalie.
  • I metodi di data mining sono stati applicati all'analisi del gas disciolto (DGA) nei trasformatori di potenza . DGA, come diagnostica per trasformatori di potenza, è disponibile da molti anni. Metodi come SOM sono stati applicati per analizzare i dati generati e per determinare tendenze che non sono ovvie ai metodi del rapporto DGA standard (come il triangolo di Duval).
  • Nella ricerca educativa, dove il data mining è stato utilizzato per studiare i fattori che portano gli studenti a scegliere di adottare comportamenti che riducono il loro apprendimento e per comprendere i fattori che influenzano la fidelizzazione degli studenti universitari. Un esempio simile di applicazione sociale del data mining è il suo uso nei sistemi di ricerca delle competenze , in cui i descrittori delle competenze umane vengono estratti, normalizzati e classificati in modo da facilitare la ricerca di esperti, in particolare nei campi scientifici e tecnici. In questo modo, il data mining può facilitare la memoria istituzionale .
  • Metodi di data mining di dati biomedici facilitati da ontologie di dominio , data mining di dati di studi clinici e analisi del traffico utilizzando SOM.
  • Nella sorveglianza delle reazioni avverse ai farmaci, il Centro di monitoraggio di Uppsala , dal 1998, ha utilizzato metodi di estrazione dei dati per esaminare regolarmente i modelli di segnalazione indicativi di problemi emergenti di sicurezza dei farmaci nel database globale dell'OMS di 4,6 milioni di sospetti incidenti di reazioni avverse ai farmaci . Recentemente, è stata sviluppata una metodologia simile per estrarre grandi raccolte di cartelle cliniche elettroniche per modelli temporali che associano prescrizioni di farmaci a diagnosi mediche.
  • Il data mining è stato applicato agli artefatti software nell'ambito dell'ingegneria del software : Mining Software Repositories .
  • Nel campo della microbiologia, sono stati utilizzati metodi di data mining per prevedere il comportamento della popolazione dei batteri negli alimenti.

Diritti umani

Il data mining di documenti governativi – in particolare i registri del sistema giudiziario (cioè, tribunali, carceri) – consente la scoperta di violazioni sistemiche dei diritti umani in relazione alla generazione e pubblicazione di documenti legali non validi o fraudolenti da parte di varie agenzie governative.

Estrazione di dati medici

Alcuni algoritmi di machine learning possono essere applicati in campo medico come strumenti diagnostici di secondo parere e come strumenti per la fase di estrazione della conoscenza nel processo di scoperta della conoscenza nei database . Uno di questi classificatori (denominato Prototype exemplar learning classifier ( PEL-C ) è in grado di scoprire sia sindromi che casi clinici atipici.

Un campo medico attuale che utilizza il processo di data mining è la Metabolomica , che è l'indagine e lo studio delle molecole biologiche e di come è caratterizzata la loro interazione con fluidi corporei, cellule, tessuti, ecc. La metabolomica è un argomento molto ricco di dati e spesso comporta il vagliare enormi quantità di dati irrilevanti prima di trarre conclusioni. Il data mining ha permesso a questo campo relativamente nuovo della ricerca medica di crescere considerevolmente nell'ultimo decennio e sarà probabilmente il metodo con cui si trovano nuove ricerche all'interno dell'argomento.

Nel 2011, il caso Sorrell v. IMS Health, Inc. , deciso dalla Corte Suprema degli Stati Uniti , ha stabilito che le farmacie possono condividere informazioni con società esterne. Questa pratica è stata autorizzata dal 1° Emendamento della Costituzione , a tutela della "libertà di parola". Tuttavia, l'approvazione dell'Health Information Technology for Economic and Clinical Health Act (HITECH Act) ha contribuito ad avviare l'adozione della cartella clinica elettronica (EHR) e della tecnologia di supporto negli Stati Uniti. L'HITECH Act è stato convertito in legge il 17 febbraio 2009 come parte dell'American Recovery and Reinvestment Act (ARRA) e ha contribuito ad aprire le porte all'estrazione di dati medici. Prima della firma di questa legge, si stima che solo il 20% dei medici con sede negli Stati Uniti utilizzasse cartelle cliniche elettroniche. Søren Brunak osserva che "il record del paziente diventa il più ricco di informazioni possibile" e quindi "massimizza le opportunità di data mining". Pertanto, le cartelle cliniche elettroniche ampliano ulteriormente le possibilità relative all'estrazione di dati medici, aprendo così la porta a una vasta fonte di analisi dei dati medici.

Data mining spaziale

Il data mining spaziale è l'applicazione di metodi di data mining ai dati spaziali. L'obiettivo finale del data mining spaziale è trovare modelli nei dati rispetto alla geografia. Finora, il data mining e i sistemi di informazione geografica (GIS) sono esistiti come due tecnologie separate, ciascuna con i propri metodi, tradizioni e approcci alla visualizzazione e all'analisi dei dati. In particolare, la maggior parte dei GIS contemporanei ha solo funzionalità di analisi spaziale di base. L'immensa esplosione di dati di riferimento geografico provocata dagli sviluppi dell'IT, della mappatura digitale, del telerilevamento e della diffusione globale del GIS sottolinea l'importanza di sviluppare approcci induttivi basati sui dati all'analisi e alla modellazione geografica.

Il data mining offre grandi potenziali vantaggi per il processo decisionale applicato basato su GIS. Recentemente, il compito di integrare queste due tecnologie è diventato di fondamentale importanza, soprattutto perché varie organizzazioni del settore pubblico e privato che possiedono enormi database con dati tematici e geografici iniziano a realizzare l'enorme potenziale delle informazioni in esse contenute. Tra queste organizzazioni ci sono:

  • Uffici che richiedono analisi o diffusione di dati statistici georeferenziati
  • Servizi di sanità pubblica alla ricerca di spiegazioni sul raggruppamento di malattie
  • Agenzie ambientali che valutano l'impatto dei cambiamenti nei modelli di uso del suolo sui cambiamenti climatici
  • Società di geomarketing che effettuano la segmentazione dei clienti in base alla posizione spaziale.

Sfide nell'estrazione spaziale: i repository di dati geospaziali tendono ad essere molto grandi. Inoltre, i set di dati GIS esistenti sono spesso frammentati in componenti di caratteristiche e attributi che sono convenzionalmente archiviati in sistemi ibridi di gestione dei dati. I requisiti algoritmici differiscono sostanzialmente per la gestione dei dati relazionali (attributo) e per la gestione dei dati topologici (funzionalità). Collegato a questo è la gamma e la diversità dei formati di dati geografici, che presentano sfide uniche. La rivoluzione dei dati geografici digitali sta creando nuovi tipi di formati di dati oltre i tradizionali formati "vettoriali" e "raster". Gli archivi di dati geografici includono sempre più dati mal strutturati, come immagini e contenuti multimediali georeferenziati.

Esistono diverse sfide di ricerca critiche nella scoperta della conoscenza geografica e nel data mining. Miller e Han offrono il seguente elenco di temi di ricerca emergenti nel campo:

  • Sviluppo e supporto di data warehouse geografici (GDW) : le proprietà spaziali sono spesso ridotte a semplici attributi spaziali nei data warehouse tradizionali. La creazione di un GDW integrato richiede la risoluzione dei problemi di interoperabilità dei dati spaziali e temporali, comprese le differenze di semantica, sistemi di riferimento, geometria, accuratezza e posizione.
  • Migliori rappresentazioni spazio-temporali nella scoperta della conoscenza geografica : gli attuali metodi di scoperta della conoscenza geografica (GKD) utilizzano generalmente rappresentazioni molto semplici di oggetti geografici e relazioni spaziali. I metodi di data mining geografico dovrebbero riconoscere oggetti geografici più complessi (cioè linee e poligoni) e relazioni (cioè distanze non euclidee, direzione, connettività e interazione attraverso lo spazio geografico attribuito come il terreno). Inoltre, la dimensione temporale deve essere maggiormente integrata in queste rappresentazioni e relazioni geografiche.
  • Scoperta della conoscenza geografica utilizzando diversi tipi di dati : dovrebbero essere sviluppati metodi GKD in grado di gestire diversi tipi di dati oltre ai tradizionali modelli raster e vettoriali, comprese immagini e multimedia georeferenziati, nonché tipi di dati dinamici (streaming video, animazione).

Data mining temporale

I dati possono contenere attributi generati e registrati in momenti diversi. In questo caso, trovare relazioni significative nei dati può richiedere di considerare l'ordine temporale degli attributi. Una relazione temporale può indicare una relazione causale, o semplicemente un'associazione.

Estrazione dei dati del sensore

Le reti di sensori wireless possono essere utilizzate per facilitare la raccolta di dati per l'estrazione di dati spaziali per una varietà di applicazioni come il monitoraggio dell'inquinamento atmosferico. Una caratteristica di tali reti è che i nodi di sensori vicini che monitorano una caratteristica ambientale in genere registrano valori simili. Questo tipo di ridondanza dei dati dovuta alla correlazione spaziale tra le osservazioni dei sensori ispira le tecniche per l'aggregazione e il mining di dati in rete. Misurando la correlazione spaziale tra i dati campionati da sensori diversi, è possibile sviluppare un'ampia classe di algoritmi specializzati per sviluppare algoritmi di data mining spaziale più efficienti.

Estrazione di dati visivi

Nel processo di trasformazione dall'analogico al digitale, sono stati generati, raccolti e archiviati grandi set di dati scoprendo modelli statistici, tendenze e informazioni nascoste nei dati, al fine di costruire modelli predittivi. Gli studi suggeriscono che il data mining visivo è più veloce e molto più intuitivo rispetto al data mining tradizionale. Vedi anche Visione artificiale .

Estrazione di dati musicali

Le tecniche di data mining, e in particolare l' analisi delle co-occorrenze , sono state utilizzate per scoprire somiglianze rilevanti tra i corpora musicali (elenchi radio, database di CD) allo scopo di classificare la musica in generi in modo più obiettivo.

Sorveglianza

Il data mining è stato utilizzato dal governo degli Stati Uniti. I programmi includono il programma Total Information Awareness (TIA), Secure Flight (precedentemente noto come Computer-Assisted Passenger Prescreening System ( CAPPS II )), Analysis, Dissemination, Visualization, Insight, Semantic Enhancement ( ADVISE ) e Multi-state Anti- Scambio di informazioni sul terrorismo ( MATRIX ). Questi programmi sono stati interrotti a causa di controversie sulla violazione del 4° emendamento alla Costituzione degli Stati Uniti, sebbene molti programmi formati sotto di essi continuino a essere finanziati da organizzazioni diverse o con nomi diversi.

Nel contesto della lotta al terrorismo, due metodi particolarmente plausibili di data mining sono il "pattern mining" e il "subject-based data mining".

Estrazione di modelli

Il "pattern mining" è un metodo di data mining che implica la ricerca di modelli esistenti nei dati. In questo contesto, pattern significa spesso regole di associazione . La motivazione originale per la ricerca delle regole di associazione derivava dal desiderio di analizzare i dati delle transazioni del supermercato, ovvero esaminare il comportamento dei clienti in termini di prodotti acquistati. Ad esempio, una regola dell'associazione "birra ⇒ patatine (80%)" afferma che quattro clienti su cinque che hanno acquistato birra hanno acquistato anche patatine.

Nel contesto del pattern mining come strumento per identificare l'attività terroristica, il Consiglio Nazionale delle Ricerche fornisce la seguente definizione: "Il data mining basato su pattern cerca modelli (compresi modelli di dati anomali) che potrebbero essere associati ad attività terroristiche - questi modelli potrebbero essere considerati come piccoli segnali in un grande oceano di rumore." Il Pattern Mining include nuove aree come il Music Information Retrieval (MIR) in cui i modelli visti sia nel dominio temporale che in quello non temporale vengono importati nei metodi classici di ricerca per la scoperta della conoscenza.

Data mining in base al soggetto

Il "data mining basato sui soggetti" è un metodo di data mining che implica la ricerca di associazioni tra individui nei dati. Nell'ambito della lotta al terrorismo, il Consiglio Nazionale delle Ricerche fornisce la seguente definizione: "Il data mining per soggetto utilizza un individuo promotore o altro dato che è considerato, sulla base di altre informazioni, di grande interesse e l'obiettivo è determinare quali altre persone o transazioni o movimenti finanziari, ecc., sono collegati a quel dato di avvio".

Griglia di conoscenza

Scoperta della conoscenza "On the Grid" si riferisce generalmente alla conduzione della scoperta della conoscenza in un ambiente aperto utilizzando concetti di grid computing , consentendo agli utenti di integrare dati da varie fonti di dati online, nonché utilizzare risorse remote, per eseguire le proprie attività di data mining. Il primo esempio è stato Discovery Net , sviluppato presso l' Imperial College di Londra , che ha vinto il "Most Innovative Data-Intensive Application Award" alla conferenza e mostra ACM SC02 (Supercomputing 2002), basato su una dimostrazione di un'applicazione di scoperta della conoscenza distribuita completamente interattiva per un'applicazione di bioinformatica. Altri esempi includono il lavoro condotto da ricercatori dell'Università della Calabria , che hanno sviluppato un'architettura Knowledge Grid per la scoperta della conoscenza distribuita, basata sul grid computing .

Riferimenti

link esterno