Exemple de minerit de date - Examples of data mining
Data mining , procesul de descoperire a modelelor în seturi mari de date , a fost utilizat în multe aplicații.
Jocuri
De la începutul anilor '60, cu disponibilitatea oracolelor pentru anumite jocuri combinatorii , numite și baze de masă (de exemplu, pentru șah 3x3) cu orice configurație de început, puncte și cutii pentru tablă mică, hex-tablă mică și anumite jocuri finale în șah , puncte și cutii și hex; a fost deschisă o nouă zonă pentru extragerea datelor. Aceasta este extragerea strategiilor utilizabile de către oameni din aceste oracole. Abordările actuale de recunoaștere a modelelor nu par să dobândească pe deplin nivelul ridicat de abstractizare necesar pentru a fi aplicat cu succes. În schimb, o experimentare extinsă cu bazele de tabel - combinată cu un studiu intensiv al răspunsurilor bazei de tabel la probleme bine concepute și cu cunoștințe despre stadiul tehnicii (adică cunoștințe de bază de tabel) - este folosită pentru a produce modele inteligente. Berlekamp (în puncte și cutii etc.) și John Nunn (în jocurile de final de șah ) sunt exemple notabile de cercetători care fac această muncă, deși nu au fost - și nu sunt - implicați în generarea bazelor de tabel.
Afaceri
În afaceri, extragerea datelor este analiza activităților istorice ale afacerii, stocate ca date statice în bazele de date ale depozitului de date. Scopul este de a dezvălui tipare și tendințe ascunse. Software-ul de extragere a datelor folosește algoritmi avansați de recunoaștere a modelelor pentru a trece prin cantități mari de date pentru a ajuta la descoperirea informațiilor strategice de afaceri necunoscute anterior. Exemple pentru care întreprinderile folosesc extragerea datelor este includerea efectuării de analize de piață pentru identificarea pachetelor de produse noi, găsirea cauzei profunde a problemelor de fabricație, prevenirea uzării clienților și achiziționarea de noi clienți, vânzarea încrucișată către clienții existenți și profilarea clienților cu mai multă acuratețe .
- În lumea de astăzi, datele brute sunt colectate de companii cu un ritm exploziv. De exemplu, Walmart procesează peste 20 de milioane de tranzacții la punctul de vânzare în fiecare zi. Aceste informații sunt stocate într-o bază de date centralizată, dar ar fi inutile fără un tip de software de extragere a datelor care să le analizeze. Dacă Walmart și-ar analiza datele de la punctul de vânzare cu tehnici de extragere a datelor, acestea ar fi capabile să stabilească tendințele de vânzare, să dezvolte campanii de marketing și să prezică mai fidel loialitatea clienților.
- Categorizarea articolelor disponibile pe site-ul de comerț electronic este o problemă fundamentală. Un sistem corect de clasificare a articolelor este esențial pentru experiența utilizatorului, deoarece ajută la determinarea articolelor relevante pentru el pentru căutare și navigare. Clasificarea articolelor poate fi formulată ca o problemă de clasificare supravegheată în extragerea datelor, în care categoriile sunt clasele țintă și caracteristicile sunt cuvintele care compun o descriere textuală a articolelor. Una dintre abordări este de a găsi inițial grupuri similare și de a le pune împreună într-un grup latent. Acum, dat un nou element, clasificați mai întâi într-un grup latent, care se numește clasificare la nivel grosier. Apoi, efectuați o a doua rundă de clasificare pentru a găsi categoria căreia îi aparține elementul.
- De fiecare dată când se folosește un card de credit sau un card de fidelitate magazin sau se completează un card de garanție, se colectează date despre comportamentul utilizatorului. Mulți oameni consideră că cantitatea de informații stocate despre noi de la companii, precum Google, Facebook și Amazon, este deranjantă și este îngrijorată de confidențialitate. Deși există potențialul ca datele noastre personale să fie utilizate în moduri dăunătoare sau nedorite, acestea sunt folosite și pentru a ne îmbunătăți viața. De exemplu, Ford și Audi speră să colecteze într-o zi informații despre modelele de conducere ale clienților, astfel încât să poată recomanda rute mai sigure și să-i avertizeze pe șoferi cu privire la condițiile de drum periculoase.
- Exploatarea datelor în aplicațiile de gestionare a relației cu clienții poate contribui semnificativ la rezultatul final. Mai degrabă decât să contacteze aleatoriu un client potențial sau un client prin intermediul unui call center sau să trimită e-mailuri, o companie își poate concentra eforturile asupra potențialilor care se estimează că au o mare probabilitate de a răspunde la o ofertă. Pot fi folosite metode mai sofisticate pentru a optimiza resursele din toate campaniile, astfel încât să se poată prevedea la ce canal și la ce ofertă este cel mai probabil să răspundă un individ (în toate ofertele potențiale). În plus, aplicații sofisticate ar putea fi utilizate pentru automatizarea corespondenței. Odată ce rezultatele obținute din extragerea datelor (potențialul potențial / client și canal / ofertă) sunt determinate, această „aplicație sofisticată” poate trimite automat un e-mail sau un e-mail obișnuit. În cele din urmă, în cazurile în care mulți oameni vor întreprinde o acțiune fără o ofertă, se poate utiliza „ modelarea înălțătoare ” pentru a determina care persoane au cea mai mare creștere a răspunsului dacă li se oferă o ofertă. Modelarea înălțătoare permite, astfel, specialiștilor în marketing să concentreze e-mailurile și ofertele către persoane convingătoare și să nu trimită oferte persoanelor care vor cumpăra produsul fără o ofertă. Clusterul de date poate fi, de asemenea, utilizat pentru a descoperi automat segmentele sau grupurile dintr-un set de date pentru clienți.
- Întreprinderile care folosesc minerit de date pot vedea o rentabilitate a investiției, dar recunosc, de asemenea, că numărul modelelor predictive poate deveni rapid foarte mare. De exemplu, mai degrabă decât să utilizeze un singur model pentru a prezice câți clienți vor produce , o companie poate alege să construiască un model separat pentru fiecare regiune și tip de client. În situațiile în care un număr mare de modele trebuie menținute, unele companii apelează la metodologii mai automatizate de extragere a datelor.
- Exploatarea datelor poate fi de ajutor departamentelor de resurse umane (HR) în identificarea caracteristicilor celor mai de succes angajați. Informațiile obținute - cum ar fi universitățile la care participă angajați de mare succes - pot ajuta HR să concentreze eforturile de recrutare în consecință. În plus, aplicațiile de gestionare strategică a întreprinderilor ajută o companie să traducă obiective la nivel de corporație, cum ar fi obiectivele de profit și cota de marjă, în decizii operaționale, cum ar fi planurile de producție și nivelurile de forță de muncă.
- Analiza coșului de piață a fost utilizată pentru a identifica tiparele de cumpărare ale consumatorului Alpha . Analiza datelor colectate despre acest tip de utilizator a permis companiilor să prezică tendințele viitoare de cumpărare și să prevadă cererile de aprovizionare.
- Exploatarea datelor este un instrument extrem de eficient în industria de marketing a catalogului. Catalogatorii au o bază de date bogată cu istoricul tranzacțiilor clienților lor pentru milioane de clienți care datează de mai mulți ani. Instrumentele de extragere a datelor pot identifica tiparele în rândul clienților și pot ajuta la identificarea celor mai probabili clienți să răspundă la viitoarele campanii de e-mail.
- Exploatarea datelor pentru aplicațiile de afaceri poate fi integrată într-un proces complex de modelare și luare a deciziilor. LIONsolver folosește Inteligența de afaceri reactivă (RBI) pentru a susține o abordare „holistică” care integrează extragerea datelor, modelarea și vizualizarea interactivă într-o descoperire end-to-end și un proces de inovare continuă alimentat de învățarea umană și automată.
- În zona luării deciziilor , abordarea RBI a fost utilizată pentru a extrage cunoștințele care sunt dobândite progresiv de la factorul de decizie, și apoi auto-regla metoda deciziei în consecință. Relația dintre calitatea unui sistem de extragere a datelor și valoarea investiției pe care este dispus să o facă decidentul a fost oficializată prin furnizarea unei perspective economice asupra valorii „cunoștințelor extrase” în ceea ce privește plățile sale către organizație Această decizie-teoretică cadrul de clasificare a fost aplicat unei linii de fabricare a oblelor semiconductoare din lumea reală, unde au fost dezvoltate reguli de decizie pentru monitorizarea și controlul eficient al liniei de fabricare a oblelor semiconductoare.
- Un exemplu de extragere a datelor legat de o linie de producție cu circuit integrat (IC) este descris în lucrarea „Mining IC Test Data to Optimize VLSI Testing”. În această lucrare, este descrisă aplicarea exploatării datelor și a analizei deciziilor la problema testării funcționale la nivel de matriță. Experimentele menționate demonstrează abilitatea de a aplica un sistem de extragere a datelor istorice de testare a morții pentru a crea un model probabilistic de tipare ale eșecului morții. Aceste tipare sunt apoi utilizate pentru a decide, în timp real, care mor pentru a testa în continuare și când să oprească testarea. S-a demonstrat că acest sistem, pe baza experimentelor cu date de testare istorice, are potențialul de a îmbunătăți profiturile produselor IC mature. Alte exemple de aplicare a metodologiilor de extragere a datelor în mediile de fabricație a semiconductoarelor sugerează că metodologiile de extragere a datelor pot fi deosebit de utile atunci când datele sunt rare, iar diferiții parametri fizici și chimici care afectează procesul prezintă interacțiuni extrem de complexe. O altă implicație este că monitorizarea on-line a procesului de fabricație a semiconductorilor folosind extragerea datelor poate fi extrem de eficientă.
Știință și inginerie
În ultimii ani, exploatarea datelor a fost utilizată pe scară largă în domeniile științei și ingineriei, cum ar fi bioinformatica , genetică , medicină , educație și inginerie electrică .
- În studiul geneticii umane, extragerea secvențelor ajută la abordarea obiectivului important de înțelegere a relației de cartografiere între variațiile interindividuale ale secvenței ADN uman și variabilitatea susceptibilității bolii. În termeni simpli, își propune să afle cum modificările din secvența ADN a unui individ afectează riscurile de a dezvolta boli comune, cum ar fi cancerul , care este de o mare importanță pentru îmbunătățirea metodelor de diagnostic, prevenire și tratare a acestor boli. O metodă de extragere a datelor care este utilizată pentru a efectua această sarcină este cunoscută sub numele de reducere a dimensionalității multifactoriale .
- În domeniul ingineriei energiei electrice, metodele de extragere a datelor au fost utilizate pe scară largă pentru monitorizarea stării echipamentelor electrice de înaltă tensiune. Scopul monitorizării stării este de a obține informații valoroase despre, de exemplu, starea izolației (sau alți parametri importanți de siguranță). Tehnicile de grupare a datelor - cum ar fi harta de auto-organizare (SOM), au fost aplicate pentru monitorizarea vibrațiilor și analiza schimbătorilor de robinet sub sarcină ale transformatoarelor (OLTCS). Folosind monitorizarea vibrațiilor, se poate observa că fiecare operațiune de schimbare a robinetului generează un semnal care conține informații despre starea contactelor schimbătorului de robinete și mecanismele de acționare. Evident, diferite poziții de atingere vor genera semnale diferite. Cu toate acestea, a existat o variabilitate considerabilă între semnalele de stare normală pentru exact aceeași poziție de atingere. SOM a fost aplicat pentru a detecta condiții anormale și pentru a face ipoteze cu privire la natura anomaliilor.
- Metodele de extragere a datelor au fost aplicate analizei gazelor dizolvate (DGA) în transformatoarele de putere . DGA, ca diagnostic pentru transformatoarele de putere, este disponibil de mulți ani. Metode precum SOM au fost aplicate pentru a analiza datele generate și pentru a determina tendințe care nu sunt evidente pentru metodele standard ale raportului DGA (cum ar fi Triunghiul Duval).
- În cercetarea educațională, unde exploatarea datelor a fost utilizată pentru a studia factorii care îi determină pe studenți să aleagă să se angajeze în comportamente care le reduc învățarea și să înțeleagă factorii care influențează retenția studenților universitari. Un exemplu similar de aplicare socială a exploatării datelor este utilizarea sa în sisteme de găsire a expertizei , prin care descriptorii de expertiză umană sunt extrase, normalizate și clasificate astfel încât să faciliteze găsirea experților, în special în domeniile științific și tehnic. În acest fel, exploatarea datelor poate facilita memoria instituțională .
- Metode de extragere a datelor de date biomedicale facilitate de ontologiile domeniului , extragerea datelor din studiile clinice și analiza traficului utilizând SOM.
- În supravegherea reacțiilor adverse la medicamente, Centrul de Monitorizare Uppsala a folosit, din 1998, metode de extragere a datelor pentru a examina în mod obișnuit modelele de raportare indicative ale problemelor emergente privind siguranța medicamentelor în baza de date globală a OMS de 4,6 milioane de incidente suspectate de reacții adverse la medicamente . Recent, a fost dezvoltată o metodologie similară pentru extragerea unor colecții mari de fișe medicale electronice pentru modele temporale care asociază prescripțiile medicamentoase la diagnosticele medicale.
- Exploatarea datelor a fost aplicată artefactelor software din domeniul ingineriei software : depozitele de software pentru minerit .
- În domeniul microbiologiei, au fost utilizate metode de extragere a datelor pentru prezicerea comportamentului populației bacteriilor din alimente.
Drepturile omului
Exploatarea datelor a evidențelor guvernamentale - în special a evidențelor sistemului judiciar (adică instanțele judecătorești, închisorile) - permite descoperirea încălcărilor sistemice ale drepturilor omului în legătură cu generarea și publicarea de evidențe juridice invalide sau frauduloase de către diferite agenții guvernamentale.
Exploatarea datelor medicale
Unii algoritmi de învățare automată pot fi aplicați în domeniul medical ca instrumente de diagnostic de opinie secundară și ca instrumente pentru faza de extragere a cunoștințelor în procesul de descoperire a cunoștințelor în baze de date . Unul dintre acești clasificatori (denumit Prototype exemplar learning classifier ( PEL-C ) este capabil să descopere sindroame , precum și cazuri clinice atipice.
Un domeniu medical actual care utilizează procesul de extragere a datelor este Metabolomics , care este investigarea și studiul moleculelor biologice și modul în care se caracterizează interacțiunea lor cu fluidele corporale, celulele, țesuturile etc. Metabolomica este un subiect foarte greu de date și implică adesea trecerea prin cantități masive de date irelevante înainte de a găsi concluzii. Exploatarea datelor a permis acestui domeniu relativ nou al cercetării medicale să crească considerabil în ultimul deceniu și va fi probabil metoda căreia se găsesc noi cercetări în cadrul subiectului.
În 2011, cazul Sorrell împotriva IMS Health, Inc. , hotărât de Curtea Supremă a Statelor Unite , a decis că farmaciile pot partaja informații cu companii externe. Această practică a fost autorizată în temeiul primului amendament al Constituției , protejând „libertatea de exprimare”. Cu toate acestea, adoptarea Legii privind tehnologia informației privind sănătatea pentru sănătatea economică și clinică (Legea HITECH) a contribuit la inițierea adoptării dosarului electronic de sănătate (EHR) și a tehnologiei de sprijin în Statele Unite. Legea HITECH a fost semnată în lege pe 17 februarie 2009 ca parte a Legii americane de recuperare și reinvestire (ARRA) și a contribuit la deschiderea ușii pentru exploatarea datelor medicale. Înainte de semnarea acestei legi, estimările pentru doar 20% dintre medicii din Statele Unite foloseau fișe electronice ale pacienților. Søren Brunak remarcă faptul că „dosarul pacientului devine cât mai bogat în informații” și, prin urmare, „maximizează oportunitățile de exploatare a datelor”. Prin urmare, înregistrările electronice ale pacienților extind în continuare posibilitățile privind exploatarea datelor medicale, deschizând astfel ușa către o sursă vastă de analiză a datelor medicale.
Exploatarea datelor spațiale
Exploatarea datelor spațiale este aplicarea metodelor de extragere a datelor la datele spațiale. Obiectivul final al exploatării datelor spațiale este de a găsi modele în date cu privire la geografie. Până în prezent, mineritul datelor și sistemele de informații geografice (GIS) au existat ca două tehnologii separate, fiecare cu propriile sale metode, tradiții și abordări de vizualizare și analiză a datelor. În special, majoritatea GIS contemporane au doar o funcționalitate foarte simplă de analiză spațială. Imensa explozie a datelor referențiate geografic ocazionată de evoluțiile în IT, cartografierea digitală, teledetecția și difuzarea globală a GIS accentuează importanța dezvoltării abordărilor inductive bazate pe date pentru analiza și modelarea geografică.
Exploatarea datelor oferă beneficii potențiale mari pentru luarea deciziilor aplicate bazate pe GIS. Recent, sarcina de integrare a acestor două tehnologii a devenit de o importanță critică, mai ales că diferite organizații din sectorul public și privat care dețin baze de date uriașe cu date tematice și geografic referite încep să realizeze potențialul imens al informațiilor conținute în acestea. Printre aceste organizații se numără:
- Birouri care necesită analiza sau diseminarea datelor statistice georeferențiate
- Servicii de sănătate publică care caută explicații privind gruparea bolilor
- Agențiile de mediu evaluează impactul schimbării modelelor de utilizare a terenului asupra schimbărilor climatice
- Companii de geo-marketing care fac segmentarea clienților pe baza locației spațiale.
Provocări în mineritul spațial: depozitele de date geospațiale tind să fie foarte mari. Mai mult, seturile de date GIS existente sunt adesea împărțite în componente de caracteristici și atribute care sunt arhivate convențional în sistemele hibride de gestionare a datelor. Cerințele algoritmice diferă substanțial pentru gestionarea datelor relaționale (atribute) și pentru gestionarea datelor topologice (caracteristici). Legat de aceasta este gama și diversitatea formatelor de date geografice, care prezintă provocări unice. Revoluția datelor geografice digitale creează noi tipuri de formate de date dincolo de formatele tradiționale „vector” și „raster”. Depozitele de date geografice includ din ce în ce mai multe date prost structurate, cum ar fi imagini și multi-media georeferențiate.
Există mai multe provocări critice de cercetare în descoperirea cunoștințelor geografice și extragerea datelor. Miller și Han oferă următoarea listă de subiecte de cercetare emergente în domeniu:
- Dezvoltarea și sprijinirea depozitelor de date geografice (GDW-uri) : Proprietățile spațiale sunt adesea reduse la atribute aspatiale simple în depozitele de date obișnuite. Crearea unui GDW integrat necesită rezolvarea problemelor de interoperabilitate a datelor spațiale și temporale - inclusiv diferențe în semantică, sisteme de referință, geometrie, precizie și poziție.
- Reprezentări spațio-temporale mai bune în descoperirea cunoștințelor geografice : metodele actuale de descoperire a cunoștințelor geografice (GKD) utilizează în general reprezentări foarte simple ale obiectelor geografice și ale relațiilor spațiale. Metodele de extragere a datelor geografice ar trebui să recunoască obiecte geografice mai complexe (adică linii și poligoane) și relații (adică distanțe neeuclidiene, direcție, conectivitate și interacțiune prin spațiu geografic atribuit, cum ar fi terenul). Mai mult, dimensiunea timpului trebuie să fie mai complet integrată în aceste reprezentări geografice și relații.
- Descoperirea cunoștințelor geografice utilizând diverse tipuri de date : ar trebui dezvoltate metode GKD care să poată gestiona diverse tipuri de date dincolo de modelele tradiționale raster și vectoriale, inclusiv imagini și multimedia georeferențiate, precum și tipuri de date dinamice (fluxuri video, animație).
Exploatarea datelor temporare
Datele pot conține atribute generate și înregistrate în momente diferite. În acest caz, găsirea unor relații semnificative în date poate necesita luarea în considerare a ordinii temporale a atributelor. O relație temporală poate indica o relație cauzală sau pur și simplu o asociere.
Exploatarea datelor senzorilor
Rețelele de senzori fără fir pot fi utilizate pentru a facilita colectarea datelor pentru extragerea datelor spațiale pentru o varietate de aplicații, cum ar fi monitorizarea poluării aerului. O caracteristică a acestor rețele este că nodurile senzorilor din apropiere care monitorizează o caracteristică de mediu înregistrează de obicei valori similare. Acest tip de redundanță a datelor datorată corelației spațiale dintre observațiile senzorilor inspiră tehnicile de agregare a datelor în rețea și minare. Măsurând corelația spațială dintre datele eșantionate de diferiți senzori, se poate dezvolta o clasă largă de algoritmi specializați pentru a dezvolta algoritmi de exploatare a datelor spațiale mai eficiente.
Exploatarea vizuală a datelor
În procesul de transformare din analog în digital, au fost generate, colectate și stocate seturi mari de date, descoperind tipare statistice, tendințe și informații ascunse în date, pentru a construi tipare predictive. Studiile sugerează că exploatarea vizuală a datelor este mai rapidă și mult mai intuitivă decât minarea tradițională de date. A se vedea, de asemenea, viziunea computerizată .
Exploatarea datelor muzicale
Tehnicile de extragere a datelor și, în special , analiza co-apariției , au fost folosite pentru a descoperi asemănări relevante între corpusurile muzicale (liste radio, baze de date CD) în scopul includerii clasificării muzicii în genuri într-un mod mai obiectiv.
Supraveghere
Exploatarea datelor a fost utilizată de guvernul SUA. Programele includ programul Total Information Awareness (TIA), Secure Flight (cunoscut anterior sub numele de Computer-Assisted Passenger Prescreening System ( CAPPS II )), Analiză, Diseminare, Vizualizare, Insight, Semantic Enhancement ( ADVISE ) și Multi-state Anti-State Schimb de informații privind terorismul ( MATRIX ). Aceste programe au fost întrerupte din cauza controverselor privind încălcarea celui de-al patrulea amendament la Constituția Statelor Unite, deși multe programe care au fost formate în temeiul lor continuă să fie finanțate de diferite organizații sau sub diferite nume.
În contextul combaterii terorismului, două metode deosebit de plauzibile de extragere a datelor sunt „extragerea de tipare” și „extragerea de date bazată pe subiecte”.
Exploatarea tiparului
„Exploatarea de tipare” este o metodă de extragere a datelor care implică găsirea de tipare existente în date. În acest context, modelele înseamnă adesea reguli de asociere . Motivația inițială pentru căutarea regulilor asociației a venit din dorința de a analiza datele tranzacțiilor din supermarket, adică de a examina comportamentul clienților în ceea ce privește produsele achiziționate. De exemplu, o regulă a asociației „bere ⇒ chipsuri de cartofi (80%)” prevede că patru din cinci clienți care au cumpărat bere au cumpărat și chipsuri de cartofi.
În contextul exploatării tiparului ca instrument pentru identificarea activității teroriste, Consiliul Național de Cercetare oferă următoarea definiție: „Exploatarea datelor bazată pe tipare caută modele (inclusiv tipare de date anormale) care ar putea fi asociate cu activitatea teroristă - aceste tipare ar putea fi privite ca semnale mici într-un ocean mare de zgomot. " Modelarea minieră include noi domenii, cum ar fi Music Information Retrieval (MIR), în care modelele văzute atât în domeniile temporale, cât și în cele temporale sunt importate în metodele clasice de căutare a descoperirii cunoștințelor.
Exploatarea datelor pe subiecte
„Exploatarea datelor bazate pe subiecte” este o metodă de extragere a datelor care implică căutarea de asociații între indivizi în date. În contextul combaterii terorismului, Consiliul Național pentru Cercetare oferă următoarea definiție: „Exploatarea datelor bazate pe subiect folosește un individ inițiator sau alt dat care este considerat, pe baza altor informații, de mare interes și scopul este de a determina ce alte persoane sau tranzacții sau mișcări financiare etc. sunt legate de acea dată de inițiere. "
Grila de cunoștințe
Descoperirea cunoștințelor „În rețea” se referă, în general, la efectuarea descoperirii cunoștințelor într-un mediu deschis folosind concepte de calculare a rețelei , permițând utilizatorilor să integreze date din diverse surse de date online, precum și să utilizeze resurse la distanță, pentru a-și executa sarcinile de extragere a datelor. Cel mai vechi exemplu a fost Discovery Net , dezvoltat la Imperial College din Londra , care a câștigat premiul „Cel mai inovator pentru aplicații intensive de date” la conferința și expoziția ACM SC02 (Supercomputing 2002), pe baza unei demonstrații a unei aplicații de descoperire a cunoștințelor distribuite complet interactiv. pentru o aplicație bioinformatică. Alte exemple includ lucrările efectuate de cercetătorii de la Universitatea din Calabria , care au dezvoltat o arhitectură Knowledge Grid pentru descoperirea distribuită a cunoștințelor, bazată pe calculul grid .