Ennakoiva mallimerkintäkieli - Predictive Model Markup Language

PMML Logo.png

Ennustemallien Markup Language ( PMML ) on XML- pohjainen ennustemallien Interchange Format sikisi tohtori Robert Lee Grossman , niin johtaja National Center for data on University of Illinois at Chicago . PMML tarjoaa tavan analyyttisille sovelluksille kuvata ja vaihtaa tiedonlouhinnan ja koneoppimisalgoritmien tuottamia ennustavia malleja . Se tukee yleisiä malleja, kuten logistista regressiota ja muita eteenpäin suuntautuvia hermoverkkoja. Versio 0.9 julkaistiin vuonna 1998. Seuraavat versiot on kehittänyt Data Mining Group.

Koska PMML on XML-pohjainen standardi, eritelmä tulee XML-skeeman muodossa . Itse PMML on kypsä standardi, ja yli 30 organisaatiota on ilmoittanut PMML: ää tukevista tuotteista.

PMML-komponentit

PMML-tiedosto voidaan kuvata seuraavilla komponenteilla:

  • Otsikko : sisältää yleisiä tietoja PMML-dokumentista, kuten mallin tekijänoikeustiedot, sen kuvaus ja tiedot mallin luomiseen käytetystä sovelluksesta, kuten nimi ja versio. Se sisältää myös aikaleiman attribuutin, jota voidaan käyttää mallin luomispäivämäärän määrittämiseen.
  • Data Dictionary : sisältää määritelmät kaikille mallin käyttämille mahdollisille kentille. Täällä kenttä määritellään jatkuvaksi, kategoriseksi tai järjestysluokaksi (attribuuttityyppi). Tästä määritelmästä riippuen määritetään sitten sopivat arvoalueet sekä tietotyyppi (kuten merkkijono tai kaksinkertainen).
  • Tiedonmuunnokset : muunnokset mahdollistavat käyttäjädatan kartoituksen kaivosmallin käyttämään toivottavampaan muotoon. PMML määrittelee useita erilaisia ​​yksinkertaisia ​​tiedonmuunnoksia.
    • Normalisointi: kartoittaa arvot numeroihin, syöttö voi olla jatkuva tai erillinen.
    • Diskretisointi: kartoita jatkuvat arvot diskreetteihin arvoihin.
    • Arvokartoitus: kartoitetaan erilliset arvot erillisiin arvoihin.
    • Funktiot (mukautetut ja sisäänrakennetut): johda arvo soveltamalla funktiota yhteen tai useampaan parametriin.
    • Yhdistelmä: käytetään arvoryhmien yhteenvetoon tai keräämiseen.
  • Malli : sisältää tiedonlouhintamallin määritelmän. Esimerkiksi monikerroksineneteenpäin suuntautuva hermoverkko on esitetty PMML: ssä "NeuralNetwork" -elementillä, joka sisältää seuraavia ominaisuuksia:
    • Mallin nimi (attribute modelName)
    • Funktion nimi (attribute functionName)
    • Algoritmin nimi (attribute algorithmName)
    • Aktivointitoiminto (attribute activationFunction)
    • Tasojen lukumäärä (attribute numberOfLayers)
Tätä informaatiota seuraa sitten kolmen tyyppinen hermokerros, jotka määrittelevät PMML-asiakirjassa edustettavan hermoverkkomallin arkkitehtuurin. Nämä määritteet ovat NeuralInputs, NeuralLayer ja NeuralOutputs. Sitä paitsi neuroverkot, PMML mahdollistaa edustus monia muita malleja kuten tukivektorikoneet , yhdistyksen säännöt , Naiivi Bayes luokitin , klustereiden malleja, tekstin malleja , päätös puita ja erilaisia regressiomallit .
  • Kaivoskaavio : luettelo kaikista mallissa käytetyistä kentistä. Tämä voi olla alajoukko kentistä sellaisina kuin ne on määritelty datasanastossa. Se sisältää tarkat tiedot kustakin kentästä, kuten:
    • Nimi (attribuutin nimi): täytyy viitata tietosanakirjan kenttään
    • Käyttötyyppi (attribute useType): määrittää, miten kenttää käytetään mallissa. Tyypillisiä arvoja ovat: aktiivinen, ennustettu ja täydentävä. Ennustetut kentät ovat niitä, joiden arvot malli ennustaa.
    • Outlier Treatment (attribute outliers): määrittelee käytetyn outlier-hoidon. PMML: ssä poikkeamat voidaan käsitellä puuttuvina arvoina, ääriarvoina (tietyn kentän korkeiden ja matalien arvojen määritelmän perusteella) tai sellaisenaan.
    • Puuttuva arvon korvauskäytäntö (attribute missingValueReplacement): jos tämä määritteitä määritetään, puuttuva arvo korvataan automaattisesti annetuilla arvoilla.
    • Puuttuva arvohoito (attribuutti missingValueTreatment): osoittaa, kuinka puuttuva arvon korvaus johdettiin (esim. Arvona, keskiarvona tai mediaanina).
  • Kohteet : mahdollistaa ennustetun arvon jälkikäsittelyn skaalausmuodossa, jos mallin tulos on jatkuva. Kohteita voidaan käyttää myös luokitustehtävissä. Tässä tapauksessa attribuutti priorProbability määrittää oletustodennäköisyyden vastaavalle kohdeluokalle. Sitä käytetään, jos ennustuslogiikka itsessään ei tuottanut tulosta. Näin voi käydä esimerkiksi, jos syötetty arvo puuttuu eikä puuttuvien arvojen käsittelyyn ole muuta menetelmää.
  • Output : Tätä elementtiä voidaan käyttää nimeämään kaikki mallilta odotetut lähtökentät. Nämä ovat ennustetun kentän ominaisuuksia, ja niin ovat tyypillisesti ennustettu arvo itse, todennäköisyys, klusterin affiniteetti (klusterimalleille), vakiovirhe jne. PMML: n uusin julkaisu, PMML 4.1, laajennettu lähtö mahdollistamaan yleisen jälkikäsittelyn mallin tuotoksista. PMML 4.1: ssä kaikki sisäänrakennetut ja mukautetut toiminnot, jotka olivat alun perin käytettävissä vain esikäsittelyyn, tulivat saataville myös jälkikäsittelyyn.

PMML 4.0, 4.1, 4.2 ja 4.3

PMML 4.0 julkaistiin 16. kesäkuuta 2009.

Esimerkkejä uusista ominaisuuksista:

PMML 4.1 julkaistiin 31. joulukuuta 2011.

Uusia ominaisuuksia:

  • Uudet mallielementit tuloskorttien, k- lähimpien naapureiden ( KNN ) ja peruskarttamallien esittämiseen.
  • Useiden mallien yksinkertaistaminen. PMML 4.1: ssä samaa elementtiä käytetään mallien segmentoinnin, yhdistämisen ja ketjutuksen esittämiseen.
  • Kentän laajuuden ja kenttien nimien yleinen määritelmä.
  • Uusi attribuutti, joka tunnistaa jokaisen mallielementin, jos malli on valmis tuotantokäyttöön.
  • Parannetut jälkikäsittelyominaisuudet (lähtöelementin kautta).

PMML 4.2 julkaistiin 28. helmikuuta 2014.

Uusia ominaisuuksia ovat:

  • Muunnokset: Uudet elementit tekstin louhinnan toteuttamiseksi
  • Uudet sisäänrakennetut toiminnot säännöllisten lausekkeiden toteuttamiseksi: ottelut, yhdistäminen ja korvaaminen
  • Yksinkertaistetut lähdöt jälkikäsittelyä varten
  • Tuloskortin ja Naive Bayes -mallielementtien parannukset

PMML 4.3 julkaistiin 23. elokuuta 2016.

Uusia ominaisuuksia ovat:

  • Uudet mallityypit:
    • Gaussin prosessi
    • Bayesian-verkosto
  • Uudet sisäänrakennetut toiminnot
  • Käytä selvennyksiä
  • Dokumentaation parannukset

Versio 4.4 julkaistiin marraskuussa 2019.

Julkaisuhistoria

Versio Julkaisupäivä
Versio 0.7 Heinäkuu 1997
Versio 0.9 Heinäkuu 1998
Versio 1.0 Elokuu 1999
Versio 1.1 Elokuu 2000
Versio 2.0 Elokuu 2001
Versio 2.1 Maaliskuu 2003
Versio 3.0 Lokakuu 2004
Versio 3.1 Joulukuu 2005
Versio 3.2 Toukokuu 2007
Versio 4.0 Kesäkuu 2009
Versio 4.1 Joulukuu 2011
Versio 4.2 helmikuu 2014
Versio 4.2.1 Maaliskuu 2015
Versio 4.3 Elokuu 2016
Versio 4.4 Marraskuu 2019

Tiedonlouhintaryhmä

Data Mining Group on yhteenliittymä hallinnoi Laskennallisen tieteen Research, Inc., voittoa vuonna 2008 perustettu Data Mining Group myös kehittänyt standardin nimeltä Portable muoto Analytics tai PFA, joka täydentää PMML.

Katso myös

Viitteet

Ulkoiset linkit