Prædiktiv modelmarkup sprog - Predictive Model Markup Language
Den prædiktiv model Markup Language ( PMML ) er et XML -baserede prædiktiv model udvekslingsformat udtænkt af Dr. Robert Lee Grossman , derefter direktør for National Center for Data Mining ved University of Illinois i Chicago . PMML giver en måde for analytiske applikationer at beskrive og udveksle forudsigelige modeller produceret af datamining og maskinlæringsalgoritmer . Det understøtter almindelige modeller som logistisk regression og andre feedforward neurale netværk. Version 0.9 blev offentliggjort i 1998. Efterfølgende versioner er udviklet af Data Mining Group.
Da PMML er en XML-baseret standard, kommer specifikationen i form af et XML-skema . PMML i sig selv er en moden standard med over 30 organisationer, der har annonceret produkter, der understøtter PMML.
PMML-komponenter
En PMML-fil kan beskrives af følgende komponenter:
- Overskrift : indeholder generelle oplysninger om PMML-dokumentet, såsom copyright-oplysninger til modellen, dens beskrivelse og information om det program, der bruges til at generere modellen, såsom navn og version. Det indeholder også en attribut til et tidsstempel, der kan bruges til at specificere datoen for oprettelse af model.
- Data Dictionary : indeholder definitioner for alle de mulige felter, der bruges af modellen. Det er her, at et felt defineres som kontinuerligt, kategorisk eller ordinært (attributoptype). Afhængig af denne definition defineres de relevante værdiområder såvel som datatypen (såsom streng eller dobbelt).
-
Datatransformationer : transformationer muliggør kortlægning af brugerdata til en mere ønskelig form, der kan bruges af minedriftsmodellen. PMML definerer flere slags enkle datatransformationer.
- Normalisering: kortlæg værdier til tal, input kan være kontinuerligt eller diskret.
- Diskretisering: kortlæg kontinuerlige værdier til diskrete værdier.
- Værdikortlægning: kortlæg diskrete værdier til diskrete værdier.
- Funktioner (tilpasset og indbygget): udlede en værdi ved at anvende en funktion til en eller flere parametre.
- Aggregering: bruges til at opsummere eller indsamle grupper af værdier.
-
Model : indeholder definitionen af datamining-modellen. F.eks. Er et multi-lag feedforward neuralt netværk repræsenteret i PMML af et "NeuralNetwork" -element, der indeholder attributter såsom:
- Modelnavn (attribut modelnavn)
- Funktionsnavn (attribut funktionsnavn)
- Algoritmnavn (attributalgoritmnavn)
- Aktiveringsfunktion (attribut aktiveringFunktion)
- Antal lag (attributnummerOfLayers)
- Denne information efterfølges af tre slags neurale lag, der specificerer arkitekturen for den neurale netværksmodel, der er repræsenteret i PMML-dokumentet. Disse attributter er NeuralInputs, NeuralLayer og NeuralOutputs. Udover neurale netværk tillader PMML repræsentation af mange andre typer modeller, herunder understøttende vektormaskiner , associeringsregler , Naive Bayes-klassifikator , klyngemodeller, tekstmodeller , beslutningstræer og forskellige regressionsmodeller .
-
Mineskema : en liste over alle felter, der er brugt i modellen. Dette kan være en delmængde af felterne som defineret i dataordbogen. Den indeholder specifikke oplysninger om hvert felt, såsom:
- Navn (attributnavn): skal henvise til et felt i dataordbogen
- Usage type (attribute usageType): definerer den måde, hvorpå et felt skal bruges i modellen. Typiske værdier er: aktive, forudsagte og supplerende. Forudsagte felter er dem, hvis værdier forudsiges af modellen.
- Outlier Treatment (attribut outliers): definerer den outlier behandling, der skal bruges. I PMML kan outliers behandles som manglende værdier, som ekstreme værdier (baseret på definitionen af høje og lave værdier for et bestemt felt) eller som det er.
- Politik for udskiftning af manglende værdi (attribut missingValueReplacement): Hvis denne attribut er angivet, erstattes en manglende værdi automatisk med de givne værdier.
- Manglende værdibehandling (attribut missingValueTreatment): indikerer, hvordan den manglende værdiudskiftning blev afledt (f.eks. Som værdi, gennemsnit eller median).
- Mål : muliggør efterbehandling af den forudsagte værdi i formatet skalering, hvis output fra modellen er kontinuerlig. Mål kan også bruges til klassificeringsopgaver. I dette tilfælde angiver attributten priorProbability en standard sandsynlighed for den tilsvarende målkategori. Det bruges, hvis forudsigelseslogikken ikke selv gav et resultat. Dette kan f.eks. Ske, hvis en inputværdi mangler, og der ikke er nogen anden metode til behandling af manglende værdier.
- Output : dette element kan bruges til at navngive alle de ønskede outputfelter, der forventes fra modellen. Dette er funktioner i det forudsagte felt, og det er typisk selve den forudsagte værdi, sandsynligheden, klyngeaffinitet (for klyngemodeller), standardfejl osv. Den seneste udgivelse af PMML, PMML 4.1, udvidet output for at muliggøre generisk efterbehandling af modeludgange. I PMML 4.1 blev alle de indbyggede og brugerdefinerede funktioner, der oprindeligt kun var tilgængelige til forbehandling, også tilgængelige til efterbehandling.
PMML 4.0, 4.1, 4.2 og 4.3
PMML 4.0 blev frigivet den 16. juni 2009.
Eksempler på nye funktioner inkluderet:
- Forbedrede kapaciteter til forbehandling: Tilføjelser til indbyggede funktioner inkluderer en række boolske operationer og en If-Then-Else- funktion.
- Tidsseriemodeller : Nye eksponentielle udjævningsmodeller ; placere også indehavere til ARIMA , Seasonal Trend Decomposition og Spectral density estimation , som skal understøttes i den nærmeste fremtid.
- Modelforklaring: Gemning af målinger af evaluering og modelydelse i selve PMML-filen.
- Flere modeller: Kapaciteter til modelsammensætning, ensembler og segmentering (f.eks. Kombination af regression og beslutningstræer).
- Udvidelser af eksisterende elementer: Tilføjelse af klassificering i flere klasser for Support Vector Machines , forbedret repræsentation for associeringsregler og tilføjelse af Cox Regression Models .
PMML 4.1 blev frigivet den 31. december 2011.
Nye funktioner inkluderet:
- Nye modelementer til repræsentation af scorecards, k-nærmeste naboer ( KNN ) og baseline-modeller.
- Forenkling af flere modeller. I PMML 4.1 bruges det samme element til at repræsentere modelsegmentering, ensemble og kæde.
- Overordnet definition af feltomfang og feltnavne.
- En ny attribut, der identificerer for hvert modelelement, hvis modellen er klar eller ikke til implementering af produktionen.
- Forbedrede efterbehandlingsfunktioner (via outputelementet).
PMML 4.2 blev frigivet den 28. februar 2014.
Nye funktioner inkluderer:
- Transformationer: Nye elementer til implementering af tekstminedrift
- Nye indbyggede funktioner til implementering af regulære udtryk: matches, concat og erstatte
- Forenklet output til efterbehandling
- Forbedringer af Scorecard og Naive Bayes modelelementer
PMML 4.3 blev frigivet 23. august 2016.
Nye funktioner inkluderer:
- Nye modeltyper:
- Gaussisk proces
- Bayesian netværk
- Nye indbyggede funktioner
- Brugsafklaringer
- Dokumentationsforbedringer
Version 4.4 blev udgivet i november 2019.
Udgiv historik
| Version | Udgivelses dato |
|---|---|
| Version 0.7 | Juli 1997 |
| Version 0.9 | Juli 1998 |
| Version 1.0 | August 1999 |
| Version 1.1 | August 2000 |
| Version 2.0 | August 2001 |
| Version 2.1 | Marts 2003 |
| Version 3.0 | Oktober 2004 |
| Version 3.1 | December 2005 |
| Version 3.2 | Maj 2007 |
| Version 4.0 | Juni 2009 |
| Version 4.1 | December 2011 |
| Version 4.2 | Februar 2014 |
| Version 4.2.1 | Marts 2015 |
| Version 4.3 | August 2016 |
| Version 4.4 | November 2019 |
Data Mining Group
Det Data Mining Group er et konsortium ledet af Center for Computational Science Research, Inc., en nonprofit grundlagt i 2008. Data Mining Group også udviklet en standard kaldet Portable Format til Analytics , eller PFA, der er komplementær til PMML.
Se også
Referencer
eksterne links
- Dataforbehandling i PMML og ADAPA - En primer
- Video af Dr. Alex Guazzellis PMML-præsentation for ACM Data Mining Group (hostet af LinkedIn)
- PMML 3.2 Specifikation
- PMML 4.0 Specifikation
- PMML 4.1 Specifikation
- PMML 4.2.1 Specifikation
- PMML 4.3 Specifikation
- Repræsenterer forudsigelige løsninger i PMML: Flyt fra rådata til forudsigelser - Artikel offentliggjort på IBM developerWorks-webstedet.
- Forudsigende analyse inden for sundhedssektoren: vigtigheden af åbne standarder - artikel offentliggjort på IBM DeveloperWorks-webstedet.
