Prædiktiv modelmarkup sprog - Predictive Model Markup Language

PMML Logo.png

Den prædiktiv model Markup Language ( PMML ) er et XML -baserede prædiktiv model udvekslingsformat udtænkt af Dr. Robert Lee Grossman , derefter direktør for National Center for Data Mining ved University of Illinois i Chicago . PMML giver en måde for analytiske applikationer at beskrive og udveksle forudsigelige modeller produceret af datamining og maskinlæringsalgoritmer . Det understøtter almindelige modeller som logistisk regression og andre feedforward neurale netværk. Version 0.9 blev offentliggjort i 1998. Efterfølgende versioner er udviklet af Data Mining Group.

Da PMML er en XML-baseret standard, kommer specifikationen i form af et XML-skema . PMML i sig selv er en moden standard med over 30 organisationer, der har annonceret produkter, der understøtter PMML.

PMML-komponenter

En PMML-fil kan beskrives af følgende komponenter:

  • Overskrift : indeholder generelle oplysninger om PMML-dokumentet, såsom copyright-oplysninger til modellen, dens beskrivelse og information om det program, der bruges til at generere modellen, såsom navn og version. Det indeholder også en attribut til et tidsstempel, der kan bruges til at specificere datoen for oprettelse af model.
  • Data Dictionary : indeholder definitioner for alle de mulige felter, der bruges af modellen. Det er her, at et felt defineres som kontinuerligt, kategorisk eller ordinært (attributoptype). Afhængig af denne definition defineres de relevante værdiområder såvel som datatypen (såsom streng eller dobbelt).
  • Datatransformationer : transformationer muliggør kortlægning af brugerdata til en mere ønskelig form, der kan bruges af minedriftsmodellen. PMML definerer flere slags enkle datatransformationer.
    • Normalisering: kortlæg værdier til tal, input kan være kontinuerligt eller diskret.
    • Diskretisering: kortlæg kontinuerlige værdier til diskrete værdier.
    • Værdikortlægning: kortlæg diskrete værdier til diskrete værdier.
    • Funktioner (tilpasset og indbygget): udlede en værdi ved at anvende en funktion til en eller flere parametre.
    • Aggregering: bruges til at opsummere eller indsamle grupper af værdier.
  • Model : indeholder definitionen af ​​datamining-modellen. F.eks. Er et multi-lag feedforward neuralt netværk repræsenteret i PMML af et "NeuralNetwork" -element, der indeholder attributter såsom:
    • Modelnavn (attribut modelnavn)
    • Funktionsnavn (attribut funktionsnavn)
    • Algoritmnavn (attributalgoritmnavn)
    • Aktiveringsfunktion (attribut aktiveringFunktion)
    • Antal lag (attributnummerOfLayers)
Denne information efterfølges af tre slags neurale lag, der specificerer arkitekturen for den neurale netværksmodel, der er repræsenteret i PMML-dokumentet. Disse attributter er NeuralInputs, NeuralLayer og NeuralOutputs. Udover neurale netværk tillader PMML repræsentation af mange andre typer modeller, herunder understøttende vektormaskiner , associeringsregler , Naive Bayes-klassifikator , klyngemodeller, tekstmodeller , beslutningstræer og forskellige regressionsmodeller .
  • Mineskema : en liste over alle felter, der er brugt i modellen. Dette kan være en delmængde af felterne som defineret i dataordbogen. Den indeholder specifikke oplysninger om hvert felt, såsom:
    • Navn (attributnavn): skal henvise til et felt i dataordbogen
    • Usage type (attribute usageType): definerer den måde, hvorpå et felt skal bruges i modellen. Typiske værdier er: aktive, forudsagte og supplerende. Forudsagte felter er dem, hvis værdier forudsiges af modellen.
    • Outlier Treatment (attribut outliers): definerer den outlier behandling, der skal bruges. I PMML kan outliers behandles som manglende værdier, som ekstreme værdier (baseret på definitionen af ​​høje og lave værdier for et bestemt felt) eller som det er.
    • Politik for udskiftning af manglende værdi (attribut missingValueReplacement): Hvis denne attribut er angivet, erstattes en manglende værdi automatisk med de givne værdier.
    • Manglende værdibehandling (attribut missingValueTreatment): indikerer, hvordan den manglende værdiudskiftning blev afledt (f.eks. Som værdi, gennemsnit eller median).
  • Mål : muliggør efterbehandling af den forudsagte værdi i formatet skalering, hvis output fra modellen er kontinuerlig. Mål kan også bruges til klassificeringsopgaver. I dette tilfælde angiver attributten priorProbability en standard sandsynlighed for den tilsvarende målkategori. Det bruges, hvis forudsigelseslogikken ikke selv gav et resultat. Dette kan f.eks. Ske, hvis en inputværdi mangler, og der ikke er nogen anden metode til behandling af manglende værdier.
  • Output : dette element kan bruges til at navngive alle de ønskede outputfelter, der forventes fra modellen. Dette er funktioner i det forudsagte felt, og det er typisk selve den forudsagte værdi, sandsynligheden, klyngeaffinitet (for klyngemodeller), standardfejl osv. Den seneste udgivelse af PMML, PMML 4.1, udvidet output for at muliggøre generisk efterbehandling af modeludgange. I PMML 4.1 blev alle de indbyggede og brugerdefinerede funktioner, der oprindeligt kun var tilgængelige til forbehandling, også tilgængelige til efterbehandling.

PMML 4.0, 4.1, 4.2 og 4.3

PMML 4.0 blev frigivet den 16. juni 2009.

Eksempler på nye funktioner inkluderet:

PMML 4.1 blev frigivet den 31. december 2011.

Nye funktioner inkluderet:

  • Nye modelementer til repræsentation af scorecards, k-nærmeste naboer ( KNN ) og baseline-modeller.
  • Forenkling af flere modeller. I PMML 4.1 bruges det samme element til at repræsentere modelsegmentering, ensemble og kæde.
  • Overordnet definition af feltomfang og feltnavne.
  • En ny attribut, der identificerer for hvert modelelement, hvis modellen er klar eller ikke til implementering af produktionen.
  • Forbedrede efterbehandlingsfunktioner (via outputelementet).

PMML 4.2 blev frigivet den 28. februar 2014.

Nye funktioner inkluderer:

  • Transformationer: Nye elementer til implementering af tekstminedrift
  • Nye indbyggede funktioner til implementering af regulære udtryk: matches, concat og erstatte
  • Forenklet output til efterbehandling
  • Forbedringer af Scorecard og Naive Bayes modelelementer

PMML 4.3 blev frigivet 23. august 2016.

Nye funktioner inkluderer:

  • Nye modeltyper:
    • Gaussisk proces
    • Bayesian netværk
  • Nye indbyggede funktioner
  • Brugsafklaringer
  • Dokumentationsforbedringer

Version 4.4 blev udgivet i november 2019.

Udgiv historik

Version Udgivelses dato
Version 0.7 Juli 1997
Version 0.9 Juli 1998
Version 1.0 August 1999
Version 1.1 August 2000
Version 2.0 August 2001
Version 2.1 Marts 2003
Version 3.0 Oktober 2004
Version 3.1 December 2005
Version 3.2 Maj 2007
Version 4.0 Juni 2009
Version 4.1 December 2011
Version 4.2 Februar 2014
Version 4.2.1 Marts 2015
Version 4.3 August 2016
Version 4.4 November 2019

Data Mining Group

Det Data Mining Group er et konsortium ledet af Center for Computational Science Research, Inc., en nonprofit grundlagt i 2008. Data Mining Group også udviklet en standard kaldet Portable Format til Analytics , eller PFA, der er komplementær til PMML.

Se også

Referencer

eksterne links