SpraakXML - VoiceXML

VoiceXML ( VXML ) is een digitale documentstandaard voor het specificeren van interactieve media en gesproken dialogen tussen mensen en computers. Het wordt gebruikt voor het ontwikkelen van audio- en spraakresponstoepassingen, zoals banksystemen en geautomatiseerde portals voor klantenservice. VoiceXML-toepassingen worden ontwikkeld en ingezet op een manier die analoog is aan hoe een webbrowser de Hypertext Markup Language (HTML) die hij van een webserver ontvangt, interpreteert en visueel weergeeft . VoiceXML-documenten worden geïnterpreteerd door een spraakbrowser en in veelgebruikte implementatiearchitecturen communiceren gebruikers met spraakbrowsers via het openbare geschakelde telefoonnetwerk (PSTN).

Het VoiceXML-documentformaat is gebaseerd op Extensible Markup Language (XML). Het is een standaard ontwikkeld door het World Wide Web Consortium (W3C).

Gebruik

VoiceXML-applicaties worden veel gebruikt in veel bedrijfstakken en commerciële segmenten. Deze toepassingen omvatten, om onderzoek, pakket tracking, een routebeschrijving, alert, wake-up, flight tracking, voice toegang tot e-mail, customer relationship management, voorschrift navullen, audio opiniebladen, voice dialing, vastgoed informatie en nationale inlichtingendiensten toepassingen .

VoiceXML heeft tags die de spraakbrowser instrueren om spraaksynthese , automatische spraakherkenning , dialoogbeheer en audioweergave te bieden. Het volgende is een voorbeeld van een VoiceXML-document:

<vxml version="2.0" xmlns="http://www.w3.org/2001/vxml">
  <form>
    <block>
      <prompt>
        Hello world!
      </prompt>
    </block>
  </form>
</vxml>

Indien geïnterpreteerd door een VoiceXML-tolk, wordt "Hallo wereld" weergegeven met gesynthetiseerde spraak.

Gewoonlijk wordt HTTP gebruikt als het transportprotocol voor het ophalen van VoiceXML-pagina's. Sommige toepassingen kunnen statische VoiceXML-pagina's gebruiken, terwijl andere afhankelijk zijn van dynamische VoiceXML-paginageneratie met behulp van een toepassingsserver zoals Tomcat , Weblogic , IIS of WebSphere .

Historisch gezien hebben leveranciers van VoiceXML-platforms de standaard op verschillende manieren geïmplementeerd en eigen functies toegevoegd. Maar de VoiceXML 2.0-standaard, aangenomen als een W3C-aanbeveling op 16 maart 2004, verduidelijkte de meeste verschillen. Het VoiceXML Forum, een branchegroep die het gebruik van de standaard promoot, biedt een conformiteitstestproces dat de implementaties van leveranciers certificeert als conform.

Geschiedenis

AT&T Corporation , IBM , Lucent en Motorola hebben in maart 1999 het VoiceXML Forum opgericht om een ​​standaard opmaaktaal te ontwikkelen voor het specificeren van gesproken dialogen. In september 1999 bracht het Forum VoiceXML 0.9 uit voor commentaar van leden, en in maart 2000 publiceerden ze VoiceXML 1.0. Kort daarna droeg het Forum de controle over de standaard over aan de W3C. Het W3C produceerde verschillende tussenversies van VoiceXML 2.0, die in maart 2004 de laatste "Aanbeveling"-fase bereikten.

VoiceXML 2.1 heeft een relatief kleine set extra functies toegevoegd aan VoiceXML 2.0, gebaseerd op feedback van implementaties van de 2.0-standaard. Het is achterwaarts compatibel met VoiceXML 2.0 en bereikte in juni 2007 de W3C-aanbevelingsstatus.

Toekomstige versies van de standaard

VoiceXML 3.0 wordt de volgende grote release van VoiceXML, met nieuwe belangrijke functies. Het bevat een nieuwe XML statechart-beschrijvingstaal genaamd SCXML .

Gerelateerde normen:

Het Speech Interface Framework van het W3C definieert ook deze andere standaarden die nauw verbonden zijn met VoiceXML.

SRGS en SISR

De Speech Recognition Grammar Specification (SRGS) wordt gebruikt om de spraakherkenner te vertellen welke zinspatronen hij moet horen: deze patronen worden grammatica's genoemd. Zodra de spraakherkenner de meest waarschijnlijke zin heeft bepaald die hij heeft gehoord, moet hij de semantische betekenis uit die zin extraheren en terugsturen naar de VoiceXML-interpreter. Deze semantische interpretatie wordt gespecificeerd via de Semantic Interpretation for Speech Recognition (SISR) standaard. SISR wordt binnen SRGS gebruikt om de semantische resultaten te specificeren die bij de grammatica's horen, dwz de set ECMAScript-toewijzingen die de semantische structuur creëren die wordt geretourneerd door de spraakherkenner.

SSML

De Speech Synthesis Markup Language (SSML) wordt gebruikt om tekstuele prompts te verfraaien met informatie over hoe ze het beste in synthetische spraak kunnen worden weergegeven, bijvoorbeeld welke spraaksynthesizer-stem moet worden gebruikt of wanneer luider of zachter moet worden gesproken.

AUB

De Pronunciation Lexicon Specification (PLS) wordt gebruikt om te definiëren hoe woorden worden uitgesproken. De gegenereerde uitspraakinformatie is bedoeld om te worden gebruikt door zowel spraakherkenners als spraaksynthesizers in toepassingen voor het bladeren door spraak.

CCXML

De Call Control eXtensible Markup Language (CCXML) is een aanvullende W3C-standaard. Op sommige VoiceXML-platforms wordt een CCXML-tolk gebruikt om de eerste oproep tot stand te brengen tussen de beller en de spraakbrowser en om telefoniediensten te bieden, zoals het doorverbinden van oproepen en de verbinding met de spraakbrowser. CCXML kan ook worden gebruikt in niet-VoiceXML-contexten.

MSML, MSCML, MediaCTRL

In mediaservertoepassingen is het vaak nodig dat meerdere gesprekslijnen met elkaar communiceren, bijvoorbeeld in een conferentie met meerdere partijen. Er werden enkele tekortkomingen vastgesteld in VoiceXML voor deze toepassing en daarom hebben bedrijven specifieke scripttalen ontworpen om met deze omgeving om te gaan. De Media Server Markup Language (MSML) was de oplossing van Convedia en de Media Server Control Markup Language (MSCML) was de oplossing van Snowshore. Snowshore is nu eigendom van Dialogic en Convedia is nu eigendom van Radisys. Deze talen bevatten ook 'hooks' zodat externe scripts (zoals VoiceXML) kunnen draaien op call-legs waar IVR- functionaliteit vereist is.

Er was een IETF-werkgroep genaamd mediactrl ("media control") die werkte aan een opvolger voor deze scriptingsystemen, waarvan men hoopt dat deze zal evolueren naar een open en algemeen aanvaarde standaard. De werkgroep mediactrl is in 2013 afgerond.

Zie ook

Referenties

Externe links

Luister naar dit artikel ( 9 minuten )
Gesproken Wikipedia-pictogram
Dit audiobestand is gemaakt op basis van een herziening van dit artikel van 29 oktober 2011 en geeft geen latere bewerkingen weer. ( 29-10-2011 )