ABX test - ABX test
En ABX -test er en metode til at sammenligne to valg af sensoriske stimuli for at identificere påviselige forskelle mellem dem. Et emne præsenteres med to kendte prøver (prøve A , den første reference og prøve B , den anden reference) efterfulgt af en ukendt prøve X , der tilfældigt vælges fra enten A eller B. Emnet skal derefter identificere X som enten A eller B. Hvis X ikke kan identificeres pålideligt med en lav p-værdi i et forudbestemt antal forsøg, kan nulhypotesen ikke afvises, og det kan ikke bevises, at der er en mærkbar forskel mellem A og B.
ABX-test kan let udføres som dobbeltblindede forsøg , hvilket eliminerer enhver mulig ubevidst indflydelse fra forskeren eller testvejlederen. Fordi prøver A og B leveres lige før prøve X, behøver forskellen ikke at skelnes fra antagelse baseret på langtidshukommelse eller tidligere erfaring. Således svarer ABX -testen, om der under ideelle omstændigheder kan findes en perceptuel forskel.
ABX -test bruges almindeligvis i evalueringer af digitale lyddatakomprimeringsmetoder ; prøve A er typisk en ukomprimeret prøve, og prøve B er en komprimeret version af A. Hørbare komprimeringsartefakter, der angiver en mangel i komprimeringsalgoritmen, kan identificeres med efterfølgende test. ABX -test kan også bruges til at sammenligne de forskellige grader af loyalitetstab mellem to forskellige lydformater ved en given bitrate .
ABX -test kan bruges til at auditionere input, bearbejdning og output komponenter samt kabelføring: stort set ethvert lydprodukt eller prototypedesign.
Historie
Historien om ABX -test og navngivning går tilbage til 1950 i et papir udgivet af to Bell Labs -forskere, WA Munson og Mark B. Gardner, med titlen Standardizing Auditory Tests .
Formålet med dette papir er at beskrive en testprocedure, der har vist løfte i denne retning, og at give beskrivelser af udstyr, der har vist sig nyttigt til at minimere variationen af testresultaterne. Proceduren, som vi har kaldt “ABX” -testen, er en ændring af metoden til parrede sammenligninger. En observatør får en tidssekvens med tre signaler for hver dom, han bliver bedt om at foretage. I løbet af det første tidsinterval hører han signal A, under det andet, signal B og til sidst signal X. Hans opgave er at angive, om lyden, der blev hørt under X -intervallet, var mere sådan under A -intervallet eller mere sådan under B interval. For en tærskeltest er A -intervallet stille, B -intervallet er signal, og X -intervallet er enten stille eller signal.
Testen har udviklet sig til andre variationer, såsom emnekontrol over varighed og sekvens af test. Et sådant eksempel var hardware ABX -komparatoren i 1977, bygget af ABX -virksomheden i Troy, Michigan, og dokumenteret af en af dens grundlæggere, David Clark.
Forfining til A/B -testen
Forfatterens første erfaring med dobbeltblindet hørbarhedstest var som medlem af SMWTMS Audio Club i begyndelsen af 1977. Der blev leveret en knap, der tilfældigt ville vælge komponent A eller B. Identificere en af disse blev X-komponenten stærkt hæmmet af ikke have de kendte A og B til rådighed som reference.
Dette blev korrigeret ved hjælp af tre sammenlåste trykknapper, A, B og X. Når et X var valgt, ville det forblive det pågældende A eller B, indtil det blev besluttet at gå videre til et andet tilfældigt valg.
Et andet problem blev imidlertid hurtigt indlysende. Der var altid en hørbar relæovergangsforsinkelse ved skift fra A til B. Ved skift fra A til X ville tidsforsinkelsen imidlertid mangle, hvis X virkelig var A og til stede, hvis X virkelig var B. Denne fremmede cue blev fjernet af indsætte en frafaldstid med fast længde, når der blev foretaget ændringer. Frafaldstiden blev valgt til at være 50 ms, hvilket giver et let konsistent klik, samtidig med at den muliggør subjektivt øjeblikkelig sammenligning.
ABX -virksomheden er nu nedlagt og hardware -sammenligninger generelt, da kommercielle tilbud uddø. Der findes et utal af softwareværktøjer, f.eks. Foobar ABX-plug-in til udførelse af filsammenligninger. Men test af hardwareudstyr kræver opbygning af brugerdefinerede implementeringer.
Hardware test
ABX testudstyr, der anvender relæer til at skifte mellem to forskellige hardwarestier, kan hjælpe med at afgøre, om der er perceptuelle forskelle i kabler og komponenter. Video, lyd og digitale transmissionsveje kan sammenlignes. Hvis skiftet er mikroprocessorstyret, er dobbeltblindede tests mulige.
Højttalerniveau og linjeniveau sammenligninger kan udføres på en ABX -testenhed, der tilbydes til salg som ABX -komparatoren af QSC Audio Products fra 1998 til 2004. Andre hardwareløsninger er blevet fremstillet privat af enkeltpersoner eller organisationer til intern testning.
Tillid
Hvis der kun blev udført et ABX -forsøg, ville tilfældigt gætteri have en 50% chance for at vælge det korrekte svar, det samme som at vende en mønt. For at kunne afgive en erklæring med en vis grad af tillid , skal mange forsøg udføres. Ved at øge antallet af forsøg øges sandsynligheden for statistisk at hævde en persons evne til at skelne A og B for et givet konfidensniveau. Et konfidensniveau på 95% betragtes almindeligvis som statistisk signifikant . Firmaet QSC i ABX Comparator -brugermanualen anbefalede mindst ti lytteforsøg i hver testrunde.
| Antal forsøg | 10 | 11 | 12 | 13 | 14 | 15 | 16 | 17 | 18 | 19 | 20 | 21 | 22 | 23 | 24 | 25 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Mindste antal korrekte | 9 | 9 | 10 | 10 | 11 | 12 | 12 | 13 | 13 | 14 | 15 | 15 | 16 | 16 | 17 | 18 |
QSC anbefalede, at der ikke udføres mere end 25 forsøg, da emnets træthed kan indtræde, hvilket gør testen mindre følsom (mindre tilbøjelig til at afsløre ens faktiske evne til at skelne mellem forskellen mellem A og B). Imidlertid kan en mere følsom test opnås ved at samle resultaterne fra en række sådanne tests ved hjælp af separate individer eller tests fra det samme emne udført mellem hvilepauser. For et stort antal samlede forsøg N kan der kræves et signifikant resultat (et med 95% tillid), hvis antallet af korrekte svar overstiger . Vigtige beslutninger er normalt baseret på et højere tillidsniveau, da et fejlagtigt "betydeligt resultat" ville blive hævdet i en af 20 sådanne tests simpelthen ved en tilfældighed.
Softwaretest
Den foobar2000 og Amarok lydafspillere support softwarebaseret ABX test, sidstnævnte ved hjælp af en tredjepart script. Lacinato ABX er et cross-platform lydtestværktøj til Linux, Windows og 64-bit Mac. Lacinato WebABX er et webbaseret cross-browser audio ABX-værktøj. Open source aveX blev hovedsageligt udviklet til Linux, som også leverer testovervågning fra en fjerncomputer. ABX patcher er en ABX -implementering til Max/MSP . Mere ABX -software findes på det arkiverede PCABX -websted.
Codec -lytteprøver
En codec -lyttetest er en videnskabelig undersøgelse designet til at sammenligne to eller flere tabende lyd -codecs , normalt med hensyn til opfattet troværdighed eller komprimeringseffektivitet.
Potentielle fejl
ABX er en form for tvunget valg -test. Et emnes valg kan være fortjent, dvs. at emnet virkelig ærligt forsøgte at identificere, om X virkede tættere på A eller B. Men uinteresserede eller trætte emner vælger tilfældigt uden selv at prøve. Hvis det ikke fanges, kan dette fortynde resultaterne af andre forsøgspersoner, der med vilje tog testen og udsætte resultatet for Simpsons paradoks , hvilket kan resultere i falske resuméresultater. Blot at se på testens totalresultater ( m ud af n svar er korrekte) kan ikke afsløre forekomster af dette problem.
Dette problem bliver mere akut, hvis forskellene er små. Brugeren kan blive frustreret og simpelthen sigte mod at afslutte testen ved at stemme tilfældigt. I denne henseende har tvangsvalgstest som ABX en tendens til at favorisere negative resultater, når forskellene er små, hvis der ikke bruges korrekte protokoller til at beskytte mod dette problem.
Bedste praksis kræver både inkludering af kontroller og screening af forsøgspersoner:
En vigtig overvejelse er inddragelse af passende kontrolbetingelser. Typisk omfatter kontrolbetingelserne præsentation af uforstyrret lydmateriale, der er indført på måder, der er uforudsigelige for emnerne. Det er forskellene mellem bedømmelse af disse kontrolstimuli og de potentielt nedsatte, der gør det muligt at konkludere, at karaktererne er faktiske vurderinger af funktionsnedsættelserne.
3.2.2 Efter-screening af emner
Post-screening metoder kan groft adskilles i mindst to klasser; den ene er baseret på inkonsekvenser sammenlignet med middelresultatet, og en anden er afhængig af subjektets evne til at foretage korrekte identifikationer. Første klasse er aldrig forsvarlig. Når der udføres en subjektiv lytte-test med den testmetode, der anbefales her, er de nødvendige oplysninger til anden klasse efter-screening automatisk tilgængelige. En foreslået statistisk metode til at gøre dette er beskrevet i bilag 1. '
Metoderne bruges primært til at eliminere emner, der ikke kan foretage passende diskrimineringer. Anvendelsen af en efterscreeningsmetode kan tydeliggøre tendenserne i et testresultat. I betragtning af variationen i forsøgspersoners følsomhed over for forskellige artefakter bør der udvises forsigtighed.
Andre mangler inkluderer mangel på faglig uddannelse og fortrolighed med testen og det valgte indhold:
4.1 Kendskab eller uddannelsesfase
Inden formel bedømmelse skal forsøgspersonerne have lov til at blive grundigt fortrolige med testfaciliteterne, testmiljøet, karakterprocessen, karakterskalaerne og metoderne til deres anvendelse. Emner bør også blive grundigt fortrolige med de undersøgte artefakter. For de mest følsomme tests bør de blive udsat for alt det materiale, de vil bedømme senere i de formelle karakterer. Under bekendtgørelse eller træning skal emner helst være sammen i grupper (f.eks. Bestående af tre emner), så de frit kan interagere og diskutere de artefakter, de opdager med hinanden.
Andre problemer kan opstå fra selve ABX -udstyret, som skitseret af Clark, hvor udstyret giver et signal , så motivet kan identificere kilden. Manglende gennemsigtighed i ABX -armaturet skaber lignende problemer.
Da auditive tests og mange andre sensoriske tests er afhængige af korttidshukommelse , som kun varer et par sekunder, er det kritisk, at testarmaturet giver emnet mulighed for at identificere korte segmenter, der hurtigt kan sammenlignes. Pops og fejl i switch-apparater skal ligeledes elimineres, da de kan dominere eller på anden måde forstyrre stimuli, der testes i det, der er gemt i motivets korttidshukommelse.
Alternativer
Evaluering af algoritmisk lydkomprimering
Da ABX-test kræver, at mennesker evaluerer tabende lyd-codecs, er det tidskrævende og dyrt. Derfor er der udviklet billigere metoder, fx PEAQ , som er en implementering af ODG .
MUSHRA
I MUSHRA præsenteres emnet for referencen (mærket som sådan), et bestemt antal testprøver, en skjult version af referencen og et eller flere ankre. En 0-100 RATING-skala gør det muligt at bedømme meget små forskelle, og den skjulte version giver stadig diskriminationskontrol.
Forskelsbehandlingstest
Alternative generelle metoder bruges til diskrimineringstest , såsom parret sammenligning, duo -trio og trekantstest . Heraf er duo -trio og trekantstestning særlig tæt på ABX -test. Skematisk:
- Duo -trio
- AXY - en kendt, to ukendte (en er lig med A, andre er lig med B), testen er hvilken ukendt er den kendte: X = A (og Y = B) eller Y = A (og X = B).
- Trekant
- XXY - tre ukendte (to er A og en er B eller en er A og to er B), test som er den ulige: Y = 1, Y = 2 eller Y = 3.
I denne sammenhæng er ABX -test også kendt som "duo -trio" i "afbalanceret reference" -tilstand - begge kendte præsenteres som referencer, snarere end én alene.