By Daniel Whitmore, MSc in Industrial and Organizational Psychology
Kort fortalt
Signaler om spørsmålskvalitet er statistikk regnet ut fra ekte kandidatsvar, som forteller deg om et spørsmål gjør jobben sin. De to som betyr mest, er vanskelighetsgrad — andelen kandidater som svarer riktig — og skilleevne — hvor godt spørsmålet skiller sterke kandidater fra svake. Et spørsmål nesten alle svarer riktig eller galt på, bærer lite informasjon, og et med lav skilleevne sorterer ikke kandidatene i det hele tatt. Begge er signaler om å kontrollere fasiten og revidere ordlyden før spørsmålet former enda en beslutning.
Et spørsmål som ser greit ut, kan likevel måle ingenting
De fleste vurderingsspørsmål skrives én gang, gjennomgås for ordlyd, og betros deretter for alltid. Den tilliten er feilplassert — ikke fordi forfatterne er slurvete, men fordi kvaliteten på et spørsmål ikke er synlig i teksten. To spørsmål kan lese seg like godt og oppføre seg helt forskjellig i det øyeblikket kandidatene svarer: det ene skiller rent dem som kan stoffet, fra dem som ikke kan det, det andre deler rommet tilfeldig.
Spørsmålsanalyse er disiplinen med å bedømme spørsmål ut fra atferden deres i stedet for utseendet. Den kommer fra klassisk testteori, og for en arbeidsprøvebank trenger du bare to av målene dens for å fange spørsmålene som stille skader deg: hvor vanskelig spørsmålet er, og hvor godt det skiller. Begge regnes ut fra svarene dine egne kandidater allerede har gitt, og det er dette som gjør dem troverdige — de beskriver din test, på din populasjon, ikke et lærebokideal.
Poenget er ikke å jage et perfekt tall på hvert eneste spørsmål. Det er å løfte fram det lille settet med spørsmål som aktivt forvrenger resultatene dine, slik at et menneske kan se på dem og bestemme om hvert av dem skal rettes, beholdes eller pensjoneres. En god bank er ikke en der hvert spørsmål er feilfritt; den er en der de feilbeheftede spørsmålene er kjent.
Vanskelighetsgrad: både for lett og for vanskelig koster deg informasjon
Vanskelighetsgrad, forvirrende nok navngitt, er rett og slett andelen kandidater som svarer riktig på et spørsmål — et spørsmål 70 % svarer riktig på, har en vanskelighetsgrad på 0,70. Jobben dens er ikke å være høy eller lav, men å være informativ, og ytterpunktene bærer nesten ingen informasjon. Når 95 % eller flere av kandidatene svarer riktig, skiller det ikke lenger noen: både sterke og svake kandidater klarer det, så spørsmålet legger til lengde uten å legge til signal. Det kan fortsatt høre hjemme i starten av en vurdering som oppvarming, men det gjør ikke målearbeid.
Det motsatte ytterpunktet er farligere. Når bare 20 % eller færre svarer riktig, er den ærlige førstemistanken ikke at kandidatene dine er svake — det er at spørsmålet er ødelagt. En feilnøklet fasit, en flertydig spørsmålstekst, to forsvarlige alternativer, eller en oppgave som tester noe rollen aldri trenger, vil alle drive riktigandelen i gulvet. Et genuint vanskelig spørsmål som en femtedel av et sterkt tilfang likevel klarer, er legitimt og verdifullt; et spørsmål nesten ingen klarer, har som regel et problem du kan rette på ett minutt når du først leter.
Så vanskelighetsgrad leses best som et par rekkverk, ikke som et mål. Svært lette spørsmål er kandidater til pensjonering eller flytting; svært vanskelige spørsmål er kandidater til en kontroll av fasit og ordlyd. Alt imellom gjør jobben sin, og trenger ikke oppmerksomheten din.
Skilleevne: skiller spørsmålet sterke fra svake?
Skilleevne er det kraftigste av de to signalene, og det teamene oftest overser. Det stiller ett eneste spørsmål: har kandidatene som gjør det godt på dette spørsmålet, også en tendens til å gjøre det godt på vurderingen samlet sett? Når svaret er ja, drar spørsmålet i samme retning som resten av testen — det skiller. Når det ikke finnes noen sammenheng, måler spørsmålet noe annet, eller ingenting, uansett hvor fornuftig det leses.
Konkret er skilleevne korrelasjonen mellom å svare riktig på ett spørsmål og kandidatens totalpoengsum. Høye verdier betyr at sterke kandidater treffer og svake bommer, som er nøyaktig det du vil ha. En verdi nær null betyr at spørsmålet ikke sorterer kandidatene i det hele tatt. En negativ verdi er alarmen verdt å handle på umiddelbart: den betyr at de sterkere kandidatene dine har større sannsynlighet for å svare galt — det klassiske fingeravtrykket på en feilnøklet fasit eller en felle som straffer dem som forstår stoffet dypest.
En mye brukt tommelfingerregel behandler skilleevne under omtrent 0,20 som dårlig — spørsmålet skiller så vidt sterke fra svake og er en kandidat til revisjon. Men skilleevne er bare meningsfull når nok har svart; på tre svar er den støy. Derfor venter en ansvarlig markering på et minsteutvalg før den stoler på tallet, og derfor blir et ferskt spørsmål aldri dømt på sine første få kandidater.
Disse signalene opparbeides, de gjettes ikke
Den ærlige begrensningen ved spørsmålsanalyse er at den ikke kan fortelle deg noe den dagen du skriver et spørsmål. Vanskelighetsgrad og skilleevne er egenskaper ved svar, så et helt nytt spørsmål har ingen helse i det hele tatt før kandidatene har svart på det nok ganger til å si noe reelt. Dette er en egenskap, ikke et hull: det holder signalene forankret i dokumentasjon i stedet for i meninger, og det beskytter et nytt spørsmål mot å bli bedømt før det har fått en rettferdig sjanse.
Det betyr også at spørsmålskvalitet er en vedlikeholdsvane, ikke en engangssperre. En bank som var ren for et år siden, glir etter hvert som rollen endrer seg, som kandidattilfanget skifter, og som spørsmål gjenbrukes på tvers av vurderinger. Spørsmålene verdt å følge med på, er de med reell bruk og nok svar til å stole på — som i praksis er et lite, skiftende utvalg av banken framfor hele den. Du gransker ikke alt; du leser den håndfullen spørsmål dataene har markert.
Slik løfter SkillCort dette fram: «Needs attention»-markeringen
SkillCort regner ut spørsmålshelse fra ekte kandidatsvar på tvers av hver vurdering et spørsmål opptrer i, og gjør de to signalene om til ett enkelt, tydelig filter på spørsmålsbanken din: Needs attention. Et spørsmål havner der når dataene viser ett av tre konkrete problemer — lav skilleevne når minst fem personer har svart, en vanskelighetsgrad på 95 % eller høyere (svært lett), eller en vanskelighetsgrad på 20 % eller lavere (svært vanskelig). Ingenting markeres på en anelse, og ingenting markeres før det har svarene som rettferdiggjør det.
Hvert markert spørsmål bærer begrunnelsen sin rett i listen, som en brikke ved siden av spørsmålet: Low discrimination, Very easy eller Very hard, med de underliggende tallene ved museover. Så banken forteller deg ikke bare at et spørsmål er svakt — den forteller deg hvorfor, og det er dette som gjør en advarsel om til et neste steg. En analysevisning for spørsmålsbanken ruller de samme signalene opp over hele banken, og legger til hvilke spørsmål som har nok data til å bedømmes, og hvilke som aldri har vært i bruk, slik at du kan se helsen i målingene dine med ett blikk framfor ett spørsmål om gangen.
Designregelen bak alt dette er den samme som styrer resten av plattformen: systemet løfter fram signalet og begrunnelsen, og et menneske tar avgjørelsen. SkillCort vil fortelle deg at et spørsmål er svært vanskelig og vise deg at bare 12 % svarte riktig på det; den vil ikke stille slette spørsmålet eller overprøve din vurdering av om den vanskelighetsgraden er et problem eller selve poenget.
Hva du gjør når et spørsmål blir markert
Start med fasiten, særlig for spørsmål som er svært vanskelige eller har negativ skilleevne. En overraskende andel av de alarmerende tallene løser seg i det øyeblikket du leser det nøklede svaret på nytt og innser at et alternativ nummer to også er riktig, eller at det tiltenkte svaret er galt. Denne ene kontrollen retter flere markerte spørsmål enn noen mengde omskriving.
Er fasiten riktig, les spørsmålet slik en forvirret kandidat ville gjort. Svært vanskelige spørsmål og spørsmål med lav skilleevne deler ofte en rotårsak: flertydig ordlyd, to forsvarlige svar, eller en spørsmålstekst som stille tester noe utenfor ferdigheten du mente å måle. Å stramme inn språket slik at bare én lesning overlever, er som regel nok til å flytte tallene. Svært lette spørsmål er det mildere tilfellet — behold dem som oppvarming hvis de tjener det formålet, eller pensjoner dem, slik at vurderingen bruker tiden sin der målingen faktisk skjer.
Til slutt: motstå trangen til å overreagere på små utvalg. Et spørsmål markert på grunnlag av en håndfull svar er et spørsmål å følge med på, ikke å dømme; gi det flere kandidater før du handler. Spørsmålskvalitet er en langsom, kumulativ lesning, og målet er en bank der de svake spørsmålene er kjent og håndtert — ikke en bank skrubbet fri for hvert eneste ufullkomne tall.
Hovedpunkter
- Kvaliteten på et spørsmål ligger i hvordan kandidatene svarer på det, ikke i hvordan det leses — to like ryddige spørsmål kan oppføre seg helt forskjellig.
- Vanskelighetsgrad er et par rekkverk: svært lette spørsmål (≥95 % riktig) tilfører ikke signal; svært vanskelige (≤20 % riktig) peker som regel på et feilnøklet eller flertydig spørsmål.
- Skilleevne — om sterke kandidater treffer og svake bommer — er det skarpeste signalet; under omtrent 0,20 er svakt, og en negativ verdi betyr nesten alltid en feilnøklet fasit.
- Denne statistikken opparbeides fra ekte svar, så nye spørsmål har ingen helse før nok kandidater har svart; en ansvarlig markering venter på et minsteutvalg.
- SkillCorts filter «Needs attention» løfter fram markerte spørsmål med begrunnelsen rett i listen (Low discrimination / Very easy / Very hard) — systemet viser signalet, et menneske beslutter tiltaket.