By Daniel Whitmore, MSc in Industrial and Organizational Psychology
Kort sagt
Signaler om frågekvalitet är statistik som beräknas ur verkliga kandidatsvar och som talar om ifall en fråga gör sitt jobb. De två som betyder mest är svårighetsgraden — andelen kandidater som svarar rätt — och särskiljningsförmågan — hur väl frågan skiljer starka kandidater från svaga. En fråga som nästan alla svarar rätt eller fel på bär lite information, och en med låg särskiljningsförmåga sorterar inte kandidaterna alls. Båda är signaler om att kontrollera facit och se över formuleringen innan frågan formar ännu ett beslut.
En fråga som ser bra ut kan ändå mäta ingenting
De flesta bedömningsfrågor skrivs en gång, granskas språkligt och får sedan förtroende för alltid. Det förtroendet är felplacerat — inte för att författarna är slarviga, utan för att en frågas kvalitet inte syns i texten. Två frågor kan läsas lika väl och bete sig helt olika i samma stund som kandidaterna svarar på dem: den ena skiljer rent de som kan stoffet från de som inte kan det, den andra delar rummet på måfå.
Frågeanalys är disciplinen att bedöma frågor efter deras beteende i stället för deras utseende. Den kommer från klassisk testteori, och för en arbetsprovsbank behöver du bara två av dess mått för att fånga de frågor som i tysthet skadar dig: hur svår frågan är och hur väl den särskiljer. Båda beräknas ur de svar dina egna kandidater redan har gett, och det är det som gör dem tillförlitliga — de beskriver ditt test, på din population, inte ett läroboksideal.
Poängen är inte att jaga en perfekt siffra på varje fråga. Den är att lyfta fram den lilla uppsättning frågor som aktivt förvränger dina resultat, så att en människa kan titta på dem och avgöra om var och en ska åtgärdas, behållas eller pensioneras. En bra bank är inte en där varje fråga är felfri; den är en där de bristfälliga frågorna är kända.
Svårighetsgrad: både för lätt och för svårt kostar dig information
Svårighetsgraden är, förvirrande nog, helt enkelt andelen kandidater som svarar rätt på en fråga — en fråga som 70 % svarar rätt på har svårighetsgraden 0,70. Dess uppgift är inte att vara hög eller låg utan att vara informativ, och ytterligheterna bär nästan ingen information. När 95 % eller fler av kandidaterna svarar rätt på en fråga skiljer den inte längre någon åt: både starka och svaga kandidater klarar den, så frågan lägger till längd utan att lägga till signal. Den kan fortfarande höra hemma i början av en bedömning som uppvärmning, men den utför inget mätarbete.
Den motsatta ytterligheten är farligare. När bara 20 % eller färre svarar rätt är den ärliga första misstanken inte att dina kandidater är svaga — det är att frågan är trasig. Ett felaktigt facit, en tvetydig frågestam, två försvarbara alternativ eller en uppgift som testar något rollen aldrig behöver kommer alla att driva rättfrekvensen i botten. En genuint svår fråga som en femtedel av en stark grupp ändå löser är legitim och värdefull; en fråga som nästan ingen löser har oftast ett problem du kan åtgärda på en minut när du väl letar.
Svårighetsgraden läses alltså bäst som ett par skyddsräcken, inte som ett mål. Mycket lätta frågor är kandidater för pensionering eller omplacering; mycket svåra frågor är kandidater för en kontroll av facit och formulering. Allt däremellan gör sitt jobb och behöver inte din uppmärksamhet.
Särskiljningsförmåga: skiljer frågan starka från svaga?
Särskiljningsförmågan är den kraftfullare av de två signalerna och den som team oftast missar. Den ställer en enda fråga: tenderar de kandidater som klarar just den här frågan väl också att klara bedömningen som helhet väl? När svaret är ja drar frågan åt samma håll som resten av testet — den särskiljer. När det inte finns något samband mäter frågan något annat, eller ingenting, hur förnuftig den än läses.
Konkret är särskiljningsförmågan korrelationen mellan att svara rätt på en enskild fråga och kandidatens totalpoäng. Höga värden betyder att starka kandidater klarar den och svaga missar den, vilket är precis vad du vill ha. Ett värde nära noll betyder att frågan inte sorterar kandidaterna alls. Ett negativt värde är larmet som är värt att agera på omedelbart: det betyder att dina starkare kandidater är mer benägna att svara fel på frågan — det klassiska fingeravtrycket av ett felaktigt facit eller en fälla som straffar dem som förstår stoffet djupast.
En vida använd tumregel behandlar särskiljningsförmåga under ungefär 0,20 som dålig — frågan skiljer knappt starka från svaga och är en kandidat för omarbetning. Men särskiljningsförmågan är meningsfull först när tillräckligt många har svarat; på tre svar är den brus. Det är därför en ansvarsfull flagga väntar in ett minsta urval innan den litar på siffran, och därför en färsk fråga aldrig döms ut på sina första kandidater.
De här signalerna förtjänas, de gissas inte
Den ärliga begränsningen med frågeanalys är att den inte kan säga dig någonting den dag du skriver en fråga. Svårighetsgrad och särskiljningsförmåga är egenskaper hos svar, så en helt ny fråga har ingen hälsa alls förrän kandidater har svarat på den tillräckligt många gånger för att den ska säga något verkligt. Det är en egenskap, inte en lucka: det håller signalerna förankrade i underlag i stället för i tyckande, och det skyddar en ny fråga från att dömas innan den har fått en rättvis chans.
Det betyder också att frågekvalitet är en underhållsvana, inte en engångsgrind. En bank som var ren för ett år sedan glider när rollen förändras, när kandidatgruppen skiftar och när frågor återanvänds mellan bedömningar. De frågor som är värda att hålla ögonen på är de med verklig användning och tillräckligt många svar för att gå att lita på — vilket i praktiken är en liten, föränderlig delmängd av banken snarare än hela den. Du granskar inte allt; du läser den handfull frågor som data har flaggat.
Så lyfter SkillCort fram detta: flaggan ”Needs attention”
SkillCort beräknar frågehälsa ur verkliga kandidatsvar över varje bedömning en fråga förekommer i, och gör de två signalerna till ett enda, enkelt filter på din frågebank: Needs attention. En fråga hamnar där när data visar ett av tre konkreta problem — låg särskiljningsförmåga när minst fem personer har svarat, en svårighetsgrad på 95 % eller högre (mycket lätt), eller en svårighetsgrad på 20 % eller lägre (mycket svår). Ingenting flaggas på en känsla, och ingenting flaggas innan det finns svar som motiverar det.
Varje flaggad fråga bär sitt skäl direkt i listan, som en etikett bredvid frågan: Low discrimination, Very easy eller Very hard, med de underliggande siffrorna vid hovring. Så banken talar inte bara om att en fråga är svag — den talar om varför, och det är det som gör en varning till en nästa åtgärd. En analysvy för frågebanken räknar upp samma signaler över hela banken och lägger till vilka frågor som har tillräckligt med data för att bedömas och vilka som aldrig har använts, så att du kan se hälsan i din mätning med en blick i stället för en fråga i taget.
Designregeln bakom allt detta är densamma som styr resten av plattformen: systemet lyfter fram signalen och skälet, och en människa fattar beslutet. SkillCort talar om för dig att en fråga är mycket svår och visar att bara 12 % svarade rätt på den; systemet raderar inte frågan i tysthet och kör inte över din bedömning av om den svårighetsgraden är ett problem eller själva poängen.
Vad du gör när en fråga flaggas
Börja med facit, särskilt för mycket svåra frågor och frågor med negativ särskiljningsförmåga. En förvånande andel av de oroande siffrorna löser sig i samma stund som du läser om det markerade svaret och inser att ett andra alternativ också är rätt, eller att det avsedda svaret är fel. Den här enda kontrollen åtgärdar fler flaggade frågor än hur mycket omskrivning som helst.
Om facit stämmer, läs frågan som en förvirrad kandidat skulle göra. Mycket svåra frågor och frågor med låg särskiljningsförmåga delar ofta en grundorsak: tvetydig formulering, två försvarbara svar eller en frågestam som i tysthet testar något utanför den färdighet du menade att mäta. Att strama åt språket så att bara en läsning överlever räcker oftast för att flytta siffrorna. Mycket lätta frågor är det mildare fallet — behåll dem som uppvärmning om de fyller det syftet, eller pensionera dem så att bedömningen lägger sin tid där mätningen faktiskt sker.
Motstå slutligen lusten att överreagera på små urval. En fråga som flaggas på styrkan av en handfull svar är en fråga att hålla ögonen på, inte att döma ut; ge den fler kandidater innan du agerar. Frågekvalitet är en långsam, kumulativ avläsning, och målet är en bank vars svaga frågor är kända och hanterade — inte en bank skrubbad ren från varje ofullkomlig siffra.
Det viktigaste
- En frågas kvalitet finns i hur kandidaterna svarar på den, inte i hur den läses — två lika välskrivna frågor kan bete sig helt olika.
- Svårighetsgraden är ett par skyddsräcken: mycket lätta frågor (≥ 95 % rätt) tillför ingen signal; mycket svåra frågor (≤ 20 % rätt) pekar oftast på ett felaktigt facit eller en tvetydig fråga.
- Särskiljningsförmågan — om starka kandidater klarar frågan och svaga missar den — är den skarpaste signalen; under ungefär 0,20 är den svag, och ett negativt värde betyder nästan alltid ett felaktigt facit.
- Den här statistiken förtjänas av verkliga svar, så nya frågor har ingen hälsa förrän tillräckligt många kandidater har svarat; en ansvarsfull flagga väntar in ett minsta urval.
- SkillCorts filter ”Needs attention” lyfter fram flaggade frågor med skälet direkt i listan (Low discrimination / Very easy / Very hard) — systemet visar signalen, en människa beslutar om åtgärden.