Gå til indhold
SkillCort

30. juli 2026 · 7 min. læsningAssessmentkvalitet

Signaler om spørgsmålskvalitet: de spørgsmål, der stilfærdigt svækker jeres assessment

Hvert spørgsmål i jeres assessment er et lille måleinstrument, og som med ethvert instrument er nogle præcise, nogle fejlkalibrerede, og enkelte måler slet ingenting. Problemet er, at et defekt spørgsmål ser nøjagtig ud som et godt på siden — I opdager først, at det var i stykker, ved at se på, hvordan rigtige kandidater svarer på det. Det er dét, opgaveanalyse er til for, og det er lettere at læse, end ryet antyder.

By Daniel Whitmore, MSc in Industrial and Organizational Psychology

Kort fortalt

Signaler om spørgsmålskvalitet er statistikker beregnet ud fra rigtige kandidatbesvarelser, der fortæller jer, om et spørgsmål gør sit arbejde. De to vigtigste er sværhedsgrad — andelen af kandidater, der svarer rigtigt — og diskrimination — hvor godt spørgsmålet skiller stærke kandidater fra svage. Et spørgsmål, som næsten alle svarer rigtigt eller forkert på, bærer kun lidt information, og et med lav diskrimination sorterer slet ikke kandidaterne. Begge dele er signaler om at tjekke facitlisten og omskrive formuleringen, før spørgsmålet former endnu en beslutning.

Et spørgsmål, der ser fint ud, kan stadig måle ingenting

De fleste spørgsmål i et assessment skrives én gang, gennemlæses for formulering og betros derefter for altid. Den tillid er malplaceret — ikke fordi forfatterne er sjuskede, men fordi et spørgsmåls kvalitet ikke er synlig i dets tekst. To spørgsmål kan læses lige godt og opføre sig helt forskelligt i samme øjeblik kandidaterne svarer på dem: det ene skiller rent dem, der kan stoffet, fra dem, der ikke kan, det andet deler lokalet tilfældigt.

Opgaveanalyse er disciplinen at bedømme spørgsmål på deres adfærd frem for på deres udseende. Den kommer fra den klassiske testteori, og til en bank med arbejdsprøver har I kun brug for to af dens mål for at fange de spørgsmål, der stilfærdigt skader jer: hvor svært spørgsmålet er, og hvor godt det diskriminerer. Begge beregnes ud fra de svar, jeres egne kandidater allerede har givet, og det er dét, der gør dem troværdige — de beskriver jeres prøve, på jeres population, ikke et lærebogsideal.

Pointen er ikke at jage et perfekt tal på hvert eneste spørgsmål. Det er at løfte den lille håndfuld spørgsmål frem, der aktivt forvrider jeres resultater, så et menneske kan se på dem og beslutte, om hvert enkelt skal rettes, beholdes eller pensioneres. En god bank er ikke en, hvor hvert spørgsmål er fejlfrit; det er en, hvor de fejlbehæftede spørgsmål er kendte.

Sværhedsgrad: både for let og for svær koster jer information

Sværhedsgrad er, forvirrende nok, blot andelen af kandidater, der svarer rigtigt på et spørgsmål — et spørgsmål, 70 % svarer rigtigt på, har en sværhedsgrad på 0,70. Dens opgave er ikke at være høj eller lav, men at være informativ, og yderpunkterne bærer næsten ingen information. Når 95 % eller flere af kandidaterne svarer rigtigt, skiller spørgsmålet ikke længere nogen: både stærke og svage kandidater klarer det, så det tilføjer længde uden at tilføje signal. Det kan stadig høre hjemme i begyndelsen af et assessment som opvarmning, men det udfører ikke måling.

Det modsatte yderpunkt er farligere. Når kun 20 % eller færre svarer rigtigt, er den ærlige første mistanke ikke, at jeres kandidater er svage — det er, at spørgsmålet er i stykker. Et forkert facit, en flertydig spørgsmålsstamme, to forsvarlige svarmuligheder eller en opgave, der tester noget, rollen aldrig får brug for, vil alle trykke andelen af rigtige i bund. Et reelt svært spørgsmål, som en femtedel af et stærkt felt stadig kan løse, er legitimt og værdifuldt; et spørgsmål, næsten ingen løser, har som regel et problem, I kan rette på et minut, når først I leder.

Sværhedsgraden læses derfor bedst som et par autoværn, ikke som et mål. Meget lette spørgsmål er kandidater til pensionering eller til at blive flyttet; meget svære spørgsmål er kandidater til et tjek af facit og formulering. Alt derimellem gør sit arbejde og behøver ikke jeres opmærksomhed.

Diskrimination: skiller spørgsmålet stærke fra svage?

Diskrimination er det stærkeste af de to signaler og det, teams oftest overser. Den stiller ét enkelt spørgsmål: har de kandidater, der klarer dette spørgsmål godt, også tendens til at klare assessmentet godt samlet set? Er svaret ja, trækker spørgsmålet i samme retning som resten af prøven — det diskriminerer. Er der ingen sammenhæng, måler spørgsmålet noget andet, eller ingenting, uanset hvor fornuftigt det læses.

Konkret er diskrimination korrelationen mellem at svare rigtigt på ét spørgsmål og kandidatens samlede score. Høje værdier betyder, at stærke kandidater rammer det, og svage misser det, og det er præcis, hvad I vil have. En værdi tæt på nul betyder, at spørgsmålet slet ikke sorterer kandidaterne. En negativ værdi er den alarm, det er værd at handle på med det samme: den betyder, at jeres stærkere kandidater oftere svarer forkert på spørgsmålet — det klassiske fingeraftryk på et forkert facit eller en fælde, der straffer dem, der forstår stoffet dybest.

En udbredt tommelfingerregel behandler diskrimination under omkring 0,20 som dårlig — spørgsmålet skiller knap nok stærke fra svage og er en kandidat til omskrivning. Men diskrimination er kun meningsfuld, når nok mennesker har svaret; på tre besvarelser er den støj. Derfor venter en ansvarlig markering på en minimumsstikprøve, før den fæster lid til tallet, og derfor dømmes et nyt spørgsmål aldrig på sine første par kandidater.

Disse signaler gøres man sig fortjent til, de gættes ikke

Den ærlige begrænsning ved opgaveanalyse er, at den ikke kan fortælle jer noget den dag, I skriver et spørgsmål. Sværhedsgrad og diskrimination er egenskaber ved besvarelser, så et helt nyt spørgsmål har slet ingen sundhedstilstand, før kandidater har svaret på det nok gange til at sige noget reelt. Det er en egenskab, ikke et hul: det holder signalerne forankret i dokumentation frem for i mening, og det beskytter et nyt spørgsmål mod at blive dømt, før det har fået en fair chance.

Det betyder også, at spørgsmålskvalitet er en vedligeholdelsesvane, ikke en engangsport. En bank, der var ren for et år siden, glider, efterhånden som rollen ændrer sig, som kandidatfeltet forskyder sig, og som spørgsmål genbruges på tværs af assessments. De spørgsmål, der er værd at holde øje med, er dem med reel brug og nok besvarelser til at stole på — hvilket i praksis er en lille, foranderlig delmængde af banken frem for det hele. I gennemgår ikke alt; I læser den håndfuld spørgsmål, data har markeret.

Sådan løfter SkillCort det frem: markeringen »Kræver opmærksomhed«

SkillCort beregner spørgsmålenes sundhedstilstand ud fra rigtige kandidatbesvarelser på tværs af hvert assessment, et spørgsmål optræder i, og gør de to signaler til ét enkelt, ligefremt filter på jeres spørgsmålsbank: Kræver opmærksomhed. Et spørgsmål lander dér, når data viser et af tre konkrete problemer — lav diskrimination, når mindst fem har svaret, en sværhedsgrad på eller over 95 % (meget let), eller en sværhedsgrad på eller under 20 % (meget svær). Intet markeres på en fornemmelse, og intet markeres, før der er besvarelser nok til at retfærdiggøre det.

Hvert markeret spørgsmål bærer sin grund skrevet ud, som et mærkat ved siden af spørgsmålet: Lav diskrimination, Meget let eller Meget svær, med de underliggende tal ved museover. Banken fortæller jer altså ikke bare, at et spørgsmål er svagt — den fortæller jer hvorfor, og det er dét, der gør en advarsel til en næste handling. En analysevisning for spørgsmålsbanken ruller de samme signaler op på tværs af hele banken og tilføjer, hvilke spørgsmål der har data nok til at kunne bedømmes, og hvilke der aldrig er blevet brugt, så I kan se jeres målings sundhedstilstand med ét blik frem for ét spørgsmål ad gangen.

Designreglen bag det hele er den samme, som gælder for resten af platformen: systemet løfter signalet og grunden frem, og et menneske træffer afgørelsen. SkillCort fortæller jer, at et spørgsmål er meget svært, og viser jer, at kun 12 % svarede rigtigt; den sletter ikke stilfærdigt spørgsmålet og tilsidesætter ikke jeres vurdering af, om den sværhedsgrad er et problem eller netop pointen.

Hvad I gør, når et spørgsmål bliver markeret

Begynd ved facitlisten, især ved meget svære spørgsmål og spørgsmål med negativ diskrimination. En overraskende stor andel af de alarmerende tal opløser sig i det øjeblik, I genlæser det angivne rigtige svar og opdager, at en anden svarmulighed også er korrekt, eller at det tilsigtede svar er forkert. Dette ene tjek retter flere markerede spørgsmål end nogen mængde omskrivning.

Er facit rigtigt, så læs spørgsmålet, som en forvirret kandidat ville. Meget svære spørgsmål og spørgsmål med lav diskrimination deler ofte en rodårsag: flertydig formulering, to forsvarlige svar eller en stamme, der stilfærdigt tester noget uden for den færdighed, I ville måle. At stramme sproget, så kun én læsning overlever, er som regel nok til at flytte tallene. Meget lette spørgsmål er det mildere tilfælde — behold dem som opvarmning, hvis de tjener det formål, eller pensionér dem, så assessmentet bruger sin tid dér, hvor målingen faktisk sker.

Modstå til sidst trangen til at overreagere på små stikprøver. Et spørgsmål, der er markeret på baggrund af en håndfuld besvarelser, er et spørgsmål at holde øje med, ikke at dømme; giv det flere kandidater, før I handler. Spørgsmålskvalitet er en langsom, kumulativ læsning, og målet er en bank, hvis svage spørgsmål er kendte og håndterede — ikke en bank, der er skrubbet fri for hvert ufuldkomment tal.

Det vigtigste

  • Et spørgsmåls kvalitet bor i, hvordan kandidaterne svarer på det, ikke i hvordan det læses — to lige velskrevne spørgsmål kan opføre sig helt forskelligt.
  • Sværhedsgraden er et par autoværn: meget lette spørgsmål (≥95 % rigtige) tilføjer intet signal; meget svære spørgsmål (≤20 % rigtige) peger som regel på et forkert facit eller en flertydig formulering.
  • Diskrimination — om stærke kandidater rammer spørgsmålet, og svage misser det — er det skarpeste signal; under ca. 0,20 er svagt, og en negativ værdi betyder næsten altid et forkert facit.
  • Statistikkerne gøres man sig fortjent til gennem rigtige besvarelser, så nye spørgsmål har ingen sundhedstilstand, før nok kandidater har svaret; en ansvarlig markering venter på en minimumsstikprøve.
  • SkillCorts filter »Kræver opmærksomhed« løfter de markerede spørgsmål frem med grunden skrevet ud (Lav diskrimination / Meget let / Meget svær) — systemet viser signalet, et menneske beslutter, hvad der skal rettes.

Ofte stillede spørgsmål

Hvad er en god diskriminationsværdi for et spørgsmål i et assessment?
Som tommelfingerregel er diskrimination over omkring 0,30 sund, 0,20-0,30 er på grænsen, og under 0,20 er svag og værd at omskrive. En negativ værdi er den, man skal handle på med det samme — den betyder, at stærkere kandidater svarer forkert på spørgsmålet, hvilket som regel peger på et forkert facit eller en vildledende spørgsmålsstamme.
Hvorfor er et spørgsmål, som næsten alle svarer rigtigt på, et problem?
Fordi det ikke længere skiller kandidaterne. Svarer 95 % eller flere rigtigt, klarer både stærke og svage kandidater det, så spørgsmålet forlænger assessmentet uden at tilføje information. Sådanne spørgsmål kan stadig fungere som opvarmning, men de udfører ikke måling — og en bank fuld af dem frembringer scorer, der ser præcise ud, men skelner kun lidt.
Hvor mange besvarelser kræver et spørgsmål, før jeg kan stole på dets statistik?
Nok til, at tallene ikke er støj. Diskrimination er især ustabil på en håndfuld svar, og derfor venter SkillCort på en minimumsstikprøve — mindst fem besvarelser — før lav diskrimination markeres, og derfor dømmes et helt nyt spørgsmål aldrig på sine første par kandidater. Sværhedsgraden stabiliserer sig hurtigere, men fortjener stadig en beskeden stikprøve, før I handler.
Betyder et meget svært spørgsmål, at mine kandidater er svage?
Sjældent. Når kun en lille andel svarer rigtigt, bør den første mistanke falde på spørgsmålet, ikke på feltet: et forkert facit, en flertydig stamme eller to forsvarlige svarmuligheder vil alle trykke andelen af rigtige ned. Tjek facit og formuleringen først; et reelt svært spørgsmål, som en femtedel af de stærke kandidater stadig kan løse, er legitimt og nyttigt.
Kan jeg lade AI rette svage spørgsmål automatisk?
AI kan hjælpe jer med at finde og skrive udkast — markere spørgsmål, der ser skæve ud, og foreslå klarere formuleringer — men beslutningen om at ændre, beholde eller pensionere et spørgsmål bliver hos jer. SkillCort løfter signalet og grunden frem; et menneske efterprøver facitlisten og vurderer, om et svært spørgsmål er en defekt eller den tilsigtede udfordring. Selve måleafgørelsen automatiseres aldrig væk.

Til rekrutteringsteams

Se sundhedstilstanden i jeres spørgsmålsbank med ét blik

SkillCort læser sværhedsgrad og diskrimination ud af rigtige kandidatbesvarelser og markerer de spørgsmål, der trænger til et kig — med grunden hæftet på, så I ved, hvad der skal rettes. Book en demo, og se analysen af spørgsmål og filteret »Kræver opmærksomhed« på en rigtig bank.

Signaler om spørgsmålskvalitet: find de svage spørgsmål | SkillCort