By Daniel Whitmore, MSc in Industrial and Organizational Psychology
In het kort
Signalen voor vraagkwaliteit zijn statistieken, berekend uit echte kandidaatantwoorden, die u vertellen of een vraag zijn werk doet. De twee die het meest tellen zijn de moeilijkheidsgraad — het aandeel kandidaten dat correct antwoordt — en het discriminerend vermogen — hoe goed de vraag sterke van zwakke kandidaten scheidt. Een vraag die bijna iedereen goed of fout heeft, draagt weinig informatie, en een vraag met een laag discriminerend vermogen sorteert kandidaten helemaal niet. Beide zijn signalen om de antwoordsleutel te controleren en de formulering te herzien voordat de vraag opnieuw een beslissing kleurt.
Een vraag die er prima uitziet, kan alsnog niets meten
De meeste assessmentvragen worden één keer geschreven, op formulering nagekeken en daarna voor altijd vertrouwd. Dat vertrouwen is misplaatst — niet omdat auteurs slordig zijn, maar omdat de kwaliteit van een vraag niet zichtbaar is in de tekst. Twee vragen kunnen even goed lezen en zich volstrekt verschillend gedragen zodra kandidaten ze beantwoorden: de ene scheidt netjes de mensen die de stof kennen van de mensen die dat niet doen, de andere verdeelt de zaal willekeurig.
Itemanalyse is de discipline die vragen beoordeelt op hun gedrag in plaats van op hun uiterlijk. Ze komt uit de klassieke testtheorie, en voor een werkproefbank hebt u maar twee van haar maten nodig om de vragen te vangen die u ongemerkt schaden: hoe moeilijk de vraag is, en hoe goed hij discrimineert. Beide worden berekend uit de antwoorden die uw eigen kandidaten al hebben gegeven, en juist dat maakt ze betrouwbaar — ze beschrijven uw test, op uw populatie, niet een ideaal uit het leerboek.
Het gaat er niet om op elk item een perfect getal na te jagen. Het gaat erom de kleine groep vragen zichtbaar te maken die uw resultaten actief vertekenen, zodat een mens ernaar kan kijken en per vraag kan beslissen om hem te repareren, te behouden of uit te faseren. Een goede bank is niet een bank waarin elke vraag foutloos is; het is een bank waarin de gebrekkige vragen bekend zijn.
Moeilijkheidsgraad: te makkelijk en te moeilijk kosten u allebei informatie
De moeilijkheidsgraad is, verwarrend genoeg, gewoon het aandeel kandidaten dat een vraag correct beantwoordt — een vraag die 70% van de mensen goed heeft, heeft een moeilijkheidsgraad van 0,70. Zijn taak is niet om hoog of laag te zijn, maar om informatief te zijn, en de uitersten dragen bijna geen informatie. Als 95% of meer van de kandidaten een vraag goed heeft, scheidt hij niemand meer: sterke en zwakke kandidaten halen hem allebei, dus het item voegt lengte toe zonder signaal toe te voegen. Hij kan nog steeds aan het begin van een assessment thuishoren als warming-up, maar hij doet geen meetwerk.
Het andere uiterste is gevaarlijker. Als slechts 20% of minder correct antwoordt, is het eerlijke eerste vermoeden niet dat uw kandidaten zwak zijn — maar dat de vraag kapot is. Een onjuiste antwoordsleutel, een dubbelzinnige vraagstam, twee verdedigbare opties of een opdracht die iets toetst wat de rol nooit nodig heeft: ze drukken het percentage goede antwoorden allemaal naar de bodem. Een werkelijk moeilijke vraag die een vijfde van een sterke groep nog wel oplost, is legitiem en waardevol; een vraag die bijna niemand oplost, heeft meestal een probleem dat u in een minuut kunt verhelpen zodra u gaat kijken.
De moeilijkheidsgraad leest u dus het best als een paar vangrails, niet als een streefwaarde. Heel makkelijke vragen komen in aanmerking om uit te faseren of te verplaatsen; heel moeilijke vragen komen in aanmerking voor een controle van sleutel en formulering. Alles daartussen doet zijn werk en heeft uw aandacht niet nodig.
Discriminerend vermogen: onderscheidt de vraag sterk van zwak?
Het discriminerend vermogen is het krachtigste van de twee signalen en het signaal dat teams het vaakst missen. Het stelt één vraag: doen de kandidaten die het goed doen op dit item, het over het geheel genomen ook goed op het assessment? Als het antwoord ja is, trekt het item dezelfde kant op als de rest van de test — het discrimineert. Als er geen verband is, meet het item iets anders, of niets, hoe verstandig het ook leest.
Concreet is het discriminerend vermogen de correlatie tussen het goed hebben van één item en de totaalscore van de kandidaat. Hoge waarden betekenen dat sterke kandidaten hem goed hebben en zwakke kandidaten hem missen, en dat is precies wat u wilt. Een waarde rond nul betekent dat het item kandidaten helemaal niet sorteert. Een negatieve waarde is het alarm waarop het de moeite waard is onmiddellijk te handelen: het betekent dat uw sterkere kandidaten het item eerder fout hebben — de klassieke vingerafdruk van een onjuiste antwoordsleutel of van een strikvraag die juist de mensen straft die de stof het diepst begrijpen.
Een veelgebruikte vuistregel beschouwt een discriminerend vermogen onder ongeveer 0,20 als zwak — het item scheidt sterk en zwak nauwelijks en komt in aanmerking voor herziening. Maar het discriminerend vermogen is pas betekenisvol zodra genoeg mensen hebben geantwoord; bij drie antwoorden is het ruis. Daarom wacht een verantwoorde markering op een minimale steekproef voordat ze het getal vertrouwt, en daarom wordt een nieuwe vraag nooit veroordeeld op haar eerste paar kandidaten.
Deze signalen worden verdiend, niet geraden
De eerlijke beperking van itemanalyse is dat ze u niets kan vertellen op de dag dat u een vraag schrijft. Moeilijkheidsgraad en discriminerend vermogen zijn eigenschappen van antwoorden, dus een gloednieuw item heeft helemaal geen gezondheid totdat kandidaten het vaak genoeg hebben beantwoord om iets echts te zeggen. Dat is een eigenschap, geen tekortkoming: het houdt de signalen geworteld in bewijs in plaats van in meningen, en het beschermt een nieuwe vraag ertegen beoordeeld te worden voordat ze een eerlijke kans heeft gehad.
Het betekent ook dat vraagkwaliteit een onderhoudsgewoonte is, geen eenmalige poort. Een bank die een jaar geleden schoon was, drijft af naarmate de rol verandert, de kandidatenpool verschuift en vragen over assessments heen worden hergebruikt. De vragen die het waard zijn om te volgen, zijn de vragen met echt gebruik en genoeg antwoorden om te vertrouwen — in de praktijk een kleine, wisselende deelverzameling van de bank in plaats van het geheel. U controleert niet alles; u leest de handvol items die de data heeft gemarkeerd.
Hoe SkillCort dit zichtbaar maakt: de markering 'Needs attention'
SkillCort berekent de gezondheid van items uit echte kandidaatantwoorden in elk assessment waarin een vraag voorkomt, en zet de twee signalen om in één eenvoudig filter op uw itembank: Needs attention. Een item belandt daar wanneer de data een van drie concrete problemen laat zien — een laag discriminerend vermogen zodra ten minste vijf mensen hebben geantwoord, een moeilijkheidsgraad van 95% of hoger (heel makkelijk), of een moeilijkheidsgraad van 20% of lager (heel moeilijk). Niets wordt op gevoel gemarkeerd, en niets wordt gemarkeerd voordat er genoeg antwoorden zijn om het te rechtvaardigen.
Elk gemarkeerd item draagt zijn reden bij zich, als een label naast de vraag: Low discrimination, Very easy of Very hard, met de onderliggende getallen bij hover. De bank vertelt u dus niet alleen dát een vraag zwak is — hij vertelt u waarom, en dat is wat een waarschuwing tot een volgende stap maakt. Een analyseweergave van de itembank rolt dezelfde signalen op over de hele bank en voegt daaraan toe welke items genoeg data hebben om te beoordelen en welke nooit zijn gebruikt, zodat u de gezondheid van uw meting in één oogopslag ziet in plaats van vraag voor vraag.
De ontwerpregel achter dit alles is dezelfde die voor de rest van het platform geldt: het systeem toont het signaal en de reden, en een mens neemt de beslissing. SkillCort vertelt u dat een vraag heel moeilijk is en laat u zien dat maar 12% hem correct beantwoordde; het verwijdert de vraag niet stilzwijgend en zet uw oordeel niet opzij over de vraag of die moeilijkheidsgraad een probleem is of juist de bedoeling.
Wat te doen als een vraag gemarkeerd wordt
Begin bij de antwoordsleutel, zeker bij heel moeilijke items en items met een negatief discriminerend vermogen. Een verrassend deel van de alarmerende getallen lost op zodra u het als juist aangemerkte antwoord herleest en beseft dat een tweede optie ook correct is, of dat het bedoelde antwoord fout is. Deze ene controle repareert meer gemarkeerde items dan welke hoeveelheid herschrijven ook.
Klopt de sleutel wel, lees het item dan zoals een verwarde kandidaat het zou lezen. Heel moeilijke vragen en vragen met een laag discriminerend vermogen delen vaak dezelfde oorzaak: dubbelzinnige formuleringen, twee verdedigbare antwoorden, of een vraagstam die stilletjes iets toetst buiten de vaardigheid die u wilde meten. De taal zo aanscherpen dat er maar één lezing overblijft, is meestal genoeg om de getallen te verplaatsen. Heel makkelijke items zijn het mildere geval — houd ze als warming-up als ze dat doel dienen, of faseer ze uit zodat het assessment zijn tijd besteedt waar de meting echt gebeurt.
Weersta tot slot de neiging om overdreven te reageren op kleine steekproeven. Een vraag die op grond van een handvol antwoorden is gemarkeerd, is een vraag om in de gaten te houden, niet om te veroordelen; geef haar meer kandidaten voordat u handelt. Vraagkwaliteit is een langzame, cumulatieve lezing, en het doel is een bank waarvan de zwakke vragen bekend zijn en beheerd worden — niet een bank die van elk imperfect getal is ontdaan.
Kort samengevat
- De kwaliteit van een vraag zit in de manier waarop kandidaten hem beantwoorden, niet in hoe hij leest — twee even nette vragen kunnen zich volstrekt verschillend gedragen.
- De moeilijkheidsgraad vormt twee vangrails: heel makkelijke items (≥95% correct) voegen geen signaal toe; heel moeilijke items (≤20% correct) wijzen meestal op een vraag met een onjuiste antwoordsleutel of een dubbelzinnige formulering.
- Het discriminerend vermogen — of sterke kandidaten het item goed hebben en zwakke het missen — is het scherpste signaal; onder ~0,20 is zwak, en een negatieve waarde betekent bijna altijd een onjuiste antwoordsleutel.
- Deze statistieken worden verdiend met echte antwoorden, dus nieuwe vragen hebben geen gezondheid totdat genoeg kandidaten hebben geantwoord; een verantwoorde markering wacht op een minimale steekproef.
- Het filter 'Needs attention' van SkillCort toont gemarkeerde items met de reden erbij (Low discrimination / Very easy / Very hard) — het systeem laat het signaal zien, een mens beslist over de oplossing.