By Daniel Whitmore, MSc in Industrial and Organizational Psychology
In breve
I segnali di qualità degli item sono statistiche calcolate sulle risposte reali dei candidati che indicano se una domanda sta facendo il suo lavoro. I due che contano di più sono la difficoltà — la quota di candidati che risponde correttamente — e la capacità discriminante — quanto bene la domanda separa i candidati forti da quelli deboli. Una domanda che quasi tutti azzeccano o sbagliano porta poca informazione, e una con bassa capacità discriminante non ordina affatto i candidati. Entrambi sono segnali per controllare la chiave di risposta e rivedere la formulazione prima che quella domanda orienti un’altra decisione.
Una domanda che sembra a posto può comunque non misurare nulla
La maggior parte delle domande di un assessment viene scritta una volta, rivista nella formulazione e poi ritenuta valida per sempre. Quella fiducia è mal riposta — non perché chi scrive sia sbadato, ma perché la qualità di una domanda non è visibile nel suo testo. Due domande possono leggersi ugualmente bene e comportarsi in modo completamente diverso nel momento in cui i candidati vi rispondono: una separa nettamente chi conosce la materia da chi non la conosce, l’altra divide la platea a caso.
L’analisi degli item è la disciplina che giudica le domande dal loro comportamento anziché dal loro aspetto. Viene dalla teoria classica dei test e, per una banca di prove di lavoro, bastano due delle sue misure per intercettare le domande che le fanno danno in silenzio: quanto è difficile la domanda e quanto bene discrimina. Entrambe sono calcolate sulle risposte che i suoi stessi candidati hanno già dato, ed è questo a renderle affidabili — descrivono il suo test, sulla sua popolazione, non un ideale da manuale.
L’obiettivo non è rincorrere un numero perfetto su ogni item. È far emergere il piccolo insieme di domande che stanno attivamente distorcendo i suoi risultati, perché una persona possa guardarle e decidere se correggerle, tenerle o ritirarle. Una buona banca non è quella in cui ogni domanda è impeccabile; è quella in cui le domande difettose sono note.
Difficoltà: sia troppo facile sia troppo difficile le costano informazione
La difficoltà, con un nome che confonde, è semplicemente la proporzione di candidati che risponde correttamente a una domanda — una domanda azzeccata dal 70% delle persone ha una difficoltà di 0,70. Il suo compito non è essere alta o bassa, ma essere informativa, e gli estremi non portano quasi nessuna informazione. Quando il 95% o più dei candidati azzecca una domanda, questa non separa più nessuno: sia i forti sia i deboli la superano, quindi l’item aggiunge lunghezza senza aggiungere segnale. Può ancora stare all’inizio di un assessment come riscaldamento, ma non sta facendo un lavoro di misura.
L’estremo opposto è più pericoloso. Quando risponde correttamente solo il 20% o meno, il primo sospetto onesto non è che i suoi candidati siano deboli — è che la domanda sia guasta. Una chiave di risposta sbagliata, un testo ambiguo, due opzioni entrambe difendibili o un compito che verifica qualcosa di cui il ruolo non ha mai bisogno spingono tutti la percentuale di risposte corrette a terra. Una domanda genuinamente difficile che un quinto di un bacino forte riesce comunque a risolvere è legittima e preziosa; una domanda che quasi nessuno risolve di solito ha un problema che può correggere in un minuto, una volta che va a cercarlo.
Quindi la difficoltà va letta come una coppia di guardrail, non come un obiettivo. Le domande molto facili sono candidate al ritiro o al riposizionamento; quelle molto difficili sono candidate a un controllo di chiave e formulazione. Tutto ciò che sta in mezzo sta facendo il suo lavoro e non ha bisogno della sua attenzione.
Capacità discriminante: la domanda distingue i forti dai deboli?
La capacità discriminante è il più potente dei due segnali e quello che i team trascurano più spesso. Pone una sola domanda: i candidati che se la cavano bene su questo item tendono a cavarsela bene anche sull’assessment nel suo complesso? Quando la risposta è sì, l’item tira nella stessa direzione del resto del test — discrimina. Quando non c’è alcuna relazione, l’item misura qualcos’altro, o niente, per quanto sensato possa leggersi.
In concreto, la capacità discriminante è la correlazione fra l’azzeccare un item e il punteggio totale del candidato. Valori alti significano che i candidati forti lo azzeccano e quelli deboli lo sbagliano, che è esattamente ciò che desidera. Un valore vicino allo zero significa che l’item non ordina affatto i candidati. Un valore negativo è l’allarme su cui vale la pena agire subito: significa che i suoi candidati più forti hanno più probabilità di sbagliare l’item — l’impronta classica di una chiave di risposta sbagliata o di un tranello che penalizza proprio chi comprende la materia più a fondo.
Una regola pratica molto diffusa considera scarsa una capacità discriminante sotto circa 0,20 — l’item separa a stento i forti dai deboli ed è candidato alla revisione. Ma la capacità discriminante ha senso solo quando un numero sufficiente di persone ha risposto; su tre risposte è rumore. Per questo una segnalazione responsabile attende un campione minimo prima di fidarsi del numero, ed è per questo che una domanda nuova non viene mai condannata sui suoi primi candidati.
Questi segnali si guadagnano, non si indovinano
Il limite onesto dell’analisi degli item è che non può dirle nulla il giorno in cui scrive una domanda. Difficoltà e capacità discriminante sono proprietà delle risposte, quindi un item nuovo di zecca non ha alcuno stato di salute finché i candidati non vi hanno risposto abbastanza volte da dire qualcosa di reale. Questa è una caratteristica, non una lacuna: mantiene i segnali radicati nelle evidenze anziché nelle opinioni e protegge una domanda nuova dall’essere giudicata prima di aver avuto una prova equa.
Significa anche che la qualità degli item è un’abitudine di manutenzione, non uno sbarramento una tantum. Una banca che un anno fa era pulita va alla deriva man mano che il ruolo cambia, che il bacino di candidati si sposta e che le domande vengono riutilizzate fra assessment diversi. Le domande che vale la pena tenere d’occhio sono quelle con un uso reale e abbastanza risposte da poterci contare — il che, in pratica, è un sottoinsieme piccolo e mutevole della banca, non l’intera banca. Non sta verificando tutto; sta leggendo la manciata di item che i dati hanno segnalato.
Come SkillCort fa emergere tutto questo: la segnalazione «Needs attention»
SkillCort calcola lo stato di salute di un item sulle risposte reali dei candidati in tutti gli assessment in cui la domanda compare, e trasforma i due segnali in un unico filtro chiaro sulla sua banca di item: Needs attention. Un item finisce lì quando i dati mostrano uno di tre problemi concreti — bassa capacità discriminante una volta che almeno cinque persone hanno risposto, una difficoltà pari o superiore al 95% (molto facile) o una difficoltà pari o inferiore al 20% (molto difficile). Nulla viene segnalato per intuito, e nulla viene segnalato prima di avere le risposte che lo giustificano.
Ogni item segnalato porta il proprio motivo accanto, come etichetta di fianco alla domanda: Low discrimination, Very easy o Very hard, con i numeri sottostanti al passaggio del cursore. Così la banca non le dice soltanto che una domanda è debole — le dice perché, ed è questo a trasformare un avviso in un’azione successiva. Una vista di analitiche della banca di item aggrega gli stessi segnali sull’intera banca, aggiungendo quali item hanno dati sufficienti per essere giudicati e quali non sono mai stati usati, così può vedere a colpo d’occhio lo stato di salute della sua misurazione anziché una domanda per volta.
La regola di progettazione dietro a tutto questo è la stessa che governa il resto della piattaforma: il sistema fa emergere il segnale e il motivo, e una persona decide. SkillCort le dirà che una domanda è molto difficile e le mostrerà che solo il 12% vi ha risposto correttamente; non cancellerà la domanda in silenzio né scavalcherà il suo giudizio sul fatto che quella difficoltà sia un problema o il punto stesso della domanda.
Che cosa fare quando una domanda viene segnalata
Cominci dalla chiave di risposta, soprattutto per gli item molto difficili e con capacità discriminante negativa. Una quota sorprendente di numeri allarmanti si risolve nel momento in cui rilegge la risposta indicata come corretta e si accorge che è corretta anche una seconda opzione, o che quella prevista è sbagliata. Questo singolo controllo sistema più item segnalati di qualunque quantità di riscrittura.
Se la chiave è giusta, legga l’item come lo leggerebbe un candidato confuso. Le domande molto difficili e quelle con bassa capacità discriminante condividono spesso la stessa causa profonda: formulazione ambigua, due risposte entrambe difendibili o un testo che verifica di soppiatto qualcosa al di fuori dell’abilità che intendeva misurare. Stringere il linguaggio così che sopravviva una sola lettura di solito basta a muovere i numeri. Gli item molto facili sono il caso più benevolo — li tenga come riscaldamento se servono a quello, oppure li ritiri, così l’assessment spende il suo tempo dove la misurazione avviene davvero.
Infine, resista alla tentazione di reagire in modo eccessivo a campioni piccoli. Una domanda segnalata sulla base di una manciata di risposte è una domanda da tenere d’occhio, non da condannare; le dia altri candidati prima di agire. La qualità degli item è una lettura lenta e cumulativa, e l’obiettivo è una banca in cui le domande deboli sono note e gestite — non una banca ripulita da ogni numero imperfetto.
In sintesi
- La qualità di una domanda sta in come i candidati vi rispondono, non in come si legge — due domande ugualmente pulite possono comportarsi in modo completamente diverso.
- La difficoltà è una coppia di guardrail: gli item molto facili (≥95% di risposte corrette) non aggiungono segnale; quelli molto difficili (≤20% di risposte corrette) di solito indicano una domanda con chiave sbagliata o ambigua.
- La capacità discriminante — se i candidati forti azzeccano l’item e quelli deboli lo sbagliano — è il segnale più netto; sotto ~0,20 è debole, e un valore negativo significa quasi sempre una chiave di risposta sbagliata.
- Queste statistiche si guadagnano dalle risposte reali, quindi le domande nuove non hanno alcuno stato di salute finché non risponde un numero sufficiente di candidati; una segnalazione responsabile attende un campione minimo.
- Il filtro «Needs attention» di SkillCort fa emergere gli item segnalati con il motivo accanto (Low discrimination / Very easy / Very hard) — il sistema mostra il segnale, una persona decide la correzione.