By Daniel Whitmore, MSc in Industrial and Organizational Psychology
Kort fortalt
Kalibrering af bedømmere er en kort arbejdssession, hvor de, der scorer, uafhængigt af hinanden bedømmer de samme eksempelbesvarelser op mod en fælles bedømmelsesmatrix, sammenligner deres scorer kriterium for kriterium og bliver enige om, hvad hvert niveau betyder, før en eneste rigtig kandidat gennemgås. Det er den mest effektive måde at gøre scorerne konsistente på tværs af bedømmere — og det kræver jævnlige eftersyn, for glidning i bedømmelsen sniger sig ind igen med tiden.
Hvorfor scorerne glider
Glidning i bedømmelsen er ikke en karakterbrist; det er udgangspunktet i enhver proces med flere bedømmere. Hver bedømmer møder op med sin egen private indre standard, formet af det seneste team, vedkommende ansatte til, den stærkeste kandidat, vedkommende husker, og sin egen tolerance over for ufuldkomne svar. En bedømmelsesmatrix indsnævrer den variation, men ord som »tydeligt næste skridt« eller »passende tone« efterlader stadig plads til fortolkning — og det er i fortolkningen, glidningen bor.
Glidningen forstærkes også over tid. En bedømmer, der scorer tyve inside sales-rollespil på en uge, begynder at bedømme op mod bunken frem for op mod matricen: et middelmådigt afdækningsmøde ser stærkt ud efter tre svage. Andre glider mod det strenge eller det lempelige under deadlinepres. Intet af det viser sig i selve scorerne, hvilket er præcis derfor, det er farligt — et 4-tal fra én bedømmer og et 4-tal fra en anden kan beskrive to forskellige kandidater.
Løsningen er ikke en mere detaljeret matrix. Over et vist punkt tilføjer flere detaljer i matricen læsebyrde uden at tilføje enighed. Løsningen er kalibrering: at få bedømmerne til at score det samme arbejde, få forskellene frem i lyset og forhandle sig frem til en fælles standard, de alle kan pege på senere — før en rigtig kandidats udfald afhænger af, hvis læsning der tilfældigvis vinder.
Kalibreringssessionen, trin for trin
Hold én struktureret session, før I begynder at score rigtige kandidater. Vælg to eller tre rigtige besvarelser på den faktiske opgave — for eksempel en kandidats skriftlige svar til en frustreret kunde eller en optaget øvelse i indvendingshåndtering til en salgsrolle. Vælg bevidst: én tydeligt stærk, én tydeligt svag og én, der reelt ligger på grænsen. Det er grænsetilfældet, der gør kalibreringen sin løn værd.
Selve sessionen følger en enkel rækkefølge, og rækkefølgen betyder noget. Den uafhængige scoring skal komme først; i det øjeblik én bedømmer siger noget, forankrer de andre sig i den mening, og øvelsen måler så konformitet i stedet for enighed. Sæt cirka en time af til et panel på tre eller fire bedømmere, og betragt sessionen som en del af at lancere assessmentet frem for et valgfrit ekstra.
- Hver bedømmer scorer hvert eksempel uafhængigt op mod matricen, med skriftlig begrundelse pr. kriterium — ingen diskussion endnu.
- Afslør alle scorer på én gang, og beregn forskellene pr. kriterium, ikke blot pr. kandidat.
- Diskutér kun de kriterier, hvor scorerne afviger med mere end ét niveau; enighed behøver ikke taletid.
- Beslut for hver uenighed, hvad niveauet i matricen faktisk kræver, og omskriv beskrivelsen, hvis ordene tillod begge læsninger.
- Gem de diskuterede eksempler, med deres aftalte scorer og begrundelser, som ankereksempler knyttet til matricen.
Diskutér forskellene, ikke menneskene
Samtalen, efter scorerne er afsløret, er hele pointen, og den går galt på en forudsigelig måde: den bliver en diskussion om, hvem der har ret. Vend den om. Spørgsmålet er aldrig »hvorfor gav du et 2-tal?«, men »hvad i besvarelsen, og hvad i matricen, førte dig derhen?« Begge bedømmere anvender som regel matricen loyalt — bare på hver sin læsning af den.
De fleste forskelle kan føres tilbage til én af tre årsager: beskrivelsen i matricen er flertydig, bedømmerne vægter delkriterier forskelligt, eller den ene bedømmer scorer noget, matricen slet ikke dækker, som stavefejl i en opgave, der skal måle dømmekraft. At sætte navn på, hvilken årsag I står med, gør en diskussion til en redigering. Flertydighed får en omskrevet beskrivelse; skjult vægtning gøres udtrykkelig; kriterier uden for scope holdes udtrykkeligt ude.
Afslut hver diskussion med noget håndgribeligt. En kalibreringssession, der kun frembringer en behagelig samtale, skal gentages om en måned. En, der frembringer skarpere beskrivelser og gemte ankereksempler, betaler sig hver gang en ny bedømmer kommer ind i panelet, og hver gang en kandidat på grænsen tvinger gruppen tilbage til den præcise formulering af et niveau.
Forankr matricen med rigtige besvarelser
Abstrakte beskrivelser inviterer til glidning; konkrete eksempler modstår den. Knyt for hvert scoreniveau, der betyder noget — normalt grænsen mellem »acceptabel« og »stærk«, hvor de fleste ansættelsesbeslutninger reelt afgøres — en rigtig, anonymiseret besvarelse fra kalibreringen og en sætning, der forklarer, hvorfor den ligger på det niveau. »Et 3-tal anerkender kundens frustration, før løsningen foreslås; dette svar gør det, men begraver næste skridt« er et helt afsnit af tillægsord værd.
Ankre ændrer måden, bedømmerne arbejder på. I stedet for at spørge »hvor godt er dette svar?« — et spørgsmål, der inviterer private standarder ind — spørger de »ligner dette mest ankeret for et 3-tal eller ankeret for et 4-tal?« Sammenligning er en langt mere pålidelig vurdering end absolut bedømmelse, og det er den samme vurdering for alle i panelet, også den bedømmer, der kommer til om et halvt år og aldrig deltog i den oprindelige session.
Løbende stikprøver: kalibrering er ikke en engangsforestilling
En enkelt kalibreringssession sætter standarden; den vedligeholder den ikke. Glidningen sniger sig ind igen med mængde, tid og udskiftning i panelet. Vedligeholdelsesritualet er let: send med jævne mellemrum et lille antal allerede scorede besvarelser videre til en bedømmer nummer to, blindt, og sammenlign. I scorer ikke pipelinen om — I tager stikprøver af den for uenighed.
Hold øje med mønsteret, ikke den enkelte afvigelse. Én forskel på to point på en besvarelse i grænselandet er normalt; en konsekvent forskel på ét niveau mellem det samme par bedømmere er glidning, og et kriterium, der bliver ved med at frembringe uenigheder på tværs af par, er et problem med matricen, ikke med menneskene. Når et mønster viser sig, så kør en kort genkalibrering på netop det kriterium — score ét eksempel, diskutér, stram beskrivelsen. Tyve minutter, ikke en workshop.
Det er også her, en assessmentplatform gør sig fortjent: når hver score registreres op mod matricen med sin begrundelse, bliver mønstre pr. bedømmer synlige frem for anekdotiske, og stikprøven bliver en rapport, I læser, frem for et regneark, I bygger for enden af en lang scoringsrunde. Jo lettere ritualet er, jo større er chancen for, at det overlever mødet med en travl rekrutteringssæson.
Når to bedømmere er uenige om en aktuel kandidat
Uenighed om en rigtig kandidat er ikke et svigt i processen — det er processen, der løfter et reelt tæt tilfælde frem. De forkerte reaktioner er de dovne: stilfærdigt at tage gennemsnittet af scorerne eller at lade den mest erfarne bedømmer vinde som standard. Gennemsnittet skjuler uenigheden; anciennitet løser den efter hierarki frem for efter dokumentation. Begge dele efterlader jer ude af stand til at forklare scoren senere.
Behandl i stedet en væsentlig uenighed som en udløser. De to bedømmere sammenligner deres begrundelser op mod matricen og dens ankre; de fleste kløfter lukker sig på minutter, når begge peger på den samme beskrivelse. Er de stadig uenige, så hent en tredje bedømmer ind, som scorer besvarelsen blindt uden at se de to første scorer, og lad diskussionen fortsætte ud fra tre uafhængige læsninger.
Uanset hvordan det løses, skal det registreres: de oprindelige scorer, begrundelserne, og hvorfor den endelige score landede, hvor den gjorde. Den registrering er dét, der gør en tæt afgørelse forklarlig over for en ansættende leder — eller over for kandidatens fremtidige fortaler — og hver løst uenighed bliver en kandidat til ankerbiblioteket, så den samme diskussion aldrig behøver at finde sted to gange.
Det vigtigste
- Glidning i bedømmelsen er udgangspunktet i enhver proces med flere bedømmere; matricer indsnævrer den, men kun kalibrering lukker den.
- Hold en kalibreringssession, før I scorer rigtige kandidater: uafhængige scorer først, derefter diskussion af forskellene alene, derefter rettelse af matricen, dér hvor ordene tillod to læsninger.
- Ankereksempler — rigtige besvarelser knyttet til bestemte scoreniveauer — gør absolutte bedømmelser til sammenligninger, og de er langt mere konsistente.
- Vedligehold overensstemmelsen med lette, regelmæssige blinde stikprøver, og kalibrér ét enkelt kriterium igen, når et mønster viser sig.
- Udjævn aldrig en aktuel uenighed med et gennemsnit: sammenlign begrundelserne, tilføj en blind tredje læsning om nødvendigt, og registrér, hvordan den blev løst.
