Ir para o conteúdo
SkillCort

7 min · 7 stepsTutorial de avaliação

Como realizar uma sessão de calibração de avaliadores

Uma grelha partilhada põe os avaliadores de acordo; a calibração prova que a estão de facto a ler da mesma maneira. Este tutorial percorre uma sessão curta e estruturada — pontuação independente de respostas de referência, uma comparação por critério e acordos documentados — que torna comparáveis as pontuações de vários avaliadores antes de candidatos reais dependerem delas.

What you'll need

  • Uma grelha concluída associada à avaliação (um instantâneo congelado)
  • 2–3 respostas de referência que abranjam diferentes níveis de qualidade
  • Todos os avaliadores que vão pontuar candidatos, com 45–60 minutos em conjunto
  • Um local para registar as interpretações acordadas, partilhado com o painel

Step 1: Escolha duas ou três respostas de referência

Escolha respostas que tornem visível o desacordo: uma claramente forte, uma claramente fraca e — o mais importante — uma genuinamente limítrofe. Respostas de um ensaio-piloto feito por colegas funcionam bem; respostas iniciais de candidatos também, se a sua janela de revisão permitir que a pontuação comece depois da calibração.

É na resposta limítrofe que a calibração se justifica. Toda a gente concorda quanto à excelência e ao fracasso; os painéis dividem-se na resposta que é forte num critério e frágil noutro. Se nenhuma das suas referências produzir essa tensão, redija uma que a produza.

Step 2: Apresente a grelha ao painel antes de alguém pontuar

Percorra a grelha com o painel: cada critério, as descrições ancoradas dos seus níveis e o seu peso. O objetivo é uma compreensão partilhada do padrão, não de qualquer resposta — ainda não discuta as referências. Convide agora as perguntas sobre linguagem ambígua nas âncoras, enquanto nenhuma pontuação está em jogo.

Relembre ao painel como funciona a pontuação em matriz na SkillCort: para cada critério, clica-se no cartão do nível cuja descrição corresponde à resposta, e a pontuação desse nível fica registada. A instrução que mais importa: pontue face às âncoras escritas, não face à sua noção pessoal do que é uma boa resposta.

Step 3: Pontue as referências de forma independente

Cada avaliador pontua sozinho todas as respostas de referência, sem discussão, usando a grelha partilhada. A independência é a essência de tudo — a sessão mede como o painel diverge naturalmente, e qualquer conversa antes de as pontuações estarem registadas destrói essa medição. Dê a todos a mesma janela de trabalho em silêncio e adie todas as comparações até que todas as pontuações estejam entregues.

Peça aos avaliadores que anexem a cada pontuação de critério uma nota curta que cite as evidências na resposta que justificaram o nível escolhido. Na SkillCort, as notas anexam-se às pontuações como evidências, e nesta sessão são elas que transformam «discordamos» em «estamos a ler esta âncora de maneira diferente» — o tipo produtivo de desacordo.

Step 4: Compare as pontuações por critério, não por total

Junte as pontuações e compare-as critério a critério. Os totais escondem a história: dois avaliadores podem chegar a pontuações globais semelhantes através de leituras opostas de dois critérios, o que significa que a sua concordância é sorte, não calibração. As diferenças por critério mostram exatamente onde as interpretações divergem.

Para cada critério com dispersão, peça aos avaliadores discordantes que leiam em voz alta as suas notas de evidências — as notas mostram para o que cada pessoa estava efetivamente a olhar quando escolheu um nível, o que é muito mais útil do que discutir os números. Quase todas as divergências se resolvem num de poucos padrões, e nomear o padrão diz-lhe o que corrigir.

  • Uma âncora ambígua que admite duas leituras — torne mais rigorosa a interpretação da formulação
  • Um avaliador a pontuar as evidências de um critério adjacente — reafirme a fronteira
  • Um padrão pessoal importado de experiências passadas — regresse à âncora escrita
  • Diferenças genuínas de julgamento em trabalho limítrofe — acordem uma convenção

Step 5: Acorde as âncoras e documente cada interpretação

Transforme cada divergência num acordo explícito: que nível merece este tipo de resposta, e porquê. Registe os acordos numa nota de calibração partilhada — clarificações das âncoras, regras de fronteira entre critérios, convenções para casos-limite recorrentes. Os acordos não documentados evaporam-se numa semana e nunca chegam a um avaliador que se junte mais tarde.

Lembre-se de que a grelha associada é um instantâneo congelado, pelo que, a meio da avaliação, está a documentar interpretações das âncoras e não a reescrevê-las — é isso que mantém a pontuação consistente para os candidatos já avaliados. Devolva as correções genuínas de formulação à grelha no seu banco, para que a próxima avaliação associe uma versão mais afinada.

Step 6: Volte a pontuar uma referência para confirmar o alinhamento

Encerre a sessão pedindo a todos que pontuem, de forma independente, mais uma resposta — uma referência nova, se tiver uma, ou novamente o caso limítrofe — aplicando os acordos documentados. Se a dispersão por critério tiver diminuído visivelmente, o painel está suficientemente calibrado para começar a pontuar candidatos.

Se um critério continuar a dividir o painel, não faça a média para fazer o problema desaparecer. Uma divisão persistente significa que a âncora ou o acordo continua ambíguo; dedique mais dez minutos a esse único critério em vez de enviar um desacordo por resolver para a pontuação de todos os candidatos.

Step 7: Agende verificações de desvio durante a janela de revisão

A calibração degrada-se. Ao longo de uma janela de revisão longa, os avaliadores desviam-se — os padrões sobem à medida que respostas fortes redefinem as expectativas, ou afrouxam com o cansaço. Planeie verificações de desvio breves: periodicamente, escolha uma resposta pontuada há pouco e peça a um segundo avaliador que a pontue às cegas, comparando depois as diferenças por critério exatamente como na sessão.

É também aqui que a assistência da IA se mantém no seu lugar. A IA da SkillCort pode redigir resumos e sugestões de pontuação ao nível do critério, o que acelera a revisão — mas cada pontuação é confirmada ou anulada por uma pessoa identificada, e as verificações de desvio verificam as pessoas, já que é o julgamento delas que sustentará a decisão. Reúna o painel brevemente se uma verificação de desvio revelar uma nova divergência.

Pro tips

  • Calibre antes de a janela de revisão abrir, não depois de metade dos candidatos estar pontuada — recalibrar a meio cria duas populações de pontuações.
  • Mantenha a sessão em 45–60 minutos; uma sessão apertada sobre três respostas vale mais do que uma longa que se dissolve num redesenho da grelha.
  • Nunca deixe a pessoa mais sénior pontuar primeiro nem falar primeiro nas comparações — a independência é o mecanismo, a hierarquia é o seu inimigo.
  • Guarde a nota de calibração junto à avaliação, para que todos os avaliadores futuros herdem as interpretações acordadas.
  • Esteja atento a um avaliador consistentemente mais severo em todos os critérios — isso é uma linha de base pessoal a discutir, não um problema da grelha.

Perguntas frequentes

De quantas respostas de referência precisamos?
Duas ou três chegam: uma forte, uma fraca e uma limítrofe. A resposta limítrofe faz a maior parte do trabalho, porque é aí que as interpretações das âncoras pelos avaliadores divergem genuinamente. Mais referências acrescentam tempo mais depressa do que acrescentam sinal.
Porquê comparar por critério em vez de comparar as pontuações totais?
Os totais podem coincidir enquanto os julgamentos subjacentes se contradizem — dois avaliadores a chegar ao mesmo número através de leituras opostas de dois critérios. Como as pontuações dos avaliadores são calculadas em média dentro de cada critério antes de os pesos as combinarem, é a concordância ao nível do critério que torna as pontuações finais realmente significativas.
Podemos alterar a grelha se a calibração expuser uma âncora má?
A grelha associada a uma avaliação ativa é um instantâneo congelado, por isso documente a interpretação acordada para a avaliação atual e corrija a formulação na grelha do seu banco para as futuras. Isso mantém a pontuação consistente para os candidatos sem que a melhoria se perca.
As sugestões de pontuação da IA eliminam a necessidade de calibração?
Não. A IA pode redigir resumos e sugestões ao nível do critério, mas é uma pessoa identificada que confirma ou anula cada pontuação — a decisão assenta no julgamento humano, por isso são as pessoas que têm de estar calibradas. Os rascunhos da IA tornam a revisão mais rápida; não a tornam consistente.
Com que frequência devemos fazer verificações de desvio?
Ajuste-as à janela de revisão: uma janela de poucos dias pode precisar apenas de uma repontuação às cegas a meio, ao passo que uma janela de várias semanas merece um ritmo periódico. A verificação em si é barata — uma resposta, uma segunda pontuação às cegas, uma comparação por critério.

For hiring teams

Torne cada avaliador intercambiável — no melhor sentido

Veja como as grelhas partilhadas, as notas de evidências e a pontuação com avaliador identificado da SkillCort mantêm um painel de vários revisores consistente do primeiro ao último candidato. Marque uma demonstração.

Como Realizar uma Sessão de Calibração de Avaliadores | SkillCort