Passo 1: Derive os critérios do perfil, não da resposta
Cada critério da sua grelha deve remeter para um comportamento do seu perfil de função. Abra a tabela de mapeamento do perfil, encontre as competências que a tarefa foi construída para observar e transponha os seus comportamentos como critérios. Nada entra na grelha que o perfil não nomeie, e nada que a tarefa tenha sido desenhada para observar fica por pontuar. É esta rastreabilidade que dá sentido a uma pontuação mais tarde: um 4 em «juízo dentro da política» aponta de volta para um comportamento definido, que aponta de volta para artefactos reais do trabalho.
Mantenha o número curto — três a cinco critérios por tarefa. Os avaliadores pontuam de forma fiável quando cada critério é distinto; dez critérios sobrepostos produzem pontuação por efeito de halo, em que uma impressão forte se espalha por todas as linhas. Se dois critérios se movessem quase sempre juntos, como «clareza» e «estrutura» numa resposta escrita de apoio ao cliente, junte-os e diga-o na descrição do critério.
Resista a acrescentar critérios a meio da revisão porque uma resposta o surpreendeu. Se os candidatos insistem em fazer algo que a grelha não consegue ver — para o bem ou para o mal —, anote-o antes numa lista de pendentes para a versão seguinte. Mudar o instrumento enquanto se mede é como a consistência morre: os candidatos pontuados ontem e os candidatos pontuados amanhã enfrentariam padrões diferentes, e ninguém saberia dizer que pontuação significa o quê.
Passo 2: Escreva os critérios como comportamento observável, não como traços
Um critério é observável quando um avaliador consegue apontar para a linha da resposta que o satisfaz. As palavras de traço — empático, confiante, atento ao detalhe — convidam cada avaliador a consultar uma definição privada, e é nas definições privadas que duas pontuações divergem. Reescreva cada traço como o ato visível que o evidencia no trabalho entregue nesta tarefa em concreto.
O padrão de reescrita é mecânico: nomeie o traço, pergunte o que veria literalmente numa resposta forte e escreva isso. Faça a reescrita contra as respostas do seu piloto da fase de desenho da tarefa, porque o piloto mostrou-lhe exatamente o aspeto de cada comportamento neste formato e com esta extensão. Os exemplos abaixo vêm de tarefas de apoio ao cliente e de inside sales.
- Em vez de "mostra empatia" → "reconhece a frustração do cliente nas primeiras linhas, antes de propor qualquer solução".
- Em vez de "bom juízo" → "aplica corretamente a política de reembolsos e explica a exceção que abre, com o motivo".
- Em vez de "bom comunicador" → "indica o próximo passo, quem é o responsável por ele e quando o cliente terá notícias".
- Em vez de "consultivo" → "faz pelo menos uma pergunta de descoberta sobre o processo atual do potencial cliente antes de posicionar o produto".
- Em vez de "organizado" → "trabalha a fila por uma ordem de prioridade defensável e explica o raciocínio da ordem escolhida".
Passo 3: Ancore cada nível da escala com descrições concretas
Uma escala de 1 a 4 sem âncoras não passa de quatro sabores de intuição. Para cada critério, escreva uma descrição curta daquilo que uma resposta contém realmente em cada nível — é esta a grelha por níveis, ou em matriz, que faz convergir avaliadores independentes. São as âncoras que alinham, por isso cada uma tem de descrever evidência e não palavras de grau: «algo claro» e «muito claro» não ancoram nada.
Tome o critério de desescalada numa tarefa de ticket de apoio ao cliente. Nível 4: reconhece a frustração de forma específica, mantém-se não defensivo, resolve dentro da política e compromete-se com um próximo passo concreto e com um prazo. Nível 3: reconhece e resolve corretamente, mas o compromisso é vago. Nível 2: correto quanto à política, mas ignora o estado emocional do cliente, ou pede desculpa sem resolver seja o que for. Nível 1: sobe o tom, expõe mal a política ou deixa o cliente sem um caminho em frente.
Use um número par de níveis — quatro funciona bem — para que não exista um ponto médio confortável onde estacionar as pontuações incertas. E ancore a partir das respostas do seu piloto: os resultados fortes, médios e fracos que as pessoas de dentro produziram são exemplos reais dos níveis, e citar os seus padrões nas âncoras mantém a escala honesta face à tarefa.
Passo 4: Pondere os critérios de forma deliberada
As grelhas sem pesos declaram em silêncio que tudo é igual, o que quase nunca é o que o perfil diz. Transporte os pesos por competência do perfil para dentro da grelha: a competência sem a qual o responsável pela contratação se recusaria a contratar leva os critérios mais pesados, as que se treinam levam menos. Defina os pesos antes de a pontuação começar e escreva uma frase de fundamentação ao lado de cada um, para que a escolha seja inspecionável em vez de folclore.
Seja igualmente deliberado quanto ao que não leva peso nenhum. A ortografia num rascunho cronometrado, os floreados de formatação ou o sotaque de um candidato numa resposta em áudio devem ser listados explicitamente como não pontuados, a menos que o perfil os nomeie — e na maioria das funções de apoio ao cliente e de inside sales não nomeia. Nomear os não critérios é um dos gestos mais fortes de equidade que uma grelha pode fazer, porque desarma os enviesamentos que os avaliadores não sabem que têm.
- Os pesos espelham o perfil: as competências críticas para a decisão mais pesadas, as que se treinam mais leves.
- Uma frase de fundamentação registada por cada peso.
- Não critérios nomeados explicitamente: aquilo que os avaliadores não podem deixar mover uma pontuação.
- Sem barreiras de passa/não passa em critérios de juízo — as respostas de zona cinzenta pontuam proporcionalmente face às âncoras.
Passo 5: Teste a grelha com respostas de amostra antes do arranque
Uma grelha que nunca pontuou nada é uma hipótese. Pegue nas respostas do seu piloto — mais algumas deliberadamente imperfeitas que redija você próprio, como uma resposta calorosa mas errada quanto à política, ou um email de seguimento rigoroso mas frio — e peça a dois avaliadores que as pontuem de forma independente face à grelha em rascunho. Depois compare, critério a critério.
Onde as duas pontuações discordam, a correção está quase sempre no texto da âncora, e não nos avaliadores. Uma diferença entre um 2 e um 3 na mesma resposta significa que as descrições dos níveis deixam margem para interpretação: afine-as com a evidência específica que a resposta em disputa continha. A resposta calorosa mas errada é especialmente útil — obriga a grelha a provar que o tom e a correção são pontuados em linhas separadas em vez de se dissolverem numa só impressão.
Repita até que as pontuações independentes fiquem a menos de um nível de distância uma da outra em cada critério. A IA pode ajudar aqui como apoio à decisão — resumindo respostas longas ou indicando onde uma resposta tocou cada critério —, mas as pontuações deste teste têm de vir dos seus avaliadores humanos, porque é a concordância entre eles que a grelha existe para produzir.
Passo 6: Congele uma versão antes de os candidatos entrarem
No momento em que chega a primeira resposta de um candidato, a grelha tem de parar de se mexer. Congele-a como v1: critérios, âncoras, pesos e não critérios, com uma data e uma ligação para a versão do perfil de que deriva. Cada pontuação da vaga passa a referir-se a um instrumento fixo, e é isso que lhe permite comparar o primeiro candidato com o quadragésimo e defender ambas as pontuações meses depois, se uma decisão for questionada.
As melhorias vão para uma lista de pendentes, não para a grelha em uso. Quando a vaga fecha — ou quando uma âncora genuinamente avariada obriga a uma revisão antecipada —, publique a v2 com um registo de alterações e, se uma mudança acontecer a meio da vaga, decida explicitamente e registe se as respostas anteriores são repontuadas ao abrigo da nova versão. Uma grelha congelada e versionada é a diferença entre um processo de decisão pronto para auditoria e uma pilha de números que ninguém consegue reconstruir.
Pontos essenciais
- Cada critério remete para um comportamento do perfil — três a cinco critérios distintos por tarefa, nunca acrescentados a meio da revisão.
- Escreva os critérios como atos visíveis no trabalho entregue, e não como palavras de traço que convidam a definições privadas.
- Ancore cada nível da escala com descrições concretas de evidência, usando as respostas do piloto como exemplos reais dos níveis.
- Pondere os critérios a partir do perfil antes de a pontuação começar, e diga o que fica explicitamente por pontuar.
- Teste até que dois avaliadores independentes fiquem a menos de um nível de distância em cada critério; depois congele e versione a grelha.