Ir para o conteúdo
SkillCort

30 de julho de 2026 · 7 min de leituraQualidade da avaliação

Sinais de qualidade dos itens: as perguntas que enfraquecem a sua avaliação em silêncio

Cada pergunta da sua avaliação é um pequeno instrumento de medida e, como em qualquer instrumento, algumas são precisas, outras estão descalibradas e há umas quantas que não medem nada. O problema é que uma pergunta avariada tem exatamente o mesmo aspeto de uma boa pergunta no papel — só descobre que era defeituosa observando como candidatos reais lhe respondem. É para isto que serve a análise de itens, e é mais simples de ler do que a sua reputação sugere.

By Daniel Whitmore, MSc in Industrial and Organizational Psychology

Em resumo

Os sinais de qualidade dos itens são estatísticas calculadas a partir de respostas reais de candidatos que lhe dizem se uma pergunta está a fazer o seu trabalho. Os dois que mais importam são a dificuldade — a proporção de candidatos que responde corretamente — e o poder discriminativo — o quão bem a pergunta separa candidatos fortes de candidatos fracos. Uma pergunta que quase toda a gente acerta ou erra transporta pouca informação, e uma com baixo poder discriminativo não ordena os candidatos de todo. Ambos são sinais para verificar o gabarito e rever a redação antes de a pergunta moldar outra decisão.

Uma pergunta que parece boa pode, ainda assim, não medir nada

A maior parte das perguntas de avaliação é escrita uma vez, revista quanto à redação e depois considerada fiável para sempre. Essa confiança é mal colocada — não porque os autores sejam descuidados, mas porque a qualidade de uma pergunta não é visível no seu texto. Duas perguntas podem ler-se igualmente bem e comportar-se de forma completamente diferente no momento em que os candidatos lhes respondem: uma separa com nitidez quem domina a matéria de quem não a domina, a outra divide a sala ao acaso.

A análise de itens é a disciplina de julgar as perguntas pelo seu comportamento em vez do seu aspeto. Vem da teoria clássica dos testes e, para um banco de provas de trabalho, bastam-lhe duas das suas medidas para apanhar as perguntas que o prejudicam em silêncio: o quão difícil é a pergunta e o quão bem discrimina. Ambas são calculadas a partir das respostas que os seus próprios candidatos já deram, e é isso que as torna fiáveis — descrevem o seu teste, na sua população, e não um ideal de manual.

O objetivo não é perseguir um número perfeito em cada item. É revelar o pequeno conjunto de perguntas que está ativamente a distorcer os seus resultados, para que uma pessoa possa olhar para elas e decidir se corrige, mantém ou retira cada uma. Um bom banco não é aquele em que todas as perguntas são impecáveis; é aquele em que as perguntas com defeito são conhecidas.

Dificuldade: demasiado fácil e demasiado difícil custam-lhe informação

A dificuldade, apesar do nome confuso, é apenas a proporção de candidatos que responde corretamente a uma pergunta — uma pergunta acertada por 70% das pessoas tem uma dificuldade de 0,70. A sua função não é ser alta ou baixa, mas ser informativa, e os extremos quase não transportam informação. Quando 95% ou mais dos candidatos acertam numa pergunta, ela deixa de separar seja quem for: candidatos fortes e fracos passam-na, por isso o item acrescenta comprimento sem acrescentar sinal. Pode continuar a ter lugar no início de uma avaliação como aquecimento, mas não está a fazer trabalho de medição.

O extremo oposto é mais perigoso. Quando apenas 20% ou menos respondem corretamente, a primeira suspeita honesta não é que os seus candidatos sejam fracos — é que a pergunta está avariada. Um gabarito errado, um enunciado ambíguo, duas opções defensáveis ou uma tarefa que testa algo de que a função nunca precisa fazem todos a taxa de acerto cair ao chão. Uma pergunta genuinamente difícil que um quinto de um conjunto forte ainda consegue resolver é legítima e valiosa; uma pergunta que quase ninguém resolve tem normalmente um problema que consegue corrigir num minuto assim que for procurá-lo.

Por isso, a dificuldade lê-se melhor como um par de guardas de segurança do que como um alvo. As perguntas muito fáceis são candidatas a serem retiradas ou reposicionadas; as perguntas muito difíceis são candidatas a uma verificação de gabarito e de redação. Tudo o que está entre uma coisa e outra está a fazer o seu trabalho e não precisa da sua atenção.

Poder discriminativo: a pergunta distingue os fortes dos fracos?

O poder discriminativo é o mais potente dos dois sinais e aquele que as equipas mais vezes ignoram. Faz uma única pergunta: os candidatos que se saem bem neste item também tendem a sair-se bem na avaliação no seu conjunto? Quando a resposta é sim, o item puxa na mesma direção que o resto do teste — tem poder discriminativo. Quando não há relação nenhuma, o item está a medir outra coisa, ou nada, por muito sensato que se leia.

Em concreto, o poder discriminativo é a correlação entre acertar num item e a pontuação total do candidato. Valores elevados significam que os candidatos fortes acertam e os fracos falham, que é exatamente o que quer. Um valor perto de zero significa que o item não está a ordenar os candidatos de todo. Um valor negativo é o alarme sobre o qual vale a pena agir de imediato: significa que os seus candidatos mais fortes têm maior probabilidade de errar o item — a impressão digital clássica de um gabarito errado ou de uma armadilha que castiga quem compreende a matéria mais a fundo.

Uma regra prática muito usada trata um poder discriminativo abaixo de cerca de 0,20 como fraco — o item mal está a separar os fortes dos fracos e é candidato a revisão. Mas o poder discriminativo só tem significado depois de pessoas suficientes terem respondido; com três respostas é ruído. É por isso que um alerta responsável espera por uma amostra mínima antes de confiar no número, e é por isso que uma pergunta nova nunca é condenada com base nos seus primeiros candidatos.

Estes sinais conquistam-se, não se adivinham

A limitação honesta da análise de itens é que nada lhe consegue dizer no dia em que escreve uma pergunta. A dificuldade e o poder discriminativo são propriedades das respostas, por isso um item acabado de criar não tem saúde nenhuma até que os candidatos lhe tenham respondido vezes suficientes para dizer algo real. Isto é uma qualidade, não uma lacuna: mantém os sinais assentes em evidências em vez de opinião e protege uma pergunta nova de ser julgada antes de ter tido uma oportunidade justa.

Significa também que a qualidade dos itens é um hábito de manutenção, não uma barreira única. Um banco que estava limpo há um ano vai derivando à medida que a função muda, que o conjunto de candidatos se altera e que as perguntas são reutilizadas em várias avaliações. As perguntas que vale a pena vigiar são as que têm utilização real e respostas suficientes para merecerem confiança — o que, na prática, é um subconjunto pequeno e mutável do banco, e não o banco inteiro. Não está a auditar tudo; está a ler o punhado de itens que os dados assinalaram.

Como a SkillCort revela isto: o alerta 'Needs attention'

A SkillCort calcula a saúde dos itens a partir de respostas reais de candidatos em todas as avaliações em que uma pergunta aparece e transforma os dois sinais num único filtro simples no seu banco de itens: Needs attention. Um item aterra aí quando os dados mostram um de três problemas concretos — baixo poder discriminativo depois de pelo menos cinco pessoas terem respondido, uma dificuldade igual ou superior a 95% (muito fácil) ou uma dificuldade igual ou inferior a 20% (muito difícil). Nada é assinalado por palpite, e nada é assinalado antes de ter as respostas que o justifiquem.

Cada item assinalado leva o seu motivo em linha, como uma etiqueta ao lado da pergunta: Low discrimination, Very easy ou Very hard, com os números subjacentes ao passar o rato. Assim, o banco não lhe diz apenas que uma pergunta é fraca — diz-lhe porquê, que é o que transforma um aviso numa ação seguinte. Uma vista de análise do banco de itens agrega os mesmos sinais para todo o banco, acrescentando quais os itens que têm dados suficientes para serem julgados e quais nunca foram usados, para que veja a saúde da sua medição num relance em vez de pergunta a pergunta.

A regra de conceção por trás de tudo isto é a mesma que rege o resto da plataforma: o sistema revela o sinal e o motivo, e uma pessoa decide. A SkillCort dir-lhe-á que uma pergunta é muito difícil e mostrar-lhe-á que apenas 12% responderam corretamente; não apagará a pergunta em silêncio nem se sobreporá ao seu juízo sobre se essa dificuldade é um problema ou é precisamente o objetivo.

O que fazer quando uma pergunta é assinalada

Comece pelo gabarito, sobretudo nos itens muito difíceis e nos de poder discriminativo negativo. Uma proporção surpreendente de números alarmantes resolve-se no momento em que relê a resposta marcada como certa e percebe que uma segunda opção também está correta, ou que a resposta pretendida está errada. Esta única verificação corrige mais itens assinalados do que qualquer quantidade de reescrita.

Se o gabarito está certo, leia o item como o leria um candidato confuso. As perguntas muito difíceis e as de baixo poder discriminativo partilham muitas vezes a mesma causa de fundo: redação ambígua, duas respostas defensáveis ou um enunciado que testa discretamente algo fora da capacidade que queria medir. Apertar a linguagem para que sobreviva apenas uma leitura costuma bastar para mexer nos números. Os itens muito fáceis são o caso mais benigno — mantenha-os como aquecimento se cumprirem essa função, ou retire-os para que a avaliação gaste o seu tempo onde a medição acontece de facto.

Por fim, resista à tentação de reagir em excesso a amostras pequenas. Uma pergunta assinalada com base num punhado de respostas é uma pergunta para vigiar, não para condenar; dê-lhe mais candidatos antes de agir. A qualidade dos itens é uma leitura lenta e cumulativa, e o objetivo é um banco cujas perguntas fracas são conhecidas e geridas — não um banco esfregado até desaparecer qualquer número imperfeito.

Pontos essenciais

  • A qualidade de uma pergunta vive na forma como os candidatos lhe respondem, não na forma como se lê — duas perguntas igualmente limpas podem comportar-se de maneiras completamente diferentes.
  • A dificuldade é um par de guardas de segurança: os itens muito fáceis (≥95% de acerto) não acrescentam sinal; os itens muito difíceis (≤20% de acerto) apontam normalmente para uma pergunta com o gabarito errado ou ambígua.
  • O poder discriminativo — se os candidatos fortes acertam no item e os fracos falham — é o sinal mais afiado; abaixo de cerca de 0,20 é fraco, e um valor negativo significa quase sempre um gabarito errado.
  • Estas estatísticas conquistam-se com respostas reais, por isso as perguntas novas não têm saúde nenhuma até que candidatos suficientes tenham respondido; um alerta responsável espera por uma amostra mínima.
  • O filtro 'Needs attention' da SkillCort revela os itens assinalados com o motivo em linha (Low discrimination / Very easy / Very hard) — o sistema mostra o sinal, uma pessoa decide a correção.

Perguntas frequentes

Qual é um bom valor de poder discriminativo para uma pergunta de avaliação?
Como regra prática, um poder discriminativo acima de cerca de 0,30 é saudável, entre 0,20 e 0,30 é marginal, e abaixo de 0,20 é fraco e merece revisão. Um valor negativo é aquele sobre o qual deve agir de imediato — significa que os candidatos mais fortes estão a errar o item, o que aponta normalmente para um gabarito errado ou um enunciado enganador.
Porque é que uma pergunta que quase toda a gente acerta é um problema?
Porque deixou de separar os candidatos. Se 95% ou mais respondem corretamente, candidatos fortes e fracos passam-na, por isso o item alonga a avaliação sem acrescentar informação. Estas perguntas podem continuar a servir de aquecimento, mas não estão a fazer medição — e um banco cheio delas produz pontuações que parecem precisas mas distinguem pouco.
De quantas respostas precisa um item antes de eu confiar nas suas estatísticas?
Das suficientes para que os números não sejam ruído. O poder discriminativo, em particular, é instável com um punhado de respostas, e é por isso que a SkillCort espera por uma amostra mínima — pelo menos cinco respostas — antes de assinalar baixo poder discriminativo, e é por isso que uma pergunta acabada de criar nunca é julgada pelos seus primeiros candidatos. A dificuldade estabiliza mais cedo, mas merece na mesma uma amostra modesta antes de agir.
Uma pergunta muito difícil significa que os meus candidatos são fracos?
Raramente. Quando só uma pequena fração responde corretamente, a primeira suspeita deve recair sobre a pergunta e não sobre o conjunto de candidatos: um gabarito errado, um enunciado ambíguo ou duas opções defensáveis fazem todos a taxa de acerto descer. Verifique primeiro o gabarito e a redação; uma pergunta genuinamente difícil que um quinto dos candidatos fortes ainda consegue resolver é legítima e útil.
Posso confiar na IA para corrigir automaticamente as perguntas fracas?
A IA pode ajudá-lo a encontrar e a redigir — assinalando itens que parecem estranhos e sugerindo uma redação mais clara — mas a decisão de alterar, manter ou retirar uma pergunta continua consigo. A SkillCort revela o sinal e o motivo; uma pessoa verifica o gabarito e julga se uma pergunta difícil é um defeito ou o desafio pretendido. A decisão sobre a medição nunca é entregue a um automatismo.

Para equipas de contratação

Veja a saúde do seu banco de itens num relance

A SkillCort lê a dificuldade e o poder discriminativo a partir de respostas reais de candidatos e assinala as perguntas que precisam de ser vistas — com o motivo anexado, para que saiba o que corrigir. Marque uma demonstração para ver a análise de itens e o filtro 'Needs attention' num banco real.

Sinais de qualidade dos itens: detetar perguntas fracas | SkillCort