Saltar al contenido
SkillCort

30 de julio de 2026 · 7 min de lecturaCalidad de la evaluación

Señales de calidad de los ítems: las preguntas que debilitan su evaluación en silencio

Cada pregunta de su evaluación es un pequeño instrumento de medida y, como cualquier instrumento, algunas son precisas, otras están descalibradas y unas pocas no miden nada en absoluto. El problema es que sobre el papel una pregunta rota tiene exactamente el mismo aspecto que una buena — solo descubre que era defectuosa observando cómo la responden candidatos reales. Para eso sirve el análisis de ítems, y se lee más fácilmente de lo que sugiere su fama.

By Daniel Whitmore, MSc in Industrial and Organizational Psychology

En resumen

Las señales de calidad de los ítems son estadísticos calculados a partir de respuestas reales de candidatos que le dicen si una pregunta está haciendo su trabajo. Los dos que más importan son la dificultad — la proporción de candidatos que responde correctamente — y la discriminación — lo bien que la pregunta separa a los candidatos fuertes de los débiles. Una pregunta que casi todo el mundo acierta o falla aporta poca información, y una con discriminación baja no ordena a los candidatos en absoluto. Ambas son señales para revisar la clave de respuesta y corregir la redacción antes de que la pregunta condicione otra decisión.

Una pregunta que parece correcta puede no medir nada

La mayoría de las preguntas de evaluación se escriben una vez, se revisan por su redacción y después se dan por buenas para siempre. Esa confianza está mal puesta — no porque los autores sean descuidados, sino porque la calidad de una pregunta no se ve en su texto. Dos preguntas pueden leerse igual de bien y comportarse de forma completamente distinta en cuanto los candidatos las responden: una separa con nitidez a quien domina la materia de quien no, la otra divide la sala al azar.

El análisis de ítems es la disciplina de juzgar las preguntas por su comportamiento en lugar de por su apariencia. Viene de la teoría clásica de los tests y, para un banco de pruebas de trabajo, solo necesita dos de sus medidas para cazar las preguntas que le perjudican en silencio: cuán difícil es la pregunta y cuán bien discrimina. Ambas se calculan con las respuestas que sus propios candidatos ya han dado, que es lo que las hace fiables — describen su prueba, sobre su población, no un ideal de manual.

No se trata de perseguir un número perfecto en cada ítem. Se trata de sacar a la luz el pequeño conjunto de preguntas que están distorsionando activamente sus resultados, para que una persona pueda mirarlas y decidir si corrige, mantiene o retira cada una. Un buen banco no es aquel en el que toda pregunta es impecable; es aquel en el que las preguntas defectuosas están identificadas.

Dificultad: demasiado fácil y demasiado difícil le cuestan información por igual

La dificultad, pese a su nombre confuso, no es más que la proporción de candidatos que responde correctamente a una pregunta — una pregunta que acierta el 70% de las personas tiene una dificultad de 0,70. Su misión no es ser alta ni baja, sino informativa, y los extremos apenas aportan información. Cuando el 95% o más de los candidatos acierta una pregunta, esta ya no separa a nadie: los candidatos fuertes y los débiles la superan por igual, así que el ítem añade longitud sin añadir señal. Puede seguir teniendo sentido al principio de una evaluación como calentamiento, pero no está haciendo trabajo de medición.

El extremo opuesto es más peligroso. Cuando solo responde correctamente el 20% o menos, la primera sospecha honesta no es que sus candidatos sean flojos — es que la pregunta está rota. Una clave de respuesta equivocada, un enunciado ambiguo, dos opciones defendibles o una tarea que evalúa algo que el puesto nunca necesita hundirán la tasa de acierto. Una pregunta genuinamente difícil que una quinta parte de un grupo fuerte todavía resuelve es legítima y valiosa; una pregunta que casi nadie resuelve suele tener un problema que puede arreglar en un minuto en cuanto se pone a buscarlo.

Así que la dificultad se lee mejor como un par de barandillas que como un objetivo. Las preguntas muy fáciles son candidatas a retirarse o a reubicarse; las muy difíciles son candidatas a una revisión de clave y redacción. Todo lo que queda en medio está haciendo su trabajo y no necesita su atención.

Discriminación: ¿distingue la pregunta a los fuertes de los débiles?

La discriminación es la más potente de las dos señales y la que más a menudo se les escapa a los equipos. Plantea una sola pregunta: ¿los candidatos que rinden bien en este ítem tienden también a rendir bien en la evaluación en conjunto? Cuando la respuesta es sí, el ítem tira en la misma dirección que el resto de la prueba — discrimina. Cuando no hay relación, el ítem está midiendo otra cosa, o nada, por muy sensato que se lea.

En concreto, la discriminación es la correlación entre acertar un ítem y la puntuación total del candidato. Los valores altos significan que los candidatos fuertes lo aciertan y los débiles lo fallan, que es exactamente lo que usted quiere. Un valor cercano a cero significa que el ítem no está ordenando a los candidatos en absoluto. Un valor negativo es la alarma que merece acción inmediata: significa que sus candidatos más fuertes tienen más probabilidades de fallar el ítem — la huella clásica de una clave de respuesta equivocada o de una trampa que castiga a quien entiende la materia con más profundidad.

Una regla práctica muy extendida considera pobre una discriminación por debajo de alrededor de 0,20 — el ítem apenas separa a los fuertes de los débiles y es candidato a revisión. Pero la discriminación solo tiene sentido cuando ha respondido suficiente gente; con tres respuestas es ruido. Por eso un aviso responsable espera a una muestra mínima antes de fiarse del número, y por eso una pregunta recién creada nunca se condena por sus primeros candidatos.

Estas señales se ganan, no se adivinan

La limitación honesta del análisis de ítems es que no puede decirle nada el día en que escribe una pregunta. La dificultad y la discriminación son propiedades de las respuestas, así que un ítem recién creado no tiene salud alguna hasta que los candidatos lo han respondido suficientes veces como para decir algo real. Esto es una virtud, no una carencia: mantiene las señales ancladas en la evidencia en lugar de en la opinión, y protege a una pregunta nueva de ser juzgada antes de haber tenido un recorrido justo.

También significa que la calidad de los ítems es un hábito de mantenimiento, no un filtro de una sola vez. Un banco que estaba limpio hace un año se desvía a medida que cambia el puesto, se desplaza el grupo de candidatos y las preguntas se reutilizan entre evaluaciones. Las preguntas que merece la pena vigilar son las que tienen uso real y suficientes respuestas para fiarse — lo que, en la práctica, es un subconjunto pequeño y cambiante del banco, no el banco entero. No está auditando todo; está leyendo el puñado de ítems que los datos han marcado.

Cómo lo saca a la luz SkillCort: el aviso «Needs attention»

SkillCort calcula la salud de los ítems a partir de respuestas reales de candidatos en todas las evaluaciones en las que aparece una pregunta, y convierte las dos señales en un único filtro sencillo sobre su banco de ítems: Needs attention. Un ítem cae ahí cuando los datos muestran uno de tres problemas concretos — discriminación baja una vez que han respondido al menos cinco personas, una dificultad igual o superior al 95% (muy fácil) o una dificultad igual o inferior al 20% (muy difícil). Nada se marca por corazonada, y nada se marca antes de tener las respuestas que lo justifiquen.

Cada ítem marcado lleva su motivo al lado, como una etiqueta junto a la pregunta: Low discrimination, Very easy o Very hard, con los números subyacentes al pasar el cursor. Así el banco no solo le dice que una pregunta es débil — le dice por qué, que es lo que convierte un aviso en una acción siguiente. Una vista de analítica del banco de ítems agrega esas mismas señales para todo el banco y añade qué ítems tienen datos suficientes para juzgarlos y cuáles no se han usado nunca, de modo que puede ver la salud de su medición de un vistazo en lugar de pregunta a pregunta.

La regla de diseño detrás de todo esto es la misma que rige el resto de la plataforma: el sistema saca a la luz la señal y el motivo, y una persona toma la decisión. SkillCort le dirá que una pregunta es muy difícil y le mostrará que solo el 12% la respondió correctamente; no borrará la pregunta en silencio ni pasará por encima de su criterio sobre si esa dificultad es un problema o es justo lo que se buscaba.

Qué hacer cuando una pregunta queda marcada

Empiece por la clave de respuesta, sobre todo en los ítems muy difíciles y de discriminación negativa. Una proporción sorprendente de números alarmantes se resuelve en cuanto relee la respuesta clavada y se da cuenta de que una segunda opción también es correcta, o de que la respuesta prevista es errónea. Esta sola comprobación arregla más ítems marcados que cualquier cantidad de reescritura.

Si la clave es correcta, lea el ítem como lo leería un candidato confundido. Las preguntas muy difíciles y las de discriminación baja suelen compartir una causa raíz: redacción ambigua, dos respuestas defendibles o un enunciado que evalúa calladamente algo ajeno a la habilidad que quería medir. Apretar el lenguaje para que solo sobreviva una lectura suele bastar para mover los números. Los ítems muy fáciles son el caso más benigno — consérvelos como calentamiento si cumplen esa función, o retírelos para que la evaluación dedique su tiempo a donde de verdad ocurre la medición.

Por último, resista la tentación de reaccionar en exceso ante muestras pequeñas. Una pregunta marcada a partir de un puñado de respuestas es una pregunta para vigilar, no para condenar; deje que pasen más candidatos antes de actuar. La calidad de los ítems es una lectura lenta y acumulativa, y el objetivo es un banco cuyas preguntas débiles estén identificadas y gestionadas — no un banco depurado de todo número imperfecto.

Ideas clave

  • La calidad de una pregunta está en cómo la responden los candidatos, no en cómo se lee — dos preguntas igual de limpias pueden comportarse de forma completamente distinta.
  • La dificultad son dos barandillas: los ítems muy fáciles (≥95% de aciertos) no aportan señal; los muy difíciles (≤20% de aciertos) suelen apuntar a una pregunta mal clavada o ambigua.
  • La discriminación — si los candidatos fuertes aciertan el ítem y los débiles lo fallan — es la señal más nítida; por debajo de ~0,20 es débil, y un valor negativo casi siempre significa una clave de respuesta equivocada.
  • Estos estadísticos se ganan con respuestas reales, así que las preguntas nuevas no tienen salud hasta que responden suficientes candidatos; un aviso responsable espera a una muestra mínima.
  • El filtro «Needs attention» de SkillCort saca a la luz los ítems marcados con el motivo al lado (Low discrimination / Very easy / Very hard) — el sistema muestra la señal, una persona decide el arreglo.

Preguntas frecuentes

¿Qué valor de discriminación es bueno para una pregunta de evaluación?
Como regla práctica, una discriminación por encima de alrededor de 0,30 es saludable, entre 0,20 y 0,30 es marginal, y por debajo de 0,20 es débil y merece revisión. Un valor negativo es el que exige acción inmediata — significa que los candidatos más fuertes están fallando el ítem, lo que suele apuntar a una clave de respuesta equivocada o a un enunciado que induce a error.
¿Por qué es un problema una pregunta que casi todo el mundo acierta?
Porque ya no separa a los candidatos. Si responde correctamente el 95% o más, los candidatos fuertes y los débiles la superan por igual, así que el ítem alarga la evaluación sin añadir información. Esas preguntas pueden seguir funcionando como calentamiento, pero no están midiendo — y un banco lleno de ellas produce puntuaciones que parecen precisas pero distinguen poco.
¿Cuántas respuestas necesita un ítem antes de fiarme de sus estadísticos?
Las suficientes para que los números no sean ruido. La discriminación en particular es inestable con un puñado de respuestas, y por eso SkillCort espera a una muestra mínima — al menos cinco respuestas — antes de marcar una discriminación baja, y por eso una pregunta recién creada nunca se juzga por sus primeros candidatos. La dificultad se estabiliza antes, pero también merece una muestra modesta antes de actuar.
¿Una pregunta muy difícil significa que mis candidatos son flojos?
Rara vez. Cuando solo acierta una fracción pequeña, la primera sospecha debería recaer en la pregunta, no en el grupo: una clave de respuesta equivocada, un enunciado ambiguo o dos opciones defendibles hundirán la tasa de acierto. Revise primero la clave y la redacción; una pregunta genuinamente difícil que una quinta parte de los candidatos fuertes todavía resuelve es legítima y útil.
¿Puedo confiar en la IA para arreglar automáticamente las preguntas débiles?
La IA puede ayudarle a encontrar y a redactar — marcando ítems que parecen fallar y sugiriendo una redacción más clara — pero la decisión de cambiar, mantener o retirar una pregunta sigue siendo suya. SkillCort saca a la luz la señal y el motivo; una persona verifica la clave de respuesta y juzga si una pregunta difícil es un defecto o el reto buscado. La decisión sobre la medición nunca se automatiza.

Para equipos de selección

Vea de un vistazo la salud de su banco de ítems

SkillCort lee la dificultad y la discriminación a partir de respuestas reales de candidatos y marca las preguntas que necesitan una mirada — con el motivo adjunto, para que sepa qué corregir. Reserve una demostración para ver la analítica de ítems y el filtro «Needs attention» sobre un banco real.