By Daniel Whitmore, MSc in Industrial and Organizational Psychology
En resumen
La calibración de evaluadores es una sesión de trabajo breve en la que quienes puntúan valoran de forma independiente las mismas respuestas de muestra frente a una rúbrica compartida, comparan sus puntuaciones criterio por criterio y acuerdan qué significa cada nivel antes de revisar a ningún candidato real. Es la manera más eficaz de hacer que las puntuaciones de rúbrica sean coherentes entre evaluadores — y necesita comprobaciones periódicas, porque la deriva de quien puntúa vuelve a colarse con el tiempo.
Por qué derivan las puntuaciones de rúbrica
La deriva de quien puntúa no es un defecto de carácter; es el estado por defecto de cualquier proceso con varios evaluadores. Cada revisor llega con un estándar interno propio, formado por el último equipo para el que contrató, el candidato más sólido que recuerda y su propia tolerancia a las respuestas imperfectas. Una rúbrica reduce esa varianza, pero expresiones como «siguiente paso claro» o «tono adecuado» siguen dejando espacio a la interpretación — y la interpretación es donde vive la deriva.
La deriva también se acumula con el tiempo. Un evaluador que puntúa veinte juegos de rol de venta interna en una semana empieza a calificar frente al lote y no frente a la rúbrica: una llamada de descubrimiento mediocre parece sólida después de tres flojas. Otros derivan hacia la severidad o la indulgencia bajo la presión de los plazos. Nada de esto aparece en las puntuaciones mismas, que es justamente por lo que resulta peligroso — un 4 de un revisor y un 4 de otro pueden describir a dos candidatos distintos.
La solución no es una rúbrica más elaborada. Pasado cierto punto, más detalle en la rúbrica añade carga de lectura sin añadir acuerdo. La solución es la calibración: hacer que los evaluadores puntúen el mismo trabajo, saquen a la luz sus diferencias y negocien un estándar compartido al que todos puedan remitirse después — antes de que el resultado de un candidato real dependa de qué lectura acabe imponiéndose.
La sesión de calibración, paso a paso
Antes de que empiece cualquier puntuación real, celebre una sesión estructurada. Elija dos o tres respuestas reales a la tarea concreta — por ejemplo, la respuesta escrita de un candidato a un cliente molesto, o un ejercicio grabado de gestión de objeciones para un puesto comercial. Elija de forma deliberada: una claramente sólida, una claramente floja y una realmente limítrofe. La muestra limítrofe es donde la calibración se gana el sueldo.
La sesión en sí sigue una secuencia sencilla, y el orden importa. La puntuación independiente debe ir primero; en cuanto un evaluador habla, los demás se anclan a esa opinión y el ejercicio mide conformidad en lugar de acuerdo. Reserve alrededor de una hora para un panel de tres o cuatro evaluadores, y trate la sesión como parte del lanzamiento de la evaluación y no como un extra opcional.
- Cada evaluador puntúa cada muestra de forma independiente frente a la rúbrica, con una justificación escrita por criterio — todavía sin discusión.
- Revele todas las puntuaciones a la vez y calcule las diferencias por criterio, no solo por candidato.
- Discuta solo los criterios en los que las puntuaciones difieren en más de un nivel; el acuerdo no necesita tiempo de palabra.
- Para cada desacuerdo, decida qué exige realmente el nivel de la rúbrica y reescriba el descriptor si las palabras permitían ambas lecturas.
- Guarde las muestras discutidas, con sus puntuaciones acordadas y su justificación, como ejemplos ancla adjuntos a la rúbrica.
Discuta las diferencias, no a las personas
La conversación posterior a la revelación de las puntuaciones es lo esencial, y se tuerce de una manera previsible: se convierte en un debate sobre quién tiene razón. Replantéela. La pregunta nunca es «¿por qué lo ha puntuado con un 2?», sino «¿qué hay en la respuesta, y qué hay en la rúbrica, que le ha llevado ahí?». Los dos evaluadores suelen estar aplicando la rúbrica con fidelidad — a lecturas distintas de ella.
La mayoría de las diferencias se remontan a una de tres causas: el descriptor de la rúbrica es ambiguo, los evaluadores ponderan los subcriterios de forma distinta, o un revisor está puntuando algo que la rúbrica no cubre en absoluto, como las erratas en una tarea pensada para medir la capacidad de juicio. Nombrar la causa que tiene delante convierte una discusión en una edición. La ambigüedad recibe un descriptor reescrito; la ponderación oculta se hace explícita; los criterios fuera de alcance se excluyen de forma explícita.
Termine cada discusión con un artefacto. Una sesión de calibración que solo produce una conversación agradable habrá que repetirla dentro de un mes. Una que produce descriptores más nítidos y ejemplos ancla guardados rinde cada vez que un nuevo evaluador se incorpora al panel, y cada vez que un candidato limítrofe obliga al grupo a volver a la redacción exacta de un nivel.
Ancle la rúbrica con respuestas reales
Los descriptores abstractos invitan a la deriva; los ejemplos concretos se le resisten. Para cada nivel de puntuación que importa — normalmente la frontera entre «aceptable» y «sólido», donde de verdad se deciden la mayoría de las contrataciones — adjunte una respuesta real y anonimizada de la calibración y una frase que explique por qué se sitúa en ese nivel. «Un 3 reconoce la frustración del cliente antes de proponer la solución; esta respuesta lo hace, pero entierra el siguiente paso» vale más que un párrafo de adjetivos.
Las anclas cambian la manera de trabajar de los evaluadores. En lugar de preguntar «¿cómo de buena es esta respuesta?» — una pregunta que invita a los estándares personales — preguntan «¿se parece más al ancla de un 3 o al ancla de un 4?». La comparación es un juicio mucho más fiable que la valoración absoluta, y es el mismo juicio para todos los del panel, incluido el evaluador que se incorpore dentro de seis meses y nunca asistió a la sesión original.
Comprobaciones por muestreo continuas: la calibración no es un acto único
Una sola sesión de calibración fija el estándar; no lo mantiene. La deriva vuelve a colarse con el volumen, el tiempo y la rotación en el panel. El ritual de mantenimiento es ligero: con una cadencia regular, envíe un número reducido de respuestas ya puntuadas a un segundo evaluador, a ciegas, y compare. No está volviendo a puntuar todo el proceso — lo está muestreando en busca de desacuerdos.
Fíjese en el patrón, no en el fallo aislado. Una diferencia de dos puntos en una respuesta limítrofe es normal; una brecha constante de un nivel entre la misma pareja de evaluadores es deriva, y un criterio que sigue produciendo desacuerdos entre distintas parejas es un problema de rúbrica, no de personas. Cuando aparezca un patrón, haga una recalibración breve solo de ese criterio — puntuar una muestra, discutir, afinar el descriptor. Veinte minutos, no un taller.
Aquí también se gana el sueldo una plataforma de evaluación: cuando cada puntuación queda registrada frente a la rúbrica con su justificación, los patrones por evaluador son visibles en lugar de anecdóticos, y la comprobación por muestreo se convierte en un informe que se lee y no en una hoja de cálculo que se construye al final de un ciclo largo de puntuación. Cuanto más ligero sea el ritual, más probable es que sobreviva al contacto con una temporada de contratación intensa.
Cuando dos evaluadores discrepan sobre un candidato real
El desacuerdo sobre un candidato real no es un fallo del proceso — es el proceso sacando a la luz un caso realmente reñido. Las respuestas equivocadas son las perezosas: promediar las puntuaciones en silencio o dejar que gane por defecto el evaluador más veterano. Promediar oculta el desacuerdo; la veteranía lo resuelve por jerarquía y no por evidencia. Ambas le dejan sin poder explicar la puntuación después.
En su lugar, trate un desacuerdo relevante como un disparador. Los dos evaluadores comparan sus justificaciones frente a la rúbrica y sus anclas; la mayoría de las brechas se resuelven en minutos en cuanto ambos señalan el mismo descriptor. Si aun así discrepan, incorpore a un tercer evaluador que puntúe la respuesta a ciegas, sin ver las dos primeras puntuaciones, y deje que la discusión avance a partir de tres lecturas independientes.
Sea cual sea la resolución, déjela registrada: las puntuaciones originales, las justificaciones y por qué la puntuación final acabó donde acabó. Ese registro es lo que hace explicable una decisión reñida ante un responsable de contratación — o ante quien en el futuro defienda al candidato — y cada desacuerdo resuelto se convierte en un candidato para la biblioteca de anclas, de modo que la misma discusión nunca tenga que repetirse.
Ideas clave
- La deriva de quien puntúa es lo normal en cualquier proceso con varios evaluadores; las rúbricas la reducen, pero solo la calibración la cierra.
- Celebre una sesión de calibración antes de puntuar en real: primero las puntuaciones independientes, después discuta solo las diferencias y después corrija la rúbrica allí donde las palabras permitían dos lecturas.
- Los ejemplos ancla — respuestas reales fijadas a niveles de puntuación — convierten las valoraciones absolutas en comparaciones, que son mucho más coherentes.
- Mantenga el acuerdo con comprobaciones por muestreo ciegas, ligeras y regulares, y recalibre un único criterio cuando aparezca un patrón.
- Nunca disuelva en una media un desacuerdo real: compare las justificaciones, añada una tercera lectura ciega si hace falta y deje constancia de cómo se resolvió.
