Saltar al contenido
SkillCort

7 min · 7 stepsTutorial de evaluación

Cómo llevar a cabo una sesión de calibración de evaluadores

Una rúbrica compartida pone a los evaluadores de acuerdo sobre el texto; la calibración demuestra que realmente lo están leyendo de la misma manera. Este tutorial recorre una sesión breve y estructurada — puntuación independiente de respuestas de referencia, una comparación por criterio y acuerdos documentados — que hace comparables las puntuaciones de varios evaluadores antes de que dependan de ellas candidatos reales.

What you'll need

  • Una rúbrica terminada y adjunta a la evaluación (una instantánea congelada)
  • 2–3 respuestas de referencia que abarquen distintos niveles de calidad
  • Todos los evaluadores que vayan a puntuar candidatos, con 45–60 minutos en común
  • Un lugar donde registrar las interpretaciones acordadas, compartido con el panel

Step 1: Elija dos o tres respuestas de referencia

Elija respuestas que hagan visible el desacuerdo: una claramente buena, una claramente floja y — lo más importante — una realmente dudosa. Las respuestas de una prueba piloto con compañeros funcionan bien; también las primeras respuestas de candidatos, si su ventana de revisión permite empezar a puntuar después de la calibración.

La respuesta dudosa es donde la calibración demuestra su valor. Todo el mundo coincide en la excelencia y en el fracaso; los paneles se dividen ante la respuesta que es sólida en un criterio y floja en otro. Si ninguna de sus referencias produce esa tensión, redacte una que lo haga.

Step 2: Explique la rúbrica al panel antes de que nadie puntúe

Recorra la rúbrica con el panel: cada criterio, sus descripciones de nivel ancladas y su peso. El objetivo es un entendimiento compartido del estándar, no de ninguna respuesta — todavía no comente las referencias. Invite ahora a preguntar sobre el lenguaje ambiguo de los anclajes, mientras no hay ninguna puntuación en juego.

Recuerde al panel cómo funciona la puntuación por matriz en SkillCort: para cada criterio se hace clic en la tarjeta de nivel cuya descripción coincide con la respuesta, y queda registrada la puntuación de ese nivel. La indicación que más importa: puntuar frente a los anclajes escritos, no frente a la idea privada de cómo es una buena respuesta.

Step 3: Puntúe las referencias de forma independiente

Cada evaluador puntúa cada respuesta de referencia a solas, sin discusión, con la rúbrica compartida. La independencia es todo el sentido del ejercicio — la sesión mide cuánto diverge el panel de forma natural, y cualquier consulta previa a que las puntuaciones queden registradas destruye esa medición. Dé a todos la misma ventana de trabajo en silencio y posponga toda comparación hasta que estén todas las puntuaciones.

Pida a los evaluadores que adjunten una nota breve a la puntuación de cada criterio citando la evidencia de la respuesta que justificó el nivel elegido. En SkillCort, las notas se adjuntan a las puntuaciones como evidencia y, en esta sesión, son lo que convierte «no estamos de acuerdo» en «estamos leyendo este anclaje de forma distinta» — el tipo productivo de desacuerdo.

Step 4: Compare las puntuaciones por criterio, no por total

Reúna las puntuaciones y compárelas criterio por criterio. Los totales ocultan la historia: dos evaluadores pueden llegar a puntuaciones globales parecidas mediante lecturas opuestas de dos criterios, lo que significa que su coincidencia es suerte, no calibración. Las diferencias por criterio muestran exactamente dónde divergen las interpretaciones.

En cada criterio con dispersión, pida a los evaluadores que difieren que lean en voz alta sus notas de evidencia — las notas muestran qué estaba mirando realmente cada persona al elegir un nivel, lo cual resulta mucho más útil que debatir los números. Casi toda diferencia se resuelve en uno de unos pocos patrones, y nombrar el patrón indica qué hay que corregir.

  • Un anclaje ambiguo que admite dos lecturas — precise la interpretación del lenguaje
  • Un evaluador que puntúa la evidencia de un criterio contiguo — vuelva a enunciar el límite
  • Un estándar privado importado de la experiencia pasada — vuelva al anclaje escrito
  • Diferencias de juicio genuinas sobre trabajo dudoso — acuerde una convención

Step 5: Acuerde los anclajes y documente cada interpretación

Resuelva cada divergencia en un acuerdo explícito: qué nivel merece este tipo de respuesta y por qué. Escriba los acuerdos en una nota de calibración compartida — aclaraciones de anclajes, reglas de límite entre criterios, convenciones para casos límite recurrentes. Los acuerdos no documentados se evaporan en una semana y nunca llegan a un evaluador que se incorpora más tarde.

Recuerde que la rúbrica adjunta es una instantánea congelada, de modo que a mitad de la evaluación usted documenta interpretaciones de los anclajes, no los reescribe — que es lo que mantiene coherente la puntuación para los candidatos ya evaluados. Traslade las correcciones de redacción genuinas a la rúbrica de su banco para que la próxima evaluación adjunte una versión más afinada.

Step 6: Vuelva a puntuar una referencia para confirmar la alineación

Cierre la sesión haciendo que todos puntúen de forma independiente una respuesta más — una referencia nueva, si dispone de ella, o de nuevo el caso dudoso — aplicando los acuerdos documentados. Si la dispersión por criterio se ha estrechado de forma visible, el panel está lo bastante calibrado para empezar a puntuar candidatos.

Si un criterio sigue dividiendo al panel, no promedie el problema hasta hacerlo desaparecer. Una división persistente significa que el anclaje o el acuerdo sigue siendo ambiguo; dedique diez minutos más a ese único criterio en lugar de llevar un desacuerdo sin resolver a la puntuación de todos los candidatos.

Step 7: Programe comprobaciones de deriva durante la ventana de revisión

La calibración se degrada. A lo largo de una ventana de revisión larga, los evaluadores derivan: los estándares suben a medida que las respuestas fuertes reajustan las expectativas, o se ablandan con el cansancio. Planifique comprobaciones breves de deriva: elija periódicamente una respuesta puntuada hace poco y haga que un segundo evaluador la puntúe a ciegas, y compare después las diferencias por criterio exactamente igual que en la sesión.

Aquí es también donde la asistencia de la IA se mantiene en su sitio. La IA de SkillCort puede redactar resúmenes y sugerencias de puntuación por criterio, lo que agiliza la revisión — pero cada puntuación la confirma o la anula una persona identificada, y las comprobaciones de deriva verifican a las personas, ya que es su juicio lo que sostendrá la decisión. Vuelva a reunir al panel brevemente si una comprobación de deriva revela una nueva divergencia.

Pro tips

  • Calibre antes de que se abra la ventana de revisión, no después de haber puntuado a la mitad de los candidatos — recalibrar a mitad de camino crea dos poblaciones de puntuaciones.
  • Mantenga la sesión en 45–60 minutos; una sesión ceñida sobre tres respuestas supera a una larga que se disuelve en un rediseño de la rúbrica.
  • Nunca deje que la persona de mayor rango puntúe primero ni hable primero en las comparaciones — la independencia es el mecanismo y la jerarquía es su enemiga.
  • Guarde la nota de calibración junto a la evaluación para que todo evaluador futuro herede las interpretaciones acordadas.
  • Esté atento a que un evaluador sea sistemáticamente más severo en todos los criterios — eso es una referencia personal que conviene comentar, no un problema de la rúbrica.

Preguntas frecuentes

¿Cuántas respuestas de referencia necesitamos?
Con dos o tres basta: una buena, una floja y una dudosa. La respuesta dudosa hace casi todo el trabajo, porque es donde las interpretaciones de los anclajes por parte de los evaluadores divergen de verdad. Más referencias añaden tiempo más deprisa de lo que añaden señal.
¿Por qué comparar por criterio en lugar de comparar las puntuaciones totales?
Los totales pueden coincidir mientras los juicios subyacentes se contradicen: dos evaluadores que llegan al mismo número mediante lecturas opuestas de dos criterios. Dado que las puntuaciones de los evaluadores se promedian dentro de cada criterio antes de que los pesos las combinen, el acuerdo a nivel de criterio es lo que realmente hace significativas las puntuaciones finales.
¿Podemos cambiar la rúbrica si la calibración deja al descubierto un anclaje deficiente?
La rúbrica adjunta a una evaluación en curso es una instantánea congelada, así que documente la interpretación acordada para la evaluación actual y corrija la redacción en su banco de rúbricas para las futuras. Así la puntuación se mantiene coherente para los candidatos mientras la mejora igualmente se aplica.
¿Las sugerencias de puntuación de la IA eliminan la necesidad de calibración?
No. La IA puede redactar resúmenes y sugerencias por criterio, pero una persona identificada confirma o anula cada puntuación — el juicio humano es lo que sostiene la decisión, así que son las personas quienes deben estar calibradas. Los borradores de la IA hacen la revisión más rápida; no la hacen coherente.
¿Con qué frecuencia deberíamos hacer comprobaciones de deriva?
Ajústelas a la ventana de revisión: una ventana de unos pocos días puede necesitar solo una repuntuación a ciegas a mitad de la ventana, mientras que una ventana de varias semanas merece un ritmo periódico. La comprobación en sí es barata: una respuesta, una segunda puntuación a ciegas, una comparación por criterio.

For hiring teams

Haga que todos los evaluadores sean intercambiables — en el mejor sentido

Vea cómo las rúbricas compartidas, las notas de evidencia y la puntuación con evaluador identificado de SkillCort mantienen coherente a un panel de varios revisores desde el primer candidato hasta el último. Reserve una demostración.