Zum Inhalt springen
SkillCort

7 min · 7 stepsTutorial zur Bewertung

So führen Sie eine Kalibrierungssitzung für Prüfende durch

Eine gemeinsame Rubrik bringt Prüfende auf einen Stand; die Kalibrierung zeigt, ob sie sie tatsächlich gleich lesen. Dieses Tutorial führt durch eine kurze, strukturierte Sitzung — unabhängiges Bewerten von Referenzantworten, ein Vergleich je Kriterium und dokumentierte Vereinbarungen — die Punktwerte mehrerer Prüfender vergleichbar macht, bevor echte Bewerbende davon abhängen.

What you'll need

  • Eine fertige Rubrik, die dem Assessment angehängt ist (eine eingefrorene Momentaufnahme)
  • 2–3 Referenzantworten, die unterschiedliche Qualitätsniveaus abdecken
  • Alle Prüfenden, die Bewerbende bewerten werden, mit 45–60 gemeinsamen Minuten
  • Ein Ort, an dem die vereinbarten Auslegungen festgehalten werden und den das Panel einsehen kann

Step 1: Wählen Sie zwei oder drei Referenzantworten aus

Wählen Sie Antworten, die Uneinigkeit sichtbar machen: eine klar starke, eine klar schwache und — am wichtigsten — eine wirklich grenzwertige. Antworten aus einem Probelauf mit Kolleginnen und Kollegen eignen sich gut; ebenso frühe Antworten von Bewerbenden, wenn Ihr Prüfzeitraum es zulässt, dass die Bewertung erst nach der Kalibrierung beginnt.

Bei der grenzwertigen Antwort zahlt sich die Kalibrierung aus. Über herausragende und ungenügende Leistungen sind sich alle einig; ein Panel spaltet sich an der Antwort, die in einem Kriterium stark und in einem anderen wacklig ist. Wenn keine Ihrer Referenzen diese Spannung erzeugt, entwerfen Sie eine, die es tut.

Step 2: Briefen Sie das Panel zur Rubrik, bevor jemand bewertet

Gehen Sie die Rubrik gemeinsam mit dem Panel durch: jedes Kriterium, seine verankerten Stufenbeschreibungen und sein Gewicht. Ziel ist ein gemeinsames Verständnis des Maßstabs, nicht einer einzelnen Antwort — besprechen Sie die Referenzen noch nicht. Laden Sie jetzt zu Fragen zu mehrdeutigen Ankerformulierungen ein, solange kein Punktwert auf dem Spiel steht.

Erinnern Sie das Panel daran, wie die Matrixbewertung in SkillCort funktioniert: Für jedes Kriterium klicken Sie auf die Stufenkarte, deren Beschreibung zur Antwort passt, und der Punktwert dieser Stufe wird erfasst. Die wichtigste Anweisung lautet: Bewerten Sie anhand der geschriebenen Anker, nicht anhand Ihrer eigenen Vorstellung davon, wie eine gute Antwort aussieht.

Step 3: Bewerten Sie die Referenzen unabhängig voneinander

Jede prüfende Person bewertet jede Referenzantwort allein, ohne Austausch, anhand der gemeinsamen Rubrik. Die Unabhängigkeit ist der springende Punkt — die Sitzung misst, wie weit das Panel von sich aus auseinandergeht, und jede Absprache vor der Festlegung der Punktwerte zerstört diese Messung. Geben Sie allen dasselbe ruhige Zeitfenster zum Arbeiten und halten Sie alle Vergleiche zurück, bis jeder Punktwert vorliegt.

Bitten Sie die Prüfenden, an jeden Kriteriumswert eine kurze Notiz zu hängen, die den Nachweis in der Antwort benennt, der die gewählte Stufe begründet. In SkillCort werden Notizen als Nachweis an Punktwerte gehängt, und in dieser Sitzung machen sie aus „wir sind uneinig“ ein „wir lesen diesen Anker unterschiedlich“ — die produktive Art von Uneinigkeit.

Step 4: Vergleichen Sie Punktwerte je Kriterium, nicht je Gesamtsumme

Führen Sie die Punktwerte zusammen und vergleichen Sie sie Kriterium für Kriterium. Gesamtsummen verbergen die Geschichte: Zwei Prüfende können über gegensätzliche Lesarten zweier Kriterien bei ähnlichen Gesamtwerten landen — dann ist ihre Übereinstimmung Zufall, nicht Kalibrierung. Die Abweichungen je Kriterium zeigen genau, wo die Auslegungen auseinandergehen.

Lassen Sie bei jedem Kriterium mit Streuung die abweichenden Prüfenden ihre Nachweisnotizen laut vorlesen — die Notizen zeigen, worauf jede Person bei der Wahl der Stufe tatsächlich geschaut hat, und das ist weit nützlicher, als über die Zahlen zu streiten. Fast jede Lücke lässt sich auf eines von wenigen Mustern zurückführen, und das Muster zu benennen sagt Ihnen, was zu beheben ist.

  • Ein mehrdeutiger Anker, der zwei Lesarten zulässt — schärfen Sie die Auslegung der Formulierung
  • Eine prüfende Person bewertet den Nachweis eines benachbarten Kriteriums — halten Sie die Abgrenzung erneut fest
  • Ein eigener Maßstab aus früherer Erfahrung — kehren Sie zum geschriebenen Anker zurück
  • Echte Urteilsunterschiede bei grenzwertigen Arbeiten — einigen Sie sich auf eine Konvention

Step 5: Einigen Sie sich auf Anker und dokumentieren Sie jede Auslegung

Lösen Sie jede Abweichung in eine ausdrückliche Vereinbarung auf: Welche Stufe verdient eine Antwort dieser Art, und warum. Halten Sie die Vereinbarungen in einer gemeinsamen Kalibrierungsnotiz fest — Klarstellungen zu Ankern, Abgrenzungsregeln zwischen Kriterien, Konventionen für wiederkehrende Grenzfälle. Undokumentierte Vereinbarungen verflüchtigen sich innerhalb einer Woche und erreichen nie eine prüfende Person, die später dazukommt.

Denken Sie daran, dass die angehängte Rubrik eine eingefrorene Momentaufnahme ist: Mitten im Assessment dokumentieren Sie Auslegungen der Anker, Sie schreiben sie nicht um — und genau das hält die Bewertung für bereits beurteilte Bewerbende konsistent. Führen Sie tatsächliche Verbesserungen der Formulierung in die Rubrik in Ihrer Bank zurück, damit das nächste Assessment eine schärfere Fassung anhängt.

Step 6: Bewerten Sie eine Referenz erneut, um die Übereinstimmung zu bestätigen

Schließen Sie die Sitzung damit ab, dass alle noch eine Antwort unabhängig voneinander bewerten — eine frische Referenz, falls vorhanden, oder erneut den Grenzfall — und dabei die dokumentierten Vereinbarungen anwenden. Wenn sich die Streuung je Kriterium sichtbar verringert hat, ist das Panel ausreichend kalibriert, um mit der Bewertung von Bewerbenden zu beginnen.

Wenn ein Kriterium das Panel weiterhin spaltet, mitteln Sie das Problem nicht weg. Eine anhaltende Spaltung bedeutet, dass der Anker oder die Vereinbarung noch mehrdeutig ist; verbringen Sie zehn weitere Minuten mit diesem einen Kriterium, statt eine ungelöste Uneinigkeit in die Bewertung jeder bewerbenden Person zu tragen.

Step 7: Planen Sie Driftkontrollen während des Prüfzeitraums

Kalibrierung verfällt. Über einen langen Prüfzeitraum driften Prüfende — Maßstäbe steigen, weil starke Antworten die Erwartungen verschieben, oder sie werden mit zunehmender Ermüdung milder. Planen Sie kurze Driftkontrollen: Greifen Sie regelmäßig eine kürzlich bewertete Antwort heraus und lassen Sie sie von einer zweiten prüfenden Person blind bewerten, dann vergleichen Sie die Abweichungen je Kriterium genau wie in der Sitzung.

Auch hier bleibt die KI-Unterstützung in ihrer Spur. Die KI von SkillCort kann Zusammenfassungen und Vorschläge für Punktwerte auf Kriteriumsebene entwerfen, was die Prüfung beschleunigt — aber jeder Punktwert wird von einer namentlich benannten Person bestätigt oder überschrieben, und Driftkontrollen prüfen die Menschen, denn auf deren Urteil wird die Entscheidung beruhen. Kommen Sie kurz erneut zusammen, wenn eine Driftkontrolle eine neue Abweichung zutage fördert.

Pro tips

  • Kalibrieren Sie, bevor der Prüfzeitraum beginnt, nicht erst, wenn die Hälfte der Bewerbenden bewertet ist — eine Nachkalibrierung mittendrin erzeugt zwei Populationen von Punktwerten.
  • Halten Sie die Sitzung bei 45–60 Minuten; eine straffe Sitzung zu drei Antworten ist besser als eine lange, die sich in einer Neugestaltung der Rubrik verliert.
  • Lassen Sie niemals die ranghöchste Person zuerst bewerten oder im Vergleich zuerst sprechen — Unabhängigkeit ist der Mechanismus, Hierarchie ist sein Feind.
  • Bewahren Sie die Kalibrierungsnotiz neben dem Assessment auf, damit alle künftigen Prüfenden die vereinbarten Auslegungen übernehmen.
  • Achten Sie darauf, ob eine prüfende Person über alle Kriterien hinweg durchgängig strenger bewertet — das ist eine persönliche Ausgangslage, über die zu sprechen ist, und kein Problem der Rubrik.

Häufig gestellte Fragen

Wie viele Referenzantworten brauchen wir?
Zwei oder drei genügen: eine starke, eine schwache und eine grenzwertige. Die grenzwertige Antwort leistet den größten Teil der Arbeit, denn dort gehen die Auslegungen der Anker durch die Prüfenden wirklich auseinander. Weitere Referenzen kosten schneller Zeit, als sie Erkenntnis bringen.
Warum je Kriterium vergleichen statt der Gesamtwerte?
Gesamtsummen können übereinstimmen, während die zugrunde liegenden Urteile im Widerspruch stehen — zwei Prüfende erreichen dieselbe Zahl über gegensätzliche Lesarten zweier Kriterien. Da die Punktwerte der Prüfenden innerhalb jedes Kriteriums gemittelt werden, bevor die Gewichte sie zusammenführen, ist die Übereinstimmung auf Kriteriumsebene das, was die Endwerte überhaupt aussagekräftig macht.
Können wir die Rubrik ändern, wenn die Kalibrierung einen schlechten Anker offenlegt?
Die an ein laufendes Assessment angehängte Rubrik ist eine eingefrorene Momentaufnahme. Dokumentieren Sie daher die vereinbarte Auslegung für das aktuelle Assessment und korrigieren Sie die Formulierung in Ihrer Rubrikbank für künftige Assessments. So bleibt die Bewertung für Bewerbende konsistent, und die Verbesserung kommt trotzdem an.
Machen KI-Vorschläge für Punktwerte die Kalibrierung überflüssig?
Nein. Die KI kann Zusammenfassungen und Vorschläge auf Kriteriumsebene entwerfen, aber eine namentlich benannte Person bestätigt oder überschreibt jeden Punktwert — das menschliche Urteil ist das, worauf die Entscheidung beruht, also müssen die Menschen kalibriert sein. KI-Entwürfe machen die Prüfung schneller; konsistent machen sie sie nicht.
Wie oft sollten wir Driftkontrollen durchführen?
Richten Sie sich nach dem Prüfzeitraum: Bei einem Zeitraum von wenigen Tagen genügt möglicherweise eine einzige blinde Neubewertung in der Mitte, während ein mehrwöchiger Zeitraum einen regelmäßigen Rhythmus verdient. Die Kontrolle selbst ist günstig — eine Antwort, eine blinde Zweitbewertung, ein Vergleich je Kriterium.

For hiring teams

Machen Sie alle Prüfenden austauschbar — im besten Sinne

Sehen Sie, wie gemeinsame Rubriken, Nachweisnotizen und die Bewertung durch namentlich benannte Prüfende in SkillCort ein Panel aus mehreren Prüfenden von der ersten bis zur letzten bewerbenden Person konsistent halten. Buchen Sie eine Demo.