By Daniel Whitmore, MSc in Industrial and Organizational Psychology
Kurz gesagt
Kompetenzen zu gewichten heißt zu erklären, dass manche Teile einer Rolle mehr zählen als andere, wenn die Bewertung einer bewerbenden Person zusammengeführt wird. Jahrzehnte der Forschung zeigen, dass gleiche Gewichte Bewerbende ungefähr so gut ordnen wie sorgfältig hergeleitete differenzielle Gewichte — Gewichtung ist also kein Weg, eine Bewertung aussagekräftiger für die spätere Leistung zu machen. Ihr Wert liegt im Arbeitsplatzbezug: Eine gewichtete Bewertung bildet ab, was die Rolle tatsächlich ist, und genau das macht eine Personalentscheidung erklärbar und begründbar, wenn jemand fragt, warum eine bewerbende Person vorgezogen wurde.
Zu zählen, wie viele Hürden jemand nimmt, verdeckt, welche es waren
Der einfachste Weg, eine bewerbende Person gegenüber einer Rolle zusammenzufassen, ist zu zählen: Sie erfüllt vier der sieben Kompetenzen, die die Rolle verlangt. Das liest sich sauber und lässt sich leicht erklären, und genau deshalb hören so viele Scorecards genau hier auf. Das Problem ist, was die Zählung wegwirft — sie behandelt jede Kompetenz als austauschbar und kann Ihnen deshalb nicht sagen, ob die vier erfüllten auch die vier waren, auf die es ankommt.
Stellen Sie sich eine Support-Rolle vor, in der die Arbeit ganz überwiegend schriftlich ist: den ganzen Tag Kundschaft schriftlich betreuen, mit Empathie. Die Rolle listet außerdem Produktwissen, Priorisierung und Dokumentation auf — real, aber nachrangig. Eine bewerbende Person erfüllt schriftliche Kommunikation und Empathie und verfehlt die anderen drei. Eine zweite erfüllt die drei nachrangigen und verfehlt die beiden, die die Stelle ausmachen. Nach der Zählung wirkt die zweite Person stärker — drei schlägt zwei. Nach der Tätigkeit ist die erste die einzige, die die Arbeit tatsächlich leisten kann.
An diesem Ergebnis ist nichts ein Fehler in der Rechnung; die Rechnung hat genau das getan, was ihr aufgetragen war. Es ist ein Modellierungsfehler: Dem Modell wurde nie mitgeteilt, dass manche Teile dieser Rolle die Stelle tragen und andere sie nur unterstützen. Gewichtung ist die Art, wie Sie diese Information nachliefern.
Was die Forschung tatsächlich über Gewichte sagt
Hier wird es für die meisten Anbietertexte unangenehm, denn der ehrliche Befund ist nicht der schmeichelhafte. Eine lange Forschungslinie zeigt, dass Einheitsgewichte — jede Komponente gleich zu behandeln — Menschen ungefähr so gut ordnen wie Gewichte, die mit weit größerem Aufwand hergeleitet wurden. Wainer betitelte sein Papier von 1976 über die Schätzung von Koeffizienten in linearen Modellen mit der Wendung, die dem Befund seither anhängt: it don't make no nevermind. Dawes lieferte 1979 das Gegenstück zu dem, was er improper linear models nannte, und zeigte, dass einfache gleichgewichtete Komposite bemerkenswert robust sind und aufwendigere Verfahren an neuen Daten oft schlagen.
Bobko, Roth und Buster kehrten 2007 eigens für die Komposite zu der Frage zurück, die wir in der Personalauswahl bilden, sichteten die Literatur und kamen zu dem Schluss, dass Einheitsgewichte unter einer breiten Palette von Bedingungen ein sehr angemessener Ansatz sind. Der Grund ist kein Geheimnis. Die Komponenten eines gut gebauten Assessments hängen untereinander zusammen, und sobald sie das tun, verschiebt eine Umverteilung von Gewicht die resultierende Rangfolge weit weniger, als die Intuition nahelegt. Differenzielle Gewichte tragen zudem ihren eigenen Schätzfehler mit sich, der die Präzision, die sie hinzufügen sollten, leise wieder aufheben kann.
Wenn eine Plattform Ihnen also sagt, dass das Gewichten Ihrer Kompetenzen ihre Bewertungen genauer oder aussagekräftiger für die spätere Leistung macht, gehen Sie mit dieser Aussage vorsichtig um. Nach der Datenlage ist das nicht das, was Gewichtung verlässlich einbringt. Das offen zu sagen kostet einen Anbieter einen gut klingenden Satz — und es ist die einzige Fassung des Satzes, die den Kontakt mit der Literatur übersteht.
Warum dann überhaupt gewichten? Weil die Bewertung zur Tätigkeit passen muss
Das Argument für Gewichtung ist nicht die Vorhersage. Es ist die Inhaltsvalidität — die Anforderung, dass ein Assessment und die Bewertung, die es erzeugt, die Tätigkeit abbilden, die zu messen sie beanspruchen. Eine Zahl, die eine bewerbende Person als starke Passung für eine schreiblastige Rolle ausweist, während sie das Schreiben leise als ein Sechstel des Ergebnisses zählt, beschreibt diese Rolle nicht. Sie mag Bewerbende trotzdem akzeptabel ordnen; sie lässt sich nur nicht ohne Verlegenheit erklären.
Diese Erklärbarkeit ist der praktische Ertrag. Auswahlentscheidungen werden hinterfragt — von einem Hiring Manager, der anderer Meinung ist, von einer bewerbenden Person, die nach dem Warum fragt, manchmal von einer Anwältin. In solchen Momenten ist das nützliche Dokument eine belegte Kette: Das ist die Anforderungsanalyse, das sind die Kompetenzen, die sie ergeben hat, so viel zählt jede und warum, und hier sind die Nachweise für diese bewerbende Person dagegen. Ein gewichteter Gesamtwert macht diese Kette vollständig. Ein ungewichteter lässt genau dort eine Lücke, wo die Begründung zur relativen Wichtigkeit stehen müsste, und „wir haben alles gleich gezählt, weil das die Voreinstellung war“ ist eine schwache Antwort, wenn die Stelle offensichtlich nicht so funktioniert.
Es gibt einen zweiten, leiseren Nutzen. Gewichte zu setzen erzwingt ein Gespräch, das Teams sonst überspringen. Zu entscheiden, dass schriftliche Kommunikation dreimal so viel zählt wie Dokumentation, verlangt von Hiring Manager und Recruiting, sich darüber zu einigen, was die Rolle ist — bevor Bewerbende da sind, nicht im Streit über eine einzelne Person. Der größte Teil des Werts einer Gewichtungsübung ist eingefahren, bevor eine einzige Bewertung berechnet wurde.
Gewichte beantworten eine andere Frage als Muss-Kriterien
Gewichtung wird oft damit verwechselt, etwas als unverzichtbar zu markieren, und die beiden sind tatsächlich verschiedene Instrumente. Ein Gewicht sagt, wie viel eine Kompetenz in einer Summe zählt, in der Stärke im einen Bereich Schwäche im anderen ausgleichen kann — ein kompensatorisches Modell. Ein Muss-Kriterium sagt, dass keine Stärke anderswo ein Defizit an dieser Stelle aufwiegt — eine Hürde. Die Literatur zu Auswahlmodellen behandelt diese als einander ergänzende Bauformen und nicht als Rivalen; Vergleiche zwischen kompensatorischen und Multiple-Hurdle-Ansätzen drehen sich um Kosten, Reihenfolge und Nutzen, nicht darum, dass eines richtig wäre.
Der Fehlerfall ist, das eine zu nutzen, wo Sie das andere brauchen. Drücken Sie ein echtes Muss-Kriterium als hohes Gewicht aus, kann eine bewerbende Person die Gesamthürde trotzdem nehmen, obwohl sie den unverhandelbaren Teil der Arbeit nicht leisten kann. Drücken Sie eine bloße Priorität als Muss-Kriterium aus, sagen Sie Menschen wegen Defiziten ab, die die Rolle verkraften kann — und sobald mehrere Kompetenzen als unverzichtbar markiert sind, scheitert fast jede Person an einer, und die Markierung trägt keine Information mehr.
Eine praktische Regel: Greifen Sie zum Muss-Kriterium, wenn die ehrliche Antwort auf „könnten wir jemanden einstellen, der hier schwach ist?“ Nein lautet, und zum Gewicht, wenn die Antwort „ja, aber es würde uns etwas kosten“ lautet. Halten Sie Muss-Kriterien selten. Ihre Kraft kommt daher, dass sie rar sind.
- Gewicht — wie viel dies in einer Bewertung zählt, in der Stärken Schwächen ausgleichen können.
- Muss-Kriterium — ein Defizit wird für sich berichtet, nie durch Stärke anderswo weggemittelt.
- Nutzen Sie beides: einen gewichteten Gesamtwert für das Gesamtbild, Hürden für das Unverhandelbare.
Was eine fehlende Messung niemals bedeuten darf
Gewichtete Modelle bringen einen Fehlerfall mit sich, den man benennen sollte, weil er Bewerbende für etwas bestraft, das sie gar nicht getan haben. Führt eine Rolle eine stark gewichtete Kompetenz auf, die das Assessment nie tatsächlich gemessen hat, behandelt ein naiver Gesamtwert die Abwesenheit als Null — und die bewerbende Person wird für eine Frage abgewertet, die ihr niemand gestellt hat.
Die richtige Behandlung ist, das nicht Erhobene sowohl aus dem Zähler als auch aus dem Nenner herauszunehmen, damit die Bewertung das tatsächlich abgedeckte Feld beschreibt. Eine bewerbende Person sollte an den vorhandenen Nachweisen gemessen werden, und der Bericht sollte ausdrücklich sagen, wie viel von der Rolle diese Nachweise abdecken. Diese Transparenz leistet auch für die Arbeitgeberseite etwas Nützliches: Eine Kompetenz, die immer wieder als nicht gemessen auftaucht, ist eine Lücke im Assessment, und erst wenn das ausgesprochen dasteht, fügt jemand die Aufgabe hinzu, die sie schließt.
Das ist dasselbe Prinzip, das den Rest eines begründbaren Bewertungsmodells regiert. Das Fehlen von Nachweisen ist kein Nachweis des Fehlens, und ein Bewertungssystem, das das eine still in das andere verwandelt, erzeugt irgendwann eine Entscheidung, die niemand rechtfertigen kann.
Gewichte setzen, die Sie tatsächlich begründen können
Beginnen Sie bei gleich. Angesichts dessen, was die Forschung über Einheitsgewichte sagt, ist Gleichgewichtung eine begründbare Voreinstellung und keine bequeme, und sie sollte das sein, was Ihr Blueprint tut, bis jemand sagen kann, warum eine Kompetenz mehr verdient. Begründungsbedürftig ist das Abweichen, nicht das Bleiben.
Leiten Sie die Unterschiede aus der Tätigkeit ab, nicht aus dem Assessment. Die Frage lautet, wie zentral eine Kompetenz für das Ausüben der Rolle ist — wie viel der Arbeit sie berührt, wie sichtbar die Folgen sind, wenn sie schwach ist — und beantwortet wird sie von den Menschen, die die Stelle kennen, idealerweise mit derselben Anforderungsanalyse, aus der die Kompetenzliste hervorging. Gewichte, die erfunden wurden, damit eine bevorzugte bewerbende Person besser dasteht, sind keine Gewichte; sie sind ein Ergebnis, das rückwärts arbeitet.
Halten Sie die Skala grob und die Begründung schriftlich fest. Feingliedrige Gewichte suggerieren eine Präzision, die die zugrunde liegenden Urteile nicht haben, und der Unterschied zwischen 1,7 und 1,8 hält keiner Prüfung stand — eine kleine Zahl von Stufen genügt, um auszudrücken, was ein Team wirklich glaubt. Halten Sie fest, warum es jedes vom Standard abweichende Gewicht gibt, damit das Modell Monate später auch von jemandem erklärt werden kann, der nicht im Raum war.
- Standardmäßig gleiche Gewichte; jede Abweichung als Entscheidung behandeln, die eine Begründung braucht.
- Gewichte aus der Anforderungsanalyse ableiten, bevor Sie Bewerbende sehen.
- Eine grobe Skala nutzen — wenige Stufen, keine Nachkommastellen, die falsche Präzision suggerieren.
- Für jedes vom Standard abweichende Gewicht den Grund aufschreiben.
- Gewichte überprüfen, wenn sich die Rolle ändert; ein veralteter Blueprint misst eine Stelle, die es so nicht mehr gibt.
Wie SkillCort das umsetzt
Ein Rollen-Blueprint in SkillCort listet die Kompetenzen auf, die eine Rolle verlangt, jede mit einem Zielniveau, einem Gewicht und einer optionalen Kennzeichnung „kritisch“. Die Nachweise einer bewerbenden Person laufen aus den bearbeiteten Aufgaben in diese Kompetenzen zusammen, und der Bericht zeigt zwei Zahlen nebeneinander: wie viele der erhobenen Kompetenzen ihr Ziel erreicht haben und — nur wenn der Blueprint tatsächlich vom Standard abweichende Gewichte trägt — welcher Anteil des erhobenen Gewichts der Rolle erfüllt wurde. Bei gleichen Gewichten sind die beiden schon von der Konstruktion her identisch, es wird also nichts Redundantes angezeigt und keine bestehende Zahl verschiebt sich still, wenn die Funktion hinzukommt.
Kritische Kompetenzen bleiben außerhalb des Gesamtwerts. Ein Defizit dort wird als eigene Lücke berichtet, statt in einen Durchschnitt eingeglättet zu werden; so bleiben die kompensatorische Zusammenfassung und das Unverhandelbare in getrennten Spalten, wo sie hingehören. Kompetenzen ohne Nachweise werden aus beiden Zahlen ausgeschlossen, damit eine nicht gemessene Anforderung eine bewerbende Person niemals nach unten ziehen kann.
Die Aussage, die an all dem hängt, ist bewusst eng gehalten. SkillCort behauptet nicht, dass die gewichtete Zahl die spätere Leistung im Job besser vorhersagt als die ungewichtete, denn die Datenlage stützt das nicht. SkillCort sagt Ihnen, dass die Zahl die Rolle abbildet, die Sie definiert haben — und stellt ihr den Blueprint, die Nachweise und den Prüfpfad zur Seite, mit denen Sie Ihre Begründung zeigen können, wenn jemand fragt.
Das Wichtigste in Kürze
- Zu zählen, wie viele Kompetenzen eine bewerbende Person erfüllt, behandelt jeden Teil einer Rolle als austauschbar — und kann die falsche Person an die erste Stelle setzen.
- Gleiche Gewichte ordnen Bewerbende ungefähr so gut wie differenzielle Gewichte (Wainer 1976; Dawes 1979; Bobko, Roth & Buster 2007) — Gewichtung ist kein Gewinn an Genauigkeit.
- Das eigentliche Argument für Gewichtung ist die Inhaltsvalidität: Die Bewertung soll die Tätigkeit beschreiben, und genau das macht eine Entscheidung erklärbar.
- Gewichte und Muss-Kriterien beantworten verschiedene Fragen — nutzen Sie einen gewichteten Gesamtwert für das Gesamtbild und halten Sie Hürden für das Unverhandelbare selten.
- Lassen Sie eine nicht gemessene Kompetenz nie als Null zählen; schließen Sie sie aus und legen Sie die Abdeckung offen.
Quellen und weiterführende Literatur
- Wainer (1976), Estimating coefficients in linear models: It don't make no nevermind — Psychological Bulletin
- Dawes (1979), The robust beauty of improper linear models in decision making — American Psychologist
- Bobko, Roth & Buster (2007), The Usefulness of Unit Weights in Creating Composite Scores — Organizational Research Methods
- Ock (2018), The Utility of Personnel Selection Decisions: Comparing Compensatory and Multiple-Hurdle Selection Models — Journal of Personnel Psychology