Zum Inhalt springen
SkillCort

30. Juli 2026 · 7 Min. LesezeitAssessment-Qualität

Signale zur Aufgabenqualität: die Fragen, die Ihr Assessment leise schwächen

Jede Frage in Ihrem Assessment ist ein kleines Messinstrument, und wie bei jedem Instrument sind einige präzise, einige falsch justiert und ein paar messen überhaupt nichts. Das Problem ist, dass eine kaputte Frage auf dem Papier genauso aussieht wie eine gute — dass sie fehlerhaft war, erfahren Sie erst, wenn Sie beobachten, wie echte Bewerbende sie beantworten. Genau dafür gibt es die Itemanalyse, und sie liest sich einfacher, als ihr Ruf vermuten lässt.

By Daniel Whitmore, MSc in Industrial and Organizational Psychology

Kurz gesagt

Signale zur Aufgabenqualität sind Kennzahlen, die aus echten Antworten von Bewerbenden berechnet werden und Ihnen sagen, ob eine Frage ihre Arbeit tut. Die beiden wichtigsten sind die Schwierigkeit — der Anteil der Bewerbenden, die richtig antworten — und die Trennschärfe — wie gut die Frage starke von schwachen Bewerbenden trennt. Eine Frage, die fast alle richtig oder fast alle falsch beantworten, trägt wenig Information, und eine mit geringer Trennschärfe sortiert Bewerbende überhaupt nicht. Beides sind Hinweise, den Antwortschlüssel zu prüfen und die Formulierung zu überarbeiten, bevor die Frage die nächste Entscheidung mitprägt.

Eine Frage, die gut aussieht, kann trotzdem nichts messen

Die meisten Assessment-Fragen werden einmal geschrieben, auf ihre Formulierung hin geprüft und danach für immer als richtig vorausgesetzt. Dieses Vertrauen ist fehl am Platz — nicht weil Autorinnen und Autoren nachlässig wären, sondern weil die Qualität einer Frage in ihrem Text nicht sichtbar ist. Zwei Fragen können sich gleich gut lesen und sich in dem Moment, in dem Bewerbende sie beantworten, völlig unterschiedlich verhalten: Die eine trennt sauber die Menschen, die den Stoff beherrschen, von denen, die ihn nicht beherrschen, die andere teilt den Raum zufällig auf.

Die Itemanalyse ist die Disziplin, Fragen nach ihrem Verhalten statt nach ihrem Erscheinungsbild zu beurteilen. Sie stammt aus der klassischen Testtheorie, und für eine Arbeitsproben-Bank brauchen Sie nur zwei ihrer Maße, um die Fragen zu erwischen, die Ihnen leise schaden: wie schwer die Frage ist und wie gut sie trennt. Beide werden aus den Antworten berechnet, die Ihre eigenen Bewerbenden bereits gegeben haben — genau das macht sie belastbar: Sie beschreiben Ihren Test, an Ihrer Population, nicht ein Lehrbuchideal.

Es geht nicht darum, bei jedem Item einer perfekten Zahl hinterherzujagen. Es geht darum, die kleine Gruppe von Fragen sichtbar zu machen, die Ihre Ergebnisse aktiv verzerren, damit ein Mensch sie ansehen und für jede einzelne entscheiden kann, ob sie korrigiert, behalten oder ausgemustert wird. Eine gute Bank ist nicht die, in der jede Frage fehlerfrei ist; es ist die, in der die fehlerhaften Fragen bekannt sind.

Schwierigkeit: zu leicht und zu schwer kosten Sie beide Information

Die Schwierigkeit ist — trotz des verwirrenden Namens — schlicht der Anteil der Bewerbenden, die eine Frage richtig beantworten: Eine Frage, die 70 % der Menschen richtig lösen, hat eine Schwierigkeit von 0,70. Ihre Aufgabe ist nicht, hoch oder niedrig zu sein, sondern informativ, und die Extreme tragen fast keine Information. Wenn 95 % oder mehr der Bewerbenden eine Frage richtig beantworten, trennt sie niemanden mehr: Starke und schwache Bewerbende kommen beide durch, das Item verlängert den Test also, ohne Signal beizutragen. Am Anfang eines Assessments kann es als Aufwärmfrage trotzdem seinen Platz haben, aber Messarbeit leistet es nicht.

Das entgegengesetzte Extrem ist gefährlicher. Wenn nur 20 % oder weniger richtig antworten, lautet der ehrliche erste Verdacht nicht, dass Ihre Bewerbenden schwach sind — sondern dass die Frage kaputt ist. Ein falsch hinterlegter Antwortschlüssel, ein mehrdeutiger Fragestamm, zwei vertretbare Optionen oder eine Aufgabe, die etwas prüft, das die Rolle nie braucht: All das drückt die Lösungsquote in den Keller. Eine wirklich schwere Frage, die ein Fünftel eines starken Feldes noch löst, ist legitim und wertvoll; eine Frage, die fast niemand löst, hat meist ein Problem, das Sie in einer Minute beheben können, sobald Sie nachsehen.

Die Schwierigkeit liest man also am besten als ein Paar Leitplanken, nicht als Zielwert. Sehr leichte Fragen kommen für die Ausmusterung oder eine neue Platzierung infrage; sehr schwere Fragen für eine Prüfung von Schlüssel und Formulierung. Alles dazwischen tut seine Arbeit und braucht Ihre Aufmerksamkeit nicht.

Trennschärfe: unterscheidet die Frage Stark von Schwach?

Die Trennschärfe ist das stärkere der beiden Signale und dasjenige, das Teams am häufigsten übersehen. Sie stellt eine einzige Frage: Neigen die Bewerbenden, die bei diesem Item gut abschneiden, auch dazu, im Assessment insgesamt gut abzuschneiden? Lautet die Antwort ja, zieht das Item in dieselbe Richtung wie der Rest des Tests — es trennt. Gibt es keinen Zusammenhang, misst das Item etwas anderes oder gar nichts, so vernünftig es sich auch liest.

Konkret ist die Trennschärfe der Zusammenhang zwischen dem Lösen eines einzelnen Items und dem Gesamtergebnis der bewerbenden Person. Hohe Werte bedeuten, dass starke Bewerbende es lösen und schwache es verfehlen — genau das, was Sie wollen. Ein Wert nahe null bedeutet, dass das Item Bewerbende überhaupt nicht sortiert. Ein negativer Wert ist der Alarm, auf den Sie sofort reagieren sollten: Er bedeutet, dass Ihre stärkeren Bewerbenden das Item eher falsch beantworten — der klassische Fingerabdruck eines falsch hinterlegten Antwortschlüssels oder eines Tricks, der ausgerechnet die Menschen bestraft, die den Stoff am tiefsten verstehen.

Eine verbreitete Faustregel behandelt eine Trennschärfe unter etwa 0,20 als schlecht — das Item trennt Stark und Schwach kaum noch und ist ein Fall für eine Überarbeitung. Aussagekräftig ist die Trennschärfe aber erst, wenn genügend Menschen geantwortet haben; bei drei Antworten ist sie Rauschen. Deshalb wartet ein verantwortungsvoller Hinweis auf eine Mindeststichprobe, bevor er der Zahl traut, und deshalb wird eine frische Frage nie nach ihren ersten paar Bewerbenden verurteilt.

Diese Signale werden verdient, nicht geraten

Die ehrliche Grenze der Itemanalyse ist, dass sie Ihnen an dem Tag, an dem Sie eine Frage schreiben, gar nichts sagen kann. Schwierigkeit und Trennschärfe sind Eigenschaften von Antworten, ein brandneues Item hat also überhaupt keinen Gesundheitswert, bis Bewerbende es oft genug beantwortet haben, um etwas Belastbares zu sagen. Das ist eine Eigenschaft, keine Lücke: Es hält die Signale an Nachweisen statt an Meinungen fest, und es schützt eine neue Frage davor, beurteilt zu werden, bevor sie einen fairen Lauf hatte.

Es bedeutet auch, dass Itemqualität eine Pflegegewohnheit ist und kein einmaliges Tor. Eine Bank, die vor einem Jahr sauber war, driftet, während sich die Rolle verändert, das Feld der Bewerbenden verschiebt und Fragen über Assessments hinweg wiederverwendet werden. Beobachtenswert sind die Fragen mit echter Nutzung und genügend Antworten, um ihnen zu trauen — praktisch also eine kleine, wechselnde Teilmenge der Bank statt des Ganzen. Sie prüfen nicht alles; Sie lesen die Handvoll Items, die die Daten markiert haben.

Wie SkillCort das sichtbar macht: der Hinweis „Needs attention“

SkillCort berechnet die Item-Gesundheit aus echten Antworten von Bewerbenden über jedes Assessment hinweg, in dem eine Frage vorkommt, und macht aus den beiden Signalen einen einzigen, schlichten Filter auf Ihrer Item-Bank: Needs attention. Ein Item landet dort, wenn die Daten eines von drei konkreten Problemen zeigen — geringe Trennschärfe, sobald mindestens fünf Menschen geantwortet haben, eine Schwierigkeit von 95 % oder darüber (sehr leicht) oder eine Schwierigkeit von 20 % oder darunter (sehr schwer). Nichts wird auf Verdacht markiert, und nichts wird markiert, bevor es die Antworten hat, die das rechtfertigen.

Jedes markierte Item trägt seine Begründung direkt daneben, als Chip neben der Frage: Low discrimination, Very easy oder Very hard, mit den zugrunde liegenden Zahlen beim Überfahren mit der Maus. Die Bank sagt Ihnen also nicht nur, dass eine Frage schwach ist — sie sagt Ihnen, warum, und genau das macht aus einer Warnung eine nächste Handlung. Eine Analyseansicht der Item-Bank fasst dieselben Signale über die gesamte Bank zusammen und ergänzt, welche Items genug Daten für ein Urteil haben und welche nie eingesetzt wurden, sodass Sie die Gesundheit Ihrer Messung auf einen Blick sehen statt Frage für Frage.

Die Gestaltungsregel hinter alldem ist dieselbe, die für den Rest der Plattform gilt: Das System zeigt das Signal und die Begründung, und ein Mensch entscheidet. SkillCort sagt Ihnen, dass eine Frage sehr schwer ist, und zeigt Ihnen, dass nur 12 % sie richtig beantwortet haben; es löscht die Frage nicht stillschweigend und setzt sich nicht über Ihr Urteil hinweg, ob diese Schwierigkeit ein Problem ist oder gerade der Punkt.

Was zu tun ist, wenn eine Frage markiert wird

Beginnen Sie beim Antwortschlüssel, besonders bei sehr schweren Items und solchen mit negativer Trennschärfe. Ein überraschender Anteil alarmierender Zahlen löst sich in dem Moment auf, in dem Sie die hinterlegte Antwort noch einmal lesen und merken, dass eine zweite Option ebenfalls richtig ist oder dass die vorgesehene Antwort falsch ist. Diese eine Prüfung repariert mehr markierte Items als jede Menge Umschreiben.

Stimmt der Schlüssel, lesen Sie das Item so, wie es eine verwirrte bewerbende Person läse. Sehr schwere Fragen und solche mit geringer Trennschärfe haben oft dieselbe Ursache: mehrdeutige Formulierung, zwei vertretbare Antworten oder ein Fragestamm, der leise etwas außerhalb der Fähigkeit prüft, die Sie messen wollten. Die Sprache so zu straffen, dass nur eine Lesart übrig bleibt, reicht meist, um die Zahlen zu bewegen. Sehr leichte Items sind der mildere Fall — behalten Sie sie als Aufwärmfragen, wenn sie diesem Zweck dienen, oder mustern Sie sie aus, damit das Assessment seine Zeit dort verbringt, wo tatsächlich gemessen wird.

Widerstehen Sie schließlich dem Impuls, auf kleine Stichproben überzureagieren. Eine Frage, die auf Basis einer Handvoll Antworten markiert wurde, ist eine Frage zum Beobachten, nicht zum Verurteilen; geben Sie ihr mehr Bewerbende, bevor Sie handeln. Itemqualität ist eine langsame, kumulative Lektüre, und das Ziel ist eine Bank, deren schwache Fragen bekannt und gemanagt sind — keine Bank, die von jeder unvollkommenen Zahl gesäubert wurde.

Das Wichtigste in Kürze

  • Die Qualität einer Frage steckt darin, wie Bewerbende sie beantworten, nicht darin, wie sie sich liest — zwei gleich sauber formulierte Fragen können sich völlig unterschiedlich verhalten.
  • Die Schwierigkeit ist ein Paar Leitplanken: sehr leichte Items (≥ 95 % richtig) tragen kein Signal bei; sehr schwere Items (≤ 20 % richtig) deuten meist auf einen falsch hinterlegten Antwortschlüssel oder eine mehrdeutige Frage hin.
  • Die Trennschärfe — ob starke Bewerbende das Item lösen und schwache es verfehlen — ist das schärfste Signal; unter ~0,20 ist sie schwach, und ein negativer Wert bedeutet fast immer einen falsch hinterlegten Antwortschlüssel.
  • Diese Kennzahlen werden aus echten Antworten verdient, deshalb haben neue Fragen keinen Gesundheitswert, bis genügend Bewerbende geantwortet haben; ein verantwortungsvoller Hinweis wartet auf eine Mindeststichprobe.
  • Der Filter „Needs attention“ in SkillCort zeigt markierte Items samt Begründung direkt in der Liste (Low discrimination / Very easy / Very hard) — das System zeigt das Signal, über die Korrektur entscheidet ein Mensch.

Häufig gestellte Fragen

Was ist ein guter Trennschärfewert für eine Assessment-Frage?
Als Faustregel gilt: Eine Trennschärfe über etwa 0,30 ist gesund, 0,20–0,30 ist grenzwertig, und unter 0,20 ist sie schwach und eine Überarbeitung wert. Ein negativer Wert ist der, auf den Sie sofort reagieren sollten — er bedeutet, dass stärkere Bewerbende das Item falsch beantworten, was meist auf einen falsch hinterlegten Antwortschlüssel oder einen irreführenden Fragestamm hindeutet.
Warum ist eine Frage, die fast alle richtig beantworten, ein Problem?
Weil sie Bewerbende nicht mehr trennt. Wenn 95 % oder mehr richtig antworten, kommen starke und schwache Bewerbende beide durch, das Item verlängert das Assessment also, ohne Information beizutragen. Solche Fragen können als Aufwärmfragen weiterhin funktionieren, aber sie messen nicht — und eine Bank voll davon erzeugt Bewertungen, die präzise aussehen und wenig unterscheiden.
Wie viele Antworten braucht ein Item, bevor ich seinen Kennzahlen traue?
Genug, dass die Zahlen kein Rauschen sind. Besonders die Trennschärfe ist bei einer Handvoll Antworten instabil; deshalb wartet SkillCort auf eine Mindeststichprobe — mindestens fünf Antworten —, bevor es geringe Trennschärfe markiert, und deshalb wird eine brandneue Frage nie nach ihren ersten paar Bewerbenden beurteilt. Die Schwierigkeit stabilisiert sich früher, verdient aber trotzdem eine bescheidene Stichprobe, bevor Sie handeln.
Bedeutet eine sehr schwere Frage, dass meine Bewerbenden schwach sind?
Selten. Wenn nur ein kleiner Teil richtig antwortet, sollte der erste Verdacht der Frage gelten, nicht dem Feld: Ein falsch hinterlegter Antwortschlüssel, ein mehrdeutiger Fragestamm oder zwei vertretbare Optionen drücken die Lösungsquote allesamt nach unten. Prüfen Sie zuerst Schlüssel und Formulierung; eine wirklich schwere Frage, die ein Fünftel der starken Bewerbenden noch löst, ist legitim und nützlich.
Kann ich mich darauf verlassen, dass KI schwache Fragen automatisch repariert?
KI kann beim Finden und Entwerfen helfen — indem sie Items markiert, die auffällig wirken, und klarere Formulierungen vorschlägt —, aber die Entscheidung, eine Frage zu ändern, zu behalten oder auszumustern, bleibt bei Ihnen. SkillCort zeigt das Signal und die Begründung; ein Mensch prüft den Antwortschlüssel und beurteilt, ob eine schwere Frage ein Mangel ist oder die beabsichtigte Herausforderung. Die Messentscheidung wird nie wegautomatisiert.

Für Recruiting-Teams

Die Gesundheit Ihrer Item-Bank auf einen Blick

SkillCort liest Schwierigkeit und Trennschärfe aus echten Antworten von Bewerbenden und markiert die Fragen, die einen Blick brauchen — mit der Begründung daneben, damit Sie wissen, was zu korrigieren ist. Buchen Sie eine Demo und sehen Sie die Itemanalytik und den Filter „Needs attention“ an einer echten Bank.