Zum Inhalt springen
SkillCort

12. Juni 2026 · Aktualisiert am Jul 7, 2026 · 7 Min. LesezeitArbeitsprobendesign

Arbeitsprobenaufgaben gestalten, die Rückschlüsse auf die Leistung im Job erlauben

Am meisten darüber, wie jemand den Job machen wird, sagt es aus, diese Person einen Ausschnitt davon tatsächlich machen zu sehen. Doch eine Arbeitsprobe erhält diese Aussagekraft nur, wenn sie gut gestaltet ist: realistisch genug, um zu zählen, standardisiert genug, um zu vergleichen, kurz genug, um Bewerbende zu respektieren, und strukturiert genug, um sie zu bewerten. Hier ist eine wiederholbare Methode — eine, die Sie einmal bauen und nicht für jede Stelle neu.

Eine Frau an einem aufgeräumten Schreibtisch bearbeitet im Profil eine Aufgabe an ihrem Laptop

By Daniel Whitmore, MSc in Industrial and Organizational Psychology

Kurz gesagt

Eine Arbeitsprobenaufgabe ist ein kurzer, standardisierter Ausschnitt der echten Arbeit einer Rolle — ein eingehendes Ticket, eine Priorisierungsübung, ein schriftlicher Fall —, den alle Bewerbenden unter denselben Bedingungen bearbeiten. Sie erlaubt Rückschlüsse auf die Leistung im Job, weil sie den Job selbst misst statt eines Ersatzsignals dafür. Das Handwerk besteht darin, Arbeit zu wählen, die häufig, folgenreich und beobachtbar ist, und dann die Vorgaben so zu standardisieren, dass die Ergebnisse aller Bewerbenden vergleichbar und bewertbar sind.

Nehmen Sie eine Stichprobe der Arbeit, statt sie anzunähern

Die Forschung zur Personalauswahl weist seit Jahrzehnten in dieselbe Richtung: Assessments, die dem Job ähneln, erlauben bessere Rückschlüsse auf den Job als Assessments, die einem Quiz ähneln. Ein Produktwissenstest sagt Ihnen, was eine bewerbende Person im Support auswendig gelernt hat; ein simuliertes Ticket einer verärgerten Kundin sagt Ihnen, wie sie liest, was sie priorisiert und wie sie unter leichtem Druck schreibt. Das Erste ist Faktenwissen, das neue Mitarbeitende in der ersten Woche lernen. Das Zweite ist der Job.

Die Gestaltungsfrage lautet daher nicht „Welche Fragen sollen wir stellen?“, sondern „Welchen Ausschnitt der Arbeit sollen wir übergeben?“. Diese Umdeutung verändert alles Weitere — wie lange die Aufgabe dauert, welche Materialien Bewerbende brauchen, wie das Ergebnis aussieht und wie Prüfende es bewerten. Stimmt der Ausschnitt, ergibt sich der Rest der Gestaltung fast von selbst; stimmt er nicht, rettet ihn auch die klügste Bewertung nicht.

Den Ausschnitt wählen: häufig, folgenreich, beobachtbar

Gehen Sie von der tatsächlichen Arbeitslast der Rolle aus, nicht von dem, was sich leicht abfragen lässt. Listen Sie auf, womit die Person wirklich Stunden verbringen wird, und wählen Sie dann den Ausschnitt, in dem Unterschiede im Können am sichtbarsten und am teuersten sind. Im Kundenservice ist das selten „kennt die Rückgaberichtlinie“ — es ist das schriftliche Deeskalieren einer verärgerten Kundin, ohne dabei ungenau zu werden. Im Inside Sales ist es selten „kann BANT definieren“ — es ist der Umgang mit einem Preiseinwand oder die Nachfass-E-Mail, die einen ins Stocken geratenen Abschluss wiederbelebt.

Ein guter Ausschnitt besteht drei Prüfungen auf einmal. Er ist häufig, sodass Sie den Alltag des Jobs erfassen und keinen seltenen Sonderfall. Er ist folgenreich, sodass schwache Leistung wirklich schadet — eine verpatzte Eskalation, eine verlorene Verlängerung. Und er ist in einem Arbeitsergebnis beobachtbar: etwas, das die bewerbende Person hervorbringt und das eine prüfende Person lesen und bewerten kann, kein privater Denkprozess, den Sie erraten müssen.

  • Häufig: Die Person wird das wöchentlich tun, nicht einmal im Jahr.
  • Folgenreich: Es schlecht zu tun, hat sichtbare Kosten für Kundschaft oder Umsatz.
  • Beobachtbar: Es endet in einem Arbeitsergebnis — einer Antwort, einer E-Mail, einer sortierten Warteschlange, einem Gesprächsplan.
  • Erlernbar vs. auswählbar: Lassen Sie alles weg, was neue Mitarbeitende im Onboarding aufschnappen; prüfen Sie, was sie mitbringen müssen.

Realismus vs. Standardisierung: fiktives Unternehmen, echte Arbeit

Realismus und Standardisierung ziehen in entgegengesetzte Richtungen, und das Handwerk besteht darin, beides zu halten. Voller Realismus — Ihr echtes Produkt, laufende Tickets — macht die Aufgabe unwiederholbar und lässt vertraulichen Kontext abfließen. Volle Standardisierung — abstrakte Rätsel — wirft genau die Jobnähe weg, die die Arbeitsprobe erst lohnend gemacht hat. Die Auflösung ist ein fiktives, aber plausibles Setting: ein erfundenes Unternehmen mit einem einfachen Produkt, einem kurzen Richtlinienblatt und Szenarien, die sich auf Ihre echten reimen.

Die fiktive Hülle ist ein Vorteil, kein Kompromiss. Sie stellt alle Bewerbenden unabhängig von ihrer Branchenherkunft auf dieselbe Ausgangslage: Der Profi vom Wettbewerber und die Quereinsteigerin lesen dasselbe zweiseitige Briefing, sodass Sie Urteilsvermögen und Kommunikation messen und nicht angesammeltes Insiderwissen. Außerdem macht sie die Aufgabe über Stellen und Kunden hinweg wiederverwendbar, ohne dass jemand Antworten aus einer früheren Runde einstudiert.

Halten Sie die Vorgaben bewusst knapp. Wenn Bewerbende fünfzehn Seiten Kontext brauchen, bevor sie die Aufgabe angehen können, prüfen Sie Lesedurchhaltevermögen und freie Zeit, nicht die gemeinte Fähigkeit. Eine glaubwürdige Kundennachricht, ein Richtlinienauszug, eine kurze Produktbeschreibung — genug Kontext, damit sich das Szenario echt anfühlt, und wenig genug, damit die eigentliche Arbeit in den ersten Minuten beginnt.

Zeitbegrenzung: verhältnismäßig zur Rolle, ehrlich mit der Uhr

Eine Arbeitsprobe sollte einen nennenswerten Teil einer Stunde beanspruchen, kein Wochenende. Für Support- und Inside-Sales-Rollen reichen zwanzig bis fünfundvierzig konzentrierte Minuten meist aus, um Urteilsvermögen, Ton und Klarheit über zwei oder drei zusammenhängende Übungen hinweg zu sehen. Längere Aufgaben liefern kein entsprechend stärkeres Signal; sie filtern danach, wer freie Abende hat, was Ihren Bewerbendenpool still gegen Berufstätige und Sorgearbeitende verzerrt.

Seien Sie ehrlich darüber, was die Uhr misst. Wenn der echte Job darin besteht, durchdachte Antworten mit Nachschlagematerial zur Hand zu verfassen, fügt ein gnadenloser Countdown Rauschen hinzu, keinen Realismus. Wenn der Job Tempo tatsächlich belohnt — eine Live-Chat-Warteschlange —, dann gehört maßvoller Zeitdruck zum Gemessenen dazu. Setzen Sie das Limit aus der Arbeit heraus, sagen Sie Bewerbenden genau, was sie erwartet, und geben Sie allen dieselben Bedingungen. Zeitfallen, die Bewerbende überraschen, erzeugen Daten über Anspannung, nicht über Können.

Bedenken wegen unbezahlter Arbeit vermeiden

Bewerbende sind zu Recht misstrauisch gegenüber „Assessments“, die wie unbezahlte Beratung aussehen: unseren echten Funnel auditieren, eine Kampagne entwerfen, die wir ausspielen könnten. Neben der ethischen Frage sind solche Aufgaben schlechte Messungen — alle Bewerbenden bearbeiten ein anderes echtes Problem, sodass nichts vergleichbar ist. Die Gestaltung mit fiktivem Unternehmen löst beide Probleme auf einmal: Keine Abgabe lässt sich kommerziell verwerten, und alle beantworten dasselbe Briefing.

Machen Sie Ihre Absicht ausdrücklich deutlich. Sagen Sie Bewerbenden, dass das Szenario erfunden ist, dass die Arbeit ausschließlich zur Bewertung verwendet wird und wie sie ungefähr bewertet wird. Halten Sie den Umfang sichtbar begrenzt — eine Antwort und eine kurze Begründung, kein Strategiedeck. Eine Aufgabe, die Bewerbende respektiert, ist nicht nur freundlicher; sie schützt Abschlussquoten und Ihre Arbeitgebermarke, und sie hält die stärksten Bewerbenden, die die meisten Optionen haben, in Ihrem Prozess.

  • Verorten Sie jede Aufgabe in einem fiktiven Unternehmen, damit keine Abgabe kommerziellen Wert hat.
  • Sagen Sie klar, dass Antworten nur zur Bewertung genutzt und nie produktiv eingesetzt werden.
  • Begrenzen Sie das Ergebnis: eine Antwort, eine E-Mail, eine Sortierung — kein offenes Projekt.
  • Bitten Sie Bewerbende nie, an Ihrer echten Kundschaft, echten Abschlüssen oder echten Inhalten zu arbeiten.

Das Ergebnis bewertbar machen

Eine Arbeitsprobe gelingt oder scheitert im Moment der Bewertung. Gestalten Sie die Aufgabe und ihre Rubrik gemeinsam: Schreiben Sie für jede Kompetenz, die der Ausschnitt sichtbar machen soll, in konkreten, beobachtbaren Worten auf, wie stark, akzeptabel und schwach aussehen — bevor die erste bewerbende Person antwortet. „Hat die Verärgerung der Kundin anerkannt, bevor eine Lösung vorgeschlagen wurde“ ist bewertbar; „gute Kommunikation“ ist eine Stimmung.

Ziehen Sie bei Urteilsaufgaben die abgestufte Bewertung dem Bestanden/Nicht-bestanden vor. Die meisten realistischen Szenarien haben eine beste Antwort, eine vertretbare und eine schwache — eine Rubrik, die nur richtig und falsch kennt, löscht genau die Unterscheidung aus, auf die es Ihren Hiring Managern ankommt. Und begrenzen Sie das Ausgabeformat gerade so weit, dass sich vergleichen lässt: eine Antwort aus wenigen Sätzen plus eine einzeilige Begründung lässt sich leicht nebeneinanderlegen; ein freier Aufsatz nicht.

Die KI verdient sich hier ihren Platz als Entscheidungsunterstützung: Sie fasst längere Antworten zusammen, ordnet eine Antwort den Rubrikkompetenzen zu und entwirft erste Notizen, die die prüfende Person bestätigt. Was sie nie tut, ist eigenständig bewerten und ablehnen. Jede vergebene Stufe verantwortet die prüfende Person — das ist es, was das Ergebnis gegenüber Ihrem Panel und gegenüber der bewerbenden Person erklärbar hält.

Einmal bauen, über Stellen hinweg wiederverwenden

Das letzte Gestaltungsziel ist Wiederverwendung. Wenn jede neue Stelle bedeutet, eine Aufgabe von Grund auf zu erfinden, erodiert die Qualität unter Termindruck, und die Maßstäbe driften zwischen Hiring Managern auseinander. Verankern Sie Aufgaben stattdessen in einem Rollenprofil — den benannten Kompetenzen, die eine Rollenfamilie braucht — und parametrisieren Sie die Oberflächendetails. Das Deeskalationsszenario für den Support und die E-Mail zur Einwandbehandlung für den Inside Sales bleiben strukturell identisch; das fiktive Produkt, die Kundschaft und die Richtliniendetails rotieren.

Wiederverwendung ist auch das, was Nachweise über die Zeit vergleichbar macht. Wenn die Support-Bewerbenden dieses Quartals dieselbe strukturelle Aufgabe bearbeiten wie die des letzten, bedeuten Bewertungen dasselbe, die Kalibrierung trägt weiter, und Ihre Entscheidungsakten lassen sich über Kohorten hinweg vergleichen. Eine gut gestaltete Arbeitsprobe ist kein einmaliger Screening-Trick; sie ist ein Instrument, das Ihr Team pflegt, versioniert und dem es vertraut.

Das Wichtigste in Kürze

  • Wählen Sie den Ausschnitt der Arbeit, der häufig und folgenreich ist und in einem bewertbaren Arbeitsergebnis endet — und lassen Sie alles weg, was das Onboarding ohnehin beibringt.
  • Lösen Sie das Spannungsfeld zwischen Realismus und Standardisierung mit einem fiktiven, aber plausiblen Unternehmen: echte Arbeit, gleiche Ausgangslage, kein Risiko für Vertraulichkeit oder unbezahlte Arbeit.
  • Begrenzen Sie die Zeit verhältnismäßig — für Support- und Inside-Sales-Rollen etwa 20–45 konzentrierte Minuten — und lassen Sie die Arbeit die Uhr stellen, nicht die Dramaturgie.
  • Schreiben Sie die Rubrik zusammen mit der Aufgabe, mit konkreten Stufenbeschreibungen und abgestufter Bewertung; die KI fasst zusammen und ordnet zu, jede Bewertung vergeben Menschen.
  • Verankern Sie Aufgaben in einem Rollenprofil, damit Sie einmal bauen und über Stellen hinweg wiederverwenden — und Bewertungen über Kohorten hinweg vergleichbar bleiben.

Häufig gestellte Fragen

Wie lange sollte eine Arbeitsprobenaufgabe dauern?
Für die meisten Support- und Inside-Sales-Rollen reichen zwanzig bis fünfundvierzig konzentrierte Minuten über zwei oder drei zusammenhängende Übungen aus, um Urteilsvermögen, Ton und Klarheit zu sehen. Längere Aufgaben filtern vor allem nach freier Zeit statt nach Können, und sie stoßen Berufstätige und Sorgearbeitende ab — oft Ihre stärksten Bewerbenden.
Wie machen wir eine Arbeitsprobe realistisch, ohne vertrauliche Informationen preiszugeben?
Verorten Sie sie in einem fiktiven, aber plausiblen Unternehmen: ein erfundenes Produkt, ein kurzes Richtlinienblatt und Szenarien, die die Struktur Ihrer echten Arbeit spiegeln. Bewerbende tun dieselbe Art von Arbeit wie im Job, aber auf identischen, teilbaren Materialien, die nichts preisgeben und niemandes Branchenherkunft bevorzugen.
Wie vermeiden wir, dass sich die Aufgabe für Bewerbende wie unbezahlte Arbeit anfühlt?
Nutzen Sie fiktive Szenarien, damit keine Abgabe kommerziellen Wert hat, sagen Sie ausdrücklich, dass Antworten nur zur Bewertung verwendet werden, und halten Sie das Ergebnis eng begrenzt — eine Antwort und eine kurze Begründung, kein Projekt. Bitten Sie Bewerbende nie, an Ihrer echten Kundschaft, echten Abschlüssen oder echten Inhalten zu arbeiten.
Kann die KI die Arbeitsprobe für uns bewerten?
Die KI kann die Bewertung unterstützen — Antworten zusammenfassen, Antworten den Rubrikkompetenzen zuordnen und erste Notizen entwerfen —, doch jede Bewertung vergibt eine prüfende Person, und jede Entscheidung trifft sie. Das hält das Assessment gegenüber Bewerbenden erklärbar und gegenüber Ihrem eigenen Panel vertretbar.
Brauchen wir für jede offene Stelle eine neue Aufgabe?
Nein. Verankern Sie Aufgaben in einem Rollenprofil aus benannten Kompetenzen und rotieren Sie dann die Oberflächendetails — das fiktive Produkt, die Kundschaft und die Richtlinie. Die Struktur bleibt konstant, sodass die Kalibrierung weiterträgt und Bewertungen über Stellen und Kohorten hinweg vergleichbar bleiben.

Für Recruiting-Teams

Machen Sie aus einer Ihrer Rollen eine Arbeitsprobe

Bringen Sie eine Support- oder Vertriebsstelle in eine 30-minütige Demo mit; wir bilden sie auf ein Rollenprofil ab, zeigen eine echte Arbeitsprobenaufgabe und gehen die Rubrik und die Entscheidungsakte durch, die dabei entstehen.

Arbeitsproben gestalten, die die echte Arbeit abbilden | SkillCort