By Daniel Whitmore, MSc in Industrial and Organizational Psychology
Kurz gesagt
Ein KI-Interview ist ein strukturiertes Gespräch, das eine KI im Auftrag des Unternehmens führt: Sie stellt rollenrelevante Fragen, passt Nachfragen an, um die Antworten zu vertiefen, und hält den Austausch als Transkript fest. In einem begründbaren Aufbau ist dieses Transkript das Ergebnis — ein Nachweis, den eine benannte prüfende Person anhand einer Rubrik bewertet — und keine Blackbox-Zahl zur „Passung“. KI-Interviews bringen den größten Nutzen bei strukturiertem sprachlichem Denken, Kommunikation und situativem Urteilsvermögen; sie ersetzen keine praktische Arbeitsprobe, und sie sollten niemals Persönlichkeit oder Emotionen aus Gesicht oder Tonfall einer bewerbenden Person ableiten.
Was ein KI-Interview wirklich ist (und was nicht)
Nimmt man das Marketing weg, ist ein KI-Interview ein Gespräch mit Struktur. Ein KI-System stellt einer bewerbenden Person eine Reihe rollenrelevanter Fragen, hört oder liest die Antworten und stellt Nachfragen, um tiefer zu gehen — so wie es eine gute interviewende Person täte, wenn eine Antwort dünn bleibt oder eine Behauptung ein konkretes Beispiel braucht. Die bewerbende Person kann per Stimme oder schriftlich antworten. Heraus kommt eine Aufzeichnung dessen, was tatsächlich gesagt wurde: ein Transkript, verknüpft mit den Fragen, die es ausgelöst haben.
Diese Aufzeichnung ist der Punkt. In einem gut gebauten KI-Interview ist das Transkript das Ergebnis — ein Nachweis, den ein Mensch liest und anhand einer Rubrik bewertet. Die KI hat das Gespräch geführt, damit ein Mensch nicht jedes Erstgespräch terminieren und absitzen musste; entschieden hat sie nichts.
Dem gegenüber steht die Variante, die KI-Interviews ihren schlechten Ruf eingebracht hat: Systeme, die Gesichtsausdrücke, Mikrogesten oder Stimmlage analysieren und daraus Persönlichkeitsmerkmale oder einen „Culture Fit“-Wert ableiten. Dieser Ansatz hat eine schwache wissenschaftliche Grundlage und ein großes Fairness-Problem — er kann einen Akzent, eine flache Ausdrucksweise, eine schlechte Webcam oder eine Behinderung bestrafen, die mit der Arbeit nichts zu tun hat. Die nützliche Art von KI-Interview erzeugt Nachweise, die ein Mensch prüfen kann. Die schädliche Art erzeugt eine Zahl, die niemand vertreten kann. Alles Folgende setzt die erste Art voraus.
| KI-Interview, das Nachweise sammelt | Blackbox-„KI-Analyse“ |
|---|---|
| Stellt strukturierte, arbeitsrelevante Fragen | Bewertet Gesicht, Tonfall oder Wortwahl |
| Ergebnis ist ein Transkript, das ein Mensch liest | Ergebnis ist ein undurchsichtiger Merkmals- oder Passungswert |
| Eine benannte prüfende Person bewertet anhand einer Rubrik | Das Werkzeug sortiert oder filtert automatisch |
| Nachvollziehbar: Sie sehen, was gesagt wurde und warum es so bewertet wurde | Nicht nachvollziehbar: die Begründung bleibt verborgen |
Wie das Gespräch abläuft: erst Struktur, dann Nachfragen in festen Grenzen
Der mit Abstand größte Faktor dafür, ob ein Interview die spätere Arbeitsleistung vorhersagt, ist Struktur — dieselben Kernfragen, verknüpft mit den Kompetenzen, die die Rolle braucht, für alle gleich bewertet. Jahrzehnte der Forschung zur Personalauswahl weisen in dieselbe Richtung: Strukturierte Interviews schneiden deutlich besser ab als unstrukturierte, und die Struktur ist es, die die Arbeit leistet. Der eigentliche Vorteil eines KI-Interviewers ist, dass er diese Struktur konsistent anwendet. Er wird bei der zehnten bewerbenden Person nicht müde, driftet nicht in Smalltalk zum Beziehungsaufbau ab und stellt der Person mit dem starken Lebenslauf keine leichteren Fragen.
Struktur allein kann sich aber wie ein Formular anfühlen. Der Grund, KI statt eines starren Fragebogens zu nutzen, ist die angepasste Nachfrage: Gibt eine bewerbende Person auf eine situative Frage eine vage Antwort, fragt die KI nach der konkreten Handlung; erwähnt sie eine Entscheidung, fragt sie, was dabei abgewogen wurde. Gut gemacht, vertieft das dieselben Kompetenzen, ohne für jede Person zu einem anderen Interview zu werden.
Das Gestaltungsrisiko ist eine Nachfrage, die abschweift — weg von der Rolle, ins Persönliche oder in ein Detail, das begünstigt, wer redseliger ist. Deshalb müssen die Nachfragen begrenzt sein: In SkillCort bleiben die Nachfragen eines KI-Interviews innerhalb der Kompetenzkarte der Rolle. Das System geht dort tiefer, wo die Rolle es wirklich verlangt, und improvisiert sich nicht zu Fragen, die Sie einem Menschen nie genehmigen würden. Strukturiertes Rückgrat, angepasste Tiefe, feste Grenzen.
Wie KI-Interviews bewertet werden — und wie sie es sollten
Hier wird das meiste Vertrauen gewonnen oder verspielt. In einem begründbaren KI-Interview geht die Bewertung vom Transkript aus und richtet sich nach einer Rubrik, die ein Mensch geschrieben hat: Jede Kompetenz hat Beschreibungen, und jede Antwort wird daran gemessen. Die KI kann unterstützen — ein langes Transkript zusammenfassen, auf die Passage zeigen, an der eine bewerbende Person die Kundensicht anerkannt oder eine Abwägung getroffen hat, und sogar je Kompetenz einen an der Rubrik verankerten Bewertungsvorschlag entwerfen. Was sie nicht kann, ist entscheiden. Jede Kriteriumsbewertung bleibt offen, bis eine benannte prüfende Person sie bestätigt oder überschreibt — und Überschreiben ist genauso einfach wie Bestätigen.
Das wiegt bei Interviews schwerer als bei fast allem anderen, denn ein Gespräch ist genau die Art von reichhaltigem, mehrdeutigem Nachweis, bei dem ein Modell kompetent, aber nicht vollständig liest. Es kann übersehen, dass die „unpolierte“ Antwort einer bewerbenden Person genau das richtige Urteil beschrieben hat — oder dass eine flüssige Antwort nichts gesagt hat. Der Mensch, der das Transkript liest, bemerkt das — und trägt die Entscheidung.
Das Anti-Muster ist der verborgene „Interview-Wert“: eine einzelne Zahl, die das Werkzeug vergibt und weiterreicht, während das Transkript vergraben oder verworfen wird. Wenn Sie das Interview einer bewerbenden Person nicht öffnen, nicht nachlesen können, was gesagt wurde, und nicht sehen, welche Passage welche Kriteriumsbewertung verdient hat, dann haben Sie kein Assessment — Sie haben ein Urteil ohne Nachweis dahinter. Und keine bewerbende Person sollte einen KI-Interview-Wert von einem Unternehmen zum nächsten mitnehmen; jede Personalentscheidung steht für sich und wird an ihren eigenen Nachweisen gemessen.
Was ein KI-Interview messen kann und was nicht
KI-Interviews sind stark, wo der Nachweis sprachlich und strukturiert ist. Sie passen gut zu situativem Urteilsvermögen („Eine Kundin sagt X — was tun Sie und warum?“), zur Qualität der Kommunikation, zu Denkwegen, die man eine bewerbende Person durchgehen hören kann, und zu Rollenwissen, das mit Nachfragen geprüft wird. Für die Vorauswahl in großen Mengen — Kundenservice, Contact Center, Inside Sales — kann ein strukturiertes KI-Interview weit mehr vergleichbare Nachweise sammeln als ein hastiges Telefonscreening durch Menschen, und das ohne den Terminierungsengpass.
Schwach oder schlicht das falsche Werkzeug sind sie anderswo. Ein Interview bittet eine bewerbende Person, Arbeit zu beschreiben oder über sie nachzudenken; es bittet sie nicht, sie zu tun. Für alles Praktische — die tatsächliche Antwort an die verärgerte Kundin schreiben, das Ticket bearbeiten, die Sache bauen — schlägt eine Arbeitsprobe jedes Interview, weil sie das echte Ergebnis misst statt der Schilderung durch die bewerbende Person. Und kein KI-Interview sollte versuchen, Persönlichkeit, Emotion oder „Passung“ aus einem Gesicht oder einer Stimme zu lesen; das ist der diskreditierte Ansatz aus dem ersten Abschnitt, kein Zusatznutzen.
Die praktische Antwort lautet selten „Interview oder Arbeitsprobe“. Es ist beides, nacheinander: ein strukturiertes KI-Interview, um breite, vergleichbare Nachweise effizient zu sammeln, und danach eine Arbeitsprobe für die engere Auswahl, um zu sehen, wie die Arbeit tatsächlich getan wird. Das Interview zeigt Ihnen, wie jemand denkt und kommuniziert; die Arbeitsprobe zeigt Ihnen, was jemand tatsächlich hervorbringen kann.
Fairness, Verzerrung und die Rechtslage
KI beseitigt keine Verzerrung im Interview; sie verschiebt, wo Verzerrung entstehen kann und wie sichtbar sie ist. Die realen Risiken in einem KI-Interview, das Nachweise sammelt, sind konkret: eine Spracherkennung, die manche Akzente ungenauer transkribiert als andere, Fragen, die nicht wirklich arbeitsrelevant sind, und — am schlimmsten — eine automatische Bewertung, die Menschen aussortiert, ohne dass ein Mensch die Nachweise liest. Für jedes davon gibt es eine Gegenmaßnahme: arbeitsrelevante strukturierte Fragen, Transkripte, die ein Mensch prüft, und einen Bestätigen-oder-Überschreiben-Schritt bei jeder Bewertung, damit niemand von einer Maschine abgelehnt wird.
Die Regulierung läuft auf genau diese Disziplin hinaus. Das Local Law 144 von New York City verlangt eine unabhängige Bias-Prüfung automatisierter Werkzeuge für Beschäftigungsentscheidungen sowie einen Hinweis an Bewerbende vor dem Einsatz. Der Artificial Intelligence Video Interview Act in Illinois verlangt, Bewerbende zu informieren, die Funktionsweise der KI zu erklären, eine Einwilligung einzuholen und Aufzeichnungen auf Anfrage zu löschen. Der EU AI Act stuft KI im Recruiting als hochriskant ein, mit Pflichten zu menschlicher Aufsicht, Transparenz und Dokumentation. Die Einzelheiten unterscheiden sich je nach Rechtsraum und ändern sich mit der Zeit — nehmen Sie das als Orientierung, nicht als Rechtsberatung, und prüfen Sie die für Sie geltenden Regeln — aber die Richtung ist unmissverständlich: Hinweis, menschliche Aufsicht, Nachvollziehbarkeit.
Das Beruhigende daran ist, dass das rechtlich saubere und das wirksame Design dasselbe Design sind. Arbeitsrelevante strukturierte Fragen, ein vorzeigbares Transkript, eine Bewertung in menschlicher Hand und ein Prüfpfad machen ein KI-Interview zugleich fair vertretbar und gut darin, Leistung vorherzusagen. Ein Werkzeug, dessen Verkaufsargument lautet „unsere KI sortiert und filtert Bewerbende für Sie“, verkauft Ihnen genau die Architektur, gegen die sich das Recht bewegt — und diejenige, die der Frage einer bewerbenden Person oder einer Aufsichtsbehörde nach dem „Warum“ am wenigsten standhält.
Eine Checkliste für ein begründbares KI-Interview
Wenn Sie KI-Interviews einführen oder eines prüfen, das Sie bereits durchführen, sind dies die Fragen, die ein Nachweise sammelndes Interview von einer Blackbox trennen. Können Sie alle mit Ja beantworten, haben Sie ein Verfahren, hinter dem Sie stehen können.
- Strukturiertes Rückgrat: Bekommt jede bewerbende Person dieselben arbeitsrelevanten Kernfragen, bewertet an derselben Rubrik?
- Begrenzte Nachfragen: Bleiben angepasste Nachfragen innerhalb der Kompetenzen der Rolle, statt von der Rolle abzuschweifen?
- Transkript als Nachweis: Können Sie jedes Interview öffnen und genau nachlesen, was gesagt wurde?
- Bewertung in menschlicher Hand: Bestätigt oder überschreibt eine benannte prüfende Person jede Kriteriumsbewertung — und ist Überschreiben genauso einfach wie Annehmen?
- Keine Rückschlüsse aus Gesicht oder Stimme: Bewertet das System Antworten und niemals Mimik, Emotion oder „Passung“?
- Transparenz für Bewerbende: Wird Bewerbenden gesagt, dass eine KI sie interviewt, wie sie funktioniert und wie ihre Daten verarbeitet werden?
- Kombiniert mit einer Arbeitsprobe: Machen die Personen in der engeren Auswahl auch die tatsächliche Arbeit, statt sie nur zu beschreiben?
- Auf Wirkung geprüft: Prüfen Sie die Ergebnisse auf benachteiligende Wirkung zwischen Gruppen und korrigieren Sie Fragen, die dem nicht standhalten?
Das Wichtigste in Kürze
- Ein KI-Interview soll Nachweise sammeln — strukturierte Fragen, angepasste Nachfragen, ein Transkript, das ein Mensch bewertet — und nicht Gesicht oder Stimme einer bewerbenden Person auf einen verborgenen „Fit“-Wert hin analysieren.
- Struktur ist es, was ein Interview vorhersagekräftig macht; der eigentliche Wert eines KI-Interviewers liegt darin, diese Struktur konsistent anzuwenden — mit Nachfragen, die an die Rolle gebunden bleiben.
- Die Bewertung muss vom Transkript ausgehen und sich an einer von Menschen geschriebenen Rubrik orientieren, wobei eine benannte prüfende Person jede Kriteriumsbewertung bestätigt oder überschreibt.
- KI-Interviews messen sprachliches Denken und Kommunikation gut, können aber keine praktische Arbeitsprobe ersetzen — nutzen Sie beides, nacheinander.
- Fair by Design und rechtlich sauber by Design sind dasselbe Design: arbeitsrelevante Fragen, ein lesbares Transkript, Entscheidungen in menschlicher Hand und ein Prüfpfad (NYC LL144, Illinois AIVIA, EU AI Act).
Quellen und weiterführende Literatur
- Levashina, Hartwell, Morgeson & Campion (2014), "The Structured Employment Interview: Narrative and Quantitative Review of the Research Literature," Personnel Psychology
- McDaniel, Whetzel, Schmidt & Maurer (1994), "The Validity of Employment Interviews: A Comprehensive Review and Meta-Analysis," Journal of Applied Psychology
- Regulation (EU) 2024/1689 (EU AI Act) — Official Journal of the European Union
- NYC Local Law 144 — Automated Employment Decision Tools (NYC DCWP)
