KI & Technologie · 9. Mär 2026

KI bewertet Kandidaten in Sekunden - aber wie gut ist dieses Urteil wirklich?

Microsoft Copilot, ChatGPT & Co. im Recruiting: Eine aktuelle Studie zeigt, warum KI-gestützte Persönlichkeitsbewertungen problematisch sind.

KI·3 Min.·Autor: Marcus Fischer

Microsoft Copilot, ChatGPT & Co. werden im Recruiting und Sourcing zunehmend eingesetzt. Lebenslauf hochladen, LinkedIn-Profil analysieren lassen, Persönlichkeit und Intelligenz einschätzen - fertig ist die „smarte Vorauswahl". Klingt effizient. Ist es das aber auch?

Eine aktuelle Studie von Tobias Marc Härtel im Journal of Business and Psychology hat genau das untersucht. 406 LinkedIn-Profile wurden von Microsoft Copilot analysiert. Die Personen dahinter hatten zuvor echte psychologische Tests durchgeführt. Man wusste also, wie ausgeprägt ihre Persönlichkeit und Intelligenz tatsächlich waren.

Das Ergebnis: Die KI lag nur sehr begrenzt richtig. Und teilweise deutlich daneben.

Erstes Problem: Die KI ist nicht stabil in der Beurteilung

Dasselbe Profil wurde zweimal bewertet. Teilweise kam fast dasselbe Ergebnis heraus. Teilweise aber auch nicht. Bei einigen Persönlichkeitsmerkmalen schwankten die Einschätzungen deutlich. Heisst übersetzt: Die Bewertung hängt spürbar davon ab, wie das Modell gerade „denkt". Für ein Tool, das über Einstellungen oder Absagen mitentscheiden soll, ist das schwierig.

Zweites Problem: Sie trifft die Realität nur mässig

Die entscheidende Frage ist: Wie stark stimmen die KI-Einschätzungen mit den tatsächlichen Testergebnissen überein?

  • Intelligenz: schwach positiv
  • Offenheit: schwach positiv
  • Extraversion: schwach positiv
  • Andere Merkmale: kaum oder gar nicht zutreffend

Die KI erkennt leichte Tendenzen. Aber sie erfasst keine belastbare Persönlichkeitsstruktur. Die Trefferquote liegt eher im Bereich „besser als raten", aber weit entfernt von „diagnostisch brauchbar".

Drittes Problem: Der „Alles-sieht-gut-aus"-Effekt

Ein spannender Befund: Die KI bewertet Menschen systematisch positiver. LinkedIn ist eine Selbstinszenierungsplattform. Und KI-Modelle sind darauf trainiert, positive, sozial erwünschte Muster zu erkennen. Das Ergebnis ist eine doppelte Verzerrung. Fast alle wirken „überdurchschnittlich gut". Für Recruiting ist das fatal. Denn die Auswahl lebt von Differenzierung.

Viertes Problem: Der Halo-Effekt in algorithmischer Form

Die Studie zeigt ausserdem: Die KI trennt Merkmale nicht sauber voneinander. Wer viele Stationen, internationale Erfahrung oder akademische Abschlüsse hat, wird insgesamt höher bewertet - über mehrere Eigenschaften hinweg. Ein positiver Eindruck färbt alles andere ein.

Fünftes Problem: Mehr Text = bessere Persönlichkeit?

  • Längere Profile → bessere Gesamtbewertung
  • Profile auf Englisch → tendenziell positiver bewertet
  • Viele Follower → höhere Extraversion

Das klingt weniger nach fundierter Persönlichkeitsanalyse und mehr nach Mustererkennung auf Oberflächenebene.

Sechstes Problem: Bias verschwindet nicht

Auch Unterschiede zwischen Geschlechtern und Altersgruppen wurden sichtbar. Wenn Unternehmen solche Systeme in der Vorauswahl nutzen, tragen sie die Verantwortung für die Wirkung - nicht der Softwareanbieter.

Was heisst das für die Praxis?

Die Studie sagt nicht: „KI im Recruiting ist Unsinn." Sie sagt: KI ist kein Ersatz für fundierte Eignungsdiagnostik - zumindest nicht in dieser Form.

Wo liegen die klaren Grenzen?

  • Keine verlässliche Persönlichkeitsdiagnose aus LinkedIn-Profilen
  • Hohe Verzerrungsanfälligkeit (Positivitätsbias, Halo-Effekte)
  • Geringe Differenzierung zwischen Kandidaten
  • Risiko systematischer Gruppenunterschiede
  • Fehlende Transparenz der Entscheidungslogik

Wo ist der sinnvolle Einsatz?

  • Strukturieren von Profilen
  • Zusammenfassungen erstellen
  • Matching auf harte Kriterien
  • Unterstützung bei Interviewfragen
  • Ergänzung - nicht Ersatz - menschlicher Bewertung

Der Kernpunkt

Recruiting ist keine Textanalyse-Aufgabe. Es ist ein Entscheidungsproblem mit realen Konsequenzen. LLMs sind hervorragend darin, Sprache zu verarbeiten. Aber Persönlichkeit ist mehr als ein sprachliches Muster.

Die Versuchung ist groß: schnell, günstig, skalierbar. Doch „AI-gestützt" bedeutet nicht automatisch „qualitätsgesichert". Wer Copilot & Co. zur Persönlichkeitsbewertung einsetzt, sollte wissen: Die wissenschaftliche Grundlage ist aktuell dünn. Und Bequemlichkeit ist kein Ersatz für Evidenz.

Quelle: Härtel, T. M. (2026). In the Blink of an AI: Exploring Large Language Models' Capability to Infer Traits From LinkedIn. Journal of Business and Psychology.