Methodik

Wie aus einem Gespräch eine Auswertung wird

Nach jedem Übungsgespräch bekommst du eine Rückmeldung: eine Einschätzung zu jeder Kompetenz, eine Bewertung der Ziele des Szenarios und konkrete Hinweise, belegt mit Stellen aus deinem eigenen Gespräch. Diese Seite erklärt, wie das entsteht, warum es so aufgebaut ist und wo die Grenzen liegen.

1 · Im Gespräch

Die KI spielt dein Gegenüber

Ihr sprecht miteinander.

Protokoll

2 · Danach

Eine zweite KI wertet aus

Sie bewertet jedes Ziel und jede Kompetenz einzeln.

Einzelwerte

3 · Dein Ergebnis

Das System rechnet die Note aus

Immer gleich gewichtet.

Zwei getrennte KIs — die eine spricht mit dir, die andere kennt das Gespräch nur als Protokoll.

01

Wer mitspielt, bewertet nicht

Rollenspiel und Auswertung sind zwei verschiedene Systeme.

Im Gespräch übernimmt eine KI die Rolle deines Gegenübers. Danach liest eine zweite, davon unabhängige KI das Gesprächsprotokoll und bewertet es. Die KI, die mitgespielt hat, bewertet das Gespräch also nicht selbst.

Die auswertende KI darf keine Gesamtnote vergeben. Sie bewertet jedes Ziel und jede Kompetenz einzeln. Die Gesamtnote rechnet danach das System aus, nach einer Gewichtung, die bei jedem Gespräch dieselbe ist.

Warum das wichtig ist

Wer ein Gespräch selbst geführt hat, bewertet es nicht neutral — das gilt für Menschen wie für Sprachmodelle. Die Trennung sorgt dafür, dass die Auswertung nicht die eigene Leistung im Rollenspiel mitbeurteilt.

02

Woran die Auswertung misst

Der Maßstab steht fest, bevor das Gespräch beginnt.

Die KI denkt sich ihre Maßstäbe nicht selbst aus. Was in einem Szenario erreicht werden soll und woran das erkennbar ist, wird beim Erstellen des Szenarios festgelegt — von Menschen, vor dem Gespräch. Danach bleibt es unverändert.

Das bekommt die auswertende KI

  • Das Protokoll des Gesprächs
  • Die Ziele des Szenarios, mit ihrer Gewichtung
  • Zu jedem Ziel die Anweisung, woran es als erreicht gilt
  • Die Kompetenzen des Trainingsbereichs mit ihren vier Stufen
  • Die Ausgangslage und die Beschreibung der Figur, mit der gesprochen wurde

Das bekommt sie nicht

  • Die Tonaufnahme — ausgewertet wird nur der Text
  • Frühere Gespräche oder Ergebnisse derselben Person
  • Angaben zu Rolle, Abteilung oder Betriebszugehörigkeit
  • Die Befugnis, eine Gesamtnote zu vergeben

Zwei kleine Regeln gehören noch dazu: Der erste Satz kommt von der KI, nicht von dir — er wird deshalb nicht mitbewertet. Und Stellen, an denen die Spracherkennung offensichtlich etwas falsch verstanden hat, bleiben außen vor.

03

Woraus sich deine Note zusammensetzt

Aus zwei Teilen: ob du erreicht hast, worum es ging — und wie du das Gespräch geführt hast.

70 %

Ziele dieses Szenarios

30 %

Kompetenzen

Für jedes Szenario eigens festgelegt: die Situation, was als erreicht gilt und wie stark es zählt.

Fester Satz je Trainingsbereich.

Jeder einzelne Wert auf derselben Skala

  • 8–10

    sicher gezeigt

  • 6–7

    erkennbar, nicht durchgängig

  • 4–5

    ansatzweise

  • 0–3

    kaum gezeigt

Die Kompetenzen hängen vom Trainingsbereich ab — was in einer Verhandlung zählt, ist etwas anderes als in einem Führungsgespräch.

04

Verhalten beschreiben statt Noten vergeben

Eine Stufe, die nur „gut“ heißt, versteht jeder anders.

Steht dagegen konkret beschrieben, welches Verhalten gemeint ist, hat jeder denselben Bezugspunkt. Der Spielraum für Auslegung wird kleiner.

Deshalb ist bei uns jede Kompetenz über vier ausformulierte Stufen beschrieben. Bewertet wird nicht, wie jemand ist, sondern was in dieser Situation zu sehen war. Zwei Beispiele aus unterschiedlichen Trainingsbereichen:

Beispiel 1 · Führung · „Aktives Zuhören“

  1. 8–10 Fragt gezielt nach und gibt in eigenen Worten wieder, was ankam.

    Greift Gesagtes später wieder auf. Das Gegenüber fühlt sich verstanden.

  2. 6–7 Hört zu und fragt nach, aber nicht durchgängig.

    Einzelne Signale des Gegenübers bleiben unaufgegriffen.

  3. 4–5 Stellt Fragen, hört die Antwort aber kaum aus.

    Das eigene Anliegen bestimmt den Verlauf.

  4. 0–3 Redet über weite Strecken allein oder unterbricht.

    Es entsteht kein Dialog.

Beispiel 2 · Vertrieb · „Umgang mit Einwänden“

  1. 8–10 Nimmt den Einwand auf und fragt nach dem Grund dahinter.

    Geht dann gezielt darauf ein. Das Gespräch läuft weiter.

  2. 6–7 Geht auf den Einwand ein, bleibt aber an der Oberfläche.

    Der eigentliche Grund bleibt ungeklärt.

  3. 4–5 Rechtfertigt sich oder wiederholt das eigene Argument.

    Der Einwand steht danach unverändert im Raum.

  4. 0–3 Übergeht den Einwand oder gibt sofort nach.

    Über die Sache wird gar nicht gesprochen.

Beispielhafte Darstellung. Für jeden Trainingsbereich sind eigene Kompetenzen mit eigenen Stufen ausgearbeitet — und alle lassen sich an euer Unternehmen anpassen.

So sieht eine Rückmeldung dann aus

Jede Einschätzung wird an einer Stelle aus dem Gespräch festgemacht. Damit lässt sich nachvollziehen, worauf sie sich bezieht — und im Zweifel auch widersprechen.

Aktives Zuhören

6 von 10

Stelle aus deinem Gespräch

„Verstehe. Lass uns trotzdem beim Freitag bleiben, ich brauche die Zahlen bis dahin.“

Zwei Sätze vorher hatte dein Gegenüber gesagt, dass gerade mehrere Dinge gleichzeitig laufen. Du hast es gehört und bestätigt, bist danach aber direkt zu deinem Termin zurückgekehrt. Eine kurze Nachfrage hätte gereicht, um zu erfahren, woran es tatsächlich hängt — und ob der Freitag realistisch ist.

Beispiel, nachgebaut aus einem Führungsszenario. Zitate stammen immer aus dem eigenen Gespräch; erfundene Belege sind der auswertenden KI untersagt.

05

Vier Entscheidungen und ihre Grundlage

Jede davon haben wir bewusst getroffen — keine ist ein Nebeneffekt der Technik.

Verhalten statt Person

Jede Rückmeldung hängt an einer konkreten Stelle deines Gesprächs und beschreibt, was dort passiert ist — nicht, wie du bist.

Feedback wirkt, solange die Aufmerksamkeit bei der Aufgabe bleibt. Wandert sie zur Person, lässt die Wirkung nach. In einem Drittel der untersuchten Fälle hat Feedback die Leistung sogar verschlechtert.

Kluger & DeNisi, 1996

Beschriebene Stufen

Vier ausformulierte Stufen je Kompetenz statt abstrakter Noten. In jeder steht, was zu sehen war.

Skalen, die über beobachtbares Verhalten definiert sind, geben allen Beurteilenden denselben Bezugspunkt.

Smith & Kendall, 1963

Konkrete Situationen

Jedes Szenario hat eigene Ziele: eine konkrete Lage, an der klar ist, was als erreicht gilt. Jedes Ziel wird einzeln gewichtet und einzeln bewertet.

Bewertet wird an konkreten Situationen aus dem Arbeitsalltag, nicht an allgemeinen Eigenschaften.

Flanagan, 1954

Die Gesamtnote rechnet das System

Die auswertende KI vergibt Einzelwerte, aber keine Gesamtnote. Die Gewichtung ist im System festgelegt.

So ist jederzeit nachvollziehbar, wie eine Note zustande kommt — und sie kommt über alle Gespräche, Gruppen und Zeiträume gleich zustande.

Designentscheidung

Regeln, die immer gelten

Vier Festlegungen sorgen dafür, dass eine Bewertung nicht kippt — weder ins Gnadenlose noch ins Beliebige.

  • 3 Punkte

    Höchstabzug für ungünstige Gesprächsmuster — etwa zu früh nachgeben, persönlich statt sachlich werden oder ohne verbindliches Ergebnis aus dem Gespräch gehen. Mehr verliert ein Gespräch nie.

  • 3 Redebeiträge

    So viele verständliche Beiträge braucht es mindestens. Darunter gibt es gar keine Note: Eine Bewertung auf dünner Grundlage ist schlechter als keine.

  • 70/30

    Die Ziele des Szenarios zählen 70 Prozent, die Kompetenzen 30. Die KI kann daran nichts ändern — deshalb sind Auswertungen untereinander vergleichbar.

  • 2 KIs

    Eine spricht mit dir, die andere wertet aus. Wer mitgespielt hat, beurteilt die Szene nicht.

Eine Rückmeldung, die nach einem Fehler nur noch das Scheitern zeigt, sagt niemandem mehr, was beim nächsten Mal anders gehen könnte.

06

Anpassung an euer Unternehmen

Eigene Leitfäden und Modelle lassen sich hinterlegen.

Arbeitet ihr mit einem eigenen Gesprächsleitfaden, Führungsleitbild oder Kompetenzmodell? Dann hinterlegen wir es nach Absprache in der Auswertung. Die Teilnehmenden bekommen ihre Rückmeldung dann in eurer Sprache und an euren Maßstäben statt an allgemeinen.

Das bringt ihr mit

  • Euer Führungsleitbild

    oder Kompetenzmodell

  • Euer Gesprächsleitfaden

    falls ihr mit einem arbeitet

  • Echte Situationen

    aus dem Alltag eurer Teams

Das richten wir damit ein

  • Die Kompetenzen tragen eure Begriffe

    Formuliert so, wie bei euch über Gespräche geredet wird.

  • Jedes Szenario bekommt eigene Ziele

    Aus Situationen, die bei euch wirklich vorkommen.

  • Euer Modell wird zum Maßstab

    Bewertet wird entlang eures Rasters, nicht eines fremden.

  • Tonfall und Grenzen passen zu euch

    Ihr liefert Material und Begriffe. Das Einrichten übernehmen wir.

Für euch bleibt es bei einem Abstimmungstermin und dem Material, das ihr ohnehin habt. Das Einrichten ist unsere Arbeit.

Bringt ihr nichts Eigenes mit, ist das ebenso in Ordnung. Die Szenarien arbeiten von Haus aus ohne ein bestimmtes Modell.

Eine Ausnahme ist das Verhandlungstraining. Dort gehören Begriffe wie beste Alternative, Ankern und Gegenleistung fest zu den Kompetenzen — ohne sie lässt sich eine Verhandlung nicht sinnvoll bewerten.

Nicht anpassbar ist die Gewichtung von 70 zu 30. Das ist Absicht: Nur so bleiben Auswertungen über Teams und über Monate hinweg vergleichbar.

07

Grenzen des Systems

Vier Dinge, die eine Auswertung nicht leisten kann.

Wir nennen sie, weil sie für die Einordnung wichtiger sind als jede Stärke, die wir aufzählen könnten.

  • Keine Eignungsdiagnostik.

    Die Bewertung ist kein Test und taugt nicht als Grundlage für Personalentscheidungen. Sie ist ein Trainingsinstrument.

  • Kein geprüfter Abgleich mit menschlichen Bewertern.

    Unsere Skala ist nach dem Prinzip der verhaltensverankerten Beurteilung aufgebaut. Wie stark sie mit der Einschätzung erfahrener Trainerinnen und Trainer übereinstimmt, haben wir bisher nicht gemessen.

  • Keine Auswertung einzelner Personen für Vorgesetzte.

    Das Ergebnis gehört der Person, die geübt hat. Nach oben berichtet wird ausschließlich auf Gruppenebene.

  • Kein Ergebnis, das sich wortgleich wiederholt.

    Die Auswertung läuft mit sehr geringer Zufälligkeit und in festem Format. Dasselbe Gespräch zweimal ausgewertet ergibt dieselbe Einordnung, aber nicht Wort für Wort denselben Text.

Was sich überprüfen lässt

Den zweiten Punkt könnt ihr im laufenden Betrieb prüfen: Zwei erfahrene Personen bewerten eine Stichprobe von Gesprächsprotokollen nach denselben Stufen, ohne die Werte des Systems zu kennen. Der Vergleich zeigt, wo beide Einschätzungen auseinandergehen. Der Aufwand liegt bei etwa einem Tag, und am Ende steht eine belastbare Zahl statt einer Annahme. Sprecht uns an, wenn ihr das für euer Programm einplanen wollt.

Quellen

  1. Smith & Kendall (1963)

    Retranslation of expectations: An approach to the construction of unambiguous anchors for rating scales.

    Journal of Applied Psychology, 47(2), 149–155.

    Grundlagenarbeit zu verhaltensverankerten Bewertungsskalen. Die Befundlage zur Verringerung von Bewertungsverzerrungen ist positiv, aber nicht durchgängig.

  2. Kluger & DeNisi (1996)

    The effects of feedback interventions on performance.

    Psychological Bulletin, 119(2), 254–284.

    Metaanalyse über 607 Effektstärken. Feedback verbessert die Leistung im Mittel, verschlechtert sie aber in über einem Drittel der untersuchten Fälle.

  3. Flanagan (1954)

    The critical incident technique.

    Psychological Bulletin, 51(4), 327–358.

    Methodik zur Ableitung von Beurteilungskriterien aus konkreten beruflichen Situationen.

Fragen zur Methodik? Wir beantworten sie gern im Detail — auch gegenüber Betriebsrat, Datenschutz oder Fachabteilung.

Careertrainer.ai[email protected]Stand: September 2026