Warum ist das Einstellen von Evaluation Sets bzw. Frage-Antwort-Pärchen vor dem Go-live wichtig?
Qualität vor Livegang prüfen
Mit 50 realistischen Testfragen und erwarteten Expertenantworten prüfst du, ob die KI fachlich korrekt, vollständig und im gewünschten Stil antwortet, bevor Kunden oder Mitarbeitende sie nutzen.Wissenslücken und Themenabdeckung erkennen
Der Vergleich zwischen KI-Antwort und Expertenantwort zeigt, ob alle relevanten Themenbereiche deiner Firma wirklich abgedeckt sind oder ob Daten, Prompts oder Trainingslogik noch Lücken haben.Risiken reduzieren und gezielt optimieren
Erst durch systematisches Testen erkennst du, wo die KI noch falsche, zu allgemeine oder unvollständige Antworten gibt, damit du vor dem Go-live gezielt nachschärfen kannst, statt Fehler erst im Echtbetrieb zu entdecken.
1. Navigiere zu AI Evaluation
Über die linke Seitennavigation gelangst du über den Eintrag “AI” — zu “AI Evaluation”

2. Erstelle Test-Fragen und Antworten
Einzelne Fragen und Antworten einfügen
Du klickst den Button “Add new Evaluation Set”
Du kannst in das linke Eingabefeld “Question Sample” eine Frage hinzufügen
Ins rechte Eingabefeld “Expert Answer” kannst du die von dir erwartete Antwort von der KI hinzufügen.
Als Letztes speicherst du dein Frage-Antwort-Pärchen über den blauen save Button
Einfluss der Expertenantwort
Die Expertenantwort hat KEINEN Einfluss auf die Antwortqualität der KI. Diese wird über Feedback und Prompt gesteuert.
Die Expertenantwort ist wichtig für euer Projektmanagement. Die Expertenantwort gibt das inhaltliche Ziel für die KI Antwort vor.
Indem die Expertenantwort erfasst wird, kann die KI unabhängig von Personen und abteilungsübergreifend verbessert werden, da das Ziel transparent ersichtlich ist.
Bedeutet: Person A hat Kapazitäten, die KI zu verbessern, Person B liefert jedoch die fachliche Expertise. So kann Person A auf das Ziel hinarbeiten.
💡 Du oder einer Deiner Arbeitskollegen sollten beim Trainieren der KI zwei Dinge gut kennen:
Die Art der Produktinhalte
Weißt Du, wie Deine Produkte, Eigenschaften oder Angebote in den PDFs oder Excel-Dateien beschrieben sind?
Sind es eher technische Begriffe, wie „Prozessor x6-1365U“, oder eher allgemeine Formulierungen, wie „sehr leistungsstark“?
Überlege, wie Deine Kunden derzeit oder später suchen und fragen werden:
Eher konkret („Hat der Laptop einen x6-1365U?“)
Oder eher frei („Welcher Laptop ist schnell und gut für Arbeit und Reisen?“)
Mehrere Fragen und Antworten auf einmal hinzufügen
Den Button “Add new Evaluation Set” betätigen
Fragen und Antworten aus einer Excel kopieren (ohne Überschriften oder leere Zeilen)
Nachdem die Zellen kopiert wurden, muss der Button/Link “Paste two columns from Excel” unterhalb der Eingabefelder betätigt werden
Das System zeigt dir alle deine kopierten Frage-Antwort-Pärchen auf einen Blick
Prüfe deine Einträge und scrolle bis zum Ende, um diese zu speichern

3. Initiale Qualität bewerten
Update all Audit Ratings
Die “Update all Audit Ratings” kann zum einen zum Erstellen der initialen KI-Antworten benutzt werden und zum anderen, um stets Abweichungen deiner KI-Antwort vom Idealzustand zu erkennen.
Als Erstes betätigst du den Button “Update All Audit Ratings”, oben rechts neben dem “Add new Evaluation set”
Nun kreiert das System automatisch zu all deinen Frage-Antwort-Pärchen die aktuelle KI Antwort
Du siehst, der Button “Generate AI Answer” verschwindet und wird durch die aktuelle KI Antwort ersetzt
Hinzu führt das System ebenfalls eine erste Bewertung der Antwortqualität durch. In der Spalte “Audit Rating” findest du nun einen Score von 1 (sehr gut) bis 4 (sehr schlecht)
Diese Bewertung basiert auf einem semantischen Abgleich der Expertenantwort zur derzeitigen KI-Antwort.
Sprich: Besitzt die aktuelle KI Antwort die gleichen Inhalte und vermittelt es die gleiche Bedeutung wie deine Expertenantwort.
Je nachdem, wie viele Frage-Antwort-Pärchen du besitzt, kann der komplette Prozess des Abgleichs einige Minuten dauern. Wie am Ladebalken beschrieben, passiert dies im Hintergrund und du musst nicht unbedingt auf der Seite verweilen.
Aufbau Evaluation Sets – Akkordeons öffnen für Details
Das Evaluation-Set ist wie folgt aufgebaut: Sieh dir dazu das unten stehende Video an, um einen Überblick zu erhalten.
Oberste Reihe:
Question Sample: Einblick in die von dir erzeugte Frage.
Expert Answer: Einblick in die von dir erzeugte Antwort, zugehörig zur Frage.
Linke Seite:
AI Answer: Zeigt dir die derzeitige KI Antwort
Reload AI Answer: Hier kannst du jederzeit deine KI Antwort neu laden
Answer Rating: Hier bewertest du als Experte, ob die derzeitige KI-Antwort 1 (sehr gut), 2 (gut), 3 (schlecht), 4 (sehr schlecht) ist
Audit Rating: Die bereits oben angesprochene automatische Bewertung. Dies kannst du über das kleine refresh Icon stets für ein einzelnes Evaluation Set durchführen
Comment: Wenn du eine KI-Antwort nicht verbessern kannst, du Hilfe von einem Kollegen zur Bewertung benötigst oder du weißt, dass Inhalte fehlen oder Prompt Anpassungen durchgeführt werden müssen, kannst du das hier hineinschreiben. Bei 50 bis 1000 Frage-Antwort-Pärchen verliert man schnell den Überblick, was noch zu tun war, um die KI Qualität zu erhöhen. Das Kommentarfeld hilft dir dabei. Wichtig: Das Kommentarfeld hat keinen Einfluss auf die Antwortqualität, es hilft dir dabei deine to dos zu strukturieren.
Rechte Seite:
Show Documents used: Die PDF Seiten, welche die KI als am relevantesten für deine Frage sieht.
Tabelle mit Infos zu den Dokumenten inklusive Feedback wird im nächsten Artikel beschrieben.
Search for additional documents: Hier kannst du Dokumente hinzufügen, wenn diese nicht aufgelistet sind.
Abschluss der Bewertung vom Evaluation Set
Nachdem du nun die KI-Antwort siehst und sogar siehst, welche Dokumente benutzt werden, um die Antwort zu generieren, gibst du eine Experten Bewertung von 1 bis 4 ab.
Das kannst du für alle Evaluations-Sets wiederholen, oder wenn die Frage schlecht beantwortet wird, gehst du sofort ins Feedback der Antwort rein und verbesserst, solange, bis du die Antwort als 1 bewertest, oder keinen Effekt vom Feedback mehr erkennst. (siehe verwandte Artikel)
Wenn du trotz des Feedbacks auf die Antwortqualität keinen Einfluss mehr hast, musst du vermutlich im Kommentarfeld hinterlassen, was noch fehlt. Hier gibt es vermutlich die folgenden Fehler:
Stil der Antwort ist nicht richtig: Prompt Anpassung (siehe verwandte Artikel)
Der KI fehlt Wissen: Produktdaten müssen erweitert werden (siehe verwandte Artikel)
Feedback-Button funktioniert nicht oder ist ausgegraut: Schaue für Hilfe ins Feedback FAQ (siehe verwandte Artikel)
Expertise zur Einschätzung der Antwortqualität fehlt
