Zum Hauptinhalt springen

Auswertung & Evaluation mit G-Eval

Wie zuverlässig beantwortet ein Chatbot die Fragen seiner Nutzer:innen? Gerade in sensiblen Bereichen wie Gesundheit und Pflege ist diese Frage zentral. Für die Qualitätsprüfung der mit Buddy erstellten Chatbots nutzen wir das G-Eval-Verfahren. Dabei prüft eine zweite KI automatisiert, wie korrekt der Chatbot die Fragen beantwortet.

Was ist G-Eval?

G-Eval ist ein Verfahren, bei dem eine KI die Antworten eines Chatbots bewertet. Der Chatbot wird mit einem festgelegten Fragenkatalog geprüft, und die Qualität seiner Antworten wird systematisch, nachvollziehbar und wiederholbar erfasst. So lässt sich objektiv messen, wie gut ein Chatbot sein Fachgebiet beherrscht, und zwar nicht nur einmalig, sondern auch nach jeder Anpassung.

So funktioniert die Evaluation mit Buddy

Schritt 1: Fragenkatalog hinterlegen
Im Buddy-System wird ein Fragenkatalog hinterlegt. Er enthält X Fragen, die der Chatbot beantworten können soll, jeweils mit der dazugehörigen Musterantwort. Die Musterantworten werden fachlich abgestimmt und dienen später als Maßstab.

Schritt 2: Automatisierte Prüfung
Der Fragenkatalog wird dem Chatbot automatisiert zur Prüfung vorgelegt. Der Chatbot beantwortet jede Frage so, wie er es auch im regulären Einsatz tun würde.

Schritt 3: Bewertung durch eine zweite KI
Eine zweite KI vergleicht die Antworten des Chatbots mit den hinterlegten Musterantworten. Sie gibt für jede Frage eine Einschätzung ab, wie korrekt sie beantwortet wurde.

Schritt 4: Auswertung
Die Einschätzungen liefern ein klares Bild der Antwortqualität. So wird sichtbar, in welchen Themenbereichen der Chatbot sicher antwortet und wo Wissensquellen oder Einstellungen nachgeschärft werden sollten.

Ihre Vorteile

  • Objektive Qualitätsmessung: Die Antwortqualität wird anhand fachlich abgestimmter Musterantworten bewertet.
  • Automatisiert und effizient: Auch umfangreiche Fragenkataloge lassen sich ohne manuellen Prüfaufwand abarbeiten.
  • Wiederholbar: Die Prüfung kann nach Änderungen an Wissensquellen oder Einstellungen erneut durchgeführt werden. So lässt sich Verbesserung oder Verschlechterung direkt vergleichen.
  • Gezielte Optimierung: Schwächen werden erkannt und können gezielt behoben werden.
  • Vertrauen schaffen: Nachvollziehbare Evaluationsergebnisse sind eine gute Grundlage, um den Einsatz des Chatbots intern und gegenüber Nutzer:innen zu begründen.

Hinweis

Die Bewertung durch die KI ist eine fundierte Einschätzung und ersetzt nicht die fachliche Prüfung durch Expert:innen. Wir empfehlen, den Fragenkatalog und die Musterantworten gemeinsam mit Fachpersonen zu erstellen und die Ergebnisse stichprobenartig zu kontrollieren.

Sie möchten Ihren Chatbot evaluieren?

Diese E-Mail-Adresse ist vor Spambots geschützt! Zur Anzeige muss JavaScript eingeschaltet sein.. Wir unterstützen Sie gern bei der Erstellung des Fragenkatalogs und der Auswertung der Ergebnisse.