Dokumentation / Anleitungen
Testen Sie Ihren Agenten, bevor er live geht
Pflegen Sie ein Golden Set aus Fragen, führen Sie es gegen Ihren Entwurf aus und lassen Sie einen fehlgeschlagenen Durchlauf das Deployment blockieren.
Zuletzt aktualisiert:
Ein Agent, der letzten Monat noch gut geantwortet hat, kann nach einer Änderung am Prompt oder an seinem Wissen plötzlich schlecht antworten. Die Evaluierungsseite fängt das ab, bevor es Ihre Besucher tun: Sie pflegen ein Set aus Testfragen, führen es gegen den Entwurf des Agenten aus und entscheiden, was ein fehlgeschlagener Durchlauf für ein Deployment bedeutet.
Das Golden Set aufbauen#
Öffnen Sie Evaluation in der Konsole und wählen Sie einen Agenten aus. Jeder Testfall besteht aus einer Frage und mindestens einer Erwartung:
- der expected answer, die nach ihrer Bedeutung und nicht nach dem genauen Wortlaut beurteilt wird,
- einer Antwort, die der Agent nie wiederholen darf (ein bestätigter früherer Fehler),
- oder dem geforderten Verhalten: Ihre Dokumente zitieren, an einen Menschen übergeben oder die Antwort verweigern.
Ein Testfall ohne Erwartung kann nicht fehlschlagen, deshalb speichert der Editor ihn nicht.
Der schnellste Weg zu einem brauchbaren Set: Klicken Sie auf Import confirmed-wrong reports. Jede Antwort, die Ihre Prüfer auf der Seite Antwort-Feedback als falsch bestätigt haben, wird zu einem Fall, den der Agent nie wiederholen darf, samt der ursprünglichen Frage des Besuchers. Zweimal zu importieren ist unbedenklich: Vorhandene Fälle werden übersprungen und nie überschrieben, Ihre Änderungen bleiben also erhalten.
Ausführen#
Run the set stellt jede Frage an den Entwurf des Agenten, mit dessen eigenen Anweisungen und eigenem Wissen, und ein automatischer Bewerter benotet jede Antwort. Der gespeicherte Durchlauf zeigt für jeden Fall bestanden oder nicht bestanden, warum er fehlgeschlagen ist und was sich seit dem vorherigen Durchlauf geändert hat: welche Fälle neu fehlschlagen, welche sich wieder erholt haben und welche hinzugekommen sind.
Durchläufe werden dauerhaft aufbewahrt, die Frage „Was hat diese Version bestanden, bevor sie live ging?“ hat also immer eine Antwort.
Legen Sie fest, was ein Fehlschlag bedeutet#
Das Deployment-Gate ist eine projektweite Einstellung mit drei Stellungen:
- Off: Durchläufe sind rein informativ.
- Warnen: Ein Deployment über einen fehlgeschlagenen Durchlauf hinweg gelingt, nennt Ihnen aber den fehlgeschlagenen Durchlauf.
- Blockieren: Ein Deployment wird abgelehnt, bis der Durchlauf besteht oder das Gate herabgesetzt wird.
Nur ein wirklich fehlgeschlagener Durchlauf greift. Ein Durchlauf, der mit einem Fehler endete, weil der Testmechanismus selbst ein Problem hatte, blockiert Ihr Deployment nie.
Qualität im Produktivbetrieb überwachen#
Dieselbe Seite enthält die Qualitätsalarme des Projekts: eine Obergrenze für die Halluzinationsrate (Antworten, die nicht durch Ihre Dokumente belegt sind, gemessen von einem automatischen Bewerter an einer Stichprobe echter Gespräche) und eine für die Übernahmerate durch Menschen. Überschreitet eine Rate ihre Obergrenze, wird ein Alarmereignis an Ihre konfigurierten Kanäle gesendet, und ein weiteres, sobald sie sich wieder erholt. Das Dashboard zeigt dieselben Zahlen: belegte Antworten, negatives Feedback und Chats, die ohne einen Menschen gelöst wurden.
Der periodische Betriebsbericht#
Operations report in der Konsole ist derselbe Qualitätsbericht für einen ganzen Kalenderzeitraum, aufbewahrt als Nachweis statt als Live-Anzeige.
Schalten Sie den Zeitplan ein, wählen Sie monatlich oder vierteljährlich und tragen Sie die Adressen ein, die ihn erhalten sollen. Am Ende jedes Zeitraums wird der Bericht erzeugt und als Tabelle per E-Mail verschickt. Er wird außerdem hier aufbewahrt, sodass Sie ihn lesen oder herunterladen können, ohne auf die E-Mail zu warten. Ohne Adressen wird er trotzdem erzeugt und aufbewahrt, nur eben an niemanden verschickt.
Jeder Bericht beginnt mit der Kennzahl, um die herum er aufgebaut ist: dem Anteil der Website-Chats, die endeten, ohne dass jemand nach einem Menschen gefragt hat, mit dem Zielwert daneben, erreicht oder nicht. Darunter folgt das gesamte Projekt und dann dieselben Zahlen je Agent: bearbeitete Gespräche, wie viele davon ohne Eskalation gelöst wurden, wie viele Antworten durch Ihre Dokumente belegt waren, negative Bewertungen, wie die Gespräche von Anfang bis Ende empfunden wurden, das Thema mit den meisten Gesprächen, wie viele Anliegen von Anrufern zu einem von Ihnen konfigurierten Intent passten, und die Evaluierungsläufe des Zeitraums.
Sie müssen nicht warten, bis ein Zeitraum endet. Generate erstellt auf Anforderung einen Bericht für jeden vergangenen Monat oder jedes vergangene Quartal und bietet dafür zwei Schaltflächen: erzeugen ohne Versand, um ihn zuerst zu lesen, oder erzeugen und an die Adressen des Zeitplans senden.
Die Erzeugung auf Anforderung ist auf eine Handvoll Berichte pro Stunde begrenzt. Jeder einzelne liest vor seiner Antwort jedes Gespräch, jede Bewertung und jeden Evaluierungslauf des Zeitraums und verschickt eine Tabelle per E-Mail, sofern Sie nichts anderes verlangt haben; das Limit ist also das, was verhindert, dass ein paar Klicks zur Last für dieselben Datensätze werden, die Ihre laufenden Gespräche nutzen. Die drei Monate eines Quartals in einem Zug durchzuarbeiten liegt bequem darunter. Wenn Sie es doch erreichen, sagt die Konsole das und bittet Sie, ein paar Minuten zu warten; Ihr geplanter Bericht ist davon nie betroffen, denn das Limit gilt nur für die Erzeugung auf Anforderung.
Jede Zahl im Bericht beruht auf derselben Berechnung, die auch das Dashboard und Ihr eigenes Monitoring auslesen. Ein Zeitraum, der an ein Leselimit gestoßen ist, weist in seiner eigenen Zeile darauf hin: Die Zahlen sind dann eine Untergrenze über die jüngsten Gespräche statt über den gesamten Zeitraum.
Wenn sich der Score bewegt und niemand den Agenten angefasst hat#
Schalten Sie neben dem Deployment-Gate die Drift detection ein, und Ihr Golden Set wird für Sie erneut ausgeführt: in einem Takt, den Sie festlegen, und noch einmal, sobald sich die Modelle hinter Ihren Anrufen ändern. Jeder Durchlauf wird mit dem vorherigen desselben Agenten verglichen, und Sie werden benachrichtigt, wenn der Score stärker fällt als das von Ihnen gesetzte Limit.
Sie warnt bei einem Rückgang, nicht bei einem Mindestwert, und genau dieser Unterschied macht sie brauchbar. Ein Agent, der bei einem bewusst schweren Set immer 60 Prozent erreicht hat, driftet nicht. Einer, der gestern 92 und heute 84 erreicht hat, schon, und nur der zweite Fall ist es wert, jemanden dafür zu wecken.
Die Benachrichtigung geht an dieselben Kanäle wie Ihre Qualitätsalarme und nennt die Fälle, die beim letzten Mal bestanden haben und jetzt fehlschlagen. Eine Wiederholung gibt in der Liste der Durchläufe an, warum sie stattfand: nach Zeitplan oder weil sich die Modelle geändert haben.
Sie ist standardmäßig ausgeschaltet, weil jede Wiederholung pro Frage in Ihrem Set eine Antwort des Agenten und einen Bewertungsdurchgang kostet.