Tests
Speichern Sie Gespräche als Tests, beschreiben Sie, was eine gute Antwort leisten muss, und führen Sie alle Tests mit der aktuellen Konfiguration Ihres Agenten aus. So sehen Sie, was eine Änderung an Prompt, Modell oder Tools tatsächlich bewirkt.
Mit Tests prüfen Sie in einem Durchgang, wie sich ein Agent in einer Reihe von Situationen verhält, bevor Ihre Kundschaft eine Änderung zu sehen bekommt. Ein gespeicherter Test besteht aus einem Gespräch, das mit einer Kundennachricht endet, und einer Erwartung: eine Beschreibung in einfachen Worten, was eine gute nächste Antwort leisten muss. Alle ausführen spielt jeden gespeicherten Test mit dem Agenten in seiner aktuellen Konfiguration erneut ab und bewertet jede Antwort.
Die Tests finden Sie auf der Seite des Agenten, in der Gruppe Tests der Agentennavigation: Tests, Vorhersagen und Verlauf. Auf einem breiten Bildschirm ist die Gruppe zunächst zugeklappt. Klicken Sie auf die Gruppenüberschrift Tests, um sie zu öffnen; die Seite merkt sich Ihre Wahl.
Wer Tests nutzen kann
Für Tests gelten die Berechtigungen des Agenten. Builder, Admins und Owner können Tests erstellen und ausführen. Die Rolle Mitglied kann nur chatten und keine Agentenseiten öffnen. Gespeicherte Tests sind für alle sichtbar, die den Agenten sehen können.
Gespeicherte Tests
Ein gespeicherter Test besteht aus:
- Gespräch: 1 bis 100 Nachrichten von Kundschaft und Agent, die mit einer Kundennachricht beginnen und enden. Die letzte Nachricht ist die, auf die der Agent antworten muss. Frühere Nachrichten liefern nur Kontext und werden nie bewertet.
- Erwartung (erforderlich): was eine gute Antwort leisten muss, bis zu 8'000 Zeichen. Siehe Erwartungen formulieren.
- Tags (optional): bis zu 20 kurze Bezeichnungen zum Filtern, etwa
hoursoderreturns.
Pro Agent sind bis zu 200 gespeicherte Tests möglich. Tests haben keinen Titel: Die Liste zeigt die Kundennachricht, die getestet wird.
Erste Schritte
Solange ein Agent noch keinen Test hat, zeigt Tests eine kurze Einführung mit der Schaltfläche Einrichten. Sie öffnet eine Anleitung in fünf Schritten: Wählen Sie die Plattform, das Modell und die Tools, die ein Lauf verwenden darf, schreiben Sie einen ersten Test (eine Kundennachricht und was die Antwort leisten muss; Später überspringt diesen Schritt) und schliessen Sie mit Alle ausführen ab, sobald ein Test gespeichert ist. Diese Auswahl entspricht den Einstellungen im Block Alle Tests ausführen und wird in Ihrem Browser gemerkt. Sobald Tests vorhanden sind, öffnet die Hilfe-Schaltfläche im Block Alle Tests ausführen (Einrichtungshilfe) die Anleitung erneut.
Drei Wege, einen Test zu erstellen
Selbst schreiben
Klicken Sie unter Tests auf Test hinzufügen und geben Sie die Kundennachricht ein. Brauchen Sie Kontext, fügen Sie mit Frühere Nachrichten hinzufügen davor je eine Nachricht von Kundschaft und Agent ein. Das × neben einem Austausch entfernt wieder beide Nachrichten, damit sich Kundschaft und Agent im Gespräch weiterhin abwechseln. (Test hinzufügen erscheint, sobald der Agent mindestens einen Test hat. Für den allerersten Test verwenden Sie Einrichten oder speichern eine Antwort.)
Eine Antwort aus dem Testchat speichern
Klicken Sie im Bereich Agent testen von Konfigurieren (siehe Agent testen) unter einer beliebigen Antwort des Agenten auf Als Test speichern. Das Gespräch bis zu dieser Kundennachricht wird zum Test. Die ursprüngliche Antwort bleibt nur als Referenz erhalten.
Ein echtes Kundengespräch speichern
In Chats hat jede Antwort des Agenten dieselbe Schaltfläche Als Test speichern. Kopiert wird der Gesprächszweig, der zu dieser Antwort geführt hat. Die ursprüngliche Antwort und ein allfälliges Daumen hoch oder Daumen runter der Besuchenden werden als Referenz angezeigt. Gespräche mit Anhängen oder solche, die mit einer Begrüssung des Agenten beginnen, lassen sich nicht unverändert übernehmen. Schreiben Sie stattdessen eine reine Textversion, die mit einer Kundennachricht beginnt.
Der Editor kann eine Erwartung und Tags für Sie entwerfen (Erwartung vorschlagen, Auto). Beides ruft ein Modell auf und kostet Credits. Das Ergebnis ist jeweils ein Entwurf, den Sie vor dem Speichern bearbeiten können. Öffnen Sie den Editor über Als Test speichern, entwirft er die Erwartung automatisch (gleich abgerechnet). Ist das nicht möglich, bleibt das Feld leer und Sie füllen es selbst aus. Jede Antwort lässt sich einmal speichern. Danach heisst die Schaltfläche Als Test gespeichert und führt zu Tests. Gespräche, aus denen Tests stammen, sind in Chats markiert (zum Beispiel «2 Tests») und in der Gesprächsübersicht (ein Laborkolben-Symbol mit der Anzahl).
Erwartungen formulieren
Die Erwartung geht nur an das Bewertungsmodell, nie an den Agenten. Sie verändert also nicht, wie der Agent antwortet. Am besten formulieren Sie sie als einige wenige konkrete Anforderungen:
| Art der Anforderung | Beispiel | So wird sie geprüft |
|---|---|---|
| Fakten | «Sagen, dass wir am Samstagnachmittag geschlossen haben: Am Samstag sind wir von 7:00 bis 13:00 geöffnet.» | Nur anhand des Fakts, den Sie angeben. «Die korrekten Öffnungszeiten nennen» lässt sich nicht prüfen, weil das Bewertungsmodell keine andere verlässliche Quelle hat. Das Ergebnis ist dann Nicht bewertbar. |
| Verhalten und Ton | «Höflich sein. In der Sprache der Kundschaft antworten. Eine telefonische Bestätigung anbieten.» | Durch das Bewertungsmodell, anhand der Antwort. |
| Länge | «Die Antwort unter 300 Zeichen halten.» | Eine einfache Zeichengrenze für die ganze Antwort wie diese wird exakt gezählt. Grenzen, die nur für einen Teil gelten («jeder Satz unter 100 Zeichen»), an eine Bedingung geknüpft sind («wenn die Kundschaft fragt») oder ein Urteil enthalten («unter 100 Zeichen ist zu kurz»), beurteilt das Bewertungsmodell. Es sieht die exakte Zeichenzahl. |
Referenzfakten mitgeben
Das Bewertungsmodell kennt Ihr Unternehmen nicht. Geht es in einem Test um einen Fakt, schreiben Sie diesen Fakt in die Erwartung. «Produkt A empfehlen» prüft, ob Produkt A empfohlen wird. Eigenschaften von Produkt A, die Sie nicht angegeben haben, kann es nicht prüfen.
Tests ausführen
Der Block Alle Tests ausführen unter Tests (sichtbar, sobald der Agent einen gespeicherten Test hat) legt fest, wie ein Lauf abläuft:
- Plattform: Website oder Interner Chat. Damit wählen Sie die Tools und das Verhalten, die der Agent auf diesem Kanal hätte. Beide stehen in jedem kostenpflichtigen Plan zur Verfügung, denn ein Test stellt nichts bereit.
- Modell: jedes Textmodell, das Ihre Organisation nutzen darf. In einem neuen Browser sind zunächst Modell und Plattform des ersten Deployments des Agenten eingestellt.
- Tools: ein Schalter pro Tool. Wissenssuche, erweitertes Wissens-Browsing und Websuche sind standardmässig eingeschaltet, sofern der Agent sie hat. Verbindungen und andere Aktions-Tools sind standardmässig aus und mit Kann echte Aktionen ausführen gekennzeichnet: Schalten Sie eines davon ein, ruft ein Test es wirklich auf. Verbindungen, die eine persönliche Anmeldung brauchen, und Tools, die eine laufende Chat-Umgebung voraussetzen (Code-Ausführung, geplante Aufgaben), sind in Tests nicht verfügbar.
Diese Einstellungen merkt sich Ihr Browser pro Agent. Den Agenten selbst ändern sie nie.
Jeder Test läuft mit der aktuell gespeicherten Konfiguration des Agenten: Prompt, Wissensdatenbanken, Tools und Formulare so, wie sie in diesem Moment sind, und nur mit den Verbindungen der Organisation. Weder das Benutzergedächtnis noch die Identität eines Mitglieds fliessen ein. Ein Lauf ist deshalb gleich, egal wer ihn startet.
Klicken Sie auf Alle ausführen, um alle gespeicherten Tests auszuführen, auch wenn die Liste gefiltert ist. Pro Agent ist jeweils nur ein Lauf aktiv. Sie können die Seite verlassen oder neu laden: Der Lauf geht weiter, und den Fortschritt sehen Sie im Verlauf. Nach aktuellen Tests stoppen bricht die Tests ab, die noch nicht begonnen haben, und lässt die bereits laufenden fertig werden.
Um einen einzelnen Test auszuprobieren, öffnen Sie ihn und klicken auf Test ausprobieren. Diese Vorschau verwendet dieselben Einstellungen, zeigt die Antwort und ihre Bewertung im Dialog an und erzeugt keinen Eintrag im Verlauf.
Formulare in Tests
Ist Formular erfassen (das Tool Formular / Lead-Erfassung des Agenten) für einen Test eingeschaltet, kann der Agent das Formular ausfüllen und absenden wie bei echter Kundschaft, und die Antwort wird daran gemessen. Die Eingabe selbst wird nicht gespeichert und es wird keine Benachrichtigungs-E-Mail verschickt. Testläufe erzeugen also nie Leads.
Ergebnisse lesen
Jeder Test endet mit einem dieser Ergebnisse:
| Ergebnis | Bedeutung |
|---|---|
| Bestanden | Alle Anforderungen der Erwartung wurden erfüllt. |
| Nicht bestanden | Mindestens eine Anforderung wurde nicht erfüllt. |
| Nicht bewertbar | Die Antwort wurde erstellt, aber mindestens eine Anforderung liess sich nicht beurteilen (meist ein Fakt ohne Referenz in der Erwartung), und keine Anforderung wurde verfehlt. Oder die Bewertung selbst konnte nicht durchgeführt werden (etwa weil die Credits nach der Antwort ausgegangen sind). Die Begründung zeigt, was zutrifft. |
| Ausführungsfehler | Es wurde keine Antwort erstellt: Der Test wurde unterbrochen oder hat das Zeitlimit überschritten, der Agent hat eine leere Antwort geliefert, das Gespräch ist für das gewählte Modell zu lang, die Credits sind ausgegangen oder der Agent konnte nicht geladen werden. |
| Nicht ausgeführt | Der Test hat nie begonnen, weil Nach aktuellen Tests stoppen verwendet wurde oder der Lauf stoppte, nachdem die Credits ausgegangen waren. |
Öffnen Sie ein Ergebnis, um das Gespräch, die Erwartung, die erstellte Antwort und die Bewertung pro Anforderung zu sehen, jeweils mit einer kurzen Begründung. Das Ergebnis hält auch fest, mit welcher Plattform, welchem Modell und welchen Tool-Schaltern es entstanden ist.
Bestanden, Nicht bestanden und Nicht bewertbar sind eine KI-Bewertung der Antwort anhand Ihrer Erwartung. Betrachten Sie ein überraschendes Urteil als Anlass, die Erwartung zu schärfen, nicht als unumstössliche Wahrheit.
Verlauf
Der Verlauf zeigt einen Eintrag für jeden Lauf über Alle ausführen, den neusten zuoberst, mit den Einstellungen und der Anzahl bestandener, nicht bestandener, nicht bewertbarer, fehlerhafter und nicht ausgeführter Tests. Öffnen Sie einen Lauf, um die Ergebnisse der einzelnen Tests zu sehen. Ein Lauf bewahrt die Testeingaben und Erwartungen so auf, wie sie bei seinem Start waren. Bearbeiten oder löschen Sie später einen gespeicherten Test, bleibt der Verlauf deshalb unverändert. Passt das letzte Ergebnis eines gespeicherten Tests nicht mehr zu seinem aktuellen Inhalt, zeigt seine Zeile Test bearbeitet an.
Vorhersagen
Vorhersagen sagt anhand der letzten Gespräche im Website-Widget des Agenten voraus, welche Fragen Ihre Kundschaft wahrscheinlich als Nächstes stellt (Telefonanrufe und interne Chats werden nicht verwendet). Klicken Sie auf Zukünftige Chats vorhersagen, um bis zu zehn Entwürfe zu erhalten, jeder mit Gespräch, Erwartung und Tags und alle bereits ausgewählt. Klappen Sie einen Entwurf auf, um die letzte Kundennachricht und die Erwartung zu bearbeiten oder Tags zu entfernen, wählen Sie die nicht gewünschten ab und klicken Sie auf Ausgewählte Tests speichern, um sie zu Tests hinzuzufügen. Die Vorhersage ruft ein Modell auf und kostet Credits. Hat ein Agent keine aktuellen Gespräche im Website-Widget, gibt es nichts, woraus sich etwas vorhersagen liesse.
Was ein Test kostet
Ein Testlauf wird wie die normale Nutzung abgerechnet: Die Antwort des Agenten und ihre Bewertung kosten je Credits, die im Ergebnis getrennt aufgeführt sind. Testantworten zählen nicht als Kundennachrichten. Tools, die der Agent während eines Tests aufruft (Websuche, gelesene Webseiten, Verbindungen), werden wie in einem Chat abgerechnet.
Was Tests nicht tun
- Tests ändern den Agenten nicht. Es gibt kein automatisches Umschreiben des Prompts, keine automatische Modellwahl und keine «Beheben»-Schaltfläche.
- Tests halten die Konfiguration nicht fest. Laufen dieselben Tests vor und nach einer Prompt-Änderung, vergleichen die beiden Läufe den alten mit dem neuen Prompt. Genau darum geht es.
- Tests verwenden weder das Benutzergedächtnis noch persönliche Verbindungen eines Mitglieds.
- Tests machen echte Aktionen nicht rückgängig. Ein eingeschaltetes Aktions-Tool führt seine Aktion einmal pro Test aus und wird nicht wiederholt. Führen Sie die Tests erneut aus, wird die Aktion erneut ausgeführt.
Zuletzt aktualisiert am 4. Oktober 2026