- Einleitung
- Erste Schritte
- Erstellen mit Maestro BPMN
- Grundlegendes zur BPMN-Modellierung von Maestro
- Öffnen der Modellierungsarbeitsfläche
- Modellierung Ihres Prozesses
- Ausrichten und Verbinden von BPMN-Elementen
- Patterns library
- Autopilot for Maestro (Vorschau)
- Prozess-Repository
- Einen einfachen BPMN-Prozess implementieren
- Einen komplexen BPMN-Prozess implementieren
- Debugging
- Simulieren
- Auswertungen (Vorschau)
- Häufige Implementierungsszenarien
- Erstellen mit Maestro Case
- Einführung in Maestro Case
- Maestro BPMN vs. Maestro Case: Wann wird Case Management verwendet?
- Der Lebenszyklus von Maestro Case: Vom Ereignis-Trigger zum App-Erlebnis
- Erstellen Sie Ihren ersten Fall mit Maestro Case
- Maestro Case mit einem Codierungs-Agent erstellen (Vorschau)
- Definieren von Fallschlüsseln (System vs. extern)
- Erstellen von Task-E/A- und Write-Back-Verträgen
- Austrittsregeln und Beendigung der frühen Phase
- Modellieren von primären und sekundären Phasen
- Auslösen eines Falls aus Data Fabric
- Implementieren von Personas und Berechtigungen auf Phasenebene
- Festlegen von SLAs und automatisierten Eskalationsregeln
- Konfigurieren einer Nacharbeitsschleife (Wiedereintritt)
- Konfigurieren und Testen des Case Manager-Agents (Vorschau)
- Eingabe- und Ausgabevertrag für den Fall Manager
- Wörterbuch für die Komponente „Maestro Case“.
- Erstellen mit Maestro Flow
- Maestro Automate
- Integrationen
- Betrieb
- Überwachung
- Optimieren
- Referenzinformationen
Automatisierte Qualitätsprüfungen für Flow-Workflow-Ausgaben, die in Auswertungssätzen gruppiert und anhand der Auswerter bewertet werden, die Sie an jede Ausführung anhängen.
Mit Auswertungen können Sie automatisierte Qualitätsprüfungen für die Ausgaben eines Flow-Workflows definieren. Sie gruppieren erwartete Ergebnisse in einem Auswertungssatz, und Flow bewertet jede Ausführung anhand der Auswerter, die Sie anhängen.
Konzepte
- Auswertungssatz – eine Sammlung von Datenpunkten, die auf dasselbe Thema abzielen. Führen Sie den Satz aus, um den Workflow gleichzeitig anhand jedes Datenpunkts zu bewerten.
- Datenpunkt – ein einzelner Fall: eine Reihe von Eingabewerten und die erwartete Ausgabe für diese Eingaben. Erstellen Sie einen Datenpunkt manuell oder erfassen Sie einen aus einer tatsächlichen Ausführung (siehe Erfassen eines Datenpunkts aus einer Ausführung).
- Datensatz – die Datenpunkte, die einen Auswertungssatz bilden.
- Auswerter – eine Prüfung, die die tatsächliche Ausgabe mit der erwarteten Ausgabe vergleicht und eine Punktzahl erzeugt. Ein Boolean-Auswerter liefert ein Bestehen oder Nichtbestehen pro Auswerter.
- Punktzahl – das Ergebnis, das ein Auswerter für einen Datenpunkt meldet.
Auswertungssätze auf Knotenebene im Vergleich zur Flowebene
Ein Auswertungssatz zielt entweder auf einen einzelnen Knoten oder den gesamten Ablauf ab:
- Auf Knotenebene – an einen Knoten angeheftet. Jeder Datenpunkt liefert die Eingaben dieses Knotens und seine erwartete Ausgabe.
- Auf Flow-Ebene – an einen Trigger-Einstiegspunkt gebunden. Jeder Datenpunkt liefert die Eingaben des Triggers und die erwartete Ausgabe des Ablaufs.
Sie können Datenpunkte auf Knotenebene und auf Flow-Ebene im selben Auswertungssatz nicht mischen.
Auswerter
Flow gruppiert Auswerter in drei Familien.
Deterministisch
Vergleichen Sie die Ausgabe genau mit der erwarteten Ausgabe, ohne ein Modell in der Schleife.
- Enthält – überprüft, ob die Ausgabe eine erwartete Teilzeichenfolge enthält.
- Exakte Übereinstimmung – überprüft, ob die Ausgabe dem erwarteten Wert entspricht.
- JSON-Ähnlichkeit – vergleicht die Ausgabe und die erwartete Ausgabe als JSON.
LLM-Judge
Verwenden Sie ein Modell, um die Ausgabe anhand der erwarteten Ausgabe zu bewerten.
- Semantische Ähnlichkeit der Ausgabe – beurteilt, ob die Ausgabe dasselbe bedeutet wie die erwartete Ausgabe.
- Ausgabe der strengen JSON-Ähnlichkeit – bewertet die JSON-Ausgabe anhand der erwarteten JSON.
- Trajektorien-Ähnlichkeit – bewertet die Schritte, die der Agent ausgeführt hat, anhand einer erwarteten Trajektorie.
- Trajektorien-Simulation – bewertet einen simulierten Verlauf.
Tool-Aufruf
Prüfen Sie, wie ein Knoten seine Tools aufgerufen hat. Diese Auswerter sind nur auf Knotenebene verfügbar.
- Argumentübereinstimmung – überprüft die Argumente, die an einen Toolaufruf übergeben werden.
- Aufrufanzahl – überprüft, wie oft ein Tool aufgerufen wurde.
- Aufrufreihenfolge – überprüft die Reihenfolge, in der Tools aufgerufen wurden.
- Ausgabeübereinstimmung – überprüft die Ausgabe eines Toolaufrufs.
Auswertungssatz-Lebenszyklus
Ein Auswertungssatz ist um ein Thema, Datenpunkte und Auswerter herum aufgebaut. Der Gegenstand ist entweder ein einzelner Knoten oder ein Trigger-Einstiegspunkt. Jeder Datenpunkt liefert Eingabewerte und die erwartete Ausgabe, und jeder Auswerter definiert, wie Flow das Ausführungsergebnis bewertet.
Wenn ein Auswertungssatz ausgeführt wird, führt Flow den Gegenstand für jeden Datenpunkt aus und zeigt die Punktzahlen pro Auswerter im Auswertungsverlauf an.
Erfassen eines Datenpunkts aus einer Ausführung
Sie müssen nicht jeden Datenpunkt manuell erstellen. Sie können einen erstellen, indem Sie eine tatsächliche Ausführung importieren: Erfassen Sie eine Debug-Ausführung, und ihre Eingaben und Ausgaben werden zur Eingabe des Datenpunkts und zur erwarteten Ausgabe. Dies ist eine schnelle Möglichkeit, einen Auswertungssatz aus echtem Verhalten zu erstellen, das Sie bereits beobachtet haben.
Verwenden von Auswertungen in Development
Auswertungen sind in folgenden Fällen am nützlichsten:
- Sie erstellen Workflows, die KI-Agenten aufrufen, und müssen vor der Veröffentlichung überprüfen, ob die Ausgabe des Agenten die Qualitätserwartungen erfüllt.
- Sie benötigen eine Regressionsabdeckung – die Ausführung von Auswertungen nach jeder Änderung bestätigt, dass das vorhandene Verhalten nicht beeinträchtigt wurde.
- Sie möchten alternative Implementierungen vergleichen, indem Sie Auswertungen an zwei Versionen desselben Workflows ausführen.
Auswertungsergebnisse
Die Ergebnisse werden im Auswertungsverlauf gespeichert und können jederzeit überprüft werden. Jede Ausführung zeigt die Punktzahlen pro Auswerter, einzelne Datenpunktergebnisse und die tatsächlichen im Vergleich zu den erwarteten Werten für jeden Datenpunkt an.
Beispiel aus der Praxis
Ein Workflow, der einen KI-Agenten verwendet, um Kundensupport-E-Mails zu klassifizieren. Vor der Veröffentlichung haben Sie einen Auswertungssatz mit 10 Datenpunkten eingerichtet:
- 5 E-Mails, die als
"billing"klassifiziert werden sollten - 3 E-Mails, die als
"technical"klassifiziert werden sollten - 2 Edge-Fälle (mehrdeutige E-Mails)
Jeder Datenpunkt definiert den erwarteten classification Ausgabewert. Ein Auswerter für Genaue Übereinstimmungen in der Klassifizierung bewertet jedes Ergebnis, und die Auswertungsausführung zeigt an, bei welchen Fällen der Agent falsch lag, bevor der Workflow in die Produktion geht.
Häufige Fehler
- Einen Auswertungssatz nur einmal ausführen – Auswertungssätze sind nach jeder wesentlichen Änderung in einem Workflow, der einen Agenten aufruft, am nützlichsten Das Agent-Verhalten kann sich ändern, da Modelle aktualisiert werden, auch wenn sich der Workflow nicht geändert hat.
- Datenpunkte nur für den Idealpfad schreiben – Auswertungen sind am wertvollsten für Randfälle und Fehlermodi. Starke Datenpunkte enthalten Eingaben, die mehrdeutig oder fehlerhaft formatiert sind oder sich an der Grenze des erwarteten Bereichs befinden.
- Behandlung einer All-Pass-Punktzahl als Signal zum Anhalten von Tests – Drei Datenpunkte sind kein Vertrauensbeweis. Größere Sätze, insbesondere solche, die echte Eingaben aus der Produktion widerspiegeln, bieten eine bessere Abdeckung.
Zugehörige Seiten
- Konzepte
- Auswertungssätze auf Knotenebene im Vergleich zur Flowebene
- Auswerter
- Deterministisch
- LLM-Judge
- Tool-Aufruf
- Auswertungssatz-Lebenszyklus
- Erfassen eines Datenpunkts aus einer Ausführung
- Verwenden von Auswertungen in Development
- Auswertungsergebnisse
- Beispiel aus der Praxis
- Häufige Fehler
- Zugehörige Seiten