UiPath Documentation
maestro
latest
false
Benutzerhandbuch zu Maestro
Wichtig :
Es kann 1–2 Wochen dauern, bis die Lokalisierung neu veröffentlichter Inhalte verfügbar ist.

Bewertungen

Automatisierte Qualitätsprüfungen für Flow-Workflow-Ausgaben, die in Auswertungssätzen gruppiert und anhand der Auswerter bewertet werden, die Sie an jede Ausführung anhängen.

Mit Auswertungen können Sie automatisierte Qualitätsprüfungen für die Ausgaben eines Flow-Workflows definieren. Sie gruppieren erwartete Ergebnisse in einem Auswertungssatz, und Flow bewertet jede Ausführung anhand der Auswerter, die Sie anhängen.

Konzepte​

  • Auswertungssatz – eine Sammlung von Datenpunkten, die auf dasselbe Thema abzielen. Führen Sie den Satz aus, um den Workflow gleichzeitig anhand jedes Datenpunkts zu bewerten.
  • Datenpunkt – ein einzelner Fall: eine Reihe von Eingabewerten und die erwartete Ausgabe für diese Eingaben. Erstellen Sie einen Datenpunkt manuell oder erfassen Sie einen aus einer tatsächlichen Ausführung (siehe Erfassen eines Datenpunkts aus einer Ausführung).
  • Datensatz – die Datenpunkte, die einen Auswertungssatz bilden.
  • Auswerter – eine Prüfung, die die tatsächliche Ausgabe mit der erwarteten Ausgabe vergleicht und eine Punktzahl erzeugt. Ein Boolean-Auswerter liefert ein Bestehen oder Nichtbestehen pro Auswerter.
  • Punktzahl – das Ergebnis, das ein Auswerter für einen Datenpunkt meldet.

Auswertungssätze auf Knotenebene im Vergleich zur Flowebene​

Ein Auswertungssatz zielt entweder auf einen einzelnen Knoten oder den gesamten Ablauf ab:

  • Auf Knotenebene – an einen Knoten angeheftet. Jeder Datenpunkt liefert die Eingaben dieses Knotens und seine erwartete Ausgabe.
  • Auf Flow-Ebene – an einen Trigger-Einstiegspunkt gebunden. Jeder Datenpunkt liefert die Eingaben des Triggers und die erwartete Ausgabe des Ablaufs.

Sie können Datenpunkte auf Knotenebene und auf Flow-Ebene im selben Auswertungssatz nicht mischen.

Auswerter​

Flow gruppiert Auswerter in drei Familien.

Deterministisch​

Vergleichen Sie die Ausgabe genau mit der erwarteten Ausgabe, ohne ein Modell in der Schleife.

  • Enthält – überprüft, ob die Ausgabe eine erwartete Teilzeichenfolge enthält.
  • Exakte Übereinstimmung – überprüft, ob die Ausgabe dem erwarteten Wert entspricht.
  • JSON-Ähnlichkeit – vergleicht die Ausgabe und die erwartete Ausgabe als JSON.

LLM-Judge​

Verwenden Sie ein Modell, um die Ausgabe anhand der erwarteten Ausgabe zu bewerten.

  • Semantische Ähnlichkeit der Ausgabe – beurteilt, ob die Ausgabe dasselbe bedeutet wie die erwartete Ausgabe.
  • Ausgabe der strengen JSON-Ähnlichkeit – bewertet die JSON-Ausgabe anhand der erwarteten JSON.
  • Trajektorien-Ähnlichkeit – bewertet die Schritte, die der Agent ausgeführt hat, anhand einer erwarteten Trajektorie.
  • Trajektorien-Simulation – bewertet einen simulierten Verlauf.

Tool-Aufruf​

Prüfen Sie, wie ein Knoten seine Tools aufgerufen hat. Diese Auswerter sind nur auf Knotenebene verfügbar.

  • Argumentübereinstimmung – überprüft die Argumente, die an einen Toolaufruf übergeben werden.
  • Aufrufanzahl – überprüft, wie oft ein Tool aufgerufen wurde.
  • Aufrufreihenfolge – überprüft die Reihenfolge, in der Tools aufgerufen wurden.
  • Ausgabeübereinstimmung – überprüft die Ausgabe eines Toolaufrufs.

Auswertungssatz-Lebenszyklus​

Ein Auswertungssatz ist um ein Thema, Datenpunkte und Auswerter herum aufgebaut. Der Gegenstand ist entweder ein einzelner Knoten oder ein Trigger-Einstiegspunkt. Jeder Datenpunkt liefert Eingabewerte und die erwartete Ausgabe, und jeder Auswerter definiert, wie Flow das Ausführungsergebnis bewertet.

Wenn ein Auswertungssatz ausgeführt wird, führt Flow den Gegenstand für jeden Datenpunkt aus und zeigt die Punktzahlen pro Auswerter im Auswertungsverlauf an.

Erfassen eines Datenpunkts aus einer Ausführung​

Sie müssen nicht jeden Datenpunkt manuell erstellen. Sie können einen erstellen, indem Sie eine tatsächliche Ausführung importieren: Erfassen Sie eine Debug-Ausführung, und ihre Eingaben und Ausgaben werden zur Eingabe des Datenpunkts und zur erwarteten Ausgabe. Dies ist eine schnelle Möglichkeit, einen Auswertungssatz aus echtem Verhalten zu erstellen, das Sie bereits beobachtet haben.

Verwenden von Auswertungen in Development​

Auswertungen sind in folgenden Fällen am nützlichsten:

  • Sie erstellen Workflows, die KI-Agenten aufrufen, und müssen vor der Veröffentlichung überprüfen, ob die Ausgabe des Agenten die Qualitätserwartungen erfüllt.
  • Sie benötigen eine Regressionsabdeckung – die Ausführung von Auswertungen nach jeder Änderung bestätigt, dass das vorhandene Verhalten nicht beeinträchtigt wurde.
  • Sie möchten alternative Implementierungen vergleichen, indem Sie Auswertungen an zwei Versionen desselben Workflows ausführen.

Auswertungsergebnisse​

Die Ergebnisse werden im Auswertungsverlauf gespeichert und können jederzeit überprüft werden. Jede Ausführung zeigt die Punktzahlen pro Auswerter, einzelne Datenpunktergebnisse und die tatsächlichen im Vergleich zu den erwarteten Werten für jeden Datenpunkt an.

Beispiel aus der Praxis​

Ein Workflow, der einen KI-Agenten verwendet, um Kundensupport-E-Mails zu klassifizieren. Vor der Veröffentlichung haben Sie einen Auswertungssatz mit 10 Datenpunkten eingerichtet:

  • 5 E-Mails, die als "billing" klassifiziert werden sollten
  • 3 E-Mails, die als "technical" klassifiziert werden sollten
  • 2 Edge-Fälle (mehrdeutige E-Mails)

Jeder Datenpunkt definiert den erwarteten classification Ausgabewert. Ein Auswerter für Genaue Übereinstimmungen in der Klassifizierung bewertet jedes Ergebnis, und die Auswertungsausführung zeigt an, bei welchen Fällen der Agent falsch lag, bevor der Workflow in die Produktion geht.

Häufige Fehler​

  • Einen Auswertungssatz nur einmal ausführen – Auswertungssätze sind nach jeder wesentlichen Änderung in einem Workflow, der einen Agenten aufruft, am nützlichsten Das Agent-Verhalten kann sich ändern, da Modelle aktualisiert werden, auch wenn sich der Workflow nicht geändert hat.
  • Datenpunkte nur für den Idealpfad schreiben – Auswertungen sind am wertvollsten für Randfälle und Fehlermodi. Starke Datenpunkte enthalten Eingaben, die mehrdeutig oder fehlerhaft formatiert sind oder sich an der Grenze des erwarteten Bereichs befinden.
  • Behandlung einer All-Pass-Punktzahl als Signal zum Anhalten von Tests – Drei Datenpunkte sind kein Vertrauensbeweis. Größere Sätze, insbesondere solche, die echte Eingaben aus der Produktion widerspiegeln, bieten eine bessere Abdeckung.

War diese Seite hilfreich?

Verbinden

Benötigen Sie Hilfe? Support

Möchten Sie lernen? UiPath Academy

Haben Sie Fragen? UiPath-Forum

Auf dem neuesten Stand bleiben