- Überblick
- Erste Schritte mit UiPath Agents
- Erste Schritte mit UiPath Agents mit LangGraph
- Erstellen eines Low-Code-Agents in Studio Web
- Hinzufügen von Tools zu Ihrem UiPath Agent
Führen Sie Evaluierungsablaufverfolgungen lokal aus und überprüfen Sie die Ergebnisse, die in Studio Web einfließen.
Wenn der Agent lokal ausgeführt wird und die Einstiegspunkte registriert sind, können Sie ihn ausführen und einen Evaluierungssatz erstellen.
Schritt 6 – Führen Sie den Agent lokal aus
Führen Sie den Agent mit der Beispieleingabedatei aus, die Ihr Codierungsagent erstellt hat:
uip codedagent run agent --file input.json
uip codedagent run agent --file input.json
Sie sollten sehen, wie der Agent die Anforderung klassifiziert und eine Stufe mit Argumentation zurückgibt.
Sie können Eingaben auch inline übergeben. Diese Beispiele verwenden die Bash-Syntax für einzelne Anführungszeichen. Wenn Sie PowerShell verwenden, verwenden Sie stattdessen --file mit einer JSON-Datei:
uip codedagent run agent '{"description": "Clear the rats out of the inn cellar"}'
uip codedagent run agent '{"description": "Clear the rats out of the inn cellar"}'
Probieren Sie einige verschiedene Eingaben aus, um zu überprüfen, ob die Klassifizierungen sinnvoll sind:
uip codedagent run agent '{"description": "Slay the ancient red dragon terrorizing the countryside"}'
uip codedagent run agent '{"description": "Slay the ancient red dragon terrorizing the countryside"}'
Schritt 7 – Auswertungstests erstellen
Evaluierungen testen, wie gut Ihr Agent bei einer Reihe von Eingaben abschneidet. Die Fähigkeit uipath-agents enthält die vollständige Referenz des Auswertungsframeworks: Auswertertypen, Auswertungssatzschema, Konventionen für die Verzeichnisstruktur und bewährte Methoden wie die Verwendung gpt-4.1 (nicht mini) für LLM-Judge-Auswerter. Ihr Codierungs-Agent verwendet dies, um aus einer kurzen Eingabeaufforderung korrekte Auswerterkonfigurationen und Testsätze zu erstellen.
Fragen Sie Ihren Programmier-Agent:
Create an evaluation set for the intake classifier agent with 5 test cases:
1. A clearly trivial request (e.g., delivering a letter)
2. A standard request (e.g., escort a caravan)
3. A heroic request (e.g., clear a goblin stronghold)
4. A legendary request (e.g., slay a dragon)
5. An edge case with ambiguous difficulty
Use both a semantic similarity evaluator (to check the output) and a
trajectory evaluator (to check the agent's reasoning path).
Include evaluator config files in evaluations/evaluators/ and the eval
set in evaluations/eval-sets/. Use gpt-4.1-2025-04-14 as the model in
the evaluator configs. Each evaluator config must include a populated
defaultEvaluationCriteria - use {"expectedOutput": {}} for the
semantic evaluator and {"expectedAgentBehavior": ""} for the
trajectory evaluator. Empty {} fails schema validation.
Create an evaluation set for the intake classifier agent with 5 test cases:
1. A clearly trivial request (e.g., delivering a letter)
2. A standard request (e.g., escort a caravan)
3. A heroic request (e.g., clear a goblin stronghold)
4. A legendary request (e.g., slay a dragon)
5. An edge case with ambiguous difficulty
Use both a semantic similarity evaluator (to check the output) and a
trajectory evaluator (to check the agent's reasoning path).
Include evaluator config files in evaluations/evaluators/ and the eval
set in evaluations/eval-sets/. Use gpt-4.1-2025-04-14 as the model in
the evaluator configs. Each evaluator config must include a populated
defaultEvaluationCriteria - use {"expectedOutput": {}} for the
semantic evaluator and {"expectedAgentBehavior": ""} for the
trajectory evaluator. Empty {} fails schema validation.
Schritt 8 – Ausführen von Bewertungen
Führen Sie den Auswertungssatz lokal aus:
uip codedagent eval agent evaluations/eval-sets/smoke-test.json --workers 3 --output-file eval-results.json
uip codedagent eval agent evaluations/eval-sets/smoke-test.json --workers 3 --output-file eval-results.json
Das Auswertungsframework führt jeden Testfall über Ihren Agent aus und bewertet die Ergebnisse.
| Bewertung | Was gemessen wird |
|---|---|
| Semantische Ähnlichkeit | Wie genau die Ausgabe des Agents der erwarteten Ausgabe entspricht |
| Agent-Verlauf | Ob der Agent den erwarteten Argumentationspfad genommen hat |
Erwarten Sie für diesen Agent eine Verlaufspunktzahl von 0,0. Verlaufsauswerter beurteilen den Argumentationspfad des Agents: welche Tools er aufgerufen hat, in welcher Reihenfolge und wie er zwischen Knoten weitergeleitet wurde. Dieser Klassifizierer führt keine Toolaufrufe aus und hat einen einzelnen Knoten, sodass jeder Testfall eine Punktzahl von 0,0 erhält. Für diesen Klassifizierer mit einem einzelnen Knoten nutzen Sie semantische Ähnlichkeitsbewertungen.
Für die semantische Ähnlichkeit sind Werte über 0,8 im Allgemeinen solide. Überprüfen Sie eval-results.json , um zu sehen, wie Ihr Agent ausgeführt wurde.
Nachdem Sie im nächsten Schritt eine Verbindung mit Studio Web hergestellt haben, werden die Ergebnisse durch uip codedagent eval run über die CLI automatisch in Studio Web hochgeladen; Sie werden auf der Registerkarte Evaluierungssätze unter Ausführungen angezeigt.
Die Schaltfläche „Evals ausführen“ in Studio Web ist nicht dasselbe. Diese Schaltfläche löst eine Cloud Robot-Ausführung aus, die Python-Laufzeitunterstützung erfordert – ein aufwendigeres Setup außerhalb des Rahmens dieses Projekts. Verwenden Sie stattdessen uip codedagent eval run aus der CLI; Die Ergebnisse werden in beiden Versionen in Studio Web angezeigt.
Wenn die lokalen Auswertungsergebnisse bestätigt wurden, können Sie das Projekt im nächsten Abschnitt mit Studio Web verbinden.