- Vue d'ensemble (Overview)
- Commencer avec les agents UiPath
- Premiers pas avec les agents UiPath utilisant LangGraph
- Créer un agent low-code dans Studio Web
- Ajouter des outils à votre agent UiPath
Exécutez les traçages d'évaluation localement et examinez les résultats entrant dans Studio Web.
Lorsque l'agent est exécuté localement et que les points d'entrée sont enregistrés, vous êtes prêt à l'exécuter et à créer un ensemble d'évaluation.
Étape 6 - Exécuter l’agent localement
Exécutez l'agent avec le fichier d'entrée exemple votre agent de codage créé:
uip codedagent run agent --file input.json
uip codedagent run agent --file input.json
Vous devriez voir l'agent classer la demande et renvoyer un niveau avec un raisonnement.
Vous pouvez également transmettre l'entrée en ligne. Ces exemples utilisent la syntaxe à apostrophes Bash; si vous êtes dans PowerShell, utilisez plutôt --file avec un fichier JSON:
uip codedagent run agent '{"description": "Clear the rats out of the inn cellar"}'
uip codedagent run agent '{"description": "Clear the rats out of the inn cellar"}'
Essayez quelques entrées différentes pour vérifier le sens des classifications:
uip codedagent run agent '{"description": "Slay the ancient red dragon terrorizing the countryside"}'
uip codedagent run agent '{"description": "Slay the ancient red dragon terrorizing the countryside"}'
Étape 7 - Créer des tests d’évaluation
Les évaluations testent les performances de votre agent sur une plage d'entrées. La compétence uipath-agents inclut la référence complète du cadre d’évaluation: types d’évaluateurs, schéma d’ensemble d’évaluation, conventions de structure d’annuaire et meilleures pratiques telles que l’utilisation gpt-4.1 (non mini) pour les évaluateurs de juge LLM. Votre agent de codage l'utilise pour produire des configurations d'évaluateur et des ensembles de test corrects à partir d'une courte invite.
Demandez à votre agent de codage:
Create an evaluation set for the intake classifier agent with 5 test cases:
1. A clearly trivial request (e.g., delivering a letter)
2. A standard request (e.g., escort a caravan)
3. A heroic request (e.g., clear a goblin stronghold)
4. A legendary request (e.g., slay a dragon)
5. An edge case with ambiguous difficulty
Use both a semantic similarity evaluator (to check the output) and a
trajectory evaluator (to check the agent's reasoning path).
Include evaluator config files in evaluations/evaluators/ and the eval
set in evaluations/eval-sets/. Use gpt-4.1-2025-04-14 as the model in
the evaluator configs. Each evaluator config must include a populated
defaultEvaluationCriteria - use {"expectedOutput": {}} for the
semantic evaluator and {"expectedAgentBehavior": ""} for the
trajectory evaluator. Empty {} fails schema validation.
Create an evaluation set for the intake classifier agent with 5 test cases:
1. A clearly trivial request (e.g., delivering a letter)
2. A standard request (e.g., escort a caravan)
3. A heroic request (e.g., clear a goblin stronghold)
4. A legendary request (e.g., slay a dragon)
5. An edge case with ambiguous difficulty
Use both a semantic similarity evaluator (to check the output) and a
trajectory evaluator (to check the agent's reasoning path).
Include evaluator config files in evaluations/evaluators/ and the eval
set in evaluations/eval-sets/. Use gpt-4.1-2025-04-14 as the model in
the evaluator configs. Each evaluator config must include a populated
defaultEvaluationCriteria - use {"expectedOutput": {}} for the
semantic evaluator and {"expectedAgentBehavior": ""} for the
trajectory evaluator. Empty {} fails schema validation.
Étape 8 - Exécuter les évaluations
Exécutez l'ensemble d'évaluation localement:
uip codedagent eval agent evaluations/eval-sets/smoke-test.json --workers 3 --output-file eval-results.json
uip codedagent eval agent evaluations/eval-sets/smoke-test.json --workers 3 --output-file eval-results.json
Le cadre d'évaluation exécute chaque cas de test via votre agent et donne un score aux résultats.
| Score | Ce qu'il mesure |
|---|---|
| Similitude sémantique | La proximité de la sortie de l’agent avec la sortie attendue |
| Trajectoire de l'agent | Indique si l’agent a suivi le chemin de raisonnement attendu |
Attendez-vous à des scores de trajectoire de 0,0 sur cet agent. Les évaluateurs de trajectoire évaluent le chemin de raisonnement de l’agent: les outils qu’il a appelés, dans quel ordre et comment il a été routé entre les nœuds. Ce classifieur n’effectue aucun appel d’outil et possède un nœud unique, de sorte que chaque cas de test affiche un score de 0,0. Pour ce classifieur à nœud unique, basez-vous sur les scores de similarité sémantique.
Pour la similarité sémantique, les scores supérieurs à 0,8 sont généralement solides. Examinez eval-results.json pour voir comment votre agent a fonctionné.
Après vous être connecté à Studio Web lors de l'étape suivante, l'exécution de uip codedagent eval run depuis la CLI charge automatiquement les résultats dans Studio Web; elles apparaissent dans l'onglet Ensembles d'évaluation sous Exécutions.
Le bouton Exécuter les évaluations de Studio Web n’est pas identique. Ce bouton déclenche une exécution de robot cloud nécessitant une prise en charge du runtime Python — une configuration plus impliquée en dehors du champ d'application de ce laboratoire. Utilisez uip codedagent eval run à partir de la CLI à la place; les résultats apparaissent dans Studio Web dans l'une ou l'autre des cas.
Les résultats de l'évaluation locale ayant été confirmés, vous êtes prêt à connecter le projet à Studio Web dans la section suivante.