- Visão geral
- Introdução aos agentes da UiPath
- Introdução aos agentes da UiPath usando o LangGraph
- Construção de um agente de pouco código no Studio Web
- Adicionando ferramentas ao seu agente UiPath
Execute traces de avaliação localmente e revise os resultados que fluem para o Studio Web.
Com o agente em execução localmente e os pontos de entrada registrados, você está pronto para executá-lo e criar um conjunto de avaliação.
Etapa 6 - Executar o agente localmente
Execute o agente com o arquivo de entrada de amostra que seu agente de codificação criou:
uip codedagent run agent --file input.json
uip codedagent run agent --file input.json
Você deve ver o agente classificar a solicitação e retornar um nível com raciocínio.
Você também pode passar a entrada em linha. Esses exemplos usam a sintaxe de aspas simples do Bash; se você estiver no PowerShell, use --file com um arquivo JSON:
uip codedagent run agent '{"description": "Clear the rats out of the inn cellar"}'
uip codedagent run agent '{"description": "Clear the rats out of the inn cellar"}'
Tente algumas entradas diferentes para verificar se as classificações fazem sentido:
uip codedagent run agent '{"description": "Slay the ancient red dragon terrorizing the countryside"}'
uip codedagent run agent '{"description": "Slay the ancient red dragon terrorizing the countryside"}'
Etapa 7 - Criar testes de avaliação
As avaliações testam o desempenho do seu agente em um intervalo de entradas. uipath-agents habilidade inclui a referência completa da estrutura de avaliação: tipos de avaliadores, esquema de conjunto de avaliação, convenções de estrutura de diretório e práticas recomendadas, como o uso de gpt-4.1 (não mini) para avaliadores com Julgamento via LLM. Seu agente de codificação usa isso para produzir configurações de avaliador e conjuntos de testes corretos a partir de uma breve solicitação.
Pergunte ao seu agente de codificação:
Create an evaluation set for the intake classifier agent with 5 test cases:
1. A clearly trivial request (e.g., delivering a letter)
2. A standard request (e.g., escort a caravan)
3. A heroic request (e.g., clear a goblin stronghold)
4. A legendary request (e.g., slay a dragon)
5. An edge case with ambiguous difficulty
Use both a semantic similarity evaluator (to check the output) and a
trajectory evaluator (to check the agent's reasoning path).
Include evaluator config files in evaluations/evaluators/ and the eval
set in evaluations/eval-sets/. Use gpt-4.1-2025-04-14 as the model in
the evaluator configs. Each evaluator config must include a populated
defaultEvaluationCriteria - use {"expectedOutput": {}} for the
semantic evaluator and {"expectedAgentBehavior": ""} for the
trajectory evaluator. Empty {} fails schema validation.
Create an evaluation set for the intake classifier agent with 5 test cases:
1. A clearly trivial request (e.g., delivering a letter)
2. A standard request (e.g., escort a caravan)
3. A heroic request (e.g., clear a goblin stronghold)
4. A legendary request (e.g., slay a dragon)
5. An edge case with ambiguous difficulty
Use both a semantic similarity evaluator (to check the output) and a
trajectory evaluator (to check the agent's reasoning path).
Include evaluator config files in evaluations/evaluators/ and the eval
set in evaluations/eval-sets/. Use gpt-4.1-2025-04-14 as the model in
the evaluator configs. Each evaluator config must include a populated
defaultEvaluationCriteria - use {"expectedOutput": {}} for the
semantic evaluator and {"expectedAgentBehavior": ""} for the
trajectory evaluator. Empty {} fails schema validation.
Etapa 8 - Executar avaliações
Execute o conjunto de avaliação localmente:
uip codedagent eval agent evaluations/eval-sets/smoke-test.json --workers 3 --output-file eval-results.json
uip codedagent eval agent evaluations/eval-sets/smoke-test.json --workers 3 --output-file eval-results.json
A estrutura de avaliação executa cada caso de teste por meio do seu agente e pontua os resultados.
| Pontuação | O que ele mede |
|---|---|
| Similaridade semântica | O grau de semelhança da saída do agente com a saída esperada |
| Trajetória do agente | Se o agente seguiu o caminho de raciocínio esperado |
Espere pontuações de trajetória de 0.0 neste agente. Os avaliadores de trajetória julgam o caminho de raciocínio do agente: quais ferramentas ele chamei, em qual ordem e como ele roteou entre os nós. Esse classificador não faz chamadas de ferramenta e tem um único nó, então cada caso de teste pontua 0.0. Para este classificador de nó único, use pontuações de similaridade semântica.
Para similaridade semântica, as pontuações acima de 0,8 são geralmente sólidas. eval-results.json para ver como foi o desempenho do seu agente.
Depois de se conectar ao Studio Web na próxima etapa, a execução de uip codedagent eval run a partir da CLI carrega os resultados para o Studio Web automaticamente; eles aparecem na aba Conjuntos de avaliação em Execuções.
O botão Avaliações do Studio Web Run não é a mesma coisa. Esse botão dispara uma execução de robô na nuvem que requer suporte para runtime do Python — uma configuração mais envolvida fora do escopo deste laboratório. Em vez disso, use uip codedagent eval run a partir da CLI; os resultados aparecem no Studio Web de qualquer maneira.
Com os resultados da avaliação local confirmados, você está pronto para conectar o projeto ao Studio Web na próxima seção.