UiPath Documentation
maestro
latest
false
Guia do usuário do Maestro
Importante :
A localização de um conteúdo recém-publicado pode levar de 1 a 2 semanas para ficar disponível.

Avaliações

Verificações de qualidade automatizadas para saídas de fluxo de trabalho do fluxo, agrupadas em conjuntos de avaliação e pontuadas em relação aos avaliadores que você anexa a cada execução.

As avaliações permitem que você defina verificações de qualidade automatizadas nas saídas de um fluxo de trabalho Flow. Você agrupa resultados esperados em um conjunto de avaliação e o Flow pontua cada execução em relação aos avaliadores que você anexar.

Conceitos

  • Conjunto de avaliação — uma coleção de pontos de dados que têm o mesmo assunto. Execute o conjunto para marcar o fluxo de trabalho em relação a cada ponto de dados de uma só vez.
  • Ponto de dados — um único caso: um conjunto de valores de entrada e a saída esperada para essas entradas. Crie um ponto de dados manualmente ou capture um de uma execução real (consulte Captura de um ponto de dados de uma execução).
  • Conjunto de dados — os pontos de dados que compõem um conjunto de avaliação.
  • Avaliador — uma verificação que compara a saída real com a saída esperada e produz uma pontuação. Um avaliador booleano produz aprovação ou falha por avaliador.
  • Pontuação — o resultado que um avaliador relata para um ponto de dados.

Conjuntos de avaliação no nível do nó versus no nível do fluxo

Um conjunto de avaliação tem como alvo um único nó ou todo o fluxo:

  • Nível de nó — fixado a um nó. Cada ponto de dados fornece as entradas desse nó e sua saída esperada.
  • Nível de fluxo — fixado em um ponto de entrada de gatilho. Cada ponto de dados fornece as entradas do gatilho e a saída esperada do fluxo.

Você não pode misturar pontos de dados no nível do nó e no nível do fluxo no mesmo conjunto de avaliação.

Avaliadores

O fluxo agrupa os avaliadores em três família.

Determinista

Compare a saída com a saída esperada exatamente, sem nenhum modelo no loop.

  • Contém — verifica se a saída contém uma substring esperada.
  • Correspondência exata — verifica se a saída é igual ao valor esperado.
  • Similaridade do JSON — compara a saída e a saída esperada como JSON.

juiz do LLM

Use um modelo para avaliar a saída em relação à saída esperada.

  • Similaridade semântica de saída — julga se a saída significa o mesmo que a saída esperada.
  • Saída de similaridade JSON estrita — julga a saída JSON em relação ao JSON esperado.
  • Similaridade de trajetória — julga as etapas que o agente seguiu contra uma trajetória esperada.
  • Simulação de trajetória — julga uma trajetória simulada.

Chamada da ferramenta

Verifique como um nó chama suas ferramentas. Esses avaliadores são apenas no nível de nó.

  • Correspondência de argumento — verifica os argumentos passados para uma chamada de ferramenta.
  • Contagem de chamadas — verifica quantas vezes uma ferramenta foi chamada.
  • Ordem de chamada — verifica a ordem na qual as ferramentas foram chamadas.
  • Correspondência de saída — verifica a saída de uma chamada de ferramenta.

Ciclo de vida do conjunto de avaliação

Um conjunto de avaliação é construído em torno de um assunto, pontos de dados e avaliadores. O assunto é um único nó ou um ponto de entrada de gatilho. Cada ponto de dados fornece valores de entrada e a saída esperada, e cada avaliador define como o Fluxo pontua o resultado da execução.

Quando um conjunto de avaliação é executado, o Fluxo executa o assunto para cada ponto de dados e exibe as pontuações por avaliador no histórico de avaliação.

Capturando um ponto de dados de uma execução

Você não tem que criar cada ponto de dados manualmente. Você pode criar um importando uma execução real: capture uma execução de depuração e suas entradas e saídas se tornam a entrada e a saída esperada do ponto de dados. Essa é uma maneira rápida de gerar um conjunto de avaliação a partir do comportamento real que você já observara.

Uso de avaliações em desenvolvimento

As avaliações são mais úteis quando:

  • Você está criando fluxos de trabalho que invocam agentes de IA e precisa verificar se a saída do agente atende às expectativas de qualidade antes de publicar.
  • Você precisa de cobertura de regressão — a execução de avaliações após cada alteração confirma que o comportamento existente não foi interrompido.
  • Você deseja comparar implementações alternativas executando avaliações em duas versões do mesmo fluxo de trabalho.

Resultados da avaliação

Os resultados são armazenados no histórico de avaliação e podem ser revisados a qualquer momento. Cada execução mostra as pontuações por avaliador, resultados de pontos de dados individuais e os valores reais versus esperados para cada ponto de dados.

Exemplo prático

Um fluxo de trabalho que usa um agente de IA para classificar e-mails de suporte ao cliente. Antes de publicar, você configura um conjunto de avaliação com 10 pontos de dados:

  • Cinco emails que devem ser classificados como "billing"
  • Três emails que devem ser classificados como "technical"
  • 2 casos extremos (e-mails ambíguos)

Cada ponto de dados define o valor de saída classification esperado. Um avaliador de correspondência exata nas pontuações de classificação de cada resultado, e a execução de avaliação mostra quais casos o agente errou antes que o fluxo de trabalho fosse para produção.

Erros comuns

  • Execução de um conjunto de avaliação apenas uma vez — Os conjuntos de avaliação são mais úteis após cada alteração significativa em um fluxo de trabalho que invoca um agente de IA. O comportamento do agente pode mudar à medida que os modelos são atualizados, mesmo que o fluxo de trabalho não tenha sido alterado.
  • Escrevendo pontos de dados apenas para o caminho feliz — As avaliações são mais valiosas para casos de borda e modos de falha. Os pontos de dados fortes incluem entradas ambíguas, malformadas ou no limite do intervalo esperado.
  • Tratar uma pontuação de aprovação total como um sinal para interromper os testes — Três pontos de dados de passagem não é confiança. Conjuntos maiores, especialmente aqueles que refletem entradas reais da produção, fornecem uma cobertura mais forte.

Esta página foi útil?

Conectar

Precisa de ajuda? Suporte

Quer aprender? Academia UiPath

Tem perguntas? Fórum do UiPath

Fique por dentro das novidades