UiPath Documentation
maestro
latest
false
Guia do usuário do Maestro
Importante :
A localização de um conteúdo recém-publicado pode levar de 1 a 2 semanas para ficar disponível.

Avaliações

Verificações de qualidade automatizadas para saídas de fluxo de trabalho do Flow, agrupadas em conjuntos de avaliação e pontuadas em relação aos avaliadores que você anexa a cada execução.

As avaliações permitem definir verificações de qualidade automatizadas nas saídas de um fluxo de trabalho do Flow. Você agrupa os resultados esperados em um conjunto de avaliação o Fluxo pontua cada execução em relação aos avaliadores que você anexa.

Conceitos​

  • Conjunto de avaliação — uma coleção de pontos de dados que têm como destino o mesmo assunto. Execute o conjunto para pontuar o fluxo de trabalho em relação a cada ponto de dados de uma só vez.
  • Ponto de dados — um caso único: um conjunto de valores de entrada e a saída esperada para essas entradas. Crie um ponto de dados manualmente ou capture um de uma execução real (consulte Captura de um ponto de dados de uma execução).
  • Conjunto de dados — os pontos de dados que compõem um conjunto de avaliação.
  • Avaliador — uma verificação que compara a saída real com a saída esperada e produz uma pontuação. Um avaliador booleano produz aprovação ou reprovação por avaliador.
  • Pontuação — o resultado que um avaliador relata para um ponto de dados.

Conjuntos de avaliação no nível de nó versus no nível de fluxo​

Um conjunto de avaliação foca ou em um único nó ou em todo o fluxo:

  • Nível de nó — fixado em um nó. Cada ponto de dados fornece as entradas desse nó e sua saída esperada.
  • Nível de fluxo — fixado em um ponto de entrada de gatilho. Cada ponto de dados fornece as entradas do gatilho e a saída esperada do fluxo.

Você não pode misturar pontos de dados no nível de nó e no nível de fluxo no mesmo conjunto de avaliação.

Avaliadores​

O fluxo agrupa avaliadores em três famílias.

Determinista​

Compare a saída com a saída esperada exatamente, sem nenhum modelo no loop.

  • Contém — verifica se a saída contém uma substring esperada.
  • Correspondência exata — verifica se a saída é igual ao valor esperado.
  • Similaridade do JSON — compara a saída e a saída esperada como JSON.

Juiz de LLM​

Use um modelo para julgar a saída em relação à saída esperada.

  • Similaridade semântica da saída — julga se a saída significa o mesmo que a saída esperada.
  • Similaridade rigorosa de saída JSON — julga a saída JSON em relação ao JSON esperado.
  • Similaridade de trajetória — julga as etapas que o agente seguiu em relação a uma trajetória esperada.
  • Simulação de trajetória — julga uma trajetória simulada.

Chamada de ferramenta​

Verificar como um nó chamou suas ferramentas. Esses avaliadores estão apenas no nível de nó.

  • Correspondência de argumentos — verifica os Argumentos passados para uma chamada de ferramenta.
  • Contagem de chamadas — verifica quantas vezes uma ferramenta foi chamada.
  • Ordem de chamadas — verifica a ordem em que as ferramentas foram chamadas.
  • Correspondência de saída — verifica a saída de uma chamada de ferramenta.

Ciclo de vida do conjunto de avaliação​

Cria-se um conjunto de avaliação em torno de um assunto, pontos de dados e avaliadores. O assunto é um nó único ou um ponto de entrada do gatilho. Cada ponto de dados fornece valores de entrada e a saída esperada, e cada avaliador define como o Fluxo pontua o resultado da execução.

Quando um conjunto de avaliação é executado, o Fluxo executa o assunto para cada ponto de dados e exibe as pontuações por avaliador no histórico de avaliação.

Captura de um ponto de dados de uma execução​

Você não precisa criar manualmente todos os pontos de dados. Você pode criar um importando uma execução real: capture uma execução de depuração, e suas entradas e saídas se tornam a entrada e a saída esperadas do ponto de dados. Essa é uma maneira rápida de semear um conjunto de avaliação a partir do comportamento real que você já observou.

Uso de avaliações no desenvolvimento​

As avaliações são mais úteis quando:

  • Você está criando fluxos de trabalho que invocam agentes de IA e precisa verificar se a saída do agente atende às expectativas de qualidade antes da publicação.
  • Você precisa de cobertura de regressão — executar avaliações após cada alteração confirma que o comportamento existente não foi violado.
  • Você deseja comparar implementações alternativas executando avaliações em duas versões do mesmo fluxo de trabalho.

Resultados da avaliação​

Os resultados são armazenados no histórico de avaliações e podem ser revisados a qualquer momento. Cada execução mostra as pontuações por avaliador, resultados de pontos de dados individuais e os valores reais em comparação com valores esperados para cada ponto de dados.

Exemplo prático​

Um fluxo de trabalho que usa um agente de IA para classificar e-mails de suporte ao cliente. Antes de publicar, você configura um conjunto de avaliação com 10 pontos de dados:

  • 5 e-mails que devem ser classificados como "billing"
  • 3 e-mails que devem ser classificados como "technical"
  • 2 casos de borda (e-mails ambíguos)

Cada ponto de dados define o valor de saída classificationesperado. Um avaliador de Correspondência exata na classificação classifica cada resultado, e a execução de avaliação mostra em quais casos o agente errou antes que o fluxo de trabalho entrasse em produção.

Erros comuns​

  • Execução de um conjunto de avaliação apenas uma vez — os conjuntos de avaliação são mais úteis após cada alteração significativa em um fluxo de trabalho que invoca um agente de IA. O comportamento do agente pode mudar à medida que os modelos são atualizados, mesmo se o fluxo de trabalho não tenha sido alterado.
  • Gravação de pontos de dados apenas para o caminho feliz — as avaliações são mais valiosas para casos de borda e modos de falha. Os pontos de dados fortes incluem entradas ambíguas, malformadas ou no limite do intervalo esperado.
  • Tratar uma pontuação de aprovação total como um sinal para interromper os testes — Três pontos de dados de passagem não é confiança. Conjuntos maiores, especialmente aqueles que refletem entradas reais da produção, fornecem uma cobertura mais forte.

Esta página foi útil?

Conectar

Precisa de ajuda? Suporte

Quer aprender? Academia UiPath

Tem perguntas? Fórum do UiPath

Fique por dentro das novidades