UiPath Documentation
maestro
latest
false
Guia do usuário do Maestro
Importante :
A localização de um conteúdo recém-publicado pode levar de 1 a 2 semanas para ficar disponível.

Avaliações (pré-visualização)

Verificações de qualidade automatizadas para fluxos de trabalho BPMN do Maestro, com conjuntos de avaliação, avaliadores determinísticos e com juiz de LLM e simulações de saída de nó.

As avaliações permitem que você defina verificações de qualidade automatizadas para um fluxo de trabalho BPMN do Maestro. Você agrupa os resultados esperados em um conjunto de avaliação, e cada execução é pontuada em relação aos avaliadores que você anexar.

As avaliações usam a mesma estrutura de avaliação já disponível para Agents de IA e Maestro Flow, portanto, os fluxos de trabalho com etapas não determinísticas podem ser verificados antes de serem enviados.

Conceitos​

  • Conjunto de dados — uma coleção de pontos de dados que têm o mesmo assunto. A execução do conjunto pontua o fluxo de trabalho em relação a cada ponto de dados de uma só vez.
  • Ponto de dados — um único caso: um conjunto de valores de entrada e a saída esperada para essas entradas. Você pode criar um ponto de dados manualmente ou capturar um de uma execução real.
  • Avaliador — um classificador que compara a saída real com a saída esperada ou a trajetória com uma trajetória esperada e produz uma pontuação.
  • Pontuação — o resultado que um avaliador relata para um ponto de dados.

Conjuntos de avaliação no nível do BPMN​

Um conjunto de avaliação tem como alvo todo o fluxo de trabalho BPMN do Maestro. Ele é fixado em um ponto de entrada de gatilho e cada ponto de dados fornece as entradas do gatilho e a saída esperada do fluxo de trabalho.

Conjuntos de avaliação no nível do nó fixar uma avaliação em um único nó, para que cada ponto de dados forneça as entradas desse nó e sua saída esperada. As avaliações no nível do nó não fazem parte desta visualização pública.

Avaliadores​

Os avaliadores BPMN do Maestro enquadram-se em duas família.

Determinista​

Esses avaliadores comparam a saída com a saída esperada exatamente, sem nenhum modelo no loop.

  • Contém — verifica se a saída contém uma substring esperada.
  • Correspondência exata — verifica se a saída é igual ao valor esperado.
  • Similaridade do JSON — compara a saída e a saída esperada como JSON.

Juiz de LLM​

Esses avaliadores usam um modelo para julgar a saída em relação à saída esperada.

  • Similaridade semântica da saída — julga se a saída significa o mesmo que a saída esperada.
  • Similaridade rigorosa de saída JSON — julga a saída JSON em relação ao JSON esperado.
  • Similaridade de trajetória — julga as etapas que o agente seguiu em relação a uma trajetória esperada.
  • Simulação de trajetória — julga uma trajetória simulada.

Captura de um ponto de dados de uma execução​

Você não tem que criar cada ponto de dados manualmente. Você pode criar um importando uma execução real: quando você captura uma execução de depuração, suas entradas e saídas se tornam a entrada e a saída esperada do ponto de dados.

Capturar uma execução é uma maneira rápida de gerar um conjunto de avaliação a partir do comportamento real que você já observara.

Quando usar avaliações​

As avaliações são mais úteis quando:

  • Você está criando fluxos de trabalho BPMN do Maestro que invocam agentes de IA e precisa verificar se a saída do agente atende às expectativas de qualidade antes de publicar.
  • Você precisa de cobertura de regressão, e a execução de avaliações após cada alteração confirma que o comportamento existente não foi interrompido.
  • Você deseja comparar implementações alternativas executando avaliações em duas versões do mesmo fluxo de trabalho.

Resultados da avaliação​

Os resultados são armazenados no histórico de avaliação e podem ser revisados a qualquer momento. Eles são visíveis para os usuários que os executam e podem ser exportados como JSON ou CSV. Traces individuais dentro de uma execução de avaliação também podem ser exportados.

A aba Histórico de execuções de avaliação mostra, para cada execução:

  • Pontuações por avaliador, juntamente com a justificativa do classificador
  • Resultados de pontos de dados individuais, com valores reais e esperados lado a lado
  • O trace completo: o que disparou a execução, o caminho que seguiu, saída por nó e tempo

O rastreamento e a justificativa do classificador indicam o que precisa mudar para que o fluxo de trabalho seja executado corretamente em cada caso.

Exemplo: classificação de emails de suporte​

Um fluxo de trabalho BPMN do Maestro usa um agente de IA para classificar e-mails de suporte ao cliente. Antes de publicar, você configura um conjunto de avaliação com 10 pontos de dados:

  • 5 emails classificados como "billing"
  • 3 emails classificados como "technical"
  • Dois emails ambíguos, tratados como casos extremos

Cada ponto de dados define o valor de saída classification esperado ou um escalonamento acionado para um humano para os e-mails ambíguos. Um avaliador de correspondência exata nas pontuações de classificação de cada resultado para "billing" ou "technical", e um avaliador de trajetória verifica o escalonamento humano. Cada execução mostra em quais casos o agente errou antes que o fluxo de trabalho fosse para produção.

Simulações de nós​

As simulações substituem saídas de nós selecionadas durante uma execução de avaliação, para que você possa testar a lógica subsequente sem executar a ação real de um nó. Isso é útil quando a ação real é lenta, cara ou depende de sistemas externos que não estão disponíveis durante o projeto.

Quando uma simulação é habilitada em um nó, a execução ignora a execução real desse nó e usa os valores de saída simulados diretamente. Todos os nós subsequentes recebem os valores simulados como se o nó tivesse sido executado normalmente.

As simulações são aplicáveis apenas durante execuções de teste. Eles nunca estão ativos em fluxos de trabalho de produção publicados.

Estratégias de simulação​

Cada nó simulado usa uma de duas estratégias:

  • Simulação estática — uma simulação baseada em regras que sempre retorna o valor que você define.
  • Simulação gerada — uma resposta gerada pelo LLM, produzida dinamicamente cada vez que a avaliação é executada.

Configuração de uma simulação​

Configure uma simulação em qualquer nó cuja saída real você deseja substituir durante uma execução de avaliação. A sequência a seguir mostra o fluxo completo, desde a seleção do nó até a entrada da saída simulada.

  1. Selecione o nó que você deseja simular na tela.
  2. No painel de configuração, abra Adicionar simulação.
  3. Escolha a estratégia de simulação para o nó.
  4. Insira a saída simulada para a estratégia que você escolheu:
    1. Para Simulação estática, insira os valores de saída, editando o JSON manualmente ou gerando-o com a funcionalidade de prompt. Use JSON válido que corresponda ao esquema de saída do nó.
    2. Para Simulação gerada, insira a solicitação que o modelo usa para gerar uma resposta de ferramenta em cada execução de avaliação.

Resultado: o nó é simulado. Na próxima execução de teste, o Maestro BPMN pula sua execução real e injeta seus valores subsequentes.

Nós que você pode simular​

As simulações são úteis nos seguintes tipos de nó:

  • Tarefa humana — retorna uma resposta aprovada ou rejeitada sem esperar um aprovador real.
  • Solicitação HTTP — retorna uma resposta de API específica, incluindo respostas de erro, para que você possa testar seus caminhos de tratamento de erros.
  • Agente — retorna a saída de um agente de IA, para que você possa testar como seu fluxo de trabalho lida com diferentes respostas do agente.
  • Conexão — retorna a saída de um nó de conexão, para que você possa testar o fluxo de trabalho sem fazer alterações em aplicativos externos.

Disponibilidade e licenciamento​

  • As avaliações estão disponíveis para usuários com os tipos de licença e planos de licenciamento de organização do Automation Cloud detalhados em Licenciamento.
  • Simulações de nós, geração de simulação usando funcionalidades de LLM dentro de avaliações e avaliadores com juiz de LLM são gratuitos durante a visualização. As execuções BPMN do Maestro em design consomem dos limites mensais do usuário.

Restrições conhecidas​

  • As avaliações no nível do nó não estão disponíveis.
  • As avaliações BPMN do Maestro não têm suporte para habilidades CLI .

Esta página foi útil?

Conectar

Precisa de ajuda? Suporte

Quer aprender? Academia UiPath

Tem perguntas? Fórum do UiPath

Fique por dentro das novidades