- Introdução
- Introdução
- Criação com o Maestro BPMN
- Entendendo a modelagem BPMN do Maestro
- Abertura da tela de modelagem
- Modelagem de seu processo
- Alinhamento e conexão de elementos BPMN
- Patterns library
- Autopilot para Maestro (visualização)
- Repositório de processos
- Implementação de um processo BPMN simples
- Implementação de um processo BPMN complexo
- Depuração
- Simulação
- Avaliações (pré-visualização)
- Cenários de implementação comuns
- Criação com o Maestro Case
- Introdução ao Maestro Case
- Maestro BPMN versus Maestro Case: quando usar o Case Management
- O ciclo de vida do Maestro Case: do disparo de eventos à experiência do aplicativo
- Crie seu primeiro caso com o Maestro Case
- Crie um Maestro Case com um agente de codificação (visualização)
- Definição de chaves de caso (sistema versus externo)
- Estabelecimento de contratos de E/S e de write-back
- Regras de saída e término do estágio inicial
- Modelagem de estágios primário e secundário
- Disparo de um caso a partir do Data Fabric
- Implementação de personas e permissões no nível de estágio
- Configuração de SLAs e regras de escalonamento automatizadas
- Configuração de um loop de retrabalho (reentrada)
- Configuração e teste do agente do caso (pré-visualização)
- Contrato de entrada e saída do Case Manager
- Dicionário de componentes Maestro Case
- Criação com o Maestro Flow
- Maestro Automate
- Integrações
- Operando
- Monitoramento
- Otimizando
- Informações de referência
Avaliações (pré-visualização)
Verificações de qualidade automatizadas para fluxos de trabalho BPMN do Maestro, com conjuntos de avaliação, avaliadores determinísticos e com juiz de LLM e simulações de saída de nó.
As avaliações permitem que você defina verificações de qualidade automatizadas para um fluxo de trabalho BPMN do Maestro. Você agrupa os resultados esperados em um conjunto de avaliação, e cada execução é pontuada em relação aos avaliadores que você anexar.
As avaliações usam a mesma estrutura de avaliação já disponível para Agents de IA e Maestro Flow, portanto, os fluxos de trabalho com etapas não determinísticas podem ser verificados antes de serem enviados.
Conceitos
- Conjunto de dados — uma coleção de pontos de dados que têm o mesmo assunto. A execução do conjunto pontua o fluxo de trabalho em relação a cada ponto de dados de uma só vez.
- Ponto de dados — um único caso: um conjunto de valores de entrada e a saída esperada para essas entradas. Você pode criar um ponto de dados manualmente ou capturar um de uma execução real.
- Avaliador — um classificador que compara a saída real com a saída esperada ou a trajetória com uma trajetória esperada e produz uma pontuação.
- Pontuação — o resultado que um avaliador relata para um ponto de dados.
Conjuntos de avaliação no nível do BPMN
Um conjunto de avaliação tem como alvo todo o fluxo de trabalho BPMN do Maestro. Ele é fixado em um ponto de entrada de gatilho e cada ponto de dados fornece as entradas do gatilho e a saída esperada do fluxo de trabalho.
Conjuntos de avaliação no nível do nó fixar uma avaliação em um único nó, para que cada ponto de dados forneça as entradas desse nó e sua saída esperada. As avaliações no nível do nó não fazem parte desta visualização pública.
Avaliadores
Os avaliadores BPMN do Maestro enquadram-se em duas família.
Determinista
Esses avaliadores comparam a saída com a saída esperada exatamente, sem nenhum modelo no loop.
- Contém — verifica se a saída contém uma substring esperada.
- Correspondência exata — verifica se a saída é igual ao valor esperado.
- Similaridade do JSON — compara a saída e a saída esperada como JSON.
Juiz de LLM
Esses avaliadores usam um modelo para julgar a saída em relação à saída esperada.
- Similaridade semântica da saída — julga se a saída significa o mesmo que a saída esperada.
- Similaridade rigorosa de saída JSON — julga a saída JSON em relação ao JSON esperado.
- Similaridade de trajetória — julga as etapas que o agente seguiu em relação a uma trajetória esperada.
- Simulação de trajetória — julga uma trajetória simulada.
Captura de um ponto de dados de uma execução
Você não tem que criar cada ponto de dados manualmente. Você pode criar um importando uma execução real: quando você captura uma execução de depuração, suas entradas e saídas se tornam a entrada e a saída esperada do ponto de dados.
Capturar uma execução é uma maneira rápida de gerar um conjunto de avaliação a partir do comportamento real que você já observara.
Quando usar avaliações
As avaliações são mais úteis quando:
- Você está criando fluxos de trabalho BPMN do Maestro que invocam agentes de IA e precisa verificar se a saída do agente atende às expectativas de qualidade antes de publicar.
- Você precisa de cobertura de regressão, e a execução de avaliações após cada alteração confirma que o comportamento existente não foi interrompido.
- Você deseja comparar implementações alternativas executando avaliações em duas versões do mesmo fluxo de trabalho.
Resultados da avaliação
Os resultados são armazenados no histórico de avaliação e podem ser revisados a qualquer momento. Eles são visíveis para os usuários que os executam e podem ser exportados como JSON ou CSV. Traces individuais dentro de uma execução de avaliação também podem ser exportados.
A aba Histórico de execuções de avaliação mostra, para cada execução:
- Pontuações por avaliador, juntamente com a justificativa do classificador
- Resultados de pontos de dados individuais, com valores reais e esperados lado a lado
- O trace completo: o que disparou a execução, o caminho que seguiu, saída por nó e tempo
O rastreamento e a justificativa do classificador indicam o que precisa mudar para que o fluxo de trabalho seja executado corretamente em cada caso.
Exemplo: classificação de emails de suporte
Um fluxo de trabalho BPMN do Maestro usa um agente de IA para classificar e-mails de suporte ao cliente. Antes de publicar, você configura um conjunto de avaliação com 10 pontos de dados:
- 5 emails classificados como
"billing" - 3 emails classificados como
"technical" - Dois emails ambíguos, tratados como casos extremos
Cada ponto de dados define o valor de saída classification esperado ou um escalonamento acionado para um humano para os e-mails ambíguos. Um avaliador de correspondência exata nas pontuações de classificação de cada resultado para "billing" ou "technical", e um avaliador de trajetória verifica o escalonamento humano. Cada execução mostra em quais casos o agente errou antes que o fluxo de trabalho fosse para produção.
Simulações de nós
As simulações substituem saídas de nós selecionadas durante uma execução de avaliação, para que você possa testar a lógica subsequente sem executar a ação real de um nó. Isso é útil quando a ação real é lenta, cara ou depende de sistemas externos que não estão disponíveis durante o projeto.
Quando uma simulação é habilitada em um nó, a execução ignora a execução real desse nó e usa os valores de saída simulados diretamente. Todos os nós subsequentes recebem os valores simulados como se o nó tivesse sido executado normalmente.
As simulações são aplicáveis apenas durante execuções de teste. Eles nunca estão ativos em fluxos de trabalho de produção publicados.
Estratégias de simulação
Cada nó simulado usa uma de duas estratégias:
- Simulação estática — uma simulação baseada em regras que sempre retorna o valor que você define.
- Simulação gerada — uma resposta gerada pelo LLM, produzida dinamicamente cada vez que a avaliação é executada.
Configuração de uma simulação
Configure uma simulação em qualquer nó cuja saída real você deseja substituir durante uma execução de avaliação. A sequência a seguir mostra o fluxo completo, desde a seleção do nó até a entrada da saída simulada.
- Selecione o nó que você deseja simular na tela.
- No painel de configuração, abra Adicionar simulação.
- Escolha a estratégia de simulação para o nó.
- Insira a saída simulada para a estratégia que você escolheu:
- Para Simulação estática, insira os valores de saída, editando o JSON manualmente ou gerando-o com a funcionalidade de prompt. Use JSON válido que corresponda ao esquema de saída do nó.
- Para Simulação gerada, insira a solicitação que o modelo usa para gerar uma resposta de ferramenta em cada execução de avaliação.
Resultado: o nó é simulado. Na próxima execução de teste, o Maestro BPMN pula sua execução real e injeta seus valores subsequentes.
Nós que você pode simular
As simulações são úteis nos seguintes tipos de nó:
- Tarefa humana — retorna uma resposta aprovada ou rejeitada sem esperar um aprovador real.
- Solicitação HTTP — retorna uma resposta de API específica, incluindo respostas de erro, para que você possa testar seus caminhos de tratamento de erros.
- Agente — retorna a saída de um agente de IA, para que você possa testar como seu fluxo de trabalho lida com diferentes respostas do agente.
- Conexão — retorna a saída de um nó de conexão, para que você possa testar o fluxo de trabalho sem fazer alterações em aplicativos externos.
Disponibilidade e licenciamento
- As avaliações estão disponíveis para usuários com os tipos de licença e planos de licenciamento de organização do Automation Cloud detalhados em Licenciamento.
- Simulações de nós, geração de simulação usando funcionalidades de LLM dentro de avaliações e avaliadores com juiz de LLM são gratuitos durante a visualização. As execuções BPMN do Maestro em design consomem dos limites mensais do usuário.
Restrições conhecidas
- As avaliações no nível do nó não estão disponíveis.
- As avaliações BPMN do Maestro não têm suporte para habilidades CLI .
Páginas relacionadas
- Conceitos
- Conjuntos de avaliação no nível do BPMN
- Avaliadores
- Determinista
- Juiz de LLM
- Captura de um ponto de dados de uma execução
- Quando usar avaliações
- Resultados da avaliação
- Exemplo: classificação de emails de suporte
- Simulações de nós
- Estratégias de simulação
- Configuração de uma simulação
- Nós que você pode simular
- Disponibilidade e licenciamento
- Restrições conhecidas
- Páginas relacionadas