- Introdução
- Introdução
- Criação com o Maestro BPMN
- Entendendo a modelagem BPMN do Maestro
- Abertura da tela de modelagem
- Modelagem de seu processo
- Alinhamento e conexão de elementos BPMN
- Autopilot para Maestro (visualização)
- Repositório de processos
- Implementação de um processo BPMN simples
- Implementação de um processo BPMN complexo
- Depuração
- Simulação
- Evaluations (Preview)
- Cenários de implementação comuns
- Criação com o Maestro Case
- Introdução ao Maestro Case
- Maestro BPMN versus Maestro Case: quando usar o Case Management
- O ciclo de vida do Maestro Case: do disparo de eventos à experiência do aplicativo
- Crie seu primeiro caso com o Maestro Case
- Build a Maestro Case with a coding agent (preview)
- Definição de chaves de caso (sistema versus externo)
- Estabelecimento de contratos de E/S e de write-back
- Regras de saída e término do estágio inicial
- Modelagem de estágios primário e secundário
- Disparo de um caso a partir do Data Fabric
- Implementação de personas e permissões no nível de estágio
- Configuração de SLAs e regras de escalonamento automatizadas
- Configuração de um loop de retrabalho (reentrada)
- Configuring and testing the Case Manager Agent (preview)
- Contrato de entrada e saída do Case Manager
- Dicionário de componentes Maestro Case
- Criação com o Maestro Flow
- Maestro Automate
- Integrações
- Operando
- Monitoramento
- Otimizando
- Informações de referência
Verificações de qualidade automatizadas para saídas de fluxo de trabalho do Flow, agrupadas em conjuntos de avaliação e pontuadas em relação aos avaliadores que você anexa a cada execução.
As avaliações permitem definir verificações de qualidade automatizadas nas saídas de um fluxo de trabalho do Flow. Você agrupa os resultados esperados em um conjunto de avaliação o Fluxo pontua cada execução em relação aos avaliadores que você anexa.
Conceitos
- Conjunto de avaliação — uma coleção de pontos de dados que têm como destino o mesmo assunto. Execute o conjunto para pontuar o fluxo de trabalho em relação a cada ponto de dados de uma só vez.
- Ponto de dados — um caso único: um conjunto de valores de entrada e a saída esperada para essas entradas. Crie um ponto de dados manualmente ou capture um de uma execução real (consulte Captura de um ponto de dados de uma execução).
- Conjunto de dados — os pontos de dados que compõem um conjunto de avaliação.
- Avaliador — uma verificação que compara a saída real com a saída esperada e produz uma pontuação. Um avaliador booleano produz aprovação ou reprovação por avaliador.
- Pontuação — o resultado que um avaliador relata para um ponto de dados.
Conjuntos de avaliação no nível de nó versus no nível de fluxo
Um conjunto de avaliação foca ou em um único nó ou em todo o fluxo:
- Nível de nó — fixado em um nó. Cada ponto de dados fornece as entradas desse nó e sua saída esperada.
- Nível de fluxo — fixado em um ponto de entrada de gatilho. Cada ponto de dados fornece as entradas do gatilho e a saída esperada do fluxo.
Você não pode misturar pontos de dados no nível de nó e no nível de fluxo no mesmo conjunto de avaliação.
Avaliadores
O fluxo agrupa avaliadores em três famílias.
Determinista
Compare a saída com a saída esperada exatamente, sem nenhum modelo no loop.
- Contém — verifica se a saída contém uma substring esperada.
- Correspondência exata — verifica se a saída é igual ao valor esperado.
- Similaridade do JSON — compara a saída e a saída esperada como JSON.
Juiz de LLM
Use um modelo para julgar a saída em relação à saída esperada.
- Similaridade semântica da saída — julga se a saída significa o mesmo que a saída esperada.
- Similaridade rigorosa de saída JSON — julga a saída JSON em relação ao JSON esperado.
- Similaridade de trajetória — julga as etapas que o agente seguiu em relação a uma trajetória esperada.
- Simulação de trajetória — julga uma trajetória simulada.
Chamada de ferramenta
Verificar como um nó chamou suas ferramentas. Esses avaliadores estão apenas no nível de nó.
- Correspondência de argumentos — verifica os Argumentos passados para uma chamada de ferramenta.
- Contagem de chamadas — verifica quantas vezes uma ferramenta foi chamada.
- Ordem de chamadas — verifica a ordem em que as ferramentas foram chamadas.
- Correspondência de saída — verifica a saída de uma chamada de ferramenta.
Ciclo de vida do conjunto de avaliação
Cria-se um conjunto de avaliação em torno de um assunto, pontos de dados e avaliadores. O assunto é um nó único ou um ponto de entrada do gatilho. Cada ponto de dados fornece valores de entrada e a saída esperada, e cada avaliador define como o Fluxo pontua o resultado da execução.
Quando um conjunto de avaliação é executado, o Fluxo executa o assunto para cada ponto de dados e exibe as pontuações por avaliador no histórico de avaliação.
Captura de um ponto de dados de uma execução
Você não precisa criar manualmente todos os pontos de dados. Você pode criar um importando uma execução real: capture uma execução de depuração, e suas entradas e saídas se tornam a entrada e a saída esperadas do ponto de dados. Essa é uma maneira rápida de semear um conjunto de avaliação a partir do comportamento real que você já observou.
Uso de avaliações no desenvolvimento
As avaliações são mais úteis quando:
- Você está criando fluxos de trabalho que invocam agentes de IA e precisa verificar se a saída do agente atende às expectativas de qualidade antes da publicação.
- Você precisa de cobertura de regressão — executar avaliações após cada alteração confirma que o comportamento existente não foi violado.
- Você deseja comparar implementações alternativas executando avaliações em duas versões do mesmo fluxo de trabalho.
Resultados da avaliação
Os resultados são armazenados no histórico de avaliações e podem ser revisados a qualquer momento. Cada execução mostra as pontuações por avaliador, resultados de pontos de dados individuais e os valores reais em comparação com valores esperados para cada ponto de dados.
Exemplo prático
Um fluxo de trabalho que usa um agente de IA para classificar e-mails de suporte ao cliente. Antes de publicar, você configura um conjunto de avaliação com 10 pontos de dados:
- 5 e-mails que devem ser classificados como
"billing" - 3 e-mails que devem ser classificados como
"technical" - 2 casos de borda (e-mails ambíguos)
Cada ponto de dados define o valor de saída classificationesperado. Um avaliador de Correspondência exata na classificação classifica cada resultado, e a execução de avaliação mostra em quais casos o agente errou antes que o fluxo de trabalho entrasse em produção.
Erros comuns
- Execução de um conjunto de avaliação apenas uma vez — os conjuntos de avaliação são mais úteis após cada alteração significativa em um fluxo de trabalho que invoca um agente de IA. O comportamento do agente pode mudar à medida que os modelos são atualizados, mesmo se o fluxo de trabalho não tenha sido alterado.
- Gravação de pontos de dados apenas para o caminho feliz — as avaliações são mais valiosas para casos de borda e modos de falha. Os pontos de dados fortes incluem entradas ambíguas, malformadas ou no limite do intervalo esperado.
- Tratar uma pontuação de aprovação total como um sinal para interromper os testes — Três pontos de dados de passagem não é confiança. Conjuntos maiores, especialmente aqueles que refletem entradas reais da produção, fornecem uma cobertura mais forte.
Páginas relacionadas
- Conceitos
- Conjuntos de avaliação no nível de nó versus no nível de fluxo
- Avaliadores
- Determinista
- Juiz de LLM
- Chamada de ferramenta
- Ciclo de vida do conjunto de avaliação
- Captura de um ponto de dados de uma execução
- Uso de avaliações no desenvolvimento
- Resultados da avaliação
- Exemplo prático
- Erros comuns
- Páginas relacionadas