- Introduction
- Démarrage
- Créer avec Maestro BPMN
- Compréhension de la modélisation BPMN de Maestro
- Ouverture du canevas de modélisation
- Modéliser votre processus
- Alignement et connexion des éléments BPMN
- Patterns library
- Autopilot pour Maestro (aperçu)
- Référentiel de processus
- Implémenter un processus BPMN simple
- Implémenter un processus BPMN complexe
- Débogage
- Simulation
- Évaluations (Aperçu)
- Scénarios de mise en œuvre courants
- Building with Maestro Case
- Présentation de Maestro Case
- Maestro BPMN vs. Maestro Case : quand utiliser la gestion des incidents
- Le cycle de vie de Maestro Case : du déclencheur d'événement à l'expérience de l'application
- Créer votre premier incident avec Maestro Case
- Créer un Maestro Case avec un agent de codage (aperçu)
- Définition des clés de cas (système vs. externe)
- Établissement des contrats d'E/S et de réécriture de la tâche
- Règles de sortie et fin de l’étape précoce
- Modélisation des étapes primaires et secondaires
- Déclencher un cas à partir de Data Fabric
- Implémentation des personas et des autorisations au niveau de l'étape
- Définition des SLA et des règles d'escalade automatisées
- Configuration d'une boucle de retraitement (renouvellement)
- Configurer et tester l'agent Case Manager (aperçu)
- Contrat d’entrée et de sortie du gestionnaire de cas
- Dictionnaire des composants de Maestro Case
- Créer avec Maestro Flow
- Maestro Automate
- Intégrations
- Opérations
- Surveillance
- Optimisation
- Informations de référence
Évaluations (Aperçu)
Vérifications de la qualité automatisées pour les workflows Maestro BPMN avec des ensembles d'évaluation, des évaluateurs déterministes et de juge LLM et des simulations de sortie de nœud.
Les évaluations vous permettent de définir des contrôles qualité automatisés pour un workflow Maestro BPMN. Vous regroupez les résultats attendus dans un ensemble d'évaluation, et chaque exécution est notée en fonction des évaluateurs que vous associez.
Les évaluations utilisent le même cadre d'évaluation déjà disponible pour les agents d'IA et Maestro Flow, de sorte que les workflows avec des étapes non déterministes puissent être vérifiés avant leur expédition.
Concepts
- Ensemble de données — une collection de points de données qui ciblent le même sujet. L'exécution de l'ensemble évalue le workflow pour chaque point de données à la fois.
- Point de données — un cas unique: un ensemble de valeurs d'entrée et la sortie attendue pour ces entrées. Vous pouvez créer un point de données manuellement ou en capturer un à partir d'une exécution réelle.
- Évaluateur — un évaluateur qui compare la sortie réelle à la sortie attendue, ou la trajectoire à la trajectoire attendue, et produit un score.
- Score - le résultat qu'un évaluateur signale pour un point de données.
Ensembles d'évaluation au niveau BPMN
Un ensemble d’évaluations cible l’ensemble du workflow Maestro BPMN. Il est épinglé à un point d'entrée de déclencheur, et chaque point de données fournit les entrées du déclencheur et la sortie attendue du workflow.
Les ensembles d'évaluation au niveau du nœud épinglent une évaluation à un seul nœud, de sorte que chaque point de données fournit les entrées de ce nœud et sa sortie attendue. Les évaluations au niveau du nœud ne font pas partie de cet aperçu public.
Évaluateurs
Les évaluateurs BPMN Maestro se classent en deux catégories.
Déterministe
Ces évaluateurs comparent exactement la sortie à la sortie attendue sans modèle dans la boucle.
- Contient - vérifie que la sortie contient une sous-chaîne attendue.
- Correspondance exacte - vérifie que la sortie est égale à la valeur attendue.
- Similarité de JSON - compare la sortie et la sortie attendue en tant que JSON.
Juge LLM
Ces évaluateurs utilisent un modèle pour évaluer la sortie par rapport à la sortie attendue.
- Similarité sémantique de la sortie - vérifie si le résultat correspond au résultat attendu.
- Comparaison stricte des données JSON - compare le format JSON de sortie avec le format JSON attendu.
- Similarité des trajectoires - évalue les actions effectuées par l'agent par rapport à une trajectoire attendue.
- Simulation de trajectoire - évalue une trajectoire simulée.
Capture d'un point de données à partir d'une exécution
Il n'est pas nécessaire de créer chaque point de données manuellement. Vous pouvez en créer une en important une exécution réelle: lorsque vous capturez une exécution de débogage, ses entrées et ses sorties deviennent l'entrée et la sortie attendue du point de données.
La capture d'une exécution est un moyen rapide de référencer un ensemble d'évaluation à partir d'un comportement réel que vous avez déjà observé.
Quand utiliser les évaluations
Les évaluations sont plus utiles lorsque :
- Vous créez des workflows Maestro BPMN qui invoquent des agents d’IA et devez vérifier que la sortie de l’agent répond aux attentes de qualité avant de publier.
- Vous avez besoin d'une couverture de régression, et l'exécution d'évaluations après chaque modification confirme que le comportement existant n'a pas été interrompu.
- Vous souhaitez comparer les implémentations alternatives en exécutant des évaluations sur deux versions du même workflow.
Résultats de l’évaluation
Les résultats sont stockés dans l’historique des évaluations et peuvent être examinés à tout moment. Elles sont visibles par les utilisateurs qui les exécutent et peuvent être exportées au format JSON ou CSV. Les traçages individuels au sein d'une exécution d'évaluation peuvent également être exportés.
L'onglet Historique des exécutions d'évaluation affiche, pour chaque exécution:
- Scores par évaluateur, ainsi que la justification de l’évaluateur
- Résultats de points de données individuels, avec les valeurs réelles et attendues côte à côte
- La trace complète: ce qui a déclenché l'exécution, le chemin qu'elle a emprunté, la sortie par nœud et le minutage
Le traçage et la justification de l’évaluateur indiquent ce qui doit être modifié pour que le workflow s’exécute correctement dans chaque cas.
Exemple: classification des e-mails d'assistance
Un workflow Maestro BPMN utilise un agent d'IA pour classifier les e-mails d'assistance des clients. Avant de publier, vous configurez un ensemble d'évaluation avec 10 points de données:
- 5 e-mails classés comme
"billing" - 3 e-mails classés comme
"technical" - 2 e-mails ambigus, traités comme des cas limites
Chaque point de données définit la valeur de sortie classification attendue ou une escalade déclenchée vers un humain pour les e-mails ambigus. Un évaluateur de correspondance exacte sur la classification score chaque résultat pour "billing" ou "technical", et un évaluateur de trajectoire vérifie l’escalade humaine. Chaque exécution montre les cas où l’agent s’est tromper avant que le workflow ne passe à la production.
Simulations de nœud
Les simulations remplacent les sorties de nœud sélectionnées pendant une exécution d'évaluation, ce qui vous permet de tester la logique en aval sans exécuter l'action réelle d'un nœud. Cela est utile lorsque l'action réelle est lente, coûteuse ou dépend de systèmes externes qui ne sont pas disponibles lors de la conception.
Lorsqu’une simulation est activée sur un nœud, l’exécution ignore l’exécution réelle de ce nœud et utilise directement les valeurs de sortie simulées. Tous les nœuds en aval reçoivent les valeurs simulées comme si le nœud avait fonctionné normalement.
Les simulations s'appliquent uniquement pendant les exécutions de test. Elles ne sont jamais actives dans les workflows de production publiés.
Stratégies de simulation
Chaque nœud simulé utilise l'une de ces deux stratégies:
- Simulation statique : une simulation basée sur des règles qui renvoie toujours la valeur que vous définissez.
- Simulation générée — une réponse générée par LLM, produite dynamiquement chaque fois que l'évaluation s'exécute.
Configuration d'une simulation
Configurez une simulation sur n’importe quel nœud dont vous souhaitez remplacer la sortie réelle lors d’une exécution d’évaluation. La séquence suivante montre le flux complet, de la sélection du nœud à la saisie de la sortie simulée.
- Sélectionnez le nœud que vous souhaitez simuler sur le canevas.
- Dans le panneau de configuration, ouvrez Ajouter une simulation.
- Choisissez la stratégie de simulation pour le nœud.
- Saisissez la sortie simulée de la stratégie que vous avez choisie:
- Pour Simulation statique, saisissez les valeurs de sortie soit en modifiant manuellement le JSON, soit en le générant avec la fonctionnalité d'invite. Utilisez un JSON valide qui correspond au schéma de sortie du nœud.
- Pour Simulation générée, saisissez l'invite utilisée par le modèle pour générer une réponse d'outil lors de chaque exécution d'évaluation.
Résultat: le nœud est simulé. Lors du prochain test, Maestro BPMN ignore son exécution réelle et injecte vos valeurs en aval à la place.
Nœuds que vous pouvez simuler
Les simulations sont utiles sur les types de nœuds suivants:
- Tâche humaine — renvoie une réponse approuvée ou rejetée sans attendre un approbateur réel.
- Requête HTTP — renvoie une réponse d'API spécifique, y compris les réponses d'erreur, afin que vous puissiez tester vos chemins de gestion des erreurs.
- Agent : renvoie la sortie d'un agent d'IA afin que vous puissiez tester la façon dont votre workflow gère les différentes réponses de l'agent.
- Connexion : renvoie la sortie d’un nœud de connexion afin que vous puissiez tester le workflow sans apporter de modifications dans les applications externes.
Disponibilité et licences
- Les évaluations sont disponibles pour les utilisateurs disposant des types de licence et des plans de licence d'organisation Automation Cloud détaillés dans Concession de licence.
- Les simulations de nœud, la génération de simulations à l’aide des fonctionnalités LLM à l’intérieur des évaluations et les évaluateurs de juge LLM sont gratuits pendant la prévisualisation. Les exécutions Maestro BPMN lors de la conception consomment à partir des limites d'utilisateurs mensuelles.
Limites connues
- Les évaluations au niveau du nœud ne sont pas disponibles.
- Les évaluations BPMN Maestro ne prennent pas en charge les compétences CLI .
Pages liées
- Concepts
- Ensembles d'évaluation au niveau BPMN
- Évaluateurs
- Déterministe
- Juge LLM
- Capture d'un point de données à partir d'une exécution
- Quand utiliser les évaluations
- Résultats de l’évaluation
- Exemple: classification des e-mails d'assistance
- Simulations de nœud
- Stratégies de simulation
- Configuration d'une simulation
- Nœuds que vous pouvez simuler
- Disponibilité et licences
- Limites connues
- Pages liées