- Introduction
- Démarrage
- Modélisation du processus avec BPMN
- Compréhension de la modélisation des processus
- Ouverture du canevas de modélisation
- Modéliser votre processus
- Alignement et connexion des éléments BPMN
- Autopilot pour Maestro (aperçu)
- Référentiel de processus
- Modélisation des processus avec la gestion des incidents
- Concevoir un schéma d'entité de cas persistant
- Définition des clés de cas (système vs. externe)
- Établissement des contrats d'E/S et de réécriture de la tâche
- Règles de sortie et fin de l’étape précoce
- Modélisation des étapes primaires et secondaires
- Déclencher un cas à partir de Data Fabric
- Implémentation des personas et des autorisations au niveau de l'étape
- Définition des SLA et des règles d'escalade automatisées
- Configuration d'une boucle de retraitement (renouvellement)
- Gestion des instances de cas en cours : suspendre, migrer et réessayer
- Dictionnaire des composants de gestion des incidents Maestro
- Modélisation des processus avec Flow
- Implémentation des processus
- Débogage
- Simulation
- Publication et mise à niveau des processus agentiques
- Scénarios de mise en œuvre courants
- Extraire et valider des documents
- Opérations de processus
- Surveillance des processus
- Optimisation des processus
- Informations de référence
Vérifications de la qualité automatisées pour les sorties de workflow de flux, regroupées en ensembles d'évaluation et notées par rapport aux évaluateurs que vous associez à chaque exécution.
Les évaluations vous permettent de définir des vérifications de la qualité automatisées sur les sorties d'un workflow Flow. Vous regroupez les résultats attendus dans un ensemble d'évaluation, et Flow enregistre chaque exécution par rapport aux évaluateurs que vous associez.
Concepts
- Ensemble d’évaluation — une collection de points de données qui ciblent le même sujet. Exécutez l'ensemble pour noter le workflow sur chaque point de données à la fois.
- Point de données — un cas unique: un ensemble de valeurs d'entrée et la sortie attendue pour ces entrées. Créez un point de données manuellement ou capturez-en un à partir d'une exécution réelle (voir Capture d'un point de données à partir d'une exécution).
- Ensemble de données — les points de données qui constituent un ensemble d'évaluation.
- Évaluateur — une vérification qui compare la sortie réelle à la sortie attendue et produit un score. Un évaluateur booléen renvoie la réussite ou l’échec par évaluateur.
- Score : le résultat qu’un évaluateur rapporte pour un point de données.
Ensembles d’évaluation au niveau du nœud et au niveau du flux
Un ensemble d’évaluations cible soit un nœud unique , soit l’ensemble du flux:
- Au niveau du nœud — épinglé à un nœud. Chaque point de données fournit les entrées de ce nœud et sa sortie attendue.
- Au niveau du flux — épinglé à un point d'entrée de déclencheur. Chaque point de données fournit les entrées du déclencheur et la sortie attendue du flux.
Vous ne pouvez pas combiner des points de données au niveau du nœud et au niveau du flux dans le même ensemble d'évaluations.
Évaluateurs
Le flux regroupe les évaluateurs en trois catégories.
Déterministe
Comparez la sortie à la sortie attendue exactement sans modèle dans la boucle.
- Contient — vérifie que la sortie contient une sous-chaîne attendue.
- Correspondance exacte — vérifie que la sortie est égale à la valeur attendue.
- Similitude JSON — compare la sortie et la sortie attendue au format JSON.
LLM-as-a-judge
Utilisez un modèle pour juger la sortie par rapport à la sortie attendue.
- Similitude sémantique de sortie — évalue si la sortie signifie la même que la sortie attendue.
- Similitude JSON stricte de sortie — évalue la sortie JSON par rapport au JSON attendu.
- Similitude de la trajectoire - évalue les étapes suivies par l’agent par rapport à une trajectoire attendue.
- Simulation de trajectoire - évalue une trajectoire simulée.
Appel d’outils
Vérifiez la façon dont un nœud a appelé ses outils. Ces évaluateurs sont au niveau des nœuds uniquement.
- Correspondance d’argument — vérifie les arguments transmis à un appel d’outil.
- Nombre d’appels — vérifie combien de fois un outil a été appelé.
- Ordre des appels — vérifie l'ordre dans lequel les outils ont été appelés.
- Correspondance de sortie — vérifie la sortie d'un appel d'outil.
Cycle de vie de l’ensemble d’évaluation
Un ensemble d’évaluation est créé autour d’un sujet, de points de données et d’évaluateurs. L'objet est soit un nœud unique, soit un point d'entrée de déclencheur. Chaque point de données fournit les valeurs d'entrée et la sortie attendue, et chaque évaluateur définit la façon dont le flux donne le score du résultat de l'exécution.
Lorsqu'un ensemble d'évaluations s'exécute, Flow exécute le sujet pour chaque point de données et affiche les scores par évaluateur dans l'historique des évaluations.
Capturer un point de données depuis une exécution
Il n'est pas nécessaire de créer chaque point de données manuellement. Vous pouvez en créer une en important une exécution réelle: capturez une exécution de débogage et ses entrées et sorties deviennent l'entrée et la sortie attendue du point de données. Il s'agit d'un moyen rapide de référencer un ensemble d'évaluation à partir du comportement réel que vous avez déjà observé.
Utiliser des évaluations dans le développement
Les évaluations sont plus utiles lorsque:
- Vous créez des workflows qui invoquent des agents d’IA et devez vérifier que la sortie de l’agent répond aux attentes de qualité avant de publier.
- Vous avez besoin d'une couverture de régression - l'exécution d'évaluations après chaque changement confirme que le comportement existant n'a pas été interrompu.
- Vous souhaitez comparer des implémentations alternatives en exécutant des évaluations sur deux versions du même workflow.
Résultats de l’évaluation
Les résultats sont stockés dans l’historique des évaluations et peuvent être examinés à tout moment. Chaque exécution affiche les scores par évaluateur, les résultats des points de données individuels et les valeurs réelles et attendues pour chaque point de données.
Exemple pratique
Un workflow qui utilise un agent d’IA pour classifier les e-mails de l’assistance. Avant de publier, vous configurez un ensemble d'évaluation avec 10 points de données:
- 5 e-mails qui doivent être classés comme
"billing" - 3 e-mails qui doivent être classés comme
"technical" - 2 cas périphériques (e-mails ambigus)
Chaque point de données définit la valeur de sortie classification attendue. Un évaluateur de correspondance exacte sur la classification évalue chaque résultat, et l’exécution de l’évaluation affiche les cas où l’agent s’est erroné avant que le workflow ne passe à la production.
Erreurs courantes
- Exécution d’un ensemble d’évaluation uniquement une fois - Les ensembles d'évaluation sont plus utiles après chaque modification significative apportée à un workflow qui invoque un agent d'IA. Le comportement de l'agent peut changer à mesure que les modèles sont mis à jour même si le workflow n'a pas changé.
- Écrire des points de données uniquement pour le chemin heureux - Les évaluations sont plus utiles pour les cas limites et les modes d’échec. Les points de données solides incluent les entrées ambiguës, malformées ou à la limite de la plage attendue.
- Traitement d'un score de réussite comme un signal pour arrêter le test - Trois points de données de passage n'est pas une confiance. Des ensembles plus grands, en particulier ceux qui reflètent les entrées réelles de la production, fournissent une couverture plus forte.
Pages liées
- Concepts
- Ensembles d’évaluation au niveau du nœud et au niveau du flux
- Évaluateurs
- Déterministe
- LLM-as-a-judge
- Appel d’outils
- Cycle de vie de l’ensemble d’évaluation
- Capturer un point de données depuis une exécution
- Utiliser des évaluations dans le développement
- Résultats de l’évaluation
- Exemple pratique
- Erreurs courantes
- Pages liées