UiPath Documentation
maestro
latest
false
Guide de l'utilisateur de Maestro
Important :
La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.

Évaluations

Vérifications de qualité automatisées pour les sorties de workflow de Flow, regroupées en ensembles d'évaluation et notées par rapport aux évaluateurs que vous associez à chaque exécution.

Les évaluations vous permettent de définir des contrôles de qualité automatisés sur les sorties d'un workflow de Flow. Vous regroupez les résultats attendus dans un ensemble d'évaluation et Flow note chaque exécution par rapport aux évaluateurs que vous associez.

Concepts​

  • Ensemble d'évaluation - une collection de points de données qui ciblent le même sujet. Exécutez l'ensemble pour noter le workflow par rapport à chaque point de données à la fois.
  • Point de données - un seul cas : un ensemble de valeurs d'entrée et la sortie attendue pour ces entrées. Créez un point de données à la main ou capturez-en un à partir d'une exécution réelle (consultez la section Capture d'un point de données à partir d'une exécution).
  • Ensemble de données - les points de données qui composent un ensemble d'évaluation.
  • Évaluateur - une vérification qui compare la sortie réelle à la sortie attendue et produit un score. Un évaluateur booléen produit une réussite ou un échec par évaluateur.
  • Score - le résultat qu'un évaluateur signale pour un point de données.

Ensembles d'évaluation au niveau du nœud vs au niveau du flux​

Un ensemble d'évaluation cible soit un seul nœud ou l'ensemble du flux :

  • Au niveau du nœud - épinglé à un nœud. Chaque point de données fournit les entrées de ce nœud et sa sortie attendue.
  • Au niveau du flux - épinglé à un point d'entrée du déclencheur. Chaque point de données fournit les entrées du déclencheur et la sortie attendue du flux.

Vous ne pouvez pas mélanger les points de données au niveau du nœud et au niveau du flux dans le même ensemble d'évaluation.

Évaluateurs​

Flow regroupe les évaluateurs en trois familles.

Déterministe​

Comparez la sortie à la sortie attendue exactement, sans modèle dans la boucle.

  • Contient - vérifie que la sortie contient une sous-chaîne attendue.
  • Correspondance exacte - vérifie que la sortie est égale à la valeur attendue.
  • Similarité de JSON - compare la sortie et la sortie attendue en tant que JSON.

Juge LLM​

Utilisez un modèle pour comparer le résultat obtenu au résultat attendu.

  • Similarité sémantique de la sortie - vérifie si le résultat correspond au résultat attendu.
  • Comparaison stricte des données JSON - compare le format JSON de sortie avec le format JSON attendu.
  • Similarité des trajectoires - évalue les actions effectuées par l'agent par rapport à une trajectoire attendue.
  • Simulation de trajectoire - évalue une trajectoire simulée.

Appel d'outil​

Vérifiez comment un nœud a appelé ses outils. Ces évaluateurs sont au niveau du nœud uniquement.

  • Correspondance de l'argument - vérifie les arguments transmis à un appel d'outil.
  • Nombre d'appels - vérifie combien de fois un outil a été appelé.
  • Ordre de l'appel - vérifie l'ordre dans lequel les outils ont été appelés.
  • Correspondance de la sortie - vérifie la sortie d'un appel d'outil.

Cycle de vie de l'ensemble d'évaluation​

Un ensemble d'évaluation est construit autour d'un sujet, de points de données et d'évaluateurs. Le sujet est un seul nœud ou un point d'entrée du déclencheur. Chaque point de données fournit des valeurs d'entrée et la sortie attendue, et chaque évaluateur définit la façon dont Flow note le résultat de l'exécution.

Lorsqu'un ensemble d'évaluation s'exécute, Flow exécute le sujet pour chaque point de données et affiche les scores par évaluateur dans l'historique d'évaluation.

Capture d'un point de données à partir d'une exécution​

Vous n'avez pas besoin de saisir manuellement chaque point de données. Vous pouvez en créer un en important une exécution réelle : enregistrez une exécution de débogage, et ses entrées et sorties deviennent l'entrée du point de données et la sortie attendue. Il s'agit d'un moyen rapide de constituer un ensemble d'évaluation à partir du comportement réel que vous avez déjà observé.

Utilisation des évaluations dans le développement​

Les évaluations sont plus utiles lorsque :

  • Vous créez des workflows qui invoquent des agents d'IA et devez vérifier que la sortie de l'agent répond aux attentes de qualité avant la publication.
  • Vous avez besoin d'une couverture de régression - l'exécution d'évaluations après chaque modification confirme que le comportement existant n'a pas été interrompu.
  • Vous souhaitez comparer les implémentations alternatives en exécutant des évaluations sur deux versions du même workflow.

Résultats de l’évaluation​

Les résultats sont stockés dans l'historique d'évaluation et peuvent être examinés à tout moment. Chaque exécution affiche les scores par évaluateur, les résultats de points de données individuels et les valeurs réelles par rapport aux valeurs attendues pour chaque point de données.

Exemple pratique​

Un workflow qui utilise un agent d'IA pour classifier les e-mails d'assistance client. Avant de publier, vous configurez un ensemble d'évaluation avec 10 points de données :

  • 5 e-mails qui doivent être classés comme "billing"
  • 3 e-mails qui doivent être classés comme "technical"
  • 2 cas limites (e-mails ambigus)

Chaque point de données définit la valeur de sortie classification attendue. Un évaluateur de correspondance exacte sur la classification note chaque résultat et l'exécution d'évaluation affiche les cas dans lesquels l'agent s'est trompé avant que le workflow ne passe en production.

Erreurs courantes​

  • Lancer un ensemble d'évaluation une seule fois - Les ensembles d'évaluation sont les plus utiles après chaque modification significative apportée à un workflow qui invoque un agent d'IA. Le comportement de l'agent peut changer lorsque les modèles sont mis à jour, même si le workflow n'a pas changé.
  • Écriture de points de données uniquement pour le scénario nominal - Les évaluations sont les plus précieuses pour les cas limites et les modes d'échec. Les points de données forts incluent les entrées ambiguës, mal formées ou à la limite de la plage attendue.
  • Traiter un score de réussite totale comme un signal d'arrêt des tests - Trois points de données validés ne constituent pas une preuve de confiance. Les ensembles plus grands, en particulier ceux qui reflètent les entrées réelles de la production, fournissent une couverture plus forte.

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour