UiPath Documentation
maestro
latest
false
Guide de l'utilisateur de Maestro
Important :
La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.

Évaluations

Vérifications de la qualité automatisées pour les sorties de workflow de flux, regroupées en ensembles d'évaluation et notées par rapport aux évaluateurs que vous associez à chaque exécution.

Les évaluations vous permettent de définir des vérifications de la qualité automatisées sur les sorties d'un workflow Flow. Vous regroupez les résultats attendus dans un ensemble d'évaluation, et Flow enregistre chaque exécution par rapport aux évaluateurs que vous associez.

Concepts

  • Ensemble d’évaluation — une collection de points de données qui ciblent le même sujet. Exécutez l'ensemble pour noter le workflow sur chaque point de données à la fois.
  • Point de données — un cas unique: un ensemble de valeurs d'entrée et la sortie attendue pour ces entrées. Créez un point de données manuellement ou capturez-en un à partir d'une exécution réelle (voir Capture d'un point de données à partir d'une exécution).
  • Ensemble de données — les points de données qui constituent un ensemble d'évaluation.
  • Évaluateur — une vérification qui compare la sortie réelle à la sortie attendue et produit un score. Un évaluateur booléen renvoie la réussite ou l’échec par évaluateur.
  • Score : le résultat qu’un évaluateur rapporte pour un point de données.

Ensembles d’évaluation au niveau du nœud et au niveau du flux

Un ensemble d’évaluations cible soit un nœud unique , soit l’ensemble du flux:

  • Au niveau du nœud — épinglé à un nœud. Chaque point de données fournit les entrées de ce nœud et sa sortie attendue.
  • Au niveau du flux — épinglé à un point d'entrée de déclencheur. Chaque point de données fournit les entrées du déclencheur et la sortie attendue du flux.

Vous ne pouvez pas combiner des points de données au niveau du nœud et au niveau du flux dans le même ensemble d'évaluations.

Évaluateurs

Le flux regroupe les évaluateurs en trois catégories.

Déterministe

Comparez la sortie à la sortie attendue exactement sans modèle dans la boucle.

  • Contient — vérifie que la sortie contient une sous-chaîne attendue.
  • Correspondance exacte — vérifie que la sortie est égale à la valeur attendue.
  • Similitude JSON — compare la sortie et la sortie attendue au format JSON.

LLM-as-a-judge

Utilisez un modèle pour juger la sortie par rapport à la sortie attendue.

  • Similitude sémantique de sortie — évalue si la sortie signifie la même que la sortie attendue.
  • Similitude JSON stricte de sortie — évalue la sortie JSON par rapport au JSON attendu.
  • Similitude de la trajectoire - évalue les étapes suivies par l’agent par rapport à une trajectoire attendue.
  • Simulation de trajectoire - évalue une trajectoire simulée.

Appel d’outils

Vérifiez la façon dont un nœud a appelé ses outils. Ces évaluateurs sont au niveau des nœuds uniquement.

  • Correspondance d’argument — vérifie les arguments transmis à un appel d’outil.
  • Nombre d’appels — vérifie combien de fois un outil a été appelé.
  • Ordre des appels — vérifie l'ordre dans lequel les outils ont été appelés.
  • Correspondance de sortie — vérifie la sortie d'un appel d'outil.

Cycle de vie de l’ensemble d’évaluation

Un ensemble d’évaluation est créé autour d’un sujet, de points de données et d’évaluateurs. L'objet est soit un nœud unique, soit un point d'entrée de déclencheur. Chaque point de données fournit les valeurs d'entrée et la sortie attendue, et chaque évaluateur définit la façon dont le flux donne le score du résultat de l'exécution.

Lorsqu'un ensemble d'évaluations s'exécute, Flow exécute le sujet pour chaque point de données et affiche les scores par évaluateur dans l'historique des évaluations.

Capturer un point de données depuis une exécution

Il n'est pas nécessaire de créer chaque point de données manuellement. Vous pouvez en créer une en important une exécution réelle: capturez une exécution de débogage et ses entrées et sorties deviennent l'entrée et la sortie attendue du point de données. Il s'agit d'un moyen rapide de référencer un ensemble d'évaluation à partir du comportement réel que vous avez déjà observé.

Utiliser des évaluations dans le développement

Les évaluations sont plus utiles lorsque:

  • Vous créez des workflows qui invoquent des agents d’IA et devez vérifier que la sortie de l’agent répond aux attentes de qualité avant de publier.
  • Vous avez besoin d'une couverture de régression - l'exécution d'évaluations après chaque changement confirme que le comportement existant n'a pas été interrompu.
  • Vous souhaitez comparer des implémentations alternatives en exécutant des évaluations sur deux versions du même workflow.

Résultats de l’évaluation

Les résultats sont stockés dans l’historique des évaluations et peuvent être examinés à tout moment. Chaque exécution affiche les scores par évaluateur, les résultats des points de données individuels et les valeurs réelles et attendues pour chaque point de données.

Exemple pratique

Un workflow qui utilise un agent d’IA pour classifier les e-mails de l’assistance. Avant de publier, vous configurez un ensemble d'évaluation avec 10 points de données:

  • 5 e-mails qui doivent être classés comme "billing"
  • 3 e-mails qui doivent être classés comme "technical"
  • 2 cas périphériques (e-mails ambigus)

Chaque point de données définit la valeur de sortie classification attendue. Un évaluateur de correspondance exacte sur la classification évalue chaque résultat, et l’exécution de l’évaluation affiche les cas où l’agent s’est erroné avant que le workflow ne passe à la production.

Erreurs courantes

  • Exécution d’un ensemble d’évaluation uniquement une fois - Les ensembles d'évaluation sont plus utiles après chaque modification significative apportée à un workflow qui invoque un agent d'IA. Le comportement de l'agent peut changer à mesure que les modèles sont mis à jour même si le workflow n'a pas changé.
  • Écrire des points de données uniquement pour le chemin heureux - Les évaluations sont plus utiles pour les cas limites et les modes d’échec. Les points de données solides incluent les entrées ambiguës, malformées ou à la limite de la plage attendue.
  • Traitement d'un score de réussite comme un signal pour arrêter le test - Trois points de données de passage n'est pas une confiance. Des ensembles plus grands, en particulier ceux qui reflètent les entrées réelles de la production, fournissent une couverture plus forte.

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour