UiPath Documentation
maestro
latest
false
Maestro 用户指南
重要 :
新发布内容的本地化可能需要 1-2 周的时间才能完成。

评估

对 Flow 工作流输出进行自动质量检查,将其分组到评估集,并根据您附加到每次执行的评估程序进行评分。

通过评估,您可以定义对流工作流输出的自动质量检查。您将预期结果分组到评估集中,Flow 根据您附加的评估程序对每次执行进行评分。

概念

  • 评估集— 针对同一主题的数据点集合。运行该集,以一次根据每个数据点对工作流进行评分。
  • 数据点— 单例:一组输入值以及这些输入的预期输出。手动创作数据点,或从实际运行中捕获一个(请参阅从运行中捕获数据点)。
  • 数据集— 构成评估集的数据点。
  • 评估程序— 将实际输出与预期输出进行比较并生成分数的检查。布尔值评估程序会根据评估程序的结果确定通过或失败情况。
  • 分数— 评估程序为数据点报告的结果。

节点级评估集与流级评估集

评估集针对单个节点整个流:

  • 节点级别— 固定到一个节点。每个数据点都提供该节点的输入及其预期输出。
  • 流级别— 固定到触发器入口点。每个数据点都为触发器提供输入和流程的预期输出。

您不能在同一评估集中混合使用节点级别和流级别的数据点。

评估者

流程将评估程序分为三个系列。

确定性

在循环中没有模型的情况下,将输出与预期输出完全进行比较。

  • 包含— 检查输出是否包含预期子字符串。
  • 精确匹配— 检查输出是否等于预期值。
  • JSON 相似度— 比较输出和预期的 JSON 输出。

LLM 评判者

使用模型根据预期输出判断输出。

  • 输出语义相似度— 判断输出的含义是否与预期输出相同。
  • 输出 JSON 严格相似度— 对照预期 JSON 判断 JSON 输出。
  • 轨迹相似度— 根据预期轨迹判断智能体采取的步数。
  • 轨迹模拟— 判断模拟轨迹。

工具调用

检查节点如何调用其工具。这些评估程序仅为节点级别

  • 参数匹配— 检查传递给工具调用的参数。
  • 调用计数— 检查工具被调用的次数。
  • 调用顺序— 检查调用工具的顺序。
  • 输出匹配— 检查工具调用的输出。

评估集生命周期

评估集围绕主题、数据点和评估程序构建。主题可以是单个节点或触发器入口点。每个数据点都提供输入值和预期输出,每个评估程序都定义了流如何对执行结果进行评分。

当评估集运行时,Flow 执行每个数据点的主题,并在评估历史记录中显示每个评估程序的分数。

从运行中捕获数据点

您无需手动创作每个数据点。您可以通过导入实际执行来构建这样的自动化:捕获调试运行,其输入和输出将成为数据点的输入和预期输出。这是根据您已经观察到的真实行为作为评估集种子的快速方法。

在开发中使用评估

在以下情况下,评估最有用:

  • 您正在构建调用 AI 智能体的工作流,并且需要在发布前验证智能体的输出是否符合质量预期。
  • 您需要回归覆盖率——在每次更改后运行评估,以确认现有行为尚未受到破坏。
  • 您需要通过对同一工作流的两个版本运行评估来比较替代实施方案。

评估结果

结果存储在评估历史记录中,可随时查看。每次运行都会显示每个评估程序的分数、单个数据点结果以及每个数据点的实际值与预期值。

实际示例

使用 AI 智能体对客户支持电子邮件进行分类的工作流。在发布之前,您设置一个包含 10 个数据点的评估集:

  • 5 封应分类为"billing"电子邮件
  • 3 封电子邮件应分类为"technical"
  • 2 种边缘用例(模糊的电子邮件)

每个数据点都定义了预期classification输出值。分类的精确匹配评估程序会为每个结果评分,评估运行会显示在工作流投入生产之前智能体出错的案例。

常见错误

  • 仅运行一次评估集— 每次对调用 AI 智能体的工作流进行重大更改后,评估集最有用。即使工作流没有改变,智能体的行为也可能会随着模型的更新而发生变化。
  • 仅出于正常路径写入数据点——评估对边缘用例和故障模式最有价值。可靠的数据点包括模糊、格式错误或处于预期范围边界的输入。
  • 将全通过分数视为停止测试的信号——三个及格的数据点不构成置信度。较大的数据集,尤其是反映生产中实际输入的数据集,可提供更强的覆盖范围。

此页面有帮助吗?

连接

需要帮助? 支持

想要了解详细内容? UiPath Academy

有问题? UiPath 论坛

保持更新