maestro
latest
false
Maestro 用户指南
- 简介
- 入门指南
- 使用 BPMN 进行流程建模
- 使用 Case Management 进行流程建模
- 使用 Flow 进行流程建模
- 流程实施
- 流程运营
- 流程监控
- 流程优化
- 参考信息
重要 :
新发布内容的本地化可能需要 1-2 周的时间才能完成。
对 Flow 工作流输出进行自动质量检查,将其分组到评估集,并根据您附加到每次执行的评估程序进行评分。
通过评估,您可以定义对流工作流输出的自动质量检查。您将预期结果分组到评估集中,Flow 根据您附加的评估程序对每次执行进行评分。
概念
- 评估集— 针对同一主题的数据点集合。运行该集,以一次根据每个数据点对工作流进行评分。
- 数据点— 单例:一组输入值以及这些输入的预期输出。手动创作数据点,或从实际运行中捕获一个(请参阅从运行中捕获数据点)。
- 数据集— 构成评估集的数据点。
- 评估程序— 将实际输出与预期输出进行比较并生成分数的检查。布尔值评估程序会根据评估程序的结果确定通过或失败情况。
- 分数— 评估程序为数据点报告的结果。
节点级评估集与流级评估集
评估集针对单个节点或整个流:
- 节点级别— 固定到一个节点。每个数据点都提供该节点的输入及其预期输出。
- 流级别— 固定到触发器入口点。每个数据点都为触发器提供输入和流程的预期输出。
您不能在同一评估集中混合使用节点级别和流级别的数据点。
评估者
流程将评估程序分为三个系列。
确定性
在循环中没有模型的情况下,将输出与预期输出完全进行比较。
- 包含— 检查输出是否包含预期子字符串。
- 精确匹配— 检查输出是否等于预期值。
- JSON 相似度— 比较输出和预期的 JSON 输出。
LLM 评判者
使用模型根据预期输出判断输出。
- 输出语义相似度— 判断输出的含义是否与预期输出相同。
- 输出 JSON 严格相似度— 对照预期 JSON 判断 JSON 输出。
- 轨迹相似度— 根据预期轨迹判断智能体采取的步数。
- 轨迹模拟— 判断模拟轨迹。
工具调用
检查节点如何调用其工具。这些评估程序仅为节点级别。
- 参数匹配— 检查传递给工具调用的参数。
- 调用计数— 检查工具被调用的次数。
- 调用顺序— 检查调用工具的顺序。
- 输出匹配— 检查工具调用的输出。
评估集生命周期
评估集围绕主题、数据点和评估程序构建。主题可以是单个节点或触发器入口点。每个数据点都提供输入值和预期输出,每个评估程序都定义了流如何对执行结果进行评分。
当评估集运行时,Flow 执行每个数据点的主题,并在评估历史记录中显示每个评估程序的分数。
从运行中捕获数据点
您无需手动创作每个数据点。您可以通过导入实际执行来构建这样的自动化:捕获调试运行,其输入和输出将成为数据点的输入和预期输出。这是根据您已经观察到的真实行为作为评估集种子的快速方法。
在开发中使用评估
在以下情况下,评估最有用:
- 您正在构建调用 AI 智能体的工作流,并且需要在发布前验证智能体的输出是否符合质量预期。
- 您需要回归覆盖率——在每次更改后运行评估,以确认现有行为尚未受到破坏。
- 您需要通过对同一工作流的两个版本运行评估来比较替代实施方案。
评估结果
结果存储在评估历史记录中,可随时查看。每次运行都会显示每个评估程序的分数、单个数据点结果以及每个数据点的实际值与预期值。
实际示例
使用 AI 智能体对客户支持电子邮件进行分类的工作流。在发布之前,您设置一个包含 10 个数据点的评估集:
- 5 封应分类为
"billing"电子邮件 - 3 封电子邮件应分类为
"technical" - 2 种边缘用例(模糊的电子邮件)
每个数据点都定义了预期classification输出值。分类的精确匹配评估程序会为每个结果评分,评估运行会显示在工作流投入生产之前智能体出错的案例。
常见错误
- 仅运行一次评估集— 每次对调用 AI 智能体的工作流进行重大更改后,评估集最有用。即使工作流没有改变,智能体的行为也可能会随着模型的更新而发生变化。
- 仅出于正常路径写入数据点——评估对边缘用例和故障模式最有价值。可靠的数据点包括模糊、格式错误或处于预期范围边界的输入。
- 将全通过分数视为停止测试的信号——三个及格的数据点不构成置信度。较大的数据集,尤其是反映生产中实际输入的数据集,可提供更强的覆盖范围。