- 简介
- 入门指南
- 使用 Maestro BPMN 进行构建
- 使用 Maestro Case 构建
- 使用 Maestro Flow 进行构建
- Maestro Automate
- 集成
- 运营
- 监控
- 正在优化
- 参考信息
评估(预览版)
通过评估集、确定性评估器和 LLM-judge 评估器以及节点输出模拟,对 Maestro BPMN 工作流进行自动质量检查。
通过评估,您可以为 Maestro BPMN 工作流定义自动化质量检查。您将预期结果分组到评估集中,并且系统会根据您附加的评估程序对每次执行进行评分。
评估使用已用于 AI 智能体和 Maestro Flow 的相同评估框架,因此包含非确定性步骤的工作流可以在发货前进行验证。
概念
- 数据集— 针对同一主题的数据点的集合。运行该集,同时根据每个数据点对工作流进行评分。
- 数据点— 单例:一组输入值以及这些输入的预期输出。您可以手动创作数据点,或从实际运行中捕获数据点。
- 评估程序— 一种评分器,用于将实际输出与预期输出或轨迹与预期轨迹进行比较,并生成分数。
- 分数— 评估程序为数据点报告的结果。
BPMN 级别的评估集
评估集以整个 Maestro BPMN 工作流为目标。它已固定到触发器入口点,每个数据点都提供触发器的输入和工作流的预期输出。
节点级别评估集将评估固定到单个节点,以便每个数据点提供该节点的输入及其预期输出。节点级别评估不属于此公开预览版。
评估者
Maestro BPMN 评估程序分为两个系列。
确定性
这些评估程序不会在循环中提供任何模型,从而将输出与预期输出进行精确比较。
- 包含— 检查输出是否包含预期子字符串。
- 精确匹配— 检查输出是否等于预期值。
- JSON 相似度— 比较输出和预期的 JSON 输出。
LLM 评判者
这些评估程序使用模型来根据预期输出判断输出。
- 输出语义相似度— 判断输出的含义是否与预期输出相同。
- 输出 JSON 严格相似度— 对照预期 JSON 判断 JSON 输出。
- 轨迹相似度— 根据预期轨迹判断智能体采取的步数。
- 轨迹模拟— 判断模拟轨迹。
从运行中捕获数据点
您无需手动创作每个数据点。您可以通过导入实际执行来构建反馈:当您捕获调试运行时,其输入和输出将成为数据点的输入和预期输出。
捕获运行是根据您已经观察到的真实行为作为评估集的快速种子方法。
何时使用评估
在以下情况下,评估最有用:
- 您正在构建调用 AI 智能体的 Maestro BPMN 工作流,您需要在发布前验证智能体的输出是否符合质量预期。
- 您需要回归覆盖率,并在每次更改后运行评估,以确认现有行为尚未受到破坏。
- 您需要通过对同一工作流的两个版本运行评估来比较替代实施方案。
评估结果
结果存储在评估历史记录中,可随时查看。它们对运行它们的用户可见,并可以导出为 JSON 或 CSV 格式。也可以导出评估运行中的单个追踪记录。
对于每次运行,“评估运行历史记录”选项卡显示:
- 每个评估者的分数,以及评分者的理由
- 单个数据点结果,并排显示实际值和预期值
- 完整追踪:触发运行的原因、采取的路径、每个节点的输出和时间
追踪记录和评分器理由表明需要更改哪些内容才能使工作流在每个案例上正确运行。
示例:对支持电子邮件进行分类
Maestro BPMN 工作流使用 AI 智能体对客户支持电子邮件进行分类。在发布之前,您设置一个包含 10 个数据点的评估集:
- 5 封电子邮件分类为
"billing" - 3 个电子邮件分类为
"technical" - 2 封模棱两可的电子邮件,视为边缘用例
每个数据点都定义了预期 classification 输出值,或者说,对于模糊的电子邮件,升级为触发的人工升级。分类的精确匹配评估器会为"billing"或"technical"每个结果评分,轨迹评估器会检查人工升级情况。每次运行都会显示在工作流投入生产之前智能体出错的案例。
节点模拟
在评估运行期间,模拟会覆盖选定的节点输出,因此您可以测试下游逻辑,而无需执行节点的实际操作。当实际操作速度慢、成本高昂,或者依赖于设计期间不可用的外部系统时,这非常有用。
在节点上启用模拟时,运行会跳过该节点的实际执行,并直接使用模拟的输出值。所有下游节点都会收到模拟值,就像节点正常运行一样。
模拟仅在测试运行期间适用。它们在已发布的生产工作流中永远不会处于活动状态。
模拟策略
每个模拟节点都使用以下以下策略之一:
- 静态模拟— 一种基于规则的模拟,始终返回您定义的值。
- 生成的模拟— 由 LLM 生成的响应,在每次运行评估时动态生成。
设置模拟
在评估运行期间,在要替换其实际输出的任何节点上配置模拟。以下序列显示了从选择节点到输入模拟输出的完整流程。
- 选择要在画布上模拟的节点。
- 在“配置”面板中,打开“添加模拟” 。
- 选择节点的模拟策略。
- 输入所选策略的模拟输出:
- 对于静态模拟,通过手动编辑 JSON 或使用提示词功能生成 JSON 来输入输出值。使用与节点输出架构匹配的有效 JSON。
- 对于生成的模拟,输入模型在每次评估运行时生成工具响应的提示词。
结果:节点已模拟完成。在下一次测试运行时,Maestro BPMN 会跳过实际执行,并将您的值注入下游。
您可以模拟的节点
模拟适用于以下节点类型:
- 人工任务— 无需等待真实人批准即可返回已批准或拒绝的响应。
- HTTP 请求— 返回特定 API 响应,包括错误响应,以便您测试错误处理路径。
- 智能体— 返回 AI 智能体的输出,以便您测试工作流如何处理不同的智能体响应。
- 连接— 返回连接节点的输出,以便您测试工作流,而无需在外部应用程序中进行更改。
可用性和许可
- 拥有许可中详述的许可证类型和 Automation Cloud 组织许可计划的用户可以进行评估。
- 在预览期间,可以免费提供节点模拟、在评估中使用 LLM 功能的模拟生成以及 LLM-judge 评估程序。设计中的 Maestro BPMN 执行消耗量不超过每月用户上限。
已知限制
- 节点级别评估不可用。
- Maestro BPMN 评估没有CLI 技能支持。