uip Maestro 流评估
“uip Maestro Flow eval”的语法和选项,可在本地管理评估程序、评估集和数据点,并在 Studio Web 中运行。
uip maestro flow eval用于管理 Flow 项目的评估资产——评估程序(评分逻辑)、评估集(命名的测试用例组)和数据点(集合中的单个测试用例)——并在 Studio Web 中远程运行这些资产。所有这些操作都会编辑 Flow 项目中的本地 JSON 文件,但 eval run 除外,它会与 Studio Web 通信。
概念
- 评估程序— 应用于数据点的实际输出的评分逻辑(精确匹配、JSON 相似度、包含或 LLM 评判者)。
- 评估集— 数据点的命名集合以及对其进行评分的评估器。可将作用域限定为整个流或一个代理节点(
--entry-point具有代理节点 ID)。 - 数据点— 一个集合中的一个测试用例:输入、可选的预期输出、可选的每个评估程序条件。
- 模拟——对附加到特定数据点的一个组件(节点或智能体节点上的子工具)的模拟或 LLM 模拟响应,让您无需调用真实依赖项即可测试流程。
- 每个本地子命令(
evaluator、set、裸数据点动词simulation)都接受--path <path>——一个 Flow 项目目录或一个包含一个 Flow 项目的解决方案目录。默认为.。
大纲
uip maestro flow eval evaluator add <name> --type <type> [--description <text>] [--target-key <key>] [--model <model>] [--prompt <text>] [--path <path>]
uip maestro flow eval evaluator list [--path <path>]
uip maestro flow eval evaluator remove <id> [--path <path>]
uip maestro flow eval set add <name> [--evaluators <refs>] [--entry-point <id>] [--path <path>]
uip maestro flow eval set list [--path <path>]
uip maestro flow eval set remove <id> [--path <path>]
uip maestro flow eval add <name> --set <name> [--inputs <json>] [--input-file <key=path>]... [--expected <json>] [--criteria <json>] [--search-text <text>] [--path <path>]
uip maestro flow eval list --set <name> [--path <path>]
uip maestro flow eval remove <id> --set <name> [--path <path>]
uip maestro flow eval simulation add <component-id> --set <name> --data-point <id> --strategy <Static|Llm> [options...] [--path <path>]
uip maestro flow eval simulation list --set <name> --data-point <id> [--parent <component-id>] [--path <path>]
uip maestro flow eval simulation remove <component-id> --set <name> --data-point <id> [--parent <component-id>] [--path <path>]
uip maestro flow eval run start --set <name> [--solution-id <id> | --project-id <id>] [--entry-point <entry>] [--folder-key <key>] [--debug-mode <mode>] [--wait [--timeout <seconds>]]
uip maestro flow eval run status <evalSetRunId> --set <name> [--solution-id <id> | --project-id <id>]
uip maestro flow eval run results <evalSetRunId> --set <name> [--only-failed] [--verbose] [--export-format <json|csv>]
uip maestro flow eval run list --set <name> [--solution-id <id> | --project-id <id>]
uip maestro flow eval run compare <evalSetRunId> --compare-to <id> --set <name>
uip maestro flow eval evaluator add <name> --type <type> [--description <text>] [--target-key <key>] [--model <model>] [--prompt <text>] [--path <path>]
uip maestro flow eval evaluator list [--path <path>]
uip maestro flow eval evaluator remove <id> [--path <path>]
uip maestro flow eval set add <name> [--evaluators <refs>] [--entry-point <id>] [--path <path>]
uip maestro flow eval set list [--path <path>]
uip maestro flow eval set remove <id> [--path <path>]
uip maestro flow eval add <name> --set <name> [--inputs <json>] [--input-file <key=path>]... [--expected <json>] [--criteria <json>] [--search-text <text>] [--path <path>]
uip maestro flow eval list --set <name> [--path <path>]
uip maestro flow eval remove <id> --set <name> [--path <path>]
uip maestro flow eval simulation add <component-id> --set <name> --data-point <id> --strategy <Static|Llm> [options...] [--path <path>]
uip maestro flow eval simulation list --set <name> --data-point <id> [--parent <component-id>] [--path <path>]
uip maestro flow eval simulation remove <component-id> --set <name> --data-point <id> [--parent <component-id>] [--path <path>]
uip maestro flow eval run start --set <name> [--solution-id <id> | --project-id <id>] [--entry-point <entry>] [--folder-key <key>] [--debug-mode <mode>] [--wait [--timeout <seconds>]]
uip maestro flow eval run status <evalSetRunId> --set <name> [--solution-id <id> | --project-id <id>]
uip maestro flow eval run results <evalSetRunId> --set <name> [--only-failed] [--verbose] [--export-format <json|csv>]
uip maestro flow eval run list --set <name> [--solution-id <id> | --project-id <id>]
uip maestro flow eval run compare <evalSetRunId> --compare-to <id> --set <name>
请注意命名:数据点使用纯 eval add/list/remove(而不是 eval evaluation add - 实际命令路径中没有“评估”一词,即使来源内部将此概念称为“评估” “评估”)。
uip Maestro 流评估评估程序
管理评估程序 — 应用于数据点的评分逻辑。
uip Maestro 流评估评估程序添加
| 选项 | 必填 | 描述 |
|---|---|---|
<name> (参数) | 是 | 评估程序名称。 |
--type <type> | 是 | 为以下选项之一:exact-match、json-similarity、contains、llm-judge-output、llm-judge-strict-json、llm-judge-trajectory、llm-judge-trajectory-simulation。 |
--description <text> | 否 | 评估程序说明。 |
--target-key <key> | 否 | 要评分的目标输出键。默认 *(整体输出)。 |
--model <model> | 否 | LLM 模型 — 仅对 llm-judge-* 类型有意义。 |
--prompt <text> | 否 | 自定义 LLM 判断提示词 — 仅对 llm-judge-* 类型有意义。 |
--path <path> | 否 | 流项目目录。默认 .。 |
数据形状: Code: "FlowEvalEvaluatorAdd" 、 Data: { Name, Id, Type, File } 。
uip Maestro 流评估评估程序列表
数据形状:Code: "FlowEvalEvaluatorList",Data 是 { Name, Id, Type, TargetKey, File } 的数组。
uip Maestro 流评估评估程序删除
参数:<id> — 评估程序 ID、名称或文件基本名称。数据形状:Code: "FlowEvalEvaluatorRemove"。
uip Maestro 流评估集
管理评估集。
uip Maestro 流评估集添加
| 选项 | 必填 | 描述 |
|---|---|---|
<name> (参数) | 是 | 评估集名称。 |
--evaluators <refs> | 否 | 逗号分隔的评估程序 ID 或文件基本名称。默认值:项目中的所有评估程序。 |
--entry-point <id> | 否 | 入口点节点 ID,存储为集合的 selectedEntrypoint。传递代理节点的ID 会创建一个节点范围的集合,该集合仅独立评估该代理。 |
--path <path> | 否 | 流项目目录。 |
数据形状:Code: "FlowEvalSetAdd" 、Data: { Name, Id, Evaluators, File, Scope, TargetNode? } — TargetNode 仅适用于节点范围内的集合。
uip Maestro 流评估集列表
数据形状:Code: "FlowEvalSetList",Data 是 { Name, Id, DataPoints, Evaluators, File, Scope, TargetNode? } 的数组。
删除 uip Maestro 流评估集
参数:<id> — 集合 ID、名称或文件基本名称。数据形状:Code: "FlowEvalSetRemove"。
uip Maestro 流评估(数据点)
管理评估集中的单个测试用例。已直接在 eval 上注册,而非在 data-point 或 evaluation 子组下注册。
uip Maestro 流评估添加
| 选项 | 必填 | 描述 |
|---|---|---|
<name> (参数) | 是 | 数据点名称。 |
--set <name> | 是 | 评估集名称或 ID。 |
--inputs <json> | 否* | JSON 对象形式的输入值。 |
--input-file <key=path> | 否* | 附加文件作为输入 <key>。可重复。 |
--expected <json> | 否 | 预期输出为 JSON 对象形式。 |
--criteria <json> | 否 | 基于评估程序的条件,以评估程序 ID 为键控的 JSON 对象。 |
--search-text <text> | 否 | 用于 contains 类型评估程序的搜索文本。 |
--path <path> | 否 | 流项目目录。 |
* --inputs/--input-file 中至少有一个为必填项。
数据形状: Code: "FlowEvalAdd" 、 Data: { Status, Name, Id, Set } 。
uip Maestro 流评估列表
需要 --set <name>。数据形:Code: "FlowEvalList",Data 是 { Name, Id, Inputs, Expected, Evaluators } 的数组(Inputs/Expected 为字符串化的 JSON;Expected 当不存在时为 "-")。
移除 uip Maestro 流评估
参数:<id>(数据点 ID 或名称)。需要 --set <name>。数据形状:Code: "FlowEvalRemove"。
uip Maestro 流评估模拟
模拟或 LLM - 模拟组件对一个数据点的响应 — 让数据点在不涉及实际依赖项(外部 API、嵌套智能体工具等)的情况下执行流程。
添加 uip Maestro 流评估模拟
| 选项 | 必填 | 描述 |
|---|---|---|
<component-id> (参数) | 是 | 要模拟的组件 ID。 |
--set <name> | 是 | 评估集名称或 ID。 |
--data-point <id> | 是 | 数据点名称或 ID。 |
--strategy <Static|Llm> | 是 | 模拟策略。 |
--component-type <type> | 有条件地 | 如果传递 Node,则默认为 --parent;否则需要。 |
--component-description <text> | 否 | 组件描述。 |
--simulation-instructions <text> | 需要 Llm | LLM 模拟说明。 |
--mock-value <json> | 需要 Static | 以 JSON 格式输出的模拟输出值。 |
--parent <component-id> | 否 | 父智能体组件 ID。设置后,这将作为子工具模拟添加到该智能体节点上,而不是顶层组件模拟。 |
--path <path> | 否 | 流项目目录。 |
数据形状:Code: "FlowEvalSimulationAdd"(或 "FlowEvalChildSimulationAdd",如果设置了 --parent),Data: { ComponentId, ComponentType, Strategy, DataPoint, Set, Parent? }。
uip Maestro 流评估模拟列表
需要 --set/--data-point。--parent <component-id> 列出该代理节点上的子工具模拟,而不是顶级工具模拟。数据形状:Code: "FlowEvalSimulationList"(或 "FlowEvalChildSimulationList" 且为 --parent)。
uip Maestro 流评估模拟已删除
参数:<component-id>。需要 --set/--data-point; --parent 以以子模拟为目标。数据形状:Code: "FlowEvalSimulationRemove"。
uip Maestro 流评估运行
在 Studio Web 中远程运行评估集并检查结果。每个子命令都接受 --set <name>(必填),以及用于固定目标 Studio Web 项目的 --solution-id <id> 或 --project-id <id>(默认情况下,从父级 .uipx 或 SolutionStorage.json 读取)的 --path <path>。
uip Maestro 流评估运行开始
其他选项:--entry-point <entry>(流程入口点路径,例如 /Main.bpmn#start 或开始节点 ID)、--folder-key <key>(Orchestrator 文件夹 — 如果省略,则使用个人工作区)、--debug-mode <mode>(覆盖 Studio Web 调试模式) --wait(在完成之前阻止并打印结果),--timeout <seconds>(使用 --wait)。
uip maestro flow eval run start --set "Regression Suite" --wait
uip maestro flow eval run start --set "Regression Suite" --wait
数据形状:Code: "FlowEvalRunStarted"、Data: { EvalSetRunId, EvalSetName, DataPoints, Evaluators, Status }。如果没有 --wait,Instructions 会告诉您要轮询的确切 eval run status 命令。
uip Maestro 流评估运行状态
参数:<evalSetRunId>。数据形状:Code: "FlowEvalRunStatus"、Data: { EvalSetRunId, Status, Score, Duration, EvaluatorScores }(如果尚未评分,则Score为"-")。
uip Maestro 流评估运行结果
参数:<evalSetRunId>。其他选项:--only-failed(筛选到失败/出错的数据点)、--verbose(包括评估程序理由)、--export-format <json|csv>(写入文件而不是打印)。数据形状:Code: "FlowEvalRunResults",Data 是按数据点的结果行组成的数组。
uip Maestro 流评估运行列表
除共享目标选项外无参数。数据形状:Code: "FlowEvalRunList",Data 是该集合过去运行摘要的数组。
uip Maestro 流评估运行比较
参数:<evalSetRunId> 加上 --compare-to <id>(必填)— 要比较的第二次运行。数据形状:Code: "FlowEvalRunComparison",Data 是两次运行分数和每个数据点结果之间的结构化差异。
另请参阅
uip maestro flow debug— 以交互式方式对流进行烟雾测试,而不是运行已评分的评估集uip maestro flow init、uip maestro flow node- 流概述
- 全局选项、退出代码
- 概念
- 大纲
- uip Maestro 流评估评估程序
- uip Maestro 流评估评估程序添加
- uip Maestro 流评估评估程序列表
- uip Maestro 流评估评估程序删除
- uip Maestro 流评估集
- uip Maestro 流评估集添加
- uip Maestro 流评估集列表
- 删除 uip Maestro 流评估集
- uip Maestro 流评估(数据点)
- uip Maestro 流评估添加
- uip Maestro 流评估列表
- 移除 uip Maestro 流评估
- uip Maestro 流评估模拟
- 添加 uip Maestro 流评估模拟
- uip Maestro 流评估模拟列表
- uip Maestro 流评估模拟已删除
- uip Maestro 流评估运行
- uip Maestro 流评估运行开始
- uip Maestro 流评估运行状态
- uip Maestro 流评估运行结果
- uip Maestro 流评估运行列表
- uip Maestro 流评估运行比较
- 另请参阅