UIP 评估
“uip eval”的语法和选项,该语法和选项针对 Orchestrator 包运行运行时评估,并管理评估程序、评估集、评估和计划。
uip eval 针对已部署的 Orchestrator 包运行运行时评估:通过流程提交真实输入,使用一个或多个评估程序对输出进行评分,并检查结果。它还管理该工作流背后的可重用构建块,其中包括评估程序(评分逻辑)、评估集(对评估进行分组的命名集合)、评估(单独保存的测试用例定义——名称、输入、预期输出/行为)以及触发器将自动运行。
此资源跨四个页面,按子域划分:
- 此页面— 概念,和
execute-and-evaluate/run(提交运行,然后列出/检查其结果)。 schedule— 创建/列出/获取/更新/暂停/继续/删除定期评估运行。evaluator— 管理评分逻辑(例如LLM-judge 评估程序),运行将应用于其输出。eval-set和evaluation— 管理策划项目集合和单个评估定义。
uip eval作为自己的独立包( @uipath/eval-tool ,命令前缀eval )提供,它不是uip or的子命令,即使此处的每个动词都是针对 Orchestrator 流程/文件夹进行操作的。有关此工具的--process-key / --folder-key / --tenant选项遵循的共享 Orchestrator 约定(身份验证、文件夹作用域、密钥类型、输出信封),请参阅uip or概述” 。
概念
- 评估项目— 一个测试用例内联传递给
execute-and-evaluate:一个id、一个name和一个inputs对象,与流程的预期输入架构匹配。运行会直接在命令行中提交这些数组,无论它是否引用了已保存的评估集。 - 评估— 评估项目的已保存对应项:属于评估集的保留的测试用例定义(名称、输入,以及(可选)预期输出/行为)。使用
eval evaluation进行管理。 - 评估程序— 应用于每个项目输出的评分逻辑,由
evaluatorTypeId(例如uipath-llm-judge-output-semantic-similarity)和evaluatorConfig对象标识。使用eval evaluator管理已保存的评估程序;运行还可以通过--evaluators传递评估程序配置。 - 评估集— 已命名的可重用评估集合,通过
eval eval-set进行管理。execute-and-evaluate可以通过--eval-set-id引用其中一个以进行跟踪/分组,也可以省略它以临时运行(默认为零 GUID00000000-0000-0000-0000-000000000000)—无论哪种方式,给定运行中的实际项目评分均为--items该调用中包含以下内容。 - 评估集运行与评估运行— 提交
execute-and-evaluate将创建一次评估集运行(整体批次,由EvalSetRunId标识),每个评估集扇出到每个项目一次评估运行(run results单独列出这些项目,每个项目都有自己的属性Status/Result)。 - 文件夹范围—
execute-and-evaluate和run解析--folder-key中的文件夹,如果省略,则默认为您的个人工作区(CLI 自动查找)。这与大多数uip or动词不同,后者需要明确的文件夹选取器 — 请参阅常规约定概述。
大纲
uip eval execute-and-evaluate --process-key <guid> --workload-id <guid> --items <json> --evaluators <json> [--eval-set-id <guid>] [--batch-size <n>] [--folder-key <key>] [--tenant <name>]
uip eval run list --process-key <guid> [--limit <n>] [--offset <n>] [--tenant <name>]
uip eval run get <evalSetRunId> --process-key <guid> [--tenant <name>]
uip eval run results <evalSetRunId> --process-key <guid> [--tenant <name>]
uip eval execute-and-evaluate --process-key <guid> --workload-id <guid> --items <json> --evaluators <json> [--eval-set-id <guid>] [--batch-size <n>] [--folder-key <key>] [--tenant <name>]
uip eval run list --process-key <guid> [--limit <n>] [--offset <n>] [--tenant <name>]
uip eval run get <evalSetRunId> --process-key <guid> [--tenant <name>]
uip eval run results <evalSetRunId> --process-key <guid> [--tenant <name>]
execute-and-evaluate 有一个别名:run-offline-evals。
uip eval 执行并评估
提交 Orchestrator 包的运行时评估运行:通过由 --process-key 标识的流程发送一批项目,使用给定的评估程序对每个输出进行评分,并返回 EvalSetRunId 以使用 run get/run results 进行轮询。
选项
| 短 | 长 | 值 | 默认 | 描述 |
|---|---|---|---|---|
| — | --process-key | GUID | — | 必需。流程密钥。使用 uip or processes list 查找可用密钥。 |
| — | --workload-id | GUID | — | 必需。工作负载 ID。 |
| — | --items | JSON 数组 | — | 必需。评估项目,每个项目带有 id(字符串)、name(字符串)和 inputs(对象)。在调用前已进行客户端验证 — 任何项目上的字段缺失/格式错误都会快速失败,从而命名项目索引。 |
| — | --evaluators | JSON 数组 | — | 必需。评估程序配置,每个配置都包含 id、evaluatorTypeId 和 evaluatorConfig。 |
| — | --eval-set-id | GUID | 零 GUID | 引用已保存的评估集。若为临时运行,可省略。 |
| — | --batch-size | 数字 | 5 | 评估管道并发数量上限。 |
| — | --folder-key | GUID | 个人工作区 | 要在其中运行的文件夹。使用 uip or folders list 查找可用密钥。 |
| — | --tenant | name | 会话默认值 | UiPath 租户名称。“纯文本”选项 — 请参阅“概念” 。 |
示例
# Submit a run with an ad hoc item and an inline evaluator
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
--workload-id a1b2c3d4-0000-0000-0000-000000000001 \
--items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
--evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]'
# Submit a run with an ad hoc item and an inline evaluator
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
--workload-id a1b2c3d4-0000-0000-0000-000000000001 \
--items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
--evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]'
# Reference a saved eval set and a specific folder
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
--workload-id a1b2c3d4-0000-0000-0000-000000000001 \
--items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
--evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]' \
--eval-set-id a1b2c3d4-0000-0000-0000-000000000001 \
--folder-key a9f3b2c1-7d4e-4a8b-9c2f-5e1d3b6a8f7e
# Reference a saved eval set and a specific folder
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
--workload-id a1b2c3d4-0000-0000-0000-000000000001 \
--items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
--evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]' \
--eval-set-id a1b2c3d4-0000-0000-0000-000000000001 \
--folder-key a9f3b2c1-7d4e-4a8b-9c2f-5e1d3b6a8f7e
数据形状(--输出 json)
{
"Code": "EvalRunSubmitted",
"Data": {
"ProcessKey": "9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09",
"Folder": "user@uipath.com's workspace",
"EvalSetId": "00000000-0000-0000-0000-000000000000",
"EvalSetRunId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04"
}
}
{
"Code": "EvalRunSubmitted",
"Data": {
"ProcessKey": "9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09",
"Folder": "user@uipath.com's workspace",
"EvalSetId": "00000000-0000-0000-0000-000000000000",
"EvalSetRunId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04"
}
}
如果省略 Folder,--folder-key 会回显解析的个人工作区名称,否则会回显您传递的原始密钥。
运行 uip 评估
检查由 execute-and-evaluate 创建、由 --process-key 限定的评估集运行。
uip 评估运行列表
列出流程的评估集运行情况。
选项
| 短 | 长 | 值 | 默认 | 描述 |
|---|---|---|---|---|
| — | --process-key | GUID | — | 必需。流程密钥(部署 GUID)。 |
| — | --limit | 数字 | 50 | 要返回的最大运行次数。 |
| — | --offset | 数字 | 0 | 要跳过的运行数。 |
| — | --tenant | name | 会话默认值 | UiPath 租户名称。 |
示例
uip eval run list --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
uip eval run list --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
数据形状(--输出 json)
{
"Code": "EvalSetRunList",
"Data": [
{
"EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
"EvalSetId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04",
"Status": "completed",
"Score": 0.86,
"EvalsExecuted": 5,
"Duration": "42.5s",
"CreatedAt": "2026-08-01T10:00:00Z"
}
],
"Pagination": { "returned": 1, "limit": 50, "offset": 0 }
}
{
"Code": "EvalSetRunList",
"Data": [
{
"EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
"EvalSetId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04",
"Status": "completed",
"Score": 0.86,
"EvalsExecuted": 5,
"Duration": "42.5s",
"CreatedAt": "2026-08-01T10:00:00Z"
}
],
"Pagination": { "returned": 1, "limit": 50, "offset": 0 }
}
当尚不可用(运行仍在进行中)时,Score和 Duration为 "-"。不足一秒时,Duration 的格式为 Nms,否则为 N.Ns。
uip eval 运行获取
获取一次评估集运行的详细信息。
参数
| 名称 | 必填 | 用途 |
|---|---|---|
<evalSetRunId> | 是 | 评估集运行 ID (GUID),来自 run list 或 execute-and-evaluate 的输出。 |
选项
| 短 | 长 | 值 | 默认 | 描述 |
|---|---|---|---|---|
| — | --process-key | GUID | — | 必需。流程密钥(部署 GUID)。 |
| — | --tenant | name | 会话默认值 | UiPath 租户名称。 |
示例
uip eval run get a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
uip eval run get a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
数据形状(--输出 json)
{
"Code": "EvalSetRunDetails",
"Data": {
"EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
"Status": "completed",
"Score": 0.86,
"EvalsExecuted": 5,
"Duration": "42.5s"
}
}
{
"Code": "EvalSetRunDetails",
"Data": {
"EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
"Status": "completed",
"Score": 0.86,
"EvalsExecuted": 5,
"Duration": "42.5s"
}
}
形状与一个 run list 条目相同(减去 EvalSetId/CreatedAt),按 ID 获取,而非列出。
uip 评估运行结果
查看评估集运行的每个项目的评估运行结果 — 在原始 execute-and-evaluate 调用中提交的每个项目一个条目。
参数
| 名称 | 必填 | 用途 |
|---|---|---|
<evalSetRunId> | 是 | 评估集运行 ID (GUID)。 |
选项
| 短 | 长 | 值 | 默认 | 描述 |
|---|---|---|---|---|
| — | --process-key | GUID | — | 必需。流程密钥(部署 GUID)。 |
| — | --tenant | name | 会话默认值 | UiPath 租户名称。 |
示例
uip eval run results a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
uip eval run results a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
数据形状(--输出 json)
{
"Code": "EvalRunResults",
"Data": [
{
"EvalRunId": "e1e2e3e4-0000-0000-0000-000000000001",
"DataPoint": "Test Case 1",
"Status": "completed",
"Result": {}
}
]
}
{
"Code": "EvalRunResults",
"Data": [
{
"EvalRunId": "e1e2e3e4-0000-0000-0000-000000000001",
"DataPoint": "Test Case 1",
"Status": "completed",
"Result": {}
}
]
}
DataPoint 是原始项目的 name(如果快照没有,则回退为评估运行自己的 ID)。Result 是评估程序的原始评分有效负载 — 形式取决于运行的评估程序。
相关内容
schedule— 按照计划自动化execute-and-evaluate。evaluator— 管理已保存的评分逻辑。eval-set和evaluation— 管理已保存的项目集合和评估定义。