UiPath Documentation
uipath-cli
latest
false
UiPath CLI 用户指南
重要 :
请注意,此内容已使用机器翻译进行了本地化。 新发布内容的本地化可能需要 1-2 周的时间才能完成。

UIP 评估

“uip eval”的语法和选项,该语法和选项针对 Orchestrator 包运行运行时评估,并管理评估程序、评估集、评估和计划。

uip eval 针对已部署的 Orchestrator 包运行运行时评估:通过流程提交真实输入,使用一个或多个评估程序对输出进行评分,并检查结果。它还管理该工作流背后的可重用构建块,其中包括评估程序(评分逻辑)、评估集(对评估进行分组的命名集合)、评估(单独保存的测试用例定义——名称、输入、预期输出/行为)以及触发器将自动运行。

此资源跨四个页面,按子域划分:

  • 此页面— 概念,和execute-and-evaluate / run (提交运行,然后列出/检查其结果)。
  • schedule — 创建/列出/获取/更新/暂停/继续/删除定期评估运行。
  • evaluator — 管理评分逻辑(例如LLM-judge 评估程序),运行将应用于其输出。
  • eval-set和evaluation — 管理策划项目集合和单个评估定义。

uip eval作为自己的独立包( @uipath/eval-tool ,命令前缀eval )提供,它不是uip or的子命令,即使此处的每个动词都是针对 Orchestrator 流程/文件夹进行操作的。有关此工具的--process-key / --folder-key / --tenant选项遵循的共享 Orchestrator 约定(身份验证、文件夹作用域、密钥类型、输出信封),请参阅uip or概述” 。

概念​

  • 评估项目— 一个测试用例内联传递给execute-and-evaluate :一个id 、一个name和一个inputs对象,与流程的预期输入架构匹配。运行会直接在命令行中提交这些数组,无论它是否引用了已保存的评估集。
  • 评估— 评估项目的已保存对应项:属于评估集的保留的测试用例定义(名称、输入,以及(可选)预期输出/行为)。使用eval evaluation进行管理。
  • 评估程序— 应用于每个项目输出的评分逻辑,由evaluatorTypeId (例如uipath-llm-judge-output-semantic-similarity )和evaluatorConfig对象标识。使用eval evaluator管理已保存的评估程序;运行还可以通过--evaluators传递评估程序配置。
  • 评估集— 已命名的可重用评估集合,通过eval eval-set进行管理。execute-and-evaluate 可以通过 --eval-set-id 引用其中一个以进行跟踪/分组,也可以省略它以临时运行(默认为零 GUID 00000000-0000-0000-0000-000000000000)—无论哪种方式,给定运行中的实际项目评分均为 --items该调用中包含以下内容。
  • 评估集运行与评估运行— 提交execute-and-evaluate将创建一次评估集运行(整体批次,由EvalSetRunId标识),每个评估集扇出到每个项目一次评估运行( run results单独列出这些项目,每个项目都有自己的属性Status / Result )。
  • 文件夹范围— execute-and-evaluate和run解析--folder-key中的文件夹,如果省略,则默认为您的个人工作区(CLI 自动查找)。这与大多数uip or动词不同,后者需要明确的文件夹选取器 — 请参阅常规约定概述。

大纲​

uip eval execute-and-evaluate --process-key <guid> --workload-id <guid> --items <json> --evaluators <json> [--eval-set-id <guid>] [--batch-size <n>] [--folder-key <key>] [--tenant <name>]
uip eval run list    --process-key <guid> [--limit <n>] [--offset <n>] [--tenant <name>]
uip eval run get     <evalSetRunId> --process-key <guid> [--tenant <name>]
uip eval run results <evalSetRunId> --process-key <guid> [--tenant <name>]
uip eval execute-and-evaluate --process-key <guid> --workload-id <guid> --items <json> --evaluators <json> [--eval-set-id <guid>] [--batch-size <n>] [--folder-key <key>] [--tenant <name>]
uip eval run list    --process-key <guid> [--limit <n>] [--offset <n>] [--tenant <name>]
uip eval run get     <evalSetRunId> --process-key <guid> [--tenant <name>]
uip eval run results <evalSetRunId> --process-key <guid> [--tenant <name>]

execute-and-evaluate 有一个别名:run-offline-evals。

uip eval 执行并评估​

提交 Orchestrator 包的运行时评估运行:通过由 --process-key 标识的流程发送一批项目,使用给定的评估程序对每个输出进行评分,并返回 EvalSetRunId 以使用 run get/run results 进行轮询。

选项​

短长值默认描述
—--process-keyGUID—必需。流程密钥。使用 uip or processes list 查找可用密钥。
—--workload-idGUID—必需。工作负载 ID。
—--itemsJSON 数组—必需。评估项目,每个项目带有 id(字符串)、name(字符串)和 inputs(对象)。在调用前已进行客户端验证 — 任何项目上的字段缺失/格式错误都会快速失败,从而命名项目索引。
—--evaluatorsJSON 数组—必需。评估程序配置,每个配置都包含 id、evaluatorTypeId 和 evaluatorConfig。
—--eval-set-idGUID零 GUID引用已保存的评估集。若为临时运行,可省略。
—--batch-size数字5评估管道并发数量上限。
—--folder-keyGUID个人工作区要在其中运行的文件夹。使用 uip or folders list 查找可用密钥。
—--tenantname会话默认值UiPath 租户名称。“纯文本”选项 — 请参阅“概念” 。

示例​

# Submit a run with an ad hoc item and an inline evaluator
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
  --workload-id a1b2c3d4-0000-0000-0000-000000000001 \
  --items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
  --evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]'
# Submit a run with an ad hoc item and an inline evaluator
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
  --workload-id a1b2c3d4-0000-0000-0000-000000000001 \
  --items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
  --evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]'
# Reference a saved eval set and a specific folder
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
  --workload-id a1b2c3d4-0000-0000-0000-000000000001 \
  --items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
  --evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]' \
  --eval-set-id a1b2c3d4-0000-0000-0000-000000000001 \
  --folder-key a9f3b2c1-7d4e-4a8b-9c2f-5e1d3b6a8f7e
# Reference a saved eval set and a specific folder
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
  --workload-id a1b2c3d4-0000-0000-0000-000000000001 \
  --items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
  --evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]' \
  --eval-set-id a1b2c3d4-0000-0000-0000-000000000001 \
  --folder-key a9f3b2c1-7d4e-4a8b-9c2f-5e1d3b6a8f7e

数据形状(--输出 json)​

{
  "Code": "EvalRunSubmitted",
  "Data": {
    "ProcessKey": "9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09",
    "Folder": "user@uipath.com's workspace",
    "EvalSetId": "00000000-0000-0000-0000-000000000000",
    "EvalSetRunId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04"
  }
}
{
  "Code": "EvalRunSubmitted",
  "Data": {
    "ProcessKey": "9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09",
    "Folder": "user@uipath.com's workspace",
    "EvalSetId": "00000000-0000-0000-0000-000000000000",
    "EvalSetRunId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04"
  }
}

如果省略 Folder,--folder-key 会回显解析的个人工作区名称,否则会回显您传递的原始密钥。

运行 uip 评估​

检查由 execute-and-evaluate 创建、由 --process-key 限定的评估集运行。

uip 评估运行列表​

列出流程的评估集运行情况。

选项​
短长值默认描述
—--process-keyGUID—必需。流程密钥(部署 GUID)。
—--limit数字50要返回的最大运行次数。
—--offset数字0要跳过的运行数。
—--tenantname会话默认值UiPath 租户名称。
示例​
uip eval run list --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
uip eval run list --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
数据形状(--输出 json)​
{
  "Code": "EvalSetRunList",
  "Data": [
    {
      "EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
      "EvalSetId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04",
      "Status": "completed",
      "Score": 0.86,
      "EvalsExecuted": 5,
      "Duration": "42.5s",
      "CreatedAt": "2026-08-01T10:00:00Z"
    }
  ],
  "Pagination": { "returned": 1, "limit": 50, "offset": 0 }
}
{
  "Code": "EvalSetRunList",
  "Data": [
    {
      "EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
      "EvalSetId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04",
      "Status": "completed",
      "Score": 0.86,
      "EvalsExecuted": 5,
      "Duration": "42.5s",
      "CreatedAt": "2026-08-01T10:00:00Z"
    }
  ],
  "Pagination": { "returned": 1, "limit": 50, "offset": 0 }
}

当尚不可用(运行仍在进行中)时,Score和 Duration为 "-"。不足一秒时,Duration 的格式为 Nms,否则为 N.Ns。

uip eval 运行获取​

获取一次评估集运行的详细信息。

参数​
名称必填用途
<evalSetRunId>是评估集运行 ID (GUID),来自 run list 或 execute-and-evaluate 的输出。
选项​
短长值默认描述
—--process-keyGUID—必需。流程密钥(部署 GUID)。
—--tenantname会话默认值UiPath 租户名称。
示例​
uip eval run get a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
uip eval run get a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
数据形状(--输出 json)​
{
  "Code": "EvalSetRunDetails",
  "Data": {
    "EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
    "Status": "completed",
    "Score": 0.86,
    "EvalsExecuted": 5,
    "Duration": "42.5s"
  }
}
{
  "Code": "EvalSetRunDetails",
  "Data": {
    "EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
    "Status": "completed",
    "Score": 0.86,
    "EvalsExecuted": 5,
    "Duration": "42.5s"
  }
}

形状与一个 run list 条目相同(减去 EvalSetId/CreatedAt),按 ID 获取,而非列出。

uip 评估运行结果​

查看评估集运行的每个项目的评估运行结果 — 在原始 execute-and-evaluate 调用中提交的每个项目一个条目。

参数​
名称必填用途
<evalSetRunId>是评估集运行 ID (GUID)。
选项​
短长值默认描述
—--process-keyGUID—必需。流程密钥(部署 GUID)。
—--tenantname会话默认值UiPath 租户名称。
示例​
uip eval run results a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
uip eval run results a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
数据形状(--输出 json)​
{
  "Code": "EvalRunResults",
  "Data": [
    {
      "EvalRunId": "e1e2e3e4-0000-0000-0000-000000000001",
      "DataPoint": "Test Case 1",
      "Status": "completed",
      "Result": {}
    }
  ]
}
{
  "Code": "EvalRunResults",
  "Data": [
    {
      "EvalRunId": "e1e2e3e4-0000-0000-0000-000000000001",
      "DataPoint": "Test Case 1",
      "Status": "completed",
      "Result": {}
    }
  ]
}

DataPoint 是原始项目的 name(如果快照没有,则回退为评估运行自己的 ID)。Result 是评估程序的原始评分有效负载 — 形式取决于运行的评估程序。

另请参阅​

此页面有帮助吗?

连接

需要帮助? 支持

想要了解详细内容? UiPath Academy

有问题? UiPath 论坛

保持更新