- 概要
- はじめに
- 概念
- UiPath CLI を使用する
- 使用ガイド
- CI/CD レシピ
- コマンド リファレンス
- 概要
- 終了コード
- グローバル オプション
- uip codedagent
- UIP コーダー
- UIP のコンテキスト グラウンディング
- uip docsai
- uip 関数
- UIP ガードレール
- uip llm - 構成
- uip llm-gateway
- uip model-hub
- add-test-data-entity
- テスト データのキューを追加
- 追加-テスト-データ-バリエーション
- 分析
- 開発
- プロジェクトを作成
- 差分
- アクティビティを検索
- GET-ANALYZER-RULES
- get-default-activity-xaml
- エラーを取得
- 手動テスト用のテスト ケースを取得
- 手動テストステップを取得
- get-library-object-repository
- オブジェクト リポジトリを取得
- get-versions
- Get-workflow-example
- indicate-application
- 要素を示す
- inspect-package
- install-data-fabric-entities
- パッケージのインストールまたは更新
- list-data-fabric-entities
- リスト - インスタンス
- list-workflow-examples
- パッケージ化
- パブリッシュ
- リモート
- 元に戻す
- 実行、デバッグ、実行
- ファイル名を実行
- 検索テンプレート
- スタートスタジオ
- 実行を停止
- TM
- UIA
- UIP タスク
- uip traces
- UIP トレースのフィードバック
- 移行
- 参照とサポート
UIP の評価
「uip eval」の構文とオプション。Orchestrator パッケージに対して実行時の評価を実行し、評価器、評価セット、評価、スケジュールを管理します。
uip eval は、デプロイ済みの Orchestrator パッケージに対して実行時の評価を実行します。プロセスを介して実際の入力を送信し、1 つ以上の評価器で出力をスコアリングし、結果を検証します。また、そのワークフローの背後にある再利用可能な構成要素 (評価器 (スコアリング ロジック)、評価セット (評価をグループ化する名前付きコレクション)、評価 (個別に保存されたテスト ケースの定義 - 名前、入力、期待される出力/動作)、および自動的に実行をトリガーする定期的なスケジュール) も管理します。
このリソースは 4 ページにまたがり、サブドメインごとに分割されています。
- このページ — 概念、および
execute-and-evaluate/run(実行を送信して、その結果を表示/検証する) schedule— 定期的な評価実行を作成/一覧表示/取得/更新/一時停止/再開/削除します。evaluator— スコアリング ロジックを管理します (例:LLM による評価器による評価器) の実行はその出力に適用されます。eval-setとevaluation— キュレーションされたアイテム コレクションと個々の評価の定義を管理します。
uip eval は、独自のスタンドアロン パッケージ (@uipath/eval-tool、コマンド プレフィックス eval) として出荷されます。ここでのすべての動詞は Orchestrator のプロセス/フォルダーに対して動作しますが、uip orのサブコマンドではありません。このツールの--process-key/--folder-key/--tenant オプションが従う共通の Orchestrator 規則 (認証、フォルダーのスコープ、キーの種類、出力エンベロープ) については、uip orの概要をご覧ください。
概念
- 評価項目 —
execute-and-evaluateにインラインで渡された 1 つのテスト ケース (id、name、およびプロセスの予期される入力スキーマに一致するinputsオブジェクト)。実行時に、保存された評価セットも参照しているかどうかに関係なく、これらの配列がコマンド ラインで直接送信されます。 - 評価 — 評価セットに属する、永続化されたテスト ケースの定義 (名前、入力、および必要に応じて期待される出力/動作) である、評価項目に対して保存されたもの。これらを
eval evaluationで管理します。 - 評価器 — 各項目の出力に適用されるスコアリング ロジックです。
evaluatorTypeId(例:uipath-llm-judge-output-semantic-similarity) とevaluatorConfigオブジェクトで識別されます。保存した評価器をeval evaluatorで管理します。実行では、 を介して評価器の設定をインラインで渡すこともできます--evaluators。 - 評価セット — 名前付きで再利用可能な評価のコレクションです。
eval eval-setで管理されます。execute-and-evaluate、追跡/グループ化のために--eval-set-idで参照することも、アドホックで実行するために省略することもできます (既定ではゼロの GUID00000000-0000-0000-0000-000000000000)。 どちらの方法でも、特定の実行でスコアが付けられた実際の項目は、その呼び出しに含まれる--itemsです。 - 評価セットの実行と評価の実行 —
execute-and-evaluate提出すると、 評価セットの実行 が 1 つ作成され (EvalSetRunIdで識別されるバッチ全体) が作成され、項目ごとに 1 つの 評価実行 に展開されます (run resultsには、これらが個別にリストされ、それぞれに独自のStatus/Resultが記載されています)。 - フォルダーへの範囲設定 — フォルダーを
--folder-keyからexecute-and-evaluateしてrun解決します。省略する場合は既定で個人用ワークスペースに設定します (CLI によって自動的に検索されます)。これは、明示的なフォルダー セレクターを必要とするほとんどのuip or動詞とは異なります。一般的な 規則の概要をご覧ください 。
概要
uip eval execute-and-evaluate --process-key <guid> --workload-id <guid> --items <json> --evaluators <json> [--eval-set-id <guid>] [--batch-size <n>] [--folder-key <key>] [--tenant <name>]
uip eval run list --process-key <guid> [--limit <n>] [--offset <n>] [--tenant <name>]
uip eval run get <evalSetRunId> --process-key <guid> [--tenant <name>]
uip eval run results <evalSetRunId> --process-key <guid> [--tenant <name>]
uip eval execute-and-evaluate --process-key <guid> --workload-id <guid> --items <json> --evaluators <json> [--eval-set-id <guid>] [--batch-size <n>] [--folder-key <key>] [--tenant <name>]
uip eval run list --process-key <guid> [--limit <n>] [--offset <n>] [--tenant <name>]
uip eval run get <evalSetRunId> --process-key <guid> [--tenant <name>]
uip eval run results <evalSetRunId> --process-key <guid> [--tenant <name>]
execute-and-evaluate のエイリアスは run-offline-evalsです。
UIP 評価 Execute-and-Evaluate
Orchestrator パッケージの実行時の評価実行を提出します。項目のバッチを、 --process-keyで識別されたプロセスを通じて送信し、指定した評価器で各出力をスコアリングし、run get/run resultsでポーリングするEvalSetRunIdを返します。
オプション
| Short | 長押し | 値 (Value) | 既定 (Default) | 説明 |
|---|---|---|---|---|
| — | --process-key | GUID | — | 必須。プロセス キー。uip or processes list を使用して、使用可能なキーを検索します。 |
| — | --workload-id | GUID | — | 必須。ワークロード ID |
| — | --items | JSON 配列 | — | 必須。評価項目。それぞれ id (文字列)、 name (文字列)、 inputs (オブジェクト) が含まれます。呼び出し前にクライアント側で検証済み — すべての項目のフィールドが欠落しているか、形式が正しくないと、項目のインデックスに名前が付けられるとすぐに失敗します。 |
| — | --evaluators | JSON 配列 | — | 必須。エバリュエーターの設定。それぞれに id、 evaluatorTypeId、 evaluatorConfigがあります。 |
| — | --eval-set-id | GUID | GUID ゼロ | 保存した評価セットを参照します。アドホック実行の場合は省略します。 |
| — | --batch-size | Number | 5 | 同時評価パイプラインの最大数。 |
| — | --folder-key | GUID | 個人用ワークスペース | 実行するフォルダー。uip or folders list を使用して、使用可能なキーを検索します。 |
| — | --tenant | name | セッションの既定値 | UiPath のテナント名です。プレーン オプション — 「概念」をご覧ください。 |
例
# Submit a run with an ad hoc item and an inline evaluator
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
--workload-id a1b2c3d4-0000-0000-0000-000000000001 \
--items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
--evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]'
# Submit a run with an ad hoc item and an inline evaluator
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
--workload-id a1b2c3d4-0000-0000-0000-000000000001 \
--items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
--evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]'
# Reference a saved eval set and a specific folder
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
--workload-id a1b2c3d4-0000-0000-0000-000000000001 \
--items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
--evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]' \
--eval-set-id a1b2c3d4-0000-0000-0000-000000000001 \
--folder-key a9f3b2c1-7d4e-4a8b-9c2f-5e1d3b6a8f7e
# Reference a saved eval set and a specific folder
uip eval execute-and-evaluate --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09 \
--workload-id a1b2c3d4-0000-0000-0000-000000000001 \
--items '[{"id":"1","name":"greeting","inputs":{"input":"hello"}}]' \
--evaluators '[{"id":"ev-1","evaluatorTypeId":"uipath-llm-judge-output-semantic-similarity","evaluatorConfig":{}}]' \
--eval-set-id a1b2c3d4-0000-0000-0000-000000000001 \
--folder-key a9f3b2c1-7d4e-4a8b-9c2f-5e1d3b6a8f7e
データシェイプ(--output json)
{
"Code": "EvalRunSubmitted",
"Data": {
"ProcessKey": "9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09",
"Folder": "user@uipath.com's workspace",
"EvalSetId": "00000000-0000-0000-0000-000000000000",
"EvalSetRunId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04"
}
}
{
"Code": "EvalRunSubmitted",
"Data": {
"ProcessKey": "9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09",
"Folder": "user@uipath.com's workspace",
"EvalSetId": "00000000-0000-0000-0000-000000000000",
"EvalSetRunId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04"
}
}
Folder は、省略されている場合は解決された個人用ワークスペース名 --folder-key 、またはそれ以外の場合は渡した未加工のキーを反映します。
UIP 評価の実行
execute-and-evaluateによって作成された評価セットの実行を検査します。--process-keyでスコープが設定されています。
UIP 評価の実行のリスト
プロセスの評価セットの実行のリストを表示します。
オプション
| Short | 長押し | 値 (Value) | 既定 (Default) | 説明 |
|---|---|---|---|---|
| — | --process-key | GUID | — | 必須。プロセス キー (デプロイの GUID)。 |
| — | --limit | Number | 50 | 戻りまでの最大実行数。 |
| — | --offset | Number | 0 | スキップする実行回数。 |
| — | --tenant | name | セッションの既定値 | UiPath のテナント名です。 |
例
uip eval run list --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
uip eval run list --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
データシェイプ(--output json)
{
"Code": "EvalSetRunList",
"Data": [
{
"EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
"EvalSetId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04",
"Status": "completed",
"Score": 0.86,
"EvalsExecuted": 5,
"Duration": "42.5s",
"CreatedAt": "2026-08-01T10:00:00Z"
}
],
"Pagination": { "returned": 1, "limit": 50, "offset": 0 }
}
{
"Code": "EvalSetRunList",
"Data": [
{
"EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
"EvalSetId": "f3a7d219-8b4c-4e62-a951-7d3f6e2c8b04",
"Status": "completed",
"Score": 0.86,
"EvalsExecuted": 5,
"Duration": "42.5s",
"CreatedAt": "2026-08-01T10:00:00Z"
}
],
"Pagination": { "returned": 1, "limit": 50, "offset": 0 }
}
Score と Duration はまだ利用できない場合は "-" されます (実行中)。Duration は 1 秒未満 Nms 形式 N.Ns 、それ以外の形式ではありません。
UIP 評価の実行 Get
1 つの評価セットの実行の詳細を取得します。
引数
| 名前 | Required | 目的 |
|---|---|---|
<evalSetRunId> | ○ | run list または execute-and-evaluateの出力から実行 ID (GUID) を評価します。 |
オプション
| Short | 長押し | 値 (Value) | 既定 (Default) | 説明 |
|---|---|---|---|---|
| — | --process-key | GUID | — | 必須。プロセス キー (デプロイの GUID)。 |
| — | --tenant | name | セッションの既定値 | UiPath のテナント名です。 |
例
uip eval run get a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
uip eval run get a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
データシェイプ(--output json)
{
"Code": "EvalSetRunDetails",
"Data": {
"EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
"Status": "completed",
"Score": 0.86,
"EvalsExecuted": 5,
"Duration": "42.5s"
}
}
{
"Code": "EvalSetRunDetails",
"Data": {
"EvalSetRunId": "a1b2c3d4-0000-0000-0000-000000000101",
"Status": "completed",
"Score": 0.86,
"EvalsExecuted": 5,
"Duration": "42.5s"
}
}
1 つの run list エントリと同じ形状 ( EvalSetId/CreatedAtを引いた値) で、リストではなく ID で取得されます。
UIP 評価の実行結果
評価セットの実行の項目ごとの評価実行結果を表示します。元の execute-and-evaluate 呼び出しで送信された項目ごとに 1 つのエントリが表示されます。
引数
| 名前 | Required | 目的 |
|---|---|---|
<evalSetRunId> | ○ | 評価セットの実行 ID (GUID)。 |
オプション
| Short | 長押し | 値 (Value) | 既定 (Default) | 説明 |
|---|---|---|---|---|
| — | --process-key | GUID | — | 必須。プロセス キー (デプロイの GUID)。 |
| — | --tenant | name | セッションの既定値 | UiPath のテナント名です。 |
例
uip eval run results a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
uip eval run results a1b2c3d4-0000-0000-0000-000000000101 --process-key 9e4b2f17-7c3a-4d81-b592-3f6e8a1d5c09
データシェイプ(--output json)
{
"Code": "EvalRunResults",
"Data": [
{
"EvalRunId": "e1e2e3e4-0000-0000-0000-000000000001",
"DataPoint": "Test Case 1",
"Status": "completed",
"Result": {}
}
]
}
{
"Code": "EvalRunResults",
"Data": [
{
"EvalRunId": "e1e2e3e4-0000-0000-0000-000000000001",
"DataPoint": "Test Case 1",
"Status": "completed",
"Result": {}
}
]
}
DataPoint は元の項目の name です (スナップショットに ID がない場合は、評価実行の独自の ID にフォールバックします)。Result は評価器の生のスコアリング ペイロードです。形状は実行された評価器によって異なります。
関連
schedule— 定期的なスケジュールに従ってexecute-and-evaluateを自動化します。evaluator— 保存されたスコアリング ロジックを管理します。eval-setとevaluation— 保存したアイテムのコレクションと評価の定義を管理します。
参照
uip orの概要 — このプロセスとフォルダーが動作するツールです。--process-key/--folder-key/--tenantの共有規則です。- グローバル オプション
- 終了コード