- はじめに
- スタート アップ ガイド
- Maestro の BPMN を使用した構築
- Maestro Case を使用した構築
- Maestro Case について
- Maestro BPMN と Maestro Case の比較: ケース管理を使用すべき状況
- Maestro Case のライフサイクル: イベント トリガーからアプリのエクスペリエンスまで
- Maestro Case を使用して最初のケースを構築する
- コーディング エージェントを使用して Maestro Case を構築する (プレビュー)
- ケース キーを定義する (システムと外部)
- タスクの I/O と書き戻しの契約を確立する
- 終了ルールと早期終了
- プライマリ ステージとセカンダリ ステージをモデリングする
- Data Fabric からケースをトリガーする
- ステージレベルのペルソナと権限を実装する
- SLA と自動エスカレーション ルールを設定する
- 再作業によるループ (再エントリ) を設定する
- Case Manager エージェントを設定およびテストする (プレビュー)
- ケース マネージャーの入力および出力コントラクト
- Maestro Case コンポーネント ディクショナリ
- Maestro Flow を使用した構築
- Maestro Automate
- Integrations
- オペレーティング
- 監視
- 最適化中
- 参考情報
評価 (プレビュー)
評価セット、決定論的な評価器と LLM による評価評価器、ノード出力シミュレーションを使用した、Maestro BPMN ワークフローの品質チェックを自動化します。
評価により、Maestro BPMN ワークフローの自動化された品質チェックを定義できます。期待される結果を評価セットにグループ化し、各実行は、アタッチした評価器に対してスコアが付けられます。
評価では、AI エージェントと Maestro Flow ですでに利用可能なものと同じ評価フレームワークを使用するため、非決定論的なステップを含むワークフローは、出荷前に検証できます。
概念
- データセット — 同じサブジェクトを対象とするデータ ポイントのコレクションです。セットを実行すると、すべてのデータ ポイントに対してワークフローが一度にスコアリングされます。
- データ ポイント — 1 つのケース: 一連の入力値と、それらの入力の期待される出力です。データ ポイントは手動で作成することも、実際の実行からキャプチャすることもできます。
- 評価器 — 実際の出力を期待される出力と比較したり、軌跡を期待される軌跡と比較してスコアを生成するグレーダーです。
- スコア — 評価器がデータ ポイントについて報告する結果です。
BPMN レベルの評価セット
評価セットは、Maestro の BPMN ワークフロー全体を対象としています。データ ポイントはトリガーのエントリ ポイントにピン留めされ、各データ ポイントはトリガーの入力とワークフローの期待される出力を提供します。
ノードレベルの評価セットは、評価を単一のノードに固定し、各データポイントがそのノードの入力と期待される出力を提供するようにします。ノード レベルの評価は、このパブリック プレビューには含まれません。
評価器
Maestro の BPMN 評価器は、次の 2 つのファミリに分類されます。
決定論的
これらの評価器は、出力を期待される出力と正確に比較します。ループにはモデルが含まれていません。
- 次の値を含む — 出力に予期される部分文字列が含まれていることを確認します。
- 完全一致 — 出力が期待値と等しいことを確認します。
- JSON の類似性 — 出力と期待される出力を JSON として比較します。
LLM による評価
これらの評価器は、モデルを使用して、期待される出力に照らして出力を判断します。
- 出力の意味的類似性 — 出力が期待される出力と同じ意味を持つかどうかを判断します。
- 出力: 厳密な JSON の類似性 — JSON 出力を期待される JSON に照らして判断します。
- 軌跡の類似性 — エージェントが実行したステップを、予期される軌跡に照らして判断します。
- 軌跡シミュレーション — シミュレートされた軌跡を判断します。
実行からデータ ポイントをキャプチャする
すべてのデータ ポイントを手動で作成する必要はありません。デバッグ実行をキャプチャすると、デバッグ実行をキャプチャすると、その入力と出力がデータ ポイントの入力と期待される出力になります。
実行をキャプチャすると、すでに観察済みの実際の動作から評価セットを素早くシードできます。
評価を使用すべき状況
評価は次の場合に最も役に立ちます。
- AI エージェントを呼び出す Maestro BPMN ワークフローを構築しており、パブリッシュ前にエージェントの出力が品質の期待値を満たしていることを確認する必要があります。
- 回帰カバレッジが必要であり、各変更後に評価を実行することで、既存の動作が壊れていないことを確認します。
- 同じワークフローの 2 つのバージョンで評価を実行して、代替の実装を比較する場合を考えます。
評価結果
結果は評価履歴に保存され、いつでも確認できます。これらは実行したユーザーに表示され、JSON または CSV としてエクスポートできます。評価の実行内の個々のトレースをエクスポートすることもできます。
評価の実行の履歴タブには、各実行について以下が表示されます。
- 評価者ごとのスコアと、採点者の根拠
- 実際の値と期待値が並んで表示された、個々のデータ ポイントの結果
- 完全なトレース: 実行をトリガーしたきっかけ、実行がたどったパス、ノードごとの出力、タイミング
トレースと採点者の妥当性は、各ケースでワークフローを正しく実行するために何を変更する必要があるかを示します。
例: サポート メールを分類する
Maestro の BPMN ワークフローでは、AI エージェントを使用してカスタマー サポートのメールを分類します。パブリッシュする前に、10 個のデータ ポイントを持つ評価セットを設定します。
- に分類された 5
"billing"件のメール "technical"に分類されたメール 3 件- エッジ ケースとして扱われるあいまいなメール 2 通
各データ ポイントは、期待される classification 出力値、またはあいまいなメールに対して人間へのトリガーされるエスカレーションを定義します。分類の 完全一致 評価器は、 "billing" または "technical"について各結果をスコアリングし、軌跡評価器が人間によるエスカレーションを確認します。各実行では、ワークフローが運用環境に移行する前に、エージェントがどのケースを間違えたかが確認できます。
ノードのシミュレーション
シミュレーションは評価の実行中に選択したノードの出力を上書きするため、ノードの実際のアクションを実行せずに下流のロジックをテストできます。これは、実際のアクションが遅い場合、コストがかかる場合、または設計時には使用できない外部システムに依存している場合に便利です。
ノードでシミュレーションが有効化されている場合、実行ではそのノードの実際の実行がスキップされ、モックされた出力値が直接使用されます。下流のすべてのノードは、ノードが正常に実行されたかのようにモックされた値を受け取ります。
シミュレーションはテスト実行中にのみ適用されます。パブリッシュ済みの運用環境のワークフローではアクティブになりません。
シミュレーションの戦略
シミュレートされた各ノードは、次の 2 つの方法のいずれかを使用します。
- 静的モック — 定義した値を常に返すルールベースのシミュレーションです。
- 生成されたモック — LLM によって生成される応答です。評価が実行されるたびに動的に生成されます。
シミュレーションを設定する
評価の実行中に実際の出力を置換する任意のノードでシミュレーションを設定します。次のシーケンスは、ノードの選択からシミュレートされた出力を入力するまでの流れ全体を示しています。
- キャンバス上でシミュレートするノードを選択します。
- 設定パネルで [シミュレーションを追加] を開きます。
- ノードのシミュレーション戦略を選択します。
- 選択したストラテジのシミュレートされた出力を入力します。
- [ 静的モック] の場合は、JSON を手動で編集するか、プロンプト機能を使用して生成して、出力値を入力します。ノードの出力スキーマに一致する有効な JSON を使用してください。
- [ 生成されたモック] に、評価の実行ごとにツールの応答を生成するためにモデルが使用するプロンプトを入力します。
結果: ノードがシミュレートされます。次回のテスト実行時に、Maestro BPMN は実際の実行をスキップし、代わりに値を下流に挿入します。
シミュレートできるノード
シミュレーションは、次のノードの種類で役立ちます。
- 人間によるタスク — 実際の承認者を待たずに、承認済みまたは却下済みの応答を返します。
- HTTP 要求 — エラー応答を含む特定の API 応答を返すので、エラー処理パスをテストできます。
- エージェント — AI エージェントの出力を返すので、ワークフローでエージェントのさまざまな応答がどのように処理されるかをテストできます。
- 接続 — 接続ノードの出力を返すため、外部アプリケーションに変更を加えることなくワークフローをテストできます。
提供状況とライセンス
- 評価は、「 ライセンス」で詳しく説明されているライセンスの種類と Automation Cloud 組織のライセンス プランを持つユーザーが利用できます。
- プレビュー中は、ノードのシミュレーション、評価内での LLM 機能を使用したモック生成、LLM による評価器の評価器は無料です。設計における Maestro の BPMN 実行は、 月間ユーザー制限から消費します。
既知の制限事項
- ノード レベルの評価は利用できません。
- Maestro の BPMN 評価では、 CLI スキル はサポートされません。