- Información general
- Primeros pasos con los agentes de UiPath
- Primeros pasos con los agentes de UiPath utilizando LangGraph
- Introducción
- Configura tu entorno
- Crear el agente
- Evaluar el agente
- Conectar a Studio Web
- Crear un agente de código bajo en Studio Web
- Añadir herramientas a tu agente de UiPath
Ejecuta seguimientos de evaluación localmente y revisa los resultados que fluyen en Studio Web.
Con el agente ejecutándose localmente y los puntos de entrada registrados, estás listo para ejecutarlo y crear un conjunto de evaluación.
Paso 6: ejecutar el agente localmente
Ejecuta el agente con el archivo de entrada de muestra que creó tu agente de codificación:
uip codedagent run agent --file input.json
uip codedagent run agent --file input.json
Deberías ver al agente clasificar la solicitud y devolver un nivel con razonamiento.
También puedes pasar la entrada en línea. Estos ejemplos utilizan la sintaxis de comillas simples de Bash; si estás en PowerShell, utiliza --file con un archivo JSON en su lugar:
uip codedagent run agent '{"description": "Clear the rats out of the inn cellar"}'
uip codedagent run agent '{"description": "Clear the rats out of the inn cellar"}'
Prueba algunas entradas diferentes para verificar que las clasificaciones tengan sentido:
uip codedagent run agent '{"description": "Slay the ancient red dragon terrorizing the countryside"}'
uip codedagent run agent '{"description": "Slay the ancient red dragon terrorizing the countryside"}'
Paso 7: crear pruebas de evaluación
Las evaluaciones prueban el rendimiento de tu agente en un rango de entradas. La habilidad uipath-agents incluye la referencia completa del marco de evaluación: tipos de evaluador, esquema de conjunto de evaluación, convenciones de estructura de directorios y mejores prácticas como usar gpt-4.1 (no mini) para evaluadores de juez de LLM. Tu agente de codificación utiliza esto para producir configuraciones de evaluador y conjuntos de prueba correctos a partir de una breve solicitud.
Pregunta a tu agente de codificación:
Create an evaluation set for the intake classifier agent with 5 test cases:
1. A clearly trivial request (e.g., delivering a letter)
2. A standard request (e.g., escort a caravan)
3. A heroic request (e.g., clear a goblin stronghold)
4. A legendary request (e.g., slay a dragon)
5. An edge case with ambiguous difficulty
Use both a semantic similarity evaluator (to check the output) and a
trajectory evaluator (to check the agent's reasoning path).
Include evaluator config files in evaluations/evaluators/ and the eval
set in evaluations/eval-sets/. Use gpt-4.1-2025-04-14 as the model in
the evaluator configs. Each evaluator config must include a populated
defaultEvaluationCriteria - use {"expectedOutput": {}} for the
semantic evaluator and {"expectedAgentBehavior": ""} for the
trajectory evaluator. Empty {} fails schema validation.
Create an evaluation set for the intake classifier agent with 5 test cases:
1. A clearly trivial request (e.g., delivering a letter)
2. A standard request (e.g., escort a caravan)
3. A heroic request (e.g., clear a goblin stronghold)
4. A legendary request (e.g., slay a dragon)
5. An edge case with ambiguous difficulty
Use both a semantic similarity evaluator (to check the output) and a
trajectory evaluator (to check the agent's reasoning path).
Include evaluator config files in evaluations/evaluators/ and the eval
set in evaluations/eval-sets/. Use gpt-4.1-2025-04-14 as the model in
the evaluator configs. Each evaluator config must include a populated
defaultEvaluationCriteria - use {"expectedOutput": {}} for the
semantic evaluator and {"expectedAgentBehavior": ""} for the
trajectory evaluator. Empty {} fails schema validation.
Paso 8: ejecutar evaluaciones
Ejecuta el conjunto de evaluación localmente:
uip codedagent eval agent evaluations/eval-sets/smoke-test.json --workers 3 --output-file eval-results.json
uip codedagent eval agent evaluations/eval-sets/smoke-test.json --workers 3 --output-file eval-results.json
El marco de evaluación ejecuta cada caso de prueba a través de tu agente y puntúa los resultados.
| Puntuación | Qué mide |
|---|---|
| Similitud semántica | En qué medida la salida del agente coincide con la salida esperada |
| Trayectoria del agente | Si el agente tomó la ruta de razonamiento esperada |
Espere puntuaciones de trayectoria de 0,0 en este agente. Los evaluadores de trayectoria juzgan la ruta de razonamiento del agente: qué herramientas llamó, en qué orden y cómo enrutó entre nodos. Este clasificador no realiza llamadas de herramientas y tiene un solo nodo, por lo que cada caso de prueba obtiene una puntuación de 0.0. Para este clasificador de nodo único, apóyate en las puntuaciones de similitud semántica.
Para la similitud semántica, las puntuaciones superiores a 0,8 son generalmente sólidas. Revise eval-results.json para ver cómo se desempeñó su agente.
Después de conectarse a Studio Web en el siguiente paso, ejecutar uip codedagent eval run desde la CLI carga los resultados a Studio Web automáticamente; aparecen en la pestaña Conjuntos de evaluación en Ejecuciones.
El botón Ejecutar evaluaciones de Studio Web no es lo mismo. Ese botón desencadena una ejecución de Cloud Robot que requiere compatibilidad con el runtime de Python, una configuración más compleja fuera del ámbito de este laboratorio. Usa uip codedagent eval run desde la CLI en su lugar; los resultados aparecen en Studio Web de cualquier manera.
Con los resultados de la evaluación local confirmados, estás listo para conectar el proyecto a Studio Web en la siguiente sección.