- Introducción
- Primeros pasos
- Crear con Maestro BPMN
- Comprender el modelado de Maestro BPMN
- Abrir el lienzo de modelado
- Modelar tu proceso
- Alinear y conectar elementos BPMN
- Patterns library
- Autopilot para Maestro (vista previa)
- Repositorio de procesos
- Implementar un proceso BPMN simple
- Implementar un proceso BPMN complejo
- Depuración
- Simular
- Evaluaciones (vista previa)
- Escenarios de implementación comunes
- Crear con Maestro Case
- Introducción a Maestro Case
- Maestro BPMN frente a Maestro Case: cuándo utilizar la gestión de casos
- El ciclo de vida de Maestro Case: del desencadenador de eventos a la experiencia de la aplicación
- Crea tu primer caso con Maestro Case
- Crear un Maestro Case con un agente de codificación (vista previa)
- Definir claves de caso (de sistema o externo)
- Establecer contratos de entrada/salida y de escritura diferida de tareas
- Reglas de salida y terminación temprana de etapas
- Modelar las etapas principal y secundaria
- Iniciar un caso desde Data Fabric
- Implementar perfiles y permisos a nivel de etapa
- Establecer SLA y reglas de escalado automatizadas
- Configurar un bucle de reprocesamiento (reingreso)
- Configurar y probar el agente de Case Manager (vista previa)
- Contrato de entrada y salida del gestor de casos
- Diccionario de componentes de Maestro Case
- Crear con Maestro Flow
- Nodos del conector
- Maestro Automate
- Integraciones
- En funcionamiento
- Supervisión
- Optimizando
- Información de referencia
Evaluaciones (vista previa)
Comprobaciones de calidad automatizadas para flujos de trabajo BPMN de Maestro, con conjuntos de evaluación, evaluadores deterministas y de juez de LLM y simulaciones de salida de nodo.
Las evaluaciones te permiten definir comprobaciones de calidad automatizadas para un flujo de trabajo BPMN de Maestro. Agrupas los resultados esperados en un conjunto de evaluación, y cada ejecución se puntúa en función de los evaluadores que adjuntes.
Las evaluaciones utilizan el mismo marco de evaluación ya disponible para los agentes de IA y Maestro Flow, por lo que los flujos de trabajo con pasos no deterministas pueden verificarse antes de enviarse.
Conceptos
- Conjunto de datos : una colección de puntos de datos que se dirigen al mismo sujeto. Ejecutar el conjunto puntúa el flujo de trabajo en función de cada punto de datos a la vez.
- Punto de datos : un solo caso: un conjunto de valores de entrada y la salida esperada para esas entradas. Puedes crear un punto de datos a mano o capturar uno de una ejecución real.
- Evaluador : un calificador que compara la salida real con la salida esperada, o la trayectoria con una trayectoria esperada, y produce una puntuación.
- Puntuación : el resultado que informa un evaluador para un punto de datos.
Conjuntos de evaluación de nivel BPMN
Un conjunto de evaluación se dirige a todo el flujo de trabajo de Maestro BPMN. Se ancla a un punto de entrada del desencadenador y cada punto de datos proporciona las entradas del desencadenador y la salida esperada del flujo de trabajo.
Los conjuntos de evaluación a nivel de nodo fijan una evaluación a un solo nodo, de modo que cada punto de datos proporcione las entradas de ese nodo y su salida esperada. Las evaluaciones a nivel de nodo no forman parte de esta vista previa pública.
Evaluadores
Los evaluadores BPMN de Maestro se dividen en dos familias.
Determinista
Estos evaluadores comparan la salida con la salida esperada exactamente, sin ningún modelo en el bucle.
- Contiene : comprueba que la salida contiene una subcadena esperada.
- Coincidencia exacta : comprueba que la salida es igual al valor esperado.
- Similitud de JSON : compara la salida y la salida esperada como JSON.
Juez de LLM
Estos evaluadores utilizan un modelo para juzgar la salida en comparación con la salida esperada.
- Similitud semántica de salida : juzga si la salida significa lo mismo que la salida esperada.
- Similitud de JSON estricta de salida : juzga la salida de JSON en comparación con el JSON esperado.
- Similitud de trayectoria : juzga los pasos que dio el agente en comparación con una trayectoria esperada.
- Simulación de trayectoria : juzga una trayectoria simulada.
Capturar un punto de datos de una ejecución
No tienes que crear cada punto de datos a mano. Puedes crear uno importando una ejecución real: cuando capturas una ejecución de depuración, sus entradas y salidas se convierten en la entrada del punto de datos y la salida esperada.
Capturar una ejecución es una forma rápida de generar un conjunto de evaluación a partir del comportamiento real que ya has observado.
Cuándo utilizar evaluaciones
Las evaluaciones son más útiles cuando:
- Estás creando flujos de trabajo BPMN de Maestro que invocan agentes de IA y necesitas verificar que la salida del agente cumpla con las expectativas de calidad antes de publicar.
- Necesitas cobertura de regresión, y ejecutar evaluaciones después de cada cambio confirma que el comportamiento existente no se ha roto.
- Quieres comparar implementaciones alternativas ejecutando evaluaciones en dos versiones del mismo flujo de trabajo.
Resultados de la evaluación
Los resultados se almacenan en el historial de evaluación y pueden revisarse en cualquier momento. Son visibles para los usuarios que los ejecutan y se pueden exportar como JSON o CSV. También se pueden exportar los seguimientos individuales dentro de una ejecución de evaluación.
La pestaña del historial de ejecuciones de evaluación muestra, para cada ejecución:
- Puntuaciones por evaluador, junto con la justificación del calificador
- Resultados de puntos de datos individuales, con valores reales y esperados uno al lado del otro
- El seguimiento completo: qué desencadenó la ejecución, la ruta que tomó, la salida por nodo y el tiempo
El seguimiento y la justificación del calificador indican lo que debe cambiar para que el flujo de trabajo se ejecute correctamente en cada caso.
Ejemplo: clasificar correos electrónicos de soporte
Un flujo de trabajo BPMN de Maestro utiliza un agente de IA para clasificar los correos electrónicos de atención al cliente. Antes de publicar, configuras un conjunto de evaluación con 10 puntos de datos:
- 5 correos electrónicos clasificados como
"billing" - 3 correos electrónicos clasificados como
"technical" - 2 correos electrónicos ambiguos, tratados como casos límite
Cada punto de datos define el valor de salida classification esperado, o una escalada desencadenada a un humano para los correos electrónicos ambiguos. Un evaluador de coincidencia exacta en la clasificación puntúa cada resultado para "billing" o "technical", y un evaluador de trayectoria comprueba la escalada humana. Cada ejecución muestra en qué casos se equivocó el agente antes de que el flujo de trabajo pase a producción.
Simulaciones de nodo
Las simulaciones anulan las salidas de nodo seleccionadas durante una ejecución de evaluación, para que puedas probar la lógica descendente sin ejecutar la acción real de un nodo. Esto es útil cuando la acción real es lenta, costosa o depende de sistemas externos que no están disponibles durante el diseño.
Cuando se habilita una simulación en un nodo, la ejecución omite la ejecución real de ese nodo y utiliza los valores de salida simulados directamente. Todos los nodos posteriores reciben los valores simulados como si el nodo se hubiera ejecutado normalmente.
Las simulaciones se aplican solo durante las ejecuciones de prueba. Nunca están activos en los flujos de trabajo de producción publicados.
Estrategias de simulación
Cada nodo simulado utiliza una de dos estrategias:
- Simulacro estático : una simulación basada en reglas que siempre devuelve el valor que defines.
- Simulacro generado : una respuesta generada por LLM, producida dinámicamente cada vez que se ejecuta la evaluación.
Configurar una simulación
Configura una simulación en cualquier nodo cuya salida real quieras reemplazar durante una ejecución de evaluación. La siguiente secuencia muestra el flujo completo, desde la selección del nodo hasta la introducción de la salida simulada.
- Selecciona el nodo que deseas simular en el lienzo.
- En el panel de configuración, abre Añadir simulación.
- Elige la estrategia de simulación para el nodo.
- Introduce la salida simulada para la estrategia que has elegido:
- Para Simulacro estático, introduce los valores de salida, ya sea editando el JSON manualmente o generándolo con la característica de solicitud. Utilice un JSON válido que coincida con el esquema de salida del nodo.
- Para Simulacro generado, introduce la solicitud que utiliza el modelo para generar una respuesta de herramienta en cada ejecución de evaluación.
Resultado: el nodo se simula. En la siguiente ejecución de prueba, Maestro BPMN omite su ejecución real e inyecta tus valores en sentido descendente en su lugar.
Nodos que puedes simular
Las simulaciones son útiles en los siguientes tipos de nodos:
- Tarea humana : devuelve una respuesta aprobada o rechazada sin esperar a un aprobador real.
- Solicitud HTTP : devuelve una respuesta de API específica, incluidas las respuestas de error, para que puedas probar tus rutas de gestión de errores.
- Agente : devuelve la salida de un agente de IA, para que puedas probar cómo tu flujo de trabajo maneja las diferentes respuestas de los agentes.
- Conexión : devuelve la salida de un nodo de conexión, para que puedas probar el flujo de trabajo sin realizar cambios en las aplicaciones externas.
Disponibilidad y licencias
- Las evaluaciones están disponibles para los usuarios con los tipos de licencia y los planes de licencias de organización de Automation Cloud detallados en Licencias.
- Las simulaciones de nodos, la generación de simulacros utilizando características de LLM dentro de las evaluaciones y los evaluadores de juez de LLM son gratuitos durante la vista previa. Las ejecuciones de Maestro BPMN en diseño consumen de los límites mensuales de usuario.
Limitaciones conocidas
- Las evaluaciones a nivel de nodo no están disponibles.
- Las evaluaciones de Maestro BPMN no tienen soporte de habilidades CLI .
Páginas relacionadas
- Conceptos
- Conjuntos de evaluación de nivel BPMN
- Evaluadores
- Determinista
- Juez de LLM
- Capturar un punto de datos de una ejecución
- Cuándo utilizar evaluaciones
- Resultados de la evaluación
- Ejemplo: clasificar correos electrónicos de soporte
- Simulaciones de nodo
- Estrategias de simulación
- Configurar una simulación
- Nodos que puedes simular
- Disponibilidad y licencias
- Limitaciones conocidas
- Páginas relacionadas