- Introducción
- Primeros pasos
- Modelado de procesos con BPMN
- Comprender el modelado del proceso
- Abrir el lienzo de modelado
- Modelar tu proceso
- Alinear y conectar elementos BPMN
- Autopilot para Maestro (vista previa)
- Repositorio de procesos
- Modelado de procesos con gestión de casos
- Diseñar un esquema de entidad de caso persistente
- Definir claves de caso (de sistema o externo)
- Establecer contratos de entrada/salida y de escritura diferida de tareas
- Reglas de salida y terminación temprana de etapas
- Modelar las etapas principal y secundaria
- Iniciar un caso desde Data Fabric
- Implementar perfiles y permisos a nivel de etapa
- Establecer SLA y reglas de escalado automatizadas
- Configurar un bucle de reprocesamiento (reingreso)
- Gestionar instancias de casos en ejecución: pausar, migrar y reintentar
- Diccionario de componentes de la gestión de casos de Maestro
- Modelado de procesos con Flow
- Implementación del proceso
- Depuración
- Simular
- Publicar y actualizar procesos de agente
- Escenarios de implementación comunes
- Extracción y validación de documentos
- Operaciones de proceso
- Supervisión de procesos
- Optimización de procesos
- Información de referencia
Comprobaciones de calidad automatizadas para las salidas del flujo de trabajo de Flow, agrupadas en conjuntos de evaluación y puntuadas frente a los evaluadores que adjuntas a cada ejecución.
Las evaluaciones te permiten definir comprobaciones de calidad automatizadas en las salidas de un flujo de trabajo de flujo. Agrupas los resultados esperados en un conjunto de evaluación y Flow puntúa cada ejecución en comparación con los evaluadores que adjuntas.
Conceptos
- Conjunto de evaluación : una colección de puntos de datos que se dirigen al mismo sujeto. Ejecuta el conjunto para puntuar el flujo de trabajo en función de cada punto de datos a la vez.
- Punto de datos : un solo caso: un conjunto de valores de entrada y la salida esperada para esas entradas. Crea un punto de datos a mano o captura uno de una ejecución real (consulta Capturar un punto de datos de una ejecución).
- Conjunto de datos : los puntos de datos que componen un conjunto de evaluación.
- Evaluador : una comprobación que compara la salida real con la salida esperada y produce una puntuación. Un evaluador booleano produce aprobado o suspenso por evaluador.
- Puntuación : el resultado que informa un evaluador para un punto de datos.
Conjuntos de evaluación a nivel de nodo frente a a nivel de flujo
Un conjunto de evaluación se dirige a un solo nodo o a todo el flujo:
- Nivel de nodo : anclado a un nodo. Cada punto de datos proporciona las entradas de ese nodo y su salida esperada.
- Nivel de flujo : anclado a un punto de entrada del desencadenador. Cada punto de datos proporciona las entradas del desencadenador y la salida esperada del flujo.
No se pueden mezclar puntos de datos a nivel de nodo y a nivel de flujo en el mismo conjunto de evaluación.
Evaluadores
El flujo agrupa a los evaluadores en tres familias.
Determinista
Compara la salida con la salida esperada exactamente, sin modelo en el bucle.
- Contiene : comprueba que la salida contiene una subcadena esperada.
- Coincidencia exacta : comprueba que la salida es igual al valor esperado.
- Similitud de JSON : compara la salida y la salida esperada como JSON.
Juez de LLM
Utilice un modelo para juzgar la salida en comparación con la salida esperada.
- Similitud semántica de salida : juzga si la salida significa lo mismo que la salida esperada.
- Similitud de JSON estricta de salida : juzga la salida de JSON en comparación con el JSON esperado.
- Similitud de trayectoria : juzga los pasos que dio el agente en comparación con una trayectoria esperada.
- Simulación de trayectoria : juzga una trayectoria simulada.
Llamada de herramienta
Comprueba cómo un nodo llama a sus herramientas. Estos evaluadores son solo a nivel de nodo.
- Coincidencia de argumentos : comprueba los argumentos pasados a una llamada de herramienta.
- Recuento de llamadas : comprueba cuántas veces se ha llamado a una herramienta.
- Orden de llamada : comprueba el orden en que se llamaron las herramientas.
- Coincidencia de salida : comprueba la salida de una llamada de herramienta.
Ciclo de vida del conjunto de evaluación
Un conjunto de evaluación se crea en torno a un asunto, puntos de datos y evaluadores. El asunto es un nodo único o un punto de entrada del desencadenador. Cada punto de datos proporciona valores de entrada y la salida esperada, y cada evaluador define cómo el flujo puntúa el resultado de la ejecución.
Cuando se ejecuta un conjunto de evaluación, Flow ejecuta el asunto para cada punto de datos y muestra las puntuaciones por evaluador en el historial de evaluación.
Capturar un punto de datos de una ejecución
No tienes que crear cada punto de datos a mano. Puedes crear uno importando una ejecución real: captura una ejecución de depuración y sus entradas y salidas se convierten en la entrada y la salida esperada del punto de datos. Esta es una forma rápida de generar un conjunto de evaluación a partir del comportamiento real que ya has observado.
Utilizar evaluaciones en desarrollo
Las evaluaciones son más útiles cuando:
- Estás creando flujos de trabajo que invocan agentes de IA y necesitas verificar que la salida del agente cumpla con las expectativas de calidad antes de publicar.
- Necesitas cobertura de regresión: ejecutar evaluaciones después de cada cambio confirma que el comportamiento existente no se ha roto.
- Quieres comparar implementaciones alternativas ejecutando evaluaciones en dos versiones del mismo flujo de trabajo.
Resultados de la evaluación
Los resultados se almacenan en el historial de evaluación y pueden revisarse en cualquier momento. Cada ejecución muestra las puntuaciones por evaluador, los resultados de los puntos de datos individuales y los valores reales frente a los esperados para cada punto de datos.
Ejemplo práctico
Un flujo de trabajo que utiliza un agente de IA para clasificar los correos electrónicos de atención al cliente. Antes de publicar, configuras un conjunto de evaluación con 10 puntos de datos:
- 5 correos electrónicos que deben clasificarse como
"billing" - 3 correos electrónicos que deben clasificarse como
"technical" - 2 casos límite (correos electrónicos ambiguos)
Cada punto de datos define el valor de salida classification esperado. Un evaluador de coincidencia exacta en la clasificación puntúa cada resultado, y la ejecución de evaluación muestra en qué casos se equivocó el agente antes de que el flujo de trabajo pase a producción.
Errores comunes
- Ejecutar un conjunto de evaluación solo una vez : los conjuntos de evaluación son más útiles después de cada cambio significativo en un flujo de trabajo que invoca un agente de IA. El comportamiento del agente puede cambiar a medida que se actualizan los modelos, incluso si el flujo de trabajo no ha cambiado.
- Escribir puntos de datos solo para la ruta feliz : las evaluaciones son más valiosas para los casos límite y los modos de fallo. Los puntos de datos sólidos incluyen entradas que son ambiguas, mal formadas o en el límite del rango esperado.
- Tratar una puntuación de aprobación total como una señal para detener la prueba : tres puntos de datos aprobados no son confianza. Los conjuntos más grandes, especialmente los que reflejan entradas reales de producción, proporcionan una cobertura más sólida.
Páginas relacionadas
- Conceptos
- Conjuntos de evaluación a nivel de nodo frente a a nivel de flujo
- Evaluadores
- Determinista
- Juez de LLM
- Llamada de herramienta
- Ciclo de vida del conjunto de evaluación
- Capturar un punto de datos de una ejecución
- Utilizar evaluaciones en desarrollo
- Resultados de la evaluación
- Ejemplo práctico
- Errores comunes
- Páginas relacionadas