- Primeros pasos
- Componentes de marco
- Resumen de la clasificación de documentos
- Asistente para Configurar clasificadores de Clasificar ámbito de documento
- Clasificador basado en palabras clave
- Clasificador inteligente de palabra clave
- Clasificador de CapturaFlexible
- Clasificador de aprendizaje automático
- Actividades relacionadas con la clasificación de documentos
- Paquetes ML
- Procesos
- Acerca de los procesos
- Procesos de entrenamiento
- Procesos de evaluación
- Procesos completos
- Ajuste preciso
- Bucle de ajuste preciso automático (vista previa pública)
- Gestor de datos
- Servicios de OCR
- Document Understanding implementado en Automation Suite
- Document Understanding implementado en AI Center independiente
- Aprendizaje profundo
- Licencia
- Referencias
- Actividades.DeUipath
- UiPath.AbbyyEmbedded.Activities
- UiPath.DocumentUnderstanding.ML.Activities
- UiPath.DocumentUnderstanding.OCR.LocalServer.Activities
- UiPath.IntelligentOCR.Activities
- UiPath.OCR.Activities
- UiPath.OCR.Contracts
- UiPath.DocumentProcessing.Contracts
- UiPath.OmniPage.Activities
- UiPath.PDF.Activities
A la hora de entrenar/reentrenar un modelo ML, lo primero que hay que tener en cuenta es que los mejores resultados se obtienen acumulando todos los datos en un único conjunto de datos grande e, idealmente, minuciosamente conservado. Entrenar en el conjunto de datos A y luego volver a entrenar el modelo resultante en el conjunto de datos B generará resultados claramente peores que entrenar en el conjunto de datos combinado A+B.
The second thing to keep in mind is that not all data is the same. Data labeled in a dedicated tool like Data Manager is in general better quality and will result in a better performing model than data labeled in tools with a different focus - such as Validation Station. Data from Validation Station may be high quality from a business process point of view, but less so from a model training point of view, because an ML Model needs data in a very specific form, which is almost always different from the form needed by business processes. For instance, on a 10-page invoice, the invoice number may appear on each page, but in Validation Station it is sufficient to indicate it on the first page, while in Data Manager you would label it on every page. In this case, 90% of the correct labels are missing from the Validation Station data. For this reason, Validation Station data has a limited utility, as described above.
Para entrenar con eficacia un modelo ML, se necesita un conjunto de datos único, completo, de alta calidad y representativo. Por lo tanto, un enfoque acumulativo consiste en añadir más datos al conjunto de datos de entrada y, por lo tanto, entrenar el modelo ML con un conjunto de datos cada vez mayor. Una forma de hacerlo es utilizar el bucle de ajuste fino automático.
Para comprender mejor esta función, veamos dónde encaja el ajuste fino automático en el ciclo de vida del modelo ML.
Ciclo de vida de un modelo ML
En el ciclo de vida de cualquier modelo de aprendizaje automático, hay dos fases principales:
- Fase de construcción
- Fase de mantenimiento
Fase de construcción
In this first phase, you use Data Manager to prepare the training dataset and the evaluation dataset in order to obtain the best performance possible.
Al mismo tiempo, se construye la automatización de RPA y la lógica empresarial en torno al modelo ML, que es al menos tan importante como el propio modelo para obtener el retorno de la inversión previsto.
Fase de mantenimiento
En esta segunda fase, se intenta mantener el nivel de alto rendimiento alcanzado en la fase de construcción, evitando regresiones.
El ajuste fino automático (y los datos de la estación de validación en general) se refieren estrictamente a la fase de mantenimiento. El objetivo del ajuste fino automático es principalmente evitar que el modelo ML retroceda a medida que cambian los datos que pasan por el proceso.
Data fed back from the human validation using Validation Station should not be used to build a model from scratch. Building a model should be done by preparing training and evaluation datasets in Data Manager.
Componentes del bucle de ajuste fino automático
El bucle de ajuste fino automático consta de los siguientes componentes:
Requisitos previos
Para poder implementar esta funcionalidad, es necesario cumplir dos requisitos:
-
You need to have created a Data Manager session in AI Center and to have configured a certain number of fields, more precisely to label high-quality Training and Evaluation datasets. You can either manually define your fields or you can import a schema. Should fields not be configured, the Schedule (Preview) tab is not enabled and the following message is displayed on the screen:
-
Debes haber entrenado unas cuantas versiones del modelo ML, haberlas probado, haber solucionado cualquier problema que haya podido surgir y haberlas implementado en la automatización de RPA+AI.
1. Flujo de trabajo del robot: actividad Entrenador de extractor con aprendizaje automático
Añade la actividad Entrenador de extractor con aprendizaje automático a tu flujo de trabajo en Entrenar el alcance de los extractores, configura adecuadamente el alcance, asegurándote de que el alias del marco contiene el mismo alias que el del Extractor con aprendizaje automático en el Alcance de la extracción de información.
Then, select the Project and the Dataset associated with the Data Manager session that contains your Training and Evaluation datasets. The drop-down menus are prepopulated once you are connected to Orchestrator.
Puedes establecer un valor para la propiedad Carpeta de salida si deseas exportar los datos localmente en el flujo de trabajo.
Puedes ver el nombre del conjunto de datos en la vista de etiquetado de datos en AI Center, junto al nombre de la sesión de Etiquetado de datos:
Para el conjunto de datos seleccionado, la actividad Entrenador de extractor con aprendizaje automático crea una carpeta llamada fine-tune donde se guardan los documentos exportados en 3 carpetas: documents, metadata y predictions.
This is the folder where the data will then be imported into Data Manager automatically, merged with the previously existing data, and exported into the right format to be consumed by a Training or a Full pipeline.
2. Data Manager: característica de programación de la exportación
From a Data Manager session, click the Export button
, go to the Schedule (Preview) tab, and enable the Scheduling slider. Then select a start time and a recurrence. When ready, click the Schedule button.
La casilla de verificación Exportación compatible con versiones anteriores te permite aplicar el comportamiento de exportación heredado, que consiste en exportar cada página como un documento independiente. Prueba esta opción si el modelo entrenado con la exportación predeterminada no cumple las expectativas. Deja esta opción sin seleccionar para exportar los documentos en su formulario original de varias páginas.
La recurrencia mínima es de 1 día y la máxima es de 60 días.
Dado que los procesos de entrenamiento de AI Center están configurados principalmente para ejecutarse semanalmente, se recomienda una recurrencia de 7 días.
When you set the schedule for export, the imported data from the fine-tune folder is exported to the export folder under auto-exporttime_stamp.
Para ser más específicos, la exportación programada importa los datos que existen en la carpeta fine-tune creada en el Paso 1, y luego exporta el conjunto de datos completo, incluidos los datos previamente existentes y los datos de la estación de validación recién importados, a la carpeta de exportación. Así, con cada exportación programada, el conjunto de datos exportado es cada vez más grande.
The file latest.txt is updated or created if this is the first scheduled export. Here you can see the name of the latest export made by Data Manager. Schema export, however, does not update latest.txt. This file is used by the auto-retraining pipeline in AI Center to determine which is the latest export so it can always train on the latest data, so you should never remove or modify it, otherwise, your auto-retraining pipelines will fail.
The Scheduled import+export operation might take up to 1-2 hours, depending on how much data was sent from Step 1 during the previous week. We recommend you choose a time when you will not use the Data Manager due to the fact that when an export operation is ongoing no other exports or imports are allowed. However, labeling is always possible.
3. AI Center: proceso de reentrenamiento automático programado
Al programar un entrenamiento o un proceso completo en AI Center, hay algunos aspectos que deben tenerse en cuenta.
En primer lugar, te recomendamos encarecidamente crear un conjunto de datos de evaluación y programar únicamente procesos completos. Los procesos completos ejecutan el entrenamiento y la evaluación juntos, y el proceso de evaluación utiliza el conjunto de datos de evaluación para generar una puntuación. Esta puntuación será crucial para decidir si la nueva versión es mejor que la anterior, y se puede implementar para su consumo por parte de los robots.
En segundo lugar, para el proceso completo es necesario especificar dos conjuntos de datos: uno de entrada y otro de evaluación.
No existe ningún cambio en el conjunto de datos de evaluación en el contexto de la función de bucle de ajuste fino automático. Sigue siendo necesario seleccionar un conjunto de datos de la forma habitual, que contenga las dos carpetas (images y latest) y los dos archivos (schema.json y split.csv).
Sin embargo, el conjunto de datos de entrada ya no es un conjunto de datos, sino que es necesario seleccionar la carpeta de exportación en el conjunto de datos del AI Center que está conectado a la sesión de etiquetado de datos. De este modo, el entrenamiento se ejecuta en la última exportación de la sesión de etiquetado de datos, mientras que la evaluación se ejecuta en el mismo conjunto de datos de evaluación que se especifique.
Si no se selecciona la carpeta de exportación, el reentrenamiento automático no funciona.
En tercer lugar, hay que establecer la variable de entorno de reentrenamiento automático en Verdadero.
Finally, you need to select Recurring and set a day and time to leave enough time for the export from Data Manager to finish. For example, if the Data Manager export runs at 1 AM on Saturday, then the Pipeline might run at 2 or 3 AM on Saturday. If the export is not finished when the pipeline runs, it uses the previous export, and it might retrain on the same data it trained on the previous week.
4. (opcional) Habilidades ML de actualización automática
Si deseas implementar automáticamente la última versión del paquete ML que se genera mediante los procesos de entrenamiento automáticamente programados, puedes habilitar la función de actualización automática en la habilidad ML.
La habilidad ML se actualiza automáticamente independientemente de que la puntuación de precisión haya mejorado con respecto al entrenamiento anterior, de modo que utiliza esta función con precaución.
En algunos casos, es posible que la puntuación global mejore, aunque un campo específico pueda retroceder ligeramente. Sin embargo, ese campo puede ser crítico para tu proceso empresarial, por lo que la actualización y el reciclaje automáticos, en general, requieren una minuciosa supervisión para tener éxito.
El bucle de ajuste fino automático está completo. Ahora puedes reentrenar automáticamente tus modelos ML con datos de la estación de validación.
- Ciclo de vida de un modelo ML
- Fase de construcción
- Fase de mantenimiento
- Componentes del bucle de ajuste fino automático
- Requisitos previos
- 1. Flujo de trabajo del robot: actividad Entrenador de extractor con aprendizaje automático
- 2. Data Manager: característica de programación de la exportación
- 3. AI Center: proceso de reentrenamiento automático programado
- 4. (opcional) Habilidades ML de actualización automática