- Información general
- Proceso de Document Understanding
- Tutoriales de inicio rápido
- Componentes de marco
- Paquetes ML
- Procesos
- Gestor de datos
- Servicios de OCR
- Document Understanding implementado en Automation Suite
- Document Understanding implementado en AI Center independiente
- Aprendizaje profundo
- Crear un modelo ML de alto rendimiento
- Licencia
- Referencias
- Actividades.DeUipath
- UiPath.AbbyyEmbedded.Activities
- UiPath.DocumentUnderstanding.ML.Activities
- UiPath.DocumentUnderstanding.OCR.LocalServer.Activities
- UiPath.IntelligentOCR.Activities
- UiPath.OCR.Activities
- UiPath.OCR.Contracts
- UiPath.DocumentProcessing.Contracts
- UiPath.OmniPage.Activities
- UiPath.PDF.Activities
Un proceso completo ejecuta conjuntamente un proceso de entrenamiento y un proceso de evaluación.
Tamaño mínimo del conjunto de datos
Para ejecutar con éxito un proceso de entrenamiento, recomendamos encarecidamente al menos 25 documentos y al menos 10 muestras de cada campo etiquetado en tu conjunto de datos. En caso contrario, el proceso genera el siguiente error: Dataset Creation Failed.
Entrenamiento en la GPU frente a la CPU
- Para conjuntos de datos más grandes, es necesario entrenar con la GPU. Además, el uso de una GPU (AI Robot Pro) para el entrenamiento es como mínimo 10 veces más rápido que el uso de una CPU (AI Robot).
- El entrenamiento en la CPU solo es compatible con conjuntos de datos de hasta 5000 páginas para paquetes ML v21.10.x y de hasta 1000 páginas para otras versiones de paquetes ML.
- El entrenamiento de la CPU estaba limitado a 500 páginas antes de 2021.10, ascendió a 5000 páginas para 2021.10, y con 2022.4 volverá a descender a 1000 páginas como máximo.
Entrenar y evaluar un modelo al mismo tiempo
Configura el proceso de entrenamiento como sigue:
-
En el campo Tipo de proceso, selecciona Ejecución de proceso completo.
-
En el campo Elegir paquete, selecciona el paquete que deseas entrenar y evaluar.
-
En el campo Elegir la versión principal del paquete, selecciona una versión principal para tu paquete.
-
En el campo Elegir versión secundaria del paquete, selecciona una versión secundaria para tu paquete. Se recomienda encarecidamente usar siempre la versión menor 0 (cero).
-
In the Choose input dataset field, select a representative training dataset.
-
In the Choose evaluation dataset field, select a representative evaluation dataset.
-
En la sección Introducir parámetros, escribe cualquier variable de entorno definida y utilizada por tu proceso, si la hubiera. Para la mayoría de los casos de uso, no es necesario especificar ningún parámetro; el modelo usa técnicas avanzadas para encontrar una configuración eficaz. Sin embargo, aquí hay algunas variables de entorno que podrías usar:
-
auto_retrainingwhich allows you to complete the Auto-retraining Loop; if the variable is set to True, then the input dataset needs to be the export folder associated with the labeling session where the data is tagged; if the variable remains set to False, then the input dataset needs to correspond to the dataset format. -
model.epochsque personaliza el número de epochs para el proceso de entrenamiento (el valor predeterminado es 100). -
Select whether to train the pipeline on GPU or on CPU. The Enable GPU slider is disabled by default, in which case the pipeline is trained on CPU. Using a GPU (AI Robot Pro) for training is at least 10 times faster than using a CPU (AI Robot). Moreover, training on CPU is supported for datasets up to 5000 images in size only. For larger datasets, you need to train using GPU.
-
Selecciona una de las opciones cuando el proceso debe ejecutarse: Ejecutar ahora, Basado en tiempo o Recurrente. En caso de que estés utilizando la variable
auto_retraining, selecciona Recurrente. -
After you configure all the fields, click Create. The pipeline is created.
Artefactos
En el caso de un proceso de evaluación, el panel de resultados también incluye una carpeta artifacts / eval_metrics que contiene dos archivos:
evaluation_default.xlsxes una hoja de cálculo de Excel con una comparación paralela de datos reales frente al valor predicho para cada campo predicho por el modelo, así como una métrica de precisión por documento, en orden de precisión ascendente. Por lo tanto, los documentos más inexactos se presentan en la parte superior para facilitar el diagnóstico y la resolución de problemas.evaluation_metrics_default.txtcontiene las puntuaciones F1 de los campos que se predijeron.- En el caso de los elementos de línea, se obtiene una puntuación global para el conjunto de todas las columnas.