- Información general
- Proceso de Document Understanding
- Tutoriales de inicio rápido
- Componentes de marco
- Resumen de la clasificación de documentos
- Asistente para Configurar clasificadores de Clasificar ámbito de documento
- Clasificador basado en palabras clave
- Clasificador inteligente de palabra clave
- Clasificador de CapturaFlexible
- Clasificador de aprendizaje automático
- Actividades relacionadas con la clasificación de documentos
- Consumo de datos
- Paquetes ML
- Procesos
- Administrador de documentos
- Servicios de OCR
- Document Understanding implementado en Automation Suite
- Instalar y utilizar
- Primera experiencia de ejecución
- Implementar UiPathDocumentOCR
- Implementar un paquete ML listo para usar
- Paquetes sin conexión 2022.10.0
- Paquetes sin conexión 2022.10.2
- Paquetes sin conexión 2022.10.4
- Paquetes sin conexión 2022.10.6
- Paquetes sin conexión 2022.10.8
- Paquetes sin conexión 2022.10.9
- Paquetes sin conexión 2022.10.10
- Paquetes sin conexión 2022.10.11
- Paquetes sin conexión 2022.10.12
- Paquetes sin conexión 2022.10.13
- Paquetes sin conexión 2022.10.14
- Paquetes sin conexión 2022.10.14+patch1
- Paquetes sin conexión 2022.10.15
- Utiliza Document Manager
- Utilizar el marco
- Document Understanding implementado en AI Center independiente
- Aprendizaje profundo
- Licencia
- Referencias
- Actividades.DeUipath
- UiPath.AbbyyEmbedded.Activities
- UiPath.DocumentUnderstanding.ML.Activities
- UiPath.DocumentUnderstanding.OCR.LocalServer.Activities
- UiPath.IntelligentOCR.Activities
- UiPath.OCR.Activities
- UiPath.OCR.Contracts
- UiPath.DocumentProcessing.Contracts
- UiPath.OmniPage.Activities
- UiPath.PDF.Activities
Tamaño mínimo del conjunto de datos
Para ejecutar con éxito un proceso de entrenamiento, recomendamos encarecidamente al menos 25 documentos y al menos 10 muestras de cada campo etiquetado en tu conjunto de datos. En caso contrario, el proceso genera el siguiente error: Dataset Creation Failed.
Entrenamiento en la GPU frente a la CPU
- Para conjuntos de datos más grandes, es necesario entrenar con la GPU. Además, el uso de una GPU (AI Robot Pro) para el entrenamiento es como mínimo 10 veces más rápido que el uso de una CPU (AI Robot).
- El entrenamiento en la CPU solo es compatible con conjuntos de datos de hasta 5000 páginas para paquetes ML v21.10.x y de hasta 1000 páginas para otras versiones de paquetes ML.
- El entrenamiento en la CPU estaba limitado a 500 páginas antes de la versión 2021.10, ascendió a 5000 páginas para la 2021.10, y con la 2022.4 regresó a un máximo de 1000 páginas.
Hay dos maneras de entrenar un modelo ML:
- entrenar un modelo desde cero
- reentrenamiento de un modelo listo para usar
El entrenamiento de un modelo desde cero puede hacerse con el paquete ML DocumentUnderstanding, que lo hace sobre el conjunto de datos proporcionado como entrada.
El reentrenamiento puede realizarse con paquetes ML listos para usar, como Facturas, Recibos, Órdenes de compra, Facturas de servicios públicos, Facturas de India, Facturas de Australia, etc. Básicamente, cualquier otro paquete ML de extracción de datos, excepto DocumentUnderstanding. El entrenamiento con uno de estos paquetes tiene una entrada adicional: un modelo base. Lo llamamos reentrenamiento porque no se parte de cero, sino de un modelo base. Este enfoque usa una técnica llamada Aprendizaje de transferencia, en la que el modelo aprovecha la información codificada en otro modelo: el preexistente. El modelo conserva parte de los conocimientos previos, pero también aprende de los nuevos datos. Sin embargo, a medida que aumenta el tamaño del conjunto de datos de entrenamiento, el modelo base preentrenado importa cada vez menos. Es relevante sobre todo para conjuntos de datos de entrenamiento de tamaño pequeño o medio (hasta 500-800 páginas).
Configura el proceso de entrenamiento como sigue:
-
En el campo Tipo de proceso, selecciona Ejecución de entrenamiento.
-
En el campo Elegir paquete, selecciona el paquete que has creado basándote en el Paquete ML de DocumentUnderstanding.
-
En el campo Elegir la versión principal del paquete, selecciona una versión principal para tu paquete.
-
In the Choose package minor version field, select a minor version for your package. It is strongly recommended to always use minor version 0 (zero). Check the Choosing the minor version section below for more information.
-
In the Choose input dataset field, select a dataset as shown in the video below on this page. For building high quality training datasets, you can check this tutorial.
-
En la sección Introducir parámetros, escribe cualquier variable de entorno definida y utilizada por tu proceso, si la hubiera. Para la mayoría de los casos de uso, no es necesario especificar ningún parámetro; el modelo usa técnicas avanzadas para encontrar una configuración eficaz. Sin embargo, aquí hay algunas variables de entorno que podrías usar:
-
model.epochsque personaliza el número de epochs para el proceso de entrenamiento (el valor predeterminado es 100).Nota:For larger datasets, containing more than 5000 pages, you can initially perform a full pipeline run with the default number of epochs. This allows you to evaluate the model’s accuracy. After that, you can decrease the number of epochs to about 30-40. This approach allows you to compare the accuracy of the results and determine if the reduction of epochs yields comparable precision.
Al utilizar conjuntos de datos más pequeños, en particular aquellos con menos de 5000 páginas, puedes mantener el número predeterminado de épocas.
-
Selecciona si quieres entrenar el proceso en la GPU o en la CPU. El control deslizante Habilitar GPU está deshabilitado de forma predeterminada, en cuyo caso el proceso se entrena en la CPU.
-
Selecciona una de las opciones cuando el proceso debe ejecutarse: Ejecutar ahora, Basado en tiempo o Recurrente. En caso de que estés utilizando la variable
auto_retraining, selecciona Recurrente. -
After you configure all the fields, click Create. The pipeline is created.
Este es un ejemplo de creación de un nuevo proceso de entrenamiento con un conjunto de datos previamente exportado a AI Center:
Elegir la versión menor
En la mayoría de las situaciones, se debe elegir la versión menor 0. Esto se debe a que cuanto más grande y más diverso tu conjunto de datos de entrenamiento, mejor el rendimiento de tu modelo. Este principio se alinea con el objetivo de la tecnología ML de última generación actual de utilizar conjuntos de entrenamiento grandes, de alta calidad y representativos. Por lo tanto, a medida que acumulas más datos de entrenamiento para un modelo, debes añadir los datos al mismo conjunto de datos para mejorar aún más el rendimiento del modelo.
Sin embargo, hay situaciones donde el entrenamiento en una versión menor distinta de 0 tiene sentido.Este es normalmente el caso cuando un socio necesita atender a varios clientes en la misma industria, pero UiPath no tiene un modelo preentrenado optimizado para esa industria, geografía o tipo de documento.
En tal caso, el socio puede desarrollar un modelo preentrenado utilizando una variedad de muestras de documentos de esa industria (no de una única fuente, sino de muchas para una mejor generalización). Este modelo se utilizaría como modelo base para entrenar modelos de cliente específicos, se entrenaría en la versión 0 del paquete ML. Las siguientes versiones, como la versión 1, se utilizarían para refinar el modelo preentrenado o crear modelos específicos para el cliente.
Sin embargo, para obtener buenos resultados, el modelo preentrenado debe ser imparcial y basarse en un conjunto de entrenamiento altamente diverso. Si el modelo base se optimiza para un cliente específico, puede no funcionar bien para otros clientes. En tal caso, utilizar la versión menor cero como modelo base produce mejores resultados.