UiPath Documentation
document-understanding
2020.10
false
Guía del usuario de Document Understanding
Importante :
La localización de contenidos recién publicados puede tardar entre una y dos semanas en estar disponible.

Acerca de los paquetes ML

El uso de un paquete ML de Document Undestanding implica estos pasos:

  • Recopila muestras de documentos y los requisitos de los puntos de datos que deben extraerse.

  • Label documents using Data Manager.

    Data Manager itself will connect to an OCR Service.

  • Exporta documentos etiquetados como un conjunto de datos de entrenamiento y carga la carpeta exportada al almacenamiento de AI Center.

  • Exporta documentos etiquetados como un conjunto de datos de prueba y carga la carpeta exportada al almacenamiento de AI Center.

  • Ejecuta un proceso de entrenamiento en AI Center.

  • Evalúa el rendimiento del modelo con un proceso de evaluación en AI Center.

  • Implementa el modelo entrenado como una habilidad ML en AI Center.

  • Query the ML Skill from an RPA workflow using the UiPath.DocumentUnderstanding.ML activity package.

    Nota:

    Recuerda que el uso de paquetes ML de Document Understanding requiere que la máquina en la que está instalado AI Center pueda acceder a https://du-metering.uipath.com.

    Importante:

    Al crear un paquete UiPath.DocumentUnderstanding.ML.Activities en AI Center, el nombre del paquete no debe contener ninguna palabra clave reservada de Python, como class, break, from, finally, global o None. Ten en cuenta que esta lista no es exhaustiva, ya que el nombre del paquete se usa para class <pkg-name> y import <pkg-name>.

Se trata de modelos de aprendizaje automático listos para usarse para clasificar y extraer cualquier punto de datos común de documentos semiestructurados o no estructurados, incluidos los campos regulares, las columnas de tablas y los campos de clasificación, con un enfoque sin plantillas.

Document Understanding contiene múltiples Paquetes ML divididos en cuatro categorías principales:

UiPath Document OCR

This is a non-retrainable model which can be used with the UiPath Document OCR engine activity as part of the Digitize Document activity. To be used, it must first be made public so that a URL can be copy-pasted into the UiPath Document OCR engine activity.

UiPathDocumentOCR requiere acceso al servidor de medición de Document Understanding en https://du.uipath.com/metering si la habilidad ML se ejecuta en una implementación regular de AI Center local. No se necesita acceso a Internet en las implementaciones aisladas de AI Center locales.

El paquete ML UiPathDocumentOCR de AI Center está optimizado para ejecutarse en GPU, por lo que recomendamos encarecidamente su uso en GPU. Si no se dispone de GPU, es recomendable utilizar el contenedor docker independiente.

Document Understanding

Se trata de un modelo genérico y reentrenable para extraer cualquier punto de datos común de cualquier tipo de documentos estructurados o semiestructurados, creando un modelo desde cero. Este paquete ML debe ser entrenado. Si se implementa sin entrenamiento previo, la implementación falla con un error que indica que el modelo no está entrenado.

Out-of-the-box Pre-trained ML Packages

Se trata de paquetes de ML reentrenables que contienen el conocimiento de diferentes modelos de aprendizaje automático.

Se pueden personalizar para extraer campos adicionales o admitir idiomas adicionales mediante ejecuciones de procesos. Gracias a las capacidades de aprendizaje de transferencia de última generación, este modelo puede volver a entrenarse con documentos etiquetados adicionales y adaptarse a casos de uso específicos o ampliarse para que admita más idiomas latinos, cirílicos o griegos.

El conjunto de datos usado puede tener los mismos campos, un subconjunto de campos o tener campos adicionales. Para beneficiarte de la inteligencia ya contenida en el modelo preentrenado, es necesario usar campos con los mismos nombres que en el propio modelo listo para usar.

Estos paquetes ML son:

  • Invoices: The fields extracted out-of-the-box can be found here.
  • InvoicesAustraliaPreview: The fields extracted out-of-the-box can be found here.
  • InvoicesIndiaPreview: The fields extracted out-of-the-box can be found here.
  • InvoicesJapanPreview: The fields extracted out-of-the-box can be found here.
  • Receipts: The fields extracted out-of-the-box can be found here.
  • PurchaseOrdersPreview: The fields extracted out-of-the-box can be found here.
  • UtilityBillsPreview: The fields extracted out-of-the-box can be found here.

Estos modelos son arquitecturas de aprendizaje profundo diseñadas por UiPath. Una GPU puede usarse tanto en el tiempo de servicio como en el de entrenamiento, pero no es obligatoria. Una GPU ofrece una mejora de más de 10 veces en la velocidad para el entrenamiento en particular.

Otros paquetes ML listos para usar

Se trata de paquetes no entrenables que son necesarios para los componentes no ML del paquete de Document Understanding.

Estos paquetes ML son:

  • FormExtractor: Deploy as Public Skill and paste the URL into the Form Extractor activity.
  • IntelligentFormExtractor: Deploy as Public Skill and paste the URL into the Intelligent Form Extractor activity. Make sure to first deploy the HandwritingRecognition ML Skill and configure that as the OCR for this package.
  • IntelligentKeywordClassifier: Deploy as Public Skill and paste the URL into the Intelligent Keyword Classifier activity.
  • HandwritingRecognition: Deploy as Public Skill and use as OCR when creating the IntelligentFormExtractor package.

¿Te ha resultado útil esta página?

Conectar

¿Necesita ayuda? Soporte

¿Quiere aprender? UiPath Academy

¿Tiene alguna pregunta? Foro de UiPath

Manténgase actualizado