Document Understanding
2022.10
False
Imagen de fondo del banner
Guía del usuario de Document Understanding
Última actualización 19 de abr. de 2024

Acerca de los paquetes ML

El uso de un paquete ML de Document Undestanding implica estos pasos:

  • Recopila muestras de documentos y los requisitos de los puntos de datos que deben extraerse.
  • Etiquetado de documentos con Document Manager. El propio Document Manager se conecta a un servicio de OCR.
  • Descarga o exportación de documentos etiquetados como conjunto de datos de entrenamiento y carga de la carpeta exportada en el almacenamiento de AI Center.
  • Descarga o exportación de documentos etiquetados como un conjunto de datos de evaluación y carga de la carpeta exportada en el almacenamiento de AI Center.
  • Ejecución de un proceso de entrenamiento en AI Center.
  • Evaluación del rendimiento del modelo con un proceso de evaluación en AI Center.
  • Implementación del modelo entrenado como una habilidad ML en AI Center.
  • Consultar la habilidad ML desde un flujo de trabajo RPA con el paquete de actividades UiPath.DocumentUnderstanding.ML.
    Nota: Recuerda que el uso de los paquetes ML de Document Understanding requiere que la máquina en la que está instalado AI Center pueda acceder a https://du-metering.uipath.com.
    Importante: Al crear un paquete UiPath.DocumentUnderstanding.ML.Activities en AI Center, el nombre del paquete no debería contener ninguna palabra clave reservada para Python, como class, break, from, finally, global, None, etc. Ten en cuenta que esta lista no es exhaustiva, ya que el nombre del paquete se usa para class <pkg-name> y import <pkg-name> .

Se trata de modelos de aprendizaje automático listos para usarse para clasificar y extraer cualquier punto de datos común de documentos semiestructurados o no estructurados, incluidos los campos regulares, las columnas de tablas y los campos de clasificación, con un enfoque sin plantillas.



Nota:

Los paquetes de aprendizaje automático suministrados por UiPath tienen la versión 0 y ya están disponibles en tu tenant, lo que significa que no es necesario descargarlos.

La descarga está disponible solo para las versiones 1 o superiores, que ya fueron entrenadas por ti.

Document Understanding contiene múltiples paquetes de ML divididos en cinco categorías principales:

  • UiPath Document OCR
  • Document Understanding
  • Clasificador de documentos
  • Paquetes ML preentrenados listos para usar
  • Paquetes ML DU preentrenados listos para usar en AI Center
  • Otros paquetes ML listos para usar

UiPath Document OCR

Este es un modelo no entrenable que puede usarse con la actividad del motor UiPath Document OCR como parte de la actividad Digitalizar documento. Para poder usarla, la habilidad ML debe hacerse pública primero para copiar una URL en la actividad del motor UiPath Document OCR.

Puede ejecutar UiPathDocumentOCR en la GPU o en la CPU, siendo la precisión la misma en ambos casos y el entrenamiento en la GPU es más rápido que en la CPU. Consulta los Requisitos de hardware para obtener más información.

UiPathDocumentOCR requiere acceso al servidor de medición de Document Understanding en https://du.uipath.com/metering si la habilidad ML se está ejecutando en una implementación regular de AI Center local. No es necesario el acceso a Internet en las implementaciones aisladas de AI Center locales.

UiPathDocumentOCR_CPU

Este paquete ML se puede implementar de la misma manera que el paquete ML de UiPathDocumentOCR, con las siguientes diferencias:

  • está optimizado para ejecutarse en la CPU, por lo que deberías ver un aumento de velocidad de 3 a 4 veces cuando se ejecuta en el flujo de trabajo, y de 5 a 10 veces cuando se utiliza para importar documentos en el administrador de documentos.
  • la precisión es ligeramente inferior a la del paquete ML UiPathDocumentOCR, y es similar a la del paquete de Studio UiPath.DocumentUnderstanding.OCR.LocalServer.
  • Debido a que es más rápida, la CPU también se recomienda cuando los documentos son grandes (más de 20 páginas por documento) en ausencia de una GPU, que es lo ideal.

Document Understanding

Se trata de un modelo genérico y reentrenable para extraer cualquier punto de datos común de cualquier tipo de documentos estructurados o semiestructurados, creando un modelo desde cero. Este paquete ML debe ser entrenado. Si se implementa sin entrenamiento previo, la implementación falla con un error que indica que el modelo no está entrenado.

Clasificador de documentos

Se trata de un modelo genérico y reentrenable para clasificar cualquier tipo de documentos estructurados o semiestructurados, creando un modelo desde cero. Este paquete ML debe ser entrenado. Si se implementa sin entrenamiento previo, la implementación falla con un error que indica que el modelo no está entrenado.

Paquetes ML preentrenados listos para usar

Se trata de paquetes de ML reentrenables que contienen el conocimiento de diferentes modelos de aprendizaje automático.

Se pueden personalizar para extraer campos adicionales o admitir idiomas adicionales mediante ejecuciones de procesos. Gracias a las capacidades de aprendizaje de transferencia de última generación, este modelo puede volver a entrenarse con documentos etiquetados adicionales y adaptarse a casos de uso específicos o ampliarse para que admita más idiomas latinos, cirílicos o griegos.

El conjunto de datos usado puede tener los mismos campos, un subconjunto de campos o tener campos adicionales. Para beneficiarte de la inteligencia ya contenida en el modelo preentrenado, es necesario usar campos con los mismos nombres que en el propio modelo listo para usar.

Estos paquetes ML son:

  • Facturas: los campos extraídos listos para usar pueden consultarse aquí.
  • FacturasAustralia: los campos extraídos listos para usar pueden consultarse aquí.
  • FacturasIndia: los campos extraídos listos para usar pueden consultarse aquí.
  • FacturasJapón Preview: los campos extraídos listos para usar pueden consultarse aquí.

    Por el momento no se admite el reentrenamiento con datos de la Estación de validación.

  • FacturasChina Preview: los campos extraídos listos para usar pueden consultarse aquí.

    Por el momento no se admite el reentrenamiento con datos de la Estación de validación.

  • Recibos: los campos extraídos listos para usar pueden consultarse aquí.
  • Órdenes de compra: los campos extraídos listos para usar pueden consultarse aquí.
  • Facturas de serivicios: los campos extraídos listos para usar pueden consultarse aquí.
  • Documentos de identidad: los campos extraídos listos para usar pueden consultarse aquí.
  • Pasaportes: los campos extraídos listos para usar pueden consultarse aquí.
  • ConsejosDeRemesas: los campos extraídos listos para usar pueden consultarse aquí.
  • ConocimientosDeEmbarque: los campos extraídos listos para usar pueden consultarse aquí.
  • W2: los campos extraídos listos para usar pueden consultarse aquí.
  • W9: los campos extraídos listos para usar pueden consultarse aquí.
  • ACORD125: los campos extraídos listos para usar pueden consultarse aquí
  • I9: los campos extraídos listos para usar pueden consultarse aquí
  • 990 Preview: los campos extraídos listos para usar pueden consultarse aquí
  • 4506T: los campos extraídos listos para usar pueden consultarse aquí
  • FM1003 Preview: los campos extraídos listos para usar pueden consultarse aquí
  • ACORD25: los campos extraídos listos para usar pueden consultarse aquí
  • 1040: los campos extraídos listos para usar pueden consultarse aquí
  • Cheques: los campos extraídos listos para usar pueden consultarse aquí
  • Extractos bancarios: los campos extraídos listos para usar pueden consultarse aquí
  • Estados financieos: los campos extraídos listos para usar pueden consultarse aquí
  • Listas de embalaje: los campos extraídos listos para usar pueden consultarse aquí
  • ACORD131: los campos extraídos listos para usar pueden consultarse aquí
  • ACORD126: los campos extraídos listos para usar pueden consultarse aquí
  • ACORD140: los campos extraídos listos para usar pueden consultarse aquí
  • Titulación de vehículos: los campos extraídos listos para usar pueden consultarse aquí

Estos modelos son arquitecturas de aprendizaje profundo diseñadas por UiPath. Una GPU puede usarse tanto en el tiempo de servicio como en el de entrenamiento, pero no es obligatoria. Una GPU ofrece una mejora de más de 10 veces en la velocidad para el entrenamiento en particular.

Los paquetes ML preentrenados listos para usar pueden dividirse en categorías de documentos en función del uso previsto de cada modelo:

Categoría de documento

Modelo de ML

KYC

  • Pasaportes
  • Carnés de identidad
  • Facturas de servicios públicos
  • 4506T
  • 1040
  • Comprobaciones
  • Títulos de vehículos

Seguros

  • ACORD125
  • Acord131
  • Acord126
  • Acord140

Préstamos

  • FM1003
  • W2
  • 4506T

Recursos humanos

  • Pasaportes
  • Carnés de identidad
  • W9
  • I9

Envíos

  • Facturas
  • Conocimientos de embarque (incluye cartas de porte marítimo y aéreo)
  • Listas de embalaje

AP

  • Facturas
  • Facturas de servicios públicos

AR

  • Consejos de remisión
  • Órdenes de compra
  • Extractos bancarios
  • Estados financieros

Gastos

  • Recibos

Otros paquetes ML listos para usar

Se trata de paquetes no entrenables que son necesarios para los componentes no ML del paquete de Document Understanding.

Estos paquetes ML son:

  • ExtractorDeFormularios: impleméntala como habilidad pública y pega la URL en la actividad Extractor de formularios.
  • ExtractorInteligenteDeFormularios: implementa como habilidad pública y pega la URL en la actividad Extractor inteligente de formularios. Asegúrate de implementar primero la habilidad ML Reconocimiento de escritura manual y configúrala como OCR para este paquete.
  • ClasificadorInteligenteDePalabrasClave: impleméntala como habilidad pública y pega la URL en la actividad Clasificador inteligente de palabras clave.
  • HandwritingRecognitionOCR: implementa como habilidad pública y usa como OCR al crear el paquete Extractor inteligente de formularios.

Was this page helpful?

Obtén la ayuda que necesitas
RPA para el aprendizaje - Cursos de automatización
Foro de la comunidad UiPath
Logotipo blanco de UiPath
Confianza y seguridad
© 2005-2024 UiPath. All rights reserved.