UiPath Documentation
document-understanding
2022.4
true
Guía del usuario de Document Understanding
Importante :
La localización de contenidos recién publicados puede tardar entre una y dos semanas en estar disponible.

Facturas reordenadas con un campo adicional

Importante:

El objetivo de esta página es ayudar a los usuarios noveles a familiarizarse con Document Understanding.

For scalable production deployments, we strongly recommend using the Document Understanding Process available in UiPath Studio under the Templates section.

Esta guía rápida te muestra cómo reentrenar el modelo listo para usar ML de Facturas para extraer un campo más.

Let’s use the same workflow we used for the receipts in the previous quickstart and modify it so it can support invoices.

Para ello, debemos realizar los siguientes pasos en nuestro flujo de trabajo:

  1. Modificar taxonomía
  2. Añadir un clasificador
  3. Añadir un extractor con aprendizaje automático
  4. Etiquetar datos
  5. Reentrenar el modelo ML de facturas

Ahora, veamos cada paso con detalle.

1. Modificar taxonomía​

En este paso, debemos modificar la taxonomía para añadir el tipo de documento de factura.

To do so, open Taxonomy Manager and create group named "Semi Structured Documents", a category named "Finance", a document type named "Invoices". Create the above listed fields with user-friendly names along with respective data types.

  • nombre: Text
  • dirección del proveedor: Address
  • billing-name - Text
  • billing-address - Address
  • shipping-address - Address
  • invoice-no - Text
  • po-no - Text
  • vendor-vat-no - Text
  • fecha: Date
  • tax - Number
  • total: Number
  • payment-terms - Text
  • net-amount - Number
  • due-date - Date
  • discount - Number
  • shipping-charges - Number
  • payment-addr - Address
  • descripción: Text
  • elementos: Table
    • descripción: Text
    • cantidad: Number
    • precio unitario: Number
    • importe de línea: Number
    • item-po-no - Text
    • line-no - Text
    • part-no - Text
    • billing-vat-no - Text

2. Añadir un clasificador​

En este paso, tenemos que añadir un clasificador para poder procesar tanto los recibos como las facturas con nuestro flujo de trabajo.

Dado que nuestro flujo de trabajo admite ahora dos tipos de documentos, «Recibos» y «Facturas», necesitamos añadir el clasificador para diferenciar entre los distintos tipos de documentos que llegan como entrada:

  1. Add a Classify Document Scope after the Digitize Document activity and provide the DocumentPath,DocumentText, DocumentObjectModel, and Taxonomy as input arguments and capture the ClassificationResults in a new variable. We need this variable to check what document(s) we are processing.

  2. We also need to specify one or more classifiers. In this example, we are using the Intelligent Keyword Classifier. Add it to the Classify Document Scope activity.

    This page helps you take an educated decision on what classification method you should use in different scenarios.

  3. Train the classifier as described here.

  4. Configura el clasificador habilitándolo para ambos tipos de documentos.

  5. Depending on your use case, you might want to validate the classification. You can do that using the Present Classification Station or the Create Document Classification Action and Wait For Document Classification Action And Resume activities.

3. Añadir un extractor con aprendizaje automático​

In this step, we need to add a Machine Learning Extractor to the Data Extraction Scope activity and connect it to the Invoices public endpoint.

El procedimiento es el mismo que para el anterior Extractor de recibos con aprendizaje automático que hemos añadido antes:

  1. Añade una actividad Extractor con aprendizaje automático a la vez que Extractor de recibos con aprendizaje automático.

  2. Provide the Invoices public endpoint, namely https://du.uipath.com/ie/invoices/, and an API key to the extractor.

  3. Configura el extractor para que opere con facturas asignando los campos creados en el Gestor de taxonomía a los campos disponibles en el modelo ML:

  4. No olvides utilizar la variable de resultados de la clasificación generada por Clasificar ámbito de documento como entrada al ámbito de extracción de datos, en lugar de especificar un ID de tipo de documento.

    Deberías terminar con algo como lo siguiente:

  5. Ejecuta el flujo de trabajo para comprobar que funciona correctamente con las facturas.

4. Etiquetar datos​

Necesitamos etiquetar los datos antes de reentrenar el modelo ML para Facturas que soporte el nuevo campo IBAN.

  1. Recopila los requisitos y los documentos de muestra de facturas en un volumen suficiente para la complejidad del caso de uso que debes resolver.

    Label 50 pages, as explained on this documentation page.

  2. Gain access to an instance of Document Manager either on premises or in AI Center in the Cloud. Make sure you have the permissions to use Document Manager.

  3. Crea un proyecto de AI Center y ve a Etiquetado de datos > UiPath Document Understanding y crea una sesión de Etiquetado de datos.

  4. Configure an OCR Engine as described here, try importing a diverse set of your production documents and make sure that the OCR engine reads the text you need to extract.

    More suggestions in this section. Only proceed to next step after you have settled on a OCR engine.

  5. Crea una nueva sesión del Administrador de documentos e importa un conjunto de entrenamiento y un conjunto de evaluación, asegurándote de marcar la casilla de verificación Convertirlo en un conjunto de prueba al importar el conjunto de evaluación.

  6. Crea y configura el campo IBAN.

    More advanced guidelines are available in this section.

  7. Label a Training dataset and an Evaluation dataset as described here.

    La función de preetiquetado de Document Manager puede facilitar mucho el trabajo de etiquetado.

  8. Exporta primero el conjunto de evaluación y luego el conjunto de entrenamiento a AI Center seleccionándolos en el filtro desplegable de la parte superior de la vista del Administrador de documentos.

A continuación, vamos a crear nuestro modelo, volver a entrenarlo e implementarlo.

5. Reentrenar el modelo ML de facturas​

Ahora que nuestro flujo de trabajo admite el procesamiento de facturas, necesitamos extraer el IBAN de nuestras facturas, ya que es un campo que no se obtiene de manera predeterminada por el modelo ML Facturas listo para usar. Eso significa que tenemos que volver a entrenar un nuevo modelo, partiendo del de base.

  1. Create an ML Package as described here. If your document type is different from the ones available out-of-the-box, then choose the DocumentUnderstanding ML Package. Otherwise, use the package closest to the document type you need to extract.

  2. Create a Training Pipeline as described here using the Input dataset which you exported in the previous section from Document Manager.

  3. Cuando el entrenamiento haya terminado y tengas la versión secundaria del paquete 1, ejecuta un proceso de evaluación en esta versión secundaria e inspecciona la comparación lado a lado de evaluation.xlsx.

    Use the detailed guidelines here.

  4. Si los resultados de la evaluación son correctos, ve a la vista Habilidades ML y crea una utilizando la nueva versión secundaria del paquete ML. Si quieres usarlo para hacer el preetiquetado en el Administrador de Documentos, debes hacer clic en el botón Modificar implementación actual en la parte superior derecha de la vista Habilidad ML y activar Hacer pública la habilidad ML.

  5. Tras crear la habilidad ML, tenemos que consumirla en Studio. La forma más sencilla de hacerlo es hacer pública la habilidad ML como se describe aquí. Entonces, lo único que queda por hacer es simplemente reemplazar el punto de conexión público del modelo ML Facturas que hemos añadido inicialmente al extractor con aprendizaje automático en nuestro flujo de trabajo con el punto de conexión público de la habilidad ML.

  6. Si ejecutas el flujo de trabajo, deberías ver que el campo IBAN recién añadido se extrae junto con los campos de las facturas predeterminados.

Descargar ejemplo​

Descarga este proyecto de ejemplo utilizando este enlace. Debes cambiar el Extractor de aprendizaje automático para facturas del modo Punto final a tu habilidad ML entrenada.

¿Te ha resultado útil esta página?

Conectar

¿Necesita ayuda? Soporte

¿Quiere aprender? UiPath Academy

¿Tiene alguna pregunta? Foro de UiPath

Manténgase actualizado