UiPath Documentation
document-understanding
2022.4
true
Guide de l'utilisateur de Document Understanding
Important :
La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.

Factures réentraînées avec un champ supplémentaire

Important :

Le but de cette page est d'aider les nouveaux utilisateurs à se familiariser avec Document Understanding.

For scalable production deployments, we strongly recommend using the Document Understanding Process available in UiPath Studio under the Templates section.

Ce guide de démarrage rapide vous montre comment recycler le modèle ML prêt à l'emploi de Factures (Invoices) pour extraire un champ supplémentaire.

Let’s use the same workflow we used for the receipts in the previous quickstart and modify it so it can support invoices.

Pour ce faire, nous devons effectuer les étapes suivantes dans notre workflow :

  1. Modifier la taxonomie
  2. Ajouter un classifieur
  3. Ajouter un extracteur d'apprentissage automatique
  4. Labelliser les données
  5. Réentraîner le modèle Invoices ML

Voyons maintenant chaque étape en détail.

1. Modifier la taxonomie​

Dans cette étape, nous devons modifier la taxonomie pour ajouter le type de document de facture.

To do so, open Taxonomy Manager and create group named "Semi Structured Documents", a category named "Finance", a document type named "Invoices". Create the above listed fields with user-friendly names along with respective data types.

  • nom - Text
  • adresse-fournisseur - Address
  • nom-facturation - Text
  • adresse-facturation - Address
  • adresse-livraison - Address
  • facture-no - Text
  • po-non - Text
  • fournisseur-tva-no - Text
  • date - Date
  • taxe - Number
  • total - Number
  • conditions-paiement - Text
  • montant-net - Number
  • date-d'échéance - Date
  • remise - Number
  • frais-d'expédition - Number
  • adresse-paiement - Address
  • description - Text
  • éléments - Table
    • description - Text
    • quantité - Number
    • prix unitaire – Number
    • montant-ligne - Number
    • élément-po-no - Text
    • ligne-no - Text
    • part-no - Text
    • nom-facturation - Text

2. Ajouter un classifieur​

Lors de cette étape, nous devons ajouter un classifieur afin de pouvoir traiter à la fois les reçus et les factures avec notre workflow.

Étant donné que notre workflow prend désormais en charge deux types de documents, « Reçus » et « Factures », nous devons ajouter le classifieur pour différencier les différents types de documents entrant en entrée :

  1. Add a Classify Document Scope after the Digitize Document activity and provide the DocumentPath,DocumentText, DocumentObjectModel, and Taxonomy as input arguments and capture the ClassificationResults in a new variable. We need this variable to check what document(s) we are processing.

  2. We also need to specify one or more classifiers. In this example, we are using the Intelligent Keyword Classifier. Add it to the Classify Document Scope activity.

    This page helps you take an educated decision on what classification method you should use in different scenarios.

  3. Train the classifier as described here.

  4. Configurez le classifieur en l'activant pour les deux types de documents.

  5. Depending on your use case, you might want to validate the classification. You can do that using the Present Classification Station or the Create Document Classification Action and Wait For Document Classification Action And Resume activities.

3. Ajouter un extracteur d'apprentissage automatique​

In this step, we need to add a Machine Learning Extractor to the Data Extraction Scope activity and connect it to the Invoices public endpoint.

La procédure est exactement la même que pour le précédent extracteur d'apprentissage automatique des reçus que nous avons ajouté auparavant :

  1. Ajoutez une activité extracteur d'apprentissage automatique (Machine Learning Extractor) à côté des reçus extracteur d'apprentissage automatique (Receipts Machine Learning Extractor).

  2. Provide the Invoices public endpoint, namely https://du.uipath.com/ie/invoices/, and an API key to the extractor.

  3. Configurez l'extracteur pour qu'il fonctionne avec les factures en mappant les champs créés dans le Taxonomy Manager aux champs disponibles dans le modèle ML :

  4. N'oubliez pas d'utiliser la variable ClassificationResults générée par Classer la portée du document (Classify Document Scope) comme entrée de Étendue de l'extraction de données (Data Extraction Scope), au lieu de spécifier un IDTypeDocument.

    Vous devriez vous retrouver avec quelque chose comme ça :

  5. Exécutez le workflow pour tester qu'il fonctionne correctement avec les factures.

4. Labelliser les données​

Nous devons labelliser les données avant de réentrainer le modèle Factures (Invoices) ML de base afin qu'il prenne en charge le nouveau champ IBAN.

  1. Rassemblez les exigences et les exemples de documents de facturation en volume suffisant pour la complexité du cas d'utilisation que vous devez résoudre.

    Label 50 pages, as explained on this documentation page.

  2. Gain access to an instance of Document Manager either on premises or in AI Center in the Cloud. Make sure you have the permissions to use Document Manager.

  3. Créez un projet AI Center et accédez à Labellisation des données (Data Labeling) > UiPath Document Understanding et créez une session Labellisation des données (Data Labeling).

  4. Configure an OCR Engine as described here, try importing a diverse set of your production documents and make sure that the OCR engine reads the text you need to extract.

    More suggestions in this section. Only proceed to next step after you have settled on a OCR engine.

  5. Create a fresh Document Manager session, and import a Training set and an Evaluation set, while making sure to check the Make this a Test set checkbox when importing the Evaluation set.

  6. Créez et configurez le champ IBAN.

    More advanced guidelines are available in this section.

  7. Label a Training dataset and an Evaluation dataset as described here.

    La fonction de prébalisage de Data Manager peut rendre le travail de labellisation beaucoup plus facile.

  8. Exportez d'abord l'ensemble d'évaluation, puis l'ensemble d'entraînement vers AI Center en les sélectionnant dans la liste déroulante des filtres en haut de la vue du Data Manager.

Ensuite, créons notre modèle, ré-entraînons-le et déployons-le.

5. Réentraîner le modèle ML Factures​

Maintenant que notre flux de travail prend en charge le traitement des factures, nous devons extraire l'IBAN de nos factures, qui est un champ qui n'est pas récupéré par défaut par le modèle Factures (Invoices) ML prêt à l'emploi. Cela signifie que nous devons recycler un nouveau modèle, en commençant par celui de base.

  1. Create an ML Package as described here. If your document type is different from the ones available out-of-the-box, then choose the DocumentUnderstanding ML Package. Otherwise, use the package closest to the document type you need to extract.

  2. Create a Training Pipeline as described here using the Input dataset which you exported in the previous section from Document Manager.

  3. Lorsque l'entraînement est terminé et que vous disposez de la version mineure 1 du package, exécutez un pipeline d'évaluation sur cette version mineure et inspectez la comparaison côte à côte evaluation.xlsx.

    Use the detailed guidelines here.

  4. If the evaluation results are satisfactory, go to the ML Skills view and create an ML Skill using the new minor version of the ML Package. If you want to use this to do prelabeling in Document Manager, you need to click on the Modify Current Deployment button at the top right of the ML Skill view and toggle on the Make ML Skill Public.

  5. Après avoir créé la compétence ML, nous devons maintenant l’utiliser dans Studio. Pour ce faire, le moyen le plus simple consiste à rendre la compétence ML publique, comme décrit ici. Ensuite, il ne reste plus qu'à remplacer le point de terminaison public du modèle ML Factures (Invoices) que nous avons initialement ajouté à l'extracteur d'apprentissage automatique dans notre workflow par le point de terminaison public de la compétence ML.

  6. Exécutez le workflow et vous devriez voir le champ IBAN nouvellement ajouté être extrait avec les champs de factures par défaut.

Téléchargez l'exemple​

Téléchargez cet exemple de projet à l'aide de ce lien. Vous devez modifier l'extracteur d'apprentissage automatique pour les factures du mode point de terminaison à votre compétence ML entraînée.

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour