UiPath Documentation
document-understanding
2022.4
false
Guide de l'utilisateur de Document Understanding
Important :
La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.

À propos des paquets ML

L'utilisation d'un paquet ML Document Understanding implique les étapes suivantes :

  • Recueillir les échantillons de documents et les exigences des points de données qui doivent être extraits.

  • Labeling documents using Document Manager. Be aware that Document Manager itself connects to an OCR Service.

  • Le téléchargement ou l'export de documents labellisés en tant qu'ensemble de données d'entraînement et le téléversement de ce dossier exporté sur un stockage AI Center.

  • Le téléchargement ou l'export de documents labellisés en tant qu'ensemble de données d'évaluation et le téléversement de ce dossier exporté sur un stockage AI Center.

  • L'exécution d'un Pipeline d'entraînement (Training Pipeline) sur AI Center.

  • L'évaluation des performances du modèle avec un Pipeline d'évaluation (Evaluation Pipeline) sur AI Center.

  • Le déploiement du modèle entraîné en tant que compétence ML sur AI Center.

  • La requête envers la compétence ML à partir d'un workflow RPA à l'aide du package d'activités UiPath.DocumentUnderstanding.ML.

    Remarque :

    N'oubliez pas que l'utilisation de paquets ML Document Understanding nécessite que la machine sur laquelle AI Center est installé puisse accéder https://du-metering.uipath.com.

    Remarque :

    When creating a UiPath.DocumentUnderstanding.ML.Activities Package in AI Center, the package name should not be any python reserved keyword, such as class , break, from, finally, global, None, etc. Note that this list is not exhaustive since the package name is used for class <pkg-name> and import <pkg-name>.

Il s'agit de modèles d'apprentissage automatique prêts à l'emploi pour classer et extraire tous les points de données courants à partir de documents semi-structurés ou non structurés, y compris les champs réguliers, les colonnes de table et les champs de classification dans une approche sans modèle.

Remarque :

Les packages d’apprentissage automatique prêts à l’emploi fournis par UiPath ont la version 0 et sont déjà disponibles sur votre locataire, ce qui signifie qu’il n’est pas nécessaire de les télécharger.

Le téléchargement est disponible uniquement pour les versions 1 ou supérieures, que vous avez déjà entraînées.

Document Understanding contient plusieurs paquets ML divisés en cinq catégories principales :

UiPath Document OCR

This is a non-retrainable model which can be used with the UiPath Document OCR engine activity as part of the Digitize Document activity. To be used, the ML Skill must first be made public so that a URL can be copy-pasted into the UiPath Document OCR engine activity.

UiPathDocumentOCR nécessite l'accès au serveur de comptage de Document Understanding à l' adresse https://du.uipath.com/metering si la compétence ML s'exécute sur une version locale d'AI Center à déploiement régulier. Aucun accès Internet n'est nécessaire sur la version locale d'AI Center pour les déploiements physiquement isolés.

UiPathDocumentOCR_CPU

Ce paquet ML peut être déployé exactement de la même manière que le paquet ML UiPathDocumentOCR, avec les différences suivantes :

  • il est optimisé pour fonctionner sur le processeur, vous devriez donc constater une exécution 3 à 4 fois plus rapide dans le workflow et une utilisation 5 à 10 fois plus rapide lors de l'importation des documents dans Document Manager
  • la précision est légèrement inférieure à celle du paquet ML UiPathDocumentOCR et est similaire au paquet Studio UiPath.DocumentUnderstanding.OCR.LocalServer
  • en raison de sa rapidité, le processeur est également recommandé lorsque les documents sont volumineux (plus de 20 pages par document) en l’absence d’un GPU, ce qui est idéal.

Document Understanding

Il s'agit d'un modèle générique et réentraînable permettant d'extraire tous les points de données courants de tout type de documents structurés ou semi-structurés, en créant un modèle à partir de zéro. Ce paquet ML doit être entraîné. S'il est déployé sans entraînement préalable, le déploiement échouera en présentant une erreur indiquant que le modèle n'a pas été entraîné.

Classifieur de documents

Il s'agit d'un modèle générique et réentraînable pour classer tout type de documents structurés ou semi-structurés, en construisant un modèle à partir de zéro. Ce paquet ML doit être entraîné. S'il est déployé sans entraînement préalable, le déploiement échouera en présentant une erreur indiquant que le modèle n'a pas été entraîné.

Out-of-the-box Pre-trained ML Packages

Il s'agit de packages ML réentraînables qui détiennent la connaissance de différents modèles d'apprentissage automatique.

Ils peuvent être personnalisés pour extraire des champs supplémentaires ou prendre en charge des langues supplémentaires à l'aide d'exécutions de pipeline. En utilisant des capacités d'apprentissage par transfert de pointe, ce modèle peut être réentraîné sur des documents labellisés supplémentaires et adapté à des cas d'utilisation spécifiques ou étendu pour une prise en charge supplémentaire des langues latines, cyrilliques ou grecques.

L'ensemble de données utilisé peut avoir les mêmes champs, un sous-ensemble des champs ou des champs supplémentaires. Afin de bénéficier des informations déjà contenues dans le modèle préentraîné, vous devez utiliser des champs portant les mêmes noms que dans le modèle prêt à l'emploi lui-même.

Ces packages ML sont :

  • Invoices: The fields extracted out-of-the-box can be found here.
  • InvoicesAustralia: The fields extracted out-of-the-box can be found here.
  • InvoicesIndia: The fields extracted out-of-the-box can be found here.
  • InvoicesJapanPreview: The fields extracted out-of-the-box can be found here. Retraining using data from Validation Station is currently not supported.
  • InvoicesChinaPreview: The fields extracted out-of-the-box can be found here. Retraining using data from Validation Station is currently not supported.
  • Receipts: The fields extracted out-of-the-box can be found here.
  • Purchase Orders: The fields extracted out-of-the-box can be found here.
  • Utility Bills: The fields extracted out-of-the-box can be found here.
  • ID CardsPreview: The fields extracted out-of-the-box can be found here.
  • Passports: The fields extracted out-of-the-box can be found here.
  • RemittanceAdvicesPreview: The fields extracted out-of-the-box can be found here.
  • W2Preview: The fields extracted out-of-the-box can be found here.
  • W9: The fields extracted out-of-the-box can be found here.
  • ACORD125Preview: The fields extracted out-of-the-box can be found here
  • I9Preview: The fields extracted out-of-the-box can be found here
  • 990Preview: The fields extracted out-of-the-box can be found here
  • 4506TPreview: The fields extracted out-of-the-box can be found here
  • FM1003Preview: The fields extracted out-of-the-box can be found here

Ces modèles sont des architectures d'apprentissage profond développées par UiPath. Un GPU peut être utilisé à la fois au moment du service et au moment de l'entraînement, mais n'est pas obligatoire. Un GPU offre une amélioration de la vitesse multipliée par 10 pour l'entraînement en particulier.

Autres paquets ML prêts à l’emploi

Il s'agit de packages non réentraînables requis pour les composants non ML de la suite Document Understanding.

Ces packages ML sont :

  • FormExtractor: Deploy as Public Skill and paste the URL into the Form Extractor activity.
  • IntelligentFormExtractor: Deploy as Public Skill and paste the URL into the Intelligent Form Extractor activity. Make sure to first deploy the HandwritingRecognition ML Skill and configure that as OCR for the this package.
  • IntelligentKeywordClassifier: Deploy as Public Skill and paste the URL into the Intelligent Keyword Classifier activity.
  • HandwritingRecognitionOCR : déployez-le en tant que compétence publique et utilisez-le en tant qu'OCR lors de la création du package IntelligentFormExtractor.

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour