UiPath Documentation
activities
latest
false
Activités Document Understanding
Important :
Veuillez noter que ce contenu a été localisé en partie à l’aide de la traduction automatique. La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.

Extraire les données du document

Extrayez les données d'un fichier de document ou d'un objet Données du document et stockez les résultats dans un objet Données du document à l'aide de l'activité Extraire les données du document.

UiPath.IntelligentOCR.StudioWeb.Activities.ExtractDocumentDataWithDocumentData<UiPath.IntelligentOCR.StudioWeb.Activities.DataExtraction.ExtendedExtractionResultForDocumentData>

Description

Extrait les données d'un fichier d'entrée ou d'un objet Données du document (Document Data) et stocke les résultats dans un objet Données du document (Document Data).

Avant de commencer

Prérequis

L’activité Extraire les données du document (Extract Document Data) nécessite des objets d’entrée de type Données de document (Document Data) ou Fichier (File). Un cas d’utilisation possible pour utiliser cette activité consiste à la précéder d’une activité Classer un document (Classify Document), qui génère un objet de type Données du document (Document Data).

Options d'entrée

L'activité Extraire les données du document (Extract Document Data) reçoit en entrée l'un des choix suivants :

  • Données du document (Document Data) : à partir de l'activité Classer un document (Classify Document)
  • Fichier (File) : à partir des activités Obtenir un fichier/dossier (Get File/Folder) ou Obtenir l'e-mail le plus récent (Get Newest Email)

Langues prises en charge pour les modèles génératifs

Les langues prises en charge pour les modèles génératifs sont les mêmes que celles du moteur OCR utilisé, lequel dépend du projet. Pour les projets prédéfinis et génératifs , le moteur OCR utilisé est UiPath Document OCR. Pour plus d’informations, consultez la page Langues prises en charge par l’OCR .

Modèles utilisés par l’activité

L’activité Extraire les données du document (Extract Document Data) utilise les éléments suivants :

  • Modèles spécialisés pré-entraînés disponibles en prêt à l’emploi, basés sur l’ Helix Extractor.
  • Modèles pré-entraînés personnalisés, déployés dans les projets modernes et classiques Document Understanding.
  • Modèles d’extraction génératifs.

Limites connues

Le type de projet Génératif prédéfini et les extracteurs correspondants ne sont pas disponibles dans Automation Suite.

Lorsque vous utilisez l’activité Extraire les données du document, les champs de classification sont pris en charge pour les extracteurs de projets modernes et les modèles prêts à l’emploi, mais pas pour les extracteurs de projets classiques.

Fourniture de DocumentData avec des sous-documents à l'activité Extraire les données du document, déclenchera une erreur de runtime. Ce comportement est conçu par conception. Pour extraire des données d’un document fractionné, parcourez chaque sous-document.

Compatibilité du projet

Windows | Multiplate-forme

Configuration

Module Designer

  • Entrée (Input) : vous devez spécifier le fichier lui-même, ou les Données du document (Document Data), au cas où vous auriez déjà utilisé d'autres activités Document Understanding dans votre workflow (par exemple, Classer un document (Classify Document)).

    Important :

    Un fichier peut avoir au maximum 500 pages. Les fichiers dépassant cette limite ne pourront pas être extraits.

  • Projet (Project) : vous devez sélectionner votre projet Document Understanding dans la liste déroulante. Les options disponibles sont :

    • Prédéfini : type de projet classique qui utilise des modèles spécialisés pré-entraînés recommandés dans le cadre de scénarios standard. Pour plus d’informations sur la logique de facturation pour les projets classiques, consultez la section Logique de mesure et de facturation.
    • Génératif prédéfini : type de projet moderne utilisant des modèles génératifs pré-entraînés acceptant des instructions en tant qu’entrée pour l’extraction des données de document. Pour plus d’informations sur la logique de facturation des projets modernes, consultez la section Logique de mesure et de facturation.
    • Langues non latines prédéfinies : type de projet moderne utilisant des modèles pré-entraînés pour des scénarios de traitement de documents non latins. Pour plus d’informations sur la logique de facturation des projets modernes, consultez la section Logique de mesure et de facturation.
    • Projets du locataire et du dossier auxquels vous êtes connecté.
    • Vous pouvez créer un projet personnalisé en accédant à Document Understanding. Pour plus d'informations, consultez la section Introduction à la création de modèles.
      Remarque :

      Si vous avez créé plus de 500 projets sur votre locataire et que vous utilisez l’activité Extraire les données du document, UiPath Studio ou Studio Web n’affichera aucun projet au-delà des 500 initiaux. Par conséquent, ces projets ne peuvent pas être utilisés.

  • Extracteur (Extractor) : après avoir sélectionné un projet, vous pouvez également sélectionner l'extracteur que vous souhaitez utiliser.

    • Pour le projet Prédéfini , vous avez deux choix : - Sélectionner un modèle pré-entraîné. Consultez Modèles prêts à l’emploi pour obtenir une liste des modèles pré-entraînés que vous pouvez utiliser.
      Remarque :

      L'activité Extraire les données du document extrait les informations des champs disponibles sur le type de document de l'extracteur sélectionné (quel que soit le type réel du document). Cela ne s'applique pas aux modèles génératifs.

      • Sélectionnez l’extracteur génératif.
        Remarque :

        Les informations envoyées à l’extracteur génératif sont envoyées à une instance de modèle LLM. Cette instance n’est pas accessible au public, ne stocke pas les données envoyées et ne les utilise pas à des fins d’entraînement.

    • Pour le projet Génératif prédéfini, vous disposez de trois choix d’extraction, qui s’adapteront chacun à une mise en page de document spécifique :
      • Extracteur de mise en page simple de document long : recommandé pour les longs documents contenant principalement du texte et des en-têtes. Par exemple, utilisez l’extracteur de mise en page simple pour documents longs sur des documents tels que des contrats de bail, des accords-cadres ou d’autres documents similaires.
      • Extracteur de mise en page complexe de document long (Aperçu) : recommandé pour les documents longs qui incluent des éléments tels que des images, de l’écriture manuscrite, des contrôles de formulaire, des zones de légende flottantes ou d’autres types de mise en page complexes. Vous pouvez par exemple utiliser l’extracteur de mise en page complexe de document long sur des documents tels que des polices d’assurance ou d’autres documents similaires.
      • Extracteur de mise en page complexe de documents courts (Aperçu) : recommandé pour les documents courts qui incluent des éléments tels que des images, de l’écriture manuscrite, du contrôle de formulaires, des zones de légende flottantes ou d’autres types de mise en page complexes. Par exemple, vous pouvez utiliser l’Extracteur de mise en page complexe de document court sur des documents tels que des cartes d’identification du secteur public, des formulaires de prise en charge des soins de santé ou d’autres documents similaires.
    • Pour le projet Langues non latines prédéfinies , vous disposez de trois choix d'extraction, qui s'adapteront chacun à une mise en page de document non latine spécifique :
      • Factures Japon ) : recommandé pour les documents de facturation japonais. L'extracteur peut gérer les mises en page de factures japonaises courantes et peut identifier et extraire les champs de facture clés tels que les informations sur le fournisseur, le numéro de facture et la devise.
      • Factures Chine - Recommandé pour les documents de facturation chinois. L'extracteur peut gérer les mises en page de factures chinoises courantes et peut identifier et extraire les champs de facture clés tels que les informations sur le fournisseur, le numéro de facture et la devise.
      • Reçus Japon - Recommandé pour les documents de reçu japonais. Vous pouvez utiliser l'extracteur pour identifier et extraire des champs tels que le nom du vendeur, la date de la transaction, le montant total, les taxes et la devise des reçus en japonais.
    • Utiliser le résultat de la classification: si la propriété Générer un type de données est définie sur false, vous pouvez opter pour l’option Utiliser le résultat de la classification . Cette option utilise automatiquement un extracteur recommandé en fonction du type de document résultant de l’activité Classer un document . Si plusieurs extracteurs peuvent fonctionner avec ce type de document, l’activité renvoie une erreur. Dans ce scénario, vous devez sélectionner manuellement votre extracteur préféré.
  • Détails du type de document : ce champ s’affiche si vous choisissez l’option Génératif. Invite pour identifier les champs à extraire, fournie sous forme de paires clé-valeur, où la clé représente le nom du champ et la valeur une description de celui-ci, permettant à l’extracteur d’identifier la valeur correspondante. Sélectionnez le champ pour obtenir une invite avec les options suivantes, fournies par paires :

    • Nom du champ (Field name) : vous devez saisir le nom du champ à extraire (ex. Date d'échéance) (limite de 30 caractères)
    • Instruction : vous devez fournir des instructions sur les informations devant être extraites pour le champ correspondant. Le nombre maximum de caractères autorisés est de 1 000. Le résultat d’extraction résultant, également appelé Complétion, dispose d’une limite de mots de 700. Il est limité à 700 mots. Cela signifie que vous ne pouvez pas extraire plus de 700 mots à partir d’une seule invite. Si vos besoins d’extraction dépassent cette limite, vous pouvez diviser le document en plusieurs pages, les traiter individuellement, puis fusionner les résultats.
      Astuce :

      Pour connaître les bonnes pratiques relatives à l’utilisation des invites génératives, consultez la page Extracteur génératif - Bonnes pratiques .

  • Version : utilisez cette propriété lorsque vous utilisez un projet moderne Document Understanding existant. Sélectionnez le nom de la version ou la balise qui correspond à la version de projet à partir de laquelle vous souhaitez traiter les données. Par exemple, si vous choisissez la balise Production affectée à la version 3, l’activité traitera les données de la version 3 de votre projet dans l’environnement de production. Vous pouvez également choisir une version spécifique dans la liste déroulante si vous ne souhaitez pas utiliser les balises d'organisation et de production. Pour plus d'informations sur les versions, consultez la section Publication de modèles.

  • Type de document : lorsque vous choisissez une balise dans le champ Version, l’activité sélectionne automatiquement le premier type de document déployé dans la version pertinente de votre projet choisi. De plus, l’activité affiche les champs d’extraction liés au type de document que vous avez choisi.

  • Use Solution Resource - Enable this toggle to select an IXP model as a solution resource. This option is available only when your workflow is part of a solution. The selected IXP model is added to the solution, appears in the Resource Explorer in Studio Web, and is packaged and deployed together with the rest of the solution's resources.

    • IXP Model - Select the IXP model that you want to use for data extraction. This field appears only when you enable the Use Solution Resource toggle.

Panneau propriétés

Entrée
  • Délai d’attente (secondes) : le délai d’exécution maximal (en secondes) pour l’appel du modèle génératif. Si l’opération dépasse ce délai, elle est automatiquement arrêtée pour éviter les retards ou les blocages. Cette propriété s’affiche uniquement si l’ extracteur génératif est sélectionné comme extracteur.
  • Validation automatique : utilisez cette option pour activer la validation automatique, une fonctionnalité qui permet de valider les résultats obtenus pour l'extraction de données par rapport à un modèle génératif. La valeur par défaut du champ Validation automatique est False.
    • Seuil de confiance : ce champ devient visible une fois que vous avez activé la validation automatique. Les résultats d’extraction inférieurs au seuil sont comparés au modèle d’extraction générative. S’ils correspondent, le système ajuste la confiance d’extraction pour atteindre la valeur seuil. Les valeurs de seuil possibles sont comprises entre 0 et 100. Si la valeur est définie sur 0, aucune validation n'est appliquée. Cependant, si vous définissez une valeur spécifique (de 0 à 100), le système vérifie tous les résultats d'extraction inférieurs à cette valeur. Par exemple, si vous définissez un seuil de confiance de 80 %, le système appliquera la validation générative pour les champs avec un niveau de confiance inférieur à 80 %.
      Remarque :

      La validation automatique est disponible uniquement pour les modèles d’extraction spécialisés.

  • Generate Data Type - If set to True, indicates that the output should be generated based on the selected extractor, resulting in an IDocumentData<ExtractorType> object. Alternatively, if set to False, indicates that the data generation should be skipped, resulting in a generic IDocumentData<DictionaryData> object. When set to False, you can consume the results either through the Get/Set methods or through the strongly-typed ExtractionResultHandler navigator, available on the output as DocumentData.Data.Handler. Visit Document Data for additional details and limitations available for the two object types.
Sortie
  • Document Data - All the extracted field data from the file. Information can also be received from Classify Document. To learn how Document Data works and how to consume the extracted results for single and multi-value fields, visit Document data. When Generate Data Type is off, the DictionaryData output can also be navigated and edited with the strongly-typed ExtractionResultHandler navigator, via DocumentData.Data.Handler.

    Lorsque vous utilisez des projets de documents non structurés IXP Extraction et traitement intelligents avec l’activité Extraire les données du document , l’objet de sortie Données du document prend en charge les éléments suivants:

    • Les résultats sont rapportés sous forme de groupes de champs au lieu de tables.
    • Les champs renvoient les types de champs spécifiques définis dans le projet, y compris Quantité monétaire.
    • Les tâches de validation de document affichent les résultats sous forme de groupes de champs au lieu de tables.

    Toute logique de traitement en aval ou de manipulation de données qui repose sur cette sortie doit tenir compte des valeurs du groupe de champs . Pour obtenir la liste complète des types de champs pris en charge, consultez Énumération FieldType.

Connexion externe
  • Ressource d’informations d’identification : le chemin de la ressource des informations d’identification Orchestrator utilisé pour s’authentifier auprès du locataire Document Understanding. L'entrée doit utiliser le format <orchestratorFolder>/<assetName>.
  • URL du locataire - URL du locataire utilisée pour s'authentifier auprès du service Document Understanding. L'entrée doit utiliser le format https://<base_url>/<organization>/<tenant>.
Remarque :

Vous devez configurer la ressource d'informations d'identification avec Étendue d'accès → Automatisations et API. L’authentification vers un locataire ou une organisation différent(e) ne fonctionne que dans les environnements qui prennent en charge cette configuration de ressource d’informations d’identification.

Modèles pris en charge

Les extracteurs génératifs disponibles sous le projet Génératif prédéfini peuvent être utilisés pour les documents décrits dans le tableau suivant :

Remarque :

Les extracteurs Long Document Complex Layout et Short Document Complex Layout ne sont pas disponibles actuellement dans Automation CloudTM pour les environnements du secteur public (FedRamp).

Tableau 1. Scénarios pris en charge pour les extracteurs génératifs

ExtracteurScénario recommandéFournisseurDisponibilité régionalePrise en charge multimodale1
Extracteur de mise en page simple de document longRecommandée pour les documents longs contenant principalement du texte et des titres. Par exemple, utilisez l’extracteur de mise en page simple pour documents longs sur des documents tels que des contrats de bail, des accords-cadres ou d’autres documents similaires.Azure OpenAIAustralie, Union européenne, Inde, Japon, Singapour, Royaume-Uni, États-Unis, Canada
Extracteur de mise en page complexe de documents longs (aperçu)Recommandé pour les documents longs avec une mise en page complexe, tels que les images, le texte manuscrit, les éléments de formulaire ou les mises en page distinctives telles que les encadrés flottants. Vous pouvez utiliser cet extracteur sur des documents volumineux tels que les polices d’assurance, qui possèdent généralement une mise en page complexe.Azure OpenAIÉtats-Unis, Union européenne, Japon, Singapour
Extracteur de mise en page complexe de documents courts (aperçu)Recommandé pour les documents plus courts (20 pages maximum) contenant des images, du texte manuscrit, des éléments de formulaire ou des mises en page complexes, telles que les encadrés flottants. Utiliser cet extracteur sur des documents tels que des pièces d’identité officielles ou des formulaires médicaux dont les mises en page sont généralement plus courtes, mais plus complexes.Azure OpenAIÉtats-Unis, Union européenne, Japon, Singapour

1 La prise en charge multimodale fait référence à la capacité d’extraire différents types d’entrées de données, tels que du texte, des images, du texte manuscrit, etc.

Utilisation de l'extracteur génératif

Pour commencer rapidement à utiliser les fonctionnalités génératives de l’activité Extraire les données du document (Extract Document Data), procédez aux étapes suivantes :

  1. Ajoutez une activité Extraire les données du document .
  2. Dans la liste déroulante Projet, sélectionnez Génératif Prédéfini.
  3. Pour le champ Extracteur, sélectionnez l’un des extracteurs suivants : Extracteur de mise en page simple de document long, Extracteur de mise en page complexe de document long ou Extracteur de mise en page complexe de document court. La propriété Détails du type de document s’affiche dans le corps de l’activité.
  4. Pour Dictionnaire, indiquez vos instructions sous la forme de paires clé-valeur de dictionnaire, où :
    • Nom de champ représente le nom du champ que vous souhaitez extraire du document. Par exemple, email address.

    • Instruction représente l’instruction sur les informations que vous souhaitez donner à l’extracteur pour l’extraction du champ. Il s’agit de la description utilisée par l’extracteur génératif pour identifier la valeur correspondante. Par exemple, consultez la table suivante pour un exemple de paires clé-valeur :

      Tableau 2. Exemples de paires clé-valeur pour l’invite de l’extracteur génératif

      Nom du champInstruction
      Nom« Quel est le nom du candidat ? »
      Exécution actuelle« Quelle est la tâche actuelle du candidat ? »
      Employeur« Quel est l'employeur actuel du candidat ? »

      Graphique 1. Détails des paires clé-valeur pour l’extracteur génératif

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour