- Démarrage
- Composants de l'infrastructure
- Vue d’ensemble de classification de document
- Assistant de configuration des classifieurs de l'activité Classer l'étendue du document (Classify Document Scope)
- Keyword Based Classifier
- Intelligent Keyword Classifier
- FlexiCapture Classifier
- Machine Learning Classifier
- Activités liées à la classification des documents
- Vue d’ensemble de l'entraînement de la classification des documents
- Assistant de configuration des classifieurs (Configure Classifiers Wizard) de l'activité Tester l'étendue des classifieurs (Train Classifier Scope)
- Machine Learning Classifier Trainer
- Activités liées à l'entraînement de la classification des documents
- Vue d’ensemble de l’extraction des données
- Assistant de configuration des extracteurs (Configure Extractors Wizard) de l'activité Étendue de l'extraction de données (Data Extraction Scope)
- Regex Based Extractor
- Form Extractor
- Extracteur de formulaires intelligents
- Extracteur d'apprentissage automatique
- FlexiCapture Extractor
- Activités liées à l'extraction de données
- Paquets ML
- Pipelines
- Data Manager
- Services OCR
- Document Understanding déployé dans Automation Suite
- Document Understanding déployé dans une version AI Center autonome
- Apprentissage profond
- Licences
- Référence (Reference)
- UiPath.Abbyy.Activities
- UiPath.AbbyyEmbedded.Activities
- UiPath.DocumentUnderstanding.ML.Activities
- UiPath.DocumentUnderstanding.OCR.LocalServer.Activities
- UiPath.IntelligentOCR.Activities
- UiPath.OCR.Activities
- UiPath.OCR.Contracts
- UiPath.DocumentProcessing.Contracts
- UiPath.OmniPage.Activities
- UiPath.PDF.Activities
Cases à cocher
Dans le contexte d'un modèle d'extraction ML, une case à cocher n'est pas une valeur réelle, mais un moyen de sélectionner un certain morceau de texte.
Pour cette raison, le mot situé à côté devient le point de focalisation, pas la case à cocher. Et c'est précisément le but de la case à cocher ; d'agir comme un point d'ancrage pour un mot spécifique.
Par conséquent, pour entraîner un modèle ML, vous devez labelliser le mot, pas la case à cocher.
Dans certains cas, la case à cocher n'est pas détectée. Par exemple, l'OCR pourrait le lire comme un X, ou peut-être qu'il s'agit simplement d'une marque manuscrite qui n'est pas du tout captée. Le modèle ML peut apprendre et associer toutes ces situations avec le mot à côté de la marque.
Ainsi, il est plus efficace d'entraîner un modèle à reconnaître un mot, quelle que soit la manière dont il est sélectionné : avec une case à cocher, avec un X, ou avec une marque manuscrite (cerclée, soulignée, etc.).
Cases à cocher à option unique
Pour l’exemple ci-dessus, vous pouvez créer deux champs dans le Gestionnaire de données comme suit :
- condition-employment (labelliser le mot OUI) ;
- condition-auto-accident (labelliser le mot OUI) ;
The ML model learns to recognize those words whether they are marked by checkboxes, X’s, or just circled in pen. To do so, you could use UiPath Document OCR which can recognize even checkboxes.
Cases à cocher sans libellé
Dans certains cas, aucun libellé n'est associé à une case à cocher. Par exemple, lorsque les cases à cocher font partie des tableaux.
Voici un exemple typique :
Dans ce cas, il est nécessaire de labelliser les cases. L'extracteur renverra la valeur de string de la case à cocher qui est l'un de ces deux caractères :
- ☒
- ☐
These two characters can be copied and pasted like any other and can be used in workflows to verify if a checkbox was returned as checked or unchecked. Moreover, the IntelligentOCR framework knows how to recognize these, especially if a field is defined as Boolean:
- si l'extracteur renvoie ☒, cela correspond à OUI ;
- si l'extracteur renvoie ☐, cela correspond à NON.
In cases where an unchecked box is returned as O or D, or when a checked box is returned as X,V,K or R, these can also be included in the RPA workflow logic to make the workflow more robust when these kinds of OCR errors occur.
Détection de signatures
Les signatures sont des caractéristiques visuelles qui ne sont détectées par aucun moteur OCR, de sorte qu'un modèle ML ne peut pas les détecter directement.
Cependant, les modèles UiPath ML apprennent en regardant à la fois les mots et les pixels sur l'image. Il est possible de faire une détection de signature en utilisant cette méthode.
Prenons comme exemple le formulaire ci-dessous.
At the end of the page, next to the signature, there is the text Signature of U.S. person. It does not matter what the text is, as long as it is close enough to the signature (whenever the signature exists). Dealing with a signature is similar to dealing with a checkbox - see the Checkboxes section above.
Vous pouvez créer un champ de texte appelé signature et lorsque le document a une signature, labellisez les mots Signature of US person comme champ de signature. Lorsque le document n'a pas de signature, vous laissez le champ vide.
Ensuite, vous devez vous assurer que votre ensemble d'entraînement dispose d'environ la moitié des documents avec une signature et de l'autre moitié sans. Cela peut être 60/40 % aussi, mais pas 80/20 % ou 90/10 %. De plus, vous devez avoir au moins 20 à 30 échantillons de chaque pour que le modèle puisse apprendre cela.
De cette façon, vous pouvez utiliser le modèle ML pour effectuer une détection de signature.