UiPath Documentation
document-understanding
2023.4
false
Guide de l'utilisateur de Document Understanding
Important :
La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.

Cases à cocher et signatures

Cases à cocher​

Il existe plusieurs types de champs à choix multiples qui utilisent des cases à cocher :

  • les cases à cocher mutuellement exclusives
  • les cases à cocher non mutuellement exclusives, où vous pouvez sélectionner plusieurs options.

Un autre aspect important est le nombre de choix disponibles pour un champ à choix multiples donné. Dans certains cas, il peut y avoir une seule option, où la case est cochée ou non, tandis que dans d’autres cas, il peut y avoir 10 options, 20 options ou plus, disposées dans une grille ou un tableau, comme sur de nombreux formulaires de santé.

Il existe deux manières principales de labelliser ces types de champs à choix multiples.

Label the options​

Let's take an example to understand how you can label the options. Forms can include the options Project or Policy. In this case, you only have one field, and you only label the selected word, i.e. label the word Project if the checkbox next to it is checked or the word Policy if the checkbox next to it is checked. If neither is checked then you label neither, and both being checked is not possible, and such documents would just be deleted from the training set.

Cette approche présente l’avantage de n’avoir qu’un seul champ, ce qui nécessite moins de données. Il présente également l’avantage de ne pas reposer sur une détection réussie des cases à cocher. Si une case à cocher est détectée comme une lettre X, le modèle peut toujours apprendre à reconnaître que cela signifie que l’option à côté est sélectionnée.

The disadvantage is that you need to make sure both options are roughly equally represented, which is not always the case. Potentially, in your training set, 90% of the documents might have Project checked. In this case, the model cannot perform well and this approach fails. The problem gets worse when you have more options because some of them are almost always rare. In these cases you may need to create fake documents with the rare options checked to balance things out.

Label the checkboxes, with separate field for each checkbox​

In the previous example, you may have one field called Project where you always label the checkbox for Project, and one field called policy where you always label the checkbox for Policy, whether they are checked or not. This has the advantage that the balance matters a lot less, even if one of the options is checked 90% of the time, the model still learns to recognize them because the checkboxes are always in the same place.

L’inconvénient est que vous avez deux champs au lieu d’un. Lorsqu’il y a deux options, cela peut ne pas être un gros problème, mais lorsqu’il y a 10 ou 20 options, avoir 10 ou 20 champs au lieu d’un seul rend beaucoup plus difficile la labellisation, et le modèle est plus difficile à entraîner, nécessitant plus d’entraînement de données.

Another downside is that sometimes the checkbox might not be detected correctly and you may need to add more complex logic in the workflow to handle all the X, V or K returned characters. In some cases the OCR might even merge the checkbox with the word next to it, like XProject, requiring an even more complex RPA logic to handle this situation.

Étiqueter les options avec un seul champ à plusieurs valeurs​

Multivalued fields are part of the 2022.10 release of Document UnderstandingTM. This makes it easier to label, it is not affected by unbalanced choices being checked, and it is not affected if there is a large number of options. However it still relies on the accuracy of the checkbox detection or the risk that checkboxes might be merged with the options next to them. OCR errors are very hard to defend against.

Étiqueter les options avec un seul champ à plusieurs valeurs​

Cela facilite également la labellisation, est moins sensible aux erreurs de détection de case à cocher, mais peut être plus sensible aux options déséquilibrées, tout comme la première option.

Détection de signatures​

À partir de la version 2022.4 de LTS Enterprise, les signatures peuvent être détectées à l'aide de l'OCR de document UiPath. Par conséquent, les modèles d'apprentissage automatique peuvent détecter directement les signatures.

Labelliser une signature comme tout autre champ dans votre document. Une fois détecté par l’OCR de document UiPath, le modèle d’apprentissage automatique apprend à reconnaître le champ comme une signature.

Remarque :

Pour une analyse de signature plus approfondie, vous pouvez également utiliser le modèle de comparaison de signatures qui réside dans les paquets ML d’analyse d’image UiPath.

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour