UiPath Documentation
document-understanding
2024.10
false
Important :
La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.
UiPath logo, featuring letters U and I in white

Document Understanding user guide

Dernière mise à jour 6 avr. 2026

Présentation de la numérisation

Ce qu'est la numérisation

Digitization is the process of obtaining machine readable text from a given incoming file, so that a robot can then understand its contents and act upon them. It is the first step applied on files that need to be processed through the Document UnderstandingTM framework.

L'étape de numérisation a deux sorties :

  • le texte du fichier traité, stocké dans une variable chaîne, et
  • le modèle d'objet document de ce fichier – objet JSON contenant des informations de base telles que le nom, le type de contenu, la longueur du texte, le nombre de pages ainsi que des informations détaillées telles que la rotation des pages, la langue détectée, le contenu et les coordonnées de chaque mot identifié dans le fichier.

In the Document Processing Framework, digitization is performed using the Digitize Document activity.

Ce que la numérisation n'est pas

Bien que liée, l'étape de numérisation se distingue de l'OCR.

Dans de nombreux cas, les fichiers à traiter sont des fichiers PDF natifs (non numérisés) qui peuvent être lus par programmation par le robot sans appliquer l'OCR.

Quand l'OCR est utilisée dans la numérisation

The Digitize Document activity requires, as part of its configuration, the selection of an OCR engine - so that, at need, it can be used, but only executes OCR on:

  • les fichiers images
    • les formats d'images pris en charge sont .png, .jpe, .jpg, .jpeg, .tiff, .tif, .bmp
    • pour les fichiers TIFF multipages, l'OCR est appliqué pour chaque page
  • pages PDF qui
    • ne présentent aucun contenu lisible par machine
    • contiennent des images qui couvrent une zone significative de la page.
Remarque :

The following digitization limitations apply:

  • La limite de taille de fichier est de 160 Mo.
  • Il y a un maximum de 500 pages par limite de document.

OCR is also applied, always, if the Digitize Document activity is configured with the ForceApplyOCR flag set to True. This option is usually recommended for use cases in which a significant percentage of files seem to contain native content, but the natively read content does not correspond to what a user can observe in those files.

Comment choisir votre moteur OCR

As each use case has its own particularities, it is strongly recommended to test all available OCR Engines with different settings, in order to determine which one works best for your project. Another recommendation is to pay particular attention to the OCR engine arguments, such as Profile, Scale, Language etc. (may vary from one engine to another), so that you identify the best settings for each use case.

  • Ce qu'est la numérisation
  • Ce que la numérisation n'est pas
  • Quand l'OCR est utilisée dans la numérisation
  • Comment choisir votre moteur OCR

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour