- Vue d'ensemble (Overview)
- Document Processing Contracts
- Notes de publication
- À propos des contrats de traitement de documents
- Classe Zone
- Interface ActivitéIPersisted
- Classe PrettyBoxConverter
- Interface ActivitéIClassifier
- Interface FournisseurIClassifieurCapacités
- Classe TypeDocumentClassifieur
- Classe RésultatClassifieur
- Classe ActivitéCodeClassifieur
- Classe ActivitéClassifieurNatif
- Classe ActivitéClassifieurCodeAsync
- Classe CapacitéClassifieurTypeDocument
- Classe ActivitéExtracteurCodeAsync
- Classe ActivitéExtracteurCode
- Classe ExtracteurTypeDocument
- Classe ExtracteurDocumentTypeCapacités
- Classe ExtracteurChampCapacités
- Classe ActivitéExtracteurNatif
- Classe ExtracteurRésultat
- Interface FournisseurICapabilities
- Interface ActivitéIExtractor
- Classe ChargeUtileExtracteur
- Énumération PrioritéActionDocument
- Classe DocumentActionData
- Énumération StatutActionDocument
- Énumération TypeActionDocument
- Classe DocumentClassificationActionData
- Classe DocumentValidationActionData
- Classe DonnéesUtilisateur
- Classe Documents
- Classe RésultatDivisionDocument
- Classe ExtensionDom
- Classe Page
- Classe SectionPage
- Classe Polygone
- Classe ConvertisseurPolygones
- Classe de métadonnées
- Classe GroupeMot
- Classe Mot
- Énumération SourceTraitement
- Classe CelluleRésultatsTable
- Classe ValeurTableRésultats
- Classe InformationsColonnesTableRésultats
- Classe TableRésultats
- Énumération Rotation
- Énumération TypeSection
- Énumération TypeGroupeMot
- ProjectionTexteIDocument Interface
- Classe RésultatClassification
- Classe RésultatExtraction
- Classe ResultatsDocument
- Classe ResultatsLimitesDocument
- Classe ResultatsDonnéesPoint
- Classe RésultatsValeur
- Classe ResultatsContenuRéference
- Classe ResultatsValeurJetons
- Classe ResultatsChampDérivé
- Énumération ResultatsSourceDonnées
- Classe ResultatsConstantes
- Classe ChampValeurSimple
- Classe ValeurChampTable
- Classe GroupeDocument
- Classe DocumentTaxonomie
- Classe TypeDocument
- Classe Champ
- Énumération TypeChamp
- Classe InfoLangage
- Classe SaisieMétadonnées
- Énumération TypeTexte
- Classe TypeFieldTypeField Class
- Interface ActivitéISuivi
- ITrainableActivity Interface
- Interface ActivitéClassifieurITrainable
- Interface ActivitéExtracteurITrainable
- Classe ActivitéFormationClassifieurCodeAsync
- Classe ActivitéFormationClassifieurCode
- Classe ActivitéFormationClassifieurNatif
- Classe ActivitéFormationExtracteurCodeAsync
- Classe ActivitéFormationExtracteurCode
- Classe ActivitéFormationExtracteurNative
- Numériseur de Document Understanding
- Document Understanding ML
- Serveur local OCR Document Understanding
- Document Understanding
- Notes de publication
- À propos du package d’activités Document Understanding
- Compatibilité du projet
- Définir le mot de passe du PDF
- Merge PDFs
- Get PDF Page Count
- Extraire le texte PDF (Extract PDF Text)
- Extract PDF Images
- Extract PDF Page Range
- Extraire les données du document
- Create Validation Task and Wait
- Attendre la tâche de validation et reprendre
- Create Validation Task
- Classer un document (Classify Document)
- Créer une tâche de validation de classification (Create Classification Validation Task)
- Créer une tâche de validation de classification et attendre (Create Classification Validation Task and Wait)
- Attendre la tâche de validation de la classification et reprendre
- IntelligentOCR
- Notes de publication
- À propos du package d'activités IntelligentOCR
- Compatibilité du projet
- Configuration de l'authentification
- Load Taxonomy
- Digitize Document
- Classify Document Scope
- Keyword Based Classifier
- Classifieur de projet Document Understanding (Document Understanding Project Classifier)
- Intelligent Keyword Classifier
- Create Document Classification Action
- Attendre l'action de classification du document et reprendre
- Tester l'étendue des classifieurs
- Outil d'entraînement de classifieur basé sur des mots-clés
- Intelligent Keyword Classifier Trainer
- Data Extraction Scope
- Extracteur de projet Document Understanding (Document Understanding Project Extractor)
- Regex Based Extractor
- Form Extractor
- Extracteur de formulaires intelligents
- Present Validation Station
- Create Document Validation Action
- Wait For Document Validation Action And Resume
- Tester l'étendue des extracteurs
- Export Extraction Results
- Services ML
- OCR
- Contrats OCR
- Notes de publication
- À propos des contrats OCR
- Compatibilité du projet
- Interface ActivitéIOCR
- Classe OCRCodeAsync
- Classe ActivitéCodeOCR
- Classe ActivitéOCRNatif
- Classe Caractère
- Classe RésultatOCR
- Classe Mot
- Énumération StylesPolice
- Énumération RotationOCR
- Classe OCRCapabilities
- Classe BaseCaptureOCR
- Classe UsineCaptureOCR
- Classe BaseContrôleCapture
- Énumération UtilisationCaptureMoteur
- ScrapeEngineBase
- Classe ScrapeEngineFactory
- Classe ScrapeEngineProvider
- OmniPage
- PDF
- [Non listé] Abbyy
- Notes de publication
- À propos du package d'activités Abbyy
- Compatibilité du projet
- Reconnaissance optique des caractères ABBYY (ABBYY OCR)
- Reconnaissance optique des caractères ABBYY Cloud (ABBYY Cloud OCR)
- FlexiCapture Classifier
- FlexiCapture Extractor
- FlexiCapture Scope
- Classer un document (Classify Document)
- Traiter le document (Process Document)
- Valider le document (Validate Document)
- Exporter le document (Export Document)
- Obtenir le champ (Get Field)
- Obtenir la table (Get Table)
- Prepare Validation Station Data
- [Non listé] Abbyy intégré
Digitize Document
UiPath.IntelligentOCR.Activities.Digitization.DigitizeDocument
Numérise un document, en extrayant son DOM (Document Object Model) et texte et les stocke dans leurs types de variables correspondants.
Panneau propriétés
Commun
- NomAffichage (DisplayName) - Nom affiché de l'activité.
Entrée
- AppliquerOCRAuxPDF - Détermine si le processus OCR doit être appliqué ou non aux documents PDF. S'il est défini sur Oui(Yes), l'OCR est appliqué à toutes les pages PDF du document. S'il est défini sur Non, seul le texte saisi numériquement est extrait. La valeur par défaut est Auto, déterminant si le document nécessite l'application de l'algorithme OCR en fonction du document d'entrée.
- DegréDeParallélisme : spécifie, le cas échéant, combien de pages doivent être analysées en parallèle. La valeur
-1
utilise le « Nombre de cœurs sur la machine - 1 ». Cela signifie que l’activité va essayer de traiter en parallèle autant de pages que de nombre de cœurs - 1 valeur, tout en spécifiant une valeur positive utilisant ce nombre de processeurs logiques. Par défaut, cette propriété est configurée sur-1
.Cette propriété accepte toute valeur non supérieure àLogicalProcessorCount - 1
. - DétecterCasesCocher : détecte les cases à cocher disponibles dans le document lors de sa numérisation. La valeur par défaut est Vrai.
- CheminDocument : le chemin d’accès du document à numériser. Ce champ prend uniquement en charge les chaînes et les variables
String
.Remarque :- En cas d’échec de la classification d’un document contenant suffisamment de données, dans l’activité Numériser le document (Digitize Document), définissez la propriété AppliquerOCRAuxPDF sur Oui.
- L’extraction de texte à partir de fichiers PDF a bénéficié d’une mise à niveau. Le processus d’extraction a ainsi été optimisé, permettant de récupérer simultanément le texte natif et le texte numérisé. Le processus applique l’OCR uniquement aux images identifiées dans le fichier PDF. Cette amélioration est disponible uniquement lorsque l’option AppliquerOCRAuxPDF est définie sur Auto.
Remarque : les types de fichiers pris en charge pour ce champ de propriété sont les suivants :.png
,.jpe
,.jpg
,.jpeg
,.tiff
,.tif
et.pdf
.
Divers
- Privé (Private) - Si cette option est sélectionnée, les valeurs des variables et des arguments ne sont plus enregistrées au niveau Détaillé (Verbose).
Sortie
- DocumentObjectModel : le modèle objet de document (DOM) du fichier, stocké dans une variable
Document
. Ce champ ne prend en charge queDocument
variables. - TexteDocument : le texte extrait du document spécifié. Vous pouvez utiliser par la suite cette variable dans l’activité Présenter la station de validation (Present Validation Station). Ce champ ne prend en charge que les variables
String
.Note: Starting with UiPath.IntelligentOCR.Activities package v6.3.0-preview, the Digitize Document activity comes with a default preselected OCR engine, the UiPath® Document OCR engine.
Les deux variables de sortie, associées dans la mesure où elles sont dépendantes, peuvent être utilisées ultérieurement dans le traitement de document sur l’ensemble de l’infrastructure de traitement de document (classification, extraction de données, validation humaine, etc.).
Si le package UiPath.IntelligentOCR.Activities a été mis à jour vers la version v5.1.0, alors le paramètre ForcerApplicationOCR a été remplacé par AppliquerOCRAuxPDF. Voici la compatibilité entre les anciens et les nouveaux paramètres :
- ForcerApplicationOCR = Vrai est remplacé par AppliquerOCRAuxPDF = Oui ;
- ForcerApplicationOCR = Faux est remplacé par AppliquerOCRAuxPDF = Auto ;
- ForcerApplicationOCR = un champ vide est remplacé par AppliquerOCRAuxPDF = Auto ;
- ForcerApplicationOCR = votre variable définie est remplacée par AppliquerOCRAuxPDF = Auto.
Le modèle d’objet document est capturé dans un objet propriétaire. Consultez la section Classe Documents pour plus d’informations.
- Pour qu’une image soit numérisée/traitée avec succès, ses dimensions en largeur et en hauteur doivent être comprises entre 50 et 10 000 pixels. Toute image inférieure ou supérieure à cette plage sera rejetée, avec un message d’exception. Une image validée avec les dimensions mentionnées précédemment et avec une taille totale supérieure à 14 MP sera réduite à 14 MP, tout en conservant le même aspect (rapport largeur ou hauteur).
- Les meilleurs résultats sont obtenus en maintenant l’angle d’inclinaison à +/- 20 degrés.
Consultez la page Valider manuellement des documents numérisés pour découvrir comment l’activité Numériser le document (Digitize Document) est utilisée dans un exemple qui intègre plusieurs activités.