- Vue d'ensemble (Overview)
- Démarrage
- Activités (Activities)
- Tableaux de bord Insights.
- Processus Document Understanding
- Didacticiels de démarrage rapide
- Composants de l'infrastructure
- Vue d'ensemble (Overview)
- Activités Document Understanding
- Vue d’ensemble de classification de document
- Assistant de configuration des classifieurs de l'activité Classer l'étendue du document (Classify Document Scope)
- Intelligent Keyword Classifier
- Keyword Based Classifier
- Machine Learning Classifier
- Classifieur génératif
- Activités liées à la classification des documents
- Assistant de configuration des classifieurs (Configure Classifiers Wizard) de l'activité Tester l'étendue des classifieurs (Train Classifier Scope)
- Vue d’ensemble de l'entraînement de la classification des documents
- Activités liées à l'entraînement de la classification des documents
- Machine Learning Classifier Trainer
- Assistant de configuration des extracteurs (Configure Extractors Wizard) de l'activité Étendue de l'extraction de données (Data Extraction Scope)
- Vue d’ensemble de l’extraction des données
- Activités liées à l'extraction de données
- Form Extractor
- Extracteur de formulaires intelligents
- Extracteur d'apprentissage automatique
- Regex Based Extractor
- Consommation de données
- Appels API
- Paquets ML
- Vue d'ensemble (Overview)
- Paquets ML - Document Understanding
- Classifieur de documents - Paquet ML
- Paquets ML avec capacités OCR
- 1040 - Paquet ML
- Annexe C du formulaire 1040 Planification C - Paquet ML
- 1040 Planification D - Paquet ML
- Annexe E du formulaire 1040 - Paquet ML
- Paquet ML - 1040x
- Paquet ML 3949a
- 4506T - Paquet ML
- Paquet ML 709
- Paquet ML 941x
- Paquet ML 9465
- ACORD131 - Paquet ML
- ACORD140 - Paquet ML
- ACORD25 - Paquet ML
- États financiers - Paquet ML
- Connaissement - Paquet ML
- Paquet ML - Certificat de constitution
- Paquet ML - Certificat d'origine
- Chèques - Paquet ML
- Paquet ML - Certificat de produit pour enfants
- CMS1500 - Paquet ML
- Paquet ML - Déclaration de conformité de l’UE
- États financiers - Paquet ML
- FM1003 - Paquet ML
- I9 - Paquet ML
- Cartes d’identité - Paquet ML
- Factures - Paquet ML
- FacturesAustralie - Paquet ML
- FacturesChine - Paquet ML
- Paquet ML - Factures hébreu
- FacturesInde - Paquet ML
- FacturesJapon - Paquet ML
- Paquet ML - Livraison des factures
- Listes de colisage - Paquet ML
- Fiches de paie - Paquet ML
- Passeports - Paquet ML
- Bons de commande - Paquet ML
- Reçus - Paquet ML
- RemittanceAdvices - Paquet ML
- Formulaire UB04 - Paquet ML
- Factures de services publics - Paquet ML
- Titres de véhicule - Paquet ML
- W2 - Paquet ML
- W9 - Paquet ML
- Autres paquets ML prêts à l’emploi
- Points de terminaison publics
- Limitations du trafic
- Configuration OCR
- Pipelines
- Services OCR
- Langues prises en charge
- Apprentissage profond
- Licences
Guide de l'utilisateur de Document Understanding
Diagnostic du jeu de données
L’entraînement d’un nouveau modèle à partir de zéro peut parfois être une tâche très exigeante.
La fonctionnalité Dataset Diagnostics vous aide à créer des ensembles de données efficaces en fournissant des commentaires et des conseils sur les étapes nécessaires pour obtenir une bonne précision pour le modèle entraîné.
Situé dans la barre de gestion du gestionnaire de documents, Dataset Diagnostics fournit des conseils visuels et écrits tout au long du processus d’apprentissage d’un nouveau modèle.
Il existe trois niveaux d’état de l’ensemble de données affichés dans la barre de gestion :
- Rouge : plus de données d’entraînement libellées requises.
- Orange : plus de données d’entraînement libellées recommandées.
- Vert : le niveau requis de données d’apprentissage labellisées est atteint.
Si aucun champ n’est créé dans la session, le niveau d’état de l’ensemble de données est grisé.
Plus d’informations sur chaque statut sont disponibles dans le menu contextuel Dataset Diagnostics. Cliquez sur le bouton Dataset Diagnostics pour l’ouvrir.
Fournit des informations sur les documents utilisés pour l'entraînement du modèle, le nombre total de pages importées et le nombre total de pages labellisées.
La séparation sur la barre d'état des couleurs est déterminée par le nombre recommandé de pages labellisées nécessaires à l'apprentissage du modèle et par l'état réel de votre ensemble de données, y compris les données labellisées et non labellisées. Le survol de chaque couleur de la barre d’état fournit des informations supplémentaires, dans une info-bulle, sur chaque état.
Les nombres disponibles dans l’onglet Ensemble de données sont calculés en fonction du nombre de champs standard et de champs d’élément de la session d’entraînement.
- Rouge : l’ensemble de données nécessite davantage de données labellisées pour l’apprentissage du modèle.
- Orange : pour un niveau de précision accru sur le modèle entraîné, davantage de données labellisées sont recommandées. Vous pouvez choisir d’aller plus loin avec les données réelles, mais le niveau de précision n’est pas aussi élevé que souhaité.
- Vert : les données labellisées sont suffisantes pour que l’ensemble de données soit entraîné en conséquence et reçoive des informations précises.
Fournit des informations sur chaque champ étiqueté, plus précisément le nombre total de pages d’entraînement sur lesquelles l’étiquette est étiquetée, le nombre total de documents évalués avec le champ étiqueté et son statut pour l’ensemble d’entraînement actuel.
- Champ (Field) : le nom du champ libellé.
- Pages d’entraînement : le nombre de pages de l’ensemble Entraînement+Validation sur lesquelles le champ est libellé.
- Documents d’évaluation (Evaluation Documents) : le nombre de documents de l’ensemble d’évaluation sur lesquels ce champ est libellé.
- Statut (Status) - le statut de chaque champ, marqué par trois options : Rouge, Orange et Vert.
Voici toutes les options disponibles pour la barre de Statut (Status) :
- Rouge : les données sur le champ sont insuffisantes, d’autres libellés étant nécessaires.
- Orange : davantage de pages doivent être labellisées pour que les résultats soient pertinents.
- Vert : le nombre de pages labellisées est suffisant pour que les résultats soient pertinents.
Les boutons Actualiser (Refresh) et Fermer (Close) s’appliquent aux deux onglets, ce qui signifie que si le bouton Actualiser (Refresh) est cliqué dans l’onglet Ensemble de données (Dataset), l’onglet Fichiers (Files) est également actualisé.
- Actualiser (Refresh) : utilisez l’option d’actualisation après que des modifications ont été apportées à l’ensemble de données, que ce soit sur le nombre total de pages ou le nombre de pages labellisées. Le menu contextuel s’actualise automatiquement toutes les quelques minutes et cela s’effectue sur les deux onglets simultanément. Utilisez cette fonction lorsqu’une actualisation est nécessaire en dehors de la fenêtre automatique.
- Fermer (Close) : une fois toutes les informations nécessaires rassemblées, fermez le menu en cliquant sur le bouton Fermer (Close). L’ensemble du menu contextuel est fermé, quel que soit l’onglet à partir duquel le bouton a été cliqué.
Vous pouvez modifier les champs suivants à l'aide du calculateur d'ensemble de données :
- Type de document prêt à l’emploi
- Nombre de langues
- Nombre de mises en page
Les champs suivants de l'onglet Calculatrice (Calculator) sont en lecture seule et leurs valeurs sont déterminées par l'intersection du type de document prêt à l'emploi utilisé et des champs du schéma actuel :
- Champs réguliers prêts à l’emploi
- Champs de colonne prêts à l’emploi
- Champs de classification prêts à l'emploi
La modification de l'un des champs mentionnés a un impact sur la taille recommandée de l'ensemble de données. L'onglet Ensemble de données (Dataset) de la fenêtre contextuelle actuellement ouverte est mis à jour et passe au statut vert/jaune/rouge en fonction de la nouvelle taille recommandée. Une fois les modifications enregistrées, l'indicateur global de Diagnostic de l'ensemble de données (Dataset Diagnosis) prend en compte le nouvel état de santé de l'onglet Ensemble de données (Dataset).
Supposons que, lors de la création initiale du type de document, vous ayez sélectionné Factures (Invoices) dans le champ Type de document prêt à l'emploi (Out-of-the-box document type). Si vous changez votre choix initial pour quelque chose d'autre, les reçus par exemple, alors l'ensemble de données assimile les informations pour les deux types de documents et affiche les informations qui recoupent les deux types (factures et reçus) que vous avez sélectionnés.
Si certains champs ne sont présents que dans l'un des modèles, ils apparaissent dans les champs réguliers personnalisés ou les champs de colonnes personnalisés, car ces modifications s'appliquent aux champs réguliers et aux champs de classification.