- Démarrage
- Composants de l'infrastructure
- Vue d’ensemble de l’extraction des données
- Assistant de configuration des extracteurs (Configure Extractors Wizard) de l'activité Étendue de l'extraction de données (Data Extraction Scope)
- Regex Based Extractor
- Form Extractor
- Extracteur de formulaires intelligents
- Extracteur d'apprentissage automatique
- FlexiCapture Extractor
- Activités liées à l'extraction de données
- Document Understanding dans AI Center
- Pipelines
- Paquets ML
- Data Manager
- Services OCR
- Licences
- Référence (Reference)
Guide de l'utilisateur de Document Understanding
Keyword Based Classifier
Le classifieur basé sur des mots-clés est un classifieur simple qui recherche des séquences de chaînes répétitives dans un fichier donné afin d'effectuer une classification de documents.
L'algorithme est construit autour du concept de titres de documents et part du principe que l'apparence des titres des types de documents qui en comportent varie relativement peu dans les documents.
Lors de la classification d'un fichier dans un type de document, le classifieur basé sur des mots-clés (Keyword Based Classifier) :
- trouve la meilleure chaîne ou collection de chaînes correspondante à partir de ses données d'apprentissage, qui s'applique à un type de document de taxonomie. La confiance est calculée sur la base :
- du degré de correspondance au début du document,
- du nombre de fois que la correspondance a été confirmée par les travailleurs de la connaissance et confortée dans les données d'apprentissage.
- des rapports sur le type de document ayant obtenu le score le plus élevé, avec la configuration correspondante sous-jacente.
Le classifieur basé sur des mots-clés (Keyword Based Classifier) peut fonctionner avec une seule entrée de chaîne (une chaîne considérée comme une entrée dans les données d'apprentissage utilisée par le classifieur) ou avec une entrée contenant plusieurs chaînes (deux chaînes ou plus qui forment une seule entrée). En cas de chaîne multiple, le classifieur applique l'algorithme de correspondance sur chaque chaîne, puis calcule une moyenne simple des confiances des correspondances identifiées.
Prenons l'exemple ci-dessous :
- si une entrée contient une seule chaîne, par exemple, "this is my match", le classifieur basé sur les mots-clés recherche et évalue cette chaîne comme une correspondance potentielle de type de document (selon le type de document auquel la chaîne est attribuée).
- si une entrée contient trois chaînes, par exemple, ["this is a match", "needs more evidence for filtering", "yet another one"], le classifieur basé sur les mots-clés recherche et évalue chacune des trois chaînes, puis calcule une moyenne simple des confiances correspondantes à des fins de rapport.
Nous vous conseillons d'utiliser ce classifieur si :
- vos fichiers contiennent chacun un seul et unique type de document (aucun fractionnement de fichier n'est donc nécessaire) ;
- vos dossiers contiennent des preuves liées au type de document dans les trois premières pages du dossier.
Aucune exigence particulière pour utiliser le classifieur basé sur les mots-clés (Keyword Based Classifier).
Vous pouvez configurer le classifieur basé sur les mots-clés (Keyword Based Classifier) au moment de la conception en accédant simplement à l'assistant Gérer l'apprentissage (Manage Learning) de l'activité. Le même assistant peut servir à réviser les données collectées pendant la phase d'entraînement de la classification des documents en ouvrant le même assistant avec un chemin de fichier d'apprentissage mis à jour.
Cet assistant permet de configurer et de gérer les mots-clés utilisés par cette activité pour identifier le type de document. Il a été créé pour répondre au besoin de modifier un chemin de fichier. Si un paramètre Learning Data avec une variable est utilisé à la place, il vous est demandé si vous souhaitez modifier un chemin de fichier spécifique ou abandonner cette opération.
L'assistant contient autant de catégories de types de documents que vous avez définies dans votre taxonomie. Vous pouvez ajouter un ou plusieurs mots clés pour chaque type de document. L'activité apprend les mots-clés d'un document spécifique et est capable plus tard d'identifier et de classer le document dans une catégorie spécifique en fonction de ces règles.
""
(guillemets), et vous pouvez ajouter une ou plusieurs valeurs.
- Cliquer sur le bouton Ajouter un nouvel ensemble de mots-clés (Add new keyword set) ajoute un champ supplémentaire à cette catégorie.
- Cliquer sur le bouton supprime le champ et ses mots clés.
-
Cliquez sur le bouton Enregistrer (Save) pour enregistrer la configuration de votre assistant. Vous pouvez trouver toutes les valeurs ajoutées dans le fichier
.json
du projet.Remarque : les guillemets doubles entrés pour définir un mot-clé dans l'assistant Gérer les mots-clés (Manage Keywords) sont toujours échappés, conformément à la convention Visual Basic (guillemets doubles), même dans un projet C#.
Placez l'activité Outil d'entraînement de classifieur basé sur mot-clé (Keyword Based Classifier Trainer) dans une activité Tester l'étendue des classifieurs (Train Classifiers Scope) et configurez-la en conséquence.
Pour en savoir plus, consultez la section Entraînement de la classification de documents (Document Classification Traning).