- Introduction
- Configuration de votre compte
- Équilibre
- Clusters
- Dérive de concept
- Couverture
- Jeux de données
- Champs généraux
- Libellés (prédictions, niveaux de confiance, hiérarchie des libellés et sentiment des libellés)
- Modèles
- Flux
- Évaluation du modèle
- Projets
- Précision
- Rappel
- Messages annotés et non annotés
- Extraction des champs
- Sources
- Taxonomies
- Apprentissage
- Prédictions positives et négatives vraies et fausses
- Validation
- Messages
- Contrôle et administration de l'accès
- Gérer les sources et les jeux de données
- Comprendre la structure des données et les autorisations
- Créer ou supprimer une source de données dans l'interface graphique
- Préparation des données en vue du téléchargement du fichier .CSV
- Téléchargement d’un fichier CSV dans une source
- Téléchargement d'un fichier PST
- Création d'un ensemble de données
- Sources et jeux de données multilingues
- Activation des sentiments sur un ensemble de données
- Modification des paramètres du jeu de données
- Supprimer un message
- Supprimer un jeu de données
- Exporter un ensemble de données
- Utilisation d'intégrations Exchange
- Balises de transformation d’e-mail
- Entraînement et maintenance du modèle
- Comprendre les libellés, les champs généraux et les métadonnées
- Hiérarchie de libellés et meilleures pratiques
- Comparer les cas d’utilisation des analyses et des automatisations
- Transformer vos objectifs en libellés
- Présentation du processus d'entraînement du modèle
- Annotation générative
- Statut du jeu de données
- Entraînement des modèles et annotation des meilleures pratiques
- Entraînement avec l'analyse des sentiments des libellés activée
- Comprendre les exigences de données
- Entraîner
- Vue d'ensemble (Overview)
- Examen des prédictions de libellé
- Entraînement à l'aide de la classification par glisser-déposer
- Entraînement à l'aide de l'option Enseigner le libellé (Explore)
- Entraînement à l'aide d'une confiance faible
- Entraînement à l'aide de la recherche (Explorer)
- Affiner et réorganiser votre taxonomie
- Introduction à affiner
- Précision et rappel expliqués
- Précision et rappel
- Comment fonctionne la validation
- Comprendre et améliorer les performances du modèle
- Raisons de la faible précision moyenne des libellés
- Entraînement à l'aide du libellé Vérifier (Check label) et du libellé Manqué (Missed Label)
- Entraînement à l'aide du libellé En savoir plus (Affiner)
- Entraînement à l'aide de la recherche (affiner)
- Comprendre et augmenter la couverture
- Amélioration de l'équilibre et utilisation du rééquilibrage
- Quand arrêter l'entraînement de votre modèle
- Utilisation de champs généraux
- Extraction générative
- Vue d'ensemble (Overview)
- Configurer des champs
- Filtrage par type de champ d’extraction
- Génération de vos extractions
- Validation et annotation des extractions générées
- Meilleures pratiques et considérations
- Comprendre la validation des extractions et des performances d'extraction
- Questions fréquemment posées (FAQ)
- Utilisation des analyses et de la surveillance
- Automations et Communications Mining™
- Développeur
- Charger des données
- Téléchargement de données
- Intégration avec l'utilisateur du service Azure
- Intégration avec l'authentification d'application Azure
- Intégration d’Exchange avec l’authentification et le graphique d’application Azure
- Guide de migration : Exchange Web Services (EWS) vers l'API Microsoft Graph
- Récupérer des données pour Tableau avec Python
- Intégration d'Elasticsearch
- Extraction de champ général
- Intégration avec Exchange auto-hébergée
- Infrastructure d’automatisation UiPath®
- Activités officielles UiPath®
- Comment les machines apprennent à comprendre les mots : guide d'intégration dans NLP
- Apprentissage basé sur des invites avec des Transformers
- Efficient Transformers II : Dilarisation des connaissances et affinement
- Transformateurs efficaces I : mécanismes d'attention
- Modélisation de l'intention hiérarchique profonde non supervisée : obtenir de la valeur sans données d'entraînement
- Correction des biais d’annotation avec Communications Mining™
- Apprentissage actif : de meilleurs modèles d'ML en moins de temps
- Tout est dans les chiffres : évaluer les performances du modèle avec des métriques
- Pourquoi la validation du modèle est importante
- Comparaison de Communications Mining™ et de Google AutoML pour l’information sur des données conversationnelles
- Licences
- FAQ et plus encore
Télécharger des e-mails historiques dans Communications Mining à partir d’un fichier PST exporté depuis Exchange, avec les exigences d’exportation, les limitations connues et les résolutions des erreurs de téléchargement.
Un fichier PST est un instantané unique, et non un flux en direct. Utilisez un téléchargement PST pour débloquer l'entraînement du modèle ou pour renvoyer les e-mails historiques pendant la configuration d'une intégration permanente. Pour l’ingestion continue des e-mails, utilisez plutôt l’ intégration Exchange .
Vous téléchargez un fichier PST avec la CLI de Communications Mining™, qui analyse les e-mails dans le fichier et les écrit dans un compartiment. Vous allez ensuite créer une source à partir de ce compartiment et ajouter la source à un ensemble de données.
Quand utiliser un fichier PST
| Utilisez un fichier PST lorsque | N'utilisez pas de fichier PST lorsque |
|---|---|
| Vous devez débloquer l'entraînement du modèle avant qu'une intégration en ligne soit disponible. | Vous passez en production. Configurez plutôt l' intégration avec Microsoft Exchange . |
| Vous avez besoin d'un renvoi historique d'e-mails que l'intégration en production ne peut pas atteindre, par exemple parce que la boîte aux lettres utilise une archive locale. | Vous avez besoin d’une ingestion en temps réel ou d’une ingestion continue. Un fichier PST capture la boîte aux lettres à un moment unique. |
| Votre environnement bloque l'intégration d'Exchange et vous avez rapidement besoin de données dans la plateforme. | Vous avez besoin de fils de conversation complets. Une exportation PST peut omettre les messages d'une conversation. |
Pour un renvoi historique, laissez l’intégration Exchange activée pour les nouveaux e-mails et utilisez le fichier PST uniquement pour les anciennes données. Le fait de maintenir la synchronisation pendant l’exécution fournit à l’apprentissage actif plus de données à utiliser.
Limites connues
Un téléchargement PST n'est pas un moyen fiable pour obtenir des données sur la plate-forme et ne remplace pas une intégration en production. Chaque téléchargement PST perd des données, alors ne vous attendez pas à ce que chaque e-mail du fichier atteigne la plate-forme. Lorsque votre environnement le permet, utilisez plutôt l’intégration Exchange.
Les limitations suivantes s’appliquent:
- Les fichiers PST exportés à partir d'Outlook ne sont pas pris en charge. Une exportation de client Outlook supprime les en-têtes de transport requis par Communications Mining et omet le dossier Éléments envoyés. La CLI peut ne pas réussir à analyser entièrement un tel fichier. Il s'agit de la cause la plus courante de perte de données à grande échelle.
- Les e-mails dont le seul corps est RTF ne sont pas téléchargés. La CLI utilise le corps HTML lorsqu’il est présent et revient au corps en texte brut. Un e-mail n'est déposé que lorsque les deux sont manquants. La plupart des courriers Outlook composés de RTF transportent également une alternative en texte brut et des téléchargements sans problème. Il n’existe aucun moyen de détecter les e-mails contenant uniquement des RTF dans un fichier PST avant d’exécuter le téléchargement.
- Le contenu de la pièce jointe n’est pas téléchargé. Seules les métadonnées de la pièce jointe sont téléchargées: nom, taille et type de contenu. Le type de contenu est déduit de l'extension de fichier plutôt que lu à partir du fichier PST. Les pièces jointes qui sont elles-mêmes des e-mails sont ignorées, de sorte qu’un e-mail dont la seule pièce jointe est un message transféré ne rapporte aucune pièce jointe.
- Une perte de données est attendue. En règle générale, budgétisez environ 1 % d'e-mails échouent. Les résultats réels varient dans les deux sens, exécutez donc d'abord le téléchargement avec
--dry-runet vérifiez les compteursemails failed to parseetfailed to uploadque la CLI imprime à la fin de chaque exécution. - Les éléments qui ne sont pas des e-mails sont comptabilisés comme des échecs. La CLI parcourt chaque dossier dans le fichier PST et exige que chaque élément ait à la fois un en-tête
Message-IDetDate. Les brouillons, les éléments de calendrier, les contacts et les tâches ne possèdent aucun des deux, ils sont donc signalés comme des échecs d’analyse. Un nombre d’échecs non nul est attendu. - Les fils de discussion peuvent être incomplets. Un fichier PST ne contient pas nécessairement chaque message d'une conversation.
- Les jeux de caractères autres qu'UTF-8 peuvent être codés. Les e-mails japonais et chinois sont les plus concernés. Le comportement dépend du type de corps:
- Les corps de texte brut sont convertis à l'aide de la page de code du message. Si la conversion échoue, l'e-mail est déposé et comptabilisé comme un échec d'analyse, qui
--dry-runsignale. - Les corps HTML sont renforcées en UTF-8, de sorte que les octets qui ne peuvent pas être décodés deviennent des caractères de remplacement. Aucune erreur n'est générée, aucun compteur n'est incrémenté et
--dry-runne la signale pas. Examinez un exemple d’e-mails HTML dans la plate-forme après le téléchargement.
- Les corps de texte brut sont convertis à l'aide de la page de code du message. Si la conversion échoue, l'e-mail est déposé et comptabilisé comme un échec d'analyse, qui
Pour remplir une boîte aux lettres avant de l'exporter, déplacez, copiez ou redirigez les e-mails, par exemple en les faisant glisser entre les boîtes aux lettres dans Outlook. Ne les transmettez pas. Un message transféré arrive avec la conversation précédente grattée du corps, ce qui ne laisse que des en-têtes et des adresses et n'est pas utile pour l'entraînement.
Exportation du fichier PST
Exportez le fichier PST depuis Exchange, et non depuis Outlook. Un fichier PST exporté à partir du client Outlook, via Fichier > Ouvrir et exporter > Importer/Exporter, omet le dossier Éléments envoyés et les autres dossiers, et peut produire un fichier que la CLI ne peut pas analyser.
Pour obtenir un aperçu des routages d’exportation pris en charge, consultez la section Procédures d’exportation de la boîte aux lettres.
Microsoft 365 et Exchange Online
Utilisez Microsoft Purchase eDiscovery pour les boîtes aux lettres cloud. Pour de plus amples informations, consultez la section Exporter les résultats de recherche dans eDiscovery.
Prérequis :
- L'administrateur exécutant l'exportation dispose du rôle eDiscovery Manager dans le portail Microsoft Purchase. Ce rôle n'est pas attribué par défaut.
- L’organisation dispose d’une licence E3 ou E5.
Steps:
- Dans le portail Microsoft Purchase, créez ou ouvrez un incident eDiscovery.
- Exécutez une recherche étendue aux boîtes aux lettres cibles. Laissez les mots-clés vides pour renvoyer tous les éléments de la plage de dates.
- Sélectionnez Exporter lors de la recherche.
- Sous Format d'exportation, choisissez Créer des PST pour les messages.
- Incluez la boîte aux lettres d'archives et les éléments récupérés pour exporter l'historique complet. Les boîtes aux lettres principales et d'archives sont fusionnées en un seul fichier PST.
- Définissez la taille maximale du package PST sur 1, 2, 5 ou 10 Go. Les paquets plus petits sont plus faciles à transférer.
- Téléchargez le package à partir du Gestionnaire de processus.
Les packages d’exportation expirent après 14 jours. Extrayez le package avec un outil d’archivage tiers plutôt que l’extraction Windows intégrée, et vérifiez la taille des fichiers une fois le téléchargement terminé.
On-premises Exchange Server
Cette procédure s'applique à Exchange Server 2016, 2019 et à l'édition de l'abonnement. Pour plus de détails, consultez la section Exporter les résultats de la recherche eDiscovery vers un fichier PST.
Prérequis :
- La machine d’exportation a installé.NET Framework 4.7 et le complément ClickOnce dans Chrome ou Firefox.
- Le compte exécutant l’exportation n’utilise pas l’authentification multifacteur. L'outil d'exportation eDiscovery PST ne fonctionne pas avec les comptes MFA: créez d'abord un mot de passe d'application pour le compte.
Steps:
- Dans le centre d'administration Exchange, accédez à Gestion de la conformité > eDiscovery et attente sur place.
- Sélectionnez la recherche, puis sélectionnez Exporter vers un fichier PST.
- Dans l'outil d'exportation eDiscovery PST, choisissez un emplacement de téléchargement.
- Vous pouvez également sélectionner Activer la déduplication pour écrire tous les résultats dans un seul fichier PST, et Inclure les éléments non consultables.
- Sélectionnez Démarrer.
Les proxys et les pare-feu de l’entreprise peuvent bloquer ou limiter le téléchargement de l’exportation. Les points de terminaison Microsoft impliqués peuvent devoir être ajoutés à votre liste d’autorisation réseau.
Téléchargement du fichier PST
Prérequis
- La CLI de Communications Mining est installée. Pour plus d’informations, consultez la section CLI.
- Un contexte est configuré pour votre point de terminaison Communications Mining. Pour de plus amples informations, consultez la section Configurer l'interface de ligne de commande.
- Le fichier PST est exporté à partir d'Exchange, comme décrit dans la section précédente.
- Vous disposez des autorisations nécessaires pour créer des compartiments et des sources dans le projet cible.
Le chargement d'e-mails consomme des AI Units ou des Platform Units, de sorte que la CLI vous invite à consentir aux frais avant que le chargement ne commence. Un test ne consomme rien, mais affiche toujours l’invite. Ajoutez --yes pour supprimer l'invite dans une exécution non assistée ou scriptée.
Étapes
-
Créez un compartiment pour les e-mails. Les noms de projet et de compartiment acceptent uniquement les lettres, les chiffres, les traits d’union et les traits de soulignement.
re -c <context> create bucket <ProjectName>/<BucketName>re -c <context> create bucket <ProjectName>/<BucketName> -
Vérifiez que le fichier PST est analysé avant de consommer des unités.
re -c <context> parse pst --bucket <ProjectName>/<BucketName> --file <PathToPst> --dry-runre -c <context> parse pst --bucket <ProjectName>/<BucketName> --file <PathToPst> --dry-runLa commande lit le fichier entier et signale les erreurs d'analyse sans rien télécharger. Il imprime soit
No parse errors found, soit la répartition de chaque erreur distincte et le nombre d'e-mails affectés. -
Chargez le fichier PST dans le compartiment.
re -c <context> parse pst --bucket <ProjectName>/<BucketName> --file <PathToPst> --resume-on-errorre -c <context> parse pst --bucket <ProjectName>/<BucketName> --file <PathToPst> --resume-on-errorL'indicateur
--resume-on-errorignore et compte les e-mails qui ne peuvent pas être traités. Sans cela, le premier e-mail qui échoue abandonne toute l'exécution.
Les e-mails se trouvent maintenant dans le compartiment. Pour les rendre disponibles pour l'entraînement, créez une source à partir du compartiment et ajoutez cette source à un ensemble de données.
Options et comportement de téléchargement
- Un fichier PST par commande. L'indicateur
--fileemprunte un chemin unique. Faites une boucle dans votre shell pour télécharger plusieurs fichiers PST. - Le nom de la boîte aux lettres dans la plate-forme est le nom de fichier du fichier PST, qui inclut l'extension. Un fichier nommé
export (1).pstproduit une boîte aux lettres nomméeexport (1).pst, visible par vos utilisateurs. Renommez le fichier plus significatif avant de le télécharger. - Un fichier PST volumineux démarre lentement. La CLI compte chaque élément du fichier avant de commencer le téléchargement, de sorte que le fichier est lu deux fois et que la barre de progression prend le temps d'apparaître. N'arrêtez pas l'exécution.
--num-threadsn'a aucun effet. La commandere parse pstest conçue à un fil unique.- La réexécution du même fichier PST dans le même compartiment est idempotente. Chaque e-mail est renseigné sur son en-tête
Message-IDet le téléchargement est une insertion, il est donc sécurisé de se réexécuter après un échec ou une interruption du téléchargement. - Déposez
--resume-on-errorlorsque vous diagnostiquez les défaillances. La CLI s’arrête alors au premier échec et en signale la raison.
Compartiments, sources et jeux de données
Savoir comment les e-mails se déplacent sur la plate-forme empêche la cause la plus courante de commentaires en double:
- Un compartiment stocke les e-mails bruts. C’est ici que se pointent les e-mails PST et Exchange.
- Une source est créée à partir d'un compartiment. Les e-mails sont synchronisés depuis le compartiment dans la source, où ils sont convertis en commentaires.
- Un ensemble de données est ce sur quoi vous vous entraînez. Il contient une ou plusieurs sources.
Nous vous recommanderons de lier un compartiment à une source et de remplir chaque source via une seule méthode, soit un compartiment, soit l'API. Si vous joignez le même compartiment à quatre sources, chaque e-mail est dupliqué pour les quatre sources.
Pour plus de détails sur la création de la source, consultez Création ou suppression d’une source de données dans l’interface graphique.
E-mails en double lorsque vous utilisez également l’intégration Exchange
Communications Mining supprime les doublons d’e-mail au niveau de l’en-tête Message-ID, et le téléchargement est une insertion d’upsert. Renvoyer un fichier PST, puis activer l'intégration Exchange ne produit donc pas de commentaires en double. Deux fichiers PST qui partagent des e-mails ne se doublent pas non plus, à condition que les deux portent le même Message-ID. Si vous voyez des doublons, vérifiez à combien de sources le compartiment est attaché.
Résolution des problèmes
| Symptôme | Cause et résolution |
|---|---|
Chaque e-mail ne peut pas être analysé, par exemple Total emails: 304 / failed to parse: 304 / uploaded: 0. | Le fichier PST a été exporté à partir d'Outlook, ce qui n'est pas pris en charge. Réexportez le fichier depuis Exchange. |
| Certains e-mails échouent et la raison n’est pas claire. | Réexécutez le téléchargement sans --resume-on-error afin que la CLI s’arrête au premier échec et imprime la raison. Une note --dry-run signale les mêmes erreurs sur l’ensemble du fichier sans téléchargement. |
| Vous devez savoir si un fichier PST est corrompu. | Si la CLI peut ouvrir le fichier et itérer ses éléments, recherchez plutôt une cause au niveau de l'analyse. Si le fichier ne peut pas être lu du tout, téléchargez-le à nouveau et vérifiez que la taille du fichier local correspond à la source. Un téléchargement partiel ressemble à un fichier corrompu. |
| La CLI rapporte plus d'e-mails que l'ensemble de données ne contient. | Les fichiers PST contiennent des valeurs Message-ID en double, que la plate-forme supprime lors du chargement. Aucun rapport sur les éléments dupliqués n’est disponible. Pour confirmer, comptez les valeurs Message-ID uniques dans le fichier. |
| Vous devez trouver les e-mails RTF uniquement avant d'exécuter le téléchargement. | Ceci n’est pas détectable dès le départ. Exécutez le téléchargement avec --dry-run et lisez les erreurs signalées. |
| Le téléchargement semble s'être arrêté. | Sur un fichier PST volumineux, la CLI compte tous les éléments avant de les télécharger, il y a donc une longue phase de silencieux d'abord. Si l'exécution est réellement bloquée, vérifiez que la machine n'est pas limitée par les ressources et copiez le fichier PST sur un chemin local en dehors de tout dossier de stockage cloud synchronisé. |
| Les e-mails affichent du texte saisi. | Limitation connue pour les jeux de caractères autres que UTF-8, tels que le japonais ISO-2022-JP et le chinois. Les corps HTML sont corrompus en mode silencieux, c’est pourquoi --dry-run ne les signale pas. Aucune solution de contournement n’est disponible. |
re create bucket ou re parse pst renvoie Unknown context, ou cible le mauvais locataire. | Chaque commande a besoin d'un contexte: re -c <context>. L'indicateur -c prend le nom d'un contexte que vous avez déjà enregistré, et non une chaîne d'organisation et de locataire. Un contexte créé avec re config parse-from-url est nommé <organization>/<tenant>, et un contexte créé avec re config add --name production est nommé production. Répertoriez les contextes enregistrés avec re config ls. |
| L'invite de téléchargement vous demande confirmation et bloque une exécution scriptée. | L’invite correspond au consentement aux frais d’AI Unit ou de Platform Unit. Ajoutez --yes. |
| La CLI ne peut pas accéder à la plate-forme. | Votre réseau filtre les sorties. Ajoutez la plateforme et les points de terminaison de CLI à votre liste d’autorisation, ou exécutez la CLI à partir d’une machine qui y a accès. |
| Tous les e-mails n’ont pas été téléchargés. | Un degré est attendu. Confirmez que l’exportation provient d’Exchange et que --resume-on-error a été utilisé, et vérifiez les compteurs d’échecs. Les brouillons, les éléments de calendrier et les contacts sont comptabilisés comme des échecs. |
Si votre problème n’est pas répertorié, soumettez un ticket d’assistance UiPath®.
- Quand utiliser un fichier PST
- Limites connues
- Exportation du fichier PST
- Microsoft 365 et Exchange Online
- On-premises Exchange Server
- Téléchargement du fichier PST
- Prérequis
- Étapes
- Options et comportement de téléchargement
- Compartiments, sources et jeux de données
- E-mails en double lorsque vous utilisez également l’intégration Exchange
- Résolution des problèmes