- Vue d'ensemble (Overview)
- Automatisation de l'interface utilisateur
- À propos du package d'activités UIAutomation
- Applications et technologies automatisées avec UI Automation
- Compatibilité du projet
- UI-ANA-016 - Extraire l'URL ouverte du navigateur
- UI-ANA-017 - ContinuerSurErreur (ContinueOnError) True
- UI-ANA-018 - Répertorier les activités d'OCR/d'image
- UI-DBP-006 - Utilisation du conteneur
- UI-DBP-013 - Utilisation abusive de l’automatisation Excel
- UI-DBP-030 - Utilisation de variables interdites dans les sélecteurs
- UI-DBP-031 : Vérification de l’activité
- UI-PRR-001 - Simuler un clic
- UI-PRR-002 - Type de simulation
- UI-PRR-003 - Ouverture d'une utilisation abusive de l'application
- UI-PRR-004 - Délais codés en dur
- UI-REL-001 - Idx volumineux dans les sélecteurs
- UI-SEC-004 - Données d’e-mail du sélecteur
- UI-SEC-010 - Restrictions d'applications/d'URL
- UI-USG-011 - Attributs non autorisés
- UX-SEC-010 - Restrictions d'applications/d'URL
- UX-DBP-029 - Utilisation d'un mot de passe non sécurisé
- UI-PST-001 - Niveau du journal d'audit dans les paramètres du projet
- Outil de migration de navigateur UiPath
- À propos des éléments d'interface utilisateur
- Propriétés des activités de l'interface utilisateur
- Exemple d'utilisation des méthodes de saisie
- Méthodes de sortie ou de capture de données d'écran
- Exemple d'utilisation de méthodes de sortie ou de capture de données d'écran
- Génération de tables à partir de données non structurées
- Capture relative de données
- Zone de détourage
- Enregistreur de Computer Vision
- À propos de l'automatisation des images et des textes
- Activités liées à la souris et au clavier
- Exemple d'utilisation de l'automatisation de la souris et du clavier
- Les activités de type texte
- Exemple d'utilisation d'automatisation de texte
- Activités de type OCR
- Activités de type image
- Exemple d'utilisation de l'automatisation d'image et d'OCR
- Index des activités
- Activer (Activate)
- Base d'ancrage (Anchor Base)
- Lier à un navigateur (Attach Browser)
- Lier à une fenêtre (Attach Window)
- Block User Input
- Légende (Callout)
- Vérifier (Check)
- Cliquer (Click)
- Cliquer sur l'image (Click Image)
- Déclencheur de clic image (Click Image Trigger)
- Cliquer sur le texte OCR (Click OCR Text)
- Cliquer sur le texte (Click Text)
- Déclencheur de clic (Click Trigger)
- Fermer l'application (Close Application)
- Fermer l'onglet (Close Tab)
- Fermer la fenêtre (Close Window)
- Context Aware Anchor
- Copier le texte sélectionné (Copy Selected Text)
- Element Attribute Change Trigger
- Élément existant (Element Exists)
- Étendue de l'élément (Element Scope)
- Element State Change Trigger
- Export UI Tree
- Extraire les données structurées (Extract Structured Data)
- Rechercher les enfants (Find Children)
- Rechercher l'élément (Find Element)
- Rechercher l'image (Find Image)
- Rechercher les correspondances de l'image (Find Image Matches)
- Rechercher une position de texte OCR (Find OCR Text Position)
- Rechercher l'élément relatif (Find Relative Element)
- Rechercher la position du texte (Find Text Position)
- Obtenir la fenêtre active (Get Active Window)
- Obtenir l'ancêtre (Get Ancestor)
- Obtenir l'attribut (Get Attribute)
- Obtenir les infos de l'événement (Get Event Info)
- Récupérer du presse-papiers (Get From Clipboard)
- Obtenir le texte complet (Get Full Text)
- Obtenir le texte OCR (Get OCR Text)
- Récupérer le mot de passe (Get Password)
- Obtenir la position (Get Position)
- Obtenir l'élément source (Get Source Element)
- Obtenir le texte (Get Text)
- Obtenir le texte visible (Get Visible Text)
- Revenir en arrière (Go Back)
- Avancer (Go Forward)
- Accéder à l'accueil (Go Home)
- Google Cloud Vision OCR
- Masquer la fenêtre (Hide Window)
- Mettre en surbrillance (Highlight)
- Déclencheur de raccourci (Hotkey Trigger)
- Pointer (Hover)
- Pointer sur l'image (Hover Image)
- Pointer sur le texte OCR (Hover OCR Text)
- Pointer sur le texte (Hover Text)
- Image existante (Image Exists)
- Indiquer sur l'écran (Indicate On Screen)
- Injecter du code .NET
- Inject Js Script
- Invoquer la méthode ActiveX
- Déclencheur de pression de touche (Key Press Trigger)
- Charger l'image (Load Image)
- Agrandir la fenêtre (Maximize Window)
- Microsoft Azure ComputerVision OCR
- Reconnaissance optique des caractères Microsoft (Microsoft OCR)
- Microsoft Project Oxford Online OCR
- Réduire la fenêtre (Minimize Window)
- Surveiller les événements (Monitor Events)
- Déclencheur de souris (Mouse Trigger)
- Déplacer la fenêtre (Move Window)
- Accéder à (Navigate To)
- Texte OCR existant (OCR Text Exists)
- Sur affichage de l'élément (On Element Appear)
- Sur disparition de l'élément (On Element Vanish)
- Sur apparition de l'image (On Image Appear)
- Sur disparition de l'image (On Image Vanish)
- Ouvrir l'application (Open Application)
- Ouvrir le navigateur (Open Browser)
- Actualiser le navigateur (Refresh Browser)
- Relire l'événement utilisateur (Replay User Event)
- Restaurer la fenêtre (Restore Window)
- Enregistrer l'image (Save Image)
- Sélectionner l'élément (Select Item)
- Sélectionner plusieurs éléments (Select Multiple Items)
- Envoyer le raccourci (Send Hotkey)
- Définir la zone de détourage (Set Clipping Region)
- Définir le focus (Set Focus)
- Définir le texte (Set Text)
- Placer dans le presse-papiers (Set To Clipboard)
- Définir l'attribut Web (Set Web Attribute)
- Afficher la fenêtre (Show Window)
- Déclencher le processus (Start Process)
- Déclencheur système (System Trigger)
- Prendre une capture d'écran (Take Screenshot)
- Tesseract OCR
- Texte existant (Text Exists)
- Info-bulle
- Saisir dans (Type Into)
- Saisir un texte sécurisé (Type Secure Text)
- Utiliser le premier plan
- Attendre un attribut (Wait Attribute)
- Attendre que l'élément disparaisse (Wait Element Vanish)
- Attendre que l'image disparaisse (Wait Image Vanish)
- Vérification de l’accessibilité
- Application event trigger
- Block User Input
- Check/Uncheck
- Check App State
- Check Element
- Cliquer (Click)
- Click Event Trigger
- Glisser et déposer
- Étendue de l'élément (Element Scope)
- Extract Table Data
- Find Elements
- For Each UiElement
- Get Browser Data
- Get Clipboard (Obtenir le Presse-papiers)
- Obtenir le texte (Get Text)
- Get URL
- Go To URL
- Mettre en surbrillance (Highlight)
- Pointer (Hover)
- Inject Js Script
- Raccourcis clavier
- Keypress Event Trigger
- Mouse scroll
- Navigate Browser
- Enregistrer l'image (Save Image)
- Sélectionner l'élément (Select Item)
- Set Browser Data
- Set Clipboard (Définir le Presse-papiers)
- Définir CV Server
- Définir le navigateur du runtime (Set Runtime Browser)
- Définir le focus (Set Focus)
- Définir les paramètres du projet
- Définir le texte (Set Text)
- Prendre une capture d'écran (Take Screenshot)
- Saisir dans (Type Into)
- Unblock User Input
- Window operation
- Joindre
- Vérifier (Check)
- Cliquer (Click)
- Glisser et déposer
- Extraire des données
- Obtenir l'attribut (Get Attribute)
- ObtenirEnfants
- ObtenirCibleRuntime
- GetText
- Get URL
- GoToUrl
- Mettre en surbrillance (Highlight)
- Pointer (Hover)
- IsEnabled
- Raccourci clavier
- Mouse scroll
- Ouvrir
- Sélectionner l'élément (Select Item)
- Prendre une capture d'écran (Take Screenshot)
- Saisir dans (Type Into)
- ÉtatAttente
- Effectuez une recherche par navigateur et récupérez les résultats à l'aide des API UI Automation
- Navigation sur le Web
- Rechercher des images
- Cliquer sur des images
- Déclencher et surveiller des événements
- Créer et remplacer des fichiers
- Pages HTML : extraire et manipuler des informations
- Manipulation des fenêtres
- Sélection de liste automatisée
- Rechercher et manipuler des éléments de fenêtre
- Gérer l'automatisation du texte
- Charger et traiter des images
- Gérer les actions activées par la souris
- Automatiser l'exécution des applications
- Exécution automatisée d'une application locale
- Navigation avec le navigateur
- Automatisation Web
- Exemple de fonctionnalités du déclencheur
- Activer la prise en charge d’UI Automation dans DevExpress
- Computer Vision Local Server
- Automatisation mobile
- Notes de publication
- À propos de l'architecture d'automatisation des appareils mobiles
- Compatibilité du projet
- Get Log Types
- Get Logs
- Get Page Source
- Get Device Orientation
- Get Session Identifier
- Installer l'application
- Gérer l'application actuelle
- Gérer une autre application
- Ouvrir DeepLink
- Ouvrir l'URL
- Mobile Device Connection
- Balayer directionnel
- Dessiner un modèle
- Positional Swipe
- Press Hardware Button
- Set Device Orientation
- Prendre une capture d'écran (Take Screenshot)
- Prendre une partie de capture d'écran
- Élément existant (Element Exists)
- Execute Command
- Obtenir l'attribut (Get Attribute)
- Get Selected Item
- Obtenir le texte (Get Text)
- Set Selected Item
- Définir le texte (Set Text)
- Balayer
- Tap
- Saisir texte
- Premiers pas avec les API d’automatisation mobile
- Gestion des boîtes de dialogue contextuelles dans les automatisations mobiles
- Creating variables from selector attributes
- Créer des workflows d'automatisation mobile
- Utiliser l’automatisation mobile pour les applications de banque mobile
- Automatisation pour les applications React Native
- Terminal
- Notes de publication
- À propos du package d'activités Terminal
- Compatibilité du projet
- Meilleures pratiques
- Rechercher un texte (Find Text)
- Get Color At Position
- Obtenir la position du curseur (Get Cursor Position)
- Obtenir le champ (Get Field)
- Obtenir le champ en position (Get Field at Position)
- Accéder à la zone d'écran (Get Screen Area)
- Obtenir le texte (Get Text)
- Obtenir le texte en position (Get Text at Position)
- Déplacer le curseur (Move Cursor)
- Move Cursor to Text
- Envoyer la touche Contrôle (Send Control Key)
- Envoyer les touches (Send Keys)
- Envoyer les touches en toute sécurité (Send Keys Secure)
- Définir le champ (Set Field)
- Définir le champ en position (Set Field at Position)
- Session de terminal (Terminal Session)
- Attendre le texte de champ (Wait Field Text)
- Wait Screen Ready
- Attendre le texte d'écran (Wait Screen Text)
- Attendre le texte en position (Wait Text at Position)
- API d'automatisation codée par terminal
Méthodes de recherche du sélecteur sémantique: modes DOM et Image pour cibler les éléments de l’IU par signification, et quand utiliser chacun.
Les sélecteurs sémantiques vous permettent d’indiquer les éléments d’IU en fonction de leur signification, et non uniquement en fonction des attributs de sélecteur traditionnels. Vous décrivez l'élément avec lequel vous souhaitez interagir et UiPath utilise l'IA pour identifier la meilleure cible correspondante.
Les sélecteurs sémantiques prennent en charge deux méthodes de recherche:
- DOM (modèle d’objet de document) : la méthode de recherche par défaut pour les applications Web. Il utilise des informations extraites du DOM d’application.
- Image — la méthode de recherche par défaut pour les applications non Web. Il utilise l'image à l'écran visible et les capacités d'ancrage de l'image des modèles multimodal modernes.
Mode DOM
En mode DOM, UiPath effectue une recherche dans le DOM pour trouver l’élément cible. Ce mode utilise l'extracteur DOM d'UiPath pour collecter des informations structurées sur la page, puis envoie ces informations à un modèle LLM (Large Language Model) pour faire correspondre les éléments de l'interface utilisateur en fonction de leur description sémantique.
Le mode DOM est recommandé lorsque la cible peut être identifiée grâce aux informations disponibles dans le DOM, telles que:
- texte visible;
- libellés;
- rôles;
- attributs;
- hiérarchie des éléments;
- relations structurées entre les éléments.
Le mode DOM peut accéder à n’importe quel élément disponible dans le DOM, y compris les éléments qui sont hors écran. Cela le rend utile pour les applications Web où l'élément cible existe dans la structure de la page même lorsqu'il n'est pas visible dans la fenêtre d'affichage.
Le mode DOM est moins précis lorsque les caractéristiques d’identification les plus importantes sont visuelles, telles qu’une forme d’icône, une couleur, un style ou une position visuelle spécifique. Le mode DOM n'est également pas disponible pour les applications non Web.
L’info-bulle intégrée au produit résume le mode DOM comme suit: « Recherche le DOM. Atteint n'importe quel élément, y compris hors écran. Moins précis sur les détails visuels. Non disponible sur les applications non Web. »
Mode image
En mode Image, les sélecteurs sémantiques recherchent l’image visible à l’écran au lieu du DOM. Le mode image peut détecter et raisonner sur les objets visibles à l’écran, y compris les icônes, les couleurs, les styles, la mise en page et les relations visuelles.
Ce mode utilise les capacités d’ancrage d’image des derniers modèles multimodal. Ces modèles peuvent comprendre non seulement l'existence d'un élément, mais également son emplacement d'affichage à l'écran et son apparence par rapport à l'interface utilisateur voisine.
Le mode image est préférable lorsque la cible est décrite de façon plus fiable par son apparence que par sa structure, par exemple:
- une icône avec une forme ou une couleur spécifique;
- un bouton visuellement distinct mais mal décrit dans le DOM;
- une vignette ou une carte identifiée par sa couleur, sa position ou son style;
- une icône d'avertissement, de statut ou d'action;
- un contrôle dans une application non Web;
- un écran sur lequel les informations DOM sont incomplètes, bruyantes ou indisponibles.
Par exemple, le mode image peut cibler « la vignette verte Opportunités de vente», « l’icône bleue à côté du champ de recherche» ou « l’icône d’avertissement dans le coin supérieur droit».
Étant donné que le mode image fonctionne à partir de l'image de l'écran, il est limité à ce qui est visible. Si un élément est hors écran, masqué ou non rendu visuel au moment du ciblage, le mode image ne peut pas l’identifier à partir de la capture d’écran actuelle.
Pour les cibles hors écran, une activité Mouse Scroll (Défilement de la souris) avec la propriété Vers l'élément , placée avant l'action du Sélecteur sémantique, affiche l'élément avant l'exécution de l'action.
L’info-bulle intégrée au produit résume le mode image comme suit: « Recherche l’image à l’écran. Détecte n'importe quel objet à l'écran, y compris les icônes, les couleurs et les styles. Limité à ce qui est visible.»
Relation avec Computer Vision
Le mode image est l'évolution naturelle de la technologie Computer Vision d'UiPath.
Computer Vision utilise la détection d'objets basée sur l'IA pour identifier les éléments d'interface utilisateur à l'écran. Elle reste disponible dans Cible unifiée et continue d’être une méthode de ciblage importante. Étant donné que Computer Vision est basé sur un détecteur d'objets dédié, il est plus stable et déterministe dans les scénarios qui nécessitent une détection prévisible des éléments visuels.
Le mode image s'appuie sur la même direction - en utilisant la compréhension visuelle pour interagir avec les applications lorsque les sélecteurs traditionnels ne suffisent pas - mais introduit une approche plus flexible. Il utilise des modèles multimodal modernes qui raisonnent sur l’image en mode plein écran et correspondent aux éléments basés sur des descriptions en langage naturel. La table suivante indique quand utiliser chaque méthode:
| Method | Utilisez-le lorsque |
|---|---|
| Computer Vision | Vous avez besoin d’une détection d’objets visuels stable et déterministe. |
| Mode image | Vous souhaitez un ciblage sémantique flexible basé sur des attributs visuels visibles. |
| Mode DOM | L’élément peut être identifié de manière fiable à partir des informations DOM. |
Computer Vision reste de la Cible unifiée et n’est pas remplacé par la méthode de recherche d’image des sélecteurs sémantiques.
Sélection du modèle
Les sélecteurs sémantiques incluent une liste déroulante Modèle dans Paramètres du projet > UI Automation > Sélecteur sémantique qui vous permet de choisir le modèle sous-jacent utilisé pour le ciblage sémantique pour chaque méthode de recherche disponible.
Pour le mode DOM, deux modèles sont disponibles:
| Modèle | Description |
|---|---|
| Gemini 2.5 Flash | Un modèle de compréhension sémantique sur les informations extraites par DOM. Convient lorsque la cible peut être décrite via les informations disponibles dans le DOM. |
| Path Mini | Le modèle rapide et compact d'UiPath, conçu pour obtenir des performances solides tout en optimisant la vitesse et l'efficacité. Pathmini prend en charge à la fois les fonctionnalités d'utilisation par ordinateur et l'ancrage de l'image pour les sélecteurs sémantiques. |
À des fins de transparence, Pathmini est basé sur un modèle Qwen affiné.
Pour le mode Image, les sélecteurs sémantiques ne peuvent utiliser que Pathmini, car il prend en charge l’ancrage de l’image et peut raisonner sur l’image visible de l’écran.
Conseils d'utilisation
Le mode DOM est l’option par défaut pour les applications Web lorsque la cible peut être identifiée via du texte, des libellés, des rôles, des attributs ou une structure disponible dans le DOM. Le mode DOM est également utile lorsque la cible existe dans le DOM, mais n’est pas visible à l’écran.
Le mode image est préférable lorsque la cible est décrite par son apparence, lorsque la couleur, la forme de l’icône, le style, la position visuelle ou la mise en page voisine sont plus pertinents que les attributs DOM. Le mode image est également utile pour les applications non Web ou lorsque le DOM ne fournit pas suffisamment d’informations fiables.
En mode image, la cible doit être visible à l'écran au moment du ciblage. Pour les cibles hors écran, une activité Mouse Scroll (Défilement de la souris) avec la propriété Vers l'élément , placée avant l'action du Sélecteur sémantique, affiche l'élément avant l'exécution de l'action.
Contenu associé
Pour plus d’informations sur les sélecteurs sémantiques, consultez la section À propos des sélecteurs sémantiques.