UiPath Documentation
activities
latest
false
Activités UIAutomation
Important :
Veuillez noter que ce contenu a été localisé en partie à l’aide de la traduction automatique. La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.

Méthodes de recherche

Méthodes de recherche du sélecteur sémantique: modes DOM et Image pour cibler les éléments de l’IU par signification, et quand utiliser chacun.

Les sélecteurs sémantiques vous permettent d’indiquer les éléments d’IU en fonction de leur signification, et non uniquement en fonction des attributs de sélecteur traditionnels. Vous décrivez l'élément avec lequel vous souhaitez interagir et UiPath utilise l'IA pour identifier la meilleure cible correspondante.

Les sélecteurs sémantiques prennent en charge deux méthodes de recherche:

  • DOM (modèle d’objet de document) : la méthode de recherche par défaut pour les applications Web. Il utilise des informations extraites du DOM d’application.
  • Image — la méthode de recherche par défaut pour les applications non Web. Il utilise l'image à l'écran visible et les capacités d'ancrage de l'image des modèles multimodal modernes.

Mode DOM

En mode DOM, UiPath effectue une recherche dans le DOM pour trouver l’élément cible. Ce mode utilise l'extracteur DOM d'UiPath pour collecter des informations structurées sur la page, puis envoie ces informations à un modèle LLM (Large Language Model) pour faire correspondre les éléments de l'interface utilisateur en fonction de leur description sémantique.

Le mode DOM est recommandé lorsque la cible peut être identifiée grâce aux informations disponibles dans le DOM, telles que:

  • texte visible;
  • libellés;
  • rôles;
  • attributs;
  • hiérarchie des éléments;
  • relations structurées entre les éléments.

Le mode DOM peut accéder à n’importe quel élément disponible dans le DOM, y compris les éléments qui sont hors écran. Cela le rend utile pour les applications Web où l'élément cible existe dans la structure de la page même lorsqu'il n'est pas visible dans la fenêtre d'affichage.

Le mode DOM est moins précis lorsque les caractéristiques d’identification les plus importantes sont visuelles, telles qu’une forme d’icône, une couleur, un style ou une position visuelle spécifique. Le mode DOM n'est également pas disponible pour les applications non Web.

Remarque :

L’info-bulle intégrée au produit résume le mode DOM comme suit: « Recherche le DOM. Atteint n'importe quel élément, y compris hors écran. Moins précis sur les détails visuels. Non disponible sur les applications non Web. »

Mode image

En mode Image, les sélecteurs sémantiques recherchent l’image visible à l’écran au lieu du DOM. Le mode image peut détecter et raisonner sur les objets visibles à l’écran, y compris les icônes, les couleurs, les styles, la mise en page et les relations visuelles.

Ce mode utilise les capacités d’ancrage d’image des derniers modèles multimodal. Ces modèles peuvent comprendre non seulement l'existence d'un élément, mais également son emplacement d'affichage à l'écran et son apparence par rapport à l'interface utilisateur voisine.

Le mode image est préférable lorsque la cible est décrite de façon plus fiable par son apparence que par sa structure, par exemple:

  • une icône avec une forme ou une couleur spécifique;
  • un bouton visuellement distinct mais mal décrit dans le DOM;
  • une vignette ou une carte identifiée par sa couleur, sa position ou son style;
  • une icône d'avertissement, de statut ou d'action;
  • un contrôle dans une application non Web;
  • un écran sur lequel les informations DOM sont incomplètes, bruyantes ou indisponibles.

Par exemple, le mode image peut cibler « la vignette verte Opportunités de vente», « l’icône bleue à côté du champ de recherche» ou « l’icône d’avertissement dans le coin supérieur droit».

Étant donné que le mode image fonctionne à partir de l'image de l'écran, il est limité à ce qui est visible. Si un élément est hors écran, masqué ou non rendu visuel au moment du ciblage, le mode image ne peut pas l’identifier à partir de la capture d’écran actuelle.

Pour les cibles hors écran, une activité Mouse Scroll (Défilement de la souris) avec la propriété Vers l'élément , placée avant l'action du Sélecteur sémantique, affiche l'élément avant l'exécution de l'action.

Remarque :

L’info-bulle intégrée au produit résume le mode image comme suit: « Recherche l’image à l’écran. Détecte n'importe quel objet à l'écran, y compris les icônes, les couleurs et les styles. Limité à ce qui est visible.»

Relation avec Computer Vision

Le mode image est l'évolution naturelle de la technologie Computer Vision d'UiPath.

Computer Vision utilise la détection d'objets basée sur l'IA pour identifier les éléments d'interface utilisateur à l'écran. Elle reste disponible dans Cible unifiée et continue d’être une méthode de ciblage importante. Étant donné que Computer Vision est basé sur un détecteur d'objets dédié, il est plus stable et déterministe dans les scénarios qui nécessitent une détection prévisible des éléments visuels.

Le mode image s'appuie sur la même direction - en utilisant la compréhension visuelle pour interagir avec les applications lorsque les sélecteurs traditionnels ne suffisent pas - mais introduit une approche plus flexible. Il utilise des modèles multimodal modernes qui raisonnent sur l’image en mode plein écran et correspondent aux éléments basés sur des descriptions en langage naturel. La table suivante indique quand utiliser chaque méthode:

MethodUtilisez-le lorsque
Computer VisionVous avez besoin d’une détection d’objets visuels stable et déterministe.
Mode imageVous souhaitez un ciblage sémantique flexible basé sur des attributs visuels visibles.
Mode DOML’élément peut être identifié de manière fiable à partir des informations DOM.

Computer Vision reste de la Cible unifiée et n’est pas remplacé par la méthode de recherche d’image des sélecteurs sémantiques.

Sélection du modèle

Les sélecteurs sémantiques incluent une liste déroulante Modèle dans Paramètres du projet > UI Automation > Sélecteur sémantique qui vous permet de choisir le modèle sous-jacent utilisé pour le ciblage sémantique pour chaque méthode de recherche disponible.

Pour le mode DOM, deux modèles sont disponibles:

ModèleDescription
Gemini 2.5 FlashUn modèle de compréhension sémantique sur les informations extraites par DOM. Convient lorsque la cible peut être décrite via les informations disponibles dans le DOM.
Path MiniLe modèle rapide et compact d'UiPath, conçu pour obtenir des performances solides tout en optimisant la vitesse et l'efficacité. Pathmini prend en charge à la fois les fonctionnalités d'utilisation par ordinateur et l'ancrage de l'image pour les sélecteurs sémantiques.

À des fins de transparence, Pathmini est basé sur un modèle Qwen affiné.

Pour le mode Image, les sélecteurs sémantiques ne peuvent utiliser que Pathmini, car il prend en charge l’ancrage de l’image et peut raisonner sur l’image visible de l’écran.

Conseils d'utilisation

Le mode DOM est l’option par défaut pour les applications Web lorsque la cible peut être identifiée via du texte, des libellés, des rôles, des attributs ou une structure disponible dans le DOM. Le mode DOM est également utile lorsque la cible existe dans le DOM, mais n’est pas visible à l’écran.

Le mode image est préférable lorsque la cible est décrite par son apparence, lorsque la couleur, la forme de l’icône, le style, la position visuelle ou la mise en page voisine sont plus pertinents que les attributs DOM. Le mode image est également utile pour les applications non Web ou lorsque le DOM ne fournit pas suffisamment d’informations fiables.

En mode image, la cible doit être visible à l'écran au moment du ciblage. Pour les cibles hors écran, une activité Mouse Scroll (Défilement de la souris) avec la propriété Vers l'élément , placée avant l'action du Sélecteur sémantique, affiche l'élément avant l'exécution de l'action.

Pour plus d’informations sur les sélecteurs sémantiques, consultez la section À propos des sélecteurs sémantiques.

  • Mode DOM
  • Mode image
  • Relation avec Computer Vision
  • Sélection du modèle
  • Conseils d'utilisation
  • Contenu associé

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour