UiPath Documentation
activities
latest
false
Atividades do UIAutomation
Importante :
A tradução automática foi aplicada parcialmente neste conteúdo. A localização de um conteúdo recém-publicado pode levar de 1 a 2 semanas para ficar disponível.

Encontrar métodos

Métodos de localização do seletor semântico: modos DOM e Imagem para segmentar elementos de interface gráfica por significado e quando usar cada um deles.

Os seletores semânticos permitem que você indique elementos de interface gráfica com base em seu significado, não apenas nos atributos do seletor tradicional. Você descreve o elemento com o qual deseja interagir, e a UiPath usa IA para identificar o melhor destino de correspondência.

Os seletores semânticos são compatíveis com dois métodos de localização:

  • DOM (Modelo de Objeto de Documento) — o método de localização padrão para aplicativos da Web. Ele usa informações extraídas do aplicativo DOM.
  • Imagem — o método de localização padrão para aplicativos não web. Ele usa a imagem da tela visível e os recursos de embasamento de imagem de modelos multimodais modernos.

Modo DOM

No modo DOM, a UiPath pesquisa o DOM para encontrar o elemento de destino. Esse modo usa o DOM Extractor da UiPath para coletar informações estruturadas sobre a página e, em seguida, envia essas informações para um grande modelo de linguagem (LLM) para corresponder os elementos da interface gráfica com base em sua descrição semântica.

O modo DOM é recomendado quando o destino pode ser identificado por meio de informações disponíveis no DOM, como:

  • texto visível;
  • rótulos;
  • funções;
  • atributos;
  • hierarquia de elementos;
  • relações estruturados entre elementos.

O modo DOM pode alcançar qualquer elemento disponível no DOM, incluindo elementos que estão fora da tela. Isso o torna útil para aplicativos web em que o elemento de destino existe na estrutura da página mesmo quando não está visível na janela de visualização.

O modo DOM é menos preciso quando as características de identificação mais importantes são visuais, como uma forma de ícone específica, cor, estilo ou posição visual. O modo DOM também não está disponível para aplicativos não web.

Observação:

A dica de ferramenta no produto resume o modo DOM como: "Pesquisa o DOM. Atinge qualquer elemento, incluindo fora da tela. Menos preciso nos detalhes visuais. Não disponível em aplicativos não web."

Modo de imagem

No modo de imagem, os seletores semânticos pesquisam a imagem da tela visível em vez do DOM. O modo de imagem pode detectar e raciocinar sobre objetos visíveis na tela, incluindo ícones, cores, estilos, layout e relações visuais.

Esse modo usa os recursos de embasamento de imagem dos modelos multimodais mais recentes. Esses modelos podem entender não apenas que um elemento existe, mas também onde ele aparece na tela e como ele se parece em relação à interface gráfica ao redor.

O modo de imagem é a melhor escolha quando o destino é descrito de forma mais confiável por sua aparência do que por sua estrutura, por exemplo:

  • um ícone com uma forma ou cor específica;
  • um botão visualmente distinto, mas mal descrito no DOM;
  • um bloco ou cartão identificado por sua cor, posição ou estilo;
  • um ícone de aviso, status ou ação;
  • um controle em um aplicativo não web;
  • uma tela em que as informações do DOM estão incompletas, ruidosas ou indisponíveis.

Por exemplo, o modo de imagem pode segmentar "o bloco verde Oportunidades de vendas", "o ícone azul ao lado do campo de pesquisa" ou "o ícone de aviso no canto superior direito".

Como o modo de imagem funciona a partir da imagem da tela, ele é limitado ao que está visível. Se um elemento estiver fora da tela, oculto ou não renderizado visualmente no tempo de segmentação, o modo de imagem não poderá identificá-lo na captura de tela atual.

Para destinos fora da tela, uma atividade Mouse Scroll com a propriedade Elemento Para , colocada antes da ação do Seletor Semântico, traz o elemento para a visualização antes que a ação seja executada.

Observação:

A dica de ferramenta no produto resume o modo de imagem como: "Pesquisa a imagem da tela. Detecta qualquer objeto na tela, incluindo ícones, cores e estilos. Limitada ao que estiver visível."

Relacionamento com o Computer Vision

O modo de imagem é a evolução natural da tecnologia Computer Vision da UiPath.

O Computer Vision usa a detecção de objetos baseada em IA para identificar elementos de interface gráfica na tela. Ele permanece disponível no Destino Unificado e continua a ser um importante método de segmentação. Como o Computer Vision é baseado em um detectado de objetos dedicado, ele é mais estável e determinista em cenários que exigem a detecção de elementos visuais previsíveis.

O modo de imagem baseia-se na mesma direção — usando a compreensão visual para interagir com aplicativos quando os seletores tradicionais não são suficientes — mas introduz uma abordagem mais flexível. Usa modelos multimodais modernos que raciocinam sobre a imagem de tela cheia e correspondem elementos com base em descrições em linguagem natural. A tabela a seguir resume quando usar cada método:

MétodoUse-o ao
Computer VisionVocê precisa de uma detecção visual de objetos estável e determinística.
Modo de imagemVocê deseja uma segmentação semântica flexível com base em atributos visuais visíveis.
Modo DOMO elemento pode ser identificado de forma confiável a partir de informações do DOM.

O Computer Vision permanece parte do Destino Unificado e não é substituído pelo método Encontrar Imagem de Seletores Semânticos.

Seleção de modelo

Os seletores semânticos incluem uma lista suspensa Modelo em Configurações do projeto > Automação de interface gráfica > Seletor semântico que permite escolher o modelo subjacente usado para a segmentação semântica para cada método de localização disponível.

Para o modo DOM, dois modelos estão disponíveis:

ModeloDescription
Gemini 2.5 FlashUm modelo para a compreensão semântica de informações extraídas do DOM. Adequado quando o destino puder ser descrito por meio das informações disponíveis no DOM.
Path MiniO modelo rápido e compacto da UiPath, projetado para um desempenho forte enquanto otimiza a velocidade e a eficiência. O PathMini é compatível com recursos de Uso do Computador e embasamento de imagens para seletores semânticos.

Para transparência, o PathMini é baseado em um modelo Qwen ajustado.

Para o modo de imagem, os seletores semânticos podem usar apenas o PathMini, porque ele é compatível com a imagem da tela e pode raciocinar sobre a imagem da tela visível.

Orientação de uso

O modo DOM é a opção padrão para aplicativos da Web quando o destino pode ser identificado por meio de texto, rótulos, funções, atributos ou estrutura disponível no DOM. O modo DOM também é útil quando o destino existe no DOM, mas não está visível na tela.

O modo de imagem é a melhor opção quando o destino é descrito por sua aparência, quando a cor, a forma do ícone, o estilo, a posição visual ou o layout ao redor são mais relevantes do que os atributos do DOM. O modo de imagem também é útil para aplicativos não web ou quando o DOM não fornece informações confiáveis suficientes.

Ao usar o modo de imagem, o destino deve estar visível na tela no momento da segmentação. Para destinos fora da tela, uma atividade Mouse Scroll com a propriedade Elemento Para , colocada antes da ação do Seletor Semântico, traz o elemento para a visualização antes que a ação seja executada.

Para obter mais informações sobre seletores semânticos, consulte Sobre seletores semânticos.

  • Modo DOM
  • Modo de imagem
  • Relacionamento com o Computer Vision
  • Seleção de modelo
  • Orientação de uso
  • Conteúdo relacionado

Esta página foi útil?

Conectar

Precisa de ajuda? Suporte

Quer aprender? Academia UiPath

Tem perguntas? Fórum do UiPath

Fique por dentro das novidades