- Visão geral
- Automação de Interface Gráfica
- Sobre o pacote de atividades UIAutomation
- Aplicativos e tecnologias automatizados com a Automação de Interface Gráfica
- Compatibilidade do projeto
- UI-ANA-016 - Extrair URL de navegador aberto
- UI-ANA-017 - ContinuarComErro verdadeiro
- UI-ANA-018 - Listar atividades de OCR/Imagem
- UI-DBP-006 - Uso do contêiner
- UI-DBP-013 - Uso Incorreto da Automação do Excel
- UI-DBP-030 - Uso de variáveis proibidas em seletores
- UI-DBP-031 - Verificação de atividades
- UI-PRR-001 - Simular clique
- UI-PRR-002 - Simular Digitação
- UI-PRR-003 - Uso incorreto do aplicativo aberto
- UI-PRR-004 - Atrasos Embutidos em Código
- UI-REL-001 - Idx grande em Seletores
- UI-SEC-004 - Dados de e-mail do seletor
- UI-SEC-010 — restrições de app/URL
- UI-USG-011 - Atributos não permitidos
- UX-SEC-010 — restrições de app/URL
- UX-DBP-029 - Uso de senha não segura
- UI-PST-001 - Nível de log de auditoria nas configurações do projeto
- Ferramenta de Migração de Navegador do UiPath
- Região do Recorte
- Computer Vision Recorder
- Índice de atividades
- Ativar
- Anchor Base
- Anexar Navegador
- Anexar Janela
- Block User Input
- Texto Explicativo
- Marcar
- Click
- Clicar na Imagem
- Click Image Trigger
- Click OCR Text
- Clicar no Texto
- Click Trigger
- Close Application
- Fechar Guia
- Close Window
- Context Aware Anchor
- Copy Selected Text
- Element Attribute Change Trigger
- Element Exists
- Element Scope
- Element State Change Trigger
- Export UI Tree
- Extrair Dados Estruturados
- Find Children
- Localizar Elemento
- Localizar Imagem
- Find Image Matches
- Find OCR Text Position
- Localizar Elemento Relativo
- Find Text Position
- Get Active Window
- Get Ancestor
- Get Attribute
- Get Event Info
- Get From Clipboard
- Obter Texto Completo
- Get OCR Text
- Get Password
- Get Position
- Get Source Element
- Get Text
- Obter Texto Visível
- Voltar
- Avançar
- Ir para a Página Inicial
- Google Cloud Vision OCR
- Hide Window
- Highlight
- Hotkey Trigger
- Hover
- Focalizar Imagem
- Hover OCR Text
- Focalizar Texto
- Imagem Existe
- Indicate On Screen
- Inject .NET Code
- Inject Js Script
- Invoke ActiveX Method
- Key Press Trigger
- Carregar Imagem
- Maximize Window
- Microsoft Azure Computer Vision OCR
- Microsoft OCR
- Microsoft Project Oxford Online OCR
- Minimize Window
- Monitorar eventos
- Mouse Trigger
- Move Window
- Navegar Para
- OCR Text Exists
- On Element Appear
- On Element Vanish
- Aparecer Na Imagem
- Desaparecer Na Imagem
- Abrir Aplicativo
- Abrir Navegador
- Atualizar Navegador
- Replay User Event
- Restore Window
- Save Image
- Select Item
- Select Multiple Items
- Enviar Tecla de Acesso
- Set Clipping Region
- Set Focus
- Set Text
- Set To Clipboard
- Set Web Attribute
- Show Window
- Iniciar Processo
- System Trigger
- Take Screenshot
- Tesseract OCR
- Texto Existe
- Dica de ferramenta
- Type Into
- Digitar Texto Seguro
- Use Foreground
- Wait Attribute
- Esperar Elemento Desaparecer
- Aguardar Imagem Desaparecer
- Verificação de acessibilidade
- Application event trigger
- Block User Input
- Check/Uncheck
- Check App State
- Check Element
- Click
- Click Event Trigger
- Drag and Drop
- Element Scope
- Extract Table Data
- Localizar elementos
- For Each UI Element
- Get Browser Data
- Obter Área de Transferência
- Get Text
- Get URL
- Go To URL
- Highlight
- Hover
- Inject Js Script
- Keyboard Shortcuts
- Keypress Event Trigger
- Mouse Scroll
- Navigate Browser
- Save Image
- Select Item
- Set Browser Data
- Definir Área de Transferência
- Definir servidor CV
- Set Runtime Browser
- Set Focus
- Definir configuração do projeto
- Set Text
- Take Screenshot
- Type Into
- Unblock User Input
- Window operation
- Realize pesquisa no navegador e recupere resultados usando APIs de Automação de interface gráfica
- Navegação na Web
- Localizar imagens
- Clicar em imagens
- Disparar e monitorar eventos
- Criar e substituir arquivos
- Páginas HTML: extrair e manipular informações
- Manipulação de janelas
- Seleção automatizada de listas
- Localizar e manipular elementos de janela
- Gerenciar automação de texto
- Carregar e processar imagens
- Gerenciar ações ativadas pelo mouse
- Automatizar o runtime de aplicativos
- Execução automatizada de um aplicativo local
- Navegação em navegador
- Automação da Web
- Exemplo de escopo de disparador
- Habilitar o suporte de Automação de Interface Gráfica no DevExpress
- Computer Vision Local Server
- Automação Móvel
- Notas de versão
- Sobre a arquitetura de automação de dispositivos móveis
- Compatibilidade do projeto
- Get Log Types
- Get Logs
- Get Page Source
- Get Device Orientation
- Get Session Identifier
- Instalar Aplicativo
- Gerenciar Aplicativo Atual
- Manage Other App
- Open DeepLink
- Abrir URL
- Mobile Device Connection
- Deslizar Direcional
- Padrão de Desenho
- Positional Swipe
- Press Hardware Button
- Set Device Orientation
- Take Screenshot
- Obter parte da captura de tela
- Element Exists
- Execute Command
- Get Attribute
- Get Selected Item
- Get Text
- Set Selected Item
- Set Text
- Deslizar
- Tap
- Type Text
- Terminal
- Notas de versão
- Sobre o pacote de atividades Terminal
- Compatibilidade do projeto
- Melhores práticas
- Find Text
- Get Color At Position
- Get Cursor Position
- Get Field
- Obter Campo na Posição
- Obter Área da Tela
- Get Text
- Obter Texto na Posição
- Mover Cursor
- Mover cursor para o texto
- Enviar Tecla de Controle
- Send Keys
- Send Keys Secure
- Set Field
- Definir Campo na Posição
- Terminal Session
- Aguardar Texto do Campo
- Wait Screen Ready
- Aguardar Texto da Tela
- Aguardar Texto na Posição
- APIs de automação codificadas em terminais
Métodos de localização do seletor semântico: modos DOM e Imagem para segmentar elementos de interface gráfica por significado e quando usar cada um deles.
Os seletores semânticos permitem que você indique elementos de interface gráfica com base em seu significado, não apenas nos atributos do seletor tradicional. Você descreve o elemento com o qual deseja interagir, e a UiPath usa IA para identificar o melhor destino de correspondência.
Os seletores semânticos são compatíveis com dois métodos de localização:
- DOM (Modelo de Objeto de Documento) — o método de localização padrão para aplicativos da Web. Ele usa informações extraídas do aplicativo DOM.
- Imagem — o método de localização padrão para aplicativos não web. Ele usa a imagem da tela visível e os recursos de embasamento de imagem de modelos multimodais modernos.
Modo DOM
No modo DOM, a UiPath pesquisa o DOM para encontrar o elemento de destino. Esse modo usa o DOM Extractor da UiPath para coletar informações estruturadas sobre a página e, em seguida, envia essas informações para um grande modelo de linguagem (LLM) para corresponder os elementos da interface gráfica com base em sua descrição semântica.
O modo DOM é recomendado quando o destino pode ser identificado por meio de informações disponíveis no DOM, como:
- texto visível;
- rótulos;
- funções;
- atributos;
- hierarquia de elementos;
- relações estruturados entre elementos.
O modo DOM pode alcançar qualquer elemento disponível no DOM, incluindo elementos que estão fora da tela. Isso o torna útil para aplicativos web em que o elemento de destino existe na estrutura da página mesmo quando não está visível na janela de visualização.
O modo DOM é menos preciso quando as características de identificação mais importantes são visuais, como uma forma de ícone específica, cor, estilo ou posição visual. O modo DOM também não está disponível para aplicativos não web.
A dica de ferramenta no produto resume o modo DOM como: "Pesquisa o DOM. Atinge qualquer elemento, incluindo fora da tela. Menos preciso nos detalhes visuais. Não disponível em aplicativos não web."
Modo de imagem
No modo de imagem, os seletores semânticos pesquisam a imagem da tela visível em vez do DOM. O modo de imagem pode detectar e raciocinar sobre objetos visíveis na tela, incluindo ícones, cores, estilos, layout e relações visuais.
Esse modo usa os recursos de embasamento de imagem dos modelos multimodais mais recentes. Esses modelos podem entender não apenas que um elemento existe, mas também onde ele aparece na tela e como ele se parece em relação à interface gráfica ao redor.
O modo de imagem é a melhor escolha quando o destino é descrito de forma mais confiável por sua aparência do que por sua estrutura, por exemplo:
- um ícone com uma forma ou cor específica;
- um botão visualmente distinto, mas mal descrito no DOM;
- um bloco ou cartão identificado por sua cor, posição ou estilo;
- um ícone de aviso, status ou ação;
- um controle em um aplicativo não web;
- uma tela em que as informações do DOM estão incompletas, ruidosas ou indisponíveis.
Por exemplo, o modo de imagem pode segmentar "o bloco verde Oportunidades de vendas", "o ícone azul ao lado do campo de pesquisa" ou "o ícone de aviso no canto superior direito".
Como o modo de imagem funciona a partir da imagem da tela, ele é limitado ao que está visível. Se um elemento estiver fora da tela, oculto ou não renderizado visualmente no tempo de segmentação, o modo de imagem não poderá identificá-lo na captura de tela atual.
Para destinos fora da tela, uma atividade Mouse Scroll com a propriedade Elemento Para , colocada antes da ação do Seletor Semântico, traz o elemento para a visualização antes que a ação seja executada.
A dica de ferramenta no produto resume o modo de imagem como: "Pesquisa a imagem da tela. Detecta qualquer objeto na tela, incluindo ícones, cores e estilos. Limitada ao que estiver visível."
Relacionamento com o Computer Vision
O modo de imagem é a evolução natural da tecnologia Computer Vision da UiPath.
O Computer Vision usa a detecção de objetos baseada em IA para identificar elementos de interface gráfica na tela. Ele permanece disponível no Destino Unificado e continua a ser um importante método de segmentação. Como o Computer Vision é baseado em um detectado de objetos dedicado, ele é mais estável e determinista em cenários que exigem a detecção de elementos visuais previsíveis.
O modo de imagem baseia-se na mesma direção — usando a compreensão visual para interagir com aplicativos quando os seletores tradicionais não são suficientes — mas introduz uma abordagem mais flexível. Usa modelos multimodais modernos que raciocinam sobre a imagem de tela cheia e correspondem elementos com base em descrições em linguagem natural. A tabela a seguir resume quando usar cada método:
| Método | Use-o ao |
|---|---|
| Computer Vision | Você precisa de uma detecção visual de objetos estável e determinística. |
| Modo de imagem | Você deseja uma segmentação semântica flexível com base em atributos visuais visíveis. |
| Modo DOM | O elemento pode ser identificado de forma confiável a partir de informações do DOM. |
O Computer Vision permanece parte do Destino Unificado e não é substituído pelo método Encontrar Imagem de Seletores Semânticos.
Seleção de modelo
Os seletores semânticos incluem uma lista suspensa Modelo em Configurações do projeto > Automação de interface gráfica > Seletor semântico que permite escolher o modelo subjacente usado para a segmentação semântica para cada método de localização disponível.
Para o modo DOM, dois modelos estão disponíveis:
| Modelo | Description |
|---|---|
| Gemini 2.5 Flash | Um modelo para a compreensão semântica de informações extraídas do DOM. Adequado quando o destino puder ser descrito por meio das informações disponíveis no DOM. |
| Path Mini | O modelo rápido e compacto da UiPath, projetado para um desempenho forte enquanto otimiza a velocidade e a eficiência. O PathMini é compatível com recursos de Uso do Computador e embasamento de imagens para seletores semânticos. |
Para transparência, o PathMini é baseado em um modelo Qwen ajustado.
Para o modo de imagem, os seletores semânticos podem usar apenas o PathMini, porque ele é compatível com a imagem da tela e pode raciocinar sobre a imagem da tela visível.
Orientação de uso
O modo DOM é a opção padrão para aplicativos da Web quando o destino pode ser identificado por meio de texto, rótulos, funções, atributos ou estrutura disponível no DOM. O modo DOM também é útil quando o destino existe no DOM, mas não está visível na tela.
O modo de imagem é a melhor opção quando o destino é descrito por sua aparência, quando a cor, a forma do ícone, o estilo, a posição visual ou o layout ao redor são mais relevantes do que os atributos do DOM. O modo de imagem também é útil para aplicativos não web ou quando o DOM não fornece informações confiáveis suficientes.
Ao usar o modo de imagem, o destino deve estar visível na tela no momento da segmentação. Para destinos fora da tela, uma atividade Mouse Scroll com a propriedade Elemento Para , colocada antes da ação do Seletor Semântico, traz o elemento para a visualização antes que a ação seja executada.
Conteúdo relacionado
Para obter mais informações sobre seletores semânticos, consulte Sobre seletores semânticos.