- Información general
- Automatización de IU
- Acerca del paquete de actividades de automatización de IU
- Aplicaciones y tecnologías automatizadas con UI Automation
- Compatibilidad de proyectos
- UI-ANA-016: Introducir URL para abrir el navegador
- UI-ANA-017: ContinueOnError verdadero
- UI-ANA-018: enumerar actividades de OCR / imagen
- UI-DBP-006: uso del contenedor
- UI-DBP-013: uso incorrecto de la automatización de Excel
- UI-DBP-030: uso de variables prohibidas en selectores
- UI-DBP-031: verificación de actividad
- UI-PRR-001: Simular clic
- UI-PRR-002: Simular tipo
- UI-PRR-003: uso incorrecto de aplicación abierta
- UI-PRR-004: retrasos codificados
- UI-REL-001: Idx grande en selectores
- UI-SEC-004: datos de correo electrónico del selector
- UI-SEC-010: Restricciones de aplicaciones / URL
- UI-USG-011: atributos no permitidos
- UX-SEC-010: restricciones de aplicaciones / URL
- UX-DBP-029: uso no seguro de contraseña
- UI-PST-001: nivel de registro de auditoría en la configuración del proyecto
- Herramienta de migración del navegador de UiPath
- Recorte de región
- Grabadora de Computer Vision
- Acerca de la automatización de imágenes y texto
- Actividades con el ratón y el teclado
- Ejemplo de uso de la automatización de ratón y teclado
- Actividades de texto
- Ejemplo de uso de la automatización de texto
- Actividades de OCR
- Actividades de imagen
- Ejemplo de uso de la automatización de OCR y la automatización de imágenes
- Índice de actividades
- Activar
- Base de anclaje
- Asociar navegador
- Asociar ventana
- Bloquear entrada de usuario
- Aviso
- Comprobar
- Clic
- Clic en imagen
- Desencadenador de clic de imagen
- Clic en texto OCR
- Clic en el texto
- Desencadenador de clic
- Cerrar aplicación
- Cerrar pestaña
- Cerrar ventana
- Anclaje consciente de contexto
- Copiar texto seleccionado
- Desencadenador de cambio del atributo del elemento
- Elemento existente
- Ámbito del elemento
- Desencadenador de cambio de estado de elemento
- Exportar el árbol de la IU
- Extraer datos estructurados
- Buscar elementos secundarios
- Buscar elemento
- Buscar imagen
- Buscar coincidencias de imágenes
- Buscar texto OCR
- Buscar elemento relativo
- Buscar posición de texto
- Obtener ventana activa
- Obtener antecesor
- Obtener atributo
- Obtener información de atributo
- Obtener a partir del portapapeles
- Obtener texto completo
- Obtener texto OCR
- Obtener contraseña
- Obtener posición
- Obtener elemento de origen
- Obtener texto
- Obtener texto visible
- Volver
- Avanzar
- Ir a inicio
- Google Cloud Vision OCR
- Ocultar ventana
- Resaltar
- Desencadenador de tecla de acceso rápido
- Mantener el puntero
- Mantener el puntero en imagen
- Mantener el puntero sobre texto OCR
- Mantener el puntero en el texto
- Imagen existente
- Indicar en pantalla
- Insertar código .NET
- Inject Js Script
- Invocar método de ActiveX
- Desencadenador de pulsación de tecla
- Cargar imagen
- Maximizar ventana
- Microsoft Azure Computer Vision OCR
- Microsoft OCR
- Microsoft Project Oxford Online OCR
- Minimizar ventana
- Supervisar eventos
- Desencadenador del ratón
- Mover ventana
- Ir a
- Texto OCR existente
- Apariencia en elemento
- Fuga en elemento
- Apariencia en imagen
- Fuga en imagen
- Abrir aplicación
- Abrir navegador
- Actualizar navegador
- Reproducir evento de usuario
- Restaurar ventana
- Guardar imagen
- Seleccionar elemento
- Seleccionar varios elementos
- Enviar tecla de acceso rápido
- Establecer región de recorte
- Establecer foco
- Establecer texto
- Establecer en portapapeles
- Establecer atributo web
- Mostrar ventana
- Iniciar proceso
- Desencadenador del sistema
- Realizar captura
- Tesseract OCR
- Texto existente
- Información sobre herramientas
- Escribir en
- Escribir Texto Seguro
- Utilizar primer plano
- Esperar a atributo
- Esperar a fuga de elemento
- Esperar a fuga de imagen
- Comprobación de accesibilidad
- Desencadenador de eventos de aplicación
- Bloquear entrada de usuario
- Marcar/Desmarcar
- Comprobar estado de aplicación
- Comprobar elemento
- Clic
- Clic desencadenador de eventos
- Arrastrar y soltar
- Ámbito del elemento
- Extraer datos de tabla
- Buscar elementos
- Para cada elemento de interfaz de usuario
- Obtener datos del navegador
- Obtener Portapapeles
- Obtener texto
- Obtener URL
- Ir a URL
- Resaltar
- Mantener el puntero
- Inject Js Script
- Atajos del teclado
- Desencadenador de eventos de pulsación de tecla
- Desplazamiento del ratón
- Navegar por el navegador
- Guardar imagen
- Seleccionar elemento
- Establecer datos del navegador
- Configurar el portapapeles
- Establecer servidor de CV
- Establecer navegador de Runtime
- Establecer foco
- Establecer la configuración del proyecto
- Establecer texto
- Realizar captura
- Escribir en
- Desbloquear entrada de usuario
- Operación de ventana
- Transacción de llamada
- Clic en imagen en pantalla
- Hacer clic en botón de barra de herramientas
- Expandir tabla jerárquica ALV
- Expandir árbol ALV
- Expandir árbol
- Lectura de barra de estado
- Inicio de sesión en SAP
- Inicio de sesión en SAP
- Desencadenador de cambio de atributos de sesión de SAP
- Seleccionar fechas en el calendario
- Seleccionar elemento de menú
- Ámbito de la celda de la tabla
- Transacción de llamada
- Clic en imagen en pantalla
- Hacer clic en botón de barra de herramientas
- Expandir tabla jerárquica ALV
- Expandir árbol ALV
- Expandir árbol
- Lectura de barra de estado
- Inicio de sesión en SAP
- Inicio de sesión en SAP
- Seleccionar fechas en el calendario
- Seleccionar elemento de menú
- Ámbito de la celda de la tabla
- Realizar búsquedas en el navegador y recuperar resultados mediante las API de automatización de IU
- Exploración web
- Buscar imágenes
- Hacer clic en imágenes
- Eventos de desencadenador y supervisor
- Crear y anular archivos
- Páginas HTML: extraer y manipular información
- Manipulación de ventana
- Selección de lista automatizada
- Buscar y manipular elementos de ventana
- Gestionar automatización de texto
- Cargar y procesar imágenes
- Gestionar acciones activadas por el ratón
- Automatizar tiempo de ejecución de aplicación
- Ejecución automática de una aplicación local
- Navegación de explorador
- Automatización web
- Ejemplo de ámbito de desencadenador
- Habilitar soporte de automatización de IU en DevExpress
- Computer Vision Local Server
- Automatización móvil
- Notas relacionadas
- Acerca de la arquitectura de automatización de dispositivos móviles
- Compatibilidad de proyectos
- Obtener tipos de registro
- Obtener registros
- Obtener origen de la página
- Obtener la orientación del dispositivo
- Obtener identificador de sesión
- Instalar aplicación
- Administrar aplicación actual
- Administrar otras aplicaciones
- Abrir enlace profundo
- Abrir URL
- Conexión de dispositivo móvil
- Deslizamiento direccional
- Patrón de dibujo
- Pase de dedo posicional
- Pulse un botón del hardware
- Establecer orientación del dispositivo
- Realizar captura
- Tomar parte de la captura de pantalla
- Elemento existente
- Ejecutar comando
- Obtener atributo
- Obtener elemento seleccionado
- Obtener texto
- Establecer elemento seleccionado
- Establecer texto
- Deslizamiento
- Pulsar
- Escribir Texto
- Primeros pasos con las API de automatización móvil
- Gestionar cuadros de diálogo emergentes en automatizaciones móviles
- Creating variables from selector attributes
- Creación de flujos de trabajo de automatización móvil
- Utilizar automatización móvil para una aplicación de banca móvil
- Automatización para aplicaciones React Native
- Terminal
- Notas relacionadas
- Acerca del paquete de actividades de Terminal
- Compatibilidad de proyectos
- Mejores prácticas
- Buscar texto
- Obtener color de la posición
- Obtener la posición del cursor
- Obtener campo
- Obtener campo en posición
- Obtener área de pantalla
- Obtener texto
- Obtener texto en posición
- Mover cursor
- Mover cursor al texto
- Enviar tecla de control
- Teclas de envío
- Teclas de envío seguras
- Establecer campo
- Configurar campo en posición
- Sesión del terminal
- Esperar texto de campo
- Esperar a que la pantalla esté lista
- Esperar texto en pantalla
- Esperar texto en posición
- API de automatización codificadas de terminal
Métodos de búsqueda del selector semántico: modos DOM e Imagen para orientar elementos de IU por significado y cuándo utilizar cada uno.
Los selectores semánticos te permiten indicar elementos de la IU en función de su significado, no solo en los atributos del selector tradicional. Describes el elemento con el que deseas interactuar y UiPath utiliza IA para identificar el destino que mejor coincide.
Los selectores semánticos admiten dos métodos de búsqueda:
- DOM (modelo de objeto de documento) : el método de búsqueda predeterminado para aplicaciones web. Utiliza información extraída del DOM de la aplicación.
- Imagen : el método de búsqueda predeterminado para aplicaciones no web. Utiliza la imagen de pantalla visible y las capacidades de conexión a tierra de imagen de los modelos multimodales modernos.
Modo DOM
En el modo DOM, UiPath busca el DOM para encontrar el elemento de destino. Este modo utiliza el extractor DOM de UiPath para recopilar información estructurada sobre la página y luego envía esa información a un modelo lingüístico de gran tamaño (LLM) para que coincida con los elementos de la interfaz de usuario en función de su descripción semántica.
El modo DOM se recomienda cuando el destino puede identificarse a través de la información disponible en el DOM, como:
- texto visible;
- etiquetas;
- roles;
- atributos;
- jerarquía de elementos;
- relaciones estructurales entre elementos.
El modo DOM puede llegar a cualquier elemento disponible en el DOM, incluidos los elementos que están fuera de pantalla. Esto lo hace útil para aplicaciones web en las que el elemento de destino existe en la estructura de la página incluso cuando no es visible en la ventana gráfica.
El modo DOM es menos preciso cuando las características de identificación más importantes son visuales, como una forma, color, estilo o posición visual de icono específicos. El modo DOM tampoco está disponible para aplicaciones no web.
La información sobre herramientas del producto resume el modo DOM como: "Busca en el DOM. Llega a cualquier elemento, incluido el fuera de pantalla. Menos preciso en los detalles visuales. No disponible en aplicaciones no web".
Modo de imagen
En el modo Imagen, los selectores semánticos buscan la imagen de la pantalla visible en lugar del DOM. El modo de imagen puede detectar y razonar sobre objetos que son visibles en la pantalla, incluidos iconos, colores, estilos, diseño y relaciones visuales.
Este modo utiliza las capacidades de contextualización de imagen de los últimos modelos multimodales. Estos modelos pueden comprender no solo que un elemento existe, sino también dónde aparece en la pantalla y cómo se ve en relación con la IU que lo rodea.
El modo de imagen es la mejor opción cuando el destino se describe de forma más fiable por su aspecto que por su estructura, por ejemplo:
- un icono con una forma o color específico;
- un botón que es visualmente distinto pero mal descrito en el DOM;
- un mosaico o tarjeta identificada por su color, posición o estilo;
- un icono de advertencia, estado o acción;
- un control en una aplicación no web;
- una pantalla en la que la información DOM está incompleta, es ruidosa o no está disponible.
Por ejemplo, el modo Imagen puede orientar "el mosaico verde de Oportunidades de ventas", "el icono azul junto al campo de búsqueda" o "el icono de advertencia en la esquina superior derecha".
Como el modo Imagen funciona a partir de la imagen de la pantalla, se limita a lo que es visible. Si un elemento está fuera de pantalla, oculto o no se representa visualmente en el momento de la orientación, el modo de imagen no puede identificarlo en la captura de pantalla actual.
Para objetivos fuera de pantalla, una actividad Desplazamiento del ratón con la propiedad A elemento , colocada antes de la acción Selector semántico, trae el elemento a la vista antes de que se ejecute la acción.
La información sobre herramientas del producto resume Modo de imagen como: "Busca la imagen de la pantalla. Detecta cualquier objeto en la pantalla, incluidos iconos, colores y estilos. Limitado a lo que es visible".
Relación con Computer Vision
El modo Imagen es la evolución natural de la tecnología Computer Vision de UiPath.
Computer Vision utiliza la detección de objetos basada en IA para identificar los elementos de la interfaz de usuario en la pantalla. Sigue estando disponible en Destino unificado y sigue siendo un método de destino importante. Dado que Computer Vision se basa en un detector de objetos dedicado, es más estable y determinista en escenarios que requieren una detección predecible de elementos visuales.
El modo de imagen se basa en la misma dirección: utilizar la comprensión visual para interactuar con las aplicaciones cuando los selectores tradicionales no son suficientes, pero introduce un enfoque más flexible. Utiliza modelos multimodales modernos que razonan sobre la imagen de pantalla completa y hacen coincidir elementos en función de descripciones en lenguaje natural. La siguiente tabla resume cuándo utilizar cada método:
| Método | Úsalo cuando |
|---|---|
| Computer Vision | Necesitas una detección visual de objetos estable y determinista. |
| Modo de imagen | Quieres una orientación semántica flexible basada en atributos visuales visibles. |
| Modo DOM | El elemento puede identificarse de forma fiable a partir de la información del DOM. |
Computer Vision sigue formando parte de Unified Target y no se reemplaza por el método de búsqueda de imagen de los selectores semánticos.
Selección de modelo
Los selectores semánticos incluyen un menú desplegable Modelo en Configuración del proyecto > Automatización de IU > Selector semántico que te permite elegir el modelo subyacente utilizado para la orientación semántica para cada método de búsqueda disponible.
Para el modo DOM, hay dos modelos disponibles:
| Modelo | Descripción |
|---|---|
| Gemini 2.5 Flash | Un modelo para la comprensión semántica de la información extraída del DOM. Adecuado cuando el destino puede describirse a través de la información disponible en el DOM. |
| Path Mini | El modelo rápido y compacto de UiPath, diseñado para un rendimiento sólido a la vez que se optimiza para obtener velocidad y eficiencia. PathMini admite tanto las capacidades de uso del ordenador como la conexión a tierra de imágenes para los selectores semánticos. |
Para mayor transparencia, PathMini se basa en un modelo Qwen ajustado.
Para el modo Imagen, los selectores semánticos solo pueden utilizar PathMini, porque admite la conexión a tierra de imágenes y puede razonar sobre la imagen de pantalla visible.
Guía de uso
El modo DOM es la opción predeterminada para las aplicaciones web cuando el destino puede identificarse a través de texto, etiquetas, roles, atributos o estructura disponibles en el DOM. El modo DOM también es útil cuando el destino existe en el DOM pero no es visible en la pantalla.
El modo de imagen es la mejor opción cuando el destino se describe por su aspecto, cuando el color, la forma del icono, el estilo, la posición visual o el diseño circundante son más relevantes que los atributos DOM. El modo de imagen también es útil para aplicaciones no web o cuando el DOM no proporciona suficiente información fiable.
Al utilizar el modo de imagen, el objetivo debe ser visible en la pantalla en el momento de la orientación. Para objetivos fuera de pantalla, una actividad Desplazamiento del ratón con la propiedad A elemento , colocada antes de la acción Selector semántico, trae el elemento a la vista antes de que se ejecute la acción.
Contenido relacionado
Para obtener más información sobre los selectores semánticos, consulta Acerca de los selectores semánticos.