- Überblick
- UI-Automatisierung (UI Automation)
- Über das UIAutomation-Aktivitätspaket
- Mit UI-Automatisierung automatisierte Anwendungen und Technologien
- Projektkompatibilität
- UI-ANA-016 – URL zum Öffnen eines Browsers abrufen
- UI-ANA-017 – ContinueOnError True
- UI-ANA-018 – OCR-/Bildaktivitäten auflisten
- UI-DBP-006 – Containernutzung
- UI-DBP-013 – Falscher Gebrauch von Excel-Automatisierung
- UI-DBP-030 – Verwendung unzulässiger Variablen in Selektoren
- UI-DBP-031 – Aktivitätsverifizierung
- UI-PRR-001 – Klick simulieren
- UI-PRR-002 – Typ simulieren
- UI-PRR-003 – Offener Anwendungsmissbrauch
- UI-PRR-004 – Hartcodierte Verzögerungen
- UI-REL-001 – Große IDX in Selektoren
- UI-SEC-004 – Selektor-E-Mail-Daten
- UI-SEC-010 – App-/URL-Einschränkungen
- UI-USG-011 – Nicht zulässige Attribute
- UX-SEC-010 – App-/URL-Einschränkungen
- UX-DBP-029 – Unsichere Kennwortnutzung
- UI-PST-001 – Prüfungsprotokollebene in Projekteinstellungen
- UiPath-Browsermigrationstool
- Clippingbereich
- Computer Vision Recorder
- Aktivitätenindex
- Aktivieren (Activate)
- Ankerbasis (Anchor Base)
- Browser anhängen (Attach Browser)
- Fenster anhängen (Attach Window)
- Benutzeingabe blockieren (Block User Input)
- Textfeld (Callout)
- Prüfen (Check)
- Klicken (Click)
- Bild anklicken (Click Image)
- Bild-Trigger anklicken (Click Image Trigger)
- OCR-Text anklicken (Click OCR Text)
- Text anklicken (Click Text)
- Trigger anklicken (Click Trigger)
- Anwendung schließen (Close Application)
- Registerkarte schließen (Close Tab)
- Fenster schließen (Close Window)
- Kontextbewusster Anker
- Ausgewählten Text kopieren (Copy Selected Text)
- Element Attribute Change Trigger
- Element vorhanden (Element Exists)
- Elementumfang (Element Scope)
- Element State Change Trigger
- Export UI Tree
- Strukturierte Daten extrahieren (Extract Structured Data)
- Untergeordnete Elemente finden (Find Children)
- Element finden (Find Element)
- Bild finden (Find Image)
- Bildübereinstimmung finden (Find Image Matches)
- OCR-Textposition finden (Find OCR Text Position)
- Relatives Element finden (Find Relative Element)
- Textposition finden (Find Text Position)
- Aktives Fenster abrufen (Get Active Window)
- Vorgänger-Element erhalten (Get Ancestor)
- Attribut erhalten (Get Attribute)
- Ereignisinfo erhalten (Get Event Info)
- Aus Zwischenablage erhalten (Get From Clipboard)
- Volltext erhalten (Get Full Text)
- OCR-Text erhalten (Get OCR Text)
- Passwort erhalten (Get Password)
- Position erhalten (Get Position)
- Quellelement erhalten (Get Source Element)
- Text erhalten (Get Text)
- Sichtbaren Text erhalten (Get Visible Text)
- Zurück (Go Back)
- Weiter (Go Forward)
- Zur Startseite (Go Home)
- Google Cloud Vision OCR
- Fenster ausblenden (Hide Window)
- Markieren (Highlight)
- Hotkey-Trigger (Hotkey Trigger)
- Darauf zeigen (Hover)
- Auf Bild zeigen (Hover Image)
- Auf OCR-Text zeigen (Hover OCR Text)
- Text beim Darauf zeigen (Hover Text)
- Bild vorhanden (Image Exists)
- Auf Bildschirm anzeigen (Indicate On Screen)
- .NET-Code einfügen
- Inject Js Script
- ActiveX-Methode aufrufen
- Tastendruck-Trigger (Key Press Trigger)
- Bild laden (Load Image)
- Fenster maximieren (Maximize Window)
- Microsoft Azure ComputerVision OCR
- Microsoft OCR
- Microsoft Project Oxford Online OCR
- Fenster minimieren (Minimize Window)
- Ereignisse überwachen (Monitor Events)
- Maus-Trigger (Mouse Trigger)
- Fenster verschieben (Move Window)
- Navigieren zu (Navigate To)
- OCR-Text vorhanden (OCR Text Exists)
- Auf Element erscheinen (On Element Appear)
- Auf Element verschwinden (On Element Vanish)
- Auf Bild erscheinen (On Image Appear)
- Auf Bild verschwinden (On Image Vanish)
- Anwendung öffnen (Open Application)
- Browser öffnen (Open Browser)
- Browser aktualisieren (Refresh Browser)
- Benutzerereignis wiedergeben (Replay User Event)
- Fenster wiederherstellen (Restore Window)
- Bild speichern (Save Image)
- Objekt auswählen (Select Item)
- Mehrere Objekte auswählen (Select Multiple Items)
- Hotkey senden (Send Hotkey)
- Ausschneidebereich einstellen (Set Clipping Region)
- Fokus legen auf (Set Focus)
- Text einstellen (Set Text)
- Auf Zwischenablage setzen (Set To Clipboard)
- Web-Attribut setzen (Set Web Attribute)
- Fenster anzeigen (Show Window)
- Prozess starten (Start Process)
- System-Trigger (System Trigger)
- Screenshot anfertigen (Take Screenshot)
- Tesseract OCR
- Text vorhanden (Text Exists)
- Tooltip
- Eingeben in (Type Into)
- Sicheren Text eingeben (Type Secure Text)
- Vordergrund verwenden
- Attribut abwarten (Wait Attribute)
- Warten, bis Element verschwindet (Wait Element Vanish)
- Warten, bis Bild verschwindet (Wait Image Vanish)
- Prüfung der Barrierefreiheit
- Application event trigger
- Benutzeingabe blockieren (Block User Input)
- Check/Uncheck
- Check App State
- Check Element
- Klicken (Click)
- Click Event Trigger
- Ziehen und Ablegen
- Elementumfang (Element Scope)
- Extract Table Data
- Find Elements
- For Each UI Element
- Get Browser Data
- Clipboard abrufen
- Text erhalten (Get Text)
- Get URL
- Zu URL wechseln
- Markieren (Highlight)
- Darauf zeigen (Hover)
- Inject Js Script
- Tastenkombinationen
- Keypress Event Trigger
- Mouse Scroll
- Navigate Browser
- Bild speichern (Save Image)
- Objekt auswählen (Select Item)
- Set Browser Data
- Clipboard festlegen
- Legen Sie den CV-Server fest
- Set Runtime Browser
- Fokus legen auf (Set Focus)
- Projekteinstellung festlegen
- Text einstellen (Set Text)
- Screenshot anfertigen (Take Screenshot)
- Eingeben in (Type Into)
- Unblock User Input
- Window operation
- Anhängen
- Prüfen (Check)
- Klicken (Click)
- Ziehen und Ablegen
- Daten extrahieren
- Attribut erhalten (Get Attribute)
- GetChildren
- GetRuntimeTarget
- GetText
- Get URL
- GoToUrl
- Markieren (Highlight)
- Darauf zeigen (Hover)
- IsEnabled
- Tastaturkürzel (Keyboard Shortcut)
- Mouse Scroll
- Offen
- Objekt auswählen (Select Item)
- Screenshot anfertigen (Take Screenshot)
- Eingeben in (Type Into)
- Wartestatus
- Führen Sie eine Browsersuche durch und rufen Sie Ergebnisse mithilfe von UIAutomation-APIs ab
- Web-Browsing
- Finden von Bildern
- Klicken auf Bilder
- Auslösen und Überwachen von Ereignissen
- Erstellen und Überschreiben von Dateien
- HTML-Seiten: Extrahieren und Bearbeiten von Informationen
- Bearbeiten von Fenstern
- Automatisierte Listenauswahl
- Finden und Bearbeiten von Fensterelementen
- Verwalten der Textautomatisierung
- Laden und Verarbeiten von Bildern
- Verwalten von mausaktivierten Aktionen
- Automatisieren der Anwendungslaufzeit
- Automatisierte Ausführung einer lokalen Anwendung
- Browsernavigation
- Web-Automatisierung
- Beispiel für Trigger Scope
- Aktivieren der Unterstützung für die UI-Automatisierung in DevExpress
- Computer Vision Local Server
- Mobile Automation
- Versionshinweise
- Über die Architektur der Automatisierung von Mobilgeräten
- Projektkompatibilität
- Get Log Types
- Get Logs
- Get Page Source
- Get Device Orientation
- Get Session Identifier
- Install App
- Manage Current App
- Manage Other App
- DeepLink öffnen
- Open URL
- Mobile Device Connection
- Richtungswechsel
- Muster zeichnen
- Positional Swipe
- Press Hardware Button
- Set Device Orientation
- Screenshot anfertigen (Take Screenshot)
- Take Screenshot Part
- Element vorhanden (Element Exists)
- Execute Command
- Attribut erhalten (Get Attribute)
- Get Selected Item
- Text erhalten (Get Text)
- Set Selected Item
- Text einstellen (Set Text)
- Wischen
- Tap
- Type Text
- Terminal
- Versionshinweise
- Über das Terminal-Aktivitätspaket
- Projektkompatibilität
- Best Practices
- Find Text
- Get Color At Position
- Get Cursor Position
- Feld erhalten (Get Field)
- Feld an Position erhalten (Get Field at Position)
- Bildschirmbereich erhalten (Get Screen Area)
- Text erhalten (Get Text)
- Text an Position erhalten (Get Text at Position)
- Cursor bewegen (Move Cursor)
- Move Cursor to Text
- Strg-Taste senden (Send Control Key)
- Tasten senden (Send Keys)
- Sichere Tasten senden (Send Keys Secure)
- Feld setzen (Set Field)
- Feld an Position setzen (Set Field at Position)
- Terminalsitzung (Terminal Session)
- Warte auf Feldtext (Wait Field Text)
- Wait Screen Ready
- Warte auf Bildschirmtext (Wait Screen Text)
- Warte auf Text an Position (Wait Text at Position)
- Terminalcodierte Automatisierungs-APIs
Suchmethoden für semantische Selektoren: DOM und Bildmodi für das Anvisieren von UI-Elementen nach Bedeutung und wann sie jeweils verwendet werden sollen.
Mit semantischen Selektoren können Sie UI-Elemente basierend auf ihrer Bedeutung angeben, nicht nur auf herkömmlichen Selektorattributen. Sie beschreiben das Element, mit dem Sie interagieren möchten, und UiPath identifiziert mithilfe von KI das am besten übereinstimmende Ziel.
Semantische Selektoren unterstützen zwei Suchmethoden:
- DOM (Document Object Model) – Die Standardsuchmethode für Webanwendungen. Es verwendet Informationen, die aus dem Anwendungs-DOM extrahiert wurden.
- Bild – die standardmäßige Suchmethode für Nicht-Webanwendungen. Es nutzt das sichtbare Bildschirmbild und die Bildgrundlagenfunktionen moderner multimodaler Modelle.
DOM-Modus
Im DOM-Modus durchsucht UiPath das DOM nach dem Zielelement. Dieser Modus verwendet den DOM Extractor von UiPath, um strukturierte Informationen über die Seite zu sammeln, und sendet diese Informationen dann an ein Large Language Model (LLM), um UI-Elemente basierend auf ihrer semantischen Beschreibung abzugleichen.
Der DOM-Modus wird empfohlen, wenn das Ziel durch im DOM verfügbare Informationen identifiziert werden kann, z. B.:
- sichtbarer Text;
- Beschriftungen;
- Rollen
- Attribute
- Elementhierarchie;
- strukturierte Beziehungen zwischen Elementen.
Der DOM-Modus kann jedes im DOM verfügbare Element erreichen, einschließlich Elemente, die sich außerhalb des Bildschirms befinden. Dies ist nützlich für Webanwendungen, bei denen das Zielelement in der Seitenstruktur vorhanden ist, auch wenn es im Ansichtsfenster nicht sichtbar ist.
Der DOM-Modus ist weniger präzise, wenn die wichtigsten Erkennungsmerkmale visuell sind, z. B. eine bestimmte Symbolform, Farbe, Stil oder visuelle Position. Der DOM-Modus ist auch nicht für Nicht-Webanwendungen verfügbar.
Der produktinterne Tooltip fasst den DOM-Modus wie folgt zusammen: „Durchsucht das DOM. Erreicht jedes Element, einschließlich außerhalb des Bildschirms. Weniger präzise bei visuellen Details. Nicht verfügbar für Nicht-Webanwendungen.“
Bildmodus
Im Bildmodus suchen semantische Selektoren das sichtbare Bildschirmbild anstelle des DOM. Der Bildmodus kann Objekte erkennen und analysieren, die auf dem Bildschirm sichtbar sind, einschließlich Symbole, Farben, Stile, Layout und visuelle Beziehungen.
Dieser Modus verwendet die Bildgrundlagenfunktionen der neuesten multimodalen Modelle. Diese Modelle können nicht nur verstehen, dass ein Element vorhanden ist, sondern auch, wo es auf dem Bildschirm erscheint und wie es in Bezug auf die umgebende Benutzeroberfläche aussieht.
Der Bildmodus ist die bessere Wahl, wenn das Ziel durch sein Aussehen zuverlässiger als durch seine Struktur beschrieben wird, zum Beispiel:
- ein Symbol mit einer bestimmten Form oder Farbe;
- eine Taste, die visuell deutlich erkennbar ist, aber im DOM schlecht beschrieben ist;
- eine Kachel oder Karte, die durch Farbe, Position oder Stil identifiziert wird;
- ein Warn-, Status- oder Aktionssymbol;
- ein Steuerelement in einer Nicht-Webanwendung;
- ein Bildschirm, auf dem DOM-Informationen unvollständig, laut oder nicht verfügbar sind.
Der Bildmodus kann beispielsweise auf „die grüne Kachel für Vertriebsmöglichkeiten“, „das blaue Symbol neben dem Suchfeld“ oder „das Warnsymbol in der rechten oberen Ecke“ ausgerichtet sein.
Da der Bildmodus über das Bildschirmbild funktioniert, ist er auf das sichtbare Element beschränkt. Wenn ein Element zur Zielzeit außerhalb des Bildschirms, ausgeblendet oder nicht visuell gerendert ist, kann der Bildmodus es auf dem aktuellen Screenshot nicht identifizieren.
Bei Zielen außerhalb des Bildschirms bringt eine Aktivität Mouse Scroll mit der Eigenschaft Zu Element , die vor der Aktion „Semantischer Selektor“ platziert ist, das Element ins Sichtfeld, bevor die Aktion ausgeführt wird.
Der produktinterne Tooltip fasst den Bildmodus als „Durchsucht das Bildschirmbild“ zusammen. Erkennt jedes Objekt auf dem Bildschirm, einschließlich Symbole, Farben und Stile. Auf das Sichtbare beschränkt.“
Beziehung mit Computer Vision
Der Bildmodus ist die natürliche Weiterentwicklung der Computer Vision-Technologie von UiPath.
Computer Vision verwendet KI-basierte Objekterkennung, um UI-Elemente auf dem Bildschirm zu erkennen. Sie bleibt im einheitlichen Ziel verfügbar und ist weiterhin eine wichtige Zielmethode. Da Computer Vision auf einem dedizierten Objektempfänger basiert, ist es stabiler und deterministischer in Szenarien, die eine vorhersehbare visuelle Elementerkennung erfordern.
Der Bildmodus baut auf der gleichen Richtung – mit visuellem Verständnis zur Interaktion mit Anwendungen, wenn herkömmliche Selektoren nicht ausreichen – führt jedoch einen flexibleren Ansatz ein. Es verwendet moderne multimodale Modelle, die das Vollbildmodus nutzen und Elemente basierend auf Beschreibungen in natürlicher Sprache abgleichen. Die folgende Tabelle fasst die einzelnen Methoden zusammen:
| Method | Verwenden Sie sie, wenn |
|---|---|
| Computer Vision | Sie benötigen eine stabile, deterministische visuelle Objekterkennung. |
| Bildmodus | Sie möchten eine flexible semantische Zielausrichtung basierend auf sichtbaren visuellen Attributen. |
| DOM-Modus | Das Element kann zuverlässig aus den DOM-Informationen identifiziert werden. |
Computer Vision bleibt Teil des einheitlichen Ziels und wird nicht durch die Bildsuchmethode der semantischen Selektoren ersetzt.
Modellauswahl
Semantische Selektoren enthalten ein Modell -Dropdownmenü unter Projekteinstellungen > UI-Automatisierung > Semantischer Selektor , mit dem Sie das zugrunde liegende Modell auswählen können, das für das semantische Ziel für jede verfügbare Suchmethode verwendet wird.
Für den DOM-Modus sind zwei Modelle verfügbar:
| Modell | Beschreibung |
|---|---|
| Gemini 2.5 Flash | Ein Modell für das semantische Verständnis von DOM-extrahierten Informationen. Geeignet, wenn das Ziel durch die im DOM verfügbaren Informationen beschrieben werden kann. |
| Path Mini | Das schnelle und kompakte Modell von UiPath, das für starke Leistung bei gleichzeitiger Optimierung von Geschwindigkeit und Effizienz entwickelt wurde. PathMini unterstützt sowohl die Computernutzung als auch die Bildgrundlage für semantische Selektoren. |
Für die Transparenz basiert PathMini auf einem fein abgestimmten Qwen-Modell.
Für den Bildmodus können semantische Selektoren nur PathMini verwenden, da es die Bildgrundlage unterstützt und das sichtbare Bildschirmbild nutzen kann.
Nutzungsanleitung
Der DOM-Modus ist die Standardoption für Webanwendungen, wenn das Ziel durch Text, Beschriftungen, Rollen, Attribute oder die im DOM verfügbare Struktur identifiziert werden kann. Der DOM-Modus ist auch nützlich, wenn das Ziel im DOM vorhanden, aber auf dem Bildschirm nicht sichtbar ist.
Der Bildmodus ist die bessere Option, wenn das Ziel durch sein Aussehen beschrieben wird, wenn Farbe, Symbolform, Stil, visuelle Position oder das umgebende Layout relevanter sind als DOM-Attribute. Der Bildmodus ist auch nützlich für Nicht-Webanwendungen oder wenn das DOM nicht genügend zuverlässige Informationen bereitstellt.
Wenn Sie den Bildmodus verwenden, muss das Ziel zur Zielzeit auf dem Bildschirm sichtbar sein. Bei Zielen außerhalb des Bildschirms bringt eine Aktivität Mouse Scroll mit der Eigenschaft Zu Element , die vor der Aktion „Semantischer Selektor“ platziert ist, das Element ins Sichtfeld, bevor die Aktion ausgeführt wird.
Zugehörige Inhalte
Weitere Informationen zu semantischen Selektoren finden Sie unter Über semantische Selektoren.