UiPath Documentation
activities
latest
false
UI Automation アクティビティ
重要 :
このコンテンツの一部は機械翻訳によって処理されており、完全な翻訳を保証するものではありません。 新しいコンテンツの翻訳は、およそ 1 ~ 2 週間で公開されます。

メソッドを検索する

セマンティック セレクターの検索方法: UI 要素を意味でターゲット設定するための DOM モードと画像モード、およびそれぞれをどのような場合に使用すべきか。

セマンティック セレクターを使用すると、従来のセレクターの属性だけでなく、意味に基づいて UI 要素を指定できます。操作する要素を記述すると、UiPath は AI を使用して、最も一致するターゲットを特定します。

セマンティック セレクターは、次の 2 つの検索メソッドをサポートしています。

  • DOM (ドキュメント オブジェクト モデル) — Web アプリケーションの既定の検索方法。アプリケーション DOM から抽出された情報を使用します。
  • 画像 — 非 Web アプリケーションのデフォルトの検索方法。最新のマルチモーダル モデルに表示される画面イメージとイメージ グラウンディング機能を使用します。

DOM モード

DOM モードでは、UiPath は DOM を検索してターゲット要素を見つけます。このモードでは、UiPath の DOM 抽出器を使用してページに関する構造化された情報を収集し、その情報を大規模言語モデル (LLM) に送信して、意味的記述に基づいて UI 要素を照合します。

DOM モードは、次のような DOM で入手可能な情報からターゲットを識別できる場合に推奨されます。

  • 表示されるテキスト
  • ラベル
  • 役割;
  • 属性;
  • 要素階層
  • 要素間の構造的関係。

DOM モードは、画面外の要素を含む、DOM で使用可能な任意の要素に到達できます。このため、ターゲット要素がビューポートに表示されない場合でもページ構造に存在する Web アプリケーションで役立ちます。

DOM モードは、最も重要な識別特性が特定のアイコンの形状、色、スタイル、視覚的な位置など、視覚的なものである場合の精度が低くなります。DOM モードは、非 Web アプリケーションでも利用できません。

注:

製品内のツールチップでは、DOM モードが次のように要約されています。画面外を含む任意の要素に到達します。視覚的な詳細の精度が低い。Web 以外のアプリケーションでは使用できません。

画像モード

画像モードでは、セマンティック セレクターは DOM ではなく表示されている画面画像を検索します。画像モードでは、アイコン、色、スタイル、レイアウト、視覚的な関係など、画面に表示されているオブジェクトを検出して推論できます。

このモードでは、最新のマルチモーダル モデルの画像グラウンディング機能が使用されます。これらのモデルは、要素が存在することだけでなく、画面上のどこに表示されているか、周囲の UI との関係でどのように見えるかも理解できます。

画像モードは、ターゲットが構造よりも見た目によってより確実に記述されている場合に適しています。

  • 特定の形や色のアイコン
  • 視覚的に区別できるが、DOMでの説明が不十分なボタン。
  • 色、位置、またはスタイルで識別されるタイルまたはカード。
  • 警告、ステータス、またはアクション アイコン
  • Web 以外のアプリケーションのコントロール。
  • DOM 情報が不完全、ノイズが多い、または使用できない画面。

たとえば、画像モードでは、「緑色の営業案件タイル」、「検索フィールドの横にある青いアイコン」、または「右上隅の警告アイコン」をターゲットにできます。

画像モードは画面画像から機能するため、表示されているものに限定されます。ターゲット設定時に要素が画面外にあるか、非表示であるか、視覚的にレンダリングされていない場合、画像モードでは現在のスクリーンショットからその要素を識別できません。

画面外のターゲットの場合、[ マウス スクロール] アクティビティで [ 要素まで ] プロパティをセマンティック セレクター アクションの前に配置すると、アクションの実行前に要素が表示されます。

注:

製品内のツールチップでは、画像モードが次のように要約されています。アイコン、色、スタイルなど、画面上の任意のオブジェクトを検出します。目に見えるものに限定されています。」

Computer Vision との関係

画像モードは、UiPath の Computer Vision テクノロジが自然に進化したものです。

Computer Vision は、AI ベースのオブジェクト検出を使用して画面上の UI 要素を識別します。これは統合ターゲットで引き続き使用でき、今後も重要なターゲット メソッドです。Computer Vision は専用のオブジェクト検出に基づいているため、予測可能な視覚的な要素検出を必要とするシナリオにおいて、より安定して確定的です。

画像モードは、従来のセレクターでは不十分な場合に、視覚的な理解を使用してアプリケーションを操作するという同じ方向に基づいて構築されていますが、より柔軟なアプローチが導入されています。最新のマルチモーダル モデルを使用しており、全画面表示の画像を推論し、自然言語の説明に基づいて要素を照合します。以下の表は、各メソッドをどのような場合に使用するかをまとめたものです。

メソッド次の場合に使用します
Computer Vision安定した確定的な視覚的オブジェクト検出が必要です。
画像モード目に見える視覚属性に基づいた柔軟なセマンティック ターゲット設定が必要です。
DOM モードDOM 情報から要素を確実に識別できます。

Computer Vision は引き続き統合ターゲットの一部であり、セマンティック セレクターの画像検索メソッドに置き換えられることはありません。

モデルの選択

セマンティック セレクターには、[プロジェクト設定] > [UI Automation] > [セマンティック セレクター] に [モデル] ドロップダウンがあります。セマンティック セレクターでは、利用可能な検索メソッドごとに、セマンティック ターゲットのターゲット設定に使用する基になるモデルを選択できます。

DOM モードでは、次の 2 つのモデルを使用できます。

モデル説明
Gemini 2.5 FlashDOM で抽出された情報に対する意味的理解のモデル。DOM で入手可能な情報を通じてターゲットを記述できる場合に適しています。
Path MiniUiPath の高速でコンパクトなモデルは、速度と効率を最適化しながら、強力なパフォーマンスを発揮するように設計されています。PathMiniは、セマンティックセレクターのコンピューター使用機能と画像グラウンディングの両方をサポートしています。

透明性のために、PathMiniは微調整されたQwenモデルに基づいています。

画像モードの場合、セマンティックセレクターは PathMini のみを使用できます。これは、画像グラウンディングをサポートし、表示されている画面イメージを推論できるためです。

利用案内

DOM モードは、DOM で使用可能なテキスト、ラベル、ロール、属性、または構造によってターゲットを識別できる場合の Web アプリケーションのデフォルトオプションです。DOM モードは、ターゲットが DOM に存在するが画面に表示されない場合にも便利です。

画像モードは、ターゲットの外観によって記述され、色、アイコンの形状、スタイル、視覚的な位置、または周囲のレイアウトが DOM 属性よりも関連性の高い場合に適しています。画像モードは、Web 以外のアプリケーションや、DOM が十分な信頼できる情報を提供しない場合にも役立ちます。

画像モードを使用する場合、ターゲットはターゲット時に画面に表示されている必要があります。画面外のターゲットの場合、[ マウス スクロール] アクティビティで [ 要素まで ] プロパティをセマンティック セレクター アクションの前に配置すると、アクションの実行前に要素が表示されます。

セマンティック セレクターについて詳しくは、「 セマンティック セレクターについて」をご覧ください

  • DOM モード
  • 画像モード
  • Computer Vision との関係
  • モデルの選択
  • 利用案内
  • 関連コンテンツ

このページは役に立ちましたか?

接続

ヘルプ リソース サポート

学習する UiPath アカデミー

質問する UiPath フォーラム

最新情報を取得