UiPath Documentation
activities
latest
false
用户界面自动化活动
重要 :
请注意,此内容已使用机器翻译进行了部分本地化。 新发布内容的本地化可能需要 1-2 周的时间才能完成。

v26.10

v26.10 适用于用户界面自动化活动的发布说明,版本 26.10.x。

v26.10.3

发布日期:2026 年 8 月 21 日

跨平台 UI Explorer

UI Explorer, the tool used for indicating UI elements and generating selectors during UI Automation authoring, is now available as a cross-platform tool. Previously, this capability was only available on Windows, leaving users on macOS without a way to inspect or tune selectors. The new tool brings the same experience across all Studio flavors whether you're building Windows, macOS, or cross-platform automations.

有关更多信息,请参阅“UI Explorer”页面。

现在,每个针对用户界面元素的用户界面自动化活动都会在“展开目标属性”上下文菜单中公开两个附加命令,以便轻松在活动和新的UI Explorer之间移动目标:

  • 将目标复制到剪贴板— 复制活动的统一目标,以便将其粘贴到UI Explorer编辑元素卡中。
  • 从剪贴板粘贴目标—粘贴先前在“UI Explorer”中指示的统一目标。

SAP 自动化

  • 添加了对 SAP WebGUI 提取数据的支持,并改进了表/树可重复请求行为。

  • 现在,在SAP GUI for Java中始终启用可编写脚本的文件选取器。在自动化时,SAP 现在会打开其可编写脚本的文件选取器对话框,而不是原生对话框。这带来了以下改进:

    • 可编写脚本的对话框专为自动化而设计,不会使 SAP 会话保持忙碌。通过 SAP 选取器使用“模拟”输入方法或通过 SAP 专属活动打开文件选取器的操作不会再因等待脚本会话解锁而暂停。配置步骤复杂,例如启用“强制执行 SAP 硬超时”并设置“出错时继续”设置为 True,则不再需要。

    • 其选取器对 SAP 客户端更新的适应能力更强,从而使自动化随着时间的推移而更加可靠。

    警告:

    由于对话框类型会发生变化,必须更新自动化 SAP 文件选取器的现有工作流,以针对新的对话框。

扩展了 macOS 的浏览器扩展程序安装选项

UiPath Assistant 2026.0.200 STS开始,macOS 用户可以使用以下安装方法安装和管理 Chrome、Edge 和 Safari 浏览器扩展程序:

  • 当前用户
  • 所有用户
  • 在线组策略
  • 离线组策略
  • 当前用户(仅限原生消息传递主机)
  • 所有用户(仅限原生消息传递主机)

此增强功能为扩展程序部署提供了更大的灵活性,并使 macOS 的体验更接近于 Studio 桌面版。有关更多信息,请参阅macOS 上的 Chrome 扩展程序和Safari 扩展程序文档。

错误修复

  • 修复了传统用户界面自动化体验中的一个问题,即在启用“更新子对象中的窗口选取器”选项的情况下,编辑对象存储库屏幕的窗口选取器时不会更新子对象的窗口选取器

v26.10.2

发布日期:2026 年 8 月 10 日

对编码智能体的用户界面自动化支持

UI Automation 中的编码智能体改进包括:

选取器和定位改进:

  • 已为编码智能体实现语义选取器,从而在不可用基于 DOM 的方法时,使用自然语言描述识别元素,并进行可视化分析。
  • 添加了对SAP GUI for Java应用程序的编码智能体支持。
  • 为编码智能体添加了目标配置验证,有助于在使用前确保目标定义准确无误。
  • 更新了模糊目标,以默认为“输入信息”“设置文本”“获取文本”“选择项目”活动禁用check:text ,从而提高了元素定位的可靠性。

命令行改进:

  • 使用 uip rpa uia interact sapselect-dates-in-calendarclick-picture-on-screen 交互扩展了 expand-tree 命令集。
  • 添加了新的uip rpa uia target-anchorable preview-text命令,用于预览获取文本活动为目标可锚定定义返回的文本。
  • 增强了 uip rpa uia target-anchorable resolve-defaults 命令以支持元素的 namedescription 属性,从而实现更精确的识别。
  • 通过系统权限检查和用于验证或请求必要权限(辅助功能和屏幕录制)的新uip rpa uia permissions命令,改进了macOS上的命令行界面 (CLI) 体验。

用户界面自动化新式活动

  • “注入 Js 脚本”活动的“脚本代码”属性采用了新的已启用 JS 的代码编辑器微件。此微件仅适用于从 Studio Desktop 26.0.198 开始的 Windows 项目。Studio Web 支持尚未实现。
  • 扩展了用户界面自动化活动追踪,以捕获语义活动ScreenPlay 的使用详细信息。执行追踪默认处于禁用状态,您可以通过“用户界面自动化新式”>“Robot 日志记录”>“启用活动追踪”项目设置来启用此功能。只有失败的作业的追踪数据才会上传到 Orchestrator。

选择帮助程序用户界面树

  • 直接在“用户界面树”面板中添加了“启用 Computer Vision”按钮。现在,当应用程序在作用域内并且选取了元素时, “计算机视觉元素”选项卡始终可见。禁用 Computer Vision 后,面板将显示可操作状态,其中包含“启用 Computer Vision”按钮,用于打开 CV、捕获屏幕截图并自动构建 CV 元素树。

错误修复

  • 修复了一个问题,即在使用新式用户界面自动化活动指示元素期间,会出现代理身份验证对话框(“登录以访问此网站”),从而阻止用户指定对话框后面的用户界面元素。

v26.10.1

发布日期:2026 年 7 月 21 日

选择助手

  • 新增了对通过目标扩展面板上的新按钮直接从选择帮助程序中配置偏移点的支持。更新偏移点时,系统会自动选择并突出显示关联的目标,以提供即时可视反馈。
  • 更新了首选用户界面框架选取器,以在操作栏中显示为紧凑的菜单按钮,并包含策略缩写和图标( Auto / AA / UIA )。
  • 改进了Selection Helper性能,减少了悬停、元素选择和布局交互期间的变更检测和渲染开销。

对编码智能体的用户界面自动化支持

  • 添加了计算机视觉 (CV) 定位支持,使编码 Agents 能够为用户界面元素配置基于 CV 的定位方法。
  • 具有图像和语义分析功能,增强了基于智能体的元素发现。当浏览器或应用程序 DOM 不可用时,智能体现在可以使用可视化信息和自然语言描述来识别用户界面元素。
  • 通过生成高亮显示已识别元素的带注释的屏幕截图,以及用于控制图像和令牌成本的新的屏幕截图大小上限,改进了可视化诊断
  • 新增了对通过用户界面自动化工具验证目标和锚点配置的支持,有助于确保定位定义在使用前准确无误。

改进

  • 使用“填充”选项扩展了用户界面自动化高亮显示 API ,该选项在目标元素上呈现纯色矩形,从而使工作流能够在捕获屏幕截图之前隐藏敏感信息或高亮显示多个屏幕区域。

v26.10.0

发布日期:2026 年 6 月 24 日

用户界面自动化智能体

语义选取器

语义选取器现在支持两种查找方法:文档对象模型 (DOM) 和图像。DOM 模式是网页应用程序的默认模式,使用从应用程序 DOM 中提取的信息来匹配元素。图像模式是一种新的查找方法,也是非网页应用程序的默认方法,该模式使用可见的屏幕图像和现代多模态模型的图像锚定功能,像人类一样理解可见内容。它支持任何类型的描述,包括可视化描述(DOM 方法通常无法执行的操作)。

您可以从项目设置 > 用户界面自动化 > 语义选取器 的“模型”下拉列表中选择用于每种查找方法的模型。DOM 模式支持 Gemini 2.5 Flash 和PathMini;图像模式使用PathMini。

有关更多信息,请参阅查找方法

语义活动

您现在可以使用自己的大型语言模型订阅而不是 UiPath 托管的订阅,为“用户界面自动化语义”活动提供支持。您可以在 AI Trust Layer 的“LLM 配置”选项卡中的“用户界面自动化”>“语义活动”下,使用受支持的模型之一配置模型。有关设置步骤,请参阅语义活动自带模型设置

您现在可以在“ 项目设置 ”>“新式用户界面自动化 ”>“ 语义活动 ”下为语义活动设置项目级默认值,其中包括每个活动的默认模型和“提取用户界面数据(预览)”的提取模式。这些默认值适用于 Studio 设计时体验(例如选择和测试运行)和 runtime。有关项目级默认值,请参阅用户界面自动化新式项目设置

更新用户界面自动化活动包将语义活动(不包括关闭弹出窗口)的默认模型更改为PathMini。有关设置步骤,请参阅语义活动自带模型设置。有关项目级默认值,请参阅用户界面自动化新式项目设置

ScreenPlay
  • 编码工作流中的 SecureString 和 ScreenPlayImage 支持— ScreenPlay 编码工作流现在处理另外两种参数类型: SecureString ,用于传递敏感的字符串值,而不以纯文本形式公开这些值; ScreenPlayImage ,用于直接在 ScreenPlay 提示词中包含屏幕截图,以提供模型的附加可视化上下文。以前,编码工作流没有对这些类型的原生处理;此更改使它们与低代码工作流持平。
  • 分布式追踪 SpanId — ScreenPlay 现在会向对后端服务(例如语义代理和 LLM 网关)发出的 HTTP 调用中添加X-UIPATH-SEMANTIC-SPAN-ID标头。跨度标识符可让单个 ScreenPlay 执行及其请求在不同服务之间进行端到端关联,从而提高可观察性和故障排除能力。
  • 应用程序实例附加模式— ScreenPlay 现在支持“使用应用程序/浏览器”活动上的“应用程序实例窗口附加模式”。内部活动会在整个应用程序实例(所有的父窗口和子窗口、警示和弹出窗口)中进行搜索,而不是单个窗口,除了现有的单一窗口支持之外,ScreenPlay 还可以在所有这些实例中正确捕获和记录追踪。
  • 刷新的 HTML 追踪文件— ScreenPlay HTML 追踪文件具有经过更新的可视化设计。现在,追踪查看器的输出具有更新的布局和样式,使执行追踪记录更易于阅读和导航,同时符合当前的 UiPath 设计标准。
提取用户界面数据(预览)

“提取用户界面数据”是一个 AI 驱动的新语义活动,用于从任何应用程序屏幕中提取结构化业务数据。您可以定义要捕获的自定义数据结构,并将其作为业务对象进行检索,使其能够跨用户界面技术使用,而不是仅限于单一布局类型。当存在表单时,该活动默认捕获网页表单数据,并且支持通过自定义提示提取自定义字段。

现在,该活动可以一致地处理“未找到”结果。以前,当找不到任何查询的答案时,它会引发异常,并会在仅缺少一部分答案时返回空字符串。现在,当找不到值时,该值会作为null返回,从而提供了一种可预测的方法来检测和处理所有提取场景中的缺失数据。

提取用户界面数据是一个预览活动,这是一个实验性实验室,用于架构驱动的语义用户界面提取。它不会作为独立活动正式发布;此功能将并入 ScreenPlay 的数据抓取功能中。在预览期间采用“提取用户界面数据”的用户应为最终迁移到 ScreenPlay 制定计划。

Healing Agent

当 Healing Agent 无法恢复活动时,机器人日志现在包含失败原因。原因将显示在 Orchestrator 的机器人日志中,因此您可以在不检查内部日志的情况下了解恢复不成功的原因。例如,日志条目可能为“Healing Agent 无法恢复活动。自我修复已禁用。”

对编码智能体的用户界面自动化支持

26.10.0 版本为 AI Coding Agents 带来了 UI Automation。现在,您可以要求智能体(例如 Claude Code、Cursor、GitHub Copilot)以简单的语言构建和维护用户界面自动化,它将驱动真实的应用程序,生成可靠的选取器,并代表您在项目的对象存储库中注册这些选取器。

这些支持作为一组智能体技能与活动一起打包,并由uip rpa uia命令行接口提供支持。这些技能与活动本身应用于同一桌面、网页和 SAP 应用程序。

包含三种技能:

  • 配置目标( uia-configure-target ) — 将智能体指向屏幕和您关注的元素(“在结账页面上设置提交按钮”)。它会捕获实时应用程序,找到每个元素,生成可靠的选取器,在“对象存储库”中注册屏幕和元素,并根据屏幕截图验证每个元素,然后交还工作流可以使用的引用 ID。
  • 与实时应用程序交互( uia-interact ) — 让智能体与正在运行的应用程序交互 — 单击、输入、读取值、填写表单、导航菜单、提取表格或截取屏幕截图。用于在自动化应用程序之前探索应用程序,或确认更改是否按预期运行。
  • 改进选取器( uia-improve-selector ) — 修复、强化或从 runtime 数据恢复选取器。请参阅下面的选取器智能

技能在uipath-rpa 技能存储库中提供。

智能选取器 (uia-improve-selector)

选取器智能是uia-improve-selector技能背后的推理引擎。它会诊断选取器失败的原因并重写选取器 — 无需手动编辑 XML。

应用程序更改时(重命名属性、自动生成的 ID 移动、布局移动),选取器会中断。选取器智能让编码智能体诊断并重写选取器,以便您的自动化继续运行,而无需您手动编辑脆弱的选取器 XML。

它以两种模式运行:

  • 恢复— 选取器已停止工作(“未找到元素”、运行时故障)。智能体会根据应用程序的当前状态重写匹配项,以便再次与元素进行匹配。
  • 改进— 选取器仍然可以工作,但很脆弱,因为它依赖于位置、自动生成的 ID 或反映不断变化的内容的值。智能体会针对相同元素生成更强大的版本。

当您查看新生成的选取器,并发现它依赖于生成的 ID 或位置索引时,请主动使用“改进” 。当 Unattended 作业失败并且您拥有 runtime 数据时,使用响应式恢复

可靠原因:

  • 由 runtime 数据驱动。它适用于实时应用程序或故障时捕获的数据,因此,即使应用程序不再运行,也可以稍后在另一台计算机上恢复在无人值守机器人上中断的选取器。
  • 活动感知。例如,智能体知道“获取文本”目标不应依赖于其应读取的文本, “检查”目标不应依赖于该复选框当前是否处于选中状态。每次重写都遵循一定的规则,使选取器针对其特定用途保持稳定。
  • 已验证,而非猜测。在写回任何内容之前,每个候选选取器都会经过检查并评分。如果第一次尝试不起作用,智能体会自动优化并重试,然后保留最强的结果。
  • 已作出解释。恢复选取器后,您将获得单行的根本原因(损坏原因)以及用于使其持久的策略,因此您可以一目了然地信任其更改。

Chromium 自动化

我们添加了Chromium 自动化,这是一种新的浏览器自动化方法,可通过Chrome 开发者工具协议 (CDP)直接控制 Chrome 和 Edge。UiPath 在内部启动并管理浏览器会话 —无需安装浏览器扩展程序,也无需下载 WebDriver 二进制文件或与浏览器版本保持同步

“使用应用程序/浏览器” 活动的“浏览器自动化模式” 下拉列表中以及“项目设置”>“用户界面自动化新式”>“应用程序/浏览器” 中提供两个新选项:

Chromium 自动化适用于Chrome、Edge 和所有基于 Chromium 的浏览器。此方法不支持 Firefox 和 Safari — 请继续使用这些浏览器扩展程序或 WebDriver。

Oracle 自动化

用户界面自动化现在支持跨 Oracle AFS(应用程序开发框架)和 Oracle Redbook (Oracle JET) 界面自动化 Oracle融合应用程序。新的识别方法可显示每种技术稳定的选取器属性,因此,尽管这些界面具有动态特性,自动化仍然可以保持可靠,并且所有用户界面自动化活动都可用于 Oracle融合屏幕。

有关更多信息,请参阅“Oracle融合自动化”

macOS 用户界面自动化

  • 增强了对“选择项目”活动中基于 macOS 菜单的控件的支持。您现在可以将“选择项目”AXPopUpButtonAXMenuButton控件一起使用,从而与基于下拉列表和菜单的用户界面元素进行可靠的交互,这些元素需要打开弹出窗口才能访问其项目。
  • 添加了对三击操作的支持。此功能适用于:
    • 使用硬件事件的 Windows 和 macOS
    • 使用 ChromiumAPI 的 Windows 和 macOS
  • 在 macOS 上添加了对鼠标拖动操作的支持。

用户界面自动化新式活动

  • 跨平台项目的对象存储库中启用了“捕获元素”功能。

  • “设置运行时浏览器”活动现在可以在跨平台项目的运行时解析默认系统浏览器。新的“使用默认系统浏览器”选项允许在系统默认浏览器或特定浏览器之间进行选择:

    • Windows 项目:Chrome、Edge、Firefox
    • 跨平台项目:Chrome、Edge、Safari

    活动的显示名称现在反映了选定的浏览器(文字值、默认系统浏览器或截断的表达式)。

  • 添加了辅助功能检查活动,该活动使用户能够在Test Cloud 的Test Manager实例中执行辅助功能测试。此活动将加载网页浏览器页面,并根据 WCAG 2.1(或更高版本)标准执行辅助功能检查。辅助功能检查的示例包括 DOM 和视觉无障碍功能、对比度、alt 标签、Tab 键顺序、不当的 Aria 角色。

高级选取器编辑器

  • 高级选取器编辑器选择帮助程序添加了缩放控件,让您可以使用+-重置选项在 80% 到 110% 之间放大或缩小。

  • 高级选取器编辑器中添加了对属性区分大小写的支持。

  • “使用应用程序/浏览器”添加了“编辑目标”选项,并公开了:

    • 窗口选取器
    • 应用程序属性(例如浏览器 URL、浏览器参数、应用程序路径、应用程序参数和工作目录)
    • 用于“更新”子活动中窗口选取器的选项。这样可以自动将对屏幕“窗口选取器”所做的任何更改应用于所有子元素。
  • 除了用户界面元素选取器外,高级选取器编辑器现在还可用于编辑窗口选取器

  • UI Explorer“用户界面树”面板中,添加了一个切换开关,用于显示或隐藏“兼容选取器”“其他”部分中具有空值的属性,从而有助于仅显示相关信息。

  • 用户界面树面板中添加了筛选属性选项,从而在兼容选取器其他部分中按名称筛选所选节点的属性。

改进

  • 优化了 Active Accessibility 选取器,以提高大型表格的提取表格数据的性能。

错误修复

  • 对于链接类型节点,不检索文本,并且使用内部 SAP ID 生成树路径。通过此修复,将使用正确的节点文本。这影响了SAP 展开树活动。

  • 修复了以下问题:在 CAMBIO Cosmic 应用程序(使用 JxBrowser 的基于 Java 的医疗保健应用程序)中与 HTML 视图交互时,无法识别选取器。

  • 修复了跨平台“键入信息”活动在 Automation Cloud Robot VM 上无响应的问题。

  • 修复了字形和日语字符的原生捕获

  • 修复了Java 扩展程序在卸载后继续报告为已安装的问题。

更正,2026 年 8 月 11 日添加

原始 v26.10.0 公告中省略了以下 ScreenPlay 条目,这些条目适用于 v26.10.0 版本。

扩展了 ScreenPlay 的模型选择范围

ScreenPlay活动上的“模型”下拉列表现在提供更广泛的 Screen Agent 模型,其中添加了 GPT-5.4、GPT-5.4 mini、GPT-5.5、Gemini 3.0 Flash 预览版和Path Mini。与以前的模型相比,添加的模型功能更强大、速度更快,与 25.10 GA 版本相比,这是减少此版本中执行延迟的最大因素。Path Mini 是基于 Q文的模型,已由 UiPath 针对屏幕理解和用户界面交互进行了微调,由 UiPath 在自己的云基础架构上托管和提供服务,是选择中速度最快的选项。

完整的选择为:

Basic 层级:

  • Screen Agent(使用 Path Mini)
  • Screen Agent(使用 Gemini 2.5 Flash)
  • Screen Agent(使用 Gemini 3.0 Flash 预览版)
  • Screen Agent(使用 GPT-4.1 mini)
  • Screen Agent(使用 GPT-5 mini)
  • Screen Agent(使用 GPT-5.4 mini)

标准层级:

  • Screen Agent(使用 GPT-4.1)
  • Screen Agent(使用 GPT-5)
  • Screen Agent(使用 GPT-5.4)
  • Screen Agent(使用 GPT-5.5)
  • OpenAI - Operator
  • Anthropic - Computer Use

有关每个模型的特征,请参阅ScreenPlay

ScreenPlay 的新默认模型

ScreenPlay活动的默认模型从Screen Agent(使用 Gemini 2.5 Flash)更改为Screen Agent(使用 GPT-5.4) 。GPT-5.4 是标准层级模型,而 Gemini 2.5 Flash 是基础第一层级模型。现有自动化会保留配置时的模型;新的默认值适用于新添加的ScreenPlay活动。

ScreenPlay 执行超出指定的范围

ScreenPlay 不再仅限于作为其作用域传递的应用程序或窗口。现在,此功能可以在同一任务中跨多个浏览器选项卡和多个应用程序运行。

ScreenPlay 执行修复

此版本包含对 ScreenPlay 执行可靠性的修复。

此页面有帮助吗?

连接

需要帮助? 支持

想要了解详细内容? UiPath Academy

有问题? UiPath 论坛

保持更新