Enable predefined guardrails for PII, prompt injection, harmful content, and IP leakage, or configure LLM as Judge to evaluate custom natural-language policies, then set actions to log, block, or escalate.
开箱即用的防护机制是预定义的、即用的保护机制,您可以为 智能体 启用,无需任何自定义配置或编码。它们可立即防范常见风险,例如敏感数据暴露和提示注入攻击,帮助您更快地构建安全、可信赖的 智能体。
先决条件
开箱即用的防护机制可用于以下许可计划:
- Flex 定价计划:Enterprise – 标准层和高级层。
- Unified Pricing计划:标准版、企业版、App 测试平台标准版、App Test Platform 企业版。
如果未为您的 Organization 启用所需的权限,则相应的防护栏选项将不会显示在用户界面中。如果您已经配置了防护机制,并且稍后会禁用必要的权限,那么您的 智能体 在执行期间将跳过这些防护机制,它们不会导致 智能体 运行失败。
能否开箱即用的防护机制,还取决于您使用的云平台。有关详细信息,请参阅“Agents 功能可用性”。
您可以直接从智能体的设置中设置和配置现成的防护机制。根据所选作用域和操作类型,配置在运行时自动应用。
- 打开“智能体”设置。
- 在 Studio Web 中,打开您的智能体。
- 打开“智能体设置”面板。
- 转到“防护栏”选项卡,然后选择“添加防护栏”。
- 从预定义的可用防护机制中选择类型:
- PII 检测 – 识别并阻止敏感信息,例如电子邮件地址或物理地址。 此防护机制使用 Azure 认知服务。
- 提示注入 – 在 LLM 交互期间检测并阻止恶意或操纵提示。 此防护机制使用 Noma 安全。 由于 Noma 服务托管在美国,由这两个防护机制处理的数据可能会在您租户所在区域之外进行处理。
- 有害内容 – 检测 LLM 交互中的仇恨言论、自残、色情内容及暴力信息。此防护机制采用 Azure AI 内容安全服务。
- 知识产权保护 – 检测模型生成的文本和代码中是否存在知识产权泄漏风险。此防护机制采用 Azure AI 内容安全服务。
- 用户提示词攻击 – 检测并阻止用户提示词攻击,例如越狱或提示词注入。此防护机制采用 Azure AI 内容安全服务。
- LLM as Judge – Evaluates prompts, responses, or LLM calls against custom instructions that you write in plain natural language, using the LLM you select as the judge model.
配置 PII 检测防护机制
PII 检测可在智能体交互中识别并标记敏感个人信息,例如电子邮件地址、电话号码和物理地址。您可以将其应用于智能体提示词、LLM 调用或工具数据。此防护机制使用 Azure 认知服务。
- 将 PII 检测防护机制添加到您的智能体中。
- 填写以下字段:
- 防护栏名称 – 为此防护栏输入描述性名称。
- 防护栏描述 – 解释它检测到的内容或应用的位置。
- 选择要检测的实体。 从“用于检测的实体”下拉列表中,选择要监控的信息类型(例如,电子邮件、电话或地址)。
- 设置检测阈值。 对于每个选定的实体,定义介于 0 和 1 之间的“检测阈值”。 阈值越高,检测越严格(误报越少),而阈值越低,检测越灵敏。
- 选择作用域。 选择要应用防护栏的位置:
- 智能体 – 检查智能体的用户提示词和输出。
- LLM 调用 – 检查 LLM 请求和响应。
- 工具 – 检查工具输入和输出数据。 您可以选择一个或多个作用域,以将相同的检测逻辑应用于多个执行阶段。
- 如果选择“工具”作用域,请从“选择工具”列表中选择一个或多个工具。 这使您能够在同一智能体中的多个工具上重复使用同一防护机制。
- 定义“操作”类型。 配置系统在检测到 PII 时应如何响应:
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 信息 – 适用于一般性信息或影响较小的结果。
- 警告 – 适用于不会阻止执行的潜在风险。
- 错误 – 适用于需要审核的关键检测。
- 阻止 – 在触发防护栏时停止智能体或工具执行。
- 阻止原因 – 提供阻止操作的简要说明(例如“在工具输出中检测到 PII 数据”)。
- 升级 – 在发生违规时发送升级。
- 将应用程序分配到 – 选择升级目标类型:特定用户、定义的用户组或外部地址。
- 收件人 – 搜索并选择收件人(姓名或电子邮件)。
- 操作应用程序 – 选择将处理升级的应用程序。
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 启用用于评估。 切换启用评估所需的防护机制,以便在智能体测试或评估期间运行此防护机制。
- 保存防护机制。配置后,防护机制会自动监控所有 LLM 请求和响应,并在检测到提示注入尝试时阻止执行。
配置提示注入防护栏
提示词注入检测会监控 LLM 交互过程,识别企图篡改智能体既定行为的恶意或操控性指令。此防护机制采用 Noma 安全服务。
- 将“提示注入”防护机制添加到您的智能体中。
- 填写以下字段:
- 防护栏名称 – 为此防护栏输入描述性名称。
- 防护栏描述 – 可选地解释其检测到的内容或应用的位置。
- 设置检测阈值。 指定灵敏度级别(例如 0.8)。 值越高,检测越严格,并减少误报。
- 定义“操作”类型。 配置系统应如何处理检测事件:
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 信息 – 适用于一般性信息或影响较小的结果。
- 警告 – 适用于不会阻止执行的潜在风险。
- 错误 – 适用于需要审核的关键检测。
- 阻止 – 在触发防护栏时停止智能体或工具执行。
- 阻止原因 – 提供阻止操作的简短说明。
- 升级 – 在发生违规时发送升级。
- 将应用程序分配到 – 选择升级目标类型:特定用户、定义的用户组或外部地址。
- 收件人 – 搜索并选择收件人(姓名或电子邮件)。
- 操作应用程序 – 选择将处理升级的应用程序。
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 启用用于评估。 切换启用评估所需的防护机制,以便在智能体测试或评估期间运行此防护机制。
- 保存防护机制。配置后,防护机制会自动监控所有 LLM 请求和响应,并在检测到提示注入尝试时阻止执行。
配置有害内容防护机制
有害内容检测可识别 LLM 交互中的仇恨言论、自残、色情内容及暴力信息。您可以在调用 LLM 之前、之后或同时在两个阶段应用它。此防护机制采用 Azure AI 内容安全服务。
- 将有害内容防护机制添加到智能体。
- 定义防护栏详细信息。 填写以下字段:
- 防护栏名称 – 为此防护栏输入描述性名称。
- 防护栏描述 – 解释它检测到的内容或应用的位置。
- 选择要检测的类别。从“要检测的实体”列表中,选择一种或多种要监控的内容:仇恨言论、自残、色情内容或暴力信息。
- 设置检测阈值。 对于每个选定的实体,定义介于 0 到 6 之间的检测阈值。数值越高,触发所需的内容严重程度就越高。
- 选择作用域。 选择要应用防护栏的位置:
- 智能体 – 检查智能体的用户提示词和输出。
- LLM 调用 – 检查 LLM 请求和响应。
- 工具 – 检查工具输入和输出。您可以选择一个或多个作用域,以将相同的检测逻辑应用于多个执行阶段。
- 如果选择“工具”作用域,请从“选择工具”列表中选择一个或多个工具。 这使您能够在同一智能体中的多个工具上重复使用同一防护机制。
- 定义“操作”类型。 配置系统在检测到有害内容时应如何响应:
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 信息 – 适用于一般性信息或影响较小的结果。
- 警告 – 适用于不会阻止执行的潜在风险。
- 错误 – 适用于需要审核的关键检测。
- 阻止 – 在触发防护栏时停止智能体或工具执行。
- 阻止原因 – 提供阻止操作的简短说明。
- 升级 – 在发生违规时发送升级。
- 将应用程序分配到 – 选择升级目标类型:特定用户、定义的用户组或外部地址。
- 收件人 – 搜索并选择收件人(姓名或电子邮件)。
- 操作应用程序 – 选择将处理升级的应用程序。
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 启用用于评估。 切换启用评估所需的防护机制,以便在智能体测试或评估期间运行此防护机制。
- 保存防护机制。配置完成后,防护机制会监控 LLM 交互,并在检测到有害内容时根据配置的处理措施执行相应操作。
配置知识产权保护防护机制
IP 保护可检测模型生成的文本和代码中是否存在知识产权泄漏。此防护机制仅在执行后生效,即在调用 LLM 后检查模型的响应。此防护机制采用 Azure AI 内容安全服务。
- 将 IP 保护防护机制添加到智能体。
- 定义防护栏详细信息。 填写以下字段:
- 防护栏名称 – 为此防护栏输入描述性名称。
- 防护栏描述 – 可选地解释其检测到的内容或应用的位置。
- 从“要检测的实体”列表中,选择要监控的内容类型:文本、代码或两者皆选。
- 选择作用域。 选择要应用防护栏的位置:
- 智能体 – 检查智能体的输入和输出提示。
- LLM 调用 – 检查与模型交换的请求和响应。
- 定义“操作”类型。 配置系统应如何处理检测事件:
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 信息 – 适用于一般性信息或影响较小的结果。
- 警告 – 适用于不会阻止执行的潜在风险。
- 错误 – 适用于需要审核的关键检测。
- 阻止 – 在触发防护栏时停止智能体或工具执行。
- 阻止原因 – 提供阻止操作的简短说明。
- 升级 – 在发生违规时发送升级。
- 将应用程序分配到 – 选择升级目标类型:特定用户、定义的用户组或外部地址。
- 收件人 – 搜索并选择收件人(姓名或电子邮件)。
- 操作应用程序 – 选择将处理升级的应用程序。
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 启用用于评估。 切换启用评估所需的防护机制,以便在智能体测试或评估期间运行此防护机制。
- 保存防护机制。配置完成后,防护机制会监控所有 LLM 响应,并在检测到 IP 泄漏时根据配置的处理措施执行相应操作。
配置用户提示词攻击防护机制
用户提示词攻击防护机制会在请求到达 LLM 之前,检测提示词注入和越狱尝试。此防护机制仅在预执行阶段生效。
- 将用户提示词攻击防护机制添加到智能体。
- 定义防护栏详细信息。 填写以下字段:
- 防护栏名称 – 为此防护栏输入描述性名称。
- 防护栏描述 – 解释它检测到的内容或应用的位置。
- 定义“操作”类型。 配置检测到攻击时系统应如何响应:
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 信息 – 适用于一般性信息或影响较小的结果。
- 警告 – 适用于不会阻止执行的潜在风险。
- 错误 – 适用于需要审核的关键检测。
- 阻止 – 在触发防护栏时停止智能体或工具执行。
- 阻止原因 – 提供阻止操作的简短说明。
- 升级 – 在发生违规时发送升级。
- 将应用程序分配到 – 选择升级目标类型:特定用户、定义的用户组或外部地址。
- 收件人 – 搜索并选择收件人(姓名或电子邮件)。
- 操作应用程序 – 选择将处理升级的应用程序。
- 日志 – 记录事件,而不中断智能体执行。 “严重性”级别为日志条目设置重要性级别:
- 启用用于评估。 切换启用评估所需的防护机制,以便在智能体测试或评估期间运行此防护机制。
- 保存防护机制。配置完成后,防护机制会自动监控所有 LLM 请求和响应,并在检测到用户提示词攻击时阻止执行。
Configuring an LLM as Judge guardrail
LLM as Judge evaluates agent prompts, responses, or LLM calls against custom instructions that you write in plain natural language, using an LLM as the judge. Unlike the other out-of-the-box guardrails, which check for a fixed, predefined category through a managed classification service, LLM as Judge lets you enforce free-form policies that don't map to an existing category, such as "never quote pricing" or "tool inputs must not contain internal code names."
Each check this guardrail performs makes a real LLM call, adding the judge model's token usage on top of the agent's own usage. This happens every time the guardrail runs, including during agent testing and evaluation runs when enabled for evaluations. You can choose a cheaper judge model where possible, because a judge doesn't need the agent model's capability to stay accurate.
- Add the LLM as Judge guardrail to your agent.
- 定义防护栏详细信息。 填写以下字段:
- 防护栏名称 – 为此防护栏输入描述性名称。
- 防护栏描述 – 解释它检测到的内容或应用的位置。
- In the Rule prompt field, describe the policy to enforce in plain text, up to 4,000 characters, for example, "Never quote pricing" or "Always include this disclaimer."
- From the dedicated judge model picker, select the LLM to use as the Judge model, separate from the agent's own model list. The picker includes UiPath-managed models, and your own LLM Configurations if your organization uses bring your own model/subscription in AI Trust Layer.
- Optionally, provide up to two positive and two negative examples to improve judge accuracy. Each example is limited to 1,000 characters.
- Set a Detection threshold. This threshold defines the sensitivity level the judge uses to decide whether content violates the rule prompt.
- Choose where the guardrail applies:
- Agent – Checks the agent's user prompt and output.
- LLM 调用 – 检查 LLM 请求和响应。
- Tools – Checks tool input and output data. The guardrail applies before and after execution for the selected scope.
- Choose the Action type — how the guardrail responds when the judge returns a failing verdict: Log, Block, or Skip.
- Toggle Enable guardrail for evaluations to run this guardrail during agent testing and evaluation.
- Save the guardrail.
At runtime, the judge model returns a pass or fail verdict together with a human-readable reason, both visible in the trace details. Because the judge's own request and response are themselves an LLM call, centralized guardrails enabled in your AI Trust Layer policy for harmful content, prompt injection, PII, and IP protection also apply to them, the same as they apply to other LLM calls in the platform. For details, refer to Monitoring guardrails and Centralized guardrails.