- 概述
- 要求
- 预安装
- 安装
- 安装后
- 迁移和升级
- 监控和警示
- 集群管理
- 特定于产品的配置
- 故障排除
- 由于无法连接到 Azure Government,备份设置不起作用
- 启用自定义节点污点时,UiPath 命名空间中的 Pod 卡住
- 无法使用代理设置启动 Automation Hub 和 Apps
- 由于“验证失败”错误,Velero 备份失败
- 外部密码故障排除
- 时间即服务故障排除
- 无法在启用 TLS 证书验证的情况下启动 AI Center 和 Document Understanding Pod
- TLS 证书验证错误
- Fluentd 不会在 IPv6 环境中导出日志
- Studio 桌面版无法加载 Integration Service 连接器和活动
- 手动 ArgoCD 网络策略缓解措施 (MHSA-47m3-95c7-g2g8)
- 为 uipathctl 创建的工作负载配置资源请求和限制
EKS/AKS 上多站点 Automation Suite 的基础架构、延迟、数据源、管理、RTO 和 RPO 注意事项。
与任何多站点部署一样,Automation Suite 的主要架构注意事项涉及基础架构、延迟、数据源、管理、恢复时间目标、恢复点目标等。
基础架构
我们建议对两个集群使用相同的硬件。 但是,Automation Suite 集群可能会在几乎没有区别的类似硬件配置下工作。 异构硬件可能会增加复杂性并减慢故障排除速度。
管理
两个 Automation Suite 集群相互独立,不共享任何配置。因此,必须在这些集群上单独完成任何管理或维护活动。例如,您必须更新两个集群上的 SQL 连接字符串,并且单独配置证书等。此外,您必须独立监控两个集群,并且单独升级它们等。
数据源
对象存储与 SQL 数据库一起构成 Automation Suite 上已安装产品的状态。
SQL Server 配置
SQL Server 配置在多站点部署中起着至关重要的作用。尽管 SQL Server 是 Automation Suite 的外部组件,但在使用 Automation Suite 时,还需要一些其他步骤以确保真正的 HA。
必须在“始终开启”可用性组或故障转移组中配置 SQL Server。必须将其分布在两个站点上,以确保在一个站点关闭时提供准确的高可用性。两个集群必须在连接字符串中使用相同的 SQL 侦听器端点。此外,当 SQL Server/数据库分布在多个子网中时,建议在连接字符串中设置 MultiSubnetFailover=True 属性。
PostgreSQL 服务器配置
与 SQL Server 一样,PostgreSQL 位于 Automation Suite 的外部,但在多站点部署中要实现真正的 HA 还需要一些其他步骤。PostgreSQL 由 Process Mining、Autopilot for Developers 和 Temporal 即服务使用。对于 Disaster Recovery,必须将 Autopilot for Developers 复制到辅助站点。Process Mining 数据库不需要跨站点复制。辅助集群不支持 TaaS;仅应付账款部署的主站点支持此功能。
在站点 1 中配置一台主 PostgreSQL 服务器,使用物理复制功能到站点 2 中的至少一个只读备用服务器,并通过单个端点将两个集群指向当前主服务器。如果发生灾难,将站点 2 的待机状态提升为主节点,并将端点更新为指向站点 2。
- 托管服务:使用提供程序的跨区域复制功能及在故障转移期间更新其端点的功能,例如Amazon RDS for PostgreSQL 、 Amazon Aurora PostgreSQL 全局数据库或Azure Database for PostgreSQL 。
- 自托管:在主集群之前使用 DNS 记录(例如 Amazon Route 53),以便两个集群使用相同的地址。在故障转移期间将 DNS 记录更新为指向辅助记录。
外部对象存储配置
外部对象存储不会因节点故障而可能发生损坏。数据复制和 Disaster Recovery 可以独立于 Automation Suite 执行。与 SQL Server 一样,必须在高可用性 Disaster Recovery 设置中配置外部对象存储。
主对象存储实例在实际位于主数据中心,并且至少一个辅助实例位于辅助数据中心且已启用数据同步。您可以在对象存储上配置负载均衡器,以确保两个 Automation Suite 集群引用相同的端点。这使得部署独立于对象存储的内部配置方式。
对于 AWS S3,多区域访问点不支持 Automation Suite 中运行的所有产品所需的所有 s3 API。有关支持 API 列表的详细信息,请参阅将多区域接入点与受支持的 API 操作一起使用。
您可以在这两个区域中为每个产品/套件创建两个存储桶并启用同步。在同一区域中运行的 Automation Suite 集群将引用同一区域中的存储桶。
恢复时间目标
在设计多站点 Automation Suite 集群时,您组织的 RTO 策略至关重要。要实现所需的 RTO,请考虑以下方面:
- 流量管理器的设计;
- 辅助/被动集群中节点的可用性;
- 辅助集群上的动态工作负载可用性,例如,ML 技能;
- 配置管理。
流量管理器
要释放两个集群的全部潜力,适当配置流量管理器至关重要。理想情况下,设置应有助于将流量分配到两个集群。此策略不仅可确保均衡的负载分布,还可保障业务连续性,从而在任一站点完全关闭时减少任何潜在的中断。
节点可用性
如果发生灾难导致一个站点完全无法运行,则另一个站点必须有足够的容量,以确保业务自动化不受影响。正常站点的容量不足可能会对企业的运营产生负面影响,并可能导致重大的运营问题。
动态工作负载可用性
一些产品(例如 AI Center)会在运行时动态部署 ML 技能。另一个集群中的技能部署始终为异步。这不能保证它们的可用性。为确保您的自动化解决方案在所需时间内恢复在线,您可以定期同步另一个集群中的技能。
配置管理
由于多站点 Automation Suite 部署由两个不同的集群组成,因此在任何集群上执行的任何操作都必须及时在另一个集群上执行,以减少偏差。这可确保两个集群具有相似的配置,并且在恢复时不需要额外的工作。
恢复点目标
在设计多站点 Automation Suite 集群时,您组织的恢复点目标 (RPO) 策略至关重要。要实现所需的 RPO,必须考虑以下方面:
- 数据同步;
- 计划的备份。
数据同步
写入主数据源时,必须也将数据同步到辅助集群。但是,当数据中心关闭且数据未同步时,就有可能丢失数据。示例网络配置(例如两个数据中心之间的高带宽和低延迟)可以加快同步速度。
计划的备份
并非所有 Disaster Recovery 都可以完全防止数据丢失。但是,您可以部署定期备份策略,以最大程度地减少灾难对数据恢复的影响。有关详细信息,请参阅备份和还原集群。