- 概述
- 要求
- 部署模板
- 手动:准备安装
- 手动:准备安装
- 步骤 2:为离线安装配置符合 OCI 的注册表
- 步骤 3:配置外部对象存储
- 步骤 4:配置 High Availability Add-on
- 步骤 5:配置 SQL 数据库
- 步骤 7:配置 DNS
- 步骤 8:配置磁盘
- 步骤 9:配置内核和操作系统级别设置
- 步骤 10:配置节点端口
- 步骤 11:应用其他设置
- 步骤 12:验证并安装所需的 RPM 包
- 步骤 13:生成 cluster_config.json
- Cluster_config.json 示例
- 常规配置
- 配置文件配置
- 证书配置
- 数据库配置
- 外部对象存储配置
- 预签名 URL 配置
- ArgoCD 配置
- Kerberos 身份验证配置
- 符合 OCI 的外部注册表配置
- Disaster Recovery:主动/被动和主动/主动配置
- High Availability Add-on 配置
- 特定于 Orchestrator 的配置
- Insights 特定配置
- Process Mining 特定配置
- Document Understanding 特定配置
- Automation Suite Robot 特定配置
- 监控配置
- 可选:配置代理服务器
- 可选:在多节点 HA 就绪生产集群中启用区域故障恢复
- 可选:传递自定义 resolv.conf
- 可选:提高容错能力
- 添加具有 GPU 支持的专用代理节点
- 为 Automation Suite Robot 添加专用代理节点
- 步骤 15:为离线安装配置临时 Docker 注册表
- 步骤 16:验证安装的先决条件
- 正在运行 uipathctl
- 手动:执行安装
- 安装后
- 集群管理
- 监控和警示
- 迁移和升级
- 特定于产品的配置
- 最佳实践和维护
- 故障排除
- 如何在安装过程中对服务进行故障排除
- 如何减少 NFS 备份目录的权限
- 如何卸载集群
- 如何清理离线工件以改善磁盘空间
- 如何清除 Redis 数据
- 如何启用 Istio 日志记录
- 如何手动清理日志
- 将 Ceph 退出只读模式
- 如何清理存储在 sf-logs 存储桶中的旧日志
- 如何禁用 AI Center 的流日志
- 如何对失败的 Automation Suite 安装进行调试
- 如何在升级后从旧安装程序中删除映像
- 如何禁用 TX 校验和卸载
- 如何手动将 ArgoCD 日志级别设置为 Info
- 如何扩展 AI Center 存储
- 如何为外部注册表生成已编码的 pull_secret_value
- 如何解决 TLS 1.2 中的弱密码问题
- 如何查看 TLS 版本
- 如何使用证书
- 如何计划 Ceph 备份和还原数据
- 如何使用集群内对象存储 (Ceph) 收集 DU 使用情况数据
- 如何在离线环境中安装 RKE2 SELinux
- 如何清理 NFS 服务器上的旧差异备份
- 如何在已启用 FIPS 的集群中部署 Insights
- 如何迁移到 cgroup v2
- 如何在虚拟机重新启动后恢复 Kerberos 身份验证
- 如何将本地 Docker 映像推送到集群内注册表
- 如何从备份中排除存储桶
- 无法获取沙盒映像
- Pod 未显示在 ArgoCD 用户界面中
- Redis 探测器失败
- RKE2 服务器无法启动
- ArgoCD 在首次安装后进入“进行中”状态
- 处于 CrashLoopBackOff 状态的 ArgoCD 存储库服务器 Pod
- 手动 ArgoCD 网络策略缓解措施 (MHSA-47m3-95c7-g2g8)
- 监控仪表板中缺少 Ceph-rook 指标
- 诊断性运行状况检查期间报告的错误不匹配
- 为 uipathctl 创建的工作负载配置资源请求和限制
- 无正常的上游问题
- 杀毒软件阻止了 Redis 启动
- 无法在启用 TLS 证书验证的情况下启动 AI Center 和 Document Understanding Pod
- Fluentd 不会在 IPv6 环境中导出日志
- Studio 桌面版无法加载 Integration Service 连接器和活动
- 使用 Process Mining 运行高可用性
- 使用 Kerberos 登录时 Process Mining 挖掘失败
- 无法使用 pyodbc 格式连接字符串连接到 AutomationSuite_ProcessMining_Warehouse 数据库
- Airflow 安装失败,并显示 sqlalchemy.exc.ArgumentError:无法从字符串“”中解析 rfc1738 URL
- 如何添加 IP 表格规则以使用 SQL Server 端口 1433
- 运行 CData Sync 的服务器不信任 Automation Suite 证书
- Process Mining fails to load after disabling and re-enabling it
- 运行诊断工具
- 使用 Automation Suite 支持捆绑包
- 探索日志
多站点 Automation Suite 部署的关键架构注意事项,包括延迟、RTO 和 RPO 因素。
与任何多站点部署一样,Automation Suite 的主要架构注意事项涉及基础架构、延迟、数据源、管理、恢复时间目标、恢复点目标等。
基础架构
我们建议对两个集群使用相同的硬件。 但是,Automation Suite 集群可能会在几乎没有区别的类似硬件配置下工作。 异构硬件可能会增加复杂性并减慢故障排除速度。
延迟
在设计主动/主动模型时,延迟至关重要。它表示两个 Automation Suite 集群之间的往返时间 (RTT)。两个站点之间的延迟级别越短越好,因为它可以大大降低中断期间数据丢失的风险。RTT 必须低于 10 毫秒的阈值。
在进入生产阶段之前,您应该严格测试 RTT,因为它直接影响性能指标。如果站点对之间的延迟超过 10 毫秒基准,我们建议考虑主动/被动设置,而不是主动/主动配置。
任何需要同步的组件的 RTT 均不得超过 10 毫秒。这包括 SQL Server、HAA、对象存储等。
管理
两个 Automation Suite 集群相互独立,不共享任何配置。因此,必须在这些集群上单独完成任何管理或维护活动。例如,您必须更新两个集群上的 SQL 连接字符串,并且单独配置证书等。此外,您必须独立监控两个集群,并且单独升级它们等。
数据源
对象存储与 SQL 数据库一起构成 Automation Suite 上已安装产品的状态。
SQL Server 配置
SQL Server 配置在多站点部署中起着至关重要的作用。尽管 SQL Server 是 Automation Suite 的外部组件,但在使用 Automation Suite 时,还需要一些其他步骤以确保真正的 HA。
必须在“始终开启”可用性组或故障转移组中配置 SQL Server。必须将其分布在两个站点上,以确保在一个站点关闭时提供准确的高可用性。两个集群必须在连接字符串中使用相同的 SQL 侦听器端点。此外,当 SQL Server/数据库分布在多个子网中时,建议在连接字符串中设置 MultiSubnetFailover=True 属性。
有关详细信息,请参阅“始终开启”可用性组和“始终开启”可用性组的先决条件、限制和建议。
外部对象存储配置
外部对象存储不会因节点故障而可能发生损坏。数据复制和 Disaster Recovery 可以独立于 Automation Suite 执行。与 SQL Server 一样,必须在高可用性 Disaster Recovery 设置中配置外部对象存储。
主对象存储实例在实际位于主数据中心,并且至少一个辅助实例位于辅助数据中心且已启用数据同步。您可以在对象存储上配置负载均衡器,以确保两个 Automation Suite 集群引用相同的端点。这使得部署独立于对象存储的内部配置方式。
对于 AWS S3,多区域访问点不支持 Automation Suite 中运行的所有产品所需的所有 s3 API。有关支持 API 列表的详细信息,请参阅将多区域接入点与受支持的 API 操作一起使用。
您可以在这两个区域中为每个产品/套件创建两个存储桶并启用同步。在同一区域中运行的 Automation Suite 集群将引用同一区域中的存储桶。
恢复时间目标
在设计多站点 Automation Suite 集群时,您组织的 RTO 策略至关重要。要实现所需的 RTO,请考虑以下方面:
- 流量管理器的设计;
- 辅助/被动集群中节点的可用性;
- 辅助集群上的动态工作负载可用性,例如,ML 技能;
- 配置管理。
流量管理器
要释放两个集群的全部潜力,适当配置流量管理器至关重要。理想情况下,设置应有助于将流量分配到两个集群。此策略不仅可确保均衡的负载分布,还可保障业务连续性,从而在任一站点完全关闭时减少任何潜在的中断。
节点可用性
如果发生灾难导致一个站点完全无法运行,则另一个站点必须有足够的容量,以确保业务自动化不受影响。正常站点的容量不足可能会对企业的运营产生负面影响,并可能导致重大的运营问题。
动态工作负载可用性
一些产品(例如 AI Center)会在运行时动态部署 ML 技能。另一个集群中的技能部署始终为异步。这不能保证它们的可用性。为确保您的自动化解决方案在所需时间内恢复在线,您可以定期同步另一个集群中的技能。
配置管理
由于多站点 Automation Suite 部署由两个不同的集群组成,因此在任何集群上执行的任何操作都必须及时在另一个集群上执行,以减少偏差。这可确保两个集群具有相似的配置,并且在恢复时不需要额外的工作。
恢复点目标
在设计多站点 Automation Suite 集群时,您组织的恢复点目标 (RPO) 策略至关重要。要实现所需的 RPO,必须考虑以下方面:
- 数据同步;
- 计划的备份。
数据同步
写入主数据源时,必须也将数据同步到辅助集群。但是,当数据中心关闭且数据未同步时,就有可能丢失数据。示例网络配置(例如两个数据中心之间的高带宽和低延迟)可以加快同步速度。
计划的备份
并非所有 Disaster Recovery 都可以完全防止数据丢失。但是,您可以部署定期备份策略,以最大程度地减少灾难对数据恢复的影响。有关详细信息,请参阅备份和还原集群。