- 概述
- 要求
- 部署模板
- 手动:准备安装
- 手动:准备安装
- 步骤 2:为离线安装配置符合 OCI 的注册表
- 步骤 3:配置外部对象存储
- 步骤 4:配置 High Availability Add-on
- 步骤 5:配置 SQL 数据库
- 步骤 7:配置 DNS
- 步骤 8:配置磁盘
- 步骤 9:配置内核和操作系统级别设置
- 步骤 10:配置节点端口
- 步骤 11:应用其他设置
- 步骤 12:验证并安装所需的 RPM 包
- 步骤 13:生成 cluster_config.json
- Cluster_config.json 示例
- 常规配置
- 配置文件配置
- 证书配置
- 数据库配置
- 外部对象存储配置
- 预签名 URL 配置
- ArgoCD 配置
- Kerberos 身份验证配置
- 符合 OCI 的外部注册表配置
- Disaster Recovery:主动/被动和主动/主动配置
- High Availability Add-on 配置
- 特定于 Orchestrator 的配置
- Insights 特定配置
- Process Mining 特定配置
- Document Understanding 特定配置
- Automation Suite Robot 特定配置
- 监控配置
- 可选:配置代理服务器
- 可选:在多节点 HA 就绪生产集群中启用区域故障恢复
- 可选:传递自定义 resolv.conf
- 可选:提高容错能力
- 添加具有 GPU 支持的专用代理节点
- 为 Automation Suite Robot 添加专用代理节点
- 步骤 15:为离线安装配置临时 Docker 注册表
- 步骤 16:验证安装的先决条件
- 正在运行 uipathctl
- 手动:执行安装
- 安装后
- 集群管理
- 监控和警示
- 迁移和升级
- 特定于产品的配置
- 最佳实践和维护
- 故障排除
- 如何在安装过程中对服务进行故障排除
- 如何减少 NFS 备份目录的权限
- 如何卸载集群
- 如何清理离线工件以改善磁盘空间
- 如何清除 Redis 数据
- 如何启用 Istio 日志记录
- 如何手动清理日志
- 将 Ceph 退出只读模式
- 如何清理存储在 sf-logs 存储桶中的旧日志
- 如何禁用 AI Center 的流日志
- 如何对失败的 Automation Suite 安装进行调试
- 如何在升级后从旧安装程序中删除映像
- 如何禁用 TX 校验和卸载
- 如何手动将 ArgoCD 日志级别设置为 Info
- 如何扩展 AI Center 存储
- 如何为外部注册表生成已编码的 pull_secret_value
- 如何解决 TLS 1.2 中的弱密码问题
- 如何查看 TLS 版本
- 如何使用证书
- 如何计划 Ceph 备份和还原数据
- 如何使用集群内对象存储 (Ceph) 收集 DU 使用情况数据
- 如何在离线环境中安装 RKE2 SELinux
- 如何清理 NFS 服务器上的旧差异备份
- 如何在已启用 FIPS 的集群中部署 Insights
- 如何迁移到 cgroup v2
- 如何在虚拟机重新启动后恢复 Kerberos 身份验证
- 如何将本地 Docker 映像推送到集群内注册表
- 如何从备份中排除存储桶
- 无法获取沙盒映像
- Pod 未显示在 ArgoCD 用户界面中
- Redis 探测器失败
- RKE2 服务器无法启动
- ArgoCD 在首次安装后进入“进行中”状态
- 处于 CrashLoopBackOff 状态的 ArgoCD 存储库服务器 Pod
- 手动 ArgoCD 网络策略缓解措施 (MHSA-47m3-95c7-g2g8)
- 监控仪表板中缺少 Ceph-rook 指标
- 诊断性运行状况检查期间报告的错误不匹配
- 为 uipathctl 创建的工作负载配置资源请求和限制
- 无正常的上游问题
- 杀毒软件阻止了 Redis 启动
- 无法在启用 TLS 证书验证的情况下启动 AI Center 和 Document Understanding Pod
- Fluentd 不会在 IPv6 环境中导出日志
- Studio 桌面版无法加载 Integration Service 连接器和活动
- 使用 Process Mining 运行高可用性
- 使用 Kerberos 登录时 Process Mining 挖掘失败
- 无法使用 pyodbc 格式连接字符串连接到 AutomationSuite_ProcessMining_Warehouse 数据库
- Airflow 安装失败,并显示 sqlalchemy.exc.ArgumentError:无法从字符串“”中解析 rfc1738 URL
- 如何添加 IP 表格规则以使用 SQL Server 端口 1433
- 运行 CData Sync 的服务器不信任 Automation Suite 证书
- Process Mining fails to load after disabling and re-enabling it
- 运行诊断工具
- 使用 Automation Suite 支持捆绑包
- 探索日志
从多节点 Automation Suite 集群中删除服务器、代理或 GPU 节点,以进行维护或资源管理。
安装 Automation Suite 后,您可以从集群中删除任何节点,以进行计算机维护或释放未使用的资源。您可以从集群中删除服务器、代理和 GPU 节点。
只有在多节点 HA 就绪生产设置中才能从集群中删除节点。
从集群中删除节点不会导致任何停机。但是,如果未配置 HAA,它仍会影响内部缓存组件。
删除 GPU 节点时,不会等待已计划的作业,例如训练管道或分析。如果在删除节点的流程中删除了这些作业,则需要重新开始。确保计划删除的节点上没有运行任何流程。
执行以下步骤只会从集群中删除节点。计算机不会完全擦除,一些残留物可能会使其无法用于进一步的安装。
确保按照配置磁盘中的说明格式化计算机,并做好安装或将其添加到现有集群的准备。
要求
要成功从集群中删除节点,您必须满足以下要求:
- 生成的集群的容量必须与运行计划的工作负载(删除节点前)所需的总容量相匹配。 例如,如果总工作负载需要 32 个 vCPU 和 64 GB 内存,则删除节点后,集群中的其余节点应至少具有相同数量的资源。 否则,您将无法删除节点。
- 生成的集群必须至少具有 3 个服务器节点;并且需要奇数个服务器节点。
- 如果设置为多区域,则生成的集群必须在 3 个区域中的每个区域中都有服务器节点。
- 集群必须处于正常运行状态,即所有节点或 Pod 都处于正常运行状态。当 Pod 处于以下任何状态时,它们的运行状况不佳:
Pending、Error、Init、Crashloopbackoff、Terminating。 - 除非有其他相应的 GPU 节点可用,否则您无法删除 GPU 节点。
从集群中删除节点
要从集群中删除节点,请执行以下步骤:
-
登录到您不打算删除的任何服务器节点,然后导航到安装程序文件夹:
cd /opt/UiPathAutomationSuitecd /opt/UiPathAutomationSuite -
(可选)如果您使用的是在线设置,请执行以下命令:
cd online_installer_{VERSION} # Example: if you are using version 2021.10.3 then replace {VERSION} with 2021.10.3cd online_installer_{VERSION} # Example: if you are using version 2021.10.3 then replace {VERSION} with 2021.10.3 -
通过运行以下命令从集群中删除一个或多个节点:
./bin/uipathctl rke2 node remove --name [comma separated list of node names without space in quotes] # Example: # ./bin/uipathctl rke2 node remove --name "server1,agent3"./bin/uipathctl rke2 node remove --name [comma separated list of node names without space in quotes] # Example: # ./bin/uipathctl rke2 node remove --name "server1,agent3"
脚本会警告您关闭或终止节点;在您关闭节点之前,它不会从集群中删除节点。脚本会等待 5 分钟,以便节点关闭,然后超时。该脚本提供了要关闭哪个节点以及以何种顺序关闭的说明。如果您未在请求的时间内关闭节点,也可以重新运行脚本。
要自动化整个节点删除流程,请执行以下步骤:
- 在步骤 3 中的脚本末尾添加
--skip-node-deletion标志。 - 脚本运行成功后,关闭第一个目标节点,然后重新运行脚本,这次不运行
--skip-node-deletion。 如果您没有按照提供给脚本的顺序关闭节点,则会失败。 关闭预期的节点后,您始终可以重新运行脚本。 - 重复上一步,直到成功删除所有节点。
要获取要删除的节点的名称,请参阅如何获取节点名称。
删除服务器节点最多可能需要几个小时,具体取决于集群中存储的数据总量。删除代理节点(包括 GPU 节点)最多可能需要 20 分钟。
如何获取节点名称
要获取节点的名称,请执行以下步骤:
-
按照启用 kubectl 中的说明设置 Kubernetes 上下文。
-
通过运行以下命令获取节点的名称:
kubectl get nodeskubectl get nodes
下图显示了一个示例输出,其中节点名称为 agent3、server0、server1 和 server2。