- 概述
- 要求
- 部署模板
- 手动:准备安装
- 手动:准备安装
- 步骤 2:为离线安装配置符合 OCI 的注册表
- 步骤 3:配置外部对象存储
- 步骤 4:配置 High Availability Add-on
- 步骤 5:配置 SQL 数据库
- 步骤 7:配置 DNS
- 步骤 8:配置磁盘
- 步骤 9:配置内核和操作系统级别设置
- 步骤 10:配置节点端口
- 步骤 11:应用其他设置
- 步骤 12:验证并安装所需的 RPM 包
- 步骤 13:生成 cluster_config.json
- Cluster_config.json 示例
- 常规配置
- 配置文件配置
- 证书配置
- 数据库配置
- 外部对象存储配置
- 预签名 URL 配置
- ArgoCD 配置
- Kerberos 身份验证配置
- 符合 OCI 的外部注册表配置
- Disaster Recovery:主动/被动和主动/主动配置
- High Availability Add-on 配置
- 特定于 Orchestrator 的配置
- Insights 特定配置
- Process Mining 特定配置
- Document Understanding 特定配置
- Automation Suite Robot 特定配置
- 监控配置
- 可选:配置代理服务器
- 可选:在多节点 HA 就绪生产集群中启用区域故障恢复
- 可选:传递自定义 resolv.conf
- 可选:提高容错能力
- 添加具有 GPU 支持的专用代理节点
- 为 Automation Suite Robot 添加专用代理节点
- 步骤 15:为离线安装配置临时 Docker 注册表
- 步骤 16:验证安装的先决条件
- 正在运行 uipathctl
- 手动:执行安装
- 安装后
- 集群管理
- 监控和警示
- 迁移和升级
- 特定于产品的配置
- 最佳实践和维护
- 故障排除
- 如何在安装过程中对服务进行故障排除
- 如何减少 NFS 备份目录的权限
- 如何卸载集群
- 如何清理离线工件以改善磁盘空间
- 如何清除 Redis 数据
- 如何启用 Istio 日志记录
- 如何手动清理日志
- 如何清理存储在 sf-logs 存储桶中的旧日志
- 如何禁用 AI Center 的流日志
- 如何对失败的 Automation Suite 安装进行调试
- 如何在升级后从旧安装程序中删除映像
- 如何禁用 TX 校验和卸载
- 如何手动将 ArgoCD 日志级别设置为 Info
- 如何扩展 AI Center 存储
- 如何为外部注册表生成已编码的 pull_secret_value
- 如何解决 TLS 1.2 中的弱密码问题
- 如何查看 TLS 版本
- 如何使用证书
- 如何计划 Ceph 备份和还原数据
- 如何使用集群内对象存储 (Ceph) 收集 DU 使用情况数据
- 如何在离线环境中安装 RKE2 SELinux
- 如何清理 NFS 服务器上的旧差异备份
- 如何在已启用 FIPS 的集群中部署 Insights
- 如何迁移到 cgroup v2
- 如何在虚拟机重新启动后恢复 Kerberos 身份验证
- 如何将本地 Docker 映像推送到集群内注册表
- 如何从备份中排除存储桶
- 无法获取沙盒映像
- Pod 未显示在 ArgoCD 用户界面中
- Redis 探测器失败
- RKE2 服务器无法启动
- 在 UiPath 命名空间中找不到密码
- ArgoCD 在首次安装后进入“进行中”状态
- 处于 CrashLoopBackOff 状态的 ArgoCD 存储库服务器 Pod
- 手动 ArgoCD 网络策略缓解措施 (MHSA-47m3-95c7-g2g8)
- 监控仪表板中缺少 Ceph-rook 指标
- 诊断性运行状况检查期间报告的错误不匹配
- 为 uipathctl 创建的工作负载配置资源请求和限制
- 无正常的上游问题
- 杀毒软件阻止了 Redis 启动
- 无法在启用 TLS 证书验证的情况下启动 AI Center 和 Document Understanding Pod
- Fluentd 不会在 IPv6 环境中导出日志
- Studio 桌面版无法加载 Integration Service 连接器和活动
- 运行诊断工具
- 使用 Automation Suite 支持捆绑包
- 探索日志
响应磁盘使用率高警示,并识别在 Automation Suite 中的 Kubernetes 节点上消耗过多存储空间的 Pod。
kubernetes-system
KubernetesDiskPressure
此警示表示 Kubernetes 节点上的磁盘使用率非常高。
如果触发此警示,请尝试查看哪个 Pod 消耗更多磁盘:
-
使用以下命令确认节点是否在
DiskPressure下:kubectl describe node <node-name>kubectl describe node <node-name>
识别输出中的 DiskPressure 条件。
-
检查受影响节点上的磁盘空间使用情况:
df -hdf -h
这将显示所有已装载文件系统上的磁盘使用情况。 确定使用情况偏高的位置。
- 如果磁盘已满且清理不够,请考虑调整节点磁盘的大小(尤其是在 AWS 或 GCP 等云环境中)。 此流程可能涉及扩展数量,具体取决于您的基础架构。
KubernetesMemoryPressure
此警示表示 Kubernetes 节点上的内存使用率非常高。
当 Kubernetes 集群节点内存不足时,发生事件类型为 MemoryPressure 的 Kubernetes 节点,这可能是由应用程序中的内存泄漏引起的。 您需要立即注意此类型的事件,以防止出现任何停机情况,并确保 Kubernetes 集群正常运行。
如果触发此警示,请尝试采取以下步骤来确定节点上消耗较多内存的 Pod:
-
检索节点 CPU 和内存统计信息:
kubectl top nodekubectl top node -
检索节点上运行的 Pod:
kubectl get pods --all-namespaces -o wide --field-selector spec.nodeName=${NODE_NAME}kubectl get pods --all-namespaces -o wide --field-selector spec.nodeName=${NODE_NAME} -
使用以下命令检查命名空间中 Pod 的内存使用情况:
kubectl top pod --namespace <namespace> kubectl logs -f <pod-name> -n <ns>kubectl top pod --namespace <namespace> kubectl logs -f <pod-name> -n <ns>
如果您能够识别任何内存使用率高的 Pod,请检查 Pod 的日志并查找内存泄漏错误。
要解决此问题,请尽可能增加节点的内存规格。
如果问题仍然存在,请生成支持捆绑包并联系 UiPath™ 支持团队。
KubePersistentVolumeFillingUp
出现警告时:可用空间低于 30%,并且可能会在四天内填满。
严重时:可用空间小于 10%。
对于空间不足的任何服务,数据可能难以恢复,因此应在可用空间达到 0% 之前调整卷的大小。
有关说明,请参阅配置集群。
对于特定于 Prometheus 的警示,请参阅Prometheus 存储使用情况以了解详细信息。
KubePersistentVolumeErrors
无法配置持久卷。这意味着任何需要该卷的服务都不会启动。检查 Longhorn 和/或 Ceph 存储是否存在其他错误,并联系 UiPath™ 支持团队。
node-exporter
NodeFilesystemSpaceFillingUp
特定节点上的文件系统正在填满。
如果触发此警示,请考虑执行以下步骤:
-
使用以下命令确认节点是否在
DiskPressure下:kubectl describe node <node-name>kubectl describe node <node-name>识别输出中的
DiskPressure条件。 -
清除日志和临时文件。 检查
/var/log/中的大型日志文件,并在可能的情况下进行清理。 -
检查受影响节点上的磁盘空间使用情况:
df -hdf -h
这将显示所有已装载文件系统上的磁盘使用情况。 确定使用情况偏高的位置。
- 如果磁盘已满且清理不够,请考虑调整节点磁盘的大小(尤其是在 AWS 或 GCP 等云环境中)。 此流程可能涉及扩展数量,具体取决于您的基础架构。
NodeFilesystemAlmostOutOfSpace
特定节点上的文件系统正在填满。通过添加磁盘或装载未使用的磁盘来配置更多空间。
NodeFilesystemFilesFillingUp
特定节点上的文件系统正在填满。通过添加磁盘或装载未使用的磁盘来配置更多空间。
NodeFilesystemAlmostOutOfFiles
特定节点上的文件系统正在填满。通过添加磁盘或装载未使用的磁盘来配置更多空间。
NodeNetworkReceiveErrs
这些错误表明网络驱动程序报告大量故障。 这可能是由物理硬件故障或物理网络中的配置错误引起的。 此问题与操作系统有关,不受 UiPath™ 应用程序控制。
该警示通过监控 Linux 内核提供的 /proc/net/dev 计数器触发。
请联系您的网络管理员和管理物理基础架构的团队。
NodeNetworkTransmitErrs
这些错误表明网络驱动程序报告大量故障。 这可能是由物理硬件故障或物理网络中的配置错误引起的。 此问题与操作系统有关,不受 UiPath™ 应用程序控制。
该警示通过监控 Linux 内核提供的 /proc/net/dev 计数器触发。
请联系您的网络管理员和管理物理基础架构的团队。
ceph.rules、cluster-state-alert.rules
CephClusterErrorState
此警示表示 Ceph 存储集群处于错误状态的时间已超过 10m。
此警示反映rook-ceph-mgr作业处于错误状态的时间过长。 检查在此警示之前可能已触发的其他警示,并首先对其进行故障排除。
kubectl describe cephcluster -n rook-ceph
kubectl describe cephcluster -n rook-ceph
CephMonQuorumAtRisk
此警示表示存储集群仲裁人数不足。
多个 mon 协同工作以提供冗余;这是可能的,因为每个人都保留了元数据的副本。 集群部署了 3 个 mon,并且需要 2 个或更多 mon 启动并运行,才能使仲裁和存储操作运行。 如果仲裁丢失,则对数据的访问存在风险。
如果触发此警示,请检查是否存在任何 OSD 处于终止状态,如果有,请强制删除这些 Pod,并等待一段时间以便运算符进行协调。 如果问题仍然存在,请联系 UiPath™ 支持团队。
CephMgr 不在
此警示表示 Ceph 管理器已从 Prometheus 目标发现中消失。
如果触发此警示,请检查并确保 Ceph 管理器 Pod 正在运行并且运行状况良好。 如果 Pod 运行正常,请检查日志,并检查 Pod 是否能够发出 Prometheus 指标。
Ceph 节点关闭
此警示表示运行 Ceph Pod 的节点已关闭。 虽然存储操作可以继续运行,因为 Ceph 旨在处理节点故障,但建议解决此问题,以最大程度地减少另一个节点关闭并影响存储功能的风险。
如果触发此警示,则在多节点集群的情况下,必须将 Pod 计划在另一个节点上。 确保 rook-ceph 命名空间中的新 osd Pod 正在新节点中运行并处于正常运行状态。
您可以通过使用以下命令描述节点来检查节点故障:
kubectl get nodes
kubectl get nodes
检查节点以确定问题的根本原因,并联系 UiPath™ 支持团队。
cluster-utilization-alert.rules
CephClusterNearFull
此警示表示 Ceph 存储集群利用率已超过 75%,将在 85% 时变为只读状态。
如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。
在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求。
CephClusterCriticallyFull
此警示表示 Ceph 存储集群利用率已超过 80%,将在 85% 时变为只读状态。
如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。
在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求。
CephClusterReadOnly
此警示表示 Ceph 存储集群利用率已超过 85%,现在将变为只读状态。 请立即释放一些空间或扩展存储集群。
如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。
在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求。
osd-alert.rules
CephOSDCriticallyFull
当警示严重性为 Critical 时,可用空间小于 20%。
对于空间不足的任何服务,数据可能难以恢复,因此应在可用空间达到 10% 之前调整卷的大小。请参阅以下说明:配置集群。
CephOSDNearFull
此警示表示 Ceph 存储集群利用率已超过 75%,将在 85% 时变为只读状态。
如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。
在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求。
PersistentVolumeUsageNearFull
此警示表示 Ceph 存储集群利用率已超过 75%,将在 85% 时变为只读状态。
如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。
在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求。
CephOSD 抖动
此警示表示存储守护程序在过去 5 分钟内已重新启动 5 次以上。
如果触发此警示,请执行以下步骤:
-
检查 Ceph 集群运行状况。 您必须在 Ceph 工具箱中运行
ceph status以识别抖动的 OSD:kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph statuskubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status您可以通过列出命名空间中的 Pod 来识别 Ceph 工具 Pod:
kubectl -n rook-ceph get pod | grep toolskubectl -n rook-ceph get pod | grep tools -
检查抖动 OSD Pod 的 OSD 日志,以识别问题:
kubectl -n rook-ceph logs <osd-pod>kubectl -n rook-ceph logs <osd-pod> -
确定节点级别问题:
-
检查资源使用情况:
kubectl top node <node-name>kubectl top node <node-name> -
检查磁盘运行状况。 您需要通过 SSH 连接到节点,并运行
df -h和dmesg以检查磁盘错误。
-
-
重新启动 OSD Pod。 如果问题是暂时的,则需要重新启动抖动的 OSD Pod:
kubectl -n rook-ceph delete pod <osd-pod>kubectl -n rook-ceph delete pod <osd-pod> -
确保 OSD 和 Ceph 显示器之间不存在网络连接问题。
-
如果需要,将抖动的 OSD 临时标记为
out:ceph osd out <osd-id>ceph osd out <osd-id> -
继续监控集群,以确保问题不会再次发生。
CephOSD 磁盘无响应
此警示表示主机磁盘设备无响应。
如果触发此警示,请执行以下步骤:
-
检查 Ceph 集群的状态。 您需要确认 Ceph 集群的整体运行状况,并获取有关 OSD 状态的更多详细信息:
-
在 Ceph 工具箱 Pod 中运行以下命令:
kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph statuskubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status -
通过列出命名空间中的 Pod 来识别 Ceph 工具 Pod:
kubectl -n rook-ceph get pod | grep toolskubectl -n rook-ceph get pod | grep tools
-
-
检查 OSD Pod 状态。 您需要检查 OSD Pod 是否正在运行。 运行以下命令以检查所有 OSD Pod 状态:
kubectl -n rook-ceph get pods | grep osdkubectl -n rook-ceph get pods | grep osd如果任何 OSD Pod 处于
CrashLoopBackOff或Pending状态,则可能表明 OSD 磁盘或基础节点存在问题。 -
重新启动受影响的 OSD Pod。 如果 OSD Pod 处于错误状态(
CrashLoopBackOff、Error等),则必须重新启动该 Pod 以查看问题是否已自行解决。 Kubernetes 会自动尝试重新计划 Pod。kubectl -n rook-ceph delete pod <osd-pod>kubectl -n rook-ceph delete pod <osd-pod>OSD Pod 将重新启动,如果这是暂时问题,则此操作可能会解决。
-
检查 OSD 日志。 如果重新启动不能解决问题,请检查 OSD Pod 日志,详细了解磁盘无响应的原因:
kubectl -n rook-ceph logs <osd-pod>kubectl -n rook-ceph logs <osd-pod>查找与磁盘相关的错误或其他问题(例如,I/O 错误、安装失败)。
-
确定节点级别问题。 如果 OSD 磁盘未正确装载或已断开连接,您可以登录到受影响的节点并检查磁盘装载状态:
ssh <node> df -hssh <node> df -h查找 Ceph 期望的缺失或未装载磁盘。 如有必要,重新装载磁盘或在发生故障时进行更换。
CephOSD磁盘不可用
此警示表示无法在主机上访问 Ceph OSD 磁盘。
如果触发此警示,请执行以下步骤:
-
检查 Ceph 集群的状态。 您需要确认 Ceph 集群的整体运行状况,并获取有关 OSD 状态的更多详细信息:
-
在 Ceph 工具箱 Pod 中运行以下命令:
kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph statuskubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status -
通过列出命名空间中的 Pod 来识别 Ceph 工具 Pod:
kubectl -n rook-ceph get pod | grep toolskubectl -n rook-ceph get pod | grep tools
-
-
检查 OSD Pod 状态。 您需要检查 OSD Pod 是否正在运行。 运行以下命令以检查所有 OSD Pod 状态:
kubectl -n rook-ceph get pods | grep osdkubectl -n rook-ceph get pods | grep osd如果任何 OSD Pod 处于
CrashLoopBackOff或Pending状态,则可能表明 OSD 磁盘或基础节点存在问题。 -
重新启动受影响的 OSD Pod。 如果 OSD Pod 处于错误状态(
CrashLoopBackOff、Error等),则必须重新启动该 Pod 以查看问题是否已自行解决。 Kubernetes 会自动尝试重新计划 Pod。kubectl -n rook-ceph delete pod <osd-pod>kubectl -n rook-ceph delete pod <osd-pod>OSD Pod 将重新启动,如果这是暂时问题,则此操作可能会解决。
-
检查 OSD 日志。 如果重新启动不能解决问题,请检查 OSD Pod 日志,详细了解磁盘无响应的原因:
kubectl -n rook-ceph logs <osd-pod>kubectl -n rook-ceph logs <osd-pod>查找与磁盘相关的错误或其他问题(例如,I/O 错误、安装失败)。
persistent-volume-alert.rules
PersistentVolumeUsageCritical
如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。
在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求。
pool-quota.rules
CephPoolQuotaBytesCriticallyExhausted
此警示表示 Ceph 存储池使用率已超过 90%。
如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 CEPH 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。
在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求。
host-disk
LowDiskForRancherPartition
此警示表示/var/lib/rancher分区的可用空间小于:
- 25% - 警示的严重性为“关键”
您必须登录到主机服务器并验证磁盘使用情况。 您可以使用 df -h /var/lib/rancher 等命令来检查可用磁盘空间。 如果空间不足,请考虑以下选项:
-
清除不必要的文件。 随着时间的推移,日志文件、临时文件、孤立数据和备份可能会消耗大量空间。 定期清理这些文件有助于维护磁盘空间。
-
调整分区大小。 如果文件系统支持,并且磁盘上有未使用的空间,则可以调整分区大小,为其提供更多磁盘空间。
-
添加更多磁盘空间。 如果前面的选项还不够,且您的基础架构允许,请增加磁盘的大小,以使 Rancher 正常运行。
-
检查任何异常大的文件的存储使用情况:
find /var/lib/rancher -type f -exec du -h {} + | sort -rh | head -n 10find /var/lib/rancher -type f -exec du -h {} + | sort -rh | head -n 10 -
检查任何将大文件写入磁盘的容器。
LowDiskForKubeletPartition
此警示表示/var/lib/kubelet分区的可用空间小于:
- 25% - 警示的严重性为“关键”
如果触发此警示,请增加磁盘大小。
LowDiskForVarPartition
此警示表示/var分区的可用空间小于:
- 25% - 警示的严重性为“关键”
发生这种情况的原因可能是容器系统日志的累积。
如果触发此警示,请执行以下步骤:
-
检查存储使用情况:
find /var/ -type f -exec du -h {} + | sort -rh | head -n 10find /var/ -type f -exec du -h {} + | sort -rh | head -n 10 -
增加磁盘大小。
变量日志分区的低磁盘数量
此警示表示/var/lib/var分区的可用空间小于:
- 25% - 警示的严重性为“关键”
如果触发此警示,请增加磁盘大小。
- kubernetes-system
- KubernetesDiskPressure
- KubernetesMemoryPressure
- KubePersistentVolumeFillingUp
- KubePersistentVolumeErrors
- node-exporter
- NodeFilesystemSpaceFillingUp
- NodeFilesystemAlmostOutOfSpace
- NodeFilesystemFilesFillingUp
- NodeFilesystemAlmostOutOfFiles
- NodeNetworkReceiveErrs
- NodeNetworkTransmitErrs
- ceph.rules、cluster-state-alert.rules
- CephClusterErrorState
- CephMonQuorumAtRisk
- CephMgr 不在
- Ceph 节点关闭
- cluster-utilization-alert.rules
- CephClusterNearFull
- CephClusterCriticallyFull
- CephClusterReadOnly
- osd-alert.rules
- CephOSDCriticallyFull
- CephOSDNearFull
- PersistentVolumeUsageNearFull
- CephOSD 抖动
- CephOSD 磁盘无响应
- CephOSD磁盘不可用
- persistent-volume-alert.rules
- PersistentVolumeUsageCritical
- pool-quota.rules
- CephPoolQuotaBytesCriticallyExhausted
- host-disk
- LowDiskForRancherPartition
- LowDiskForKubeletPartition
- LowDiskForVarPartition
- 变量日志分区的低磁盘数量