UiPath Documentation
automation-suite
2.2510
true
Linux 版 Automation Suite 安装指南
重要 :
请注意,此内容已使用机器翻译进行了部分本地化。 新发布内容的本地化可能需要 1-2 周的时间才能完成。

存储警示

响应磁盘使用率高警示,并识别在 Automation Suite 中的 Kubernetes 节点上消耗过多存储空间的 Pod。

kubernetes-system

KubernetesDiskPressure

此警示表示 Kubernetes 节点上的磁盘使用率非常高。

如果触发此警示,请尝试查看哪个 Pod 消耗更多磁盘:

  • 使用以下命令确认节点是否在 DiskPressure 下:

    kubectl describe node <node-name>
    kubectl describe node <node-name>
    

识别输出中的 DiskPressure 条件。

  • 检查受影响节点上的磁盘空间使用情况:

    df -h
    df -h
    

这将显示所有已装载文件系统上的磁盘使用情况。 确定使用情况偏高的位置。

  • 如果磁盘已满且清理不够,请考虑调整节点磁盘的大小(尤其是在 AWS 或 GCP 等云环境中)。 此流程可能涉及扩展数量,具体取决于您的基础架构。

KubernetesMemoryPressure

此警示表示 Kubernetes 节点上的内存使用率非常高。

当 Kubernetes 集群节点内存不足时,发生事件类型为 MemoryPressure 的 Kubernetes 节点,这可能是由应用程序中的内存泄漏引起的。 您需要立即注意此类型的事件,以防止出现任何停机情况,并确保 Kubernetes 集群正常运行。

如果触发此警示,请尝试采取以下步骤来确定节点上消耗较多内存的 Pod:

  1. 检索节点 CPU 和内存统计信息:

    kubectl top node
    kubectl top node
    
  2. 检索节点上运行的 Pod:

    kubectl get pods --all-namespaces -o wide --field-selector spec.nodeName=${NODE_NAME}
    kubectl get pods --all-namespaces -o wide --field-selector spec.nodeName=${NODE_NAME}
    
  3. 使用以下命令检查命名空间中 Pod 的内存使用情况:

    kubectl top pod --namespace <namespace>
    kubectl logs -f <pod-name> -n <ns>
    kubectl top pod --namespace <namespace>
    kubectl logs -f <pod-name> -n <ns>
    

如果您能够识别任何内存使用率高的 Pod,请检查 Pod 的日志并查找内存泄漏错误。

要解决此问题,请尽可能增加节点的内存规格。

如果问题仍然存在,请生成支持捆绑包并联系 UiPath™ 支持团队。

KubePersistentVolumeFillingUp

出现警告时:可用空间低于 30%,并且可能会在四天内填满。

严重时:可用空间小于 10%。

对于空间不足的任何服务,数据可能难以恢复,因此应在可用空间达到 0% 之前调整卷的大小。

有关说明,请参阅配置集群

对于特定于 Prometheus 的警示,请参阅Prometheus 存储使用情况以了解详细信息。

KubePersistentVolumeErrors

无法配置持久卷。这意味着任何需要该卷的服务都不会启动。检查 Longhorn 和/或 Ceph 存储是否存在其他错误,并联系 UiPath™ 支持团队。

node-exporter

NodeFilesystemSpaceFillingUp

特定节点上的文件系统正在填满。

如果触发此警示,请考虑执行以下步骤:

  • 使用以下命令确认节点是否在 DiskPressure 下:

    kubectl describe node <node-name>
    kubectl describe node <node-name>
    

    识别输出中的 DiskPressure 条件。

  • 清除日志和临时文件。 检查 /var/log/ 中的大型日志文件,并在可能的情况下进行清理。

  • 检查受影响节点上的磁盘空间使用情况:

    df -h
    df -h
    

这将显示所有已装载文件系统上的磁盘使用情况。 确定使用情况偏高的位置。

  • 如果磁盘已满且清理不够,请考虑调整节点磁盘的大小(尤其是在 AWS 或 GCP 等云环境中)。 此流程可能涉及扩展数量,具体取决于您的基础架构。

NodeFilesystemAlmostOutOfSpace

特定节点上的文件系统正在填满。通过添加磁盘或装载未使用的磁盘来配置更多空间。

NodeFilesystemFilesFillingUp

特定节点上的文件系统正在填满。通过添加磁盘或装载未使用的磁盘来配置更多空间。

NodeFilesystemAlmostOutOfFiles

特定节点上的文件系统正在填满。通过添加磁盘或装载未使用的磁盘来配置更多空间。

NodeNetworkReceiveErrs

这些错误表明网络驱动程序报告大量故障。 这可能是由物理硬件故障或物理网络中的配置错误引起的。 此问题与操作系统有关,不受 UiPath™ 应用程序控制。

该警示通过监控 Linux 内核提供的 /proc/net/dev 计数器触发。

请联系您的网络管理员和管理物理基础架构的团队。

NodeNetworkTransmitErrs

这些错误表明网络驱动程序报告大量故障。 这可能是由物理硬件故障或物理网络中的配置错误引起的。 此问题与操作系统有关,不受 UiPath™ 应用程序控制。

该警示通过监控 Linux 内核提供的 /proc/net/dev 计数器触发。

请联系您的网络管理员和管理物理基础架构的团队。

ceph.rules、cluster-state-alert.rules

CephClusterErrorState

此警示表示 Ceph 存储集群处于错误状态的时间已超过 10m。

此警示反映rook-ceph-mgr作业处于错误状态的时间过长。 检查在此警示之前可能已触发的其他警示,并首先对其进行故障排除。

kubectl describe cephcluster -n rook-ceph
kubectl describe cephcluster -n rook-ceph

CephMonQuorumAtRisk

此警示表示存储集群仲裁人数不足。

多个 mon 协同工作以提供冗余;这是可能的,因为每个人都保留了元数据的副本。 集群部署了 3 个 mon,并且需要 2 个或更多 mon 启动并运行,才能使仲裁和存储操作运行。 如果仲裁丢失,则对数据的访问存在风险。

如果触发此警示,请检查是否存在任何 OSD 处于终止状态,如果有,请强制删除这些 Pod,并等待一段时间以便运算符进行协调。 如果问题仍然存在,请联系 UiPath™ 支持团队。

CephMgr 不在

此警示表示 Ceph 管理器已从 Prometheus 目标发现中消失。

如果触发此警示,请检查并确保 Ceph 管理器 Pod 正在运行并且运行状况良好。 如果 Pod 运行正常,请检查日志,并检查 Pod 是否能够发出 Prometheus 指标。

Ceph 节点关闭

此警示表示运行 Ceph Pod 的节点已关闭。 虽然存储操作可以继续运行,因为 Ceph 旨在处理节点故障,但建议解决此问题,以最大程度地减少另一个节点关闭并影响存储功能的风险。

如果触发此警示,则在多节点集群的情况下,必须将 Pod 计划在另一个节点上。 确保 rook-ceph 命名空间中的新 osd Pod 正在新节点中运行并处于正常运行状态。

您可以通过使用以下命令描述节点来检查节点故障:

kubectl get nodes
kubectl get nodes

检查节点以确定问题的根本原因,并联系 UiPath™ 支持团队。

cluster-utilization-alert.rules

CephClusterNearFull

此警示表示 Ceph 存储集群利用率已超过 75%,将在 85% 时变为只读状态。

如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。

在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求

CephClusterCriticallyFull

此警示表示 Ceph 存储集群利用率已超过 80%,将在 85% 时变为只读状态。

如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。

在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求

CephClusterReadOnly

此警示表示 Ceph 存储集群利用率已超过 85%,现在将变为只读状态。 请立即释放一些空间或扩展存储集群。

如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。

在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求

osd-alert.rules

CephOSDCriticallyFull

当警示严重性为 Critical 时,可用空间小于 20%。

对于空间不足的任何服务,数据可能难以恢复,因此应在可用空间达到 10% 之前调整卷的大小。请参阅以下说明:配置集群

CephOSDNearFull

此警示表示 Ceph 存储集群利用率已超过 75%,将在 85% 时变为只读状态。

如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。

在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求

PersistentVolumeUsageNearFull

此警示表示 Ceph 存储集群利用率已超过 75%,将在 85% 时变为只读状态。

如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。

在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求

CephOSD 抖动

此警示表示存储守护程序在过去 5 分钟内已重新启动 5 次以上。

如果触发此警示,请执行以下步骤:

  1. 检查 Ceph 集群运行状况。 您必须在 Ceph 工具箱中运行 ceph status 以识别抖动的 OSD:

    kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
    kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
    

    您可以通过列出命名空间中的 Pod 来识别 Ceph 工具 Pod:

    kubectl -n rook-ceph get pod | grep tools
    kubectl -n rook-ceph get pod | grep tools
    
  2. 检查抖动 OSD Pod 的 OSD 日志,以识别问题:

    kubectl -n rook-ceph logs <osd-pod>
    kubectl -n rook-ceph logs <osd-pod>
    
  3. 确定节点级别问题:

    • 检查资源使用情况:

      kubectl top node <node-name>
      kubectl top node <node-name>
      
    • 检查磁盘运行状况。 您需要通过 SSH 连接到节点,并运行 df -hdmesg 以检查磁盘错误。

  4. 重新启动 OSD Pod。 如果问题是暂时的,则需要重新启动抖动的 OSD Pod:

    kubectl -n rook-ceph delete pod <osd-pod>
    kubectl -n rook-ceph delete pod <osd-pod>
    
  5. 确保 OSD 和 Ceph 显示器之间不存在网络连接问题。

  6. 如果需要,将抖动的 OSD 临时标记为 out

    ceph osd out <osd-id>
    ceph osd out <osd-id>
    
  7. 继续监控集群,以确保问题不会再次发生。

CephOSD 磁盘无响应

此警示表示主机磁盘设备无响应。

如果触发此警示,请执行以下步骤:

  1. 检查 Ceph 集群的状态。 您需要确认 Ceph 集群的整体运行状况,并获取有关 OSD 状态的更多详细信息:

    • 在 Ceph 工具箱 Pod 中运行以下命令:

      kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
      kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
      
    • 通过列出命名空间中的 Pod 来识别 Ceph 工具 Pod:

      kubectl -n rook-ceph get pod | grep tools
      kubectl -n rook-ceph get pod | grep tools
      
  2. 检查 OSD Pod 状态。 您需要检查 OSD Pod 是否正在运行。 运行以下命令以检查所有 OSD Pod 状态:

    kubectl -n rook-ceph get pods | grep osd
    kubectl -n rook-ceph get pods | grep osd
    

    如果任何 OSD Pod 处于 CrashLoopBackOffPending 状态,则可能表明 OSD 磁盘或基础节点存在问题。

  3. 重新启动受影响的 OSD Pod。 如果 OSD Pod 处于错误状态(CrashLoopBackOffError 等),则必须重新启动该 Pod 以查看问题是否已自行解决。 Kubernetes 会自动尝试重新计划 Pod。

    kubectl -n rook-ceph delete pod <osd-pod>
    kubectl -n rook-ceph delete pod <osd-pod>
    

    OSD Pod 将重新启动,如果这是暂时问题,则此操作可能会解决。

  4. 检查 OSD 日志。 如果重新启动不能解决问题,请检查 OSD Pod 日志,详细了解磁盘无响应的原因:

    kubectl -n rook-ceph logs <osd-pod>
    kubectl -n rook-ceph logs <osd-pod>
    

    查找与磁盘相关的错误或其他问题(例如,I/O 错误、安装失败)。

  5. 确定节点级别问题。 如果 OSD 磁盘未正确装载或已断开连接,您可以登录到受影响的节点并检查磁盘装载状态:

    ssh <node> df -h
    ssh <node> df -h
    

    查找 Ceph 期望的缺失或未装载磁盘。 如有必要,重新装载磁盘或在发生故障时进行更换。

CephOSD磁盘不可用

此警示表示无法在主机上访问 Ceph OSD 磁盘。

如果触发此警示,请执行以下步骤:

  1. 检查 Ceph 集群的状态。 您需要确认 Ceph 集群的整体运行状况,并获取有关 OSD 状态的更多详细信息:

    • 在 Ceph 工具箱 Pod 中运行以下命令:

      kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
      kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
      
    • 通过列出命名空间中的 Pod 来识别 Ceph 工具 Pod:

      kubectl -n rook-ceph get pod | grep tools
      kubectl -n rook-ceph get pod | grep tools
      
  2. 检查 OSD Pod 状态。 您需要检查 OSD Pod 是否正在运行。 运行以下命令以检查所有 OSD Pod 状态:

    kubectl -n rook-ceph get pods | grep osd
    kubectl -n rook-ceph get pods | grep osd
    

    如果任何 OSD Pod 处于 CrashLoopBackOffPending 状态,则可能表明 OSD 磁盘或基础节点存在问题。

  3. 重新启动受影响的 OSD Pod。 如果 OSD Pod 处于错误状态(CrashLoopBackOffError 等),则必须重新启动该 Pod 以查看问题是否已自行解决。 Kubernetes 会自动尝试重新计划 Pod。

    kubectl -n rook-ceph delete pod <osd-pod>
    kubectl -n rook-ceph delete pod <osd-pod>
    

    OSD Pod 将重新启动,如果这是暂时问题,则此操作可能会解决。

  4. 检查 OSD 日志。 如果重新启动不能解决问题,请检查 OSD Pod 日志,详细了解磁盘无响应的原因:

    kubectl -n rook-ceph logs <osd-pod>
    kubectl -n rook-ceph logs <osd-pod>
    

    查找与磁盘相关的错误或其他问题(例如,I/O 错误、安装失败)。

persistent-volume-alert.rules

PersistentVolumeUsageCritical

如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 Ceph 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。

在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求

pool-quota.rules

CephPoolQuotaBytesCriticallyExhausted

此警示表示 Ceph 存储池使用率已超过 90%。

如果触发此警示,请通过删除 AI Center 中一些未使用的数据集,在 CEPH 中释放一些空间,或者扩展可用于 Ceph PVC 的存储。

在调整 PVC 的大小之前,请确保您满足存储要求。有关详细信息,请参阅评估存储需求

host-disk

LowDiskForRancherPartition

此警示表示/var/lib/rancher分区的可用空间小于:

  • 25% - 警示的严重性为“关键”

您必须登录到主机服务器并验证磁盘使用情况。 您可以使用 df -h /var/lib/rancher 等命令来检查可用磁盘空间。 如果空间不足,请考虑以下选项:

  • 清除不必要的文件。 随着时间的推移,日志文件、临时文件、孤立数据和备份可能会消耗大量空间。 定期清理这些文件有助于维护磁盘空间。

  • 调整分区大小。 如果文件系统支持,并且磁盘上有未使用的空间,则可以调整分区大小,为其提供更多磁盘空间。

  • 添加更多磁盘空间。 如果前面的选项还不够,且您的基础架构允许,请增加磁盘的大小,以使 Rancher 正常运行。

  • 检查任何异常大的文件的存储使用情况:

    find /var/lib/rancher -type f -exec du -h {} + | sort -rh | head -n 10
    find /var/lib/rancher -type f -exec du -h {} + | sort -rh | head -n 10
    
  • 检查任何将大文件写入磁盘的容器。

LowDiskForKubeletPartition

此警示表示/var/lib/kubelet分区的可用空间小于:

  • 25% - 警示的严重性为“关键”

如果触发此警示,请增加磁盘大小。

LowDiskForVarPartition

此警示表示/var分区的可用空间小于:

  • 25% - 警示的严重性为“关键”
备注:

发生这种情况的原因可能是容器系统日志的累积。

如果触发此警示,请执行以下步骤:

  1. 检查存储使用情况:

    find /var/ -type f -exec du -h {} + | sort -rh | head -n 10
    find /var/ -type f -exec du -h {} + | sort -rh | head -n 10
    
  2. 增加磁盘大小。

变量日志分区的低磁盘数量

此警示表示/var/lib/var分区的可用空间小于:

  • 25% - 警示的严重性为“关键”

如果触发此警示,请增加磁盘大小。

此页面有帮助吗?

连接

需要帮助? 支持

想要了解详细内容? UiPath Academy

有问题? UiPath 论坛

保持更新