UiPath Documentation
automation-suite
2.2510
true
Guide d'installation d'Automation Suite sur Linux
Important :
Veuillez noter que ce contenu a été localisé en partie à l’aide de la traduction automatique. La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.

Alertes de stockage

Répondre aux alertes d'utilisation élevée du disque et identifier les pods utilisant un stockage excessif sur les nœuds Kubernetes dans Automation Suite.

kubernetes-system

KubernetesDiskPressure

Cette alerte indique que l'utilisation du disque est très élevée sur le nœud Kubernetes.

Si cette alerte se déclenche, essayez de voir quel pod consomme davantage de disque :

  • Confirmez si le nœud se trouve sous DiskPressure à l'aide de la commande suivante :

    kubectl describe node <node-name>
    kubectl describe node <node-name>
    

Identifiez la condition DiskPressure dans la sortie.

  • Vérifiez l'utilisation de l'espace disque sur le nœud concerné :

    df -h
    df -h
    

Cela indique l'utilisation du disque sur tous les systèmes de fichiers montés. Identifier où l’utilisation élevée.

  • Si le disque est plein et que le nettoyage est insuffisant, envisagez de redimensionner le disque pour le nœud (en particulier dans les environnements cloud tels qu’AWS ou GCP). Ce processus peut impliquer une augmentation des volumes, en fonction de votre infrastructure.

KubernetesMemoryPressure

Cette alerte indique que l'utilisation de la mémoire est très élevée sur le nœud Kubernetes.

Les nœuds Kubernetes avec le type d'incident MemoryPressure se produisent lorsqu'un nœud de cluster Kubernetes dispose d'une mémoire insuffisante, ce qui peut être dû à une fuite de mémoire dans une application. Ce type d'incident nécessite une attention immédiate pour éviter tout temps d'arrêt et assurer le bon fonctionnement du cluster Kubernetes.

Si cette alerte se déclenche, essayez d'identifier le pod sur le nœud qui consomme plus de mémoire, en procédant comme suit :

  1. Récupérez les statistiques du processeur et de la mémoire des nœuds :

    kubectl top node
    kubectl top node
    
  2. Récupérez les pods exécutés sur le nœud :

    kubectl get pods --all-namespaces -o wide --field-selector spec.nodeName=${NODE_NAME}
    kubectl get pods --all-namespaces -o wide --field-selector spec.nodeName=${NODE_NAME}
    
  3. Vérifiez l'utilisation de la mémoire pour les pods dans un espace de noms en utilisant :

    kubectl top pod --namespace <namespace>
    kubectl logs -f <pod-name> -n <ns>
    kubectl top pod --namespace <namespace>
    kubectl logs -f <pod-name> -n <ns>
    

Si vous êtes en mesure d'identifier n'importe quel pod avec une utilisation élevée de la mémoire, consultez les journaux du pod et recherchez les erreurs de fuite de mémoire.

Pour résoudre ce problème, augmentez si possible les spécifications de mémoire des nœuds.

Si le problème persiste, générez le pack d’assistance et contactez le support UiPath®.

KubePersistentVolumeFillingUp

Quand Avertissement : l'espace disponible est inférieur à 30 % et il est probable qu'il se remplira d'ici quatre jours.

Lorsque critique : l'espace disponible est inférieur à 10 %.

Pour tous les services qui manquent d'espace, les données peuvent être difficiles à récupérer, les volumes doivent donc être redimensionnés avant d'atteindre 0 % d'espace disponible.

Pour obtenir des instructions, consultez la section Configuration du cluster.

Pour les alertes spécifiques à Prometheus, reportez-vous à PrometheusStorageUsage pour plus de détails.

KubePersistentVolumeErrors

PersistentVolume ne peut pas être enregistré. Cela signifie que tout service nécessitant le volume ne démarrerait pas. Recherchez d’autres erreurs avec le stockage Longhorn et/ou Ceph et contactez le support UiPath®.

node-exporter

NodeFilesystemSpaceFillingUp

Le système de fichiers sur un nœud particulier se remplit.

Si cette alerte se déclenche, tenez compte des étapes suivantes :

  • Confirmez si le nœud se trouve sous DiskPressure à l'aide de la commande suivante :

    kubectl describe node <node-name>
    kubectl describe node <node-name>
    

    Identifiez la condition DiskPressure dans la sortie.

  • Effacez les journaux et les fichiers temporaires. Vérifiez les fichiers journaux volumineux dans /var/log/ et supprimez-les, si possible.

  • Vérifiez l'utilisation de l'espace disque sur le nœud concerné :

    df -h
    df -h
    

Cela indique l'utilisation du disque sur tous les systèmes de fichiers montés. Identifier où l’utilisation élevée.

  • Si le disque est plein et que le nettoyage est insuffisant, envisagez de redimensionner le disque pour le nœud (en particulier dans les environnements cloud tels qu’AWS ou GCP). Ce processus peut impliquer une augmentation des volumes, en fonction de votre infrastructure.

NodeFilesystemAlmostOutOfSpace

Le système de fichiers sur un nœud particulier se remplit. Enregistrez plus d'espace en ajoutant un disque ou en montant des disques inutilisés.

NodeFilesystemFilesFillingUp

Le système de fichiers sur un nœud particulier se remplit. Enregistrez plus d'espace en ajoutant un disque ou en montant des disques inutilisés.

NodeFilesystemAlmostOutOfFiles

Le système de fichiers sur un nœud particulier se remplit. Enregistrez plus d'espace en ajoutant un disque ou en montant des disques inutilisés.

NodeNetworkReceiveErrs

Ces erreurs indiquent que le pilote réseau signale un nombre élevé d'échecs. Cela peut être dû à des défaillances matérielles ou à une mauvaise configuration du réseau physique. Ce problème concerne le système d’exploitation et n’est pas contrôlé par l’application UiPath®.

L'alerte est déclenchée en surveillant le compteur/proc/net/dev fourni par le noyau Linux.

Contactez votre administrateur réseau et l'équipe qui gère l'infrastructure physique.

NodeNetworkTransmitErrs

Ces erreurs indiquent que le pilote réseau signale un nombre élevé d'échecs. Cela peut être dû à des défaillances matérielles ou à une mauvaise configuration du réseau physique. Ce problème concerne le système d’exploitation et n’est pas contrôlé par l’application UiPath®.

L'alerte est déclenchée en surveillant le compteur/proc/net/dev fourni par le noyau Linux.

Contactez votre administrateur réseau et l'équipe qui gère l'infrastructure physique.

ceph.rules, cluster-state-alert.rules

CephClusterErrorState

Cette alerte indique que le cluster de stockage Ceph est en état d'erreur depuis plus de 10 minutes.

Cette alerte indique que la tâche rook-ceph-mgr est en état d'erreur depuis une durée inacceptable. Recherchez d’autres alertes qui auraient pu être déclenchées avant celle-ci et résolvez-les en premier.

kubectl describe cephcluster -n rook-ceph
kubectl describe cephcluster -n rook-ceph

CephMonQuorumAtRisk

Cette alerte indique que le quorum du cluster de stockage est faible.

Plusieurs mons fonctionnent ensemble pour assurer la redondance ; cela est possible car chacun conserve une copie des métadonnées. Le cluster est déployé avec 3 mons et nécessite 2 mons ou plus pour être opérationnel pour le quorum et pour que les opérations de stockage s'exécutent. Si le quorum est perdu, l'accès aux données est menacé.

Si cette alerte se déclenche, vérifiez si des OSD sont en fin d’exécution ; le cas échéant, supprimez ces pods et laissez un certain temps s’écouler afin que l’opérateur puisse procéder au rapprochement. Si le problème persiste, contactez le support UiPath®.

CephMgrIsAbsent

Cette alerte indique que Ceph Manager a disparu de la découverte de cibles Prometheus.

Si cette alerte se déclenche, vérifiez et assurez-vous que le pod du gestionnaire Ceph est opérationnel et sain. Si le pod est sain, consultez les journaux et vérifiez si le pod est activé pour émettre des métriques Prometheus.

Nœud Ceph

Cette alerte indique qu'un nœud exécutant des pods Ceph est en panne. Bien que les opérations de stockage continuent de fonctionner car Ceph est conçu pour gérer une défaillance de nœud, il est recommandé de résoudre le problème afin de minimiser le risque qu'un autre nœud tombe en panne et affecte les fonctions de stockage.

Si cette alerte se déclenche, dans le cas d'un cluster multi-nœuds, le pod doit être planifié sur un autre nœud. Assurez-vous que les nouveaux pods OSD dans l'espace de noms rook-ceph sont en cours d'exécution et en état sain dans le nouveau nœud.

Vous pouvez vérifier l'échec du nœud en décrivant le nœud à l'aide de la commande suivante :

kubectl get nodes
kubectl get nodes

Vérifiez le nœud pour identifier la cause profonde du problème et contactez l’assistance UiPath®.

cluster-utilization-alert.rules

CephClusterNearFull

Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 75 % et passera en lecture seule à 85 %.

Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.

Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.

CephClusterCriticallyFull

Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 80 % et passera en lecture seule à 85 %.

Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.

Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.

CephClusterReadOnly

Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 85 % et passera désormais en lecture seule. Libérez de l'espace ou développez immédiatement le cluster de stockage.

Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.

Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.

osd-alert.rules

CephOSDCriticallyFull

Lorsque la gravité de l'alerte est Critique (Critical), l'espace disponible est inférieur à 20 %.

Pour tous les services qui manquent d'espace, les données peuvent être difficiles à récupérer, nous vous recommandons donc de redimensionner les volumes avant d'atteindre 10 % d'espace disponible. Consultez les instructions suivantes : Configuration du cluster.

CephOSDNearFull

Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 75 % et passera en lecture seule à 85 %.

Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.

Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.

PersistentVolumeUsageNearFull

Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 75 % et passera en lecture seule à 85 %.

Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.

Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.

Mappage CephOSDFl

Cette alerte indique que le démon de stockage a redémarré plus de 5 fois en 5 dernières minutes.

Si cette alerte se déclenche, procédez comme suit :

  1. Vérifiez l'intégrité du cluster Ceph. Vous devez exécuter ceph status dans la boîte à outils Ceph pour identifier les OSD flottants :

    kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
    kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
    

    Vous pouvez identifier le pod de Ceph Tools en répertoriant les pods dans l'espace de noms :

    kubectl -n rook-ceph get pod | grep tools
    kubectl -n rook-ceph get pod | grep tools
    
  2. Consultez les journaux OSD du pod OSD flottant pour identifier les problèmes :

    kubectl -n rook-ceph logs <osd-pod>
    kubectl -n rook-ceph logs <osd-pod>
    
  3. Identifier les problèmes au niveau du nœud :

    • Vérifiez l’utilisation des ressources :

      kubectl top node <node-name>
      kubectl top node <node-name>
      
    • Vérifiez l'intégrité du disque. Vous devez vous connecter en SSH au nœud et exécuterdf -h et dmesg pour vérifier les erreurs de disque.

  4. Redémarrez le pod OSD. Si le problème est temporaire, vous devez redémarrer le pod OSD flottant :

    kubectl -n rook-ceph delete pod <osd-pod>
    kubectl -n rook-ceph delete pod <osd-pod>
    
  5. Assurez-vous qu'il n'y a pas de problèmes de connectivité réseau entre les OSD et les moniteurs Ceph.

  6. Si nécessaire, marquez temporairement l'OSD flottant comme out:

    ceph osd out <osd-id>
    ceph osd out <osd-id>
    
  7. Continuez à surveiller le cluster pour vous assurer que le problème ne se produit pas.

Disque CephOSD Ne Répond pas

Cette alerte indique que le périphérique de disque hôte ne répond pas.

Si cette alerte se déclenche, procédez comme suit :

  1. Vérifiez le statut du cluster Ceph. Vous devez confirmer l'intégrité globale du cluster Ceph et obtenir plus de détails sur le statut de l'OSD :

    • Exécutez la commande suivante dans le pod de boîte à outils Ceph :

      kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
      kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
      
    • Identifiez le pod de outils Ceph en répertoriant les pods dans l'espace de noms :

      kubectl -n rook-ceph get pod | grep tools
      kubectl -n rook-ceph get pod | grep tools
      
  2. Vérifiez le statut du pod OSD. Vous devez vérifier si les pods OSD sont en cours d'exécution. Exécutez la commande suivante pour vérifier tous les statuts des pods OSD :

    kubectl -n rook-ceph get pods | grep osd
    kubectl -n rook-ceph get pods | grep osd
    

    Si un pod OSD est dans un état CrashLoopBackOff ou Pending, cela peut indiquer un problème avec le disque OSD ou le nœud sous-jacent.

  3. Redémarrez le pod OSD affecté. Si un pod OSD est dans un état incorrect (CrashLoopBackOff, Error, etc.), vous devez redémarrer le pod pour voir si le problème se résout lui-même. Kubernetes tente automatiquement de replanifier le pod.

    kubectl -n rook-ceph delete pod <osd-pod>
    kubectl -n rook-ceph delete pod <osd-pod>
    

    Le pod OSD sera redémarré, et s'il s'agit d'un problème temporaire, cela pourra le résoudre.

  4. Vérifiez les journaux du système d'exploitation. Si le redémarrage n'a pas résolu le problème, consultez les journaux du pod OSD pour plus de détails sur la raison pour laquelle le disque ne répond pas :

    kubectl -n rook-ceph logs <osd-pod>
    kubectl -n rook-ceph logs <osd-pod>
    

    Recherchez les erreurs liées au disque ou d'autres problèmes (par exemple, erreurs d'E/S, échec de montages).

  5. Identifier les problèmes au niveau du nœud. Si le disque OSD n'est pas monté correctement ou a été déconnecté, vous pouvez vous connecter au nœud concerné et vérifier l'état de montage du disque :

    ssh <node> df -h
    ssh <node> df -h
    

    Recherchez les disques manquants ou non montés que Ceph attend. Si nécessaire, montez le disque ou remplacez-le s'il a échoué.

DisqueCephOSDIndisponible

Cette alerte indique que le disque Ceph OSD n'est pas accessible sur l'hôte.

Si cette alerte se déclenche, procédez comme suit :

  1. Vérifiez le statut du cluster Ceph. Vous devez confirmer l'intégrité globale du cluster Ceph et obtenir plus de détails sur le statut de l'OSD :

    • Exécutez la commande suivante dans le pod de boîte à outils Ceph :

      kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
      kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status
      
    • Identifiez le pod de outils Ceph en répertoriant les pods dans l'espace de noms :

      kubectl -n rook-ceph get pod | grep tools
      kubectl -n rook-ceph get pod | grep tools
      
  2. Vérifiez le statut du pod OSD. Vous devez vérifier si les pods OSD sont en cours d'exécution. Exécutez la commande suivante pour vérifier tous les statuts des pods OSD :

    kubectl -n rook-ceph get pods | grep osd
    kubectl -n rook-ceph get pods | grep osd
    

    Si un pod OSD est dans un état CrashLoopBackOff ou Pending, cela peut indiquer un problème avec le disque OSD ou le nœud sous-jacent.

  3. Redémarrez le pod OSD affecté. Si un pod OSD est dans un état incorrect (CrashLoopBackOff, Error, etc.), vous devez redémarrer le pod pour voir si le problème se résout lui-même. Kubernetes tente automatiquement de replanifier le pod.

    kubectl -n rook-ceph delete pod <osd-pod>
    kubectl -n rook-ceph delete pod <osd-pod>
    

    Le pod OSD sera redémarré, et s'il s'agit d'un problème temporaire, cela pourra le résoudre.

  4. Vérifiez les journaux du système d'exploitation. Si le redémarrage n'a pas résolu le problème, consultez les journaux du pod OSD pour plus de détails sur la raison pour laquelle le disque ne répond pas :

    kubectl -n rook-ceph logs <osd-pod>
    kubectl -n rook-ceph logs <osd-pod>
    

    Recherchez les erreurs liées au disque ou d'autres problèmes (par exemple, erreurs d'E/S, échec de montages).

persistent-volume-alert.rules

PersistentVolumeUsageCritical

Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.

Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.

pool-quota.rules

CephPoolQuotaBytesCriticallyExhausted

Cette alerte indique que l'utilisation du pool de stockage Ceph a dépassé 90 %.

Si cette alerte se déclenche, libérez de l'espace dans CEPH en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.

Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.

host-disk

LowDiskForRancherPartition

Cette alerte indique que l'espace libre de la partition /var/lib/rancher est inférieur à :

  • 25 % : la gravité de l'alerte est critique

Vous devez vous connecter au serveur hôte et vérifier l'utilisation du disque. Vous pouvez utiliser des commandes telles que df -h /var/lib/rancher pour vérifier l'espace disque disponible. Si vous disposez d'un espace insuffisant, envisagez les options suivantes :

  • Effacez les fichiers inutiles. Au fil du temps, les fichiers journaux, les fichiers temporaires, les données orphelines et les sauvegardes peuvent consommer beaucoup d'espace. Le nettoyage régulier de ces fichiers peut aider à maintenir l'espace disque.

  • Redimensionnez la partition. Si votre système de fichiers le prend en charge et s'il y a de l'espace inutilisé disponible sur votre disque, vous pouvez redimensionner la partition pour lui donner plus d'espace disque.

  • Ajoutez plus d'espace disque. Si les options précédentes ne sont pas suffisantes et si votre infrastructure le permet, augmentez la taille du disque pour un fonctionnement correct de Rancher.

  • Vérifiez l'utilisation du stockage pour tous les fichiers anormalement volumineux :

    find /var/lib/rancher -type f -exec du -h {} + | sort -rh | head -n 10
    find /var/lib/rancher -type f -exec du -h {} + | sort -rh | head -n 10
    
  • Vérifiez tous les conteneurs qui écrivent des fichiers volumineux sur le disque.

LowDiskForKubeletPartition

Cette alerte indique que l'espace libre de la partition /var/lib/kubelet est inférieur à :

  • 25 % : la gravité de l'alerte est critique

Si cette alerte se déclenche, augmentez la taille du disque.

LowDiskForVarPartition

Cette alerte indique que l'espace libre de la partition /var est inférieur à :

  • 25 % : la gravité de l'alerte est critique
Remarque :

Cela peut se produire en raison de l'accumulation de journaux système de conteneur.

Si cette alerte se déclenche, procédez comme suit :

  1. Vérifiez l'utilisation du stockage :

    find /var/ -type f -exec du -h {} + | sort -rh | head -n 10
    find /var/ -type f -exec du -h {} + | sort -rh | head -n 10
    
  2. Augmentez la taille du disque.

LowDiskForVarLogPartition

Cette alerte indique que l'espace libre de la partition /var/lib/var est inférieur à :

  • 25 % : la gravité de l'alerte est critique

Si cette alerte se déclenche, augmentez la taille du disque.

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour