- Vue d'ensemble (Overview)
- Prérequis
- Modèles de déploiement
- Manuel : Préparation de l'installation
- Manuel : Préparation de l'installation
- Étape 2 : configurer le registre compatible OCI pour les installations hors ligne
- Étape 3 : configurer le magasin d’objets externe
- Étape 4 : Configuration de High Availability Add-on
- Étape 5 : configurer les bases de données SQL
- Étape 7 : configurer le DNS
- Étape 8 : configuration des disques
- Étape 9 : configurer les paramètres au niveau du noyau et du système d’exploitation
- Étape 10 : configuration des ports de nœud
- Étape 11 : appliquer divers paramètres
- Étape 12 : Valider et installer les packages RPM requis
- Étape 13 : génération du fichier cluster_config.json
- Exemple Cluster_config.json
- Configuration générale
- Configuration du profil
- Configuration du certificat
- Configuration de la base de données
- Configuration du magasin d'objets externe
- Configuration d'URL pré-signée
- Configuration d'ArgoCD
- Configuration de l'authentification Kerberos
- Configuration du registre externe compatible OCI
- Disaster Recovery : configurations actif/passif et actif/actif
- Configuration de High Availability Add-on
- Configuration spécifique à Orchestrator
- Configuration spécifique à Insights
- Configuration spécifique à Process Mining
- Configuration spécifique à Document Understanding
- Configuration spécifique à Automation Suite Robots
- Configuration de la surveillance
- Facultatif : configuration du serveur proxy
- Facultatif : Activation de la résilience aux échecs locaux dans un cluster en mode production multi-nœuds compatible haute disponibilité
- Facultatif : Transmettre le fichier personnalisé resolv.conf
- Facultatif : augmentation de la tolérance aux pannes
- Ajout d'un nœud d'agent dédié avec prise en charge GPU
- Ajout d'un nœud d'agent dédié pour les Automation Suite Robots
- Étape 15 : configuration du registre Docker temporaire pour les installations hors ligne
- Étape 16 : validation des prérequis de l’installation
- Exécution de uipathctl
- Manuel : Exécution de l'installation
- Post-installation
- Administration du cluster
- Gestion des produits
- Premiers pas avec le portail d'administration du cluster
- Migration de Redis de High Availability Add-on externe vers un une version externe de High Availability Add-on
- Migration des données entre les librairies
- Migration d'un magasin d'objets intégré au cluster vers un magasin d'objets externe
- Migration du registre intégré au cluster vers un registre externe compatible OCI
- Basculer manuellement vers le cluster secondaire dans une configuration actif/passif
- Disaster Recovery : exécution d'opérations post-installation
- Conversion d'une installation existante en configuration multi-sites
- Recommandations pour mettre à niveau un déploiement actif/passif ou actif/actif
- Recommandations pour sauvegarder et restaurer un déploiement actif/passif ou actif/actif
- Mise à l'échelle d'un déploiement à nœud unique (évaluation) vers un déploiement multi-nœuds (HA)
- Surveillance et alerte
- Migration et mise à niveau
- Migration entre les clusters Automation Suite
- Mettre à niveau Automation Suite
- Téléchargement des packages d'installation et obtention de l'ensemble des fichiers sur le premier nœud de serveur
- Récupération de la dernière configuration appliquée à partir du cluster
- Mise à jour de la configuration du cluster
- Configuration du registre compatible OCI pour les installations hors ligne
- Exécution de la mise à niveau
- Exécution d'opérations post-mise à niveau
- Configuration spécifique au produit
- Configuration avancée d'Orchestrator
- Configuration des paramètres d'Orchestrator
- Configuration des paramètres d'application
- Configuration de la taille maximale de la requête
- Remplacement de la configuration du stockage au niveau du cluster
- Configuration de NLog
- Enregistrement des journaux du robot dans Elasticsearch
- Configuration des magasins d'informations d'identification
- Configuration de la clé de chiffrement par locataire
- Nettoyer la base de données Orchestrator
- Ignorer l’installation de la bibliothèque hôte
- Rotation des informations d’identification de stockage d’objets blob
- Désactivation de l'utilisation d'URL pré-signées lors du téléchargement de données vers le stockage Amazon S3
- Configuration de la sécurité de l'application de processus
- Configurer une authentification Kerberos avec l’authentification MSSQL de base pour Process Mining
- Bonnes pratiques et maintenance
- Résolution des problèmes
- Comment résoudre les problèmes des services lors de l'installation
- Comment réduire les autorisations d’un répertoire de sauvegarde NFS
- Comment désinstaller le cluster
- Comment nettoyer les artefacts hors ligne pour améliorer l'espace disque
- Comment effacer les données Redis
- Comment activer la journalisation Istio
- Comment nettoyer manuellement les journaux
- Comment nettoyer les anciens journaux stockés dans le compartiment sf-logs
- Comment désactiver les journaux de diffusion pour AI Center
- Comment déboguer les installations d'Automation Suite ayant échoué
- Comment supprimer des images de l’ancien programme d’installation après la mise à niveau
- Comment désactiver le déchargement de la somme de contrôle txt
- Comment définir manuellement le niveau de journalisation d’ArgoCD sur Info
- Comment augmenter le stockage d’AI Center
- Comment générer la valeur pull_secret_value encodée pour les registres externes
- Comment résoudre les chiffrements faibles dans TLS 1.2
- Comment vérifier la version TLS
- Comment travailler avec les certificats
- Comment planifier la sauvegarde et la restauration des données Ceph
- Comment collecter les données d'utilisation de DU avec le magasin d'objets intégré au cluster (Ceph)
- Comment installer RKE2 SELinux dans des environnements isolés
- Comment nettoyer les anciennes sauvegardes différentielles sur un serveur NFS
- Comment déployer Insights dans un cluster compatible FIPS
- Comment migrer vers cgroup v2
- Comment récupérer l'authentification Kerberos après le redémarrage d'une machine virtuelle
- Comment transmettre une image Docker locale au registre intégré au cluster
- Comment exclure des compartiments de la sauvegarde
- Erreur lors du téléchargement du bundle
- L'installation hors ligne échoue en raison d'un fichier binaire manquant
- Problème de certificat dans l'installation hors ligne
- Erreur de validation de la chaîne de connexion SQL
- Disque Azure non marqué comme SSD
- Échec après la mise à jour du certificat
- Erreurs de validation du certificat TLS
- L'antivirus provoque des problèmes d'installation
- Automation Suite ne fonctionne pas après la mise à niveau du système d'exploitation
- Automation Suite requiert que backlog_wait_time soit défini sur 0
- L'installation du registre temporaire échoue sur RHEL 8.9
- Problème de redémarrage fréquent dans les déploiements d'espace de noms uipath lors des installations hors ligne
- Paramètres DNS non respectés par CoreDNS
- L’amorçage du registre intégré au cluster échoue en raison d’une mémoire insuffisante
- Les vérifications des prérequis échouent lorsque les projets modernes Document Understanding sont activés et qu’AI Center est désactivé
- Échec de la mise à niveau en raison d’un Ceph défectueux
- RKE2 ne démarre pas en raison d'un problème d'espace
- La mise à niveau échoue en raison d’objets classiques dans la base de données Orchestrator
- Cluster Ceph trouvé dans un état dégradé après une mise à niveau côte à côte
- La mise à niveau du service échoue pour Apps
- Délais d'attente de mise à niveau sur place
- La mise à niveau échoue dans les environnements hors ligne
- Le pod d'instantané-contrôleur-crds dans l'état CrashLoopBackOff après la mise à niveau
- La mise à niveau échoue en raison du remplacement des tailles de PVC Insights
- Échec de la mise à niveau en raison d’un nom d’hôte en majuscules
- Définition d'un délai d'expiration pour les portails de gestion
- L'authentification ne fonctionne pas après la migration
- kinit : Impossible de trouver le KDC pour le domaine <AD Domain> lors de l'obtention des informations d'identification initiales
- Kinit : Keytab ne contient aucune clé appropriée pour *** lors de l'obtention des informations d'identification initiales
- L'opération GSSAPI a échoué en raison d'un code de statut non valide
- Alarme reçue pour l'échec de la tâche Kerberos-tgt-update
- Fournisseur SSPI : serveur introuvable dans la base de données Kerberos
- La connexion a échoué pour l'utilisateur AD en raison d'un compte désactivé
- Échec de connexion à ArgoCD
- Mettre à jour les connexions du répertoire sous-jacent
- Impossible d'obtenir l'image du bac à sable
- Les pods ne s'affichent pas dans l'interface utilisateur ArgoCD
- Échec de la sonde Redis
- Le serveur RKE2 ne démarre pas
- Secret introuvable dans l'espace de noms UiPath
- ArgoCD passe à l'état Progression (Progressing) après la première installation
- Pod de serveur ArgoCD dans CrashLoopBackOff
- Atténuation manuelle de la politique réseau ArgoCD
- Métriques Ceph-rook manquantes dans les tableaux de bord de surveillance
- Discordance dans les erreurs signalées lors des vérifications de l'intégrité des diagnostics
- Configurer les requêtes et les limites de ressources pour les charges de travail créées par uipathctl
- Aucun problème sain en amont
- Démarrage de Redis bloqué par un antivirus
- Les pods AI Center et Document Understanding ne démarrent pas avec la vérification du certificat TLS activée
- Fluentd n’exporte pas les journaux dans les environnements IPv6
- Studio Desktop ne peut pas charger les connecteurs et activités Integration Service
- Document Understanding n'est pas affiché sur la barre de gauche d'Automation Suite
- État Échec (Failed) lors de la création d'une session de labellisation des données
- État Échec (Failed) lors de la tentative de déploiement d'une compétence ML
- La tâche de migration échoue dans ArgoCD
- La reconnaissance de l'écriture manuscrite avec l'Extracteur de formulaires intelligents (Intelligent Form Extractor) ne fonctionne pas
- Exécution de la haute disponibilité avec Process Mining
- Échec de l’ingestion de Process Mining lors de la connexion à l’aide de Kerberos
- Impossible de se connecter à la base de données AutomationSuite_ProcessMining_Authentication à l'aide d'une chaîne de connexion au format pyodbc
- L'installation d'airflow échoue avec sqlalchemy.exc.ArgumentError: impossible d'analyser l'URL rfc1738 de la chaîne ''
- Comment ajouter une règle de table d'adresse IP pour utiliser le port SQL Server 1433
- Le certificat Automation Suite n'est pas approuvé depuis le serveur sur lequel CData Sync est en cours d'exécution
- Exécution de l'outil de diagnostic
- Utilisation du pack d'assistance Automation Suite
- Explorer les journaux
Répondre aux alertes d'utilisation élevée du disque et identifier les pods utilisant un stockage excessif sur les nœuds Kubernetes dans Automation Suite.
kubernetes-system
KubernetesDiskPressure
Cette alerte indique que l'utilisation du disque est très élevée sur le nœud Kubernetes.
Si cette alerte se déclenche, essayez de voir quel pod consomme davantage de disque :
-
Confirmez si le nœud se trouve sous
DiskPressureà l'aide de la commande suivante :kubectl describe node <node-name>kubectl describe node <node-name>
Identifiez la condition DiskPressure dans la sortie.
-
Vérifiez l'utilisation de l'espace disque sur le nœud concerné :
df -hdf -h
Cela indique l'utilisation du disque sur tous les systèmes de fichiers montés. Identifier où l’utilisation élevée.
- Si le disque est plein et que le nettoyage est insuffisant, envisagez de redimensionner le disque pour le nœud (en particulier dans les environnements cloud tels qu’AWS ou GCP). Ce processus peut impliquer une augmentation des volumes, en fonction de votre infrastructure.
KubernetesMemoryPressure
Cette alerte indique que l'utilisation de la mémoire est très élevée sur le nœud Kubernetes.
Les nœuds Kubernetes avec le type d'incident MemoryPressure se produisent lorsqu'un nœud de cluster Kubernetes dispose d'une mémoire insuffisante, ce qui peut être dû à une fuite de mémoire dans une application. Ce type d'incident nécessite une attention immédiate pour éviter tout temps d'arrêt et assurer le bon fonctionnement du cluster Kubernetes.
Si cette alerte se déclenche, essayez d'identifier le pod sur le nœud qui consomme plus de mémoire, en procédant comme suit :
-
Récupérez les statistiques du processeur et de la mémoire des nœuds :
kubectl top nodekubectl top node -
Récupérez les pods exécutés sur le nœud :
kubectl get pods --all-namespaces -o wide --field-selector spec.nodeName=${NODE_NAME}kubectl get pods --all-namespaces -o wide --field-selector spec.nodeName=${NODE_NAME} -
Vérifiez l'utilisation de la mémoire pour les pods dans un espace de noms en utilisant :
kubectl top pod --namespace <namespace> kubectl logs -f <pod-name> -n <ns>kubectl top pod --namespace <namespace> kubectl logs -f <pod-name> -n <ns>
Si vous êtes en mesure d'identifier n'importe quel pod avec une utilisation élevée de la mémoire, consultez les journaux du pod et recherchez les erreurs de fuite de mémoire.
Pour résoudre ce problème, augmentez si possible les spécifications de mémoire des nœuds.
Si le problème persiste, générez le pack d’assistance et contactez le support UiPath®.
KubePersistentVolumeFillingUp
Quand Avertissement : l'espace disponible est inférieur à 30 % et il est probable qu'il se remplira d'ici quatre jours.
Lorsque critique : l'espace disponible est inférieur à 10 %.
Pour tous les services qui manquent d'espace, les données peuvent être difficiles à récupérer, les volumes doivent donc être redimensionnés avant d'atteindre 0 % d'espace disponible.
Pour obtenir des instructions, consultez la section Configuration du cluster.
Pour les alertes spécifiques à Prometheus, reportez-vous à PrometheusStorageUsage pour plus de détails.
KubePersistentVolumeErrors
PersistentVolume ne peut pas être enregistré. Cela signifie que tout service nécessitant le volume ne démarrerait pas. Recherchez d’autres erreurs avec le stockage Longhorn et/ou Ceph et contactez le support UiPath®.
node-exporter
NodeFilesystemSpaceFillingUp
Le système de fichiers sur un nœud particulier se remplit.
Si cette alerte se déclenche, tenez compte des étapes suivantes :
-
Confirmez si le nœud se trouve sous
DiskPressureà l'aide de la commande suivante :kubectl describe node <node-name>kubectl describe node <node-name>Identifiez la condition
DiskPressuredans la sortie. -
Effacez les journaux et les fichiers temporaires. Vérifiez les fichiers journaux volumineux dans
/var/log/et supprimez-les, si possible. -
Vérifiez l'utilisation de l'espace disque sur le nœud concerné :
df -hdf -h
Cela indique l'utilisation du disque sur tous les systèmes de fichiers montés. Identifier où l’utilisation élevée.
- Si le disque est plein et que le nettoyage est insuffisant, envisagez de redimensionner le disque pour le nœud (en particulier dans les environnements cloud tels qu’AWS ou GCP). Ce processus peut impliquer une augmentation des volumes, en fonction de votre infrastructure.
NodeFilesystemAlmostOutOfSpace
Le système de fichiers sur un nœud particulier se remplit. Enregistrez plus d'espace en ajoutant un disque ou en montant des disques inutilisés.
NodeFilesystemFilesFillingUp
Le système de fichiers sur un nœud particulier se remplit. Enregistrez plus d'espace en ajoutant un disque ou en montant des disques inutilisés.
NodeFilesystemAlmostOutOfFiles
Le système de fichiers sur un nœud particulier se remplit. Enregistrez plus d'espace en ajoutant un disque ou en montant des disques inutilisés.
NodeNetworkReceiveErrs
Ces erreurs indiquent que le pilote réseau signale un nombre élevé d'échecs. Cela peut être dû à des défaillances matérielles ou à une mauvaise configuration du réseau physique. Ce problème concerne le système d’exploitation et n’est pas contrôlé par l’application UiPath®.
L'alerte est déclenchée en surveillant le compteur/proc/net/dev fourni par le noyau Linux.
Contactez votre administrateur réseau et l'équipe qui gère l'infrastructure physique.
NodeNetworkTransmitErrs
Ces erreurs indiquent que le pilote réseau signale un nombre élevé d'échecs. Cela peut être dû à des défaillances matérielles ou à une mauvaise configuration du réseau physique. Ce problème concerne le système d’exploitation et n’est pas contrôlé par l’application UiPath®.
L'alerte est déclenchée en surveillant le compteur/proc/net/dev fourni par le noyau Linux.
Contactez votre administrateur réseau et l'équipe qui gère l'infrastructure physique.
ceph.rules, cluster-state-alert.rules
CephClusterErrorState
Cette alerte indique que le cluster de stockage Ceph est en état d'erreur depuis plus de 10 minutes.
Cette alerte indique que la tâche rook-ceph-mgr est en état d'erreur depuis une durée inacceptable. Recherchez d’autres alertes qui auraient pu être déclenchées avant celle-ci et résolvez-les en premier.
kubectl describe cephcluster -n rook-ceph
kubectl describe cephcluster -n rook-ceph
CephMonQuorumAtRisk
Cette alerte indique que le quorum du cluster de stockage est faible.
Plusieurs mons fonctionnent ensemble pour assurer la redondance ; cela est possible car chacun conserve une copie des métadonnées. Le cluster est déployé avec 3 mons et nécessite 2 mons ou plus pour être opérationnel pour le quorum et pour que les opérations de stockage s'exécutent. Si le quorum est perdu, l'accès aux données est menacé.
Si cette alerte se déclenche, vérifiez si des OSD sont en fin d’exécution ; le cas échéant, supprimez ces pods et laissez un certain temps s’écouler afin que l’opérateur puisse procéder au rapprochement. Si le problème persiste, contactez le support UiPath®.
CephMgrIsAbsent
Cette alerte indique que Ceph Manager a disparu de la découverte de cibles Prometheus.
Si cette alerte se déclenche, vérifiez et assurez-vous que le pod du gestionnaire Ceph est opérationnel et sain. Si le pod est sain, consultez les journaux et vérifiez si le pod est activé pour émettre des métriques Prometheus.
Nœud Ceph
Cette alerte indique qu'un nœud exécutant des pods Ceph est en panne. Bien que les opérations de stockage continuent de fonctionner car Ceph est conçu pour gérer une défaillance de nœud, il est recommandé de résoudre le problème afin de minimiser le risque qu'un autre nœud tombe en panne et affecte les fonctions de stockage.
Si cette alerte se déclenche, dans le cas d'un cluster multi-nœuds, le pod doit être planifié sur un autre nœud. Assurez-vous que les nouveaux pods OSD dans l'espace de noms rook-ceph sont en cours d'exécution et en état sain dans le nouveau nœud.
Vous pouvez vérifier l'échec du nœud en décrivant le nœud à l'aide de la commande suivante :
kubectl get nodes
kubectl get nodes
Vérifiez le nœud pour identifier la cause profonde du problème et contactez l’assistance UiPath®.
cluster-utilization-alert.rules
CephClusterNearFull
Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 75 % et passera en lecture seule à 85 %.
Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.
Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.
CephClusterCriticallyFull
Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 80 % et passera en lecture seule à 85 %.
Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.
Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.
CephClusterReadOnly
Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 85 % et passera désormais en lecture seule. Libérez de l'espace ou développez immédiatement le cluster de stockage.
Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.
Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.
osd-alert.rules
CephOSDCriticallyFull
Lorsque la gravité de l'alerte est Critique (Critical), l'espace disponible est inférieur à 20 %.
Pour tous les services qui manquent d'espace, les données peuvent être difficiles à récupérer, nous vous recommandons donc de redimensionner les volumes avant d'atteindre 10 % d'espace disponible. Consultez les instructions suivantes : Configuration du cluster.
CephOSDNearFull
Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 75 % et passera en lecture seule à 85 %.
Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.
Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.
PersistentVolumeUsageNearFull
Cette alerte indique que l'utilisation du cluster de stockage Ceph a franchi 75 % et passera en lecture seule à 85 %.
Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.
Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.
Mappage CephOSDFl
Cette alerte indique que le démon de stockage a redémarré plus de 5 fois en 5 dernières minutes.
Si cette alerte se déclenche, procédez comme suit :
-
Vérifiez l'intégrité du cluster Ceph. Vous devez exécuter
ceph statusdans la boîte à outils Ceph pour identifier les OSD flottants :kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph statuskubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph statusVous pouvez identifier le pod de Ceph Tools en répertoriant les pods dans l'espace de noms :
kubectl -n rook-ceph get pod | grep toolskubectl -n rook-ceph get pod | grep tools -
Consultez les journaux OSD du pod OSD flottant pour identifier les problèmes :
kubectl -n rook-ceph logs <osd-pod>kubectl -n rook-ceph logs <osd-pod> -
Identifier les problèmes au niveau du nœud :
-
Vérifiez l’utilisation des ressources :
kubectl top node <node-name>kubectl top node <node-name> -
Vérifiez l'intégrité du disque. Vous devez vous connecter en SSH au nœud et exécuter
df -hetdmesgpour vérifier les erreurs de disque.
-
-
Redémarrez le pod OSD. Si le problème est temporaire, vous devez redémarrer le pod OSD flottant :
kubectl -n rook-ceph delete pod <osd-pod>kubectl -n rook-ceph delete pod <osd-pod> -
Assurez-vous qu'il n'y a pas de problèmes de connectivité réseau entre les OSD et les moniteurs Ceph.
-
Si nécessaire, marquez temporairement l'OSD flottant comme
out:ceph osd out <osd-id>ceph osd out <osd-id> -
Continuez à surveiller le cluster pour vous assurer que le problème ne se produit pas.
Disque CephOSD Ne Répond pas
Cette alerte indique que le périphérique de disque hôte ne répond pas.
Si cette alerte se déclenche, procédez comme suit :
-
Vérifiez le statut du cluster Ceph. Vous devez confirmer l'intégrité globale du cluster Ceph et obtenir plus de détails sur le statut de l'OSD :
-
Exécutez la commande suivante dans le pod de boîte à outils Ceph :
kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph statuskubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status -
Identifiez le pod de outils Ceph en répertoriant les pods dans l'espace de noms :
kubectl -n rook-ceph get pod | grep toolskubectl -n rook-ceph get pod | grep tools
-
-
Vérifiez le statut du pod OSD. Vous devez vérifier si les pods OSD sont en cours d'exécution. Exécutez la commande suivante pour vérifier tous les statuts des pods OSD :
kubectl -n rook-ceph get pods | grep osdkubectl -n rook-ceph get pods | grep osdSi un pod OSD est dans un état
CrashLoopBackOffouPending, cela peut indiquer un problème avec le disque OSD ou le nœud sous-jacent. -
Redémarrez le pod OSD affecté. Si un pod OSD est dans un état incorrect (
CrashLoopBackOff,Error, etc.), vous devez redémarrer le pod pour voir si le problème se résout lui-même. Kubernetes tente automatiquement de replanifier le pod.kubectl -n rook-ceph delete pod <osd-pod>kubectl -n rook-ceph delete pod <osd-pod>Le pod OSD sera redémarré, et s'il s'agit d'un problème temporaire, cela pourra le résoudre.
-
Vérifiez les journaux du système d'exploitation. Si le redémarrage n'a pas résolu le problème, consultez les journaux du pod OSD pour plus de détails sur la raison pour laquelle le disque ne répond pas :
kubectl -n rook-ceph logs <osd-pod>kubectl -n rook-ceph logs <osd-pod>Recherchez les erreurs liées au disque ou d'autres problèmes (par exemple, erreurs d'E/S, échec de montages).
-
Identifier les problèmes au niveau du nœud. Si le disque OSD n'est pas monté correctement ou a été déconnecté, vous pouvez vous connecter au nœud concerné et vérifier l'état de montage du disque :
ssh <node> df -hssh <node> df -hRecherchez les disques manquants ou non montés que Ceph attend. Si nécessaire, montez le disque ou remplacez-le s'il a échoué.
DisqueCephOSDIndisponible
Cette alerte indique que le disque Ceph OSD n'est pas accessible sur l'hôte.
Si cette alerte se déclenche, procédez comme suit :
-
Vérifiez le statut du cluster Ceph. Vous devez confirmer l'intégrité globale du cluster Ceph et obtenir plus de détails sur le statut de l'OSD :
-
Exécutez la commande suivante dans le pod de boîte à outils Ceph :
kubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph statuskubectl -n rook-ceph exec -it <ceph-tools-pod> -- ceph status -
Identifiez le pod de outils Ceph en répertoriant les pods dans l'espace de noms :
kubectl -n rook-ceph get pod | grep toolskubectl -n rook-ceph get pod | grep tools
-
-
Vérifiez le statut du pod OSD. Vous devez vérifier si les pods OSD sont en cours d'exécution. Exécutez la commande suivante pour vérifier tous les statuts des pods OSD :
kubectl -n rook-ceph get pods | grep osdkubectl -n rook-ceph get pods | grep osdSi un pod OSD est dans un état
CrashLoopBackOffouPending, cela peut indiquer un problème avec le disque OSD ou le nœud sous-jacent. -
Redémarrez le pod OSD affecté. Si un pod OSD est dans un état incorrect (
CrashLoopBackOff,Error, etc.), vous devez redémarrer le pod pour voir si le problème se résout lui-même. Kubernetes tente automatiquement de replanifier le pod.kubectl -n rook-ceph delete pod <osd-pod>kubectl -n rook-ceph delete pod <osd-pod>Le pod OSD sera redémarré, et s'il s'agit d'un problème temporaire, cela pourra le résoudre.
-
Vérifiez les journaux du système d'exploitation. Si le redémarrage n'a pas résolu le problème, consultez les journaux du pod OSD pour plus de détails sur la raison pour laquelle le disque ne répond pas :
kubectl -n rook-ceph logs <osd-pod>kubectl -n rook-ceph logs <osd-pod>Recherchez les erreurs liées au disque ou d'autres problèmes (par exemple, erreurs d'E/S, échec de montages).
persistent-volume-alert.rules
PersistentVolumeUsageCritical
Si cette alerte se déclenche, libérez de l'espace dans Ceph en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.
Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.
pool-quota.rules
CephPoolQuotaBytesCriticallyExhausted
Cette alerte indique que l'utilisation du pool de stockage Ceph a dépassé 90 %.
Si cette alerte se déclenche, libérez de l'espace dans CEPH en supprimant certains ensembles de données inutilisés dans AI Center, ou augmentez le stockage disponible pour Ceph PVC.
Avant de redimensionner PVC, assurez-vous de répondre aux exigences de stockage. Pour de plus amples informations, consultez la section Évaluation de vos besoins de stockage.
host-disk
LowDiskForRancherPartition
Cette alerte indique que l'espace libre de la partition /var/lib/rancher est inférieur à :
- 25 % : la gravité de l'alerte est critique
Vous devez vous connecter au serveur hôte et vérifier l'utilisation du disque. Vous pouvez utiliser des commandes telles que df -h /var/lib/rancher pour vérifier l'espace disque disponible. Si vous disposez d'un espace insuffisant, envisagez les options suivantes :
-
Effacez les fichiers inutiles. Au fil du temps, les fichiers journaux, les fichiers temporaires, les données orphelines et les sauvegardes peuvent consommer beaucoup d'espace. Le nettoyage régulier de ces fichiers peut aider à maintenir l'espace disque.
-
Redimensionnez la partition. Si votre système de fichiers le prend en charge et s'il y a de l'espace inutilisé disponible sur votre disque, vous pouvez redimensionner la partition pour lui donner plus d'espace disque.
-
Ajoutez plus d'espace disque. Si les options précédentes ne sont pas suffisantes et si votre infrastructure le permet, augmentez la taille du disque pour un fonctionnement correct de Rancher.
-
Vérifiez l'utilisation du stockage pour tous les fichiers anormalement volumineux :
find /var/lib/rancher -type f -exec du -h {} + | sort -rh | head -n 10find /var/lib/rancher -type f -exec du -h {} + | sort -rh | head -n 10 -
Vérifiez tous les conteneurs qui écrivent des fichiers volumineux sur le disque.
LowDiskForKubeletPartition
Cette alerte indique que l'espace libre de la partition /var/lib/kubelet est inférieur à :
- 25 % : la gravité de l'alerte est critique
Si cette alerte se déclenche, augmentez la taille du disque.
LowDiskForVarPartition
Cette alerte indique que l'espace libre de la partition /var est inférieur à :
- 25 % : la gravité de l'alerte est critique
Cela peut se produire en raison de l'accumulation de journaux système de conteneur.
Si cette alerte se déclenche, procédez comme suit :
-
Vérifiez l'utilisation du stockage :
find /var/ -type f -exec du -h {} + | sort -rh | head -n 10find /var/ -type f -exec du -h {} + | sort -rh | head -n 10 -
Augmentez la taille du disque.
LowDiskForVarLogPartition
Cette alerte indique que l'espace libre de la partition /var/lib/var est inférieur à :
- 25 % : la gravité de l'alerte est critique
Si cette alerte se déclenche, augmentez la taille du disque.
- kubernetes-system
- KubernetesDiskPressure
- KubernetesMemoryPressure
- KubePersistentVolumeFillingUp
- KubePersistentVolumeErrors
- node-exporter
- NodeFilesystemSpaceFillingUp
- NodeFilesystemAlmostOutOfSpace
- NodeFilesystemFilesFillingUp
- NodeFilesystemAlmostOutOfFiles
- NodeNetworkReceiveErrs
- NodeNetworkTransmitErrs
- ceph.rules, cluster-state-alert.rules
- CephClusterErrorState
- CephMonQuorumAtRisk
- CephMgrIsAbsent
- Nœud Ceph
- cluster-utilization-alert.rules
- CephClusterNearFull
- CephClusterCriticallyFull
- CephClusterReadOnly
- osd-alert.rules
- CephOSDCriticallyFull
- CephOSDNearFull
- PersistentVolumeUsageNearFull
- Mappage CephOSDFl
- Disque CephOSD Ne Répond pas
- DisqueCephOSDIndisponible
- persistent-volume-alert.rules
- PersistentVolumeUsageCritical
- pool-quota.rules
- CephPoolQuotaBytesCriticallyExhausted
- host-disk
- LowDiskForRancherPartition
- LowDiskForKubeletPartition
- LowDiskForVarPartition
- LowDiskForVarLogPartition