UiPath Documentation
automation-suite
2.2510
true
Guide d'installation d'Automation Suite sur Linux
Important :
Veuillez noter que ce contenu a été localisé en partie à l’aide de la traduction automatique. La localisation du contenu nouvellement publié peut prendre 1 à 2 semaines avant d’être disponible.

Alertes de gestion

Résolvez les alertes de gestion liées aux incohérences de configuration du gestionnaire d'alertes dans Automation Suite.

alertmanager.rules

AlertmanagerConfigInconsistent

Cette alerte se déclenche lorsque Alertmanager instances d'un même cluster ont des configurations différentes. Cela peut indiquer un problème avec le déploiement de la configuration qui n'est pas cohérent pour toutes les instances de Alertmanager.

Pour résoudre le problème, procédez comme suit :

  1. Exécutez un outil diff entre tous les alertmanager.yml déployés pour identifier le problème.
  2. Supprimez la clé secrète incorrecte et déployez la bonne clé secrète.

Si le problème persiste, contactez le support UiPath®.

AlertmanagerFailedReload

AlertManager n’a pas pu charger ou recharger la configuration. Veuillez vérifier toutes les configurations AlertManager personnalisées pour les erreurs de saisie ; sinon, contactez l’assistance UiPath® et fournissez le package d’assistance. Pour de plus amples informations, consultez la section Utiliser le package d'assistance Automation Suite.

AlertmanagerMembersInconsistent

Il s'agit d'erreurs internes du gestionnaire d'alertes pour les clusters haute disponibilité avec plusieurs répliques du gestionnaire d'alertes. Les alertes peuvent apparaître et disparaître par intermittence. La réduction temporaire, puis la mise à l'échelle des répliques du gestionnaire d'alertes peuvent résoudre le problème.

Pour résoudre le problème, procédez comme suit :

  1. Définissez la mise à l'échelle sur zéro. Notez qu'il faut un moment pour que les pods s'arrêtent :

    statefulset.apps/alertmanager-monitoring-kube-prometheus-alertmanager scaled
    statefulset.apps/alertmanager-monitoring-kube-prometheus-alertmanager scaled
    
  2. Redéfinissez la mise à l'échelle sur deux :

    kubectl scale statefulset -n monitoring alertmanager-monitoring-kube-prometheus-alertmanager --replicas=2
    kubectl scale statefulset -n monitoring alertmanager-monitoring-kube-prometheus-alertmanager --replicas=2
    
  3. Vérifiez si les pods du gestionnaire d'alertes ont démarré et sont en cours d'exécution :

    kubectl get po -n monitoring
    kubectl get po -n monitoring
    

Si le problème persiste, contactez le support UiPath®.

Règles.générales

TargetDown

Prometheus n'est pas en mesure de collecter les métriques de la cible dans l'alerte, ce qui signifie que les tableaux de bord Grafana et d'autres alertes basées sur les métriques de cette cible ne sont pas disponibles. Vérifiez les autres alertes relatives à cette cible.

Watchdog

Il s'agit d'une alerte destinée à garantir que l'ensemble du pipeline d'alerte est fonctionnel. Cette alerte est toujours déclenchée. Par conséquent, elle doit toujours se déclencher dans AlertManager et à l'encontre d'un récepteur. Il existe des intégrations avec divers mécanismes de notification qui vous avertissent lorsque cette alerte ne se déclenche pas. Par exemple, l'intégration de DeadMansSnitch dans PagerDuty.

prometheus-operator

PrometheusOperatorListErrors, PrometheusOperatorWatchErrors, PrometheusOperatorSyncFailed, PrometheusOperatorReconcileErrors, PrometheusOperatorNodeLookupErrors, PrometheusOperatorNotReady, PrometheusOperatorRejectedResources

Erreurs internes de l’opérateur Prometheus, qui contrôle les ressources Prometheus. Prometheus peut lui-même conserver une bonne intégrité alors que ces erreurs sont présentes ; cependant, cette erreur indique que la configurabilité de la surveillance est dégradée. Contactez l’assistance UiPath®.

Prometheus

PrometheusBadConfig

Prometheus n’a pas pu charger ou recharger la configuration. Veuillez vérifier toutes les configurations Prometheus personnalisées pour les erreurs de saisie. Sinon, contactez le support UiPath®.

PrometheusErrorSendingAlertsToSomeAlertmanagers, PrometheusErrorSendingAlertsToAnyAlertmanager, PrometheusNotConnectedToAlertmanagers

La connexion de Prometheus à AlertManager n’est pas saine. Les métriques peuvent toujours faire l’objet de requêtes et les tableaux de bord Grafana peuvent toujours les afficher, mais les alertes ne se déclencheront pas. Vérifiez toute configuration personnalisée d’AlertManager pour les erreurs de saisie. Sinon, contactez le support UiPath®.

PrometheusNotificationQueueRunningFull, PrometheusTSDBReloadsFailing, PrometheusTSDBCompactionsFailing, PrometheusNotIngestingSamples, PrometheusDuplicateTimestamps, PrometheusOutOfOrderTimestamps, PrometheusRemoteStorageFailures, PrometheusRemoteWriteBehind, PrometheusRemoteWriteDesiredShards

Les erreurs internes Prometheus indiquant que les métriques peuvent ne pas être collectées comme prévu. Veuillez contacter l’assistance UiPath®.

PrometheusRuleFailures

Cela peut se produire s’il existe des alertes malformées basées sur des métriques inexistantes ou une syntaxe PromQL incorrecte. Contactez l’assistance UiPath® si aucune alerte personnalisée n’a été ajoutée.

PrometheusMissingRuleEvaluations

Prometheus n’est pas en mesure d’évaluer si les alertes doivent être déclenchées. Cela peut se produire s’il y a trop d’alertes. Veuillez supprimer les évaluations d’alertes personnalisées coûteuses et/ou consulter la documentation sur l’augmentation de la limite du processeur pour Prometheus. Contactez l’assistance UiPath® si aucune alerte personnalisée n’a été ajoutée.

PrometheusTargetLimitHit

Il y a trop de cibles depuis lesquelles Prometheus peut collecter. Si des ServiceMonitors supplémentaires ont été ajoutés (voir Console de surveillance), vous pouvez les supprimer.

uipath.prometheus.resource.provisioning.alerts

PrometheusMemoryUsage, PrometheusStorageUsage

Ces alertes vous avertissent lorsque le cluster approche des limites configurées pour la mémoire et le stockage. Cela est susceptible de se produire sur les clusters avec une augmentation substantielle récente de l'utilisation (généralement de la part des Robots plutôt que des utilisateurs), ou lorsque des nœuds sont ajoutés au cluster sans ajuster les ressources Prometheus. Cela est dû à une augmentation de la quantité de mesures collectées.

Cela peut également être dû au grand nombre d'alertes qui sont déclenchées; il est important de vérifier pourquoi la grande quantité d'alertes est déclenchée.

Si le problème persiste, veuillez contacter le support UiPath® avec le package d’assistance généré .

uipath.availability.alerts

UiPathAvailabilityHighTrafficUserFacing

Le nombre de réponses http 500 des services UiPath® dépasse la limite donnée. Le tableau suivant décrit les seuils de niveau de trafic utilisés pour évaluer les taux d'erreur.

Niveau de traficNombre de requêtes en 20 minutesSeuil d'erreur (pour http 500s)
Haute>100 0000,1 %
MoyenneEntre 10 000 et 100 0001 %
Basse< 10 0005 %

Les erreurs dans les services destinés aux utilisateurs entraîneraient probablement une dégradation des fonctionnalités directement observable dans l'interface utilisateur d'Automation Suite, tandis que les erreurs dans les services principaux auraient des conséquences moins visibles.

L'alerte indique quel service connaît actuellement un taux d'erreur élevé. Pour comprendre les problèmes pouvant découler d'autres services dont dépend le service de création de rapports, vous pouvez utiliser le tableau de bord Istio Workload, qui affiche les erreurs entre les services.

Veuillez revérifier tous les produits Automation Suite récemment reconfigurés. Des journaux détaillés sont également disponibles avec la commande kubectl logs. Si l’erreur persiste, veuillez contacter l’assistance UiPath®.

Sauvegarde

NFSServerDisconnected

Cette alerte indique que la connexion au serveur NFS est perdue.

Vous devez vérifier la connexion au serveur NFS et le chemin de montage.

VolumeBackupFailed

Cette alerte indique que la sauvegarde a échoué pour une PVC.

Pour résoudre ce problème, procédez comme suit :

  1. Vérifiez le statut du PVC pour vous assurer qu'il est Bound vers un volume persistant (PV).

    kubectl get pvc --namespace <namespace>
    kubectl get pvc --namespace <namespace>
    

    La commande répertorie toutes les PVC et leur statut actuel. La PVC doit avoir un statut Bound pour indiquer qu'elle a revendiqué avec succès un PV.

    Si le statut est Pending, cela signifie que le PVC attend toujours un PV approprié et qu'une enquête plus approfondie est nécessaire.

  2. Si le PVC n'est pas dans un état Bound ou si vous avez besoin d'informations plus détaillées, utilisez la commande describe :

    kubectl describe pvc <pvc-name> --namespace <namespace>
    kubectl describe pvc <pvc-name> --namespace <namespace>
    

    Recherchez des informations sur le statut, les événements et les messages d'erreur. Par exemple, un problème peut être lié à des erreurs de configuration de classe de stockage ou à des limitations de quota.

  3. Vérifiez l'intégrité du volume persistant (PV) lié à la PVC :

    kubectl get pv <pv-name>
    kubectl get pv <pv-name>
    

    Le statut doit être Bound Si le PV est dans un état Released ou Failed, cela peut indiquer des problèmes avec le stockage sous-jacent.

  4. Si la PVC est utilisée par un pod, vérifiez si le pod a monté avec succès le volume :

    kubectl get pod <pod-name> --namespace <namespace>
    kubectl get pod <pod-name> --namespace <namespace>
    

    Si le pod est dans un état Running, cela indique que le PVC est monté avec succès. Si le pod présente un état d'erreur (tel que InitBackOff), cela peut indiquer des problèmes de montage de volume.

  5. S'il y a des problèmes avec le montage du PVC, décrivez le pod pour vérifier les erreurs de montage :

    kubectl describe pod <pod-name> --namespace <namespace>
    kubectl describe pod <pod-name> --namespace <namespace>
    

SauvegardeDésactivée

Cette alerte indique que la sauvegarde est désactivée.

Vous devez activer la sauvegarde.

ÉchecPartialageSauvegarde

Cette alerte indique que la sauvegarde Velero a échoué.

Vous devez contacter l’assistance UiPath®.

cronjob-alerts

CronJobSuspended

La tâche cron uipath-infra/istio-configure-script-cronjob est à l’état suspendu.

Pour résoudre ce problème, activez la tâche cron en procédant comme suit :

export KUBECONFIG="/etc/rancher/rke2/rke2.yaml" && export PATH="$PATH:/usr/local/bin:/var/lib/rancher/rke2/bin"
kubectl -n uipath-infra patch cronjob istio-configure-script-cronjob -p '{"spec":{"suspend":false}}'
epoch=$(date +"%s")
kubectl -n uipath-infra create job istio-configure-script-cronjob-manual-$epoch --from=cronjob/istio-configure-script-cronjob
kubectl -n uipath-infra wait --for=condition=complete --timeout=300s job/istio-configure-script-cronjob-manual-$epoch
kubectl get node -o wide
#Verif if all the IP's listed by the previous command are part of output of the following command
kubectl -n istio-system get svc istio-ingressgateway -o json | jq '.spec.externalIPs'
export KUBECONFIG="/etc/rancher/rke2/rke2.yaml" && export PATH="$PATH:/usr/local/bin:/var/lib/rancher/rke2/bin"
kubectl -n uipath-infra patch cronjob istio-configure-script-cronjob -p '{"spec":{"suspend":false}}'
epoch=$(date +"%s")
kubectl -n uipath-infra create job istio-configure-script-cronjob-manual-$epoch --from=cronjob/istio-configure-script-cronjob
kubectl -n uipath-infra wait --for=condition=complete --timeout=300s job/istio-configure-script-cronjob-manual-$epoch
kubectl get node -o wide
#Verif if all the IP's listed by the previous command are part of output of the following command
kubectl -n istio-system get svc istio-ingressgateway -o json | jq '.spec.externalIPs'

IdentityKerberosTgtUpdateFailed

Cette tâche met à jour le dernier ticket Kerberos pour tous les services UiPath®. Les échecs de cette tâche entraîneraient l’échec de l’authentification du serveur SQL. Veuillez contacter l’assistance UiPath®.

Cette page vous a-t-elle été utile ?

Connecter

Besoin d'aide ? Assistance

Vous souhaitez apprendre ? UiPath Academy

Vous avez des questions ? UiPath Forum

Rester à jour