- 概述
- 要求
- 部署模板
- 手动:准备安装
- 手动:准备安装
- 步骤 2:为离线安装配置符合 OCI 的注册表
- 步骤 3:配置外部对象存储
- 步骤 4:配置 High Availability Add-on
- 步骤 5:配置 SQL 数据库
- 步骤 7:配置 DNS
- 步骤 8:配置磁盘
- 步骤 9:配置内核和操作系统级别设置
- 步骤 10:配置节点端口
- 步骤 11:应用其他设置
- 步骤 12:验证并安装所需的 RPM 包
- 步骤 13:生成 cluster_config.json
- Cluster_config.json 示例
- 常规配置
- 配置文件配置
- 证书配置
- 数据库配置
- 外部对象存储配置
- 预签名 URL 配置
- ArgoCD 配置
- Kerberos 身份验证配置
- 符合 OCI 的外部注册表配置
- Disaster Recovery:主动/被动和主动/主动配置
- High Availability Add-on 配置
- 特定于 Orchestrator 的配置
- Insights 特定配置
- Process Mining 特定配置
- Document Understanding 特定配置
- Automation Suite Robot 特定配置
- 监控配置
- 可选:配置代理服务器
- 可选:在多节点 HA 就绪生产集群中启用区域故障恢复
- 可选:传递自定义 resolv.conf
- 可选:提高容错能力
- 添加具有 GPU 支持的专用代理节点
- 为 Automation Suite Robot 添加专用代理节点
- 步骤 15:为离线安装配置临时 Docker 注册表
- 步骤 16:验证安装的先决条件
- 正在运行 uipathctl
- 手动:执行安装
- 安装后
- 集群管理
- 监控和警示
- 迁移和升级
- 特定于产品的配置
- 最佳实践和维护
- 故障排除
- 如何在安装过程中对服务进行故障排除
- 如何减少 NFS 备份目录的权限
- 如何卸载集群
- 如何清理离线工件以改善磁盘空间
- 如何清除 Redis 数据
- 如何启用 Istio 日志记录
- 如何手动清理日志
- 将 Ceph 退出只读模式
- 如何清理存储在 sf-logs 存储桶中的旧日志
- 如何禁用 AI Center 的流日志
- 如何对失败的 Automation Suite 安装进行调试
- 如何在升级后从旧安装程序中删除映像
- 如何禁用 TX 校验和卸载
- 如何手动将 ArgoCD 日志级别设置为 Info
- 如何扩展 AI Center 存储
- 如何为外部注册表生成已编码的 pull_secret_value
- 如何解决 TLS 1.2 中的弱密码问题
- 如何查看 TLS 版本
- 如何使用证书
- 如何计划 Ceph 备份和还原数据
- 如何使用集群内对象存储 (Ceph) 收集 DU 使用情况数据
- 如何在离线环境中安装 RKE2 SELinux
- 如何清理 NFS 服务器上的旧差异备份
- 如何在已启用 FIPS 的集群中部署 Insights
- 如何迁移到 cgroup v2
- 如何在虚拟机重新启动后恢复 Kerberos 身份验证
- 如何将本地 Docker 映像推送到集群内注册表
- 如何从备份中排除存储桶
- 无法获取沙盒映像
- Pod 未显示在 ArgoCD 用户界面中
- Redis 探测器失败
- RKE2 服务器无法启动
- ArgoCD 在首次安装后进入“进行中”状态
- 处于 CrashLoopBackOff 状态的 ArgoCD 存储库服务器 Pod
- 手动 ArgoCD 网络策略缓解措施 (MHSA-47m3-95c7-g2g8)
- 监控仪表板中缺少 Ceph-rook 指标
- 诊断性运行状况检查期间报告的错误不匹配
- 为 uipathctl 创建的工作负载配置资源请求和限制
- 无正常的上游问题
- 杀毒软件阻止了 Redis 启动
- 无法在启用 TLS 证书验证的情况下启动 AI Center 和 Document Understanding Pod
- Fluentd 不会在 IPv6 环境中导出日志
- Studio 桌面版无法加载 Integration Service 连接器和活动
- 使用 Process Mining 运行高可用性
- 使用 Kerberos 登录时 Process Mining 挖掘失败
- 无法使用 pyodbc 格式连接字符串连接到 AutomationSuite_ProcessMining_Warehouse 数据库
- Airflow 安装失败,并显示 sqlalchemy.exc.ArgumentError:无法从字符串“”中解析 rfc1738 URL
- 如何添加 IP 表格规则以使用 SQL Server 端口 1433
- 运行 CData Sync 的服务器不信任 Automation Suite 证书
- Process Mining fails to load after disabling and re-enabling it
- 运行诊断工具
- 使用 Automation Suite 支持捆绑包
- 探索日志
Automation Suite 中的监控功能,包括 Prometheus、Grafana 和 Alertmanager 集成。
默认情况下,Automation Suite 包含预配置的 Prometheus、Grafana 和 Alert Manager 组件,提供:
- 即用型仪表板
- 开箱即用的警示规则
- 核心组件的集成日志和指标
或者,您可以将指标导出到自己的监控工具。有关详细信息,请参阅外部监控工具。
有关可以监控的组件的列表,请参阅部署架构。
使用监控堆栈
节点故障可能会导致 Kubernetes 关闭,从而中断 Prometheus 警示。为防止出现这种情况,我们建议在 RKE2 服务器上设置单独的警示。
访问监控工具
概述
您可以使用以下 URL 单独访问 Automation Suite 监控工具:
| 应用程序 | 工具 | URL | 示例 |
|---|---|---|---|
| 指标 | Prometheus | https://monitoring.fqdn/metrics | https://monitoring.automationsuite.mycompany.com/metrics |
| 仪表板 | Grafana | https://monitoring.fqdn/grafana | https://monitoring.automationsuite.mycompany.com/grafana |
| 警示管理 | 警示管理器 | https://monitoring.fqdn/alertmanager | https://monitoring.automationsuite.mycompany.com/alertmanager |
有关如何获取 Grafana 凭据的详细信息,请参阅“访问 Grafana 仪表板”部分。
如果您已排除内置监控组件,则相关工具和 URL 将不可用。有关详细信息,请参阅可选:配置监控解决方案。
监控工具身份验证
首次访问监控工具时,请使用以下默认凭据以管理员身份登录:
-
用户名: admin
-
密码:要检索密码,请运行以下命令:
kubectl get secrets/dex-static-credential -n uipath -o "jsonpath={.data['password']}" | base64 --decodekubectl get secrets/dex-static-credential -n uipath -o "jsonpath={.data['password']}" | base64 --decode
Dex 身份验证
要在访问监控工具时更新用于 Dex 身份验证的默认密码,请执行以下步骤。
Dex 是基于监控工具的基本身份验证方法。 因此,更新 Dex 密码不会影响监控工具的密码。 在这种情况下,监控工具的密码将与以前相同。
-
通过将
newpassword替换为您的新密码来运行以下命令:password="newpassword" password=$(echo -n $password | base64) kubectl patch secret dex-static-credential -n uipath --type='json' -p="[{'op': 'replace', 'path': '/data/password', 'value': '$password'}]"password="newpassword" password=$(echo -n $password | base64) kubectl patch secret dex-static-credential -n uipath --type='json' -p="[{'op': 'replace', 'path': '/data/password', 'value': '$password'}]" -
运行以下命令以更新密码:
./bin/uipathctl manifest apply /opt/UiPathAutomationSuite/cluster_config.json --versions versions/helm-charts.json./bin/uipathctl manifest apply /opt/UiPathAutomationSuite/cluster_config.json --versions versions/helm-charts.json
集成外部监控工具
如果您的组织更喜欢使用集中式可观察性平台(例如 Datadog、ELK、New Relic),则可以在安装过程中通过更新cluster_config.json配置文件来禁用内置监控组件。有关详细信息,请参阅可选:配置监控解决方案。
导出关键指标
当您使用外部监控解决方案时,必须收集和监控某些关键平台指标(例如证书过期),以维护平台的可靠性和安全性。
为支持此操作,即使排除内置监控,Automation Suite 也会部署推送网关。推送网关会定期推送重要指标,以便外部系统可以抓取这些指标并生成警示。
内部平台作业会收集证书和许可证过期数据,并将其发送到推送网关。然后,外部 Prometheus 实例可以抓取端点并根据需要触发警示。
以下关键指标可通过推送网关进行外部监控:
| 指标名称 | 描述 |
|---|---|
rke2-cert-expiry | RKE2 节点或服务器证书过期前的天数。 |
tls-cert-expiry | Kubernetes 密码中的 TLS 证书过期前的天数。 |
redis-license-expiry | Redis 企业版许可证过期前的天数。 |
signing-certificate-expires-30 | 表示身份签名证书将在 30 天后过期。 |
signing-certificate-expires-7 | 表示身份签名证书将在 7 天后过期。 |
以下示例显示了 Prometheus 抓取时的tls-cert-expiry指标:
tls_cert_expiry {
certname="ca.crt",
instance="",
job="tls-cert-expiry",
ns="istio-system",
secret="istio-ingressgateway-certs"
} 10
tls_cert_expiry {
certname="ca.crt",
instance="",
job="tls-cert-expiry",
ns="istio-system",
secret="istio-ingressgateway-certs"
} 10
在此示例中,命名空间istio-system中的证书ca.crt存储在密码istio-ingressgateway-certs中,将在 10 天后过期。