- Visão geral
- Requisitos
- Modelos de implantação
- Manual: preparando a instalação
- Manual: preparando a instalação
- Etapa 2: configuração do registro compatível com OCI para instalações offline
- Etapa 3: configuração do objectstore externo
- Etapa 4: configuração do High Availability Add-on
- Etapa 5: configuração de bancos de dados SQL
- Etapa 6: configuração do balanceador de carga
- Etapa 7: configuração do DNS
- Etapa 8: configuração dos discos
- Etapa 9: configuração dos ajustes do nível do kernel e do sistema operacional
- Etapa 10: configuração das portas do nó
- Etapa 11: aplicação de configurações diversas
- Etapa 12: validação e instalação dos pacotes RPM necessários
- Etapa 13: geração de cluster_config.json
- Configuração de Certificados
- Configuração do Banco de Dados
- Configuração externa do Objectstore
- Configuração de URL pré-assinada
- Configuração da autenticação do Kerberos
- Configuração de registro externo compatível com OCI
- Disaster Recovery: configurações Ativo/Passivo e Ativo/Ativo
- Configuração do High Availability Add-on
- Configuração específica do Orchestrator
- Configuração específica do Insights
- Process Mining-specific configuration
- Configuração específica do Document Understanding
- Automation Suite Robots-specific configuration
- Configuração do monitoramento
- Opcional: configuração do servidor proxy
- Opcional: habilitação da resiliência a falhas zonais em um cluster de produção pronto para alta disponibilidade de vários nós
- Opcional: transmitindo resolv.conf personalizado
- Optional: Increasing fault tolerance
- Parâmetros do install-uipath.sh
- Adicionando um nó de agente dedicado com suporte a GPU
- Adição de um nó de agente dedicado ao Task Mining
- Conexão do aplicativo Task Mining
- Adicionando um nó de agente dedicado para robôs do Automation Suite
- Etapa 15: configuração do registro temporário do Docker para instalações offline
- Etapa 16: validação dos pré-requisitos para a instalação
- Manual: realizando a instalação
- Pós-instalação
- Administração de cluster
- Gerenciando produtos
- Introdução ao portal de administração do cluster
- Migração do High Availability Add-on no cluster para externo
- Migração de um registro no cluster para um registro externo compatível com OCI
- Mudança para o cluster secundário manualmente em uma configuração Ativo/Passivo
- Disaster Recovery: executando operações pós-instalação
- Convertendo uma instalação existente para configuração multi-local
- Diretrizes sobre atualização de uma implantação Ativo/Passivo ou Ativo/Ativo
- Diretrizes sobre backup e restauração de uma implantação Ativo/Passivo ou Ativo/Ativo
- Redirecionamento do tráfego dos serviços não compatíveis para o cluster principal
- Escalando uma implantação de nó único (avaliação) para uma implantação de vários nós (HA)
- Monitoramento e alertas
- Migração e atualização
- Etapa 1: mover os dados da organização do Identity, de independente para o Automation Suite
- Etapa 2: restauração do banco de dados de produtos independente
- Etapa 3: backup do banco de dados da plataforma no Automation Suite
- Etapa 4: mesclando organizações no Automation Suite
- Etapa 5: atualização das strings de conexão do produto migradas
- Etapa 6: migração do Orchestrator independente
- Etapa 7: migração do Insights independente
- Etapa 8: migração do Test Manager independente
- Etapa 9: exclusão do tenant padrão
- Executando uma migração de único tenant
- Migração do Automation Suite no Linux para o Automation Suite no EKS/AKS
- Atualizando o Automação Suite
- Download dos pacotes de instalação e obtenção de todos os arquivos no primeiro nó do servidor
- Recuperação da mais recente configuração aplicada do cluster
- Atualização da configuração de cluster
- Configuração do registro compatível com OCI para instalações offline
- Execução da atualização
- Realização de operações pós-atualização
- Configuração específica do produto
- Uso da ferramenta de configuração do Orchestrator
- Configuração de parâmetros do Orchestrator
- Configurações de aplicativo do Orchestrator
- Configuração do AppSettings
- Configuração do tamanho máximo da solicitação
- Substituição da configuração de armazenamento no nível do cluster
- Configuração dos repositórios de credenciais
- Configuração da chave de criptografia por tenant
- Limpeza do banco de dados do Orchestrator
- Melhores práticas e manutenção
- Solução de problemas
- Como solucionar problemas dos serviços durante a instalação
- Como desinstalar o cluster
- Como limpar os artefatos offline para melhorar o espaço em disco
- Como limpar os dados do Redis
- Como habilitar o registro em log do Istio
- Alterando o modo somente leitura do Ceph
- Como limpar logs antigos armazenados no bucket do sf-logs
- Como desabilitar os logs de streaming para o AI Center
- Como depurar instalações do Automation Suite com falha
- Como excluir imagens do instalador antigo após a atualização
- Como desabilitar o descarregamento de soma de verificação do TX
- Como atualizar do Automation Suite 2022.10.10 e 2022.4.11 para 2023.10.2
- Como definir manualmente o nível de log do ArgoCD como Info
- Como expandir o armazenamento do AI Center
- Como gerar o pull_secret_value codificado para registros externos
- Como lidar com cifras fracas no TLS 1.2
- Como trabalhar com certificados
- Como encaminhar logs do aplicativo para o Splunk
- Como limpar imagens do Docker não usadas dos pods de registro
- Como coletar dados de uso de DU com objectstore (Ceph) no cluster
- Como instalar o RKE2 SELinux em ambientes air-gapped
- Como limpar backups diferenciados antigos em um servidor NFS
- Não é possível executar uma instalação offline no SO RHEL 8.4
- Erro ao baixar o pacote
- A instalação offline falha devido a um binário ausente
- Verificação de pré-requisito para o módulo iscsid do selinux falha
- Azure disk not marked as SSD
- Falha após a atualização do certificado
- Antivírus causa problemas de instalação
- Automation Suite not working after OS upgrade
- O Automation Suite requer que backlog_wait_time seja definido como 0
- Não é possível montar o volume devido a não estar pronto para cargas de trabalho
- Falha na coleta de logs do pacote de suporte
- A cadeia de caracteres de conexão SQL da Automação de Teste é ignorada
- Configurações de DNS não honradas pelo CoreDNS
- Perda de dados ao reinstalar ou atualizar o Insights após a atualização do Automation Suite
- A atualização de nó único falha no estágio de malha
- Upgrade fails due to unhealthy Ceph
- O volume não pode ser montado e permanece no estado de loop anexar/desanexar
- A atualização falha devido a objetos clássicos no banco de dados do Orchestrator
- Um cluster do Ceph foi encontrado em um estado degradado após atualização lado a lado
- Um componente sem integridade do Insights causa uma falha na migração
- A atualização do serviço falha para o Apps
- Tempos limite de atualização no local
- Migração de registro do Docker presa no estágio de exclusão do PVC
- Falha no provisionamento do AI Center após a atualização para a 2023.10 ou posterior
- Falha de atualização em ambientes offline
- A validação de SQL falha durante a atualização
- pod snapshot-controller-crds no estado CrashLoopBackOff após a atualização
- Erro de upgrade/reinstalação do endpoint da API REST do Longhorn
- Falha de atualização devido aos tamanhos de PVC do Insights substituídos
- Falha de atualização de serviço durante a execução de script pré-serviço
- Configurando um intervalo de tempo limite para os portais de gerenciamento
- Autenticação não funciona após migração
- kinit: não é possível encontrar o KDC para o realm <AD Domain> ao obter credenciais iniciais
- kinit: o Keytab não contém chaves adequadas para *** ao obter credenciais iniciais
- Falha na operação GSSAPI devido a código de status inválido
- Alarme recebido para trabalho com falha do Kerberos-tgt-update
- Provedor de SSPI: servidor não encontrado no banco de dados Kerberos
- Falha de login para usuário do AD devido a conta desabilitada
- ArgoCD login failed
- Falha ao obter a imagem do sandbox
- Os pods não são exibidos na UI do ArgoCD
- Falha de teste do Redis
- O servidor RKE2 falha ao iniciar
- O ArgoCD entra em estado Em andamento após a primeira instalação
- Migreção manual do ArgoCD NetworkPolicy (GHSA-47m3-95c7-g2g8)
- Unhealthy services after cluster restore or rollback
- Métricas Ceph-rook ausentes nos painéis de monitoramento
- Os pods não podem se comunicar com o FQDN em um ambiente de proxy
- Falha ao configurar alertas por e-mail após a atualização
- Nenhum problema upstream íntegro
- Falha ao adicionar nós de agente em ambientes offline
- O acesso ao FQDN retorna RBAC: erro de acesso negado
- O Document Understanding não está no menu de navegação esquerdo do Automation Suite
- Status de Falha ao criar uma sessão de rotulagem de dados
- Status de Falha ao tentar implantar uma habilidade de ML
- Trabalho de migração falha no ArgoCD
- Reconhecimento de escrita com o Extrator de formulários inteligente não está funcionando
- Falha na implantação de habilidade de ML devido à expiração do token
- Execução de alta disponibilidade com o Process Mining
- Falha na ingestão do Process Mining ao fazer logon usando o Kerberos
- Após a recuperação de desastres, o Dapr não está funcionando corretamente para Process Mining
- Configurando o Dapr com o Redis no modo de cluster
- Não é possível conectar-se ao banco de dados AutomationSuite_ProcessMining_Warehouse usando uma string de conexão em formato pyodbc.
- A instalação do Airflow falha com sqlalchemy.exc.ArgumentError: não foi possível analisar o URL rfc1738 da string ''
- Como adicionar uma regra de tabela de IP para usar a porta 1433 do SQL Server
- O certificado do Automation Suite não é confiável para o servidor em que o CData Sync está sendo executado
- Execução da ferramenta de diagnóstico
- Usando o pacote de suporte do Automation Suite
- Exploração de logs
Conclua as etapas de verificação e configuração pós-implantação após instalar o Automation Suite na infraestrutura do Azure.
When using Azure Bastion, keep in mind that copy-pasting commands split over multiple lines using \ may not work as expected. To ensure new lines are interpreted correctly, use the console's clipboard widget.
Validando a instalação
To check if Automation Suite was installed successfully, you must go to the storage account, inside the flags container. The installation is complete if the contents of the auto-generated file called installResult (in the container) is successful. The contents will be failed if the installation failed.
Atualização de certificados
O processo de instalação gera certificados autoassinados em seu nome. Esses certificados são compatíveis com FIPS 140-2. O modelo de implantação do Azure também oferece a opção de fornecer um certificado de servidor emitido pela CA no momento da instalação, em vez de usar um certificado autoassinado gerado automaticamente.
Certificados autoassinados expirarão em 90 dias e você deverá substituí-los por certificados assinados por uma CA confiável assim que a instalação for concluída. Se você não atualizar os certificados, a instalação deixará de funcionar após 90 dias.
Se você instalou o Automation Suite em um host habilitado para FIPS 140-2 e deseja atualizar os certificados, verifique se são compatíveis com FIPS 140-2.
Para obter instruções, consulte Gerenciamento de certificados.
Habilitando o FIPS 140-2
Após concluir uma instalação do Automation Suite usando o modelo de implantação do Azure, você pode habilitar o FIPS 140-2 em suas máquinas. Para obter instruções, consulte Segurança e conformidade.
Exploring flags and logs
Se você precisar de mais informações sobre o processo de instalação do Automation Suite ou outras operações, um bom lugar para começar é a conta de armazenamento usada para armazenar vários sinalizadores e logs durante a implantação e manutenção do cluster.
Para localizar a conta de armazenamento, execute as seguintes etapas:
-
Navegue até o grupo de recursos em que a implantação foi executada.
-
Filter by resource type Storage Account.
-
Localize a conta de armazenamento cujo nome termina com
st. Por exemplo: -
Selecione a conta de armazenamento e, em seguida, selecione Contêineres. Suas opções são sinalizadores e logs.
Sinalizadores de contêiner
The flags container stores various flags or files needed for orchestration or just to report the status of various operations. On a new cluster, the flags container contents typically look as shown in the following example:
Files in the flags containers are used to orchestrate various operations, such as the Automation Suite installation process on the cluster, or specific cluster operations, such as Instance Refresh. For example:
uipath-server-000000.successindica que a instalação da infraestrutura foi concluída com êxito nesse nó específico do cluster;installResultlêsuccessse a instalação geral for bem-sucedida.
Contêiner de logs
When performing an operation, it typically produces a log file in the logs container. On a fresh cluster, the logs container contents typically look as shown in the following example:
Every file in the logs container represents the logs for a specific step of the installation process. For example:
infra-uipath-server-000000.logarmazena os logs de instalação da infraestrutura;fabric.logarmazena os logs para a instalação da malha;services.logarmazena os logs para a instalação de aplicativos e serviços.
Acessando saídas de implantação
Quando a instalação estiver concluída, você precisa acessar os Resultados de implantação na aba Resultados.
Para fazer isso, vá para o seu Grupo de Recursos e, em seguida, para Implantações → mainTemplate (ou algo como Microsoft.Template-DateTime) → Saídas.
Saídas da implantação
| Saída | Description |
|---|---|
| Documentação | Um link para a documentação. |
| URL | A URL do balanceador de carga. Pode ser usado para acesso direto. Se os domínios personalizados forem habilitados, este é o domínio que você usaria para a associação CNAME. |
| KeyVaultURL | A URL do Portal do Azure para o Key Vault criado pela implantação. Ela contém todos os segredos (credenciais) usados na implantação. |
| ArgoCDURL | A URL para acessar o ArgoCD. Isso está disponível na VNet. O acesso externo a essa URL deve ser configurado conforme descrito na: Etapa 4: Configuração do DNS. |
| ArgoCDPassword | A senha usada para fazer login no portal ArgoCD. |
| HostAdminUsername e HostAdminPassword | As credenciais usadas para Administração de Host. |
| ClusterAdministrationURL | A URL para o portal de administração de cluster. |
| DashboardMonitoringURL | O URL para ferramentas de monitoramento de painel (Grafana): https://monitoring.<fqdn>/dashboard. Certifique-se de substituir <fqdn> por seu FQDN. |
| MetricsMonitoringURL | O URL para ferramentas de monitoramento de métricas (Prometheus): https://monitoring.<fqdn>/metrics. Certifique-se de substituir <fqdn> por seu FQDN. |
| AlertmanagerMonitoringURL | O URL para ferramentas de monitoramento do Alertmanager: https://monitoring.<fqdn>/alertmanager. Certifique-se de substituir <fqdn> por seu FQDN. |
Todas as credenciais usadas na implantação são armazenadas como segredos dentro de um Key Vault provisionado durante a implantação. Para acessar os segredos, filtre os recursos dentro do Grupo de Recursos, pesquise Vault e, em seguida, selecione Segredos.
Se você vir o The operation "List" is not enabled in the key vault's access policyaviso na guia Segredos guia, siga os seguintes passos:
- Vá para Políticas de acesso → Adicionar política de acesso → Configurar o modelo → Gerenciamento de segredo → Selecionar principal .
- Selecione seu usuário e, em seguida, selecione Salvar.
- Navegue de volta para Segredos . O aviso deve desaparecer e os segredos devem estar visíveis.
Como acessar VMs de cluster
As VMs são provisionadas dentro de uma VNet privada. Você pode acessá-los por meio do Azure Bastion seguindo estas etapas:
-
Navegue até o grupo de recursos em que você implantou o Automation Suite.
-
Como os agentes, agentes de GPU e VMs de servidor estão dentro dos conjuntos de dimensionamento, você precisa acessar o conjunto de dimensionamento que contém a instância desejada.
-
Vá para a seção Instâncias na guia Configurações.
-
Selecione o nome da VM que você deseja conectar.
-
Selecione o botão Conectar e, em seguida, escolha Bastion no menu suspenso.
-
Insira as credenciais fornecidas na implantação (parâmetros Nome de usuário do administrador e Senha do administrador , que você pode encontrar no cofre de chaves das credenciais, em Segredos) e selecione Conectar.
Requisitos de DNS
Como mencionado na Etapa 1: Preparação de sua implantação do Azure, a implantação do Automation Suite Azure cria um balanceador de carga com um IP público e um rótulo DNS associado. Esta etiqueta DNS é de propriedade da Microsoft.
A implantação também provisiona uma zona de DNS privado dentro da VNet do cluster e adiciona vários registros que são usados durante o processo de instalação e configuração.
Se você optar por se conectar de uma máquina externa, não poderá usar a zona DNS privada para resolver o DNS de vários serviços, portanto, será necessário adicionar esses registros ao arquivo host.
Consulte Etapa 4: Configurando o DNS para mais detalhes.
Agora você deve conseguir se conectar a vários serviços em execução em seu cluster.
Acessando o portal de administração de cluster
O portal de administração de cluster é um local centralizado onde você pode encontrar todos os recursos necessários para concluir uma instalação do Automation Suite e executar operações pós-instalação comuns. Para obter detalhes, consulte Introdução ao portal de administração do cluster.
Para acessar o portal de Administração do Cluster, execute a seguinte etapa:
Acesse o seguinte URL: https://${CONFIG_CLUSTER_FQDN}/uipath-management.
You do not need any credentials to access the Cluster Administration portal.
Acessando a interface geral do Automation Suite
A interface do usuário do Automation Suite de uso geral é usada como portal tanto para os administradores quanto para os usuários da organização. É um recurso comum ao nível de organização a partir do qual todos podem acessar todas as áreas do Automation Suite: páginas de administração, páginas ao nível de plataforma, páginas específicas de serviço e páginas específicas do usuário.
Para acessar o Automation Suite, execute as seguintes etapas:
- Acesse a seguinte URL:
https://${Loadbalancer_dns}, onde<loadbalancer_dns>é a etiqueta DNS para o balanceador de carga e é encontrado em resultados. - Altere para organização padrão.
- O nome de usuário é orgadmin.
- Recupere a senha acessando CofreDeChaves,Segredos e, então, Senha do admin do host.
Acessando a administração do host
O portal do host é onde os administradores do sistema configuram a instância do Automation Suite. As configurações definidas neste portal são herdadas por todas as suas organizações e algumas podem ser substituídas no nível da organização.
Para acessar a administração do host, execute as seguintes etapas:
- Acesse a seguinte URL:
https://${Loadbalancer_dns}, onde<loadbalancer_dns>é a etiqueta DNS para o balanceador de carga e é encontrado em Saídas. - Alterne para a organização do Host.
- Enter the username you previously specified as a value for the UiPath Admin Username parameter.
- Insira a senha que você especificou anteriormente como um valor para o parâmetro Senha de administrador da UiPath. Recupere a senha acessando CofreDeChaves,Segredos e, então, Senha do admin do host.
Acessando o ArgoCD
Você pode usar o console do ArgoCD para gerenciar produtos instalados.
Para acessar o ArgoCD, siga as seguintes etapas:
- Acesse a seguinte URL:
https://alm.${Loadbalancer_dns}, onde<loadbalancer_dns>é a etiqueta DNS para o balanceador de carga e é encontrado em Saídas. Observe que você deve configurar o acesso externo a essa URL, conforme descrito na Etapa 4: configuração do DNS. - O nome de usuário é admin.
- Para acessar a senha, acesse o Resultados guia ou o Keyvault da credencial.
Acessando as ferramentas de monitoramento
Para acessar as ferramentas de monitoramento pela primeira vez, faça login como administrador com as seguintes credenciais padrão:
- Nome de usuário: admin
- Senha: para recuperar a senha, execute o seguinte comando:
kubectl get secrets/dex-static-credential -n uipath-auth -o "jsonpath={.data['password']}" | base64 -dkubectl get secrets/dex-static-credential -n uipath-auth -o "jsonpath={.data['password']}" | base64 -d
Para atualizar a senha padrão usada para autenticação Dex ao acessar as ferramentas de monitoramento, execute as seguintes etapas.
- Execute o seguinte comando substituindo
newpasswordpor sua nova senha:password="newpassword" password=$(echo -n $password | base64) kubectl patch secret dex-static-credential -n uipath-auth --type='json' -p="[{'op': 'replace', 'path': '/data/password', 'value': '$password'}]"password="newpassword" password=$(echo -n $password | base64) kubectl patch secret dex-static-credential -n uipath-auth --type='json' -p="[{'op': 'replace', 'path': '/data/password', 'value': '$password'}]" - Execute o seguinte comando para atualizar a senha:
./install-uipath.sh -i /opt/UiPathAutomationSuite/cluster_config.json -o ./output.json -f --accept-license-agreement./install-uipath.sh -i /opt/UiPathAutomationSuite/cluster_config.json -o ./output.json -f --accept-license-agreement
Escalonando seu cluster
Os recursos de computação provisionados da implantação consistem em conjuntos de escalonamento do Azure, que permitem fácil escalonamento.
Você pode adicionar mais recursos manualmente a um conjunto de dimensionamento específico, incluindo a adição de nós de servidor, nós de agente ou nós de agente especializados (como nós de GPU).
Você pode executar uma escala manual identificando o conjunto de escala específico e adicionar recursos diretamente.
Para fazer isso, siga os seguintes passos:
-
Vá para o Portal do Azure e filtre no conjunto de escalonamento específico:
-
Selecione o conjunto de escalonamento apropriado e selecione Escala.
-
Modifique o campo Contagem de instâncias usando o controle deslizante ou o campo de entrada ao lado dele e, em seguida, selecione Salvar.
Observação:Para conjuntos de escalonamento de servidor, a contagem de instâncias precisa ser um número ímpar.
-
A operação de escalonamento deve começar em segundo plano e novos recursos ficam disponíveis após a conclusão.
Concluindo uma atualização
Após realizar uma atualização de cluster do Automation Suite, as implantações de modelos do Azure exigem algumas alterações para garantir que um novo nó entre no cluster corretamente. Para automatizar as alterações, recomendamos usar o script dedicado. Para obter instruções, consulte a documentação do Modelo de implantação do Azure.
Operações de ciclo de vida da VM do Azure
O Azure permite uma janela de 15 minutos no máximo para se preparar para o desligamento, enquanto o encerramento normal de um nó do Automation Suite varia de 20 minutos (para nós de agente e agente de GPU) a horas (no caso de nós de servidor).
Para evitar a perda de dados, a política de atualização do VMSS do servidor é definida como manual, e as VMs do servidor têm a proteção para as ações de conjunto de escala habilitadas. Como resultado, recomendamos gerenciar o ciclo de vida dos servidores por meio dos Runbooks fornecidos.
The InstanceRefresh, RemoveNodes, RemoveServers, and CheckServerZoneResilience runbooks are supported only for multi-node HA-ready production deployments.
O número de servidores após a execução de qualquer runbook deve ser ímpar e maior que três (por exemplo, você não pode executar uma atualização de instância se tiver 4 servidores; não pode remover um servidor se tiver um total de cinco).
Todas as VMs em VMSSes devem estar no estado Running .
Somente um runbook deve ser executado por vez.
Os runbooks InstanceRefresh, RemoveNodes e RemoveServers são afetados por um problema que faz com que as operações de remoção de nós falhem se você usar o Azure para o Governo dos EUA.
Trabalhadores híbridos
Todas as nossas contas de armazenamento e servidores SQL têm endpoints privados. Um grupo de trabalhadores híbridos executa as operações automatizadas existentes para que elas funcionem sem problemas.
Um trabalho híbrido é uma VM que fica dentro da VNET e na qual as várias automações serão executadas.
A VM é normalmente uma Standard_D2s_v3 ou uma Standard_F2s_v2, dependendo de qual você escolher para as VMs do seu servidor e se a cota permite. A VM é encerrada quando a implantação é concluída para minimizar os custos.
Os runbooks são divididos em duas categorias: runbooks regulares e runbooks híbridos. Você usa os runbooks regulares para iniciar uma operação e reunir todos os dados. O runbook regular então inicia a VM do Worker Híbrido e o runbook do runbook, com este último concluindo a operação.
Quando a operação for concluída, você poderá desativar a VM do híbrido de trabalho para limitar os custos.
A tabela a seguir descreve o detalhamento do runbook:
| Runbooks regulares | Runbooks híbridos |
|---|---|
| AddGpuNode | HybridAddGpuNode |
| BackupCluster | HybridBackupCluster |
| GetAllBackups | HybridGetAllBackups |
| InstanceRefresh | HybridInstanceRefresh (+HybridCheckServerZoneRezilience) |
| RegisterAiCenterExternalOrchestrator | HybridRegisterAiCenterExternalOrchestrator |
| RemoveNodes | HybridRemoveNodes |
| RemoveServers | HybridRemoveServers |
| RestoreClusterInitialize | HybridRestoreClusterInitialize + HybridRestoreClusterSnapshot |
| ValidateFullInstall | Execução no final da implantação para validar a instalação completa. |
InstanceRefresh
Description
The InstanceRefresh runbook has the following use cases:
- Atualize o VMSS OS SKU nos conjuntos de dimensionamento de servidor, agente e GPU.
- Execute uma operação de rotação de nó para um/mais VMSSes.
- Outras alterações de configuração do VMSS que foram aplicadas ao VMSS anteriormente.
Uso
- Go to the Azure Portal and search for the resource called InstanceRefresh.
- Selecione o botão para abrir a lista de parâmetros. Complete os parâmetros considerando:
- Uma operação de rotação de nó é executada em um VMSS somente se o parâmetro
REFRESH<node_type>estiver configurado comoTrue. Se vários parâmetrosREFRESH<node_type>forem definidos comoTrue, a ordem de rotação do nó VMSS será Servidores -> Agentes -> Agentes de GPU. - Você deve fornecer o parâmetro
NEWOSVERSIONpara atualizar o VMSS OS SKU. Você pode encontrar o SKU de imagem de VMs do Azure Marketplace disponível usandoaz vm image list-skus --location <deployment_location> --offer RHEL --publisher RedHat --output table. As VMs atuais não são atualizadas automaticamente para o modelo mais recente (uma operação de rotação de nós é necessária para isso).
- Uma operação de rotação de nó é executada em um VMSS somente se o parâmetro
Selecione o botão OK para iniciar o runbook.
Detalhes da implementação
O runbook InstanceRefresh é um wrapper para o runbook RemoveNodes . Como resultado, o status é rastreado durante a execução do RemoveNodes. Ele atualiza todas as versões do sistema operacional VMSS (se necessário) e extrai, com base nos parâmetros recebidos, o nome do host para a operação de rotação de nós e os encaminha para o RemoveNodes.
Se o cluster tiver exatamente três servidores, o runbook InstanceRefresh criará três novos servidores; caso contrário, o RemoveNodes lida com a escalabilidade para manter pelo menos um servidor em cada Zona de Disponibilidade de cada vez.
RemoveNodes
Description
O runbook RemoveNodes tem os seguintes casos de uso:
- Remova os nós especificados do cluster do Automation Suite.
- Execute uma operação de rotação de nós para uma ou duas VMs.
Uso
-
Pesquise os nomes de computador dos nós que você deseja remover. Para fazer isso, vá para um VMSS e selecione
Instancesna seçãoSettings. -
Go to the Azure Portal and search for the resource called RemoveNodes.
-
Selecione o botão para abrir a lista de parâmetros. Complete os parâmetros considerando o seguinte:
NODESTOBEREMOVEDCOMPUTERNAMEé uma lista separada por vírgulas de nomes de computador das VMs que você deseja excluir (por exemplo,pxlqw-agent-000009,pxlqw-agent-00000A) e é o único parâmetro obrigatório. Recomendamos remover os nós de um único VMSS por vez.ISINSTANCEREFRESHandTHREESERVERSSCENARIOare flags populated by the InstanceRefresh wrapper.
Selecione o botão OK para iniciar o runbook.
Detalhes da implementação
O runbook RemoveNodes tem uma abordagem recursiva para superar o tempo limite de 3 horas de quota justa . Isso remove ou repõe o primeiro ou os dois primeiros nós (o número é escolhido para atender à restrição de número ímpar de servidores) da lista recebida e executa novamente outra instância do runbook com a lista restante.
A operação de reparação de nó requer as seguintes etapas:
- Expanda o VMSS com uma ou duas VMs com base no número de nós que serão removidos.
- Execute a remoção do nó para as instâncias antigas.
A operação de remoção de nó para um nó requer a execução das seguintes etapas:
- Isolar e drenar as instâncias. A operação expira após 20 minutos para um agente e
number_of_instances * 60minutos para servidores. - Pare o serviço rke nas instâncias. A operação expira após 5 minutos.
- Remova os nós do cluster do Automation Suite e exclua as VMs. A operação expira após 20 minutos para agentes e
number_of_instances * 60minutos para servidores.
RemoveServers
Description
The RemoveServers runbook has the following use case:
- remova os servidores do cluster do Automation Suite.
Uso
- Go to the Azure Portal and search for the resource called RemoveServers.
- Selecione o botão para abrir a lista de parâmetros. Complete os parâmetros considerando o seguinte:
-
REMOVEDSERVERSCOUNTé o número de servidores que serão removidos. Recomendamos remover não mais do que 2 servidores de cada vez para não atingir o tempo limite de quota justa .
Detalhes da implementação
The RemoveServers runbook removes the number of servers received as a parameter from the Availability Zones with the most VMs.
CheckServerZoneResilience
Description
The CheckServerZoneResilience runbook scales out the server VMSS and uses the RemoveServers runbook to balance the servers across Availability Zones. This is part of the InstanceRefresh flow and should not be run manually.
AddGpuNode
Description
No cenário em que a implantação inicial foi criada sem um nó de GPU, criamos o Conjunto de Escalonamento de VMs, mas temos um SKU diferente para evitar problemas de disponibilidade de zona/SKU. Esse runbook altera o SKU para um SKU de GPU e adiciona um nó.
Do not scale the initial GPU VMSS created before running this runbook if the initial deployment was created without GPU nodes.
Uso
Para usar este runbook, execute as seguintes etapas:
- Navegue até o grupo de recursos em que você implantou o Automation Suite, identifique e selecione Conta de automação.
- Selecione Runbooks e, em seguida, o runbook AddGPUNode .
- Forneça um nome para o SKU que você deseja ter e selecione Iniciar.
Parâmetros:
skuName – o SKU para os nós de GPU VMSS.
Valores permitidos:
Standard_NC8as_T4_v3Standard_NC12s_v3Standard_NC24s_v3
RegisterAiCenterExternalOrchestrator
Description
O runbook registra o AI Center no Orchestrator externo fornecido no momento da implantação.
Uso
O documento expõe um único parâmetro obrigatório, IdentityToken, que é um token de acesso de instalação gerado pelo serviço de Identidade externo. Como o token tem uma breve disponibilidade (aproximadamente 1 a 2 horas), recomendamos gerá-lo antes de executar o runbook. Para obter instruções, consulte Chave de instalação.
BackupCluster
Description
O runbook BackupCluster ajuda você a fazer backup do seu cluster.
Uso
-
Navegue até o grupo de recursos em que você implantou o Automation Suite, identifique e selecione a Conta do Automation.
-
Selecione Runbooks e, em seguida, o runbook BackupCluster .
-
Forneça um nome para o backup que você deseja criar.
-
Para iniciar uma operação de backup para o cluster do Automation Suite, selecione o botão Iniciar na parte superior da página.
-
Assim que o status da tarefa runbook for
Completed, a operação de backup será concluída. Se o status do trabalho de runbook forFailed, você poderá verificar os logs na conta de armazenamento para obter mais informações.
GetAllBackups
Description
The GetAllBackups runbook helps you view a list of all available backups, both scheduled and manual.
RestoreClusterInitialize, RestoreSnapshot
Description
Esses runbooks ajudam a executar uma restauração do cluster.
Uso
When starting the restore process, we put the cluster in maintenance mode. Once the restore process is successful, we take the cluster out of maintenance mode.
Para executar uma operação de restauração, execute as seguintes etapas:
-
Identify the restore files you want to use. To do this, navigate to your Automation Suite deployment Automation Account, and run the GetAllBackups runbook.
-
When the runbook job is complete, check the bottom of the Output tab for a list of available backups. Select the one you want to use in the restore operation and copy it.
-
Navigate back to the Automation Account and run the RestoreClusterInitialize runbook. For the parameter, paste the name of the previously copied backup file. At this point, the restore process is started.
-
The RestoreSnapshot job is started automatically. When the job is done, the restore process is complete.
Observação:Logs are present in the storage account (ending with
st), in the backups container, under therestores/<backup-name>/folder, wherebackup-nameis the name of the backup used to perform the restore. -
Após uma restauração, você deve confirmar que o cluster está em um bom estado (consulte Validação da instalação ou qualquer link de solução de problemas do ArgoCD). Depois disso, você tem a opção de habilitar o backup no cluster executando o runbook RestoreClusterFinalize com o mesmo parâmetro que na etapa anterior. Isso habilita os backups para o cluster.
Solução de problemas
- Caso uma VM não entre no cluster do Automation Suite, uma reversão será tentada. As VMs recém-criadas seguirão as mesmas etapas que uma remoção de nó habitual (associar, drenar, interromper o serviço rke, remover o nó do cluster e excluir as VMs). Você pode encontrar os logs do procedimento de associação de nó na conta de armazenamento, dentro do contêiner de logs , em blobs como
infra-<hostname>.log. - In case of a failure while deleting nodes, any runbook will stop and display the logs for the step that failed. Fix the issue, complete the process manually or using the RemoveNodes runbook. You can find all the logs in the storage account, inside the logs container, as follows:
- Isolamento e drenagem -
<timestamp>-<runbook_abreviation>-drain_nodes.log - Interrompa o serviço do rke -
<timestamp>-<runbook_abreviation>-stop_rke.log - Remova o nó do cluster -
<timestamp>-<runbook_abreviation>-remove_nodes.log
- Isolamento e drenagem -
- Em caso de tempo limite, você deve aguardar a etapa finalizar sua execução, verificar os logs e concluir o processo manualmente ou usando o runbook RemoveNodes . Todos os runbooks usam a funcionalidade Comando de Execução do Azure para executar código no contexto das VMs. Uma limitação desse método é que ele não retorna o status da execução. Portanto, as etapas para isolar, drenar e interromper o serviço rke são executadas de forma assíncrona, e o status é mantido com blobs no seguinte formato:
<timestamp>-<runbook_abreviation>-<step_name>.<success/fail>.
- Validando a instalação
- Atualização de certificados
- Habilitando o FIPS 140-2
- Exploring flags and logs
- Sinalizadores de contêiner
- Contêiner de logs
- Acessando saídas de implantação
- Saídas da implantação
- Como acessar VMs de cluster
- Requisitos de DNS
- Acessando o portal de administração de cluster
- Acessando a interface geral do Automation Suite
- Acessando a administração do host
- Acessando o ArgoCD
- Acessando as ferramentas de monitoramento
- Como escalonar seu cluster
- Concluindo uma atualização
- Operações de ciclo de vida da VM do Azure
- Trabalhadores híbridos
- InstanceRefresh
- RemoveNodes
- RemoveServers
- CheckServerZoneResilience
- AddGpuNode
- RegisterAiCenterExternalOrchestrator
- BackupCluster
- GetAllBackups
- RestoreClusterInitialize, RestoreSnapshot
- Solução de problemas