Monitoramento, registro em log, análise, remediação e otimização de desempenho1 / 5
Uma empresa executa uma aplicação de produção em instâncias EC2. O administrador de SysOps precisa corrigir automaticamente um problema comum em que as instâncias param de responder por causa de um bug conhecido da aplicação. Quando o CloudWatch detecta uso de CPU acima de 95% por mais de 10 minutos, o sistema deve reiniciar automaticamente o serviço da aplicação na instância afetada. Qual solução exige o MENOR esforço operacional?
CorretoQuase
Alex
As quatro opções acabariam reiniciando alguma coisa, então a pergunta é qual delas exige que você construa e mantenha menos. O alarme do CloudWatch já sabe mudar de estado quando um limite é ultrapassado, o EventBridge já sabe rotear essa mudança de estado e o Systems Manager Automation já sabe executar uma sequência documentada de etapas em uma instância gerenciada, já que você inicia uma automação indicando um runbook como destino de um evento do EventBridge. Nada é escrito sob medida, nada novo é instalado e o runbook reinicia apenas o serviço da aplicação, e não o host inteiro.
As alternativas acrescentam trabalho ou vão longe demais. Uma regra agendada que consulta a cada minuto é um cron que agora é seu: refaz o que o alarme já faz e cobra uma invocação a cada minuto, havendo algo errado ou não. Uma função que abre uma sessão de shell na instância significa gerenciar chaves, caminhos de rede e tratamento de erros para um mecanismo que o agente já oferece. E a ação de alarme integrada que reinicia a instância é a mais grosseira de todas: derruba a máquina inteira quando bastava reiniciar um serviço.
Dica de prova: menor esforço operacional quase sempre significa compor serviços gerenciados. Prefira a resposta que conecta serviços existentes em vez da que introduz código, credenciais ou um laço de polling que você terá de manter.
Fontedocs.aws.amazon.com
Crie uma conta grátis para continuar perguntando ao Alex — sem cartão de crédito.
Questão 1 de 5
Comece grátis