Implantação e orquestração de fluxos de trabalho de ML1 / 5
Um engenheiro de ML está implantando um modelo de visão computacional que exige inferência em GPU. O modelo recebe tráfego constante durante o horário comercial, mas quase nenhum tráfego à noite. Qual configuração de implantação do SageMaker otimiza o custo e ao mesmo tempo garante a disponibilidade de GPU durante o horário comercial?
CorretoIncorreto
Alex
O auto scaling agendado permite que você defina a capacidade do endpoint de forma proativa usando expressões no estilo cron que acompanham padrões de tráfego já conhecidos (documentação do AWS Auto Scaling). Para cargas de trabalho em GPU com tráfego previsível no horário comercial, isso evita manter instâncias de GPU caras rodando 24/7 e ainda garante que a capacidade já esteja escalada antes de a demanda chegar. O Serverless Inference não oferece suporte a tipos de instância com GPU, o que o torna inadequado para cargas de trabalho em GPU. Instâncias de CPU não têm o poder de processamento necessário para a inferência de visão computacional, o que resulta em latência inaceitável. O Batch Transform processa dados em lotes em vez de servir previsões em tempo real, então não consegue atender a requisições sob demanda.
Fontedocs.aws.amazon.com
Você pode obter respostas às suas dúvidas no app. Crie uma conta grátis, sem cartão de crédito.
Questão 1 de 5
Criar uma conta grátis