Despliegue y orquestación de flujos de trabajo de ML1 / 5
Un ingeniero de ML está desplegando un modelo de visión por computadora que requiere inferencia en GPU. El modelo recibe tráfico constante durante el horario laboral, pero muy poco tráfico durante la noche. ¿Qué configuración de despliegue de SageMaker optimiza el costo y, al mismo tiempo, garantiza la disponibilidad de GPU durante el horario laboral?
CorrectoIncorrecto
Alex
El auto scaling programado te permite definir de forma proactiva la capacidad del endpoint con expresiones tipo cron que coinciden con patrones de tráfico conocidos (documentación de AWS Auto Scaling). Para cargas de trabajo con GPU y tráfico predecible en horario laboral, esto evita tener instancias de GPU costosas funcionando 24/7 y a la vez asegura que la capacidad ya esté escalada antes de que llegue la demanda. Serverless Inference no admite tipos de instancia con GPU, así que no sirve para cargas de trabajo con GPU. Las instancias de CPU no tienen la potencia de procesamiento que exige la inferencia de visión por computadora, lo que produce una latencia inaceptable. Batch Transform procesa los datos por lotes en lugar de entregar predicciones en tiempo real, por lo que no puede atender solicitudes entrantes bajo demanda.
Fuentedocs.aws.amazon.com
Puedes obtener respuestas a tus dudas en la app. Crea una cuenta gratis, sin tarjeta de crédito.
Pregunta 1 de 5
Crear una cuenta gratis