Déploiement et orchestration des workflows de ML1 / 5
Un ingénieur ML déploie un modèle de vision par ordinateur qui nécessite une inférence sur GPU. Le modèle reçoit un trafic régulier pendant les heures de bureau, mais très peu de trafic la nuit. Quelle configuration de déploiement SageMaker optimise les coûts tout en garantissant la disponibilité des GPU pendant les heures de bureau ?
Bonne réponseRéponse incorrecte
Alex
L'auto scaling planifié te permet de définir à l'avance la capacité de l'endpoint à l'aide d'expressions de type cron qui correspondent à des schémas de trafic connus (documentation AWS Auto Scaling). Pour des charges de travail GPU au trafic prévisible sur les heures de bureau, cela évite de faire tourner des instances GPU coûteuses 24/7 tout en garantissant que la capacité est déjà montée avant l'arrivée de la demande. Serverless Inference ne prend pas en charge les types d'instances GPU, ce qui le rend inadapté aux charges de travail GPU. Les instances CPU n'ont pas la puissance de calcul nécessaire à l'inférence en vision par ordinateur, d'où une latence inacceptable. Batch Transform traite les données par lots au lieu de servir des prédictions en temps réel : il ne peut donc pas répondre aux requêtes entrantes à la demande.
Sourcedocs.aws.amazon.com
Les réponses aux questions complémentaires sont disponibles dans l’app. Crée un compte gratuit, sans carte bancaire.
Question 1 sur 5
Créer un compte gratuit