Bereitstellung und Orchestrierung von ML-Workflows1 / 5
Ein ML-Engineer stellt ein Computer-Vision-Modell bereit, das GPU-Inferenz erfordert. Das Modell bekommt während der Geschäftszeiten gleichmäßigen Traffic, nachts dagegen kaum welchen. Welche SageMaker-Bereitstellungskonfiguration optimiert die Kosten und stellt gleichzeitig sicher, dass während der Geschäftszeiten GPUs verfügbar sind?
RichtigFalsch
Alex
Mit zeitgesteuertem Auto Scaling kannst du die Kapazität eines Endpoints proaktiv über cron-ähnliche Ausdrücke festlegen, die zu bekannten Traffic-Mustern passen (Dokumentation zu AWS Auto Scaling). Bei GPU-Workloads mit vorhersehbarem Traffic während der Geschäftszeiten vermeidest du so, teure GPU-Instanzen 24/7 laufen zu lassen, und sorgst trotzdem dafür, dass die Kapazität schon hochskaliert ist, bevor die Nachfrage einsetzt. Serverless Inference unterstützt keine GPU-Instanztypen und ist damit für GPU-Workloads ungeeignet. CPU-Instanzen haben nicht die Rechenleistung, die für Computer-Vision-Inferenz nötig ist, was zu inakzeptabler Latenz führt. Batch Transform verarbeitet Daten in Batches, statt Vorhersagen in Echtzeit auszuliefern, und kann eingehende Anfragen daher nicht bedarfsgerecht bedienen.
Quelledocs.aws.amazon.com
Antworten auf Rückfragen bekommst du in der App. Erstelle ein kostenloses Konto — ohne Kreditkarte.
Frage 1 von 5
Kostenloses Konto erstellen