Bereitstellung und Orchestrierung von ML-Workflows1 / 5
Ein ML-Engineer stellt ein Computer-Vision-Modell bereit, das GPU-Inferenz erfordert. Das Modell bekommt während der Geschäftszeiten gleichmäßigen Traffic, nachts dagegen kaum welchen. Welche SageMaker-Bereitstellungskonfiguration optimiert die Kosten und stellt gleichzeitig sicher, dass während der Geschäftszeiten GPUs verfügbar sind?
RichtigNicht ganz
Alex
Mit zeitgesteuertem Auto Scaling kannst du die Kapazität eines Endpoints proaktiv über cron-ähnliche Ausdrücke festlegen, die zu bekannten Traffic-Mustern passen (Dokumentation zu AWS Auto Scaling). Bei GPU-Workloads mit vorhersehbarem Traffic während der Geschäftszeiten vermeidest du so, teure GPU-Instanzen 24/7 laufen zu lassen, und sorgst trotzdem dafür, dass die Kapazität schon hochskaliert ist, bevor die Nachfrage einsetzt. Serverless Inference unterstützt keine GPU-Instanztypen und ist damit für GPU-Workloads ungeeignet. CPU-Instanzen haben nicht die Rechenleistung, die für Computer-Vision-Inferenz nötig ist, was zu inakzeptabler Latenz führt. Batch Transform verarbeitet Daten in Batches, statt Vorhersagen in Echtzeit auszuliefern, und kann eingehende Anfragen daher nicht bedarfsgerecht bedienen.
Quelledocs.aws.amazon.com
Erstelle ein kostenloses Konto, um Alex weiter zu fragen — keine Kreditkarte nötig.
Frage 1 von 5
Kostenlos starten