Modelle bereitstellen und skalieren1 / 5
Du musst Online-Inferenz mit einem Modell durchführen, das Textantworten generiert. Die Antworten können sehr lang sein (bis zu 2000 Tokens). Du möchtest die Nutzererfahrung verbessern, indem du die Antwort-Tokens streamst, während sie generiert werden. Welche Serving-Funktion von Vertex AI unterstützt das?
RichtigFalsch
Alex
Vertex AI bietet Streaming-Vorhersagen über die API-Endpoints serverStreamingPredict und streamGenerateContent für generative KI-Modelle, die längere Texte erzeugen. Beim Streaming werden die Tokens inkrementell gesendet, sobald sie generiert sind, was die Time-to-First-Token (TTFT) senkt – Nutzer sehen, wie die Antwort in Echtzeit entsteht. Der Endpoint liefert über Server-Sent Events (SSE) einen Stream von StreamingPredictResponse-Instanzen. Standard-Prediction-Endpoints warten auf die vollständige Antwort, bevor sie zurückgeben, was bei Ausgaben mit über 2000 Tokens zu inakzeptablen Verzögerungen führt. Batch Prediction verarbeitet Offline-Workloads, keine Interaktion in Echtzeit. Eigene WebSocket-Container bringen unnötige Komplexität, wenn natives Streaming verfügbar ist. Prüfungstipp: Serving generativer KI mit langen Ausgaben → Streaming-Prediction-Endpoints; tabellarisch/Klassifikation → Standard-Endpoints. Ref: docs.cloud.google.com/vertex-ai/generative-ai/docs/reference/rest/v1/projects.locations.endpoints
Quellecloud.google.com
Antworten auf Rückfragen bekommst du in der App. Erstelle ein kostenloses Konto — ohne Kreditkarte.
Frage 1 von 5
Kostenloses Konto erstellen