Servir et mettre à l'échelle les modèles1 / 5
Tu dois faire de l'inférence en ligne avec un modèle qui génère des réponses textuelles. Les réponses peuvent être très longues (jusqu'à 2000 tokens). Tu veux offrir une meilleure expérience utilisateur en diffusant les tokens de la réponse au fur et à mesure qu'ils sont générés. Quelle fonctionnalité de serving de Vertex AI le permet ?
Bonne réponseRéponse incorrecte
Alex
Vertex AI propose la prédiction en streaming via les endpoints d'API serverStreamingPredict et streamGenerateContent, pour les modèles d'IA générative qui produisent des textes longs. Le streaming envoie les tokens de façon incrémentale, au fur et à mesure de leur génération, ce qui réduit le temps jusqu'au premier token (TTFT) : les utilisateurs voient la réponse se construire en temps réel. L'endpoint renvoie un flux d'instances StreamingPredictResponse via des server-sent events (SSE). Les endpoints de prédiction standards attendent la réponse complète avant de la renvoyer, d'où des délais inacceptables pour des sorties de plus de 2000 tokens. La prédiction par lots traite des charges de travail hors ligne, pas de l'interaction en temps réel. Les conteneurs WebSocket personnalisés ajoutent une complexité inutile alors que le streaming natif existe. Astuce d'examen : serving d'IA générative avec de longues sorties → endpoints de prédiction en streaming ; tabulaire/classification → endpoints standards. Ref: docs.cloud.google.com/vertex-ai/generative-ai/docs/reference/rest/v1/projects.locations.endpoints
Sourcecloud.google.com
Les réponses aux questions complémentaires sont disponibles dans l’app. Crée un compte gratuit, sans carte bancaire.
Question 1 sur 5
Créer un compte gratuit