Servir e escalar modelos1 / 5
Você precisa fazer inferência online com um modelo que gera respostas em texto. As respostas podem ser bem longas (até 2000 tokens). Você quer oferecer uma experiência melhor transmitindo os tokens da resposta conforme eles são gerados. Qual recurso de serving do Vertex AI oferece suporte a isso?
CorretoIncorreto
Alex
O Vertex AI oferece previsão em streaming pelos endpoints de API serverStreamingPredict e streamGenerateContent, para modelos de IA generativa que produzem textos longos. O streaming envia os tokens de forma incremental, conforme são gerados, reduzindo o tempo até o primeiro token (TTFT) — os usuários veem a resposta se formando em tempo real. O endpoint devolve um stream de instâncias StreamingPredictResponse por meio de server-sent events (SSE). Endpoints de previsão padrão esperam a resposta completa antes de devolvê-la, o que causa atrasos inaceitáveis em saídas com mais de 2000 tokens. A previsão em lote processa cargas de trabalho offline, não interação em tempo real. Containers WebSocket personalizados acrescentam complexidade desnecessária quando existe streaming nativo. Dica de prova: serving de IA generativa com saídas longas → endpoints de previsão em streaming; tabular/classificação → endpoints padrão. Ref: docs.cloud.google.com/vertex-ai/generative-ai/docs/reference/rest/v1/projects.locations.endpoints
Fontecloud.google.com
Você pode obter respostas às suas dúvidas no app. Crie uma conta grátis, sem cartão de crédito.
Questão 1 de 5
Criar uma conta grátis