Servir y escalar modelos1 / 5
Necesitas hacer inferencia en línea con un modelo que genera respuestas de texto. Las respuestas pueden ser muy largas (hasta 2000 tokens). Quieres ofrecer una mejor experiencia de usuario transmitiendo los tokens de la respuesta a medida que se generan. ¿Qué función de serving de Vertex AI admite esto?
CorrectoIncorrecto
Alex
Vertex AI ofrece predicción con streaming mediante los endpoints de API serverStreamingPredict y streamGenerateContent para modelos de IA generativa que producen textos largos. El streaming envía los tokens de forma incremental, a medida que se generan, lo que reduce el tiempo hasta el primer token (TTFT): los usuarios ven cómo la respuesta se va construyendo en tiempo real. El endpoint devuelve un stream de instancias StreamingPredictResponse mediante server-sent events (SSE). Los endpoints de predicción estándar esperan a que la respuesta esté completa antes de devolverla, lo que provoca demoras inaceptables con salidas de más de 2000 tokens. La predicción por lotes procesa cargas de trabajo offline, no interacción en tiempo real. Los contenedores personalizados con WebSocket agregan complejidad innecesaria cuando ya existe streaming nativo. Consejo para el examen: serving de IA generativa con salidas largas → endpoints de predicción con streaming; tabular/clasificación → endpoints estándar. Ref: docs.cloud.google.com/vertex-ai/generative-ai/docs/reference/rest/v1/projects.locations.endpoints
Fuentecloud.google.com
Puedes obtener respuestas a tus dudas en la app. Crea una cuenta gratis, sin tarjeta de crédito.
Pregunta 1 de 5
Crear una cuenta gratis