EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-MLP · Professional

Databricks Machine Learning Professional — Preguntas de práctica y simulacro de examen

Practica con preguntas realistas de DB-MLP, alineadas con los objetivos del examen. Alex explica cada respuesta y tu Readiness Score te muestra qué estudiar después.

59Preguntas
120minLímite de tiempo

Verificado con Databricks · agosto de 2026Versión actual del examen

Sobre el examen

El examen Databricks Certified Machine Learning Professional valida experiencia avanzada en la construcción de sistemas de ML en producción y a gran escala sobre Databricks. Cubre técnicas avanzadas de desarrollo de modelos, la gestión del ciclo de vida de MLOps (incluidos CI/CD y monitoreo) y estrategias de despliegue de modelos. El desarrollo de modelos y MLOps pesan un 44% del examen cada uno. Tienes que demostrar soltura en el diseño de pipelines de ML productivos y en la gestión del ciclo de vida de los modelos a gran escala.

Esta certificación está pensada para ingenieros de ML senior y científicos de datos con uno o más años construyendo sistemas de ML en producción sobre Databricks. Demuestra que puedes operar sistemas de ML de forma confiable en producción y a gran escala.

Qué entra en el examen

El desarrollo de modelos y MLOps empatan con 44% cada uno, así que entre los dos se llevan la gran mayoría del examen. Desarrollo de modelos cubre entrenamiento distribuido con SparkML, Ray y Optuna, feature engineering con corrección point-in-time y runs anidados de MLflow para experimentos complejos; MLOps cubre CI/CD para ML, Lakehouse Monitoring, detección de drift y reentrenamiento automático disparado por degradación del rendimiento.

El despliegue de modelos es el 12% restante: ahí se evalúan las estrategias de rollout blue-green y canary, y cómo llegar a modelos custom PyFunc mediante un serving endpoint en lugar de solo la UI. El reparto parejo entre desarrollo y operación refleja lo que hace de verdad un ML engineer senior: construir modelos es la mitad del trabajo, mantenerlos sanos en producción es la otra mitad.

Temario oficial: DB-MLP

Model Development44%

Desarrollo avanzado de modelos, entrenamiento distribuido, feature engineering a gran escala, diseño de experimentos, optimización de hiperparámetros con Ray/Optuna y arquitecturas de modelos personalizadas.

≈ 53 h
MLOps44%

MLOps practices, CI/CD for ML, Databricks Asset Bundles for ML, model testing strategies, A/B testing, model monitoring, drift detection, and pipeline automation.

≈ 53 h
Model Deployment12%

Serving de modelos en producción, inferencia batch vs. tiempo real, escalado de serving endpoints y automatización del despliegue.

≈ 14 h

Formato del examen y tipos de pregunta

El examen tiene 59 preguntas puntuadas de opción múltiple en una ventana de 120 minutos, y puede incluir preguntas piloto que no suman puntos. Espera escenarios a fondo: elegir entre Ray o Spark para un job de entrenamiento distribuido, diseñar una alerta de Lakehouse Monitoring para cuando el drift pase cierto umbral, o escoger una estrategia de rollout para un serving endpoint con mucho tráfico.

Tipos de pregunta: DB-MLP

Opción múltiple100%

Elige la única respuesta correcta entre cuatro o cinco opciones — el formato de siempre del examen.

Databricks confirma estos tipos de pregunta — no publica una distribución porcentual; las proporciones reflejan nuestro banco de preguntas alineado con el examen.

Prueba cinco preguntas de DB-MLP

Cinco preguntas directas de nuestro banco de Databricks Certified Machine Learning Professional. Responde una — Alex te explica el porqué.

El examen y la app están en inglés — estas preguntas de muestra las hemos traducido.

MLOps1 / 5

Un ingeniero de machine learning necesita implementar una práctica de MLOps en la que cada ejecución de entrenamiento de un modelo quede vinculada al commit exacto de Git del código de entrenamiento, a la versión específica de los datos de entrenamiento y al artefacto de modelo resultante. ¿Qué garantiza esta trazabilidad de extremo a extremo?

AlexExplicación completa de Alex

Cadena de procedencia en MLOps: 1) Código → ejecución: Databricks Repos: integración automática con Git. MLflow: registra la ruta del notebook y el SHA del commit de Git. Reproducibilidad: haz checkout del commit y vuelve a ejecutar el notebook. 2) Datos → ejecución: versión de Delta Lake: snapshot exacto de los datos de entrenamiento. Hash de datos: huella del dataset. Versión del Feature Store: qué versión de la tabla de features se usó. Time travel: spark.read.format('delta').option('versionAsOf', 42).table('training_data'). 3) Ejecución → modelo: la ejecución de MLflow contiene: parámetros, métricas, artefactos. Modelo registrado desde la ejecución: vinculado mediante run_id. Model Registry: versión → ejecución → código + datos. 4) Modelo → despliegue: logs de despliegue: qué versión del modelo está sirviendo. Endpoint: hace referencia al URI del modelo. Tabla de inferencia: registra cada predicción. 5) Cadena completa: predicción → versión del modelo → ejecución de MLflow → (commit de Git + versión de los datos) → código fuente y datos originales. 6) Automatización: autologging: captura automáticamente la mayoría de los vínculos entre código y modelo. Registro de datos: requiere un mlflow.log_param manual para la versión de los datos. Unity Catalog: agrega una capa de gobernanza (permisos, logs de auditoría). 7) Beneficios: reproducibilidad: recrear cualquier modelo. Auditabilidad: cumplir con los requisitos de compliance. Depuración: encontrar qué cambió cuando el modelo se degradó.

Fuentedocs.databricks.com

Despliegue de modelos2 / 5

Un ingeniero de machine learning necesita implementar una solución que sirva distintas versiones del modelo a distintas regiones geográficas. La región de la UE requiere un modelo entrenado con datos conformes al RGPD (sin identificadores personales), mientras que la región de EE. UU. puede usar todas las features. ¿Cómo se configura este serving multirregión?

AlexExplicación completa de Alex

Model serving consciente de la regulación: 1) Requisitos del RGPD: minimización de datos: el modelo destinado a la UE solo puede entrenarse con features que no contengan identificadores personales. Limitación de la finalidad: las features se usan solo para el fin declarado. Derecho al olvido: el modelo no debe memorizar datos individuales. 2) Categorías de features: PII: nombre, email, teléfono, dirección, IP. Cuasi-identificadores: edad + código postal + género (la combinación puede identificar). Agregadas: monto promedio de transacción (últimos 30 días). De comportamiento: cantidad de inicios de sesión (no identifica a personas concretas). 3) Por qué dos versiones registradas: la frontera de compliance son los propios datos de entrenamiento, así que necesitas dos artefactos entrenados distintos —uno con el conjunto de features conforme al RGPD y otro con todas las features— registrados uno al lado del otro en el Model Registry, donde cada versión lleva su propio lineage, su stage y su rastro de auditoría. 4) Enrutamiento de solicitudes: una capa de enrutamiento delante del endpoint de serving inspecciona el header de región de la solicitud y dirige las solicitudes de la UE a la versión conforme y las de EE. UU. a la versión con todas las features. Databricks Model Serving permite servir varios modelos y varias versiones de un modelo al mismo tiempo, y te deja consultar un modelo servido concreto detrás de un endpoint, por lo que enrutar cada solicitud a una versión registrada específica es un patrón soportado. 5) Pruebas: versión conforme: verifica que no haya features de PII en su firma de entrada. Versión con todas las features: verifica que todas las features estén disponibles. Enrutamiento: verifica que un header de región de la UE siempre resuelva a la versión conforme. 6) Documentación de compliance: las model cards de cada versión registrada documentan qué features se usan. El lineage del Model Registry rastrea el origen de los datos de entrenamiento de cada versión. Los logs de acceso registran qué versión sirvió cada solicitud.

Fuentedocs.databricks.com

Desarrollo de modelos3 / 5

Cuando haces tuning de hiperparámetros con Hyperopt en Databricks, ¿cuál es el beneficio principal de usar SparkTrials en lugar de la clase Trials por defecto?

AlexExplicación completa de Alex

Hyperopt es una librería de optimización de hiperparámetros que soporta algoritmos Tree-structured Parzen Estimators (TPE) y búsqueda aleatoria. La clase Trials por defecto ejecuta los trials de forma secuencial en una sola máquina. SparkTrials extiende esto distribuyendo los trials en un clúster de Spark, donde cada worker entrena un modelo con hiperparámetros distintos en paralelo. Esto resulta especialmente efectivo con modelos de ML de un solo nodo (scikit-learn, XGBoost), en los que cada trial cabe en un worker.

Fuentedocs.databricks.com

Gestión del ciclo de vida del modelo4 / 5

Un sistema de monitoreo de modelos detecta que las distribuciones de las features de entrada cambiaron significativamente respecto de la distribución de los datos de entrenamiento. Sin embargo, las métricas de rendimiento del modelo se mantienen estables. ¿Qué debería hacer el ML engineer?

AlexExplicación completa de Alex

El monitoreo de modelos distingue entre data drift (cambios en la distribución de las features de entrada) y concept drift (cambios en la relación entre las features y el target). El data drift puede ocurrir sin impacto inmediato en el rendimiento si el modelo generaliza bien a la región desplazada. Sin embargo, el data drift sostenido suele preceder al concept drift. La mejor práctica es monitorear tanto las métricas de drift como las métricas de rendimiento, configurar alertas con distintos niveles de severidad y tener pipelines de reentrenamiento listos para activarse cuando el rendimiento realmente se degrade.

Fuentedocs.databricks.com

Despliegue de modelos5 / 5

Un ingeniero de machine learning necesita implementar una solución de model serving que devuelva no solo una predicción, sino también un score de confianza y las features que más contribuyen a cada predicción. La respuesta debe incluir las tres piezas de información. ¿Cómo se debe diseñar el endpoint?

AlexExplicación completa de Alex

Respuestas enriquecidas en model serving: 1) Básica: {'prediction': 1}. 2) Con confianza: {'prediction': 1, 'confidence': 0.92}. 3) Con explicación: {'prediction': 1, 'confidence': 0.92, 'top_features': [{'name': 'credit_score', 'impact': 0.15}, {'name': 'debt_ratio', 'impact': -0.08}]}. 4) Con metadatos: agrega model_version, timestamp, request_id. 5) Patrones de implementación: predict de pyfunc → devuelve un DataFrame. Cada columna pasa a formar parte de la respuesta. Estructuras complejas: serialízalas como string JSON en una columna. 6) Compromisos de rendimiento: solo predicción: ~10ms. Predicción + confianza: ~10ms (las probabilidades ya están calculadas). Predicción + SHAP: ~50-200ms (el cálculo de SHAP agrega overhead). Optimización: calcula SHAP solo cuando se solicite (flag opcional en la petición). 7) Integración con el cliente: REST API: respuesta JSON con todos los campos. SDK: parseada en objetos tipados. Dashboard: mostrar la predicción + un medidor de confianza + un gráfico de cascada de features.

Fuentedocs.databricks.com

325 preguntas, construidas como el examen

Cada dominio del examen DB-MLP tiene suficientes preguntas en el banco para practicarlo a fondo. El simulacro te plantea 59 preguntas seguidas, con el mismo cronómetro de 120 minutos que el día del examen.

Acta de verificación: DB-MLP

Cotejo del temario con Databricks13 de agosto de 2026

última verificación con la fuente oficial de Databricks

Cobertura del temario47 objetivos oficiales

repartidos en 3 dominios, según la guía oficial del examen

Tamaño del banco325 preguntas

= 5 simulacros completos de 59 preguntas — nunca la misma pregunta dos veces

Cobertura de dominioslos 3 dominios en su peso oficial

Model Development 132 · MLOps 118 · Model Deployment 75

Validación canónica325 de 325

cada una verificada con la documentación oficial de Databricks — respuesta, opciones y explicación, fuente citada

Metodología documentada abiertamente.Cómo se crean las preguntas →

Preparación para DB-MLP

Cuánto tiempo necesitas depende de la experiencia práctica que ya tienes. El resto lo define el proveedor: cómo se hace el examen, cuándo puedes repetirlo y cuánto dura la certificación.

El examen se rinde en línea con un proctor remoto o en un centro de pruebas, y solo está disponible en inglés. La credencial vale dos años, y para recertificarte tienes que aprobar la versión vigente del examen.

Tu plan: DB-MLP

Preparación

Tiempo de estudio70–180 h

normalmente unas 70 h si ya trabajas con estas tecnologías, unas 180 h si empiezas de cero

NivelProfessional
Conviene tener antesNo hay requisitos previos. Se recomienda tener al menos 1 año de experiencia práctica con ML en Databricks.

El día del examen y después

ModalidadSupervisado en línea o centro de examen
Política de repeticiónSin período de espera obligatorio. Se aplica una tarifa de reintento.
Vigencia2 años

Debes recertificarte cada 2 años presentando la versión vigente del examen.

Las horas son nuestra propia estimación de planificación — Databricks no publica un tiempo de preparación para este examen. Un punto de partida para tu calendario, no una meta.

Errores comunes

MLOps en este nivel mide criterio de producción más que proceso de manual: reconocer qué tipo de tabla de Lakehouse Monitoring encaja en cada escenario, diseñar un test de integración que cubra de punta a punta el pipeline que va del feature engineering a la inferencia, y saber qué prueba estadística de la tabla de métricas de drift aplica al drift categórico y cuál al numérico. Las preguntas de desarrollo de modelos van bastante más allá del uso básico de SparkML: entran en tuning distribuido de hiperparámetros con Ray y Optuna, y en los trade-offs entre paralelismo de modelo y paralelismo de datos para entrenamiento a gran escala. El despliegue de modelos es apenas el 12% del examen, pero las decisiones entre blue-green y canary, junto con el escalado de endpoints bajo tráfico real, se evalúan con detalle específico y muy pegado a escenarios.

Puntos de atención: DB-MLP

  1. 01Point-in-Time Correctness

    Si unes features con labels sin respetar la point-in-time correctness, información del futuro se filtra al entrenamiento y terminas fallando las preguntas de feature engineering.

  2. 02Online Feature Tables

    Servir features desde una batch feature table, en vez de configurar una online table para lookups de baja latencia, te lleva a respuestas incorrectas en las preguntas sobre feature serving en tiempo real.

  3. 03Custom Metrics Logging

    Registrar solo las métricas que MLflow trae por defecto, sin parámetros ni artifacts propios dentro de nested runs, hace que falles las preguntas de experiment tracking avanzado.

  4. 04DAB ML Asset Config

    No declarar en conjunto un serving endpoint, un experimento de MLflow y un registered model a través de los Automation Bundles te lleva a respuestas incorrectas en las preguntas sobre entornos escalables.

  5. 05Endpoint Health Metrics

    Vigilar únicamente el drift en la calidad del modelo y dejar de lado las métricas de infraestructura del endpoint, como latencia, tasa de error y uso de memoria, deja incompletas tus respuestas en las preguntas de monitoreo en producción.

Pass-IT te entrena justo en estos puntos débiles — adaptativo y espaciado →

Preguntas frecuentes

¿Cuánto dura el examen Databricks Certified Machine Learning Professional?

El examen Databricks Certified Machine Learning Professional tiene 59 preguntas y un límite de 120 minutos.

¿Cuáles son los errores más comunes en el examen Databricks Certified Machine Learning Professional?

Los errores más comunes incluyen: Point-in-Time Correctness, Online Feature Tables, Custom Metrics Logging, DAB ML Asset Config, Endpoint Health Metrics. Dedica tiempo de estudio a estas áreas para no perder puntos.

¿Cómo se pondera el examen Machine Learning Professional?

Model development y MLOps valen 44% cada uno, y model deployment un 12%. Es un reparto poco habitual por lo tajante: el examen son básicamente dos mitades. Quien sabe construir modelos pero nunca los ha puesto en producción pierde la mitad del examen.

¿Necesitas primero la Machine Learning Associate?

No, Databricks no exige ninguna certificación previa. La diferencia está en dónde cae el peso: el examen associate dedica un 38% al tooling de la plataforma, mientras que el professional dedica un 44% a MLOps. Si los pipelines, el monitoreo y el reentrenamiento todavía no forman parte de tu semana, el examen associate es el punto de partida más honesto.

¿Qué experiencia da por hecha la Machine Learning Professional?

Un año o más de trabajo práctico con machine learning en Databricks. El catálogo calcula 120 horas además de esa experiencia, no en lugar de ella. Nada bloquea la inscripción, así que el filtro te lo pones tú.

¿Cuánto tiempo vale la Machine Learning Professional?

Dos años desde la fecha de aprobación, y se renueva volviendo a rendir la versión vigente. Databricks no tiene programa de educación continua, así que planifica el nuevo intento en vez de esperar que aparezca una vía de créditos.

Pass-IT es una herramienta de estudio independiente, no afiliada a Databricks ni respaldada por Databricks; Databricks y los nombres de los exámenes son marcas de sus respectivos propietarios.

Una certificación. Un solo pago.

Acceso completo a DB-MLP

Accede al banco completo de preguntas de esta certificación. Alex explica cada respuesta y tu Readiness Score te muestra qué estudiar después.

Comprar acceso a DB-MLP por $29.99Un solo pago. Acceso de por vida a esta certificación.
Comprueba gratis si estás listo20 preguntas. Sin tarjeta. Mira qué estudiar antes de comprar.

Llega al 80 % de preparación y aprueba — o te devolvemos el dinero.

Cómo funciona el score →