EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-MLP · Professional

Databricks Machine Learning Professional — Preguntas de práctica y simulacro de examen

Prepara DB-MLP con preguntas de práctica originales y respuestas explicadas con claridad. Pide más detalles a Alex, tu tutor de IA, usa tus resultados para identificar los temas que necesitas repasar y practica cómo distribuir tu tiempo con simulacros de examen cronometrados.

59Preguntas del simulacro
120minTiempo límite

Contrastado con Databricks · agosto de 2026 · Versión actual del examen

Acerca del examen

El examen Databricks Certified Machine Learning Professional valida experiencia avanzada en la construcción de sistemas de ML en producción y a gran escala sobre Databricks. Cubre técnicas avanzadas de desarrollo de modelos, la gestión del ciclo de vida de MLOps (incluidos CI/CD y monitoreo) y estrategias de despliegue de modelos. El desarrollo de modelos y MLOps pesan un 44% del examen cada uno. Tienes que demostrar soltura en el diseño de pipelines de ML productivos y en la gestión del ciclo de vida de los modelos a gran escala.

Esta certificación está pensada para ingenieros de ML senior y científicos de datos con uno o más años construyendo sistemas de ML en producción sobre Databricks. Demuestra que puedes operar sistemas de ML de forma confiable en producción y a gran escala.

Prueba cinco preguntas de DB-MLP

Practica con cinco preguntas del banco actual de Databricks Certified Machine Learning Professional de la app, con sus respuestas y explicaciones.

MLOps1 / 5

Un ingeniero de machine learning necesita implementar una práctica de MLOps en la que cada ejecución de entrenamiento de un modelo quede vinculada al commit exacto de Git del código de entrenamiento, a la versión específica de los datos de entrenamiento y al artefacto de modelo resultante. ¿Qué garantiza esta trazabilidad de extremo a extremo?

AlexExplicación completa de Alex

Cadena de procedencia en MLOps: 1) Código → ejecución: Databricks Repos: integración automática con Git. MLflow: registra la ruta del notebook y el SHA del commit de Git. Reproducibilidad: haz checkout del commit y vuelve a ejecutar el notebook. 2) Datos → ejecución: versión de Delta Lake: snapshot exacto de los datos de entrenamiento. Hash de datos: huella del dataset. Versión del Feature Store: qué versión de la tabla de features se usó. Time travel: spark.read.format('delta').option('versionAsOf', 42).table('training_data'). 3) Ejecución → modelo: la ejecución de MLflow contiene: parámetros, métricas, artefactos. Modelo registrado desde la ejecución: vinculado mediante run_id. Model Registry: versión → ejecución → código + datos. 4) Modelo → despliegue: logs de despliegue: qué versión del modelo está sirviendo. Endpoint: hace referencia al URI del modelo. Tabla de inferencia: registra cada predicción. 5) Cadena completa: predicción → versión del modelo → ejecución de MLflow → (commit de Git + versión de los datos) → código fuente y datos originales. 6) Automatización: autologging: captura automáticamente la mayoría de los vínculos entre código y modelo. Registro de datos: requiere un mlflow.log_param manual para la versión de los datos. Unity Catalog: agrega una capa de gobernanza (permisos, logs de auditoría). 7) Beneficios: reproducibilidad: recrear cualquier modelo. Auditabilidad: cumplir con los requisitos de compliance. Depuración: encontrar qué cambió cuando el modelo se degradó.

Fuentedocs.databricks.com

Despliegue de modelos2 / 5

Un ingeniero de machine learning necesita implementar una solución que sirva distintas versiones del modelo a distintas regiones geográficas. La región de la UE requiere un modelo entrenado con datos conformes al RGPD (sin identificadores personales), mientras que la región de EE. UU. puede usar todas las features. ¿Cómo se configura este serving multirregión?

AlexExplicación completa de Alex

Model serving consciente de la regulación: 1) Requisitos del RGPD: minimización de datos: el modelo destinado a la UE solo puede entrenarse con features que no contengan identificadores personales. Limitación de la finalidad: las features se usan solo para el fin declarado. Derecho al olvido: el modelo no debe memorizar datos individuales. 2) Categorías de features: PII: nombre, email, teléfono, dirección, IP. Cuasi-identificadores: edad + código postal + género (la combinación puede identificar). Agregadas: monto promedio de transacción (últimos 30 días). De comportamiento: cantidad de inicios de sesión (no identifica a personas concretas). 3) Por qué dos versiones registradas: la frontera de compliance son los propios datos de entrenamiento, así que necesitas dos artefactos entrenados distintos —uno con el conjunto de features conforme al RGPD y otro con todas las features— registrados uno al lado del otro en el Model Registry, donde cada versión lleva su propio lineage, su stage y su rastro de auditoría. 4) Enrutamiento de solicitudes: una capa de enrutamiento delante del endpoint de serving inspecciona el header de región de la solicitud y dirige las solicitudes de la UE a la versión conforme y las de EE. UU. a la versión con todas las features. Databricks Model Serving permite servir varios modelos y varias versiones de un modelo al mismo tiempo, y te deja consultar un modelo servido concreto detrás de un endpoint, por lo que enrutar cada solicitud a una versión registrada específica es un patrón soportado. 5) Pruebas: versión conforme: verifica que no haya features de PII en su firma de entrada. Versión con todas las features: verifica que todas las features estén disponibles. Enrutamiento: verifica que un header de región de la UE siempre resuelva a la versión conforme. 6) Documentación de compliance: las model cards de cada versión registrada documentan qué features se usan. El lineage del Model Registry rastrea el origen de los datos de entrenamiento de cada versión. Los logs de acceso registran qué versión sirvió cada solicitud.

Fuentedocs.databricks.com

Desarrollo de modelos3 / 5

Cuando haces tuning de hiperparámetros con Hyperopt en Databricks, ¿cuál es el beneficio principal de usar SparkTrials en lugar de la clase Trials por defecto?

AlexExplicación completa de Alex

Hyperopt es una librería de optimización de hiperparámetros que soporta algoritmos Tree-structured Parzen Estimators (TPE) y búsqueda aleatoria. La clase Trials por defecto ejecuta los trials de forma secuencial en una sola máquina. SparkTrials extiende esto distribuyendo los trials en un clúster de Spark, donde cada worker entrena un modelo con hiperparámetros distintos en paralelo. Esto resulta especialmente efectivo con modelos de ML de un solo nodo (scikit-learn, XGBoost), en los que cada trial cabe en un worker.

Fuentedocs.databricks.com

Gestión del ciclo de vida del modelo4 / 5

Un sistema de monitoreo de modelos detecta que las distribuciones de las features de entrada cambiaron significativamente respecto de la distribución de los datos de entrenamiento. Sin embargo, las métricas de rendimiento del modelo se mantienen estables. ¿Qué debería hacer el ML engineer?

AlexExplicación completa de Alex

El monitoreo de modelos distingue entre data drift (cambios en la distribución de las features de entrada) y concept drift (cambios en la relación entre las features y el target). El data drift puede ocurrir sin impacto inmediato en el rendimiento si el modelo generaliza bien a la región desplazada. Sin embargo, el data drift sostenido suele preceder al concept drift. La mejor práctica es monitorear tanto las métricas de drift como las métricas de rendimiento, configurar alertas con distintos niveles de severidad y tener pipelines de reentrenamiento listos para activarse cuando el rendimiento realmente se degrade.

Fuentedocs.databricks.com

Despliegue de modelos5 / 5

Un ingeniero de machine learning necesita implementar una solución de model serving que devuelva no solo una predicción, sino también un score de confianza y las features que más contribuyen a cada predicción. La respuesta debe incluir las tres piezas de información. ¿Cómo se debe diseñar el endpoint?

AlexExplicación completa de Alex

Respuestas enriquecidas en model serving: 1) Básica: {'prediction': 1}. 2) Con confianza: {'prediction': 1, 'confidence': 0.92}. 3) Con explicación: {'prediction': 1, 'confidence': 0.92, 'top_features': [{'name': 'credit_score', 'impact': 0.15}, {'name': 'debt_ratio', 'impact': -0.08}]}. 4) Con metadatos: agrega model_version, timestamp, request_id. 5) Patrones de implementación: predict de pyfunc → devuelve un DataFrame. Cada columna pasa a formar parte de la respuesta. Estructuras complejas: serialízalas como string JSON en una columna. 6) Compromisos de rendimiento: solo predicción: ~10ms. Predicción + confianza: ~10ms (las probabilidades ya están calculadas). Predicción + SHAP: ~50-200ms (el cálculo de SHAP agrega overhead). Optimización: calcula SHAP solo cuando se solicite (flag opcional en la petición). 7) Integración con el cliente: REST API: respuesta JSON con todos los campos. SDK: parseada en objetos tipados. Dashboard: mostrar la predicción + un medidor de confianza + un gráfico de cascada de features.

Fuentedocs.databricks.com

Las preguntas de la app están actualmente en inglés. Las traducciones de esta vista previa solo se aplican a la vista previa. Consulta con el proveedor de la certificación los idiomas disponibles para el examen oficial.

325 preguntas de práctica

El banco de preguntas de Pass-IT te ofrece material para practicar para DB-MLP. Un simulacro de Pass-IT incluye 59 preguntas y un tiempo límite de 120 minutos; estos son los ajustes de la práctica.

Datos del banco de preguntas: DB-MLP

Datos del examen contrastados con Databricks13 de agosto de 2026

fecha de la última comprobación con la fuente oficial de Databricks

Objetivos de la guía47 objetivos enumerados en la guía oficial

distribuidos entre 3 dominios en la guía oficial del examen

Tamaño del banco325 preguntas

= El tamaño del banco equivale a 5 conjuntos de 59 preguntas. Esto no significa que cada simulacro utilice un conjunto distinto.

Dominios del temario3 dominios en el temario del examen

Model Development 132 · MLOps 118 · Model Deployment 75

Registradas como contrastadas con fuentes325 de 325

preguntas cuya respuesta, opciones y explicación constan como contrastadas con la documentación oficial de Databricks

Contenido del examen

El desarrollo de modelos y MLOps empatan con 44% cada uno, así que entre los dos se llevan la gran mayoría del examen. Desarrollo de modelos cubre entrenamiento distribuido con SparkML, Ray y Optuna, feature engineering con corrección point-in-time y runs anidados de MLflow para experimentos complejos; MLOps cubre CI/CD para ML, Lakehouse Monitoring, detección de drift y reentrenamiento automático disparado por degradación del rendimiento.

El despliegue de modelos es el 12% restante: ahí se evalúan las estrategias de rollout blue-green y canary, y cómo llegar a modelos custom PyFunc mediante un serving endpoint en lugar de solo la UI. El reparto parejo entre desarrollo y operación refleja lo que hace de verdad un ML engineer senior: construir modelos es la mitad del trabajo, mantenerlos sanos en producción es la otra mitad.

Temario del examen: DB-MLP

Model Development44%

Desarrollo avanzado de modelos, entrenamiento distribuido, feature engineering a gran escala, diseño de experimentos, optimización de hiperparámetros con Ray/Optuna y arquitecturas de modelos personalizadas.

≈ 53 h
MLOps44%

MLOps practices, CI/CD for ML, Databricks Asset Bundles for ML, model testing strategies, A/B testing, model monitoring, drift detection, and pipeline automation.

≈ 53 h
Model Deployment12%

Serving de modelos en producción, inferencia batch vs. tiempo real, escalado de serving endpoints y automatización del despliegue.

≈ 14 h

Formato del examen y tipos de preguntas

El examen tiene 59 preguntas puntuadas de opción múltiple en una ventana de 120 minutos, y puede incluir preguntas piloto que no suman puntos. Espera escenarios a fondo: elegir entre Ray o Spark para un job de entrenamiento distribuido, diseñar una alerta de Lakehouse Monitoring para cuando el drift pase cierto umbral, o escoger una estrategia de rollout para un serving endpoint con mucho tráfico.

Tipos de preguntas: DB-MLP

Opción múltiple100%

Selecciona la única respuesta que mejor cumpla los requisitos de la pregunta.

Consulta a Databricks para conocer la información oficial sobre los formatos de preguntas. Las proporciones mostradas describen el banco de práctica de Pass-IT y no determinan las del examen oficial.

Preparación para DB-MLP

El examen se rinde en línea con un proctor remoto o en un centro de pruebas, y solo está disponible en inglés. La credencial vale dos años, y para recertificarte tienes que aprobar la versión vigente del examen.

Preparación y aspectos prácticos: DB-MLP

Preparación

Ejemplo de tiempo de estudio70–180 h

rango orientativo para planificar: de 70 h con experiencia relevante a 180 h si empiezas desde cero; tus necesidades pueden quedar fuera de este rango

NivelProfesional
Conocimientos recomendadosNo hay requisitos previos. Se recomienda tener al menos 1 año de experiencia práctica con ML en Databricks.

Obtención y mantenimiento de la certificación

ModalidadSupervisado en línea o centro de examen
Política de repeticiónSin período de espera obligatorio. Se aplica una tarifa de reintento.
Validez de la certificación2 años

Debes recertificarte cada 2 años presentando la versión vigente del examen.

Errores frecuentes

Temas para repasar: DB-MLP

  1. 01Point-in-Time Correctness

    Si unes features con labels sin respetar la point-in-time correctness, información del futuro se filtra al entrenamiento y terminas fallando las preguntas de feature engineering.

  2. 02Online Feature Tables

    Servir features desde una batch feature table, en vez de configurar una online table para lookups de baja latencia, te lleva a respuestas incorrectas en las preguntas sobre feature serving en tiempo real.

  3. 03Custom Metrics Logging

    Registrar solo las métricas que MLflow trae por defecto, sin parámetros ni artifacts propios dentro de nested runs, hace que falles las preguntas de experiment tracking avanzado.

  4. 04DAB ML Asset Config

    No declarar en conjunto un serving endpoint, un experimento de MLflow y un registered model a través de los Automation Bundles te lleva a respuestas incorrectas en las preguntas sobre entornos escalables.

  5. 05Endpoint Health Metrics

    Vigilar únicamente el drift en la calidad del modelo y dejar de lado las métricas de infraestructura del endpoint, como latencia, tasa de error y uso de memoria, deja incompletas tus respuestas en las preguntas de monitoreo en producción.

Preguntas frecuentes

¿Cuánto dura el examen Databricks Certified Machine Learning Professional?

El examen Databricks Certified Machine Learning Professional tiene 59 preguntas y un tiempo límite de 120 minutos.

¿Qué errores conviene revisar al preparar Databricks Certified Machine Learning Professional?

Entre los temas que conviene repasar están Point-in-Time Correctness, Online Feature Tables, Custom Metrics Logging, DAB ML Asset Config, Endpoint Health Metrics. Trabaja con ejemplos para comprobar que entiendes las diferencias y puedes justificar tu respuesta.

¿Cómo se pondera el examen Machine Learning Professional?

Model development y MLOps valen 44% cada uno, y model deployment un 12%. Es un reparto poco habitual por lo tajante: el examen son básicamente dos mitades. Quien sabe construir modelos pero nunca los ha puesto en producción pierde la mitad del examen.

¿Necesitas primero la Machine Learning Associate?

No, Databricks no exige ninguna certificación previa. La diferencia está en dónde cae el peso: el examen associate dedica un 38% al tooling de la plataforma, mientras que el professional dedica un 44% a MLOps. Si los pipelines, el monitoreo y el reentrenamiento todavía no forman parte de tu semana, el examen associate es el punto de partida más honesto.

¿Qué experiencia da por hecha la Machine Learning Professional?

Un año o más de trabajo práctico con machine learning en Databricks. El catálogo calcula 120 horas además de esa experiencia, no en lugar de ella. Nada bloquea la inscripción, así que el filtro te lo pones tú.

¿Cuánto tiempo vale la Machine Learning Professional?

Dos años desde la fecha de aprobación, y se renueva volviendo a rendir la versión vigente. Databricks no tiene programa de educación continua, así que planifica el nuevo intento en vez de esperar que aparezca una vía de créditos.

Una certificación, 12 meses

Práctica para DB-MLP

Centra tu práctica en una certificación o elige Pro para practicar todas las certificaciones.

Empezar una sesión de práctica gratuitaPrueba las primeras 20 preguntas sin tarjeta para ver si la práctica te resulta útil.

Para compras elegibles: garantía de devolución del dinero si no apruebas tu examen.

Ver condiciones de la garantía →