EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEP · Professional

Databricks Data Engineer Professional — Preguntas de práctica y simulacro de examen

Practica con preguntas realistas de DB-DEP, alineadas con los objetivos del examen. Alex explica cada respuesta y tu Readiness Score te muestra qué estudiar después.

59Preguntas
120minLímite de tiempo

Verificado con Databricks · agosto de 2026Versión actual del examen

Sobre el examen

El examen Databricks Certified Data Engineer Professional valida tu experiencia avanzada en la construcción y optimización de sistemas de datos en producción sobre la Databricks Data Intelligence Platform. Abarca la escritura de código de procesamiento de datos en Python y SQL, la ingesta y transformación de datos, la optimización de costos y rendimiento, la seguridad y el gobierno de datos, además de la depuración y el despliegue de pipelines. Necesitas demostrar dominio de los aspectos internos de Delta Lake, del gobierno con Unity Catalog y del tuning de rendimiento en Spark.

Esta certificación está pensada para data engineers con experiencia, con uno o más años construyendo pipelines de datos en producción sobre la Databricks Lakehouse Platform. Acredita tu capacidad para diseñar, asegurar y operar sistemas de datos complejos a gran escala.

Qué entra en el examen

El desarrollo de código para procesamiento de datos es el dominio más grande con 22%: abarca la estructura de proyectos en Python para los automation bundles, el desarrollo de UDF personalizadas y la construcción de pipelines ETL listos para producción con Structured Streaming y el framework declarativo de pipelines de Lakeflow. Le sigue la optimización de costos y rendimiento con 13%, que evalúa Liquid Clustering, deletion vectors y ajustes guiados por el query profile, no la construcción básica de pipelines.

Ingesta, transformación, compartición, monitoreo, seguridad, gobernanza, depuración y modelado completan el examen con 5–10% cada uno y miden habilidades operativas más acotadas: configuración de Delta Sharing, enmascaramiento de PII, depuración a partir de los event logs y modelado dimensional con Liquid Clustering en lugar de particionamiento manual.

Temario oficial: DB-DEP

Developing Code for Data Processing using Python and SQL22%

Structure Python projects for automation bundles and write the UDFs they call, build production ETL with Lakeflow pipelines, Autoloader, and Structured Streaming, handle change-data-capture and control-flow logic within them, and cover the result with unit and integration tests.

≈ 26 h
Data Ingestion and Acquisition7%

Patrones avanzados de ingesta, evolución de esquemas, adquisición de datos desde fuentes diversas y manejo de formatos de datos complejos.

≈ 8 h
Data Transformation, Cleansing, and Quality10%

Marcos avanzados de calidad de datos, expectativas, estrategias de limpieza y patrones de transformación complejos.

≈ 12 h
Data Sharing and Federation5%

Delta Sharing, acceso a datos entre workspaces, patrones de federación de datos e integración de datos externos.

≈ 6 h
Monitoring and Alerting10%

Monitoreo de pipelines, estrategias de alertas, logging, observabilidad y solución de problemas en workflows de datos en producción.

≈ 12 h
Cost and Performance Optimization13%

Ajuste de rendimiento de Spark, dimensionamiento de clústeres, Liquid Clustering, Z-ordering, estrategias de caché y gestión de costos.

≈ 16 h
Ensuring Data Security and Compliance10%

Cifrado de datos, controles de acceso, registro de auditoría, marcos de cumplimiento y mejores prácticas de seguridad en Databricks.

≈ 12 h
Data Governance7%

Funciones avanzadas de Unity Catalog, linaje de datos, etiquetado, clasificación y políticas de gobernanza.

≈ 8 h
Debugging and Deploying10%

CI/CD para pipelines de datos, Databricks Asset Bundles, estrategias de pruebas, técnicas de depuración y automatización de despliegues.

≈ 12 h
Data Modeling6%

Design large-scale data models on Delta Lake, replace manual partitioning and Z-ordering decisions with Liquid Clustering, and structure dimensional models built for fast, accurate analytical queries.

≈ 7 h

Formato del examen y tipos de pregunta

El examen toma 59 preguntas puntuadas de opción múltiple en una sesión de 120 minutos, y puede incluir preguntas piloto que no cuentan para tu resultado. Casi todo viene planteado como escenarios de ajuste de rendimiento, implementación de seguridad y depuración de pipelines: se espera que te muevas con soltura entre los detalles internos de Delta Lake y la gobernanza con Unity Catalog, no que recuerdes APIs de memoria.

Tipos de pregunta: DB-DEP

Opción múltiple100%

Elige la única respuesta correcta entre cuatro o cinco opciones — el formato de siempre del examen.

Databricks confirma estos tipos de pregunta — no publica una distribución porcentual; las proporciones reflejan nuestro banco de preguntas alineado con el examen.

Prueba cinco preguntas de DB-DEP

Cinco preguntas directas de nuestro banco de Databricks Certified Data Engineer Professional. Responde una — Alex te explica el porqué.

El examen y la app están en inglés — estas preguntas de muestra las hemos traducido.

Garantizar la seguridad y el cumplimiento de los datos1 / 5

Un data engineer descubre que los audit logs de Unity Catalog muestran intentos de acceso no autorizado a una tabla de producción sensible. ¿Qué pasos debes seguir para investigar y remediar la situación?

AlexExplicación completa de Alex

Flujo de investigación de seguridad: 1) Detectar: alertar sobre intentos de acceso fallidos a tablas sensibles. 2) Investigar: consultar los audit logs para conocer la identidad del usuario, los patrones de acceso y los horarios. 3) Evaluar: ¿el intento de acceso del usuario fue legítimo (por ejemplo, nombre de tabla equivocado) o sospechoso (intentos repetidos sobre tablas con PII)? 4) Remediar: revocar permisos excesivos (principio de menor privilegio), agregar alertas de monitoreo, implementar filtros de fila si los datos deben ser parcialmente accesibles. 5) Prevenir: etiquetar las tablas sensibles con tags de clasificación, crear políticas de acceso a datos vinculadas a esos tags. 6) Reportar: documentar el incidente, las acciones tomadas y los cambios de políticas. De forma continua: programar revisiones semanales de los audit logs para detectar patrones de acceso anómalos.

Fuentedocs.databricks.com

Transformación, limpieza y calidad de datos2 / 5

Un data engineer tiene una tabla Delta en la que algunas columnas contienen structs y arrays profundamente anidados. Los analistas se quejan de que los datos son difíciles de consultar. ¿Qué estrategia de aplanamiento los vuelve accesibles y a la vez preserva las relaciones entre los datos?

AlexExplicación completa de Alex

Patrones para aplanar datos anidados: 1) Struct: df.select('order_id', 'customer.name', 'customer.email'). SQL: SELECT customer.name FROM orders. 2) Array: df.select('order_id', explode('items').alias('item')). SQL: SELECT EXPLODE(items) FROM orders. 3) Array anidado de structs: df.select('order_id', explode('items').alias('item')).select('order_id', 'item.product', 'item.qty'). 4) Map: df.select('order_id', explode('metadata').alias('key', 'value')). 5) Expansión con estrella: df.select('order_id', 'customer.*'). Expande el struct en columnas individuales. 6) Aplanamiento recursivo: para estructuras muy anidadas, escribe una función recursiva que recorra el esquema y genere las expresiones select. 7) Consideraciones: explosión de cardinalidad — EXPLODE sobre arrays multiplica la cantidad de filas. Usa array_size() para estimar la expansión. Para arrays de alta cardinalidad (100+ elementos), considera agregar antes de aplanar.

Fuentedocs.databricks.com

Gobernanza de datos3 / 5

Un data engineer necesita implementar una solución que permita a distintas unidades de negocio administrar sus propios catálogos de datos de forma independiente, compartiendo al mismo tiempo un marco de gobernanza común. ¿Cómo apoya esto el namespace de tres niveles de Unity Catalog?

AlexExplicación completa de Alex

Namespace de Unity Catalog: 1) Tres niveles: catalog.schema.table. Catalog: límite organizacional de nivel superior. Schema: agrupación lógica dentro de un catálogo. Table/View/Function: objetos de datos. 2) Estrategias de catálogo: por unidad de negocio: finance_catalog, marketing_catalog. Por entorno: dev_catalog, staging_catalog, prod_catalog. Por dominio: customers_catalog, orders_catalog. Híbrida: prod_finance, prod_marketing, dev_shared. 3) Delegación de propiedad: el dueño del catálogo administra su catálogo. Puede crear esquemas y otorgar permisos. No puede modificar otros catálogos. 4) Consistencia de gobernanza: el admin del metastore define: permisos por defecto. Retención de los audit logs. Requisitos de clasificación de datos. Esto aplica a todos los catálogos. 5) Migración: desde el Hive metastore: default (un solo catálogo) → migrar a múltiples catálogos. SHOW DATABASES → pasa a ser esquemas dentro de un catálogo. 6) Límites: un metastore por región. Múltiples catálogos por metastore. Cientos de esquemas por catálogo. Millones de tablas por esquema.

Fuentedocs.databricks.com

Desarrollo de código para el procesamiento de datos con Python y SQL4 / 5

Un data engineer está construyendo un job batch de PySpark que debe aplicar un cálculo de scoring complejo a nivel de fila, escrito en Python puro, sobre un DataFrame con 200 millones de filas. La lógica no se puede expresar con funciones integradas de Spark SQL. Busca el menor overhead de serialización y el mejor rendimiento disponible en la DataFrame API. ¿Qué enfoque debería elegir?

AlexExplicación completa de Alex

Las UDFs estándar de Python en Spark serializan los datos fila por fila a través de la frontera entre la JVM y Python, lo que resulta costoso a gran escala. Las UDFs de Pandas (también llamadas UDFs vectorizadas) usan en cambio Apache Arrow para mover batches columnares y ejecutar código de pandas sobre Series o DataFrames, amortizando la serialización entre muchas filas. Mantienen el trabajo distribuido entre los executors, a diferencia de collect(), y conservan la planificación de Catalyst, a diferencia de la API de RDD. Para lógica de Python personalizada que no se puede expresar con funciones nativas de Spark, una UDF de Pandas es la opción recomendada de alto rendimiento. Las funciones nativas de Spark SQL siguen siendo preferibles cuando la lógica se puede expresar con ellas. Consejo de examen: cuando una pregunta combina 'lógica de Python personalizada' con 'mejor rendimiento' sobre datos grandes, elige la UDF de Pandas/vectorizada por encima de una UDF de Python simple.

Fuentedocs.databricks.com

Compartición y federación de datos5 / 5

A un data engineer le encargan construir un pipeline de reverse ETL que envíe datos agregados desde el lakehouse Delta de vuelta a un sistema CRM operativo a través de su API. ¿Qué arquitectura permite un reverse ETL confiable?

AlexExplicación completa de Alex

Componentes de reverse ETL: 1) Consulta de origen: SELECT customer_id, total_orders, avg_order_value, churn_score FROM gold.customer_360 WHERE updated_at > last_sync_time. 2) Seguimiento de la sincronización: CREATE TABLE sync_status (record_id STRING, target STRING, last_synced TIMESTAMP, status STRING, error_message STRING). 3) Integración con la API: for batch in batches: try: response = crm_api.upsert(batch). update_status(batch, 'synced'). except RateLimitError: sleep(backoff). retry. except APIError as e: update_status(batch, 'failed', str(e)). 4) Idempotencia: usar llamadas de upsert a la API (crear o actualizar). Volver a ejecutar sincroniza los mismos registros sin duplicados. 5) Monitoreo: alertar cuando la tasa de fallos de sincronización supere el umbral. Dashboard: registros sincronizados por corrida, tasas de error, latencia. 6) Calendario: hacerlo coincidir con la cadencia de refresco de la tabla gold. Si gold se refresca a diario a las 6 AM, sincroniza al CRM a las 7 AM.

Fuentedocs.databricks.com

319 preguntas, construidas como el examen

El banco de DB-DEP cubre todos los dominios del examen y sigue creciendo con preguntas nuevas. El simulacro te plantea 59 preguntas seguidas, con el mismo cronómetro de 120 minutos que el día del examen.

Acta de verificación: DB-DEP

Cotejo del temario con Databricks4 de agosto de 2026

última verificación con la fuente oficial de Databricks

Cobertura del temario27 objetivos oficiales

repartidos en 10 dominios, según la guía oficial del examen

Tamaño del banco319 preguntas

= 5 simulacros completos de 59 preguntas — nunca la misma pregunta dos veces

Validación canónica319 de 319

cada una verificada con la documentación oficial de Databricks — respuesta, opciones y explicación, fuente citada

Metodología documentada abiertamente.Cómo se crean las preguntas →

Preparación para DB-DEP

Cuánto tiempo necesitas depende de la experiencia práctica que ya tienes. El resto lo define el proveedor: cómo se hace el examen, cuándo puedes repetirlo y cuánto dura la certificación.

El examen se rinde en línea con supervisión remota o en un centro de evaluación, y está disponible en inglés, japonés, portugués (BR) y coreano. La credencial tiene una vigencia de dos años, y recertificarte significa aprobar la versión vigente del examen.

Tu plan: DB-DEP

Preparación

Tiempo de estudio70–180 h

normalmente unas 70 h si ya trabajas con estas tecnologías, unas 180 h si empiezas de cero

NivelProfessional
Conviene tener antesNo hay requisitos previos. Se recomienda tener al menos 1 año de experiencia práctica con Databricks. La certificación Data Engineer Associate ayuda, pero no es obligatoria.

El día del examen y después

ModalidadSupervisado en línea o centro de examen
Política de repeticiónSin período de espera obligatorio. Se aplica una tarifa de reintento.
Vigencia2 años

Debes recertificarte cada 2 años presentando la versión vigente del examen.

Las horas son nuestra propia estimación de planificación — Databricks no publica un tiempo de preparación para este examen. Un punto de partida para tu calendario, no una meta.

Errores comunes

Este nivel evalúa el funcionamiento interno de Spark más que tu familiaridad con las APIs: distinguir Liquid Clustering de Z-ordering por sus trade-offs, rastrear un job fallido en los logs del cluster y en los query profiles en vez de adivinar por los síntomas, y saber cuándo Change Data Feed resuelve una limitación de las streaming tables que Delta Sharing no cubre. Compartir y federar datos es un dominio pequeño, apenas 5%, pero la diferencia entre el sharing de Databricks a Databricks y el protocolo de open sharing aparece con un nivel de detalle muy específico y evaluable. Depuración y despliegue pesa 10% y premia a quien ya rompió un pipeline y lo reparó con automation bundles, no a quien solo leyó sobre el proceso.

Puntos de atención: DB-DEP

  1. 01Quarantine Pipeline Design

    No armar una ruta de cuarentena dedicada para los registros que no pasan la validación, y en cambio descartarlos o dejarlos pasar en silencio, te lleva a responder mal las preguntas sobre pipelines de calidad de datos.

  2. 02Lakehouse Federation

    Confundir Lakehouse Federation, que consulta sistemas externos en vivo, con Delta Sharing, que copia o transmite los datos hacia afuera, hace que falles en las preguntas de integración de fuentes de datos.

  3. 03PII Anonymization vs Masking

    Mezclar el masking de columnas, el filtrado de filas y la verdadera anonimización o seudonimización de PII, y olvidarte del lado de la purga de datos en el cumplimiento de retención, te deja con respuestas equivocadas en las preguntas de seguridad y cumplimiento.

  4. 04Permission Inheritance

    Dar por hecho que un grant de Unity Catalog a nivel de catalog siempre gana sobre uno más acotado a nivel de schema o table, en lugar de entender cómo funciona de verdad el modelo de herencia, termina en respuestas equivocadas sobre governance.

  5. 05DAB Project Structure

    No estructurar un proyecto de Python para desarrollo modular e integración con CI/CD dentro de los Automation Bundles te complica las preguntas de despliegue, porque esperan una organización de código específica y testeable.

Pass-IT te entrena justo en estos puntos débiles — adaptativo y espaciado →

Preguntas frecuentes

¿Cuánto dura el examen Databricks Certified Data Engineer Professional?

El examen Databricks Certified Data Engineer Professional tiene 59 preguntas y un límite de 120 minutos.

¿Cuáles son los errores más comunes en el examen Databricks Certified Data Engineer Professional?

Los errores más comunes incluyen: Quarantine Pipeline Design, Lakehouse Federation, PII Anonymization vs Masking, Permission Inheritance, DAB Project Structure. Dedica tiempo de estudio a estas áreas para no perder puntos.

¿Cómo apruebas el examen Databricks Data Engineer Professional?

Escribir código de procesamiento de datos en Python y SQL es el área más grande con un 22%, y las preguntas te muestran código en lugar de describirlo. El presupuesto del catálogo es de 120 horas y Databricks recomienda un año o más de trabajo práctico con la plataforma. Los que la pasan mal suelen ser los que se prepararon leyendo documentación en vez de armar y romper pipelines.

¿Cuánto tiempo vale la certificación Data Engineer Professional?

Dos años desde la fecha de aprobación. Databricks recertifica con examen, así que vuelves a rendir la versión vigente en lugar de acumular créditos de formación continua. No hay período de gracia previsto, así que el nuevo intento tiene que ocurrir antes de la fecha de vencimiento.

¿Cómo se pondera el examen Data Engineer Professional?

El código de procesamiento de datos encabeza con un 22%, seguido de la optimización de costos y rendimiento con un 13%. Transformación y calidad, monitoreo y alertas, seguridad y cumplimiento, y depuración y despliegue se llevan un 10% cada una, y el resto queda para ingesta, gobernanza, modelado y federación. Está repartido en diez objetivos, así que el examen toma muestras de todo el trabajo y no de una sola parte.

¿Conviene dar primero el Data Engineer Associate?

Databricks describe la certificación associate como útil pero no obligatoria, así que puedes reservar el examen professional directamente. La distancia entre ambos es real: 80 horas contra 120, y preguntas de reconocimiento contra preguntas de lectura de código. Si llevas menos de un año en la plataforma, el examen associate es la forma más barata de saber dónde estás parado.

¿Qué experiencia asume el Data Engineer Professional?

Un año o más de trabajo práctico con Databricks, según la recomendación del propio Databricks. Ninguna certificación bloquea la inscripción. El presupuesto de 120 horas del catálogo da por hecho que esa experiencia ya está, así que tómalo como un piso y no como un total.

¿Qué tan pronto puedes repetir el examen Data Engineer Professional?

De inmediato, en lo que respecta a la política de Databricks: no hay un período de espera obligatorio. El límite es tu propia preparación, no una regla de enfriamiento.

Pass-IT es una herramienta de estudio independiente, no afiliada a Databricks ni respaldada por Databricks; Databricks y los nombres de los exámenes son marcas de sus respectivos propietarios.

Una certificación. Un solo pago.

Acceso completo a DB-DEP

Accede al banco completo de preguntas de esta certificación. Alex explica cada respuesta y tu Readiness Score te muestra qué estudiar después.

Comprar acceso a DB-DEP por $29.99Un solo pago. Acceso de por vida a esta certificación.
Comprueba gratis si estás listo20 preguntas. Sin tarjeta. Mira qué estudiar antes de comprar.

Llega al 80 % de preparación y aprueba — o te devolvemos el dinero.

Cómo funciona el score →