EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEP · Professional

Databricks Data Engineer Professional — Preguntas de práctica y simulacro de examen

Prepara DB-DEP con preguntas de práctica originales y respuestas explicadas con claridad. Pide más detalles a Alex, tu tutor de IA, usa tus resultados para identificar los temas que necesitas repasar y practica cómo distribuir tu tiempo con simulacros de examen cronometrados.

59Preguntas del simulacro
120minTiempo límite

Contrastado con Databricks · agosto de 2026 · Versión actual del examen

Acerca del examen

El examen Databricks Certified Data Engineer Professional valida tu experiencia avanzada en la construcción y optimización de sistemas de datos en producción sobre la Databricks Data Intelligence Platform. Abarca la escritura de código de procesamiento de datos en Python y SQL, la ingesta y transformación de datos, la optimización de costos y rendimiento, la seguridad y el gobierno de datos, además de la depuración y el despliegue de pipelines. Necesitas demostrar dominio de los aspectos internos de Delta Lake, del gobierno con Unity Catalog y del tuning de rendimiento en Spark.

Esta certificación está pensada para data engineers con experiencia, con uno o más años construyendo pipelines de datos en producción sobre la Databricks Lakehouse Platform. Acredita tu capacidad para diseñar, asegurar y operar sistemas de datos complejos a gran escala.

Prueba cinco preguntas de DB-DEP

Practica con cinco preguntas del banco actual de Databricks Certified Data Engineer Professional de la app, con sus respuestas y explicaciones.

Garantizar la seguridad y el cumplimiento de los datos1 / 5

Un data engineer descubre que los audit logs de Unity Catalog muestran intentos de acceso no autorizado a una tabla de producción sensible. ¿Qué pasos debes seguir para investigar y remediar la situación?

AlexExplicación completa de Alex

Flujo de investigación de seguridad: 1) Detectar: alertar sobre intentos de acceso fallidos a tablas sensibles. 2) Investigar: consultar los audit logs para conocer la identidad del usuario, los patrones de acceso y los horarios. 3) Evaluar: ¿el intento de acceso del usuario fue legítimo (por ejemplo, nombre de tabla equivocado) o sospechoso (intentos repetidos sobre tablas con PII)? 4) Remediar: revocar permisos excesivos (principio de menor privilegio), agregar alertas de monitoreo, implementar filtros de fila si los datos deben ser parcialmente accesibles. 5) Prevenir: etiquetar las tablas sensibles con tags de clasificación, crear políticas de acceso a datos vinculadas a esos tags. 6) Reportar: documentar el incidente, las acciones tomadas y los cambios de políticas. De forma continua: programar revisiones semanales de los audit logs para detectar patrones de acceso anómalos.

Fuentedocs.databricks.com

Transformación, limpieza y calidad de datos2 / 5

Un data engineer tiene una tabla Delta en la que algunas columnas contienen structs y arrays profundamente anidados. Los analistas se quejan de que los datos son difíciles de consultar. ¿Qué estrategia de aplanamiento los vuelve accesibles y a la vez preserva las relaciones entre los datos?

AlexExplicación completa de Alex

Patrones para aplanar datos anidados: 1) Struct: df.select('order_id', 'customer.name', 'customer.email'). SQL: SELECT customer.name FROM orders. 2) Array: df.select('order_id', explode('items').alias('item')). SQL: SELECT EXPLODE(items) FROM orders. 3) Array anidado de structs: df.select('order_id', explode('items').alias('item')).select('order_id', 'item.product', 'item.qty'). 4) Map: df.select('order_id', explode('metadata').alias('key', 'value')). 5) Expansión con estrella: df.select('order_id', 'customer.*'). Expande el struct en columnas individuales. 6) Aplanamiento recursivo: para estructuras muy anidadas, escribe una función recursiva que recorra el esquema y genere las expresiones select. 7) Consideraciones: explosión de cardinalidad — EXPLODE sobre arrays multiplica la cantidad de filas. Usa array_size() para estimar la expansión. Para arrays de alta cardinalidad (100+ elementos), considera agregar antes de aplanar.

Fuentedocs.databricks.com

Gobernanza de datos3 / 5

Un data engineer necesita implementar una solución que permita a distintas unidades de negocio administrar sus propios catálogos de datos de forma independiente, compartiendo al mismo tiempo un marco de gobernanza común. ¿Cómo apoya esto el namespace de tres niveles de Unity Catalog?

AlexExplicación completa de Alex

Namespace de Unity Catalog: 1) Tres niveles: catalog.schema.table. Catalog: límite organizacional de nivel superior. Schema: agrupación lógica dentro de un catálogo. Table/View/Function: objetos de datos. 2) Estrategias de catálogo: por unidad de negocio: finance_catalog, marketing_catalog. Por entorno: dev_catalog, staging_catalog, prod_catalog. Por dominio: customers_catalog, orders_catalog. Híbrida: prod_finance, prod_marketing, dev_shared. 3) Delegación de propiedad: el dueño del catálogo administra su catálogo. Puede crear esquemas y otorgar permisos. No puede modificar otros catálogos. 4) Consistencia de gobernanza: el admin del metastore define: permisos por defecto. Retención de los audit logs. Requisitos de clasificación de datos. Esto aplica a todos los catálogos. 5) Migración: desde el Hive metastore: default (un solo catálogo) → migrar a múltiples catálogos. SHOW DATABASES → pasa a ser esquemas dentro de un catálogo. 6) Límites: un metastore por región. Múltiples catálogos por metastore. Cientos de esquemas por catálogo. Millones de tablas por esquema.

Fuentedocs.databricks.com

Desarrollo de código para el procesamiento de datos con Python y SQL4 / 5

Un data engineer está construyendo un job batch de PySpark que debe aplicar un cálculo de scoring complejo a nivel de fila, escrito en Python puro, sobre un DataFrame con 200 millones de filas. La lógica no se puede expresar con funciones integradas de Spark SQL. Busca el menor overhead de serialización y el mejor rendimiento disponible en la DataFrame API. ¿Qué enfoque debería elegir?

AlexExplicación completa de Alex

Las UDFs estándar de Python en Spark serializan los datos fila por fila a través de la frontera entre la JVM y Python, lo que resulta costoso a gran escala. Las UDFs de Pandas (también llamadas UDFs vectorizadas) usan en cambio Apache Arrow para mover batches columnares y ejecutar código de pandas sobre Series o DataFrames, amortizando la serialización entre muchas filas. Mantienen el trabajo distribuido entre los executors, a diferencia de collect(), y conservan la planificación de Catalyst, a diferencia de la API de RDD. Para lógica de Python personalizada que no se puede expresar con funciones nativas de Spark, una UDF de Pandas es la opción recomendada de alto rendimiento. Las funciones nativas de Spark SQL siguen siendo preferibles cuando la lógica se puede expresar con ellas. Consejo de examen: cuando una pregunta combina 'lógica de Python personalizada' con 'mejor rendimiento' sobre datos grandes, elige la UDF de Pandas/vectorizada por encima de una UDF de Python simple.

Fuentedocs.databricks.com

Compartición y federación de datos5 / 5

A un data engineer le encargan construir un pipeline de reverse ETL que envíe datos agregados desde el lakehouse Delta de vuelta a un sistema CRM operativo a través de su API. ¿Qué arquitectura permite un reverse ETL confiable?

AlexExplicación completa de Alex

Componentes de reverse ETL: 1) Consulta de origen: SELECT customer_id, total_orders, avg_order_value, churn_score FROM gold.customer_360 WHERE updated_at > last_sync_time. 2) Seguimiento de la sincronización: CREATE TABLE sync_status (record_id STRING, target STRING, last_synced TIMESTAMP, status STRING, error_message STRING). 3) Integración con la API: for batch in batches: try: response = crm_api.upsert(batch). update_status(batch, 'synced'). except RateLimitError: sleep(backoff). retry. except APIError as e: update_status(batch, 'failed', str(e)). 4) Idempotencia: usar llamadas de upsert a la API (crear o actualizar). Volver a ejecutar sincroniza los mismos registros sin duplicados. 5) Monitoreo: alertar cuando la tasa de fallos de sincronización supere el umbral. Dashboard: registros sincronizados por corrida, tasas de error, latencia. 6) Calendario: hacerlo coincidir con la cadencia de refresco de la tabla gold. Si gold se refresca a diario a las 6 AM, sincroniza al CRM a las 7 AM.

Fuentedocs.databricks.com

Las preguntas de la app están actualmente en inglés. Las traducciones de esta vista previa solo se aplican a la vista previa. Consulta con el proveedor de la certificación los idiomas disponibles para el examen oficial.

318 preguntas de práctica

Utiliza el banco de preguntas de Pass-IT para practicar para DB-DEP. Los simulacros están configurados con 59 preguntas en 120 minutos.

Datos del banco de preguntas: DB-DEP

Objetivos de la guía27 objetivos enumerados en la guía oficial

distribuidos entre 10 dominios en la guía oficial del examen

Tamaño del banco318 preguntas

= El tamaño del banco equivale a 5 conjuntos de 59 preguntas. Esto no significa que cada simulacro utilice un conjunto distinto.

Registradas como contrastadas con fuentes318 de 318

preguntas cuya respuesta, opciones y explicación constan como contrastadas con la documentación oficial de Databricks

Contenido del examen

El desarrollo de código para procesamiento de datos es el dominio más grande con 22%: abarca la estructura de proyectos en Python para los automation bundles, el desarrollo de UDF personalizadas y la construcción de pipelines ETL listos para producción con Structured Streaming y el framework declarativo de pipelines de Lakeflow. Le sigue la optimización de costos y rendimiento con 13%, que evalúa Liquid Clustering, deletion vectors y ajustes guiados por el query profile, no la construcción básica de pipelines.

Ingesta, transformación, compartición, monitoreo, seguridad, gobernanza, depuración y modelado completan el examen con 5–10% cada uno y miden habilidades operativas más acotadas: configuración de Delta Sharing, enmascaramiento de PII, depuración a partir de los event logs y modelado dimensional con Liquid Clustering en lugar de particionamiento manual.

Temario del examen: DB-DEP

Developing Code for Data Processing using Python and SQL22%

Structure Python projects for automation bundles and write the UDFs they call, build production ETL with Lakeflow pipelines, Autoloader, and Structured Streaming, handle change-data-capture and control-flow logic within them, and cover the result with unit and integration tests.

≈ 26 h
Data Ingestion and Acquisition7%

Patrones avanzados de ingesta, evolución de esquemas, adquisición de datos desde fuentes diversas y manejo de formatos de datos complejos.

≈ 8 h
Data Transformation, Cleansing, and Quality10%

Marcos avanzados de calidad de datos, expectativas, estrategias de limpieza y patrones de transformación complejos.

≈ 12 h
Data Sharing and Federation5%

Delta Sharing, acceso a datos entre workspaces, patrones de federación de datos e integración de datos externos.

≈ 6 h
Monitoring and Alerting10%

Monitoreo de pipelines, estrategias de alertas, logging, observabilidad y solución de problemas en workflows de datos en producción.

≈ 12 h
Cost and Performance Optimization13%

Ajuste de rendimiento de Spark, dimensionamiento de clústeres, Liquid Clustering, Z-ordering, estrategias de caché y gestión de costos.

≈ 16 h
Ensuring Data Security and Compliance10%

Cifrado de datos, controles de acceso, registro de auditoría, marcos de cumplimiento y mejores prácticas de seguridad en Databricks.

≈ 12 h
Data Governance7%

Funciones avanzadas de Unity Catalog, linaje de datos, etiquetado, clasificación y políticas de gobernanza.

≈ 8 h
Debugging and Deploying10%

CI/CD para pipelines de datos, Databricks Asset Bundles, estrategias de pruebas, técnicas de depuración y automatización de despliegues.

≈ 12 h
Data Modeling6%

Design large-scale data models on Delta Lake, replace manual partitioning and Z-ordering decisions with Liquid Clustering, and structure dimensional models built for fast, accurate analytical queries.

≈ 7 h

Formato del examen y tipos de preguntas

El examen toma 59 preguntas puntuadas de opción múltiple en una sesión de 120 minutos, y puede incluir preguntas piloto que no cuentan para tu resultado. Casi todo viene planteado como escenarios de ajuste de rendimiento, implementación de seguridad y depuración de pipelines: se espera que te muevas con soltura entre los detalles internos de Delta Lake y la gobernanza con Unity Catalog, no que recuerdes APIs de memoria.

Tipos de preguntas: DB-DEP

Opción múltiple100%

Selecciona la única respuesta que mejor cumpla los requisitos de la pregunta.

Consulta a Databricks para conocer la información oficial sobre los formatos de preguntas. Las proporciones mostradas describen el banco de práctica de Pass-IT y no determinan las del examen oficial.

Preparación para DB-DEP

El examen se rinde en línea con supervisión remota o en un centro de evaluación, y está disponible en inglés, japonés, portugués (BR) y coreano. La credencial tiene una vigencia de dos años, y recertificarte significa aprobar la versión vigente del examen.

Preparación y aspectos prácticos: DB-DEP

Preparación

Ejemplo de tiempo de estudio70–180 h

rango orientativo para planificar: de 70 h con experiencia relevante a 180 h si empiezas desde cero; tus necesidades pueden quedar fuera de este rango

NivelProfesional
Conocimientos recomendadosNo hay requisitos previos. Se recomienda tener al menos 1 año de experiencia práctica con Databricks. La certificación Data Engineer Associate ayuda, pero no es obligatoria.

Obtención y mantenimiento de la certificación

ModalidadSupervisado en línea o centro de examen
Política de repeticiónSin período de espera obligatorio. Se aplica una tarifa de reintento.
Validez de la certificación2 años

Debes recertificarte cada 2 años presentando la versión vigente del examen.

Errores frecuentes

Temas para repasar: DB-DEP

  1. 01Quarantine Pipeline Design

    No armar una ruta de cuarentena dedicada para los registros que no pasan la validación, y en cambio descartarlos o dejarlos pasar en silencio, te lleva a responder mal las preguntas sobre pipelines de calidad de datos.

  2. 02Lakehouse Federation

    Confundir Lakehouse Federation, que consulta sistemas externos en vivo, con Delta Sharing, que copia o transmite los datos hacia afuera, hace que falles en las preguntas de integración de fuentes de datos.

  3. 03PII Anonymization vs Masking

    Mezclar el masking de columnas, el filtrado de filas y la verdadera anonimización o seudonimización de PII, y olvidarte del lado de la purga de datos en el cumplimiento de retención, te deja con respuestas equivocadas en las preguntas de seguridad y cumplimiento.

  4. 04Permission Inheritance

    Dar por hecho que un grant de Unity Catalog a nivel de catalog siempre gana sobre uno más acotado a nivel de schema o table, en lugar de entender cómo funciona de verdad el modelo de herencia, termina en respuestas equivocadas sobre governance.

  5. 05DAB Project Structure

    No estructurar un proyecto de Python para desarrollo modular e integración con CI/CD dentro de los Automation Bundles te complica las preguntas de despliegue, porque esperan una organización de código específica y testeable.

Preguntas frecuentes

¿Cuánto dura el examen Databricks Certified Data Engineer Professional?

El examen Databricks Certified Data Engineer Professional tiene 59 preguntas y un tiempo límite de 120 minutos.

¿Qué errores conviene revisar al preparar Databricks Certified Data Engineer Professional?

Entre los temas que conviene repasar están Quarantine Pipeline Design, Lakehouse Federation, PII Anonymization vs Masking, Permission Inheritance, DAB Project Structure. Trabaja con ejemplos para comprobar que entiendes las diferencias y puedes justificar tu respuesta.

¿Cómo apruebas el examen Databricks Data Engineer Professional?

Escribir código de procesamiento de datos en Python y SQL es el área más grande con un 22%, y las preguntas te muestran código en lugar de describirlo. El presupuesto del catálogo es de 120 horas y Databricks recomienda un año o más de trabajo práctico con la plataforma. Los que la pasan mal suelen ser los que se prepararon leyendo documentación en vez de armar y romper pipelines.

¿Cuánto tiempo vale la certificación Data Engineer Professional?

Dos años desde la fecha de aprobación. Databricks recertifica con examen, así que vuelves a rendir la versión vigente en lugar de acumular créditos de formación continua. No hay período de gracia previsto, así que el nuevo intento tiene que ocurrir antes de la fecha de vencimiento.

¿Cómo se pondera el examen Data Engineer Professional?

El código de procesamiento de datos encabeza con un 22%, seguido de la optimización de costos y rendimiento con un 13%. Transformación y calidad, monitoreo y alertas, seguridad y cumplimiento, y depuración y despliegue se llevan un 10% cada una, y el resto queda para ingesta, gobernanza, modelado y federación. Está repartido en diez objetivos, así que el examen toma muestras de todo el trabajo y no de una sola parte.

¿Conviene dar primero el Data Engineer Associate?

Databricks describe la certificación associate como útil pero no obligatoria, así que puedes reservar el examen professional directamente. La distancia entre ambos es real: 80 horas contra 120, y preguntas de reconocimiento contra preguntas de lectura de código. Si llevas menos de un año en la plataforma, el examen associate es la forma más barata de saber dónde estás parado.

¿Qué experiencia asume el Data Engineer Professional?

Un año o más de trabajo práctico con Databricks, según la recomendación del propio Databricks. Ninguna certificación bloquea la inscripción. El presupuesto de 120 horas del catálogo da por hecho que esa experiencia ya está, así que tómalo como un piso y no como un total.

¿Qué tan pronto puedes repetir el examen Data Engineer Professional?

De inmediato, en lo que respecta a la política de Databricks: no hay un período de espera obligatorio. El límite es tu propia preparación, no una regla de enfriamiento.

Una certificación, 12 meses

Práctica para DB-DEP

Centra tu práctica en una certificación o elige Pro para practicar todas las certificaciones.

Empezar una sesión de práctica gratuitaPrueba las primeras 20 preguntas sin tarjeta para ver si la práctica te resulta útil.

Para compras elegibles: garantía de devolución del dinero si no apruebas tu examen.

Ver condiciones de la garantía →