EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEA · Associate

Databricks Data Engineer Associate — Preguntas de práctica y simulacro de examen

Practica con preguntas realistas de DB-DEA, alineadas con los objetivos del examen. Alex explica cada respuesta y tu Readiness Score te muestra qué estudiar después.

45Preguntas
90minLímite de tiempo

Verificado con Databricks · agosto de 2026Versión actual del examen

Sobre el examen

El examen Databricks Certified Data Engineer Associate valida tu capacidad para usar la Databricks Data Intelligence Platform en tareas centrales de ingeniería de datos. Abarca el desarrollo de ETL con PySpark y SQL, la ingesta de datos con Auto Loader, COPY INTO y Lakeflow Connect, la orquestación de pipelines con Lakeflow Jobs, y la gobernanza y seguridad a través de Unity Catalog. Necesitas demostrar soltura en Delta Lake, CI/CD para pipelines de datos y resolución de problemas en cargas de trabajo de producción.

Esta certificación está pensada para ingenieros de datos con seis meses o más de experiencia práctica en Databricks, trabajando con Spark SQL, PySpark, Delta Lake y workflows de Databricks. Acredita que sabes construir y operar pipelines de datos confiables y listos para producción sobre la plataforma.

Qué entra en el examen

La transformación y el modelado de datos es el dominio con más peso, un 22%, apenas por encima de la ingesta y carga de datos con 21%. Entre los dos suman casi la mitad del examen y giran alrededor del pipeline bronze-silver-gold: limpiar registros con PySpark y SQL, y luego elegir el método de aterrizaje entre COPY INTO, Auto Loader o Lakeflow Connect. Después vienen el trabajo con Lakeflow Jobs (16%) y la gobernanza y seguridad (15%), que cubren la orquestación basada en DAG y las reglas de acceso de Unity Catalog.

Los fundamentos de la plataforma, CI/CD y la resolución de problemas se mueven cada uno entre el 6% y el 10%, y evalúan habilidades operativas más acotadas: selección de compute, despliegue con Git mediante automation bundles, y lectura de las métricas de stages en la Spark UI para detectar skew o memory spill. Es otro tipo de trabajo, distinto a la construcción de pipelines que ocupa el resto del examen.

Temario oficial: DB-DEA

Databricks Intelligence Platform6%

Map the architecture behind Databricks' Delta Lake storage layer and its Unity Catalog governance layer, then match workloads to the right compute service by weighing cost against performance limits.

≈ 5 h
Data Ingestion and Loading21%

Enable batch, streaming, and incremental data ingestion patterns using tools such as COPY INTO, Auto Loader, and Lakeflow Connect into Unity Catalog-governed tables. Also covers prioritizing between ingestion methods based on volume, frequency, and governance needs, and ingesting semi-structured and unstructured data.

≈ 17 h
Data Transformation and Modeling22%

Clean and transform data through the bronze, silver, and gold layers using PySpark and SQL, including joins, deduplication, aggregation, and column and row manipulation. Also covers basic Spark tuning parameters and applying data quality checks to Silver and Gold datasets.

≈ 18 h
Working with Lakeflow Jobs16%

Orchestrate Lakeflow Jobs with retry logic and conditional branching, wire task dependencies into a DAG, and decide whether a job should fire on a schedule or in response to new data arriving.

≈ 13 h
Implementing CI/CD10%

Branch, commit, and open pull requests through Databricks' Git integration, promote the same codebase across environments with variable overrides, and package jobs, pipelines, and other assets for deployment using automation bundles and the CLI.

≈ 8 h
Troubleshooting, Monitoring, and Optimization10%

Compare current job run times against historical baselines to catch regressions, read the Lakeflow Jobs UI for pipeline health, pinpoint bottlenecks like skew and disk spilling in the Spark UI, and diagnose cluster or library failures using both Liquid Clustering and Databricks' predictive-optimization feature.

≈ 8 h
Governance and Security15%

Distinguish Unity Catalog's managed tables from externally referenced ones, grant or deny access at the right level of the hierarchy, and mask or filter sensitive rows and columns using both group-based rules and centralized ABAC policies.

≈ 12 h

Formato del examen y tipos de pregunta

El examen toma 45 preguntas puntuadas de opción múltiple en una sesión de 90 minutos, con espacio para contenido piloto sin puntuar que no cuenta para tu calificación. Las preguntas se plantean como escenarios: leer tablas bronze y escribir una salida silver limpia, elegir un método de ingesta para una fuente determinada, u orquestar un DAG en Lakeflow Jobs con el tipo de trigger correcto.

Tipos de pregunta: DB-DEA

Opción múltiple100%

Elige la única respuesta correcta entre cuatro o cinco opciones — el formato de siempre del examen.

Databricks confirma estos tipos de pregunta — no publica una distribución porcentual; las proporciones reflejan nuestro banco de preguntas alineado con el examen.

Prueba cinco preguntas de DB-DEA

Cinco preguntas directas de nuestro banco de Databricks Certified Data Engineer Associate. Responde una — Alex te explica el porqué.

El examen y la app están en inglés — estas preguntas de muestra las hemos traducido.

Gobernanza y seguridad1 / 5

Un ingeniero de datos necesita acceder a la API REST de Databricks desde un notebook. ¿Qué método de autenticación se recomienda para cargas de trabajo de producción automatizadas?

AlexExplicación completa de Alex

OAuth M2M con service principals es la autenticación que Databricks recomienda para cargas de trabajo de producción automatizadas. Los service principals son identidades no humanas que generan tokens OAuth de corta duración mediante el flujo de client credentials, lo que elimina los riesgos de las credenciales de larga duración. Análisis de los distractores: los roles de IAM con alcance de clúster controlan el acceso a los recursos del clúster, no la autenticación de la API. Los tokens de usuario de Azure AD están ligados a sesiones interactivas de usuario, así que no sirven para automatización desatendida. Los PAT en secret scopes son más simples, pero son de larga duración y están ligados a un usuario: si esa persona se va o el PAT se filtra, el pipeline queda comprometido. Buena práctica: guarda las credenciales de OAuth y léelas con dbutils.secrets.get(), nunca dejes los tokens escritos en el código. Ref: docs.databricks.com/en/dev-tools/auth/oauth-m2m

Fuentedocs.databricks.com

Transformación y modelado de datos2 / 5

Un ingeniero de datos escribe una consulta de Structured Streaming que hace un join entre un DataFrame de streaming y un DataFrame estático. ¿De qué tipo de join se trata?

AlexExplicación completa de Alex

Unir un DataFrame de streaming con un DataFrame normal (estático) produce un join stream-static. El lado estático se vuelve a leer en cada trigger de micro-batch, así que las actualizaciones de la tabla estática se recogen automáticamente. No hace falta watermark ni gestión de estado. Análisis de los distractores: el join con ventanas se refiere a agregaciones basadas en ventanas de tiempo en el procesamiento de streams, no a una clasificación de tipos de join. El join de streams con estado implica joins stream-stream, que necesitan watermarks en ambos lados para acotar el estado y evitar un crecimiento sin límite. El join de búsqueda temporal no es un término reconocido en Spark Structured Streaming. Los joins stream-static son ideales para enriquecer datos de streaming con tablas de dimensiones que cambian lentamente. Ref: docs.databricks.com/en/transform/join

Fuentedocs.databricks.com

Implementación de CI/CD3 / 5

¿Cuál de estas afirmaciones sobre Databricks Repos es correcta?

AlexExplicación completa de Alex

Databricks Repos (ahora llamados carpetas de Git) se integran con proveedores de Git (GitHub, Azure DevOps, GitLab, Bitbucket) para sincronizar notebooks y código con repositorios remotos. Los usuarios pueden clonar, crear ramas, hacer commit, push y pull, lo que habilita flujos de trabajo de Git estándar dentro de Databricks. Análisis de los distractores: los Repos NO aplican reglas de protección de ramas; eso se configura en los ajustes del proveedor de Git. Los Repos NO guardan resultados de ejecución: solo se sincronizan los archivos fuente y el historial de ejecuciones se queda en el workspace. Los Repos NO incluyen un runner de CI/CD integrado: el CI/CD se maneja fuera, con GitHub Actions o Azure DevOps Pipelines, disparado por los pushes al remoto. Ref: docs.databricks.com/en/repos/git-operations-with-repos

Fuentedocs.databricks.com

Ingesta y carga de datos4 / 5

¿Cuál es la diferencia entre una lectura batch (spark.read) y una lectura de streaming (spark.readStream) de una tabla Delta?

AlexExplicación completa de Alex

Las lecturas batch de Delta cargan una instantánea de la tabla, incluidas las instantáneas de time travel cuando se especifica una versión o una marca de tiempo. Las lecturas de streaming de Delta usan Structured Streaming para procesar la instantánea inicial y los commits futuros como micro-batches, con el progreso guardado en checkpoints y opciones como startingVersion o startingTimestamp. Si el esquema de la tabla de origen cambia después de que empezó una lectura de streaming, Databricks documenta que la consulta falla y que normalmente hay que reiniciarla ante cambios de esquema compatibles.

Fuentedocs.databricks.com

Databricks Intelligence Platform5 / 5

¿Qué hace el comando CONVERT TO DELTA?

AlexExplicación completa de Alex

CONVERT TO DELTA realiza una conversión in situ de tablas Parquet o Iceberg existentes al formato Delta Lake. Escanea los archivos de datos existentes, crea un log de transacciones _delta_log con las entradas del commit inicial y deja la tabla consultable como Delta, sin reescribir ningún archivo de datos. Sintaxis: CONVERT TO DELTA parquet.`path` [PARTITIONED BY (col type)]. Para tablas Iceberg con archivos Parquet, lee el manifiesto de Iceberg para construir el log de Delta. Incorrecto: no migra tablas Hive administradas a tablas externas. Incorrecto: convierte HACIA Delta, no DESDE Delta. Incorrecto: no reescribe archivos de datos; la conversión es solo de metadatos. Avro y ORC no están soportados por CONVERT TO DELTA. Ref: docs.databricks.com/en/sql/language-manual/delta-convert-to-delta.html

Fuentedocs.databricks.com

322 preguntas, construidas como el examen

El banco de DB-DEA cubre todos los dominios del examen y sigue creciendo con preguntas nuevas. El simulacro te plantea 45 preguntas seguidas, con el mismo cronómetro de 90 minutos que el día del examen.

Acta de verificación: DB-DEA

Cotejo del temario con Databricks4 de agosto de 2026

última verificación con la fuente oficial de Databricks

Cobertura del temario33 objetivos oficiales

repartidos en 7 dominios, según la guía oficial del examen

Tamaño del banco322 preguntas

= 7 simulacros completos de 45 preguntas — nunca la misma pregunta dos veces

Validación canónica322 de 322

cada una verificada con la documentación oficial de Databricks — respuesta, opciones y explicación, fuente citada

Metodología documentada abiertamente.Cómo se crean las preguntas →

Preparación para DB-DEA

Cuánto tiempo necesitas depende de la experiencia práctica que ya tienes. El resto lo define el proveedor: cómo se hace el examen, cuándo puedes repetirlo y cuánto dura la certificación.

El examen se rinde en línea con proctor remoto o en un centro de evaluación, y está disponible en inglés, japonés, portugués (BR) y coreano. La credencial tiene una vigencia de dos años, y recertificarte implica aprobar la versión vigente del examen.

Tu plan: DB-DEA

Preparación

Tiempo de estudio50–120 h

normalmente unas 50 h si ya trabajas con estas tecnologías, unas 120 h si empiezas de cero

NivelAssociate
Conviene tener antesNo hay requisitos previos. Se recomienda tener al menos 6 meses de experiencia práctica con Databricks.

El día del examen y después

ModalidadSupervisado en línea o centro de examen
Política de repeticiónSin período de espera obligatorio. Se aplica una tarifa de reintento.
Vigencia2 años

Debes recertificarte cada 2 años presentando la versión vigente del examen.

Las horas son nuestra propia estimación de planificación — Databricks no publica un tiempo de preparación para este examen. Un punto de partida para tu calendario, no una meta.

Errores comunes

Las preguntas de ingesta van más allá de los nombres de las herramientas: hay que saber cuándo importan las opciones de schema evolution de Auto Loader y cuándo basta con la simplicidad de COPY INTO, además de cómo Lakeflow Connect maneja los managed connectors frente a los standard connectors según la fuente. La gobernanza y seguridad pesa lo suyo con ese 15%, y GRANT, REVOKE y DENY se comportan distinto según el nivel de la jerarquía de Unity Catalog en el que los apliques; esa diferencia suele complicar a quienes solo han trabajado con permisos a nivel de workspace. La orquestación con Lakeflow Jobs es fácil de subestimar con su 16%: los tipos de trigger, las dependencias entre tareas y la lógica de reintentos pesan tanto como buena parte del dominio de ingesta.

Puntos de atención: DB-DEA

  1. 01Gold Layer Objects

    Si no distingues entre streaming tables, materialized views y views normales para la capa Gold, vas a fallar las preguntas sobre cómo servir datos a los equipos de BI y analítica.

  2. 02Broadcast Join Tuning

    Si no sabes cómo autoBroadcastJoinThreshold y los demás ajustes de shuffle y paralelismo afectan el plan de ejecución de un join, vas a fallar las preguntas sobre tuning de transformaciones.

  3. 03Asset Bundle Config

    Confundir los overrides de variables por entorno en los Automation Bundles con una configuración hardcodeada te lleva a respuestas equivocadas sobre promoción de dev a prod en las preguntas de CI/CD.

  4. 04Cluster Startup Failures

    Si no sabes distinguir, a partir de los síntomas en la Spark UI, entre conflictos de librerías, errores de out-of-memory y fallas al iniciar el cluster, vas a fallar las preguntas de troubleshooting.

  5. 05Compute Service Choice

    Elegir una opción de compute demasiado grande o demasiado chica para el modelo de costos de una carga de trabajo, en vez de ajustar el tipo de cluster al caso de uso real, te cuesta puntos en las preguntas de fundamentos de la plataforma.

Pass-IT te entrena justo en estos puntos débiles — adaptativo y espaciado →

Preguntas frecuentes

¿Cuánto dura el examen Databricks Certified Data Engineer Associate?

El examen Databricks Certified Data Engineer Associate tiene 45 preguntas y un límite de 90 minutos.

¿Cuáles son los errores más comunes en el examen Databricks Certified Data Engineer Associate?

Los errores más comunes incluyen: Gold Layer Objects, Broadcast Join Tuning, Asset Bundle Config, Cluster Startup Failures, Compute Service Choice. Dedica tiempo de estudio a estas áreas para no perder puntos.

¿Cómo se pondera el examen Databricks Data Engineer Associate?

Data transformation and modeling es el área más grande con un 22%, seguida de ingestion and loading con un 21% y Lakeflow jobs con un 16%. Governance and security se lleva un 15%, mientras que CI/CD y troubleshooting quedan en un 10% cada uno y platform basics en un 6%. Ingestion y transformation juntas suman más de dos quintas partes del examen.

¿Caduca la certificación Data Engineer Associate?

Sí, a los dos años. Databricks solo recertifica mediante examen, así que rindes la versión vigente en ese momento en lugar de juntar créditos de educación continua. Como la plataforma cambia rápido, repetirlo suele implicar estudio de verdad y no un simple trámite.

¿Necesitas experiencia antes del examen Data Engineer Associate?

No hace falta ninguna certificación para agendarlo. Databricks recomienda seis meses o más de trabajo práctico con la plataforma, y el catálogo calcula unas 80 horas. El examen menciona partes concretas del producto, como Lakeflow, así que leer solo la documentación te deja huecos.

¿Qué viene después del Data Engineer Associate?

El examen Data Engineer Professional es el paso directo hacia arriba, con 120 horas estimadas y preguntas en las que tienes que escribir Python y SQL, no solo reconocerlos. El Generative AI Engineer Associate es el movimiento lateral si tus pipelines empiezan a alimentar modelos. Ninguno exige tener antes la certificación associate.

¿Qué pasa si no apruebas el examen Data Engineer Associate?

No hay período de espera obligatorio antes del siguiente intento. Databricks te deja el ritmo a ti, así que el límite real es qué tan rápido cierras el hueco que te hizo reprobar.

Pass-IT es una herramienta de estudio independiente, no afiliada a Databricks ni respaldada por Databricks; Databricks y los nombres de los exámenes son marcas de sus respectivos propietarios.

Una certificación. Un solo pago.

Acceso completo a DB-DEA

Accede al banco completo de preguntas de esta certificación. Alex explica cada respuesta y tu Readiness Score te muestra qué estudiar después.

Comprar acceso a DB-DEA por $29.99Un solo pago. Acceso de por vida a esta certificación.
Comprueba gratis si estás listo20 preguntas. Sin tarjeta. Mira qué estudiar antes de comprar.

Llega al 80 % de preparación y aprueba — o te devolvemos el dinero.

Cómo funciona el score →