EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEA · Associate

Databricks Data Engineer Associate — Preguntas de práctica y simulacro de examen

Prepara DB-DEA con preguntas de práctica originales y respuestas explicadas con claridad. Pide más detalles a Alex, tu tutor de IA, usa tus resultados para identificar los temas que necesitas repasar y practica cómo distribuir tu tiempo con simulacros de examen cronometrados.

45Preguntas del simulacro
90minTiempo límite

Contrastado con Databricks · agosto de 2026 · Versión actual del examen

Acerca del examen

El examen Databricks Certified Data Engineer Associate valida tu capacidad para usar la Databricks Data Intelligence Platform en tareas centrales de ingeniería de datos. Abarca el desarrollo de ETL con PySpark y SQL, la ingesta de datos con Auto Loader, COPY INTO y Lakeflow Connect, la orquestación de pipelines con Lakeflow Jobs, y la gobernanza y seguridad a través de Unity Catalog. Necesitas demostrar soltura en Delta Lake, CI/CD para pipelines de datos y resolución de problemas en cargas de trabajo de producción.

Esta certificación está pensada para ingenieros de datos con seis meses o más de experiencia práctica en Databricks, trabajando con Spark SQL, PySpark, Delta Lake y workflows de Databricks. Acredita que sabes construir y operar pipelines de datos confiables y listos para producción sobre la plataforma.

Prueba cinco preguntas de DB-DEA

Practica con cinco preguntas del banco actual de Databricks Certified Data Engineer Associate de la app, con sus respuestas y explicaciones.

Gobernanza y seguridad1 / 5

Un ingeniero de datos necesita acceder a la API REST de Databricks desde un notebook. ¿Qué método de autenticación se recomienda para cargas de trabajo de producción automatizadas?

AlexExplicación completa de Alex

OAuth M2M con service principals es la autenticación que Databricks recomienda para cargas de trabajo de producción automatizadas. Los service principals son identidades no humanas que generan tokens OAuth de corta duración mediante el flujo de client credentials, lo que elimina los riesgos de las credenciales de larga duración. Análisis de los distractores: los roles de IAM con alcance de clúster controlan el acceso a los recursos del clúster, no la autenticación de la API. Los tokens de usuario de Azure AD están ligados a sesiones interactivas de usuario, así que no sirven para automatización desatendida. Los PAT en secret scopes son más simples, pero son de larga duración y están ligados a un usuario: si esa persona se va o el PAT se filtra, el pipeline queda comprometido. Buena práctica: guarda las credenciales de OAuth y léelas con dbutils.secrets.get(), nunca dejes los tokens escritos en el código. Ref: docs.databricks.com/en/dev-tools/auth/oauth-m2m

Fuentedocs.databricks.com

Transformación y modelado de datos2 / 5

Un ingeniero de datos escribe una consulta de Structured Streaming que hace un join entre un DataFrame de streaming y un DataFrame estático. ¿De qué tipo de join se trata?

AlexExplicación completa de Alex

Unir un DataFrame de streaming con un DataFrame normal (estático) produce un join stream-static. El lado estático se vuelve a leer en cada trigger de micro-batch, así que las actualizaciones de la tabla estática se recogen automáticamente. No hace falta watermark ni gestión de estado. Análisis de los distractores: el join con ventanas se refiere a agregaciones basadas en ventanas de tiempo en el procesamiento de streams, no a una clasificación de tipos de join. El join de streams con estado implica joins stream-stream, que necesitan watermarks en ambos lados para acotar el estado y evitar un crecimiento sin límite. El join de búsqueda temporal no es un término reconocido en Spark Structured Streaming. Los joins stream-static son ideales para enriquecer datos de streaming con tablas de dimensiones que cambian lentamente. Ref: docs.databricks.com/en/transform/join

Fuentedocs.databricks.com

Implementación de CI/CD3 / 5

¿Cuál de estas afirmaciones sobre Databricks Repos es correcta?

AlexExplicación completa de Alex

Databricks Repos (ahora llamados carpetas de Git) se integran con proveedores de Git (GitHub, Azure DevOps, GitLab, Bitbucket) para sincronizar notebooks y código con repositorios remotos. Los usuarios pueden clonar, crear ramas, hacer commit, push y pull, lo que habilita flujos de trabajo de Git estándar dentro de Databricks. Análisis de los distractores: los Repos NO aplican reglas de protección de ramas; eso se configura en los ajustes del proveedor de Git. Los Repos NO guardan resultados de ejecución: solo se sincronizan los archivos fuente y el historial de ejecuciones se queda en el workspace. Los Repos NO incluyen un runner de CI/CD integrado: el CI/CD se maneja fuera, con GitHub Actions o Azure DevOps Pipelines, disparado por los pushes al remoto. Ref: docs.databricks.com/en/repos/git-operations-with-repos

Fuentedocs.databricks.com

Ingesta y carga de datos4 / 5

¿Cuál es la diferencia entre una lectura batch (spark.read) y una lectura de streaming (spark.readStream) de una tabla Delta?

AlexExplicación completa de Alex

Las lecturas batch de Delta cargan una instantánea de la tabla, incluidas las instantáneas de time travel cuando se especifica una versión o una marca de tiempo. Las lecturas de streaming de Delta usan Structured Streaming para procesar la instantánea inicial y los commits futuros como micro-batches, con el progreso guardado en checkpoints y opciones como startingVersion o startingTimestamp. Si el esquema de la tabla de origen cambia después de que empezó una lectura de streaming, Databricks documenta que la consulta falla y que normalmente hay que reiniciarla ante cambios de esquema compatibles.

Fuentedocs.databricks.com

Databricks Intelligence Platform5 / 5

¿Qué hace el comando CONVERT TO DELTA?

AlexExplicación completa de Alex

CONVERT TO DELTA realiza una conversión in situ de tablas Parquet o Iceberg existentes al formato Delta Lake. Escanea los archivos de datos existentes, crea un log de transacciones _delta_log con las entradas del commit inicial y deja la tabla consultable como Delta, sin reescribir ningún archivo de datos. Sintaxis: CONVERT TO DELTA parquet.`path` [PARTITIONED BY (col type)]. Para tablas Iceberg con archivos Parquet, lee el manifiesto de Iceberg para construir el log de Delta. Incorrecto: no migra tablas Hive administradas a tablas externas. Incorrecto: convierte HACIA Delta, no DESDE Delta. Incorrecto: no reescribe archivos de datos; la conversión es solo de metadatos. Avro y ORC no están soportados por CONVERT TO DELTA. Ref: docs.databricks.com/en/sql/language-manual/delta-convert-to-delta.html

Fuentedocs.databricks.com

Las preguntas de la app están actualmente en inglés. Las traducciones de esta vista previa solo se aplican a la vista previa. Consulta con el proveedor de la certificación los idiomas disponibles para el examen oficial.

322 preguntas de práctica

Utiliza el banco de preguntas de Pass-IT para practicar para DB-DEA. Los simulacros están configurados con 45 preguntas en 90 minutos.

Datos del banco de preguntas: DB-DEA

Objetivos de la guía33 objetivos enumerados en la guía oficial

distribuidos entre 7 dominios en la guía oficial del examen

Tamaño del banco322 preguntas

= El tamaño del banco equivale a 7 conjuntos de 45 preguntas. Esto no significa que cada simulacro utilice un conjunto distinto.

Registradas como contrastadas con fuentes322 de 322

preguntas cuya respuesta, opciones y explicación constan como contrastadas con la documentación oficial de Databricks

Contenido del examen

La transformación y el modelado de datos es el dominio con más peso, un 22%, apenas por encima de la ingesta y carga de datos con 21%. Entre los dos suman casi la mitad del examen y giran alrededor del pipeline bronze-silver-gold: limpiar registros con PySpark y SQL, y luego elegir el método de aterrizaje entre COPY INTO, Auto Loader o Lakeflow Connect. Después vienen el trabajo con Lakeflow Jobs (16%) y la gobernanza y seguridad (15%), que cubren la orquestación basada en DAG y las reglas de acceso de Unity Catalog.

Los fundamentos de la plataforma, CI/CD y la resolución de problemas se mueven cada uno entre el 6% y el 10%, y evalúan habilidades operativas más acotadas: selección de compute, despliegue con Git mediante automation bundles, y lectura de las métricas de stages en la Spark UI para detectar skew o memory spill. Es otro tipo de trabajo, distinto a la construcción de pipelines que ocupa el resto del examen.

Temario del examen: DB-DEA

Databricks Intelligence Platform6%

Map the architecture behind Databricks' Delta Lake storage layer and its Unity Catalog governance layer, then match workloads to the right compute service by weighing cost against performance limits.

≈ 5 h
Data Ingestion and Loading21%

Enable batch, streaming, and incremental data ingestion patterns using tools such as COPY INTO, Auto Loader, and Lakeflow Connect into Unity Catalog-governed tables. Also covers prioritizing between ingestion methods based on volume, frequency, and governance needs, and ingesting semi-structured and unstructured data.

≈ 17 h
Data Transformation and Modeling22%

Clean and transform data through the bronze, silver, and gold layers using PySpark and SQL, including joins, deduplication, aggregation, and column and row manipulation. Also covers basic Spark tuning parameters and applying data quality checks to Silver and Gold datasets.

≈ 18 h
Working with Lakeflow Jobs16%

Orchestrate Lakeflow Jobs with retry logic and conditional branching, wire task dependencies into a DAG, and decide whether a job should fire on a schedule or in response to new data arriving.

≈ 13 h
Implementing CI/CD10%

Branch, commit, and open pull requests through Databricks' Git integration, promote the same codebase across environments with variable overrides, and package jobs, pipelines, and other assets for deployment using automation bundles and the CLI.

≈ 8 h
Troubleshooting, Monitoring, and Optimization10%

Compare current job run times against historical baselines to catch regressions, read the Lakeflow Jobs UI for pipeline health, pinpoint bottlenecks like skew and disk spilling in the Spark UI, and diagnose cluster or library failures using both Liquid Clustering and Databricks' predictive-optimization feature.

≈ 8 h
Governance and Security15%

Distinguish Unity Catalog's managed tables from externally referenced ones, grant or deny access at the right level of the hierarchy, and mask or filter sensitive rows and columns using both group-based rules and centralized ABAC policies.

≈ 12 h

Formato del examen y tipos de preguntas

El examen toma 45 preguntas puntuadas de opción múltiple en una sesión de 90 minutos, con espacio para contenido piloto sin puntuar que no cuenta para tu calificación. Las preguntas se plantean como escenarios: leer tablas bronze y escribir una salida silver limpia, elegir un método de ingesta para una fuente determinada, u orquestar un DAG en Lakeflow Jobs con el tipo de trigger correcto.

Tipos de preguntas: DB-DEA

Opción múltiple100%

Selecciona la única respuesta que mejor cumpla los requisitos de la pregunta.

Consulta a Databricks para conocer la información oficial sobre los formatos de preguntas. Las proporciones mostradas describen el banco de práctica de Pass-IT y no determinan las del examen oficial.

Preparación para DB-DEA

El examen se rinde en línea con proctor remoto o en un centro de evaluación, y está disponible en inglés, japonés, portugués (BR) y coreano. La credencial tiene una vigencia de dos años, y recertificarte implica aprobar la versión vigente del examen.

Preparación y aspectos prácticos: DB-DEA

Preparación

Ejemplo de tiempo de estudio50–120 h

rango orientativo para planificar: de 50 h con experiencia relevante a 120 h si empiezas desde cero; tus necesidades pueden quedar fuera de este rango

NivelAsociado
Conocimientos recomendadosNo hay requisitos previos. Se recomienda tener al menos 6 meses de experiencia práctica con Databricks.

Obtención y mantenimiento de la certificación

ModalidadSupervisado en línea o centro de examen
Política de repeticiónSin período de espera obligatorio. Se aplica una tarifa de reintento.
Validez de la certificación2 años

Debes recertificarte cada 2 años presentando la versión vigente del examen.

Errores frecuentes

Temas para repasar: DB-DEA

  1. 01Gold Layer Objects

    Si no distingues entre streaming tables, materialized views y views normales para la capa Gold, vas a fallar las preguntas sobre cómo servir datos a los equipos de BI y analítica.

  2. 02Broadcast Join Tuning

    Si no sabes cómo autoBroadcastJoinThreshold y los demás ajustes de shuffle y paralelismo afectan el plan de ejecución de un join, vas a fallar las preguntas sobre tuning de transformaciones.

  3. 03Asset Bundle Config

    Confundir los overrides de variables por entorno en los Automation Bundles con una configuración hardcodeada te lleva a respuestas equivocadas sobre promoción de dev a prod en las preguntas de CI/CD.

  4. 04Cluster Startup Failures

    Si no sabes distinguir, a partir de los síntomas en la Spark UI, entre conflictos de librerías, errores de out-of-memory y fallas al iniciar el cluster, vas a fallar las preguntas de troubleshooting.

  5. 05Compute Service Choice

    Elegir una opción de compute demasiado grande o demasiado chica para el modelo de costos de una carga de trabajo, en vez de ajustar el tipo de cluster al caso de uso real, te cuesta puntos en las preguntas de fundamentos de la plataforma.

Preguntas frecuentes

¿Cuánto dura el examen Databricks Certified Data Engineer Associate?

El examen Databricks Certified Data Engineer Associate tiene 45 preguntas y un tiempo límite de 90 minutos.

¿Qué errores conviene revisar al preparar Databricks Certified Data Engineer Associate?

Entre los temas que conviene repasar están Gold Layer Objects, Broadcast Join Tuning, Asset Bundle Config, Cluster Startup Failures, Compute Service Choice. Trabaja con ejemplos para comprobar que entiendes las diferencias y puedes justificar tu respuesta.

¿Cómo se pondera el examen Databricks Data Engineer Associate?

Data transformation and modeling es el área más grande con un 22%, seguida de ingestion and loading con un 21% y Lakeflow jobs con un 16%. Governance and security se lleva un 15%, mientras que CI/CD y troubleshooting quedan en un 10% cada uno y platform basics en un 6%. Ingestion y transformation juntas suman más de dos quintas partes del examen.

¿Caduca la certificación Data Engineer Associate?

Sí, a los dos años. Databricks solo recertifica mediante examen, así que rindes la versión vigente en ese momento en lugar de juntar créditos de educación continua. Como la plataforma cambia rápido, repetirlo suele implicar estudio de verdad y no un simple trámite.

¿Necesitas experiencia antes del examen Data Engineer Associate?

No hace falta ninguna certificación para agendarlo. Databricks recomienda seis meses o más de trabajo práctico con la plataforma, y el catálogo calcula unas 80 horas. El examen menciona partes concretas del producto, como Lakeflow, así que leer solo la documentación te deja huecos.

¿Qué viene después del Data Engineer Associate?

El examen Data Engineer Professional es el paso directo hacia arriba, con 120 horas estimadas y preguntas en las que tienes que escribir Python y SQL, no solo reconocerlos. El Generative AI Engineer Associate es el movimiento lateral si tus pipelines empiezan a alimentar modelos. Ninguno exige tener antes la certificación associate.

¿Qué pasa si no apruebas el examen Data Engineer Associate?

No hay período de espera obligatorio antes del siguiente intento. Databricks te deja el ritmo a ti, así que el límite real es qué tan rápido cierras el hueco que te hizo reprobar.

Una certificación, 12 meses

Práctica para DB-DEA

Centra tu práctica en una certificación o elige Pro para practicar todas las certificaciones.

Empezar una sesión de práctica gratuitaPrueba las primeras 20 preguntas sin tarjeta para ver si la práctica te resulta útil.

Para compras elegibles: garantía de devolución del dinero si no apruebas tu examen.

Ver condiciones de la garantía →