EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-SPARK · Associate

Databricks Associate Developer for Apache Spark — Preguntas de práctica y simulacro de examen

Practica con preguntas realistas de DB-SPARK, alineadas con los objetivos del examen. Alex explica cada respuesta y tu Readiness Score te muestra qué estudiar después.

45Preguntas
90minLímite de tiempo

Verificado con Databricks · agosto de 2026Versión actual del examen

Sobre el examen

El examen Databricks Certified Associate Developer for Apache Spark valida tu capacidad para crear aplicaciones con Apache Spark. Cubre las APIs de DataFrame y Dataset, Spark SQL, la arquitectura y los componentes de Spark, Structured Streaming, y la resolución de problemas y el tuning de aplicaciones con DataFrames. Necesitas demostrar soltura con Spark Connect y con la Pandas API on Spark; la guía vigente del examen plantea todas las tareas en Python.

Esta certificación está pensada para desarrolladores con seis meses o más de experiencia creando aplicaciones con Apache Spark en Python o Scala. Demuestra que manejas con fluidez las APIs centrales de Spark en la práctica y que sabes razonar sobre rendimiento y troubleshooting en un entorno de cómputo distribuido.

Qué entra en el examen

El desarrollo con las APIs de DataFrame y Dataset es el dominio más grande, con 30%: cubre manipulación de columnas y filas, joins, agregaciones y funciones definidas por el usuario con operadores stateful. Arquitectura y componentes (20%) y Spark SQL (20%) vienen justo detrás y, juntos, pesan tanto como el dominio de DataFrame por sí solo. Ahí se evalúa el modelo driver-executor, el particionamiento y los shuffles, la evaluación perezosa (lazy) y la lectura o escritura vía Spark SQL contra fuentes JDBC y de archivos.

Troubleshooting y tuning por un lado, y Structured Streaming por el otro, valen 10% cada uno: entran Adaptive Query Execution y el procesamiento por micro-batches con semántica exactly-once. Spark Connect y la API de Pandas de Spark son los dominios más livianos, con 5% cada uno. Son temas más nuevos o más acotados que muchas guías de estudio se saltan, pero que igual aparecen en el examen.

Temario oficial: DB-SPARK

Developing Apache Spark™ DataFrame/DataSet API Applications30%

Manipulate DataFrame columns, rows, and structures through filtering, joining, aggregating, and date operations, and manage I/O operations and user-defined functions including stateful operators. Also covers broadcast variables, accumulators, and the purpose of broadcast joins.

≈ 24 h
Apache Spark Architecture and Components20%

Arquitectura del clúster de Spark, roles de driver y executor, gestión de memoria, particionamiento y el optimizador Catalyst.

≈ 16 h
Using Spark SQL20%

Consultas SQL en Spark, creación y gestión de tablas y vistas, funciones de ventana y optimización de rendimiento de SQL.

≈ 16 h
Troubleshooting and Tuning Apache Spark DataFrame API Applications10%

Tune Spark performance by repartitioning or coalescing data to fight skew and cut shuffling, understand what Adaptive Query Execution does for you automatically, and read driver and executor logs to catch out-of-memory errors and underused clusters.

≈ 8 h
Structured Streaming10%

Creación de aplicaciones de streaming, watermarking, modos de salida, triggers y procesamiento con estado.

≈ 8 h
Using Spark Connect to deploy applications5%

Learn what Spark Connect enables for remote application development, and compare it against Apache Spark's client, cluster, and local deployment modes.

≈ 4 h
Using Pandas API on Spark5%

See what the Pandas API on Spark buys you over plain Pandas, and write Pandas UDFs that run against that same interface.

≈ 4 h

Formato del examen y tipos de pregunta

El examen tiene 45 preguntas de opción múltiple que puntúan, dentro de una ventana de 90 minutos, y puede incluir preguntas piloto que no cuentan. Las preguntas son de tipo escenario y recorren las APIs de DataFrame y Dataset, Spark SQL y la arquitectura del cluster: no basta con la sintaxis, tienes que saber si una operación es lazy o eager y cómo una decisión de particionamiento afecta el rendimiento más adelante.

Tipos de pregunta: DB-SPARK

Opción múltiple100%

Elige la única respuesta correcta entre cuatro o cinco opciones — el formato de siempre del examen.

Databricks confirma estos tipos de pregunta — no publica una distribución porcentual; las proporciones reflejan nuestro banco de preguntas alineado con el examen.

Prueba cinco preguntas de DB-SPARK

Cinco preguntas directas de nuestro banco de Databricks Certified Associate Developer for Apache Spark. Responde una — Alex te explica el porqué.

El examen y la app están en inglés — estas preguntas de muestra las hemos traducido.

Arquitectura y componentes de Apache Spark1 / 5

Un executor de Spark tiene 4 cores y 16 GB de memoria. ¿Cuántas tareas pueden ejecutarse en paralelo en ese executor?

AlexExplicación completa de Alex

Tareas concurrentes por executor = spark.executor.cores / spark.task.cpus. Con el valor por defecto spark.task.cpus=1, cada core ejecuta una tarea, así que 4 cores = 4 tareas concurrentes. Aumentar spark.task.cpus reduce la concurrencia pero le da más CPU a cada tarea — útil para algoritmos de ML multihilo o cargas de trabajo en GPU. La memoria se comparte: la memoria de trabajo de cada tarea ≈ (memoria del executor × memory fraction) / tareas concurrentes. Análisis de distractores: La opción “La cantidad de tareas concurrentes está limitada…” es incorrecta — spark.default.parallelism controla el total de particiones, no la concurrencia por executor. La opción “La concurrencia está limitada por…” es incorrecta — spark.scheduler.maxRegisteredResourcesWaitingTime no tiene relación con la cantidad de slots de tareas. La opción “Pueden ejecutarse hasta 4 tareas en paralelo…” es incorrecta — memoryFraction afecta los umbrales de spill, pero no limita la concurrencia de tareas. Ref: spark.apache.org/docs/latest/configuration.html#scheduling

Fuentedatabricks.com

Resolución de problemas y tuning de aplicaciones con la API DataFrame de Apache Spark2 / 5

Un desarrollador nota que un job de Spark tiene una tarea en una etapa de shuffle que tarda 10 minutos, mientras que todas las demás terminan en 30 segundos. ¿Cómo se llama este problema y cómo debería resolverse?

AlexExplicación completa de Alex

El data skew es un problema de rendimiento habitual en Spark: una distribución despareja de los datos genera tareas rezagadas. Síntomas: una o pocas tareas tardan mucho más que el resto en la Spark UI. Soluciones: (1) el skew join de AQE (spark.sql.adaptive.skewJoin.enabled=true, por defecto en Spark 3.x) divide automáticamente las particiones sobredimensionadas, (2) el salting de claves agrega un número aleatorio a la clave sesgada y replica el lado más chico del join, (3) un broadcast join si la tabla no sesgada es lo bastante chica, (4) una pre-agregación para reducir el volumen de datos antes de la operación sesgada.

Fuentespark.apache.org

Uso de la API de pandas sobre Spark3 / 5

Al usar la API de pandas sobre Spark, un desarrollador escribe ps_df.to_pandas(). ¿Qué pasa?

AlexExplicación completa de Alex

to_pandas() es la salida de emergencia del procesamiento distribuido al local. Usa Apache Arrow para una serialización eficiente (formato columnar, zero-copy cuando se puede). El flujo de datos: executors → driver (por la red) → batches de Arrow → DataFrame de pandas. Sobre el tamaño: el driver necesita memoria suficiente para sostener el DataFrame entero en formato pandas, que suele ser de 2 a 10 veces el tamaño que tiene en memoria en Spark por el overhead de los objetos de Python. Patrón seguro: if len(ps_df) > threshold: ps_df = ps_df.sample(frac=threshold/len(ps_df)); local_df = ps_df.to_pandas().

Fuentespark.apache.org

Structured Streaming4 / 5

Un desarrollador llama a spark.streams.awaitAnyTermination(timeout=3600). ¿Qué hace esto?

AlexExplicación completa de Alex

Ciclo de vida de una aplicación de streaming en producción: (1) arrancar las consultas de streaming con writeStream.start(), (2) llamar a spark.streams.awaitAnyTermination() para bloquear el hilo principal. Sin ese bloqueo, el proceso del driver termina y todas las consultas de streaming se detienen. awaitAnyTermination espera a que se detenga CUALQUIER consulta (por un error o por un stop() explícito). Cuando vuelve, revisa si hubo excepciones: query.exception muestra los detalles del fallo. Para apps de producción de larga duración, usa awaitAnyTermination() sin timeout (bloquea indefinidamente). En notebooks no hace falta, porque el kernel del notebook mantiene viva la sesión.

Fuentespark.apache.org

Desarrollo de aplicaciones con la API DataFrame/DataSet de Apache Spark™5 / 5

Un desarrollador escribe df.alias('orders').join(df2.alias('items'), col('orders.order_id') == col('items.order_id')). ¿Qué hace alias() en un DataFrame?

AlexExplicación completa de Alex

DataFrame.alias() asigna un nombre lógico a un DataFrame para calificar referencias a columnas en joins y selecciones. Esto es esencial para los self-joins (df.alias('current').join(df.alias('previous'), ...)) y para cualquier join en el que ambos DataFrames comparten nombres de columnas. El alias agrega un calificador para la resolución de columnas—no copia datos ni modifica el DataFrame. En SQL, esto equivale a FROM orders AS o. Análisis de distractores: La opción “Crea un ámbito lógico que aísla las columnas del DataFrame…” es incorrecta—alias no crea ámbitos de aislamiento ni bloquea optimizaciones. La opción “Declara un identificador de DataFrame reutilizable…” es incorrecta—alias no registra nada en el catálogo de la SparkSession. La opción “Registra una referencia con nombre en la tabla de símbolos del plan de consulta…” es incorrecta—alias es más simple que registrar algo en una tabla de símbolos; es solo un calificador de nombres de columna. Ref: docs.databricks.com/en/pyspark/reference/classes/dataframe/alias.html

Fuentedatabricks.com

311 preguntas, construidas como el examen

El banco de DB-SPARK cubre todos los dominios del examen y sigue creciendo con preguntas nuevas. El simulacro te plantea 45 preguntas seguidas, con el mismo cronómetro de 90 minutos que el día del examen.

Acta de verificación: DB-SPARK

Cotejo del temario con Databricks4 de agosto de 2026

última verificación con la fuente oficial de Databricks

Cobertura del temario32 objetivos oficiales

repartidos en 7 dominios, según la guía oficial del examen

Tamaño del banco311 preguntas

= 6 simulacros completos de 45 preguntas — nunca la misma pregunta dos veces

Validación canónica311 de 311

cada una verificada con la documentación oficial de Databricks — respuesta, opciones y explicación, fuente citada

Metodología documentada abiertamente.Cómo se crean las preguntas →

Preparación para DB-SPARK

Cuánto tiempo necesitas depende de la experiencia práctica que ya tienes. El resto lo define el proveedor: cómo se hace el examen, cuándo puedes repetirlo y cuánto dura la certificación.

El examen se rinde en línea con un proctor remoto o en un centro de evaluación, y solo está disponible en inglés. La credencial vale dos años, y recertificarte significa aprobar la versión vigente del examen.

Tu plan: DB-SPARK

Preparación

Tiempo de estudio50–120 h

normalmente unas 50 h si ya trabajas con estas tecnologías, unas 120 h si empiezas de cero

NivelAssociate
Conviene tener antesNo hay requisitos previos. Se recomienda tener 6 meses o más de experiencia práctica desarrollando con Apache Spark.

El día del examen y después

ModalidadSupervisado en línea o centro de examen
Política de repeticiónSin período de espera obligatorio. Se aplica una tarifa de reintento.
Vigencia2 años

Debes recertificarte cada 2 años presentando la versión vigente del examen.

Las horas son nuestra propia estimación de planificación — Databricks no publica un tiempo de preparación para este examen. Un punto de partida para tu calendario, no una meta.

Errores comunes

El dominio de la API de DataFrame evalúa criterio, no nombres de métodos: distinguir una transformación de una acción, anticipar cuándo un broadcast join ayuda y cuándo satura la memoria de los executors, y razonar sobre el comportamiento a nivel de partición con una configuración de cluster determinada. Las preguntas de arquitectura van más allá de las definiciones y entran en la jerarquía de ejecución: qué pasa entre que llamas a una acción y Spark programa las tareas, y cómo el caching y los storage levels interactúan con el garbage collection cuando hay presión de memoria. Spark Connect es un dominio de apenas cinco por ciento que casi todas las guías tratan como opcional, pero igual aparece, junto con las diferencias entre los modos de despliegue client, cluster y local.

Puntos de atención: DB-SPARK

  1. 01Stateful UDFs and StateStores

    Tratar una UDF con estado respaldada por un StateStore igual que una sin estado, sin tomar en cuenta que ese estado persiste entre micro-batches, te lleva a fallar las preguntas de UDFs avanzadas.

  2. 02Save Modes on Files

    Confundir los modos de guardado overwrite, append, ignore y error al escribir los resultados de una consulta de vuelta a archivos termina en respuestas incorrectas en las preguntas de salida de Spark SQL.

  3. 03AQE Benefits

    Si no sabes qué optimiza realmente Adaptive Query Execution en tiempo de ejecución, como el manejo de joins con skew y el dimensionamiento de las particiones de shuffle, vas a errar las preguntas de ajuste de rendimiento.

  4. 04Streaming Dedup Watermarks

    Deduplicar un DataFrame de streaming sin watermark deja que el estado crezca sin límite; no acotarlo bien para los datos que llegan tarde te cuesta puntos en las preguntas de structured streaming.

  5. 05Pandas UDF vs API

    Confundir una Pandas UDF, que vectoriza una función propia, con Pandas API on Spark, que reimplementa la sintaxis de pandas sobre DataFrames distribuidos, provoca respuestas incorrectas en las preguntas de Pandas on Spark.

Pass-IT te entrena justo en estos puntos débiles — adaptativo y espaciado →

Preguntas frecuentes

¿Cuánto dura el examen Databricks Certified Associate Developer for Apache Spark?

El examen Databricks Certified Associate Developer for Apache Spark tiene 45 preguntas y un límite de 90 minutos.

¿Cuáles son los errores más comunes en el examen Databricks Certified Associate Developer for Apache Spark?

Los errores más comunes incluyen: Stateful UDFs and StateStores, Save Modes on Files, AQE Benefits, Streaming Dedup Watermarks, Pandas UDF vs API. Dedica tiempo de estudio a estas áreas para no perder puntos.

¿Qué necesitas antes del examen Databricks Spark developer?

No hay ningún requisito formal. Databricks recomienda al menos seis meses de desarrollo práctico con Spark en Python o Scala, y así están escritas las preguntas: dan por hecho que ya usaste estas APIs y no solo que leíste sobre ellas.

¿Cuánto tiempo vale la certificación Databricks Spark?

Dos años, menos que la mayoría de las certificaciones cloud. Recertificarte implica presentar la versión vigente del examen y no una evaluación de renovación reducida, así que planifica un examen completo.

¿Qué temas pesan más en el examen Spark developer?

La DataFrame and DataSet API es el dominio más grande con 30%, seguida de Spark architecture y Spark SQL con 20% cada uno. Troubleshooting and tuning y structured streaming quedan en 10% cada uno, y Spark Connect y la pandas API on Spark en 5% cada uno. Por lo tanto, la mitad del examen es la DataFrame API más la arquitectura.

¿Qué pasa si repruebas el examen Spark developer?

Databricks no fija ningún período de espera obligatorio, así que puedes reservar de nuevo apenas te sientas listo. Cada intento tiene un costo de repetición.

Pass-IT es una herramienta de estudio independiente, no afiliada a Databricks ni respaldada por Databricks; Databricks y los nombres de los exámenes son marcas de sus respectivos propietarios.

Una certificación. Un solo pago.

Acceso completo a DB-SPARK

Accede al banco completo de preguntas de esta certificación. Alex explica cada respuesta y tu Readiness Score te muestra qué estudiar después.

Comprar acceso a DB-SPARK por $29.99Un solo pago. Acceso de por vida a esta certificación.
Comprueba gratis si estás listo20 preguntas. Sin tarjeta. Mira qué estudiar antes de comprar.

Llega al 80 % de preparación y aprueba — o te devolvemos el dinero.

Cómo funciona el score →