EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-SPARK · Associate

Databricks Associate Developer for Apache Spark — Preguntas de práctica y simulacro de examen

Prepara DB-SPARK con preguntas de práctica originales y respuestas explicadas con claridad. Pide más detalles a Alex, tu tutor de IA, usa tus resultados para identificar los temas que necesitas repasar y practica cómo distribuir tu tiempo con simulacros de examen cronometrados.

45Preguntas del simulacro
90minTiempo límite

Contrastado con Databricks · agosto de 2026 · Versión actual del examen

Acerca del examen

El examen Databricks Certified Associate Developer for Apache Spark valida tu capacidad para crear aplicaciones con Apache Spark. Cubre las APIs de DataFrame y Dataset, Spark SQL, la arquitectura y los componentes de Spark, Structured Streaming, y la resolución de problemas y el tuning de aplicaciones con DataFrames. Necesitas demostrar soltura con Spark Connect y con la Pandas API on Spark; la guía vigente del examen plantea todas las tareas en Python.

Esta certificación está pensada para desarrolladores con seis meses o más de experiencia creando aplicaciones con Apache Spark en Python o Scala. Demuestra que manejas con fluidez las APIs centrales de Spark en la práctica y que sabes razonar sobre rendimiento y troubleshooting en un entorno de cómputo distribuido.

Prueba cinco preguntas de DB-SPARK

Practica con cinco preguntas del banco actual de Databricks Certified Associate Developer for Apache Spark de la app, con sus respuestas y explicaciones.

Arquitectura y componentes de Apache Spark1 / 5

Un executor de Spark tiene 4 cores y 16 GB de memoria. ¿Cuántas tareas pueden ejecutarse en paralelo en ese executor?

AlexExplicación completa de Alex

Tareas concurrentes por executor = spark.executor.cores / spark.task.cpus. Con el valor por defecto spark.task.cpus=1, cada core ejecuta una tarea, así que 4 cores = 4 tareas concurrentes. Aumentar spark.task.cpus reduce la concurrencia pero le da más CPU a cada tarea — útil para algoritmos de ML multihilo o cargas de trabajo en GPU. La memoria se comparte: la memoria de trabajo de cada tarea ≈ (memoria del executor × memory fraction) / tareas concurrentes. Análisis de distractores: La opción “La cantidad de tareas concurrentes está limitada…” es incorrecta — spark.default.parallelism controla el total de particiones, no la concurrencia por executor. La opción “La concurrencia está limitada por…” es incorrecta — spark.scheduler.maxRegisteredResourcesWaitingTime no tiene relación con la cantidad de slots de tareas. La opción “Pueden ejecutarse hasta 4 tareas en paralelo…” es incorrecta — memoryFraction afecta los umbrales de spill, pero no limita la concurrencia de tareas. Ref: spark.apache.org/docs/latest/configuration.html#scheduling

Fuentedatabricks.com

Resolución de problemas y tuning de aplicaciones con la API DataFrame de Apache Spark2 / 5

Un desarrollador nota que un job de Spark tiene una tarea en una etapa de shuffle que tarda 10 minutos, mientras que todas las demás terminan en 30 segundos. ¿Cómo se llama este problema y cómo debería resolverse?

AlexExplicación completa de Alex

El data skew es un problema de rendimiento habitual en Spark: una distribución despareja de los datos genera tareas rezagadas. Síntomas: una o pocas tareas tardan mucho más que el resto en la Spark UI. Soluciones: (1) el skew join de AQE (spark.sql.adaptive.skewJoin.enabled=true, por defecto en Spark 3.x) divide automáticamente las particiones sobredimensionadas, (2) el salting de claves agrega un número aleatorio a la clave sesgada y replica el lado más chico del join, (3) un broadcast join si la tabla no sesgada es lo bastante chica, (4) una pre-agregación para reducir el volumen de datos antes de la operación sesgada.

Fuentespark.apache.org

Uso de la API de pandas sobre Spark3 / 5

Al usar la API de pandas sobre Spark, un desarrollador escribe ps_df.to_pandas(). ¿Qué pasa?

AlexExplicación completa de Alex

to_pandas() es la salida de emergencia del procesamiento distribuido al local. Usa Apache Arrow para una serialización eficiente (formato columnar, zero-copy cuando se puede). El flujo de datos: executors → driver (por la red) → batches de Arrow → DataFrame de pandas. Sobre el tamaño: el driver necesita memoria suficiente para sostener el DataFrame entero en formato pandas, que suele ser de 2 a 10 veces el tamaño que tiene en memoria en Spark por el overhead de los objetos de Python. Patrón seguro: if len(ps_df) > threshold: ps_df = ps_df.sample(frac=threshold/len(ps_df)); local_df = ps_df.to_pandas().

Fuentespark.apache.org

Structured Streaming4 / 5

Un desarrollador llama a spark.streams.awaitAnyTermination(timeout=3600). ¿Qué hace esto?

AlexExplicación completa de Alex

Ciclo de vida de una aplicación de streaming en producción: (1) arrancar las consultas de streaming con writeStream.start(), (2) llamar a spark.streams.awaitAnyTermination() para bloquear el hilo principal. Sin ese bloqueo, el proceso del driver termina y todas las consultas de streaming se detienen. awaitAnyTermination espera a que se detenga CUALQUIER consulta (por un error o por un stop() explícito). Cuando vuelve, revisa si hubo excepciones: query.exception muestra los detalles del fallo. Para apps de producción de larga duración, usa awaitAnyTermination() sin timeout (bloquea indefinidamente). En notebooks no hace falta, porque el kernel del notebook mantiene viva la sesión.

Fuentespark.apache.org

Desarrollo de aplicaciones con la API DataFrame/DataSet de Apache Spark™5 / 5

Un desarrollador escribe df.alias('orders').join(df2.alias('items'), col('orders.order_id') == col('items.order_id')). ¿Qué hace alias() en un DataFrame?

AlexExplicación completa de Alex

DataFrame.alias() asigna un nombre lógico a un DataFrame para calificar referencias a columnas en joins y selecciones. Esto es esencial para los self-joins (df.alias('current').join(df.alias('previous'), ...)) y para cualquier join en el que ambos DataFrames comparten nombres de columnas. El alias agrega un calificador para la resolución de columnas—no copia datos ni modifica el DataFrame. En SQL, esto equivale a FROM orders AS o. Análisis de distractores: La opción “Crea un ámbito lógico que aísla las columnas del DataFrame…” es incorrecta—alias no crea ámbitos de aislamiento ni bloquea optimizaciones. La opción “Declara un identificador de DataFrame reutilizable…” es incorrecta—alias no registra nada en el catálogo de la SparkSession. La opción “Registra una referencia con nombre en la tabla de símbolos del plan de consulta…” es incorrecta—alias es más simple que registrar algo en una tabla de símbolos; es solo un calificador de nombres de columna. Ref: docs.databricks.com/en/pyspark/reference/classes/dataframe/alias.html

Fuentedatabricks.com

Las preguntas de la app están actualmente en inglés. Las traducciones de esta vista previa solo se aplican a la vista previa. Consulta con el proveedor de la certificación los idiomas disponibles para el examen oficial.

311 preguntas de práctica

Utiliza el banco de preguntas de Pass-IT para practicar para DB-SPARK. Los simulacros están configurados con 45 preguntas en 90 minutos.

Datos del banco de preguntas: DB-SPARK

Objetivos de la guía32 objetivos enumerados en la guía oficial

distribuidos entre 7 dominios en la guía oficial del examen

Tamaño del banco311 preguntas

= El tamaño del banco equivale a 6 conjuntos de 45 preguntas. Esto no significa que cada simulacro utilice un conjunto distinto.

Registradas como contrastadas con fuentes311 de 311

preguntas cuya respuesta, opciones y explicación constan como contrastadas con la documentación oficial de Databricks

Contenido del examen

El desarrollo con las APIs de DataFrame y Dataset es el dominio más grande, con 30%: cubre manipulación de columnas y filas, joins, agregaciones y funciones definidas por el usuario con operadores stateful. Arquitectura y componentes (20%) y Spark SQL (20%) vienen justo detrás y, juntos, pesan tanto como el dominio de DataFrame por sí solo. Ahí se evalúa el modelo driver-executor, el particionamiento y los shuffles, la evaluación perezosa (lazy) y la lectura o escritura vía Spark SQL contra fuentes JDBC y de archivos.

Troubleshooting y tuning por un lado, y Structured Streaming por el otro, valen 10% cada uno: entran Adaptive Query Execution y el procesamiento por micro-batches con semántica exactly-once. Spark Connect y la API de Pandas de Spark son los dominios más livianos, con 5% cada uno. Son temas más nuevos o más acotados que muchas guías de estudio se saltan, pero que igual aparecen en el examen.

Temario del examen: DB-SPARK

Developing Apache Spark™ DataFrame/DataSet API Applications30%

Manipulate DataFrame columns, rows, and structures through filtering, joining, aggregating, and date operations, and manage I/O operations and user-defined functions including stateful operators. Also covers broadcast variables, accumulators, and the purpose of broadcast joins.

≈ 24 h
Apache Spark Architecture and Components20%

Arquitectura del clúster de Spark, roles de driver y executor, gestión de memoria, particionamiento y el optimizador Catalyst.

≈ 16 h
Using Spark SQL20%

Consultas SQL en Spark, creación y gestión de tablas y vistas, funciones de ventana y optimización de rendimiento de SQL.

≈ 16 h
Troubleshooting and Tuning Apache Spark DataFrame API Applications10%

Tune Spark performance by repartitioning or coalescing data to fight skew and cut shuffling, understand what Adaptive Query Execution does for you automatically, and read driver and executor logs to catch out-of-memory errors and underused clusters.

≈ 8 h
Structured Streaming10%

Creación de aplicaciones de streaming, watermarking, modos de salida, triggers y procesamiento con estado.

≈ 8 h
Using Spark Connect to deploy applications5%

Learn what Spark Connect enables for remote application development, and compare it against Apache Spark's client, cluster, and local deployment modes.

≈ 4 h
Using Pandas API on Spark5%

See what the Pandas API on Spark buys you over plain Pandas, and write Pandas UDFs that run against that same interface.

≈ 4 h

Formato del examen y tipos de preguntas

El examen tiene 45 preguntas de opción múltiple que puntúan, dentro de una ventana de 90 minutos, y puede incluir preguntas piloto que no cuentan. Las preguntas son de tipo escenario y recorren las APIs de DataFrame y Dataset, Spark SQL y la arquitectura del cluster: no basta con la sintaxis, tienes que saber si una operación es lazy o eager y cómo una decisión de particionamiento afecta el rendimiento más adelante.

Tipos de preguntas: DB-SPARK

Opción múltiple100%

Selecciona la única respuesta que mejor cumpla los requisitos de la pregunta.

Consulta a Databricks para conocer la información oficial sobre los formatos de preguntas. Las proporciones mostradas describen el banco de práctica de Pass-IT y no determinan las del examen oficial.

Preparación para DB-SPARK

El examen se rinde en línea con un proctor remoto o en un centro de evaluación, y solo está disponible en inglés. La credencial vale dos años, y recertificarte significa aprobar la versión vigente del examen.

Preparación y aspectos prácticos: DB-SPARK

Preparación

Ejemplo de tiempo de estudio50–120 h

rango orientativo para planificar: de 50 h con experiencia relevante a 120 h si empiezas desde cero; tus necesidades pueden quedar fuera de este rango

NivelAsociado
Conocimientos recomendadosNo hay requisitos previos. Se recomienda tener 6 meses o más de experiencia práctica desarrollando con Apache Spark.

Obtención y mantenimiento de la certificación

ModalidadSupervisado en línea o centro de examen
Política de repeticiónSin período de espera obligatorio. Se aplica una tarifa de reintento.
Validez de la certificación2 años

Debes recertificarte cada 2 años presentando la versión vigente del examen.

Errores frecuentes

Temas para repasar: DB-SPARK

  1. 01Stateful UDFs and StateStores

    Tratar una UDF con estado respaldada por un StateStore igual que una sin estado, sin tomar en cuenta que ese estado persiste entre micro-batches, te lleva a fallar las preguntas de UDFs avanzadas.

  2. 02Save Modes on Files

    Confundir los modos de guardado overwrite, append, ignore y error al escribir los resultados de una consulta de vuelta a archivos termina en respuestas incorrectas en las preguntas de salida de Spark SQL.

  3. 03AQE Benefits

    Si no sabes qué optimiza realmente Adaptive Query Execution en tiempo de ejecución, como el manejo de joins con skew y el dimensionamiento de las particiones de shuffle, vas a errar las preguntas de ajuste de rendimiento.

  4. 04Streaming Dedup Watermarks

    Deduplicar un DataFrame de streaming sin watermark deja que el estado crezca sin límite; no acotarlo bien para los datos que llegan tarde te cuesta puntos en las preguntas de structured streaming.

  5. 05Pandas UDF vs API

    Confundir una Pandas UDF, que vectoriza una función propia, con Pandas API on Spark, que reimplementa la sintaxis de pandas sobre DataFrames distribuidos, provoca respuestas incorrectas en las preguntas de Pandas on Spark.

Preguntas frecuentes

¿Cuánto dura el examen Databricks Certified Associate Developer for Apache Spark?

El examen Databricks Certified Associate Developer for Apache Spark tiene 45 preguntas y un tiempo límite de 90 minutos.

¿Qué errores conviene revisar al preparar Databricks Certified Associate Developer for Apache Spark?

Entre los temas que conviene repasar están Stateful UDFs and StateStores, Save Modes on Files, AQE Benefits, Streaming Dedup Watermarks, Pandas UDF vs API. Trabaja con ejemplos para comprobar que entiendes las diferencias y puedes justificar tu respuesta.

¿Qué necesitas antes del examen Databricks Spark developer?

No hay ningún requisito formal. Databricks recomienda al menos seis meses de desarrollo práctico con Spark en Python o Scala, y así están escritas las preguntas: dan por hecho que ya usaste estas APIs y no solo que leíste sobre ellas.

¿Cuánto tiempo vale la certificación Databricks Spark?

Dos años, menos que la mayoría de las certificaciones cloud. Recertificarte implica presentar la versión vigente del examen y no una evaluación de renovación reducida, así que planifica un examen completo.

¿Qué temas pesan más en el examen Spark developer?

La DataFrame and DataSet API es el dominio más grande con 30%, seguida de Spark architecture y Spark SQL con 20% cada uno. Troubleshooting and tuning y structured streaming quedan en 10% cada uno, y Spark Connect y la pandas API on Spark en 5% cada uno. Por lo tanto, la mitad del examen es la DataFrame API más la arquitectura.

¿Qué pasa si repruebas el examen Spark developer?

Databricks no fija ningún período de espera obligatorio, así que puedes reservar de nuevo apenas te sientas listo. Cada intento tiene un costo de repetición.

Una certificación, 12 meses

Práctica para DB-SPARK

Centra tu práctica en una certificación o elige Pro para practicar todas las certificaciones.

Empezar una sesión de práctica gratuitaPrueba las primeras 20 preguntas sin tarjeta para ver si la práctica te resulta útil.

Para compras elegibles: garantía de devolución del dinero si no apruebas tu examen.

Ver condiciones de la garantía →