EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-SPARK · Associate

Databricks Associate Developer for Apache Spark — Übungsfragen und Probeprüfung

Bereite dich mit eigens erstellten Übungsfragen und verständlichen Antworterklärungen auf DB-SPARK vor. Frage Alex, deinen KI-Tutor, wenn du mehr Details brauchst. Deine Ergebnisse zeigen dir, welche Themen du wiederholen solltest, und zeitlich begrenzte Probeprüfungen helfen dir, deine Zeiteinteilung zu üben.

45Fragen der Probeprüfung
90minZeitlimit

Mit Angaben von Databricks abgeglichen · August 2026 · Aktuelle Prüfungsversion

Über die Prüfung

Die Prüfung zum Databricks Certified Associate Developer for Apache Spark weist nach, dass du Anwendungen mit Apache Spark bauen kannst. Geprüft werden die DataFrame- und Dataset-APIs, Spark SQL, die Architektur und die Komponenten von Spark, Structured Streaming sowie Troubleshooting und Tuning von DataFrame-Anwendungen. Dazu kommt der sichere Umgang mit Spark Connect und der Pandas API on Spark. Der aktuelle Exam Guide formuliert dabei jede Aufgabe in Python.

Die Zertifizierung richtet sich an Entwicklerinnen und Entwickler, die schon mindestens ein halbes Jahr lang Anwendungen mit Apache Spark in Python oder Scala gebaut haben. Sie belegt, dass du die Kern-APIs von Spark praktisch beherrschst und Fragen zu Performance und Fehlersuche in einer verteilten Rechenumgebung sauber durchdenken kannst.

Fünf Fragen zu DB-SPARK ausprobieren

Übe mit fünf Fragen aus dem aktuellen Fragenpool für Databricks Certified Associate Developer for Apache Spark in der App, jeweils mit Antwort und Erklärung.

Apache Spark – Architektur und Komponenten1 / 5

Ein Spark-Executor hat 4 Cores und 16 GB Arbeitsspeicher. Wie viele Tasks können auf diesem Executor gleichzeitig laufen?

AlexGanze Erklärung von Alex

Gleichzeitige Tasks pro Executor = spark.executor.cores / spark.task.cpus. Mit dem Standardwert spark.task.cpus=1 führt jeder Core einen Task aus, also 4 Cores = 4 gleichzeitige Tasks. Ein höherer Wert für spark.task.cpus senkt die Parallelität, gibt jedem Task aber mehr CPU — nützlich für mehrfädige ML-Algorithmen oder GPU-Workloads. Der Speicher wird geteilt: der Arbeitsspeicher pro Task ≈ (Executor-Speicher × Memory Fraction) / gleichzeitige Tasks. Distraktor-Analyse: Die Option „Die Zahl der gleichzeitigen Tasks wird durch…“ ist falsch — spark.default.parallelism steuert die Gesamtzahl der Partitionen, nicht die Parallelität pro Executor. Die Option „Die Parallelität wird durch…“ ist falsch — spark.scheduler.maxRegisteredResourcesWaitingTime hat nichts mit der Zahl der Task-Slots zu tun. Die Option „Bis zu 4 Tasks können gleichzeitig laufen…“ ist falsch — memoryFraction beeinflusst die Spill-Schwellen, begrenzt aber nicht die Task-Parallelität. Ref: spark.apache.org/docs/latest/configuration.html#scheduling

Quelledatabricks.com

Fehlersuche und Tuning von Anwendungen mit der Apache Spark DataFrame API2 / 5

Ein Entwickler bemerkt, dass in einem Spark-Job ein Task einer Shuffle-Stage 10 Minuten braucht, während alle anderen Tasks in 30 Sekunden fertig sind. Wie heißt dieses Problem und wie sollte es behoben werden?

AlexGanze Erklärung von Alex

Data Skew ist ein häufiges Performance-Problem in Spark: eine ungleichmäßige Datenverteilung erzeugt Nachzügler. Symptome: ein oder wenige Tasks brauchen in der Spark UI deutlich länger als der Rest. Lösungen: (1) AQE Skew Join (spark.sql.adaptive.skewJoin.enabled=true, Standard in Spark 3.x) teilt übergroße Partitionen automatisch auf, (2) Key Salting hängt eine Zufallszahl an den schiefen Key und repliziert die kleinere Seite des Joins, (3) Broadcast Join, wenn die nicht schiefe Tabelle klein genug ist, (4) Vor-Aggregation, um das Datenvolumen vor der schiefen Operation zu senken.

Quellespark.apache.org

Verwendung der pandas-API auf Spark3 / 5

Beim Einsatz der pandas-API auf Spark schreibt ein Entwickler ps_df.to_pandas(). Was passiert?

AlexGanze Erklärung von Alex

to_pandas() ist die Notausstiegsluke von der verteilten zur lokalen Verarbeitung. Es nutzt Apache Arrow für eine effiziente Serialisierung (spaltenorientiertes Format, Zero-Copy, wo möglich). Der Datenfluss: Executors → Driver (über das Netzwerk) → Arrow-Batches → pandas-DataFrame. Zur Größe: der Driver braucht genug Speicher, um das gesamte DataFrame im pandas-Format zu halten — wegen des Overheads von Python-Objekten typischerweise das 2- bis 10-Fache der Größe im Spark-Arbeitsspeicher. Sicheres Muster: if len(ps_df) > threshold: ps_df = ps_df.sample(frac=threshold/len(ps_df)); local_df = ps_df.to_pandas().

Quellespark.apache.org

Structured Streaming4 / 5

Ein Entwickler ruft spark.streams.awaitAnyTermination(timeout=3600) auf. Was bewirkt das?

AlexGanze Erklärung von Alex

Lebenszyklus einer Streaming-Anwendung in Produktion: (1) Streaming-Queries mit writeStream.start() starten, (2) spark.streams.awaitAnyTermination() aufrufen, um den Haupt-Thread zu blockieren. Ohne diese Blockade beendet sich der Driver-Prozess und alle Streaming-Queries stoppen. awaitAnyTermination wartet darauf, dass IRGENDEINE Query stoppt (durch einen Fehler oder ein explizites stop()). Nach der Rückkehr solltest du auf Exceptions prüfen: query.exception zeigt die Fehlerdetails. Für dauerhaft laufende Produktions-Apps nutzt du awaitAnyTermination() ohne Timeout (blockiert unbegrenzt). In Notebooks ist das nicht nötig, weil der Notebook-Kernel die Session am Leben hält.

Quellespark.apache.org

Entwicklung von Anwendungen mit der Apache Spark™ DataFrame/DataSet API5 / 5

Ein Entwickler schreibt df.alias('orders').join(df2.alias('items'), col('orders.order_id') == col('items.order_id')). Was macht alias() bei einem DataFrame?

AlexGanze Erklärung von Alex

DataFrame.alias() weist einem DataFrame einen logischen Namen zu, um Spaltenreferenzen in Joins und Selektionen zu qualifizieren. Das ist unverzichtbar für Self-Joins (df.alias('current').join(df.alias('previous'), ...)) und für jeden Join, bei dem beide DataFrames Spaltennamen gemeinsam haben. Der Alias fügt einen Qualifier für die Spaltenauflösung hinzu—er kopiert keine Daten und verändert das DataFrame nicht. In SQL entspricht das FROM orders AS o. Distraktor-Analyse: Die Option “Erstellt einen logischen Scope, der die Spalten des DataFrames…” ist falsch—alias erstellt keine Isolations-Scopes und blockiert keine Optimierungen. Die Option “Deklariert einen wiederverwendbaren DataFrame-Bezeichner…” ist falsch—alias registriert nichts im Catalog der SparkSession. Die Option “Registriert eine benannte Referenz in der Symboltabelle des Query-Plans…” ist falsch—alias ist einfacher als ein Eintrag in einer Symboltabelle; es ist lediglich ein Qualifier für Spaltennamen. Ref: docs.databricks.com/en/pyspark/reference/classes/dataframe/alias.html

Quelledatabricks.com

Die Fragen in der App sind derzeit auf Englisch. Übersetzungen in dieser Vorschau gelten nur für die Vorschau. Welche Sprachen für die offizielle Prüfung verfügbar sind, erfährst du beim Prüfungsanbieter.

311 Übungsfragen

Nutze den Pass-IT-Fragenpool, um für DB-SPARK zu üben. Die Probeprüfungen sind auf 45 Fragen in 90 Minuten eingestellt.

Angaben zum Fragenpool: DB-SPARK

Prüfungsziele im Leitfaden32 im offiziellen Leitfaden aufgeführte Prüfungsziele

verteilt auf 7 Bereiche im offiziellen Prüfungsleitfaden

Größe des Fragenpools311 Fragen

= Der Umfang des Fragenpools entspricht rechnerisch 6 Zusammenstellungen mit je 45 Fragen. Daraus folgt nicht, dass jede Probeprüfung andere Fragen verwendet.

Als mit Quellen abgeglichen erfasst311 von 311

Fragen, deren Antwort, Antwortoptionen und Erklärung als mit der offiziellen Dokumentation von Databricks abgeglichen erfasst sind

Inhalte der Prüfung

Die Entwicklung mit den DataFrame- und Dataset-APIs ist mit 30 % der größte Bereich. Er deckt die Arbeit mit Spalten und Zeilen ab, dazu Joins, Aggregationen und User-defined Functions mit stateful Operators. Architektur und Komponenten (20 %) sowie Spark SQL (20 %) folgen dicht dahinter und wiegen zusammen genauso schwer wie der DataFrame-Bereich allein: geprüft werden das Driver-Executor-Modell, Partitioning und Shuffles, Lazy Evaluation und das Lesen und Schreiben über Spark SQL gegen JDBC- und File-Sources.

Troubleshooting und Tuning sowie Structured Streaming bringen je 10 % und behandeln Adaptive Query Execution und Micro-Batch-Verarbeitung mit Exactly-once-Semantik. Spark Connect und die Pandas-API von Spark sind mit je 5 % die kleinsten Bereiche: neuere oder engere Themen, die viele Lernunterlagen auslassen, die aber trotzdem in der Prüfung auftauchen.

Prüfungsplan: DB-SPARK

Developing Apache Spark™ DataFrame/DataSet API Applications30%

Manipulate DataFrame columns, rows, and structures through filtering, joining, aggregating, and date operations, and manage I/O operations and user-defined functions including stateful operators. Also covers broadcast variables, accumulators, and the purpose of broadcast joins.

≈ 24 h
Apache Spark Architecture and Components20%

Spark-Cluster-Architektur, die Rollen von Driver und Executor, Memory-Management, Partitionierung und der Catalyst-Optimizer.

≈ 16 h
Using Spark SQL20%

SQL-Abfragen in Spark, das Erstellen und Verwalten von Tabellen und Views, Window-Funktionen und die Performance-Optimierung von SQL.

≈ 16 h
Troubleshooting and Tuning Apache Spark DataFrame API Applications10%

Tune Spark performance by repartitioning or coalescing data to fight skew and cut shuffling, understand what Adaptive Query Execution does for you automatically, and read driver and executor logs to catch out-of-memory errors and underused clusters.

≈ 8 h
Structured Streaming10%

Streaming-Anwendungen bauen, Watermarking, Output-Modi, Trigger und zustandsbehaftete Verarbeitung.

≈ 8 h
Using Spark Connect to deploy applications5%

Learn what Spark Connect enables for remote application development, and compare it against Apache Spark's client, cluster, and local deployment modes.

≈ 4 h
Using Pandas API on Spark5%

See what the Pandas API on Spark buys you over plain Pandas, and write Pandas UDFs that run against that same interface.

≈ 4 h

Prüfungsformat und Fragetypen

Die Prüfung besteht aus 45 gewerteten Multiple-Choice-Fragen in einem Zeitfenster von 90 Minuten, dazu können ungewertete Pilotfragen kommen. Die Fragen sind durchgängig szenariobasiert und decken die DataFrame- und Dataset-APIs, Spark SQL und die Cluster-Architektur ab. Gefragt ist nicht nur Syntax, sondern ob eine bestimmte Operation lazy oder eager ist und wie sich eine Entscheidung beim Partitioning auf die Performance weiter unten in der Pipeline auswirkt.

Fragetypen: DB-SPARK

Multiple Choice100%

Wähle die einzelne Antwort aus, die die Anforderungen der Frage am besten erfüllt.

Offizielle Informationen zu den Frageformaten findest du bei Databricks. Die dargestellten Anteile beziehen sich auf den Pass-IT-Fragenpool und geben keine Verteilung für die offizielle Prüfung vor.

Vorbereitung auf DB-SPARK

Die Prüfung läuft online mit Remote-Proctor oder in einem Testcenter und wird nur auf Englisch angeboten. Das Zertifikat gilt zwei Jahre; für die Rezertifizierung bestehst du die jeweils aktuelle Version der Prüfung.

Vorbereitung und Organisation: DB-SPARK

Vorbereitung

Beispielhafter Lernaufwand50–120 h

Beispiel für die Planung: von 50 h mit einschlägiger Erfahrung bis 120 h beim Einstieg; dein Bedarf kann außerhalb dieser Spanne liegen

NiveauAssociate
Empfohlene VorkenntnisseKeine Voraussetzungen. Empfohlen werden mindestens 6 Monate praktische Erfahrung in der Entwicklung mit Apache Spark.

Prüfung und Erhalt der Zertifizierung

DurchführungOnline beaufsichtigt oder Prüfungszentrum
WiederholungsregelnKeine verpflichtende Wartezeit. Es fällt eine Wiederholungsgebühr an.
Gültigkeit der Zertifizierung2 Jahre

Alle 2 Jahre ist eine Rezertifizierung nötig: Dazu legst du die jeweils aktuelle Version der Prüfung erneut ab.

Häufige Fehlerquellen

Themen zum Wiederholen: DB-SPARK

  1. 01Stateful UDFs and StateStores

    Wenn du eine stateful UDF mit StateStore genauso behandelst wie eine zustandslose und dabei übersiehst, dass der State über Micro-Batches hinweg bestehen bleibt, liegst du bei Fragen zu fortgeschrittenen UDFs daneben.

  2. 02Save Modes on Files

    Bringst du die Save Modes overwrite, append, ignore und error beim Zurückschreiben von Query-Ergebnissen in Dateien durcheinander, führt das zu falschen Antworten bei Fragen zum Spark-SQL-Output.

  3. 03AQE Benefits

    Wer nicht weiß, was Adaptive Query Execution zur Laufzeit tatsächlich optimiert, etwa den Umgang mit schiefen Joins und die Größe der Shuffle-Partitionen, verliert Punkte bei Fragen zum Performance-Tuning.

  4. 04Streaming Dedup Watermarks

    Dedupliziert du ein Streaming-DataFrame ohne Watermark, wächst der State unbegrenzt, statt für verspätete Daten sauber begrenzt zu werden. Bei Fragen zu Structured Streaming kostet dich das die richtige Antwort.

  5. 05Pandas UDF vs API

    Eine Pandas UDF vektorisiert eine eigene Funktion, während die Pandas API on Spark die pandas-Syntax auf verteilten DataFrames nachbildet. Verwechselst du beides, antwortest du bei Fragen zu Pandas on Spark falsch.

Häufig gestellte Fragen

Wie lange dauert die Prüfung Databricks Certified Associate Developer for Apache Spark?

Die Prüfung Databricks Certified Associate Developer for Apache Spark umfasst 45 Fragen und hat ein Zeitlimit von 90 Minuten.

Welche Fehlerquellen sollte ich bei der Vorbereitung auf Databricks Certified Associate Developer for Apache Spark beachten?

Zu den Themen, die du wiederholen solltest, gehören Stateful UDFs and StateStores, Save Modes on Files, AQE Benefits, Streaming Dedup Watermarks, Pandas UDF vs API. Prüfe anhand von Beispielen, ob du die Unterschiede verstehst und deine Antwort begründen kannst.

Was brauchst du vor der Databricks-Spark-Developer-Prüfung?

Es gibt keine formale Voraussetzung. Databricks empfiehlt mindestens sechs Monate praktische Spark-Entwicklung in Python oder Scala, und genau so sind die Fragen geschrieben: Sie setzen voraus, dass du mit diesen APIs gearbeitet und nicht nur über sie gelesen hast.

Wie lange ist die Databricks-Spark-Zertifizierung gültig?

Zwei Jahre, also kürzer als bei den meisten Cloud-Zertifizierungen. Für die Rezertifizierung legst du die dann aktuelle Version der Prüfung ab und nicht ein verkürztes Renewal-Assessment, plane also einen vollen Prüfungstermin ein.

Welche Themen wiegen in der Spark-Developer-Prüfung am schwersten?

Die DataFrame and DataSet API ist mit 30% der größte Bereich, Spark architecture und Spark SQL folgen mit je 20%. Troubleshooting and tuning sowie structured streaming liegen bei je 10%, Spark Connect und die pandas API on Spark bei je 5%. Die halbe Prüfung besteht damit aus der DataFrame API plus Architektur.

Was passiert, wenn du die Spark-Developer-Prüfung nicht bestehst?

Databricks schreibt keine Wartezeit vor, du kannst also neu buchen, sobald du so weit bist. Für jeden Versuch fällt eine Wiederholungsgebühr an.

Eine Zertifizierung, 12 Monate

Für DB-SPARK üben

Übe gezielt für eine Zertifizierung oder wähle Pro, um für alle Zertifizierungen zu üben.

Kostenlos mit dem Üben beginnenProbiere die ersten 20 Fragen ohne Kreditkarte aus und finde heraus, ob die Übungen zu dir passen.

Für berechtigte Käufe: Geld-zurück-Garantie bei Nichtbestehen.

Garantiebedingungen ansehen →