EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-SPARK · Associate

Databricks Associate Developer for Apache Spark — Übungsfragen und Probeprüfung

Übe mit realistischen DB-SPARK-Fragen, die an den Prüfungszielen ausgerichtet sind. Alex erklärt jede Antwort, und dein Readiness Score zeigt dir, was du als Nächstes lernen solltest.

45Fragen
90minZeitlimit

Geprüft gegen Databricks · August 2026Aktuelle Prüfungsversion

Über die Prüfung

Die Prüfung zum Databricks Certified Associate Developer for Apache Spark weist nach, dass du Anwendungen mit Apache Spark bauen kannst. Geprüft werden die DataFrame- und Dataset-APIs, Spark SQL, die Architektur und die Komponenten von Spark, Structured Streaming sowie Troubleshooting und Tuning von DataFrame-Anwendungen. Dazu kommt der sichere Umgang mit Spark Connect und der Pandas API on Spark. Der aktuelle Exam Guide formuliert dabei jede Aufgabe in Python.

Die Zertifizierung richtet sich an Entwicklerinnen und Entwickler, die schon mindestens ein halbes Jahr lang Anwendungen mit Apache Spark in Python oder Scala gebaut haben. Sie belegt, dass du die Kern-APIs von Spark praktisch beherrschst und Fragen zu Performance und Fehlersuche in einer verteilten Rechenumgebung sauber durchdenken kannst.

Was geprüft wird

Die Entwicklung mit den DataFrame- und Dataset-APIs ist mit 30 % der größte Bereich. Er deckt die Arbeit mit Spalten und Zeilen ab, dazu Joins, Aggregationen und User-defined Functions mit stateful Operators. Architektur und Komponenten (20 %) sowie Spark SQL (20 %) folgen dicht dahinter und wiegen zusammen genauso schwer wie der DataFrame-Bereich allein: geprüft werden das Driver-Executor-Modell, Partitioning und Shuffles, Lazy Evaluation und das Lesen und Schreiben über Spark SQL gegen JDBC- und File-Sources.

Troubleshooting und Tuning sowie Structured Streaming bringen je 10 % und behandeln Adaptive Query Execution und Micro-Batch-Verarbeitung mit Exactly-once-Semantik. Spark Connect und die Pandas-API von Spark sind mit je 5 % die kleinsten Bereiche: neuere oder engere Themen, die viele Lernunterlagen auslassen, die aber trotzdem in der Prüfung auftauchen.

Prüfungsaufbau: DB-SPARK

Developing Apache Spark™ DataFrame/DataSet API Applications30%

Manipulate DataFrame columns, rows, and structures through filtering, joining, aggregating, and date operations, and manage I/O operations and user-defined functions including stateful operators. Also covers broadcast variables, accumulators, and the purpose of broadcast joins.

≈ 24 Std.
Apache Spark Architecture and Components20%

Spark-Cluster-Architektur, die Rollen von Driver und Executor, Memory-Management, Partitionierung und der Catalyst-Optimizer.

≈ 16 Std.
Using Spark SQL20%

SQL-Abfragen in Spark, das Erstellen und Verwalten von Tabellen und Views, Window-Funktionen und die Performance-Optimierung von SQL.

≈ 16 Std.
Troubleshooting and Tuning Apache Spark DataFrame API Applications10%

Tune Spark performance by repartitioning or coalescing data to fight skew and cut shuffling, understand what Adaptive Query Execution does for you automatically, and read driver and executor logs to catch out-of-memory errors and underused clusters.

≈ 8 Std.
Structured Streaming10%

Streaming-Anwendungen bauen, Watermarking, Output-Modi, Trigger und zustandsbehaftete Verarbeitung.

≈ 8 Std.
Using Spark Connect to deploy applications5%

Learn what Spark Connect enables for remote application development, and compare it against Apache Spark's client, cluster, and local deployment modes.

≈ 4 Std.
Using Pandas API on Spark5%

See what the Pandas API on Spark buys you over plain Pandas, and write Pandas UDFs that run against that same interface.

≈ 4 Std.

Format und Fragetypen

Die Prüfung besteht aus 45 gewerteten Multiple-Choice-Fragen in einem Zeitfenster von 90 Minuten, dazu können ungewertete Pilotfragen kommen. Die Fragen sind durchgängig szenariobasiert und decken die DataFrame- und Dataset-APIs, Spark SQL und die Cluster-Architektur ab. Gefragt ist nicht nur Syntax, sondern ob eine bestimmte Operation lazy oder eager ist und wie sich eine Entscheidung beim Partitioning auf die Performance weiter unten in der Pipeline auswirkt.

Fragetypen: DB-SPARK

Multiple Choice100%

Eine einzige beste Antwort aus vier oder fünf Optionen — das Brot-und-Butter-Format der Prüfung.

Databricks bestätigt diese Fragetypen — eine prozentuale Verteilung wird nicht publiziert; die Aufteilung spiegelt unseren am Exam ausgerichteten Fragenpool wider.

Fünf DB-SPARK-Fragen zum Ausprobieren

Fünf Fragen direkt aus unserem Databricks Certified Associate Developer for Apache Spark-Pool. Beantworte eine — Alex erklärt dir das Warum.

Die Prüfung und die App sind auf Englisch — diese Beispielfragen haben wir übersetzt.

Apache Spark – Architektur und Komponenten1 / 5

Ein Spark-Executor hat 4 Cores und 16 GB Arbeitsspeicher. Wie viele Tasks können auf diesem Executor gleichzeitig laufen?

AlexGanze Erklärung von Alex

Gleichzeitige Tasks pro Executor = spark.executor.cores / spark.task.cpus. Mit dem Standardwert spark.task.cpus=1 führt jeder Core einen Task aus, also 4 Cores = 4 gleichzeitige Tasks. Ein höherer Wert für spark.task.cpus senkt die Parallelität, gibt jedem Task aber mehr CPU — nützlich für mehrfädige ML-Algorithmen oder GPU-Workloads. Der Speicher wird geteilt: der Arbeitsspeicher pro Task ≈ (Executor-Speicher × Memory Fraction) / gleichzeitige Tasks. Distraktor-Analyse: Die Option „Die Zahl der gleichzeitigen Tasks wird durch…“ ist falsch — spark.default.parallelism steuert die Gesamtzahl der Partitionen, nicht die Parallelität pro Executor. Die Option „Die Parallelität wird durch…“ ist falsch — spark.scheduler.maxRegisteredResourcesWaitingTime hat nichts mit der Zahl der Task-Slots zu tun. Die Option „Bis zu 4 Tasks können gleichzeitig laufen…“ ist falsch — memoryFraction beeinflusst die Spill-Schwellen, begrenzt aber nicht die Task-Parallelität. Ref: spark.apache.org/docs/latest/configuration.html#scheduling

Quelledatabricks.com

Fehlersuche und Tuning von Anwendungen mit der Apache Spark DataFrame API2 / 5

Ein Entwickler bemerkt, dass in einem Spark-Job ein Task einer Shuffle-Stage 10 Minuten braucht, während alle anderen Tasks in 30 Sekunden fertig sind. Wie heißt dieses Problem und wie sollte es behoben werden?

AlexGanze Erklärung von Alex

Data Skew ist ein häufiges Performance-Problem in Spark: eine ungleichmäßige Datenverteilung erzeugt Nachzügler. Symptome: ein oder wenige Tasks brauchen in der Spark UI deutlich länger als der Rest. Lösungen: (1) AQE Skew Join (spark.sql.adaptive.skewJoin.enabled=true, Standard in Spark 3.x) teilt übergroße Partitionen automatisch auf, (2) Key Salting hängt eine Zufallszahl an den schiefen Key und repliziert die kleinere Seite des Joins, (3) Broadcast Join, wenn die nicht schiefe Tabelle klein genug ist, (4) Vor-Aggregation, um das Datenvolumen vor der schiefen Operation zu senken.

Quellespark.apache.org

Verwendung der pandas-API auf Spark3 / 5

Beim Einsatz der pandas-API auf Spark schreibt ein Entwickler ps_df.to_pandas(). Was passiert?

AlexGanze Erklärung von Alex

to_pandas() ist die Notausstiegsluke von der verteilten zur lokalen Verarbeitung. Es nutzt Apache Arrow für eine effiziente Serialisierung (spaltenorientiertes Format, Zero-Copy, wo möglich). Der Datenfluss: Executors → Driver (über das Netzwerk) → Arrow-Batches → pandas-DataFrame. Zur Größe: der Driver braucht genug Speicher, um das gesamte DataFrame im pandas-Format zu halten — wegen des Overheads von Python-Objekten typischerweise das 2- bis 10-Fache der Größe im Spark-Arbeitsspeicher. Sicheres Muster: if len(ps_df) > threshold: ps_df = ps_df.sample(frac=threshold/len(ps_df)); local_df = ps_df.to_pandas().

Quellespark.apache.org

Structured Streaming4 / 5

Ein Entwickler ruft spark.streams.awaitAnyTermination(timeout=3600) auf. Was bewirkt das?

AlexGanze Erklärung von Alex

Lebenszyklus einer Streaming-Anwendung in Produktion: (1) Streaming-Queries mit writeStream.start() starten, (2) spark.streams.awaitAnyTermination() aufrufen, um den Haupt-Thread zu blockieren. Ohne diese Blockade beendet sich der Driver-Prozess und alle Streaming-Queries stoppen. awaitAnyTermination wartet darauf, dass IRGENDEINE Query stoppt (durch einen Fehler oder ein explizites stop()). Nach der Rückkehr solltest du auf Exceptions prüfen: query.exception zeigt die Fehlerdetails. Für dauerhaft laufende Produktions-Apps nutzt du awaitAnyTermination() ohne Timeout (blockiert unbegrenzt). In Notebooks ist das nicht nötig, weil der Notebook-Kernel die Session am Leben hält.

Quellespark.apache.org

Entwicklung von Anwendungen mit der Apache Spark™ DataFrame/DataSet API5 / 5

Ein Entwickler schreibt df.alias('orders').join(df2.alias('items'), col('orders.order_id') == col('items.order_id')). Was macht alias() bei einem DataFrame?

AlexGanze Erklärung von Alex

DataFrame.alias() weist einem DataFrame einen logischen Namen zu, um Spaltenreferenzen in Joins und Selektionen zu qualifizieren. Das ist unverzichtbar für Self-Joins (df.alias('current').join(df.alias('previous'), ...)) und für jeden Join, bei dem beide DataFrames Spaltennamen gemeinsam haben. Der Alias fügt einen Qualifier für die Spaltenauflösung hinzu—er kopiert keine Daten und verändert das DataFrame nicht. In SQL entspricht das FROM orders AS o. Distraktor-Analyse: Die Option “Erstellt einen logischen Scope, der die Spalten des DataFrames…” ist falsch—alias erstellt keine Isolations-Scopes und blockiert keine Optimierungen. Die Option “Deklariert einen wiederverwendbaren DataFrame-Bezeichner…” ist falsch—alias registriert nichts im Catalog der SparkSession. Die Option “Registriert eine benannte Referenz in der Symboltabelle des Query-Plans…” ist falsch—alias ist einfacher als ein Eintrag in einer Symboltabelle; es ist lediglich ein Qualifier für Spaltennamen. Ref: docs.databricks.com/en/pyspark/reference/classes/dataframe/alias.html

Quelledatabricks.com

311 Fragen, gebaut wie die Prüfung

Der DB-SPARK-Pool deckt jede Domain ab und wird laufend um neue Fragen erweitert. Eine Probeprüfung stellt dir 45 Fragen am Stück, mit derselben 90-Minuten-Uhr wie am Prüfungstag.

Prüfprotokoll: DB-SPARK

Spec-Abgleich gegen Databricks4. August 2026

zuletzt gegen die offizielle Databricks-Quelle verifiziert

Blueprint-Deckung32 offizielle Lernziele

verteilt auf 7 Domains, laut offiziellem Prüfungsleitfaden

Pool-Größe311 Fragen

= 6 volle Probeprüfungen à 45 Fragen — nie dieselbe Frage zweimal

Kanonisch validiert311 von 311

einzeln gegen offizielle Databricks-Dokumentation geprüft — Antwort, Optionen und Erklärung, Quelle zitiert

Methodik offen dokumentiert.So entstehen unsere Fragen →

Vorbereitung auf DB-SPARK

Wie lange du brauchst, hängt davon ab, wie viel Praxiserfahrung du mitbringst. Den Rest legt der Anbieter fest: wie die Prüfung abläuft, wie schnell du wiederholen darfst und wie lange das Zertifikat gültig bleibt.

Die Prüfung läuft online mit Remote-Proctor oder in einem Testcenter und wird nur auf Englisch angeboten. Das Zertifikat gilt zwei Jahre; für die Rezertifizierung bestehst du die jeweils aktuelle Version der Prüfung.

Dein Plan: DB-SPARK

Vorbereitung

Lernzeit50–120 Std.

typischerweise rund 50 Std., wenn du ohnehin mit diesen Technologien arbeitest, rund 120 Std. bei komplettem Neueinstieg

LevelAssociate
Vorher sinnvollKeine Voraussetzungen. Empfohlen werden mindestens 6 Monate praktische Erfahrung in der Entwicklung mit Apache Spark.

Prüfungstag & danach

PrüfungsartOnline beaufsichtigt oder Prüfungszentrum
WiederholungsregelnKeine verpflichtende Wartezeit. Es fällt eine Wiederholungsgebühr an.
Gültig2 Jahre

Alle 2 Jahre ist eine Rezertifizierung nötig: Dazu legst du die jeweils aktuelle Version der Prüfung erneut ab.

Die Stundenzahl ist unsere eigene Planungsschätzung — Databricks veröffentlicht keine Vorbereitungszeit für diese Prüfung. Ein Startwert für deinen Kalender, keine Vorgabe.

Häufige Fehler

Der DataFrame-API-Bereich prüft Urteilsvermögen, nicht nur Methodennamen: Du musst eine Transformation von einer Action unterscheiden, vorhersagen, wann ein Broadcast Join hilft und wann er den Executor-Speicher flutet, und das Verhalten auf Partitionsebene unter einer gegebenen Cluster-Konfiguration durchdenken. Die Architekturfragen gehen über Definitionen hinaus bis in die Ausführungshierarchie: was zwischen dem Aufruf einer Action und dem Scheduling der Tasks durch Spark passiert und wie Caching und Storage Levels bei Speicherdruck mit der Garbage Collection zusammenspielen. Spark Connect ist ein Fünf-Prozent-Bereich, den die meisten Lernunterlagen als optional behandeln. Er kommt trotzdem dran, genauso wie die Unterschiede zwischen den Deployment Modes client, cluster und local.

Stolperstellen: DB-SPARK

  1. 01Stateful UDFs and StateStores

    Wenn du eine stateful UDF mit StateStore genauso behandelst wie eine zustandslose und dabei übersiehst, dass der State über Micro-Batches hinweg bestehen bleibt, liegst du bei Fragen zu fortgeschrittenen UDFs daneben.

  2. 02Save Modes on Files

    Bringst du die Save Modes overwrite, append, ignore und error beim Zurückschreiben von Query-Ergebnissen in Dateien durcheinander, führt das zu falschen Antworten bei Fragen zum Spark-SQL-Output.

  3. 03AQE Benefits

    Wer nicht weiß, was Adaptive Query Execution zur Laufzeit tatsächlich optimiert, etwa den Umgang mit schiefen Joins und die Größe der Shuffle-Partitionen, verliert Punkte bei Fragen zum Performance-Tuning.

  4. 04Streaming Dedup Watermarks

    Dedupliziert du ein Streaming-DataFrame ohne Watermark, wächst der State unbegrenzt, statt für verspätete Daten sauber begrenzt zu werden. Bei Fragen zu Structured Streaming kostet dich das die richtige Antwort.

  5. 05Pandas UDF vs API

    Eine Pandas UDF vektorisiert eine eigene Funktion, während die Pandas API on Spark die pandas-Syntax auf verteilten DataFrames nachbildet. Verwechselst du beides, antwortest du bei Fragen zu Pandas on Spark falsch.

Pass-IT trainiert dich gezielt auf genau diese Schwächen — adaptiv & verteilt →

Häufige Fragen

Wie lange dauert die Prüfung Databricks Certified Associate Developer for Apache Spark?

Die Prüfung Databricks Certified Associate Developer for Apache Spark hat 45 Fragen und ein Zeitlimit von 90 Minuten.

Was sind häufige Fehler bei der Prüfung Databricks Certified Associate Developer for Apache Spark?

Häufige Fallstricke sind: Stateful UDFs and StateStores, Save Modes on Files, AQE Benefits, Streaming Dedup Watermarks, Pandas UDF vs API. Konzentriere deine Lernzeit auf diese Bereiche, um keine Punkte zu verlieren.

Was brauchst du vor der Databricks-Spark-Developer-Prüfung?

Es gibt keine formale Voraussetzung. Databricks empfiehlt mindestens sechs Monate praktische Spark-Entwicklung in Python oder Scala, und genau so sind die Fragen geschrieben: Sie setzen voraus, dass du mit diesen APIs gearbeitet und nicht nur über sie gelesen hast.

Wie lange ist die Databricks-Spark-Zertifizierung gültig?

Zwei Jahre, also kürzer als bei den meisten Cloud-Zertifizierungen. Für die Rezertifizierung legst du die dann aktuelle Version der Prüfung ab und nicht ein verkürztes Renewal-Assessment, plane also einen vollen Prüfungstermin ein.

Welche Themen wiegen in der Spark-Developer-Prüfung am schwersten?

Die DataFrame and DataSet API ist mit 30% der größte Bereich, Spark architecture und Spark SQL folgen mit je 20%. Troubleshooting and tuning sowie structured streaming liegen bei je 10%, Spark Connect und die pandas API on Spark bei je 5%. Die halbe Prüfung besteht damit aus der DataFrame API plus Architektur.

Was passiert, wenn du die Spark-Developer-Prüfung nicht bestehst?

Databricks schreibt keine Wartezeit vor, du kannst also neu buchen, sobald du so weit bist. Für jeden Versuch fällt eine Wiederholungsgebühr an.

Pass-IT ist ein unabhängiges Lernwerkzeug und weder mit Databricks verbunden noch von Databricks unterstützt; Databricks und Prüfungsnamen sind Marken ihrer jeweiligen Inhaber.

Eine Zertifizierung. Eine Zahlung.

Voller Zugang zu DB-SPARK

Du bekommst den vollständigen Fragenpool für diese Zertifizierung. Alex erklärt jede Antwort, und dein Readiness Score zeigt dir, woran du als Nächstes arbeiten solltest.

Zugang zu DB-SPARK für $29.99 kaufenEinmal zahlen. Dauerhafter Zugang zu dieser Zertifizierung.
Kostenlos prüfen, ob du bereit bist20 Fragen. Keine Karte nötig. Sieh vor dem Kauf, was du üben solltest.

Erreiche 80 % Readiness und bestehe die Prüfung — oder du bekommst dein Geld zurück.

So funktioniert der Score →