EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEA · Associate

Databricks Data Engineer Associate — Übungsfragen und Probeprüfung

Übe mit realistischen DB-DEA-Fragen, die an den Prüfungszielen ausgerichtet sind. Alex erklärt jede Antwort, und dein Readiness Score zeigt dir, was du als Nächstes lernen solltest.

45Fragen
90minZeitlimit

Geprüft gegen Databricks · August 2026Aktuelle Prüfungsversion

Über die Prüfung

Die Prüfung Databricks Certified Data Engineer Associate weist nach, dass du die Databricks Data Intelligence Platform für die zentralen Aufgaben im Data Engineering einsetzen kannst. Sie deckt die ETL-Entwicklung mit PySpark und SQL ab, die Datenaufnahme mit Auto Loader, COPY INTO und Lakeflow Connect, die Orchestrierung von Pipelines mit Lakeflow Jobs sowie Governance und Sicherheit über Unity Catalog. Außerdem musst du zeigen, dass du sicher mit Delta Lake umgehst, CI/CD für Datenpipelines beherrschst und Probleme in produktiven Workloads findest und behebst.

Gedacht ist die Zertifizierung für Data Engineers mit mindestens sechs Monaten praktischer Databricks-Erfahrung in Spark SQL, PySpark, Delta Lake und Databricks-Workflows. Sie belegt, dass du auf der Plattform zuverlässige, produktionsreife Datenpipelines bauen und betreiben kannst.

Was geprüft wird

Data Transformation and Modeling ist mit 22 % der schwerste Bereich, knapp vor Data Ingestion and Loading mit 21 %. Damit dreht sich fast die halbe Prüfung um die Pipeline von Bronze über Silver nach Gold: Datensätze mit PySpark und SQL bereinigen und anschließend eine Lademethode wählen, COPY INTO, Auto Loader oder Lakeflow Connect. Es folgen die Arbeit mit Lakeflow Jobs (16 %) und Governance and Security (15 %), wo es um DAG-basierte Orchestrierung und Zugriffsregeln im Unity Catalog geht.

Platform Fundamentals, CI/CD und Troubleshooting liegen jeweils bei 6 bis 10 % und prüfen enger gefasste operative Fähigkeiten: die Wahl der passenden Compute-Ressourcen, Git-basiertes Deployment über Automation Bundles und das Lesen von Stage-Metriken in der Spark UI auf Skew oder Memory Spill. Um das eigentliche Bauen von Pipelines, das den Rest der Prüfung füllt, geht es hier nicht.

Prüfungsaufbau: DB-DEA

Databricks Intelligence Platform6%

Map the architecture behind Databricks' Delta Lake storage layer and its Unity Catalog governance layer, then match workloads to the right compute service by weighing cost against performance limits.

≈ 5 Std.
Data Ingestion and Loading21%

Enable batch, streaming, and incremental data ingestion patterns using tools such as COPY INTO, Auto Loader, and Lakeflow Connect into Unity Catalog-governed tables. Also covers prioritizing between ingestion methods based on volume, frequency, and governance needs, and ingesting semi-structured and unstructured data.

≈ 17 Std.
Data Transformation and Modeling22%

Clean and transform data through the bronze, silver, and gold layers using PySpark and SQL, including joins, deduplication, aggregation, and column and row manipulation. Also covers basic Spark tuning parameters and applying data quality checks to Silver and Gold datasets.

≈ 18 Std.
Working with Lakeflow Jobs16%

Orchestrate Lakeflow Jobs with retry logic and conditional branching, wire task dependencies into a DAG, and decide whether a job should fire on a schedule or in response to new data arriving.

≈ 13 Std.
Implementing CI/CD10%

Branch, commit, and open pull requests through Databricks' Git integration, promote the same codebase across environments with variable overrides, and package jobs, pipelines, and other assets for deployment using automation bundles and the CLI.

≈ 8 Std.
Troubleshooting, Monitoring, and Optimization10%

Compare current job run times against historical baselines to catch regressions, read the Lakeflow Jobs UI for pipeline health, pinpoint bottlenecks like skew and disk spilling in the Spark UI, and diagnose cluster or library failures using both Liquid Clustering and Databricks' predictive-optimization feature.

≈ 8 Std.
Governance and Security15%

Distinguish Unity Catalog's managed tables from externally referenced ones, grant or deny access at the right level of the hierarchy, and mask or filter sensitive rows and columns using both group-based rules and centralized ABAC policies.

≈ 12 Std.

Format und Fragetypen

Die Prüfung stellt dir in 90 Minuten 45 gewertete Multiple-Choice-Fragen, dazu können ungewertete Pilotfragen kommen, die nicht in dein Ergebnis einfließen. Die Fragen sind szenariobasiert: Bronze-Tabellen lesen und sauberen Silver-Output schreiben, für eine bestimmte Quelle die passende Ingestion-Methode wählen oder einen Lakeflow-Jobs-DAG mit dem richtigen Trigger-Typ orchestrieren.

Fragetypen: DB-DEA

Multiple Choice100%

Eine einzige beste Antwort aus vier oder fünf Optionen — das Brot-und-Butter-Format der Prüfung.

Databricks bestätigt diese Fragetypen — eine prozentuale Verteilung wird nicht publiziert; die Aufteilung spiegelt unseren am Exam ausgerichteten Fragenpool wider.

Fünf DB-DEA-Fragen zum Ausprobieren

Fünf Fragen direkt aus unserem Databricks Certified Data Engineer Associate-Pool. Beantworte eine — Alex erklärt dir das Warum.

Die Prüfung und die App sind auf Englisch — diese Beispielfragen haben wir übersetzt.

Governance und Sicherheit1 / 5

Ein Data Engineer muss aus einem Notebook heraus auf die Databricks REST API zugreifen. Welche Authentifizierungsmethode wird für automatisierte Produktions-Workloads empfohlen?

AlexGanze Erklärung von Alex

OAuth M2M mit Service Principals ist die von Databricks empfohlene Authentifizierung für automatisierte Produktions-Workloads. Service Principals sind nicht-menschliche Identitäten, die über den Client-Credentials-Flow kurzlebige OAuth-Tokens erzeugen und damit die Risiken langlebiger Credentials beseitigen. Distraktor-Analyse: Cluster-scoped IAM-Rollen steuern den Zugriff auf Cluster-Ressourcen, nicht die API-Authentifizierung. Azure AD-Benutzertokens sind an interaktive Benutzersitzungen gebunden und damit für unbeaufsichtigte Automatisierung ungeeignet. PATs in Secret Scopes sind einfacher, aber langlebig und an einen Benutzer gebunden – verlässt der Benutzer das Unternehmen oder wird das PAT geleakt, ist die Pipeline kompromittiert. Best Practice: Speichere OAuth-Credentials und lies sie über dbutils.secrets.get() aus, hardcode Tokens niemals. Ref: docs.databricks.com/en/dev-tools/auth/oauth-m2m

Quelledocs.databricks.com

Datentransformation und Modellierung2 / 5

Ein Data Engineer schreibt eine Structured-Streaming-Abfrage, die ein Streaming-DataFrame mit einem statischen DataFrame joint. Um welche Art von Join handelt es sich?

AlexGanze Erklärung von Alex

Wenn du ein Streaming-DataFrame mit einem normalen (statischen) DataFrame joinst, entsteht ein Stream-Static-Join. Die statische Seite wird bei jedem Micro-Batch-Trigger neu gelesen, sodass Änderungen an der statischen Tabelle automatisch übernommen werden. Weder ein Watermark noch State-Management sind nötig. Distraktor-Analyse: Windowed Join bezeichnet zeitfensterbasierte Aggregationen in der Stream-Verarbeitung und ist keine Klassifizierung eines Join-Typs. Stateful Stream Join meint Stream-Stream-Joins, die auf beiden Seiten Watermarks brauchen, um den State zu begrenzen und unbegrenztes Wachstum zu verhindern. Temporal Lookup Join ist kein anerkannter Begriff in Spark Structured Streaming. Stream-Static-Joins eignen sich ideal, um Streaming-Daten mit sich langsam ändernden Dimensionstabellen anzureichern. Ref: docs.databricks.com/en/transform/join

Quelledocs.databricks.com

CI/CD implementieren3 / 5

Welche Aussage über Databricks Repos ist korrekt?

AlexGanze Erklärung von Alex

Databricks Repos (inzwischen Git-Ordner genannt) lassen sich in Git-Provider (GitHub, Azure DevOps, GitLab, Bitbucket) integrieren, um Notebooks und Code mit Remote-Repositories zu synchronisieren. Benutzer können klonen, branchen, committen, pushen und pullen – damit sind übliche Git-Workflows innerhalb von Databricks möglich. Distraktor-Analyse: Repos erzwingen KEINE Branch-Protection-Regeln – die werden in den Einstellungen des Git-Providers konfiguriert. Repos speichern KEINE Ausführungsergebnisse – synchronisiert werden nur Quelldateien; der Ausführungsverlauf bleibt im Workspace. Repos bieten KEINEN integrierten CI/CD-Runner – CI/CD läuft extern über GitHub Actions oder Azure DevOps Pipelines, ausgelöst durch Pushes ins Remote-Repository. Ref: docs.databricks.com/en/repos/git-operations-with-repos

Quelledocs.databricks.com

Datenaufnahme und Laden4 / 5

Worin besteht der Unterschied zwischen einem Batch-Read (spark.read) und einem Streaming-Read (spark.readStream) einer Delta-Tabelle?

AlexGanze Erklärung von Alex

Delta-Batch-Reads laden einen Snapshot der Tabelle, einschließlich Time-Travel-Snapshots, wenn eine Version oder ein Zeitstempel angegeben wird. Delta-Streaming-Reads verarbeiten über Structured Streaming den initialen Snapshot und künftige Commits als Micro-Batches, mit über Checkpoints festgehaltenem Fortschritt und Optionen wie startingVersion oder startingTimestamp. Ändert sich das Schema der Quelltabelle, nachdem ein Streaming-Read begonnen hat, dokumentiert Databricks, dass die Abfrage fehlschlägt und bei kompatiblen Schemaänderungen in der Regel neu gestartet werden muss.

Quelledocs.databricks.com

Databricks Intelligence Platform5 / 5

Was macht der Befehl CONVERT TO DELTA?

AlexGanze Erklärung von Alex

CONVERT TO DELTA führt eine In-place-Konvertierung bestehender Parquet- oder Iceberg-Tabellen ins Delta-Lake-Format durch. Der Befehl scannt die vorhandenen Datendateien, legt ein _delta_log-Transaktionslog mit den initialen Commit-Einträgen an und macht die Tabelle als Delta abfragbar – ohne Datendateien neu zu schreiben. Syntax: CONVERT TO DELTA parquet.`path` [PARTITIONED BY (col type)]. Bei Iceberg-Tabellen mit Parquet-Dateien wird das Iceberg-Manifest gelesen, um daraus das Delta-Log aufzubauen. Falsch – managed Hive-Tabellen werden nicht in externe Tabellen migriert. Falsch – konvertiert wird ZU Delta, nicht VON Delta. Falsch – Datendateien werden nicht neu geschrieben; die Konvertierung betrifft nur die Metadaten. Avro und ORC werden von CONVERT TO DELTA nicht unterstützt. Ref: docs.databricks.com/en/sql/language-manual/delta-convert-to-delta.html

Quelledocs.databricks.com

322 Fragen, gebaut wie die Prüfung

Der DB-DEA-Pool deckt jede Domain ab und wird laufend um neue Fragen erweitert. Eine Probeprüfung stellt dir 45 Fragen am Stück, mit derselben 90-Minuten-Uhr wie am Prüfungstag.

Prüfprotokoll: DB-DEA

Spec-Abgleich gegen Databricks4. August 2026

zuletzt gegen die offizielle Databricks-Quelle verifiziert

Blueprint-Deckung33 offizielle Lernziele

verteilt auf 7 Domains, laut offiziellem Prüfungsleitfaden

Pool-Größe322 Fragen

= 7 volle Probeprüfungen à 45 Fragen — nie dieselbe Frage zweimal

Kanonisch validiert322 von 322

einzeln gegen offizielle Databricks-Dokumentation geprüft — Antwort, Optionen und Erklärung, Quelle zitiert

Methodik offen dokumentiert.So entstehen unsere Fragen →

Vorbereitung auf DB-DEA

Wie lange du brauchst, hängt davon ab, wie viel Praxiserfahrung du mitbringst. Den Rest legt der Anbieter fest: wie die Prüfung abläuft, wie schnell du wiederholen darfst und wie lange das Zertifikat gültig bleibt.

Die Prüfung legst du online mit Remote-Proctor oder in einem Testcenter ab, angeboten wird sie auf Englisch, Japanisch, Portugiesisch (BR) und Koreanisch. Das Zertifikat ist zwei Jahre gültig; für die Rezertifizierung bestehst du die jeweils aktuelle Version der Prüfung.

Dein Plan: DB-DEA

Vorbereitung

Lernzeit50–120 Std.

typischerweise rund 50 Std., wenn du ohnehin mit diesen Technologien arbeitest, rund 120 Std. bei komplettem Neueinstieg

LevelAssociate
Vorher sinnvollKeine Voraussetzungen. Empfohlen werden mindestens 6 Monate praktische Erfahrung mit Databricks.

Prüfungstag & danach

PrüfungsartOnline beaufsichtigt oder Prüfungszentrum
WiederholungsregelnKeine verpflichtende Wartezeit. Es fällt eine Wiederholungsgebühr an.
Gültig2 Jahre

Alle 2 Jahre ist eine Rezertifizierung nötig: Du legst dafür einfach die aktuelle Version der Prüfung ab.

Die Stundenzahl ist unsere eigene Planungsschätzung — Databricks veröffentlicht keine Vorbereitungszeit für diese Prüfung. Ein Startwert für deinen Kalender, keine Vorgabe.

Häufige Fehler

Bei den Ingestion-Fragen geht es um mehr als Werkzeugnamen: Du musst wissen, wann die Schema-Evolution-Einstellungen von Auto Loader wirklich zählen und wann die Einfachheit von COPY INTO ausreicht, und wie Lakeflow Connect für eine gegebene Quelle mit Managed- und Standard-Connectors umgeht. Governance and Security fällt mit 15 % ins Gewicht, und GRANT, REVOKE und DENY verhalten sich unterschiedlich, je nachdem, an welcher Stelle der Unity-Catalog-Hierarchie du sie anwendest. Genau diese Unterscheidung bringt alle ins Straucheln, die bisher nur mit Berechtigungen auf Workspace-Ebene gearbeitet haben. Die Orchestrierung mit Lakeflow Jobs wird bei 16 % gern unterschätzt: Trigger-Typen, Task-Abhängigkeiten und Retry-Logik wiegen so schwer wie ein Großteil des Ingestion-Bereichs.

Stolperstellen: DB-DEA

  1. 01Gold Layer Objects

    Wenn du streaming tables, materialized views und normale views für den Gold Layer nicht auseinanderhältst, liegst du bei Fragen zur Versorgung von BI- und Analytics-Teams falsch.

  2. 02Broadcast Join Tuning

    Wenn du nicht weißt, wie autoBroadcastJoinThreshold und die übrigen Shuffle- und Parallelism-Settings den Execution Plan eines Joins beeinflussen, gehen dir Fragen zum Tuning von Transformationen durch die Lappen.

  3. 03Asset Bundle Config

    Verwechselst du umgebungsspezifische Variablen-Overrides in Automation Bundles mit einer hartkodierten Config, scheiterst du bei CI/CD-Fragen an der Promotion von Dev nach Prod.

  4. 04Cluster Startup Failures

    Wenn du library conflicts, Out-of-Memory-Fehler und fehlgeschlagene Cluster-Starts nicht anhand der Symptome in der Spark UI unterscheiden kannst, liegst du bei Troubleshooting-Fragen daneben.

  5. 05Compute Service Choice

    Eine für das Kostenmodell eines Workloads zu große oder zu kleine Compute-Option zu wählen, statt den Cluster-Typ am tatsächlichen Use Case auszurichten, kostet dich Punkte bei Fragen zu den Plattform-Grundlagen.

Pass-IT trainiert dich gezielt auf genau diese Schwächen — adaptiv & verteilt →

Häufige Fragen

Wie lange dauert die Prüfung Databricks Certified Data Engineer Associate?

Die Prüfung Databricks Certified Data Engineer Associate hat 45 Fragen und ein Zeitlimit von 90 Minuten.

Was sind häufige Fehler bei der Prüfung Databricks Certified Data Engineer Associate?

Häufige Fallstricke sind: Gold Layer Objects, Broadcast Join Tuning, Asset Bundle Config, Cluster Startup Failures, Compute Service Choice. Konzentriere deine Lernzeit auf diese Bereiche, um keine Punkte zu verlieren.

Wie ist die Prüfung Databricks Data Engineer Associate gewichtet?

Data transformation and modeling ist mit 22% der größte Bereich, gefolgt von ingestion and loading mit 21% und Lakeflow jobs mit 16%. Governance and security kommt auf 15%, CI/CD und troubleshooting liegen bei jeweils 10% und platform basics bei 6%. Ingestion und transformation machen zusammen mehr als zwei Fünftel der Prüfung aus.

Läuft die Zertifizierung Data Engineer Associate ab?

Ja, nach zwei Jahren. Databricks rezertifiziert ausschließlich per Prüfung, du legst also die dann aktuelle Version ab, statt Weiterbildungspunkte zu sammeln. Da sich die Plattform selbst schnell verändert, ist die Wiederholung meist echter Lernaufwand und keine Formsache.

Brauchst du Erfahrung vor der Prüfung Data Engineer Associate?

Für die Buchung ist keine Zertifizierung nötig. Databricks empfiehlt sechs oder mehr Monate praktische Arbeit mit der Plattform, und der Katalog rechnet mit rund 80 Stunden. Die Prüfung nennt konkrete Produktbereiche wie Lakeflow, reines Lesen der Dokumentation lässt also Lücken.

Was kommt nach dem Data Engineer Associate?

Die Prüfung Data Engineer Professional ist der direkte nächste Schritt, mit 120 Stunden veranschlagter Vorbereitung und Fragen, bei denen du Python und SQL schreiben und nicht nur wiedererkennen musst. Der Generative AI Engineer Associate ist der Schritt zur Seite, wenn deine Pipelines anfangen, Modelle zu füttern. Keine der beiden setzt die Associate-Zertifizierung voraus.

Was passiert, wenn du die Prüfung Data Engineer Associate nicht bestehst?

Es gibt keine verpflichtende Wartezeit bis zum nächsten Versuch. Databricks überlässt dir das Tempo, die praktische Grenze ist also, wie schnell du die Lücke schließt, an der du gescheitert bist.

Pass-IT ist ein unabhängiges Lernwerkzeug und weder mit Databricks verbunden noch von Databricks unterstützt; Databricks und Prüfungsnamen sind Marken ihrer jeweiligen Inhaber.

Eine Zertifizierung. Eine Zahlung.

Voller Zugang zu DB-DEA

Du bekommst den vollständigen Fragenpool für diese Zertifizierung. Alex erklärt jede Antwort, und dein Readiness Score zeigt dir, woran du als Nächstes arbeiten solltest.

Zugang zu DB-DEA für $29.99 kaufenEinmal zahlen. Dauerhafter Zugang zu dieser Zertifizierung.
Kostenlos prüfen, ob du bereit bist20 Fragen. Keine Karte nötig. Sieh vor dem Kauf, was du üben solltest.

Erreiche 80 % Readiness und bestehe die Prüfung — oder du bekommst dein Geld zurück.

So funktioniert der Score →