EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEA · Associate

Databricks Data Engineer Associate — Übungsfragen und Probeprüfung

Bereite dich mit eigens erstellten Übungsfragen und verständlichen Antworterklärungen auf DB-DEA vor. Frage Alex, deinen KI-Tutor, wenn du mehr Details brauchst. Deine Ergebnisse zeigen dir, welche Themen du wiederholen solltest, und zeitlich begrenzte Probeprüfungen helfen dir, deine Zeiteinteilung zu üben.

45Fragen der Probeprüfung
90minZeitlimit

Mit Angaben von Databricks abgeglichen · August 2026 · Aktuelle Prüfungsversion

Über die Prüfung

Die Prüfung Databricks Certified Data Engineer Associate weist nach, dass du die Databricks Data Intelligence Platform für die zentralen Aufgaben im Data Engineering einsetzen kannst. Sie deckt die ETL-Entwicklung mit PySpark und SQL ab, die Datenaufnahme mit Auto Loader, COPY INTO und Lakeflow Connect, die Orchestrierung von Pipelines mit Lakeflow Jobs sowie Governance und Sicherheit über Unity Catalog. Außerdem musst du zeigen, dass du sicher mit Delta Lake umgehst, CI/CD für Datenpipelines beherrschst und Probleme in produktiven Workloads findest und behebst.

Gedacht ist die Zertifizierung für Data Engineers mit mindestens sechs Monaten praktischer Databricks-Erfahrung in Spark SQL, PySpark, Delta Lake und Databricks-Workflows. Sie belegt, dass du auf der Plattform zuverlässige, produktionsreife Datenpipelines bauen und betreiben kannst.

Fünf Fragen zu DB-DEA ausprobieren

Übe mit fünf Fragen aus dem aktuellen Fragenpool für Databricks Certified Data Engineer Associate in der App, jeweils mit Antwort und Erklärung.

Governance und Sicherheit1 / 5

Ein Data Engineer muss aus einem Notebook heraus auf die Databricks REST API zugreifen. Welche Authentifizierungsmethode wird für automatisierte Produktions-Workloads empfohlen?

AlexGanze Erklärung von Alex

OAuth M2M mit Service Principals ist die von Databricks empfohlene Authentifizierung für automatisierte Produktions-Workloads. Service Principals sind nicht-menschliche Identitäten, die über den Client-Credentials-Flow kurzlebige OAuth-Tokens erzeugen und damit die Risiken langlebiger Credentials beseitigen. Distraktor-Analyse: Cluster-scoped IAM-Rollen steuern den Zugriff auf Cluster-Ressourcen, nicht die API-Authentifizierung. Azure AD-Benutzertokens sind an interaktive Benutzersitzungen gebunden und damit für unbeaufsichtigte Automatisierung ungeeignet. PATs in Secret Scopes sind einfacher, aber langlebig und an einen Benutzer gebunden – verlässt der Benutzer das Unternehmen oder wird das PAT geleakt, ist die Pipeline kompromittiert. Best Practice: Speichere OAuth-Credentials und lies sie über dbutils.secrets.get() aus, hardcode Tokens niemals. Ref: docs.databricks.com/en/dev-tools/auth/oauth-m2m

Quelledocs.databricks.com

Datentransformation und Modellierung2 / 5

Ein Data Engineer schreibt eine Structured-Streaming-Abfrage, die ein Streaming-DataFrame mit einem statischen DataFrame joint. Um welche Art von Join handelt es sich?

AlexGanze Erklärung von Alex

Wenn du ein Streaming-DataFrame mit einem normalen (statischen) DataFrame joinst, entsteht ein Stream-Static-Join. Die statische Seite wird bei jedem Micro-Batch-Trigger neu gelesen, sodass Änderungen an der statischen Tabelle automatisch übernommen werden. Weder ein Watermark noch State-Management sind nötig. Distraktor-Analyse: Windowed Join bezeichnet zeitfensterbasierte Aggregationen in der Stream-Verarbeitung und ist keine Klassifizierung eines Join-Typs. Stateful Stream Join meint Stream-Stream-Joins, die auf beiden Seiten Watermarks brauchen, um den State zu begrenzen und unbegrenztes Wachstum zu verhindern. Temporal Lookup Join ist kein anerkannter Begriff in Spark Structured Streaming. Stream-Static-Joins eignen sich ideal, um Streaming-Daten mit sich langsam ändernden Dimensionstabellen anzureichern. Ref: docs.databricks.com/en/transform/join

Quelledocs.databricks.com

CI/CD implementieren3 / 5

Welche Aussage über Databricks Repos ist korrekt?

AlexGanze Erklärung von Alex

Databricks Repos (inzwischen Git-Ordner genannt) lassen sich in Git-Provider (GitHub, Azure DevOps, GitLab, Bitbucket) integrieren, um Notebooks und Code mit Remote-Repositories zu synchronisieren. Benutzer können klonen, branchen, committen, pushen und pullen – damit sind übliche Git-Workflows innerhalb von Databricks möglich. Distraktor-Analyse: Repos erzwingen KEINE Branch-Protection-Regeln – die werden in den Einstellungen des Git-Providers konfiguriert. Repos speichern KEINE Ausführungsergebnisse – synchronisiert werden nur Quelldateien; der Ausführungsverlauf bleibt im Workspace. Repos bieten KEINEN integrierten CI/CD-Runner – CI/CD läuft extern über GitHub Actions oder Azure DevOps Pipelines, ausgelöst durch Pushes ins Remote-Repository. Ref: docs.databricks.com/en/repos/git-operations-with-repos

Quelledocs.databricks.com

Datenaufnahme und Laden4 / 5

Worin besteht der Unterschied zwischen einem Batch-Read (spark.read) und einem Streaming-Read (spark.readStream) einer Delta-Tabelle?

AlexGanze Erklärung von Alex

Delta-Batch-Reads laden einen Snapshot der Tabelle, einschließlich Time-Travel-Snapshots, wenn eine Version oder ein Zeitstempel angegeben wird. Delta-Streaming-Reads verarbeiten über Structured Streaming den initialen Snapshot und künftige Commits als Micro-Batches, mit über Checkpoints festgehaltenem Fortschritt und Optionen wie startingVersion oder startingTimestamp. Ändert sich das Schema der Quelltabelle, nachdem ein Streaming-Read begonnen hat, dokumentiert Databricks, dass die Abfrage fehlschlägt und bei kompatiblen Schemaänderungen in der Regel neu gestartet werden muss.

Quelledocs.databricks.com

Databricks Intelligence Platform5 / 5

Was macht der Befehl CONVERT TO DELTA?

AlexGanze Erklärung von Alex

CONVERT TO DELTA führt eine In-place-Konvertierung bestehender Parquet- oder Iceberg-Tabellen ins Delta-Lake-Format durch. Der Befehl scannt die vorhandenen Datendateien, legt ein _delta_log-Transaktionslog mit den initialen Commit-Einträgen an und macht die Tabelle als Delta abfragbar – ohne Datendateien neu zu schreiben. Syntax: CONVERT TO DELTA parquet.`path` [PARTITIONED BY (col type)]. Bei Iceberg-Tabellen mit Parquet-Dateien wird das Iceberg-Manifest gelesen, um daraus das Delta-Log aufzubauen. Falsch – managed Hive-Tabellen werden nicht in externe Tabellen migriert. Falsch – konvertiert wird ZU Delta, nicht VON Delta. Falsch – Datendateien werden nicht neu geschrieben; die Konvertierung betrifft nur die Metadaten. Avro und ORC werden von CONVERT TO DELTA nicht unterstützt. Ref: docs.databricks.com/en/sql/language-manual/delta-convert-to-delta.html

Quelledocs.databricks.com

Die Fragen in der App sind derzeit auf Englisch. Übersetzungen in dieser Vorschau gelten nur für die Vorschau. Welche Sprachen für die offizielle Prüfung verfügbar sind, erfährst du beim Prüfungsanbieter.

322 Übungsfragen

Nutze den Pass-IT-Fragenpool, um für DB-DEA zu üben. Die Probeprüfungen sind auf 45 Fragen in 90 Minuten eingestellt.

Angaben zum Fragenpool: DB-DEA

Prüfungsziele im Leitfaden33 im offiziellen Leitfaden aufgeführte Prüfungsziele

verteilt auf 7 Bereiche im offiziellen Prüfungsleitfaden

Größe des Fragenpools322 Fragen

= Der Umfang des Fragenpools entspricht rechnerisch 7 Zusammenstellungen mit je 45 Fragen. Daraus folgt nicht, dass jede Probeprüfung andere Fragen verwendet.

Als mit Quellen abgeglichen erfasst322 von 322

Fragen, deren Antwort, Antwortoptionen und Erklärung als mit der offiziellen Dokumentation von Databricks abgeglichen erfasst sind

Inhalte der Prüfung

Data Transformation and Modeling ist mit 22 % der schwerste Bereich, knapp vor Data Ingestion and Loading mit 21 %. Damit dreht sich fast die halbe Prüfung um die Pipeline von Bronze über Silver nach Gold: Datensätze mit PySpark und SQL bereinigen und anschließend eine Lademethode wählen, COPY INTO, Auto Loader oder Lakeflow Connect. Es folgen die Arbeit mit Lakeflow Jobs (16 %) und Governance and Security (15 %), wo es um DAG-basierte Orchestrierung und Zugriffsregeln im Unity Catalog geht.

Platform Fundamentals, CI/CD und Troubleshooting liegen jeweils bei 6 bis 10 % und prüfen enger gefasste operative Fähigkeiten: die Wahl der passenden Compute-Ressourcen, Git-basiertes Deployment über Automation Bundles und das Lesen von Stage-Metriken in der Spark UI auf Skew oder Memory Spill. Um das eigentliche Bauen von Pipelines, das den Rest der Prüfung füllt, geht es hier nicht.

Prüfungsplan: DB-DEA

Databricks Intelligence Platform6%

Map the architecture behind Databricks' Delta Lake storage layer and its Unity Catalog governance layer, then match workloads to the right compute service by weighing cost against performance limits.

≈ 5 h
Data Ingestion and Loading21%

Enable batch, streaming, and incremental data ingestion patterns using tools such as COPY INTO, Auto Loader, and Lakeflow Connect into Unity Catalog-governed tables. Also covers prioritizing between ingestion methods based on volume, frequency, and governance needs, and ingesting semi-structured and unstructured data.

≈ 17 h
Data Transformation and Modeling22%

Clean and transform data through the bronze, silver, and gold layers using PySpark and SQL, including joins, deduplication, aggregation, and column and row manipulation. Also covers basic Spark tuning parameters and applying data quality checks to Silver and Gold datasets.

≈ 18 h
Working with Lakeflow Jobs16%

Orchestrate Lakeflow Jobs with retry logic and conditional branching, wire task dependencies into a DAG, and decide whether a job should fire on a schedule or in response to new data arriving.

≈ 13 h
Implementing CI/CD10%

Branch, commit, and open pull requests through Databricks' Git integration, promote the same codebase across environments with variable overrides, and package jobs, pipelines, and other assets for deployment using automation bundles and the CLI.

≈ 8 h
Troubleshooting, Monitoring, and Optimization10%

Compare current job run times against historical baselines to catch regressions, read the Lakeflow Jobs UI for pipeline health, pinpoint bottlenecks like skew and disk spilling in the Spark UI, and diagnose cluster or library failures using both Liquid Clustering and Databricks' predictive-optimization feature.

≈ 8 h
Governance and Security15%

Distinguish Unity Catalog's managed tables from externally referenced ones, grant or deny access at the right level of the hierarchy, and mask or filter sensitive rows and columns using both group-based rules and centralized ABAC policies.

≈ 12 h

Prüfungsformat und Fragetypen

Die Prüfung stellt dir in 90 Minuten 45 gewertete Multiple-Choice-Fragen, dazu können ungewertete Pilotfragen kommen, die nicht in dein Ergebnis einfließen. Die Fragen sind szenariobasiert: Bronze-Tabellen lesen und sauberen Silver-Output schreiben, für eine bestimmte Quelle die passende Ingestion-Methode wählen oder einen Lakeflow-Jobs-DAG mit dem richtigen Trigger-Typ orchestrieren.

Fragetypen: DB-DEA

Multiple Choice100%

Wähle die einzelne Antwort aus, die die Anforderungen der Frage am besten erfüllt.

Offizielle Informationen zu den Frageformaten findest du bei Databricks. Die dargestellten Anteile beziehen sich auf den Pass-IT-Fragenpool und geben keine Verteilung für die offizielle Prüfung vor.

Vorbereitung auf DB-DEA

Die Prüfung legst du online mit Remote-Proctor oder in einem Testcenter ab, angeboten wird sie auf Englisch, Japanisch, Portugiesisch (BR) und Koreanisch. Das Zertifikat ist zwei Jahre gültig; für die Rezertifizierung bestehst du die jeweils aktuelle Version der Prüfung.

Vorbereitung und Organisation: DB-DEA

Vorbereitung

Beispielhafter Lernaufwand50–120 h

Beispiel für die Planung: von 50 h mit einschlägiger Erfahrung bis 120 h beim Einstieg; dein Bedarf kann außerhalb dieser Spanne liegen

NiveauAssociate
Empfohlene VorkenntnisseKeine Voraussetzungen. Empfohlen werden mindestens 6 Monate praktische Erfahrung mit Databricks.

Prüfung und Erhalt der Zertifizierung

DurchführungOnline beaufsichtigt oder Prüfungszentrum
WiederholungsregelnKeine verpflichtende Wartezeit. Es fällt eine Wiederholungsgebühr an.
Gültigkeit der Zertifizierung2 Jahre

Alle 2 Jahre ist eine Rezertifizierung nötig: Du legst dafür einfach die aktuelle Version der Prüfung ab.

Häufige Fehlerquellen

Themen zum Wiederholen: DB-DEA

  1. 01Gold Layer Objects

    Wenn du streaming tables, materialized views und normale views für den Gold Layer nicht auseinanderhältst, liegst du bei Fragen zur Versorgung von BI- und Analytics-Teams falsch.

  2. 02Broadcast Join Tuning

    Wenn du nicht weißt, wie autoBroadcastJoinThreshold und die übrigen Shuffle- und Parallelism-Settings den Execution Plan eines Joins beeinflussen, gehen dir Fragen zum Tuning von Transformationen durch die Lappen.

  3. 03Asset Bundle Config

    Verwechselst du umgebungsspezifische Variablen-Overrides in Automation Bundles mit einer hartkodierten Config, scheiterst du bei CI/CD-Fragen an der Promotion von Dev nach Prod.

  4. 04Cluster Startup Failures

    Wenn du library conflicts, Out-of-Memory-Fehler und fehlgeschlagene Cluster-Starts nicht anhand der Symptome in der Spark UI unterscheiden kannst, liegst du bei Troubleshooting-Fragen daneben.

  5. 05Compute Service Choice

    Eine für das Kostenmodell eines Workloads zu große oder zu kleine Compute-Option zu wählen, statt den Cluster-Typ am tatsächlichen Use Case auszurichten, kostet dich Punkte bei Fragen zu den Plattform-Grundlagen.

Häufig gestellte Fragen

Wie lange dauert die Prüfung Databricks Certified Data Engineer Associate?

Die Prüfung Databricks Certified Data Engineer Associate umfasst 45 Fragen und hat ein Zeitlimit von 90 Minuten.

Welche Fehlerquellen sollte ich bei der Vorbereitung auf Databricks Certified Data Engineer Associate beachten?

Zu den Themen, die du wiederholen solltest, gehören Gold Layer Objects, Broadcast Join Tuning, Asset Bundle Config, Cluster Startup Failures, Compute Service Choice. Prüfe anhand von Beispielen, ob du die Unterschiede verstehst und deine Antwort begründen kannst.

Wie ist die Prüfung Databricks Data Engineer Associate gewichtet?

Data transformation and modeling ist mit 22% der größte Bereich, gefolgt von ingestion and loading mit 21% und Lakeflow jobs mit 16%. Governance and security kommt auf 15%, CI/CD und troubleshooting liegen bei jeweils 10% und platform basics bei 6%. Ingestion und transformation machen zusammen mehr als zwei Fünftel der Prüfung aus.

Läuft die Zertifizierung Data Engineer Associate ab?

Ja, nach zwei Jahren. Databricks rezertifiziert ausschließlich per Prüfung, du legst also die dann aktuelle Version ab, statt Weiterbildungspunkte zu sammeln. Da sich die Plattform selbst schnell verändert, ist die Wiederholung meist echter Lernaufwand und keine Formsache.

Brauchst du Erfahrung vor der Prüfung Data Engineer Associate?

Für die Buchung ist keine Zertifizierung nötig. Databricks empfiehlt sechs oder mehr Monate praktische Arbeit mit der Plattform, und der Katalog rechnet mit rund 80 Stunden. Die Prüfung nennt konkrete Produktbereiche wie Lakeflow, reines Lesen der Dokumentation lässt also Lücken.

Was kommt nach dem Data Engineer Associate?

Die Prüfung Data Engineer Professional ist der direkte nächste Schritt, mit 120 Stunden veranschlagter Vorbereitung und Fragen, bei denen du Python und SQL schreiben und nicht nur wiedererkennen musst. Der Generative AI Engineer Associate ist der Schritt zur Seite, wenn deine Pipelines anfangen, Modelle zu füttern. Keine der beiden setzt die Associate-Zertifizierung voraus.

Was passiert, wenn du die Prüfung Data Engineer Associate nicht bestehst?

Es gibt keine verpflichtende Wartezeit bis zum nächsten Versuch. Databricks überlässt dir das Tempo, die praktische Grenze ist also, wie schnell du die Lücke schließt, an der du gescheitert bist.

Eine Zertifizierung, 12 Monate

Für DB-DEA üben

Übe gezielt für eine Zertifizierung oder wähle Pro, um für alle Zertifizierungen zu üben.

Kostenlos mit dem Üben beginnenProbiere die ersten 20 Fragen ohne Kreditkarte aus und finde heraus, ob die Übungen zu dir passen.

Für berechtigte Käufe: Geld-zurück-Garantie bei Nichtbestehen.

Garantiebedingungen ansehen →