EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEA · Associate

Databricks Data Engineer Associate — Questions d'entraînement et examen blanc

Prépare DB-DEA avec des questions d’entraînement originales et des réponses clairement expliquées. Demande des précisions à Alex, ton tuteur IA, repère les sujets à revoir grâce à tes résultats et entraîne-toi à gérer ton temps avec des examens blancs chronométrés.

45Questions de l’examen blanc
90minTemps imparti

Vérifié auprès de Databricks · août 2026 · Version actuelle de l’examen

À propos de l’examen

L’examen Databricks Certified Data Engineer Associate valide ta capacité à utiliser la Databricks Data Intelligence Platform pour les tâches d’ingénierie de données courantes. Il couvre le développement ETL avec PySpark et SQL, l’ingestion de données via Auto Loader, COPY INTO et Lakeflow Connect, l’orchestration de pipelines avec Lakeflow Jobs, ainsi que la gouvernance et la sécurité assurées par Unity Catalog. Tu dois aussi démontrer ta maîtrise de Delta Lake, du CI/CD appliqué aux pipelines de données et du dépannage des charges de travail en production.

Cette certification s’adresse aux data engineers ayant au moins six mois de pratique concrète sur Databricks, avec Spark SQL, PySpark, Delta Lake et les workflows Databricks. Elle atteste que tu sais construire et exploiter des pipelines de données fiables, prêts pour la production, sur la plateforme.

Essaie cinq questions sur DB-DEA

Entraîne-toi avec cinq questions de la banque actuelle de l’app pour Databricks Certified Data Engineer Associate, accompagnées de leurs réponses et explications.

Gouvernance et sécurité1 / 5

Un data engineer doit accéder à l'API REST Databricks depuis un notebook. Quelle méthode d'authentification est recommandée pour des charges de travail de production automatisées ?

AlexExplication complète d’Alex

OAuth M2M avec des service principals est l'authentification recommandée par Databricks pour les charges de travail de production automatisées. Les service principals sont des identités non humaines qui génèrent des tokens OAuth à courte durée de vie via le flux client credentials, ce qui élimine les risques liés aux credentials à longue durée de vie. Analyse des distracteurs : les rôles IAM à portée de cluster contrôlent l'accès aux ressources du cluster, pas l'authentification à l'API. Les tokens utilisateur Azure AD sont liés à des sessions utilisateur interactives, donc inadaptés à une automatisation sans supervision. Les PAT dans des secret scopes sont plus simples, mais ils ont une longue durée de vie et sont liés à un utilisateur : si cette personne s'en va ou si le PAT fuite, le pipeline est compromis. Bonne pratique : stocke les credentials OAuth et récupère-les avec dbutils.secrets.get(), n'écris jamais de token en dur. Ref: docs.databricks.com/en/dev-tools/auth/oauth-m2m

Sourcedocs.databricks.com

Transformation et modélisation des données2 / 5

Un data engineer écrit une requête Structured Streaming qui joint un DataFrame de streaming à un DataFrame statique. De quel type de jointure s'agit-il ?

AlexExplication complète d’Alex

Joindre un DataFrame de streaming à un DataFrame ordinaire (statique) produit une jointure stream-static. Le côté statique est relu à chaque déclenchement de micro-batch, donc les mises à jour de la table statique sont prises en compte automatiquement. Aucun watermark ni aucune gestion d'état n'est nécessaire. Analyse des distracteurs : la jointure fenêtrée désigne des agrégations basées sur des fenêtres temporelles en traitement de flux, ce n'est pas une catégorie de jointure. La jointure de streams avec état implique des jointures stream-stream, qui exigent des watermarks des deux côtés pour borner l'état et éviter une croissance illimitée. La jointure de lookup temporelle n'est pas un terme reconnu dans Spark Structured Streaming. Les jointures stream-static sont idéales pour enrichir des données en streaming avec des tables de dimensions à évolution lente. Ref: docs.databricks.com/en/transform/join

Sourcedocs.databricks.com

Mise en œuvre du CI/CD3 / 5

Quelle affirmation à propos de Databricks Repos est correcte ?

AlexExplication complète d’Alex

Databricks Repos (désormais appelés dossiers Git) s'intègrent aux fournisseurs Git (GitHub, Azure DevOps, GitLab, Bitbucket) pour synchroniser notebooks et code avec des dépôts distants. Les utilisateurs peuvent cloner, créer des branches, committer, pusher et puller, ce qui permet des workflows Git standards au sein de Databricks. Analyse des distracteurs : les Repos n'appliquent PAS de règles de protection de branche, celles-ci se configurent dans les paramètres du fournisseur Git. Les Repos ne stockent PAS les résultats d'exécution : seuls les fichiers sources sont synchronisés, l'historique des exécutions reste dans le workspace. Les Repos ne fournissent PAS de runner CI/CD intégré : le CI/CD est géré à l'extérieur via GitHub Actions ou Azure DevOps Pipelines, déclenché par les pushes vers le dépôt distant. Ref: docs.databricks.com/en/repos/git-operations-with-repos

Sourcedocs.databricks.com

Ingestion et chargement des données4 / 5

Quelle est la différence entre une lecture batch (spark.read) et une lecture en streaming (spark.readStream) d'une table Delta ?

AlexExplication complète d’Alex

Les lectures batch Delta chargent un instantané de la table, y compris des instantanés de time travel lorsqu'une version ou un timestamp est précisé. Les lectures Delta en streaming s'appuient sur Structured Streaming pour traiter l'instantané initial et les commits futurs sous forme de micro-batches, avec une progression enregistrée par checkpoints et des options comme startingVersion ou startingTimestamp. Si le schéma de la table source change après le démarrage d'une lecture en streaming, Databricks documente que la requête échoue et qu'il faut généralement la redémarrer pour les changements de schéma compatibles.

Sourcedocs.databricks.com

Databricks Intelligence Platform5 / 5

Que fait la commande CONVERT TO DELTA ?

AlexExplication complète d’Alex

CONVERT TO DELTA effectue une conversion sur place de tables Parquet ou Iceberg existantes vers le format Delta Lake. Elle scanne les fichiers de données existants, crée un log de transactions _delta_log avec les entrées du commit initial et rend la table interrogeable en tant que Delta, sans réécrire le moindre fichier de données. Syntaxe : CONVERT TO DELTA parquet.`path` [PARTITIONED BY (col type)]. Pour les tables Iceberg avec des fichiers Parquet, elle lit le manifeste Iceberg pour construire le log Delta. Incorrect : elle ne migre pas les tables Hive managées vers des tables externes. Incorrect : elle convertit VERS Delta, pas DEPUIS Delta. Incorrect : elle ne réécrit pas les fichiers de données, la conversion ne touche que les métadonnées. Avro et ORC ne sont pas pris en charge par CONVERT TO DELTA. Ref: docs.databricks.com/en/sql/language-manual/delta-convert-to-delta.html

Sourcedocs.databricks.com

Les questions de l’app sont actuellement en anglais. Les traductions de cet aperçu concernent uniquement l’aperçu. Consulte l’organisme de certification pour connaître les langues disponibles pour l’examen officiel.

322 questions d’entraînement

Utilise la banque de questions Pass-IT pour t’entraîner pour DB-DEA. Les examens blancs sont réglés sur 45 questions en 90 minutes.

Détails de la banque de questions : DB-DEA

Objectifs du guide33 objectifs répertoriés dans le guide officiel

répartis entre 7 domaines dans le guide officiel de l’examen

Taille de la banque322 questions

= La taille de la banque équivaut à 7 séries de 45 questions. Cela ne signifie pas que chaque examen blanc utilise une série distincte.

Questions marquées comme vérifiées à partir des sources322 sur 322

questions dont la réponse, les choix et l’explication sont enregistrés comme ayant été vérifiés à partir de la documentation officielle de Databricks

Contenu de l’examen

La transformation et la modélisation des données forment le domaine le plus lourd, à 22 %, juste devant l’ingestion et le chargement à 21 %. Ensemble, ces deux blocs représentent près de la moitié de l’examen et tournent autour du pipeline bronze-silver-gold : nettoyer les enregistrements avec PySpark et SQL, puis choisir une méthode d’atterrissage entre COPY INTO, Auto Loader et Lakeflow Connect. Viennent ensuite le travail avec Lakeflow Jobs (16 %) et la gouvernance et la sécurité (15 %), qui couvrent l’orchestration par DAG et les règles d’accès Unity Catalog.

Les fondamentaux de la plateforme, le CI/CD et le troubleshooting pèsent chacun entre 6 et 10 %. Ils testent des compétences opérationnelles plus étroites : le choix du compute, le déploiement basé sur Git via les automation bundles, la lecture des métriques de stage dans la Spark UI pour repérer un skew ou un spill mémoire. Rien à voir avec la construction de pipelines qui occupe tout le reste de l’examen.

Programme de l’examen : DB-DEA

Databricks Intelligence Platform6%

Map the architecture behind Databricks' Delta Lake storage layer and its Unity Catalog governance layer, then match workloads to the right compute service by weighing cost against performance limits.

≈ 5 h
Data Ingestion and Loading21%

Enable batch, streaming, and incremental data ingestion patterns using tools such as COPY INTO, Auto Loader, and Lakeflow Connect into Unity Catalog-governed tables. Also covers prioritizing between ingestion methods based on volume, frequency, and governance needs, and ingesting semi-structured and unstructured data.

≈ 17 h
Data Transformation and Modeling22%

Clean and transform data through the bronze, silver, and gold layers using PySpark and SQL, including joins, deduplication, aggregation, and column and row manipulation. Also covers basic Spark tuning parameters and applying data quality checks to Silver and Gold datasets.

≈ 18 h
Working with Lakeflow Jobs16%

Orchestrate Lakeflow Jobs with retry logic and conditional branching, wire task dependencies into a DAG, and decide whether a job should fire on a schedule or in response to new data arriving.

≈ 13 h
Implementing CI/CD10%

Branch, commit, and open pull requests through Databricks' Git integration, promote the same codebase across environments with variable overrides, and package jobs, pipelines, and other assets for deployment using automation bundles and the CLI.

≈ 8 h
Troubleshooting, Monitoring, and Optimization10%

Compare current job run times against historical baselines to catch regressions, read the Lakeflow Jobs UI for pipeline health, pinpoint bottlenecks like skew and disk spilling in the Spark UI, and diagnose cluster or library failures using both Liquid Clustering and Databricks' predictive-optimization feature.

≈ 8 h
Governance and Security15%

Distinguish Unity Catalog's managed tables from externally referenced ones, grant or deny access at the right level of the hierarchy, and mask or filter sensitive rows and columns using both group-based rules and centralized ABAC policies.

≈ 12 h

Format de l’examen et types de questions

L’examen tire 45 questions notées à choix multiple d’une session de 90 minutes, avec de la place pour des questions pilotes non notées qui n’entrent pas dans le score. Les questions partent toutes de scénarios : lire des tables bronze et produire une sortie silver propre, choisir une méthode d’ingestion pour une source donnée, ou orchestrer un DAG Lakeflow Jobs avec le bon type de déclencheur.

Types de questions : DB-DEA

Choix multiple100%

Sélectionne la seule réponse qui répond le mieux aux exigences de la question.

Consulte Databricks pour les informations officielles sur les formats de questions. Les proportions affichées décrivent la banque de questions Pass-IT et ne permettent pas de déduire celles de l’examen officiel.

Préparation à DB-DEA

L’examen se passe en ligne avec un surveillant à distance ou dans un centre d’examen, en anglais, japonais, portugais (BR) et coréen. La certification est valable deux ans, et se recertifier veut dire repasser la version en cours de l’examen.

Préparation et modalités : DB-DEA

Préparation

Exemple de durée de préparation50–120 h

fourchette illustrative pour t’organiser : de 50 h avec une expérience pertinente à 120 h si tu débutes ; tes besoins peuvent se situer en dehors de cette fourchette

NiveauAssocié
Connaissances conseilléesAucun prérequis. Une expérience pratique de Databricks d'au moins 6 mois est recommandée.

Passage de l’examen et maintien de la certification

Modalités de passageSurveillé en ligne ou centre d'examen
Conditions de nouvelle tentativeAucun délai d'attente obligatoire. Des frais de nouvelle tentative s'appliquent.
Validité de la certification2 ans

Une recertification est nécessaire tous les 2 ans : tu dois repasser la version en vigueur de l'examen.

Erreurs fréquentes

Points à revoir : DB-DEA

  1. 01Gold Layer Objects

    Si tu ne fais pas la différence entre streaming tables, materialized views et vues classiques dans la couche Gold, tu te trompes sur les questions qui portent sur la mise à disposition des données pour les équipes BI et analytics.

  2. 02Broadcast Join Tuning

    Mal connaître l’effet d’autoBroadcastJoinThreshold et des autres réglages de shuffle et de parallélisme sur le plan d’exécution d’un join, c’est perdre des points sur les questions d’optimisation des transformations.

  3. 03Asset Bundle Config

    Confondre les surcharges de variables par environnement dans les Automation Bundles avec une configuration codée en dur mène à de mauvaises réponses sur la promotion de dev vers prod, dans les questions CI/CD.

  4. 04Cluster Startup Failures

    Ne pas savoir distinguer un conflit de librairies, une erreur out-of-memory et un échec de démarrage de cluster à partir des symptômes visibles dans la Spark UI te fait rater les questions de troubleshooting.

  5. 05Compute Service Choice

    Choisir une option de compute surdimensionnée ou sous-dimensionnée par rapport au modèle de coût du workload, au lieu d’aligner le type de cluster sur le cas d’usage réel, coûte des points sur les questions de fondamentaux de la plateforme.

Questions fréquentes

Combien de temps dure l’examen Databricks Certified Data Engineer Associate ?

L’examen Databricks Certified Data Engineer Associate comporte 45 questions et le temps imparti est de 90 minutes.

Quels points méritent une attention particulière pendant la préparation de Databricks Certified Data Engineer Associate ?

Les points à revoir comprennent Gold Layer Objects, Broadcast Join Tuning, Asset Bundle Config, Cluster Startup Failures, Compute Service Choice. Travaille sur des exemples pour vérifier que tu comprends les distinctions et que tu peux expliquer ta réponse.

Comment est pondéré l'examen Databricks Data Engineer Associate ?

Data transformation and modeling est le plus gros domaine avec 22%, devant ingestion and loading à 21% et Lakeflow jobs à 16%. Governance and security représente 15%, tandis que CI/CD et troubleshooting pèsent 10% chacun et platform basics 6%. Ensemble, ingestion et transformation représentent plus des deux cinquièmes de l'examen.

La certification Data Engineer Associate expire-t-elle ?

Oui, au bout de deux ans. Databricks ne recertifie que par examen : tu repasses donc la version en vigueur à ce moment-là au lieu d'accumuler des crédits de formation continue. Comme la plateforme évolue vite, ce nouveau passage demande en général un vrai travail de révision et pas une simple formalité.

Faut-il de l'expérience avant l'examen Data Engineer Associate ?

Aucune certification n'est exigée pour t'inscrire. Databricks recommande six mois ou plus de pratique sur la plateforme, et le catalogue table sur environ 80 heures. L'examen cite des briques produit précises comme Lakeflow : lire la documentation seule laisse donc des trous.

Que faire après le Data Engineer Associate ?

L'examen Data Engineer Professional est la suite directe, avec 120 heures de préparation prévues et des questions où tu dois écrire du Python et du SQL, pas seulement les reconnaître. Le Generative AI Engineer Associate est le mouvement latéral si tes pipelines commencent à alimenter des modèles. Ni l'un ni l'autre n'exige d'avoir la certification associate au préalable.

Que se passe-t-il si tu échoues à l'examen Data Engineer Associate ?

Aucun délai d'attente obligatoire avant ta prochaine tentative. Databricks te laisse gérer le rythme : la vraie limite, c'est la vitesse à laquelle tu combles la lacune qui t'a fait échouer.

Une certification, 12 mois

Entraînement pour DB-DEA

Concentre ton entraînement sur une certification ou choisis Pro pour t’entraîner à toutes les certifications.

Commencer un entraînement gratuitEssaie les 20 premières questions sans carte bancaire pour voir si cet entraînement te convient.

Pour les achats éligibles : remboursement garanti si tu échoues à ton examen.

Voir les conditions de garantie →