EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEP · Professional

Databricks Data Engineer Professional — Questions d'entraînement et examen blanc

Entraîne-toi avec des questions DB-DEP réalistes, alignées sur les objectifs de l’examen. Alex explique chaque réponse et ton score de préparation te montre quoi travailler ensuite.

59Questions
120minDurée

Vérifié auprès de Databricks · août 2026Version actuelle de l’examen

À propos de l’examen

L’examen Databricks Certified Data Engineer Professional valide une expertise avancée dans la construction et l’optimisation de systèmes de données en production sur la Databricks Data Intelligence Platform. Il couvre l’écriture de code de traitement de données en Python et SQL, l’ingestion et la transformation des données, l’optimisation des coûts et des performances, la sécurité et la gouvernance des données, ainsi que le débogage et le déploiement de pipelines. Tu devras démontrer ta maîtrise des rouages internes de Delta Lake, de la gouvernance avec Unity Catalog et du tuning des performances Spark.

Cette certification s’adresse aux data engineers expérimentés qui construisent depuis au moins un an des pipelines de données en production sur la Databricks Lakehouse Platform. Elle atteste de ta capacité à concevoir, sécuriser et exploiter des systèmes de données complexes à grande échelle.

Contenu de l’examen

Le développement de code pour le traitement des données est le domaine le plus lourd, avec 22 % : structure d’un projet Python pour les automation bundles, création d’UDF personnalisées, et construction de pipelines ETL prêts pour la production avec Structured Streaming et le framework de pipelines déclaratifs de Lakeflow. Vient ensuite l’optimisation des coûts et des performances, à 13 %, qui porte sur le Liquid Clustering, les deletion vectors et le tuning guidé par le query profile, plutôt que sur la construction de pipelines de base.

L’ingestion, la transformation, le partage, le monitoring, la sécurité, la gouvernance, le débogage et la modélisation complètent l’examen à 5 à 10 % chacun et couvrent des compétences opérationnelles plus étroites : configuration de Delta Sharing, masquage des PII, débogage à partir des event logs, et modélisation dimensionnelle où le Liquid Clustering remplace le partitionnement manuel.

Plan de l’examen : DB-DEP

Developing Code for Data Processing using Python and SQL22%

Structure Python projects for automation bundles and write the UDFs they call, build production ETL with Lakeflow pipelines, Autoloader, and Structured Streaming, handle change-data-capture and control-flow logic within them, and cover the result with unit and integration tests.

≈ 26 h
Data Ingestion and Acquisition7%

Schémas d'ingestion avancés, évolution des schémas, acquisition de données depuis des sources variées et gestion de formats de données complexes.

≈ 8 h
Data Transformation, Cleansing, and Quality10%

Frameworks avancés de qualité des données, expectations, stratégies de nettoyage et schémas de transformation complexes.

≈ 12 h
Data Sharing and Federation5%

Delta Sharing, accès aux données entre workspaces, schémas de fédération de données et intégration de données externes.

≈ 6 h
Monitoring and Alerting10%

Surveillance des pipelines, stratégies d'alerte, journalisation, observabilité et résolution des incidents sur les workflows de données en production.

≈ 12 h
Cost and Performance Optimization13%

Réglage des performances de Spark, dimensionnement des clusters, Liquid Clustering, Z-ordering, stratégies de mise en cache et gestion des coûts.

≈ 16 h
Ensuring Data Security and Compliance10%

Chiffrement des données, contrôles d'accès, journalisation d'audit, frameworks de conformité et bonnes pratiques de sécurité sur Databricks.

≈ 12 h
Data Governance7%

Fonctionnalités avancées d'Unity Catalog, lignage des données, étiquetage, classification et politiques de gouvernance.

≈ 8 h
Debugging and Deploying10%

CI/CD pour les pipelines de données, Databricks Asset Bundles, stratégies de test, techniques de débogage et automatisation du déploiement.

≈ 12 h
Data Modeling6%

Design large-scale data models on Delta Lake, replace manual partitioning and Z-ordering decisions with Liquid Clustering, and structure dimensional models built for fast, accurate analytical queries.

≈ 7 h

Format de l’examen et types de questions

L’examen tire 59 questions notées à choix multiple d’une session de 120 minutes, avec d’éventuelles questions pilotes non notées. Les énoncés sont très orientés scénario : optimisation des performances, mise en œuvre de la sécurité, débogage de pipelines. On attend de toi une vraie aisance avec les mécanismes internes de Delta Lake et la gouvernance Unity Catalog, pas une mémorisation superficielle des API.

Types de questions : DB-DEP

Choix multiple100%

Choisis la seule bonne réponse parmi quatre ou cinq options — le format de base de l’examen.

Databricks confirme ces types de questions — aucune répartition en pourcentage n’est publiée ; les parts reflètent notre banque de questions alignée sur l’examen.

Essaie cinq questions DB-DEP

Cinq questions tirées de notre banque Databricks Certified Data Engineer Professional. Réponds à une — Alex t’explique le pourquoi.

L’examen et l’app sont en anglais — ces questions d’exemple, nous les avons traduites.

Assurer la sécurité et la conformité des données1 / 5

Un data engineer découvre que les audit logs d'Unity Catalog font apparaître des tentatives d'accès non autorisées à une table de production sensible. Quelles étapes dois-tu suivre pour enquêter et corriger le problème ?

AlexExplication complète d’Alex

Déroulé d'une investigation de sécurité : 1) Détecter : déclencher une alerte sur les tentatives d'accès échouées à des tables sensibles. 2) Enquêter : interroger les audit logs pour obtenir l'identité de l'utilisateur, les schémas d'accès et les horaires. 3) Évaluer : la tentative d'accès était-elle légitime (par exemple, mauvais nom de table) ou suspecte (tentatives répétées sur des tables contenant des PII) ? 4) Corriger : révoquer les permissions excessives (principe du moindre privilège), ajouter des alertes de monitoring, mettre en place des filtres de lignes si les données doivent rester partiellement accessibles. 5) Prévenir : étiqueter les tables sensibles avec des tags de classification, créer des politiques d'accès aux données rattachées à ces tags. 6) Rendre compte : documenter l'incident, les actions menées et les changements de politique. En continu : planifier une revue hebdomadaire des audit logs pour repérer les schémas d'accès anormaux.

Sourcedocs.databricks.com

Transformation, nettoyage et qualité des données2 / 5

Un data engineer dispose d'une table Delta dont certaines colonnes contiennent des structs et des tableaux profondément imbriqués. Les analystes se plaignent que les données sont difficiles à interroger. Quelle stratégie d'aplatissement les rend accessibles tout en préservant les relations entre les données ?

AlexExplication complète d’Alex

Modèles d'aplatissement des données imbriquées : 1) Struct : df.select('order_id', 'customer.name', 'customer.email'). SQL : SELECT customer.name FROM orders. 2) Tableau : df.select('order_id', explode('items').alias('item')). SQL : SELECT EXPLODE(items) FROM orders. 3) Tableau imbriqué de structs : df.select('order_id', explode('items').alias('item')).select('order_id', 'item.product', 'item.qty'). 4) Map : df.select('order_id', explode('metadata').alias('key', 'value')). 5) Expansion par étoile : df.select('order_id', 'customer.*'). Développe le struct en colonnes individuelles. 6) Aplatissement récursif : pour les structures très imbriquées, écris une fonction récursive qui parcourt le schéma et génère les expressions select. 7) Points de vigilance : explosion de la cardinalité — EXPLODE sur des tableaux multiplie le nombre de lignes. Utilise array_size() pour estimer l'expansion. Pour les tableaux à forte cardinalité (100+ éléments), envisage une agrégation avant l'aplatissement.

Sourcedocs.databricks.com

Gouvernance des données3 / 5

Un data engineer doit mettre en place une solution permettant à différentes business units de gérer leurs propres catalogues de données de façon indépendante, tout en partageant un cadre de gouvernance commun. En quoi le namespace à trois niveaux d'Unity Catalog répond-il à ce besoin ?

AlexExplication complète d’Alex

Namespace d'Unity Catalog : 1) Trois niveaux : catalog.schema.table. Catalog : frontière organisationnelle de plus haut niveau. Schema : regroupement logique au sein d'un catalogue. Table/View/Function : objets de données. 2) Stratégies de catalogue : par business unit : finance_catalog, marketing_catalog. Par environnement : dev_catalog, staging_catalog, prod_catalog. Par domaine : customers_catalog, orders_catalog. Hybride : prod_finance, prod_marketing, dev_shared. 3) Délégation de la propriété : le propriétaire du catalogue gère son catalogue. Il peut créer des schémas et accorder des permissions. Il ne peut pas modifier les autres catalogues. 4) Cohérence de la gouvernance : l'admin du metastore définit : les permissions par défaut. La rétention des audit logs. Les exigences de classification des données. Cela s'applique à tous les catalogues. 5) Migration : depuis le metastore Hive : default (catalogue unique) → migration vers plusieurs catalogues. SHOW DATABASES → devient des schémas dans un catalogue. 6) Limites : un metastore par région. Plusieurs catalogues par metastore. Des centaines de schémas par catalogue. Des millions de tables par schéma.

Sourcedocs.databricks.com

Développer du code de traitement de données avec Python et SQL4 / 5

Un data engineer construit un job batch PySpark qui doit appliquer un calcul de scoring complexe au niveau de la ligne, écrit en pur Python, à un DataFrame de 200 millions de lignes. La logique ne peut pas s'exprimer avec les fonctions Spark SQL intégrées. L'objectif est le plus faible surcoût de sérialisation et les meilleures performances disponibles dans la DataFrame API. Quelle approche faut-il choisir ?

AlexExplication complète d’Alex

Les UDF Python standard de Spark sérialisent les données ligne par ligne à la frontière entre la JVM et Python, ce qui coûte cher à grande échelle. Les UDF Pandas (aussi appelées UDF vectorisées) utilisent à la place Apache Arrow pour transférer des batches en colonnes et exécuter du code pandas sur des Series ou des DataFrames, ce qui amortit la sérialisation sur de nombreuses lignes. Contrairement à collect(), elles gardent le travail distribué sur les executors, et contrairement à l'API RDD, elles conservent la planification Catalyst. Pour une logique Python personnalisée qui ne peut pas s'exprimer avec les fonctions natives de Spark, l'UDF Pandas est le choix haute performance recommandé. Les fonctions natives de Spark SQL restent préférables lorsque la logique peut s'exprimer avec elles. Astuce d'examen : quand une question associe 'logique Python personnalisée' et 'meilleures performances' sur de gros volumes, choisis l'UDF Pandas/vectorisée plutôt qu'une simple UDF Python.

Sourcedocs.databricks.com

Partage et fédération des données5 / 5

Un data engineer doit construire un pipeline de reverse ETL qui renvoie des données agrégées du lakehouse Delta vers un système CRM opérationnel via son API. Quelle architecture permet un reverse ETL fiable ?

AlexExplication complète d’Alex

Composants du reverse ETL : 1) Requête source : SELECT customer_id, total_orders, avg_order_value, churn_score FROM gold.customer_360 WHERE updated_at > last_sync_time. 2) Suivi de la synchronisation : CREATE TABLE sync_status (record_id STRING, target STRING, last_synced TIMESTAMP, status STRING, error_message STRING). 3) Intégration API : for batch in batches: try: response = crm_api.upsert(batch). update_status(batch, 'synced'). except RateLimitError: sleep(backoff). retry. except APIError as e: update_status(batch, 'failed', str(e)). 4) Idempotence : utiliser des appels d'API upsert (créer ou mettre à jour). Une nouvelle exécution synchronise les mêmes enregistrements sans doublons. 5) Monitoring : alerter quand le taux d'échec de synchronisation dépasse le seuil. Dashboard : enregistrements synchronisés par exécution, taux d'erreur, latence. 6) Planification : l'aligner sur la cadence de rafraîchissement de la table gold. Si gold est rafraîchie chaque jour à 6 AM, synchronise vers le CRM à 7 AM.

Sourcedocs.databricks.com

319 questions, construites comme l’examen

La banque DB-DEP couvre tous les domaines de l’examen et continue de s’enrichir de nouvelles questions. Un examen blanc te pose 59 questions d’affilée, sur le même chrono de 120 minutes que le jour de l’examen.

Procès-verbal : DB-DEP

Contrôle du programme auprès de Databricks4 août 2026

dernière vérification auprès de la source officielle Databricks

Couverture du programme27 objectifs officiels

répartis sur 10 domaines, d’après le guide officiel de l’examen

Taille de la banque319 questions

= 5 examens blancs complets de 59 questions — jamais deux fois la même question

Validation canonique319 sur 319

chacune vérifiée avec la documentation officielle Databricks — réponse, options et explication, source citée

Méthodologie documentée ouvertement.Comment les questions sont créées →

Se préparer à DB-DEP

Le temps qu’il te faut dépend de ton expérience pratique. Le reste est fixé par l’éditeur : comment l’examen se déroule, quand tu peux le repasser et combien de temps la certification reste valable.

L’examen se passe en ligne avec un surveillant à distance, ou dans un centre d’examen. Il est proposé en anglais, en japonais, en portugais (BR) et en coréen. La certification reste valable deux ans ; pour la renouveler, tu dois repasser la version en vigueur de l’examen.

Ton plan : DB-DEP

Préparation

Temps de préparation70–180 h

en général environ 70 h si tu travailles déjà avec ces technologies, environ 180 h en partant de zéro

NiveauProfessional
À maîtriser avantAucun prérequis. Une expérience pratique d'au moins un an sur Databricks est recommandée. La certification Data Engineer Associate peut aider, mais elle n'est pas obligatoire.

Le jour J et après

Mode de passageSurveillé en ligne ou centre d'examen
Politique de repriseAucun délai d'attente obligatoire. Des frais de nouvelle tentative s'appliquent.
Validité2 ans

Tu dois repasser la version en vigueur de l'examen tous les 2 ans pour rester certifié.

Ces heures sont notre propre estimation de planification — Databricks ne publie aucun temps de préparation pour cet examen. Un point de départ pour ton agenda, pas un objectif.

Erreurs courantes

À ce niveau, ce sont les rouages internes de Spark qui sont évalués, bien plus que ta familiarité avec les API : distinguer le Liquid Clustering du Z-ordering par leurs compromis respectifs, remonter un job en échec via les logs du cluster et les query profiles au lieu de deviner à partir des symptômes, savoir quand le Change Data Feed résout une limite des streaming tables que Delta Sharing ne peut pas lever. Le partage et la fédération de données ne pèsent que 5 %, mais la différence entre le partage Databricks-vers-Databricks et le protocole de partage ouvert revient dans des détails précis, directement testables. Le débogage et le déploiement valent 10 % et récompensent ceux qui ont déjà cassé un pipeline puis l’ont réparé avec des automation bundles, plutôt que d’avoir seulement lu la procédure.

Points de vigilance : DB-DEP

  1. 01Quarantine Pipeline Design

    Ne pas prévoir un chemin de quarantaine dédié pour les enregistrements qui échouent à la validation, et se contenter de les jeter ou de les laisser passer sans rien signaler, te fait rater les questions sur les pipelines de qualité des données.

  2. 02Lakehouse Federation

    Confondre Lakehouse Federation, qui interroge les systèmes externes en direct, avec Delta Sharing, qui copie ou diffuse les données vers l’extérieur : c’est l’erreur classique sur les questions d’intégration des sources de données.

  3. 03PII Anonymization vs Masking

    Mélanger le masquage de colonnes, le filtrage de lignes et la véritable anonymisation ou pseudonymisation des PII, puis oublier le volet purge des données dans la conformité aux durées de rétention, conduit à des réponses fausses en sécurité et conformité.

  4. 04Permission Inheritance

    Si tu pars du principe qu’un grant Unity Catalog posé au niveau du catalog l’emporte toujours sur un grant plus restreint au niveau du schema ou de la table, au lieu de maîtriser le vrai modèle d’héritage, tu répondras à côté sur la gouvernance.

  5. 05DAB Project Structure

    Ne pas structurer ton projet Python pour le développement modulaire et l’intégration CI/CD au sein des Automation Bundles te met en difficulté sur les questions de déploiement, qui attendent une organisation du code précise et testable.

Pass-IT t’entraîne précisément sur ces points faibles — adaptatif et espacé →

Questions fréquentes

Combien de temps dure l’examen Databricks Certified Data Engineer Professional ?

L’examen Databricks Certified Data Engineer Professional comporte 59 questions avec une limite de 120 minutes.

Quelles sont les erreurs fréquentes à l’examen Databricks Certified Data Engineer Professional ?

Les pièges fréquents incluent : Quarantine Pipeline Design, Lakehouse Federation, PII Anonymization vs Masking, Permission Inheritance, DAB Project Structure. Concentre ton temps de révision sur ces points pour ne pas perdre de points.

Comment réussir l'examen Databricks Data Engineer Professional ?

Écrire du code de traitement de données en Python et SQL est le plus gros domaine avec 22%, et les questions te montrent du code au lieu de le décrire. Le budget du catalogue est de 120 heures et Databricks recommande un an ou plus de pratique sur la plateforme. Ceux qui galèrent sont en général ceux qui ont préparé l'examen en lisant la documentation au lieu de construire et de casser des pipelines.

Combien de temps la certification Data Engineer Professional est-elle valable ?

Deux ans à partir de la date de réussite. Databricks recertifie par examen : tu repasses donc la version actuelle au lieu de cumuler des crédits de formation continue. Aucun délai de tolérance n'est prévu, la nouvelle tentative doit donc avoir lieu avant la date d'expiration.

Comment l'examen Data Engineer Professional est-il pondéré ?

Le code de traitement de données arrive en tête avec 22%, suivi de l'optimisation des coûts et des performances à 13%. Transformation et qualité, monitoring et alerting, sécurité et conformité, débogage et déploiement pèsent 10% chacun, le reste revenant à l'ingestion, la gouvernance, la modélisation et la fédération. Tout cela se répartit sur dix objectifs, donc l'examen échantillonne l'ensemble du métier plutôt qu'une seule de ses facettes.

Faut-il passer le Data Engineer Associate d'abord ?

Databricks qualifie la certification associate d'utile mais pas obligatoire, tu peux donc réserver directement l'examen professional. L'écart entre les deux est réel : 80 heures contre 120, et des questions de reconnaissance contre des questions de lecture de code. Si tu as moins d'un an sur la plateforme, l'examen associate est le moyen le moins cher de voir où tu en es.

Quelle expérience l'examen Data Engineer Professional suppose-t-il ?

Un an ou plus de pratique sur Databricks, selon la recommandation de Databricks elle-même. Aucune certification ne conditionne l'inscription. Le budget de 120 heures du catalogue part du principe que cette expérience est déjà là, alors considère-le comme un plancher plutôt que comme un total.

Au bout de combien de temps peux-tu repasser l'examen Data Engineer Professional ?

Immédiatement, du point de vue de la politique de Databricks : il n'y a aucun délai d'attente obligatoire. La contrainte, c'est ta propre préparation, pas une règle de carence.

Pass-IT est un outil de révision indépendant, ni affilié à Databricks ni approuvé par Databricks ; Databricks et les noms d’examens sont des marques de leurs propriétaires respectifs.

Une certification. Un seul paiement.

Accès complet à DB-DEP

Accède à toute la banque de questions de cette certification. Alex explique chaque réponse et ton score de préparation te montre quoi travailler ensuite.

Acheter l’accès à DB-DEP pour $29.99Un seul paiement. Accès à vie à cette certification.
Vérifie gratuitement si tu es prêt20 questions. Sans carte. Vois quoi travailler avant d’acheter.

Atteins 80 % de préparation et réussis — ou tu es remboursé.

Comment fonctionne le score →