EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEP · Professional

Databricks Data Engineer Professional — Questions d'entraînement et examen blanc

Prépare DB-DEP avec des questions d’entraînement originales et des réponses clairement expliquées. Demande des précisions à Alex, ton tuteur IA, repère les sujets à revoir grâce à tes résultats et entraîne-toi à gérer ton temps avec des examens blancs chronométrés.

59Questions de l’examen blanc
120minTemps imparti

Vérifié auprès de Databricks · août 2026 · Version actuelle de l’examen

À propos de l’examen

L’examen Databricks Certified Data Engineer Professional valide une expertise avancée dans la construction et l’optimisation de systèmes de données en production sur la Databricks Data Intelligence Platform. Il couvre l’écriture de code de traitement de données en Python et SQL, l’ingestion et la transformation des données, l’optimisation des coûts et des performances, la sécurité et la gouvernance des données, ainsi que le débogage et le déploiement de pipelines. Tu devras démontrer ta maîtrise des rouages internes de Delta Lake, de la gouvernance avec Unity Catalog et du tuning des performances Spark.

Cette certification s’adresse aux data engineers expérimentés qui construisent depuis au moins un an des pipelines de données en production sur la Databricks Lakehouse Platform. Elle atteste de ta capacité à concevoir, sécuriser et exploiter des systèmes de données complexes à grande échelle.

Essaie cinq questions sur DB-DEP

Entraîne-toi avec cinq questions de la banque actuelle de l’app pour Databricks Certified Data Engineer Professional, accompagnées de leurs réponses et explications.

Assurer la sécurité et la conformité des données1 / 5

Un data engineer découvre que les audit logs d'Unity Catalog font apparaître des tentatives d'accès non autorisées à une table de production sensible. Quelles étapes dois-tu suivre pour enquêter et corriger le problème ?

AlexExplication complète d’Alex

Déroulé d'une investigation de sécurité : 1) Détecter : déclencher une alerte sur les tentatives d'accès échouées à des tables sensibles. 2) Enquêter : interroger les audit logs pour obtenir l'identité de l'utilisateur, les schémas d'accès et les horaires. 3) Évaluer : la tentative d'accès était-elle légitime (par exemple, mauvais nom de table) ou suspecte (tentatives répétées sur des tables contenant des PII) ? 4) Corriger : révoquer les permissions excessives (principe du moindre privilège), ajouter des alertes de monitoring, mettre en place des filtres de lignes si les données doivent rester partiellement accessibles. 5) Prévenir : étiqueter les tables sensibles avec des tags de classification, créer des politiques d'accès aux données rattachées à ces tags. 6) Rendre compte : documenter l'incident, les actions menées et les changements de politique. En continu : planifier une revue hebdomadaire des audit logs pour repérer les schémas d'accès anormaux.

Sourcedocs.databricks.com

Transformation, nettoyage et qualité des données2 / 5

Un data engineer dispose d'une table Delta dont certaines colonnes contiennent des structs et des tableaux profondément imbriqués. Les analystes se plaignent que les données sont difficiles à interroger. Quelle stratégie d'aplatissement les rend accessibles tout en préservant les relations entre les données ?

AlexExplication complète d’Alex

Modèles d'aplatissement des données imbriquées : 1) Struct : df.select('order_id', 'customer.name', 'customer.email'). SQL : SELECT customer.name FROM orders. 2) Tableau : df.select('order_id', explode('items').alias('item')). SQL : SELECT EXPLODE(items) FROM orders. 3) Tableau imbriqué de structs : df.select('order_id', explode('items').alias('item')).select('order_id', 'item.product', 'item.qty'). 4) Map : df.select('order_id', explode('metadata').alias('key', 'value')). 5) Expansion par étoile : df.select('order_id', 'customer.*'). Développe le struct en colonnes individuelles. 6) Aplatissement récursif : pour les structures très imbriquées, écris une fonction récursive qui parcourt le schéma et génère les expressions select. 7) Points de vigilance : explosion de la cardinalité — EXPLODE sur des tableaux multiplie le nombre de lignes. Utilise array_size() pour estimer l'expansion. Pour les tableaux à forte cardinalité (100+ éléments), envisage une agrégation avant l'aplatissement.

Sourcedocs.databricks.com

Gouvernance des données3 / 5

Un data engineer doit mettre en place une solution permettant à différentes business units de gérer leurs propres catalogues de données de façon indépendante, tout en partageant un cadre de gouvernance commun. En quoi le namespace à trois niveaux d'Unity Catalog répond-il à ce besoin ?

AlexExplication complète d’Alex

Namespace d'Unity Catalog : 1) Trois niveaux : catalog.schema.table. Catalog : frontière organisationnelle de plus haut niveau. Schema : regroupement logique au sein d'un catalogue. Table/View/Function : objets de données. 2) Stratégies de catalogue : par business unit : finance_catalog, marketing_catalog. Par environnement : dev_catalog, staging_catalog, prod_catalog. Par domaine : customers_catalog, orders_catalog. Hybride : prod_finance, prod_marketing, dev_shared. 3) Délégation de la propriété : le propriétaire du catalogue gère son catalogue. Il peut créer des schémas et accorder des permissions. Il ne peut pas modifier les autres catalogues. 4) Cohérence de la gouvernance : l'admin du metastore définit : les permissions par défaut. La rétention des audit logs. Les exigences de classification des données. Cela s'applique à tous les catalogues. 5) Migration : depuis le metastore Hive : default (catalogue unique) → migration vers plusieurs catalogues. SHOW DATABASES → devient des schémas dans un catalogue. 6) Limites : un metastore par région. Plusieurs catalogues par metastore. Des centaines de schémas par catalogue. Des millions de tables par schéma.

Sourcedocs.databricks.com

Développer du code de traitement de données avec Python et SQL4 / 5

Un data engineer construit un job batch PySpark qui doit appliquer un calcul de scoring complexe au niveau de la ligne, écrit en pur Python, à un DataFrame de 200 millions de lignes. La logique ne peut pas s'exprimer avec les fonctions Spark SQL intégrées. L'objectif est le plus faible surcoût de sérialisation et les meilleures performances disponibles dans la DataFrame API. Quelle approche faut-il choisir ?

AlexExplication complète d’Alex

Les UDF Python standard de Spark sérialisent les données ligne par ligne à la frontière entre la JVM et Python, ce qui coûte cher à grande échelle. Les UDF Pandas (aussi appelées UDF vectorisées) utilisent à la place Apache Arrow pour transférer des batches en colonnes et exécuter du code pandas sur des Series ou des DataFrames, ce qui amortit la sérialisation sur de nombreuses lignes. Contrairement à collect(), elles gardent le travail distribué sur les executors, et contrairement à l'API RDD, elles conservent la planification Catalyst. Pour une logique Python personnalisée qui ne peut pas s'exprimer avec les fonctions natives de Spark, l'UDF Pandas est le choix haute performance recommandé. Les fonctions natives de Spark SQL restent préférables lorsque la logique peut s'exprimer avec elles. Astuce d'examen : quand une question associe 'logique Python personnalisée' et 'meilleures performances' sur de gros volumes, choisis l'UDF Pandas/vectorisée plutôt qu'une simple UDF Python.

Sourcedocs.databricks.com

Partage et fédération des données5 / 5

Un data engineer doit construire un pipeline de reverse ETL qui renvoie des données agrégées du lakehouse Delta vers un système CRM opérationnel via son API. Quelle architecture permet un reverse ETL fiable ?

AlexExplication complète d’Alex

Composants du reverse ETL : 1) Requête source : SELECT customer_id, total_orders, avg_order_value, churn_score FROM gold.customer_360 WHERE updated_at > last_sync_time. 2) Suivi de la synchronisation : CREATE TABLE sync_status (record_id STRING, target STRING, last_synced TIMESTAMP, status STRING, error_message STRING). 3) Intégration API : for batch in batches: try: response = crm_api.upsert(batch). update_status(batch, 'synced'). except RateLimitError: sleep(backoff). retry. except APIError as e: update_status(batch, 'failed', str(e)). 4) Idempotence : utiliser des appels d'API upsert (créer ou mettre à jour). Une nouvelle exécution synchronise les mêmes enregistrements sans doublons. 5) Monitoring : alerter quand le taux d'échec de synchronisation dépasse le seuil. Dashboard : enregistrements synchronisés par exécution, taux d'erreur, latence. 6) Planification : l'aligner sur la cadence de rafraîchissement de la table gold. Si gold est rafraîchie chaque jour à 6 AM, synchronise vers le CRM à 7 AM.

Sourcedocs.databricks.com

Les questions de l’app sont actuellement en anglais. Les traductions de cet aperçu concernent uniquement l’aperçu. Consulte l’organisme de certification pour connaître les langues disponibles pour l’examen officiel.

318 questions d’entraînement

Utilise la banque de questions Pass-IT pour t’entraîner pour DB-DEP. Les examens blancs sont réglés sur 59 questions en 120 minutes.

Détails de la banque de questions : DB-DEP

Objectifs du guide27 objectifs répertoriés dans le guide officiel

répartis entre 10 domaines dans le guide officiel de l’examen

Taille de la banque318 questions

= La taille de la banque équivaut à 5 séries de 59 questions. Cela ne signifie pas que chaque examen blanc utilise une série distincte.

Questions marquées comme vérifiées à partir des sources318 sur 318

questions dont la réponse, les choix et l’explication sont enregistrés comme ayant été vérifiés à partir de la documentation officielle de Databricks

Contenu de l’examen

Le développement de code pour le traitement des données est le domaine le plus lourd, avec 22 % : structure d’un projet Python pour les automation bundles, création d’UDF personnalisées, et construction de pipelines ETL prêts pour la production avec Structured Streaming et le framework de pipelines déclaratifs de Lakeflow. Vient ensuite l’optimisation des coûts et des performances, à 13 %, qui porte sur le Liquid Clustering, les deletion vectors et le tuning guidé par le query profile, plutôt que sur la construction de pipelines de base.

L’ingestion, la transformation, le partage, le monitoring, la sécurité, la gouvernance, le débogage et la modélisation complètent l’examen à 5 à 10 % chacun et couvrent des compétences opérationnelles plus étroites : configuration de Delta Sharing, masquage des PII, débogage à partir des event logs, et modélisation dimensionnelle où le Liquid Clustering remplace le partitionnement manuel.

Programme de l’examen : DB-DEP

Developing Code for Data Processing using Python and SQL22%

Structure Python projects for automation bundles and write the UDFs they call, build production ETL with Lakeflow pipelines, Autoloader, and Structured Streaming, handle change-data-capture and control-flow logic within them, and cover the result with unit and integration tests.

≈ 26 h
Data Ingestion and Acquisition7%

Schémas d'ingestion avancés, évolution des schémas, acquisition de données depuis des sources variées et gestion de formats de données complexes.

≈ 8 h
Data Transformation, Cleansing, and Quality10%

Frameworks avancés de qualité des données, expectations, stratégies de nettoyage et schémas de transformation complexes.

≈ 12 h
Data Sharing and Federation5%

Delta Sharing, accès aux données entre workspaces, schémas de fédération de données et intégration de données externes.

≈ 6 h
Monitoring and Alerting10%

Surveillance des pipelines, stratégies d'alerte, journalisation, observabilité et résolution des incidents sur les workflows de données en production.

≈ 12 h
Cost and Performance Optimization13%

Réglage des performances de Spark, dimensionnement des clusters, Liquid Clustering, Z-ordering, stratégies de mise en cache et gestion des coûts.

≈ 16 h
Ensuring Data Security and Compliance10%

Chiffrement des données, contrôles d'accès, journalisation d'audit, frameworks de conformité et bonnes pratiques de sécurité sur Databricks.

≈ 12 h
Data Governance7%

Fonctionnalités avancées d'Unity Catalog, lignage des données, étiquetage, classification et politiques de gouvernance.

≈ 8 h
Debugging and Deploying10%

CI/CD pour les pipelines de données, Databricks Asset Bundles, stratégies de test, techniques de débogage et automatisation du déploiement.

≈ 12 h
Data Modeling6%

Design large-scale data models on Delta Lake, replace manual partitioning and Z-ordering decisions with Liquid Clustering, and structure dimensional models built for fast, accurate analytical queries.

≈ 7 h

Format de l’examen et types de questions

L’examen tire 59 questions notées à choix multiple d’une session de 120 minutes, avec d’éventuelles questions pilotes non notées. Les énoncés sont très orientés scénario : optimisation des performances, mise en œuvre de la sécurité, débogage de pipelines. On attend de toi une vraie aisance avec les mécanismes internes de Delta Lake et la gouvernance Unity Catalog, pas une mémorisation superficielle des API.

Types de questions : DB-DEP

Choix multiple100%

Sélectionne la seule réponse qui répond le mieux aux exigences de la question.

Consulte Databricks pour les informations officielles sur les formats de questions. Les proportions affichées décrivent la banque de questions Pass-IT et ne permettent pas de déduire celles de l’examen officiel.

Préparation à DB-DEP

L’examen se passe en ligne avec un surveillant à distance, ou dans un centre d’examen. Il est proposé en anglais, en japonais, en portugais (BR) et en coréen. La certification reste valable deux ans ; pour la renouveler, tu dois repasser la version en vigueur de l’examen.

Préparation et modalités : DB-DEP

Préparation

Exemple de durée de préparation70–180 h

fourchette illustrative pour t’organiser : de 70 h avec une expérience pertinente à 180 h si tu débutes ; tes besoins peuvent se situer en dehors de cette fourchette

NiveauProfessionnel
Connaissances conseilléesAucun prérequis. Une expérience pratique d'au moins un an sur Databricks est recommandée. La certification Data Engineer Associate peut aider, mais elle n'est pas obligatoire.

Passage de l’examen et maintien de la certification

Modalités de passageSurveillé en ligne ou centre d'examen
Conditions de nouvelle tentativeAucun délai d'attente obligatoire. Des frais de nouvelle tentative s'appliquent.
Validité de la certification2 ans

Tu dois repasser la version en vigueur de l'examen tous les 2 ans pour rester certifié.

Erreurs fréquentes

Points à revoir : DB-DEP

  1. 01Quarantine Pipeline Design

    Ne pas prévoir un chemin de quarantaine dédié pour les enregistrements qui échouent à la validation, et se contenter de les jeter ou de les laisser passer sans rien signaler, te fait rater les questions sur les pipelines de qualité des données.

  2. 02Lakehouse Federation

    Confondre Lakehouse Federation, qui interroge les systèmes externes en direct, avec Delta Sharing, qui copie ou diffuse les données vers l’extérieur : c’est l’erreur classique sur les questions d’intégration des sources de données.

  3. 03PII Anonymization vs Masking

    Mélanger le masquage de colonnes, le filtrage de lignes et la véritable anonymisation ou pseudonymisation des PII, puis oublier le volet purge des données dans la conformité aux durées de rétention, conduit à des réponses fausses en sécurité et conformité.

  4. 04Permission Inheritance

    Si tu pars du principe qu’un grant Unity Catalog posé au niveau du catalog l’emporte toujours sur un grant plus restreint au niveau du schema ou de la table, au lieu de maîtriser le vrai modèle d’héritage, tu répondras à côté sur la gouvernance.

  5. 05DAB Project Structure

    Ne pas structurer ton projet Python pour le développement modulaire et l’intégration CI/CD au sein des Automation Bundles te met en difficulté sur les questions de déploiement, qui attendent une organisation du code précise et testable.

Questions fréquentes

Combien de temps dure l’examen Databricks Certified Data Engineer Professional ?

L’examen Databricks Certified Data Engineer Professional comporte 59 questions et le temps imparti est de 120 minutes.

Quels points méritent une attention particulière pendant la préparation de Databricks Certified Data Engineer Professional ?

Les points à revoir comprennent Quarantine Pipeline Design, Lakehouse Federation, PII Anonymization vs Masking, Permission Inheritance, DAB Project Structure. Travaille sur des exemples pour vérifier que tu comprends les distinctions et que tu peux expliquer ta réponse.

Comment réussir l'examen Databricks Data Engineer Professional ?

Écrire du code de traitement de données en Python et SQL est le plus gros domaine avec 22%, et les questions te montrent du code au lieu de le décrire. Le budget du catalogue est de 120 heures et Databricks recommande un an ou plus de pratique sur la plateforme. Ceux qui galèrent sont en général ceux qui ont préparé l'examen en lisant la documentation au lieu de construire et de casser des pipelines.

Combien de temps la certification Data Engineer Professional est-elle valable ?

Deux ans à partir de la date de réussite. Databricks recertifie par examen : tu repasses donc la version actuelle au lieu de cumuler des crédits de formation continue. Aucun délai de tolérance n'est prévu, la nouvelle tentative doit donc avoir lieu avant la date d'expiration.

Comment l'examen Data Engineer Professional est-il pondéré ?

Le code de traitement de données arrive en tête avec 22%, suivi de l'optimisation des coûts et des performances à 13%. Transformation et qualité, monitoring et alerting, sécurité et conformité, débogage et déploiement pèsent 10% chacun, le reste revenant à l'ingestion, la gouvernance, la modélisation et la fédération. Tout cela se répartit sur dix objectifs, donc l'examen échantillonne l'ensemble du métier plutôt qu'une seule de ses facettes.

Faut-il passer le Data Engineer Associate d'abord ?

Databricks qualifie la certification associate d'utile mais pas obligatoire, tu peux donc réserver directement l'examen professional. L'écart entre les deux est réel : 80 heures contre 120, et des questions de reconnaissance contre des questions de lecture de code. Si tu as moins d'un an sur la plateforme, l'examen associate est le moyen le moins cher de voir où tu en es.

Quelle expérience l'examen Data Engineer Professional suppose-t-il ?

Un an ou plus de pratique sur Databricks, selon la recommandation de Databricks elle-même. Aucune certification ne conditionne l'inscription. Le budget de 120 heures du catalogue part du principe que cette expérience est déjà là, alors considère-le comme un plancher plutôt que comme un total.

Au bout de combien de temps peux-tu repasser l'examen Data Engineer Professional ?

Immédiatement, du point de vue de la politique de Databricks : il n'y a aucun délai d'attente obligatoire. La contrainte, c'est ta propre préparation, pas une règle de carence.

Une certification, 12 mois

Entraînement pour DB-DEP

Concentre ton entraînement sur une certification ou choisis Pro pour t’entraîner à toutes les certifications.

Commencer un entraînement gratuitEssaie les 20 premières questions sans carte bancaire pour voir si cet entraînement te convient.

Pour les achats éligibles : remboursement garanti si tu échoues à ton examen.

Voir les conditions de garantie →