EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-MLP · Professional

Databricks Machine Learning Professional — Questions d'entraînement et examen blanc

Entraîne-toi avec des questions DB-MLP réalistes, alignées sur les objectifs de l’examen. Alex explique chaque réponse et ton score de préparation te montre quoi travailler ensuite.

59Questions
120minDurée

Vérifié auprès de Databricks · août 2026Version actuelle de l’examen

À propos de l’examen

L’examen Databricks Certified Machine Learning Professional valide une expertise avancée dans la construction de systèmes de ML en production, à grande échelle, sur Databricks. Il couvre les techniques avancées de développement de modèles, la gestion du cycle de vie MLOps (CI/CD et monitoring compris) ainsi que les stratégies de déploiement de modèles : le développement de modèles et les MLOps pèsent chacun 44 % de l’examen. Tu dois démontrer ta maîtrise de la conception de pipelines de ML en production et de la gestion du cycle de vie des modèles à grande échelle.

Cette certification s’adresse aux ingénieurs ML et data scientists confirmés qui ont au moins un an d’expérience dans la mise en production de systèmes de ML sur Databricks. Elle atteste de ta capacité à exploiter ces systèmes de façon fiable, en production et à grande échelle.

Contenu de l’examen

Le développement de modèles et le MLOps sont à égalité, 44 % chacun, soit la très grande majorité de l’examen. Le développement de modèles couvre l’entraînement distribué avec SparkML, Ray et Optuna, le feature engineering point-in-time-correct, ainsi que les runs MLflow imbriqués pour les expérimentations complexes. Le MLOps porte sur le CI/CD appliqué au ML, Lakehouse Monitoring, la détection de drift et le réentraînement automatique déclenché par une dégradation des performances.

Le déploiement de modèles représente les 12 % restants : stratégies de mise en production blue-green et canary, accès à des modèles PyFunc personnalisés via un serving endpoint plutôt que par la seule interface. Ce partage à parts égales entre développement et exploitation reflète bien le quotidien d’un ML engineer senior : construire les modèles, c’est la moitié du travail, les garder en bonne santé en production, c’est l’autre moitié.

Plan de l’examen : DB-MLP

Model Development44%

Développement avancé de modèles, entraînement distribué, feature engineering à grande échelle, conception d'expériences, optimisation des hyperparamètres avec Ray/Optuna et architectures de modèles personnalisées.

≈ 53 h
MLOps44%

MLOps practices, CI/CD for ML, Databricks Asset Bundles for ML, model testing strategies, A/B testing, model monitoring, drift detection, and pipeline automation.

≈ 53 h
Model Deployment12%

Serving de modèles en production, inférence batch ou temps réel, scaling des serving endpoints et automatisation du déploiement.

≈ 14 h

Format de l’examen et types de questions

L’examen compte 59 questions notées à choix multiple dans une fenêtre de 120 minutes, avec d’éventuelles questions pilotes non notées. Attends-toi à des scénarios poussés : choisir entre Ray et Spark pour un job d’entraînement distribué, concevoir une alerte Lakehouse Monitoring dès qu’un drift dépasse un seuil, ou retenir une stratégie de déploiement pour un serving endpoint à fort trafic.

Types de questions : DB-MLP

Choix multiple100%

Choisis la seule bonne réponse parmi quatre ou cinq options — le format de base de l’examen.

Databricks confirme ces types de questions — aucune répartition en pourcentage n’est publiée ; les parts reflètent notre banque de questions alignée sur l’examen.

Essaie cinq questions DB-MLP

Cinq questions tirées de notre banque Databricks Certified Machine Learning Professional. Réponds à une — Alex t’explique le pourquoi.

L’examen et l’app sont en anglais — ces questions d’exemple, nous les avons traduites.

MLOps1 / 5

Un ingénieur en machine learning doit mettre en place une pratique MLOps dans laquelle chaque exécution d'entraînement d'un modèle est reliée au commit Git exact du code d'entraînement, à la version précise des données d'entraînement et à l'artefact de modèle produit. Qu'est-ce qui garantit cette traçabilité de bout en bout ?

AlexExplication complète d’Alex

Chaîne de provenance MLOps : 1) Code → exécution : Databricks Repos : intégration Git automatique. MLflow : logge le chemin du notebook et le SHA du commit Git. Reproductibilité : fais un checkout du commit et relance le notebook. 2) Données → exécution : version Delta Lake : snapshot exact des données d'entraînement. Hash des données : empreinte du jeu de données. Version du Feature Store : quelle version de la table de features a été utilisée. Time travel : spark.read.format('delta').option('versionAsOf', 42).table('training_data'). 3) Exécution → modèle : l'exécution MLflow contient : paramètres, métriques, artefacts. Modèle enregistré depuis l'exécution : relié via run_id. Model Registry : version → exécution → code + données. 4) Modèle → déploiement : logs de déploiement : quelle version du modèle sert les requêtes. Endpoint : référence l'URI du modèle. Table d'inférence : logge chaque prédiction. 5) Chaîne complète : prédiction → version du modèle → exécution MLflow → (commit Git + version des données) → code source et données d'origine. 6) Automatisation : autologging : capture automatiquement la plupart des liens code/modèle. Logging des données : nécessite un mlflow.log_param manuel pour la version des données. Unity Catalog : ajoute une couche de gouvernance (permissions, logs d'audit). 7) Bénéfices : reproductibilité : recréer n'importe quel modèle. Auditabilité : satisfaire les exigences de conformité. Débogage : trouver ce qui a changé quand le modèle s'est dégradé.

Sourcedocs.databricks.com

Déploiement de modèles2 / 5

Un ingénieur en machine learning doit mettre en place une solution qui sert des versions de modèle différentes selon les régions géographiques. La région UE exige un modèle entraîné avec des données conformes au RGPD (sans identifiants personnels), tandis que la région US peut utiliser toutes les features. Comment configure-t-on ce serving multi-région ?

AlexExplication complète d’Alex

Serving de modèles tenant compte de la réglementation : 1) Exigences du RGPD : minimisation des données : le modèle destiné à l'UE ne peut être entraîné que sur des features sans identifiants personnels. Limitation des finalités : les features ne servent qu'à la finalité déclarée. Droit à l'oubli : le modèle ne doit pas mémoriser des données individuelles. 2) Catégories de features : PII : nom, e-mail, téléphone, adresse, IP. Quasi-identifiants : âge + code postal + genre (la combinaison peut identifier une personne). Agrégées : montant moyen des transactions (30 derniers jours). Comportementales : nombre de connexions (aucune identification individuelle). 3) Pourquoi deux versions enregistrées : la frontière de conformité, ce sont les données d'entraînement elles-mêmes ; il te faut donc deux artefacts entraînés distincts — l'un sur le jeu de features conforme au RGPD, l'autre sur toutes les features — enregistrés côte à côte dans le Model Registry, où chaque version possède son propre lineage, sa stage et sa piste d'audit. 4) Routage des requêtes : une couche de routage placée devant l'endpoint de serving inspecte le header de région de la requête et dirige les requêtes UE vers la version conforme et les requêtes US vers la version avec toutes les features. Databricks Model Serving permet de servir plusieurs modèles et plusieurs versions d'un même modèle en même temps et te laisse interroger un modèle servi précis derrière un endpoint : router chaque requête vers une version enregistrée donnée est donc un pattern pris en charge. 5) Tests : version conforme : vérifie qu'aucune feature PII n'apparaît dans sa signature d'entrée. Version avec toutes les features : vérifie que toutes les features sont disponibles. Routage : vérifie qu'un header de région UE aboutit toujours à la version conforme. 6) Documentation de conformité : les model cards de chaque version enregistrée documentent les features utilisées. Le lineage du Model Registry retrace l'origine des données d'entraînement de chaque version. Les logs d'accès enregistrent quelle version a servi chaque requête.

Sourcedocs.databricks.com

Développement de modèles3 / 5

Lorsque tu fais du tuning d'hyperparamètres avec Hyperopt sur Databricks, quel est le principal avantage d'utiliser SparkTrials plutôt que la classe Trials par défaut ?

AlexExplication complète d’Alex

Hyperopt est une bibliothèque d'optimisation d'hyperparamètres qui prend en charge les algorithmes Tree-structured Parzen Estimators (TPE) et la recherche aléatoire. La classe Trials par défaut exécute les trials séquentiellement sur une seule machine. SparkTrials va plus loin en répartissant les trials sur un cluster Spark, où chaque worker entraîne en parallèle un modèle avec des hyperparamètres différents. C'est particulièrement efficace pour les modèles de ML mono-nœud (scikit-learn, XGBoost), où chaque trial tient sur un seul worker.

Sourcedocs.databricks.com

Gestion du cycle de vie des modèles4 / 5

Un système de monitoring de modèle détecte que les distributions des features d’entrée ont fortement dérivé par rapport à la distribution des données d’entraînement. Cependant, les métriques de performance du modèle restent stables. Que doit faire le ML engineer ?

AlexExplication complète d’Alex

Le monitoring de modèle distingue la data drift (changements de distribution des features d’entrée) de la concept drift (changements dans la relation entre les features et la cible). La data drift peut se produire sans impact immédiat sur la performance si le modèle généralise bien à la région ayant dérivé. Cependant, une data drift durable précède souvent une concept drift. La bonne pratique consiste à monitorer à la fois les métriques de drift et les métriques de performance, à configurer des alertes avec différents niveaux de sévérité, et à avoir des pipelines de réentraînement prêts à se déclencher lorsque la performance se dégrade réellement.

Sourcedocs.databricks.com

Déploiement de modèles5 / 5

Un ingénieur en machine learning doit mettre en place une solution de model serving qui renvoie non seulement une prédiction, mais aussi un score de confiance et les features qui contribuent le plus à chaque prédiction. La réponse doit contenir ces trois informations. Comment concevoir l'endpoint ?

AlexExplication complète d’Alex

Réponses enrichies en model serving : 1) Basique : {'prediction': 1}. 2) Avec confiance : {'prediction': 1, 'confidence': 0.92}. 3) Avec explication : {'prediction': 1, 'confidence': 0.92, 'top_features': [{'name': 'credit_score', 'impact': 0.15}, {'name': 'debt_ratio', 'impact': -0.08}]}. 4) Avec métadonnées : ajoute model_version, timestamp, request_id. 5) Patterns d'implémentation : predict de pyfunc → renvoie un DataFrame. Chaque colonne devient une partie de la réponse. Structures complexes : les sérialiser en chaîne JSON dans une colonne. 6) Compromis de performance : prédiction seule : ~10ms. Prédiction + confiance : ~10ms (les probabilités sont déjà calculées). Prédiction + SHAP : ~50-200ms (le calcul SHAP ajoute de la surcharge). Optimisation : ne calculer SHAP que sur demande (flag optionnel dans la requête). 7) Intégration côté client : REST API : réponse JSON avec tous les champs. SDK : parsée en objets typés. Dashboard : afficher la prédiction + une jauge de confiance + un graphique en cascade des features.

Sourcedocs.databricks.com

325 questions, construites comme l’examen

Chaque domaine de l’examen DB-MLP a assez de questions dans la banque pour être travaillé en profondeur. Un examen blanc te pose 59 questions d’affilée, sur le même chrono de 120 minutes que le jour de l’examen.

Procès-verbal : DB-MLP

Contrôle du programme auprès de Databricks13 août 2026

dernière vérification auprès de la source officielle Databricks

Couverture du programme47 objectifs officiels

répartis sur 3 domaines, d’après le guide officiel de l’examen

Taille de la banque325 questions

= 5 examens blancs complets de 59 questions — jamais deux fois la même question

Couverture des domainesles 3 domaines à leur pondération officielle

Model Development 132 · MLOps 118 · Model Deployment 75

Validation canonique325 sur 325

chacune vérifiée avec la documentation officielle Databricks — réponse, options et explication, source citée

Méthodologie documentée ouvertement.Comment les questions sont créées →

Se préparer à DB-MLP

Le temps qu’il te faut dépend de ton expérience pratique. Le reste est fixé par l’éditeur : comment l’examen se déroule, quand tu peux le repasser et combien de temps la certification reste valable.

L’examen se passe en ligne avec un surveillant à distance ou dans un centre d’examen, et il n’est proposé qu’en anglais. La certification reste valable deux ans ; pour la renouveler, il faut repasser la version en vigueur de l’examen.

Ton plan : DB-MLP

Préparation

Temps de préparation70–180 h

en général environ 70 h si tu travailles déjà avec ces technologies, environ 180 h en partant de zéro

NiveauProfessional
À maîtriser avantAucun prérequis. Une expérience pratique d'au moins un an sur Databricks ML est recommandée.

Le jour J et après

Mode de passageSurveillé en ligne ou centre d'examen
Politique de repriseAucun délai d'attente obligatoire. Des frais de nouvelle tentative s'appliquent.
Validité2 ans

Tu dois te recertifier tous les 2 ans en repassant la version en vigueur de l'examen.

Ces heures sont notre propre estimation de planification — Databricks ne publie aucun temps de préparation pour cet examen. Un point de départ pour ton agenda, pas un objectif.

Erreurs courantes

À ce niveau, le MLOps évalue ton jugement en production bien plus que la théorie des processus : reconnaître quel type de table Lakehouse Monitoring convient à un scénario donné, concevoir un test d’intégration qui couvre de bout en bout le pipeline du feature engineering jusqu’à l’inférence, savoir quel test statistique de la table des métriques de drift s’applique au drift catégoriel et lequel vaut pour le drift numérique. Les questions sur le développement de modèles vont bien au-delà de l’usage basique de SparkML : tuning distribué d’hyperparamètres avec Ray et Optuna, arbitrages entre parallélisme de modèle et parallélisme de données pour l’entraînement à grande échelle. Le déploiement ne pèse que 12 % de l’examen, mais les choix entre blue-green et canary, tout comme la mise à l’échelle d’un endpoint sous trafic de production, sont testés dans le détail, toujours à partir de scénarios concrets.

Points de vigilance : DB-MLP

  1. 01Point-in-Time Correctness

    Joindre les features aux labels sans garantir la point-in-time correctness laisse fuiter de l’information future dans l’entraînement, et te fait répondre à côté sur les questions de feature engineering.

  2. 02Online Feature Tables

    Servir les features depuis une batch feature table au lieu de configurer une online table pour des lookups à faible latence te fait rater les questions sur le feature serving en temps réel.

  3. 03Custom Metrics Logging

    Ne logger que les métriques MLflow par défaut, au lieu d’y ajouter tes propres paramètres et artifacts dans des nested runs, te coûte des points sur les questions d’experiment tracking avancé.

  4. 04DAB ML Asset Config

    Ne pas déclarer ensemble un serving endpoint, une expérience MLflow et un modèle enregistré via les Automation Bundles te fait répondre à côté sur les questions d’environnements scalables.

  5. 05Endpoint Health Metrics

    Surveiller uniquement la dérive de qualité du modèle en ignorant les métriques d’infrastructure de l’endpoint (latence, taux d’erreur, consommation mémoire) te conduit à des réponses incomplètes sur les questions de monitoring en production.

Pass-IT t’entraîne précisément sur ces points faibles — adaptatif et espacé →

Questions fréquentes

Combien de temps dure l’examen Databricks Certified Machine Learning Professional ?

L’examen Databricks Certified Machine Learning Professional comporte 59 questions avec une limite de 120 minutes.

Quelles sont les erreurs fréquentes à l’examen Databricks Certified Machine Learning Professional ?

Les pièges fréquents incluent : Point-in-Time Correctness, Online Feature Tables, Custom Metrics Logging, DAB ML Asset Config, Endpoint Health Metrics. Concentre ton temps de révision sur ces points pour ne pas perdre de points.

Comment l'examen Machine Learning Professional est-il pondéré ?

Model development et MLOps pèsent 44% chacun, model deployment 12%. La répartition est inhabituellement tranchée : l'examen se divise pour ainsi dire en deux moitiés. Si tu sais construire des modèles mais que tu ne les as jamais fait tourner en production, tu perds la moitié de l'épreuve.

Faut-il passer la Machine Learning Associate d'abord ?

Non, Databricks n'impose aucune certification préalable. La différence tient à la pondération : l'examen associate consacre 38% à l'outillage de la plateforme, l'examen professional 44% au MLOps. Si les pipelines, le monitoring et le réentraînement ne font pas encore partie de ton quotidien, l'examen associate est le point de départ le plus honnête.

Quelle expérience la Machine Learning Professional suppose-t-elle ?

Au moins un an de pratique du machine learning sur Databricks. Le catalogue prévoit 120 heures en plus de cette expérience, pas à la place. Rien ne bloque l'inscription, la barrière est donc de fait celle que tu te fixes.

Combien de temps la Machine Learning Professional reste-t-elle valable ?

Deux ans à compter de la réussite, à renouveler en repassant la version en vigueur. Databricks n'a pas de programme de formation continue, alors prévois de la repasser plutôt que d'attendre l'apparition d'une voie par crédits.

Pass-IT est un outil de révision indépendant, ni affilié à Databricks ni approuvé par Databricks ; Databricks et les noms d’examens sont des marques de leurs propriétaires respectifs.

Une certification. Un seul paiement.

Accès complet à DB-MLP

Accède à toute la banque de questions de cette certification. Alex explique chaque réponse et ton score de préparation te montre quoi travailler ensuite.

Acheter l’accès à DB-MLP pour $29.99Un seul paiement. Accès à vie à cette certification.
Vérifie gratuitement si tu es prêt20 questions. Sans carte. Vois quoi travailler avant d’acheter.

Atteins 80 % de préparation et réussis — ou tu es remboursé.

Comment fonctionne le score →