EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-MLP · Professional

Databricks Machine Learning Professional — Questions d'entraînement et examen blanc

Prépare DB-MLP avec des questions d’entraînement originales et des réponses clairement expliquées. Demande des précisions à Alex, ton tuteur IA, repère les sujets à revoir grâce à tes résultats et entraîne-toi à gérer ton temps avec des examens blancs chronométrés.

59Questions de l’examen blanc
120minTemps imparti

Vérifié auprès de Databricks · août 2026 · Version actuelle de l’examen

À propos de l’examen

L’examen Databricks Certified Machine Learning Professional valide une expertise avancée dans la construction de systèmes de ML en production, à grande échelle, sur Databricks. Il couvre les techniques avancées de développement de modèles, la gestion du cycle de vie MLOps (CI/CD et monitoring compris) ainsi que les stratégies de déploiement de modèles : le développement de modèles et les MLOps pèsent chacun 44 % de l’examen. Tu dois démontrer ta maîtrise de la conception de pipelines de ML en production et de la gestion du cycle de vie des modèles à grande échelle.

Cette certification s’adresse aux ingénieurs ML et data scientists confirmés qui ont au moins un an d’expérience dans la mise en production de systèmes de ML sur Databricks. Elle atteste de ta capacité à exploiter ces systèmes de façon fiable, en production et à grande échelle.

Essaie cinq questions sur DB-MLP

Entraîne-toi avec cinq questions de la banque actuelle de l’app pour Databricks Certified Machine Learning Professional, accompagnées de leurs réponses et explications.

MLOps1 / 5

Un ingénieur en machine learning doit mettre en place une pratique MLOps dans laquelle chaque exécution d'entraînement d'un modèle est reliée au commit Git exact du code d'entraînement, à la version précise des données d'entraînement et à l'artefact de modèle produit. Qu'est-ce qui garantit cette traçabilité de bout en bout ?

AlexExplication complète d’Alex

Chaîne de provenance MLOps : 1) Code → exécution : Databricks Repos : intégration Git automatique. MLflow : logge le chemin du notebook et le SHA du commit Git. Reproductibilité : fais un checkout du commit et relance le notebook. 2) Données → exécution : version Delta Lake : snapshot exact des données d'entraînement. Hash des données : empreinte du jeu de données. Version du Feature Store : quelle version de la table de features a été utilisée. Time travel : spark.read.format('delta').option('versionAsOf', 42).table('training_data'). 3) Exécution → modèle : l'exécution MLflow contient : paramètres, métriques, artefacts. Modèle enregistré depuis l'exécution : relié via run_id. Model Registry : version → exécution → code + données. 4) Modèle → déploiement : logs de déploiement : quelle version du modèle sert les requêtes. Endpoint : référence l'URI du modèle. Table d'inférence : logge chaque prédiction. 5) Chaîne complète : prédiction → version du modèle → exécution MLflow → (commit Git + version des données) → code source et données d'origine. 6) Automatisation : autologging : capture automatiquement la plupart des liens code/modèle. Logging des données : nécessite un mlflow.log_param manuel pour la version des données. Unity Catalog : ajoute une couche de gouvernance (permissions, logs d'audit). 7) Bénéfices : reproductibilité : recréer n'importe quel modèle. Auditabilité : satisfaire les exigences de conformité. Débogage : trouver ce qui a changé quand le modèle s'est dégradé.

Sourcedocs.databricks.com

Déploiement de modèles2 / 5

Un ingénieur en machine learning doit mettre en place une solution qui sert des versions de modèle différentes selon les régions géographiques. La région UE exige un modèle entraîné avec des données conformes au RGPD (sans identifiants personnels), tandis que la région US peut utiliser toutes les features. Comment configure-t-on ce serving multi-région ?

AlexExplication complète d’Alex

Serving de modèles tenant compte de la réglementation : 1) Exigences du RGPD : minimisation des données : le modèle destiné à l'UE ne peut être entraîné que sur des features sans identifiants personnels. Limitation des finalités : les features ne servent qu'à la finalité déclarée. Droit à l'oubli : le modèle ne doit pas mémoriser des données individuelles. 2) Catégories de features : PII : nom, e-mail, téléphone, adresse, IP. Quasi-identifiants : âge + code postal + genre (la combinaison peut identifier une personne). Agrégées : montant moyen des transactions (30 derniers jours). Comportementales : nombre de connexions (aucune identification individuelle). 3) Pourquoi deux versions enregistrées : la frontière de conformité, ce sont les données d'entraînement elles-mêmes ; il te faut donc deux artefacts entraînés distincts — l'un sur le jeu de features conforme au RGPD, l'autre sur toutes les features — enregistrés côte à côte dans le Model Registry, où chaque version possède son propre lineage, sa stage et sa piste d'audit. 4) Routage des requêtes : une couche de routage placée devant l'endpoint de serving inspecte le header de région de la requête et dirige les requêtes UE vers la version conforme et les requêtes US vers la version avec toutes les features. Databricks Model Serving permet de servir plusieurs modèles et plusieurs versions d'un même modèle en même temps et te laisse interroger un modèle servi précis derrière un endpoint : router chaque requête vers une version enregistrée donnée est donc un pattern pris en charge. 5) Tests : version conforme : vérifie qu'aucune feature PII n'apparaît dans sa signature d'entrée. Version avec toutes les features : vérifie que toutes les features sont disponibles. Routage : vérifie qu'un header de région UE aboutit toujours à la version conforme. 6) Documentation de conformité : les model cards de chaque version enregistrée documentent les features utilisées. Le lineage du Model Registry retrace l'origine des données d'entraînement de chaque version. Les logs d'accès enregistrent quelle version a servi chaque requête.

Sourcedocs.databricks.com

Développement de modèles3 / 5

Lorsque tu fais du tuning d'hyperparamètres avec Hyperopt sur Databricks, quel est le principal avantage d'utiliser SparkTrials plutôt que la classe Trials par défaut ?

AlexExplication complète d’Alex

Hyperopt est une bibliothèque d'optimisation d'hyperparamètres qui prend en charge les algorithmes Tree-structured Parzen Estimators (TPE) et la recherche aléatoire. La classe Trials par défaut exécute les trials séquentiellement sur une seule machine. SparkTrials va plus loin en répartissant les trials sur un cluster Spark, où chaque worker entraîne en parallèle un modèle avec des hyperparamètres différents. C'est particulièrement efficace pour les modèles de ML mono-nœud (scikit-learn, XGBoost), où chaque trial tient sur un seul worker.

Sourcedocs.databricks.com

Gestion du cycle de vie des modèles4 / 5

Un système de monitoring de modèle détecte que les distributions des features d’entrée ont fortement dérivé par rapport à la distribution des données d’entraînement. Cependant, les métriques de performance du modèle restent stables. Que doit faire le ML engineer ?

AlexExplication complète d’Alex

Le monitoring de modèle distingue la data drift (changements de distribution des features d’entrée) de la concept drift (changements dans la relation entre les features et la cible). La data drift peut se produire sans impact immédiat sur la performance si le modèle généralise bien à la région ayant dérivé. Cependant, une data drift durable précède souvent une concept drift. La bonne pratique consiste à monitorer à la fois les métriques de drift et les métriques de performance, à configurer des alertes avec différents niveaux de sévérité, et à avoir des pipelines de réentraînement prêts à se déclencher lorsque la performance se dégrade réellement.

Sourcedocs.databricks.com

Déploiement de modèles5 / 5

Un ingénieur en machine learning doit mettre en place une solution de model serving qui renvoie non seulement une prédiction, mais aussi un score de confiance et les features qui contribuent le plus à chaque prédiction. La réponse doit contenir ces trois informations. Comment concevoir l'endpoint ?

AlexExplication complète d’Alex

Réponses enrichies en model serving : 1) Basique : {'prediction': 1}. 2) Avec confiance : {'prediction': 1, 'confidence': 0.92}. 3) Avec explication : {'prediction': 1, 'confidence': 0.92, 'top_features': [{'name': 'credit_score', 'impact': 0.15}, {'name': 'debt_ratio', 'impact': -0.08}]}. 4) Avec métadonnées : ajoute model_version, timestamp, request_id. 5) Patterns d'implémentation : predict de pyfunc → renvoie un DataFrame. Chaque colonne devient une partie de la réponse. Structures complexes : les sérialiser en chaîne JSON dans une colonne. 6) Compromis de performance : prédiction seule : ~10ms. Prédiction + confiance : ~10ms (les probabilités sont déjà calculées). Prédiction + SHAP : ~50-200ms (le calcul SHAP ajoute de la surcharge). Optimisation : ne calculer SHAP que sur demande (flag optionnel dans la requête). 7) Intégration côté client : REST API : réponse JSON avec tous les champs. SDK : parsée en objets typés. Dashboard : afficher la prédiction + une jauge de confiance + un graphique en cascade des features.

Sourcedocs.databricks.com

Les questions de l’app sont actuellement en anglais. Les traductions de cet aperçu concernent uniquement l’aperçu. Consulte l’organisme de certification pour connaître les langues disponibles pour l’examen officiel.

325 questions d’entraînement

La banque de questions Pass-IT te permet de t’entraîner pour DB-MLP. Un examen blanc Pass-IT comporte 59 questions à traiter en 120 minutes : ces paramètres sont ceux de l’entraînement.

Détails de la banque de questions : DB-MLP

Informations sur l’examen vérifiées auprès de Databricks13 août 2026

date de la dernière vérification auprès de la source officielle de Databricks

Objectifs du guide47 objectifs répertoriés dans le guide officiel

répartis entre 3 domaines dans le guide officiel de l’examen

Taille de la banque325 questions

= La taille de la banque équivaut à 5 séries de 59 questions. Cela ne signifie pas que chaque examen blanc utilise une série distincte.

Domaines du programme3 domaines dans le programme de l’examen

Model Development 132 · MLOps 118 · Model Deployment 75

Questions marquées comme vérifiées à partir des sources325 sur 325

questions dont la réponse, les choix et l’explication sont enregistrés comme ayant été vérifiés à partir de la documentation officielle de Databricks

Contenu de l’examen

Le développement de modèles et le MLOps sont à égalité, 44 % chacun, soit la très grande majorité de l’examen. Le développement de modèles couvre l’entraînement distribué avec SparkML, Ray et Optuna, le feature engineering point-in-time-correct, ainsi que les runs MLflow imbriqués pour les expérimentations complexes. Le MLOps porte sur le CI/CD appliqué au ML, Lakehouse Monitoring, la détection de drift et le réentraînement automatique déclenché par une dégradation des performances.

Le déploiement de modèles représente les 12 % restants : stratégies de mise en production blue-green et canary, accès à des modèles PyFunc personnalisés via un serving endpoint plutôt que par la seule interface. Ce partage à parts égales entre développement et exploitation reflète bien le quotidien d’un ML engineer senior : construire les modèles, c’est la moitié du travail, les garder en bonne santé en production, c’est l’autre moitié.

Programme de l’examen : DB-MLP

Model Development44%

Développement avancé de modèles, entraînement distribué, feature engineering à grande échelle, conception d'expériences, optimisation des hyperparamètres avec Ray/Optuna et architectures de modèles personnalisées.

≈ 53 h
MLOps44%

MLOps practices, CI/CD for ML, Databricks Asset Bundles for ML, model testing strategies, A/B testing, model monitoring, drift detection, and pipeline automation.

≈ 53 h
Model Deployment12%

Serving de modèles en production, inférence batch ou temps réel, scaling des serving endpoints et automatisation du déploiement.

≈ 14 h

Format de l’examen et types de questions

L’examen compte 59 questions notées à choix multiple dans une fenêtre de 120 minutes, avec d’éventuelles questions pilotes non notées. Attends-toi à des scénarios poussés : choisir entre Ray et Spark pour un job d’entraînement distribué, concevoir une alerte Lakehouse Monitoring dès qu’un drift dépasse un seuil, ou retenir une stratégie de déploiement pour un serving endpoint à fort trafic.

Types de questions : DB-MLP

Choix multiple100%

Sélectionne la seule réponse qui répond le mieux aux exigences de la question.

Consulte Databricks pour les informations officielles sur les formats de questions. Les proportions affichées décrivent la banque de questions Pass-IT et ne permettent pas de déduire celles de l’examen officiel.

Préparation à DB-MLP

L’examen se passe en ligne avec un surveillant à distance ou dans un centre d’examen, et il n’est proposé qu’en anglais. La certification reste valable deux ans ; pour la renouveler, il faut repasser la version en vigueur de l’examen.

Préparation et modalités : DB-MLP

Préparation

Exemple de durée de préparation70–180 h

fourchette illustrative pour t’organiser : de 70 h avec une expérience pertinente à 180 h si tu débutes ; tes besoins peuvent se situer en dehors de cette fourchette

NiveauProfessionnel
Connaissances conseilléesAucun prérequis. Une expérience pratique d'au moins un an sur Databricks ML est recommandée.

Passage de l’examen et maintien de la certification

Modalités de passageSurveillé en ligne ou centre d'examen
Conditions de nouvelle tentativeAucun délai d'attente obligatoire. Des frais de nouvelle tentative s'appliquent.
Validité de la certification2 ans

Tu dois te recertifier tous les 2 ans en repassant la version en vigueur de l'examen.

Erreurs fréquentes

Points à revoir : DB-MLP

  1. 01Point-in-Time Correctness

    Joindre les features aux labels sans garantir la point-in-time correctness laisse fuiter de l’information future dans l’entraînement, et te fait répondre à côté sur les questions de feature engineering.

  2. 02Online Feature Tables

    Servir les features depuis une batch feature table au lieu de configurer une online table pour des lookups à faible latence te fait rater les questions sur le feature serving en temps réel.

  3. 03Custom Metrics Logging

    Ne logger que les métriques MLflow par défaut, au lieu d’y ajouter tes propres paramètres et artifacts dans des nested runs, te coûte des points sur les questions d’experiment tracking avancé.

  4. 04DAB ML Asset Config

    Ne pas déclarer ensemble un serving endpoint, une expérience MLflow et un modèle enregistré via les Automation Bundles te fait répondre à côté sur les questions d’environnements scalables.

  5. 05Endpoint Health Metrics

    Surveiller uniquement la dérive de qualité du modèle en ignorant les métriques d’infrastructure de l’endpoint (latence, taux d’erreur, consommation mémoire) te conduit à des réponses incomplètes sur les questions de monitoring en production.

Questions fréquentes

Combien de temps dure l’examen Databricks Certified Machine Learning Professional ?

L’examen Databricks Certified Machine Learning Professional comporte 59 questions et le temps imparti est de 120 minutes.

Quels points méritent une attention particulière pendant la préparation de Databricks Certified Machine Learning Professional ?

Les points à revoir comprennent Point-in-Time Correctness, Online Feature Tables, Custom Metrics Logging, DAB ML Asset Config, Endpoint Health Metrics. Travaille sur des exemples pour vérifier que tu comprends les distinctions et que tu peux expliquer ta réponse.

Comment l'examen Machine Learning Professional est-il pondéré ?

Model development et MLOps pèsent 44% chacun, model deployment 12%. La répartition est inhabituellement tranchée : l'examen se divise pour ainsi dire en deux moitiés. Si tu sais construire des modèles mais que tu ne les as jamais fait tourner en production, tu perds la moitié de l'épreuve.

Faut-il passer la Machine Learning Associate d'abord ?

Non, Databricks n'impose aucune certification préalable. La différence tient à la pondération : l'examen associate consacre 38% à l'outillage de la plateforme, l'examen professional 44% au MLOps. Si les pipelines, le monitoring et le réentraînement ne font pas encore partie de ton quotidien, l'examen associate est le point de départ le plus honnête.

Quelle expérience la Machine Learning Professional suppose-t-elle ?

Au moins un an de pratique du machine learning sur Databricks. Le catalogue prévoit 120 heures en plus de cette expérience, pas à la place. Rien ne bloque l'inscription, la barrière est donc de fait celle que tu te fixes.

Combien de temps la Machine Learning Professional reste-t-elle valable ?

Deux ans à compter de la réussite, à renouveler en repassant la version en vigueur. Databricks n'a pas de programme de formation continue, alors prévois de la repasser plutôt que d'attendre l'apparition d'une voie par crédits.

Une certification, 12 mois

Entraînement pour DB-MLP

Concentre ton entraînement sur une certification ou choisis Pro pour t’entraîner à toutes les certifications.

Commencer un entraînement gratuitEssaie les 20 premières questions sans carte bancaire pour voir si cet entraînement te convient.

Pour les achats éligibles : remboursement garanti si tu échoues à ton examen.

Voir les conditions de garantie →