EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-MLA · Associate

Databricks Machine Learning Associate — Questions d'entraînement et examen blanc

Entraîne-toi avec des questions DB-MLA réalistes, alignées sur les objectifs de l’examen. Alex explique chaque réponse et ton score de préparation te montre quoi travailler ensuite.

48Questions
90minDurée

Vérifié auprès de Databricks · août 2026Version actuelle de l’examen

À propos de l’examen

L’examen Databricks Certified Machine Learning Associate valide ta capacité à concevoir, entraîner et déployer des modèles de machine learning sur la plateforme Databricks. Il porte sur les outils ML propres à Databricks : MLflow pour le suivi des expériences et le model registry, le Feature Store pour la gestion des features, AutoML pour le prototypage rapide, mais aussi sur le traitement des données, le développement et le déploiement de modèles. Tu dois montrer que tu sais industrialiser des modèles ML au sein du workspace Databricks Machine Learning.

Cette certification s’adresse aux data scientists et aux ML engineers qui ont au moins six mois de pratique de Databricks sur des tâches de machine learning. Elle atteste d’une maîtrise des fondamentaux du cycle de vie ML sur Databricks, du traitement des données jusqu’au déploiement.

Contenu de l’examen

Databricks Machine Learning est le domaine le plus chargé, avec 38 % de l’examen : suivi des expériences avec MLflow, model registry dans Unity Catalog, tables du Feature Store et AutoML. On est clairement sur de l’outillage propre à Databricks, pas sur de la théorie ML générale. Vient ensuite Model development à 31 %, qui porte sur le choix des algorithmes, le tuning des hyperparamètres avec Hyperopt ou la cross-validation, et les métriques de classification et de régression, valables quelle que soit la plateforme.

Data processing (19 %) et model deployment (12 %) complètent l’examen : feature engineering sur des DataFrames Spark, avec imputation, encodage et gestion des outliers, puis comparaison des approches batch, streaming et temps réel pour un endpoint donné. À eux deux, Databricks Machine Learning et Model Development pèsent 69 % de l’examen : ta maîtrise de la plateforme compte donc autant que tes connaissances ML générales.

Plan de l’examen : DB-MLA

Databricks Machine Learning38%

Suivi MLflow et model registry, Feature Store, AutoML, Unity Catalog pour les assets ML et Databricks Runtime for ML.

≈ 30 h
Data Processing14%

Statistiques descriptives sur des DataFrames Spark, suppression des valeurs aberrantes, visualisation de variables catégorielles et continues, imputation des valeurs manquantes, encodage one-hot et transformations logarithmiques.

≈ 11 h
Model Development35%

Algorithmes de ML, métriques d'évaluation, feature engineering, entraînement des modèles, réglage des hyperparamètres et validation croisée sur Databricks.

≈ 28 h
Model Deployment13%

Endpoints de model serving, inférence en batch, serving en temps réel, enregistrement des modèles et stratégies de déploiement.

≈ 10 h

Databricks ne publie pas de répartition par domaine pour cet examen — les parts reflètent notre banque de questions alignée sur l’examen et évoluent à mesure qu’elle s’enrichit.

Format de l’examen et types de questions

L’examen compte 48 questions notées, en QCM à réponse unique ou à réponses multiples, dans une fenêtre de 90 minutes ; des questions pilotes non notées peuvent aussi s’y glisser. Attends-toi à des scénarios propres à Databricks : logger un run avec l’API MLflow Client, enregistrer un modèle dans le registry Unity Catalog, ou distinguer une online feature table d’une offline selon le cas d’usage.

Types de questions : DB-MLA

Choix multiple100%

Choisis la seule bonne réponse parmi quatre ou cinq options — le format de base de l’examen.

Databricks confirme ces types de questions — aucune répartition en pourcentage n’est publiée ; les parts reflètent notre banque de questions alignée sur l’examen.

Essaie cinq questions DB-MLA

Cinq questions tirées de notre banque Databricks Certified Machine Learning Associate. Réponds à une — Alex t’explique le pourquoi.

L’examen et l’app sont en anglais — ces questions d’exemple, nous les avons traduites.

Databricks Machine Learning1 / 5

Comment AutoML dans Databricks règle-t-il le problème du choix du bon algorithme de ML ?

AlexExplication complète d’Alex

Déroulé d'AutoML : 1) Tu spécifies : jeu de données, colonne cible, type de problème (classification/régression/forecasting) et métrique d'évaluation. 2) AutoML explore : prétraitement des données (encodage, imputation), sélection de features, sélection d'algorithmes, recherche d'hyperparamètres. 3) Résultats : une liste de modèles classée selon les métriques, et des notebooks générés montrant le code exact de chaque approche. 4) Bonne pratique : sers-toi d'AutoML comme point de départ, puis personnalise le notebook le plus performant. Les notebooks générés utilisent des bibliothèques standard (scikit-learn, XGBoost, LightGBM) : ils sont donc entièrement portables et modifiables.

Sourcedocs.databricks.com

Model Deployment3 / 5

Un machine learning engineer veut revenir en arrière sur un déploiement de modèle sur Databricks après avoir découvert des problèmes en production. Quelle est l'approche la plus rapide ?

AlexExplication complète d’Alex

Les model aliases sont utiles dans les workflows de déploiement parce qu'ils découplent le libellé humain de déploiement d'une version de modèle immuable. L'inférence batch peut charger des modèles directement par alias, mais Databricks documente les workflows de Model Serving endpoint comme résolvant l'alias vers une version de modèle puis mettant à jour la configuration de l'endpoint pour servir cette version. Un rollback met donc à jour l'entité servie par l'endpoint vers la version précédente du modèle tout en conservant l'URL de l'endpoint.

Sourcedocs.databricks.com

Développement de modèles5 / 5

Qu'est-ce que le fléau de la dimensionnalité et comment affecte-t-il les modèles de machine learning ?

AlexExplication complète d’Alex

Conséquences pratiques : en grande dimension, le plus proche voisin d'un point est presque aussi éloigné que le point le plus lointain, ce qui rend KNN inefficace. Le clustering fondé sur les distances se dégrade. Les modèles linéaires peuvent avoir besoin d'exponentiellement plus de données. Parmi les remèdes : la sélection de features (retirer les features non pertinentes), la réduction de dimension (PCA, autoencodeurs), la régularisation (pénalités L1/L2) et le recours à des algorithmes moins sensibles à la dimensionnalité (les modèles à base d'arbres gèrent plutôt bien les grandes dimensions, car ils sélectionnent des features informatives à chaque split).

Sourcescikit-learn.org

362 questions, construites comme l’examen

La banque DB-MLA couvre tous les domaines de l’examen et continue de s’enrichir de nouvelles questions. Un examen blanc te pose 48 questions d’affilée, sur le même chrono de 90 minutes que le jour de l’examen.

Procès-verbal : DB-MLA

Contrôle du programme auprès de Databricks6 août 2026

dernière vérification auprès de la source officielle Databricks

Couverture du programme48 objectifs officiels

répartis sur 4 domaines, d’après le guide officiel de l’examen

Taille de la banque362 questions

= 7 examens blancs complets de 48 questions — jamais deux fois la même question

Validation canonique362 sur 362

chacune vérifiée avec la documentation officielle Databricks — réponse, options et explication, source citée

Méthodologie documentée ouvertement.Comment les questions sont créées →

Se préparer à DB-MLA

Le temps qu’il te faut dépend de ton expérience pratique. Le reste est fixé par l’éditeur : comment l’examen se déroule, quand tu peux le repasser et combien de temps la certification reste valable.

L’examen se passe en ligne avec un surveillant à distance, ou dans un centre d’examen, en anglais, japonais, portugais (BR) et coréen. La certification reste valable deux ans ; pour la renouveler, tu dois repasser la version en vigueur de l’examen.

Ton plan : DB-MLA

Préparation

Temps de préparation50–120 h

en général environ 50 h si tu travailles déjà avec ces technologies, environ 120 h en partant de zéro

NiveauAssociate
À maîtriser avantAucun prérequis. Une expérience pratique d'au moins 6 mois en ML sur Databricks est recommandée.

Le jour J et après

Mode de passageSurveillé en ligne ou centre d'examen
Politique de repriseAucun délai d'attente obligatoire. Des frais de nouvelle tentative s'appliquent.
Validité2 ans

Une recertification est nécessaire tous les 2 ans : il te suffit de repasser la version en vigueur de l'examen.

Ces heures sont notre propre estimation de planification — Databricks ne publie aucun temps de préparation pour cet examen. Un point de départ pour ton agenda, pas un objectif.

Erreurs courantes

Le domaine Databricks Machine Learning récompense la maîtrise concrète des outils bien plus que la théorie MLOps générale : savoir à quel moment un modèle challenger doit être promu champion via les aliases, pourquoi des tables de feature store au niveau du compte valent mieux que des tables au niveau du workspace pour une réutilisation entre équipes, et quel panneau de l’interface MLflow affiche les artifacts loggés d’un run. Les questions de data processing sont du travail concret sur DataFrames Spark : choisir entre une imputation par la moyenne, la médiane ou le mode, ou repérer les cas qui appellent vraiment une transformation log au lieu de l’appliquer par défaut. Model development puise autant dans les connaissances ML générales que dans l’outillage Databricks, donc le compromis biais-variance et les métriques d’évaluation classiques doivent être des réflexes, pas des définitions que tu viens tout juste de relire.

Points de vigilance : DB-MLA

  1. 01Code vs Model Promotion

    Promouvoir par réflexe un modèle déjà entraîné d’un environnement à l’autre alors que le scénario demande de promouvoir le code et de réentraîner sur place (ou l’inverse) : c’est l’erreur classique sur les questions de stratégie MLOps.

  2. 02Estimators vs Transformers

    Dans un pipeline Spark ML, un estimator apprend à partir des données via fit, un transformer se contente d’appliquer une transformation figée. Si tu confonds les deux, tu te trompes sur les questions de construction de pipeline.

  3. 03Cross-Validation Trade-offs

    On sous-estime presque toujours le nombre de modèles qu’une grid search couplée à une cross-validation entraîne réellement, et on oublie qu’un simple découpage train/validation est parfois le meilleur compromis. Résultat : des réponses fausses sur les questions de tuning.

  4. 04Endpoint Traffic Split

    Ne pas savoir répartir le trafic entre plusieurs endpoints de model serving pour un déploiement progressif ou un test A/B te coûte des points sur les questions de déploiement en inférence temps réel.

  5. 05Imbalance Mitigation

    Se rabattre sur la seule accuracy plutôt que sur une technique ou une métrique adaptée au déséquilibre, alors que les données d’entraînement sont fortement déséquilibrées, mène droit à la mauvaise réponse sur les questions de développement de modèle liées au class imbalance.

Pass-IT t’entraîne précisément sur ces points faibles — adaptatif et espacé →

Questions fréquentes

Combien de temps dure l’examen Databricks Certified Machine Learning Associate ?

L’examen Databricks Certified Machine Learning Associate comporte 48 questions avec une limite de 90 minutes.

Quelles sont les erreurs fréquentes à l’examen Databricks Certified Machine Learning Associate ?

Les pièges fréquents incluent : Code vs Model Promotion, Estimators vs Transformers, Cross-Validation Trade-offs, Endpoint Traffic Split, Imbalance Mitigation. Concentre ton temps de révision sur ces points pour ne pas perdre de points.

Comment l'examen Machine Learning Associate est-il pondéré ?

Databricks Machine Learning domine largement avec 38%, devant le développement de modèles à 31% et le traitement des données à 19%. Le déploiement de modèles ferme la marche avec 12%. Sept questions sur dix portent donc sur l'outillage de la plateforme et sur la construction de modèles à l'intérieur.

Quelle expérience l'examen Machine Learning Associate suppose-t-il ?

Databricks recommande six mois ou plus de pratique du machine learning sur la plateforme et n'exige aucune certification pour t'inscrire. Le catalogue table sur environ 80 heures. Comme l'outillage de la plateforme pèse le plus lourd, le temps passé dans le workspace compte ici davantage que la théorie générale de la modélisation.

La certification Machine Learning Associate expire-t-elle ?

Oui, deux ans après ta réussite. La recertification passe uniquement par l'examen, dans la version en vigueur à ce moment-là. Il n'existe pas de renouvellement par crédits chez Databricks.

Que faire après le Machine Learning Associate ?

L'examen Machine Learning Professional est la marche au-dessus, et sa structure est différente : le développement de modèles et le MLOps pèsent 44% chacun, si bien que l'exploitation représente la moitié de l'examen. Le Generative AI Engineer Associate est le mouvement latéral si ton travail glisse vers les modèles de fondation. Ni l'un ni l'autre n'exige la certification associate au préalable.

Pass-IT est un outil de révision indépendant, ni affilié à Databricks ni approuvé par Databricks ; Databricks et les noms d’examens sont des marques de leurs propriétaires respectifs.

Une certification. Un seul paiement.

Accès complet à DB-MLA

Accède à toute la banque de questions de cette certification. Alex explique chaque réponse et ton score de préparation te montre quoi travailler ensuite.

Acheter l’accès à DB-MLA pour $29.99Un seul paiement. Accès à vie à cette certification.
Vérifie gratuitement si tu es prêt20 questions. Sans carte. Vois quoi travailler avant d’acheter.

Atteins 80 % de préparation et réussis — ou tu es remboursé.

Comment fonctionne le score →