EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-GAIE · Associate

Databricks Generative AI Engineer Associate — Questions d'entraînement et examen blanc

Entraîne-toi avec des questions DB-GAIE réalistes, alignées sur les objectifs de l’examen. Alex explique chaque réponse et ton score de préparation te montre quoi travailler ensuite.

45Questions
90minDurée

Vérifié auprès de Databricks · août 2026Version actuelle de l’examen

À propos de l’examen

L’examen Databricks Certified Generative AI Engineer Associate valide ta capacité à concevoir, développer et déployer des applications d’IA générative sur la plateforme Databricks. Il couvre la conception d’applications, la préparation et le chunking des données, la construction et le déploiement de pipelines de retrieval-augmented generation, l’évaluation, le monitoring ainsi que la gouvernance. Tu dois démontrer ta maîtrise du prompt engineering, des model-serving endpoints et de l’outillage d’IA générative de Databricks.

Cette certification s’adresse aux ingénieurs et développeurs IA qui ont au moins six mois d’expérience dans la création d’applications d’IA générative sur Databricks. Elle atteste que tu sais mener une application d’IA générative de sa conception jusqu’à son déploiement en production.

Contenu de l’examen

Le développement d’applications est le domaine dominant avec 30 %, soit près d’un tiers de l’examen. Il couvre le choix des frameworks comme LangChain, le prompt engineering, les guardrails LLM et la sélection d’un modèle depuis un hub ou une marketplace. Vient ensuite l’assemblage et le déploiement d’applications, à 22 % : coder des chains sous forme de modèles pyfunc, les enregistrer dans Unity Catalog et mettre en place des index Vector Search pour la recherche documentaire.

La conception d’applications et la préparation des données pèsent 14 % chacune. On y teste le design des prompts face aux besoins métier, et la stratégie de chunking face à la structure des documents. L’évaluation et le monitoring (12 %) ainsi que la gouvernance (8 %) complètent l’examen, avec le scoring MLflow, le suivi via AI Gateway et les guardrails contre les entrées malveillantes ou les risques de licence dans les données sources.

Plan de l’examen : DB-GAIE

Application Development30%

Développement d'outils GenAI et de chaînes applicatives, augmentation des prompts, mise en place de guardrails, sélection de modèles et utilisation de frameworks comme LangChain sur Databricks.

≈ 24 h
Assembling and Deploying Applications22%

Déploiement de modèles, enregistrement dans Unity Catalog, configuration de Vector Search, mise en place de pipelines RAG de bout en bout et gestion des serving endpoints.

≈ 18 h
Design Applications14%

Prompt engineering, conception de pipelines, sélection des modèles et des composants, et alignement des solutions techniques sur les besoins métier.

≈ 11 h
Data Preparation14%

Stratégies de chunking pour les documents, filtrage et extraction de contenu, gestion de la structure des documents et utilisation de packages Python pour l'extraction de données.

≈ 11 h
Evaluation and Monitoring12%

Techniques d'évaluation des modèles, choix des métriques appropriées, logging et monitoring des inférences, et fonctionnalités d'évaluation de Databricks.

≈ 10 h
Governance8%

Sécurité des données et des applications, mise en place de guardrails, data masking, aspects juridiques et de licence, et gouvernance Unity Catalog pour l'IA.

≈ 6 h

Format de l’examen et types de questions

L’examen compte 45 questions notées, en QCM à réponse unique ou à réponses multiples, dans une fenêtre de 90 minutes ; des questions pilotes non notées peuvent aussi apparaître. Les énoncés sont très orientés scénario : choisir une approche de chunking adaptée à un corpus donné, faire correspondre les composants d’une chain à un format d’entrée et de sortie précis, ou configurer Vector Search en respectant un budget de latence et de coût.

Types de questions : DB-GAIE

Choix multiple100%

Choisis la seule bonne réponse parmi quatre ou cinq options — le format de base de l’examen.

Databricks confirme ces types de questions — aucune répartition en pourcentage n’est publiée ; les parts reflètent notre banque de questions alignée sur l’examen.

Essaie cinq questions DB-GAIE

Cinq questions tirées de notre banque Databricks Certified Generative AI Engineer Associate. Réponds à une — Alex t’explique le pourquoi.

L’examen et l’app sont en anglais — ces questions d’exemple, nous les avons traduites.

Gouvernance1 / 5

Quelle est la relation entre un workspace Databricks et un metastore Unity Catalog dans le contexte de la gouvernance GenAI ?

AlexExplication complète d’Alex

Dans Unity Catalog, le metastore est le conteneur de plus haut niveau : il porte la hiérarchie catalogue → schéma → actif ainsi que les permissions. Plusieurs workspaces d'une même région peuvent partager un seul metastore, ce qui permet une gouvernance inter-workspaces des modèles, des tables et des autres actifs. Autrement dit, un modèle enregistré en dev est immédiatement visible en production avec des contrôles d'accès cohérents — sans aucune copie. Analyse des distracteurs : l'option « Un metastore ne peut être rattaché qu'à un seul workspace à la fois… » est fausse, car un metastore se rattache à de nombreux workspaces, pas à un seul. L'option « Chaque workspace nécessite un metastore dédié… » est fausse, car les metastores partagés rendent inutile un metastore par environnement. L'option « Unity Catalog attribue un metastore par région cloud… » est fausse, car Unity Catalog attribue bien un metastore par région, mais les workspaces de cette région partagent effectivement la gouvernance. Ref: docs.databricks.com/en/data-governance/unity-catalog/metastores.html

Sourcedocs.databricks.com

Assemblage et déploiement des applications2 / 5

Une équipe veut comparer par test A/B deux stratégies de prompt différentes pour son agent de support client. Comment doit-elle mettre cela en place avec Databricks serving ?

AlexExplication complète d’Alex

Les tests A/B d'agents GenAI sur Databricks reposent sur la traffic_config d'un serving endpoint, qui répartit les requêtes entre les served entities. Chaque version de l'agent est déployée comme une served_entity distincte sur le même endpoint, et traffic_percentage contrôle la répartition (le total doit faire 100). Les réponses de chaque version sont journalisées séparément dans l'inference table, ce qui permet de comparer qualité, latence et retours des utilisateurs. Analyse des distracteurs : l'option « Utiliser Feature Serving pour étiqueter chaque requête et la router… » est fausse — Feature Serving sert à récupérer des features, pas à router des prompts. L'option « Déployer un endpoint unique avec un hook de prétraitement… » est fausse — les hooks de prétraitement n'offrent ni véritable gestion du trafic ni journalisation indépendante. L'option « Enregistrer chaque version de prompt dans MLflow Model Registry… » est fausse — un notebook de routage maison contourne la gestion du trafic et la journalisation des inférences intégrées à Databricks. Ref: docs.databricks.com/en/machine-learning/model-serving/serve-multiple-models-to-serving-endpoint.html

Sourcedocs.databricks.com

Conception des applications3 / 5

Quelle approche permet à un agent GenAI d'accéder aux données les plus récentes lorsqu'il répond à des questions sur l'actualité ?

AlexExplication complète d’Alex

Les connaissances d'un LLM sont figées au moment de l'entraînement : il ne peut donc pas répondre à des questions sur l'actualité. Un pipeline RAG avec Delta Live Tables (l'option « Un agent de retrieval qui interroge un pipeline Delta… ») ne récupère que des documents indexés, pas des données web en direct. Élargir la fenêtre de contexte avec des instantanés en cache (l'option « Élargir la fenêtre de contexte pour y inclure un instantané en cache de… ») revient encore à utiliser des données périmées. Un fine-tuning hebdomadaire (l'option « Faire un fine-tuning hebdomadaire du modèle de base… ») introduit un décalage de plusieurs jours. Un agent à appel d'outils doté d'une recherche web ou d'outils d'API temps réel (l'option « Un agent à appel d'outils doté d'un outil de recherche web ou d'API temps réel ») interroge des sources de données externes à la demande et renvoie des résultats à la minute près. Databricks le permet via des serveurs MCP, des outils personnalisés et l'intégration de recherche web native avec les modèles Gemini/OpenAI/Anthropic. Ref: docs.databricks.com/en/machine-learning/model-serving/web-search; docs.databricks.com/en/generative-ai/agent-framework/agent-tool.

Sourcedocs.databricks.com

Préparation des données4 / 5

Lors de la création d'un index vector search de type Delta Sync, quel paramètre désigne la colonne dont le texte doit être vectorisé automatiquement ?

AlexExplication complète d’Alex

Lors de la création d'un index vector search Delta Sync avec embeddings managés, le paramètre embedding_source_column identifie la colonne de texte que Databricks va vectoriser automatiquement. La plateforme appelle l'endpoint du modèle d'embedding indiqué, traite le texte par lots et stocke les vecteurs obtenus dans l'index. Les options « auto_embedding_column », « vector_embedding_source » et « text_vectorization_col » sont des noms de paramètres inventés : aucun n'apparaît dans le SDK ni dans l'API REST de Databricks. Pour des embeddings auto-gérés, tu indiques à la place une embedding_vector_column contenant des vecteurs pré-calculés. Ref: docs.databricks.com/en/generative-ai/vector-search/create-index; docs.databricks.com/en/vector-search/query-vector-search.

Sourceapi-docs.databricks.com

Évaluation et supervision5 / 5

Quelle fonctionnalité Databricks permet aux ingénieurs de tracer l'intégralité du flux d'exécution d'un agent GenAI, y compris les appels d'outils, les étapes de retrieval et les interactions avec le LLM ?

AlexExplication complète d’Alex

MLflow Tracing instrumente automatiquement les applications GenAI quand tu utilises un framework pris en charge (LangChain, OpenAI, Databricks SDK). Chaque requête crée un trace composé de spans hiérarchiques qui représentent les opérations individuelles. Les ingénieurs peuvent consulter les traces dans l'interface MLflow pour déboguer des problèmes, repérer les goulots d'étranglement (quel appel d'outil est lent ?), vérifier la qualité du retrieval (qu'a renvoyé le retriever ?) et comprendre le raisonnement de l'agent (qu'a décidé le LLM, et pourquoi ?).

Sourcedocs.databricks.com

326 questions, construites comme l’examen

Chaque domaine de l’examen DB-GAIE a assez de questions dans la banque pour être travaillé en profondeur. Un examen blanc te pose 45 questions d’affilée, sur le même chrono de 90 minutes que le jour de l’examen.

Procès-verbal : DB-GAIE

Contrôle du programme auprès de Databricks4 août 2026

dernière vérification auprès de la source officielle Databricks

Couverture du programme56 objectifs officiels

répartis sur 6 domaines, d’après le guide officiel de l’examen

Taille de la banque326 questions

= 7 examens blancs complets de 45 questions — jamais deux fois la même question

Couverture des domainesles 6 domaines à leur pondération officielle

Application Development 85 · Assembling and Deploying Applications 59 · Design Applications 47 · Data Preparation 51 · Evaluation and Monitoring 47 · Governance 37

Validation canonique326 sur 326

chacune vérifiée avec la documentation officielle Databricks — réponse, options et explication, source citée

Méthodologie documentée ouvertement.Comment les questions sont créées →

Se préparer à DB-GAIE

Le temps qu’il te faut dépend de ton expérience pratique. Le reste est fixé par l’éditeur : comment l’examen se déroule, quand tu peux le repasser et combien de temps la certification reste valable.

L’examen se passe en ligne avec un surveillant à distance, ou dans un centre d’examen, en anglais, japonais, portugais (BR) et coréen. La certification reste valable deux ans ; pour la renouveler, tu dois repasser la version en vigueur de l’examen.

Ton plan : DB-GAIE

Préparation

Temps de préparation50–120 h

en général environ 50 h si tu travailles déjà avec ces technologies, environ 120 h en partant de zéro

NiveauAssociate
À maîtriser avantAucun prérequis. Il est conseillé d'avoir au moins 6 mois de pratique du développement d'IA générative sur Databricks.

Le jour J et après

Mode de passageSurveillé en ligne ou centre d'examen
Politique de repriseAucun délai d'attente obligatoire. Des frais de nouvelle tentative s'appliquent.
Validité2 ans

Tu dois te recertifier tous les 2 ans en repassant la version en vigueur de l'examen.

Ces heures sont notre propre estimation de planification — Databricks ne publie aucun temps de préparation pour cet examen. Un point de départ pour ton agenda, pas un objectif.

Erreurs courantes

La configuration de Vector Search, c’est là que la théorie GenAI rencontre les spécificités de Databricks : l’examen attend que tu sois à l’aise avec les dimensions d’embedding, les modes de rafraîchissement d’index et les arbitrages latence/coût entre les configurations, pas seulement avec le RAG en tant que concept. Les questions sur le chunking testent ton jugement face à une structure documentaire précise, pas une règle apprise par cœur. La même logique vaut pour le choix d’un LLM : les model cards et les métriques d’expérimentation comptent bien plus que la notoriété de la marque. La gouvernance ne pèse que 8 % de l’examen, mais elle porte sur des scénarios détaillés autour des guardrails et du risque de licence, que des connaissances générales en sécurité de l’IA ne suffisent pas à couvrir.

Points de vigilance : DB-GAIE

  1. 01Agent Bricks Selection

    Construire une chaîne multi-agents sur mesure en partant de zéro, au lieu de reconnaître qu’un template Agent Bricks prêt à l’emploi pour le Q&A ancré dans tes données, le routage multi-agents ou l’extraction structurée répond déjà au scénario, te fait perdre des points sur les questions de conception d’application.

  2. 02MCP Server Integration

    Ne pas faire la différence entre un connecteur MCP managé, un serveur MCP hébergé en externe et un serveur MCP entièrement custom selon le besoin de l’application te fait perdre des points sur les questions d’assemblage d’outils et d’agents.

  3. 03Re-ranking Role

    Zapper le re-ranking en tant qu’étape de retrieval à part entière et considérer les meilleurs résultats de la vector search comme définitifs te fait perdre des points sur les questions de conception de pipeline de retrieval.

  4. 04AI Gateway Tracking

    Confondre le suivi des inférences et de l’usage assuré par l’AI Gateway avec la simple journalisation via les inference tables, ou oublier le rate limiting comme levier de maîtrise des coûts, te fait perdre des points sur les questions de monitoring de déploiement de LLM.

  5. 05Licensing Risk

    Négliger les conditions de licence des sources de données au moment de choisir le contenu d’entraînement ou de retrieval te fait perdre des points sur les questions de gouvernance qui portent sur le risque juridique dans un pipeline GenAI.

Pass-IT t’entraîne précisément sur ces points faibles — adaptatif et espacé →

Questions fréquentes

Combien de temps dure l’examen Databricks Certified Generative AI Engineer Associate ?

L’examen Databricks Certified Generative AI Engineer Associate comporte 45 questions avec une limite de 90 minutes.

Quelles sont les erreurs fréquentes à l’examen Databricks Certified Generative AI Engineer Associate ?

Les pièges fréquents incluent : Agent Bricks Selection, MCP Server Integration, Re-ranking Role, AI Gateway Tracking, Licensing Risk. Concentre ton temps de révision sur ces points pour ne pas perdre de points.

Quels sujets pèsent le plus dans le Generative AI Engineer Associate ?

Application development est le plus gros domaine avec 30%, suivi de l'assemblage et du déploiement d'applications à 22%. La conception et la préparation des données comptent pour 14% chacune, l'évaluation et le monitoring pour 12% et la gouvernance pour 8%. Plus de la moitié de l'examen consiste donc à construire et livrer une application générative plutôt qu'à raisonner sur les modèles.

Que te faut-il avant l'examen Generative AI Engineer Associate ?

Aucune certification n'est exigée. Databricks recommande six mois ou plus de développement d'IA générative en pratique sur la plateforme, et le catalogue table sur environ 80 heures. L'examen est écrit du point de vue de celui qui construit : les questions sur le retrieval, le chaining et le déploiement supposent que tu as déjà livré quelque chose.

Combien de temps dure le Generative AI Engineer Associate ?

Deux ans, après quoi tu repasses la version courante de l'examen. Databricks ne propose aucune alternative par formation continue. Sur un sujet qui évolue aussi vite, la reprise sera probablement un examen sensiblement différent.

Generative AI Engineer ou Machine Learning Associate ?

L'examen machine learning porte sur l'entraînement, le suivi et le déploiement de tes propres modèles, Databricks Machine Learning en représentant à lui seul 38%. L'examen d'IA générative part du principe que le modèle existe déjà et évalue ce que tu construis autour : retrieval, chaining, évaluation et gouvernance. Choisis celui qui correspond à ce que tu fais : entraîner des modèles ou les assembler.

Pass-IT est un outil de révision indépendant, ni affilié à Databricks ni approuvé par Databricks ; Databricks et les noms d’examens sont des marques de leurs propriétaires respectifs.

Une certification. Un seul paiement.

Accès complet à DB-GAIE

Accède à toute la banque de questions de cette certification. Alex explique chaque réponse et ton score de préparation te montre quoi travailler ensuite.

Acheter l’accès à DB-GAIE pour $29.99Un seul paiement. Accès à vie à cette certification.
Vérifie gratuitement si tu es prêt20 questions. Sans carte. Vois quoi travailler avant d’acheter.

Atteins 80 % de préparation et réussis — ou tu es remboursé.

Comment fonctionne le score →