EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-GAIE · Associate

Databricks Generative AI Engineer Associate — Questions d'entraînement et examen blanc

Prépare DB-GAIE avec des questions d’entraînement originales et des réponses clairement expliquées. Demande des précisions à Alex, ton tuteur IA, repère les sujets à revoir grâce à tes résultats et entraîne-toi à gérer ton temps avec des examens blancs chronométrés.

45Questions de l’examen blanc
90minTemps imparti

Vérifié auprès de Databricks · août 2026 · Version actuelle de l’examen

À propos de l’examen

L’examen Databricks Certified Generative AI Engineer Associate valide ta capacité à concevoir, développer et déployer des applications d’IA générative sur la plateforme Databricks. Il couvre la conception d’applications, la préparation et le chunking des données, la construction et le déploiement de pipelines de retrieval-augmented generation, l’évaluation, le monitoring ainsi que la gouvernance. Tu dois démontrer ta maîtrise du prompt engineering, des model-serving endpoints et de l’outillage d’IA générative de Databricks.

Cette certification s’adresse aux ingénieurs et développeurs IA qui ont au moins six mois d’expérience dans la création d’applications d’IA générative sur Databricks. Elle atteste que tu sais mener une application d’IA générative de sa conception jusqu’à son déploiement en production.

Essaie cinq questions sur DB-GAIE

Entraîne-toi avec cinq questions de la banque actuelle de l’app pour Databricks Certified Generative AI Engineer Associate, accompagnées de leurs réponses et explications.

Gouvernance1 / 5

Quelle est la relation entre un workspace Databricks et un metastore Unity Catalog dans le contexte de la gouvernance GenAI ?

AlexExplication complète d’Alex

Dans Unity Catalog, le metastore est le conteneur de plus haut niveau : il porte la hiérarchie catalogue → schéma → actif ainsi que les permissions. Plusieurs workspaces d'une même région peuvent partager un seul metastore, ce qui permet une gouvernance inter-workspaces des modèles, des tables et des autres actifs. Autrement dit, un modèle enregistré en dev est immédiatement visible en production avec des contrôles d'accès cohérents — sans aucune copie. Analyse des distracteurs : l'option « Un metastore ne peut être rattaché qu'à un seul workspace à la fois… » est fausse, car un metastore se rattache à de nombreux workspaces, pas à un seul. L'option « Chaque workspace nécessite un metastore dédié… » est fausse, car les metastores partagés rendent inutile un metastore par environnement. L'option « Unity Catalog attribue un metastore par région cloud… » est fausse, car Unity Catalog attribue bien un metastore par région, mais les workspaces de cette région partagent effectivement la gouvernance. Ref: docs.databricks.com/en/data-governance/unity-catalog/metastores.html

Sourcedocs.databricks.com

Assemblage et déploiement des applications2 / 5

Une équipe veut comparer par test A/B deux stratégies de prompt différentes pour son agent de support client. Comment doit-elle mettre cela en place avec Databricks serving ?

AlexExplication complète d’Alex

Les tests A/B d'agents GenAI sur Databricks reposent sur la traffic_config d'un serving endpoint, qui répartit les requêtes entre les served entities. Chaque version de l'agent est déployée comme une served_entity distincte sur le même endpoint, et traffic_percentage contrôle la répartition (le total doit faire 100). Les réponses de chaque version sont journalisées séparément dans l'inference table, ce qui permet de comparer qualité, latence et retours des utilisateurs. Analyse des distracteurs : l'option « Utiliser Feature Serving pour étiqueter chaque requête et la router… » est fausse — Feature Serving sert à récupérer des features, pas à router des prompts. L'option « Déployer un endpoint unique avec un hook de prétraitement… » est fausse — les hooks de prétraitement n'offrent ni véritable gestion du trafic ni journalisation indépendante. L'option « Enregistrer chaque version de prompt dans MLflow Model Registry… » est fausse — un notebook de routage maison contourne la gestion du trafic et la journalisation des inférences intégrées à Databricks. Ref: docs.databricks.com/en/machine-learning/model-serving/serve-multiple-models-to-serving-endpoint.html

Sourcedocs.databricks.com

Conception des applications3 / 5

Quelle approche permet à un agent GenAI d'accéder aux données les plus récentes lorsqu'il répond à des questions sur l'actualité ?

AlexExplication complète d’Alex

Les connaissances d'un LLM sont figées au moment de l'entraînement : il ne peut donc pas répondre à des questions sur l'actualité. Un pipeline RAG avec Delta Live Tables (l'option « Un agent de retrieval qui interroge un pipeline Delta… ») ne récupère que des documents indexés, pas des données web en direct. Élargir la fenêtre de contexte avec des instantanés en cache (l'option « Élargir la fenêtre de contexte pour y inclure un instantané en cache de… ») revient encore à utiliser des données périmées. Un fine-tuning hebdomadaire (l'option « Faire un fine-tuning hebdomadaire du modèle de base… ») introduit un décalage de plusieurs jours. Un agent à appel d'outils doté d'une recherche web ou d'outils d'API temps réel (l'option « Un agent à appel d'outils doté d'un outil de recherche web ou d'API temps réel ») interroge des sources de données externes à la demande et renvoie des résultats à la minute près. Databricks le permet via des serveurs MCP, des outils personnalisés et l'intégration de recherche web native avec les modèles Gemini/OpenAI/Anthropic. Ref: docs.databricks.com/en/machine-learning/model-serving/web-search; docs.databricks.com/en/generative-ai/agent-framework/agent-tool.

Sourcedocs.databricks.com

Préparation des données4 / 5

Lors de la création d'un index vector search de type Delta Sync, quel paramètre désigne la colonne dont le texte doit être vectorisé automatiquement ?

AlexExplication complète d’Alex

Lors de la création d'un index vector search Delta Sync avec embeddings managés, le paramètre embedding_source_column identifie la colonne de texte que Databricks va vectoriser automatiquement. La plateforme appelle l'endpoint du modèle d'embedding indiqué, traite le texte par lots et stocke les vecteurs obtenus dans l'index. Les options « auto_embedding_column », « vector_embedding_source » et « text_vectorization_col » sont des noms de paramètres inventés : aucun n'apparaît dans le SDK ni dans l'API REST de Databricks. Pour des embeddings auto-gérés, tu indiques à la place une embedding_vector_column contenant des vecteurs pré-calculés. Ref: docs.databricks.com/en/generative-ai/vector-search/create-index; docs.databricks.com/en/vector-search/query-vector-search.

Sourceapi-docs.databricks.com

Évaluation et supervision5 / 5

Quelle fonctionnalité Databricks permet aux ingénieurs de tracer l'intégralité du flux d'exécution d'un agent GenAI, y compris les appels d'outils, les étapes de retrieval et les interactions avec le LLM ?

AlexExplication complète d’Alex

MLflow Tracing instrumente automatiquement les applications GenAI quand tu utilises un framework pris en charge (LangChain, OpenAI, Databricks SDK). Chaque requête crée un trace composé de spans hiérarchiques qui représentent les opérations individuelles. Les ingénieurs peuvent consulter les traces dans l'interface MLflow pour déboguer des problèmes, repérer les goulots d'étranglement (quel appel d'outil est lent ?), vérifier la qualité du retrieval (qu'a renvoyé le retriever ?) et comprendre le raisonnement de l'agent (qu'a décidé le LLM, et pourquoi ?).

Sourcedocs.databricks.com

Les questions de l’app sont actuellement en anglais. Les traductions de cet aperçu concernent uniquement l’aperçu. Consulte l’organisme de certification pour connaître les langues disponibles pour l’examen officiel.

326 questions d’entraînement

La banque de questions Pass-IT te permet de t’entraîner pour DB-GAIE. Un examen blanc Pass-IT comporte 45 questions à traiter en 90 minutes : ces paramètres sont ceux de l’entraînement.

Détails de la banque de questions : DB-GAIE

Objectifs du guide56 objectifs répertoriés dans le guide officiel

répartis entre 6 domaines dans le guide officiel de l’examen

Taille de la banque326 questions

= La taille de la banque équivaut à 7 séries de 45 questions. Cela ne signifie pas que chaque examen blanc utilise une série distincte.

Domaines du programme6 domaines dans le programme de l’examen

Application Development 85 · Assembling and Deploying Applications 59 · Design Applications 47 · Data Preparation 51 · Evaluation and Monitoring 47 · Governance 37

Questions marquées comme vérifiées à partir des sources326 sur 326

questions dont la réponse, les choix et l’explication sont enregistrés comme ayant été vérifiés à partir de la documentation officielle de Databricks

Contenu de l’examen

Le développement d’applications est le domaine dominant avec 30 %, soit près d’un tiers de l’examen. Il couvre le choix des frameworks comme LangChain, le prompt engineering, les guardrails LLM et la sélection d’un modèle depuis un hub ou une marketplace. Vient ensuite l’assemblage et le déploiement d’applications, à 22 % : coder des chains sous forme de modèles pyfunc, les enregistrer dans Unity Catalog et mettre en place des index Vector Search pour la recherche documentaire.

La conception d’applications et la préparation des données pèsent 14 % chacune. On y teste le design des prompts face aux besoins métier, et la stratégie de chunking face à la structure des documents. L’évaluation et le monitoring (12 %) ainsi que la gouvernance (8 %) complètent l’examen, avec le scoring MLflow, le suivi via AI Gateway et les guardrails contre les entrées malveillantes ou les risques de licence dans les données sources.

Programme de l’examen : DB-GAIE

Application Development30%

Développement d'outils GenAI et de chaînes applicatives, augmentation des prompts, mise en place de guardrails, sélection de modèles et utilisation de frameworks comme LangChain sur Databricks.

≈ 24 h
Assembling and Deploying Applications22%

Déploiement de modèles, enregistrement dans Unity Catalog, configuration de Vector Search, mise en place de pipelines RAG de bout en bout et gestion des serving endpoints.

≈ 18 h
Design Applications14%

Prompt engineering, conception de pipelines, sélection des modèles et des composants, et alignement des solutions techniques sur les besoins métier.

≈ 11 h
Data Preparation14%

Stratégies de chunking pour les documents, filtrage et extraction de contenu, gestion de la structure des documents et utilisation de packages Python pour l'extraction de données.

≈ 11 h
Evaluation and Monitoring12%

Techniques d'évaluation des modèles, choix des métriques appropriées, logging et monitoring des inférences, et fonctionnalités d'évaluation de Databricks.

≈ 10 h
Governance8%

Sécurité des données et des applications, mise en place de guardrails, data masking, aspects juridiques et de licence, et gouvernance Unity Catalog pour l'IA.

≈ 6 h

Format de l’examen et types de questions

L’examen compte 45 questions notées, en QCM à réponse unique ou à réponses multiples, dans une fenêtre de 90 minutes ; des questions pilotes non notées peuvent aussi apparaître. Les énoncés sont très orientés scénario : choisir une approche de chunking adaptée à un corpus donné, faire correspondre les composants d’une chain à un format d’entrée et de sortie précis, ou configurer Vector Search en respectant un budget de latence et de coût.

Types de questions : DB-GAIE

Choix multiple100%

Sélectionne la seule réponse qui répond le mieux aux exigences de la question.

Consulte Databricks pour les informations officielles sur les formats de questions. Les proportions affichées décrivent la banque de questions Pass-IT et ne permettent pas de déduire celles de l’examen officiel.

Préparation à DB-GAIE

L’examen se passe en ligne avec un surveillant à distance, ou dans un centre d’examen, en anglais, japonais, portugais (BR) et coréen. La certification reste valable deux ans ; pour la renouveler, tu dois repasser la version en vigueur de l’examen.

Préparation et modalités : DB-GAIE

Préparation

Exemple de durée de préparation50–120 h

fourchette illustrative pour t’organiser : de 50 h avec une expérience pertinente à 120 h si tu débutes ; tes besoins peuvent se situer en dehors de cette fourchette

NiveauAssocié
Connaissances conseilléesAucun prérequis. Il est conseillé d'avoir au moins 6 mois de pratique du développement d'IA générative sur Databricks.

Passage de l’examen et maintien de la certification

Modalités de passageSurveillé en ligne ou centre d'examen
Conditions de nouvelle tentativeAucun délai d'attente obligatoire. Des frais de nouvelle tentative s'appliquent.
Validité de la certification2 ans

Tu dois te recertifier tous les 2 ans en repassant la version en vigueur de l'examen.

Erreurs fréquentes

Points à revoir : DB-GAIE

  1. 01Agent Bricks Selection

    Construire une chaîne multi-agents sur mesure en partant de zéro, au lieu de reconnaître qu’un template Agent Bricks prêt à l’emploi pour le Q&A ancré dans tes données, le routage multi-agents ou l’extraction structurée répond déjà au scénario, te fait perdre des points sur les questions de conception d’application.

  2. 02MCP Server Integration

    Ne pas faire la différence entre un connecteur MCP managé, un serveur MCP hébergé en externe et un serveur MCP entièrement custom selon le besoin de l’application te fait perdre des points sur les questions d’assemblage d’outils et d’agents.

  3. 03Re-ranking Role

    Zapper le re-ranking en tant qu’étape de retrieval à part entière et considérer les meilleurs résultats de la vector search comme définitifs te fait perdre des points sur les questions de conception de pipeline de retrieval.

  4. 04AI Gateway Tracking

    Confondre le suivi des inférences et de l’usage assuré par l’AI Gateway avec la simple journalisation via les inference tables, ou oublier le rate limiting comme levier de maîtrise des coûts, te fait perdre des points sur les questions de monitoring de déploiement de LLM.

  5. 05Licensing Risk

    Négliger les conditions de licence des sources de données au moment de choisir le contenu d’entraînement ou de retrieval te fait perdre des points sur les questions de gouvernance qui portent sur le risque juridique dans un pipeline GenAI.

Questions fréquentes

Combien de temps dure l’examen Databricks Certified Generative AI Engineer Associate ?

L’examen Databricks Certified Generative AI Engineer Associate comporte 45 questions et le temps imparti est de 90 minutes.

Quels points méritent une attention particulière pendant la préparation de Databricks Certified Generative AI Engineer Associate ?

Les points à revoir comprennent Agent Bricks Selection, MCP Server Integration, Re-ranking Role, AI Gateway Tracking, Licensing Risk. Travaille sur des exemples pour vérifier que tu comprends les distinctions et que tu peux expliquer ta réponse.

Quels sujets pèsent le plus dans le Generative AI Engineer Associate ?

Application development est le plus gros domaine avec 30%, suivi de l'assemblage et du déploiement d'applications à 22%. La conception et la préparation des données comptent pour 14% chacune, l'évaluation et le monitoring pour 12% et la gouvernance pour 8%. Plus de la moitié de l'examen consiste donc à construire et livrer une application générative plutôt qu'à raisonner sur les modèles.

Que te faut-il avant l'examen Generative AI Engineer Associate ?

Aucune certification n'est exigée. Databricks recommande six mois ou plus de développement d'IA générative en pratique sur la plateforme, et le catalogue table sur environ 80 heures. L'examen est écrit du point de vue de celui qui construit : les questions sur le retrieval, le chaining et le déploiement supposent que tu as déjà livré quelque chose.

Combien de temps dure le Generative AI Engineer Associate ?

Deux ans, après quoi tu repasses la version courante de l'examen. Databricks ne propose aucune alternative par formation continue. Sur un sujet qui évolue aussi vite, la reprise sera probablement un examen sensiblement différent.

Generative AI Engineer ou Machine Learning Associate ?

L'examen machine learning porte sur l'entraînement, le suivi et le déploiement de tes propres modèles, Databricks Machine Learning en représentant à lui seul 38%. L'examen d'IA générative part du principe que le modèle existe déjà et évalue ce que tu construis autour : retrieval, chaining, évaluation et gouvernance. Choisis celui qui correspond à ce que tu fais : entraîner des modèles ou les assembler.

Une certification, 12 mois

Entraînement pour DB-GAIE

Concentre ton entraînement sur une certification ou choisis Pro pour t’entraîner à toutes les certifications.

Commencer un entraînement gratuitEssaie les 20 premières questions sans carte bancaire pour voir si cet entraînement te convient.

Pour les achats éligibles : remboursement garanti si tu échoues à ton examen.

Voir les conditions de garantie →