EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEA · Associate

Databricks Data Engineer Associate — Questões de prática e simulado

Prepare-se para DB-DEA com questões de prática originais e respostas explicadas com clareza. Peça mais detalhes a Alex, seu tutor de IA, use seus resultados para identificar os temas que precisam de revisão e pratique a gestão do tempo com simulados cronometrados.

45Questões do simulado
90minLimite de tempo

Conferido com informações de Databricks · agosto de 2026 · Versão atual do exame

Sobre o exame

O exame Databricks Certified Data Engineer Associate valida a capacidade de usar a Databricks Data Intelligence Platform nas tarefas centrais de engenharia de dados. Ele cobre desenvolvimento de ETL com PySpark e SQL, ingestão de dados com Auto Loader, COPY INTO e Lakeflow Connect, orquestração de pipelines com Lakeflow Jobs, além de governança e segurança via Unity Catalog. Você precisa demonstrar domínio de Delta Lake, CI/CD para pipelines de dados e resolução de problemas em cargas de trabalho de produção.

A certificação foi pensada para engenheiros de dados com seis meses ou mais de prática em Databricks, trabalhando com Spark SQL, PySpark, Delta Lake e workflows do Databricks. Ela mostra que você sabe construir e operar pipelines de dados confiáveis, prontos para produção, na plataforma.

Experimente cinco questões de DB-DEA

Pratique com cinco questões do banco atual de Databricks Certified Data Engineer Associate no app, com respostas e explicações.

Governança e segurança1 / 5

Um engenheiro de dados precisa acessar a API REST do Databricks a partir de um notebook. Qual método de autenticação é recomendado para cargas de trabalho de produção automatizadas?

AlexExplicação completa do Alex

OAuth M2M com service principals é a autenticação recomendada pelo Databricks para cargas de trabalho de produção automatizadas. Service principals são identidades não humanas que geram tokens OAuth de curta duração pelo fluxo de client credentials, eliminando os riscos de credenciais de longa duração. Análise dos distratores: roles do IAM com escopo de cluster controlam o acesso aos recursos do cluster, não a autenticação da API. Tokens de usuário do Azure AD estão presos a sessões interativas de usuário, o que não serve para automação sem supervisão. PATs em secret scopes são mais simples, mas têm longa duração e ficam vinculados a um usuário — se essa pessoa sair ou o PAT vazar, o pipeline está comprometido. Boa prática: guarde as credenciais OAuth e leia-as com dbutils.secrets.get(), nunca deixe tokens fixos no código. Ref: docs.databricks.com/en/dev-tools/auth/oauth-m2m

Fontedocs.databricks.com

Transformação e modelagem de dados2 / 5

Um engenheiro de dados escreve uma consulta de Structured Streaming que faz join de um DataFrame de streaming com um DataFrame estático. Que tipo de join é esse?

AlexExplicação completa do Alex

Fazer join de um DataFrame de streaming com um DataFrame comum (estático) produz um join stream-static. O lado estático é relido a cada disparo de micro-batch, então atualizações na tabela estática são captadas automaticamente. Não é preciso watermark nem gerenciamento de estado. Análise dos distratores: join com janelas se refere a agregações baseadas em janelas de tempo no processamento de streams, não a uma classificação de tipo de join. Join de streams com estado implica joins stream-stream, que exigem watermarks nos dois lados para limitar o estado e evitar crescimento ilimitado. Join de lookup temporal não é um termo reconhecido no Spark Structured Streaming. Joins stream-static são ideais para enriquecer dados de streaming com tabelas de dimensão de mudança lenta. Ref: docs.databricks.com/en/transform/join

Fontedocs.databricks.com

Implementação de CI/CD3 / 5

Qual afirmação sobre o Databricks Repos está correta?

AlexExplicação completa do Alex

O Databricks Repos (agora chamado de pastas Git) se integra a provedores Git (GitHub, Azure DevOps, GitLab, Bitbucket) para sincronizar notebooks e código com repositórios remotos. Os usuários podem clonar, criar branches, fazer commit, push e pull, o que viabiliza fluxos de trabalho Git padrão dentro do Databricks. Análise dos distratores: os Repos NÃO aplicam regras de proteção de branch — isso é configurado nas definições do provedor Git. Os Repos NÃO armazenam resultados de execução: apenas os arquivos-fonte são sincronizados; o histórico de execuções fica no workspace. Os Repos NÃO oferecem um runner de CI/CD embutido — o CI/CD é tratado externamente via GitHub Actions ou Azure DevOps Pipelines, disparado pelos pushes para o remoto. Ref: docs.databricks.com/en/repos/git-operations-with-repos

Fontedocs.databricks.com

Ingestão e carregamento de dados4 / 5

Qual é a diferença entre uma leitura em batch (spark.read) e uma leitura em streaming (spark.readStream) de uma tabela Delta?

AlexExplicação completa do Alex

Leituras em batch no Delta carregam um snapshot da tabela, incluindo snapshots de time travel quando uma versão ou um timestamp é especificado. Leituras em streaming no Delta usam o Structured Streaming para processar o snapshot inicial e os commits futuros como micro-batches, com o progresso registrado em checkpoints e opções como startingVersion ou startingTimestamp. Se o esquema da tabela de origem mudar depois que uma leitura em streaming começou, o Databricks documenta que a consulta falha e normalmente precisa ser reiniciada no caso de mudanças de esquema compatíveis.

Fontedocs.databricks.com

Databricks Intelligence Platform5 / 5

O que o comando CONVERT TO DELTA faz?

AlexExplicação completa do Alex

O CONVERT TO DELTA faz uma conversão no próprio lugar de tabelas Parquet ou Iceberg existentes para o formato Delta Lake. Ele varre os arquivos de dados existentes, cria um log de transações _delta_log com as entradas do commit inicial e deixa a tabela consultável como Delta — sem reescrever nenhum arquivo de dados. Sintaxe: CONVERT TO DELTA parquet.`path` [PARTITIONED BY (col type)]. Para tabelas Iceberg com arquivos Parquet, ele lê o manifesto do Iceberg para montar o log do Delta. Incorreto — ele não migra tabelas Hive gerenciadas para tabelas externas. Incorreto — ele converte PARA Delta, não A PARTIR de Delta. Incorreto — ele não reescreve arquivos de dados; a conversão é só de metadados. Avro e ORC não são suportados pelo CONVERT TO DELTA. Ref: docs.databricks.com/en/sql/language-manual/delta-convert-to-delta.html

Fontedocs.databricks.com

As questões do app estão atualmente em inglês. As traduções desta prévia se aplicam apenas à prévia. Consulte a entidade certificadora para saber quais idiomas estão disponíveis para o exame oficial.

322 questões de prática

Use o banco de questões do Pass-IT para praticar para DB-DEA. Os simulados estão configurados com 45 questões em 90 minutos.

Dados do banco de questões: DB-DEA

Objetivos do guia33 objetivos listados no guia oficial

distribuídos por 7 domínios no guia oficial do exame

Tamanho do banco322 questões

= O tamanho do banco equivale a 7 conjuntos de 45 questões. Isso não significa que cada simulado use um conjunto diferente.

Registradas como conferidas com fontes322 de 322

questões cuja resposta, alternativas e explicação constam como conferidas com a documentação oficial de Databricks

Conteúdo do exame

Transformação e modelagem de dados é o domínio mais pesado, com 22%, logo à frente de ingestão e carga de dados, com 21%. Juntos, eles concentram quase metade da prova no pipeline bronze-silver-gold: limpar registros com PySpark e SQL e depois escolher o método de carga entre COPY INTO, Auto Loader e Lakeflow Connect. Na sequência vêm o trabalho com Lakeflow Jobs (16%) e governança e segurança (15%), que cobrem orquestração baseada em DAG e as regras de acesso do Unity Catalog.

Fundamentos da plataforma, CI/CD e troubleshooting ficam entre 6% e 10% cada um e cobram habilidades operacionais mais específicas: escolha de compute, deploy via Git com automation bundles e leitura das métricas de stage no Spark UI para identificar skew ou memory spill, em vez da construção de pipelines que ocupa o resto da prova.

Conteúdo programático: DB-DEA

Databricks Intelligence Platform6%

Map the architecture behind Databricks' Delta Lake storage layer and its Unity Catalog governance layer, then match workloads to the right compute service by weighing cost against performance limits.

≈ 5 h
Data Ingestion and Loading21%

Enable batch, streaming, and incremental data ingestion patterns using tools such as COPY INTO, Auto Loader, and Lakeflow Connect into Unity Catalog-governed tables. Also covers prioritizing between ingestion methods based on volume, frequency, and governance needs, and ingesting semi-structured and unstructured data.

≈ 17 h
Data Transformation and Modeling22%

Clean and transform data through the bronze, silver, and gold layers using PySpark and SQL, including joins, deduplication, aggregation, and column and row manipulation. Also covers basic Spark tuning parameters and applying data quality checks to Silver and Gold datasets.

≈ 18 h
Working with Lakeflow Jobs16%

Orchestrate Lakeflow Jobs with retry logic and conditional branching, wire task dependencies into a DAG, and decide whether a job should fire on a schedule or in response to new data arriving.

≈ 13 h
Implementing CI/CD10%

Branch, commit, and open pull requests through Databricks' Git integration, promote the same codebase across environments with variable overrides, and package jobs, pipelines, and other assets for deployment using automation bundles and the CLI.

≈ 8 h
Troubleshooting, Monitoring, and Optimization10%

Compare current job run times against historical baselines to catch regressions, read the Lakeflow Jobs UI for pipeline health, pinpoint bottlenecks like skew and disk spilling in the Spark UI, and diagnose cluster or library failures using both Liquid Clustering and Databricks' predictive-optimization feature.

≈ 8 h
Governance and Security15%

Distinguish Unity Catalog's managed tables from externally referenced ones, grant or deny access at the right level of the hierarchy, and mask or filter sensitive rows and columns using both group-based rules and centralized ABAC policies.

≈ 12 h

Formato do exame e tipos de questões

São 45 questões de múltipla escolha valendo nota em uma sessão de 90 minutos, com espaço para questões-piloto que não entram no resultado. As perguntas são baseadas em cenários: ler tabelas bronze e gravar uma saída silver limpa, escolher o método de ingestão para uma fonte específica ou orquestrar um DAG no Lakeflow Jobs com o tipo de trigger certo.

Tipos de questões: DB-DEA

Múltipla escolha100%

Selecione a única resposta que melhor atende aos requisitos da questão.

Consulte Databricks para obter as informações oficiais sobre os formatos de questões. As proporções exibidas descrevem o banco de prática do Pass-IT e não determinam as proporções do exame oficial.

Preparação para DB-DEA

A prova pode ser feita online com proctor remoto ou em um centro de testes, e está disponível em inglês, japonês, português (BR) e coreano. A certificação vale por dois anos, e para renovar você precisa passar na versão atual da prova.

Preparação e informações práticas: DB-DEA

Preparação

Exemplo de tempo de estudo50–120 h

faixa ilustrativa para o planejamento: de 50 h com experiência relevante a 120 h para quem está começando; suas necessidades podem ficar fora dessa faixa

NívelAssociado
Conhecimentos recomendadosNenhum pré-requisito obrigatório. O ideal é ter pelo menos 6 meses de prática com o Databricks.

Realização do exame e manutenção da certificação

ModalidadeSupervisionado online ou centro de testes
Política de novas tentativasSem período de espera obrigatório. Aplica-se uma taxa de repetição.
Validade da certificação2 anos

É preciso se recertificar a cada 2 anos, fazendo a versão atual do exame.

Erros comuns

Temas para revisar: DB-DEA

  1. 01Gold Layer Objects

    Quem não diferencia streaming tables, materialized views e views comuns na camada Gold acaba errando as questões sobre como atender os times de BI e analytics.

  2. 02Broadcast Join Tuning

    Se você não sabe como o autoBroadcastJoinThreshold e os demais ajustes de shuffle e paralelismo mudam o plano de execução de um join, as questões de tuning de transformações viram chute.

  3. 03Asset Bundle Config

    Confundir overrides de variáveis por ambiente nos Automation Bundles com configuração hardcoded leva a respostas erradas nas questões de CI/CD sobre promoção de dev para prod.

  4. 04Cluster Startup Failures

    Nas questões de troubleshooting, é preciso olhar os sintomas na Spark UI e saber dizer se o problema é conflito de bibliotecas, erro de out-of-memory ou falha na inicialização do cluster. Quem não faz essa distinção erra.

  5. 05Compute Service Choice

    Escolher uma opção de compute grande ou pequena demais para o modelo de custo da carga de trabalho, em vez de casar o tipo de cluster com o caso de uso real, custa pontos nas questões de fundamentos da plataforma.

Perguntas frequentes

Quanto tempo dura o exame Databricks Certified Data Engineer Associate?

O exame Databricks Certified Data Engineer Associate tem 45 questões e um limite de tempo de 90 minutos.

Quais erros merecem atenção na preparação para Databricks Certified Data Engineer Associate?

Entre os temas que merecem revisão estão Gold Layer Objects, Broadcast Join Tuning, Asset Bundle Config, Cluster Startup Failures, Compute Service Choice. Trabalhe com exemplos para verificar se você entende as diferenças e consegue justificar sua resposta.

Como é a distribuição de peso da prova Databricks Data Engineer Associate?

Data transformation and modeling é a maior área, com 22%, seguida de ingestion and loading com 21% e Lakeflow jobs com 16%. Governance and security fica com 15%, enquanto CI/CD e troubleshooting ficam com 10% cada e platform basics com 6%. Juntas, ingestion e transformation passam de dois quintos da prova.

A certificação Data Engineer Associate expira?

Sim, depois de dois anos. A Databricks só recertifica por prova, então você faz a versão vigente na época em vez de acumular créditos de educação continuada. Como a própria plataforma muda rápido, refazer a prova costuma exigir estudo de verdade, não é só formalidade.

Você precisa de experiência antes da prova Data Engineer Associate?

Nenhuma certificação é exigida para agendar. A Databricks recomenda seis meses ou mais de prática na plataforma, e o catálogo estima cerca de 80 horas. A prova cita partes específicas do produto, como Lakeflow, então só ler a documentação deixa lacunas.

O que vem depois do Data Engineer Associate?

A prova Data Engineer Professional é o passo direto acima, com 120 horas previstas e questões que esperam que você escreva Python e SQL, não apenas reconheça. O Generative AI Engineer Associate é o movimento lateral se seus pipelines começarem a alimentar modelos. Nenhuma das duas exige a certificação associate antes.

O que acontece se você for reprovado na prova Data Engineer Associate?

Não há período de espera obrigatório antes da próxima tentativa. A Databricks deixa o ritmo com você, então o limite prático é a rapidez com que você fecha a lacuna que te reprovou.

Uma certificação, 12 meses

Prática para DB-DEA

Concentre sua prática em uma certificação ou escolha o Pro para praticar para todas as certificações.

Começar uma sessão de prática gratuitaExperimente as primeiras 20 questões sem cartão para avaliar se a prática atende às suas necessidades.

Para compras elegíveis: garantia de reembolso se você não passar no exame.

Ver condições da garantia →