EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-DEA · Associate

Databricks Data Engineer Associate — Questões de prática e simulado

Pratique com questões realistas de DB-DEA, alinhadas aos objetivos do exame. Alex explica cada resposta, e seu Readiness Score mostra o que estudar em seguida.

45Questões
90minLimite de tempo

Verificado com Databricks · agosto de 2026Versão atual do exame

Sobre o exame

O exame Databricks Certified Data Engineer Associate valida a capacidade de usar a Databricks Data Intelligence Platform nas tarefas centrais de engenharia de dados. Ele cobre desenvolvimento de ETL com PySpark e SQL, ingestão de dados com Auto Loader, COPY INTO e Lakeflow Connect, orquestração de pipelines com Lakeflow Jobs, além de governança e segurança via Unity Catalog. Você precisa demonstrar domínio de Delta Lake, CI/CD para pipelines de dados e resolução de problemas em cargas de trabalho de produção.

A certificação foi pensada para engenheiros de dados com seis meses ou mais de prática em Databricks, trabalhando com Spark SQL, PySpark, Delta Lake e workflows do Databricks. Ela mostra que você sabe construir e operar pipelines de dados confiáveis, prontos para produção, na plataforma.

O que cai na prova

Transformação e modelagem de dados é o domínio mais pesado, com 22%, logo à frente de ingestão e carga de dados, com 21%. Juntos, eles concentram quase metade da prova no pipeline bronze-silver-gold: limpar registros com PySpark e SQL e depois escolher o método de carga entre COPY INTO, Auto Loader e Lakeflow Connect. Na sequência vêm o trabalho com Lakeflow Jobs (16%) e governança e segurança (15%), que cobrem orquestração baseada em DAG e as regras de acesso do Unity Catalog.

Fundamentos da plataforma, CI/CD e troubleshooting ficam entre 6% e 10% cada um e cobram habilidades operacionais mais específicas: escolha de compute, deploy via Git com automation bundles e leitura das métricas de stage no Spark UI para identificar skew ou memory spill, em vez da construção de pipelines que ocupa o resto da prova.

Estrutura do exame: DB-DEA

Databricks Intelligence Platform6%

Map the architecture behind Databricks' Delta Lake storage layer and its Unity Catalog governance layer, then match workloads to the right compute service by weighing cost against performance limits.

≈ 5 h
Data Ingestion and Loading21%

Enable batch, streaming, and incremental data ingestion patterns using tools such as COPY INTO, Auto Loader, and Lakeflow Connect into Unity Catalog-governed tables. Also covers prioritizing between ingestion methods based on volume, frequency, and governance needs, and ingesting semi-structured and unstructured data.

≈ 17 h
Data Transformation and Modeling22%

Clean and transform data through the bronze, silver, and gold layers using PySpark and SQL, including joins, deduplication, aggregation, and column and row manipulation. Also covers basic Spark tuning parameters and applying data quality checks to Silver and Gold datasets.

≈ 18 h
Working with Lakeflow Jobs16%

Orchestrate Lakeflow Jobs with retry logic and conditional branching, wire task dependencies into a DAG, and decide whether a job should fire on a schedule or in response to new data arriving.

≈ 13 h
Implementing CI/CD10%

Branch, commit, and open pull requests through Databricks' Git integration, promote the same codebase across environments with variable overrides, and package jobs, pipelines, and other assets for deployment using automation bundles and the CLI.

≈ 8 h
Troubleshooting, Monitoring, and Optimization10%

Compare current job run times against historical baselines to catch regressions, read the Lakeflow Jobs UI for pipeline health, pinpoint bottlenecks like skew and disk spilling in the Spark UI, and diagnose cluster or library failures using both Liquid Clustering and Databricks' predictive-optimization feature.

≈ 8 h
Governance and Security15%

Distinguish Unity Catalog's managed tables from externally referenced ones, grant or deny access at the right level of the hierarchy, and mask or filter sensitive rows and columns using both group-based rules and centralized ABAC policies.

≈ 12 h

Formato do exame e tipos de pergunta

São 45 questões de múltipla escolha valendo nota em uma sessão de 90 minutos, com espaço para questões-piloto que não entram no resultado. As perguntas são baseadas em cenários: ler tabelas bronze e gravar uma saída silver limpa, escolher o método de ingestão para uma fonte específica ou orquestrar um DAG no Lakeflow Jobs com o tipo de trigger certo.

Tipos de pergunta: DB-DEA

Múltipla escolha100%

Escolha a única resposta certa entre quatro ou cinco opções — o formato básico da prova.

Databricks confirma esses tipos de questão — não publica uma distribuição percentual; as proporções refletem nosso banco de questões alinhado ao exame.

Experimente cinco questões de DB-DEA

Cinco questões direto do nosso banco de Databricks Certified Data Engineer Associate. Responda uma — Alex explica o porquê.

O exame e o app são em inglês — estas questões de exemplo nós traduzimos.

Governança e segurança1 / 5

Um engenheiro de dados precisa acessar a API REST do Databricks a partir de um notebook. Qual método de autenticação é recomendado para cargas de trabalho de produção automatizadas?

AlexExplicação completa do Alex

OAuth M2M com service principals é a autenticação recomendada pelo Databricks para cargas de trabalho de produção automatizadas. Service principals são identidades não humanas que geram tokens OAuth de curta duração pelo fluxo de client credentials, eliminando os riscos de credenciais de longa duração. Análise dos distratores: roles do IAM com escopo de cluster controlam o acesso aos recursos do cluster, não a autenticação da API. Tokens de usuário do Azure AD estão presos a sessões interativas de usuário, o que não serve para automação sem supervisão. PATs em secret scopes são mais simples, mas têm longa duração e ficam vinculados a um usuário — se essa pessoa sair ou o PAT vazar, o pipeline está comprometido. Boa prática: guarde as credenciais OAuth e leia-as com dbutils.secrets.get(), nunca deixe tokens fixos no código. Ref: docs.databricks.com/en/dev-tools/auth/oauth-m2m

Fontedocs.databricks.com

Transformação e modelagem de dados2 / 5

Um engenheiro de dados escreve uma consulta de Structured Streaming que faz join de um DataFrame de streaming com um DataFrame estático. Que tipo de join é esse?

AlexExplicação completa do Alex

Fazer join de um DataFrame de streaming com um DataFrame comum (estático) produz um join stream-static. O lado estático é relido a cada disparo de micro-batch, então atualizações na tabela estática são captadas automaticamente. Não é preciso watermark nem gerenciamento de estado. Análise dos distratores: join com janelas se refere a agregações baseadas em janelas de tempo no processamento de streams, não a uma classificação de tipo de join. Join de streams com estado implica joins stream-stream, que exigem watermarks nos dois lados para limitar o estado e evitar crescimento ilimitado. Join de lookup temporal não é um termo reconhecido no Spark Structured Streaming. Joins stream-static são ideais para enriquecer dados de streaming com tabelas de dimensão de mudança lenta. Ref: docs.databricks.com/en/transform/join

Fontedocs.databricks.com

Implementação de CI/CD3 / 5

Qual afirmação sobre o Databricks Repos está correta?

AlexExplicação completa do Alex

O Databricks Repos (agora chamado de pastas Git) se integra a provedores Git (GitHub, Azure DevOps, GitLab, Bitbucket) para sincronizar notebooks e código com repositórios remotos. Os usuários podem clonar, criar branches, fazer commit, push e pull, o que viabiliza fluxos de trabalho Git padrão dentro do Databricks. Análise dos distratores: os Repos NÃO aplicam regras de proteção de branch — isso é configurado nas definições do provedor Git. Os Repos NÃO armazenam resultados de execução: apenas os arquivos-fonte são sincronizados; o histórico de execuções fica no workspace. Os Repos NÃO oferecem um runner de CI/CD embutido — o CI/CD é tratado externamente via GitHub Actions ou Azure DevOps Pipelines, disparado pelos pushes para o remoto. Ref: docs.databricks.com/en/repos/git-operations-with-repos

Fontedocs.databricks.com

Ingestão e carregamento de dados4 / 5

Qual é a diferença entre uma leitura em batch (spark.read) e uma leitura em streaming (spark.readStream) de uma tabela Delta?

AlexExplicação completa do Alex

Leituras em batch no Delta carregam um snapshot da tabela, incluindo snapshots de time travel quando uma versão ou um timestamp é especificado. Leituras em streaming no Delta usam o Structured Streaming para processar o snapshot inicial e os commits futuros como micro-batches, com o progresso registrado em checkpoints e opções como startingVersion ou startingTimestamp. Se o esquema da tabela de origem mudar depois que uma leitura em streaming começou, o Databricks documenta que a consulta falha e normalmente precisa ser reiniciada no caso de mudanças de esquema compatíveis.

Fontedocs.databricks.com

Databricks Intelligence Platform5 / 5

O que o comando CONVERT TO DELTA faz?

AlexExplicação completa do Alex

O CONVERT TO DELTA faz uma conversão no próprio lugar de tabelas Parquet ou Iceberg existentes para o formato Delta Lake. Ele varre os arquivos de dados existentes, cria um log de transações _delta_log com as entradas do commit inicial e deixa a tabela consultável como Delta — sem reescrever nenhum arquivo de dados. Sintaxe: CONVERT TO DELTA parquet.`path` [PARTITIONED BY (col type)]. Para tabelas Iceberg com arquivos Parquet, ele lê o manifesto do Iceberg para montar o log do Delta. Incorreto — ele não migra tabelas Hive gerenciadas para tabelas externas. Incorreto — ele converte PARA Delta, não A PARTIR de Delta. Incorreto — ele não reescreve arquivos de dados; a conversão é só de metadados. Avro e ORC não são suportados pelo CONVERT TO DELTA. Ref: docs.databricks.com/en/sql/language-manual/delta-convert-to-delta.html

Fontedocs.databricks.com

322 questões, construídas como o exame

O banco de DB-DEA cobre todos os domínios do exame e continua crescendo com novas questões. Um simulado apresenta 45 questões seguidas, no mesmo cronômetro de 90 minutos do dia do exame.

Ata de verificação: DB-DEA

Conferência do conteúdo com a Databricks4 de agosto de 2026

última verificação com a fonte oficial da Databricks

Cobertura do conteúdo33 objetivos oficiais

distribuídos em 7 domínios, segundo o guia oficial do exame

Tamanho do banco322 questões

= 7 simulados completos de 45 questões — nunca a mesma questão duas vezes

Validação canônica322 de 322

cada uma verificada com a documentação oficial da Databricks — resposta, opções e explicação, fonte citada

Metodologia documentada abertamente.Como as questões são feitas →

Preparação para DB-DEA

Quanto tempo você precisa depende da experiência prática que já tem. O resto é definido pelo fornecedor: como a prova é aplicada, quando você pode refazê-la e por quanto tempo a certificação continua válida.

A prova pode ser feita online com proctor remoto ou em um centro de testes, e está disponível em inglês, japonês, português (BR) e coreano. A certificação vale por dois anos, e para renovar você precisa passar na versão atual da prova.

Seu plano: DB-DEA

Preparação

Tempo de estudo50–120 h

normalmente cerca de 50 h se você já trabalha com essas tecnologias, cerca de 120 h começando do zero

NívelAssociate
Vale ter antesNenhum pré-requisito obrigatório. O ideal é ter pelo menos 6 meses de prática com o Databricks.

Dia da prova e depois

ModalidadeSupervisionado online ou centro de testes
Política de repetiçãoSem período de espera obrigatório. Aplica-se uma taxa de repetição.
Validade2 anos

É preciso se recertificar a cada 2 anos, fazendo a versão atual do exame.

As horas são a nossa própria estimativa de planejamento — a Databricks não publica um tempo de preparação para esta prova. Um ponto de partida para o seu calendário, não uma meta.

Erros comuns

As questões de ingestão vão além de decorar nomes de ferramentas: você precisa saber quando as configurações de schema evolution do Auto Loader fazem diferença e quando a simplicidade do COPY INTO já resolve, além de como o Lakeflow Connect lida com managed e standard connectors para cada tipo de fonte. Governança e segurança pesa 15%, e GRANT, REVOKE e DENY se comportam de formas diferentes conforme o ponto da hierarquia do Unity Catalog em que são aplicados. Essa distinção derruba quem só trabalhou com permissões no nível do workspace. A orquestração com Lakeflow Jobs é fácil de subestimar nos seus 16%: tipos de trigger, dependências entre tasks e lógica de retry pesam tanto quanto boa parte do domínio de ingestão.

Pontos de atenção: DB-DEA

  1. 01Gold Layer Objects

    Quem não diferencia streaming tables, materialized views e views comuns na camada Gold acaba errando as questões sobre como atender os times de BI e analytics.

  2. 02Broadcast Join Tuning

    Se você não sabe como o autoBroadcastJoinThreshold e os demais ajustes de shuffle e paralelismo mudam o plano de execução de um join, as questões de tuning de transformações viram chute.

  3. 03Asset Bundle Config

    Confundir overrides de variáveis por ambiente nos Automation Bundles com configuração hardcoded leva a respostas erradas nas questões de CI/CD sobre promoção de dev para prod.

  4. 04Cluster Startup Failures

    Nas questões de troubleshooting, é preciso olhar os sintomas na Spark UI e saber dizer se o problema é conflito de bibliotecas, erro de out-of-memory ou falha na inicialização do cluster. Quem não faz essa distinção erra.

  5. 05Compute Service Choice

    Escolher uma opção de compute grande ou pequena demais para o modelo de custo da carga de trabalho, em vez de casar o tipo de cluster com o caso de uso real, custa pontos nas questões de fundamentos da plataforma.

O Pass-IT treina você exatamente nesses pontos fracos — adaptativo e espaçado →

Perguntas frequentes

Quanto tempo dura o exame Databricks Certified Data Engineer Associate?

O exame Databricks Certified Data Engineer Associate tem 45 questões e um limite de 90 minutos.

Quais são os erros mais comuns no exame Databricks Certified Data Engineer Associate?

Os erros mais comuns incluem: Gold Layer Objects, Broadcast Join Tuning, Asset Bundle Config, Cluster Startup Failures, Compute Service Choice. Concentre seu tempo de estudo nessas áreas para não perder pontos.

Como é a distribuição de peso da prova Databricks Data Engineer Associate?

Data transformation and modeling é a maior área, com 22%, seguida de ingestion and loading com 21% e Lakeflow jobs com 16%. Governance and security fica com 15%, enquanto CI/CD e troubleshooting ficam com 10% cada e platform basics com 6%. Juntas, ingestion e transformation passam de dois quintos da prova.

A certificação Data Engineer Associate expira?

Sim, depois de dois anos. A Databricks só recertifica por prova, então você faz a versão vigente na época em vez de acumular créditos de educação continuada. Como a própria plataforma muda rápido, refazer a prova costuma exigir estudo de verdade, não é só formalidade.

Você precisa de experiência antes da prova Data Engineer Associate?

Nenhuma certificação é exigida para agendar. A Databricks recomenda seis meses ou mais de prática na plataforma, e o catálogo estima cerca de 80 horas. A prova cita partes específicas do produto, como Lakeflow, então só ler a documentação deixa lacunas.

O que vem depois do Data Engineer Associate?

A prova Data Engineer Professional é o passo direto acima, com 120 horas previstas e questões que esperam que você escreva Python e SQL, não apenas reconheça. O Generative AI Engineer Associate é o movimento lateral se seus pipelines começarem a alimentar modelos. Nenhuma das duas exige a certificação associate antes.

O que acontece se você for reprovado na prova Data Engineer Associate?

Não há período de espera obrigatório antes da próxima tentativa. A Databricks deixa o ritmo com você, então o limite prático é a rapidez com que você fecha a lacuna que te reprovou.

O Pass-IT é uma ferramenta de estudo independente, sem afiliação com a Databricks nem endosso da Databricks; Databricks e os nomes dos exames são marcas dos respectivos titulares.

Uma certificação. Um único pagamento.

Acesso completo ao DB-DEA

Acesse todo o banco de questões desta certificação. Alex explica cada resposta, e seu Readiness Score mostra o que estudar em seguida.

Comprar acesso ao DB-DEA por $29.99Um único pagamento. Acesso vitalício a esta certificação.
Veja grátis se você está pronto20 questões. Sem cartão. Veja o que estudar antes de comprar.

Chegue a 80 % de preparação e passe — ou seu dinheiro de volta.

Como funciona o score →