EnglishDeutschFrançaisEspañolPortuguês

Databricks · DB-SPARK · Associate

Databricks Associate Developer for Apache Spark — Questões de prática e simulado

Prepare-se para DB-SPARK com questões de prática originais e respostas explicadas com clareza. Peça mais detalhes a Alex, seu tutor de IA, use seus resultados para identificar os temas que precisam de revisão e pratique a gestão do tempo com simulados cronometrados.

45Questões do simulado
90minLimite de tempo

Conferido com informações de Databricks · agosto de 2026 · Versão atual do exame

Sobre o exame

O exame Databricks Certified Associate Developer for Apache Spark comprova sua capacidade de construir aplicações com o Apache Spark. Ele cobre as APIs DataFrame e Dataset, o Spark SQL, a arquitetura e os componentes do Spark, o Structured Streaming, além de troubleshooting e tuning de aplicações DataFrame. Você também precisa mostrar domínio de Spark Connect e da Pandas API on Spark; o guia oficial atual apresenta todas as tarefas em Python.

A certificação foi pensada para desenvolvedores com seis meses ou mais de experiência criando aplicações com Apache Spark em Python ou Scala. Ela mostra fluência prática nas APIs centrais do Spark e a capacidade de raciocinar sobre performance e resolução de problemas em um ambiente de computação distribuída.

Experimente cinco questões de DB-SPARK

Pratique com cinco questões do banco atual de Databricks Certified Associate Developer for Apache Spark no app, com respostas e explicações.

Arquitetura e componentes do Apache Spark1 / 5

Um executor do Spark tem 4 cores e 16 GB de memória. Quantas tasks podem rodar simultaneamente nesse executor?

AlexExplicação completa do Alex

Tasks simultâneas por executor = spark.executor.cores / spark.task.cpus. Com o padrão spark.task.cpus=1, cada core roda uma task, então 4 cores = 4 tasks simultâneas. Aumentar spark.task.cpus reduz a concorrência, mas dá mais CPU para cada task — útil para algoritmos de ML multithread ou cargas em GPU. A memória é compartilhada: a memória de trabalho de cada task ≈ (memória do executor × memory fraction) / tasks simultâneas. Análise dos distratores: A opção “O número de tasks simultâneas é limitado…” está errada — spark.default.parallelism controla o total de partições, não a concorrência por executor. A opção “A concorrência é limitada por…” está errada — spark.scheduler.maxRegisteredResourcesWaitingTime não tem relação com o número de slots de task. A opção “Até 4 tasks podem rodar simultaneamente…” está errada — memoryFraction afeta os limiares de spill, mas não limita a concorrência de tasks. Ref: spark.apache.org/docs/latest/configuration.html#scheduling

Fontedatabricks.com

Solução de problemas e tuning de aplicações com a API DataFrame do Apache Spark2 / 5

Um desenvolvedor percebe que, em um job do Spark, uma task de um stage de shuffle leva 10 minutos, enquanto todas as outras terminam em 30 segundos. Como se chama esse problema e como ele deve ser resolvido?

AlexExplicação completa do Alex

Data skew é um problema de desempenho comum no Spark: a distribuição desigual dos dados gera tasks retardatárias. Sintomas: uma ou poucas tasks demoram muito mais do que as demais na Spark UI. Soluções: (1) o skew join do AQE (spark.sql.adaptive.skewJoin.enabled=true, padrão no Spark 3.x) divide automaticamente as partições grandes demais, (2) o salting de chave acrescenta um número aleatório à chave enviesada e replica o lado menor do join, (3) um broadcast join, se a tabela não enviesada for pequena o suficiente, (4) uma pré-agregação para reduzir o volume de dados antes da operação enviesada.

Fontespark.apache.org

Uso da API do pandas no Spark3 / 5

Ao usar a API do pandas no Spark, um desenvolvedor escreve ps_df.to_pandas(). O que acontece?

AlexExplicação completa do Alex

to_pandas() é a saída de emergência do processamento distribuído para o local. Ele usa o Apache Arrow para uma serialização eficiente (formato colunar, zero-copy quando possível). O fluxo dos dados: executors → driver (pela rede) → batches do Arrow → DataFrame do pandas. Sobre o tamanho: o driver precisa de memória suficiente para segurar o DataFrame inteiro no formato pandas, o que costuma ser de 2 a 10 vezes o tamanho que ele tem em memória no Spark, por causa do overhead dos objetos Python. Padrão seguro: if len(ps_df) > threshold: ps_df = ps_df.sample(frac=threshold/len(ps_df)); local_df = ps_df.to_pandas().

Fontespark.apache.org

Structured Streaming4 / 5

Um desenvolvedor chama spark.streams.awaitAnyTermination(timeout=3600). O que isso faz?

AlexExplicação completa do Alex

Ciclo de vida de uma aplicação de streaming em produção: (1) iniciar as streaming queries com writeStream.start(), (2) chamar spark.streams.awaitAnyTermination() para bloquear a thread principal. Sem esse bloqueio, o processo do driver termina e todas as streaming queries param. O awaitAnyTermination espera QUALQUER query parar (por erro ou por um stop() explícito). Depois que ele retorna, verifique as exceções: query.exception mostra os detalhes da falha. Para aplicações de produção de longa duração, use awaitAnyTermination() sem timeout (bloqueia indefinidamente). Em notebooks isso não é necessário, porque o kernel do notebook mantém a sessão viva.

Fontespark.apache.org

Desenvolvimento de aplicações com a API DataFrame/DataSet do Apache Spark™5 / 5

Um desenvolvedor escreve df.alias('orders').join(df2.alias('items'), col('orders.order_id') == col('items.order_id')). O que alias() faz em um DataFrame?

AlexExplicação completa do Alex

DataFrame.alias() atribui um nome lógico a um DataFrame para qualificar referências a colunas em joins e seleções. Isso é essencial para self-joins (df.alias('current').join(df.alias('previous'), ...)) e para qualquer join em que os dois DataFrames compartilham nomes de colunas. O alias adiciona um qualificador para a resolução de colunas—ele não copia dados nem modifica o DataFrame. Em SQL, isso equivale a FROM orders AS o. Análise dos distratores: A opção “Cria um escopo lógico que isola as colunas do DataFrame…” está errada—alias não cria escopos de isolamento nem bloqueia otimizações. A opção “Declara um identificador de DataFrame reutilizável…” está errada—alias não registra nada no catálogo da SparkSession. A opção “Registra uma referência nomeada na tabela de símbolos do plano de consulta…” está errada—alias é mais simples do que um registro em tabela de símbolos; é apenas um qualificador de nome de coluna. Ref: docs.databricks.com/en/pyspark/reference/classes/dataframe/alias.html

Fontedatabricks.com

As questões do app estão atualmente em inglês. As traduções desta prévia se aplicam apenas à prévia. Consulte a entidade certificadora para saber quais idiomas estão disponíveis para o exame oficial.

311 questões de prática

Use o banco de questões do Pass-IT para praticar para DB-SPARK. Os simulados estão configurados com 45 questões em 90 minutos.

Dados do banco de questões: DB-SPARK

Objetivos do guia32 objetivos listados no guia oficial

distribuídos por 7 domínios no guia oficial do exame

Tamanho do banco311 questões

= O tamanho do banco equivale a 6 conjuntos de 45 questões. Isso não significa que cada simulado use um conjunto diferente.

Registradas como conferidas com fontes311 de 311

questões cuja resposta, alternativas e explicação constam como conferidas com a documentação oficial de Databricks

Conteúdo do exame

O desenvolvimento com as APIs de DataFrame e Dataset é o maior domínio, com 30%, e cobre manipulação de colunas e linhas, joins, agregações e funções definidas pelo usuário com operadores stateful. Logo atrás vêm arquitetura e componentes (20%) e Spark SQL (20%), que juntos valem tanto quanto o domínio de DataFrame sozinho: aí entram o modelo driver-executor, particionamento e shuffles, avaliação lazy e leitura ou escrita via Spark SQL em fontes JDBC e em arquivos.

Troubleshooting e tuning e Structured Streaming ficam com 10% cada, cobrindo Adaptive Query Execution e processamento em micro-batch com semântica exactly-once. Spark Connect e a API Pandas do Spark são os domínios mais leves, com 5% cada: temas mais novos ou mais restritos, que muitos guias de estudo pulam, mas que ainda assim caem na prova.

Conteúdo programático: DB-SPARK

Developing Apache Spark™ DataFrame/DataSet API Applications30%

Manipulate DataFrame columns, rows, and structures through filtering, joining, aggregating, and date operations, and manage I/O operations and user-defined functions including stateful operators. Also covers broadcast variables, accumulators, and the purpose of broadcast joins.

≈ 24 h
Apache Spark Architecture and Components20%

Arquitetura de cluster do Spark, papéis de driver e executor, gerenciamento de memória, particionamento e o Catalyst optimizer.

≈ 16 h
Using Spark SQL20%

Consultas SQL no Spark, criação e gerenciamento de tabelas e views, window functions e otimização de desempenho de SQL.

≈ 16 h
Troubleshooting and Tuning Apache Spark DataFrame API Applications10%

Tune Spark performance by repartitioning or coalescing data to fight skew and cut shuffling, understand what Adaptive Query Execution does for you automatically, and read driver and executor logs to catch out-of-memory errors and underused clusters.

≈ 8 h
Structured Streaming10%

Construção de aplicações de streaming, watermarking, modos de saída, triggers e processamento com estado.

≈ 8 h
Using Spark Connect to deploy applications5%

Learn what Spark Connect enables for remote application development, and compare it against Apache Spark's client, cluster, and local deployment modes.

≈ 4 h
Using Pandas API on Spark5%

See what the Pandas API on Spark buys you over plain Pandas, and write Pandas UDFs that run against that same interface.

≈ 4 h

Formato do exame e tipos de questões

A prova tem 45 questões de múltipla escolha valendo nota, dentro de uma janela de 90 minutos, e pode incluir questões-piloto que não contam pontos. As perguntas são baseadas em cenários e passam pelas APIs de DataFrame e Dataset, por Spark SQL e pela arquitetura do cluster, testando se uma operação é lazy ou eager e como uma escolha de particionamento afeta o desempenho lá na frente, não apenas a sintaxe.

Tipos de questões: DB-SPARK

Múltipla escolha100%

Selecione a única resposta que melhor atende aos requisitos da questão.

Consulte Databricks para obter as informações oficiais sobre os formatos de questões. As proporções exibidas descrevem o banco de prática do Pass-IT e não determinam as proporções do exame oficial.

Preparação para DB-SPARK

A prova é aplicada online, com proctor remoto, ou em um centro de testes, e está disponível apenas em inglês. A certificação vale por dois anos, e recertificar significa passar na versão atual da prova.

Preparação e informações práticas: DB-SPARK

Preparação

Exemplo de tempo de estudo50–120 h

faixa ilustrativa para o planejamento: de 50 h com experiência relevante a 120 h para quem está começando; suas necessidades podem ficar fora dessa faixa

NívelAssociado
Conhecimentos recomendadosNenhum pré-requisito obrigatório. Recomendamos ter pelo menos 6 meses de experiência prática em desenvolvimento com Apache Spark.

Realização do exame e manutenção da certificação

ModalidadeSupervisionado online ou centro de testes
Política de novas tentativasSem período de espera obrigatório. Aplica-se uma taxa de repetição.
Validade da certificação2 anos

A recertificação é obrigatória a cada 2 anos e exige que você faça a versão atual do exame.

Erros comuns

Temas para revisar: DB-SPARK

  1. 01Stateful UDFs and StateStores

    Tratar uma UDF stateful apoiada por um StateStore como se fosse stateless, sem considerar que o estado persiste entre os micro-batches, leva a respostas erradas nas questões sobre UDFs avançadas.

  2. 02Save Modes on Files

    Confundir os save modes overwrite, append, ignore e error na hora de gravar o resultado de uma query de volta em arquivos faz você errar as questões sobre saída de dados no Spark SQL.

  3. 03AQE Benefits

    Não saber o que o Adaptive Query Execution realmente otimiza em tempo de execução, como o tratamento de joins com skew e o dimensionamento das shuffle partitions, leva a erros nas questões de tuning de performance.

  4. 04Streaming Dedup Watermarks

    Deduplicar um DataFrame de streaming sem watermark, deixando o estado crescer sem limite em vez de delimitá-lo corretamente para os dados atrasados, faz você errar as questões de structured streaming.

  5. 05Pandas UDF vs API

    Confundir uma Pandas UDF, que vetoriza uma função personalizada, com a própria Pandas API on Spark, que reimplementa a sintaxe do pandas sobre DataFrames distribuídos, leva a respostas erradas nas questões sobre Pandas on Spark.

Perguntas frequentes

Quanto tempo dura o exame Databricks Certified Associate Developer for Apache Spark?

O exame Databricks Certified Associate Developer for Apache Spark tem 45 questões e um limite de tempo de 90 minutos.

Quais erros merecem atenção na preparação para Databricks Certified Associate Developer for Apache Spark?

Entre os temas que merecem revisão estão Stateful UDFs and StateStores, Save Modes on Files, AQE Benefits, Streaming Dedup Watermarks, Pandas UDF vs API. Trabalhe com exemplos para verificar se você entende as diferenças e consegue justificar sua resposta.

O que você precisa antes da prova Databricks Spark developer?

Não existe pré-requisito formal. A Databricks recomenda pelo menos seis meses de desenvolvimento prático em Spark com Python ou Scala, e é exatamente assim que as questões são escritas: elas presumem que você já usou essas APIs, e não apenas leu sobre elas.

Por quanto tempo a certificação Databricks Spark vale?

Dois anos, menos do que a maioria das certificações de nuvem. Para recertificar, você faz a versão atual da prova e não uma avaliação de renovação reduzida, então programe-se para uma prova completa.

Quais temas pesam mais na prova Spark developer?

A DataFrame and DataSet API é o maior domínio, com 30%, seguida por Spark architecture e Spark SQL com 20% cada. Troubleshooting and tuning e structured streaming ficam com 10% cada, e Spark Connect e a pandas API on Spark com 5% cada. Ou seja, metade da prova é a DataFrame API mais arquitetura.

O que acontece se você for reprovado na prova Spark developer?

A Databricks não impõe período de espera obrigatório, então você pode remarcar assim que estiver pronto. Há uma taxa de repetição para cada tentativa.

Uma certificação, 12 meses

Prática para DB-SPARK

Concentre sua prática em uma certificação ou escolha o Pro para praticar para todas as certificações.

Começar uma sessão de prática gratuitaExperimente as primeiras 20 questões sem cartão para avaliar se a prática atende às suas necessidades.

Para compras elegíveis: garantia de reembolso se você não passar no exame.

Ver condições da garantia →