Análise de dados1 / 5
Um analista de dados recebe um conjunto de dados grande com 200 atributos (colunas) para construir um modelo de classificação. Muitos atributos podem ser redundantes ou irrelevantes. Qual técnica o analista deve usar para reduzir o número de atributos mantendo as informações mais importantes?
CorretoIncorreto
Alex
Com 200 atributos, o analista enfrenta a “maldição da dimensionalidade”: variáveis demais causam overfitting, treinamento mais demorado e generalização ruim. A redução de dimensionalidade resolve isso por meio da seleção de atributos (remover os irrelevantes usando correlação ou scores de importância) ou da extração de atributos, como o PCA, que cria novos componentes capturando a máxima variância em menos dimensões (CompTIA Data+ Obj 3.2; NIST SP 800-188). Por que não as outras? A imputação preenche valores ausentes: ela não reduz a quantidade de atributos. A deduplicação remove linhas duplicadas, não colunas. A criptografia protege os dados, mas não muda a dimensionalidade. Dica de prova: “atributos demais” = redução de dimensionalidade; “valores ausentes” = imputação; “registros duplicados” = deduplicação.
Fontescikit-learn.org
Você pode obter respostas às suas dúvidas no app. Crie uma conta grátis, sem cartão de crédito.
Questão 1 de 5
Criar uma conta grátis