Analyse des données1 / 5
Un analyste de données reçoit un jeu de données volumineux comportant 200 variables (colonnes) pour construire un modèle de classification. Beaucoup de ces variables sont peut-être redondantes ou sans intérêt. Quelle technique l'analyste doit-il utiliser pour réduire le nombre de variables tout en conservant l'information la plus importante ?
Bonne réponseRéponse incorrecte
Alex
Avec 200 variables, l'analyste se heurte au « fléau de la dimensionnalité » : trop de variables entraînent du surapprentissage, des temps d'entraînement plus longs et une mauvaise généralisation. La réduction de dimensionnalité règle ce problème par la sélection de variables (supprimer les variables sans intérêt à partir des corrélations ou des scores d'importance) ou par l'extraction de variables comme PCA, qui crée de nouvelles composantes captant le maximum de variance dans moins de dimensions (CompTIA Data+ Obj 3.2 ; NIST SP 800-188). Pourquoi pas les autres ? L'imputation comble les valeurs manquantes : elle ne réduit pas le nombre de variables. La déduplication supprime les lignes en double, pas les colonnes. Le chiffrement protège les données mais ne change rien à la dimensionnalité. Astuce d'examen : « trop de variables » = réduction de dimensionnalité ; « valeurs manquantes » = imputation ; « enregistrements en double » = déduplication.
Sourcescikit-learn.org
Les réponses aux questions complémentaires sont disponibles dans l’app. Crée un compte gratuit, sans carte bancaire.
Question 1 sur 5
Créer un compte gratuit