Análisis de datos1 / 5
Un analista de datos recibe un conjunto de datos grande con 200 características (columnas) para construir un modelo de clasificación. Muchas características pueden ser redundantes o irrelevantes. ¿Qué técnica debe usar el analista para reducir la cantidad de características conservando la información más importante?
CorrectoIncorrecto
Alex
Con 200 características, el analista se enfrenta a la “maldición de la dimensionalidad”: demasiadas variables provocan sobreajuste, entrenamientos más largos y una mala generalización. La reducción de dimensionalidad resuelve esto mediante la selección de características (eliminar las irrelevantes usando correlaciones o puntajes de importancia) o mediante la extracción de características, como PCA, que crea nuevos componentes que capturan la máxima varianza en menos dimensiones (CompTIA Data+ Obj 3.2; NIST SP 800-188). ¿Por qué no las otras? La imputación rellena valores faltantes: no reduce la cantidad de características. La deduplicación elimina filas duplicadas, no columnas. El cifrado protege los datos, pero no cambia la dimensionalidad. Consejo para el examen: “demasiadas características” = reducción de dimensionalidad; “valores faltantes” = imputación; “registros duplicados” = deduplicación.
Fuentescikit-learn.org
Puedes obtener respuestas a tus dudas en la app. Crea una cuenta gratis, sin tarjeta de crédito.
Pregunta 1 de 5
Crear una cuenta gratis