Redução de dimensionalidade em PLN
Gabarito: letra C. A técnica de redução de dimensionalidade mais comum em PLN é a PCA (Principal Component Analysis), que transforma variáveis correlacionadas em componentes principais não correlacionados, reduzindo a dimensionalidade e preservando a maior parte da variância. As demais alternativas referem-se a técnicas de outras áreas (mineração de regras, agrupamento, redes neurais recorrentes e representação textual) e não são métodos de redução de dimensionalidade.
Alternativa A — ❌ Incorreta
Apriori é um algoritmo de mineração de regras de associação, utilizado para encontrar itens frequentes em conjuntos de dados transacionais – não é uma técnica de redução de dimensionalidade.
Alternativa B — ❌ Incorreta
K-means é um algoritmo de agrupamento (clustering) que particiona dados em clusters; não reduz dimensionalidade.
Alternativa C — ✅ Correta ⟵ GABARITO
PCA (Principal Component Analysis) é uma técnica estatística que reduz a dimensionalidade projetando os dados em um novo sistema de coordenadas (componentes principais) que capturam a maior variância possível. É amplamente utilizada em PLN para simplificar vetores de texto e melhorar o desempenho de modelos.
Alternativa D — ❌ Incorreta
Redes neurais LSTM (Long Short-Term Memory) são um tipo de rede recorrente indicada para processamento de sequências (tradução automática, séries temporais), e não para redução de dimensionalidade.
Alternativa E — ❌ Incorreta
TF-IDF (Term Frequency-Inverse Document Frequency) é uma técnica de ponderação que transforma documentos em vetores numéricos, mas não reduz a dimensionalidade – a dimensão do vetor TF-IDF é igual ao número de termos, podendo ser alta.
Gabarito: letra C.