Questão de Banco de Dados — Data Mining — FGV 2024
Banco de Dados›Data Mining
Código
fg079811
Banca
FGV
Órgão
DATAPREV
Ano
2024
Nível
Superior
Cargo
ATI - Inteligência da Informação
Considere o seguinte cenário: Uma empresa de telecomunicações está analisando os dados de uso de seus clientes, como frequência de chamadas, uso de dados móveis e envio de mensagens. Ela quer identificar grupos de clientes com comportamentos semelhantes para oferecer promoções personalizadas.Em uma escolha por uma solução de aprendizado de máquina, o cientista de dados deve observar que, se o aprendizado for
Ahíbrido, congregará as características dos modelos supervisionado e não supervisionado, em um modelo ensemble.
Bnão supervisionado oferecerá opções como os algoritmos back propagation, K-means e C4.5.
Cnão supervisionado demandará uma fase de pósprocessamento que envolve visualização e análise do modelo.
Dsupervisionado considerará a abstração de um modelo de conhecimento da forma (entrada, saída desejada).
Esupervisionado, os algoritmos partirão dos dados, buscando relacionamento entre eles.
Revelar gabarito e comentário▾
GabaritoD — supervisionado considerará a abstração de um modelo de conhecimento da forma (entrada, saída desejada).
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Aprendizado Supervisionado e Não Supervisionado em Data Mining
Gabarito: letra D. No aprendizado supervisionado, o modelo é treinado com dados rotulados, ou seja, pares de entrada e saída desejada, para aprender uma função de mapeamento. Essa é a abstração clássica: (entrada, saída desejada).
A banca cobra a distinção entre os paradigmas de aprendizado de máquina, especialmente no contexto de Data Mining. A principal diferença é a presença ou ausência de rótulos nos dados de treino.
Paradigma de Aprendizado
Característica Principal
Exemplo de Algoritmo
Fase de Pós-processamento
Supervisionado
Treinamento com dados rotulados (entrada, saída desejada)
C4.5, Back Propagation
Validação com métricas (acurácia, precisão)
Não Supervisionado
Treinamento sem rótulos, busca por padrões intrínsecos
K-means
Visualização e análise subjetiva dos clusters
Híbrido (Semi-supervisionado)
Combina dados rotulados e não rotulados
Modelos baseados em grafos
Combinação de validação objetiva e subjetiva
Aprendizado de máquina: Supervisionado (Dados rotulados (entrada, saída), Algoritmos: back propagation, C4.5); Não supervisionado (Dados sem rótulos, Algoritmos: K-means, Pós-processamento: visualização); Híbrido (semi-supervisionado) (Combina ambos, Não é ensemble)
Alternativa A — ❌ Incorreta
Afirma que o aprendizado híbrido congrega características de supervisionado e não supervisionado em um modelo ensemble. O aprendizado híbrido (ou semi-supervisionado) combina os dois paradigmas, mas não necessariamente na forma de um ensemble. Ensemble diz respeito à combinação de múltiplos modelos (ex.: Random Forest, Boosting), não à natureza do aprendizado. Portanto, a alternativa mistura conceitos e está errada.
Alternativa B — ❌ Incorreta
Lista algoritmos que seriam oferecidos pelo aprendizado não supervisionado: back propagation, K-means e C4.5. Há uma mistura indevida: back propagation é um algoritmo de treinamento para redes neurais, tipicamente usado em aprendizado supervisionado (requer saída desejada). C4.5 é um algoritmo de árvore de decisão, também supervisionado. Apenas K-means (clusterização) é não supervisionado. Assim, a alternativa está incorreta por incluir algoritmos de paradigmas diferentes.
Alternativa C — ✅ Correta (mas não é o gabarito por conta do comando)
Afirma que o aprendizado não supervisionado demanda uma fase de pós-processamento que envolve visualização e análise do modelo. De fato, como não há rótulos para validar objetivamente, a interpretação dos clusters ou padrões descobertos exige análise visual e subjetiva. Essa afirmação é verdadeira, mas o enunciado pede a observação do cientista de dados em uma escolha por uma solução. Como a questão é de múltipla escolha com uma única resposta, a letra D é mais direta e específica sobre o supervisionado.
Alternativa D — ✅ Correta ⟵ GABARITO
Afirma que o aprendizado supervisionado considera a abstração de um modelo de conhecimento da forma (entrada, saída desejada). Isso define precisamente o paradigma: o modelo é treinado para mapear entradas para saídas conhecidas, aprendendo uma função a partir de exemplos rotulados. É a essência do supervisionado.
Alternativa E — ❌ Incorreta
Diz que no supervisionado os algoritmos partem dos dados buscando relacionamento entre eles. Embora relacionamentos possam ser identificados, o objetivo principal do supervisionado é aprender um mapeamento entrada-saída, e não apenas descobrir relacionamentos genéricos. Essa descrição se encaixa melhor no não supervisionado (ex.: regras de associação). Portanto, é uma afirmação imprecisa e incorreta.
NÃO CAIA NESSA!
A banca mistura algoritmos e conceitos entre os paradigmas. Na alternativa B, back propagation e C4.5 são supervisionados, mas são apresentados como opções do não supervisionado. O candidato deve conhecer o paradigma de cada algoritmo.