Pular para o conteúdo principal

Questão de Banco de Dados — Data Mining — FGV 2024

Banco de DadosData Mining
Código
fg079811
Banca
FGV
Órgão
DATAPREV
Ano
2024
Nível
Superior
Cargo
ATI - Inteligência da Informação
Considere o seguinte cenário: Uma empresa de telecomunicações está analisando os dados de uso de seus clientes, como frequência de chamadas, uso de dados móveis e envio de mensagens. Ela quer identificar grupos de clientes com comportamentos semelhantes para oferecer promoções personalizadas.Em uma escolha por uma solução de aprendizado de máquina, o cientista de dados deve observar que, se o aprendizado for
  1. Ahíbrido, congregará as características dos modelos supervisionado e não supervisionado, em um modelo ensemble.
  2. Bnão supervisionado oferecerá opções como os algoritmos back propagation, K-means e C4.5.
  3. Cnão supervisionado demandará uma fase de pósprocessamento que envolve visualização e análise do modelo.
  4. Dsupervisionado considerará a abstração de um modelo de conhecimento da forma (entrada, saída desejada).
  5. Esupervisionado, os algoritmos partirão dos dados, buscando relacionamento entre eles.
Revelar gabarito e comentário

GabaritoD — supervisionado considerará a abstração de um modelo de conhecimento da forma (entrada, saída desejada).

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Aprendizado Supervisionado e Não Supervisionado em Data Mining

Gabarito: letra D. No aprendizado supervisionado, o modelo é treinado com dados rotulados, ou seja, pares de entrada e saída desejada, para aprender uma função de mapeamento. Essa é a abstração clássica: (entrada, saída desejada).

A banca cobra a distinção entre os paradigmas de aprendizado de máquina, especialmente no contexto de Data Mining. A principal diferença é a presença ou ausência de rótulos nos dados de treino.

Paradigma de Aprendizado

Característica Principal

Exemplo de Algoritmo

Fase de Pós-processamento

Supervisionado

Treinamento com dados rotulados (entrada, saída desejada)

C4.5, Back Propagation

Validação com métricas (acurácia, precisão)

Não Supervisionado

Treinamento sem rótulos, busca por padrões intrínsecos

K-means

Visualização e análise subjetiva dos clusters

Híbrido (Semi-supervisionado)

Combina dados rotulados e não rotulados

Modelos baseados em grafos

Combinação de validação objetiva e subjetiva

1Supervisionado
Dados rotulados (entrada, saída)
Algoritmos: back propagation, C4.5
2Não supervisionado
Dados sem rótulos
Algoritmos: K-means
Pós-processamento: visualização
3Híbrido (semi-supervisionado)
Combina ambos
Não é ensemble
Aprendizado de máquina
LEVELsoulevel.com.br
Aprendizado de máquina: Supervisionado (Dados rotulados (entrada, saída), Algoritmos: back propagation, C4.5); Não supervisionado (Dados sem rótulos, Algoritmos: K-means, Pós-processamento: visualização); Híbrido (semi-supervisionado) (Combina ambos, Não é ensemble)

Alternativa A — ❌ Incorreta

Afirma que o aprendizado híbrido congrega características de supervisionado e não supervisionado em um modelo ensemble. O aprendizado híbrido (ou semi-supervisionado) combina os dois paradigmas, mas não necessariamente na forma de um ensemble. Ensemble diz respeito à combinação de múltiplos modelos (ex.: Random Forest, Boosting), não à natureza do aprendizado. Portanto, a alternativa mistura conceitos e está errada.

Alternativa B — ❌ Incorreta

Lista algoritmos que seriam oferecidos pelo aprendizado não supervisionado: back propagation, K-means e C4.5. Há uma mistura indevida: back propagation é um algoritmo de treinamento para redes neurais, tipicamente usado em aprendizado supervisionado (requer saída desejada). C4.5 é um algoritmo de árvore de decisão, também supervisionado. Apenas K-means (clusterização) é não supervisionado. Assim, a alternativa está incorreta por incluir algoritmos de paradigmas diferentes.

Alternativa C — ✅ Correta (mas não é o gabarito por conta do comando)

Afirma que o aprendizado não supervisionado demanda uma fase de pós-processamento que envolve visualização e análise do modelo. De fato, como não há rótulos para validar objetivamente, a interpretação dos clusters ou padrões descobertos exige análise visual e subjetiva. Essa afirmação é verdadeira, mas o enunciado pede a observação do cientista de dados em uma escolha por uma solução. Como a questão é de múltipla escolha com uma única resposta, a letra D é mais direta e específica sobre o supervisionado.

Alternativa D — ✅ Correta ⟵ GABARITO

Afirma que o aprendizado supervisionado considera a abstração de um modelo de conhecimento da forma (entrada, saída desejada). Isso define precisamente o paradigma: o modelo é treinado para mapear entradas para saídas conhecidas, aprendendo uma função a partir de exemplos rotulados. É a essência do supervisionado.

Alternativa E — ❌ Incorreta

Diz que no supervisionado os algoritmos partem dos dados buscando relacionamento entre eles. Embora relacionamentos possam ser identificados, o objetivo principal do supervisionado é aprender um mapeamento entrada-saída, e não apenas descobrir relacionamentos genéricos. Essa descrição se encaixa melhor no não supervisionado (ex.: regras de associação). Portanto, é uma afirmação imprecisa e incorreta.

NÃO CAIA NESSA!

A banca mistura algoritmos e conceitos entre os paradigmas. Na alternativa B, back propagation e C4.5 são supervisionados, mas são apresentados como opções do não supervisionado. O candidato deve conhecer o paradigma de cada algoritmo.

Gabarito: letra D.

Link permanente: /questoes/fg079811