Questão de Banco de Dados — Data Mining — FGV 2021
Banco de Dados›Data Mining
Código
fg044920
Banca
FGV
Órgão
SEFAZ-ES
Ano
2021
Nível
Superior
Cargo
Auditor Fiscal da Receita Estadual - Manhã
Maria está preparando um relatório sobre as empresas de serviços de um município, de modo a identificar e estudar o porte dessas empresas com vistas ao estabelecimento de políticas públicas e previsões de arrecadação.Maria pretende criar nove grupos de empresas, de acordo com os valores de faturamento, e recorreu às técnicas usualmente empregadas em procedimentos de data mining para estabelecer as faixas de valores de cada grupo.Assinale a opção que apresenta a técnica diretamente aplicável a esse tipo de classificação.
AAlgoritmos de associação.
BAlgoritmos de clusterização.
CÁrvores de decisão.
DModelagem de dados.
ERegressão linear.
Revelar gabarito e comentário▾
GabaritoB — Algoritmos de clusterização.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Técnicas de Data Mining: Clusterização
Gabarito: letra B. Maria precisa criar grupos (clusters) de empresas com base nos valores de faturamento, ou seja, dividir os dados em segmentos onde as empresas de cada grupo tenham faturamentos semelhantes. A técnica diretamente aplicável a essa tarefa é a clusterização (algoritmos de clusterização), que particiona os dados em grupos previamente desconhecidos, com características semelhantes, conforme conceito de data mining (análise de conglomerados).
O problema apresentado não envolve rótulos prévios (classificação supervisionada), mas sim a descoberta natural de grupos a partir dos próprios dados – exatamente o papel da clusterização.
Técnica
Objetivo principal
Aplicabilidade ao problema de Maria
Requer rótulos prévios?
Clusterização
Agrupar dados em segmentos (clusters) com características semelhantes, sem categorias predefinidas.
Diretamente aplicável. Maria quer criar 9 grupos com base no faturamento, descobrindo as faixas naturais dos dados.
Não (não supervisionada)
Árvores de decisão
Classificar ou prever um valor com base em regras aprendidas a partir de um conjunto de dados rotulado.
Não aplicável. Maria não possui grupos predefinidos (rótulos) para treinar o modelo.
Sim (supervisionada)
Regressão linear
Modelar a relação entre uma variável dependente contínua e uma ou mais variáveis independentes.
Não aplicável. O objetivo não é prever um valor contínuo, mas sim criar grupos discretos.
Sim (supervisionada)
Algoritmos de associação
Descobrir relações frequentes entre itens em transações (ex.: regras "se... então...").
Não aplicável. Não cria grupos nem define faixas de valores.
Não (não supervisionada, mas foco em regras, não em grupos)
Modelagem de dados
Definir a estrutura lógica e física de um banco de dados (entidades, atributos, relacionamentos).
Não aplicável. É uma etapa de projeto de banco de dados, não uma técnica de mineração para agrupamento.
Não se aplica
Alternativa A — ❌ Incorreta
Algoritmos de associação (como Apriori) buscam descobrir relacionamentos frequentes entre itens (ex.: “quem compra fraldas também compra cerveja”). Não criam grupos nem definem faixas de valores – são inadequados para o objetivo de Maria.
Alternativa B — ✅ Correta ⟵ GABARITO
Clusterização (ou análise de conglomerados) é a técnica que agrupa registros semelhantes em clusters, sem necessidade de categorias predefinidas. No contexto de data mining, a descrição do material de apoio confirma: “Particiona dados em segmentos previamente desconhecidos com características semelhantes”. Maria deseja justamente isso: criar nove grupos com base nos valores de faturamento, ou seja, descobrir faixas que agrupem empresas de porte similar.
Alternativa C — ❌ Incorreta
Árvores de decisão são usadas em classificação supervisionada: necessitam de uma variável-alvo (rótulo) já conhecida para aprender regras de decisão. Como Maria não tem grupos predefinidos (quer criá-los), a árvore de decisão não se aplica diretamente ao estabelecimento das faixas.
Alternativa D — ❌ Incorreta
Modelagem de dados é um conceito amplo que envolve a definição de estruturas de dados (entidades, relacionamentos, normalização), mas não é uma técnica específica de mineração para agrupamento. Não resolve a necessidade de criar faixas de valores.
Alternativa E — ❌ Incorreta
Regressão linear é uma técnica de predição de variáveis contínuas (ex.: valor de faturamento futuro com base em outras variáveis). Ela não segmenta dados em grupos – portanto, não atende ao objetivo de Maria.
PEGA ESSA DICA!
Sempre que a questão falar em “criar grupos”, “segmentar”, “agrupar por similaridade” sem classes prévias, pense em clusterização. É o oposto de classificação (que usa rótulos conhecidos). Na dúvida, lembre-se do mnemônico: Cluster = Grupo.