Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Data Mining (Mineração de Dados): Etapas, Algoritmos e Modelos (KDD, CRISP-DM, etc.) — CESPE / CEBRASPE 2026

TI - Ciência de Dados e Inteligência ArtificialData Mining (Mineração de Dados): Etapas, Algoritmos e Modelos (KDD, CRISP-DM, etc.)
Código
ce391366
Banca
CESPE / CEBRASPE
Órgão
IPAAM
Ano
2026
Cargo
Ana Amb (Ipaam)

Imagens de satélite e inteligência artificial podem ser aplicadas para determinar os níveis de desmatamento e os detalhes da biodiversidade da Floresta Amazônica, de maneira que culturas agrícolas sejam automaticamente classificadas por um sistema de aprendizado de máquina que usa imagens de satélite nesse mapeamento.

 

É nesse sentido que a ferramenta LLP-Co (learning from label proportions with prototypical contrastive clustering) organiza grandes conjuntos de dados capturados por drones e satélites, que conseguem sobrevoar a floresta e coletar dados em grande escala, inclusive em áreas de cobertura vegetal mais densa. Esses dados são organizados, identificados (rotulados) e classificados pelo sistema, que tem a capacidade de aprender sozinho a partir da supervisão e validação dos pesquisadores.

 

As aplicações do sistema no monitoramento florestal permitem uma maior acurácia no acompanhamento do avanço do desmatamento, possibilitando uma gestão de políticas públicas mais eficaz. Além disso, a identificação e a classificação das espécies vegetais podem revelar detalhes surpreendentes da biodiversidade local, abrindo novos flancos de pesquisas voltadas para a preservação ambiental.

 

Internet: <https://portal.fgv.br> (com adaptações).

Texto 2A2-I

 

A classificação automática de culturas agrícolas e espécies vegetais, conforme descrita no texto 2A2-I, corresponde, do ponto de vista da mineração de dados, a uma tarefa de classificação porque

  1. Areduz a dimensionalidade dos dados para a visualização.
  2. Bagrupa dados sem rótulos previamente definidos.
  3. Cidentifica exceções raras em grandes volumes de dados.
  4. Ddescobre relações frequentes entre atributos independentes.
  5. Eassocia instâncias a classes previamente definidas a partir de exemplos.
Revelar gabarito e comentário

GabaritoE — associa instâncias a classes previamente definidas a partir de exemplos.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Mineração de dados: classificação supervisionada

Gabarito: letra E. A tarefa descrita no texto é uma classificação supervisionada, pois o sistema LLP-Co associa instâncias (imagens de satélite) a classes previamente definidas (tipos de culturas agrícolas e espécies vegetais) a partir de exemplos rotulados — exatamente o que a alternativa E afirma. O texto confirma: os dados são "organizados, identificados (rotulados) e classificados pelo sistema, que tem a capacidade de aprender sozinho a partir da supervisão e validação dos pesquisadores".

Na mineração de dados, a classificação é uma tarefa de aprendizado supervisionado em que o modelo é treinado com um conjunto de dados rotulados — ou seja, cada instância já vem com sua classe conhecida — e, a partir desses exemplos, aprende uma função que mapeia os atributos das instâncias para as classes. O objetivo é que, ao receber uma nova instância sem rótulo, o modelo consiga predizer a qual classe ela pertence. É o que acontece no texto: o sistema aprende a reconhecer padrões nas imagens de satélite (atributos como cor, textura, forma) e os associa a culturas agrícolas ou espécies vegetais (classes predefinidas).

O texto é explícito ao descrever o processo: "Esses dados são organizados, identificados (rotulados) e classificados pelo sistema, que tem a capacidade de aprender sozinho a partir da supervisão e validação dos pesquisadores." A palavra "rotulados" é a chave — ela indica que as instâncias de treinamento já possuem a classe correta, o que caracteriza o aprendizado supervisionado. A "supervisão e validação dos pesquisadores" reforça que há um agente externo conferindo os rótulos, típico do paradigma supervisionado.

A distinção central que a banca explora é entre classificação (supervisionada) e agrupamento/clusterização (não supervisionada). Na classificação, as classes são conhecidas a priori e o modelo aprende a partir de exemplos rotulados; na clusterização, não há rótulos e o algoritmo descobre grupos naturais nos dados. O texto deixa claro que o sistema trabalha com rótulos, então é classificação. Outras tarefas de mineração — como redução de dimensionalidade, detecção de anomalias e regras de associação — também aparecem como distratores, mas nenhuma corresponde ao que o texto descreve.

A pegadinha desta questão está em confundir a classificação com a clusterização: a alternativa B diz "agrupa dados sem rótulos previamente definidos", que é a definição exata de clusterização (não supervisionada). O candidato que não percebe que o texto menciona explicitamente os rótulos cai nessa armadilha. Guarde a fronteira: classificação = rótulos existem e o modelo aprende a partir deles; clusterização = rótulos não existem e o modelo descobre os grupos. É exatamente nessa fronteira que as alternativas se dividem.

Tarefas de mineração de dados
  • 1Supervisionadas (rótulos existem)
    • Classificação
      • associa instâncias a classes predefinidas
      • aprende de exemplos rotulados
    • Regressão
  • 2Não supervisionadas (sem rótulos)
    • Clusterização
      • agrupa dados sem rótulos
      • descobre grupos naturais
    • Regras de associação
      • relações frequentes entre atributos
  • 3Outras
    • Redução de dimensionalidade
      • PCA, t-SNE
    • Detecção de anomalias
      • exceções raras
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

Reduzir a dimensionalidade dos dados para visualização é uma tarefa de redução de dimensionalidade (como PCA ou t-SNE), não de classificação. O texto não menciona redução de dimensionalidade; ele descreve a rotulagem e a classificação de instâncias em classes predefinidas. A alternativa confunde o pré-processamento com a tarefa principal.

Alternativa B — ❌ Incorreta

"Agrupa dados sem rótulos previamente definidos" é a definição de clusterização (aprendizado não supervisionado). O texto, porém, afirma que os dados são "identificados (rotulados)" — ou seja, há rótulos. A alternativa inverte o paradigma: troca a classificação supervisionada pela clusterização não supervisionada.

Alternativa C — ❌ Incorreta

Identificar exceções raras em grandes volumes de dados é a tarefa de detecção de anomalias (outliers). O texto não descreve a busca por exceções; descreve a associação de instâncias a classes conhecidas. A alternativa confunde a classificação com a detecção de anomalias, que é outra tarefa de mineração.

Alternativa D — ❌ Incorreta

Descobrir relações frequentes entre atributos independentes é a tarefa de regras de associação (como o algoritmo Apriori, usado em análise de cesta de compras). O texto não menciona a descoberta de relações entre atributos; menciona a classificação de instâncias em classes predefinidas. A alternativa troca a classificação pela mineração de regras de associação.

Alternativa E — ✅ Correta ⟵ GABARITO

"Associa instâncias a classes previamente definidas a partir de exemplos" é a definição precisa de classificação supervisionada. O texto confirma: o sistema "organiza, identifica (rotula) e classifica" os dados, aprendendo "a partir da supervisão e validação dos pesquisadores". As instâncias (imagens de satélite) são associadas a classes (culturas agrícolas, espécies vegetais) com base em exemplos rotulados. É exatamente o que a alternativa descreve.

NÃO CAIA NESSA!

A banca troca a classificação supervisionada pela clusterização não supervisionada na alternativa B. O texto diz "dados rotulados" e "supervisão dos pesquisadores" — se o candidato não percebe esses termos, escolhe a B. Fique atento: classificação = rótulos existem; clusterização = rótulos não existem. Com treino, você enxerga essa troca de longe 💪.

PEGA ESSA DICA!

Para diferenciar as tarefas de mineração na prova, pergunte-se: "o modelo sabe a resposta certa durante o treino?" Se sim, é supervisionado (classificação ou regressão). Se não, é não supervisionado (clusterização ou associação). E se o objetivo é achar o que foge do padrão, é detecção de anomalias. Essa pergunta resolve a maioria das questões.

Gabarito: letra E

Link permanente: /questoes/ce391366