Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — FCC 2025

Banco de DadosBig Data
Código
fc073245
Banca
FCC
Órgão
Prefeitura de São Paulo - SP
Ano
2025
Nível
Superior
Cargo
Analista de Planejamento e Desenvolvimento Organizacional Tecnologia da Informação e Comunicação
A prefeitura de uma metrópole implementou um sistema de análise de dados para monitorar a concessão de subsídios e benefícios sociais. No entanto, o sistema começou a detectar um aumento de solicitações fraudulentas, Incluindo a inserção de dados falsos para se qualificar a benefícios indevidos. À equipe de analistas responsável identificou uma oportunidade de utilizar as TICs em favor da sociedade, diante da flagrante violação das questões éticas. Assim, optou-se por usar uma abordagem de mineração de dados para identificar padrões de fraude nos dados, considerando que muitas fraudes envolvem pequenas manipulações difíceis de identificar. A opção escolhida foi
  1. Aaplicar algoritmos de clusterização, como o KNN (K-Nearest Neighbours), nos dados históricos de solicitações para identificar padrões de comportamento de grupos distintos de beneficiários, agrupando os fraudadores em clusters específicos.
  2. Butilizar regras de associação negativas para encontrar combinações frequentes de características em solicitações fraudulentas, permitindo que o sistema aplique regras automáticas para marcar possíveis fraudes.
  3. Cimplementar classificação supervisionada usando o algoritmo DBSCAN, que permite rotular cada solicitação como fraudulenta ou não, com base em exemplos passados de fraudes já detectadas.
  4. Dadotar métodos de séries temporais utilizando a Média Móvel Simplificada (MMS), que dá maior peso aos dados mais recentes, para observar a evolução das solicitações ao longo do tempo e detectar picos ou comportamentos atípicos que possam indicar fraudes sazonais ou concentradas em certos períodos.
  5. Eaplicar a técnica de análise de anomalias para detectar padrões de comportamento discrepantes e encontrar fraudes que não seguem padrões bem definidos, utilizando métodos como isolamento de floresta (isolation forest) para encontrar outliers sutis.
Revelar gabarito e comentário

GabaritoE — aplicar a técnica de análise de anomalias para detectar padrões de comportamento discrepantes e encontrar fraudes que não seguem padrões bem definidos, utilizando métodos como isolamento de floresta (isolation forest) para encontrar outliers sutis.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Mineração de Dados para Detecção de Fraudes

Gabarito: letra E. A técnica mais adequada para identificar pequenas manipulações fraudulentas que não seguem padrões bem definidos é a análise de anomalias (detecção de outliers), utilizando métodos como o isolation forest. O enunciado descreve exatamente um cenário onde as fraudes são sutis e discrepantes, sendo a detecção de anomalias a abordagem correta. As demais alternativas cometem erros conceituais graves, como confundir KNN com clusterização, usar DBSCAN como classificador supervisionado, ou aplicar séries temporais com conceitos equivocados.

A questão testa o conhecimento das principais tarefas de mineração de dados (classificação, clusterização, associação, detecção de anomalias) e a capacidade de associar a técnica correta ao problema descrito. O contexto de apoio reforça que clusterização é não supervisionada (C2) e que classificação usa dados rotulados (C4), enquanto a detecção de anomalias busca outliers.

Tarefas de mineração de dados
  • 1Classificação supervisionada
    • Ex.: KNN, árvore de decisão, SVM
    • Requer dados rotulados
  • 2Clusterização (não supervisionada)
    • Ex.: K-means, DBSCAN
    • Agrupa por similaridade
  • 3Regras de associação
    • Ex.: Apriori
    • Combinações frequentes de itens
  • 4Análise de anomalias (outliers)
    • Ex.: Isolation forest
    • Detecta padrões discrepantes sutis
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

O K-Nearest Neighbours (KNN) é um algoritmo de classificação supervisionada, não de clusterização. A alternativa afirma que KNN é clusterização, o que é um erro. Além disso, clusterização (ex.: K-means) agrupa dados por similaridade, mas fraudadores podem não formar um cluster homogêneo; a detecção de anomalias é mais indicada para encontrar comportamentos atípicos.

Alternativa B — ❌ Incorreta

Regras de associação (como Apriori) são usadas para descobrir combinações frequentes de itens, não especificamente para fraudes. O termo "regras de associação negativas" não é uma técnica padrão para detecção de fraudes; a análise de anomalias é a abordagem mais direta para encontrar padrões discrepantes.

Alternativa C — ❌ Incorreta

DBSCAN é um algoritmo de clusterização (não supervisionado), não de classificação supervisionada. A alternativa o descreve como "classificação supervisionada", o que é conceitualmente errado. Para rotular solicitações com base em exemplos passados, usam-se algoritmos supervisionados como árvores de decisão, SVM ou redes neurais.

Alternativa D — ❌ Incorreta

A Média Móvel Simplificada (MMS) atribui pesos iguais a todos os dados, e não maior peso aos mais recentes (isso é característica da média móvel exponencial). Além disso, séries temporais são adequadas para tendências e sazonalidades, não para detectar pequenas manipulações sutis em dados de solicitações.

Alternativa E — ✅ Correta ⟵ GABARITO

A análise de anomalias (detecção de outliers) é a técnica ideal para identificar padrões discrepantes e comportamentos atípicos, como fraudes sutis. O isolation forest é um método eficaz para isolar outliers em grandes volumes de dados, exatamente o que o enunciado descreve: "pequenas manipulações difíceis de identificar". Esta alternativa está tecnicamente correta e alinhada com o problema apresentado.

NÃO CAIA NESSA!

A banca troca conceitos fundamentais: KNN não é clusterização (é classificação), DBSCAN não é classificação supervisionada (é clusterização), MMS não dá peso maior aos dados recentes. A única alternativa que emprega a técnica correta para o problema de detecção de fraudes sutis é a análise de anomalias. Fique atento às definições precisas de cada tarefa de mineração de dados!

Gabarito: letra E.

Link permanente: /questoes/fc073245