Agente Fazendário Estadual - Função: Profissional de Tecnologia da Informação
Em uma secretaria de fazenda, analistas de dados buscam identificar perfis de contribuintes com padrões semelhantes de comportamento tributário, de modo a orientar auditorias fiscais preventivas. Nesse contexto, a escolha do método analítico deve considerar a ausência de rótulos previamente definidos e o grande volume de atributos numéricos e categóricos associados às declarações.A partir da situação anterior, assinale a opção em que é corretamente descrita a técnica mais adequada para a finalidade pretendida pelos analistas de dados em questão.
AA análise de correlação é a técnica mais apropriada para detectar grupos de contribuintes com comportamentos fiscais similares, pois avalia a dependência estatística entre múltiplas variáveis simultaneamente.
BAs árvores de decisão são técnicas não supervisionadas de agrupamento hierárquico, ideais para identificar automaticamente padrões ocultos entre variáveis fiscais heterogêneas.
CA análise discriminante é adequada para o agrupamento de contribuintes sem rótulos prévios, pois utiliza métricas de distância para maximizar a separação entre grupos formados aleatoriamente.
DA regressão logística, por ser um método supervisionado, permite agrupar contribuintes com base em características comuns, estimando probabilidades de pertencimento a grupos previamente não definidos.
EO algoritmo k-means é apropriado para segmentar contribuintes em grupos com padrões semelhantes, desde que as variáveis categóricas sejam previamente transformadas em representações numéricas adequadas.
Revelar gabarito e comentário▾
GabaritoE — O algoritmo k-means é apropriado para segmentar contribuintes em grupos com padrões semelhantes, desde que as variáveis categóricas sejam previamente transformadas em representações numéricas adequadas.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Análise de agrupamento (clusterização) para segmentação de contribuintes
Gabarito: letra E. O k-means é a técnica de aprendizado não supervisionado mais adequada para segmentar contribuintes em grupos com padrões semelhantes, desde que as variáveis categóricas sejam previamente transformadas em representações numéricas adequadas (como one-hot encoding). As demais alternativas descrevem métodos supervisionados ou técnicas que não realizam agrupamento não supervisionado.
O problema apresentado é um caso clássico de análise de agrupamento (clusterização): identificar grupos (clusters) de contribuintes com comportamentos tributários semelhantes, sem que haja rótulos prévios (aprendizado não supervisionado). O k-means é um dos algoritmos mais populares para essa finalidade: ele particiona os dados em k grupos, minimizando a variância intra-cluster (soma dos quadrados das distâncias aos centróides).
A principal exigência do k-means é que as variáveis sejam numéricas, pois o cálculo das distâncias (geralmente euclidiana) exige valores quantitativos. Quando há variáveis categóricas, é necessário transformá-las em representações numéricas, como a codificação one-hot (dummy), antes de aplicar o algoritmo. Essa é exatamente a ressalva apresentada na alternativa E.
As demais alternativas confundem conceitos fundamentais: correlação não agrupa, árvores de decisão são supervisionadas, análise discriminante exige grupos pré-definidos e regressão logística é um método de classificação supervisionada. Vamos analisar cada uma.
Técnica
Supervisionada?
Objetivo principal
Exige rótulos prévios?
Adequada para agrupamento sem rótulos?
Análise de correlação (A)
Não (medida de associação)
Medir relação linear entre variáveis
Não
❌ Não — não agrupa observações
Árvores de decisão (B)
✅ Sim
Classificação/regressão por regras
Sim
❌ Não — é supervisionada
Análise discriminante (C)
✅ Sim
Maximizar separação entre grupos conhecidos
Sim
❌ Não — exige grupos definidos
Regressão logística (D)
✅ Sim
Estimar probabilidade de pertencimento a classes
Sim
❌ Não — contradição interna
K-means (E)
Não
Particionar dados em k grupos por distância
Não
✅ Sim — com transformação de categóricas
Aprendizado de máquina
1Supervisionado (com rótulos)
Árvore de decisão
Regressão logística
Análise discriminante
2Não supervisionado (sem rótulos)
K-means
Exige variáveis numéricas
Categóricas → one-hot encoding
Hierárquico
DBSCAN
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
A análise de correlação mede a força e a direção da relação linear entre duas variáveis (ou, em análise multivariada, entre pares de variáveis). Ela não tem por objetivo detectar grupos de observações semelhantes. A correlação é uma medida de associação, não um método de agrupamento. Além disso, a correlação não é "múltipla" no sentido de avaliar simultaneamente a dependência entre várias variáveis — isso seria papel de técnicas como a análise de correlação canônica, mas ainda assim não agrupa observações.
Alternativa B — ❌ Incorreta
As árvores de decisão são técnicas supervisionadas de classificação ou regressão, não não supervisionadas. Elas particionam o espaço de atributos com base em regras de decisão aprendidas a partir de dados rotulados. Não são métodos de agrupamento hierárquico. O erro aqui é duplo: (1) classificar árvores de decisão como não supervisionadas e (2) atribuir a elas a função de agrupamento hierárquico, que é outra família de métodos (ex.: dendrogramas).
Alternativa C — ❌ Incorreta
A análise discriminante é uma técnica supervisionada que busca encontrar uma combinação linear de variáveis que maximize a separação entre grupos previamente conhecidos (rótulos existentes). Ela não serve para agrupar dados sem rótulos; pelo contrário, exige que os grupos já estejam definidos. A alternativa inverte o sentido: a análise discriminante usa os grupos para construir a regra de classificação, não forma grupos a partir de dados não rotulados.
Alternativa D — ❌ Incorreta
A regressão logística é um método supervisionado de classificação, usado para estimar a probabilidade de pertencimento a categorias previamente definidas (rótulos). Ela não agrupa contribuintes com base em características comuns sem rótulos; pelo contrário, precisa de dados rotulados para treinar o modelo. A alternativa contém uma contradição interna: diz que o método é supervisionado, mas afirma que agrupa com base em grupos "previamente não definidos" — o que é impossível para um método supervisionado.
Alternativa E — ✅ Correta ⟵ GABARITO
O k-means é um algoritmo de aprendizado não supervisionado que particiona os dados em k grupos, minimizando a soma dos quadrados das distâncias intra-cluster. Ele é adequado para segmentar contribuintes em grupos com padrões semelhantes, exatamente o que o enunciado pede. A ressalva sobre variáveis categóricas é correta: o k-means opera com distâncias (geralmente euclidiana), que exigem variáveis numéricas. Portanto, variáveis categóricas devem ser transformadas em representações numéricas (ex.: one-hot encoding) antes da aplicação.
NÃO CAIA NESSA!
A banca explora a confusão entre métodos supervisionados e não supervisionados. O candidato pode ser tentado a escolher a análise discriminante (C) ou a regressão logística (D) por associá-las a "agrupamento", mas ambas exigem rótulos prévios. O k-means é a única alternativa que descreve corretamente um método não supervisionado de agrupamento, com a ressalva técnica sobre variáveis categóricas. Fique atento: a palavra-chave é "ausência de rótulos" — isso elimina qualquer método supervisionado.
PEGA ESSA DICA!
Para identificar a técnica correta em questões de agrupamento, verifique: (1) há rótulos? Se não, é não supervisionado (k-means, hierárquico, DBSCAN). (2) O método exige variáveis numéricas? Se sim, variáveis categóricas precisam de transformação. (3) O objetivo é segmentar ou classificar? Segmentar = agrupar; classificar = atribuir a classes conhecidas.