Questão de Noções de Informática — Inteligência Artificial e Automação — CESPE / CEBRASPE 2025
Noções de Informática›Inteligência Artificial e Automação
Código
ce214826
Banca
CESPE / CEBRASPE
Órgão
SEFAZ-SE
Ano
2025
Nível
Superior
Cargo
Auditor Fiscal Tributário - Geral
Alguns algoritmos de mineração de dados requerem que os atributos sejam categóricos, o que impossibilita o uso direto de dados numéricos. Para contornar essa limitação, pode-se aplicar a discretização. Acerca desse processo, assinale a opção correta.
AA discretização não é recomendada para atributos contínuos, pois reduz a capacidade dos algoritmos de aprender padrões úteis.
BA discretização baseada em histograma utiliza os intervalos de frequência do histograma para segmentar os dados, e os valores são substituídos conforme a faixa em que se encontram.
CA discretização baseada em entropia é uma função linear por meio da qual se busca maximizar o ganho de informação ao se dividir o conjunto de dados, obtendo-se intervalos com maior relevância para classificação.
DA discretização por agrupamento atribui aleatoriamente os valores do atributo numérico a grupos fixos, sem levar em conta critérios ou similaridades entre os dados.
EA técnica de encaixotamento (binning) substitui os valores de um atributo por limites máximos e mínimos arbitrários, desconsideradas a média e a mediana.
Revelar gabarito e comentário▾
GabaritoB — A discretização baseada em histograma utiliza os intervalos de frequência do histograma para segmentar os dados, e os valores são substituídos conforme a faixa em que se encontram.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Discretização em Mineração de Dados
Gabarito: Letra B. A discretização baseada em histograma utiliza os intervalos de frequência do histograma para segmentar os dados, substituindo os valores pela faixa correspondente. Essa é uma técnica clássica de transformação de atributos contínuos em categóricos, permitindo o uso por algoritmos que exigem dados categóricos.
A discretização é o processo de converter atributos numéricos contínuos em intervalos ou categorias discretas. Existem diversos métodos, como igual largura (equal-width), igual frequência (equal-frequency, que é o histograma), baseado em entropia, por agrupamento (clustering) e binning. A questão testa o conhecimento dessas técnicas.
Método de Discretização
Descrição Correta
Característica Principal
Erro Comum na Alternativa
Baseada em histograma (equal-frequency)
Utiliza intervalos de frequência do histograma para segmentar os dados; valores são substituídos pela faixa correspondente.
Divide dados ordenados em bins com aproximadamente o mesmo número de elementos.
—
Baseada em entropia
Processo recursivo que maximiza o ganho de informação para encontrar pontos de corte.
Não linear; usa medidas de impureza (entropia).
Descrita como "função linear" (Alternativa C).
Por agrupamento (clustering)
Agrupa dados por similaridade (ex.: k-means); clusters servem como intervalos.
Não supervisionado; leva em conta a distribuição dos dados.
Descrita como "aleatória" (Alternativa D).
Encaixotamento (binning)
Substitui valores por limites de intervalos (ex.: média, mediana ou limites arbitrários).
Pode usar estatísticas descritivas; não desconsidera média/mediana necessariamente.
Descrita como "desconsidera média e mediana" (Alternativa E).
Alternativa A — ❌ Incorreta
Afirma que a discretização não é recomendada para atributos contínuos, o que é falso. A discretização é exatamente aplicada a atributos contínuos para adequá-los a algoritmos que trabalham com dados categóricos. Embora possa haver perda de informação, é uma técnica útil e amplamente utilizada.
Alternativa B — ✅ Correta ⟵ GABARITO
Descreve corretamente a discretização baseada em histograma (também chamada de equal-frequency binning). Nesse método, os dados são ordenados e divididos em intervalos (bins) com aproximadamente o mesmo número de elementos. Os valores originais são substituídos pelo rótulo ou índice do intervalo ao qual pertencem. É uma técnica simples e eficaz.
Alternativa C — ❌ Incorreta
A discretização baseada em entropia não é uma função linear. Ela utiliza medidas de impureza (como a entropia) para encontrar os melhores pontos de corte de forma recursiva, maximizando o ganho de informação. Trata-se de um processo não linear, muitas vezes supervisionado. A descrição como "função linear" está errada.
Alternativa D — ❌ Incorreta
A discretização por agrupamento (clustering) não atribui valores aleatoriamente. Métodos como k-means agrupam os dados com base na similaridade (distância), formando clusters que servem como intervalos. É um processo não supervisionado que leva em conta a distribuição dos dados, e não aleatório.
Alternativa E — ❌ Incorreta
A técnica de encaixotamento (binning) não usa limites arbitrários. Existem variações como equal-width (intervalos de mesma amplitude) e equal-frequency (mesmo número de elementos). A média e a mediana podem ser consideradas em alguns métodos, mas não são desconsideradas. O termo "arbitrários" é incorreto.
PEGA ESSA DICA!
Para resolver questões sobre discretização, lembre-se dos métodos principais e suas características: histograma (equal-frequency), largura igual (equal-width), entropia (ganho de informação) e clustering (k-means). Identifique qual descrição se encaixa em cada um.