Questão de Banco de Dados — Big Data — FUNDATEC 2025
Banco de Dados›Big Data
Código
qg477897
Banca
FUNDATEC
Órgão
Prefeitura de Porto Alegre - RS
Ano
2025
Nível
Superior
Cargo
Auditor Fiscal da Receita Municipal - Bloco II
O pré-processamento de dados é uma etapa essencial para garantir a qualidade e a eficiência das análises em ambientes de Big Data. Sendo assim, assinale a alternativa que descreve corretamente uma técnica comum de pré-processamento de dados.
AA tokenização consiste em dividir grandes conjuntos de dados em clusters para facilitar a análise preditiva.
BA remoção de outliers visa eliminar valores que estão fora de um intervalo esperado, reduzindo o impacto de dados anômalos na análise.
CO agrupamento (clustering) é um método de pré-processamento focado na criação de previsões de séries temporais.
DA codificação one-hot é aplicada para simplificar dados numéricos, convertendo números em suas raízes quadradas.
EA normalização é utilizada para reduzir a dimensão dos dados, eliminando colunas redundantes ou irrelevantes.
Revelar gabarito e comentário▾
GabaritoB — A remoção de outliers visa eliminar valores que estão fora de um intervalo esperado, reduzindo o impacto de dados anômalos na análise.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Pré-processamento de dados em Big Data
Gabarito: letra B. A remoção de outliers (valores discrepantes) é uma técnica clássica de limpeza de dados, que elimina observações fora de um intervalo esperado para reduzir o impacto de anomalias estatísticas. Essa é a única alternativa que descreve corretamente uma etapa de pré-processamento.
A banca testa o conhecimento de técnicas comuns de preparação de dados, etapa fundamental em Big Data e mineração. Cada alternativa explora um conceito, mas apenas uma corresponde a uma técnica de pré-processamento propriamente dita.
A tokenização é o processo de dividir um texto em unidades menores (tokens, como palavras ou frases), e não consiste em dividir conjuntos de dados em clusters. O erro está em confundir tokenização com agrupamento (clustering), que é uma técnica de análise, não de pré-processamento.
Alternativa B — ✅ Correta ⟵ GABARITO
A remoção de outliers visa identificar e eliminar valores que fogem ao padrão esperado dos dados, evitando que eles distorçam médias, variâncias ou modelos preditivos. É uma etapa comum de limpeza no pré-processamento.
Alternativa C — ❌ Incorreta
O agrupamento (clustering) é um método de aprendizado não supervisionado para descobrir grupos naturais nos dados, e não um método de pré-processamento focado em previsões de séries temporais. A descrição mistura conceitos distintos.
Alternativa D — ❌ Incorreta
A codificação *one-hot* converte variáveis categóricas em vetores binários (0 ou 1) para uso em algoritmos, e não simplifica dados numéricos convertendo‑os em raízes quadradas. Esta seria uma transformação matemática sem relação com one-hot.
Alternativa E — ❌ Incorreta
A normalização (ou min‑max scaling) redimensiona valores para uma faixa (ex.: [0,1]) e não reduz a dimensionalidade. A redução de dimensão é feita por técnicas como PCA ou seleção de atributos; a normalização apenas ajusta escalas.
NÃO CAIA NESSA!
Memorize as principais tarefas de pré‑processamento: limpeza (outliers, valores nulos), transformação (normalização, codificação one‑hot), redução de dimensionalidade e seleção de atributos. Cada uma tem propósito específico — não confunda com métodos de análise como clustering ou tokenização.