Pular para o conteúdo principal

Questão de Banco de Dados — Big Data — FUNDATEC 2025

Banco de DadosBig Data
Código
qg477897
Banca
FUNDATEC
Órgão
Prefeitura de Porto Alegre - RS
Ano
2025
Nível
Superior
Cargo
Auditor Fiscal da Receita Municipal - Bloco II
O pré-processamento de dados é uma etapa essencial para garantir a qualidade e a eficiência das análises em ambientes de Big Data. Sendo assim, assinale a alternativa que descreve corretamente uma técnica comum de pré-processamento de dados.
  1. AA tokenização consiste em dividir grandes conjuntos de dados em clusters para facilitar a análise preditiva.
  2. BA remoção de outliers visa eliminar valores que estão fora de um intervalo esperado, reduzindo o impacto de dados anômalos na análise.
  3. CO agrupamento (clustering) é um método de pré-processamento focado na criação de previsões de séries temporais.
  4. DA codificação one-hot é aplicada para simplificar dados numéricos, convertendo números em suas raízes quadradas.
  5. EA normalização é utilizada para reduzir a dimensão dos dados, eliminando colunas redundantes ou irrelevantes.
Revelar gabarito e comentário

GabaritoB — A remoção de outliers visa eliminar valores que estão fora de um intervalo esperado, reduzindo o impacto de dados anômalos na análise.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Pré-processamento de dados em Big Data

Gabarito: letra B. A remoção de outliers (valores discrepantes) é uma técnica clássica de limpeza de dados, que elimina observações fora de um intervalo esperado para reduzir o impacto de anomalias estatísticas. Essa é a única alternativa que descreve corretamente uma etapa de pré-processamento.

A banca testa o conhecimento de técnicas comuns de preparação de dados, etapa fundamental em Big Data e mineração. Cada alternativa explora um conceito, mas apenas uma corresponde a uma técnica de pré-processamento propriamente dita.

block-beta
  columns 3
  DadosBrutos["Dados Brutos"]:1
  PreProcessamento["Pré-processamento"]:1
  DadosLimpos["Dados Limpos"]:1

  space:1
  Limpeza["Limpeza"]:1
  Transformacao["Transformação"]:1
  Reducao["Redução"]:1

  DadosBrutos --> PreProcessamento
  PreProcessamento --> DadosLimpos

  Limpeza --> RemocaoOutliers["Remoção de Outliers"]
  Limpeza --> TratamentoNulos["Tratamento de Nulos"]
  Transformacao --> Normalizacao["Normalização"]
  Transformacao --> OneHot["Codificação One-Hot"]
  Reducao --> PCA["PCA"]
  Reducao --> SelecaoAtributos["Seleção de Atributos"]
end

Alternativa A — ❌ Incorreta

A tokenização é o processo de dividir um texto em unidades menores (tokens, como palavras ou frases), e não consiste em dividir conjuntos de dados em clusters. O erro está em confundir tokenização com agrupamento (clustering), que é uma técnica de análise, não de pré-processamento.

Alternativa B — ✅ Correta ⟵ GABARITO

A remoção de outliers visa identificar e eliminar valores que fogem ao padrão esperado dos dados, evitando que eles distorçam médias, variâncias ou modelos preditivos. É uma etapa comum de limpeza no pré-processamento.

Alternativa C — ❌ Incorreta

O agrupamento (clustering) é um método de aprendizado não supervisionado para descobrir grupos naturais nos dados, e não um método de pré-processamento focado em previsões de séries temporais. A descrição mistura conceitos distintos.

Alternativa D — ❌ Incorreta

A codificação *one-hot* converte variáveis categóricas em vetores binários (0 ou 1) para uso em algoritmos, e não simplifica dados numéricos convertendo‑os em raízes quadradas. Esta seria uma transformação matemática sem relação com one-hot.

Alternativa E — ❌ Incorreta

A normalização (ou min‑max scaling) redimensiona valores para uma faixa (ex.: [0,1]) e não reduz a dimensionalidade. A redução de dimensão é feita por técnicas como PCA ou seleção de atributos; a normalização apenas ajusta escalas.

NÃO CAIA NESSA!

Memorize as principais tarefas de pré‑processamento: limpeza (outliers, valores nulos), transformação (normalização, codificação one‑hot), redução de dimensionalidade e seleção de atributos. Cada uma tem propósito específico — não confunda com métodos de análise como clustering ou tokenização.

Gabarito: letra B.

Link permanente: /questoes/qg477897