Questão de Banco de Dados — ETL (Extract Transform Load) — FGV 2022
Banco de Dados›ETL (Extract Transform Load)
Código
fg047190
Banca
FGV
Órgão
CGU
Ano
2022
Nível
Superior
Cargo
Auditor Federal de Finanças e Controle - Tecnologia da Informação
Uma organização deseja implementar um pipeline de dados e está avaliando a opção mais adequada para o seu contexto de operação. Em torno de 40% dos dados consumidos pela organização se encontram em planilhas eletrônicas que contêm dados sensíveis, produzidas semanalmente por suas unidades de negócio. Os outros 60% dos dados se encontram em alguns bancos de dados relacionais de sistemas de produção da organização. O tamanho da base é de moderado a pequeno, mas existe a necessidade de conformidade com normas de privacidade e confidencialidade dos dados. O objetivo do pipeline é fornecer insumos para um departamento que realiza análises de dados com métodos não supervisionados de aprendizagem de máquina para elaborar relatórios periódicos mensais. A organização está avaliando a construção de um Armazém de Dados (ETL) ou de um Lago de Dados (ELT).A proposta de modelo adequada e corretamente justificada é
AArmazém de Dados. Ambos os modelos são adequados, mas Lago de Dados tem maior latência até a carga (L) e custo maior;
BArmazém de Dados. Esse modelo possui menor latência até a carga (L) e, ao contrário do Lago de Dados, opera de forma eficiente com dados relacionais;
CArmazém de Dados. O processo ETL é mais adequado para o tratamento dos dados sensíveis e os casos de uso são bem conhecidos;
DLago de Dados. Esse modelo possui menor latência até a carga (L) e permite a extração (E) de dados semiestruturados e não estruturados;
ELago de Dados. Esse modelo não necessita de hardware especializado e, ao contrário do Armazém de Dados, possibilita tarefas de aprendizado de máquina.
Revelar gabarito e comentário▾
GabaritoC — Armazém de Dados. O processo ETL é mais adequado para o tratamento dos dados sensíveis e os casos de uso são bem conhecidos;
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Pipeline de dados: ETL vs ELT
Gabarito: letra C. A organização precisa tratar dados sensíveis (40% em planilhas) e tem casos de uso bem conhecidos (relatórios mensais com ML não supervisionado). O processo ETL transforma os dados antes da carga, permitindo aplicar regras de privacidade, anonimização e conformidade com a LGPD (dados sensíveis). Já o ELT carrega dados brutos e transforma depois, o que oferece menos controle inicial sobre dados sensíveis. Por isso, o Armazém de Dados com ETL é a escolha mais adequada.
A banca testa a diferença entre ETL e ELT, especialmente no tratamento de dados sensíveis. O contexto menciona explicitamente "necessidade de conformidade com normas de privacidade e confidencialidade dos dados", o que direciona para ETL.
Alternativa
Afirmação Principal
Correta?
Justificativa
A
Armazém de Dados; Lago de Dados tem maior latência e custo maior
❌ Incorreta
ELT (Lago) geralmente tem menor latência até a carga e pode usar hardware commodity, reduzindo custos; a justificativa está invertida
B
Armazém de Dados; menor latência até a carga e opera eficientemente só com dados relacionais
❌ Incorreta
ETL tem maior latência (transformação antes da carga); ambos lidam com dados relacionais
C
Armazém de Dados; ETL é mais adequado para dados sensíveis e casos de uso conhecidos
✅ Correta
ETL permite anonimização e regras de privacidade antes da carga; relatórios mensais com ML são caso de uso bem definido
D
Lago de Dados; menor latência até a carga e extrai dados semiestruturados
❌ Incorreta
Ignora o requisito principal de conformidade com privacidade e dados sensíveis
E
Lago de Dados; não necessita hardware especializado e possibilita ML
❌ Incorreta
Embora parcialmente verdade, desconsidera a necessidade de tratamento prévio de dados sensíveis
Pipeline de dados
1ETL (Armazém)
Trata dados sensíveis antes da carga
Casos de uso bem conhecidos
Maior latência até a carga
2ELT (Lago)
Menor latência até a carga
Dados semiestruturados/não estruturados
Dados sensíveis sem tratamento prévio
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
Afirma que Lago de Dados tem maior latência e custo maior. Na verdade, o ELT (Lago) geralmente tem menor latência até a carga, pois não transforma antes, e pode usar hardware commodity, reduzindo custos. A justificativa está invertida.
Alternativa B — ❌ Incorreta
Diz que Armazém de Dados tem menor latência até a carga. Na verdade, o ETL tem maior latência porque a transformação ocorre antes da carga. Também afirma que apenas o Armazém opera eficientemente com dados relacionais, o que é falso: ambos conseguem lidar com dados relacionais.
Alternativa C — ✅ Correta ⟵ GABARITO
O processo ETL é mais adequado para tratar dados sensíveis, já que a transformação permite limpeza, anonimização e aplicação de regras de privacidade antes de carregar os dados no destino. Além disso, os casos de uso (relatórios mensais com ML não supervisionado) são bem conhecidos, o que favorece um modelo tradicional de Data Warehouse com ETL.
Alternativa D — ❌ Incorreta
Embora o Lago de Dados realmente tenha menor latência até a carga e lide bem com dados semiestruturados, essa alternativa ignora o principal requisito do enunciado: a conformidade com privacidade e dados sensíveis. A justificativa não atende ao contexto.
Alternativa E — ❌ Incorreta
Afirma que o Lago de Dados não necessita de hardware especializado (verdade) e que possibilita tarefas de ML (ambos possibilitam). No entanto, novamente desconsidera a necessidade de tratamento de dados sensíveis e a previsibilidade dos casos de uso, que tornam o ETL mais indicado.
NÃO CAIA NESSA!
A banca troca as características de latência e custo entre ETL e ELT. O candidato deve lembrar que ETL transforma antes (maior latência, maior controle), enquanto ELT transforma depois (menor latência, mas menos controle inicial). Foque no tratamento de dados sensíveis como critério decisivo.