Auditor de Controle Externo – Tecnologia da Informação
Um Tribunal está implementando uma solução para gerenciar seu vasto acervo digital, que inclui milhões de documentos digitalizados, gravações de áudio de sessões, vídeos de audiências e dados estruturados extraídos do sistema processual eletrônico. Para viabilizar análises futuras complexas (como mineração de dados, inteligência artificial e cruzamento de informações) e consultas avançadas, optou por armazenar inicialmente todos esses dados em um data lake.A principal vantagem da escolha inicial pelo data lake reside no fato de que ele permite:
Aarmazenar dados brutos em seu formato original sem exigir esquemas rígidos pré-definidos, mantendo a flexibilidade para futuras transformações.
Brealizar automaticamente transformações complexas (ETL/ELT) e modelar os dados em tabelas altamente normalizadas, prontas para consulta analítica imediata.
Cexcluir de forma automatizada registros históricos considerados irrelevantes, reduzindo significativamente o volume total de dados armazenados e os custos associados.
Dconverter automaticamente todos os dados brutos em relatórios e dashboards visuais prontos para consumo pelos operadores do direito, sem necessidade de processamento adicional.
Erestringir o acesso aos usuários apenas a conjuntos de dados previamente filtrados, resumidos e aprovados pela governança, garantindo máxima segurança desde o início.
Revelar gabarito e comentário▾
GabaritoA — armazenar dados brutos em seu formato original sem exigir esquemas rígidos pré-definidos, mantendo a flexibilidade para futuras transformações.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Data Lake: conceitos e vantagens
Gabarito: letra A. A principal vantagem de um data lake é armazenar dados brutos em seu formato original, sem exigir esquemas rígidos pré-definidos (schema-on-read), mantendo flexibilidade para transformações futuras. Essa é a definição clássica de data lake, conforme amplamente descrito na literatura de Big Data.
A questão testa a compreensão do conceito de data lake em contraste com outras abordagens de armazenamento, como data warehouse. A alternativa correta capta exatamente a essência: repositório único de dados brutos, sem modelagem prévia, pronto para análises avançadas.
Característica
Data Lake
Data Warehouse
Formato de armazenamento
Dados brutos em formato original
Dados processados e modelados
Esquema
Schema-on-read (flexível, definido na leitura)
Schema-on-write (rígido, definido na escrita)
Processamento
Transformações sob demanda (após ingestão)
ETL/ELT obrigatório antes da análise
Objetivo principal
Flexibilidade para análises futuras (Big Data, IA)
Consultas analíticas rápidas e estruturadas
Exclusão de dados
Retenção massiva de dados históricos
Pode excluir dados considerados irrelevantes
Geração de relatórios
Não gera automaticamente; requer ferramentas de BI
Pode gerar relatórios e dashboards diretamente
Controle de acesso
Acesso a dados brutos, com governança posterior
Acesso a dados filtrados e aprovados
Alternativa A — ✅ Correta ⟵ GABARITO
Correta. Um data lake armazena dados em formato bruto (estruturados, semiestruturados ou não estruturados) sem necessidade de definir um esquema rígido no momento da ingestão. A flexibilidade (schema-on-read) permite que os dados sejam transformados e modelados conforme a necessidade futura de análise, o que é ideal para cenários de Big Data como o do enunciado.
Alternativa B — ❌ Incorreta
Incorreta. Data lakes não realizam automaticamente transformações complexas de ETL/ELT nem modelam dados em tabelas normalizadas. Essa é uma característica típica de data warehouse, que exige pré-processamento e modelagem dimensional. Data lakes armazenam dados crus; as transformações vêm depois, sob demanda.
Alternativa C — ❌ Incorreta
Incorreta. Data lakes são projetados para armazenar grandes volumes de dados históricos, inclusive registros que possam parecer irrelevantes no momento, justamente para permitir análises futuras. A exclusão automatizada de registros não é uma vantagem; pelo contrário, data lakes prezam pela retenção massiva de dados brutos.
Alternativa D — ❌ Incorreta
Incorreta. Data lakes não convertem automaticamente dados em relatórios ou dashboards. Eles fornecem a base bruta; a geração de visualizações e relatórios depende de ferramentas de BI e processamento adicional (consultas, ETL, OLAP).
Alternativa E — ❌ Incorreta
Incorreta. Data lakes, por armazenarem dados brutos, não restringem o acesso apenas a conjuntos previamente filtrados e aprovados. Embora a governança seja importante, a vantagem inicial é justamente a disponibilidade dos dados em seu estado original. Restrições mais severas são comuns em data warehouses ou sistemas de governança maduros, não no conceito fundamental do data lake.
PEGA ESSA DICA!
Para memorizar: Data Lake = dados brutos, sem esquema prévio (schema-on-read). Data Warehouse = dados processados, modelados (schema-on-write). Na prova, lembre-se de que a flexibilidade é a marca registrada do data lake.