Questão de Banco de Dados — DW - Data Warehouse — Quadrix 2023
- Código
- qg025985
- Banca
- Quadrix
- Órgão
- CREA-GO
- Ano
- 2023
- Nível
- Superior
- Cargo
- Analista de Área - T.I
- CCerto
- EErrado
GabaritoE — Errado
Gabarito: ERRADO (letra E). A operação do Data Lake que permite importar qualquer quantidade de dados em tempo real de múltiplas fontes é denominada ingestão de dados, e não exploração/visualização. A exploração/visualização é uma etapa posterior, que ocorre após os dados já estarem armazenados e disponíveis para análise.
O Data Lake é um repositório centralizado que armazena grandes volumes de dados em seu formato original, sejam eles estruturados, semiestruturados ou não estruturados. A principal característica que o diferencia de um Data Warehouse é a flexibilidade: enquanto o DW exige que os dados sejam previamente processados e modelados (via ETL), o Data Lake aceita os dados brutos, sem necessidade de transformação prévia. Essa flexibilidade permite que as organizações capturem dados de diversas fontes — bancos de dados relacionais, arquivos JSON, XML, logs, imagens, vídeos — e os armazenem para análises futuras e imprevistas.
O ciclo de vida dos dados em um Data Lake envolve várias operações, cada uma com uma finalidade específica. A ingestão é a primeira etapa, responsável por importar os dados das fontes para o repositório. Ela pode ocorrer em lote (batch) ou em tempo real (streaming), e é exatamente essa operação que permite a importação de qualquer quantidade de dados de múltiplas fontes. Após a ingestão, os dados ficam armazenados e podem passar por processos de processamento (como limpeza e transformação), exploração/visualização (para análise e geração de insights) e governança (para garantir qualidade e segurança).
A confusão entre ingestão e exploração/visualização é comum, pois ambas são etapas do fluxo de dados. No entanto, a exploração/visualização é uma atividade de consumo dos dados, que ocorre depois que eles já estão disponíveis no Data Lake. Ela envolve ferramentas de BI, dashboards, consultas ad hoc e mineração de dados, mas não é responsável por importar dados de fontes externas. A importação é função exclusiva da ingestão.
Para fixar o conceito, veja a comparação entre as operações:
Operação | Finalidade | Momento no fluxo |
|---|---|---|
Ingestão | Importar dados de múltiplas fontes, em lote ou tempo real | Primeira etapa |
Processamento | Limpar, transformar e enriquecer os dados | Após a ingestão |
Exploração/Visualização | Analisar, consultar e gerar insights | Após o armazenamento |
Governança | Garantir qualidade, segurança e conformidade | Contínua |
A pegadinha da questão está em atribuir à exploração/visualização uma função que pertence à ingestão. A banca explora a confusão entre as etapas do fluxo de dados no Data Lake, esperando que o candidato identifique corretamente qual operação realiza a importação de dados.
A afirmação está incorreta porque a operação que permite importar qualquer quantidade de dados em tempo real de múltiplas fontes é a ingestão de dados, não a exploração/visualização. A exploração/visualização é uma etapa posterior, que consome os dados já armazenados para gerar análises e insights. A banca trocou o nome da operação, criando uma armadilha clássica de inversão de conceitos.
A banca troca a operação de ingestão (importação de dados) pela exploração/visualização (análise de dados). Lembre-se: a ingestão é a porta de entrada dos dados no Data Lake; a exploração é o consumo deles. Essa inversão é recorrente em questões sobre Data Lake e Data Warehouse.
Para acertar questões sobre operações de Data Lake, memorize o fluxo: ingestão → armazenamento → processamento → exploração/visualização. Quando a questão falar em "importar dados", "coletar dados" ou "receber dados de fontes", a resposta é sempre ingestão. Quando falar em "analisar", "consultar" ou "visualizar", é exploração/visualização.
Gabarito: letra E (ERRADO).
Link permanente: /questoes/qg025985