Questão de Banco de Dados — DER - Diagrama de Entidade e Relacionamento — Quadrix 2024
- Código
- qg354475
- Banca
- Quadrix
- Órgão
- NOVACAP
- Ano
- 2024
- Nível
- Superior
- Cargo
- Analista de Sistemas - Infraestrutura
- CCerto
- EErrado
GabaritoC — Certo
Gabarito: CERTO. A afirmação descreve corretamente o Data Lake como um repositório centralizado que armazena grandes volumes de dados em seu formato bruto (raw), incluindo dados estruturados, semiestruturados e não estruturados, sem a necessidade de transformação prévia. Essa é a definição consagrada na literatura de Big Data e arquitetura de dados.
O Data Lake é um conceito fundamental no ecossistema de Big Data e analytics. Diferentemente do Data Warehouse, que armazena dados já processados, limpos e modelados para atender a necessidades específicas de negócio, o Data Lake adota a filosofia de armazenar os dados na sua forma mais original possível, preservando a fidelidade da fonte. Isso permite que diferentes consumidores (cientistas de dados, analistas, aplicações de machine learning) acessem os mesmos dados e os transformem conforme suas necessidades específicas, sem que o repositório imponha um modelo único.
A principal característica que distingue o Data Lake é o schema-on-read: o esquema é aplicado no momento da leitura, e não na escrita. Isso significa que os dados podem ser ingeridos sem validação ou transformação, e cada aplicação pode interpretá-los de forma diferente. Essa flexibilidade é o que permite armazenar dados de formatos variados — arquivos CSV, JSON, Parquet, imagens, vídeos, logs, etc. — sem a necessidade de um modelo de dados unificado.
Na prática, um Data Lake é tipicamente construído sobre sistemas de armazenamento distribuído, como Hadoop HDFS ou serviços de nuvem (Amazon S3, Azure Data Lake Storage, Google Cloud Storage). Os dados são organizados em zonas (raw, curated, etc.) para facilitar o gerenciamento, mas a essência é a mesma: um repositório central de dados brutos.
A banca explora aqui a confusão entre Data Lake e Data Warehouse. Enquanto o Data Warehouse armazena dados processados, integrados e modelados (schema-on-write), o Data Lake armazena dados brutos, em formato original (schema-on-read). A alternativa correta captura exatamente essa essência do Data Lake.
A afirmação está correta. O Data Lake é, por definição, um repositório para armazenar grandes volumes de dados em formatos variados, incluindo dados brutos não processados, semiestruturados e estruturados. Essa é a característica central que o diferencia de outras soluções de armazenamento analítico, como o Data Warehouse, que exige dados já transformados e modelados.
Gabarito: letra C (CERTO).
Link permanente: /questoes/qg354475