Questão de TI - Ciência de Dados e Inteligência Artificial — Conceitos de Big Data — IBFC 2025
- Código
- qa699259
- Banca
- IBFC
- Órgão
- TJ PE
- Ano
- 2025
- Cargo
- TJ ( )
O Apache SPARK é uma plataforma de computação com um conjunto de bibliotecas para processamento paralelo de dados em clusters de computadores. Para resolver a maioria dos desafios computacionais, ele disponibiliza um conjunto de formatos de arquivos especiais nativos e conectores de fontes externas. Diante do exposto, analise as afirmativas abaixo.
I. CSV é o formato de arquivo padrão (default) do Spark, ele é simples de entender e não requer ferramentas para visualização dos dados, pois os dados não estão em formato binário.
II. Parquet é formato de armazenamento de dados proprietário orientado a colunas que oferece uma variedade de otimizações de armazenamento, especialmente para cargas de trabalho analíticas. Ele oferece compactação em colunas, o que economiza espaço de armazenamento e permite a leitura de colunas individuais em vez de arquivos inteiros. A leitura de um arquivo Parquet é menos eficiente do que JSON ou CSV.
III. O formato JSON apresenta vantagens se for delimitado por linha, esse formato é muito mais estável pois permite anexar um novo registro a um arquivo, em vez de ter que ler um arquivo inteiro e depois escrevê-lo.
Estão corretas as afirmativas:
- AI e II apenas
- BII apenas
- CI, II e III
- DIII apenas