Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Conceitos de Big Data — IBFC 2025

TI - Ciência de Dados e Inteligência ArtificialConceitos de Big Data
Código
qa699259
Banca
IBFC
Órgão
TJ PE
Ano
2025
Cargo
TJ ( )

O Apache SPARK é uma plataforma de computação com um conjunto de bibliotecas para processamento paralelo de dados em clusters de computadores. Para resolver a maioria dos desafios computacionais, ele disponibiliza um conjunto de formatos de arquivos especiais nativos e conectores de fontes externas. Diante do exposto, analise as afirmativas abaixo.

 

I. CSV é o formato de arquivo padrão (default) do Spark, ele é simples de entender e não requer ferramentas para visualização dos dados, pois os dados não estão em formato binário.

 

II. Parquet é formato de armazenamento de dados proprietário orientado a colunas que oferece uma variedade de otimizações de armazenamento, especialmente para cargas de trabalho analíticas. Ele oferece compactação em colunas, o que economiza espaço de armazenamento e permite a leitura de colunas individuais em vez de arquivos inteiros. A leitura de um arquivo Parquet é menos eficiente do que JSON ou CSV.

 

III. O formato JSON apresenta vantagens se for delimitado por linha, esse formato é muito mais estável pois permite anexar um novo registro a um arquivo, em vez de ter que ler um arquivo inteiro e depois escrevê-lo.

 

Estão corretas as afirmativas:

  1. AI e II apenas
  2. BII apenas
  3. CI, II e III
  4. DIII apenas
Revelar gabarito e comentário

GabaritoD — III apenas

Link permanente: /questoes/qa699259