Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Ecossistema Hadoop — IBFC 2025

TI - Ciência de Dados e Inteligência ArtificialEcossistema Hadoop
Código
qa699275
Banca
IBFC
Órgão
TJ PE
Ano
2025
Cargo
AJ ( )

Antes de processar em produção uma consulta com muitos dados que são recebidos em tempo real, um Analista de Sistemas gerou o código do Apache Spark abaixo para processar um teste de 1000 (mil) registros.

 

streamingDataFrame =
    spark.readStream.schema(staticSchema).optio
    n("maxFilesPerTrigger",
    1).format("csv").option("header",
     "true").load("/FileStore/tables/*.csv")
spark.conf.set("spark.sql.shuffle.partitions", "500")
retornoConsulta =
     streamingDataFrame.selectExpr(--consulta--)
retornoConsulta.writeStream.format("memory").qu
    eryName("tResultado").outputMode("complete
     ").start()

 

Diante do exposto, analise as afirmativas abaixo.

 

I. A função maxFilesPerTrigger especifica o número de arquivos que são lidos por vez, no formato CSV com cabeçalho e especifica a rota.

 

II. spark.conf.set define o tamanho de memória para um nó único.

 

III. O resultado da consulta pode ser acessado pelo nome da tabela “tResultado” na memória com o comando spark.sql("""SELECT * FROM tResultado""").show(5).

 

Estão corretas as afirmativas:

  1. AI, II e III
  2. BII e III apenas
  3. C I e III apenas
  4. D I e II apenas
Revelar gabarito e comentário

GabaritoC — I e III apenas

Link permanente: /questoes/qa699275