Questão de TI - Ciência de Dados e Inteligência Artificial — Ecossistema Hadoop — IBFC 2025
- Código
- qa699275
- Banca
- IBFC
- Órgão
- TJ PE
- Ano
- 2025
- Cargo
- AJ ( )
Antes de processar em produção uma consulta com muitos dados que são recebidos em tempo real, um Analista de Sistemas gerou o código do Apache Spark abaixo para processar um teste de 1000 (mil) registros.
streamingDataFrame =
spark.readStream.schema(staticSchema).optio
n("maxFilesPerTrigger",
1).format("csv").option("header",
"true").load("/FileStore/tables/*.csv")
spark.conf.set("spark.sql.shuffle.partitions", "500")
retornoConsulta =
streamingDataFrame.selectExpr(--consulta--)
retornoConsulta.writeStream.format("memory").qu
eryName("tResultado").outputMode("complete
").start()
Diante do exposto, analise as afirmativas abaixo.
I. A função maxFilesPerTrigger especifica o número de arquivos que são lidos por vez, no formato CSV com cabeçalho e especifica a rota.
II. spark.conf.set define o tamanho de memória para um nó único.
III. O resultado da consulta pode ser acessado pelo nome da tabela “tResultado” na memória com o comando spark.sql("""SELECT * FROM tResultado""").show(5).
Estão corretas as afirmativas:
- AI, II e III
- BII e III apenas
- C I e III apenas
- D I e II apenas