Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Pandas — FCC 2026

TI - Ciência de Dados e Inteligência ArtificialPandas
Código
fc142201
Banca
FCC
Órgão
SEFAZ SP
Ano
2026
Cargo
AFRE ( )

Uma equipe de auditoria possui uma tabela de NF-e com mais de 1 bilhão de registros em um pyspark.sql.DataFrame chamado df. A auditora deseja inspecionar apenas 1.000 registros localmente em seu notebook, usando funcionalidades avançadas de pandas para buscar inconsistências. Nesse cenário, a abordagem em PySpark mais apropriada para gerar esses registros em um pandas.DataFrame, minimizando o risco de estouro de memória no ambiente local é:

  1. Apdf = df.toPandas() pdf_sample = pdf.sample(n=1000, random_state=42)
  2. Bsample_df = df.sample(False, 0.001, seed=42) pdf_sample = sample_df.toPandas()
  3. Cpdf_sample = df.limit(1000).toPandas()
  4. Drows = df.collect() pdf_sample = pd.DataFrame(rows[:1000])
  5. Epdf_sample = spark.createDataFrame(df.head(1000)).toPandas()
Revelar gabarito e comentário

GabaritoC — pdf_sample = df.limit(1000).toPandas()

Link permanente: /questoes/fc142201