Questão de TI - Ciência de Dados e Inteligência Artificial — Pandas — FCC 2026
TI - Ciência de Dados e Inteligência ArtificialPandas
- Código
- fc142201
- Banca
- FCC
- Órgão
- SEFAZ SP
- Ano
- 2026
- Cargo
- AFRE ( )
Uma equipe de auditoria possui uma tabela de NF-e com mais de 1 bilhão de registros em um pyspark.sql.DataFrame chamado df. A auditora deseja inspecionar apenas 1.000 registros localmente em seu notebook, usando funcionalidades avançadas de pandas para buscar inconsistências. Nesse cenário, a abordagem em PySpark mais apropriada para gerar esses registros em um pandas.DataFrame, minimizando o risco de estouro de memória no ambiente local é:
- Apdf = df.toPandas() pdf_sample = pdf.sample(n=1000, random_state=42)
- Bsample_df = df.sample(False, 0.001, seed=42) pdf_sample = sample_df.toPandas()
- Cpdf_sample = df.limit(1000).toPandas()
- Drows = df.collect() pdf_sample = pd.DataFrame(rows[:1000])
- Epdf_sample = spark.createDataFrame(df.head(1000)).toPandas()