Questão de TI - Ciência de Dados e Inteligência Artificial — Geral — FCC 2026
TI - Ciência de Dados e Inteligência ArtificialGeral
- Código
- fc142187
- Banca
- FCC
- Órgão
- SEPLAG PE
- Ano
- 2026
- Cargo
- GG POG ( )
Uma equipe de planejamento da SEPLAG está preparando um conjunto de dados para análise em Python, usando Pandas. O DataFrame df contém informações sobre projetos estratégicos, incluindo colunas como projeto, responsavel, orcamento, prazo_dias e cpf_responsavel. Durante a análise exploratória, foram identificados valores ausentes em prazo_dias, duplicatas em projeto e valores extremos em orcamento. Além disso, os dados serão compartilhados com parceiros externos. Em condições ideais, uma prática que se adequa a este cenário é
- Acriar os gráficos finais primeiro e realizar a análise exploratória em seguida, pois isso evita alterações nos dados que possam comprometer a visualização.
- Bremover valores ausentes em prazo_dias, usando df.dropna(subset='prazo_dias'), o que garante que todos os registros com dados incompletos sejam eliminados.
- Caplicar um tipo de anonimização na coluna cpf_responsavel, utilizando um salt, com df['cpf_responsavel'] = df['cpf_responsavel'].apply(lambda x: hash(salt + str(x))), o que converte os CPFs em identificadores não reversíveis e menos suscetíveis à reidentificação.
- Dpromover a detecção de outliers em orcamento, usando df['orcamento'] = df['orcamento'].drop_outliers(), pois esses valores indicam desvios estatísticos significativos em relação à média ou à massa total dos dados.
- Eremover duplicatas em projeto, usando o comando df.drop_duplicates(subset=None, keep=None, inplace=False), que verifica a coluna projeto e remove todos os registros duplicados diretamente sobre o DataFrame df.