Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — NumPy — FGV 2024

TI - Ciência de Dados e Inteligência ArtificialNumPy
Código
fg165366
Banca
FGV
Órgão
Pref Cuiabá
Ano
2024
Cargo
AFTRM ( )

1 import numpy as np
2 from scipy.stats import pearsonr
3 np.random.seed(110)
4 s1 = np.random.normal(size=1000)
5 s2 = s1.copy()
6 s2[0] = 100.0
7 print(pearsonr(s1,s2))

 

Ao ser executado o código acima, após a linha 7 foi escrito na tela o seguinte:

 

PearsonRResult(statistic=0.3104130838548752, pvalue=8.891269104323198e-24)

Considere o código abaixo escrito na linguagem Python (versão 3.11.1) com uso das bibliotecas numpy (versão 1.23.5) e scipy (versão 1.10.0).

   

Acerca do exposto, analise os itens a seguir.

 

I. Os valores possíveis para ‘statistic’ estão no intervalo entre 0 e 1.

II. Os valores da mediana de s1 e de s2 são os mesmos.

III. O resultado da linha 7 escrito na tela indica que ‘s1’ e ‘s2’ possuem uma fraca relação linear.

 

Está correto o que se afirma em

  1. AII, apenas.
  2. BI e II, apenas.
  3. C I e III, apenas.
  4. DII e III, apenas.
  5. EI, II e III.
Revelar gabarito e comentário

GabaritoA — II, apenas.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Correlação de Pearson e o efeito de outliers

Gabarito: letra A. O item II está correto porque s2 é uma cópia de s1 com apenas o primeiro elemento alterado, e a mediana é robusta a outliers — alterar um único valor em um vetor de 1000 elementos não muda a mediana. O item I está errado porque o coeficiente de correlação de Pearson varia entre -1 e 1, não entre 0 e 1. O item III está errado porque o valor 0.31 indica uma correlação fraca, mas o p-value extremamente baixo (8.89e-24) indica que essa correlação é estatisticamente significativa, e a afirmação de que há "fraca relação linear" é uma interpretação incompleta — a significância estatística é o ponto central.

A correlação de Pearson mede a força e a direção da relação linear entre duas variáveis. O coeficiente, denotado por rr, é calculado como a covariância das duas variáveis dividida pelo produto de seus desvios padrão. O valor de rr sempre estará no intervalo [1,1][-1, 1], onde:

  • r=1r = 1 indica uma relação linear perfeita positiva;

  • r=1r = -1 indica uma relação linear perfeita negativa;

  • r=0r = 0 indica ausência de relação linear.

O sinal de rr indica a direção da relação, e o valor absoluto indica a força. Valores próximos de 1 ou -1 indicam relação forte, enquanto valores próximos de 0 indicam relação fraca. Uma interpretação comum é:

Valor de

r

Força da relação

0.00 – 0.30

Fraca

0.30 – 0.70

Moderada

0.70 – 1.00

Forte

No código, s1 é gerado com uma distribuição normal padrão (média 0, desvio padrão 1) com 1000 elementos. s2 é uma cópia de s1, mas o primeiro elemento de s2 é substituído por 100.0. Isso cria um outlier extremo em s2. O outlier tem um efeito significativo na correlação de Pearson, pois a correlação é sensível a valores extremos. O valor de r=0.31r = 0.31 reflete a relação linear entre as duas variáveis, que é fraca, mas o p-value de 8.89×10248.89 \times 10^{-24} indica que a probabilidade de observar essa correlação por acaso, se não houvesse relação real, é extremamente baixa. Portanto, a correlação é estatisticamente significativa.

A mediana é uma medida de tendência central que representa o valor central de um conjunto de dados ordenado. Ela é robusta a outliers, pois não é afetada por valores extremos. Como s2 é uma cópia de s1 com apenas o primeiro elemento alterado, e a mediana de um vetor de 1000 elementos é a média dos valores nas posições 500 e 501 (após ordenação), a alteração de um único valor não afeta a mediana. Portanto, as medianas de s1 e s2 são as mesmas.

A pegadinha da questão está em dois pontos: primeiro, o item I afirma que o coeficiente de correlação varia entre 0 e 1, mas o intervalo correto é [-1, 1]. Segundo, o item III afirma que o resultado indica uma "fraca relação linear", mas ignora o p-value, que é extremamente baixo e indica significância estatística. A banca explora a confusão entre a força da correlação (fraca) e a significância estatística (alta).

Item I — ❌ Incorreto

O coeficiente de correlação de Pearson varia entre -1 e 1, não entre 0 e 1. O valor -1 indica correlação negativa perfeita, 0 indica ausência de correlação, e 1 indica correlação positiva perfeita. O item erra ao excluir os valores negativos do intervalo.

Item II — ✅ Correto

s2 é uma cópia de s1 com apenas o primeiro elemento alterado. A mediana é robusta a outliers, e alterar um único valor em um vetor de 1000 elementos não muda a mediana. Portanto, as medianas de s1 e s2 são as mesmas.

Item III — ❌ Incorreto

O valor de r=0.31r = 0.31 indica uma correlação fraca, mas o p-value de 8.89×10248.89 \times 10^{-24} indica que essa correlação é estatisticamente significativa. A afirmação de que há "fraca relação linear" é uma interpretação incompleta, pois ignora a significância estatística. A correlação é fraca, mas significativa.

Gabarito: letra A — apenas o item II está correto.

Link permanente: /questoes/fg165366