Questão de Estatística — Modelos lineares — FUNDATEC 2025
Estatística›Modelos lineares
Código
qg484195
Banca
FUNDATEC
Órgão
UFRGS
Ano
2025
Nível
Superior
Cargo
Estatístico
As Equações de Estimação Generalizadas (Generalized Estimating Equations – GEE) foram desenvolvidas com o objetivo de fornecer estimativas consistentes e eficientes dos parâmetros de modelos de regressão em situações em que os dados apresentam correlação. Esse método tem sido amplamente empregado em análises de dados longitudinais e outros cenários com medidas repetidas. Com base nos pressupostos e características dos modelos GEE, assinale a alternativa correta.
ANo GEE, embora as observações pertencentes a um mesmo grupo possam ser correlacionadas, assume-se independência entre as observações de grupos distintos.
BUm dos pressupostos do modelo é que a variável dependente seja quantitativa, podendo ser contínua ou discreta.
CÉ necessário assumir que os resíduos do modelo sejam normalmente distribuídos para que as estimativas sejam consistentes.
DUm dos pressupostos fundamentais das GEE, assim como nos Modelos Lineares Generalizados (GLM), é a independência dos resíduos.
EO método GEE não admite a presença de dados ausentes (missing values) ou observações atípicas (outliers).
Revelar gabarito e comentário▾
GabaritoA — No GEE, embora as observações pertencentes a um mesmo grupo possam ser correlacionadas, assume-se independência entre as observações de grupos distintos.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Equações de Estimação Generalizadas (GEE)
Gabarito: letra A. No método GEE, a estrutura de correlação é modelada apenas dentro dos clusters (grupos de observações correlacionadas, como medidas repetidas de um mesmo indivíduo), assumindo-se independência entre observações de grupos distintos — exatamente o que afirma a alternativa A. As demais alternativas distorcem os pressupostos do método: o GEE não exige normalidade dos resíduos, não exige independência dos resíduos (pelo contrário, modela a correlação) e não é um método que exija ausência de dados ausentes ou outliers.
O GEE (Generalized Estimating Equations) foi proposto por Liang e Zeger (1986) como uma extensão dos Modelos Lineares Generalizados (GLM) para dados correlacionados, especialmente dados longitudinais e medidas repetidas. A ideia central é estimar os parâmetros da regressão marginal (efeitos populacionais médios) especificando apenas a estrutura de correlação entre as observações dentro de cada cluster, sem precisar especificar completamente a distribuição conjunta dos dados. Isso torna o método robusto e flexível, pois as estimativas dos parâmetros permanecem consistentes mesmo que a estrutura de correlação especificada esteja incorreta (desde que a média marginal esteja corretamente especificada).
A principal distinção entre GEE e GLM está justamente no tratamento da correlação: enquanto o GLM assume independência das observações, o GEE foi desenvolvido para relaxar essa suposição, modelando explicitamente a correlação intra-cluster. Essa é a razão de ser do método — sem correlação, o GEE se reduziria ao GLM. A alternativa D inverte exatamente esse raciocínio, afirmando que o GEE exige independência dos resíduos, o que contraria a própria motivação do método.
A pegadinha da banca nesta questão é dupla: primeiro, confundir GEE com GLM (que realmente assume independência); segundo, atribuir ao GEE pressupostos de normalidade que pertencem a outros métodos de estimação, como a máxima verossimilhança em modelos lineares mistos. O candidato que não domina a distinção entre esses métodos tende a marcar a alternativa D, que parece plausível por associar GEE a GLM, mas é justamente o oposto do que o GEE propõe.
Distribuição de respostas por alternativa — só Corretas: 1; só Incorretas: 4; Corretas∩Incorretas: 0
Alternativa A — ✅ Correta ⟵ GABARITO
Esta alternativa descreve corretamente o pressuposto fundamental do GEE: a correlação é modelada dentro dos grupos (clusters), mas assume-se independência entre grupos distintos. Essa é a estrutura de correlação "working" (trabalho) que o método utiliza — o pesquisador especifica uma matriz de correlação intra-cluster (por exemplo, exchangeable, autoregressiva, não estruturada), e as observações de clusters diferentes são tratadas como independentes. Essa suposição é o que permite estimar os parâmetros de forma consistente mesmo com especificação incorreta da correlação, desde que a média marginal esteja correta.
Alternativa B — ❌ Incorreta
O GEE não exige que a variável dependente seja quantitativa. Pelo contrário, uma das grandes vantagens do método é justamente permitir modelar variáveis dependentes de diferentes naturezas — contínuas, discretas, binárias, de contagem — por ser uma extensão dos GLM. O GEE pode ser aplicado a dados binários (regressão logística marginal), dados de contagem (regressão de Poisson marginal), entre outros. A alternativa erra ao restringir o método a variáveis quantitativas, quando na verdade ele foi desenvolvido para generalizar justamente essa possibilidade.
Alternativa C — ❌ Incorreta
O GEE não exige normalidade dos resíduos. Na verdade, uma das principais vantagens do método é ser uma abordagem "quase-paramétrica" (quasi-likelihood), que não requer especificação completa da distribuição dos dados — apenas a média marginal e a estrutura de correlação. As estimativas dos parâmetros são consistentes mesmo sem normalidade, desde que a média marginal esteja corretamente especificada. A normalidade é um pressuposto de outros métodos, como a máxima verossimilhança em modelos lineares mistos, mas não do GEE.
Alternativa D — ❌ Incorreta
Esta alternativa inverte completamente a motivação do GEE. O método foi desenvolvido justamente para lidar com dados correlacionados, onde a independência dos resíduos não se verifica. Enquanto o GLM assume independência das observações, o GEE modela explicitamente a correlação intra-cluster. Afirmar que o GEE exige independência dos resíduos é o oposto do que o método propõe — é uma pegadinha clássica que confunde GEE com GLM. A alternativa D é a mais traiçoeira, pois o candidato que associa GEE a GLM pode ser levado a marcá-la.
Alternativa E — ❌ Incorreta
O GEE não exige ausência de dados ausentes ou outliers. Na verdade, o método é conhecido por ser robusto a certas violações de pressupostos, e a presença de dados ausentes pode ser tratada com técnicas apropriadas (como imputação ou análise de sensibilidade). Além disso, o GEE permite o uso de erros-padrão robustos (sandwich estimator), que fornecem inferências válidas mesmo quando a estrutura de correlação é especificada incorretamente ou quando há heterocedasticidade. A alternativa erra ao impor uma restrição que não existe no método.
NÃO CAIA NESSA!
A banca explora a confusão entre GEE e GLM. A alternativa D afirma que o GEE exige independência dos resíduos, o que é exatamente o oposto da motivação do método — o GEE foi criado para modelar dados correlacionados, onde a independência não se verifica. O candidato que associa GEE a GLM (que realmente assume independência) tende a marcar a D, mas é justamente a alternativa que inverte o sentido do método. Fique atento: GEE = modela correlação; GLM = assume independência. 💪
NÃO CAIA NESSA!
Para questões sobre GEE, lembre-se do mnemônico "GEE = Generaliza a Estimação para dados com Correlação". O método é uma extensão dos GLM para dados longitudinais e medidas repetidas, modelando a correlação intra-cluster. Na prova, desconfie de alternativas que atribuam ao GEE pressupostos de normalidade, independência ou restrições de tipo de variável — essas são as pegadinhas mais comuns. Compare sempre com o GLM: se a alternativa diz que o GEE exige independência, está errada.