Questão de Estatística — Cálculo de Probabilidades — CESPE / CEBRASPE 2024
Estatística›Cálculo de Probabilidades
Código
ce167053
Banca
CESPE / CEBRASPE
Órgão
ANATEL
Ano
2024
Nível
Superior
Cargo
Especialista em Regulação de Serviços Públicos de Telecomunicações – Especialidade: Ciências de Dados
Julgue o próximo item, relativo a Naive Bayes e random forest.Random forest é um algoritmo de classificação que permite a realização de mineração dos dados por meio da criação de estruturas de aprendizagem a partir de uma base de dados na qual se utiliza uma única árvore de decisão para a classificação dos dados.
CCerto
EErrado
Revelar gabarito e comentário▾
GabaritoE — Errado
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Random Forest: conceito e funcionamento
❌ ERRADO. A afirmativa está incorreta porque random forest não utiliza uma única árvore de decisão, mas sim um conjunto (ensemble) de muitas árvores construídas a partir de amostras bootstrap dos dados e de subconjuntos aleatórios de variáveis. O erro está exatamente na expressão "uma única árvore de decisão" — o que define o algoritmo é justamente a combinação de múltiplas árvores para melhorar a precisão e reduzir o overfitting.
O random forest é um método de aprendizado de máquina supervisionado, usado tanto para classificação quanto para regressão. Ele pertence à família dos métodos de ensemble (ou comitê), que combinam vários modelos base para obter um modelo final mais robusto. No caso específico do random forest, os modelos base são árvores de decisão, mas cada árvore é treinada em uma amostra aleatória com reposição (bootstrap) e, a cada divisão, considera apenas um subconjunto aleatório das variáveis preditoras. A previsão final é feita por votação majoritária (classificação) ou pela média das previsões (regressão).
A distinção crucial que a banca explora é entre árvore de decisão única e floresta aleatória. Uma árvore de decisão é um modelo simples, que particiona o espaço de atributos em regiões por meio de testes sucessivos. Já o random forest é um conjunto de muitas árvores, cada uma ligeiramente diferente das demais devido à aleatoriedade introduzida no treinamento. Essa diversidade é o que torna o método mais estável e com melhor capacidade de generalização do que uma única árvore.
A pegadinha aqui é clássica: o candidato que conhece apenas o nome "random forest" pode associá-lo a uma árvore de decisão, mas o termo "forest" (floresta) já indica a ideia de múltiplas árvores. A banca inverte o conceito ao afirmar que se utiliza "uma única árvore de decisão", quando na verdade o algoritmo constrói centenas ou milhares de árvores.
Random Forest vs Árvore Única — só Random Forest: muitas árvores; só Árvore Única: modelo simples; Random Forest∩Árvore Única: árvores de decisão
NÃO CAIA NESSA!
A banca troca o conceito de random forest (que é um conjunto de muitas árvores) por uma única árvore de decisão. O nome "floresta" já entrega a ideia de múltiplas árvores — se a alternativa diz "uma única árvore", está errada. Fique atento a essa inversão, que é recorrente em provas de estatística e machine learning.