Pular para o conteúdo principal

Questão de Sistemas de Informação — Sistemas de Informação — FUVEST 2025

Sistemas de InformaçãoSistemas de Informação
Código
qg502442
Banca
FUVEST
Órgão
USP
Ano
2025
Nível
Superior
Cargo
Analista de Sistemas
Uma plataforma de e-commerce deseja analisar automaticamente as avaliações deixadas pelos clientes nos produtos para determinar se são positivas ou negativas. Para isso, a equipe de ciência de dados está treinando um modelo de aprendizado de máquina para análise de sentimentos.Dado que as avaliações são textos não estruturados, a equipe experimentou diferentes métodos de representação vetorial para transformar os textos em formatos que o modelo pode processar. Após testar diferentes abordagens, eles obtiveram os seguintes resultados em um modelo de classificação de sentimentos:Imagem associada para resolução da questãoCom base nos resultados apresentados, assinale a alternativa que descreve a melhor escolha de representação vetorial para este problema e sua justificativa.
  1. ABag of Words é a melhor escolha, pois obteve a maior acurácia nos dados de treinamento, garantindo que o modelo tenha aprendido melhor os padrões do conjunto de dados.
  2. BTF-IDF é superior às outras técnicas, pois atribui pesos mais altos às palavras raras e, por isso, obteve um pequeno ganho de acurácia nos dados de teste em comparação ao BoW.
  3. CWord2Vec (CBOW) é inferior ao BoW e ao TF-IDF, pois não captura bem as características estatísticas das palavras, o que resulta em modelos menos precisos para tarefas de classificação de sentimentos.
  4. DBag of Words e Word2Vec devem ser combinados para obter um modelo híbrido, pois BoW traz alta acurácia e Word2Vec melhora a generalização, compensando as fraquezas de cada abordagem.
  5. EBERT (Transformers) é a melhor escolha, pois teve desempenho mais equilibrado entre os dados de treinamento e teste, indicando que o modelo não está sofrendo de sobreajuste e captura melhor o contexto do texto.
Revelar gabarito e comentário

GabaritoE — BERT (Transformers) é a melhor escolha, pois teve desempenho mais equilibrado entre os dados de treinamento e teste, indicando que o modelo não está sofrendo de sobreajuste e captura melhor o contexto do texto.

Link permanente: /questoes/qg502442