Questão de Engenharia de Software — Inteligencia Artificial — FGV 2024
Engenharia de Software›Inteligencia Artificial
Código
fg089877
Banca
FGV
Órgão
Prefeitura de Cuiabá - MT
Ano
2024
Nível
Superior
Cargo
Auditor Fiscal Tributário da Receita Municipal - Tecnologia da Informação (Tarde)
Para a realização de análises preditivas e de agrupamento típicas de mineração de textos, os dados não estruturados textuais devem ser preparados antes de serem analisados. Este processo consiste em quatro etapas: análise lexical, eliminação de termos irrelevantes, redução da palavra ao seus radical e construção de uma representação vetorial.A etapa de análise lexical consiste na
Ageração de uma lista de termos obtidas do texto original, a partir da eliminação da pontuação e de outros caracteres que são desnecessários no contexto em que o texto será analisado.
Beliminação de artigos, pronomes, numerais, conjunções, advérbios e palavras de outras classes gramaticais do texto que são irrelevantes no processo de mineração de dados.
Cuniformização dos termos a partir da remoção dos sufixos e prefixos das palavras.
Datribuição de pesos a cada termo presente no dicionário de termos.
Eassociação de cada termo do texto a um radical da biblioteca do corpus ao qual o documento está contido.
Revelar gabarito e comentário▾
GabaritoA — geração de uma lista de termos obtidas do texto original, a partir da eliminação da pontuação e de outros caracteres que são desnecessários no contexto em que o texto será analisado.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Mineração de textos — Etapas de pré-processamento
Gabarito: letra A. A etapa de análise lexical corresponde à geração de uma lista de termos a partir do texto original, após a remoção de pontuação e caracteres desnecessários. As demais alternativas descrevem etapas posteriores (eliminação de stopwords, stemming, ponderação), confundindo o conceito.
O processo de preparação de dados textuais para mineração segue normalmente quatro etapas sequenciais:
Análise lexical (tokenização + limpeza básica)
Eliminação de termos irrelevantes (remoção de stopwords)
Redução ao radical (stemming)
Construção de representação vetorial (com pesos como TF-IDF)
1Análise lexical (tokenização + limpeza)
2Eliminação de stopwords
3Redução ao radical (stemming)
4Representação vetorial (TF-IDF)
LEVEL · soulevel.com.br
Alternativa A — ✅ Correta ⟵ GABARITO
Descreve exatamente a análise lexical: a partir do texto original, gera-se uma lista de termos eliminando pontuação e caracteres desnecessários. Esse é o primeiro passo, conhecido como tokenização e limpeza.
Alternativa B — ❌ Incorreta
Refere-se à eliminação de artigos, pronomes, numerais, etc. — isso é a etapa de eliminação de termos irrelevantes (stopwords removal), que ocorre após a análise lexical.
Alternativa C — ❌ Incorreta
Fala em remoção de sufixos e prefixos — corresponde à etapa de redução ao radical (stemming), que é a terceira etapa, posterior à eliminação de stopwords.
Alternativa D — ❌ Incorreta
Atribuição de pesos a termos no dicionário é a etapa de ponderação, parte da construção da representação vetorial (quarta etapa), não da análise lexical.
Alternativa E — ❌ Incorreta
Associa cada termo a um radical — novamente descreve a etapa de stemming, que não é a análise lexical.
Dica: Para memorizar a ordem, pense: 1) tokenizar/limpar, 2) remover palavras comuns, 3) reduzir ao radical, 4) criar vetores com pesos. Cada alternativa errada troca uma etapa por outra.