Questão de Engenharia de Software — Inteligencia Artificial — FGV 2026
Engenharia de Software›Inteligencia Artificial
Código
fg126966
Banca
FGV
Órgão
AL-RO
Ano
2026
Nível
Superior
Cargo
Analista Legislativo (Engenharia de Computação)
Uma equipe de Engenharia de Computação está pré-processando textos de relatórios de falhas de software para análise automática de tendências em processamento de linguagem natural. O primeiro passo no pré-processamento é dividir a frase em unidades menores para que o modelo possa analisá-las individualmente.O processo inicial de PLN que consiste em dividir uma sequência de texto em unidades menores, como palavras, subpalavras ou sentenças é o(a)
AStemming.
BLemmatization.
CNormalização.
DClassificação de Texto.
ETokenização.
Revelar gabarito e comentário▾
GabaritoE — Tokenização.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Tokenização em PLN
Gabarito: letra E. Tokenização é o processo de segmentação do texto em unidades menores, chamadas tokens, que podem ser palavras, subpalavras ou sentenças. É a etapa inicial e fundamental do pré-processamento em Processamento de Linguagem Natural (PLN).
A questão cobra o conhecimento dos conceitos básicos de PLN. Vamos analisar cada alternativa:
Alternativa A — ❌ Incorreta
Stemming é o processo de reduzir palavras à sua raiz (radical), por exemplo, "correndo" → "corr". Não é a divisão do texto em unidades, mas sim uma redução morfológica.
Alternativa B — ❌ Incorreta
Lemmatization (lematização) é similar ao stemming, porém considera o contexto e reduz a palavra ao seu lema (forma canônica), como "correndo" → "correr". Também não é a etapa de segmentação.
Alternativa C — ❌ Incorreta
Normalização abrange várias transformações, como converter para minúsculas, remover acentos, etc. É uma etapa que pode vir após a tokenização, mas não é a divisão em si.
Alternativa D — ❌ Incorreta
Classificação de Texto é uma tarefa de PLN que atribui categorias a textos (ex: spam ou não). É uma etapa posterior, que depende de pré-processamento.
Alternativa E — ✅ Correta ⟵ GABARITO
Tokenização é exatamente o processo descrito: dividir o texto em tokens (palavras, subpalavras, sentenças). É o primeiro passo no pipeline de PLN.
PEGA ESSA DICA!
Lembre-se da ordem típica do pré-processamento: tokenização → normalização → stemming/lematização → remoção de stopwords. A tokenização é sempre o primeiro passo.