Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — FGV 2026

Engenharia de SoftwareInteligencia Artificial
Código
fg126966
Banca
FGV
Órgão
AL-RO
Ano
2026
Nível
Superior
Cargo
Analista Legislativo (Engenharia de Computação)
Uma equipe de Engenharia de Computação está pré-processando textos de relatórios de falhas de software para análise automática de tendências em processamento de linguagem natural. O primeiro passo no pré-processamento é dividir a frase em unidades menores para que o modelo possa analisá-las individualmente.O processo inicial de PLN que consiste em dividir uma sequência de texto em unidades menores, como palavras, subpalavras ou sentenças é o(a)
  1. AStemming.
  2. BLemmatization.
  3. CNormalização.
  4. DClassificação de Texto.
  5. ETokenização.
Revelar gabarito e comentário

GabaritoE — Tokenização.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Tokenização em PLN

Gabarito: letra E. Tokenização é o processo de segmentação do texto em unidades menores, chamadas tokens, que podem ser palavras, subpalavras ou sentenças. É a etapa inicial e fundamental do pré-processamento em Processamento de Linguagem Natural (PLN).

A questão cobra o conhecimento dos conceitos básicos de PLN. Vamos analisar cada alternativa:

Alternativa A — ❌ Incorreta

Stemming é o processo de reduzir palavras à sua raiz (radical), por exemplo, "correndo" → "corr". Não é a divisão do texto em unidades, mas sim uma redução morfológica.

Alternativa B — ❌ Incorreta

Lemmatization (lematização) é similar ao stemming, porém considera o contexto e reduz a palavra ao seu lema (forma canônica), como "correndo" → "correr". Também não é a etapa de segmentação.

Alternativa C — ❌ Incorreta

Normalização abrange várias transformações, como converter para minúsculas, remover acentos, etc. É uma etapa que pode vir após a tokenização, mas não é a divisão em si.

Alternativa D — ❌ Incorreta

Classificação de Texto é uma tarefa de PLN que atribui categorias a textos (ex: spam ou não). É uma etapa posterior, que depende de pré-processamento.

Alternativa E — ✅ Correta ⟵ GABARITO

Tokenização é exatamente o processo descrito: dividir o texto em tokens (palavras, subpalavras, sentenças). É o primeiro passo no pipeline de PLN.

PEGA ESSA DICA!

Lembre-se da ordem típica do pré-processamento: tokenização → normalização → stemming/lematização → remoção de stopwords. A tokenização é sempre o primeiro passo.

Gabarito: letra E

Link permanente: /questoes/fg126966