Questão de Engenharia de Software — Inteligencia Artificial — FGV 2024
Engenharia de Software›Inteligencia Artificial
Código
fg099059
Banca
FGV
Órgão
TJ-MT
Ano
2024
Nível
Superior
Cargo
Analista Judiciário - Tecnologia da Informação
O Processamento de Linguagem Natural (PLN) é uma subárea da inteligência artificial focada em permitir que máquinas compreendam, interpretem, gerem e respondam à linguagem humana de maneira natural e significativa. O objetivo do PLN é fazer com que sistemas computacionais realizem tarefas que envolvem a linguagem humana, como leitura, escrita e interpretação de forma semelhante à forma como os humanos processam o idioma.Em Processamento de Linguagem Natural (PLN), a tokenização
Aé a técnica que remove todas as palavras de um texto que não são substantivos, para focar apenas em entidades.
Bconsiste em dividir o texto em unidades menores, como palavras ou subpalavras, para facilitar o processamento do texto por modelos de PLN.
Cé o processo de sintetizar novas palavras com base em um modelo probabilístico, permitindo a expansão do vocabulário.
Dé a técnica que converte palavras em números aleatórios para evitar vieses durante a análise textual.
Eé o processo de combinar palavras em frases inteiras para entender o contexto completo de um texto.
Revelar gabarito e comentário▾
GabaritoB — consiste em dividir o texto em unidades menores, como palavras ou subpalavras, para facilitar o processamento do texto por modelos de PLN.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Tokenização no Processamento de Linguagem Natural (PLN)
Gabarito: letra B. Tokenização é o processo de dividir o texto em unidades menores (tokens), como palavras ou subpalavras, facilitando o processamento por modelos de PLN. Essa definição está alinhada com o conceito fundamental da área.
A questão testa o conhecimento básico sobre tokenização, uma etapa essencial no pré-processamento de texto. Vamos analisar cada alternativa:
Tokenização (PLN)
1Definição
Divisão do texto em unidades menores
Tokens: palavras ou subpalavras
Etapa de pré-processamento
2O que NÃO é
Remoção de classes gramaticais (A)
Síntese de novas palavras (C)
Conversão em números aleatórios (D)
Combinação em frases (E)
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
Afirma que a tokenização remove todas as palavras que não são substantivos. Isso não é verdade: tokenização apenas segmenta o texto, não seleciona classes gramaticais. O erro é confundir tokenização com uma etapa de filtragem por tipo de palavra.
Alternativa B — ✅ Correta ⟵ GABARITO
Descreve corretamente a tokenização como a divisão do texto em unidades menores (palavras, subpalavras) para processamento. É exatamente a definição adotada em PLN.
Alternativa C — ❌ Incorreta
Apresenta a tokenização como síntese de novas palavras a partir de modelo probabilístico. Essa é uma confusão com técnicas de geração de linguagem natural, não com tokenização.
Alternativa D — ❌ Incorreta
Diz que tokenização converte palavras em números aleatórios. Na verdade, a conversão para representações numéricas (como embeddings) é uma etapa distinta; tokenização apenas cria os tokens, não os randomiza.
Alternativa E — ❌ Incorreta
Afirma que tokenização combina palavras em frases. Isso é o oposto: tokenização divide, não combina. A combinação é feita em etapas posteriores (parsing, geração).
Concluindo: a única alternativa que define corretamente tokenização é a letra B.