Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — FGV 2024

Engenharia de SoftwareInteligencia Artificial
Código
fg099059
Banca
FGV
Órgão
TJ-MT
Ano
2024
Nível
Superior
Cargo
Analista Judiciário - Tecnologia da Informação
O Processamento de Linguagem Natural (PLN) é uma subárea da inteligência artificial focada em permitir que máquinas compreendam, interpretem, gerem e respondam à linguagem humana de maneira natural e significativa. O objetivo do PLN é fazer com que sistemas computacionais realizem tarefas que envolvem a linguagem humana, como leitura, escrita e interpretação de forma semelhante à forma como os humanos processam o idioma.Em Processamento de Linguagem Natural (PLN), a tokenização
  1. Aé a técnica que remove todas as palavras de um texto que não são substantivos, para focar apenas em entidades.
  2. Bconsiste em dividir o texto em unidades menores, como palavras ou subpalavras, para facilitar o processamento do texto por modelos de PLN.
  3. Cé o processo de sintetizar novas palavras com base em um modelo probabilístico, permitindo a expansão do vocabulário.
  4. Dé a técnica que converte palavras em números aleatórios para evitar vieses durante a análise textual.
  5. Eé o processo de combinar palavras em frases inteiras para entender o contexto completo de um texto.
Revelar gabarito e comentário

GabaritoB — consiste em dividir o texto em unidades menores, como palavras ou subpalavras, para facilitar o processamento do texto por modelos de PLN.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Tokenização no Processamento de Linguagem Natural (PLN)

Gabarito: letra B. Tokenização é o processo de dividir o texto em unidades menores (tokens), como palavras ou subpalavras, facilitando o processamento por modelos de PLN. Essa definição está alinhada com o conceito fundamental da área.

A questão testa o conhecimento básico sobre tokenização, uma etapa essencial no pré-processamento de texto. Vamos analisar cada alternativa:

Tokenização (PLN)
  • 1Definição
    • Divisão do texto em unidades menores
    • Tokens: palavras ou subpalavras
    • Etapa de pré-processamento
  • 2O que NÃO é
    • Remoção de classes gramaticais (A)
    • Síntese de novas palavras (C)
    • Conversão em números aleatórios (D)
    • Combinação em frases (E)
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

Afirma que a tokenização remove todas as palavras que não são substantivos. Isso não é verdade: tokenização apenas segmenta o texto, não seleciona classes gramaticais. O erro é confundir tokenização com uma etapa de filtragem por tipo de palavra.

Alternativa B — ✅ Correta ⟵ GABARITO

Descreve corretamente a tokenização como a divisão do texto em unidades menores (palavras, subpalavras) para processamento. É exatamente a definição adotada em PLN.

Alternativa C — ❌ Incorreta

Apresenta a tokenização como síntese de novas palavras a partir de modelo probabilístico. Essa é uma confusão com técnicas de geração de linguagem natural, não com tokenização.

Alternativa D — ❌ Incorreta

Diz que tokenização converte palavras em números aleatórios. Na verdade, a conversão para representações numéricas (como embeddings) é uma etapa distinta; tokenização apenas cria os tokens, não os randomiza.

Alternativa E — ❌ Incorreta

Afirma que tokenização combina palavras em frases. Isso é o oposto: tokenização divide, não combina. A combinação é feita em etapas posteriores (parsing, geração).

Concluindo: a única alternativa que define corretamente tokenização é a letra B.

Link permanente: /questoes/fg099059