Questão de Algoritmos e Estrutura de Dados — Algoritmos — NC-UFPR 2018
Algoritmos e Estrutura de Dados›Algoritmos
Código
qq383985
Banca
NC-UFPR
Órgão
ITAIPU BINACIONAL
Ano
2018
Nível
Superior
Em sistemas de Recuperação de Informação, os termos de indexação podem ser extraídos diretamente do texto dos documentos, fornecendo uma visão lógica dos documentos. Assinale a alternativa que apresenta corretamente uma das operações realizadas para obter as palavras-chaves.
ANo processo de reconhecimento da estrutura, ocorre a análise léxica e a remoção de palavras sem semântica associada.
BO processo de quebra do texto em palavras (tokenização) é dependente da stoplist, um dicionário próprio aplicado à separação das palavras.
CA classificação de grupos nominais visa a identificação dos verbos e remoção das demais palavras, através de listas de palavras, etiquetadores automáticos e um thesaurus da língua ou do domínio.
DAcentos, espaçamento e demais símbolos são delimitadores considerados naturais no processo de stemming.
EO processo de stemming consiste em remover os afixos, preservando o radical e possibilitando o casamento entre variações de uma mesma palavra.
Revelar gabarito e comentário▾
GabaritoE — O processo de stemming consiste em remover os afixos, preservando o radical e possibilitando o casamento entre variações de uma mesma palavra.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Recuperação de Informação: Operações de Pré-processamento
Gabarito: letra E. O processo de stemming realmente consiste em remover afixos (prefixos e sufixos) para obter o radical, permitindo que variações de uma mesma palavra (ex.: "correr", "correu", "correria") sejam agrupadas na indexação. Essa definição é a correta e corresponde ao que a banca considera.
As demais alternativas trazem confusões entre as etapas de preparação do texto para indexação. Vejamos cada uma:
1Tokenização (quebra em tokens)
2Remoção de stopwords (filtro)
3Stemming (redução ao radical)
4Classificação gramatical (opcional)
LEVEL · soulevel.com.br
Alternativa A — ❌ Incorreta
Afirma que o "reconhecimento da estrutura" envolve análise léxica e remoção de palavras sem semântica. Na verdade, o reconhecimento da estrutura (parsing) faz análise sintática, não semântica; a remoção de palavras sem carga semântica (stopwords) é uma etapa posterior, feita com base em listas de palavras vazias.
Alternativa B — ❌ Incorreta
Diz que a tokenização depende da stoplist. A tokenização é a simples quebra do texto em tokens (palavras, pontuação) e não depende de nenhum dicionário; a stoplist é usada após a tokenização para filtrar tokens irrelevantes.
Alternativa C — ❌ Incorreta
A classificação de grupos nominais (chunking) identifica sintagmas nominais, e não verbos. Além disso, seu objetivo é agrupar palavras em constituintes, não remover palavras.
Alternativa D — ❌ Incorreta
Acentos, espaçamento e símbolos são delimitadores na tokenização, não no stemming. O stemming opera sobre palavras já tokenizadas, ignorando delimitação.
Alternativa E — ✅ Correta ⟵ GABARITO
Definição perfeita de stemming: redução ao radical (ou raiz) removendo afixos. Isso permite que palavras com a mesma raiz sejam indexadas sob o mesmo termo, melhorando a recuperação.
NÃO CAIA NESSA!
A banca mistura as etapas do pré-processamento: tokenização, remoção de stopwords, stemming e classificação gramatical. Em muitas questões, o candidato confunde stemming com tokenização ou com remoção de stopwords. Lembre-se: stemming é sobre radical, não sobre separação de palavras.