Pular para o conteúdo principal

Questão de Noções de Informática — Banco de Dados — CESPE / CEBRASPE 2026

Noções de InformáticaBanco de Dados
Código
ce227896
Banca
CESPE / CEBRASPE
Órgão
SEFAZ-RN
Ano
2026
Nível
Superior
Cargo
Auditor Fiscal de Receitas Estaduais - conhecimentos complementares
Uma secretaria de fazenda estadual recebe diariamente milhões de notas fiscais eletrônicas (NF-e). Um desafio central da fiscalização é validar se a descrição textual dos itens comercializados é condizente com o código NCM (nomenclatura comum do Mercosul) declarado. Para automatizar essa classificação semântica em larga escala, utiliza-se processamento de linguagem natural (PLN) e redes neurais.Assinale a opção em que são apresentadas a técnica adequada para esse cenário e sua descrição.
  1. ALemmatization — método de agrupamento não supervisionado (clustering) que organiza descrições de mercadorias por similaridade, prescindindo de rótulos de treinamento para a classificação fiscal
  2. Bstemming — técnica de redução morfológica que mapeia palavras para vetores numéricos densos, preservando a semântica contextual completa do item fiscal
  3. Cword embeddings — representações vetoriais de palavras em um espaço contínuo, em que termos semanticamente semelhantes são projetados em posições próximas (baixa distância vetorial), facilitando a identificação de sinônimos na descrição dos produtos
  4. Darquiteturas transformer — modelos baseados no mecanismo de atenção (attention), capazes de capturar dependências contextuais e relações de longo alcance entre os termos de uma descrição, sendo altamente eficazes para a tarefa de classificação de texto e compatibilização com a NCM
  5. Etokenização — processo de detecção de anomalias sintáticas que substitui a necessidade de modelos preditivos ao identificar erros de digitação em documentos fiscais
Revelar gabarito e comentário

GabaritoD — arquiteturas transformer — modelos baseados no mecanismo de atenção (attention), capazes de capturar dependências contextuais e relações de longo alcance entre os termos de uma descrição, sendo altamente eficazes para a tarefa de classificação de texto e compatibilização com a NCM

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Classificação de texto com PLN para NCM

Gabarito: letra D. A arquitetura Transformer, baseada no mecanismo de atenção (attention), é a técnica mais adequada para classificação semântica de descrições de produtos em larga escala, pois captura dependências contextuais e relações de longo alcance, permitindo mapear as descrições para os códigos NCM com alta eficácia.

As demais alternativas apresentam técnicas que, embora sejam utilizadas em PLN, não são as mais indicadas ou têm descrições incorretas:

Alternativa A — ❌ Incorreta

Lemmatization é um processo de normalização morfológica (reduzir palavras à sua forma canônica), não um método de agrupamento não supervisionado. Clustering é outra técnica; lematização é uma etapa de pré-processamento, não resolve a classificação.

Alternativa B — ❌ Incorreta

Stemming também é redução morfológica, mas não produz vetores numéricos densos. Quem mapeia palavras para vetores densos são os word embeddings. A descrição mistura conceitos.

Alternativa C — ❌ Incorreta (embora a descrição de word embeddings esteja correta)

De fato, word embeddings geram representações vetoriais onde palavras semânticamente próximas ficam em pontos próximos. Contudo, para classificar a descrição completa do item (uma sequência de palavras), apenas embeddings não são suficientes; é preciso um modelo que processe a sequência inteira. O Transformer é superior por capturar o contexto global.

Alternativa D — ✅ Correta ⟵ GABARITO

Os Transformers, como o BERT, usam atenção para ponderar a importância de cada palavra em relação às demais, modelando dependências longas. São o estado da arte em classificação de texto e perfeitamente adequados para compatibilizar descrições de NF-e com códigos NCM.

Alternativa E — ❌ Incorreta

Tokenização é apenas a quebra do texto em tokens (palavras, pontuações). Não é um modelo preditivo nem detecta anomalias sintáticas; é uma etapa básica de pré-processamento.

PEGA ESSA DICA!

Para questões de PLN em concursos, lembre-se: tokenização, stemming, lematização são pré-processamento; word embeddings são representações; Transformers são modelos completos de sequência. A tendência é que a banca cobre os modelos mais modernos quando o cenário envolve classificação de texto em larga escala.

Link permanente: /questoes/ce227896