Questão de Noções de Informática — Inteligência Artificial e Automação — CESPE / CEBRASPE 2026
Noções de Informática›Inteligência Artificial e Automação
Código
ce227868
Banca
CESPE / CEBRASPE
Órgão
SEFAZ-PR
Ano
2026
Nível
Médio
Cargo
Agente Fazendário Estadual - Função: Profissional de Tecnologia da Informação
Suponha que uma secretaria de fazenda pretenda empregar técnicas de processamento de linguagem natural (PLN) para automatizar a análise de justificativas textuais apresentadas por contribuintes em processos administrativos fiscais, buscando identificar padrões de argumentação e indícios de inconsistências. Nesse caso, a abordagem mais adequada para capturar relações semânticas contextuais em textos extensos e gerar representações vetoriais de alta qualidade para classificação automatizada é
Aaplicar técnicas de topic modeling não supervisionado (como LDA – latent Dirichlet allocation), uma vez que esse método é voltado exclusivamente para compreensão contextual e desambiguação semântica em textos individuais.
Baplicar modelos baseados em bag-of-words com vetores esparsos e frequência de termos ponderada por TF-IDF, suficientes para captar relações sintáticas e semânticas profundas entre palavras.
Cimplementar modelos Word2Vec baseados apenas em coocorrência estática de palavras, que mantêm a mesma representação vetorial independentemente do contexto semântico.
Dempregar algoritmos de análise sintática tradicional, como part-of-speech tagging e stemming, sem incorporar aprendizado profundo, por esses algoritmos serem suficientes para detectar relações semânticas complexas.
Eutilizar embeddings pré-treinados com modelos de linguagem contextualizados, como BERT ou suas variantes, capazes de representar o significado de uma palavra de acordo com o contexto em que ocorre.
Revelar gabarito e comentário▾
GabaritoE — utilizar embeddings pré-treinados com modelos de linguagem contextualizados, como BERT ou suas variantes, capazes de representar o significado de uma palavra de acordo com o contexto em que ocorre.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Processamento de Linguagem Natural (PLN) e Abordagens para Classificação de Texto
Gabarito: letra E. A abordagem mais adequada para capturar relações semânticas contextuais em textos extensos é utilizar embeddings pré-treinados com modelos de linguagem contextualizados, como o BERT (Bidirectional Encoder Representations from Transformers). Esses modelos geram representações vetoriais que variam conforme o contexto em que a palavra aparece, permitindo capturar nuances semânticas e melhorar a classificação automatizada.
A questão cobra a diferença entre abordagens tradicionais e modernas de PLN. Abaixo, analisa-se cada alternativa.
Abordagem
Característica Principal
Captura Relações Semânticas Contextuais?
Gera Representações Vetoriais de Alta Qualidade para Classificação?
Adequada para Textos Extensos?
Topic Modeling (LDA)
Modelo não supervisionado que descobre tópicos latentes em coleções de documentos
Não (cada palavra tem representação única, não contextual)
Não (focado em distribuição de tópicos, não em classificação de textos individuais)
Sim (para coleções)
Bag-of-Words com TF-IDF
Vetores esparsos baseados em frequência de termos, ignorando ordem e contexto
Não (vetores fixos por palavra, sem semântica contextual)
Parcial (útil para tarefas simples, mas limitado para nuances semânticas)
Sim (mas com perda de informação semântica)
Word2Vec (estático)
Embeddings baseados em coocorrência, com um vetor fixo por palavra
Não (mesma representação independente do contexto)
Parcial (bom para similaridade lexical, mas não para desambiguação contextual)
Sim (mas limitado para textos longos e complexos)
Análise Sintática Tradicional (POS tagging, stemming)
Técnicas de processamento superficial sem aprendizado profundo
Não (foco em estrutura gramatical, não em semântica profunda)
Não (não gera representações vetoriais densas para classificação)
Sim (mas insuficiente para semântica complexa)
Embeddings Contextualizados (BERT)
Modelos de linguagem pré-treinados que geram vetores dependentes do contexto
Sim (representação varia conforme o contexto da palavra)
Sim (alta qualidade para classificação automatizada)
Sim (arquitetura Transformer adequada para textos longos)
Alternativa A — ❌ Incorreta
Afirma que o LDA (Latent Dirichlet Allocation) é um método voltado "exclusivamente para compreensão contextual e desambiguação semântica em textos individuais". Embora o LDA seja um modelo de tópicos não supervisionado que agrupa palavras em tópicos, ele não captura relações semânticas contextuais palavra a palavra – ele modela a distribuição de tópicos em documentos, mas cada palavra tem uma única representação (não contextual). Além disso, o LDA não é projetado para gerar representações vetoriais de alta qualidade para classificação de textos individuais (ele serve para descobrir tópicos latentes em coleções). Portanto, a afirmativa está errada.
Alternativa B — ❌ Incorreta
Afirma que bag-of-words com TF-IDF são "suficientes para captar relações sintáticas e semânticas profundas entre palavras". Na verdade, o modelo bag-of-words ignora a ordem das palavras e o contexto, gerando vetores esparsos que representam apenas a frequência dos termos. O TF-IDF pondera a importância dos termos no corpus, mas ainda assim cada palavra tem um vetor fixo, sem capturar semântica contextual. Relações sintáticas e semânticas profundas exigem modelos que considerem a sequência e o contexto, como redes neurais.
Alternativa C — ❌ Incorreta
Afirma que Word2Vec baseado apenas em coocorrência estática de palavras mantém a mesma representação vetorial independentemente do contexto. Exato: Word2Vec gera um vetor por palavra (embeddings estáticos), que não se adapta ao contexto em que a palavra aparece. Por exemplo, a palavra "banco" terá o mesmo vetor em "banco de dados" e "banco do parque". Para capturar semântica contextual, é necessário modelos como ELMo, BERT ou GPT, que produzem embeddings dinâmicos.
Alternativa D — ❌ Incorreta
Afirma que algoritmos de análise sintática tradicional (POS tagging, stemming) são suficientes para detectar relações semânticas complexas. Essas técnicas lidam com a estrutura da frase e redução de palavras ao radical, mas não extraem significado semântico contextual. Relações semânticas complexas, como polissemia e inferência, exigem modelos de aprendizado profundo que operam em nível de sentido.
Alternativa E — ✅ Correta ⟵ GABARITO
Modelos como BERT (e suas variantes: RoBERTa, DistilBERT, etc.) são treinados em grandes corpora de forma não supervisionada (e.g., masked language modeling) e geram representações vetoriais contextuais: o vetor de uma palavra depende de todas as palavras ao redor. Isso permite capturar relações semânticas contextuais em textos extensos e produzir embeddings de alta qualidade para tarefas de classificação automatizada. É a abordagem mais adequada para o problema descrito.
NÃO CAIA NESSA!
A banca explora a confusão entre abordagens tradicionais (LDA, TF-IDF, Word2Vec estático) e modelos contextuais (BERT). O candidato pode achar que LDA ou TF-IDF resolvem o problema, mas eles não capturam semântica contextual – apenas frequência ou tópicos. A chave é lembrar que a frase pede "capturar relações semânticas contextuais" – isso só é possível com modelos que consideram o contexto, como BERT. Lembre-se: embeddings estáticos = um vetor por palavra; embeddings contextuais = vetor variável conforme o contexto.