Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — CESPE / CEBRASPE 2025

Engenharia de SoftwareInteligencia Artificial
Código
ce215083
Banca
CESPE / CEBRASPE
Órgão
STM
Ano
2025
Nível
Superior
Cargo
Analista Judiciário - Área: Apoio Especializado - Especialidade: Análise de Sistemas
Modelos de linguagem de grande escala, como os do tipo transformer, são treinados exclusivamente com base em regras sintáticas explícitas extraídas de dados linguísticos anotados manualmente, o que assegura maior controle semântico.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoE — Errado

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Grandes Modelos de Linguagem (LLMs) e seu treinamento

Gabarito: ERRADO. A afirmação está incorreta porque modelos de linguagem de grande escala, especialmente os baseados em arquitetura transformer, não são treinados com regras sintáticas explícitas nem com dados anotados manualmente. Eles aprendem padrões estatísticos a partir de grandes volumes de texto não anotado, por meio de tarefas como previsão da próxima palavra (modelos decoder-only) ou preenchimento de lacunas (modelos encoder-only).

A banca testa o conhecimento sobre como LLMs são realmente treinados. Muitos candidatos confundem o processo com abordagens simbólicas ou baseadas em regras, mas o paradigma atual é o aprendizado não supervisionado em larga escala.

Treinamento de LLMs (Transformer)
  • 1Dados
    • Não anotados manualmente
    • Corpora massivos da internet
  • 2Método
    • Não usa regras sintáticas explícitas
    • Aprendizado estatístico
    • Tarefas auto-supervisionadas
      • Previsão da próxima palavra
      • Preenchimento de lacunas
  • 3Arquitetura
    • Mecanismo de atenção
    • Padrões contextuais
LEVEL · soulevel.com.br

Análise do item

O item afirma que o treinamento é "exclusivamente com base em regras sintáticas explícitas extraídas de dados linguísticos anotados manualmente". Isso é falso por vários motivos:

  • Dados não anotados: LLMs como GPT, BERT e seus sucessores são treinados em corpora massivos coletados da internet, sem anotação manual. O conteúdo de apoio menciona que "os LLMs podem imitar com precisão os padrões da linguagem natural porque são treinados em coleções de texto escrito por humanos" — ou seja, o texto é usado como está, não anotado.

  • Aprendizado estatístico, não regras explícitas: O treinamento consiste em aprender distribuições probabilísticas de tokens, não regras gramaticais explícitas. A arquitetura transformer usa mecanismos de atenção para capturar relações contextuais, mas isso é diferente de regras sintáticas predefinidas.

  • Exclusividade: O termo "exclusivamente" é problemático, pois mesmo técnicas de fine-tuning ou aprendizado por reforço (RLHF) não envolvem regras sintáticas explícitas. O treinamento principal é não supervisionado.

NÃO CAIA NESSA!

A banca tenta confundir ao sugerir que LLMs funcionam como sistemas baseados em regras ou gramáticas formais. Na realidade, eles aprendem padrões de forma estatística e auto-supervisionada, sem necessidade de anotação manual. O termo "maior controle semântico" também é enganoso, pois LLMs não têm garantia de semântica; eles geram texto com base em probabilidades.

Portanto, a assertiva é ERRADA.

Gabarito: ERRADO.

Link permanente: /questoes/ce215083