Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — FGV 2023

Engenharia de SoftwareInteligencia Artificial
Código
fg061598
Banca
FGV
Órgão
Câmara dos Deputados
Ano
2023
Nível
Superior
Cargo
Analista Legislativo - Informática Legislativa - Tarde
A evolução das redes neurais impulsionou significativamente o avanço da inteligência artificial, resultando em arquiteturas inovadoras.Entre elas, uma se sobressai por sua habilidade em gerenciar sequências de tamanho variável, eficiência em treinamentos com grandes volumes de dados e pela implementação do mecanismo de atenção, o que possibilita uma análise ponderada e dinâmica das entradas.Essa arquitetura é denominada.
  1. ATransformer.
  2. BRede Neural Convolucional (CNN).
  3. CPerceptron Multicamadas (MLP).
  4. DRede Neural Recorrente (RNN).
  5. ERede Neural de Memória Longa de Curto Prazo (LSTM).
Revelar gabarito e comentário

GabaritoA — Transformer.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Arquiteturas de Redes Neurais

Gabarito: letra A. O Transformer é a arquitetura que se destaca por gerenciar sequências de tamanho variável, ser eficiente no treinamento com grandes volumes de dados e implementar o mecanismo de atenção, que permite uma análise ponderada e dinâmica das entradas. Essas características são a essência do Transformer, base dos LLMs atuais.

A banca testa o conhecimento das principais arquiteturas de redes neurais e suas aplicações. O enunciado descreve exatamente o Transformer: capacidade de lidar com sequências (tamanho variável), eficiência em escala (paralelização) e o mecanismo de atenção (diferencial em relação a RNNs/LSTMs).

Arquiteturas de redes neurais
  • 1Sequências de tamanho variável
    • RNN (recorrente)
      • Gradiente desaparece/explode
      • Difícil paralelizar
    • LSTM (memória longa)
      • Melhora gradiente
      • Ainda sequencial
    • Transformer
      • Atenção multi-cabeça
      • Paralelização total
      • Escalável
  • 2Dados espaciais (imagens)
    • CNN (convolucional)
  • 3Dados tabulares
    • MLP (perceptron multicamadas)
LEVEL · soulevel.com.br

Alternativa A — ✅ Correta ⟵ GABARITO

O Transformer, introduzido no artigo "Attention Is All You Need" (2017), foi projetado para processar sequências sem recorrer a recorrência, usando o mecanismo de atenção multi-cabeça. Isso permite paralelização total durante o treinamento, tornando-o escalável para grandes volumes de dados. É a base de modelos como GPT, BERT e LLMs.

Alternativa B — ❌ Incorreta

A Rede Neural Convolucional (CNN) é especializada em dados com estrutura espacial (imagens, grids). Embora possa ser aplicada a sequências com adaptações, não foi projetada para sequências de tamanho variável nem possui o mecanismo de atenção como elemento central. É mais adequada para visão computacional.

Alternativa C — ❌ Incorreta

O Perceptron Multicamadas (MLP) é uma rede de alimentação direta (feedforward) com camadas totalmente conectadas. Ela não lida naturalmente com entradas de tamanho variável e não possui mecanismo de atenção. É usada para classificação e regressão em dados tabulares, não para processamento de sequências.

Alternativa D — ❌ Incorreta

A Rede Neural Recorrente (RNN) foi a arquitetura padrão para sequências antes do Transformer. Ela processa entradas sequencialmente, mantendo um estado oculto. No entanto, sofre com o desaparecimento/explosão do gradiente (vanishing/exploding gradient) e é difícil de paralelizar, tornando-se ineficiente para sequências longas e grandes volumes de dados. Não implementa o mecanismo de atenção como parte fundamental do projeto.

Alternativa E — ❌ Incorreta

A LSTM (Long Short-Term Memory) é uma melhoria da RNN que resolve parcialmente o vanishing gradient com portas de esquecimento e memória de longo prazo. Ainda assim, mantém o processamento sequencial e a dificuldade de paralelização. Embora possa ser combinada com atenção, o mecanismo de atenção não é intrínseco à LSTM; ela não é a arquitetura descrita.

PEGA ESSA DICA!

Para diferenciar: se a questão menciona "mecanismo de atenção" e "sequências de tamanho variável" com eficiência em grandes volumes, é quase certo que se trata do Transformer. RNNs/LSTMs são sequenciais e mais lentas; CNNs são para dados espaciais; MLPs não lidam bem com sequências.

Gabarito: letra A.

Link permanente: /questoes/fg061598