Questão de Engenharia de Software — Inteligencia Artificial — FGV 2023
Engenharia de Software›Inteligencia Artificial
Código
fg061598
Banca
FGV
Órgão
Câmara dos Deputados
Ano
2023
Nível
Superior
Cargo
Analista Legislativo - Informática Legislativa - Tarde
A evolução das redes neurais impulsionou significativamente o avanço da inteligência artificial, resultando em arquiteturas inovadoras.Entre elas, uma se sobressai por sua habilidade em gerenciar sequências de tamanho variável, eficiência em treinamentos com grandes volumes de dados e pela implementação do mecanismo de atenção, o que possibilita uma análise ponderada e dinâmica das entradas.Essa arquitetura é denominada.
ATransformer.
BRede Neural Convolucional (CNN).
CPerceptron Multicamadas (MLP).
DRede Neural Recorrente (RNN).
ERede Neural de Memória Longa de Curto Prazo (LSTM).
Revelar gabarito e comentário▾
GabaritoA — Transformer.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Arquiteturas de Redes Neurais
Gabarito: letra A. O Transformer é a arquitetura que se destaca por gerenciar sequências de tamanho variável, ser eficiente no treinamento com grandes volumes de dados e implementar o mecanismo de atenção, que permite uma análise ponderada e dinâmica das entradas. Essas características são a essência do Transformer, base dos LLMs atuais.
A banca testa o conhecimento das principais arquiteturas de redes neurais e suas aplicações. O enunciado descreve exatamente o Transformer: capacidade de lidar com sequências (tamanho variável), eficiência em escala (paralelização) e o mecanismo de atenção (diferencial em relação a RNNs/LSTMs).
Arquiteturas de redes neurais
1Sequências de tamanho variável
RNN (recorrente)
Gradiente desaparece/explode
Difícil paralelizar
LSTM (memória longa)
Melhora gradiente
Ainda sequencial
Transformer
Atenção multi-cabeça
Paralelização total
Escalável
2Dados espaciais (imagens)
CNN (convolucional)
3Dados tabulares
MLP (perceptron multicamadas)
LEVEL · soulevel.com.br
Alternativa A — ✅ Correta ⟵ GABARITO
O Transformer, introduzido no artigo "Attention Is All You Need" (2017), foi projetado para processar sequências sem recorrer a recorrência, usando o mecanismo de atenção multi-cabeça. Isso permite paralelização total durante o treinamento, tornando-o escalável para grandes volumes de dados. É a base de modelos como GPT, BERT e LLMs.
Alternativa B — ❌ Incorreta
A Rede Neural Convolucional (CNN) é especializada em dados com estrutura espacial (imagens, grids). Embora possa ser aplicada a sequências com adaptações, não foi projetada para sequências de tamanho variável nem possui o mecanismo de atenção como elemento central. É mais adequada para visão computacional.
Alternativa C — ❌ Incorreta
O Perceptron Multicamadas (MLP) é uma rede de alimentação direta (feedforward) com camadas totalmente conectadas. Ela não lida naturalmente com entradas de tamanho variável e não possui mecanismo de atenção. É usada para classificação e regressão em dados tabulares, não para processamento de sequências.
Alternativa D — ❌ Incorreta
A Rede Neural Recorrente (RNN) foi a arquitetura padrão para sequências antes do Transformer. Ela processa entradas sequencialmente, mantendo um estado oculto. No entanto, sofre com o desaparecimento/explosão do gradiente (vanishing/exploding gradient) e é difícil de paralelizar, tornando-se ineficiente para sequências longas e grandes volumes de dados. Não implementa o mecanismo de atenção como parte fundamental do projeto.
Alternativa E — ❌ Incorreta
A LSTM (Long Short-Term Memory) é uma melhoria da RNN que resolve parcialmente o vanishing gradient com portas de esquecimento e memória de longo prazo. Ainda assim, mantém o processamento sequencial e a dificuldade de paralelização. Embora possa ser combinada com atenção, o mecanismo de atenção não é intrínseco à LSTM; ela não é a arquitetura descrita.
PEGA ESSA DICA!
Para diferenciar: se a questão menciona "mecanismo de atenção" e "sequências de tamanho variável" com eficiência em grandes volumes, é quase certo que se trata do Transformer. RNNs/LSTMs são sequenciais e mais lentas; CNNs são para dados espaciais; MLPs não lidam bem com sequências.