Questão de Engenharia de Software — Inteligencia Artificial — FGV 2025
Engenharia de Software›Inteligencia Artificial
Código
fg106749
Banca
FGV
Órgão
CNU
Ano
2025
Nível
Superior
Cargo
Bloco Temático 3: Ciência e Tecnologia
O artigo Attention is All You Need (Vaswani et al., 2017) marcou uma ruptura no processamento de linguagem natural ao apresentar a arquitetura Transformer. Sua abordagem abriu caminho para a criação de modelos de grande escala, como BERT, GPT e diversos outros que dominam o estado da arte em processamento de linguagem natural e em outras áreas, como visão computacional e bioinformática.Sobre a arquitetura Transformer, é correto afirmar que:
Ao Transformer substitui mecanismos recorrentes por atenção, mas não utiliza codificação posicional, pois o alinhamento sequencial é aprendido implicitamente pelas cabeças de atenção;
Ba introdução do multi-head attention permite ao modelo aprender relações diferentes entre tokens em subespaços de projeção distintos, preservando a informação posicional por meio de codificadores específicos;
Co Transformer original evita camadas feed-foward densas para reduzir a complexidade, compensando essa ausência com mais cabeças de atenção por bloco;
Do mecanismo de scaled dot-product attention multiplica os escores de similaridade pela raiz quadrada da dimensão das keys para intensificar as diferenças entre tokens distantes;
Ea arquitetura de encoder-decoder é composta por blocos distintos no encoder e no decoder, sem reutilização estrutural, a fim de especializar cada parte para tarefas diferentes.
Revelar gabarito e comentário▾
GabaritoB — a introdução do multi-head attention permite ao modelo aprender relações diferentes entre tokens em subespaços de projeção distintos, preservando a informação posicional por meio de codificadores específicos;
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Arquitetura Transformer
Gabarito: letra B. O Transformer introduz o multi-head attention, que projeta queries, keys e values em múltiplos subespaços, permitindo que o modelo aprenda diferentes relações entre tokens. A informação posicional é preservada por meio de codificadores posicionais adicionados às embeddings de entrada. As demais alternativas contêm imprecisões sobre a arquitetura original.
A questão cobra o entendimento do artigo Attention is All You Need (Vaswani et al., 2017). Vamos analisar cada alternativa.
Alternativa
Afirmação sobre o Transformer
Correção
Motivo
A
Substitui recorrência por atenção, mas não usa codificação posicional (aprendizagem implícita).
❌
Atenção é invariante à permutação; o artigo original adiciona codificações posicionais (senoidais ou aprendidas) às embeddings.
B
Multi-head attention projeta queries/keys/values em subespaços distintos, aprendendo relações diferentes; informação posicional preservada por codificadores específicos.
✅
Descrição correta do mecanismo e do papel dos codificadores posicionais.
C
Evita camadas feed-forward densas para reduzir complexidade, compensando com mais cabeças de atenção.
❌
Cada bloco Transformer tem duas subcamadas: atenção multi-cabeça e uma MLP feed-forward densa.
D
Scaled dot-product attention multiplica escores por √dk para intensificar diferenças entre tokens distantes.
❌
A divisão por √dk evita que os escores cresçam excessivamente com a dimensão, mantendo gradientes estáveis.
E
Encoder e decoder são blocos distintos, sem reutilização estrutural, para especializar cada parte.
❌
Ambos compartilham a mesma estrutura básica (atenção + feed-forward); o decoder adiciona apenas atenção cruzada.
Transformer (Vaswani et al., 2017): Multi-head attention (Projeta em subespaços distintos, Aprende relações diferentes entre tokens); Codificação posicional (Senoidal ou aprendida, Preserva ordem da sequência); Scaled dot-product attention (Divide por √dk, Evita escores grandes, Mantém gradientes estáveis); Blocos (Atenção multi-cabeça, Feed-forward (MLP), Decoder: atenção cruzada extra)
Alternativa A — ❌ Incorreta
Afirma que o Transformer não utiliza codificação posicional, pois o alinhamento sequencial é aprendido implicitamente. Isso é falso. O Transformer original adiciona codificações posicionais (senoidais ou aprendidas) às embeddings de entrada para que o modelo possa utilizar a ordem da sequência, já que a atenção em si é invariante à permutação.
Alternativa B — ✅ Correta ⟵ GABARITO
O multi-head attention projeta as entradas em diferentes subespaços (cada cabeça aprende relações distintas) e, de fato, a arquitetura preserva a informação posicional por meio de codificadores posicionais específicos (como senoides ou embeddings aprendidas). Essa descrição está alinhada com o artigo original.
Alternativa C — ❌ Incorreta
Afirma que o Transformer evita camadas feed-forward densas para reduzir complexidade. É o oposto. Cada bloco do Transformer possui duas subcamadas: uma de atenção multi-cabeça e uma rede feed-forward totalmente conectada (MLP). As camadas feed-forward são essenciais e estão presentes.
Alternativa D — ❌ Incorreta
O mecanismo de scaled dot-product attention divide o produto escalar dos escores pela raiz quadrada da dimensão das keys (√dk). Isso não é para intensificar diferenças entre tokens distantes, mas para evitar que os escores cresçam demais com a dimensão, mantendo gradientes estáveis.
Alternativa E — ❌ Incorreta
O encoder e o decoder no Transformer compartilham a mesma estrutura básica (ambos possuem blocos com atenção e feed-forward). O decoder tem uma camada extra de atenção cruzada, mas há reutilização estrutural, não blocos completamente distintos sem reutilização.
PEGA ESSA DICA!
Para fixar, lembre-se: Transformer = atenção + codificação posicional + feed-forward. O multi-head permite que o modelo atente a diferentes aspectos simultaneamente.