Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — FGV 2025

Engenharia de SoftwareInteligencia Artificial
Código
fg106749
Banca
FGV
Órgão
CNU
Ano
2025
Nível
Superior
Cargo
Bloco Temático 3: Ciência e Tecnologia
O artigo Attention is All You Need (Vaswani et al., 2017) marcou uma ruptura no processamento de linguagem natural ao apresentar a arquitetura Transformer. Sua abordagem abriu caminho para a criação de modelos de grande escala, como BERT, GPT e diversos outros que dominam o estado da arte em processamento de linguagem natural e em outras áreas, como visão computacional e bioinformática.Sobre a arquitetura Transformer, é correto afirmar que:
  1. Ao Transformer substitui mecanismos recorrentes por atenção, mas não utiliza codificação posicional, pois o alinhamento sequencial é aprendido implicitamente pelas cabeças de atenção;
  2. Ba introdução do multi-head attention permite ao modelo aprender relações diferentes entre tokens em subespaços de projeção distintos, preservando a informação posicional por meio de codificadores específicos;
  3. Co Transformer original evita camadas feed-foward densas para reduzir a complexidade, compensando essa ausência com mais cabeças de atenção por bloco;
  4. Do mecanismo de scaled dot-product attention multiplica os escores de similaridade pela raiz quadrada da dimensão das keys para intensificar as diferenças entre tokens distantes;
  5. Ea arquitetura de encoder-decoder é composta por blocos distintos no encoder e no decoder, sem reutilização estrutural, a fim de especializar cada parte para tarefas diferentes.
Revelar gabarito e comentário

GabaritoB — a introdução do multi-head attention permite ao modelo aprender relações diferentes entre tokens em subespaços de projeção distintos, preservando a informação posicional por meio de codificadores específicos;

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Arquitetura Transformer

Gabarito: letra B. O Transformer introduz o multi-head attention, que projeta queries, keys e values em múltiplos subespaços, permitindo que o modelo aprenda diferentes relações entre tokens. A informação posicional é preservada por meio de codificadores posicionais adicionados às embeddings de entrada. As demais alternativas contêm imprecisões sobre a arquitetura original.

A questão cobra o entendimento do artigo Attention is All You Need (Vaswani et al., 2017). Vamos analisar cada alternativa.

Alternativa

Afirmação sobre o Transformer

Correção

Motivo

A

Substitui recorrência por atenção, mas não usa codificação posicional (aprendizagem implícita).

Atenção é invariante à permutação; o artigo original adiciona codificações posicionais (senoidais ou aprendidas) às embeddings.

B

Multi-head attention projeta queries/keys/values em subespaços distintos, aprendendo relações diferentes; informação posicional preservada por codificadores específicos.

Descrição correta do mecanismo e do papel dos codificadores posicionais.

C

Evita camadas feed-forward densas para reduzir complexidade, compensando com mais cabeças de atenção.

Cada bloco Transformer tem duas subcamadas: atenção multi-cabeça e uma MLP feed-forward densa.

D

Scaled dot-product attention multiplica escores por √dk para intensificar diferenças entre tokens distantes.

A divisão por √dk evita que os escores cresçam excessivamente com a dimensão, mantendo gradientes estáveis.

E

Encoder e decoder são blocos distintos, sem reutilização estrutural, para especializar cada parte.

Ambos compartilham a mesma estrutura básica (atenção + feed-forward); o decoder adiciona apenas atenção cruzada.

1Multi-head attention
Projeta em subespaços distintos
Aprende relações diferentes entre tokens
2Codificação posicional
Senoidal ou aprendida
Preserva ordem da sequência
3Scaled dot-product attention
Divide por √dk
Evita escores grandes
Mantém gradientes estáveis
4Blocos
Atenção multi-cabeça
Feed-forward (MLP)
Decoder: atenção cruzada extra
Transformer (Vaswani et al., 2017)
LEVELsoulevel.com.br
Transformer (Vaswani et al., 2017): Multi-head attention (Projeta em subespaços distintos, Aprende relações diferentes entre tokens); Codificação posicional (Senoidal ou aprendida, Preserva ordem da sequência); Scaled dot-product attention (Divide por √dk, Evita escores grandes, Mantém gradientes estáveis); Blocos (Atenção multi-cabeça, Feed-forward (MLP), Decoder: atenção cruzada extra)

Alternativa A — ❌ Incorreta

Afirma que o Transformer não utiliza codificação posicional, pois o alinhamento sequencial é aprendido implicitamente. Isso é falso. O Transformer original adiciona codificações posicionais (senoidais ou aprendidas) às embeddings de entrada para que o modelo possa utilizar a ordem da sequência, já que a atenção em si é invariante à permutação.

Alternativa B — ✅ Correta ⟵ GABARITO

O multi-head attention projeta as entradas em diferentes subespaços (cada cabeça aprende relações distintas) e, de fato, a arquitetura preserva a informação posicional por meio de codificadores posicionais específicos (como senoides ou embeddings aprendidas). Essa descrição está alinhada com o artigo original.

Alternativa C — ❌ Incorreta

Afirma que o Transformer evita camadas feed-forward densas para reduzir complexidade. É o oposto. Cada bloco do Transformer possui duas subcamadas: uma de atenção multi-cabeça e uma rede feed-forward totalmente conectada (MLP). As camadas feed-forward são essenciais e estão presentes.

Alternativa D — ❌ Incorreta

O mecanismo de scaled dot-product attention divide o produto escalar dos escores pela raiz quadrada da dimensão das keys (√dk). Isso não é para intensificar diferenças entre tokens distantes, mas para evitar que os escores cresçam demais com a dimensão, mantendo gradientes estáveis.

Alternativa E — ❌ Incorreta

O encoder e o decoder no Transformer compartilham a mesma estrutura básica (ambos possuem blocos com atenção e feed-forward). O decoder tem uma camada extra de atenção cruzada, mas há reutilização estrutural, não blocos completamente distintos sem reutilização.

PEGA ESSA DICA!

Para fixar, lembre-se: Transformer = atenção + codificação posicional + feed-forward. O multi-head permite que o modelo atente a diferentes aspectos simultaneamente.

Gabarito: letra B.

Link permanente: /questoes/fg106749