Pular para o conteúdo principal

Questão de Noções de Informática — Inteligência Artificial e Automação — FGV 2025

Noções de InformáticaInteligência Artificial e Automação
Código
fg121539
Banca
FGV
Órgão
TCE-PE
Ano
2025
Nível
Superior
Cargo
Auditor de Controle Externo – Tecnologia da Informação
No treinamento de grandes modelos de linguagem (LLMs), como o GPT-4, uma técnica importante, utilizada para estabilizar o treinamento e favorecer a convergência - especialmente ao lidar com camadas profundas -, é a normalização por camada, conhecida como Layer Normalization, que consiste em:
  1. Anormalizar as ativações ao longo dos canais de entrada, reduzindo o desvio padrão espacial, ideal para modelos CNN.
  2. Brealizar a normalização entre exemplos de treinamento, reduzindo a variação das ativações dentro de um mesmo lote.
  3. Cnormalizar as ativações individualmente para cada exemplo, considerando todos os neurônios da mesma camada.
  4. Daplicar uma normalização nas ativações por meio de uma média móvel das ativações das camadas anteriores.
  5. Erealizar uma normalização baseada em gradientes acumulados, diretamente no passo de retropropagação (backpropagation).
Revelar gabarito e comentário

GabaritoC — normalizar as ativações individualmente para cada exemplo, considerando todos os neurônios da mesma camada.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Layer Normalization em LLMs

Gabarito: letra C. Layer Normalization é uma técnica que normaliza as ativações de todos os neurônios de uma camada individualmente para cada exemplo de treinamento, calculando média e variância ao longo das dimensões da camada (isto é, através das features/neurônios). Isso difere do Batch Normalization, que normaliza entre exemplos de um lote. A alternativa C descreve exatamente esse processo.

A banca testa a diferença entre as principais técnicas de normalização usadas em deep learning, especialmente em modelos de linguagem como GPT-4, onde Layer Normalization é preferida por não depender do tamanho do lote e funcionar bem em sequências de tamanho variável.

erDiagram
    LLM_TRAINING {
        string technique LayerNormalization
    }
    LAYER_NORMALIZATION {
        string description "Normaliza ativacoes individualmente para cada exemplo, considerando todos os neuronios da mesma camada"
    }
    BATCH_NORMALIZATION {
        string description "Normaliza entre exemplos de treinamento, reduzindo variacao dentro de um mesmo lote"
    }
    CHANNEL_NORMALIZATION {
        string description "Normaliza ativacoes ao longo dos canais de entrada, ideal para CNNs"
    }
    MOVING_AVERAGE_NORMALIZATION {
        string description "Aplica normalizacao por media movel das ativacoes de camadas anteriores"
    }
    GRADIENT_NORMALIZATION {
        string description "Normaliza baseada em gradientes acumulados na retropropagacao"
    }

    LLM_TRAINING ||--|| LAYER_NORMALIZATION : "usa"
    LAYER_NORMALIZATION ||--o{ BATCH_NORMALIZATION : "diferente_de"
    LAYER_NORMALIZATION ||--o{ CHANNEL_NORMALIZATION : "diferente_de"
    LAYER_NORMALIZATION ||--o{ MOVING_AVERAGE_NORMALIZATION : "diferente_de"
    LAYER_NORMALIZATION ||--o{ GRADIENT_NORMALIZATION : "diferente_de"

Alternativa A — ❌ Incorreta

Descreve a normalização por canal (como Batch Normalization em CNNs), reduzindo desvio padrão espacial. Isso é típico de redes convolucionais (CNN), não de LLMs, e não é Layer Normalization.

Alternativa B — ❌ Incorreta

Descreve a normalização entre exemplos de treinamento (Batch Normalization), que calcula média e variância ao longo do lote. Layer Normalization não usa o lote; normaliza cada exemplo individualmente.

Alternativa C — ✅ Correta ⟵ GABARITO

Descreve precisamente a Layer Normalization: normalizar as ativações individualmente para cada exemplo, considerando todos os neurônios da mesma camada. É a técnica usada em Transformer models como GPT-4.

Alternativa D — ❌ Incorreta

Refere-se a uma média móvel das ativações de camadas anteriores, o que não corresponde à Layer Normalization. Médias móveis são usadas em Batch Normalization durante a inferência, mas Layer Normalization não as utiliza.

Alternativa E — ❌ Incorreta

Menciona gradientes acumulados durante a retropropagação, que é uma técnica de otimização (ex.: gradiente acumulado para lotes grandes), não uma normalização de ativações.

NÃO CAIA NESSA!

A banca tenta confundir Layer Normalization com Batch Normalization. Enquanto a Batch Normalization normaliza ao longo do lote (entre exemplos), a Layer Normalization normaliza ao longo das features da camada para cada exemplo. Alternativas A e B descrevem variantes da Batch Normalization, e D e E são distratores sem relação direta.

Gabarito: letra C.

Link permanente: /questoes/fg121539