Questão de Noções de Informática — Inteligência Artificial e Automação — FGV 2025
Noções de Informática›Inteligência Artificial e Automação
Código
fg121539
Banca
FGV
Órgão
TCE-PE
Ano
2025
Nível
Superior
Cargo
Auditor de Controle Externo – Tecnologia da Informação
No treinamento de grandes modelos de linguagem (LLMs), como o GPT-4, uma técnica importante, utilizada para estabilizar o treinamento e favorecer a convergência - especialmente ao lidar com camadas profundas -, é a normalização por camada, conhecida como Layer Normalization, que consiste em:
Anormalizar as ativações ao longo dos canais de entrada, reduzindo o desvio padrão espacial, ideal para modelos CNN.
Brealizar a normalização entre exemplos de treinamento, reduzindo a variação das ativações dentro de um mesmo lote.
Cnormalizar as ativações individualmente para cada exemplo, considerando todos os neurônios da mesma camada.
Daplicar uma normalização nas ativações por meio de uma média móvel das ativações das camadas anteriores.
Erealizar uma normalização baseada em gradientes acumulados, diretamente no passo de retropropagação (backpropagation).
Revelar gabarito e comentário▾
GabaritoC — normalizar as ativações individualmente para cada exemplo, considerando todos os neurônios da mesma camada.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Layer Normalization em LLMs
Gabarito: letra C. Layer Normalization é uma técnica que normaliza as ativações de todos os neurônios de uma camada individualmente para cada exemplo de treinamento, calculando média e variância ao longo das dimensões da camada (isto é, através das features/neurônios). Isso difere do Batch Normalization, que normaliza entre exemplos de um lote. A alternativa C descreve exatamente esse processo.
A banca testa a diferença entre as principais técnicas de normalização usadas em deep learning, especialmente em modelos de linguagem como GPT-4, onde Layer Normalization é preferida por não depender do tamanho do lote e funcionar bem em sequências de tamanho variável.
erDiagram
LLM_TRAINING {
string technique LayerNormalization
}
LAYER_NORMALIZATION {
string description "Normaliza ativacoes individualmente para cada exemplo, considerando todos os neuronios da mesma camada"
}
BATCH_NORMALIZATION {
string description "Normaliza entre exemplos de treinamento, reduzindo variacao dentro de um mesmo lote"
}
CHANNEL_NORMALIZATION {
string description "Normaliza ativacoes ao longo dos canais de entrada, ideal para CNNs"
}
MOVING_AVERAGE_NORMALIZATION {
string description "Aplica normalizacao por media movel das ativacoes de camadas anteriores"
}
GRADIENT_NORMALIZATION {
string description "Normaliza baseada em gradientes acumulados na retropropagacao"
}
LLM_TRAINING ||--|| LAYER_NORMALIZATION : "usa"
LAYER_NORMALIZATION ||--o{ BATCH_NORMALIZATION : "diferente_de"
LAYER_NORMALIZATION ||--o{ CHANNEL_NORMALIZATION : "diferente_de"
LAYER_NORMALIZATION ||--o{ MOVING_AVERAGE_NORMALIZATION : "diferente_de"
LAYER_NORMALIZATION ||--o{ GRADIENT_NORMALIZATION : "diferente_de"
Alternativa A — ❌ Incorreta
Descreve a normalização por canal (como Batch Normalization em CNNs), reduzindo desvio padrão espacial. Isso é típico de redes convolucionais (CNN), não de LLMs, e não é Layer Normalization.
Alternativa B — ❌ Incorreta
Descreve a normalização entre exemplos de treinamento (Batch Normalization), que calcula média e variância ao longo do lote. Layer Normalization não usa o lote; normaliza cada exemplo individualmente.
Alternativa C — ✅ Correta ⟵ GABARITO
Descreve precisamente a Layer Normalization: normalizar as ativações individualmente para cada exemplo, considerando todos os neurônios da mesma camada. É a técnica usada em Transformer models como GPT-4.
Alternativa D — ❌ Incorreta
Refere-se a uma média móvel das ativações de camadas anteriores, o que não corresponde à Layer Normalization. Médias móveis são usadas em Batch Normalization durante a inferência, mas Layer Normalization não as utiliza.
Alternativa E — ❌ Incorreta
Menciona gradientes acumulados durante a retropropagação, que é uma técnica de otimização (ex.: gradiente acumulado para lotes grandes), não uma normalização de ativações.
NÃO CAIA NESSA!
A banca tenta confundir Layer Normalization com Batch Normalization. Enquanto a Batch Normalization normaliza ao longo do lote (entre exemplos), a Layer Normalization normaliza ao longo das features da camada para cada exemplo. Alternativas A e B descrevem variantes da Batch Normalization, e D e E são distratores sem relação direta.