Questão de Engenharia de Software — Inteligencia Artificial — FGV 2024
Engenharia de Software›Inteligencia Artificial
Código
fg089956
Banca
FGV
Órgão
Prefeitura de Macaé - RJ
Ano
2024
Nível
Superior
Cargo
Analista Previdenciário - Especialidade: Analista de Sistemas
Large Language Models (LLMs) são um tipo de modelo IA projetado para lidar com tarefas de processamento de linguagem natural (PLN) em uma escala muito grande. Esses modelos são treinados com enormes quantidades de dados textuais e são capazes de entender e gerar texto em linguagem natural de forma altamente sofisticada.Em relação aos Large Language Models (LLMs), como o GPT, a abordagem mais relevante para melhorar a capacidade do modelo de gerar respostas coerentes e contextualmente apropriadas em conversas prolongadas, entre as listadas, é
Aaumentar o número de parâmetros do modelo.
Butilizar a técnica de fine-tuning em um grande conjunto de dados não rotulados.
Cimplementar um mecanismo de atenção (Attention Mechanism).
Daplicar a tokenização BPE (Byte Pair Encoding) ao texto de entrada.
Eaumentar a frequência de palavras raras no conjunto de treinamento.
Revelar gabarito e comentário▾
GabaritoC — implementar um mecanismo de atenção (Attention Mechanism).
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Large Language Models (LLMs) e Mecanismo de Atenção
Gabarito: letra C. O mecanismo de atenção (Attention Mechanism) é a técnica mais relevante para que LLMs como o GPT mantenham coerência em conversas longas, pois permite que o modelo pondere a importância de diferentes partes da entrada ao gerar cada token, resolvendo o problema de dependências de longo prazo. As demais alternativas são técnicas auxiliares, mas não atacam diretamente a necessidade de contexto estendido.
Alternativa
Técnica
Relevância para conversas prolongadas
A
Aumentar número de parâmetros
Melhora capacidade geral, mas não é específica para contexto; aumenta custo.
B
Fine-tuning em dados não rotulados
Fine-tuning normalmente requer dados rotulados; não rotulados não são eficazes para este fim.
C
Mecanismo de atenção
Essencial: captura dependências de longo alcance, permitindo que o modelo 'lembre' de partes anteriores da conversa.
D
Tokenização BPE
Processamento lexical, não impacta diretamente a coerência conversacional.
E
Aumentar frequência de palavras raras
Pode distorcer distribuições e não melhora contexto; foco em vocabulário, não em estrutura.
Alternativa A — ❌ Incorreta
Aumentar parâmetros pode melhorar a capacidade geral do modelo, mas não é a abordagem mais relevante para conversas prolongadas. O ganho com escala é limitado sem um mecanismo que gerencie contexto; além disso, o custo computacional cresce rapidamente.
Alternativa B — ❌ Incorreta
Fine-tuning em dados não rotulados não é uma prática comum para melhorar coerência; tipicamente o fine-tuning usa dados rotulados para tarefas específicas. Dados não rotulados são usados no pré-treinamento, não no ajuste fino.
Alternativa C — ✅ Correta ⟵ GABARITO
O mecanismo de atenção foi a inovação central dos transformers (artigo "Attention Is All You Need", 2017). Ele permite que o modelo atribua pesos a diferentes tokens da entrada, mantendo contexto por longas sequências – fundamental para diálogos extensos. Sem atenção, modelos recorrentes perdem informação ao longo do tempo.
Alternativa D — ❌ Incorreta
A tokenização BPE (Byte Pair Encoding) é uma técnica de pré-processamento para converter texto em tokens de forma eficiente, mas não contribui para a coerência contextual em conversas. É uma etapa auxiliar.
Alternativa E — ❌ Incorreta
Aumentar a frequência de palavras raras no treinamento pode causar overfitting ou distorcer a distribuição natural da língua. Não é uma estratégia eficaz para melhorar respostas coerentes em conversas longas.
PEGA ESSA DICA!
Em questões sobre LLMs e transformers, lembre-se de que o {{mecanismo de atenção}} é o componente-chave para dependências de longo prazo. As outras opções são ferramentas complementares, mas não resolvem o problema central do contexto estendido.