Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — FCC 2025

Engenharia de SoftwareInteligencia Artificial
Código
fc075534
Banca
FCC
Órgão
TRT - 6ª Região (PE)
Ano
2025
Nível
Superior
Cargo
Analista Judiciário - Área Apoio Especializado - Especialidade: Tecnologia da Informação
Uma equipe de Analistas está implementando um modelo LLM para uso no Tribunal Regional do Trabalho e precisa garantir que o modelo não gere respostas inapropriadas ou incorretas, mantendo a relevância e coerência do conteúdo. Para ajustar o desempenho do modelo e evitar problemas como alucinações e vieses, eles optaram por
  1. Areduzir o número de camadas de rede neural para minimizar o processamento e aumentar a velocidade de inferência, pois isso reduziria erros causados por dados não estruturados.
  2. Busar o aprendizado zero-shot durante o treinamento, pois ele é suficiente para que o modelo aprenda a generalizar padrões sem supervisão.
  3. Cutilizar Reinforcement Learning from Human Feedback (RLHF) para treinar o modelo a partir de respostas corrigidas por humanos.
  4. Dimplementar fine-tuning com um conjunto de dados menor & mais especifico, sem utilizar nenhum mecanismo de atenção para evitar sobrecarga de processamento.
  5. Eaumentar o número de tokens e embeddings durante o treinamento para que o modelo tenha mais dados contextuais disponíveis.
Revelar gabarito e comentário

GabaritoC — utilizar Reinforcement Learning from Human Feedback (RLHF) para treinar o modelo a partir de respostas corrigidas por humanos.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Ajuste de Modelos LLM – Técnica RLHF

Gabarito: letra C. O RLHF (Reinforcement Learning from Human Feedback) é a técnica mais adequada para treinar modelos de linguagem (LLMs) com o objetivo de reduzir alucinações, vieses e respostas inapropriadas, utilizando feedback humano para refinar o comportamento do modelo. As demais alternativas propõem abordagens que não atendem diretamente a esse propósito ou são prejudiciais ao desempenho do modelo.

Alternativa A — ❌ Incorreta

Reduzir o número de camadas da rede neural pode aumentar a velocidade de inferência, mas não é uma técnica direcionada para mitigar alucinações ou vieses. A redução de camadas pode até comprometer a capacidade de aprendizado do modelo, não resolvendo os problemas mencionados.

Alternativa B — ❌ Incorreta

O aprendizado zero-shot permite que o modelo generalize sem exemplos específicos, mas não é suficiente para corrigir vieses e alucinações. O treinamento com zero-shot não envolve supervisão humana direta, sendo incapaz de alinhar o modelo a padrões de segurança e relevância.

Alternativa C — ✅ Correta ⟵ GABARITO

O RLHF (Reinforcement Learning from Human Feedback) é uma técnica consolidada que utiliza respostas corrigidas por humanos para treinar o modelo. Conforme a literatura, ele é aplicado para remover vieses, discurso de ódio e respostas factualmente incorretas (alucinações), ajustando o modelo para gerar conteúdo mais apropriado e coerente.

Alternativa D — ❌ Incorreta

Implementar fine-tuning com um conjunto de dados menor e específico é uma prática comum, mas eliminar o mecanismo de atenção é inviável para LLMs. A atenção é o componente central dos transformers, responsável por capturar relações contextuais. Sem ela, o modelo perde a capacidade de processar sequências longas de forma eficaz, comprometendo a qualidade das respostas.

Alternativa E — ❌ Incorreta

Aumentar o número de tokens e embeddings amplia a capacidade de contexto, mas não é uma técnica de treinamento focada em corrigir alucinações ou vieses. O aumento de dados contextuais, por si só, não garante que o modelo evite respostas inapropriadas – é necessário um mecanismo de alinhamento como o RLHF.

NÃO CAIA NESSA!

Para ajustar modelos LLM visando segurança e relevância, o RLHF é a técnica mais consolidada. Não confunda com zero-shot ou fine-tuning simples: o diferencial está no feedback humano iterativo.

Link permanente: /questoes/fc075534