Pular para o conteúdo principal

Questão de Engenharia de Software — Inteligencia Artificial — CESPE / CEBRASPE 2026

Engenharia de SoftwareInteligencia Artificial
Código
ce229747
Banca
CESPE / CEBRASPE
Órgão
TCU
Ano
2026
Nível
Superior
Cargo
Auditor Federal de Controle Externo - Área de Controle Externo/ Orientação: Auditoria de Tecnologia da Informação
Tendo o texto como referência inicial, julgue o item subsecutivo, a respeito de aprendizado de máquina.O aprendizado por reforço é essencialmente uma forma de aprendizagem não supervisionada, pois seu objetivo principal é descobrir padrões ocultos e agrupamento nos dados, sem uso de rótulos; nesse paradigma, a recompensa funciona como um critério secundário de avaliação.
  1. CCerto
  2. EErrado
Revelar gabarito e comentário

GabaritoE — Errado

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Aprendizado de máquina — Tipos de aprendizado

Gabarito: E (Errado). A afirmação incorre ao classificar o aprendizado por reforço como essencialmente uma forma de aprendizado não supervisionado, com objetivo de descobrir padrões ocultos e agrupamento, tratando a recompensa como secundária. Na verdade, o aprendizado por reforço é um paradigma autônomo, baseado em interação com ambiente e feedback de recompensas/punições, com o objetivo principal de maximizar a recompensa acumulada.

O texto-base apresenta as três categorias clássicas de aprendizado de máquina:

Aprendizado supervisionado: São apresentadas ao computador exemplos de entradas e saídas desejadas, fornecidas por um "professor". O objetivo é aprender uma regra geral que mapeia as entradas para as saídas.

Aprendizado não supervisionado: Nenhum tipo de etiqueta é dado ao algoritmo de aprendizado, deixando-o sozinho para encontrar estrutura nas entradas fornecidas.

Aprendizado por reforço: Um programa de computador interage com um ambiente dinâmico, em que o programa deve desempenhar determinado objetivo. É fornecido, ao programa, feedback quanto a premiações e punições.

Observa-se que o aprendizado por reforço não se enquadra no não supervisionado: ele utiliza recompensas (feedbacks) como sinal central, e não busca padrões ocultos ou agrupamento sem rótulos. O erro da assertiva está em:

  • Afirmar que o aprendizado por reforço é "essencialmente uma forma de aprendizagem não supervisionada" — são paradigmas distintos.

  • Dizer que seu "objetivo principal é descobrir padrões ocultos e agrupamento nos dados" — o objetivo principal do reforço é aprender uma política que maximize a recompensa cumulativa.

  • Colocar a "recompensa funciona como um critério secundário de avaliação" — na verdade, a recompensa é o sinal fundamental que guia o aprendizado.

Portanto, o item está errado.

Link permanente: /questoes/ce229747