Ed
há 2 meses
No ambiente Frozen Lake, o agente aprende a tomar decisões para maximizar a recompensa acumulada ao longo do tempo, ajustando suas ações com base nas recompensas recebidas por meio de tentativa e erro. Analisando as alternativas: A) Algoritmos Genéticos: são baseados em evolução biológica, não diretamente em tentativa e erro com recompensas. B) Teoria dos Jogos: foca em interações estratégicas entre múltiplos agentes, não no aprendizado por tentativa e erro individual. C) Redes Neurais: são modelos de aprendizado, mas não descrevem diretamente o processo de aprendizado por tentativa e erro com recompensas. D) Algoritmos Baseados em Heurísticas: usam regras empíricas, não aprendizado por reforço. E) Aprendizado por Reforço: técnica em que o agente aprende por tentativa e erro, ajustando seu comportamento com base em recompensas e punições. Portanto, a alternativa correta é: E) Aprendizado por Reforço.
Cadastre-se ou realize login