Ed
ano passado
Para entender como um agente em aprendizagem por reforço ajusta seu comportamento, é fundamental saber que essa abordagem se baseia na interação com o ambiente e no feedback que o agente recebe após suas ações. Vamos analisar as alternativas: a) Memorizando uma série de ações pré-definidas sem interação com o ambiente. - Isso não é característico da aprendizagem por reforço, pois o agente precisa interagir com o ambiente. b) Aplicando algoritmo de clusterização para agrupar ações similares. - A clusterização não é uma técnica típica utilizada em aprendizagem por reforço. c) Recebendo feedback em forma de recompensas ou punições após cada ação. - Esta é a essência da aprendizagem por reforço, onde o agente aprende a partir das recompensas ou punições que recebe, ajustando seu comportamento com base nesse feedback. d) Utilizando redes neurais convolucionais para processar o estado do ambiente. - Embora redes neurais possam ser usadas em alguns algoritmos de aprendizagem por reforço, isso não é uma descrição geral do ajuste de comportamento. e) Através da observação passiva do ambiente para imitar comportamentos. - A aprendizagem por reforço não se baseia apenas na observação passiva, mas sim na interação ativa. Portanto, a alternativa correta é: c) Recebendo feedback em forma de recompensas ou punições após cada ação.
Cadastre-se ou realize login
Mais perguntas desse material