Ed
há 4 semanas
O ciclo de RLHF (Reinforcement Learning with Human Feedback) ajusta o modelo com base no feedback dos avaliadores humanos, que indicam preferências sobre as respostas geradas. O modelo aprende a priorizar essas preferências para melhorar seu comportamento. Analisando as alternativas: a) Incorreto – o modelo não armazena fatos verificados diretamente no banco de dados interno durante o ajuste. b) Correto – o comportamento do modelo reflete as preferências dos avaliadores humanos, que são aplicadas conforme critérios definidos pela empresa. c) Incorreto – regras gramaticais são aprendidas no pré-treino, não no RLHF. d) Incorreto – o modelo não memoriza perguntas frequentes com respostas corretas nesse processo. e) Incorreto – o modelo não reflete a opinião média de todos os usuários. Portanto, a alternativa correta é: b) As preferências dos avaliadores humanos, aplicadas segundo critérios definidos pela empresa.
Cadastre-se ou realize login