Ed
mês passado
Vamos analisar cada afirmação: I - A função de ativação softmax precede o cálculo de similaridade por produto escalar. Falso. O cálculo da similaridade por produto escalar ocorre antes do softmax. O softmax é aplicado depois para normalizar os valores e gerar pesos de atenção. II - As matrizes de projeção armazenam parâmetros aprendidos durante o treinamento. Verdadeiro. As matrizes de projeção (para Query, Key e Value) são parâmetros treináveis do modelo. III - Múltiplas cabeças de atenção permitem capturar perspectivas distintas da sequência. Verdadeiro. A atenção multi-head permite que o modelo foque em diferentes partes da sequência simultaneamente, capturando diferentes relações. IV - Os pesos de atenção resultam diretamente da projeção dos vetores Value. Falso. Os pesos de atenção são calculados a partir da similaridade entre Query e Key, e depois aplicados para ponderar os vetores Value, mas não resultam diretamente da projeção dos Value. Portanto, as afirmações corretas são II e III. Resposta correta: II e III, apenas.
Cadastre-se ou realize login