Logo Passei Direto
Buscar
Modelos baseados em Transformer utilizam atenção multi-head para capturar dependências em sequências. Ao processar texto, o mecanismo projeta representações em três vetores (Query, Key e Value) cujas matrizes são aprendidas no treinamento. A similaridade entre tokens é calculada por produto escalar, seguida de normalização via softmax, gerando pesos que ponderam informações relevantes ao longo da sequência. Considerando o mecanismo de atenção multi-head e as projeções Query, Key e Value, avalie as afirmações a seguir. I - A função de ativação softmax precede o cálculo de similaridade por produto escalar. II - As matrizes de projeção armazenam parâmetros aprendidos durante o treinamento. III - Múltiplas cabeças de atenção permitem capturar perspectivas distintas da sequência. IV - Os pesos de atenção resultam diretamente da projeção dos vetores Value. É correto o que se afirma em Grupo de escolhas da pergunta II, III e IV, apenas. II e III, apenas. I, II e III, apenas. I e IV, apenas. I e II, apenas.
User badge image
Fabiano Lacerda

mês passado

Respostas

User badge image

Ed Verified user icon

mês passado

Vamos analisar cada afirmação: I - A função de ativação softmax precede o cálculo de similaridade por produto escalar. Falso. O cálculo da similaridade por produto escalar ocorre antes do softmax. O softmax é aplicado depois para normalizar os valores e gerar pesos de atenção. II - As matrizes de projeção armazenam parâmetros aprendidos durante o treinamento. Verdadeiro. As matrizes de projeção (para Query, Key e Value) são parâmetros treináveis do modelo. III - Múltiplas cabeças de atenção permitem capturar perspectivas distintas da sequência. Verdadeiro. A atenção multi-head permite que o modelo foque em diferentes partes da sequência simultaneamente, capturando diferentes relações. IV - Os pesos de atenção resultam diretamente da projeção dos vetores Value. Falso. Os pesos de atenção são calculados a partir da similaridade entre Query e Key, e depois aplicados para ponderar os vetores Value, mas não resultam diretamente da projeção dos Value. Portanto, as afirmações corretas são II e III. Resposta correta: II e III, apenas.

Essa resposta te ajudou?

0
Dislike0

Ainda não achou a resposta?

  • Integrado com os principais modelos de IA do mercado
  • Respostas em segundos
  • IA treinada para estudantes brasileiros.
PasseIA logoEvolua sua forma de estudar

Cadastre-se ou realize login

Ainda com dúvidas?

Envie uma pergunta e tenha sua dúvida de estudo respondida!

Mais conteúdos dessa disciplina