Ed
mês passado
A descrição da questão fala sobre sistemas que convertem diferentes tipos de dados (imagens, sons, texto) em representações vetoriais comuns, usando componentes especializados, e que utilizam mecanismos para identificar partes relevantes da imagem para responder perguntas ou gerar legendas. Analisando as alternativas: a) Eles utilizam codificadores especializados para gerar embeddings de cada modalidade e mecanismos de atenção para integrar as informações. — Esta alternativa está correta, pois descreve o funcionamento técnico básico dos modelos multimodais: codificadores para cada tipo de dado e mecanismos de atenção para combinar as informações. b) Eles funcionam por meio da substituição manual de imagens por descrições de texto feitas por especialistas humanos antes do processamento. — Incorreto, pois o processo é automático, não manual. c) Eles utilizam apenas redes neurais convolucionais para processar textos, descartando o uso de Transformers por serem lentos. — Incorreto, pois Transformers são amplamente usados para texto e multimodalidade. d) Eles baseiam-se na exclusão de dados visuais para focar apenas na frequência de palavras positivas e negativas do enunciado. — Incorreto, pois dados visuais são essenciais nos modelos multimodais. e) Eles — Alternativa incompleta. Portanto, a alternativa correta é: a) Eles utilizam codificadores especializados para gerar embeddings de cada modalidade e mecanismos de atenção para integrar as informações.
Cadastre-se ou realize login