Logo Passei Direto
Buscar

Informática

UNIFATECIE
Para um sistema computacional conseguir "entender" uma imagem e descrevê-la em formato de texto, é necessário que diferentes tipos de dados sejam convertidos para uma linguagem matemática comum. Esse processo envolve o uso de componentes especializados que transformam pixels, ondas sonoras ou palavras em representações vetoriais que o modelo consegue processar. A eficácia desses sistemas reside na habilidade de identificar quais partes de uma imagem são mais relevantes para responder a uma pergunta específica ou para redigir uma legenda que sintetize o cenário apresentado. Assinale a alternativa que descreve corretamente o funcionamento técnico básico dos modelos multimodais, segundo o material: Questão 2Resposta a. Eles utilizam codificadores especializados para gerar embeddings de cada modalidade e mecanismos de atenção para integrar as informações. b. Eles funcionam por meio da substituição manual de imagens por descrições de texto feitas por especialistas humanos antes do processamento. c. Eles utilizam apenas redes neurais convolucionais para processar textos, descartando o uso de Transformers por serem lentos. d. Eles baseiam-se na exclusão de dados visuais para focar apenas na frequência de palavras positivas e negativas do enunciado. e. Eles
User badge image
mayara juliano kukle

mês passado

Respostas

User badge image

Ed Verified user icon

mês passado

A descrição da questão fala sobre sistemas que convertem diferentes tipos de dados (imagens, sons, texto) em representações vetoriais comuns, usando componentes especializados, e que utilizam mecanismos para identificar partes relevantes da imagem para responder perguntas ou gerar legendas. Analisando as alternativas: a) Eles utilizam codificadores especializados para gerar embeddings de cada modalidade e mecanismos de atenção para integrar as informações. — Esta alternativa está correta, pois descreve o funcionamento técnico básico dos modelos multimodais: codificadores para cada tipo de dado e mecanismos de atenção para combinar as informações. b) Eles funcionam por meio da substituição manual de imagens por descrições de texto feitas por especialistas humanos antes do processamento. — Incorreto, pois o processo é automático, não manual. c) Eles utilizam apenas redes neurais convolucionais para processar textos, descartando o uso de Transformers por serem lentos. — Incorreto, pois Transformers são amplamente usados para texto e multimodalidade. d) Eles baseiam-se na exclusão de dados visuais para focar apenas na frequência de palavras positivas e negativas do enunciado. — Incorreto, pois dados visuais são essenciais nos modelos multimodais. e) Eles — Alternativa incompleta. Portanto, a alternativa correta é: a) Eles utilizam codificadores especializados para gerar embeddings de cada modalidade e mecanismos de atenção para integrar as informações.

Essa resposta te ajudou?

0
Dislike0

Ainda não achou a resposta?

  • Integrado com os principais modelos de IA do mercado
  • Respostas em segundos
  • IA treinada para estudantes brasileiros.
PasseIA logoEvolua sua forma de estudar

Cadastre-se ou realize login

Ainda com dúvidas?

Envie uma pergunta e tenha sua dúvida de estudo respondida!

Mais conteúdos dessa disciplina