Prévia do material em texto
Prova Impressa GABARITO | Avaliação II - Individual (Cod.:1598554) Peso da Avaliação 1,50 Prova 121370037 Qtd. de Questões 10 Acertos/Erros 9/1 Nota 9,00 No processamento de grandes volumes de dados, o Hadoop serve como uma estrutura de código aberto para armazenamento e processamento distribuído. Dentro dele, o MapReduce é um modelo de programação essencial para o processamento paralelo. Juntos, eles permitem que empresas analisem Big Data de forma eficiente, otimizando o uso de vastas quantidades de informações. Considerando o MapReduce e a utilização do Hadoop, analise as afirmativas a seguir: I. Na implementação do MapReduce, apenas pode ser utilizado do Apache Hadoop. II. MapReduce é um modelo de programação para dados distribuídos. III. Utilizando o MapReduce, é possível simplificar escrita de aplicações que processam uma vasta quantidade de dados em centralizados. IV. O Apache Hadoop é um framework para big data que utiliza do modelo MapReduce. V. A implementação do MapReduce não está limitada ao framework ou linguagem de programação. É correto o que se afirma em: A III, IV e V, apenas. B I, II e IV, apenas. C II, III e V, apenas. D II, IV e V, apenas. E I, II e III, apenas. O armazenamento de grandes volumes de dados, conhecido como Big Data, envolve a gestão eficiente de quantidades massivas de informações, que variam em tipos e exigem processamento ágil. O Big Data é caracterizado por múltiplos componentes que influenciam a forma como os dados são armazenados, processados e utilizados. Esses componentes abordam tanto a escala e a diversidade dos dados quanto a velocidade com que são gerados e analisados. O objetivo final é possibilitar o uso desses dados para gerar insights valiosos, otimizando processos de decisão e inovação. Fonte: SILBERSCHATZ, A. Sistema de banco de dados. Rio de Janeiro: GEN; LTC, 2020. VOLTAR A+Aumentar, FonteAlterar modo de visualização 1 2 05/08/2026, 22:34 Avaliação II - Individual about:blank 1/7 Com base nos fundamentos do Big Data, assinale a alternativa correta: A Velocidade no contexto do Big Data indica a necessidade de uma taxa alta de transmissão e análise de dados, como ocorre em sistemas em tempo real. B O conceito de Big Data refere-se apenas à capacidade de armazenar dados estruturados em grandes volumes, com baixa diversidade de formatos. C A variedade no Big Data limita-se ao armazenamento de dados exclusivamente estruturados, como tabelas e planilhas. D Veracidade no Big Data refere-se à quantidade total de dados armazenados, sem considerar sua confiabilidade. E O conceito de valor no Big Data significa que todos os dados gerados têm um impacto significativo e devem ser armazenados e processados. O particionamento de dados é composto por um conjunto de técnicas de gestão para grandes volumes de informações, consistindo na divisão de um conjunto de dados extenso em unidades menores e mais gerenciáveis, designadas como partições. Sobre o particionamento de dados, analise as afirmativas a seguir: I. As partições podem acontecer de maneira horizontal, vertical ou funcional. II. O scaleup se refere à escalabilidade e capacidade de medir a expansão da capacidade de um computador em processar e armazenar dados. III. O particionamento pode elevar muito o custo total de propriedade de dados. IV. O grande volume de dados leva ao particionamento e distribuição de dados no contexto de big data. V. Durante um particionamento de dados, o banco de dados deve estar unificado em um mesmo servidor. É correto o que se afirma em: A II, IV e V, apenas. B II, III e V, apenas. C I, III e V, apenas. D I, II e III, apenas. 3 05/08/2026, 22:34 Avaliação II - Individual about:blank 2/7 E I, II e IV, apenas. O particionamento é uma estratégia comum utilizada por big data, na qual pode somar diferentes equipamentos de hardware trabalhando em conjunto por uma estrutura lógica que trabalha em conjunto, não causando impactos nas aplicações. Fonte: BAER, H. Particionamento no banco de dados Oracle 11g. Oracle, São Paulo, jun. 2007. Disponível em: https://www.oracle.com/technetwork/pt/database/enterprise- edition/documentation/particionamento-banco-de-dados-11g-432098-ptb.pdf?source=ad:p as:go:dg:bd+:ow:lp:cpo. Acesso em: 1 ago. 2025. Considerando o uso de particionamento de dados, avalie as asserções a seguir e a relação proposta entre elas: I. Na visão de um administrador de banco de dados, um conjunto de dados particionados possui várias partes que podem ser gerenciadas individualmente ou em conjunto. PORQUE II. No entanto, da perspectiva do aplicativo, uma tabela particionada é idêntica a uma tabela não particionada. A respeito dessas asserções, assinale a opção correta: A A asserção I é uma proposição falsa, e a II é uma proposição verdadeira. B As asserções I e II são verdadeiras, e a II é uma justificativa correta da I. C As asserções I e II são falsas. D As asserções I e II são verdadeiras, mas a II não é uma justificativa correta da I. E A asserção I é uma proposição verdadeira, e a II é uma proposição falsa. Os bancos de dados orientados a colunas oferecem uma abordagem diferenciada para o armazenamento e recuperação de grandes volumes de dados, organizando as informações em colunas ao invés de linhas. Esse tipo de estrutura favorece o processamento de consultas analíticas, particularmente em ambientes de Big Data. Além disso, alguns bancos de dados orientados a colunas, como o Apache Cassandra, são conhecidos por suas características específicas, como a capacidade de operar de forma distribuída e a adaptação a grandes volumes de dados, o que os torna ideais para aplicações que exigem alta disponibilidade e flexibilidade. Fonte: SILVA, L. F. C. et al. Banco de dados não relacional. Porto Alegre: SAGAH, 2021 Sobre bancos de dados orientados a colunas e o Apache Cassandra, analise as afirmativas a seguir: 4 Revisar Conteúdo do Livro 5 05/08/2026, 22:34 Avaliação II - Individual about:blank 3/7 I. Bancos de dados orientados a colunas são mais indicados para análises de grandes volumes de dados, pois permitem a recuperação rápida de subconjuntos específicos em vez de linhas inteiras. II. O Apache Cassandra foi projetado para garantir a escalabilidade horizontal e alta disponibilidade em ambientes distribuídos, facilitando a recuperação de dados mesmo em cenários de falha. III. Bancos de dados orientados a colunas limitam a capacidade de adaptar o esquema, pois cada linha deve ter o mesmo conjunto de colunas, o que é diferente dos bancos relacionais. IV. A arquitetura do Apache Cassandra garante uma estrutura centralizada, focada em um ponto único de falha, para melhorar o desempenho em grandes plataformas on-line. É correto o que se afirma em: A II e IV, apenas. B I, II, III e IV. C III e IV, apenas. D I e II, apenas. E I, II e III, apenas. Os Big Datas possuem um conjunto de dimensões que devem ser consideradas para um comportamento ideal, permitindo assim uma alta performance e apoio à tomada de decisão. Essas dimensões costumam ser representadas com características que se utilizam da letra V, sendo 3 dimensões principais e 3 dimensões secundárias. Considerando as 3 dimensões principais de big data, analise as opções a seguir: I. Volume. II. Veracidade. III. Velocidade. IV. Valor. V. Variedade. É correto o que se afirma em: A I, III e V, apenas. B II, III e IV, apenas. C I, IV e V, apenas. 6 05/08/2026, 22:34 Avaliação II - Individual about:blank 4/7 D II, III e IV, apenas. E III, IV e V, apenas. O Spark Streaming é uma extensão do Apache Spark que possibilita o processamento escalável e tolerante a falhas de fluxos contínuos de dados em tempo real. De acordo com a documentação do Apache Spark Streaming, o framework torna simples o desenvolvimento de aplicações em stream de dados de alta taxa de transferência, de forma que as aplicações sejam escaláveis e tolerantes a falhas. Considerando o Spark Streaming, analise as afirmativas a seguir: I. Os pontosde verificação são completamente diferentes dos pontos de verificação dos jogos computacionais, em que o estado do jogo é gravado para que possa ser o ponto de retomada caso o jogador falhe. II. As variáveis de transmissão podem ser utilizadas como uma forma pouco eficiente de manter um grande conjunto de dados em cada um dos nós. III. Algumas das técnicas do Spark envolvem armazenamento de dados em cache, utilização de acumuladores, variáveis de transmissão e pontos de verificação. IV. O armazenamento em cache é útil para dados que precisem ser reprocessados múltiplas vezes, o que gera ganho de desempenho para a aplicação. V. O Spark Streaming não utiliza o conceito de acumuladores para implementar contadores e operações de soma. É correto o que se afirma em: A II e III, apenas. B IV e V, apenas. C III e V, apenas. D III e IV, apenas. E I e II, apenas. Tradicionalmente, o Hadoop Distributed File System (HDFS) dominou ambientes on-premises, otimizado para grandes volumes e processamento em lote. Contudo, a ascensão dos serviços de armazenamento em nuvem oferece alternativas flexíveis e escaláveis. A decisão entre HDFS local e a nuvem envolve avaliar custos, desempenho, gerenciamento e escalabilidade para as crescentes demandas de dados. 7 8 05/08/2026, 22:34 Avaliação II - Individual about:blank 5/7 Assinale a alternativa correta que apresenta uma vantagem do uso do HDFS: A Alto acesso à informação através de ferramentas web-based. B Alta disponibilidade e tolerância a falhas. C Menor custo de armazenamento de TB/mês em nuvem. D Funciona perfeitamente durante mudanças de ambiente. E Maior distribuição global. O particionamento de dados é uma técnica fundamental que nos permite dividir um grande conjunto de dados em partes menores e mais gerenciáveis, chamadas de partições. Essa estratégia não apenas melhora a eficiência das consultas, mas também facilita a distribuição dos dados por múltiplos servidores, otimizando o uso de recursos e aumentando a resiliência do sistema. Considerando os tipos de particionamento, qual deles utiliza-se de shardings como estratégia de fragmentação? A Particionamento vertical. B Particionamento lateral. C Particionamento horizontal. D Particionamento dimensional. E Particionamento funcional. O particionamento de dados é uma técnica elementar que visa quebrar um vasto volume de informações em segmentos menores e mais fáceis de administrar, conhecidos como partições. Essa abordagem não só acelera a execução de consultas, mas também simplifica a dispersão dos dados por diversos servidores, resultando em uma utilização mais eficiente dos recursos e uma maior robustez do sistema. Considerando os tipos de particionamento, qual deles cria subtabelas derivadas de uma central? 9 10 05/08/2026, 22:34 Avaliação II - Individual about:blank 6/7 A Particionamento lateral. B Particionamento vertical. C Particionamento dimensional. D Particionamento horizontal. E Particionamento funcional. Imprimir 05/08/2026, 22:34 Avaliação II - Individual about:blank 7/7