Logo Passei Direto
Buscar
Grande parte do sucesso do Spark está relacionado à sua estrutura, que é composta por alguns componentes. O principal deles é o RDD. Sobre este componente, classifique V para as sentenças verdadeiras e F para as falsas: ( ) É uma estrutura física do Spark que guarda informações dos objetos do Spark. Sua única limitação é não possuir um mecanismo para tratamento de falhas. ( ) Possui uma estrutura similar a uma tabela, conhecida como dataset que pode armazenar dados de diferentes tipos. ( ) Fornece suporte a dois tipos de operações: transformação e ação. Quando se aplica uma transformação um novo RDD é criado, mas o conjunto de dados só é alterado se for aplicada uma etapa de ação. Algumas operações de transformação são: SortByKey, FlatMap e GroupByKey enquanto que collect, count e CountByKey são operações de ação. A partir das alternativas abaixo, assinale a CORRETA:
F
V
V
F
A F – V – V – F.
B F – V – V – V.
C V – V – V – F.
D F – F – V – V.
User badge image
Questões para Estudantes

há 2 anos

Respostas

User badge image

Ed Verified user icon

ano passado

Vamos analisar cada uma das afirmações sobre o RDD (Resilient Distributed Dataset) do Apache Spark: ( ) É uma estrutura física do Spark que guarda informações dos objetos do Spark. Sua única limitação é não possuir um mecanismo para tratamento de falhas. É falsa. O RDD é uma abstração que permite o processamento de dados em paralelo, e uma de suas principais características é justamente o suporte a tolerância a falhas, pois ele pode ser reconstruído a partir de dados originais em caso de falha. ( ) Possui uma estrutura similar a uma tabela, conhecida como dataset que pode armazenar dados de diferentes tipos. É verdadeira. O RDD pode ser considerado uma coleção de objetos que podem ser de diferentes tipos, mas a afirmação é um pouco confusa, pois o termo "dataset" é mais associado ao DataFrame, que é uma estrutura tabular. Portanto, essa afirmação é um pouco enganosa, mas pode ser considerada verdadeira em um contexto mais amplo. ( ) Fornece suporte a dois tipos de operações: transformação e ação. Quando se aplica uma transformação um novo RDD é criado, mas o conjunto de dados só é alterado se for aplicada uma etapa de ação. Algumas operações de transformação são: SortByKey, FlatMap e GroupByKey enquanto que collect, count e CountByKey são operações de ação. É verdadeira. Essa afirmação descreve corretamente como funcionam as operações em RDDs. Agora, vamos resumir as classificações: 1. F 2. V 3. V Portanto, a sequência correta é: A) F – V – V – F.

Essa resposta te ajudou?

0
Dislike0

Ainda não achou a resposta?

  • Integrado com os principais modelos de IA do mercado
  • Respostas em segundos
  • IA treinada para estudantes brasileiros.
PasseIA logoEvolua sua forma de estudar

Cadastre-se ou realize login

User badge image

Ed Verified user icon

há 2 anos

A alternativa correta é a letra B: F – V – V – V.

Essa resposta te ajudou?

0
Dislike0

Ainda com dúvidas?

Envie uma pergunta e tenha sua dúvida de estudo respondida!

Essa pergunta também está no material:

Mais perguntas desse material

Nesse sentido, imagine um pequeno cenário: - Um gestor de uma grande empresa alimentícia possui diversos sistemas com grandes volumes de dados de TI (CRM, ERP, Bases relacionais e diversos formatos de arquivos). Ele gostaria de monitorar os clientes que são mais aderentes (ou mais fiéis) à empresa, com informações mais atualizadas possíveis. O objetivo é, além de manter aqueles clientes com maior aderência, aproximar aqueles que porventura estejam um pouco mais distantes da empresa e com real possibilidade de deixarem de ser clientes fixos. Qual seria a solução mais viável para auxiliar esse gestor? A partir das alternativas abaixo, assinale a CORRETA:

A Monitoramento das atividades dos clientes nas redes sociais através da coleta de dados via Spark Streaming, armazenar todos os dados (externos e internos) no HDFS para manter uma base histórica e realizar análises preditivas atribuindo scores para mensurar a aderência do cliente à organização.
B Coleta dos dados estruturados utilizando o HiveQL e armazenamento em batch (lote) utilizando o HDFS do Hadoop e análise tradicional em cluster para agrupar clientes com mais fidelidade em um mesmo grupo, enquanto que outros formam um segundo grupo.
C Aplicação de processos tradicionais de ETL e armazenamento de dados no Data Lake ou Data Warehouse. Posteriormente esses dados podem ser processados via Hadoop MapReduce. Além disso, modelos de Machine Learning podem ser aplicados para prever se um cliente sairá ou não da empresa.
D Construção de uma arquitetura de BI híbrida (lote e dados em tempo real). A coleta de dados poderia ficar a cargo do Sqoop e o armazenamento de dados a cargo do Spark. Os dados podem ser analisados por algoritmos de mineração de dados para mapear as atividades dos clientes.

Os métodos tradicionais de agrupamento (clustering) podem ser implementados por uma diversidade de algoritmos. Relacione a classe de algoritmos com os métodos, associando os itens, conforme o código abaixo: I – Algoritmos DIANA, ROCK. II – Algoritmos DBSCAN, OPTICS. III – Algoritmos Expectation-Maximization (EM), Self-Organization Map (SOM) IV – Algoritmos K-Means, CLARANS. V – Algoritmos STING, WAVECLUSTER. ( ) Métodos hierárquicos. ( ) Métodos baseados em grid. ( ) Métodos de particionamento. ( ) Métodos baseados em modelos. ( ) Métodos baseados em densidade. Assinale a alternativa que apresenta a sequência CORRETA:

A I – V – IV – III – II.
B II – V – III – IV – I.
C I – IV – V – II – III.
D III – IV – II – I – V.

Dessa forma, em termos de projetos: que requisitos e componentes principais uma arquitetura tradicional deve ter? A partir das alternativas abaixo, assinale a CORRETA:

A Alto investimento em infraestrutura para suportar as demandas de Big Data. Implementação de um sólido mecanismo de coleta e armazenamento de dados no Hadoop para processar grandes volumes de dados em tempo real e uma camada de visualização que será útil para gestores de negócio extrair insights.
B Lidar com dados de quaisquer naturezas obtidos a partir de diversas fontes (internas e externas). Implementação de estrutura que suporte armazenamento e processamento em larga escala tanto para dados em lote quanto em fluxo contínuo.
C Capacidade para armazenar e processar grandes volumes de dados entregando a informação certa no tempo certo. Para isso é necessário definir uma camada de extração e ingestão de dados eficiente, política de armazenamento, definição do tipo de análise e uma camada para apresentação de resultados.
D Forte mecanismo de integração de dados para entregar ao gestor de negócios informações de forma transparente e única. É necessário alto investimento em máquinas que possam suportar o armazenamento e processamento paralelo

Os textos acima expõem conceitos relacionados ao Processamento de Linguagem Natural (PLN), em relação a esse conceito e suas aplicações é correto afirmar que: A Um dos campos de aplicação é a análise de sentimentos, ao considerar a questão subjetiva extraindo emoções de um discurso. É um tipo de aplicação ainda pouco consolidada e não possui muitos cases, porém, apresenta grande potencial. B Pode ser aplicada tanto em análise de dados estruturados como não estruturados e realiza algumas etapas, como a extração semântica no texto que observa padrões de escrita em uma frase. C Basicamente, realiza a análise de texto em grandes volumes de dados, por exemplo, análise de posts no Facebook. A PLN é um campo definitivamente consolidado e, portanto, a comunicação homem-máquina é perfeitamente compreendida. D Tem como fundamento compreender o contexto no qual um discurso foi empregado, por meio de análises léxicas, sintáticas, semânticas, etc., como é caso quando deseja-se converter voz em texto.

A
B
C
D

Empresas de muitos ramos têm investido em tecnologias e análise de dados para expandirem seus negócios. Em geral, que circunstâncias-chave tem incentivado empresas a investirem parte de seus recursos em análise de dados? A partir das alternativas abaixo, assinale a CORRETA:

A Automatização de processos, incentivos fiscais e mão de obra barata.
B Algoritmos cada vez mais inteligentes, redução de mão de obra e incremento tecnológico.
C Melhoria dos processos de negócio, aumento de competitividade e o valor que pode ser obtido.
D Mensurar retorno de investimentos, incentivos governamentais e garantia de lucro.

Existem diversos métodos tradicionais que podem ser empregados para análise em cluster e são potencialmente interessantes em cenários de baixa complexidade - com quantidade de dados reduzida. Em relação aos métodos hierárquicos é CORRETO afirmar que:

A Define aleatoriamente um ponto de partida para o parâmetro K e assim tenta otimizar o resultado ao longo das iterações.
B Divide o cluster através de níveis, onde os objetos alocados nos níveis superiores da árvore são mais próximos entre si.
C Agrupa um conjunto de pontos de dados em uma estrutura de árvore (dendograma) e fornece boa capacidade para comunicação dos resultados.
D Apresenta como vantagem a simplicidade e o fato de ser eficiente, mesmo em situações onde o conjunto de dados é significativo.

A partir das opções abaixo, classifique V para as sentenças verdadeiras e F para as falsas:
( ) O Apache Hive é um componente que pode ser integrado ao Hadoop para coletar dados de fontes estruturadas.
( ) O Apache HBase é um banco de dados não relacional propício a ambientes Big Data, uma vez que suporta um grande volume de dados mantendo alto desempenho.
( ) O Apache Sqoop permite mover grandes volumes de dados das fontes para o HDFS.
( ) O Apache Mahout é um componente responsável por trabalhar diretamente com os dados da fonte: extraindo e coletando dados tanto para processamento em lote como em tempo real.
A V – V – F – F.
B F – F – V – V.
C V – V – V – F.
D F – V – F – V.

Relacione a classe de algoritmos com os métodos, associando os itens, conforme o código abaixo:
( ) Métodos hierárquicos.
( ) Métodos baseados em grid.
( ) Métodos de particionamento.
( ) Métodos baseados em modelos.
( ) Métodos baseados em densidade.
A I – V – IV – III – II.
B III – IV – II – I – V.
C II – V – III – IV – I.
D I – IV – V – II – III.

Mais conteúdos dessa disciplina