Prévia do material em texto
Data Lake Ecossistema Hadoop É um repositório que armazena dados brutos Yarn gerencia recursos e em seu formato agenda serviços no ambiente natural. Hadoop. Armazena dados Pig facilita a manipulação e variados, incluindo consulta de dados em Big objetos multimídia e Data. arquivos diversos. Hive funciona como data Não exige que warehouse para consultas e dados estejam análises estruturadas. relacionados ou HBase, Cassandra e MongoDB organizados por são bancos distribuídos assunto. usados no ecossistema. Diferente de bancos relacionais, não possui esquemas de tabelas Big Conceitos Fundamentais Os 5 Vs do Big Data Big Data envolve grande volume, variedade e velocidade de dados. Data Volume: grande quantidade de dados gerados continuamente. Inclui dados estruturados e não Velocidade: rapidez no estruturados, como imagens e processamento e geração de informações. Refere-se também às tecnologias Variedade: diferentes tipos e para processar esses dados em fontes de dados, estruturados larga escala. e não estruturados. Os dados podem ser estruturados, Valor: importância de extrair semiestruturados ou não informações úteis para estruturados. negócio. Objetivos Estratégicos Big Data permite gerar preços e ofertas baseados em hábitos reais dos clientes. Melhora a assertividade no Bancos NoSQL Implantação de Big Data de produtos e Projetados para estratégias de marketing. Identificar desafios e priorizar armazenar dados não Reduz tempo gasto na problemas de negócio é O primeiro prospecção de clientes com passo. estruturados com modelos específicos. análises precisas. Escolher ferramentas inteligentes Proporciona conhecimento para coleta, processamento e Principais categorias: chave-valor, documentos, profundo sobre audiência, análise de dados. grafos e orientados a concorrentes e mercado. Reconhecer a relevância dos dados coluna. para decisões estratégicas eficazes. Não seguem as formas normais e a normalização Utilizar dados internos e dos bancos relacionais. externos para enriquecer a tomada de decisão. Exemplos incluem Cassandra, MongoDB e HBase, bancos distribuídos e escaláveis.