Logo Passei Direto
Buscar

topico 1 capitulo 2

Ferramentas de estudo

Material

Prévia do material em texto

TÓPICO UNIDADE 2 BIG DATA, DADOS E DISTRIBUIÇÃO DE FREQUÊNCIA INTRODUÇÃO Olá, acadêmico! A partir de agora, abordaremos sobre processos de coleta e análise dos dados. Além disso, aprenderemos sobre a elaboração e a in- terpretação gráfica dos dados e as diferentes formas de representação. Você já imaginou quantos dados históricos são armazenados para auxiliar os gestores na tomada de decisões no presente e com repercussões no furuto? Pois é. Há estudiosos que apontam um crescimento exponencial na criação e na utilização dos dados virtuais, de modo que, ao longo dos últimos dez anos, foram criados mais dados do que em toda a história humana. Sem dúvida, esse proces- so foi permitido devido ao avanço tecnológico em criação e armazenamento de dados virtualizados. Assim, organizações públicas e privadas se beneficiam desse volume de dados virtuais para agilizar processos administrativos. Com isso, essas organi- zações podem fazer uso dos dados para planejar, executar e tomar decisões mais assertivas quanto à oferta de produtos e serviços. A partir dessa necessidade, armazenamento de dados vem sendo um tema amplamente discutido, de movo que não limite a operação de negócios. A partir disso, surgiu 0 termo Big Data (Grande Base de Dados). Por meio de um Big Data, empresas podem ter maiores evidências nos dados de comportamentos passados, fornecendo um suporte para os planos e de- cisões do presente de movo a influenciar o futuro. Para que se possa transformar dados e informações úteis para a tomada de decisão, faz-se necessário a organi- zação ea estruturação dos dados. Esses dados podem ser obtidos de diversas fon- tes, como preferências, gostos, comportamentos, disposição a pagar, entre outros fatores dos clientes e potenciais consumidores. Portanto, este tópico se apropria de termos discutidos na Unidade 1 para avançar com a discussão sobre a organização de dados, estutura, Big Data e dis- tribuição de frequência. Por isso, temos, à disposição, vários materiais para lhe auxiliar nesta caminhada, além da nossa central de atendimento. Lembre-se: não basta saber, é preciso saber fazer! Bons estudos!2 BIG DATA Big Data ou, em Grande Base de Dados, refere-se a um amplo conjunto de dados em constante crescimento, ou seja, uma base de dados que acu- mula informações ao longo do tempo. Isso abrange um amplo volume de informa- ções que são criadas e coletadas de diferentes origens, sendo, portanto, frequente- mente caracterizado por múltiplas fontes de diferentes formatos 2019). A maioria dos dados são armazenadas em base de dados computacionais sendo analisadas com a utilização de um software específico que seja capaz de cessar um grande volume de dados. Com dados analistas ou profis- sionais especializados, como caso de estatísticos, podem analisar as relações dos dados por de comportamentos, tais como dados demográficos e histórico de compras, se fabrica interna ou dentre outras. Em esses dados permitem que empresas avaliem tendências para a tomada de decisão (SE- GAL 2019). o conceito do Big Data pode ser avaliado dentro de uma terminologia chamada de 6 Vs (seis "V") (NISHADI, conforme apresentado na Figura 1. Esse tema tem sido amplamente discutido na indústria da computação como fatores determinantes que definem Big Data, no qual, inicialmente, modelo foi criado com termos volume, velocidade e variedade da informação. Posterior- mente, foram adicionados termos de veracidade, variabilidade e valores dos dados como fatores de definição de um Big Data (LEE, 2017). Cada termo tem por significado: Volume: refere-se ao montante de dados que um negócio cria, manipula e gerencia. Velocidade: refere-se à velocidade no qual dados são gerados e processados. Variedade: abrange diversos tipos de dados, como dados continuos, intervalos entre outros. consiste na acurácia (precisão) e confiabilidade dos dados. Variabilidade: refere-se na variação existente dentro de uma variável. Valor aborda sobre valor que dados podem fornecer a um negócio, como ter acesso a informações para uma tomada de decisão (NISHADI, 2018).DADOS DE FIGURA MODELO DOS 6 Vs DO BIG DATA Volume Valor Variedade 6Vs do Big data Variabilidade Velocidade Veracidade Nishad 1147) Os dados passam por um de ciclo de vida. De acordo com a Fi- gura 2, os dados são coletados em um primeiro momento (coleta de dados). Na sequência, os dados devem ser armazenados em uma grande base de dados (ar- mazenamento de dados). Após, os dados são tratados e analisados (análise de dados). Por fim, esses dados permitem conclusões e criação de novos conheci- mentos (criação de conhecimento). FIGURA 2 CICLO DE VIDA DOS DADOS Coleta de de Criação de dados de dados dados conhecimento Nishad (2018) p. 1147) Como destacado na figura anterior, analistas de dados avaliam rela- cionamento de um amplo conjunto de dados. Esses testes podem ser variados, mas, em sintese, buscam avaliar a correlação existente entre dados, possíveis tendências, grupos, similaridades, diferenças entre grupos, entre outros aspectos (SEGAL, 2019). Entretanto, para que todo esse processo possa gerar novos conhe-cimentos, faz-se necessário compreender conceitos dos dois tipos de dados dados estruturados e não estruturados na seção seguir. 3 DADOS ESTRUTURADOS E NÃO ESTRUTURADOS De acordo com Lock e Lock (2017), estima-se que a quantidade de dados novos é dobrada a cada dois anos, ou seja, mais do que a soma de dados gerados ao longo dos últimos cinco mil anos. Um dos principais motivos é a dis- ponibilidade desses dados compartilhados na internet, mas, sobretudo, da cone- xão de dispositivos chamados de Internet das Coisas (ou Internet of things em inglês) com as redes virtuais. Por sua vez, a coleta e análise eficazes dos dados são ferramentas que po- dem levar organizações a obterem informações decisivas LOCK, 2017). Os dados em si são chamados de precedentes a informação, ou seja, refe- rem-se a uma coleção de observações, sejam por meio de medidas, res- postas de pesquisa etc. (TRIOLA, 2014). Os dados apresentam-se de forma bruta, sem qualquer significado aparente LOCK: LOCK, 2017). Para gerar alguma informação, os dados precisam ser coletados, organi- zados, tratados e analisados. Obviamente, tipos de análise dependem do tipo de informação que se deseja gerar, entretanto, processo de coleta, organização e tratamento ocorre de forma similar. Apenas com relação à origem dos dados, estes podem ser classificados em dados estruturados e não estruturados, como será visto no subtópico a seguir. 3.1 DADOS ESTRUTURADOS Os dados estruturados referem-se aos dados obtidos em fontes previa- mente organizadas e padronizadas. A formatação dos dados antes da coleta de dados é o que caracteriza essa classificação. A natureza destes dados é, geralmen- te, em ordem numérica (SEGAL, 2019). Esses dados podem ser obtidos por meio de relatórios de sistemas de gerenciamento de organizações (ERPs), dados de sistema, organização de planilhas entre outros. TABELA DADOS ESTRUTURADOS Código Nome Idade (anos) Grau 1 João 18 Bacharel 2 Davi 31 Doutor 3 Roberto 51 Doutor 4 Ricardo 26 Mestre 5 Maicon 19 Tecnólogo FONTE Adaptado de Cardoso (2007)Como é perceber na Tabela 1, dados estão organizados em um formato padronizado, caracterizando-o em uma classificação de dados es- truturados. Portanto, suponha que, mensalmente, uma organização consulta um relatório com os empregados, levando em conta que 0 software programado para fornecer relatórios neste layout e que, em todas as situações, relatórios apresentam o código de colaborador, nome, idade e formação. Apesar desse for- mato de dados fornecer informações prontas para análise, ele possui limitações de dados e uma geração limitada de informações quando comparados com a clas- sificação de dados não estruturados (LEE, 2017). 3.2 DADOS NÃO ESTRUTURADOS Por sua vez, os dados não estruturados referem-se a dados obtidos sem uma formatação pré-definida, ou seja, um conjunto de dados é obtido e requer uma "organização" ou "separação" dos dados úteis para análise. Esse conjunto de dados se diferencia do anterior por haver um conjunto de etapas adicionais na coleta, organização e preparação dos dados para a análise (LEE, 2017). Dessa maneira, dados não estruturados requerem algumas etapas de organização de dados após a sua coleta. Veja como exemplo, a Tabela na qual é apresentado um texto com dados sem qualquer padronização e formatação. Essa formatação pode ser classificada por meio de uma linguagem de programação computacional capaz de minimamente organizar os dados chamado de dados semiestruturados (CARDOSO, 2007). TABELA DADOS NÃO ESTRUTURADOS Dados não estruturados Dados semiestruturados A universidade possui 5600 alunos. número de identificação de João João o número de identificação 18 de Davi número ele tem 31 anos e é Doutor. Roberto é 3, ele tem 51 anos e também possui 0 mesmo diploma que Davi. Doutor FONTE Cardoso Os dados não estruturados podem ser coletados de diversas fontes, como redes sociais e outras páginas da web qual podem ser transformados em in-formações. Em geral, esse tipo de dados é recomendado para organizações que necessitam avaliar comportamento dos seus clientes, como preferências, neces- sidades e desejos (SEGAL, 2019). Todavia, que fazer com dados coletados? Na sequência, abordaremos sobre a organização de dados. 4 ORGANIZAÇÃO DOS DADOS Após a coleta de dados, faz-se necessário a organização dos casos e variá- veis em uma base de dados. Entretanto, o que significa casos e variáveis? DICAS Os casos são respondentes da dados que obtidos a partir da de um instrumento de pesquisa For correspondem a uma registrada avalada cada LOCK Para tornar mais clara a diferença entre casos e variáveis, note exemplo no Quadro 1. Perceba que existem cinco respondentes de uma pesquisa. Os dados estão em um quadro, em que há variáveis em cada coluna, enquan- to casos para denominar as linhas dos Logo, no exemplo aplicado, casos são as respostas fornecidas pelos respondentes, sendo apresentados na enquanto as variáveis referem-se nas QUADRO EXEMPLO DE CASOS E VARIAVEIS COM DADOS ESTRUTURADOS Sexo Idade (anos) Peso (kg) Respondente 1 Masc 18 105 Respondente 2 Fem 25 58 Respondente 3 Fem 21 56 Respondente 4 Masc 85 75 Respondente 5 Fem ? 77 FONTE Os Exemplo de casos e variáveis com dados não estruturados: imagine 0 mesmo exemplo do Quadro 1, mas com texto corrido. Leve em conta que cinco respondentes participaram de forma voluntária uma pesquisa. primeiro res- pondente era tinha 18 anos de idade e pesava 105 kg. o segundo era doTOPICO DADOS DE sexo feminino, com 25 anos e 58 kg. Na sequência, uma outra respondente com 21 anos e 58 kg. o quarto respondente era um homem de 85 anos com 75 kg. Por último, uma mulher não revelou sua idade, mas indicou seu peso de 77 kg. Como analisar esses dados? Como perceber as variações existentes nos da- dos? Mesmo que esse exemplo apresente apenas cinco casos, isso pode levar a dificul- dades de interpretação. A partir dessa necessidade, a organização dos dados consiste em organizá-los em uma base de dados, quadro ou tabela, conforme apresentado no Quadro 1. Portanto, como primeira etapa do tratamento de dados, você deverá organizar seus dados em um formato que permita análises estatísticas. Usualmen- Microsoft Excel e/ou similar são indicados para tal atividade uma vez que são ferramentas de fácil manipulação desses tipos de dados. Os formatos CVS e TXT são indicados para um futuro processo de importação em software de análise Após realizado a organização dos dados em bases de dados, deve-se pro- ceder uma análise unidirecional, ou seja, uma análise dos casos por variáveis. Os termos missing values e outliers são importantes neste momento. o que esses termos se referem? Enquanto 0 termo missing values refere-se aos valores não for- necidos pelo respondente (valores faltantes), os outliers representam os valores que estão fora de padrão (valores distorcidos) (HAIR et 2009). Vamos tomar o Quadro 1 para esclarecer esses conceitos. Note que há dois outliers, sendo um referente a idade respondente 4 por ter idade muito acima dos demais (85 anos), enquanto outro possui um peso relativamente acima dos demais respondente 1 por seu peso (105 kg). Portanto, a depender do objetivo da pesquisa, sugere-se que esses outliers sejam removidos da amostra para asse- gurar dados normalizados. Caso essas variáveis não sejam determinantes para a pesquisa e não devem interferir nos resultados, esses casos podem ser mantidos. Independentemente do motivo, note que o quinto respondente não forne- ceu sua idade. Essa é uma situação de missings value (valor faltante). Essa situação remete a uma decisão referente a esse caso, sendo aplicar um conjunto de técnicas para tratar esses dados: consiste em excluir o respondente da amostra uma vez que não forne- ceu informações completas. Essa técnica é sugerida quando há falta de dados em várias variáveis. Aplicar média: consiste em aplicar a média de todos os respondentes de uma variável para o caso com dados faltantes. A vantagem da técnica é de apro- veitamento de parte dos dados, porém, não se sabe exatamente motivo da ausência de dados (que também pode revelar algum motivo oculto). A técnica é sugerida quando poucos dados estão faltantes (HAIR et al., 2009).A distribuição de frequência demonstra a distribuição de uma amostra em relação classes ou grupos (CRESPO, 2017). Ou seja, quantos respondentes há em cada classe ou quantas respostas repetidas se encontram em uma determinada classe. Essa análise deve ser feita inicialmente para avaliar a distribuição por classes de um conjunto de dados, se, por exemplo, há algum viés ou tendência nos Para iniciar essa discussão, vamos, primeiramente, abordar conceito de tabela primitiva ROL a partir de um exemplo aplicado. Suponha pesquisa luntária abordada no subtópico anterior com cinco respondentes adicionais, con- forme Quadro 2. QUADRO 2 DADOS DE VOLUNTARIA Sexo Idade (anos) Peso (kg) Respondente 1 Masc 18 105 Respondente 2 Fem 25 58 Respondente 3 Fem 21 56 Respondente 4 85 75 Respondente 5 Fem ? 77 Respondente 6 Masc 45 85 Respondente 7 Masc 29 76 Respondente 8 Masc 17 65 Respondente 9 Fem 53 59 Respondente 10 Fem 61 67 FONTE Os Combase no quadro anterior, qual a menor idade? Qual a maior idade? Qual o menor peso? Qual maior peso? Para responder essas questões você deverá pro- curar valores dentro do quadro, e inclusive a probabilidade de erro na informação é relativamente alta. Essa análise se chama ROL eé apresentada na seção a seguir. 5.1 ANÁLISE ROL A tabela primitiva ROL considera a ordenação destes dados (seja crescen- on decrescente). Veja, por exemplo, o quadro a seguir: 70DADOS QUADRO QUADRO ROL REFERENTE DADOS DE IDADE E PESO Idade (anos) 17 18 21 25 29 45 53 61 85 ? Peso (kg) 56 58 59 65 67 75 76 77 85 105 Os autores Como você pode perceber, 0 Quadro 3 apresenta os mesmos dados do Qua- dro 2, mas de forma ordenada por idade e peso. Note que essa ordenação denomi- nada ROL facilita a compreensão do valor máximo e amplitude dos dados. Logo, torna-se mais fácil e assertiva responder as questões realizadas anteriormente: Qual a menor idade? 17. Qual a maior idade? 85. Qual o menor peso? 56. Qual 0 maior peso? 105. Além disso, é comum analisar a quantidade de individuos segundo uma variá- vel que, nesse caso, poderia ser idade ou peso, como exemplo. Denomina-se frequência 0 número de individuos que possui características de uma variável (CRESPO, 2017). Por exemplo, pode se elaborar um quadro com a distribuição de frequência: QUADRO 4 DISTRIBUIÇÃO DE FREQUÊNCIA POR IDADE Idade (anos) Frequência 17 18 1 21 1 25 1 29 1 45 1 53 1 61 1 85 1 FONTE: Os autores Note que, nesse exemplo, há nove intervalos de classe, quando medidos pela idade do Mas, como fazer essa análise em um volume de dados maior? É possível classificar esses dados em intervalos de análise e, a partir disso, avaliar a distribuição por intervalos. No entanto, como calcular os intervalos de classe? É comum dividir os intervalos em grupos de mesmo tamanho, exceto se há algum interesse do pesquisador em avaliar algum intervalo em específico ou dar ênfase em algum grupo. Suponha que desejamos definir quatro classes de grupos de Isso pode levar a duas maneiras de se estruturar os in- tervalos de classe, uma vez que há individuos em diferentes momentos de suas 71vidas, e considerando uma amostra com jovens, adultos, meia-idade e Para delimitar esses intervalos, será necessário a amplitude total (AT) para obter a amplitude por classe (h), e a relação com número de classes (k). Discutiremos essas etapas na e, após, apresentaremos dois métodos de delimitação de intervalos de frequência. 5.2 NÚMERO OU INTERVALOS DE CLASSE "Classes de frequência ou, simplesmente, classes, são intervalos de va- riação da variável" (CRESPO, 2017, 32). Refere-se ao número de intervalos de classe que pesquisador deseja delimitar sua amostra. cálculo de intervalos de classe tem por objetivo reduzir a distribuição de frequência em grupos me- nores. Como no Quadro 4 apresenta-se nove intervalos de classe (k=9), suponha que pesquisador deseja reduzi-lo para quatro intervalos para facilitar a distribuição e compreensão da amostra. Por fim, a simbolo é atribuido para representar 0 número de intervalos de classe. Esse cálculo é realizado apenas em variáveis e qualitativas nero, idade, cargo etc.) para delimitar intervalos de classificação dos responden- tes e seus respectivos perfis. As variáveis categóricas não necessitam desse trata- mento, pois possuem intervalos NOTA são medidas em uma escala nominal no qual as cate. identificam a sociedade da classe ou de como género e 5.3 AMPLITUDE TOTAL DA DISTRIBUIÇÃO A amplitude total (AT) refere-se na diferença entre limite superior da últi- ma classe (limite superior máximo) limite inferior da primeira classe (limite infe- rior minimo) (CRESPO, 2017). o cálculo é realizado por meio da seguinte AT L(máx) Suponha exemplo de idade do quadro 4: AT 85 17 anos. AT 68 anosDATA 5.4 AMPLITUDE DE UM INTERVALO DE CLASSE A amplitude de um intervalo de classe (h) refere-se na medida do inter- valo que define a classe (CRESPO, 2017). Como 0 número de classes (k) desejado pelos pesquisadores é 4, a amplitude de cada classe (h) é de: h 17 anos de idade. Logo, tem-se a seguinte distribuição por frequência: QUADRO 5 DISTRIBUIÇÃO DE EM INTERVALOS DE CLASSES Classe Frequência 17 34 5 34 51 1 51 68 2 68 85 autores 5.5 TIPOS DE FREQUÊNCIA As frequências podem ser caracterizadas em simples (f) ou relativas (fr), e também frequência simples acumulada (F) e frequência relativa acumulada (Fr). Enquanto as frequências simples "são valores que realmente representam número de dados de cada classe", as frequências relativas "são valores das razões entre as frequências simples e a frequência total" (CRESPO, 2017, P. 35). Veja a aplicação desses dois conceitos no Quadro 6: QUADRO 6 DISTRIBUIÇÃO POR SIMPLES E RELATIVA Classe f fr 17 34 5 0,55 34 51 0,11 51 68 2 68 85 1 0,11 Total T=1 FONTE: autores Perceba que 0 Quadro 6 demonstra a aplicação da distribuição por frequ- ência simples e frequência relativa. Para obter 0 valor da frequência relativa basta dividir valor da frequência de uma classe pelo número total da amostra (9). Porexemplo, no cálculo da primeira classe obteve-se: Por fim, a soma da frequência relativa deve-se obter número inteiro 1, ou se transformado em per- centual deverá akançar Por outro lado, a frequência acumulada (F) considera a soma dos valores ao longo das classes, enquanto a frequência acumulada agrupa valores 20 longo de cada classe. Veja a aplicação no Quadro 7: QUADRO 7 DISTRIBUIÇÃO POR FREQUÊNCIA SIMPLES E RELATIVA Classe f fr F Fr 17 34 5 0,55 5 0,55 1 6 51 68 2 0,22 8 68.85 1 0,11 9 Total T=9 T=1 T=9 FONTE Os autores Essas técnicas podem ser utilizadas manualmente ou com o uso de algum software especializado. E comum utilizar MS Excel para facilitar manuseio de dados, vejamos no próximo subtópico. 6 ANÁLISE DE FREQUÊNCIA COM MS EXCEL MS Excel pode facilitar processo de análise de frequência. Esse sof- tware oferece um amplo conjunto de fórmulas que reduzem 0 tempo de conso- lidação de informações de uma amostra. A seguir, são destacadas algumas das funcionalidades do MS Excel: a) Contar valores: essa função é utilizada para verificar o número de respondentes (n).TORCO DE FIGURA 3 COM MS N A D E F G H Idade N 9 2 17 1 CONT 3 18 1 4 21 1 5 25 1 6 29 1 7 45 1 8 53 1 9 61 1 10 85 1 11 12 13 14 15 Os autores b) Minimo: apresenta 0 limite inferior, ou seja, o valor mais baixo da variável. FIGURA 4 FREQUÊNCIA COM MS EXCEL: A D E F G H 1 Idade Frequência N 9 2 17 1 17 3 18 1 4 21 1 5 25 1 6 29 1 7 45 1 8 53 1 9 61 1 10 85 1 11 12 13 14 FONTE: Os autores c) Máximo: apresenta o limite superior, ou seja, o valor mais alto da variável.2 MEDIDAS DE FIGURA 5 COM MS EXCEL: MÁXIMO A B D E F G H 1 Idade Frequência 9 2 17 1 Mínimo 17 3 18 1 Máximo 85 A2:A10 4 21 1 5 25 1 6 29 1 7 45 1 8 53 1 9 61 1 10 85 1 11 12 13 14 FONTE: Os autores d) Frequência: indica a quantidade de casos de uma amostra a partir de um limite superior. Por exemplo, ao mencionar o valor 10, por exemplo, a fórmula ras- treia e indica quantos casos possuem valor até 10. Veja a aplicação a seguir: FIGURA COM MS EXCEL: ACUMULADA A B D E F G H 1 Idade Frequência N 9 2 17 1 17 3 18 1 Máximo 85 4 21 1 5 25 1 6 29 1 Classe F 7 45 1 17 34 5 8 53 1 34 51 6 9 61 1 51 68 8 10 85 1 68 85 9 11 12 13 14 FONTE: Os autoreso Excel indica apenas a frequência acumulada, ou seja, valor máximo de cada classe é para obter 0 volume de casos em cada classe. Para identificar a frequência por classe basta calcular a diferença entre elas. Por fim, a frequência relativa e a frequência relativa acumulada são calculadas através da relação entre a frequência de uma classe pelo valor total. Veja essas etapas nas Figuras 7,8 e 9: FIGURA 7 COM MS EXCEL: RELATIVA ACUMULADA A B D E F G H 1 Idade Frequência N 9 2 17 1 17 3 18 1 Máximo 85 4 21 1 5 25 1 6 29 1 Classe F Fr 7 45 1 17 34 5 8 1 34 51 6 9 61 1 51 68 8 10 85 1 68 9 11 12 13 14 FONTE: Os autores FIGURA 8 COM MS EXCEL: DISTRIBUIÇÃO DE A D E F G H 1 Idade Frequência 9 2 17 1. Minimo 17 3 1. Máximo 85 4 21 25 6 29 1. Classe f fr F 7 45 17 34 5 5 56% 8 sa 34 51 1 6 67% 9 61 51 68 2 89% 10 as 68 85 9 100% 11 12 13 14 FONTE: Os autores 77FIGURA 9 COM MS EXCEL RELATIVA A C D F G H 1 Idade Frequência N 9 2 17 1 Minimo 17 3 1 4 21 5 25 1 6 29 Classe fr F Fr 7 45 1 17 34 5 5 56% 53 1 34 51 1 6 67% 9 61 1 51 68 2 8 89% 10 1 68 85 1 9 100% 11 9 12 14 FONTE Os autores CASES DE EMPRESAS QUE USAM BIG DATA Veja reais de empresas que usam Big Data para sair na frente da concorrência! Empresas que usam Big Data com toda certeza pos- suem um grande Não é de hoje que as empresas buscam cada vez mais tecnologias. Com tantos avanços, uma empresa deve estar antena- da se não quiser ficar obsoleta rapidamente. No entanto, 0 Big Data ainda é pouco explorado, especialmente no Muitos nem sabem do que se trata. A verdade é: as poucas empresas que investiram no uso do Big Data tiveram resultados expressivos. Confira agora 5 cases incriveis! Eles deixam muito claro como 0 uso correto do Big Data pode set uma enorme vantagem competitiva para uma empresa: TARGETA Target é a segunda maior retail store (rede de varejo) dos Estados Unidos, ficando atrás apenas do Walmart. case dessa marca ficou extre- mamente conhecido por ter realizado algo prever quais clientes estavam Até hoje, há um grande debate sobre privacidade e até onde é correto utilizar as informações dos clientes para tal ações. Contudo, é inegável a genialidade do uso do Big Data. A equipe de análise de dados da rede criou modelos para entender e conhecer a fundo os hábitos de com- pra de seus clientes. Dessa forma, foi criar perfis de comprador, baseando-se em suas compras e dados demográficos, idade e até a situação da vida pessoal da pessoa. Assim, a empresa poderia oferecer ofertas de produtos que cada perfil estava mais propenso a comprar. Foi assim que passaram a mapear quais clientes estavam grávidas, e até qual 0 mês da gestação, baseando-se nos de compra. Apesar de ter gerado muita foi evidente aumento da assertividade das ofertas e maior nú- mero de compras e fidelizações. 2 - AMERICAN EXPRESS AMERICAN EXPRESS A American Express, mais conhecida como Amex, é uma das mais famosas empresas de serviços financeiros dos Estados Imagine a quantidade de dados que uma empresa desse nicho possui? Pensando em como tirar proveito disso, a empresa passou a utilizar a análise de dados e machine learning (aprendizagem da máquina) para tomar importantes decisões. Uma das soluções alcançadas foi detectar fraudes com muito mais facilidade. Com esse recurso, eles percebem que correspondem a transações fraudulentas, pensando em detectar rapidamente para minimizar perdas. Assim, as algoritmos, através do machine learning, aprendem 0 padrão de consumo de cada usuário. Sempre que há algum tipo de transação que foge do usual, usuário e a empresa são notificados.2 Isso fez com que a empresa economizasse milhões! Mas eles não pararam por ai. Com Big Data, viram uma grande oportunidade de di- versificar ainda mais os serviços oferecidos usuário, não se limitando ao crédito. Hoje, a empresa oferece um aplicativo que analisa os dados de compras anteriores e, em seguida, recomenda restaurantes na área que usuário provavelmente desfrutará. Além disso, oferecem cupons e ofertas em outros estabelecimentos e produtos. 3 AMAZON amazon A Amazon é uma empresa transnacional de comércio dos Estados Unidos. Hoje, é uma empresa que vende de tudo um pouco. Ela tem se destacado cada vez mais pelo uso inteligente de tecnologia e Big Data. Re- centemente, se tornou a segunda empresa americana a alcançar valor de mercado de 1 trilhão, 0 que deixa claro sua força. E nada disso teria sido possível sem 0 uso dos dados. Os algoritmos criados pela Amazon possuem principalmente a função de levar as ofertas mais personalizadas possível para cada pessoa. Resultado: cliente satisfeito, empresa vendendo mais. Através de Machine Learning (aprendizagem da máquina) e do ar- mazenamento em cloud computing (computação nas nuvens), eles apren- dem como cada consumidor se comporta. É possível até prever que tipo de mercadoria cliente poderia se interessar. No futuro, objetivo é entregar de produtos para clientes sem que eles tenham sequer pedido! E interessante ressaltar que a Amazon tem investido também em disponibili- zar a mesma tecnologia que usam para outros e-commerces. Dessa maneira, comprovam sua eficácia em diversos niveis e mostram ainda como expan- dir a oferta de serviços com 0 Big4 DELTA AIRLINES DELTA No ramo da aviação, muitas vezes dificil encontrar pontos que fa- çam uma empresa realmente se diferenciar da outra. Pensando em como além, a empresa Delta em como resolver uma das maiores dores dos passageiros quando viajam: bagagem extraviada. Com uma solução simples, porém muito inteligente e eficaz, eles pensaram em um sistema que permite cada passageiro acompanhar onde está sua bagagem. Além de deixar as pes- soas mais tranquilas, ajudou a evitar grandes dores de cabeça para a empresa. Pode parecer simples, mas esse recurso é sim uma utilização muito inteligen- te do Big Data. São mais de 130 milhões de bagagens despachadas por ano, um grande volume de informações com cada uma delas. Isso mostra como 0 Big Data não está distante de nossa realidade: pode ser utilizado por qual- quer tipo de empresa, sem gastar milhões de reais. Uma solução barata e que diferenciou a Delta como uma empresa centrada no 5 SHELLCRÁNCOS MEDIDAS DE Pra quem pensa que empresas que usam Big Data são apenas as mais novas ou muito ligadas ao digital, está muito enganado. A Shell, uma das maiores empresas do mundo passou a usar 0 Big Data para reduzir consideravelmente seus gastos de operação. Para perfurar um lo- cal para extração de petróleo, além de muito caro ocasiona em um grande impacto ambiental. Para minimizar os riscos e diminuir custos, é preciso estudar bem quais áreas estão propensas a entregarem melhor resultado. Assim, com a análise, a Shell monitora as ondas de baixa cia abaixo da superficie da Terra. Essas ondas se registram de maneira di- ferente nos sensores enquanto viajam pela crosta terrestre. Dessa forma, podem prever o tamanho provável dos recursos de petróleo e gás. FONTE: em: 82RESUMO DO TÓPICO 1 Neste tópico, você aprendeu que: o Big Data consiste em um grande base de dados onde são acumulados dados de múltiplas variáveis ao longo do tempo. o Big Data pode auxiliar empresas a tomarem decisões pautadas em dados históricos. Uma base de dados pode ser formada com dados estruturados assim como não estruturados. Enquanto os dados estruturados são criados e armazenados de forma padronizada, os dados não estruturados são dados que precisam de etapas de tratamento e organização em base de dados para posterior análise. A organização de dados torna-se fundamental para análise estatística posterior. Os conceitos de Outlier e Missing values foram apresentados como etapas de análise univariada, ou seja, para cada variável. Enquanto outlier refere-se nos dados que fogem dos padrões normais, missing values são os dados faltantes em casos. distribuição de frequência refere-se na distribuição de casos ou respondentes por intervalos de classes. Em caso de variáveis continuas e qualitativas, torna-se necessário a definição de classes. Os conceitos de intervalos de classe, amplitude total, amplitude por intervalo de classe, e tipos de frequência foram discutidos. 83

Mais conteúdos dessa disciplina