Prévia do material em texto
PROGRAMAÇÃO E BANCO DE DADOS Priscila Gonçalves Mineração de dados Objetivos de aprendizagem Ao final deste texto, você deve apresentar os seguintes aprendizados: Identificar as principais etapas do processo de mineração de dados. Descrever o processo de descoberta de conhecimento. Definir o conceito e a aplicação de Big Data. Introdução O número de dados produzidos pela sociedade, tanto por usuários (pes- soas) quanto pelas organizações (empresas), tem aumentado cada dia mais. Nesse contexto, insere-se a área de mineração de dados, que se dedica a explorá-los e analisá-los, e surgiu o termo Big Data, utilizado para descrever grandes volumes de dados. Neste capítulo, você vai estudar as principais etapas do processo de mineração de dados, vai aprender a descrever o processo de descoberta do conhecimento e o conceito e a aplicação de Big Data. As principais etapas do processo de mineração de dados A análise de dados exploratória é uma subárea da estatística à qual a mineração de dados (em inglês, Data Mining) está relacionada. A mineração de dados emergiu da intersecção de três áreas: estatística clássica, inteligência artifi cial e aprendizado de máquina. A mineração de dados está relacionada, também, às áreas da inteligência artificial que são chamadas de descoberta de conhecimento e aprendizagem de máquina. O termo mineração de dados foi criado para os estágios de des- coberta do processo de KDD (Knowledge Discovery in Databases), de modo que a mineração de dados faz parte desse processo, como mostra a Figura 1. C08_Mineracao_Dados.indd 1 10/01/2019 09:43:45 Figura 1. Relação existente entre KDD e Data Mining (mineração de dados). Fonte: Caroline (2014, documento on-line). Dentre as características mais importantes da mineração de dados, está o grande volume de dados e a capacidade de mudança de escala com relação ao tamanho dos dados. Algoritmos têm a capacidade de mudança de escala, mas a mineração é muito mais do que aplicar algoritmos, pois, geralmente, os dados contêm ruído ou estão incompletos, sendo provável que padrões sejam perdidos, de modo que a confiabilidade será baixa. Logo, o analista precisa tomar a decisão sobre quais tipos de algoritmos de mineração serão necessários, aplicando-os em um conjunto de amostra de dados específico, sintetizando os resultados, aplicando ferramentas de apoio à decisão e mineração, iterando o processo. Assim, as principais etapas do processo de mineração podem ser resumidas como: tomada de decisão do analista sobre quais algoritmos serão necessários; aplicação dos algoritmos em um conjunto de amostra de dados e va- riáveis específicos; síntese dos resultados; aplicação de mais ferramentas de apoio à decisão de mineração; iteração do processo. Mineração de dados2 C08_Mineracao_Dados.indd 2 10/01/2019 09:43:45 A Figura 2, a seguir, representa a multidisciplinaridade da mineração de dados. Figura 2. Multidisciplinaridade da mineração de dados. Fonte: Castro e Ferrari (2016). Pode-se pensar nas diferentes tarefas de mineração de dados como consultas com- plexas, com especificação em alto nível, com parâmetros definidos pelo usuário e os algoritmos especializados que serão implementados a elas. O processo de descoberta de conhecimento (KDD) A mineração de dados utiliza, como base para seus trabalhos, experimentos de estatística, inteligência artifi cial, máquina de estado e banco de dados para construir seu modelo. Segundo Fayyada, Piatetsky-Shapiro e Smyth (1996 apud BRITO, 2012, documento on-line), “KDD é um processo, de várias etapas, não trivial, in- terativo e iterativo, para identificação de padrões compreensíveis, válidos, 3Mineração de dados C08_Mineracao_Dados.indd 3 10/01/2019 09:43:46 novos e potencialmente úteis a partir de grandes conjuntos de dados”. A característica “não trivial” diz respeito à complexidade existente na execução e manutenção dos processos de KDD; “interativo” representa a relevância de possuir um elemento que controle o processo; “iterativo” indica a possibilidade de repetições em qualquer uma das etapas do processo; e “conhecimento útil” aponta para a indicação de que o objetivo foi alcançado. A fase mais importante do processo de KDD é a mineração de dados aplicada, pois é nela que se utilizam algoritmos e determinada técnica que tem como objetivo elaborar um modelo para representar um conjunto de dados. Essa fase baseia-se em técnicas de estatística, inteligência artificial, computação paralela e máquina de estado, construindo um histórico de pesquisas relacionadas a essas áreas. Busca padrões, relacionamentos entre dados, anomalias e regras, tendo como objetivo encontrar informações ocultas que sejam relevantes para tomadas de decisões. O processo de descoberta de conhecimento útil de dados e mineração de dados (aplicação de algoritmos para extrair modelos de dados) pode ser dis- tribuído em quatro etapas (Figura 3) (RAMAKRISHNAN; GEHRKE, 2013): Seleção dos dados: subconjunto objetivado dos dados; os atributos de inte- resse são identificados, examinando-se o conjunto de dados bruto inteiro. Pré-processamento: nessa etapa, o ruído e as exceções são removidos, os valores de campo são transformados em unidades comuns e alguns campos são criados pela combinação de campos existentes, o que facilita a análise. Geralmente, dados são dispostos em um formato relacional e tabelas podem ser combinadas em uma etapa de desnormalização. Nessa etapa, ocorrem as decisões de estratégias nos casos de campos omissos nos dados e são consideradas sequências temporais nos dados. Transformação: é a etapa em que ocorre o armazenamento dos dados de forma a facilitar a utilização das técnicas de mineração de dados. Procuram-se atributos úteis nos dados, considerando os objetivos a serem alcançados. São utilizados métodos de transformação, tendo em vista a redução do número efetivo de variáveis, e procuram-se representações invariantes para os dados. Mineração de dados: nessa etapa, são aplicados os algoritmos de mineração de dados para extrair padrões com os seguintes objetivos: ■ Regressão: aprendizagem de uma função que faça o mapeamento de dados em uma variável de previsão. ■ Clusterização ou segmentação: identifica um conjunto finito de categorias ou clusters para descrição de dados. Mineração de dados4 C08_Mineracao_Dados.indd 4 10/01/2019 09:43:46 ■ Sumarização: são utilizados métodos para procurar uma descrição compacta para um subconjunto de dados. ■ Modelagem de dependências ou associações: busca por um modelo que descreva de forma assertiva as dependências significativas entre variáveis. ■ Detecção de alterações e divergências: descoberta das alterações significativas nos dados a partir dos valores que foram medidos. Interpretação e avaliação: os padrões são apresentados para os usuá- rios finais de forma inteligível por meio de visualização. Nessa etapa, ocorre a consolidação do conhecimento descoberto, a incorporação do mesmo no sistema ou uma elaboração de relatórios para as partes interessadas. Também ocorre a verificação e a resolução de conflitos com conhecimento previamente extraído. Figura 3. Etapas do KDD. Fonte: Fayyad, Piatetsky-Shapiro e Smyth (1996 apud BRITO, 2012, documento on-line). Para saber mais a respeito das etapas do processo de descoberta do conhecimento, acesse o link a seguir. https://goo.gl/uuVd1A 5Mineração de dados C08_Mineracao_Dados.indd 5 10/01/2019 09:43:46 Conceito e a aplicação de Big Data O termo Big Data refere-se a um conjunto de dados gerados e armazenados muito grande e no qual os aplicativos de processamento desses dados tradicionais ainda não conseguem atuar em um tempo aceitável. O aumento exponencial da quanti- dade de dados gerados a cada minuto no mundo está relacionado ao surgimento do termo Big Data, o que representa uma nova era na sociedade, na qual os dados transformam-se em informações valiosas, mudandoa forma como agimos, atuando sobre as tomadas de decisões e impactando, inclusive, na economia e na ciência. No mundo atual, o Big Data passou a ser essencial para as relações econômicas e sociais, representando evolução nos sistemas de negócio e na ciência e tecnologia. Ferramentas de Big Data são de extrema importância na definição de es- tratégias de marketing, para o aumento de produtividade, na redução de custos e na tomada de decisões mais inteligentes, gerando valor para os negócios. A definição de Big Data está relacionada aos seguintes conceitos: Volume: grande quantidade de dados gerados. Variedade: fontes de dados variadas, aumentando a complexidade. Velocidade: com o enorme volume e variedade de dados, o processa- mento deve ser ágil, para gerar as informações necessárias. Veracidade: ligada diretamente a quanto a informação é verdadeira e fidedigna. Valor: valor obtido a partir desses dados, informação útil. As instituições estão investindo cada vez mais em Big Data por notarem que as consequências podem significar futuro próspero para os negócios, melhorando a prestação de informações aos gestores e auxiliando, dessa forma, na tomada de decisões com dados reais e precisos. Pode-se citar um exemplo de utilização de Big Data em um terremoto ocorrido no Haiti, em que pesquisadores americanos fizeram uso de geolocalização de aproximadamente 2 milhões de chips SIM para auxiliar nas missões humanitárias. Outros exemplos também são bastante pertinentes para a aplicação de Big Data, como a questão da pandemia de influenza, que ocorreu em 2009, e para a qual a empresa Google desenvolveu um aplicativo para a previsão de possíveis locais onde poderia ocorrer epidemia, ou a importância de Big Data para o descobrimento do pré-sal, no qual, dada a sua velocidade de análise, agilizou os processamentos de dados sísmicos captados pelas sondas que procuravam petróleo no fundo do mar. Mineração de dados6 C08_Mineracao_Dados.indd 6 10/01/2019 09:43:46 A aplicação de Big Data vai além da experiência de clientes, sendo possível utilizá-la para aumentar a segurança de infraestrutura de TI, otimizar processos e até prever mercados antes da concorrência. BRITO, M. Aspectos teóricos da mineração de dados e aplicação das regras de classifica- ção para apoiar o comércio. 2012. Disponível em: <https://www.devmedia.com.br/ aspectos-teoricos-da-mineracao-de-dados-e-aplicacao-das-regras-de-classificacao- -para-apoiar-o-comercio/25429>. Acesso em: 28 nov. 2018. CAROLINE, A. Diferença entre KDD e Data Mining. 26 dez. 2014. Disponível em: <http:// k2dt.blogspot.com/2014/12/diferenca-entre-kdd-e-data-mining.html>. Acesso em: 28 nov. 2018. CASTRO, L. N.; FERRARI, D. G. Introdução à Mineração de Dados: conceitos básicos, algoritmos e aplicações. São Paulo: Saraiva, 2016. RAMAKRISHNAN, R.; GEHRKE, J. Sistemas de Gerenciamento de Banco de Dados. 3. ed. Porto Alegre: Penso, 2013. Leituras recomendadas FAYYAD, U. M.; PIATETSKY-SHAPIRO, G.; SMYTH, P. From Data Mining to Knowledge Discovery in Databases. Artificial Intelligence Magazine, v. 17, n. 3, p. 37-54, 1996. HEKIMA. Big Data: tudo que você sempre quis saber sobre o tema! 2016. Disponível em: <http://www.bigdatabusiness.com.br/tudo-sobre-big-data/>. Acesso em: 28 nov. 2018. MANNINO, M. V. Projeto, Desenvolvimento de Aplicações e Administração de Banco de Dados. 3. ed. Porto Alegre: McGraw Hill, 2008. 7Mineração de dados C08_Mineracao_Dados.indd 7 10/01/2019 09:43:46 Conteúdo: