Logo Passei Direto
Buscar
Material
páginas com resultados encontrados.
páginas com resultados encontrados.

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Prévia do material em texto

1. Qual é o objetivo da mineração de dados?
Em resumo, o objetivo final da mineração de dados é transformar grandes quantidades de dados em informações relevantes e acionáveis, permitindo que as organizações tomem decisões mais embasadas e obtenham insights valiosos para alcançar seus objetivos.
2. Qual a relação entre mineração de dados e Inteligência de Negócio?
Em resumo, a relação entre mineração de dados e Inteligência de Negócio é que a mineração de dados é uma técnica utilizada dentro do processo mais amplo de Inteligência de Negócio. A mineração de dados ajuda a descobrir informações valiosas nos dados, enquanto a Inteligência de Negócio engloba a transformação dessas informações em conhecimento útil para a tomada de decisões estratégicas.
3. Qual a relação entre mineração de dados e bigdata?
A mineração de dados e o Big Data estão interligados, pois a mineração de dados é uma técnica usada para extrair informações significativas a partir dos grandes volumes de dados do Big Data. A mineração de dados é uma abordagem específica para analisar e encontrar padrões nos dados, enquanto o Big Data refere-se ao conceito mais amplo de lidar com conjuntos massivos de dados provenientes de diversas fontes. A mineração de dados é uma ferramenta crucial para explorar e obter insights valiosos a partir do Big Data, auxiliando na tomada de decisões e na descoberta de conhecimento relevante.
4. Qual a relação entre as análises estatísticas e a mineração de dados?
As análises estatísticas e a mineração de dados estão relacionadas na medida em que ambas envolvem a exploração e o entendimento de dados. A análise estatística é uma disciplina que utiliza métodos estatísticos para descrever, resumir e inferir informações a partir de dados, enquanto a mineração de dados é uma abordagem que utiliza técnicas estatísticas e de aprendizado de máquina para descobrir padrões, relações e insights valiosos nos dados. A análise estatística fornece as bases teóricas e os métodos para a mineração de dados, enquanto a mineração de dados permite a descoberta automatizada de informações relevantes e ocultas nos dados, além de possibilitar a criação de modelos preditivos e de segmentação. Ambas as abordagens são complementares e contribuem para a compreensão e a utilização efetiva dos dados.
5. Diferencie dado de informação de conhecimento. Exemplifique.
Dados são fatos brutos, informações são dados processados e organizados de forma significativa, e conhecimento é o entendimento ou a compreensão adquirida a partir das informações. Por exemplo, imagine que você tenha um conjunto de dados contendo informações sobre o clima diário, incluindo temperatura, umidade e velocidade do vento. Os dados brutos seriam as leituras individuais dessas variáveis em diferentes momentos. Ao analisar e processar esses dados, você pode calcular a média da temperatura, identificar dias com alta umidade e ventos fortes. Essas são informações derivadas dos dados. Agora, suponha que você observe uma correlação entre altas temperaturas e um aumento na demanda por sorvetes em uma determinada região. Com base nessa informação, você pode desenvolver o conhecimento de que altas temperaturas influenciam o consumo de sorvetes. Esse conhecimento é obtido através da análise e da interpretação das informações.
Em resumo, dados são os fatos brutos, informações são dados processados e organizados de forma significativa, e conhecimento é o entendimento derivado das informações que nos permite fazer previsões, tomar decisões ou agir de maneira informada.
6. Quais são as etapas para descoberta do conhecimento?
As etapas para a descoberta do conhecimento geralmente seguem um processo conhecido como KDD (Knowledge Discovery in Databases) ou Descoberta do Conhecimento em Bases de Dados. Essas etapas são:
· Seleção dos dados: Identificar e coletar os conjuntos de dados relevantes para a análise.
· Pré-processamento dos dados: Limpar, transformar e integrar os dados para garantir a qualidade e a consistência.
· Transformação dos dados: Realizar operações como agregação, redução de dimensionalidade e normalização para preparar os dados para análise.
· Mineração de dados: Utilizar técnicas de mineração de dados para descobrir padrões, relações e informações ocultas nos dados.
· Avaliação dos resultados: Avaliar a qualidade e a relevância dos padrões descobertos, utilizando métricas e critérios adequados.
· Interpretação e visualização dos resultados: Interpretar e comunicar os resultados da análise de forma compreensível e significativa, geralmente por meio de visualizações gráficas.
· Utilização do conhecimento: Aplicar o conhecimento descoberto em situações práticas, como tomada de decisões, desenvolvimento de estratégias ou otimização de processos.
· Essas etapas formam um ciclo iterativo, pois muitas vezes é necessário refinar e ajustar o processo à medida que novos insights e desafios surgem ao longo do caminho.
6. Descreva o Processo ETL.
O processo ETL (Extração, Transformação e Carga) é um conjunto de etapas utilizadas para integrar, limpar, transformar e carregar dados de várias fontes em um único local, geralmente em um data warehouse ou em um sistema de análise.
· Extração (Extraction): Nesta etapa, os dados são coletados de diferentes fontes, como bancos de dados, planilhas, arquivos CSV, APIs ou sistemas externos. Os dados podem ser extraídos de forma incremental (apenas as atualizações mais recentes) ou em lotes completos.
· Transformação (Transformation): Os dados extraídos são então transformados em um formato adequado para análise e armazenamento. Nesta etapa, são realizadas várias operações, como limpeza de dados inconsistentes ou inválidos, padronização de formatos, agregação, cálculos de métricas, enriquecimento com dados adicionais e normalização de estruturas.
· Carga (Load): Após a transformação dos dados, eles são carregados em um local de destino, como um data warehouse, um banco de dados ou um sistema de análise. A carga pode ser feita de diferentes maneiras, como inserção direta, atualização de registros existentes ou criação de novas tabelas.
O processo ETL visa garantir a qualidade e a integridade dos dados, tornando-os adequados para análise e tomada de decisões. Além disso, o ETL pode envolver o uso de ferramentas especializadas, scripts personalizados ou plataformas de integração de dados para automatizar e agilizar o processo.
É importante destacar que o processo ETL é geralmente parte de um fluxo maior de desenvolvimento de um sistema de análise de dados, no qual os dados são preparados e estruturados para fornecer insights significativos aos usuários finais.
7. Exemplifique um processo ETL.
· Extração (Extraction):
· Os dados das vendas são extraídos do sistema de comércio eletrônico da empresa, que possui um banco de dados com informações sobre pedidos, clientes, produtos e transações.
· Os dados também são extraídos de outras fontes, como um sistema de CRM (Customer Relationship Management), que contém informações sobre os clientes, e de um sistema de inventário, que fornece detalhes sobre o estoque de produtos.
· Transformação (Transformation):
· Os dados extraídos são limpos, verificando-se e corrigindo-se erros ou valores ausentes.
· Os dados são transformados em um formato consistente e padronizado para facilitar a análise, como a conversão de formatos de data e moeda.
· A agregação dos dados é realizada para calcular métricas relevantes, como o total de vendas, a quantidade de produtos vendidos, a receita por cliente etc.
· A integração dos dados é feita, relacionando as informações dos pedidos com os detalhes dos clientes e dos produtos.
· Carga (Load):
· Os dados transformados são carregados em um data warehouse, que é um local centralizado de armazenamento e análise de dados.
· Eles são inseridos em tabelas específicas do data warehouse, que foram projetadas para facilitar a análise e consulta dos dados.
· A carga pode ser feita de forma incremental, adicionando apenas os dados mais recentes, ou em lotes completos,dependendo das necessidades e do volume de dados.
Depois do processo ETL, os dados estão prontos para serem utilizados em análises de negócio. A empresa pode realizar consultas para obter insights sobre as vendas por período, identificar os produtos mais vendidos, segmentar os clientes com base em seu comportamento de compra e tomar decisões estratégicas com base nos dados consolidados e transformados no data warehouse.
8. Dê pelo menos 3 exemplos de tipos de fontes de dados diferentes.
Arquivos .txt, planilhas eletrônicas, documentos em papel, e-mails, redes sociais, arquivos gerados por alta plataforma(mainframes), bancos de dados relacionais etc.
9. O que é a Staging Area? Por que é necessário criar essa área?
É o local dentro do banco de dados ou da ferramenta de mineração de dados reservado para realizar a etapa de transformação de dados.
10. O que é Data Quality? Quais são as ações que devem ser realizadas para alcançar o data quality?
O Data quality, refere-se aos dados limpos, ou seja, é a área onde encontram-se os dados com qualidade, sem inconsistência, nem redundâncias, tão pouco, dados fora de padrões estabelecidos.
Avaliação da qualidade dos dados
Padronização e limpeza dos dados
Melhoria dos processos de entrada de dados
Estabelecimento de regras de qualidade dos dados
Monitoramento contínuo da qualidade dos dados
Treinamento e conscientização dos usuários
Uso de tecnologias e ferramentas apropriadas
12. Para que serve o modelo dimensional? Quais são os elementos encontrados nesse modelo? O modelo dimensional serve para prover as visões multidimensionais que os dados podem oferecer. Visualizar as dimensões sobre o fato, ou seja, as ocorrências sobre o registro a ser minerado. Neste modelo encontramos a tabela fato que tem os registros de valores numéricos sobre o objeto de estudo, ou seja, sobre os registros que estão sendo minerados e, também nessa tabela fato encontramos as chaves estrangeiras que fazem o relacionamento com as tabelas de dimensão.
As tabelas de dimensão são as ocorrências sobre o fato, ou seja, o que envolve o fato em relação aos dados (como?, o que? Quando?, onde?, etc). Nas tabelas de dimensão vamos encontrar os atributos sobre aquela dimensão e a chave primária que estabelece o relacionamento com a tabela fato.
13. Como podemos descobrir quais são as dimensões de um modelo dimensional? Exemplifique
Analisar a fonte de dados e utilizar o esquema 5W3H.
A tabela fato é a resposta das pergunta Quanto? E Quanto Custa?, todos os dados que responderem as essas perguntas vão compor a tabela fato. Ex.: quantidade de produtos vendidos, quantidade de peças estocadas, valor de venda, valor de custo.
Nas tabelas de dimensão as perguntas que devem ser respondidas são: Como? , Quando?, Quem?, Onde?, O que? E Por que? Ex.: Tipo da Venda , Data da Venda, Segmento de atuação, local da loja, nome do produto, motivo da venda
14. Defina e exemplifique a granularidade de uma dimensão.
A granularidade de uma dimensão refere-se ao nível de detalhe dos dados contidos nessa dimensão. Ela determina o quão específica ou generalizada são as informações representadas pela dimensão.
Por exemplo, considere uma dimensão de tempo em um sistema de análise de vendas. A granularidade dessa dimensão pode variar de acordo com o nível de detalhe desejado para a análise. Alguns exemplos de granularidade podem incluir:
1. Granularidade diária: Os dados estão agrupados por dia, fornecendo informações detalhadas sobre as vendas diárias, como o número de transações e o valor total das vendas em cada dia.
2. Granularidade mensal: Os dados estão agrupados por mês, fornecendo uma visão mais geral das vendas ao longo de cada mês. Nesse caso, as informações serão agregadas em nível mensal, incluindo o número total de vendas e o valor total das vendas em cada mês.
3. Granularidade anual: Os dados estão agrupados por ano, fornecendo uma visão ainda mais geral das vendas ao longo de um ano. Aqui, as informações serão agregadas em nível anual, incluindo o número total de vendas e o valor total das vendas em cada ano.
A escolha da granularidade depende dos objetivos da análise e da natureza dos dados disponíveis. Uma granularidade mais fina (como a diária) pode ser útil para detectar padrões de vendas diárias ou analisar tendências de curto prazo. Por outro lado, uma granularidade mais ampla (como a anual) é mais adequada para análises de longo prazo e para identificar padrões sazonais ou tendências gerais de vendas ao longo dos anos.
É importante escolher a granularidade correta, pois isso afetará a precisão das análises e insights obtidos. Além disso, em sistemas de análise de dados, é comum ter diferentes níveis de granularidade em uma dimensão, permitindo uma análise flexível e a capacidade de perfurar os dados em diferentes níveis de detalhe conforme necessário.
15. O que é um Cubo? Diferencie Cubo de HiperCubo.
Cubo é a junção de 3 dimensões em volta do fato. Ex. fato+quem+oque+quando (x,y,z)
Hipercubo é a junção de 4 ou mais dimensões em volta do fato. Ex.: fato+quem+oque+quando+como (x,y,z,w).
16. O que é um Dashboard? Qual a sua importância?
É o conjunto de vários relatórios que foram gerados com base nos cubos. O Dashboard é fundamental para a análise da alta administração do negócio, para tomada de decisão estratégica e assertiva.

Mais conteúdos dessa disciplina