Prévia do material em texto
Revisão - Unidade 1 Uma empresa de tecnologia educacional está desenvolvendo um sistema para analisar o desempenho acadêmico de estudantes. A instituição possui uma base de dados com uma grande quantidade de dados de várias instituições, como notas em disciplinas, participação em atividades extracurriculares, frequência às aulas, interações em plataformas online, e resultados de avaliações. A equipe de cientistas de dados percebeu que utilizar todas essas variáveis no sistema pode torná-lo ineficiente e mais difícil de interpretar. Assim, eles desejam aplicar uma técnica para identificar as variáveis mais importantes e simplificar a análise. Explique qual técnica é recomendada nesse cenário e descreva como essa técnica funciona e por que ela seria adequada para esse tipo de análise educacional. Questão 1 A redução de dimensionalidade tem como objetivo simplificar os dados, diminuindo o número de variáveis (dimensões), mas mantendo as informações mais relevantes. Isso é especialmente útil em cenários de big data, onde os dados podem conter muitas variáveis redundantes ou irrelevantes Redução de Dimensionalidade Reduzir a Complexidade Melhorar a Visualização Eliminar Redundância Melhorar o Desempenho do Modelo Objetivos da Redução de Dimensionalidade É uma técnica linear que transforma os dados para um novo conjunto de eixos (componentes principais) onde a variância dos dados é maximizada. Os primeiros componentes principais retêm a maior parte da variância dos dados. A técnica utiliza conceitos como matriz de covariância, autovetores e autovalores para identificar quais variáveis são mais importantes em um conjunto de dados. Análise de Componentes Principais (PCA) Uma empresa chamada HealthTrack está desenvolvendo um sistema para classificar automaticamente exames médicos de pacientes em categorias de "alto risco" ou "baixo risco" de desenvolver determinadas doenças, com base em várias características como idade, histórico familiar, hábitos de vida e resultados de exames laboratoriais. A equipe de cientistas de dados está considerando o uso do algoritmo Naive Bayes para realizar essa classificação, devido à sua eficiência em problemas onde as variáveis são independentes ou quase independentes. Explique como o algoritmo Naive Bayes pode ser aplicado no problema de classificação de exames médicos da HealthTrack. Descreva como o Naive Bayes utiliza a probabilidade condicional para calcular a probabilidade de um paciente estar em uma categoria de "alto risco" ou "baixo risco" com base nos atributos fornecidos. Questão 2 Naive Bayes Naive Bayes é uma família de algoritmos de classificação baseado no Teorema de Bayes, que utiliza a probabilidade condicional para prever a classe de um dado exemplo É um tipo de algoritmo de aprendizado supervisionado Naive Bayes Naive Bayes calcula a probabilidade de um paciente pertencer a uma categoria (alto ou baixo risco) dado um conjunto de característica X1 , X2, … XN . Isso é feito utilizando a fórmula do Teorema de Bayes A suposição ingênua do Naive Bayes é que cada característica 𝑥𝑖 no vetor de entrada 𝑥 é condicionalmente independente de todas as outras características, dado a classe 𝐶𝑘 . Isso significa que podemos reescrever 𝑃(𝑥∣𝐶𝑘) como o produto das probabilidades individuais Naive Bayes Aprendizado Inicial: O Naive Bayes estuda um conjunto de dados onde cada item já tem uma categoria definida. Contagem das Características: Durante esse aprendizado, ele conta quantas vezes cada característica aparece em cada categoria. Assumindo Independência: O algoritmo faz uma suposição simples de que cada característica é independente das outras. Classificação: Quando um novo item precisa ser classificado, o Naive Bayes calcula a probabilidade de que o item pertença a cada categoria com base nas características que ele possui. Ele usa as contagens que aprendeu para fazer esses cálculos. Escolha da Categoria: Finalmente, o Naive Bayes escolhe a categoria com a maior probabilidade. A TechInsights, uma empresa de análise de dados, está trabalhando com um grande conjunto de dados de consumidores para segmentá-los em grupos com comportamentos semelhantes. A equipe de cientistas de dados pretende identificar padrões ocultos nos dados, sem utilizar rótulos pré-definidos, e também quer prever a renda anual dos consumidores com base em suas características demográficas e comportamentais. A equipe está considerando a utilização de algoritmos de agrupamento para a segmentação dos consumidores e algoritmos de regressão para prever a renda. Eles estão analisando as diferenças entre esses dois tipos de algoritmos. Explique a diferença entre algoritmos de agrupamento e algoritmos de regressão. Em sua resposta, discuta como os algoritmos de agrupamento podem ser utilizados para segmentar consumidores sem a necessidade de rótulos, e como os algoritmos de regressão podem prever a renda anual dos consumidores. Forneça exemplos de algoritmos apropriados para cada tarefa. Questão 3 Algoritmos de Agrupamento São algoritmos de aprendizagem não supervisionada que particionam os dados em grupos com características similares, permitindo encontrar padrões entre os dados fornecidos. K-Means Ele divide os dados em 𝐾 clusters O algoritmo atribui cada ponto de dados ao cluster cujo centróide (média dos pontos do cluster) está mais próximo Os centróides são recalculados iterativamente até que os clusters se estabilizem Regressão É um tipo de problema de aprendizado supervisionado onde o objetivo é prever um valor contínuo com base em dados de entrada. Os algoritmos fazem a previsão um valor numérico. Regressão Linear O modelo tenta encontrar a melhor linha reta que se ajusta aos dados A equação do modelo é geralmente da forma 𝑦=𝛽0+𝛽1𝑥+𝜖, onde: 𝑦 é a variável dependente 𝑥 é a variável independente 𝛽0 e 𝛽1 são coeficientes ϵ é o erro A AgroFinance, uma instituição que oferece financiamentos agrícolas, está enfrentando um desafio crescente: o aumento de inadimplência entre seus clientes. Atualmente, o sistema de concessão de crédito é manual, levando em consideração variáveis como área cultivada, produtividade esperada, histórico de pagamento e condições climáticas, mas esse processo tem se mostrado ineficiente e propenso a erros. Para melhorar a precisão das decisões de crédito, a AgroFinance decidiu automatizar a classificação de risco utilizando um modelo de aprendizado supervisionado que possa indicar se um agricultor possa se tornar inadimplente com base nos dados históricos dos clientes. Qual algoritmo de aprendizado de máquina você recomendaria para automatizar a classificação de risco de crédito na AgroFinance? Explique como o algoritmo que você escolheu funciona e por que ele é adequado para essa tarefa. Questão 4 Classificação Ela envolve treinar um modelo para prever a classe à qual uma nova amostra pertence, com base em exemplos rotulados (dados de treinamento). Classificação Tipos de Classificação Binária: Existem apenas duas classes possíveis para a saída. Exemplo: "Spam" vs "Não Spam" Multiclasse: Existem mais de duas classes possíveis para a saída. Exemplo: Classificação de imagens de dígitos manuscritos (0-9) Multirrótulo: Cada instância pode pertencer a várias classes simultaneamente. Exemplo: Etiquetar artigos de notícias com vários tópicos relevantes O algoritmo cria um conjunto de regras de decisão, que divide o espaço de características para classificar as instâncias em diferentes classes. Árvore de Decisão Dúvidas !? image1.png image2.png image3.png image4.png image5.png image6.png image7.png image8.jpeg image9.png image10.png image11.png image12.png image13.png