Prévia do material em texto
6 Predição e KNN (K-Nearest Neighbors) Nesta semana estudaremos o funcionamento da predição, com ênfase ao algoritmo K-Nearest Neighbors (KNN). Vamos entender também como é feito o processo de avaliação de modelos preditivos. Objetivos de aprendizagem Ao final dessa semana, você deverá ser capaz de: • Compreender o que é uma predição; • Identificar algoritmos capazes de realizar predição; • Compreender o funcionamento do algoritmo K-Nearest Neighbors (KNN). Desafio Nesta semana fazemos uma abordagem sobre o algoritmo KNN, que apesar de ser um algoritmo bastante simples do ponto de vista matemático, tem uma estrutura de procedimento muito parecida com outros algoritmos. Portanto, compreender exatamente como utilizar o algoritmo dentro de um projeto de Machine Learning é o que realmente deve ser importante nessa semana. Nesta semana realizamos nossas primeiras instruções de treinamento e predição, observe como elas são executadas e como é feito o procedimento de validação do processo! Revisitando Conhecimentos Na última semana fizemos uma entrevista com o Leonardo Karpinski. No começo da entrevista ele falou sobre o mercado de dados, como ele começou e como está a demanda por profissionais dessa área. Sugiro rever a entrevista e observar novamente ele falando sobre projetos que já desenvolveu, inclusive para o técnico Tite na seleção brasileira de futebol. Orientação de estudos Para que possa aproveitar bem essa semana de estudos, sugere-se que assista as videoaulas 16 e 17, posteriormente, leia todos os textos base da disciplina. Na sequência, assista a videoaula 18, onde temos uma entrevista superespecial com a Data Scientist Renata Castanha, inspiração para quem quer trabalhar com Ciência de Dados, especialmente para mulheres. Para consolidar os conhecimentos é muito importante que realize os exercícios de apoio, para compreensão do funcionamento de algoritmos de predição, em especial do algoritmo KNN. E, por fim, realize a Atividade Avaliativa. Predição de Dados PREDIÇÃO ● Todas as vezes que se lê, assiste ou escuta uma abordagem sobre DS, rapidamente o termo "Predição" é colocado em pauta. ● É também esse termo que cria uma relação de diferença entre estudos de BI e de DS, visto que tanto BI quanto DS têm processos muito parecidos, inclusive no contexto de Big Data, entretanto, entende-se que o BI fomenta a tomada de decisão baseado no que já aconteceu e o DS projeta a tomada decisão baseado no que aconteceu, e no que PREVÊ que acontecerá. PREDIÇÃO - DICIONÁRIO ● A análise preditiva, ou capacidade de prever resultados e gerar insights futuros, com base em dados do passado (e do presente), com o uso de machine learning e modelagem estatística, é um dos principais recursos e objetos de desejo de quem estuda DS. ● A análise preditiva tem sido utilizada pelas maiores empresas do mundo para tomar decisões nos mais variados segmentos e está atrelada a uma diversidade de aplicações e de possibilidades, que torna impossível enumerá-las. ● Novas perspectivas nunca são demais. Quanto mais você consegue enxergar, melhores se tornam suas decisões — e ficar no escuro não é uma boa opção. ● É preciso saber o que o espera, preferencialmente antes das outras pessoas. ○ Exemplo: É como participar de um programa de TV em que você precisa escolher uma das portas para ganhar um prêmio surpresa. Elas são todas iguais, então tudo o que pode fazer é arriscar seu melhor palpite — a escolha depende de você e da sorte. Mas e se você tivesse uma vantagem — a capacidade de espiar pela fechadura? A análise preditiva proporciona essa vantagem. ● É importante que você, cientista de dados, compreenda o poder de um modelo de predição com alto índice de acerto. ● O que você faria em um mundo em que pudesse saber qual é a probabilidade de se casar com um colega de faculdade? Em que fosse possível prever qual é a profissão mais adequada para você? Em que pudesse prever a melhor cidade ou país para morar? Em que pudesse prever qual casa comprar, quando tem a intenção de vender no futuro com lucro? ● Resumindo, imagine um mundo em que seja possível maximizar o potencial de cada momento de sua vida. A vida seria produtiva, eficiente e poderosa. ● Você teria (de certo modo) superpoderes — e pouparia muito tempo. ● Esse mundo pode parecer um pouco chato para pessoas que gostam de assumir riscos não calculados, mas não para uma organização que visa lucros. ● As empresas gastam milhões em gerenciamento de riscos. E se existir algo que as ajude a gerenciar riscos, otimizar operações e maximizar lucros, com certeza você deveria conhecer. ● Esse é o mundo da análise preditiva! PREDIZENDO ● Podemos modelar comportamentos e predizer ações: ○ Quais produtos os clientes visualizaram antes de comprar? ○ Quais páginas os clientes visualizaram antes de comprar? ○ Clientes que compraram olham descrições? ○ Clientes que compraram leram comentários? ○ Clientes que compraram leram comentários positivos e negativos? ○ Compraram algum produto além do que estavam buscando? ○ As casas vendidas em um determinado bairro têm algo em comum que as que não foram vendidas não têm? ○ Clientes que cancelaram um plano (de algum produto ou serviço) tiveram que comportamento antes de solicitar o cancelamento? ○ Produtos que venceram (ou chegaram perto disso) no estoque foram comprados em que período? Eles atendem uma demanda sazonal? Eles atendem ao fluxo de caixa da empresa? ○ Produtos que foram comprados na "Promoção" do fornecedor realmente valeram a pena? ○ O aumento da visibilidade de um produto ou serviço foi impactado diretamente pelo marketing pago nas redes sociais? OPORTUNIDADES ● Organizações de todo o mundo esforçam-se para se aprimorar, competir e economizar. ● Buscam tornar seu processo de planejamento mais ágil, investigam como administrar inventários e otimizar as alocações de recursos para ter mais benefícios, e buscam agir nas oportunidades conforme surgem em tempo real. ● A análise preditiva pode tornar todos esses objetivos mais atingíveis. Os domínios em que a análise preditiva pode ser aplicada são ilimitados; o campo está aberto, e vale tudo! COMPREENSÃO PARA PREDIZER ● Quando se quer prever um evento com alguma precisão, é necessário conhecer o passado e entender a situação atual. Isso requer diversos processos: ○ Extrair os fatos que estão acontecendo no momento. ○ Distinguir os fatos passados daqueles que acabaram de acontecer. ○ Deduzir possíveis cenários (criar hipóteses) que poderiam ocorrer. ○ Classificar os cenários (modelos de ML) de acordo com a probabilidade de acontecerem. COMBINAR PARA PREDIZER ● As análises preditivas geralmente nascem de três ingredientes principais: ○ Conhecimento de negócios. ○ Equipe de ciência de dados e tecnologia. ○ Os dados. ● Embora a proporção desses três ingredientes varie de um negócio para outro, todos são necessários para uma solução de análise preditiva bem-sucedida que resulte em insights acionáveis! REALIZAR A PREDIÇÃO ● Já vimos várias etapas de um projeto de DS. Para executar o processo do ML, efetivar a predição, os passos são: ○ Carregar os dados. ○ Escolher um algoritmo que realize a tarefa de predição. ○ Treinar o modelo. ○ Visualizar o modelo. ○ Testar o modelo. ○ Avaliar o modelo. COMO ESCOLHER O ALGORITMO? ● Essa é uma das principais tarefas do cientista de dados, compreender a necessidade e as características dos projetos para poder decidir qual é o melhor algoritmo a ser utilizado. ● Existe uma regra, uma tabela, uma dica? ○ Pode até existir, mas geralmente é a experiência com o uso e aplicação dos algoritmos que fortalece o conhecimento do cientista de dados sobre caminhos a serem seguidos. ○ Saber escolher o algoritmo (sim, precisa testarmais de um), é uma das tarefas árduas do cientista de dados. ● É importante saber que os algoritmos podem realizar tarefas diversas. ● A escolha dos algoritmos depende do tipo de modelo adequado (supervisionado ou não supervisionado), que depende dos dados que se têm, e da hipótese que se tem em mente. ● É importante também compreender se é preciso fazer uma regressão, uma classificação, um agrupamento. ● Há algoritmos que têm capacidade de implementar todos esses tipos de modelos. ● Uma boa dica é começar os primeiros estudos e projetos com algum tipo de algoritmo, e identificar se ele atende às necessidades, lembrando que mudanças nos atributos (dados de entrada), uso de diferentes técnicas de regularização, mudança nos parâmetros dos algoritmos (e muitos deles têm vários parâmetros) podem representar resultados muito diferentes. ● Observe: estamos tratando aqui apenas de mudanças para um algoritmo, em várias situações estarão disponíveis uma gama de algoritmos que realizam tarefas semelhantes com resultados diferentes. ● A experiência e o aprofundamento no conhecimento sobre o funcionamento de cada algoritmo vão tornar a tarefa da escolha mais fácil, entretanto, a prática sempre mostra que alguns algoritmos, com customizações adequadas (com a experiência do profissional), vai sempre levar aos melhores resultados. ● Conhecer com profundidade tudo que um algoritmo pode entregar e quais são as características que impactam diretamente nos resultados é muito importante. ● Veja esse exemplo: ○ A imagem ao lado representa a disponibilidade de algoritmos para trabalhar com ML supervisionado na biblioteca Scikit-Learn. ○ Há muitas possibilidades para se aplicar modelos que possam gerar os melhores resultados. ● Agora veja esse exemplo: ○ Algoritmo SVM, da Scikit-Learn, vamos comentar no slide seguinte. ● O algoritmo serve para classificação, regressão e também para detecção de outliers (pode ser usado para pré-processamento). ● Veja que ele indica vantagens de ser usado para conjuntos de dados com dimensões grandes (muitos atributos) e ainda sugere eficácia para conjuntos de dados que a dimensão é maior que a amostra (mais atributos que linhas de dados). ○ Vejam que isso é uma característica da estrutura dos dados e não do tipo de negócio ou do tipo de dados que se está trabalhando. ● Na imagem também é possível ver que na descrição são apresentadas desvantagens para o algoritmo. FINALIZANDO ● Predição é um dos objetivos a serem alcançados em projetos de DS. ● A predição pode vir por meio de uma regressão, de uma classificação, de um algoritmo x ou y. ● Há uma infinidade de algoritmos, e muitas características que determinam sua escolha (mesmo antes de se iniciar uma modelagem). ● O objetivo aqui não foi descrever cada um dos algoritmos, mas facilitar a compreensão de que é necessário experimentar e testar algoritmos para os projetos. ● Na próxima aula vamos nos dedicar a um algoritmo específico para trabalhar, o KNN (K-Nearest Neighbors). PERGUNTA 1 Qual dos algoritmos apresentado na videoaula é capaz de fazer classificação, regressão e detecção de outliers? o Naive Bayes. o Kernel Ridge Regression. o KNN. o Decision Tree. o Support Vector Machines. Você acertou! Essa é a alternativa correta. O algoritmo Support Vector Machines (SVM) é capaz de fazer classificação, regressão e detecção de outliers. Algoritmo KNN (K-Nearest Neighbors) e Avaliação de Modelos Preditivos KNN (K-Nearest Neighbors) ● KNN, também chamado de K-Vizinhos mais Próximos é um algoritmo bastante utilizado em vários projetos de DS. ● Veja que a Biblioteca Scikit-Learn disponibiliza uma grande variação de aplicações para o algoritmo. ● Pode ser utilizado nos mais variados segmentos (áreas de negócios), veja que pode ser utilizado tanto para classificação quanto para regressão. ● Na classificação a máquina irá dizer a que grupo determinado registro faz parte, dentro obviamente de um contexto de negócio. ● Já a regressão irá nos fornecer um número/valor, por exemplo o valor de mercado de uma determinada casa que será colocada à venda. KNN (K-Nearest Neighbors) KNN (K-Nearest Neighbors) ● O KNN é um dos modelos preditivos mais simples que existem. Ele não possui premissas matemáticas e não requer nenhum tipo de maquinário pesado. Ele apenas requer: ○ Noção de distância ○ Premissa de que pontos que estão perto um do outro são similares. KNN - FUNCIONAMENTO ● O KNN determina pontos para cada registro e estabelece unidades de distância entre esses pontos. ● Algumas medidas de distância podem ser utilizadas: ○ Distância Euclidiana ○ Distância de Hamming ○ Distância Manhattan ○ Distância de Markowski ● Posteriormente, para cada novo ponto, ele calcula a distância entre os K vizinhos mais próximos. Procure sempre usar um K ímpar. E de acordo com os mais próximos ele é capaz de decidir sobre o novo ponto. EXEMPLO KNN ● Um dos datasets mais conhecidos para aprender ML é o Iris Flower. Ele é formado por features (atributos) que indicam a largura e o comprimento da Pétala e da Sépala das flores indicando qual é a classificação delas. ● Estrutura básica do Dataset Iris Flower. ● Pontos plotados (aqui apenas 2 variáveis). ● Escolha, veja a quantidade de vizinhos para decidir (K). ● Se K=1, o novo elemento verde (círculo) será classificado como azul (quadrado), se o K=3, o novo será vermelho (triângulo) KNN DEMONSTRAÇÃO ● Demonstração, apenas para apresentar como é o comportamento. AVALIAÇÃO DE MODELOS ● De maneira geral, pode-se afirmar que não existe técnica universal, ou seja, não é possível estabelecer, a priori, que uma técnica de ML em particular se sairá melhor na resolução de qualquer tipo de problema. ● Por exemplo, em domínios em que os exemplos possuem alta dimensionalidade, as SVMs são boas candidatas, enquanto o algoritmo KNN usando a distância euclidiana pode, a princípio, não parecer uma escolha adequada. ● Mesmo com o uso dessas heurísticas, diversos algoritmos podem ser candidatos à solução de um problema. ● Ainda que um único algoritmo seja escolhido, pode-se realizar ajustes em seus parâmetros livres, o que leva à obtenção de múltiplos modelos para os mesmos dados. ● Fica clara a necessidade de experimentação. ● Dessa forma, é recomendável seguir procedimentos que garantam a correção, a validade e a reprodutibilidade dos experimentos realizados e, mais importante, das conclusões obtidas a partir de seus resultados. MÉTRICAS ● Essa avaliação experimental de um algoritmo de ML pode ser realizada segundo diferentes aspectos, tais como acurácia do modelo gerado, compreensibilidade do conhecimento extraído, tempo de aprendizado, requisitos de armazenamento do modelo, desempenho obtido nas predições realizadas, entre outros. ● A avaliação de um algoritmo de ML supervisionado é normalmente realizada por meio da análise do desempenho do preditor gerado por ele na rotulação de novos objetos, não apresentados previamente em seu treinamento. ● Métricas diferentes podem ser aplicadas para classificação, para regressão e também várias outras alternativas como amostragem, bootstrap, validação cruzada, curva roc, entre muitos outros. ● Para classificação pode-se utilizar a acurácia, que é uma métrica que informa a porcentagem de vezes que o modelo acertou. Há outras alternativas mais complexas e que podem ser utilizadas também, como matriz de confusão, que permite determinar revocação e precisão por exemplo. ● Para regressão é comum usar métricas que determinem a diferença de valor entre o valor previsto e o valor correto. Algumas medidas como distância média absoluta (Mean Absolute Distance - MAD) e erro quadrático médio (Mean Square Error - MSE), além das suasvariações normalizadas, podem ser utilizadas. AMOSTRAGEM ● Uma métrica bastante utilizada é dividir os dados disponíveis em duas partes. Utiliza-se muito a proporção 75/25, mas não é regra (vai depender dos seus dados). ● Neste caso, utiliza-se a parte maior, chamada TREINO, para treinar o modelo e depois realiza-se a predição com a outra parte dos dados, chamada TESTE. Esse é um passo interessante antes de se colocar dados novos para testar o modelo. VALIDAÇÃO CRUZADA ● Essa métrica é conhecida como r-fold cross-validation. ● Métrica muito interessante, que usa o processo semelhante ao de amostragem, entretanto ele divide em vários subconjuntos de dados e repete o treinamento nos vários conjuntos. ● O desempenho final do preditor é dado pela média dos desempenhos observados entre cada conjunto de teste. FINALIZANDO ● Abordamos o KNN, que é um algoritmo simples e que permite realizar vários tipos de operação (classificação, regressão…). ● Já conseguiu entender a diferença entre classificação e regressão? Pense sempre em um valor categórico (label) para classificação e um valor numérico para a regressão. ● As medidas para avaliação dos modelos são muito importantes. ● Na última semana nos dedicaremos a um projeto completo, com abordagem sobre todos esses elementos! PERGUNTA 1 Qual é o nome do atributo alvo do dataset Iris Flower, usado para realizar o processo de classificação de dados? o Petal Width. o Target_name. o Sepal Length. o Sepal Width. o Petal Length. Você acertou! Essa é a alternativa correta. O atributo é o Target_name que serve como alvo para o processo de classificação. Entrevista Renata Castanha (Ambev) ENTREVISTA ● Entrevista com Renata Castanha, Data Product Manager da Ambev, que abordará a questão do mercado de trabalho para área de dados e também, como uma grande empresa como a Ambev olha para a questão da análise de dados. PERGUNTA (enunciado) Na entrevista realizada com a Renata Castanha, ela falou um pouco da atuação como cientista de dados em uma das maiores empresas do Brasil, qual empresa é essa? o Banco Itaú o Google o USP o Nestlé o Ambev Você acertou! Essa é a alternativa correta. A Renata atua na Ambev. Materiais base Não se esqueça de que, para acessar os livros (abaixo), você antes precisa fazer o login através das páginas de acesso Minha Biblioteca e Pearson. Texto-base I: Inteligência Artificial - Uma Abordagem de Aprendizado de Máquina - (Leia as páginas de 54 a 62 e 149 a 162) | André Carlos Ponce de Leon Carvalho et al. Texto-base II: Data Science do Zero (Leia capítulo 12) | Joel Grus Texto-base III: Análise e modelagem preditiva (Leia as páginas 5-29) | Orlando da Silva Júnior PERGUNTA 1 Texto-base 6.1 - Inteligência Artificial - Uma Abordagem de Aprendizado de Máquina - (Leia as páginas 54-62 e 149-162) | André Carlos Ponce de Leon Carvalho et al. Qual é a métrica utilizada para regressão que se baseia na distância absoluta média? o Acurácia o MAD. o MSE. o Matriz de Confusão. o Amostragem. Você acertou! Essa é a alternativa correta. A métrica MAD (Mean Absolute Distance) avalia um modelo preditivo baseado na distância média absoluta entre o resultado esperado e o preditado. PERGUNTA 2 Texto-base 6.2 – Data Science do Zero (Leia o Capítulo 12) | Joel Grus Assinale a alternativa que traz o nome de um algoritmo de Machine Learning que realiza processo de classificação dos dados, baseado na distância entre eles. o Logistic regression. o K-Nearest Neighbors. o Ridge regression. o Linear Regression. o Support Vector Machines. Você acertou! Essa é a alternativa correta. O algoritmo K-Nearest Neighbors (KNN) utiliza de cálculo de distância para realizar o processo de classificação entre os dados. PERGUNTA 3 Texto-base 6.3 – Análise Preditiva para Leigos (Leia as páginas 10-16) | Anasse Bari et al. https://login.univesp.br/simplesaml/module.php/core/mb.php https://login.univesp.br/simplesaml/module.php/core/pearson.php https://integrada.minhabiblioteca.com.br/reader/books/9788521637509/epubcfi/6/34%5b%3Bvnd.vst.idref%3Dchapter04%5d!/4/24/1:73%5bmer%2Co%20d https://integrada.minhabiblioteca.com.br/reader/books/9788521637509/epubcfi/6/34%5b%3Bvnd.vst.idref%3Dchapter04%5d!/4/24/1:73%5bmer%2Co%20d https://integrada.minhabiblioteca.com.br/reader/books/9788550816463/epubcfi/6/38%5b%3Bvnd.vst.idref%3Dcap12.xhtml%5d!/4%5bEPUB_data_science_do_zero-16%5d/2%5b_idContainer121%5d/2/5:0%5b%2CCap https://acesso.univesp.br/login_mb?bookUrl=9786589881063&pageid=5 https://acesso.univesp.br/login_mb?bookUrl=9786589881063&pageid=5 Considerando as diversas vantagens que uma organização pode obter com a Ciência de Dados, assinale a alternativa que traz a vantagem para uma organização, relacionada à característica da análise preditiva "Conhecer a lista de desejos de seus clientes”. o Ampliação. o Regressão. o Visão. o Precisão. o Decisão. Você acertou! Essa é a alternativa correta. Uma das análises importantes é o conhecimento e a visão sobre a lista de desejos dos clientes, no processo de análise de dados. Aprofundando o tema Não se esqueça de que, para acessar os livros (abaixo), você antes precisa fazer o login através das páginas de acesso Minha Biblioteca e Pearson. Material de apoio: Notebook da videoaula 17 – Algoritmo KNN (K-Nearest Neighbors) e Avaliação de Modelos Preditivos Material de apoio: Análise e modelagem preditiva (Leia as páginas 30-41) | Orlando da Silva Júnior Semana 6 - Fórum temático - Predição KNN é o melhor algoritmo de predição? Ele sempre será melhor em relação a outros algoritmos de predição como Random Forest e Redes Neurais? Justifique sua resposta. ATIVIDADE AVALIATIVA PERGUNTA 1 Considere como verdadeiras (V) ou falsas (F) as afirmações sobre o uso de datasets da biblioteca Scikit-Learn: ( ) Para usar o dataset é necessário importá-lo usando o comando “from sklearn import datasets”. ( ) O comando “iris=datasets.load_iris()” carrega todo o dataset iris para a variável iris. ( ) Com a variável íris tendo sido carregada com o dataset, o atributo “iris.atributes” terá o nome das colunas do dataset. ( ) Com a variável íris tendo sido carregada com o dataset, os dados, sem a coluna alvo, estarão disponíveis em “iris.target”. https://login.univesp.br/simplesaml/module.php/core/mb.php https://login.univesp.br/simplesaml/module.php/core/pearson.php https://ava.univesp.br/bbcswebdav/xid-5353605_1 https://ava.univesp.br/bbcswebdav/xid-5353605_1 https://acesso.univesp.br/login_mb?bookUrl=9786589881063&pageid=30 A sequência correta de preenchimento dos parênteses, de cima para baixo, é: o V, V, F, V o V, F, F, V o V, V, F, F o F, V, V, F o V, F, V, F PERGUNTA 2 A utilização de algoritmos por parte da ciência de dados é de fundamental importância para diversos estudos envolvendo dados a fim de criar padrões ou modelagens de comportamentos ou para estimar ações futuras. Para organizações como um todo, qualquer tipo de vantagem competitiva faz com que as mesmas estejam à frente das demais, ou seja, saber mais, um pouco antes, sempre é melhor. Para a análise preditiva de dados, temos algoritmos próprios utilizados, dentre eles o algoritmo KNN (K-Nearest Neighbors) o qual pode ser utilizado para vários contextos da gestão de negócios, seja para classificação ou regressão etc. Com base nas informações apresentadas, identifique se são (V) verdadeiras ou (F) falsas as afirmativas a seguir. I. ( ) A biblioteca Scikit-Learn propicia um leque extenso de aplicações envolvendo o algoritmo KNN. II. ( ) No âmbito da ciência de dados, o algoritmo KNN é conhecido por “K-vizinhos mais próximos” e apresenta fácil implementação. III. ( ) Essencialmente falando, o algoritmo KNNse traduz como um algoritmo supervisionado de inteligência de máquina usado para situações/problemas organizacionais de classificação. Assinale a alternativa que apresenta a sequência CORRETA. o a. F; F; V. o b. V; F; F. o c. V; V; F. o d. F; V; V. o e. V; V; V. PERGUNTA 3 Considere como verdadeiras (V) ou falsas (F) as afirmações a seguir sobre análise preditiva. ( ) A análise preditiva permite que você veja o invisível para as outras pessoas – em especial, padrões úteis em seus dados. ( ) Aumentar ou não o limite de crédito de um cliente está relacionado à vantagem de visão que a análise preditiva proporciona. ( ) Conhecer a lista de desejos dos seus clientes é uma vantagem de decisão que a análise preditiva proporciona. ( ) Um modelo de análise preditiva bem-feito oferece resultados analíticos livres de emoção ou viés. A sequência correta de preenchimento dos parênteses, de cima para baixo, é: o F, V, V, V o F, F, V, F o F, V, F, V o V, F, F, V o V, V, F, F PERGUNTA 4 Um modelo preditivo bastante conhecido, baseado em distâncias e que não parte de hipóteses matemáticas, nem exige maquinário pesado é: o SVM. o Random Forest. o KNN. o Naive Bayes. o Árvore de Decisão. PERGUNTA 5 No mundo globalizado em que vivemos, tornando-se a informação um aparato competitivo para organizações por intermédio de decisões mais assertivas, tecnologias relacionadas a predição de dados são visualizadas como ferramentas indispensáveis às empresas, independentemente da área de atuação (às vezes, vistas como mecanismo indispensável à sobrevivência por conta da transfiguração de dados em verdadeiros tesouros — informações relevantes). Diante disso, questionamentos como os dispostos adiante podem aparecer frequentemente. Qual produto ou marca você visualizou antes de decidir por qual comprar? Como você poderia escolher a melhor profissão para o futuro? Antes de adquirir um produto, você visualiza comentários sobre o mesmo? Nesse sentido, modelar comportamentos e descrever ações em data science pode ser realizado por: o a. predição de dados. o b. predição de regressões. o c. predição de variáveis. o d. predição de caracteres. o e. predição unilaterais. PERGUNTA 6 No contexto atual, cada vez mais as organizações devem basear suas decisões na análise de dados, desde problemas mais simples até os mais complexos. O conhecimento prévio e a obtenção de informações relevantes por meio de dados podem se tornar diferenciais competitivos para as organizações, independentemente da área de atuação e dos negócios. Disso advém a importância das análises preditivas de dados. Em relação ao exposto, avalie as afirmações a seguir. I. Atualmente as organizações se utilizam da análise preditiva de dados com o intuito de obter vantagem competitiva de mercado e aumentar a lucratividade. II. A análise preditiva de dados se baseia essencialmente em dados, modelos estatísticos e ferramentas de inteligência de máquina (grande volume de dados). III. Na tratativa organizacional, a análise preditiva de dados tem como responsabilidade fundamental municiar os gestores com informações confiáveis para o processo decisório. IV. A análise preditiva de dados permite, por exemplo, a caracterização de possíveis comportamentos a posteriori de mercado para direcionar os negócios empresariais. Está correto o que se afirma em: o a. II e IV, apenas. o b. I, II e III, apenas. o c. III e IV, apenas. o d. I e III, apenas. o e. I, II, III e IV. PERGUNTA 7 A predição de dados é uma técnica diretamente associada a ciência de dados e Inteligência Artificial com o intuito de caracterizar padrões, modelar comportamentos e estimar ações futuras. Assim sendo, _____________________________ e fundamentalmente usam _________________, _____________________ de cunho ____________________________ e técnicas de _________________________________, visando essencialmente à caracterização de chances envolvendo resultados futuros por meio de dados no passado e no presente. Preencha as lacunas escolhendo a alternativa CORRETA: o a. preditivas são o maior nível; dados; algoritmos; estatístico; Machine Learning. o b. preditivas são o maior nível; dados; algoritmos; estatístico; discriminantes. o c. análises preditivas são o menor nível; dados; algoritmos; estatístico; Machine Learning. o d. preditivas são o maior nível; dados; algoritmos; algébrico; Machine Learning. o e. as análises preditivas são o menor nível; dados; algoritmos; estatístico; discriminantes.