Logo Passei Direto
Buscar
Material
páginas com resultados encontrados.
páginas com resultados encontrados.

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Prévia do material em texto

6 
Predição e KNN (K-Nearest Neighbors) 
 
Nesta semana estudaremos o funcionamento da predição, com ênfase ao algoritmo K-Nearest Neighbors 
(KNN). Vamos entender também como é feito o processo de avaliação de modelos preditivos. 
Objetivos de aprendizagem 
Ao final dessa semana, você deverá ser capaz de: 
• Compreender o que é uma predição; 
• Identificar algoritmos capazes de realizar predição; 
• Compreender o funcionamento do algoritmo K-Nearest Neighbors (KNN). 
 
Desafio 
Nesta semana fazemos uma abordagem sobre o algoritmo KNN, que apesar de ser um algoritmo bastante 
simples do ponto de vista matemático, tem uma estrutura de procedimento muito parecida com outros 
algoritmos. Portanto, compreender exatamente como utilizar o algoritmo dentro de um projeto de Machine 
Learning é o que realmente deve ser importante nessa semana. Nesta semana realizamos nossas primeiras 
instruções de treinamento e predição, observe como elas são executadas e como é feito o procedimento de 
validação do processo! 
 
Revisitando Conhecimentos 
Na última semana fizemos uma entrevista com o Leonardo Karpinski. No começo da entrevista ele falou 
sobre o mercado de dados, como ele começou e como está a demanda por profissionais dessa área. 
Sugiro rever a entrevista e observar novamente ele falando sobre projetos que já desenvolveu, inclusive para 
o técnico Tite na seleção brasileira de futebol. 
 
Orientação de estudos 
Para que possa aproveitar bem essa semana de estudos, sugere-se que assista as videoaulas 16 e 17, 
posteriormente, leia todos os textos base da disciplina. Na sequência, assista a videoaula 18, onde temos uma 
entrevista superespecial com a Data Scientist Renata Castanha, inspiração para quem quer trabalhar com 
Ciência de Dados, especialmente para mulheres. Para consolidar os conhecimentos é muito importante que 
realize os exercícios de apoio, para compreensão do funcionamento de algoritmos de predição, em especial 
do algoritmo KNN. E, por fim, realize a Atividade Avaliativa. 
 
 
Predição de Dados 
PREDIÇÃO 
● Todas as vezes que se lê, assiste ou escuta uma abordagem sobre DS, rapidamente o termo "Predição" é 
colocado em pauta. 
● É também esse termo que cria uma relação de diferença entre estudos de BI e de DS, visto que tanto BI 
quanto DS têm processos muito parecidos, inclusive no contexto de Big Data, entretanto, entende-se que o 
BI fomenta a tomada de decisão baseado no que já aconteceu e o DS projeta a tomada decisão baseado no 
que aconteceu, e no que PREVÊ que acontecerá. 
 
 
 
PREDIÇÃO - DICIONÁRIO 
 
● A análise preditiva, ou capacidade de prever resultados e gerar insights futuros, com base em dados do 
passado (e do presente), com o uso de machine learning e modelagem estatística, é um dos principais 
recursos e objetos de desejo de quem estuda DS. 
● A análise preditiva tem sido utilizada pelas maiores empresas do mundo para tomar decisões nos mais 
variados segmentos e está atrelada a uma diversidade de aplicações e de possibilidades, que torna 
impossível enumerá-las. 
● Novas perspectivas nunca são demais. Quanto mais você consegue enxergar, melhores se tornam suas 
decisões — e ficar no escuro não é uma boa opção. 
● É preciso saber o que o espera, preferencialmente antes das outras pessoas. 
○ Exemplo: É como participar de um programa de TV em que você precisa escolher uma das portas para 
ganhar um prêmio surpresa. Elas são todas iguais, então tudo o que pode fazer é arriscar seu melhor 
palpite — a escolha depende de você e da sorte. Mas e se você tivesse uma vantagem — a capacidade de 
espiar pela fechadura? A análise preditiva proporciona essa vantagem. 
● É importante que você, cientista de dados, compreenda o poder de um modelo de predição com alto 
índice de acerto. 
● O que você faria em um mundo em que pudesse saber qual é a probabilidade de se casar com um colega 
de faculdade? Em que fosse possível prever qual é a profissão mais adequada para você? Em que pudesse 
prever a melhor cidade ou país para morar? Em que pudesse prever qual casa comprar, quando tem a 
intenção de vender no futuro com lucro? 
● Resumindo, imagine um mundo em que seja possível maximizar o potencial de cada momento de sua 
vida. A vida seria produtiva, eficiente e poderosa. 
● Você teria (de certo modo) superpoderes — e pouparia muito tempo. 
● Esse mundo pode parecer um pouco chato para pessoas que gostam de assumir riscos não calculados, 
mas não para uma organização que visa lucros. 
● As empresas gastam milhões em gerenciamento de riscos. E se existir algo que as ajude a gerenciar 
riscos, otimizar operações e maximizar lucros, com certeza você deveria conhecer. 
● Esse é o mundo da análise preditiva! 
 
 
PREDIZENDO 
● Podemos modelar comportamentos e predizer ações: 
○ Quais produtos os clientes visualizaram antes de comprar? 
○ Quais páginas os clientes visualizaram antes de comprar? 
○ Clientes que compraram olham descrições? 
○ Clientes que compraram leram comentários? 
○ Clientes que compraram leram comentários positivos e negativos? 
○ Compraram algum produto além do que estavam buscando? 
○ As casas vendidas em um determinado bairro têm algo em comum que as que não foram vendidas não 
têm? 
○ Clientes que cancelaram um plano (de algum produto ou serviço) tiveram que comportamento antes de 
solicitar o cancelamento? 
○ Produtos que venceram (ou chegaram perto disso) no estoque foram comprados em que período? Eles 
atendem uma demanda sazonal? Eles atendem ao fluxo de caixa da empresa? 
○ Produtos que foram comprados na "Promoção" do fornecedor realmente valeram a pena? 
○ O aumento da visibilidade de um produto ou serviço foi impactado diretamente pelo marketing pago nas 
redes sociais? 
 
OPORTUNIDADES 
● Organizações de todo o mundo esforçam-se para se aprimorar, competir e economizar. 
● Buscam tornar seu processo de planejamento mais ágil, investigam como administrar inventários e 
otimizar as alocações de recursos para ter mais benefícios, e buscam agir nas oportunidades conforme 
surgem em tempo real. 
● A análise preditiva pode tornar todos esses objetivos mais atingíveis. Os domínios em que a análise 
preditiva pode ser aplicada são ilimitados; o campo está aberto, e vale tudo! 
 
COMPREENSÃO PARA PREDIZER 
● Quando se quer prever um evento com alguma precisão, é necessário conhecer o passado e entender a 
situação atual. Isso requer diversos processos: 
○ Extrair os fatos que estão acontecendo no momento. 
○ Distinguir os fatos passados daqueles que acabaram de acontecer. 
○ Deduzir possíveis cenários (criar hipóteses) que poderiam ocorrer. 
○ Classificar os cenários (modelos de ML) de acordo com a probabilidade de acontecerem. 
 
 
COMBINAR PARA PREDIZER 
● As análises preditivas geralmente nascem de três ingredientes principais: 
○ Conhecimento de negócios. 
○ Equipe de ciência de dados e tecnologia. 
○ Os dados. 
● Embora a proporção desses três ingredientes varie de um negócio para outro, todos são necessários para 
uma solução de análise preditiva bem-sucedida que resulte em insights acionáveis! 
 
REALIZAR A PREDIÇÃO 
● Já vimos várias etapas de um projeto de DS. Para executar o processo do ML, efetivar a predição, os 
passos são: 
○ Carregar os dados. 
○ Escolher um algoritmo que realize a tarefa de predição. 
○ Treinar o modelo. 
○ Visualizar o modelo. 
○ Testar o modelo. 
○ Avaliar o modelo. 
 
COMO ESCOLHER O ALGORITMO? 
● Essa é uma das principais tarefas do cientista de dados, compreender a necessidade e as características 
dos projetos para poder decidir qual é o melhor algoritmo a ser utilizado. 
● Existe uma regra, uma tabela, uma dica? 
○ Pode até existir, mas geralmente é a experiência com o uso e aplicação dos algoritmos que fortalece o 
conhecimento do cientista de dados sobre caminhos a serem seguidos. 
○ Saber escolher o algoritmo (sim, precisa testarmais de um), é uma das tarefas árduas do cientista de 
dados. 
● É importante saber que os algoritmos podem realizar tarefas diversas. 
● A escolha dos algoritmos depende do tipo de modelo adequado (supervisionado ou não supervisionado), 
que depende dos dados que se têm, e da hipótese que se tem em mente. 
● É importante também compreender se é preciso fazer uma regressão, uma classificação, um 
agrupamento. 
● Há algoritmos que têm capacidade de implementar todos esses tipos de modelos. 
● Uma boa dica é começar os primeiros estudos e projetos com algum tipo de algoritmo, e identificar se ele 
atende às necessidades, lembrando que mudanças nos atributos (dados de entrada), uso de diferentes 
técnicas de regularização, mudança nos parâmetros dos algoritmos (e muitos deles têm vários parâmetros) 
podem representar resultados muito diferentes. 
● Observe: estamos tratando aqui apenas de mudanças para um algoritmo, em várias situações estarão 
disponíveis uma gama de algoritmos que realizam tarefas semelhantes com resultados diferentes. 
● A experiência e o aprofundamento no conhecimento sobre o funcionamento de cada algoritmo vão 
tornar a tarefa da escolha mais fácil, entretanto, a prática sempre mostra que alguns algoritmos, com 
customizações adequadas (com a experiência do profissional), vai sempre levar aos melhores resultados. 
● Conhecer com profundidade tudo que um algoritmo pode entregar e quais são as características que 
impactam diretamente nos resultados é muito importante. 
● Veja esse exemplo: 
○ A imagem ao lado representa a disponibilidade 
de algoritmos para trabalhar com ML supervisionado 
na biblioteca Scikit-Learn. 
○ Há muitas possibilidades para se aplicar modelos que 
possam gerar os melhores resultados. 
 
 
 
 
● Agora veja esse exemplo: 
○ Algoritmo SVM, da Scikit-Learn, vamos comentar no slide seguinte. 
 
● O algoritmo serve para classificação, regressão e também para detecção de outliers (pode ser usado para 
pré-processamento). 
● Veja que ele indica vantagens de ser usado para conjuntos de dados com dimensões grandes (muitos 
atributos) e ainda sugere eficácia para conjuntos de dados que a dimensão é maior que a amostra (mais 
atributos que linhas de dados). 
○ Vejam que isso é uma característica da estrutura dos dados e não do tipo de negócio ou do tipo de dados 
que se está trabalhando. 
● Na imagem também é possível ver que na descrição são apresentadas desvantagens para o algoritmo. 
FINALIZANDO 
● Predição é um dos objetivos a serem alcançados em projetos de DS. 
● A predição pode vir por meio de uma regressão, de uma classificação, de um algoritmo x ou y. 
● Há uma infinidade de algoritmos, e muitas características que determinam sua escolha (mesmo antes de 
se iniciar uma modelagem). 
● O objetivo aqui não foi descrever cada um dos algoritmos, mas facilitar a compreensão de que é 
necessário experimentar e testar algoritmos para os projetos. 
● Na próxima aula vamos nos dedicar a um algoritmo específico para trabalhar, o KNN (K-Nearest 
Neighbors). 
 
PERGUNTA 1 
Qual dos algoritmos apresentado na videoaula é capaz de fazer classificação, regressão e 
detecção de outliers? 
 
o Naive Bayes. 
 
o Kernel Ridge Regression. 
 
o KNN. 
 
o Decision Tree. 
 
o Support Vector Machines. 
Você acertou! Essa é a alternativa correta. O algoritmo Support Vector Machines (SVM) é capaz 
de fazer classificação, regressão e detecção de outliers. 
 
 
Algoritmo KNN (K-Nearest Neighbors) e Avaliação de Modelos Preditivos 
KNN (K-Nearest Neighbors) 
● KNN, também chamado de K-Vizinhos mais Próximos é um algoritmo bastante utilizado em vários 
projetos de DS. 
● Veja que a Biblioteca Scikit-Learn disponibiliza uma grande variação de aplicações para o algoritmo. 
 
● Pode ser utilizado nos mais variados segmentos (áreas de negócios), veja que pode ser utilizado tanto 
para classificação quanto para regressão. 
● Na classificação a máquina irá dizer a que grupo determinado registro faz parte, dentro obviamente de 
um contexto de negócio. 
● Já a regressão irá nos fornecer um número/valor, por exemplo o valor de mercado de uma determinada 
casa que será colocada à venda. KNN (K-Nearest Neighbors) 
 
KNN (K-Nearest Neighbors) 
● O KNN é um dos modelos preditivos mais simples que existem. Ele não possui premissas matemáticas e 
não requer nenhum tipo de maquinário pesado. Ele apenas requer: 
○ Noção de distância 
○ Premissa de que pontos que estão perto um do outro são similares. 
 
KNN - FUNCIONAMENTO 
● O KNN determina pontos para cada registro e estabelece unidades de distância entre esses pontos. 
● Algumas medidas de distância podem ser utilizadas: 
○ Distância Euclidiana 
○ Distância de Hamming 
○ Distância Manhattan 
○ Distância de Markowski 
● Posteriormente, para cada novo ponto, ele calcula a distância entre os K vizinhos mais próximos. Procure 
sempre usar um K ímpar. E de acordo com os mais próximos ele é capaz de decidir sobre o novo ponto. 
 
EXEMPLO KNN 
● Um dos datasets mais conhecidos para aprender ML é o Iris Flower. Ele é formado por features 
(atributos) que indicam a largura e o comprimento da Pétala e da Sépala das flores indicando qual é a 
classificação delas. 
 
 
 
 
● Estrutura básica do Dataset Iris Flower. 
 
● Pontos plotados (aqui apenas 2 variáveis). 
 
● Escolha, veja a quantidade de vizinhos para decidir (K). 
● Se K=1, o novo elemento verde (círculo) será classificado como azul (quadrado), se o K=3, o novo será 
vermelho (triângulo) 
 
KNN DEMONSTRAÇÃO 
● Demonstração, apenas para apresentar como é o comportamento. 
 
AVALIAÇÃO DE MODELOS 
● De maneira geral, pode-se afirmar que não existe técnica universal, ou seja, não é possível estabelecer, a 
priori, que uma técnica de ML em particular se sairá melhor na resolução de qualquer tipo de problema. 
● Por exemplo, em domínios em que os exemplos possuem alta dimensionalidade, as SVMs são boas 
candidatas, enquanto o algoritmo KNN usando a distância euclidiana pode, a princípio, não parecer uma 
escolha adequada. 
● Mesmo com o uso dessas heurísticas, diversos algoritmos podem ser candidatos à solução de um 
problema. 
● Ainda que um único algoritmo seja escolhido, pode-se realizar ajustes em seus parâmetros livres, o que 
leva à obtenção de múltiplos modelos para os mesmos dados. 
● Fica clara a necessidade de experimentação. 
● Dessa forma, é recomendável seguir procedimentos que garantam a correção, a validade e a 
reprodutibilidade dos experimentos realizados e, mais importante, das conclusões obtidas a partir de seus 
resultados. 
 
MÉTRICAS 
● Essa avaliação experimental de um algoritmo de ML pode ser realizada segundo diferentes aspectos, tais 
como acurácia do modelo gerado, compreensibilidade do conhecimento extraído, tempo de aprendizado, 
requisitos de armazenamento do modelo, desempenho obtido nas predições realizadas, entre outros. 
● A avaliação de um algoritmo de ML supervisionado é normalmente realizada por meio da análise do 
desempenho do preditor gerado por ele na rotulação de novos objetos, não apresentados previamente em 
seu treinamento. 
● Métricas diferentes podem ser aplicadas para classificação, para regressão e também várias outras 
alternativas como amostragem, bootstrap, validação cruzada, curva roc, entre muitos outros. 
● Para classificação pode-se utilizar a acurácia, que é uma métrica que informa a porcentagem de vezes 
que o modelo acertou. Há outras alternativas mais complexas e que podem ser utilizadas também, como 
matriz de confusão, que permite determinar revocação e precisão por exemplo. 
● Para regressão é comum usar métricas que determinem a diferença de valor entre o valor previsto e o 
valor correto. Algumas medidas como distância média absoluta (Mean Absolute Distance - MAD) e erro 
quadrático médio (Mean Square Error - MSE), além das suasvariações normalizadas, podem ser utilizadas. 
 
AMOSTRAGEM 
● Uma métrica bastante utilizada é dividir os dados disponíveis em duas partes. Utiliza-se muito a 
proporção 75/25, mas não é regra (vai depender dos seus dados). 
● Neste caso, utiliza-se a parte maior, chamada TREINO, para treinar o modelo e depois realiza-se a 
predição com a outra parte dos dados, chamada TESTE. Esse é um passo interessante antes de se colocar 
dados novos para testar o modelo. 
 
VALIDAÇÃO CRUZADA 
● Essa métrica é conhecida como r-fold cross-validation. 
● Métrica muito interessante, que usa o processo semelhante ao de amostragem, entretanto ele divide em 
vários subconjuntos de dados e repete o treinamento nos vários conjuntos. 
● O desempenho final do preditor é dado pela média dos desempenhos observados entre cada conjunto 
de teste. 
 
FINALIZANDO 
● Abordamos o KNN, que é um algoritmo simples e que permite realizar vários tipos de operação 
(classificação, regressão…). 
● Já conseguiu entender a diferença entre classificação e regressão? Pense sempre em um valor categórico 
(label) para classificação e um valor numérico para a regressão. 
● As medidas para avaliação dos modelos são muito importantes. 
● Na última semana nos dedicaremos a um projeto completo, com abordagem sobre todos esses 
elementos! 
 
PERGUNTA 1 
Qual é o nome do atributo alvo do dataset Iris Flower, usado para realizar o processo de 
classificação de dados? 
 
o Petal Width. 
 
o Target_name. 
 
o Sepal Length. 
 
o Sepal Width. 
 
o Petal Length. 
Você acertou! Essa é a alternativa correta. O atributo é o Target_name que serve como alvo para 
o processo de classificação. 
 
Entrevista Renata Castanha (Ambev) 
ENTREVISTA 
● Entrevista com Renata Castanha, Data Product Manager da Ambev, que abordará a questão do mercado de 
trabalho para área de dados e também, como uma grande empresa como a Ambev olha para a questão da análise de 
dados. 
 
PERGUNTA (enunciado) 
Na entrevista realizada com a Renata Castanha, ela falou um pouco da atuação como 
cientista de dados em uma das maiores empresas do Brasil, qual empresa é essa? 
 
o Banco Itaú 
 
o Google 
 
o USP 
 
o Nestlé 
 
o Ambev 
Você acertou! Essa é a alternativa correta. A Renata atua na Ambev. 
Materiais base 
 
Não se esqueça de que, para acessar os livros (abaixo), você antes precisa fazer o login 
através das páginas de acesso Minha Biblioteca e Pearson. 
 
Texto-base I: Inteligência Artificial - Uma Abordagem de Aprendizado de Máquina - 
(Leia as páginas de 54 a 62 e 149 a 162) | André Carlos Ponce de Leon Carvalho et al. 
Texto-base II: Data Science do Zero (Leia capítulo 12) | Joel Grus 
Texto-base III: Análise e modelagem preditiva (Leia as páginas 5-29) | Orlando da Silva 
Júnior 
 
PERGUNTA 1 
Texto-base 6.1 - Inteligência Artificial - Uma Abordagem de Aprendizado de Máquina - (Leia as páginas 54-62 
e 149-162) | André Carlos Ponce de Leon Carvalho et al. 
Qual é a métrica utilizada para regressão que se baseia na distância absoluta média? 
 
 
o Acurácia 
 
o MAD. 
 
o MSE. 
 
o Matriz de Confusão. 
 
o Amostragem. 
Você acertou! Essa é a alternativa correta. A métrica MAD (Mean Absolute Distance) avalia um modelo preditivo 
baseado na distância média absoluta entre o resultado esperado e o preditado. 
 
PERGUNTA 2 
Texto-base 6.2 – Data Science do Zero (Leia o Capítulo 12) | Joel Grus 
Assinale a alternativa que traz o nome de um algoritmo de Machine Learning que realiza processo de 
classificação dos dados, baseado na distância entre eles. 
 
o Logistic regression. 
 
o K-Nearest Neighbors. 
 
o Ridge regression. 
 
o Linear Regression. 
 
o Support Vector Machines. 
Você acertou! Essa é a alternativa correta. O algoritmo K-Nearest Neighbors (KNN) utiliza de cálculo de distância 
para realizar o processo de classificação entre os dados. 
 
PERGUNTA 3 
Texto-base 6.3 – Análise Preditiva para Leigos (Leia as páginas 10-16) | Anasse Bari et al. 
https://login.univesp.br/simplesaml/module.php/core/mb.php
https://login.univesp.br/simplesaml/module.php/core/pearson.php
https://integrada.minhabiblioteca.com.br/reader/books/9788521637509/epubcfi/6/34%5b%3Bvnd.vst.idref%3Dchapter04%5d!/4/24/1:73%5bmer%2Co%20d
https://integrada.minhabiblioteca.com.br/reader/books/9788521637509/epubcfi/6/34%5b%3Bvnd.vst.idref%3Dchapter04%5d!/4/24/1:73%5bmer%2Co%20d
https://integrada.minhabiblioteca.com.br/reader/books/9788550816463/epubcfi/6/38%5b%3Bvnd.vst.idref%3Dcap12.xhtml%5d!/4%5bEPUB_data_science_do_zero-16%5d/2%5b_idContainer121%5d/2/5:0%5b%2CCap
https://acesso.univesp.br/login_mb?bookUrl=9786589881063&pageid=5
https://acesso.univesp.br/login_mb?bookUrl=9786589881063&pageid=5
Considerando as diversas vantagens que uma organização pode obter com a Ciência de Dados, assinale a 
alternativa que traz a vantagem para uma organização, relacionada à característica da análise preditiva 
"Conhecer a lista de desejos de seus clientes”. 
 
 
o Ampliação. 
 
o Regressão. 
 
o Visão. 
 
o Precisão. 
 
o Decisão. 
Você acertou! Essa é a alternativa correta. Uma das análises importantes é o conhecimento e a visão sobre a lista de 
desejos dos clientes, no processo de análise de dados. 
 
Aprofundando o tema 
 
Não se esqueça de que, para acessar os livros (abaixo), você antes precisa fazer o login 
através das páginas de acesso Minha Biblioteca e Pearson. 
 
Material de apoio: Notebook da videoaula 17 – Algoritmo KNN (K-Nearest Neighbors) 
e Avaliação de Modelos Preditivos 
Material de apoio: Análise e modelagem preditiva (Leia as páginas 30-41) | Orlando 
da Silva Júnior 
 
Semana 6 - Fórum temático - Predição 
 
KNN é o melhor algoritmo de predição? Ele sempre será melhor em relação a outros algoritmos 
de predição como Random Forest e Redes Neurais? Justifique sua resposta. 
 
ATIVIDADE AVALIATIVA 
PERGUNTA 1 
Considere como verdadeiras (V) ou falsas (F) as afirmações sobre o uso de datasets da biblioteca Scikit-Learn: 
( ) Para usar o dataset é necessário importá-lo usando o comando “from sklearn import datasets”. 
( ) O comando “iris=datasets.load_iris()” 
 carrega todo o dataset iris para a variável iris. 
( ) Com a variável íris tendo sido carregada com o dataset, o atributo “iris.atributes” terá o nome das colunas 
do dataset. 
( ) Com a variável íris tendo sido carregada com o dataset, os dados, sem a coluna alvo, estarão disponíveis 
em “iris.target”. 
https://login.univesp.br/simplesaml/module.php/core/mb.php
https://login.univesp.br/simplesaml/module.php/core/pearson.php
https://ava.univesp.br/bbcswebdav/xid-5353605_1
https://ava.univesp.br/bbcswebdav/xid-5353605_1
https://acesso.univesp.br/login_mb?bookUrl=9786589881063&pageid=30
A sequência correta de preenchimento dos parênteses, de cima para baixo, é: 
 
o V, V, F, V 
 
o V, F, F, V 
 
o V, V, F, F 
 
o F, V, V, F 
 
o V, F, V, F 
 
PERGUNTA 2 
A utilização de algoritmos por parte da ciência de dados é de fundamental importância para diversos estudos 
envolvendo dados a fim de criar padrões ou modelagens de comportamentos ou para estimar ações futuras. 
Para organizações como um todo, qualquer tipo de vantagem competitiva faz com que as mesmas estejam 
à frente das demais, ou seja, saber mais, um pouco antes, sempre é melhor. Para a análise preditiva de 
dados, temos algoritmos próprios utilizados, dentre eles o algoritmo KNN (K-Nearest Neighbors) o qual pode 
ser utilizado para vários contextos da gestão de negócios, seja para classificação ou regressão etc. 
 
Com base nas informações apresentadas, identifique se são (V) verdadeiras ou (F) falsas as 
afirmativas a seguir. 
I. ( ) A biblioteca Scikit-Learn propicia um leque extenso de aplicações envolvendo o algoritmo KNN. 
II. ( ) No âmbito da ciência de dados, o algoritmo KNN é conhecido por “K-vizinhos mais próximos” 
e apresenta fácil implementação. 
III. ( ) Essencialmente falando, o algoritmo KNNse traduz como um algoritmo supervisionado de 
inteligência de máquina usado para situações/problemas organizacionais de classificação. 
Assinale a alternativa que apresenta a sequência CORRETA. 
o a. F; F; V. 
 
o b. V; F; F. 
 
o c. V; V; F. 
 
o d. F; V; V. 
 
o e. V; V; V. 
 
PERGUNTA 3 
Considere como verdadeiras (V) ou falsas (F) as afirmações a seguir sobre análise preditiva. 
( ) A análise preditiva permite que você veja o invisível para as outras pessoas – em especial, padrões úteis 
em seus dados. 
( ) Aumentar ou não o limite de crédito de um cliente está relacionado à vantagem de visão que a análise 
preditiva proporciona. 
( ) Conhecer a lista de desejos dos seus clientes é uma vantagem de decisão que a análise preditiva 
proporciona. 
( ) Um modelo de análise preditiva bem-feito oferece resultados analíticos livres de emoção ou viés. 
A sequência correta de preenchimento dos parênteses, de cima para baixo, é: 
 
o F, V, V, V 
 
o F, F, V, F 
 
o F, V, F, V 
 
o V, F, F, V 
 
o V, V, F, F 
 
PERGUNTA 4 
Um modelo preditivo bastante conhecido, baseado em distâncias e que não parte de hipóteses matemáticas, nem 
exige maquinário pesado é: 
 
o SVM. 
 
o Random Forest. 
 
o KNN. 
 
o Naive Bayes. 
 
o Árvore de Decisão. 
 
PERGUNTA 5 
No mundo globalizado em que vivemos, tornando-se a informação um aparato competitivo para 
organizações por intermédio de decisões mais assertivas, tecnologias relacionadas a predição de dados são 
visualizadas como ferramentas indispensáveis às empresas, independentemente da área de atuação (às 
vezes, vistas como mecanismo indispensável à sobrevivência por conta da transfiguração de dados em 
verdadeiros tesouros — informações relevantes). Diante disso, questionamentos como os dispostos adiante 
podem aparecer frequentemente. Qual produto ou marca você visualizou antes de decidir por qual comprar? 
Como você poderia escolher a melhor profissão para o futuro? Antes de adquirir um produto, você visualiza 
comentários sobre o mesmo? 
Nesse sentido, modelar comportamentos e descrever ações em data science pode ser realizado por: 
o a. predição de dados. 
 
o b. predição de regressões. 
 
o c. predição de variáveis. 
 
o d. predição de caracteres. 
 
o e. predição unilaterais. 
 
PERGUNTA 6 
No contexto atual, cada vez mais as organizações devem basear suas decisões na análise de dados, desde 
problemas mais simples até os mais complexos. O conhecimento prévio e a obtenção de informações 
relevantes por meio de dados podem se tornar diferenciais competitivos para as organizações, 
independentemente da área de atuação e dos negócios. Disso advém a importância das análises preditivas 
de dados. 
Em relação ao exposto, avalie as afirmações a seguir. 
I. Atualmente as organizações se utilizam da análise preditiva de dados com o intuito de obter 
vantagem competitiva de mercado e aumentar a lucratividade. 
II. A análise preditiva de dados se baseia essencialmente em dados, modelos estatísticos e 
ferramentas de inteligência de máquina (grande volume de dados). 
III. Na tratativa organizacional, a análise preditiva de dados tem como responsabilidade fundamental 
municiar os gestores com informações confiáveis para o processo decisório. 
IV. A análise preditiva de dados permite, por exemplo, a caracterização de possíveis 
comportamentos a posteriori de mercado para direcionar os negócios empresariais. 
Está correto o que se afirma em: 
o a. II e IV, apenas. 
 
o b. I, II e III, apenas. 
 
o c. III e IV, apenas. 
 
o d. I e III, apenas. 
 
o e. I, II, III e IV. 
 
PERGUNTA 7 
A predição de dados é uma técnica diretamente associada a ciência de dados e Inteligência Artificial com o 
intuito de caracterizar padrões, modelar comportamentos e estimar ações futuras. Assim sendo, 
_____________________________ e fundamentalmente usam _________________, 
_____________________ de cunho ____________________________ e técnicas 
de _________________________________, visando essencialmente à caracterização de chances envolvendo 
resultados futuros por meio de dados no passado e no presente. 
Preencha as lacunas escolhendo a alternativa CORRETA: 
o a. preditivas são o maior nível; dados; algoritmos; estatístico; Machine Learning. 
 
o b. preditivas são o maior nível; dados; algoritmos; estatístico; discriminantes. 
 
o c. análises preditivas são o menor nível; dados; algoritmos; estatístico; Machine Learning. 
 
o d. preditivas são o maior nível; dados; algoritmos; algébrico; Machine Learning. 
 
o e. as análises preditivas são o menor nível; dados; algoritmos; estatístico; discriminantes.

Mais conteúdos dessa disciplina