Prévia do material em texto
Prova- 76: Técnicas Avançadas em Ciência de Dados Introdução Nesta prova, são abordadas técnicas avançadas em ciência de dados, incluindo análise de grandes volumes de dados, modelagem preditiva, otimização de modelos e avaliação estatística. Questões 1. Qual é o objetivo do método de Monte Carlo em análise de dados? a) Estimar a probabilidade de eventos futuros com base em dados passados. b) Gerar amostras aleatórias para simular diferentes cenários e calcular distribuições de probabilidade. c) Testar a normalidade de um conjunto de dados. d) Prever valores futuros usando técnicas de regressão. e) Agrupar dados em clusters. 2. O que é a técnica de bagging (Bootstrap Aggregating)? a) Um método de aprendizado não supervisionado para previsão de séries temporais. b) Um método de aprendizado supervisionado para otimizar os parâmetros de um modelo. c) Um ensemble de modelos que combina previsões de múltiplos modelos treinados com diferentes subconjuntos de dados. d) Um método para remover outliers de grandes conjuntos de dados. e) Um algoritmo de otimização usado para ajustar hiperparâmetros. 3. O que é o princípio da máxima verossimilhança? a) Uma técnica para medir a precisão de modelos de classificação. b) Um princípio usado para estimar os parâmetros de um modelo com base nos dados observados. c) Uma técnica para ajustar o número de clusters em uma análise de agrupamento. d) Um método de avaliação de desempenho de modelos. e) Uma abordagem para prever o valor de uma variável dependente. 4. Em uma análise de regressão, o que é multicolinearidade? a) Quando há uma forte relação entre a variável dependente e a variável independente. b) Quando duas ou mais variáveis independentes estão altamente correlacionadas entre si. c) Quando os dados não seguem uma distribuição normal. d) Quando os dados são categóricos. e) Quando há uma forte relação entre os resíduos e as variáveis. 5. O que é a análise de componentes principais (PCA)? a) Uma técnica de redução de dimensionalidade que projeta dados em um novo espaço de variáveis principais. b) Um método para calcular a correlação entre variáveis. c) Uma técnica para agrupar dados em clusters. d) Um método de transformação de dados para melhorar a precisão do modelo. e) Um modelo de classificação supervisionado. 6. O que caracteriza o modelo Naive Bayes? a) Um modelo de aprendizado supervisionado baseado em regras de decisão. b) Um modelo de classificação baseado no teorema de Bayes, assumindo que as variáveis independentes são independentes entre si. c) Um modelo de aprendizado não supervisionado para agrupamento de dados. d) Um modelo de regressão para prever variáveis contínuas. e) Um modelo de otimização de parâmetros. 7. Qual é a função do algoritmo K-means em análise de dados? a) Identificar os outliers em um conjunto de dados. b) Criar clusters de dados baseados em características similares. c) Prever variáveis contínuas com base em variáveis independentes. d) Realizar a redução de dimensionalidade dos dados. e) Calcular a correlação entre variáveis. 8. Em aprendizado supervisionado, o que é um conjunto de validação? a) O conjunto de dados usado para treinar o modelo. b) O conjunto de dados usado para ajustar os hiperparâmetros do modelo. c) O conjunto de dados utilizado para fazer previsões com um modelo treinado. d) O conjunto de dados usado para avaliar o desempenho de um modelo. e) O conjunto de dados usado para detectar erros no modelo. 9. O que é a métrica F1? a) A média entre precisão e recall. b) A taxa de erro do modelo. c) A precisão do modelo multiplicada pelo recall. d) A soma da precisão e recall. e) A média ponderada de todas as métricas de avaliação de um modelo. 10. Qual é a principal vantagem de usar Redes Neurais Profundas em aprendizado de máquina? a) Elas são mais rápidas e mais fáceis de treinar do que outros modelos. b) Elas são altamente eficazes para tarefas de classificação e regressão em dados complexos e de alta dimensionalidade. c) Elas funcionam melhor com dados lineares. d) Elas são mais simples do que outros algoritmos de aprendizado supervisionado. e) Elas não precisam de grandes volumes de dados para funcionar. Gabarito e Justificativas 1. b) O método de Monte Carlo usa amostras aleatórias para simular cenários e calcular distribuições de probabilidade. 2. c) Bagging combina múltiplos modelos treinados com subconjuntos de dados, reduzindo a variação do modelo final. 3. b) O princípio da máxima verossimilhança estima parâmetros de um modelo com base nos dados observados. 4. b) A multicolinearidade ocorre quando duas ou mais variáveis independentes estão altamente correlacionadas. 5. a) PCA reduz a dimensionalidade dos dados projetando-os em um novo espaço de variáveis principais. 6. b) O modelo Naive Bayes assume que as variáveis independentes são independentes entre si. 7. b) K-means é um algoritmo de agrupamento que cria clusters com base em características similares. 8. d) O conjunto de validação é usado para avaliar o desempenho de um modelo. 9. a) A métrica F1 é a média harmônica entre precisão e recall. 10. b) Redes neurais profundas são eficazes para tarefas complexas e de alta dimensionalidade, como classificação de imagens e textos.