Prévia do material em texto
Prova 55: Análise Preditiva e Modelagem Estatística Introdução Esta prova examina conceitos avançados de análise preditiva e modelagem estatística. O foco está em técnicas utilizadas para prever resultados com base em dados históricos, avaliar o desempenho de modelos preditivos e aplicar estratégias para otimizar a precisão e a robustez do modelo, incluindo validação cruzada, regularização e seleção de características. Questões 1. O que caracteriza um modelo de regressão linear em comparação a um modelo de aprendizado supervisionado mais complexo? a) A regressão linear é mais eficaz em problemas de classificação do que em problemas de regressão. b) A regressão linear assume uma relação linear entre as variáveis dependente e independente, enquanto modelos mais complexos não fazem essa suposição. c) A regressão linear utiliza uma abordagem não supervisionada, enquanto os modelos mais complexos são supervisionados. d) A regressão linear é mais complexa do que modelos de aprendizado supervisionado mais avançados. e) A regressão linear é usada apenas para previsão de variáveis categóricas. 2. Qual a principal diferença entre regressão linear simples e regressão múltipla? a) A regressão simples lida com apenas uma variável dependente, enquanto a regressão múltipla pode lidar com múltiplas variáveis dependentes. b) A regressão simples é usada para problemas de classificação, enquanto a múltipla é usada para problemas de regressão. c) A regressão simples utiliza uma variável independente, enquanto a regressão múltipla utiliza duas ou mais variáveis independentes. d) A regressão simples utiliza apenas variáveis categóricas, enquanto a regressão múltipla utiliza variáveis contínuas. e) A regressão múltipla é mais simples de interpretar do que a regressão simples. 3. O que significa Acurácia em um modelo de classificação? a) A acurácia mede a proporção de verdadeiros positivos e verdadeiros negativos em relação ao número total de previsões feitas pelo modelo. b) A acurácia mede o erro quadrático médio de um modelo de regressão. c) A acurácia é a capacidade do modelo de minimizar o viés em relação aos dados de treinamento. d) A acurácia mede o desempenho do modelo com relação a dados que não foram vistos durante o treinamento. e) A acurácia é uma métrica de desempenho usada apenas em problemas de regressão. 4. Qual é a finalidade do principal component analysis (PCA)? a) Classificar os dados em diferentes categorias com base em suas características. b) Reduzir a dimensionalidade dos dados, mantendo o máximo possível de variação. c) Aumentar a complexidade dos dados para melhorar o ajuste do modelo. d) Melhorar a qualidade dos dados sem alterar a quantidade de variáveis. e) Determinar a importância relativa de cada variável no modelo. 5. O que caracteriza o uso do K-fold Cross Validation? a) Dividir os dados em um número fixo de subconjuntos, utilizando um subconjunto para validação e os outros para treinamento. b) Realizar o treinamento em todo o conjunto de dados e usar apenas um subconjunto de dados para testar a acurácia. c) Realizar o treinamento com dados sintéticos gerados aleatoriamente. d) Ajustar os hiperparâmetros do modelo sem precisar dividir os dados de entrada. e) Testar o modelo em dados de treinamento e em dados de validação para evitar overfitting. 6. Quando devemos usar a técnica de regularização L1 (Lasso) em um modelo de regressão? a) Quando há uma grande quantidade de variáveis independentes irrelevantes, para reduzir o impacto dessas variáveis. b) Quando se deseja reduzir a complexidade do modelo sem reduzir o número de variáveis. c) Quando se precisa aumentar o número de variáveis independentes para melhorar o desempenho do modelo. d) Quando o modelo está apresentando problemas de overfitting devido à alta variabilidade nos dados. e) Quando se quer incluir todas as variáveis no modelo sem fazer qualquer penalização. 7. Qual a principal vantagem de usar Redes Neurais para tarefas de classificação em relação a outros algoritmos? a) Elas exigem menos dados para treinar o modelo de maneira eficiente. b) Elas são capazes de modelar relações complexas e não-lineares entre variáveis de entrada e saída. c) Elas fornecem resultados mais interpretáveis do que algoritmos como árvores de decisão. d) Elas são mais rápidas em termos de tempo de treinamento do que outros algoritmos. e) Elas não necessitam de validação cruzada, uma vez que têm alta generalização. 8. O que é um modelo de Classificação de Árvores de Decisão? a) Um modelo que utiliza uma função matemática linear para predizer um valor contínuo. b) Um modelo que cria um gráfico de decisões binárias baseado nas variáveis de entrada para classificar os dados. c) Um modelo que faz previsões com base em K-vizinhos mais próximos. d) Um modelo baseado em uma única equação de regressão para prever valores contínuos. e) Um modelo que é baseado em agrupamentos de dados para classificar informações. 9. Qual a principal limitação da Acurácia como métrica de desempenho em um modelo de classificação desequilibrada? a) A acurácia pode ser influenciada por uma alta taxa de erro, não representando o verdadeiro desempenho do modelo em classificar ambas as classes. b) A acurácia só funciona bem em modelos de classificação binária, não sendo útil para problemas multiclasse. c) A acurácia mede apenas a precisão, não levando em consideração a completude das predições. d) A acurácia não é sensível ao overfitting, tornando difícil avaliar modelos muito complexos. e) A acurácia é sempre uma métrica confiável, independentemente do desequilíbrio entre as classes. 10. O que é Overfitting e como ele pode ser identificado em um modelo? a) Overfitting ocorre quando o modelo tem um desempenho ruim tanto nos dados de treinamento quanto nos dados de teste. Ele é identificado pela alta acurácia nos dados de teste. b) Overfitting ocorre quando o modelo se ajusta excessivamente aos dados de treinamento, perdendo a capacidade de generalizar. Pode ser identificado por uma grande diferença de performance entre os dados de treinamento e teste. c) Overfitting ocorre quando o modelo faz previsões melhores nos dados de teste do que nos dados de treinamento. d) Overfitting ocorre quando o modelo é muito simples, e ele é identificado quando a performance nos dados de teste é muito baixa. e) Overfitting é a capacidade de um modelo prever corretamente as classes nos dados de treinamento, mas sem erros nos dados de validação. Gabarito e Justificativas 1. b) A regressão linear simples assume uma relação linear entre as variáveis dependente e independente. Modelos mais complexos podem capturar relações não-lineares. 2. c) A regressão linear simples utiliza uma variável independente, enquanto a regressão múltipla utiliza duas ou mais variáveis independentes para prever a variável dependente. 3. a) A acurácia mede a proporção de predições corretas (verdadeiros positivos e verdadeiros negativos) em relação ao total de predições feitas. 4. b) O PCA é usado para reduzir a dimensionalidade dos dados, mantendo o máximo possível de variação entre as variáveis. 5. a) O K-fold cross-validation divide os dados em K subconjuntos, realizando treinamento e validação em diferentes combinações de subconjuntos para avaliar o desempenho do modelo. 6. a) A regularização L1 (Lasso) é usada para reduzir a quantidade de variáveis independentes irrelevantes, forçando os coeficientes de algumas variáveis a serem zero. 7. b) As redes neurais são poderosas para modelar relações complexas e não-lineares, sendo adequadas para tarefas de classificação em que outras abordagens falham. 8. b) As árvores de decisão dividem os dados em categorias baseadas em regras de decisão, fazendo previsões com base em condições sucessivas. 9. a) A acurácia pode ser enganosa em problemas com classes desequilibradas, já que ela pode ser influenciada pela classe majoritária, sem refletir o desempenho em relação à classe minoritária. 10. b) Overfitting ocorre quando o modelo aprende excessivamente os detalhes dos dados de treinamento,o que prejudica sua capacidade de generalizar para novos dados, sendo identificado pela discrepância entre o desempenho nos dados de treinamento e de teste.