Prévia do material em texto
Prova de Ciência de Dados: Métodos de Avaliação e Otimização de Modelos Introdução: Esta prova testa os conhecimentos sobre avaliação e otimização de modelos de aprendizado de máquina. Questões sobre métricas de desempenho, validação cruzada, métodos de ajuste de hiperparâmetros e estratégias de otimização serão abordadas. Questão 1 Qual é a principal diferença entre validação cruzada (k-fold cross-validation) e holdout? a) O k-fold usa uma divisão dos dados em múltiplos subconjuntos, enquanto o holdout usa apenas uma divisão simples. b) O k-fold é usado apenas em problemas de regressão, enquanto o holdout é para classificação. c) O k-fold divide os dados em dois subconjuntos, enquanto o holdout divide em três. d) O holdout é mais eficiente porque usa menos dados de teste do que o k-fold. e) O k-fold é utilizado exclusivamente para redes neurais, enquanto o holdout é usado para árvores de decisão. Questão 2 Qual é o principal objetivo da técnica de Grid Search? a) Ajustar automaticamente a estrutura do modelo para encontrar o melhor tipo de algoritmo. b) Encontrar a melhor combinação de hiperparâmetros para um modelo. c) Dividir os dados em diferentes conjuntos de validação. d) Testar a eficácia de diferentes modelos de classificação. e) Melhorar a eficiência de processamento dividindo os dados em subgrupos. Questão 3 O que é a matriz de confusão? a) Uma matriz usada para calcular o erro quadrático médio de um modelo. b) Uma matriz que mostra a relação entre as variáveis independentes e dependentes em um modelo de regressão. c) Uma tabela que apresenta a distribuição das previsões do modelo em comparação com as classes reais. d) Uma matriz usada para calcular a precisão e o recall de um modelo de aprendizado supervisionado. e) Uma tabela que mostra a diferença entre o valor real e o valor predito pelo modelo. Questão 4 O que é Regularização L2 (Ridge)? a) Uma técnica que adiciona uma penalidade ao modelo para evitar o overfitting, penalizando os valores absolutos dos coeficientes. b) Uma técnica usada para aumentar o número de parâmetros no modelo. c) Uma técnica usada para reduzir o número de variáveis explicativas em um modelo. d) Uma técnica que elimina completamente a complexidade do modelo. e) Uma técnica que penaliza os coeficientes quadráticos para reduzir o overfitting e melhorar a generalização. Questão 5 O que é um Hyperparameter em aprendizado de máquina? a) O parâmetro ajustado automaticamente durante o treinamento do modelo. b) O parâmetro usado para calcular a função de perda do modelo. c) O parâmetro ajustado antes do treinamento e influencia o desempenho do modelo. d) O parâmetro que define a quantidade de dados utilizada para treinamento. e) O parâmetro que controla a forma da rede neural em modelos profundos. Questão 6 Qual é a diferença entre precision e recall? a) A precisão mede o número de instâncias positivas corretamente identificadas, enquanto o recall mede todas as instâncias reais positivas. b) A precisão mede o número de instâncias corretamente classificadas, enquanto o recall mede o número de instâncias positivas que o modelo consegue identificar. c) A precisão mede o número de instâncias corretamente classificadas, enquanto o recall mede o erro do modelo. d) A precisão mede a acurácia, enquanto o recall mede a variabilidade do modelo. e) Não existe diferença entre precisão e recall, ambos são iguais. Questão 7 O que caracteriza o Cross-Validation? a) A técnica de dividir os dados em dois grupos: um para treinamento e outro para teste. b) Uma técnica para ajustar os parâmetros de regularização do modelo. c) A técnica de dividir os dados em várias partes e usar uma parte para validação enquanto as demais são usadas para treinamento. d) Um método para avaliar a performance de um modelo em diferentes datasets. e) Uma técnica utilizada para identificar a estrutura dos dados. Questão 8 Qual é a finalidade do AUC-ROC em avaliação de modelos? a) Medir o erro quadrático médio do modelo. b) Avaliar a performance de um modelo de classificação, considerando as taxas de verdadeiro positivo e falso positivo. c) Determinar a precisão do modelo de regressão. d) Calcular a variabilidade do modelo com diferentes conjuntos de treino. e) Estimar a acurácia do modelo a partir de sua matriz de confusão. Questão 9 O que significa o conceito de bias-variance tradeoff? a) A troca entre a complexidade do modelo e o número de parâmetros utilizados. b) A troca entre a flexibilidade do modelo e sua capacidade de generalizar, lidando com overfitting e underfitting. c) A troca entre o tempo de treinamento e a precisão do modelo. d) A troca entre o número de variáveis explicativas e a simplicidade do modelo. e) A troca entre a quantidade de dados e a velocidade de aprendizado do modelo. Questão 10 Qual é a técnica usada para melhorar o desempenho de modelos em datasets desbalanceados? a) Cross-validation. b) Aumento de dados. c) Regularização L1. d) Técnicas de sampling, como oversampling ou undersampling. e) Técnicas de regularização L2. Gabarito e Justificativa 1. a) ○ O k-fold divide os dados em múltiplos subconjuntos para testar o modelo em diferentes divisões dos dados, enquanto o holdout usa apenas uma divisão simples. 2. b) ○ O Grid Search ajuda a encontrar a melhor combinação de hiperparâmetros para o modelo, otimizando seu desempenho. 3. c) ○ A matriz de confusão mostra as previsões do modelo comparadas com os rótulos reais, permitindo calcular métricas como precisão e recall. 4. e) ○ A regularização L2 (Ridge) penaliza os coeficientes quadráticos, ajudando a evitar o overfitting ao reduzir a magnitude dos coeficientes. 5. c) ○ Os hiperparâmetros são ajustados antes do treinamento e influenciam o desempenho do modelo, como a taxa de aprendizado ou o número de camadas. 6. b) ○ A precisão mede o número de instâncias classificadas corretamente, enquanto o recall mede a capacidade do modelo de identificar todas as instâncias positivas. 7. c) ○ O Cross-Validation divide os dados em várias partes, permitindo validar o modelo em diferentes subconjuntos de dados para uma avaliação mais robusta. 8. b) ○ O AUC-ROC mede a performance de um modelo de classificação, levando em conta as taxas de verdadeiro positivo e falso positivo. 9. b) ○ O bias-variance tradeoff lida com a troca entre a complexidade do modelo e sua capacidade de generalizar, equilibrando overfitting e underfitting. 10. d) ● Técnicas como oversampling e undersampling são usadas para balancear datasets desbalanceados, melhorando o desempenho do modelo.