Prévia do material em texto
Prova- 113: Domínio de Algoritmos de Aprendizado Supervisionado Introdução Esta prova foca em algoritmos de aprendizado supervisionado, abordando desde os conceitos básicos até as técnicas mais avançadas, com ênfase na classificação e regressão de dados. Questões 1. O que caracteriza um algoritmo de aprendizado supervisionado? a) Um algoritmo que aprende a partir de dados não rotulados. b) Um algoritmo que aprende a partir de dados rotulados para prever uma variável dependente. c) Um algoritmo que agrupa dados sem nenhuma supervisão externa. d) Um algoritmo que ajusta seus parâmetros com base em feedback de usuários. e) Um algoritmo que utiliza um único ponto de dados para ajustar seu modelo. 2. Qual é a principal função do K-Nearest Neighbors (k-NN)? a) Agrupar dados com características semelhantes em clusters. b) Classificar dados com base na proximidade aos pontos de dados já rotulados. c) Realizar previsão de séries temporais. d) Reduzir a dimensionalidade dos dados. e) Ajustar os pesos de uma rede neural. 3. O que significa overfitting em um modelo de aprendizado supervisionado? a) Quando o modelo falha em aprender qualquer padrão nos dados. b) Quando o modelo se ajusta excessivamente aos dados de treinamento e perde a capacidade de generalização. c) Quando o modelo é incapaz de aprender padrões dos dados de teste. d) Quando o modelo faz previsões com alta variância e baixo viés. e) Quando o modelo usa apenas dados de teste para treinar. 4. O que caracteriza a técnica de Regularização L2 (Ridge)? a) Penaliza os coeficientes do modelo para reduzir sua complexidade. b) Aumenta os coeficientes do modelo para melhorar a precisão. c) Utiliza apenas um conjunto de dados para a análise. d) Foca na maximização do erro do modelo para melhorar a capacidade de generalização. e) Reduz a quantidade de dados necessários para treinar o modelo. 5. Qual é a principal vantagem do algoritmo Support Vector Machine (SVM)? a) Ele é eficiente para problemas de clustering não supervisionado. b) Ele é eficaz para classificar grandes volumes de dados com alta dimensionalidade. c) Ele é mais adequado para análise de séries temporais. d) Ele usa uma única variável independente para prever resultados. e) Ele é mais eficiente que o k-NN para dados não rotulados. 6. Qual é a principal diferença entre os modelos de Regressão Linear e Regressão Logística? a) A regressão linear é usada para problemas de classificação, enquanto a regressão logística é usada para previsão contínua. b) A regressão linear prevê uma variável contínua, enquanto a regressão logística prevê uma variável categórica. c) A regressão logística requer mais dados do que a regressão linear. d) A regressão linear pode ser aplicada apenas em problemas de séries temporais. e) A regressão logística não pode ser utilizada em problemas de classificação binária. 7. O que é a árvore de decisão? a) Um modelo usado exclusivamente para previsão de séries temporais. b) Um modelo de aprendizado supervisionado que divide os dados em grupos com base em perguntas de sim/não. c) Um algoritmo de aprendizado não supervisionado para agrupar dados com base em características comuns. d) Um modelo de aprendizado profundo usado para prever variáveis contínuas. e) Um algoritmo que analisa dados para encontrar padrões e agrupamentos. 8. O que é a técnica de bagging? a) Um método de ajuste de parâmetros do modelo para melhorar a precisão. b) Um tipo de ensemble learning onde múltiplos modelos são treinados com diferentes subconjuntos dos dados de treinamento. c) Um método de otimização utilizado para melhorar a eficiência do modelo. d) Uma técnica de visualização de dados para encontrar padrões. e) Um algoritmo de redes neurais profundas para análise de imagens. 9. Qual é a principal função do Cross-Validation no treinamento de modelos? a) Garantir que os dados rotulados sejam balanceados antes do treinamento. b) Testar o modelo em dados não rotulados para ajustar seu desempenho. c) Dividir os dados de treinamento em várias partes e treinar o modelo em diferentes subconjuntos para avaliar sua generalização. d) Ajustar automaticamente os hiperparâmetros do modelo. e) Testar o modelo em dados de validação antes de treinar. 10. O que caracteriza o Gradient Boosting? a) Ele constrói um único modelo forte a partir de muitos modelos fracos, geralmente árvores de decisão. b) Ele utiliza múltiplos modelos independentes para melhorar a precisão. c) Ele combina modelos de diferentes tipos, como árvores de decisão e redes neurais. d) Ele é utilizado apenas para análise de séries temporais. e) Ele funciona melhor com dados não rotulados. Gabarito e Justificativas 1. b) Aprendizado supervisionado usa dados rotulados para prever uma variável dependente. 2. b) O K-NN classifica dados com base na proximidade dos pontos de dados rotulados. 3. b) Overfitting ocorre quando o modelo se ajusta excessivamente aos dados de treinamento, perdendo a capacidade de generalização. 4. a) A regularização L2 (Ridge) penaliza os coeficientes do modelo para reduzir sua complexidade. 5. b) O SVM é eficaz para problemas de classificação com alta dimensionalidade. 6. b) A regressão linear prevê variáveis contínuas, enquanto a regressão logística prevê variáveis categóricas. 7. b) A árvore de decisão divide os dados em grupos com base em perguntas de sim/não. 8. b) Bagging treina múltiplos modelos com diferentes subconjuntos dos dados para melhorar a precisão. 9. c) Cross-validation divide os dados de treinamento em partes e avalia a generalização do modelo. 10. a) O Gradient Boosting constrói um modelo forte a partir de muitos modelos fracos, como árvores de decisão.