Prévia do material em texto
Prova- 60: Técnicas Estatísticas e Aplicações de Machine Learning Introdução Esta prova explora técnicas avançadas em análise de dados, cobrindo desde a preparação de dados e testes estatísticos até a implementação de modelos de aprendizado supervisionado. O objetivo é avaliar a capacidade de aplicar métodos estatísticos e algoritmos de machine learning de forma eficaz em cenários práticos. Questões 1. Qual é o principal propósito de usar a transformação de Box-Cox em um conjunto de dados? a) Eliminar dados discrepantes. b) Normalizar os dados para que sigam uma distribuição normal. c) Ajustar as variáveis para reduzir a multicolinearidade. d) Aumentar a variabilidade dos dados. e) Agrupar os dados em diferentes categorias. 2. Em regressão logística, o que significa o logit? a) A probabilidade de um evento ocorrer. b) A função de ativação usada para prever a classe de saída. c) A transformação do odds ratio para a variável dependente. d) A medida de erro entre os valores observados e previstos. e) A média ponderada das variáveis independentes. 3. O que define o algoritmo de clustering DBSCAN? a) Ele forma clusters de tamanho fixo com base nas distâncias entre os pontos de dados. b) Ele identifica e agrupa os dados com base em características similares, sem exigir o número de clusters previamente definido. c) Ele usa uma árvore binária para dividir os dados em dois grupos. d) Ele é um algoritmo supervisionado que classifica os dados em categorias. e) Ele utiliza distâncias Euclidianas para prever valores contínuos. 4. Em uma rede neural profunda (Deep Learning), qual é a função de uma camada oculta? a) Transformar entradas em uma saída que o modelo usará para previsões. b) Calcular o erro do modelo durante o treinamento. c) Determinar a probabilidade de uma classe de saída. d) Aprender a partir das representações dos dados, identificando padrões complexos. e) Ajustar o modelo com base no erro da previsão. 5. O que significa o conceito de escolha de modelo em aprendizado de máquina? a) Determinar o tipo de dados a ser utilizado para treinamento. b) Escolher o melhor algoritmo para analisar os dados com base na sua performance. c) Reduzir o número de variáveis para melhorar a precisão do modelo. d) Escolher a função de ativação a ser utilizada em uma rede neural. e) Ajustar os parâmetros de uma árvore de decisão. 6. Em análise de validação cruzada, qual é a vantagem de usar k-fold cross-validation? a) O modelo é treinado em uma única parte dos dados, economizando tempo. b) Ele valida o modelo várias vezes em diferentes subconjuntos de dados, fornecendo uma avaliação mais robusta do desempenho do modelo. c) Ele aumenta a variabilidade dos dados de treinamento. d) Ele ajusta automaticamente os parâmetros do modelo durante a validação. e) Ele remove dados duplicados do conjunto de validação. 7. O que caracteriza a técnica de normalização de dados? a) Modificar os dados para que sigam uma distribuição binomial. b) Ajustar os valores para que eles se alinhem a uma faixa de valores definida, como [0,1]. c) Agrupar dados com base em características semelhantes. d) Remover variáveis independentes que são muito semelhantes. e) Ajustar os dados para um modelo de regressão linear. 8. O que é a técnica de redução de dimensionalidade PCA (Principal Component Analysis)? a) Um algoritmo que divide dados em grupos baseados em similaridades. b) Um método para aumentar o número de variáveis em um conjunto de dados. c) Uma técnica para reduzir o número de variáveis, mantendo a maior quantidade de variabilidade possível. d) Um algoritmo de aprendizado supervisionado que prevê valores contínuos. e) Um método para normalizar os dados para uma faixa específica. 9. O que é o conceito de regularização L1 (Lasso) em modelos de aprendizado de máquina? a) Uma técnica que remove completamente os parâmetros de um modelo. b) Uma técnica de regularização que utiliza a soma dos valores absolutos dos coeficientes. c) Uma técnica que aumenta a complexidade do modelo. d) Uma técnica que melhora a precisão do modelo sem necessidade de mais dados. e) Uma técnica de aprendizado não supervisionado. 10. Em análise de séries temporais, qual é o objetivo do modelo ARIMA? a) Prever a variável dependente com base nas variáveis independentes. b) Analisar a relação entre diferentes variáveis ao longo do tempo. c) Identificar a distribuição dos erros de previsão. d) Modelar e prever dados com base em padrões temporais passados. e) Estimar a probabilidade de ocorrência de eventos futuros. Gabarito e Justificativas 1. b) A transformação de Box-Cox visa normalizar os dados, ajustando-os para que sigam uma distribuição normal. 2. c) O logit é a transformação do odds ratio, usada na regressão logística para modelar a probabilidade de um evento ocorrer. 3. b) O DBSCAN identifica clusters de dados com base em densidade, sem precisar definir previamente o número de clusters. 4. d) As camadas ocultas em redes neurais profundas aprendem representações complexas dos dados, permitindo identificar padrões. 5. b) A escolha de modelo envolve selecionar o melhor algoritmo com base na sua capacidade de desempenho nos dados de treinamento. 6. b) O k-fold cross-validation valida o modelo várias vezes em diferentes subconjuntos de dados, garantindo uma avaliação mais robusta. 7. b) A normalização de dados ajusta os valores para uma faixa definida, como [0,1], facilitando a análise e o treinamento dos modelos. 8. c) O PCA é uma técnica que reduz o número de variáveis, mantendo a maior quantidade possível de variabilidade dos dados. 9. b) A regularização L1 (Lasso) utiliza a soma dos valores absolutos dos coeficientes para penalizar variáveis irrelevantes, promovendo a seleção de variáveis. 10. d) O modelo ARIMA é utilizado para prever séries temporais com base em padrões observados nos dados passados.