Logo Passei Direto
Buscar

Técnicas Estatísticas e Aplicações de Machine Learning

Prova sobre Técnicas Estatísticas e Aplicações de Machine Learning com 10 questões de múltipla escolha sobre preparação de dados (Box‑Cox, normalização), regressão logística (logit), DBSCAN, redes neurais, seleção de modelo, k‑fold, PCA, regularização L1 e ARIMA. Inclui gabarito com justificativas.

Material
páginas com resultados encontrados.
páginas com resultados encontrados.

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Prévia do material em texto

Prova- 60: Técnicas Estatísticas e Aplicações de Machine Learning
Introdução
Esta prova explora técnicas avançadas em análise de dados, cobrindo desde a preparação de dados e testes estatísticos até a implementação de modelos de aprendizado supervisionado. O objetivo é avaliar a capacidade de aplicar métodos estatísticos e algoritmos de machine learning de forma eficaz em cenários práticos.
Questões
1. Qual é o principal propósito de usar a transformação de Box-Cox em um conjunto de dados?
a) Eliminar dados discrepantes.
b) Normalizar os dados para que sigam uma distribuição normal.
c) Ajustar as variáveis para reduzir a multicolinearidade.
d) Aumentar a variabilidade dos dados.
e) Agrupar os dados em diferentes categorias.
2. Em regressão logística, o que significa o logit?
a) A probabilidade de um evento ocorrer.
b) A função de ativação usada para prever a classe de saída.
c) A transformação do odds ratio para a variável dependente.
d) A medida de erro entre os valores observados e previstos.
e) A média ponderada das variáveis independentes.
3. O que define o algoritmo de clustering DBSCAN?
a) Ele forma clusters de tamanho fixo com base nas distâncias entre os pontos de dados.
b) Ele identifica e agrupa os dados com base em características similares, sem exigir o número de clusters previamente definido.
c) Ele usa uma árvore binária para dividir os dados em dois grupos.
d) Ele é um algoritmo supervisionado que classifica os dados em categorias.
e) Ele utiliza distâncias Euclidianas para prever valores contínuos.
4. Em uma rede neural profunda (Deep Learning), qual é a função de uma camada oculta?
a) Transformar entradas em uma saída que o modelo usará para previsões.
b) Calcular o erro do modelo durante o treinamento.
c) Determinar a probabilidade de uma classe de saída.
d) Aprender a partir das representações dos dados, identificando padrões complexos.
e) Ajustar o modelo com base no erro da previsão.
5. O que significa o conceito de escolha de modelo em aprendizado de máquina?
a) Determinar o tipo de dados a ser utilizado para treinamento.
b) Escolher o melhor algoritmo para analisar os dados com base na sua performance.
c) Reduzir o número de variáveis para melhorar a precisão do modelo.
d) Escolher a função de ativação a ser utilizada em uma rede neural.
e) Ajustar os parâmetros de uma árvore de decisão.
6. Em análise de validação cruzada, qual é a vantagem de usar k-fold cross-validation?
a) O modelo é treinado em uma única parte dos dados, economizando tempo.
b) Ele valida o modelo várias vezes em diferentes subconjuntos de dados, fornecendo uma avaliação mais robusta do desempenho do modelo.
c) Ele aumenta a variabilidade dos dados de treinamento.
d) Ele ajusta automaticamente os parâmetros do modelo durante a validação.
e) Ele remove dados duplicados do conjunto de validação.
7. O que caracteriza a técnica de normalização de dados?
a) Modificar os dados para que sigam uma distribuição binomial.
b) Ajustar os valores para que eles se alinhem a uma faixa de valores definida, como [0,1].
c) Agrupar dados com base em características semelhantes.
d) Remover variáveis independentes que são muito semelhantes.
e) Ajustar os dados para um modelo de regressão linear.
8. O que é a técnica de redução de dimensionalidade PCA (Principal Component Analysis)?
a) Um algoritmo que divide dados em grupos baseados em similaridades.
b) Um método para aumentar o número de variáveis em um conjunto de dados.
c) Uma técnica para reduzir o número de variáveis, mantendo a maior quantidade de variabilidade possível.
d) Um algoritmo de aprendizado supervisionado que prevê valores contínuos.
e) Um método para normalizar os dados para uma faixa específica.
9. O que é o conceito de regularização L1 (Lasso) em modelos de aprendizado de máquina?
a) Uma técnica que remove completamente os parâmetros de um modelo.
b) Uma técnica de regularização que utiliza a soma dos valores absolutos dos coeficientes.
c) Uma técnica que aumenta a complexidade do modelo.
d) Uma técnica que melhora a precisão do modelo sem necessidade de mais dados.
e) Uma técnica de aprendizado não supervisionado.
10. Em análise de séries temporais, qual é o objetivo do modelo ARIMA?
a) Prever a variável dependente com base nas variáveis independentes.
b) Analisar a relação entre diferentes variáveis ao longo do tempo.
c) Identificar a distribuição dos erros de previsão.
d) Modelar e prever dados com base em padrões temporais passados.
e) Estimar a probabilidade de ocorrência de eventos futuros.
Gabarito e Justificativas
1. b) A transformação de Box-Cox visa normalizar os dados, ajustando-os para que sigam uma distribuição normal.
2. c) O logit é a transformação do odds ratio, usada na regressão logística para modelar a probabilidade de um evento ocorrer.
3. b) O DBSCAN identifica clusters de dados com base em densidade, sem precisar definir previamente o número de clusters.
4. d) As camadas ocultas em redes neurais profundas aprendem representações complexas dos dados, permitindo identificar padrões.
5. b) A escolha de modelo envolve selecionar o melhor algoritmo com base na sua capacidade de desempenho nos dados de treinamento.
6. b) O k-fold cross-validation valida o modelo várias vezes em diferentes subconjuntos de dados, garantindo uma avaliação mais robusta.
7. b) A normalização de dados ajusta os valores para uma faixa definida, como [0,1], facilitando a análise e o treinamento dos modelos.
8. c) O PCA é uma técnica que reduz o número de variáveis, mantendo a maior quantidade possível de variabilidade dos dados.
9. b) A regularização L1 (Lasso) utiliza a soma dos valores absolutos dos coeficientes para penalizar variáveis irrelevantes, promovendo a seleção de variáveis.
10. d) O modelo ARIMA é utilizado para prever séries temporais com base em padrões observados nos dados passados.

Mais conteúdos dessa disciplina