Logo Passei Direto
Buscar

Técnicas Estatísticas Avançadas e Avaliação de Modelos Preditivos

Material
páginas com resultados encontrados.
páginas com resultados encontrados.

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Escolha uma das opções e acesse esse e outros materiais sem bloqueio. 🤩

Cadastre-se ou realize login

Ao continuar, você aceita os Termos de Uso e Política de Privacidade

Prévia do material em texto

Prova 32: Técnicas Estatísticas Avançadas e Avaliação de Modelos Preditivos
Introdução
Nesta prova, discutiremos as técnicas estatísticas avançadas aplicadas à avaliação de modelos preditivos. As questões abordarão desde o uso de métricas de erro até a validação cruzada e otimização de algoritmos para melhorar a performance dos modelos de Machine Learning.
Questões
1. O que caracteriza o modelo de Gradient Boosting?
a) Ele utiliza um único modelo de árvore de decisão para fazer previsões.
b) Ele ajusta iterativamente os erros de previsões anteriores, gerando um modelo mais forte.
c) Ele utiliza apenas dados numéricos para treinamento.
d) Ele combina múltiplos modelos de regressão linear.
e) Ele é usado apenas para problemas de classificação binária.
2. Qual é a principal característica de modelos de séries temporais?
a) Eles são usados apenas para classificação de dados.
b) Eles dependem de dados históricos para prever futuros resultados com base em padrões temporais.
c) Eles não utilizam nenhum tipo de dado numérico.
d) Eles são aplicáveis apenas a dados não estruturados.
e) Eles são adequados apenas para dados categóricos.
3. O que significa o erro de generalização de um modelo preditivo?
a) O erro cometido durante a validação dos dados de treinamento.
b) O erro cometido quando o modelo é aplicado a novos dados não vistos durante o treinamento.
c) O erro cometido apenas nas observações de treinamento.
d) O erro que ocorre devido à falta de dados.
e) O erro gerado durante a implementação do modelo no sistema final.
4. O que é o algoritmo K-fold Cross Validation?
a) Um processo de ajuste de hiperparâmetros para otimizar o modelo.
b) Um método de validação que divide o conjunto de dados em k subconjuntos, utilizando cada subconjunto como dado de teste uma vez.
c) Um processo para treinar o modelo com um único conjunto de dados de treinamento.
d) Uma técnica de redução de dimensionalidade.
e) Um algoritmo utilizado exclusivamente para análise de séries temporais.
5. Qual é o papel da normalização de dados antes de treinar um modelo?
a) Reduzir a quantidade de dados a serem usados.
b) Transformar os dados para que todas as variáveis tenham a mesma escala e unidade de medida.
c) Aumentar o número de variáveis no modelo.
d) Remover dados desnecessários do conjunto.
e) Ajustar os rótulos das variáveis para que fiquem mais claros.
6. Em Redes Neurais, o que é o backpropagation?
a) O processo de inicialização dos pesos das conexões na rede neural.
b) A técnica usada para atualizar os pesos da rede com base no erro cometido.
c) O processo de ativação das camadas da rede neural.
d) A técnica de agrupamento de dados para treinamento.
e) O ajuste dos hiperparâmetros da rede para otimização.
7. O que é o modelo de regressão polinomial?
a) Um modelo onde a relação entre as variáveis independentes e a dependente é representada por um polinômio de grau maior que 1.
b) Um modelo que utiliza apenas uma variável independente.
c) Um modelo que não utiliza qualquer tipo de função matemática.
d) Um modelo de regressão utilizado exclusivamente para classificações binárias.
e) Um modelo onde a relação entre as variáveis é linear.
8. O que significa regularização L2 (Ridge) em modelos de regressão?
a) Penalizar a soma dos quadrados dos coeficientes do modelo para evitar overfitting.
b) Aumentar o número de variáveis independentes no modelo.
c) Diminuir a quantidade de dados de treinamento.
d) Reduzir o erro de validação cruzada.
e) Aumentar a complexidade do modelo para melhorar o ajuste.
9. Qual técnica é usada para lidar com dados desbalanceados em problemas de classificação?
a) Utilizar apenas as classes minoritárias para treinamento.
b) Utilizar a técnica de oversampling ou undersampling para ajustar a distribuição das classes.
c) Remover todas as classes com poucas observações.
d) Utilizar apenas a classe majoritária para treinamento.
e) Ajustar a função de ativação do modelo.
10. O que caracteriza a técnica de análise de componentes principais (PCA)?
a) Aumento da dimensionalidade do conjunto de dados.
b) A redução da dimensionalidade do conjunto de dados, mantendo as informações mais relevantes.
c) A exclusão de variáveis irrelevantes para melhorar a performance.
d) A criação de variáveis artificiais a partir de combinações de variáveis originais.
e) A organização dos dados em clusters.
Gabarito e Justificativas
1. b) O Gradient Boosting ajusta os erros de previsões anteriores, criando um modelo forte ao combinar vários modelos fracos.
2. b) Modelos de séries temporais utilizam dados históricos para prever resultados futuros com base em padrões temporais.
3. b) O erro de generalização é o erro que ocorre quando o modelo é aplicado a novos dados não vistos durante o treinamento.
4. b) O K-fold Cross Validation divide os dados em k subconjuntos, usando cada um como dado de teste uma vez, ajudando a avaliar a robustez do modelo.
5. b) A normalização de dados transforma as variáveis para que todas tenham a mesma escala, o que facilita o treinamento e a convergência do modelo.
6. b) O backpropagation é o processo de atualização dos pesos das redes neurais com base no erro cometido durante o treinamento.
7. a) A regressão polinomial usa um polinômio de grau maior que 1 para modelar a relação entre as variáveis.
8. a) A regularização L2 (Ridge) penaliza a soma dos quadrados dos coeficientes para evitar overfitting, promovendo um modelo mais simples.
9. b) Em problemas de dados desbalanceados, técnicas como oversampling ou undersampling ajustam a distribuição das classes para melhorar o desempenho do modelo.
10. b) O PCA é usado para reduzir a dimensionalidade dos dados, mantendo as informações mais importantes, o que facilita a análise e melhora o desempenho dos modelos.