Prévia do material em texto
Prova- 79: Fundamentos de Estatística e Modelagem de Dados Introdução Nesta prova, são abordados conceitos fundamentais de estatística e técnicas de modelagem de dados, com ênfase em testes de hipóteses, avaliação de modelos preditivos e a aplicação de métricas estatísticas. Questões 1. O que caracteriza um modelo de regressão linear simples? a) Um modelo usado para prever a probabilidade de um evento ocorrer com base em variáveis independentes. b) Um modelo que tenta prever uma variável dependente com base em uma única variável independente, assumindo uma relação linear. c) Um modelo de aprendizado não supervisionado. d) Um modelo de previsão para grandes volumes de dados com múltiplas variáveis. e) Um modelo que realiza agrupamento de dados. 2. O que é o erro tipo I em um teste de hipóteses? a) Não rejeitar uma hipótese nula quando ela é verdadeira. b) Rejeitar a hipótese nula quando ela é verdadeira (falso positivo). c) Rejeitar a hipótese alternativa quando ela é verdadeira. d) Não rejeitar uma hipótese nula quando ela é falsa. e) Rejeitar a hipótese alternativa quando ela é falsa. 3. O que é a variância em estatísticas? a) A soma de todos os dados de um conjunto. b) A medida de dispersão que indica o quanto os dados se afastam da média. c) A média ponderada de todos os dados. d) A distribuição dos dados em torno da mediana. e) A probabilidade de que os dados sigam uma distribuição normal. 4. Qual é a principal vantagem da normalização de dados? a) Melhorar a visualização dos dados em gráficos de dispersão. b) Tornar as variáveis comparáveis ao garantir que todas tenham a mesma unidade de medida. c) Ajustar os dados para que sigam uma distribuição normal. d) Aumentar a precisão das previsões de modelos de aprendizado supervisionado. e) Aumentar a variabilidade dos dados. 5. O que significa outlier em um conjunto de dados? a) Um dado que segue de perto a linha de tendência. b) Um dado que é completamente diferente dos outros, frequentemente considerado uma exceção. c) Um dado que representa a média do conjunto. d) Um dado que pertence a um cluster específico. e) Um dado que foi removido de um conjunto de dados devido a erros de medição. 6. O que caracteriza a distribuição binomial? a) Uma distribuição contínua usada para modelar dados de séries temporais. b) Uma distribuição discreta usada para modelar o número de sucessos em uma sequência de experimentos independentes. c) Uma distribuição que descreve a relação entre duas variáveis contínuas. d) Uma distribuição simétrica usada para modelar dados de variáveis contínuas. e) Uma distribuição usada para modelar o tempo entre eventos. 7. O que é a métrica AUC-ROC? a) Uma métrica usada para medir a precisão de modelos de regressão. b) Uma métrica que mede a área sob a curva de erros de um modelo de aprendizado supervisionado. c) A área sob a curva ROC, que avalia a capacidade de um modelo de classificação distinguir entre classes positivas e negativas. d) Uma métrica que mede a relação entre recall e precisão. e) Uma métrica que calcula a média dos erros quadráticos do modelo. 8. O que caracteriza o algoritmo de Naive Bayes? a) Um modelo de agrupamento utilizado para segmentação de clientes. b) Um modelo de aprendizado supervisionado baseado em probabilidades condicionais, assumindo que as variáveis independentes são independentes entre si. c) Um modelo de regressão para prever variáveis contínuas. d) Um modelo de aprendizado não supervisionado para reduzir a dimensionalidade dos dados. e) Um modelo de aprendizado profundo utilizado em redes neurais. 9. Qual é o objetivo de utilizar regularização em modelos de aprendizado de máquina? a) Reduzir a complexidade do modelo e evitar o overfitting. b) Melhorar a precisão do modelo em dados de teste. c) Aumentar a complexidade para melhorar a capacidade de modelar dados ruidosos. d) Aumentar a performance do modelo em grandes volumes de dados. e) Melhorar o desempenho apenas em modelos de redes neurais. 10. O que significa a métrica de precisão em modelos de classificação? a) A proporção de verdadeiros negativos entre o total de predições. b) A proporção de verdadeiros positivos entre o total de predições positivas feitas pelo modelo. c) A proporção de falsos positivos entre o total de predições feitas pelo modelo. d) A capacidade de um modelo de acertar todas as predições possíveis. e) A quantidade de dados usados para treinar um modelo. Gabarito e Justificativas 1. b) A regressão linear simples tenta prever uma variável dependente com base em uma única variável independente com relação linear. 2. b) O erro tipo I ocorre quando rejeitamos a hipótese nula quando ela é verdadeira (falso positivo). 3. b) A variância é uma medida de dispersão que indica o quanto os dados se afastam da média. 4. b) A normalização de dados torna as variáveis comparáveis, ajustando-as para a mesma escala. 5. b) Um outlier é um dado que se afasta significativamente dos outros e é frequentemente considerado uma exceção. 6. b) A distribuição binomial modela o número de sucessos em experimentos independentes. 7. c) A métrica AUC-ROC avalia a capacidade de um modelo de classificação de distinguir entre classes positivas e negativas. 8. b) O Naive Bayes é um modelo baseado em probabilidades condicionais, assumindo independência entre variáveis. 9. a) A regularização reduz a complexidade do modelo, evitando o overfitting. 10. b) A precisão é a proporção de verdadeiros positivos entre o total de predições positivas feitas pelo modelo. Essas novas provas abordam conceitos de estatística, modelagem e avaliação de modelos em um nível mais avançado.