Prévia do material em texto
🎓 SIMULADO GERAL FINAL INTEGRADOR
PES310 — Modelagem e Inferência Estatística
Material Otimizado para Impressão e Exportação para PDF
📌 PARTE I: CADERNO DE QUESTÕES
MÓDULO 1: Fundamentos da Regressão Linear Simples e MQO (Semanas 1 e 2)
QUESTÃO 1
Um engenheiro de produção analisou a relação entre o tempo de uso de um maquinário industrial ($X$, em centenas de horas) e o custo mensal de manutenção ($Y$, em milhares de reais). A partir de uma amostra de $n = 10$ máquinas, obtiveram-se os seguintes somatórios:
$$\sum x_i = 40 \quad | \quad \sum y_i = 100 \quad | \quad \sum x_i^2 = 200 \quad | \quad \sum y_i^2 = 1100 \quad | \quad \sum x_i y_i = 460$$
Com base nos estimadores de Mínimos Quadrados Ordinários (MQO), a equação da reta ajustada (\(\hat{y} = \hat{\beta}_0 + \hat{\beta}_1 x\)) e o custo estimado de manutenção para uma máquina com $X = 8$ ($800$ horas de uso) são, respectivamente:
A) $\hat{y} = 1,5 + 4,0 x \quad \text{e} \quad \hat{y}(8) = 33,5\text{ mil reais}$
B) $\hat{y} = 4,0 + 1,5 x \quad \text{e} \quad \hat{y}(8) = 16,0\text{ mil reais}$
C) $\hat{y} = 10,0 + 1,5 x \quad \text{e} \quad \hat{y}(8) = 22,0\text{ mil reais}$
D) $\hat{y} = 1,5 + 10,0 x \quad \text{e} \quad \hat{y}(8) = 81,5\text{ mil reais}$
E) $\hat{y} = 2,5 + 2,0 x \quad \text{e} \quad \hat{y}(8) = 18,5\text{ mil reais}$
QUESTÃO 2
Em um ajuste por Mínimos Quadrados Ordinários para $n = 25$ observações, verificou-se que a Soma dos Quadrados Totais da variável dependente foi $SQT = 400,0$ e a Soma dos Quadrados dos Erros foi $SQE = 100,0$. O valor da Soma dos Quadrados da Regressão (\(SQR\)) e a proporção de variabilidade explicada pelo modelo (\(R^2\)) são:
A) $SQR = 300,0 \quad \text{e} \quad R^2 = 0,75$
B) $SQR = 100,0 \quad \text{e} \quad R^2 = 0,25$
C) $SQR = 500,0 \quad \text{e} \quad R^2 = 0,80$
D) $SQR = 300,0 \quad \text{e} \quad R^2 = 0,25$
E) $SQR = 200,0 \quad \text{e} \quad R^2 = 0,50$
QUESTÃO 3
A respeito das propriedades matemáticas e geométricas estabelecidas pelo método dos Mínimos Quadrados Ordinários (MQO) na regressão linear simples com intercepto, assinale a alternativa CORRETA:
A) Os resíduos observados $e_i = y_i - \hat{y}_i$ possuem soma estritamente positiva se a inclinação estimada $\hat{\beta}_1$ for positiva.
B) A reta de regressão estimada por MQO não passa necessariamente pelo ponto das médias amostrais $(\bar{x}, \bar{y})$, a menos que $R^2 = 1,0$.
C) O somatório do produto de cada valor predito pelo respectivo resíduo é estritamente nulo, ou seja, $\sum \hat{y}_i e_i = 0$.
D) O método do MQO minimiza a soma das distâncias perpendiculares ortogonais de cada ponto até a reta ajustada.
E) Multiplicar todos os valores da variável $X$ por uma constante $c > 0$ altera o valor do coeficiente de determinação $R^2$.
MÓDULO 2: Inferência Estatística na Regressão Linear Simples (Semana 3)
QUESTÃO 4
Em um modelo de regressão linear simples ajustado com $n = 22$ observações, encontrou-se uma Soma dos Quadrados dos Erros $SQE = 80,0$ e uma Soma dos Quadrados de $X$ igual a $S_{xx} = 400,0$. Sabendo que o coeficiente angular estimado foi $\hat{\beta}_1 = -0,40$, a estatística de teste $t$ para testar a utilidade do modelo ($H_0: \beta_1 = 0$ vs. $H_a: \beta_1 \neq 0$) e os graus de liberdade residuais correspondentes são:
A) $t = -4,00 \quad \text{e} \quad gl = 20$
B) $t = -2,00 \quad \text{e} \quad gl = 21$
C) $t = -4,00 \quad \text{e} \quad gl = 21$
D) $t = +2,00 \quad \text{e} \quad gl = 20$
E) $t = -0,10 \quad \text{e} \quad gl = 22$
QUESTÃO 5
Considere a construção de um Intervalo de Confiança (\(IC\)) para a resposta média $E(Y|x^*)$ e de um Intervalo de Previsão (\(IP\)) para uma observação futura individual $Y_{prev}$, ambos calculados sob o mesmo valor preditor $x^*$. A razão teórica pela qual o $IP$ é rigorosamente mais largo que o $IC$ reside no fato de que:
A) O $IP$ utiliza a distribuição $F$ de Snedecor, enquanto o $IC$ utiliza a distribuição $t$ de Student.
B) O $IP$ contabiliza, além da variabilidade amostral da estimativa da reta, a variabilidade do erro aleatório individual (\(\sigma^2\)) da nova observação.
C) O $IC$ perde um grau de liberdade adicional no denominador da margem de erro.
D) O $IP$ não é afetado pela distância do ponto $x^*$ em relação à média amostral $\bar{x}$.
E) O $IC$ é aplicável apenas a amostras com $n > 100$, enquanto o $IP$ exige $nEm um estudo de risco de crédito, ajustou-se um modelo de regressão logística para prever a probabilidade de inadimplência (\(Y = 1\)) em função da pontuação do cliente (\(X\)), obtendo-se a equação logit: $\ln(\text{Odds}) = -2,4 + 0,8 X$. Para um cliente com pontuação $X = 3$, a probabilidade estimada de inadimplência $p(3)$ e a Razão de Chances (Odds Ratio — $OR$) para cada aumento unitário em $X$ são, respectivamente:
A) $p(3) = 0,50 \quad \text{e} \quad OR = e^{0,8} \approx 2,23$
B) $p(3) = 0,25 \quad \text{e} \quad OR = 0,80$
C) $p(3) = 0,50 \quad \text{e} \quad OR = e^{-2,4} \approx 0,09$
D) $p(3) = 0,75 \quad \text{e} \quad OR = e^{0,8} \approx 2,23$
E) $p(3) = 0,00 \quad \text{e} \quad OR = 1,00$
QUESTÃO 12
Na aplicação da técnica de regressão não paramétrica localmente ponderada (LOESS), a escolha do parâmetro de suavização (largura de banda \(h\) ou span \(f\)) é decisiva para a qualidade do ajuste. Reduzir excessivamente o valor de \(f\) (utilizando uma fração muito pequena de pontos vizinhos) provoca:
A) Aumento do viés e redução drástica da variância, gerando uma curva praticamente reta (underfitting).
B) Redução do viés e aumento da variância, tornando a curva altamente oscilatória e sensível a ruídos locais (overfitting).
C) A transformação do modelo em uma regressão logística paramétrica global.
D) A eliminação completa do erro residual para todas as observações futuras fora da amostra.
E) A obrigatoriedade do uso de erros multiplicativos lognormais.
QUESTÃO 13
Para uma amostra original de dados observados contendo \(n = 4\) elementos distintos \(A = {10, 20, 30, 40}\), o número total de amostras Bootstrap distintas (considerando combinações com reposição onde a frequência dos elementos importa, mas não a ordem) é igual a:
A) \(4\)
B) \(16\)
C) \(24\)
D) \(35\)
E) \(256\)
MÓDULO 5: Regressão Múltipla, Multicolinearidade e Seleção (Semana 7)
QUESTÃO 14
Um modelo de regressão múltipla foi estimado como \(\hat{y} = 10 + 2,0 x_1 + 1,5 x_2 + 0,5 (x_1 x_2)\). A alteração média esperada no valor da variável resposta \(Y\) provocada pelo aumento de \(1\) unidade no preditor \(X_1\), quando \(X_2 = 4\), é igual a:
A) \(2,0\) unidades.
B) \(3,5\) unidades.
C) \(4,0\) unidades.
D) \(4,5\) unidades.
E) \(14,0\) unidades.
QUESTÃO 15
Ajustou-se um modelo de regressão linear múltipla com \(k = 3\) variáveis explicativas para uma amostra de \(n = 24\) observações. A análise de variância reportou \(SQR = 180,0\) e \(SQE = 100,0\). A estatística de teste \(F\) para testar a significância global do modelo (\(H_0: \beta_1 = \beta_2 = \beta_3 = 0\)) é:
A) \(F = 1,80\)
B) \(F = 6,00\)
C) \(F = 12,00\)
D) \(F = 36,00\)
E) \(F = 8,57\)
QUESTÃO 16
Em um modelo de regressão múltipla, regrediu-se o preditor \(X_3\) contra os demais regressores do modelo, obtendo-se um coeficiente de determinação \(R_3^2 = 0,80\). O Fator de Inflação da Variância (\(VIF_3\)) para esse preditor e a sua interpretação sobre a variância do coeficiente estimado são:
A) \(VIF_3 = 1,25\); indica que a variância do coeficiente foi reduzida em \(25%\).
B) \(VIF_3 = 5,00\); indica que a variância do coeficiente estimado foi inflacionada por um fator de \(5\) devido à colinearidade.
C) \(VIF_3 = 0,20\); indica ausência completa de correlação entre os preditores.
D) \(VIF_3 = 10,00\); indica colinearidade estritamente perfeita.
E) \(VIF_3 = 4,00\); indica que a variável deve ser eliminada imediatamente sem análise prévia.
QUESTÃO 17
Deseja-se selecionar o melhor subconjunto de regressores entre vários modelos candidatos. Um modelo com \(k = 4\) preditores (ou seja, \(p = k + 1 = 5\) parâmetros) foi avaliado. De acordo com o critério de Mallows, esse modelo apresentará um ajuste parsimonioso e praticamente isento de viés de subespecificação se o seu indicador \(C_p\) for:
A) Muito superior a \(n\) (\(C_p \ge 100\)).
B) Próximo ou igual ao número de parâmetros do modelo (\(C_p \approx 5,0\)).
C) Estritamente igual a \(0,0\).
D) Menor que o valor de \(R^2\) simples do modelo inicial.
E) Negativo.
MÓDULO 6: Questão Integradora de Diagnóstico Completo
QUESTÃO 18
Um analista de dados ajustou um modelo de regressão múltipla por MQO com \(k = 4\) preditores contínuos. A saída do software apresentou \(R^2 = 0,91\) e teste \(F\) global altamente significativo (\(pC
· Fundamentação Teórica: As equações normais da estimação por MQO garantem que o vetor de resíduos e o vetor de valores preditos são estritamente ortogonais, implicando que a soma do produto \(\sum \hat{y}_i e_i = 0\).
· Análise dos Distratores:
· A: A soma dos resíduos observados em modelos com intercepto é sempre igual a zero (\(\sum e_i = 0\)).
· B: A reta sempre passa pelo ponto amostral médio \((\bar{x}, \bar{y})\) porque \(\hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x}\).
· D: O MQO minimiza distâncias verticais no eixo \(Y\), não distâncias ortogonais perpendiculares.
· E: Multiplicar \(X\) por constante positiva escala a inclinação \(\hat{\beta}_1\), mas preserva \(R^2\).
QUESTÃO 4: Alternativa A
· Resolução Matemática:
1. Variância residual: \(s^2 = \text{QME} = \frac{SQE}{n - 2} = \frac{80,0}{22 - 2} = \frac{80,0}{20} = 4,0 \implies s = \sqrt{4,0} = 2,0\).
2. Erro padrão da inclinação: \(s_{\hat{\beta}1} = \frac{s}{\sqrt{S{xx}}} = \frac{2,0}{\sqrt{400,0}} = \frac{2,0}{20,0} = 0,10\).
3. Estatística \(t\): \(t = \frac{\hat{\beta}1 - 0}{s{\hat{\beta}_1}} = \frac{-0,40}{0,10} = -4,00\).
4. Graus de liberdade residuais: \(gl = n - 2 = 22 - 2 = 20\).
· Análise dos Distratores:
. B: Utilizou \(gl = 21\) (\(n-1\)) incorretamente.
. C: Obteve \(t = -4,00\) correto, mas errou os graus de liberdade (\(gl = 21\)).
. D: Omitiu o sinal negativo do coeficiente.
. E: Inverteu o cálculo do erro padrão.
QUESTÃO 5: Alternativa B
· Fundamentação Teórica: O erro padrão para a resposta média é \(s_{\hat{y}^*} = s \sqrt{\frac{1}{n} + \frac{(x^* - \bar{x})^2}{S_{xx}}}\). Para uma observação individual futura, a variância preditiva soma a incerteza do erro aleatório \(\sigma^2\) dessa nova observação, resultando em \(s_{prev} = s \sqrt{1 + \frac{1}{n} + \frac{(x^* - \bar{x})^2}{S_{xx}}}\). O termo \(+1\) sob o radical torna o \(IP\) mais largo.
· Análise dos Distratores:
· A: Ambos usam a distribuição \(t\) de Student com \(n-2\) gl.
· C: Ambos possuem os mesmos graus de liberdade.
· D: Quanto mais distante \(x^*\) estiver de \(\bar{x}\), maior o termo \((x^* - \bar{x})^2\), alargando ambos os intervalos.
· E: Ambas as fórmulas aplicam-se a amostras pequenas ou grandes sem restrição.
QUESTÃO 6: Alternativa B
· Fundamentação Teórica: A regra de tomada de decisão via nível descritivo é: se \(p\text{-valor} \le \alpha\), rejeita-se \(H_0\); se \(p\text{-valor} > \alpha\), não se rejeita \(H_0\). Como \(p\text{-valor} = 0,042\) é maior que \(\alpha = 0,01\), a decisão estatística a \(1%\) de significância é não rejeitar \(H_0\).
· Análise dos Distratores:
· A: O resultado seria significativo a \(5%\) (\(\alpha = 0,05\)), mas não a \(1%\) (\(\alpha = 0,01\)).
· C: A comparação do valor \(t\) deve ser feita contra o valor crítico de tabela \(t_{0,005; 28} \approx 2,763\), e não contra \(1,0\).
· D: Testes de hipóteses não "provam" valores numéricos exatos para parâmetros populacionais.
· E: O valor do erro padrão não invalida o teste.
QUESTÃO 7: Alternativa C
· Resolução Matemática:
1. Equação linearizada do modelo de potência: \(\ln Y = \ln \alpha + \beta \ln X + \ln \epsilon \implies y' = \beta_0 + \beta_1 x' + \epsilon'\).
2. Estimador do intercepto: \(\hat{\beta}_0 = \ln \hat{\alpha} = 1,6094\).
3. Retornando à escala original de \(\alpha\): \(\hat{\alpha} = e^{\hat{\beta}_0} = e^{1,6094} = 5,00\).
4. O coeficiente angular na escala transformada é diretamente o expoente original: \(\hat{\beta} = \hat{\beta}_1 = 0,50\).
· Análise dos Distratores:
. A: Não aplicou a exponencial \(e^{\hat{\beta}_0}\) para obter \(\alpha\).
. B e D: Inverteram as atribuições dos parâmetros originais \(\alpha\) e \(\beta\).
. E: Aplicou a exponencial sobre o coeficiente de inclinação indevidamente.
QUESTÃO 8: Alternativa D
· Fundamentação Teórica: No MQP, os pesos são inversamente proporcionais às variâncias residuais de cada observação: \(w_i = \frac{1}{\sigma_i^2}\). Se o desvio padrão cresce proporcionalmente a \(x_i\) (\(\sigma_i = c \cdot x_i\)), a variância é \(\sigma_i^2 = c^2 x_i^2\). Desprezando a constante \(c^2\), o peso ótimo é \(w_i = \frac{1}{x_i^2}\).
· Análise dos Distratores:
· A, B e E: Atribuiriam pesos maiores para observações com maiores variâncias, instabilizando os estimadores.
· C: Seria o peso correto se a variância (não o desvio padrão) fosse proporcional a \(x_i\) (\(\sigma_i^2 = c \cdot x_i\)).
QUESTÃO 9: Alternativa A
· Fundamentação Teórica:
1. Formato em funil no gráfico \(e \times \hat{y}\) indica variância não constante (Heterocedasticidade).
2. Padrão em parábola ou curva em "U" indica falta de ajuste funcional, exigindo um termo quadrático/polinomial.
3. Curvatura em "S" no Q-Q Plot indica que os resíduos observados diferem dos quantis da distribuição normal (Não-normalidade).
· Análise dos Distratores:
. B, C, D e E: Confundem os diagnósticos gráficos padrão da disciplina.
QUESTÃO 10: Alternativa A
· Resolução Matemática:
1. Em modelos polinomiais de grau \(k = 2\), estimam-se \(k+1 = 3\) parâmetros (\(\beta_0, \beta_1, \beta_2\)).
2. Graus de liberdade residuais: \(gl_{res} = n - (k + 1) = 15 - 3 = 12\).
3. Variância residual: \(s^2 = \text{QME} = \frac{SQE}{gl_{res}} = \frac{36,0}{12} = 3,00\).
4. Graus de liberdade totais: \(gl_{tot} = n - 1 = 15 - 1 = 14\).
5. \(R^2_{aj} = 1 - \frac{SQE / gl_{res}}{SQT / gl_{tot}} = 1 - \frac{36,0 / 12}{200,0 / 14} = 1 - \frac{3,00}{14,2857} = 1 - 0,2100 = 0,7900\) (\(79%\)).
· Análise dos Distratores:
. B: Apresenta o \(R^2\) simples não ajustado (\(1 - 36/200 = 0,82\)) e dividiu SQE por \(n=15\).
. C: Obteve \(s^2 = 3,00\) correto, mas informou o \(R^2\) não ajustado.
. D e E: Erros no cômputo dos graus de liberdade no denominador.
QUESTÃO 11: Alternativa A
· Resolução Matemática:
1. Expoente logit para \(X = 3\): \(z = -2,4 + 0,8(3) = -2,4 + 2,4 = 0,0\).
2. Razão de chances para \(X = 3\): \(\text{Odds}(3) = e^z = e^{0,0} = 1,00\).
3. Probabilidade estimada: \(p(3) = \frac{e^z}{1 + e^z} = \frac{1,00}{1 + 1,00} = \frac{1,00}{2,00} = 0,50\) (\(50%\)).
4. Odds Ratio (\(OR\)) para aumento unitário em \(X\): \(OR = e^{\beta_1} = e^{0,8} \approx 2,2255 \approx 2,23\).
· Análise dos Distratores:
. B: Confundiu o coeficiente angular com a razão de chances.
. C: Aplicou a exponencial sobre o intercepto em vez da inclinação.
. D: Calculou para um valor \(z\) incorreto.
. E: Zerou a probabilidade incorretamente.
QUESTÃO 12: Alternativa B
· Fundamentação Teórica: Um span \(f\) muito pequeno utiliza pouquíssimos pontos vizinhos em cada ajuste local. Isso torna o modelo extremamente sensível a flutuações aleatórias da amostra, eliminando o viés do treino, mas aumentando drasticamente a variância da curva (overfitting).
· Análise dos Distratores:
· A: Descreve o efeito de escolher um \(f\) muito grande (underfitting).
· C: LOESS é uma técnica não paramétrica para dados contínuos.
· D: Nenhum modelo não paramétrico elimina o erro residual em dados futuros.
· E: O LOESS não faz suposições de distribuição lognormal nos erros.
QUESTÃO 13: Alternativa D
· Resolução Matemática:
1. O número de amostras Bootstrap distintas obtidas por amostragem com reposição de tamanho \(n\) a partir de um conjunto de tamanho \(n\) equivale à combinação com repetição \(\binom{2n-1}{n}\).
2. Para \(n = 4\): \[\text{N}_b = \binom{2(4) - 1}{4} = \binom{7}{4} = \frac{7!}{4! (7-4)!} = \frac{7 \times 6 \times 5 \times 4!}{4! \times (3 \times 2 \times 1)} = \frac{210}{6} = 35\]
· Análise dos Distratores:
. A: \(n = 4\).
. B: \(n^2 = 4^2 = 16\).
. C: Permutação simples sem reposição (\(4! = 24\)).
. E: Número total de sequências ordenadas (\(n^n = 4^4 = 256\)).
QUESTÃO 14: Alternativa C
· Resolução Matemática:
1. Para encontrar a taxa de variação parcial de \(\hat{y}\) em relação a \(X_1\), reescrevemos o modelo isolando \(X_1\): \[\hat{y} = 10 + (2,0 + 0,5 x_2) x_1 + 1,5 x_2\]
2. O efeito marginal é dado por: \(\frac{\partial \hat{y}}{\partial x_1} = 2,0 + 0,5 x_2\).
3. Substituindo \(X_2 = 4\): \[\text{Efeito marginal} = 2,0 + 0,5(4) = 2,0 + 2,0 = 4,0\text{ unidades}\]· Análise dos Distratores:
. A: Ignorou o termo de interação (\(2,0\)).
. B: Somou os coeficientes principais sem utilizar \(X_2\) (\(2,0 + 1,5 = 3,5\)).
. D e E: Erros na substituição algébrica.
QUESTÃO 15: Alternativa C
· Resolução Matemática:
1. Quadrado Médio da Regressão: \(QMR = \frac{SQR}{k} = \frac{180,0}{3} = 60,0\).
2. Graus de liberdade residuais: \(gl_{res} = n - (k + 1) = 24 - (3 + 1) = 20\).
3. Quadrado Médio do Erro: \(QME = \frac{SQE}{gl_{res}} = \frac{100,0}{20} = 5,0\).
4. Estatística \(F\) Global: \(F = \frac{QMR}{QME} = \frac{60,0}{5,0} = 12,00\).
· Análise dos Distratores:
. A: Dividiu \(SQR / SQE = 180 / 100 = 1,80\) sem calcular as médias dos quadrados.
. B: Dividiu \(SQR\) pelos \(gl_{res}\) (\(180 / 20 = 9\)).
. D: Elevou a estatística ao quadrado indevidamente.
. E: Dividiu \(SQT / SQE\).
QUESTÃO 16: Alternativa B
· Resolução Matemática:
1. Fator de Inflação da Variância: \(VIF_j = \frac{1}{1 - R_j^2}\).
2. Substituindo \(R_3^2 = 0,80\): \[VIF_3 = \frac{1}{1 - 0,80} = \frac{1}{0,20} = 5,00\]
3. Interpretação: A variância do estimador do coeficiente \(\hat{\beta}_3\) foi inflacionada por um fator de \(5\) devido à colinearidade com os demais regressores.
· Análise dos Distratores:
. A: Calculou \(1 / 0,80 = 1,25\).
. C: Apresenta a tolerância \((1 - R_3^2 = 0,20)\), que é o inverso do VIF.
. D: Valor de VIF correspondente a \(R^2 = 0,90\).
. E: Apresenta a regra de corte teórica sem realizar o cômputo.
QUESTÃO 17: Alternativa B
· Fundamentação Teórica: O critério \(C_p\) de Mallows avalia o erro quadrático médio de previsão total. Para um modelo candidato com \(p = k + 1\) parâmetros estimados (incluindo o intercepto), um ajuste parsimonioso e isento de viés de subespecificação apresentará \(C_p \approx p = k + 1\) (neste caso, \(C_p \approx 5,0\)).
· Análise dos Distratores:
· A: \(C_p \gg p\) indica forte viés por omissão de variáveis relevantes.
· C: O valor zero não é a meta do \(C_p\).
· D e E: Fórmulas desconectadas da definição teórica do \(C_p\).
QUESTÃO 18: Alternativa B
· Análise Integrativa do Cenário:
1. Diagnóstico 1: \(R^2\) elevado (\(0,91\)) com Teste \(F\) global significativo (\(p