Prévia do material em texto
Econometria Básica Prof. Marcelo Nuno Carneiro de Sousa Fontes: STOCK, J.H.; WATSON, M.W. Econometria. São Paulo: Adison Wesley, 2004. Notas de aula de Christiano Arrigoni Coelho e Hamilton Kai Dummies • Com variáveis dummies, podemos acrescentar diversas variáveis qualitativas em uma regressão • Elas permitem alterar o intercepto e a inclinação da regressão Aviso • Sabemos que uma regressão sempre permite a interpretação descritiva • E que a interpretação causal somente é válida se certas condições se verificarem • A partir de agora, no curso de Econometria, vamos passar a interpretar os coeficientes de forma causal, ou seja, vamos assumir que as condições se verificam • Faremos isso porque esse é o nosso objetivo e de quem faz estudos econométricos • Agindo dessa forma, a exposição dos assuntos ficará simplificada, sem termos que a todo momento falarmos que existem duas interpretações ou as hipóteses de MQO estão valendo • Mas lembrem-se: vamos focar na interpretação causal meramente por razões didáticas; na prática, você sempre tem que estar consciente que a interpretação causal pode ser falsa • Sempre levar em conta os fatores que podem causar viés Motivação • Suponha que os salários dependam da escolaridade • No arquivo Wages1, esse seria um gráfico de dispersão. Motivação - Gênero • Mas será que os homens e mulheres recebem o mesmo, em média, para o nível de escolaridade? Indicação • O gráfico indica que, para a mesma escolaridade, os salários das mulheres são menores, em média, que os dos homens. • Para isso, usamos uma variável que tem o valor 1 se a pessoa é do sexo feminino, 0 caso contrário E se fizermos uma regressão • Podemos fazer uma regressão. • No primeiro caso, vamos supor que o efeito da escolaridade é o mesmo entre homens e mulheres, porém o salário é diferente Como fazer? • Suponha que o salário seja função dos anos de escolaridade • Mas suponha que, em média, o salário dos homens seja maior que os das mulheres (porque há discriminação no mercado de • trabalho por exemplo) • No exemplo ao lado, o intercepto da reta de regressão é menor na das mulheres e maior na dos homens • Como incorporar essa diferença no nosso método de MQO? • Resposta: usando a variável dummy (a mesma usada no gráfico) Definição de Dummy • Uma variável dummy é uma variável binária que assume apenas dois valores: 0 e 1 • • Ela é utilizada para representar variáveis qualitativas que podem ser divididas em duas categorias • Exemplos: homem\mulher, brasileiro\estrangeiro, novo\antigo, fumante\não fumante, rico\pobre etc. Importante • A definição de qual característica será associada ao 1 e qual ao 0 é arbitrária • Tanto faz definirmos o homem como o 1 e a mulher como o 0 ou a mulher como 1 e o homem como zero: • Importante: não podemos, ao mesmo tempo, colocar duas dummies para a mesma classificação. Não posso colocar uma dummy de homem e outra de mulher (a não ser se houver alguma outra classificação tipo não-binário) • Senão tenho problemas de colinearidade (lembrem-se dessa condição para regressões múltiplas) Usando a variável dummy • Nesse modelo, consideramos apenas uma mudança no intercepto • Nossa regressão será • ෞ𝑤𝑖 = 𝛽0 + 𝛽1. 𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 + 𝛽2. 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 • O intercepto será 𝛽0 para o sexo masculino e 𝛽0+ 𝛽1 para o sexo feminino (estamos supondo 𝛽1 negativo) Regressão • Vamos regredir no Python, então, o salário horário na dummy de sexo feminino e na escolaridade • Vejam o seguinte: • 1 ano a mais de escolaridade gera mais 0,506 dólares por hora (a base era o ano de 1976) tanto para homens quanto para mulheres • Entre trabalhadores de mesma escolaridade, em média, mulheres ganham por hora 2,27 dólares a menos que homens Interpretação • Nesse modelo, a escolaridade tem o mesmo efeito em homens e mulheres: cada ano • a mais de escolaridade aumenta o salário em 𝛽2, em média, tanto para homens quanto para mulheres (lembre-se que estamos assumindo que as hipóteses de MQO valem) • Porém, para cada nível de escolaridade, a mulher tem um salário menor Entendendo a diferença • Seja 𝑤𝐻 o salário do homem e 𝑤𝑀 o salário da mulher • • Lembrando que 𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 = 1 se i é mulher, temos: • 𝑤𝑖 𝑚 = 𝛽0 + 𝛽1. 𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 + 𝛽2. 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 = 𝛽0 +𝛽1 + 𝛽2. 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 • • E, como 𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 = 0 se é homem, temos: • 𝑤𝑖 ℎ = 𝛽0 + 𝛽1. 𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 + 𝛽2. 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 = 𝛽0 + 𝛽2. 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 • Logo, a diferença salarial média entre mulheres e homens de mesma escolaridade é: • 𝑤𝑖 𝑚 − 𝑤𝑖 ℎ = 𝛽0 +𝛽1 + 𝛽2. 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 −𝛽0 − 𝛽2. 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 = 𝛽1 Interpretando • Se 𝛽1 > 0, para os mesmos anos de escolaridade, o salário das mulheres seria superior que o dos homens • Se 𝛽1com suas mesmas características, fosse um homem, ela ganharia mais • Nesse sentido, δ é o efeito causal de ser mulher: as empresas estão pagando δ a menos para as mulheres com mesma produtividade dos homens justamente por elas serem mulheres • A mesma discussão continuaria válida se estivéssemos falando da dummy de cor (brancos e negros) no lugar da dummy de sexo Regressão Só com a Dummy • Se fizermos a regressão ෞ𝑤𝑖 = 𝛽0 + 𝛽1. 𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 , o coeficiente 𝛽1 será a diferença salarial, em média, entre mulheres e homens • Note a diferença na interpretação para a regressão anterior. Naquela, era “a diferença salarial média para a mesma escolaridade” Resultado • As mulheres ganham, em média, $2,5118 a menos por hora que os homens Regressão alterando a inclinação • Nossa nova especificação será: • ෞ𝑤𝑖 = 𝛽0 + 𝛽1. 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 + 𝛽2. 𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 . 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 Resultado • Essa regressão está dizendo que cada ano a mais de escolaridade aumenta, em média, o salário: • do homem em 0, 575 dólares por hora • da mulher em 0, 575 − 0, 178 = 0, 397 dólares por hora Mudando intercepto e inclinação • Vamos, agora, ajustar o modelo seguinte: • ෞ𝑤𝑖 = 𝛽0 +𝛽1𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 + 𝛽2. 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 + 𝛽3. 𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 . 𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 • Esse modelo muda o intercepto e a inclinação Interpretando • O modelo tem que ser interpretado com cuidado • Enquanto 𝛽3 é interpretado como a diferença de inclinação médio entre mulheres e homens, 𝛽1 não é mais a diferença salarial média para a mesma escolaridade, mas a diferença salarial para escolaridade zero. Resultado Resultado • Entre pessoas de escolaridade 0, mulheres recebem 1,1985 dólares a menos, por hora, em média • Cada ano a mais de escolaridade aumenta: • o salário horário do homem em 0,5395 dólares, em média • o salário horário da mulher em 0, 5395 − 0, 086 = 0,4535 dólares, em média • o salário horário do homem em 0,086 dólares a mais que o das mulheres • Portanto, o diferencial salarial entre homens e mulheres aumenta com os anos de escolaridade Duas dummies • Agora, vamos fazer a seguinte regressão: • ෞ𝑤𝑖 = 𝛽0 +𝛽1𝑓𝑒𝑚𝑖𝑛𝑖𝑛𝑜𝑖 + 𝛽2. 𝑐𝑎𝑠𝑎𝑑𝑜𝑖 Resultado • Comparando pessoas de mesmo estado civil, uma mulher ganha $2,2944 a menos por hora que um homem • Comparando pessoas de mesmo sexo, uma pessoa casada ganha $1,3395 a mais que um solteiro Dummies de Várias Categorias • Utilizamos variáveis dummies para representar variáveis qualitativas binárias • Por exemplo: homem/mulher, casado/solteiro, branco/não branco etc. • Mas a dummies podem ser utilizadas quando se quer representar variáveis qualitativas com mais de duas categorias • Por exemplo, queremos representar os 3 setores da economia: primário, secundário e terciário • Ou as 27 UF’s do Brasil (26 estados mais o DF) • Nesses slides vamos usar tais dummies apenas como interceptos • Embora seja possível usá-las também na inclinação, isso não é muito comum na prática • Suponha que temos uma variável que é o setor econômico de uma empresa: primário, secundário e terciário • São três categorias; nesse caso, criamos duas dummies: • 𝐷1𝑖 = 1 𝑠𝑒 𝑠𝑒𝑡𝑜𝑟 𝑝𝑟𝑖𝑚á𝑟𝑖𝑜 0 𝑐𝑎𝑠𝑜 𝑐𝑜𝑛𝑡𝑟á𝑟𝑖𝑜 • 𝐷2𝑖 = 1 𝑠𝑒 𝑠𝑒𝑡𝑜𝑟 𝑠𝑒𝑐𝑢𝑛𝑑á𝑟𝑖𝑜 0 𝑐𝑎𝑠𝑜 𝑐𝑜𝑛𝑡𝑟á𝑟𝑖𝑜 • Se há n categorias, teremos n-1 dummies • Problema de multicolinearidade impede usar n dummies Então, a regra • Quando a variável tem duas categorias (homem/mulher,casado/solteiro etc.), criamos um dummy • Quando a variável tem três categorias, criamos duas dummies • Quando a variável tem quatro categorias, criamos três dummies • Resumindo: se a variável tem n categorias, criamos n − 1 dummies • Ao se criar n dummies quando há n categorias surge um problema chamado multicolinearidade perfeita. Ao se tentar fazer uma regressão com n dummies (ou seja, uma para cada categoria) regressão em algum programa econométrico, há três possibilidades: • o programa dá uma mensagem de erro e não faz a regressão • o programa faz a regressão, mas antes elimina ou D1 ou D2 da regressão • O programa faz a regressão, mas avisa o problema (o resultado deve ser descartado) Interpretação • Os coeficientes de cada dummy representam o quanto que a variável dependente é maior em comparação com a omitida • Exemplo: renda per capita por UF. Se a UF omitida for SP, os coeficientes representam o quanto a renda per capita de cada outro estado é maior que SP. Se for o RJ, é quanto é maior que o RJ. Exemplo • Dados da PNAD de 2003 a 2008 • 6 anos • Dados de residentes. Quero saber como que a renda das amostras se comportou ao longo dos anos Caso 1: omito o ano de 2003 • Estimando a seguinte regressão: • 𝑟𝑒𝑛𝑑𝑎𝑖 = 𝛽0 +𝛽1𝑦𝑒𝑎𝑟2004,𝑖 +𝛽2𝑦𝑒𝑎𝑟2005,𝑖 +𝛽3𝑦𝑒𝑎𝑟2006,𝑖 +𝛽4𝑦𝑒𝑎𝑟2007,𝑖 +𝛽5𝑦𝑒𝑎𝑟2008,𝑖 +𝛽3𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 • Cada coeficiente de dummy significa que, dada a escolaridade, o quanto que a renda é maior, em média do que a que teria em 2003 Caso 2: omito o ano de 2008 • Estimando a seguinte regressão: • 𝑟𝑒𝑛𝑑𝑎𝑖 = 𝛽0 +𝛽1𝑦𝑒𝑎𝑟2003,𝑖 +𝛽2𝑦𝑒𝑎𝑟2004,𝑖 +𝛽3𝑦𝑒𝑎𝑟2005,𝑖 +𝛽4𝑦𝑒𝑎𝑟2006,𝑖 +𝛽5𝑦𝑒𝑎𝑟2007,𝑖 +𝛽3𝑒𝑠𝑐𝑜𝑙𝑎𝑟𝑖𝑑𝑎𝑑𝑒𝑖 • Cada coeficiente de dummy significa que, dada a escolaridade, o quanto que a renda é maior, em média do que a que teria em 2008 Regredindo só nas Dummies • Se regredir só nas dummies, temos uma ideia das diferenças entre as médias das rendas dos anos