Articulo de referencia

Variables instrumentales

En estadística , econometría , epidemiología y disciplinas afines, el método cuasiexperimental de variables instrumentales ( VI ) se utiliza para estimar relaciones causales cua...

En estadística , econometría , epidemiología y disciplinas afines, el método cuasiexperimental de variables instrumentales ( VI ) se utiliza para estimar relaciones causales cuando los experimentos controlados no son factibles o cuando un tratamiento no se administra con éxito a todas las unidades en un experimento aleatorio. [ 1 ] Intuitivamente, las VI se utilizan cuando una variable explicativa (también conocida como independiente o predictora) de interés está correlacionada con el término de error (endógeno), en cuyo caso los mínimos cuadrados ordinarios y el ANOVA dan resultados sesgados . Cuando se utiliza, un instrumento válido cambia la variable explicativa (la variable correlacionada con la variable endógena) pero no tiene un efecto independiente sobre la variable dependiente y no está correlacionado con el término de error, lo que permite a un investigador o analista descubrir el verdadero efecto causal de la variable explicativa sobre la variable dependiente.

Los métodos de variables instrumentales permiten una estimación consistente cuando las variables explicativas (covariables) están correlacionadas con los términos de error en un modelo de regresión . Dicha correlación puede ocurrir cuando:

  1. Los cambios en la variable dependiente modifican el valor de al menos una de las covariables (causalidad "inversa").
  2. Existen variables omitidas que afectan tanto a las variables dependientes como a las explicativas, o
  3. Las covariables están sujetas a errores de medición .

Las variables explicativas que presentan uno o más de estos problemas en el contexto de una regresión se denominan a veces endógenas . En esta situación, el método de mínimos cuadrados ordinarios produce estimaciones sesgadas e inconsistentes. [ 2 ] Sin embargo, si se dispone de un instrumento , aún se pueden obtener estimaciones consistentes. Un instrumento es una variable que no forma parte de la ecuación explicativa, pero que está correlacionada con las variables explicativas endógenas, condicionada al valor de otras covariables.

En los modelos lineales, existen dos requisitos principales para el uso de variables instrumentales:

  • El instrumento debe estar correlacionado con las variables explicativas endógenas, condicionado a las demás covariables. Si esta correlación es fuerte, se dice que el instrumento tiene una primera etapa fuerte . Una correlación débil puede dar lugar a inferencias engañosas sobre las estimaciones de los parámetros y provocar que los errores estándar en la segunda etapa sean mayores que las estimaciones de mínimos cuadrados ordinarios. [ 3 ] [ 4 ]
  • El instrumento no puede estar correlacionado con el término de error en la ecuación explicativa, condicionado a las demás covariables. En otras palabras, el instrumento no puede sufrir el mismo problema que la variable predictora original. Si se cumple esta condición, se dice que el instrumento satisface la restricción de exclusión .

Ejemplo

De manera informal, al intentar estimar el efecto causal de alguna variable X ("covariable" o "variable explicativa") sobre otra Y ("variable dependiente"), un instrumento es una tercera variable Z que afecta a Y solo a través de su efecto sobre X. 

Por ejemplo, supongamos que un investigador desea estimar el efecto causal del tabaquismo ( X ) sobre la salud general ( Y ). [ 5 ] La correlación entre el tabaquismo y la salud no implica que fumar cause mala salud, ya que otras variables, como la depresión, pueden afectar tanto a la salud como al tabaquismo, o porque la salud puede afectar al tabaquismo. No es posible realizar experimentos controlados sobre el estado de tabaquismo en la población general. El investigador puede intentar estimar el efecto causal del tabaquismo sobre la salud a partir de datos observacionales utilizando la tasa impositiva sobre los productos de tabaco ( Z ) como instrumento para el tabaquismo. La tasa impositiva sobre los productos de tabaco es una opción razonable como instrumento porque el investigador supone que solo puede correlacionarse con la salud a través de su efecto sobre el tabaquismo. Si el investigador encuentra entonces una correlación entre los impuestos al tabaco y el estado de salud, esto puede considerarse evidencia de que fumar causa cambios en la salud.

Historia

El primer uso de una variable instrumental se produjo en un libro de 1928 de Philip G. Wright , conocido principalmente por su excelente descripción de la producción, el transporte y la venta de aceites vegetales y animales a principios del siglo XX en Estados Unidos. [ 6 ] [ 7 ] En 1945, Olav Reiersøl aplicó el mismo enfoque en el contexto de modelos de errores en las variables en su tesis doctoral, dando nombre al método. [ 8 ]

Wright intentó determinar la oferta y la demanda de mantequilla utilizando datos de panel sobre precios y cantidades vendidas en Estados Unidos. La idea era que un análisis de regresión podría generar una curva de demanda o de oferta, ya que estas se forman a partir de la relación entre los precios y las cantidades demandadas u ofrecidas. El problema radicaba en que los datos observacionales no conformaban una curva de demanda o de oferta propiamente dicha, sino más bien una nube de observaciones puntuales que adoptaban diferentes formas según las condiciones del mercado. Resultaba difícil extraer conclusiones a partir de los datos.

El problema radicaba en que el precio afectaba tanto a la oferta como a la demanda, por lo que no se podía construir directamente a partir de los datos de observación una función que describiera solo una de ellas. Wright concluyó correctamente que necesitaba una variable que se correlacionara con la demanda o con la oferta, pero no con ambas; es decir, una variable instrumental.

Tras mucha deliberación, Wright decidió utilizar la precipitación regional como variable instrumental: concluyó que la lluvia afectaba la producción de pasto y, por lo tanto, la producción de leche y, en última instancia, la oferta de mantequilla, pero no la demanda. De esta manera, pudo construir una ecuación de regresión con solo la variable instrumental de precio y oferta. [ 9 ]

Judea Pearl proporcionó definiciones formales de variables instrumentales, utilizando contrafactuales y criterios gráficos, en 2000. [ 10 ] Angrist y Krueger (2001) presentan un estudio de la historia y los usos de las técnicas de variables instrumentales. [ 11 ] Heckman (2008) analiza las nociones de causalidad en econometría y su relación con las variables instrumentales y otros métodos. [ 12 ]

Teoría

Aunque las ideas detrás de las variables instrumentales se extienden a una amplia clase de modelos, un contexto muy común para las variables instrumentales es la regresión lineal . Tradicionalmente, [ 13 ] una variable instrumental se define como una variableZ{\displaystyle Z}que está correlacionada con la variable independiente incógnita{\displaystyle X}y no correlacionado con el "término de error"U{\displaystyle U}en la ecuación lineal

Y=incógnitaβ+U{\displaystyle Y=X\beta +U}

Y{\displaystyle Y}es un vector.incógnita{\displaystyle X}es una matriz, generalmente con una columna de unos y quizás con columnas adicionales para otras covariables. Considere cómo un instrumento permiteβ{\displaystyle \beta }para ser recuperado. Recuerde que MCO resuelve paraβ^{\displaystyle {\widehat {\beta }}}de tal manera quecobertura(incógnita,U^)=0{\displaystyle \operatorname {cov} (X,{\widehat {U}})=0}(cuando minimizamos la suma de los errores al cuadrado,minβ(Yincógnitaβ)(Yincógnitaβ){\displaystyle \min _{\beta }(YX\beta )'(YX\beta )}, la condición de primer orden es exactamenteincógnita(Yincógnitaβ^)=incógnitaU^=0{\displaystyle X'(YX{\widehat {\beta }})=X'{\widehat {U}}=0}). Si se cree que el modelo verdadero tienecobertura(incógnita,U)0{\displaystyle \operatorname {cov} (X,U)\neq 0}debido a cualquiera de las razones enumeradas anteriormente; por ejemplo, si hay una variable omitida que afecta a ambosincógnita{\displaystyle X}yY{\displaystyle Y}por separado—entonces este procedimiento MCO no producirá el impacto causal deincógnita{\displaystyle X}enY{\displaystyle Y}. OLS simplemente elegirá el parámetro que haga que los errores resultantes parezcan no correlacionados conincógnita{\displaystyle X}.

Consideremos, para simplificar, el caso de una sola variable. Supongamos que estamos considerando una regresión con una variable y una constante (quizás no sean necesarias otras covariables, o quizás hayamos eliminado cualquier otra covariable relevante):

y=α+βincógnita+{\displaystyle y=\alpha +\beta x+u}

En este caso, el coeficiente del regresor de interés viene dado porβ^=cobertura(incógnita,y)var(incógnita){\displaystyle {\widehat {\beta }}={\frac {\operatorname {cov} (x,y)}{\operatorname {var} (x)}}}. Sustituyendo pory{\displaystyle y}da

β^=cobertura(incógnita,y)var(incógnita)=cobertura(incógnita,α+βincógnita+)var(incógnita)=cobertura(incógnita,α+βincógnita)var(incógnita)+cobertura(incógnita,)var(incógnita)=β+cobertura(incógnita,)var(incógnita),{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\operatorname {cov} (x,y)}{\operatorname {var} (x)}}={\frac {\operatorname {cov} (x,\alpha +\beta x+u)}{\operatorname {var} (x)}}\\[6pt]&={\frac {\operatorname {cov} (x,\alpha +\beta x)}{\operatorname {var} (x)}}+{\frac {\operatorname {cov} (x,u)}{\operatorname {var} (x)}}=\beta ^{*}+{\frac {\operatorname {cov} (x,u)}{\operatorname {var} (x)}},\end{aligned}}}

dóndeβ{\displaystyle \beta ^{*}}es cuál sería el vector de coeficientes estimado si cobertura(incógnita,)=0{\displaystyle \operatorname {cov} (x,u)=0}En este caso, se puede demostrar queβ{\displaystyle \beta ^{*}}es un estimador insesgado deβ{\displaystyle \beta }. Sicobertura(incógnita,)0{\displaystyle \operatorname {cov} (x,u)\neq 0}En el modelo subyacente que creemos, entonces MCO da una estimación inconsistente que no refleja el efecto causal subyacente de interés. IV ayuda a solucionar este problema identificando los parámetrosβ{\displaystyle {\beta }}no se basa en siincógnita{\displaystyle x}no está correlacionado con{\displaystyle u}, pero en función de si otra variablez{\displaystyle z}no está correlacionado con{\displaystyle u}. Si la teoría sugiere quez{\displaystyle z}está relacionado conincógnita{\displaystyle x}(la primera etapa) pero no correlacionada con{\displaystyle u}(la restricción de exclusión), entonces IV puede identificar el parámetro causal de interés donde OLS falla. Debido a que existen múltiples formas específicas de usar y derivar estimadores IV incluso en el caso lineal (IV, 2SLS, GMM), reservamos una discusión más detallada para la sección de Estimación a continuación.

Definición gráfica

 Las técnicas de variables instrumentales se han desarrollado dentro de una clase mucho más amplia de modelos no lineales. Pearl (2000; p. 248) dio definiciones generales de variables instrumentales, utilizando formalismos contrafactuales y gráficos. [ 10 ] La definición gráfica requiere que Z satisfaga las siguientes condiciones:

(ZY)GRAMOincógnita¯(Zincógnita)GRAMO{\displaystyle (Z\perp \!\!\!\perp Y)_{G_{\overline {X}}}\qquad (Z\not \!\!{\perp \!\!\!\perp }X)_{G}}

dónde{\displaystyle \perp \!\!\!\perp }representa la separación d yGRAMOincógnita¯{\displaystyle G_{\overline {X}}}representa el gráfico en el que todas las flechas que entran en X están cortadas.

La definición contrafactual requiere que Z satisfaga

(ZYincógnita)(Zincógnita){\displaystyle (Z\perp \!\!\!\perp Y_{x})\qquad (Z\not \!\!{\perp \!\!\!\perp }X)}

donde Y x representa el valor que Y alcanzaría si X fuera x y{\displaystyle \perp \!\!\!\perp }representa la independencia.

Si hay covariables adicionales W, entonces las definiciones anteriores se modifican de manera que Z califica como un instrumento si los criterios dados se cumplen condicionalmente en W.

La esencia de la definición de Pearl es:

  1. Las ecuaciones de interés son "estructurales", no de "regresión".
  2. El término de error U representa todos los factores exógenos que afectan a Y cuando X se mantiene constante.
  3. El instrumento Z debe ser independiente de U.
  4. El instrumento Z no debe afectar a Y cuando X se mantiene constante (restricción de exclusión).
  5. El instrumento Z no debe ser independiente de X.

Estas condiciones no dependen de la forma funcional específica de las ecuaciones y, por lo tanto, son aplicables a ecuaciones no lineales, donde U puede ser no aditiva (véase Análisis no paramétrico). También son aplicables a un sistema de ecuaciones múltiples, en el que X (y otros factores) afectan a Y a través de varias variables intermedias. Una variable instrumental no tiene por qué ser una causa de X ; también se puede utilizar una variable sustituta de dicha causa, si satisface las condiciones 1 a 5. [ 10 ] La restricción de exclusión (condición 4) es redundante; se deduce de las condiciones 2 y 3.

Selección de instrumentos adecuados

Dado que U no es observable, el requisito de que Z sea independiente de U no puede inferirse de los datos y debe determinarse a partir de la estructura del modelo, es decir, del proceso de generación de datos. Los grafos causales son una representación de esta estructura, y la definición gráfica dada anteriormente puede utilizarse para determinar rápidamente si una variable Z califica como variable instrumental dado un conjunto de covariables W. Para ver cómo, considere el siguiente ejemplo.

Supongamos que queremos estimar el efecto de un programa de tutorías universitarias sobre el promedio de calificaciones ( GPA ). La relación entre la asistencia al programa de tutorías y el GPA puede verse afectada por diversos factores. Los estudiantes que participan en el programa pueden preocuparse más por sus calificaciones o estar teniendo dificultades con sus estudios. Esta confusión se ilustra en las Figuras 1 a 3 de la derecha mediante el arco bidireccional entre el Programa de Tutorías y el GPA. Si los estudiantes son asignados a las residencias universitarias al azar, la proximidad de la residencia al programa de tutorías es una variable instrumental idónea.

Sin embargo, ¿qué sucede si el programa de tutoría se encuentra en la biblioteca de la universidad? En ese caso, la Proximidad también puede hacer que los estudiantes pasen más tiempo en la biblioteca, lo que a su vez mejora su promedio de calificaciones (véase la Figura 1). Utilizando el gráfico causal representado en la Figura 2, vemos que la Proximidad no califica como una variable instrumental porque está conectada al promedio de calificaciones a través de la ruta Proximidad{\displaystyle \rightarrow }Horario de la biblioteca{\displaystyle \rightarrow } Promedio de calificaciones enGRAMOincógnita¯{\displaystyle G_{\overline {X}}}Sin embargo, si controlamos las horas de la biblioteca agregándolas como una covariable, entonces la proximidad se convierte en una variable instrumental, ya que la proximidad está separada del promedio de calificaciones dado que las horas de la biblioteca están separadas.GRAMOincógnita¯{\displaystyle G_{\overline {X}}}.

Ahora, supongamos que observamos que la "habilidad natural" de un estudiante afecta su número de horas en la biblioteca, así como su promedio de calificaciones (GPA), como se muestra en la Figura 3. Usando el grafo causal, vemos que Horas en la biblioteca es un colisionador y condicionar sobre él abre el camino Proximidad{\displaystyle \rightarrow }Horario de la biblioteca{\displaystyle \leftrightarrow }GPA. Por lo tanto, la Proximidad no puede utilizarse como variable instrumental.

Finalmente, supongamos que el horario de la biblioteca no afecta realmente al promedio de calificaciones porque los estudiantes que no estudian en la biblioteca simplemente estudian en otro lugar, como se muestra en la Figura 4. En este caso, controlar el horario de la biblioteca aún abre una relación espuria entre la proximidad y el promedio de calificaciones. Sin embargo, si no controlamos el horario de la biblioteca y lo eliminamos como covariable, entonces la proximidad puede volver a utilizarse como variable instrumental.

Estimación

Ahora revisaremos y ampliaremos la mecánica de IV con mayor detalle. Supongamos que los datos se generan mediante un proceso de la forma

yi=incógnitaiβ+mii,{\displaystyle y_{i}=X_{i}\beta +e_{i},}

dónde

  • i indexa las observaciones,
  • yi{\displaystyle y_{i}}es el i -ésimo valor de la variable dependiente,
  • incógnitai{\displaystyle X_{i}}es un vector de los valores i -ésimos de la(s) variable(s) independiente(s) y una constante,
  • mii{\displaystyle e_{i}}es el i -ésimo valor de un término de error no observado que representa todas las causas deyi{\displaystyle y_{i}}otro queincógnitai{\displaystyle X_{i}}, y
  • β{\displaystyle \beta }es un vector de parámetros no observado.

El vector de parámetrosβ{\displaystyle \beta }es el efecto causal enyi{\displaystyle y_{i}}de un cambio de una unidad en cada elemento deincógnitai{\displaystyle X_{i}}, sosteniendo todas las demás causas deyi{\displaystyle y_{i}}constante. El objetivo econométrico es estimarβ{\displaystyle \beta }. Para simplificar, supongamos que las extracciones de e no están correlacionadas y que se extraen de distribuciones con la misma varianza (es decir, que los errores no están correlacionados serialmente y son homocedásticos ).

Supongamos también que se propone un modelo de regresión de forma nominalmente similar. Dada una muestra aleatoria de T observaciones de este proceso, el estimador de mínimos cuadrados ordinarios es

β^OLS=(incógnitaTincógnita)1incógnitaTy=(incógnitaTincógnita)1incógnitaT(incógnitaβ+mi)=β+(incógnitaTincógnita)1incógnitaTmi{\displaystyle {\widehat {\beta }}_{\mathrm {OLS} }=(X^{\mathrm {T} }X)^{-1}X^{\mathrm {T} }y=(X^{\mathrm {T} }X)^{-1}X^{\mathrm {T} }(X\beta +e)=\beta +(X^{\mathrm {T} }X)^{-1}X^{\mathrm {T} }e}

donde X , y y e denotan vectores columna de longitud T. Esta ecuación es similar a la ecuación que involucracobertura(incógnita,y){\displaystyle \operatorname {cov} (X,y)}en la introducción (esta es la versión matricial de esa ecuación). Cuando X y e no están correlacionados , bajo ciertas condiciones de regularidad el segundo término tiene un valor esperado condicionado a X de cero y converge a cero en el límite, por lo que el estimador es insesgado y consistente. Sin embargo, cuando X y las otras variables causales no medidas colapsadas en el término e están correlacionadas, el estimador MCO es generalmente sesgado e inconsistente para β . En este caso, es válido usar las estimaciones para predecir valores de y dados valores de X , pero la estimación no recupera el efecto causal de X sobre y .  

Para recuperar el parámetro subyacenteβ{\displaystyle \beta }Introducimos un conjunto de variables Z que está altamente correlacionado con cada componente endógeno de X pero (en nuestro modelo subyacente) no está correlacionado con e . Para simplificar, se podría considerar que X es una matriz T × 2 compuesta por una columna de constantes y una variable endógena, y Z es una matriz T × 2 que consta de una columna de constantes y una variable instrumental. Sin embargo, esta técnica se generaliza a que X sea una matriz de una constante y, digamos, 5 variables endógenas, con Z siendo una matriz compuesta por una constante y 5 instrumentos. En la discusión que sigue, asumiremos que X es una matriz T × K y dejaremos este valor K sin especificar. Un estimador en el que X y Z son ambas matrices T × K se denomina simplemente identificado . 

Supongamos que la relación entre cada componente endógeno x i y los instrumentos viene dada por

incógnitai=Ziγ+vi,{\displaystyle x_{i}=Z_{i}\gamma +v_{i},}

La especificación de variables instrumentales más común utiliza el siguiente estimador:

β^IV=(ZTincógnita)1ZTy{\displaystyle {\widehat {\beta }}_{\mathrm {IV} }=(Z^{\mathrm {T} }X)^{-1}Z^{\mathrm {T} }y}

Esta especificación se aproxima al parámetro verdadero a medida que la muestra se hace grande, siempre y cuandoZTmi=0{\displaystyle Z^{\mathrm {T} }e=0}en el modelo verdadero:

β^IV=(ZTincógnita)1ZTy=(ZTincógnita)1ZTincógnitaβ+(ZTincógnita)1ZTmiβ{\displaystyle {\widehat {\beta }}_{\mathrm {IV} }=(Z^{\mathrm {T} }X)^{-1}Z^{\mathrm {T} }y=(Z^{\mathrm {T} }X)^{-1}Z^{\mathrm {T} }X\beta +(Z^{\mathrm {T} }X)^{-1}Z^{\mathrm {T} }e\rightarrow \beta }

MientrasZTmi=0{\displaystyle Z^{\mathrm {T} }e=0}En el proceso subyacente que genera los datos, el uso apropiado del estimador IV identificará este parámetro. Esto funciona porque IV resuelve para el parámetro único que satisfaceZTmi=0{\displaystyle Z^{\mathrm {T} }e=0}y, por lo tanto, se centra en el verdadero parámetro subyacente a medida que aumenta el tamaño de la muestra.

Ahora una extensión: supongamos que hay más instrumentos que covariables en la ecuación de interés, de modo que Z es una matriz T × M con M > K. Esto se suele denominar caso sobreidentificado . En este caso, se puede utilizar el método generalizado de momentos (GMM). El estimador GMM IV es

β^GRAMOMETROMETRO=(incógnitaTPAGZincógnita)1incógnitaTPAGZy,{\displaystyle {\widehat {\beta }}_{\mathrm {GMM} }=(X^{\mathrm {T} }P_{Z}X)^{-1}X^{\mathrm {T} }P_{Z}y,}

dóndePAGZ{\displaystyle P_{Z}}se refiere a la matriz de proyecciónPAGZ=Z(ZTZ)1ZT{\displaystyle P_{Z}=Z(Z^{\mathrm {T} }Z)^{-1}Z^{\mathrm {T} }}.

Esta expresión se reduce a la primera cuando el número de instrumentos es igual al número de covariables en la ecuación de interés. Por lo tanto, la variable instrumental sobreidentificada es una generalización de la variable instrumental simplemente identificada.

Prueba de que β GMM colapsa a β IV en el caso recién identificado.

Desarrollando elβGMM{\displaystyle \beta _{\text{GMM}}}expresión:

β^GRAMOMETROMETRO=(incógnitaTZ(ZTZ)1ZTincógnita)1incógnitaTZ(ZTZ)1ZTy{\displaystyle {\widehat {\beta }}_{\mathrm {GMM} }=(X^{\mathrm {T} }Z(Z^{\mathrm {T} }Z)^{-1}Z^{\mathrm {T} }X)^{-1}X^{\mathrm {T} }Z(Z^{\mathrm {T} }Z)^{-1}Z^{\mathrm {T} }y}

En el caso recién identificado, tenemos tantos instrumentos como covariables, de modo que la dimensión de X es la misma que la de Z. Por lo tanto, incógnitaTZ,ZTZ{\displaystyle X^{\mathrm {T} }Z,Z^{\mathrm {T} }Z}yZTincógnita{\displaystyle Z^{\mathrm {T} }X}son todas matrices cuadradas de la misma dimensión. Podemos expandir la inversa, utilizando el hecho de que, para cualesquiera matrices invertibles n x n A y B , ( AB ) ⁻¹ = B⁻¹A⁻¹ ( ver Matriz invertible#Propiedades ) :

β^GRAMOMETROMETRO=(ZTincógnita)1(ZTZ)(incógnitaTZ)1incógnitaTZ(ZTZ)1ZTy=(ZTincógnita)1(ZTZ)(ZTZ)1ZTy=(ZTincógnita)1ZTy=β^IV{\displaystyle {\begin{aligned}{\widehat {\beta }}_{\mathrm {GMM} }&=(Z^{\mathrm {T} }X)^{-1}(Z^{\mathrm {T} }Z)(X^{\mathrm {T} }Z)^{-1}X^{\mathrm {T} }Z(Z^{\mathrm {T} }Z)^{-1}Z^{\mathrm {T} }y\\&=(Z^{\mathrm {T} }X)^{-1}(Z^{\mathrm {T} }Z)(Z^{\mathrm {T} }Z)^{-1}Z^{\mathrm {T} }y\\&=(Z^{\mathrm {T} }X)^{-1}Z^{\mathrm {T} }y\\&={\widehat {\beta }}_{\mathrm {IV} }\end{aligned}}}

Referencia: véase Davidson y Mackinnon (1993) [ 14 ] : 218

Existe un estimador subidentificado equivalente para el caso en que m < k . Dado que los parámetros son las soluciones de un conjunto de ecuaciones lineales, un modelo subidentificado que utiliza el conjunto de ecuacionesZv=0{\displaystyle Z'v=0}No tiene una solución única.

Interpretación como mínimos cuadrados en dos etapas

Un método computacional que se puede utilizar para calcular las estimaciones de variables instrumentales es el de mínimos cuadrados en dos etapas (2SLS o TSLS). En la primera etapa, cada variable explicativa que es una covariable endógena en la ecuación de interés se regresa sobre todas las variables exógenas del modelo, incluyendo tanto las covariables exógenas en la ecuación de interés como los instrumentos excluidos. Los valores predichos de estas regresiones se obtienen de la siguiente manera:

Etapa 1: Regresar cada columna de X sobre Z , (incógnita=Zδ+errores{\displaystyle X=Z\delta +{\text{errors}}}):

δ^=(ZTZ)1ZTincógnita,{\displaystyle {\widehat {\delta }}=(Z^{\mathrm {T} }Z)^{-1}Z^{\mathrm {T} }X,\,}

y guardar los valores previstos:

incógnita^=Zδ^=Z(ZTZ)1ZTincógnita=PAGZincógnita.{\displaystyle {\widehat {X}}=Z{\widehat {\delta }}={\color {ProcessBlue}Z(Z^{\mathrm {T} }Z)^{-1}Z^{\mathrm {T} }}X={\color {ProcessBlue}P_{Z}}X.\,}

En la segunda etapa, la regresión de interés se estima como de costumbre, excepto que en esta etapa cada covariable endógena se reemplaza con los valores predichos de la primera etapa:

Etapa 2: Realizar una regresión de Y sobre los valores predichos de la primera etapa:

Y=incógnita^β+norteoismi,{\displaystyle Y={\widehat {X}}\beta +\mathrm {noise} ,\,}

lo cual da

β2SLS=(incógnitaTPAGZincógnita)1incógnitaTPAGZY.{\displaystyle \beta _{\text{2SLS}}=\left(X^{\mathrm {T} }{\color {ProcessBlue}P_{Z}}X\right)^{-1}X^{\mathrm {T} }{\color {ProcessBlue}P_{Z}}Y.}

Este método solo es válido en modelos lineales. Para covariables endógenas categóricas, podría ser tentador usar una primera etapa diferente a la de mínimos cuadrados ordinarios, como un modelo probit para la primera etapa seguido de MCO para la segunda. Esto se conoce comúnmente en la literatura econométrica como la regresión prohibida , [ 15 ] porque las estimaciones de parámetros de variables instrumentales de la segunda etapa son consistentes solo en casos especiales. [ 16 ]

Demostración: cálculo del estimador 2SLS

El estimador MCO habitual es:(incógnita^Tincógnita^)1incógnita^TY{\displaystyle ({\widehat {X}}^{\mathrm {T} }{\widehat {X}})^{-1}{\widehat {X}}^{\mathrm {T} }Y}. Reemplazandoincógnita^=PAGZincógnita{\displaystyle {\widehat {X}}=P_{Z}X}y observando quePAGZ{\displaystyle P_{Z}}es una matriz simétrica e idempotente , de modo quePAGZTPAGZ=PAGZPAGZ=PAGZ{\displaystyle P_{Z}^{\mathrm {T} }P_{Z}=P_{Z}P_{Z}=P_{Z}}

β2SLS=(incógnita^Tincógnita^)1incógnita^TY=(incógnitaTPAGZTPAGZincógnita)1incógnitaTPAGZTY=(incógnitaTPAGZincógnita)1incógnitaTPAGZY.{\displaystyle \beta _{\text{2SLS}}=({\widehat {X}}^{\mathrm {T} }{\widehat {X}})^{-1}{\widehat {X}}^{\mathrm {T} }Y=\left(X^{\mathrm {T} }P_{Z}^{\mathrm {T} }P_{Z}X\right)^{-1}X^{\mathrm {T} }P_{Z}^{\mathrm {T} }Y=\left(X^{\mathrm {T} }P_{Z}X\right)^{-1}X^{\mathrm {T} }P_{Z}Y.}

El estimador resultante deβ{\displaystyle \beta }es numéricamente idéntico a la expresión mostrada arriba. Se debe realizar una pequeña corrección a la suma de los residuos al cuadrado en el modelo ajustado de segunda etapa para que la matriz de covarianza deβ{\displaystyle \beta }Se calcula correctamente.

Análisis no paramétrico

Cuando se desconoce la forma de las ecuaciones estructurales, se utiliza una variable instrumental.Z{\displaystyle Z}aún se puede definir mediante las ecuaciones:

incógnita=gramo(z,){\displaystyle x=g(z,u)\,}
y=F(incógnita,){\displaystyle y=f(x,u)\,}

dóndeF{\displaystyle f}ygramo{\displaystyle g}son dos funciones arbitrarias yZ{\displaystyle Z}es independiente deU{\displaystyle U}Sin embargo, a diferencia de los modelos lineales, las mediciones deZ,incógnita{\displaystyle Z,X}yY{\displaystyle Y}no permiten la identificación del efecto causal promedio deincógnita{\displaystyle X}enY{\displaystyle Y}, denotado ACE

AS=Pr(yhacer(incógnita))=mi[F(incógnita,)].{\displaystyle {\text{ACE}}=\Pr(y\mid {\text{do}}(x))=\operatorname {E} _{u}[f(x,u)].}

Balke y Pearl [1997] derivaron límites ajustados para ACE y demostraron que estos pueden proporcionar información valiosa sobre el signo y el tamaño de ACE. [ 17 ]

En el análisis lineal, no hay ninguna prueba para refutar la suposición.Z{\displaystyle Z}es fundamental en relación con el par(incógnita,Y){\displaystyle (X,Y)}Este no es el caso cuandoincógnita{\displaystyle X}es discreto. Pearl (2000) ha demostrado que, para todoF{\displaystyle f}ygramo{\displaystyle g}, la siguiente restricción, denominada "Desigualdad Instrumental", debe cumplirse siempre queZ{\displaystyle Z}satisface las dos ecuaciones anteriores: [ 10 ]

máximoincógnitay[máximozPr(y,incógnitaz)]1.{\displaystyle \max _{x}\sum _{y}[\max _{z}\Pr(y,x\mid z)]\leq 1.}

Interpretación bajo heterogeneidad del efecto del tratamiento

La exposición anterior supone que el efecto causal de interés no varía entre las observaciones, es decir, queβ{\displaystyle \beta }es una constante. Generalmente, distintos sujetos responderán de maneras diferentes a los cambios en el "tratamiento" x . Cuando se reconoce esta posibilidad, el efecto promedio en la población de un cambio en x sobre y puede diferir del efecto en una subpoblación determinada. Por ejemplo, el efecto promedio de un programa de capacitación laboral puede diferir sustancialmente entre el grupo de personas que realmente reciben la capacitación y el grupo que decide no recibirla. Por estas razones, los métodos de variables instrumentales implican supuestos implícitos sobre la respuesta conductual, o más generalmente, supuestos sobre la correlación entre la respuesta al tratamiento y la propensión a recibirlo. [ 18 ]

El estimador IV estándar puede recuperar los efectos promedio locales del tratamiento (LATE) en lugar de los efectos promedio del tratamiento (ATE). [ 1 ] Imbens y Angrist (1994) demuestran que la estimación IV lineal puede interpretarse bajo condiciones débiles como un promedio ponderado de los efectos promedio locales del tratamiento, donde las ponderaciones dependen de la elasticidad del regresor endógeno a los cambios en las variables instrumentales. En términos generales, esto significa que el efecto de una variable solo se revela para las subpoblaciones afectadas por los cambios observados en los instrumentos, y que las subpoblaciones que responden más a los cambios en los instrumentos tendrán los mayores efectos en la magnitud de la estimación IV.

Por ejemplo, si una investigadora utiliza la presencia de una universidad pública como variable instrumental para la educación universitaria en una regresión de ingresos, identifica el efecto de la universidad en los ingresos de la subpoblación que obtendría un título universitario si existe una universidad, pero que no lo obtendría si no existe. Este enfoque empírico, sin supuestos adicionales, no le dice a la investigadora nada sobre el efecto de la universidad entre las personas que siempre o nunca obtendrían un título universitario independientemente de si existe una universidad local.

Problema de instrumentos débiles

Como señalan Bound , Jaeger y Baker (1995), el problema radica en la selección de instrumentos "débiles", es decir, instrumentos que predicen mal el predictor endógeno de la pregunta en la ecuación de la primera etapa. [ 19 ] En este caso, la predicción del predictor de la pregunta por parte del instrumento será deficiente y los valores predichos tendrán muy poca variación. Por consiguiente, es improbable que tengan mucho éxito al predecir el resultado final cuando se utilizan para reemplazar el predictor de la pregunta en la ecuación de la segunda etapa.

En el contexto del ejemplo sobre tabaquismo y salud analizado anteriormente, los impuestos al tabaco son instrumentos débiles para influir en el hábito de fumar si la condición de fumador no se ve afectada significativamente por los cambios en los impuestos. Si los impuestos más altos no inducen a las personas a dejar de fumar (o a no empezar a fumar), entonces la variación en las tasas impositivas no nos dice nada sobre el efecto del tabaquismo en la salud. Si los impuestos afectan la salud a través de canales distintos a su efecto en el tabaquismo, entonces los instrumentos son inválidos y el enfoque de variables instrumentales puede generar resultados engañosos. Por ejemplo, en lugares y épocas con poblaciones relativamente preocupadas por la salud, es posible que se implementen impuestos altos al tabaco y, aun manteniendo constantes las tasas de tabaquismo, se observe una correlación entre la salud y los impuestos al tabaco, incluso si fumar no tuviera ningún efecto en la salud. En este caso, sería erróneo inferir un efecto causal del tabaquismo en la salud a partir de la correlación observada entre los impuestos al tabaco y la salud.

Pruebas para instrumentos defectuosos

La fuerza de los instrumentos se puede evaluar directamente porque tanto las covariables endógenas como los instrumentos son observables. [ 20 ] Una regla general común para modelos con un regresor endógeno es: el estadístico F contra la hipótesis nula de que los instrumentos excluidos son irrelevantes en la regresión de primera etapa debe ser mayor que 10.

Inferencia estadística y prueba de hipótesis

Cuando las covariables son exógenas, las propiedades de muestra pequeña del estimador MCO se pueden derivar de manera directa calculando los momentos del estimador condicionados a X. Cuando algunas de las covariables son endógenas, de modo que se implementa la estimación por variables instrumentales, no se pueden obtener expresiones simples para los momentos del estimador. Generalmente, los estimadores de variables instrumentales solo tienen propiedades asintóticas deseables, no propiedades de muestra finita, y la inferencia se basa en aproximaciones asintóticas a la distribución muestral del estimador. Incluso cuando los instrumentos no están correlacionados con el error en la ecuación de interés y cuando los instrumentos no son débiles, las propiedades de muestra finita del estimador de variables instrumentales pueden ser deficientes. Por ejemplo, los modelos exactamente identificados producen estimadores de muestra finita sin momentos, por lo que se puede decir que el estimador no es ni sesgado ni insesgado, el tamaño nominal de los estadísticos de prueba puede estar sustancialmente distorsionado y las estimaciones pueden estar comúnmente lejos del valor verdadero del parámetro. [ 21 ]

Probar la restricción de exclusión

La suposición de que los instrumentos no están correlacionados con el término de error en la ecuación de interés no es contrastable en modelos exactamente identificados. Si el modelo está sobreidentificado, existe información disponible que puede utilizarse para contrastar esta suposición. La prueba más común de estas restricciones de sobreidentificación , denominada prueba de Sargan-Hansen , se basa en la observación de que los residuos deberían no estar correlacionados con el conjunto de variables exógenas si los instrumentos son verdaderamente exógenos. [ 22 ] El estadístico de la prueba de Sargan-Hansen se puede calcular comoTR2{\displaystyle TR^{2}}(el número de observaciones multiplicado por el coeficiente de determinación ) de la regresión MCO de los residuos sobre el conjunto de variables exógenas. Este estadístico será asintóticamente chi-cuadrado con m k grados de libertad bajo la hipótesis nula de que el término de error no está correlacionado con los instrumentos. 

Véase también

Referencias

  1. 1 2 Imbens, G.; Angrist, J. (1994). "Identificación y estimación de los efectos promedio locales del tratamiento" . Econometrica . 62 (2): 467– 476. doi : 10.2307/2951620 . JSTOR 2951620. S2CID 153123153 .  
  2. Bullock, JG; Green, DP; Ha, SE (2010). "Sí, pero ¿cuál es el mecanismo? (No esperes una respuesta fácil)". Journal of Personality and Social Psychology . 98 (4): 550– 558. CiteSeerX 10.1.1.169.5465 . doi : 10.1037/a0018933 . PMID 20307128. S2CID 7913867 .   
  3. https://www.stata.com/meeting/5nasug/wiv.pdf
  4. Nichols, Austin (23 de julio de 2006). "Instrumentos débiles: una visión general y nuevas técnicas" .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  5. Leigh, JP; Schembri, M. (2004). "Técnica de variables instrumentales: el precio del cigarrillo proporcionó una mejor estimación de los efectos del tabaquismo en el SF-12". Journal of Clinical Epidemiology . 57 (3): 284– 293. doi : 10.1016/j.jclinepi.2003.08.006 . PMID 15066689 . 
  6. Epstein, Roy J. (1989). "La caída de MCO en la estimación estructural". Oxford Economic Papers . 41 (1): 94– 107. doi : 10.1093/oxfordjournals.oep.a041930 . JSTOR 2663184 . 
  7. Stock, James H.; Trebbi, Francesco (2003). "Retrospectivas: ¿Quién inventó la regresión con variables instrumentales?" . Journal of Economic Perspectives . 17 (3): 177– 194. doi : 10.1257/089533003769204416 .
  8. ^ Reiersøl, Olav (1945). Análisis de Confluencia mediante Conjuntos Instrumentales de Variables . Arkiv para Matemáticas, Astronomi y Fysik. vol. 32A. Upsala: Almquist & Wiksells. OCLC 793451601 .  
  9. Wooldridge, J.: Introducción a la econometría . South-Western, Scarborough, Canadá, 2009.
  10. 1 2 3 4 Pearl, J. (2000). Causalidad: Modelos, razonamiento e inferencia . Nueva York: Cambridge University Press . ISBN 978-0-521-89560-6.
  11. Angrist, J.; Krueger, A. (2001). "Variables instrumentales y la búsqueda de identificación: de la oferta y la demanda a los experimentos naturales" . Journal of Economic Perspectives . 15 (4): 69– 85. doi : 10.1257/jep.15.4.69 . hdl : 1721.1/63775 .
  12. Heckman, J. (2008). "Causalidad econométrica". International Statistical Review . 76 (1): 1– 27. doi : 10.1111/j.1751-5823.2007.00024.x .
  13. Bowden, RJ; Turkington, DA (1984). Variables instrumentales . Cambridge, Inglaterra: Cambridge University Press.
  14. Davidson, Russell; Mackinnon, James (1993). Estimación e inferencia en econometría . Nueva York: Oxford University Press. ISBN 978-0-19-506011-9.
  15. Wooldridge, J. (2010). Análisis econométrico de datos de sección transversal y de panel. Análisis econométrico de datos de sección transversal y de panel. MIT Press.
  16. Lergenmuller, Simon (2017). Sustitución de predictores en dos etapas para datos de tiempo hasta el evento (Tesis). hdl : 10852/57801 .
  17. Balke, A.; Pearl, J. (1997). "Límites de los efectos del tratamiento a partir de estudios con cumplimiento imperfecto". Journal of the American Statistical Association . 92 (439): 1172– 1176. CiteSeerX 10.1.1.26.3952 . doi : 10.1080/01621459.1997.10474074 . S2CID 18365761 .  
  18. Heckman, J. (1997). "Variables instrumentales: Un estudio de supuestos conductuales implícitos utilizados en la realización de evaluaciones de programas". Journal of Human Resources . 32 (3): 441– 462. doi : 10.2307/146178 . JSTOR 146178 . 
  19. Bound, J.; Jaeger, DA; Baker, RM (1995). "Problemas con la estimación de variables instrumentales cuando la correlación entre los instrumentos y la variable explicativa endógena es débil". Journal of the American Statistical Association . 90 (430): 443. doi : 10.1080/01621459.1995.10476536 .
  20. Stock, J.; Wright, J.; Yogo, M. (2002). "Una revisión de instrumentos débiles e identificación débil en el método generalizado de momentos". Journal of the American Statistical Association . 20 (4): 518– 529. CiteSeerX 10.1.1.319.2477 . doi : 10.1198/073500102288618658 . S2CID 14793271 .  
  21. Nelson, CR; Startz, R. (1990). "Algunos resultados adicionales sobre las propiedades exactas de muestras pequeñas del estimador de variables instrumentales" . Econometrica . 58 (4): 967– 976. doi : 10.2307/2938359 . JSTOR 2938359. S2CID 119872226 .  
  22. Hayashi, Fumio (2000). "Prueba de restricciones sobreidentificativas" . Econometría . Princeton: Princeton University Press. pp. 217–221 . ISBN  978-0-691-01018-2.

Lecturas adicionales

  • Greene, William H. (2008). Análisis econométrico (Sexta  ed.). Upper Saddle River: Pearson Prentice-Hall. pp. 314–353 . ISBN  978-0-13-600383-0.
  • Gujarati, Damodar N .; Porter, Dawn C. (2009). Econometría básica (Quinta  ed.). Nueva York: McGraw-Hill Irwin. pp. 711–736 . ISBN  978-0-07-337577-9.
  • Keane, Michael P.; Neal, Timothy (2024). " Una guía práctica para instrumentos débiles ". Annual Review of Economics . 16 : 185–212.
  • Sargan, Denis (1988). Lecciones de teoría econométrica avanzada . Oxford: Basil Blackwell. pp. 42–67 . ISBN  978-0-631-14956-9.
  • Wooldridge, Jeffrey M. (2013). Introducción a la econometría: un enfoque moderno (Quinta  edición internacional). Mason, OH: South-Western. pp. 490–528 . ISBN  978-1-111-53439-4.

Bibliografía

  • Wooldridge, J. (1997): Métodos de cuasi-verosimilitud para datos de conteo, Manual de econometría aplicada, Volumen 2, ed. MH Pesaran y P. Schmidt, Oxford, Blackwell, pp.  352–406
  • Terza, JV (1998): "Estimación de modelos de conteo con cambio endógeno: selección de muestra y efectos de tratamiento endógenos." Journal of Econometrics (84), pp.  129–154
  • Wooldridge, J. (2002): "Análisis econométrico de datos de sección transversal y de panel", MIT Press , Cambridge, Massachusetts.
  • Capítulo del libro de texto de Daniel McFadden
  • Clase de econometría (tema: variable instrumental) en YouTube impartida por Mark Thoma .
  • Clase de econometría (tema: mínimos cuadrados en dos etapas) en YouTube por Mark Thoma
Obtenido de " https://en.wikipedia.org/w/index.php?title=Instrumental_variables&oldid=1356657858 "