En estadística , el sesgo por variables omitidas ( SVO ) se produce cuando un modelo estadístico omite una o más variables relevantes. Este sesgo provoca que el modelo atribuya el efecto de las variables omitidas a las que sí se incluyeron.
Más específicamente, el sesgo de validación cruzada (OVB, por sus siglas en inglés) es el sesgo que aparece en las estimaciones de los parámetros en un análisis de regresión , cuando la especificación asumida es incorrecta, ya que omite una variable independiente que es determinante de la variable dependiente y está correlacionada con una o más de las variables independientes incluidas.
En regresión lineal
Intuición
Supongamos que la verdadera relación de causa y efecto viene dada por:
con parámetros a, b, c , variable dependiente y , variables independientes x y z , y término de error u . Deseamos conocer el efecto de x sobre y (es decir, deseamos obtener una estimación de b ).
Para que exista sesgo por variables omitidas en la regresión lineal , deben cumplirse dos condiciones :
- La variable omitida debe ser un determinante de la variable dependiente (es decir, su verdadero coeficiente de regresión no debe ser cero); y
- La variable omitida debe estar correlacionada con una variable independiente especificada en la regresión (es decir, cov( z , x ) no debe ser igual a cero).
Supongamos que omitimos z de la regresión, y supongamos que la relación entre x y z está dada por
con parámetros d , f y término de error e . Sustituyendo la segunda ecuación en la primera se obtiene
Si se realiza una regresión de y sobre x únicamente, se estima esta última ecuación, y el coeficiente de regresión sobre x es en realidad una estimación de ( b + cf ), que no es simplemente una estimación del efecto directo deseado de x sobre y (que es b ), sino más bien de su suma con el efecto indirecto (el efecto f de x sobre z multiplicado por el efecto c de z sobre y ). Por lo tanto, al omitir la variable z de la regresión, hemos estimado la derivada total de y con respecto a x en lugar de su derivada parcial con respecto a x . Estas difieren si tanto c como f son distintos de cero.
La dirección y la magnitud del sesgo están contenidas en cf , ya que el efecto buscado es b, pero la regresión estima b+cf . La magnitud del sesgo es el valor absoluto de cf , y la dirección del sesgo es ascendente (hacia un valor más positivo o menos negativo) si cf > 0 (si la dirección de la correlación entre y y z es la misma que entre x y z ), y descendente en caso contrario.
Análisis detallado
Como ejemplo, consideremos un modelo lineal de la forma
dónde
- x i es un vector fila de 1 × p de valores de p variables independientes observadas en el tiempo i o para el i- ésimo participante del estudio;
- β es un vector columna p × 1 de parámetros no observables (los coeficientes de respuesta de la variable dependiente a cada una de las p variables independientes en x i ) que se van a estimar;
- z i es un escalar y es el valor de otra variable independiente que se observa en el tiempo i o para el i- ésimo participante del estudio;
- δ es un escalar y es un parámetro no observable (el coeficiente de respuesta de la variable dependiente a z i ) que debe estimarse;
- u i es el término de error no observable que ocurre en el tiempo i o para el i- ésimo participante del estudio; es una realización no observada de una variable aleatoria con valor esperado 0 (condicionalmente a x i y z i );
- y i es la observación de la variable dependiente en el tiempo i o para el i- ésimo participante del estudio.
Recopilamos las observaciones de todas las variables con subíndice i = 1, ..., n , y las apilamos una debajo de otra para obtener la matriz X y los vectores Y , Z y U :
y
Si se omite la variable independiente z de la regresión, entonces los valores estimados de los parámetros de respuesta de las otras variables independientes vendrán dados por el cálculo habitual de mínimos cuadrados ,
(donde la notación "prima" significa la transpuesta de una matriz y el superíndice -1 es la inversión de la matriz ).
Sustituyendo Y en base al modelo lineal supuesto,
Al tomar las esperanzas, la contribución del último término es cero; esto se deduce del supuesto de que U no está correlacionado con los regresores X. Al simplificar los términos restantes:
El segundo término después del signo igual es el sesgo de la variable omitida en este caso, que es distinto de cero si la variable omitida z está correlacionada con alguna de las variables incluidas en la matriz X (es decir, si X ′ Z no es igual a un vector de ceros). Nótese que el sesgo es igual a la porción ponderada de z i que es "explicada" por x i .
Efecto en mínimos cuadrados ordinarios
El teorema de Gauss-Markov establece que los modelos de regresión que cumplen con los supuestos del modelo de regresión lineal clásico proporcionan los estimadores más eficientes , lineales e insesgados . En el método de mínimos cuadrados ordinarios , el supuesto relevante del modelo de regresión lineal clásico es que el término de error no está correlacionado con las variables explicativas.
La presencia de sesgo por variables omitidas viola este supuesto. Esta violación provoca que el estimador MCO sea sesgado e inconsistente . La dirección del sesgo depende de los estimadores, así como de la covarianza entre los regresores y las variables omitidas. Una covarianza positiva de la variable omitida con un regresor y la variable dependiente hará que la estimación MCO del coeficiente del regresor incluido sea mayor que el valor real de dicho coeficiente. Este efecto puede observarse al calcular la esperanza del parámetro, como se muestra en la sección anterior.
Véase también
Referencias
- Barreto; Howland (2006). "Sesgo por variables omitidas" . Econometría introductoria: Uso de la simulación de Monte Carlo con Microsoft Excel . Cambridge University Press.
- Clarke, Kevin A. (2005). "La amenaza fantasma: sesgo por variables omitidas en la investigación econométrica". Conflict Management and Peace Science . 22 (4): 341– 352. doi : 10.1080/07388940500339183 .
- Greene, WH (1993). Análisis econométrico (2.ª ed.). Macmillan. pp. 245–246 .
- Wooldridge, Jeffrey M. (2009). «Sesgo por variables omitidas: El caso simple». Econometría introductoria: Un enfoque moderno . Mason, OH: Cengage Learning. pp. 89–93 . ISBN 9780324660548.
- Análisis de regresión
- Sesgo experimental