La corrección de Heckman es una técnica estadística para corregir el sesgo derivado de muestras no seleccionadas aleatoriamente o de variables dependientes truncadas incidentalmente , un problema generalizado en las ciencias sociales cuantitativas al utilizar datos observacionales . [ 1 ] Conceptualmente, esto se logra modelando explícitamente la probabilidad de muestreo individual de cada observación (la llamada ecuación de selección) junto con la esperanza condicional de la variable dependiente (la llamada ecuación de resultado). La función de verosimilitud resultante es matemáticamente similar al modelo Tobit para variables dependientes censuradas , una conexión que James Heckman estableció por primera vez en 1974. [ 2 ] Heckman también desarrolló un enfoque de función de control de dos pasos para estimar este modelo, [ 3 ] que evita la carga computacional de tener que estimar ambas ecuaciones conjuntamente , aunque a costa de ineficiencia . [ 4 ] Heckman recibió el Premio Nobel de Economía en 2000 por su trabajo en este campo. [ 5 ]
Método
Los análisis estadísticos basados en muestras no seleccionadas aleatoriamente pueden llevar a conclusiones erróneas. La corrección de Heckman, un método estadístico de dos pasos, ofrece una forma de corregir este problema.
Heckman analizó el sesgo derivado del uso de muestras no seleccionadas aleatoriamente para estimar relaciones de comportamiento como un error de especificación. Propone un método de estimación en dos etapas para corregir dicho sesgo. La corrección se basa en una función de control y es fácil de implementar. La corrección de Heckman implica un supuesto de normalidad , proporciona una prueba para detectar el sesgo de selección de la muestra y una fórmula para el modelo corregido.
Supongamos que un investigador desea estimar los determinantes de las ofertas salariales, pero solo tiene acceso a datos salariales de las personas que trabajan. Dado que las personas que trabajan se seleccionan de forma no aleatoria de la población, estimar los determinantes de los salarios a partir de la subpoblación que trabaja puede introducir sesgos. La corrección de Heckman se realiza en dos etapas.
En la primera etapa, el investigador formula un modelo, basado en la teoría económica , para la probabilidad de trabajar. La especificación canónica para esta relación es una regresión probit de la forma
donde D indica empleo ( D = 1 si el encuestado está empleado y D = 0 en caso contrario), Z es un vector de variables explicativas,es un vector de parámetros desconocidos, y Φ es la función de distribución acumulativa de la distribución normal estándar . La estimación del modelo produce resultados que pueden utilizarse para predecir esta probabilidad de empleo para cada individuo.
En la segunda etapa, el investigador corrige la autoselección incorporando una transformación de estas probabilidades individuales predichas como una variable explicativa adicional. La ecuación salarial puede especificarse,
dóndedenota una oferta salarial subyacente, que no se observa si el encuestado no trabaja. La expectativa condicional de salarios dado que la persona trabaja es entonces
Bajo el supuesto de que los términos de error son conjuntamente normales , tenemos
donde ρ es la correlación entre los determinantes no observados de la propensión a trabajary determinantes no observados de las ofertas salariales u , σ u es la desviación estándar de , yes la relación inversa de Mills evaluada enEsta ecuación demuestra la intuición de Heckman de que la selección de la muestra puede verse como una forma de sesgo por variables omitidas , condicionada tanto a X como aEs como si la muestra se seleccionara aleatoriamente. La ecuación salarial se puede estimar reemplazandocon estimaciones Probit de la primera etapa, construyendo eltérmino, e incluyéndolo como una variable explicativa adicional en la estimación de regresión lineal de la ecuación salarial. Dado que, el coeficiente ensolo puede ser cero si, por lo que probamos la hipótesis nula de que el coeficiente enes cero es equivalente a probar la selectividad de la muestra.
Los logros de Heckman han generado un gran número de aplicaciones empíricas en economía, así como en otras ciencias sociales. El método original ha sido posteriormente generalizado, tanto por Heckman como por otros. [ 6 ]
Inferencia estadística
La corrección de Heckman es un estimador M de dos pasos donde la matriz de covarianza generada por la estimación MCO de la segunda etapa es inconsistente. [ 7 ] Los errores estándar correctos y otras estadísticas pueden generarse a partir de una aproximación asintótica o mediante remuestreo, como a través de un bootstrap . [ 8 ]
Desventajas
- El estimador de dos pasos descrito anteriormente es un estimador de máxima verosimilitud de información limitada (LIML). En teoría asintótica y en muestras finitas, como demuestran las simulaciones de Monte Carlo, el estimador de información completa (FIML) presenta mejores propiedades estadísticas. Sin embargo, el estimador FIML es computacionalmente más difícil de implementar. [ 9 ]
- El modelo canónico supone que los errores son conjuntamente normales. Si esta suposición no se cumple, el estimador suele ser inconsistente y puede proporcionar inferencias engañosas en muestras pequeñas. [ 10 ] En tales casos, se pueden utilizar alternativas semiparamétricas y otras alternativas robustas. [ 11 ]
- El modelo obtiene una identificación formal a partir del supuesto de normalidad cuando las mismas covariables aparecen en la ecuación de selección y la ecuación de interés, pero la identificación será tenue a menos que haya muchas observaciones en las colas donde haya una no linealidad sustancial en la razón inversa de Mills. Generalmente, se requiere una restricción de exclusión para generar estimaciones creíbles: debe haber al menos una variable que aparezca con un coeficiente distinto de cero en la ecuación de selección pero no aparezca en la ecuación de interés, esencialmente un instrumento . Si no se dispone de dicha variable, puede ser difícil corregir la selectividad del muestreo. [ 9 ] La razón de esto es doble: Sin un instrumento, la identificación se basa en el supuesto de forma funcional que normalmente se considera muy débil. [ 12 ] Además, incluso si el supuesto se cumple, la función elegida puede estar muy cerca de una forma funcional lineal en el área bajo investigación, causando un problema de multicolinealidad en la segunda etapa.
Implementaciones en paquetes estadísticos
Véase también
- Emparejamiento por puntuación de propensión : técnica de emparejamiento estadístico
- Modelo de Roy : modelo de autoselección en economía.
Referencias
- ↑ Winship, Christopher; Mare, Robert D. (1992). "Modelos para el sesgo de selección de muestras". Annual Review of Sociology . 18 : 327–350 . doi : 10.1146/annurev.so.18.080192.001551 .
- ↑ Heckman, James (1974). "Precios sombra, salarios de mercado y oferta laboral". Econometrica . 42 (4): 679– 694. doi : 10.2307/1913937 . JSTOR 1913937 .
- ↑ Heckman, James (1976). "La estructura común de los modelos estadísticos de truncamiento, selección de muestra y variables dependientes limitadas y un estimador simple para dichos modelos" . Anales de medición económica y social . 5 (4): 475–492 .
- ↑ Nawata, Kazumitsu (1994). "Estimación de modelos de sesgo de selección de muestras mediante el estimador de máxima verosimilitud y el estimador de dos pasos de Heckman". Economics Letters . 45 (1): 33– 40. doi : 10.1016/0165-1765(94)90053-1 .
- ↑ Uchitelle, Louis (12 de octubre de 2000). "Dos estadounidenses ganan el Premio Nobel de Economía" . New York Times .
- ↑ Lee, Lung-Fei (2001). «Autoselección». En Baltagi, B. (ed.). Un compañero de la econometría teórica . Oxford: Blackwell. pp. 383–409 . doi : 10.1002/9780470996249.ch19 . ISBN 9780470996249.
- ↑ Amemiya, Takeshi (1985). Econometría avanzada . Cambridge: Harvard University Press. pp. 368–372 . ISBN 0-674-00560-0.
- ↑ Cameron, A. Colin ; Trivedi, Pravin K. (2005). "Estimación m secuencial en dos pasos" . Microeconometría: métodos y aplicaciones . Nueva York: Cambridge University Press. págs. 200–202 . ISBN 0-521-84805-9.
- 1 2 Puhani, P. (2000). "La corrección de Heckman para la selección de muestras y su crítica". Journal of Economic Surveys . 14 (1): 53– 68. doi : 10.1111/1467-6419.00104 .
- ↑ Goldberger, A. (1983). «Sesgo de selección anormal» . En Karlin, Samuel ; Amemiya, Takeshi ; Goodman, Leo (eds.). Estudios en econometría, series temporales y estadística multivariante . Nueva York: Academic Press. pp. 67–84 . ISBN 0-12-398750-4.
- ↑ Newey, Whitney; Powell, J.; Walker, James R. (1990). "Estimación semiparamétrica de modelos de selección: algunos resultados empíricos". American Economic Review . 80 (2): 324– 28. JSTOR 2006593 .
- ↑ Lewbel, Arthur (1 de diciembre de 2019). "El zoológico de la identificación: significados de la identificación en econometría" . Journal of Economic Literature . 57 (4): 835–903 . doi : 10.1257/jel.20181361 . ISSN 0022-0515 .
- ↑ Toomet, O.; Henningsen, A. (2008). "Modelos de selección de muestras en R: Paquete sampleSelection" . Journal of Statistical Software . 27 (7): 1– 23. doi : 10.18637/jss.v027.i07 .
- ↑ "sampleSelection: Modelos de selección de muestras" . Proyecto R. 3 de mayo de 2019.
- ↑ "heckman — Modelo de selección de Heckman" (PDF) . Manual de Stata .
- ↑ Cameron, A. Colin; Trivedi, Pravin K. (2010). Microeconometría con Stata ( Edición revisada). College Station: Stata Press. págs. 556–562 . ISBN 978-1-59718-073-3.
Lecturas adicionales
- Achen, Christopher H. (1986). «Estimación de los efectos del tratamiento en cuasiexperimentos : El caso de los datos censurados» . Análisis estadístico de cuasiexperimentos . Berkeley: University of California Press. pp. 97–137 . ISBN 0-520-04723-0.
- Breen, Richard (1996). Modelos de regresión : datos censurados, seleccionados mediante muestreo o truncados . Thousand Oaks: Sage. págs. 33–48 . ISBN 0-8039-5710-6.
- Fu, Vincent Kang; Winship, Christopher ; Mare, Robert D. (2004). «Modelos de sesgo de selección de muestra». En Hardy, Melissa; Bryman, Alan (eds.). Manual de análisis de datos . Londres: Sage. pp. 409–430 . doi : 10.4135/9781848608184.n18 . ISBN 0-7619-6652-8.
- Greene, William H. (2012). «Truncamiento incidental y selección de muestras». Análisis econométrico (séptima ed.). Boston: Pearson. pp. 912–27 . ISBN 978-0-273-75356-8.
- Vella, Francis (1998). "Estimación de modelos con sesgo de selección de muestra: una revisión". Journal of Human Resources . 33 (1): 127– 169. doi : 10.2307/146317 . JSTOR 146317 .
Enlaces externos
- Datos sobre Heckman, ganador del Premio Nobel.
- Muestreo (estadística)
- Análisis de regresión
- Modelización econométrica