Articulo de referencia

Método generalizado de momentos

El método generalizado de momentos ( GMM ) en econometría y estadística es un método genérico para estimar parámetros en modelos estadísticos . Generalmente se aplica en el cont...

El método generalizado de momentos ( GMM ) en econometría y estadística es un método genérico para estimar parámetros en modelos estadísticos . Generalmente se aplica en el contexto de modelos semiparamétricos , donde el parámetro de interés es de dimensión finita, mientras que la forma completa de la función de distribución de los datos puede ser desconocida y, por lo tanto, la estimación de máxima verosimilitud no es aplicable.

El método requiere que se especifique un cierto número de condiciones de momento para el modelo. Estas condiciones de momento son funciones de los parámetros del modelo y de los datos, de modo que su esperanza es cero en los valores reales de los parámetros. El método GMM minimiza entonces una cierta norma de las medias muestrales de las condiciones de momento y, por lo tanto, puede considerarse un caso especial de estimación de distancia mínima . [ 1 ]

Se sabe que los estimadores GMM son consistentes , asintóticamente normales y los más eficientes dentro de la clase de estimadores que no utilizan información adicional aparte de la contenida en las condiciones de los momentos. Lars Peter Hansen propuso los GMM en 1982 como una generalización del método de los momentos , [ 2 ] introducido por Karl Pearson en 1894. Sin embargo, estos estimadores son matemáticamente equivalentes a aquellos basados ​​en "condiciones de ortogonalidad" (Sargan, 1958, 1959) o " ecuaciones de estimación insesgadas " (Huber, 1967; Wang et al., 1997).

Descripción

Supongamos que los datos disponibles consisten en T observaciones { Y t } t = 1,..., T , donde cada observación Y t es una variable aleatoria multivariada n -dimensional . Suponemos que los datos provienen de un cierto modelo estadístico , definido salvo un parámetro desconocido θ ∈ Θ . El objetivo del problema de estimación es encontrar el valor “verdadero” de este parámetro, θ 0 , o al menos una estimación razonablemente cercana.

Una suposición general del método GMM es que los datos Y t se generen mediante un proceso estocástico ergódico débilmente estacionario . (El caso de variables Y t independientes e idénticamente distribuidas (iid) es un caso especial de esta condición).

Para aplicar GMM, necesitamos tener "condiciones de momento", es decir, necesitamos conocer una función vectorial g ( Y , θ ) tal que

metro(θ0)mi[gramo(Yt,θ0)]=0,{\displaystyle m(\theta _{0})\equiv \operatorname {E} [\,g(Y_{t},\theta _{0})\,]=0,}

donde E denota la esperanza y Y t es una observación genérica. Además, la función m ( θ ) debe ser distinta de cero para θθ 0 , de lo contrario el parámetro θ no será identificado puntualmente .

La idea básica detrás del GMM es reemplazar el valor esperado teórico E[⋅] con su análogo empírico: el promedio de la muestra:

metro^(θ)1Tt=1Tgramo(Yt,θ){\displaystyle {\hat {m}}(\theta )\equiv {\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},\theta )}

y luego minimizar la norma de esta expresión con respecto a θ . El valor mínimo de θ es nuestra estimación para θ 0 .

Por la ley de los grandes números ,metro^(θ)mi[gramo(Yt,θ)]=metro(θ){\displaystyle \scriptstyle {\hat {m}}(\theta )\,\approx \;\operatorname {E} [g(Y_{t},\theta )]\,=\,m(\theta )}para valores grandes de T , y por lo tanto esperamos quemetro^(θ0)metro(θ0)=0{\displaystyle \scriptstyle {\hat {m}}(\theta _{0})\;\approx \;m(\theta _{0})\;=\;0}El método generalizado de los momentos busca un númeroθ^{\displaystyle \scriptstyle {\hat {\theta }}}lo que haríametro^(θ^){\displaystyle \scriptstyle {\hat {m}}(\;\!{\hat {\theta }}\;\!)}lo más cercano posible a cero. Matemáticamente, esto es equivalente a minimizar una cierta norma demetro^(θ){\displaystyle \scriptstyle {\hat {m}}(\theta )}(la norma de m , denotada como || m ||, mide la distancia entre m y cero). Las propiedades del estimador resultante dependerán de la elección particular de la función de norma, y ​​por lo tanto la teoría de GMM considera una familia completa de normas, definidas como

metro^(θ)W2=metro^(θ)TWmetro^(θ),{\displaystyle \|{\hat {m}}(\theta )\|_{W}^{2}={\hat {m}}(\theta )^{\mathsf {T}}\,W{\hat {m}}(\theta ),}

donde W es una matriz de ponderación definida positiva , ymetroT{\displaystyle m^{\mathsf {T}}}denota transposición . En la práctica, la matriz de ponderación W se calcula en función del conjunto de datos disponible , que se denotará comoW^{\displaystyle \scriptstyle {\sombrero {W}}}Por lo tanto, el estimador GMM se puede escribir como

θ^=argminθΘ(1Tt=1Tgramo(Yt,θ))TW^(1Tt=1Tgramo(Yt,θ)){\displaystyle {\hat {\theta }}=\operatorname {arg} \min _{\theta \in \Theta }{\bigg (}{\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},\theta ){\bigg )}^{\mathsf {T}}{\hat {W}}{\bigg (}{\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},\theta ){\bigg )}}

En condiciones adecuadas, este estimador es consistente , asintóticamente normal y con la elección correcta de la matriz de ponderación.W^{\displaystyle \scriptstyle {\sombrero {W}}}también asintóticamente eficiente .

Propiedades

Consistencia

La consistencia es una propiedad estadística de un estimador que establece que, teniendo un número suficiente de observaciones, el estimador convergerá en probabilidad al verdadero valor del parámetro:

θ^pagθ0 como T.{\displaystyle {\hat {\theta }}{\xrightarrow {p}}\theta _{0}\ {\text{cuando}}\ T\to \infty .}

Las condiciones suficientes para que un estimador GMM sea consistente son las siguientes:

  1. W^TpagW,{\displaystyle {\sombrero {W}}_{T}{\xrightarrow {p}}W,}donde W es una matriz semidefinida positiva ,
  2. Wmi[gramo(Yt,θ)]=0{\displaystyle \,W\operatorname {E} [\,g(Y_{t},\theta )\,]=0} solo paraθ=θ0,{\displaystyle \,\theta =\theta _{0},}
  3. El espacio de parámetros posiblesΘRk{\displaystyle \Theta \subset \mathbb {R} ^{k}}es compacto ,
  4. gramo(Y,θ){\displaystyle \,g(Y,\theta )} es continua en cada θ con probabilidad uno,
  5. mi[sorberθΘgramo(Y,θ)]<.{\displaystyle \operatorname {E} [\,\textstyle \sup _{\theta \in \Theta }\lVert g(Y,\theta )\rVert \,]<\infty .}

La segunda condición (la llamada condición de identificación global ) suele ser particularmente difícil de verificar. Existen condiciones necesarias, pero no suficientes, más sencillas, que pueden utilizarse para detectar problemas de no identificación:

  • Condición de orden . La dimensión de la función de momento m(θ) debe ser al menos tan grande como la dimensión del vector de parámetros θ .
  • Identificación local . Si g(Y,θ) es continuamente diferenciable en un entorno deθ0{\displaystyle \theta _{0}}, luego matrizWmi[θgramo(Yt,θ0)]{\displaystyle W\operatorname {E} [\nabla _{\theta }g(Y_{t},\theta _{0})]}debe tener rango de columna completo .

En la práctica, los econometristas aplicados a menudo simplemente asumen que la identificación global es válida, sin demostrarlo realmente. [ 3 ] : 2127

normalidad asintótica

La normalidad asintótica es una propiedad útil, ya que nos permite construir intervalos de confianza para el estimador y realizar diferentes pruebas. Antes de poder hacer una afirmación sobre la distribución asintótica del estimador GMM, necesitamos definir dos matrices auxiliares:

GRAMO=mi[θgramo(Yt,θ0)],Ω=mi[gramo(Yt,θ0)gramo(Yt,θ0)T]{\displaystyle G=\operatorname {E} [\,\nabla _{\!\theta }\,g(Y_{t},\theta _{0})\,],\qquad \Omega =\operatorname {E} [\,g(Y_{t},\theta _{0})g(Y_{t},\theta _{0})^{\mathsf {T}}\,]}

Entonces, bajo las condiciones 1 a 6 que se enumeran a continuación, el estimador GMM será asintóticamente normal con distribución límite :

T(θ^θ0) d norte[0,(GRAMOTWGRAMO)1GRAMOTWΩWTGRAMO(GRAMOTWTGRAMO)1].{\displaystyle {\sqrt {T}}{\big (}{\hat {\theta }}-\theta _{0}{\big )}\ {\xrightarrow {d}}\ {\mathcal {N}}{\big [}0,(G^{\mathsf {T}}WG)^{-1}G^{\mathsf {T}}W\Omega W^{\mathsf {T}}G(G^{\mathsf {T}}W^{\mathsf {T}}G)^{-1}{\big ]}.}

Condiciones:

  1. θ^{\displaystyle {\hat {\theta }}}es consistente (ver sección anterior),
  2. El conjunto de parámetros posiblesΘRk{\displaystyle \Theta \subset \mathbb {R} ^{k}}es compacto ,
  3. gramo(Y,θ){\displaystyle \,g(Y,\theta )}es continuamente diferenciable en algún vecindario N deθ0{\displaystyle \theta _{0}}con probabilidad uno,
  4. mi[gramo(Yt,θ)2]<,{\displaystyle \operatorname {E} [\,\lVert g(Y_{t},\theta )\rVert ^{2}\,]<\infty ,}
  5. mi[sorberθnorteθgramo(Yt,θ)]<,{\displaystyle \operatorname {E} [\,\textstyle \sup _{\theta \in N}\lVert \nabla _{\theta }g(Y_{t},\theta )\rVert \,]<\infty ,}
  6. la matrizGRAMOWGRAMO{\displaystyle G'WG}es no singular.

Eficiencia relativa

Hasta ahora no hemos dicho nada sobre la elección de la matriz W , excepto que debe ser semidefinida positiva. De hecho, cualquier matriz de este tipo producirá un estimador GMM consistente y asintóticamente normal; la única diferencia estará en la varianza asintótica de dicho estimador. Se puede demostrar que tomando

W Ω1{\displaystyle W\propto \ \Omega ^{-1}}

dará como resultado el estimador más eficiente en la clase de todos los estimadores del método de momentos (generalizados). Solo un número infinito de condiciones ortogonales obtiene la varianza más pequeña, la cota de Cramér-Rao .

En este caso, la fórmula para la distribución asintótica del estimador GMM se simplifica a

T(θ^θ0) d norte[0,(GRAMOTΩ1GRAMO)1]{\displaystyle {\sqrt {T}}{\big (}{\hat {\theta }}-\theta _{0}{\big )}\ {\xrightarrow {d}}\ {\mathcal {N}}{\big [}0,(G^{\mathsf {T}}\,\Omega ^{-1}G)^{-1}{\big ]}}

La prueba de que dicha matriz de ponderación es realmente óptima localmente se suele adoptar, con ligeras modificaciones, al establecer la eficiencia de otros estimadores. Como regla general, una matriz de ponderación se acerca a la optimalidad cuando se convierte en una expresión más cercana al límite de Cramér-Rao .

Implementación

Una dificultad para implementar el método descrito es que no podemos tomar W = Ω −1 porque, por definición de matriz Ω, necesitamos conocer el valor de θ 0 para calcular esta matriz, y θ 0 es precisamente la cantidad que desconocemos y que estamos tratando de estimar en primer lugar. En el caso de que Y t sea i.i.d., podemos estimar W como

W^T(θ^)=(1Tt=1Tgramo(Yt,θ^)gramo(Yt,θ^)T)1.{\displaystyle {\hat {W}}_{T}({\hat {\theta }})={\bigg (}{\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},{\hat {\theta }})g(Y_{t},{\hat {\theta }})^{\mathsf {T}}{\bigg )}^{-1}.}

Existen varios enfoques para abordar este problema, siendo el primero el más popular:

  • GMM factible de dos pasos :
    • Paso 1 : Tomar W = I (la matriz identidad ) u otra matriz definida positiva, y calcular la estimación preliminar del GMM.θ^(1){\displaystyle \scriptstyle {\hat {\theta }}_{(1)}}Este estimador es consistente para θ 0 , aunque no eficiente.
    • Paso 2 :W^T(θ^(1)){\displaystyle {\hat {W}}_{T}({\hat {\theta }}_{(1)})}converge en probabilidad a Ω −1 y por lo tanto si calculamosθ^{\displaystyle \scriptstyle {\hat {\theta }}}Con esta matriz de ponderación, el estimador será asintóticamente eficiente .
  • GMM iterado . Esencialmente el mismo procedimiento que el GMM de 2 pasos, excepto que la matriz W^T{\displaystyle {\hat {W}}_{T}}se recalcula varias veces. Es decir, la estimación obtenida en el paso 2 se utiliza para calcular la matriz de ponderación para el paso 3, y así sucesivamente hasta que se cumpla algún criterio de convergencia.
    θ^(i+1)=argminθΘ(1Tt=1Tgramo(Yt,θ))TW^T(θ^(i))(1Tt=1Tgramo(Yt,θ)){\displaystyle {\hat {\theta }}_{(i+1)}=\operatorname {arg} \min _{\theta \in \Theta }{\bigg (}{\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},\theta ){\bigg )}^{\mathsf {T}}{\hat {W}}_{T}({\hat {\theta }}_{(i)}){\bigg (}{\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},\theta ){\bigg )}}
    Asintóticamente, no se puede lograr ninguna mejora mediante tales iteraciones, aunque ciertos experimentos de Montecarlo sugieren que las propiedades de muestra finita de este estimador son ligeramente mejores.
  • Estimaciones del modelo GMM de actualización continua (CUGMM o CUE).θ^{\displaystyle \scriptstyle {\hat {\theta }}}simultáneamente con la estimación de la matriz de ponderación W :
    θ^=argminθΘ(1Tt=1Tgramo(Yt,θ))TW^T(θ)(1Tt=1Tgramo(Yt,θ)){\displaystyle {\hat {\theta }}=\operatorname {arg} \min _{\theta \in \Theta }{\bigg (}{\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},\theta ){\bigg )}^{\mathsf {T}}{\hat {W}}_{T}(\theta ){\bigg (}{\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},\theta ){\bigg )}}
    En experimentos de Montecarlo, este método demostró un mejor rendimiento que el GMM tradicional de dos pasos: el estimador tiene un sesgo mediano menor (aunque colas más pesadas) y la prueba J para restricciones de sobreidentificación fue, en muchos casos, más fiable. [ 4 ]

Otro aspecto importante en la implementación del procedimiento de minimización es que la función debe explorar el espacio de parámetros Θ (posiblemente de alta dimensión) y encontrar el valor de θ que minimiza la función objetivo. No existe una recomendación genérica para dicho procedimiento; se trata de un campo específico: la optimización numérica .

Prueba J de Sargan-Hansen

Cuando el número de condiciones de momento es mayor que la dimensión del vector de parámetros θ , se dice que el modelo está sobreidentificado . Sargan (1958) propuso pruebas para restricciones de sobreidentificación basadas en estimadores de variables instrumentales que se distribuyen en muestras grandes como variables chi-cuadrado con grados de libertad que dependen del número de restricciones de sobreidentificación. Posteriormente, Hansen (1982) aplicó esta prueba a la formulación matemáticamente equivalente de los estimadores GMM. Sin embargo, cabe señalar que tales estadísticas pueden ser negativas en aplicaciones empíricas donde los modelos están mal especificados, y las pruebas de razón de verosimilitud pueden proporcionar información valiosa, ya que los modelos se estiman bajo hipótesis nula y alternativa (Bhargava y Sargan, 1983).

Conceptualmente podemos comprobar simetro^(θ^){\displaystyle {\hat {m}}({\hat {\theta }})}es suficientemente cercano a cero como para sugerir que el modelo se ajusta bien a los datos. El método GMM ha reemplazado entonces el problema de resolver la ecuación.metro^(θ)=0{\displaystyle {\hat {m}}(\theta )=0}, que eligeθ{\displaystyle \theta }para ajustarse exactamente a las restricciones, mediante un cálculo de minimización. La minimización siempre se puede realizar incluso cuando noθ0{\displaystyle \theta _{0}}existe tal quemetro(θ0)=0{\displaystyle m(\theta _{0})=0}Esto es lo que hace la prueba J. La prueba J también se denomina prueba para la sobreidentificación de restricciones .

Formalmente consideramos dos hipótesis :

  • H0: metro(θ0)=0{\displaystyle H_{0}:\ m(\theta _{0})=0} (la hipótesis nula de que el modelo es “válido”), y
  • H1: metro(θ)0, θΘ{\displaystyle H_{1}:\ m(\theta )\neq 0,\ \forall \theta \in \Theta } (la hipótesis alternativa de que el modelo es “inválido”; los datos no se acercan a cumplir las restricciones)

Bajo hipótesisH0{\displaystyle H_{0}}La siguiente estadística denominada J se distribuye asintóticamente como chi-cuadrado con k–l grados de libertad. Definimos J como:

JT(1Tt=1Tgramo(Yt,θ^))TW^T(1Tt=1Tgramo(Yt,θ^)) d χk2{\displaystyle J\equiv T\cdot {\bigg (}{\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},{\hat {\theta }}){\bigg )}^{\mathsf {T}}{\hat {W}}_{T}{\bigg (}{\frac {1}{T}}\sum _{t=1}^{T}g(Y_{t},{\hat {\theta }}){\bigg )}\ {\xrightarrow {d}}\ \chi _{k-\ell }^{2}} bajoH0,{\displaystyle H_{0},}

dóndeθ^{\displaystyle {\hat {\theta }}}es el estimador GMM del parámetroθ0{\displaystyle \theta _{0}}, k es el número de condiciones de momento (dimensión del vector g ), y l es el número de parámetros estimados (dimensión del vector θ ). MatrizW^T{\displaystyle {\hat {W}}_{T}}debe converger en probabilidad aΩ1{\displaystyle \Omega ^{-1}}, la matriz de ponderación eficiente (tenga en cuenta que anteriormente solo requeríamos que W fuera proporcional aΩ1{\displaystyle \Omega ^{-1}}para que el estimador sea eficiente; sin embargo, para realizar la prueba J, W debe ser exactamente igual aΩ1{\displaystyle \Omega ^{-1}}, no simplemente proporcional).

Bajo la hipótesis alternativaH1{\displaystyle H_{1}}, el estadístico J es asintóticamente ilimitado:

J pag {\displaystyle J\ {\xrightarrow {p}}\ \infty } bajoH1{\displaystyle H_{1}}

Para realizar la prueba calculamos el valor de J a partir de los datos. Es un número no negativo. Lo comparamos con (por ejemplo) el cuantil 0,95 de la χk2{\displaystyle \chi _{k-\ell }^{2}}distribución:

  • H0{\displaystyle H_{0}}se rechaza con un nivel de confianza del 95% siJ>q0,95χk2{\displaystyle J>q_{0.95}^{\chi _{k-\ell }^{2}}}
  • H0{\displaystyle H_{0}}no se puede rechazar con un nivel de confianza del 95% siJ<q0,95χk2{\displaystyle J<q_{0.95}^{\chi _{k-\ell }^{2}}}

Alcance

Muchas otras técnicas de estimación populares pueden expresarse en términos de optimización GMM:

  • El método de mínimos cuadrados ordinarios (MCO) es equivalente al método de momentos generalizados (GMM) con condiciones de momento:
    mi[incógnitat(ytincógnitatTβ)]=0{\displaystyle \operatorname {E} [\,x_{t}(y_{t}-x_{t}^{\mathsf {T}}\beta )\,]=0}
  • Mínimos cuadrados ponderados (WLS)
    mi[incógnitat(ytincógnitatTβ)/σ2(incógnitat)]=0{\displaystyle \operatorname {E} [\,x_{t}(y_{t}-x_{t}^{\mathsf {T}}\beta )/\sigma ^{2}(x_{t})\,]=0}
  • Regresión con variables instrumentales (VI)
    mi[zt(ytincógnitatTβ)]=0{\displaystyle \operatorname {E} [\,z_{t}(y_{t}-x_{t}^{\mathsf {T}}\beta )\,]=0}
  • Mínimos cuadrados no lineales (NLLS):
    mi[βgramo(incógnitat,β)(ytgramo(incógnitat,β))]=0{\displaystyle \operatorname {E} [\,\nabla _{\!\beta }\,g(x_{t},\beta )\cdot (y_{t}-g(x_{t},\beta ))\,]=0}
  • Estimación de máxima verosimilitud (EMV):
    mi[θlnF(incógnitat,θ)]=0{\displaystyle \operatorname {E} [\,\nabla _{\!\theta }\ln f(x_{t},\theta )\,]=0}

Alternativa al GMM

En el método de los momentos , se describe una alternativa al método de los momentos (MoM) original (no generalizado), y se proporcionan referencias a algunas aplicaciones y una lista de ventajas y desventajas teóricas en relación con el método tradicional. Este MoM de tipo bayesiano (BL-MoM) es distinto de todos los métodos relacionados descritos anteriormente, que están subsumidos por el GMM. [ 5 ] [ 6 ] La literatura no contiene una comparación directa entre el GMM y el BL-MoM en aplicaciones específicas.

Implementaciones

  • Wikilibro de programación en R, Método de los momentos
  • R
  • Stata
  • EViews
  • SAS
  • Gretl

Véase también

Referencias

  1. Hayashi, Fumio (2000). Econometría . Princeton University Press. pág.  206. ISBN 0-691-01018-8.
  2. Hansen, Lars Peter (1982). "Propiedades de muestras grandes de los estimadores del método generalizado de momentos". Econometrica . 50 (4): 1029– 1054. doi : 10.2307/1912775 . JSTOR 1912775 . 
  3. Newey, W.; McFadden, D. (1994). «Estimación de muestras grandes y prueba de hipótesis». Manual de econometría . Vol. 4. Elsevier Science. pp. 2111–2245 . CiteSeerX 10.1.1.724.4480 . doi : 10.1016/S1573-4412(05)80005-4 . ISBN    9780444887665.
  4. Hansen, Lars Peter; Heaton, John; Yaron, Amir (1996). "Propiedades de muestra finita de algunos estimadores GMM alternativos" (PDF) . Journal of Business & Economic Statistics . 14 (3): 262– 280. doi : 10.1080/07350015.1996.10524656 . hdl : 1721.1/47970 . JSTOR 1392442 . 
  5. Armitage, Peter; Colton, Theodore, eds. (18 de febrero de 2005). Enciclopedia de Bioestadística (1.ª ed.). Wiley. doi : 10.1002/0470011815 . ISBN  978-0-470-84907-1.
  6. Godambe, VP, ed. (2002). Estimación de funciones . Serie de ciencias estadísticas de Oxford ( Edición reimpresa). Oxford: Clarendon Press. ISBN  978-0-19-852228-7.

Lecturas adicionales

  • Huber, P. (1967). El comportamiento de las estimaciones de máxima verosimilitud bajo condiciones no estándar. Actas del Quinto Simposio de Berkeley sobre Estadística Matemática y Probabilidad 1, 221-233.
  • Newey W., McFadden D. (1994). Estimación de muestras grandes y prueba de hipótesis , en Manual de econometría, Cap. 36. Elsevier Science.
  • Imbens, Guido W .; Spady, Richard H.; Johnson, Phillip (1998). "Enfoques de la teoría de la información para la inferencia en modelos de condiciones de momento" (PDF) . Econometrica . 66 (2): 333–357 . doi : 10.2307/2998561 . JSTOR 2998561 . 
  • Sargan, JD (1958). La estimación de relaciones económicas mediante variables instrumentales. Econometrica, 26, 393-415.
  • Sargan, JD (1959). La estimación de relaciones con residuos autocorrelacionados mediante el uso de variables instrumentales. Journal of the Royal Statistical Society B, 21, 91-105.
  • Wang, CY, Wang, S., y Carroll, R. (1997). Estimación en muestreo basado en la elección con error de medición y análisis bootstrap. Journal of Econometrics , 77, 65-86.
  • Bhargava, A., y Sargan, JD (1983). Estimación de efectos aleatorios dinámicos a partir de datos de panel que abarcan períodos de tiempo cortos. Econometrica, 51, 6, 1635-1659.
  • Hayashi, Fumio (2000). Econometría . Princeton: Princeton University Press. ISBN 0-691-01018-8.
  • Hansen, Lars Peter (2002). "Método de los momentos". En Smelser, NJ ; Bates, PB (eds.). Enciclopedia internacional de las ciencias sociales y del comportamiento . Oxford: Pergamon.
  • Hall, Alastair R. (2005). Método generalizado de los momentos . Textos avanzados en econometría. Oxford University Press. ISBN 0-19-877520-2.
  • Faciane, Kirby Adam Jr. (2006). Estadística para finanzas empíricas y cuantitativas . Estadística para finanzas empíricas y cuantitativas. HC Baird. ISBN 0-9788208-9-4.
  • Números especiales de la Revista de Estadística Empresarial y Económica: vol. 14, n.º 3 y vol. 20, n.º 4 .
  • Breve introducción al método generalizado de los momentos