Articulo de referencia

Correlograma

Un gráfico que muestra 100 números aleatorios con una función seno "oculta" y una autocorrelación (correlograma) de la serie en la parte inferior. En el análisis de datos, un co...

Un gráfico que muestra 100 números aleatorios con una función seno "oculta" y una autocorrelación (correlograma) de la serie en la parte inferior.

En el análisis de datos, un correlograma es un gráfico de estadísticas de correlación . Por ejemplo, en el análisis de series temporales , un gráfico de las autocorrelaciones de la muestra frente a (los desfases temporales) es un autocorrelograma . Si se grafica la correlación cruzada , el resultado se denomina correlograma cruzado . a yo {\displaystyle r_{h}\,} yo {\estilo de visualización h\,}

El correlograma es una herramienta de uso común para comprobar la aleatoriedad de un conjunto de datos . Si es aleatorio, las autocorrelaciones deben ser cercanas a cero para todas y cada una de las separaciones de desfase temporal. Si no es aleatorio, entonces una o más de las autocorrelaciones serán significativamente distintas de cero.

Además, los correlogramas se utilizan en la etapa de identificación de modelos para los modelos de series temporales de promedio móvil autorregresivos de Box-Jenkins . Las autocorrelaciones deben ser cercanas a cero para la aleatoriedad; si el analista no comprueba la aleatoriedad, la validez de muchas de las conclusiones estadísticas se vuelve sospechosa. El correlograma es una excelente manera de comprobar dicha aleatoriedad.

En el análisis multivariado , las matrices de correlación mostradas como imágenes mapeadas en color también pueden denominarse "correlogramas" o "corrgramas". [1] [2] [3]

Aplicaciones

El correlograma puede ayudar a proporcionar respuestas a las siguientes preguntas: [4]

  • ¿Los datos son aleatorios?
  • ¿Una observación está relacionada con una observación adyacente?
  • ¿Una observación está relacionada con una observación eliminada dos veces? (etc.)
  • ¿La serie temporal observada es ruido blanco ?
  • ¿La serie temporal observada es sinusoidal?
  • ¿La serie temporal observada es autorregresiva?
  • ¿Cuál es un modelo apropiado para la serie temporal observada?
  • ¿Es el modelo?
Y = constante + error {\displaystyle Y={\text{constante}}+{\text{error}}}
¿Valido y suficiente?
  • ¿Es válida la fórmula ? s Y ¯ = s / norte {\displaystyle s_{\bar {Y}}=s/{\sqrt {N}}}

Importancia

La aleatoriedad (junto con el modelo fijo, la variación fija y la distribución fija) es uno de los cuatro supuestos que suelen fundamentar todos los procesos de medición. El supuesto de aleatoriedad es de vital importancia por las tres razones siguientes:

  • La mayoría de las pruebas estadísticas estándar dependen de la aleatoriedad. La validez de las conclusiones de la prueba está directamente relacionada con la validez del supuesto de aleatoriedad.
  • Muchas fórmulas estadísticas de uso común dependen del supuesto de aleatoriedad, siendo la fórmula más común la fórmula para determinar el error estándar de la media de la muestra:
s Y ¯ = s / norte {\displaystyle s_{\bar {Y}}=s/{\sqrt {N}}}

donde s es la desviación estándar de los datos. Aunque se utiliza mucho, los resultados obtenidos con esta fórmula no tienen valor a menos que se cumpla el supuesto de aleatoriedad.

  • Para datos univariados, el modelo predeterminado es
Y = constante + error {\displaystyle Y={\text{constante}}+{\text{error}}}

Si los datos no son aleatorios, este modelo es incorrecto e inválido, y las estimaciones de los parámetros (como la constante) se vuelven absurdas e inválidas.

Estimación de autocorrelaciones

El coeficiente de autocorrelación en el retardo h viene dado por

a yo = do yo / do 0 {\displaystyle r_{h}=c_{h}/c_{0}\,}

donde c h es la función de autocovarianza

do yo = 1 norte a = 1 norte yo ( Y a Y ¯ ) ( Y a + yo Y ¯ ) {\displaystyle c_{h}={\frac {1}{N}}\sum _{t=1}^{Nh}\left(Y_{t}-{\bar {Y}}\right)\left(Y_{t+h}-{\bar {Y}}\right)}

y c 0 es la función de varianza

do 0 = 1 norte a = 1 norte ( Y a Y ¯ ) 2 {\displaystyle c_{0}={\frac {1}{N}}\sum _{t=1}^{N}\left(Y_{t}-{\bar {Y}}\right)^{2}}

El valor resultante de r h oscilará entre −1 y +1.

Estimación alternativa

Algunas fuentes pueden utilizar la siguiente fórmula para la función de autocovarianza:

do yo = 1 norte yo a = 1 norte yo ( Y a Y ¯ ) ( Y a + yo Y ¯ ) {\displaystyle c_{h}={\frac {1}{N-h}}\sum _{t=1}^{N-h}\left(Y_{t}-{\bar {Y}}\right)\left(Y_{t+h}-{\bar {Y}}\right)}

Aunque esta definición tiene menos sesgo , la formulación (1/ N ) tiene algunas propiedades estadísticas deseables y es la forma más comúnmente utilizada en la literatura estadística. Consulte las páginas 20 y 49-50 en Chatfield para obtener más detalles.

A diferencia de la definición anterior, esta definición nos permite realizar los cálculos de una manera ligeramente más intuitiva. Consideremos la muestra , donde para . Entonces, sea c h {\displaystyle c_{h}} Y 1 , , Y N {\displaystyle Y_{1},\dots ,Y_{N}} Y i R n {\displaystyle Y_{i}\in \mathbb {R} ^{n}} i = 1 , , N {\displaystyle i=1,\dots ,N}

X = [ Y 1 Y ¯ Y N Y ¯ ] R n × N {\displaystyle X={\begin{bmatrix}Y_{1}-{\bar {Y}}&\cdots &Y_{N}-{\bar {Y}}\end{bmatrix}}\in \mathbb {R} ^{n\times N}}

Luego calculamos la matriz de Gram . Finalmente, se calcula como la media muestral de la diagonal n.° de . Por ejemplo, la diagonal n.° (la diagonal principal) de tiene elementos, y su media muestral corresponde a . La diagonal n.° (a la derecha de la diagonal principal) de tiene elementos, y su media muestral corresponde a , y así sucesivamente. Q = X X {\displaystyle Q=X^{\top }X} c h {\displaystyle c_{h}} h {\displaystyle h} Q {\displaystyle Q} 0 {\displaystyle 0} Q {\displaystyle Q} N {\displaystyle N} c 0 {\displaystyle c_{0}} 1 {\displaystyle 1} Q {\displaystyle Q} N 1 {\displaystyle N-1} c 1 {\displaystyle c_{1}}

Inferencia estadística con correlogramas

Ejemplo de correlograma de una muestra de 400 puntos de un proceso autorregresivo de primer orden con una correlación de 0,75 entre puntos adyacentes, junto con los intervalos de confianza del 95 % (representados gráficamente en torno a las estimaciones de correlación en negro y en torno a cero en rojo), calculados mediante las ecuaciones de esta sección. La línea azul discontinua muestra la función de autocorrelación real del proceso muestreado.
20 correlogramas de muestras de 400 puntos del mismo proceso aleatorio que en la figura anterior.

En el mismo gráfico se pueden trazar límites superior e inferior para la autocorrelación con nivel de significancia : α {\displaystyle \alpha \,}

B = ± z 1 α / 2 S E ( r h ) {\displaystyle B=\pm z_{1-\alpha /2}SE(r_{h})\,} con como la autocorrelación estimada en el rezago . r h {\displaystyle r_{h}\,} h {\displaystyle h\,}

Si la autocorrelación es mayor (menor) que este límite superior (inferior), la hipótesis nula de que no hay autocorrelación en un desfase determinado y más allá de él se rechaza con un nivel de significancia de . Esta prueba es aproximada y supone que la serie temporal es gaussiana . α {\displaystyle \alpha \,}

En lo anterior, z 1− α /2 es el cuantil de la distribución normal ; SE es el error estándar, que se puede calcular mediante la fórmula de Bartlett para procesos MA( ℓ ):

S E ( r 1 ) = 1 N {\displaystyle SE(r_{1})={\frac {1}{\sqrt {N}}}}
S E ( r h ) = 1 + 2 i = 1 h 1 r i 2 N {\displaystyle SE(r_{h})={\sqrt {\frac {1+2\sum _{i=1}^{h-1}r_{i}^{2}}{N}}}} para h > 1. {\displaystyle h>1.\,}

En el ejemplo representado, podemos rechazar la hipótesis nula de que no existe autocorrelación entre puntos de tiempo separados por desfases de hasta 4. Para la mayoría de los períodos más largos, no se puede rechazar la hipótesis nula de que no existe autocorrelación.

Tenga en cuenta que existen dos fórmulas distintas para generar las bandas de confianza:

1. Si el correlograma se utiliza para comprobar la aleatoriedad (es decir, no existe dependencia temporal en los datos), se recomienda la siguiente fórmula:

± z 1 α / 2 N {\displaystyle \pm {\frac {z_{1-\alpha /2}}{\sqrt {N}}}}

donde N es el tamaño de la muestra , z es la función cuantil de la distribución normal estándar y α es el nivel de significancia . En este caso, las bandas de confianza tienen un ancho fijo que depende del tamaño de la muestra.

2. Los correlogramas también se utilizan en la etapa de identificación de modelos para ajustar los modelos ARIMA . En este caso, se supone un modelo de promedio móvil para los datos y se deben generar las siguientes bandas de confianza:

± z 1 α / 2 1 N ( 1 + 2 i = 1 k r i 2 ) {\displaystyle \pm z_{1-\alpha /2}{\sqrt {{\frac {1}{N}}\left(1+2\sum _{i=1}^{k}r_{i}^{2}\right)}}}

donde k es el rezago. En este caso, las bandas de confianza aumentan a medida que aumenta el rezago.

Software

Los correlogramas están disponibles en la mayoría de las bibliotecas estadísticas de propósito general.

Correlogramas:

Corrgramas:

Referencias

  1. ^ Friendly, Michael (19 de agosto de 2002). "Corrgramas: visualizaciones exploratorias para matrices de correlación" (PDF) . The American Statistician . 56 (4). Taylor & Francis : 316–324. doi :10.1198/000313002533 . Consultado el 19 de enero de 2014 .
  2. ^ ab "CRAN – Paquete corrgram". cran.r-project.org . 29 de agosto de 2013 . Consultado el 19 de enero de 2014 .
  3. ^ ab "Quick-R: Correlogramas". statmethods.net . Consultado el 19 de enero de 2014 .
  4. ^ "1.3.3.1. Diagrama de autocorrelación". www.itl.nist.gov . Consultado el 20 de agosto de 2018 .
  5. ^ "Visualización § Gráfico de autocorrelación".

Lectura adicional

  • Hanke, John E.; Reitsch, Arthur G.; Wichern, Dean W. Previsión empresarial (7.ª ed.). Upper Saddle River, Nueva Jersey: Prentice Hall.
  • Box, GEP; Jenkins, G. (1976). Análisis de series de tiempo: pronóstico y control . Holden-Day.
  • Chatfield, C. (1989). El análisis de series temporales: una introducción (cuarta edición). Nueva York, NY: Chapman & Hall.
  • Diagrama de autocorrelación

Dominio público Este artículo incorpora material de dominio público del Instituto Nacional de Estándares y Tecnología.

Retrieved from "https://en.wikipedia.org/w/index.php?title=Correlogram&oldid=1147526797"