Articulo de referencia

Estimación de tendencia lineal

La estimación de tendencias lineales es una técnica estadística que se utiliza para analizar patrones de datos . Estos patrones, o tendencias, se producen cuando la información ...

La estimación de tendencias lineales es una técnica estadística que se utiliza para analizar patrones de datos . Estos patrones, o tendencias, se producen cuando la información recopilada tiende a aumentar o disminuir con el tiempo, o cuando se ve influenciada por cambios en un factor externo. La estimación de tendencias lineales crea, esencialmente, una línea recta en un gráfico de datos que representa la dirección general que siguen los datos .

Adaptarse a una tendencia: Mínimos cuadrados

Dado un conjunto de datos , existen diversas funciones que pueden elegirse para ajustarlos. La función más sencilla es una línea recta con la variable dependiente (normalmente los datos medidos) en el eje vertical y la variable independiente (a menudo el tiempo) en el eje horizontal.

El ajuste por mínimos cuadrados es un método común para ajustar una línea recta a través de los datos. Este método minimiza la suma de los errores al cuadrado en la serie de datos.y{\displaystyle y}Dado un conjunto de puntos en el tiempot{\displaystyle t}y valores de datosyt{\displaystyle y_{t}}observados para esos momentos, valores dea^{\displaystyle {\hat {a}}}yb^{\displaystyle {\hat {b}}}se eligen para minimizar la suma de los errores cuadráticos

t[yt(a^t+b^)]2{\displaystyle \sum _{t}\left[y_{t}-\left({\hat {a}}t+{\hat {b}}\right)\right]^{2}}.

Esta fórmula primero calcula la diferencia entre los datos observados.yt{\displaystyle y_{t}}y la estimación(a^t+b^){\displaystyle ({\hat {a}}t+{\hat {b}})}, la diferencia en cada punto de datos se eleva al cuadrado y luego se suman, dando como resultado la medida de error de "suma de cuadrados". Los valores dea^{\displaystyle {\hat {a}}}yb^{\displaystyle {\hat {b}}}derivado de los datos parametrizar el estimador lineal simpley^=a^incógnita+b^{\displaystyle {\hat {y}}={\hat {a}}x+{\hat {b}}}El término "tendencia" se refiere a la pendiente.a^{\displaystyle {\hat {a}}}en el estimador de mínimos cuadrados.

Los datos como tendencia y ruido

Para analizar una serie (temporal) de datos, se puede suponer que puede representarse como una tendencia más ruido:

yt=at+b+mit{\displaystyle y_{t}=at+b+e_{t}\,}

dóndea{\displaystyle a}yb{\displaystyle b}son constantes desconocidas y lami{\displaystyle e}Los errores se distribuyen aleatoriamente . Si se puede rechazar la hipótesis nula de que los errores no son estacionarios , entonces la serie no estacionaria{yt}{\displaystyle \{y_{t}\}}Se denomina estacionario de tendencia . El método de mínimos cuadrados supone que los errores se distribuyen independientemente con una distribución normal. Si este no es el caso, se realizan pruebas de hipótesis sobre los parámetros desconocidos.a{\displaystyle a}yb{\displaystyle b}puede ser inexacto. Es más sencillo si elmi{\displaystyle e}Todos los datos tienen la misma distribución, pero si no es así (si algunos tienen una varianza mayor , lo que significa que esos puntos de datos son efectivamente menos seguros), entonces esto se puede tener en cuenta durante el ajuste de mínimos cuadrados ponderando cada punto por el inverso de la varianza de ese punto.

Comúnmente, cuando solo existe una única serie temporal para analizar, la varianza de lami{\displaystyle e}'s se estima ajustando una tendencia para obtener los valores estimados de los parámetros.a^{\displaystyle {\hat {a}}}yb^,{\displaystyle {\hat {b}},}permitiendo así los valores predichos

y^=a^t+b^{\displaystyle {\hat {y}}={\hat {a}}t+{\hat {b}}}

que se restará de los datosyt{\displaystyle y_{t}}( eliminando así la tendencia de los datos), dejando los residuosmi^t{\displaystyle {\hat {e}}_{t}}como los datos sin tendencia , y estimando la varianza de lamit{\displaystyle e_{t}}a partir de los residuos: esta suele ser la única forma de estimar la varianza de lamit{\displaystyle e_{t}}'s.

Una vez que se conoce el "ruido" de la serie, se puede evaluar la significancia de la tendencia haciendo la hipótesis nula de que la tendencia,a{\displaystyle a}, no es diferente de 0. De la discusión anterior sobre tendencias en datos aleatorios con varianza conocida , se espera que la distribución de las tendencias calculadas provenga de datos aleatorios (sin tendencia). Si la tendencia estimada,a^{\displaystyle {\hat {a}}}, es mayor que el valor crítico para un cierto nivel de significancia , entonces la tendencia estimada se considera significativamente diferente de cero en ese nivel de significancia, y se rechaza la hipótesis nula de una tendencia subyacente cero.

El uso de una línea de tendencia lineal ha sido objeto de críticas, lo que ha impulsado la búsqueda de enfoques alternativos para evitar su uso en la estimación de modelos. Uno de estos enfoques alternativos consiste en pruebas de raíz unitaria y la técnica de cointegración en estudios econométricos.

El coeficiente estimado asociado a una variable de tendencia lineal, como el tiempo, se interpreta como una medida del impacto de diversos factores desconocidos o conocidos pero inconmensurables sobre la variable dependiente durante una unidad de tiempo. Estrictamente hablando, esta interpretación solo es aplicable al período de estimación. Fuera de este período, no es posible determinar cómo se comportan estos factores inconmensurables, ni cualitativa ni cuantitativamente.

Los resultados de las investigaciones de matemáticos, estadísticos, econometristas y economistas se han publicado en respuesta a esas preguntas. Por ejemplo, en Cameron (2005) se ofrecen notas detalladas sobre el significado de las tendencias temporales lineales en el modelo de regresión; [ 1 ] Granger, Engle y muchos otros econometristas han escrito sobre estacionariedad, pruebas de raíz unitaria, cointegración y cuestiones relacionadas (un resumen de algunos de los trabajos en esta área se puede encontrar en un documento informativo [ 2 ] de la Real Academia Sueca de Ciencias (2003)); y Ho-Trieu y Tucker (1990) han escrito sobre tendencias temporales logarítmicas con resultados que indican que las tendencias temporales lineales son casos especiales de ciclos .

Series temporales ruidosas

Es más difícil observar una tendencia en una serie temporal ruidosa. Por ejemplo, si la serie real es 0, 1, 2, 3, más un "ruido" independiente con distribución normal e y desviación estándar E , y se proporciona una serie de muestra de longitud 50, entonces si E = 0,1, la tendencia será evidente; si E = 100, probablemente será visible; pero si E = 10000, la tendencia quedará oculta entre el ruido.       

Consideremos un ejemplo concreto, como el registro global de temperatura superficial de los últimos 140 años presentado por el IPCC . [ 3 ] La variación interanual es de aproximadamente 0,2  °C, y la tendencia es de aproximadamente 0,6  °C a lo largo de 140 años, con límites de confianza del 95 % de 0,2  °C (casualmente, aproximadamente el mismo valor que la variación interanual). Por lo tanto, la tendencia es estadísticamente diferente de 0. Sin embargo, como se señala en otro lugar, [ 4 ] esta serie temporal no cumple con los supuestos necesarios para que los mínimos cuadrados sean válidos.

Bondad de ajuste ( r cuadrado) y tendencia

Ilustración del efecto del filtrado en . Negro  =  datos sin filtrar; rojo  =  datos promediados cada 10 puntos; azul  =  datos promediados cada 100 puntos. Todos presentan la misma tendencia, pero un mayor filtrado conlleva un mayor valor de en la línea de tendencia ajustada.

El proceso de ajuste por mínimos cuadrados produce un valor, , que es igual a 1 menos la razón entre la varianza de los residuos y la varianza de la variable dependiente. Indica qué fracción de la varianza de los datos es explicada por la línea de tendencia ajustada. No guarda relación con la significación estadística de la línea de tendencia (véase el gráfico); la significación estadística de la tendencia se determina mediante su estadístico t . A menudo, filtrar una serie aumenta sin afectar significativamente la tendencia ajustada.

Modelos avanzados

Hasta ahora, se ha asumido que los datos consisten en la tendencia más ruido, siendo el ruido en cada punto de datos variables aleatorias independientes e idénticamente distribuidas con una distribución normal. Los datos reales (por ejemplo, datos climáticos) pueden no cumplir estos criterios. Esto es importante, ya que influye enormemente en la facilidad con la que se pueden analizar las estadísticas para extraer la máxima información de la serie de datos. Si existen otros efectos no lineales que tienen correlación con la variable independiente (como influencias cíclicas), el uso de la estimación de mínimos cuadrados de la tendencia no es válido. Además, cuando las variaciones son significativamente mayores que la tendencia lineal resultante, la elección de los puntos de inicio y fin puede cambiar significativamente el resultado. Es decir, el modelo está matemáticamente mal especificado . Las inferencias estadísticas (pruebas para la presencia de una tendencia, intervalos de confianza para la tendencia, etc.) no son válidas a menos que se tengan en cuenta adecuadamente las desviaciones de los supuestos estándar, por ejemplo, como se muestra a continuación:

En R , la tendencia lineal de los datos se puede estimar utilizando la función 'tslm' del paquete 'forecast'.

Los estudios médicos y biomédicos a menudo buscan determinar un vínculo entre conjuntos de datos, como una métrica clínica o científica en tres enfermedades diferentes. Pero los datos también pueden estar vinculados en el tiempo (como el cambio en el efecto de un medicamento desde el inicio, al mes 1, al mes 2), o por un factor externo que puede o no ser determinado por el investigador y/o su sujeto (como ausencia de dolor, dolor leve, dolor moderado o dolor intenso). En estos casos, se esperaría que el estadístico de prueba del efecto (por ejemplo, la influencia de una estatina en los niveles de colesterol , un analgésico en el grado de dolor, o dosis crecientes de diferentes potencias de un medicamento en un índice medible, es decir, un efecto dosis-respuesta) cambie en orden directo a medida que se desarrolla el efecto. Supongamos que el nivel medio de colesterol antes y después de la prescripción de una estatina disminuye de 5,6 mmol/L en el inicio a 3,4 mmol/L al mes y a 3,7 mmol/L a los dos meses. Con suficiente potencia estadística, un ANOVA (análisis de varianza) probablemente encontraría una disminución significativa al mes y a los dos meses, pero esta disminución no es lineal. Además, podría ser necesario realizar una prueba post-hoc. Una prueba alternativa podría ser un ANOVA de medidas repetidas (bidireccional) o la prueba de Friedman , según la naturaleza de los datos. Sin embargo, dado que los grupos están ordenados, un ANOVA estándar resulta inapropiado. Si el colesterol disminuye de 5,4 a 4,1 a 3,7, existe una clara tendencia lineal. El mismo principio puede aplicarse a los efectos de la frecuencia alélica/genotípica , donde podría argumentarse que un polimorfismo de un solo nucleótido en los nucleótidos XX, XY, YY es, de hecho, una tendencia de ausencia de Y, presencia de una Y y, posteriormente, presencia de dos Y. [ 3 ]

La matemática de la estimación de la tendencia lineal es una variante del ANOVA estándar, que proporciona información diferente, y sería la prueba más apropiada si los investigadores plantean la hipótesis de un efecto de tendencia en su estadístico de prueba. Un ejemplo son los niveles de tripsina sérica en seis grupos de sujetos ordenados por década de edad (10-19 años hasta 60-69 años). Los niveles de tripsina (ng/mL) aumentan en una tendencia lineal directa de 128, 152, 194, 207, 215, 218 (datos de Altman). Como era de esperar, un ANOVA "estándar" da p  <  0,0001, mientras que la estimación de la tendencia lineal da p  =  0,00006. Cabe mencionar que se podría argumentar razonablemente que, dado que la edad es un índice continuo natural, no debería categorizarse en décadas, y se busca un efecto de la edad y la tripsina sérica mediante correlación (suponiendo que se disponga de los datos brutos). Otro ejemplo es el de una sustancia medida en cuatro momentos diferentes en distintos grupos:

Esta es una tendencia clara. El ANOVA arroja un valor p  =  0,091, ya que la varianza total supera la media, mientras que la estimación de la tendencia lineal da un valor p  =  0,012. Sin embargo, si los datos se hubieran recopilado en cuatro momentos diferentes en los mismos individuos, la estimación de la tendencia lineal sería inapropiada y se habría aplicado un ANOVA bidireccional (de medidas repetidas).

Véase también

Notas

  1. "Cómo hacer que la regresión sea más útil II: variables ficticias y tendencias" (PDF) . Consultado el 17 de junio de 2012 .
  2. "La Real Academia Sueca de Ciencias" (PDF) . 8 de octubre de 2003. Consultado el 17 de junio de 2012 .
  3. 1 2 "Tercer Informe de Evaluación del IPCC – Cambio Climático 2001 – Versiones completas en línea" . Archivado del original el 20 de noviembre de 2009. Recuperado el 17 de junio de 2012 .
  4. 1 2 Pronóstico: principios y práctica . 20 de septiembre de 2014. Recuperado el 17 de mayo de 2015 .

Referencias

  • Bianchi, M.; Boyle, M.; Hollingsworth, D. (1999). "Una comparación de métodos para la estimación de tendencias". Applied Economics Letters . 6 (2): 103– 109. doi : 10.1080/135048599353726 .
  • Cameron, S. (2005). «Cómo hacer más útil el análisis de regresión, II». Econometría . Maidenhead: McGraw Hill Higher Education. pp. 171–198 . ISBN  0-07-710428-5.
  • Chatfield, C. (1993). "Cálculo de pronósticos por intervalos". Journal of Business and Economic Statistics . 11 (2): 121– 135. doi : 10.1080/07350015.1993.10509938 .
  • Ho-Trieu, NL; Tucker, J. (1990). "Otra nota sobre el uso de una tendencia temporal logarítmica". Review of Marketing and Agricultural Economics . 58 (1): 89– 90. doi : 10.22004/ag.econ.12288 .
  • Kungl. Vetenskapsakademien (2003). "Econometría de series temporales: cointegración y heterocedasticidad condicional autorregresiva". Información avanzada sobre el Premio del Banco de Suecia en Ciencias Económicas en memoria de Alfred Nobel . Real Academia Sueca de Ciencias.
  • Arianos, S.; Carbone, A.; Turk, C. (2011). "Autosimilitud de medias móviles de alto orden" . Physical Review E. 84 ( 4) 046113. Bibcode : 2011PhRvE..84d6113A . doi : 10.1103/physreve.84.046113 . PMID 22181233 . 
  • Altman, DG (1991). Estadística práctica para la investigación médica . Londres: Chapman and Hall. págs. 212–220 . ISBN  0-412-27630-5.