Articulo de referencia

regresión lineal simple

La ley de Okun en macroeconomía es un ejemplo de regresión lineal simple. En este caso, se supone que la variable dependiente (crecimiento del PIB) mantiene una relación lineal ...

La ley de Okun en macroeconomía es un ejemplo de regresión lineal simple. En este caso, se supone que la variable dependiente (crecimiento del PIB) mantiene una relación lineal con las variaciones de la tasa de desempleo.

En estadística , la regresión lineal simple ( RLS ) es un modelo de regresión lineal con una sola variable explicativa . [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] Es decir, se refiere a puntos de muestra bidimensionales con una variable independiente y una variable dependiente (convencionalmente, las coordenadas x e y en un sistema de coordenadas cartesianas ) y encuentra una función lineal (una línea recta no vertical ) que, con la mayor precisión posible, predice los valores de la variable dependiente en función de la variable independiente. El adjetivo simple se refiere al hecho de que la variable de resultado está relacionada con un único predictor.

Es común estipular que se utilice el método de mínimos cuadrados ordinarios (MCO): la precisión de cada valor predicho se mide por su residuo al cuadrado (distancia vertical entre el punto del conjunto de datos y la línea ajustada), y el objetivo es minimizar la suma de estas desviaciones al cuadrado. En este caso, la pendiente de la línea ajustada es igual a la correlación entre y y x corregida por la razón de las desviaciones estándar de estas variables. La intersección de la línea ajustada es tal que la línea pasa por el centro de masa ( x , y ) de los puntos de datos.

Formulación y cálculo

Consideremos la función del modeloy=α+βincógnita,{\displaystyle y=\alpha +\beta x,} que describe una línea con pendiente β e intersección con el eje y α . En general, dicha relación puede no cumplirse exactamente para la población en gran medida no observada de valores de las variables independientes y dependientes; llamamos errores a las desviaciones no observadas de la ecuación anterior . Supongamos que observamos n pares de datos y los llamamos {( x i , y i ), i = 1, ..., n }. Podemos describir la relación subyacente entre y i y x i que involucra este término de error ε i mediante

yi=α+βincógnitai+εi.{\displaystyle y_{i}=\alpha +\beta x_{i}+\varepsilon _{i}.}

Esta relación entre los parámetros subyacentes verdaderos (pero no observables) α y β y los puntos de datos se denomina modelo de regresión lineal.

El objetivo es encontrar valores estimados.α^{\displaystyle {\widehat {\alpha }}}yβ^{\displaystyle {\widehat {\beta }}}para los parámetros α y β que proporcionarían el "mejor" ajuste en cierto sentido para los puntos de datos. Como se mencionó en la introducción, en este artículo el "mejor" ajuste se entenderá como en el método de mínimos cuadrados : una línea que minimiza la suma de los residuos al cuadrado (véase también Errores y residuos ).ε^i{\displaystyle {\widehat {\varepsilon }}_{i}}(diferencias entre los valores reales y predichos de la variable dependiente y ), cada una de las cuales viene dada por, para cualquier valor de parámetro candidatoα{\displaystyle \alpha }yβ{\displaystyle \beta },

ε^i=yiαβincógnitai.{\displaystyle {\widehat {\varepsilon }}_{i}=y_{i}-\alpha -\beta x_{i}.}

En otras palabras,α^{\displaystyle {\widehat {\alpha }}}yβ^{\displaystyle {\widehat {\beta }}}Resuelva el siguiente problema de minimización :

(α^,β^)=arginina(Q(α,β)),{\displaystyle ({\hat {\alpha }},\,{\hat {\beta }})=\operatorname {argmin} \left(Q(\alpha ,\beta )\right),} donde la función objetivo Q es: Q(α,β)=i=1norteε^i2=i=1norte(yiαβincógnitai)2 .{\displaystyle Q(\alpha ,\beta )=\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}=\sum _{i=1}^{n}(y_{i}-\alpha -\beta x_{i})^{2}\ .}

Al expandir para obtener una expresión cuadrática enα{\displaystyle \alpha }yβ,{\displaystyle \beta ,}podemos derivar valores minimizadores de los argumentos de la función, denotadosα^{\displaystyle {\widehat {\alpha }}}yβ^{\displaystyle {\widehat {\beta }}}: [ 6 ]

α^=y¯β^incógnita¯,β^=i=1norte(incógnitaiincógnita¯)(yiy¯)i=1norte(incógnitaiincógnita¯)2=i=1norteΔincógnitaiΔyii=1norteΔincógnitai2{\displaystyle {\begin{aligned}{\widehat {\alpha }}&={\bar {y}}-{\widehat {\beta }}\,{\bar {x}},\\[5pt]{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)\left(y_{i}-{\bar {y}}\right)}{\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}={\frac {\sum _{i=1}^{n}\Delta x_{i}\Delta y_{i}}{\sum _{i=1}^{n}\Delta x_{i}^{2}}}\end{aligned}}}

Aquí hemos introducido

  • incógnita¯{\displaystyle {\bar {x}}}yy¯{\displaystyle {\bar {y}}}como el promedio de x i e y i , respectivamente
  • Δincógnitai{\displaystyle \Delta x_{i}}yΔyi{\displaystyle \Delta y_{i}}como las desviaciones en x i e y i con respecto a sus respectivas medias.

Fórmulas ampliadas

Las ecuaciones anteriores son eficientes para usar si la media de las variables x e y (incógnita¯ y y¯{\displaystyle {\bar {x}}{\text{ and }}{\bar {y}}}) son conocidos. Si las medias no se conocen en el momento del cálculo, puede ser más eficiente utilizar la versión ampliada de laα^ y β^{\displaystyle {\widehat {\alpha }}{\text{ and }}{\widehat {\beta }}}ecuaciones. Estas ecuaciones expandidas pueden derivarse de las ecuaciones de regresión polinómica más generales [ 7 ] [ 8 ] definiendo el polinomio de regresión como de orden 1, como sigue.

[nortei=1norteincógnitaii=1norteincógnitaii=1norteincógnitai2][α^β^]=[i=1norteyii=1norteyiincógnitai]{\displaystyle {\begin{bmatrix}n&\sum _{i=1}^{n}x_{i}\\[1ex]\sum _{i=1}^{n}x_{i}&\sum _{i=1}^{n}x_{i}^{2}\end{bmatrix}}{\begin{bmatrix}{\widehat {\alpha }}\\[1ex]{\widehat {\beta }}\end{bmatrix}}={\begin{bmatrix}\sum _{i=1}^{n}y_{i}\\[1ex]\sum _{i=1}^{n}y_{i}x_{i}\end{bmatrix}}}

El sistema de ecuaciones lineales anterior puede resolverse directamente o mediante ecuaciones independientes.α^ y β^{\displaystyle {\widehat {\alpha }}{\text{ and }}{\widehat {\beta }}}Se pueden obtener expandiendo las ecuaciones matriciales anteriores. Las ecuaciones resultantes son algebraicamente equivalentes a las mostradas en el párrafo anterior y se muestran a continuación sin demostración. [ 9 ] [ 7 ]

α^=i=1norteyii=1norteincógnitai2i=1norteincógnitaii=1norteincógnitaiyinortei=1norteincógnitai2(i=1norteincógnitai)2β^=nortei=1norteincógnitaiyii=1norteincógnitaii=1norteyinortei=1norteincógnitai2(i=1norteincógnitai)2{\displaystyle {\begin{aligned}{\widehat {\alpha }}&={\frac {\sum \limits _{i=1}^{n}y_{i}\sum \limits _{i=1}^{n}x_{i}^{2}-\sum \limits _{i=1}^{n}x_{i}\sum \limits _{i=1}^{n}x_{i}y_{i}}{n\sum \limits _{i=1}^{n}x_{i}^{2}-\left(\sum \limits _{i=1}^{n}x_{i}\right)^{2}}}\\[2ex]{\widehat {\beta }}&={\frac {n\sum \limits _{i=1}^{n}x_{i}y_{i}-\sum \limits _{i=1}^{n}x_{i}\sum \limits _{i=1}^{n}y_{i}}{n\sum \limits _{i=1}^{n}x_{i}^{2}-\left(\sum \limits _{i=1}^{n}x_{i}\right)^{2}}}\end{aligned}}}

Interpretación

Relación con la matriz de covarianza muestral

La solución puede reformularse utilizando elementos de la matriz de covarianza : β^=sincógnita,ysincógnita2=rincógnitaysysincógnita{\displaystyle {\widehat {\beta }}={\frac {s_{x,y}}{s_{x}^{2}}}=r_{xy}{\frac {s_{y}}{s_{x}}}}

dónde

Sustituyendo las expresiones anteriores porα^{\displaystyle {\widehat {\alpha }}}yβ^{\displaystyle {\widehat {\beta }}}en la solución original produce

yy¯sy=rincógnitayincógnitaincógnita¯sincógnita.{\displaystyle {\frac {y-{\bar {y}}}{s_{y}}}=r_{xy}{\frac {x-{\bar {x}}}{s_{x}}}.}

Esto demuestra que r xy es la pendiente de la línea de regresión de los puntos de datos estandarizados (y que esta línea pasa por el origen). Dado que1rincógnitay1{\displaystyle -1\leq r_{xy}\leq 1}Entonces, si x es una medición y y es una medición de seguimiento del mismo elemento, entonces esperamos que y (en promedio) esté más cerca de la medición media que del valor original de x. Este fenómeno se conoce como regresión a la media .

Generalizar elincógnita¯{\displaystyle {\bar {x}}}En notación, podemos escribir una barra horizontal sobre una expresión para indicar el valor promedio de esa expresión sobre el conjunto de muestras. Por ejemplo:

incógnitay¯=1nortei=1norteincógnitaiyi.{\displaystyle {\overline {xy}}={\frac {1}{n}}\sum _{i=1}^{n}x_{i}y_{i}.}

Esta notación nos permite una fórmula concisa para r xy :

rincógnitay=incógnitay¯incógnita¯y¯(incógnita2¯incógnita¯2)(y2¯y¯2).{\displaystyle r_{xy}={\frac {{\overline {xy}}-{\bar {x}}{\bar {y}}}{\sqrt {\left({\overline {x^{2}}}-{\bar {x}}^{2}\right)\left({\overline {y^{2}}}-{\bar {y}}^{2}\right)}}}.}

El coeficiente de determinación ("R cuadrado") es igual arincógnitay2{\displaystyle r_{xy}^{2}}cuando el modelo es lineal con una sola variable independiente. Consulte el coeficiente de correlación de la muestra para obtener más detalles.

Interpretación sobre la pendiente

Multiplicando todos los miembros de la suma en el numerador por  :incógnitaiincógnita¯incógnitaiincógnita¯=1{\displaystyle {\frac {x_{i}-{\bar {x}}}{x_{i}-{\bar {x}}}}=1}(sin modificarlo):

β^=i=1norte(incógnitaiincógnita¯)(yiy¯)i=1norte(incógnitaiincógnita¯)2=i=1norte(incógnitaiincógnita¯)2yiy¯incógnitaiincógnita¯i=1norte(incógnitaiincógnita¯)2=i=1norte(incógnitaiincógnita¯)2j=1norte(incógnitajincógnita¯)2yiy¯incógnitaiincógnita¯{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)\left(y_{i}-{\bar {y}}\right)}{\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}\\[1ex]&={\frac {\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}{\frac {y_{i}-{\bar {y}}}{x_{i}-{\bar {x}}}}}{\sum _{i=1}^{n}\left(x_{i}-{\bar {x}}\right)^{2}}}\\[1ex]&=\sum _{i=1}^{n}{\frac {\left(x_{i}-{\bar {x}}\right)^{2}}{\sum _{j=1}^{n}\left(x_{j}-{\bar {x}}\right)^{2}}}{\frac {y_{i}-{\bar {y}}}{x_{i}-{\bar {x}}}}\\[6pt]\end{aligned}}}

Podemos ver que la pendiente (tangente del ángulo) de la línea de regresión es el promedio ponderado deyiy¯incógnitaiincógnita¯{\displaystyle {\frac {y_{i}-{\bar {y}}}{x_{i}-{\bar {x}}}}}esa es la pendiente (tangente del ángulo) de la línea que conecta el i-ésimo punto con el promedio de todos los puntos, ponderado por(incógnitaiincógnita¯)2{\displaystyle (x_{i}-{\bar {x}})^{2}}porque cuanto más alejado esté el punto, más "importante" será, ya que pequeños errores en su posición afectarán más a la pendiente que lo conecta con el punto central.

Interpretación sobre la intersección

El parámetroα^{\displaystyle {\widehat {\alpha }}}es la intersección de la función linealy=α^ +β^incógnita,{\displaystyle {\begin{aligned}{y}&={\widehat {\alpha }}\ +{\widehat {\beta }}\,{x},\\[5pt]\end{aligned}}}. Por lo tanto, ely{\displaystyle {y}}-La intersección de la función encontrada con regresión lineal simple es

yinortetmirdomipagt=α^=y¯β^incógnita¯{\displaystyle y_{\rm {intercept}}={\widehat {\alpha }}={\bar {y}}-{\widehat {\beta }}\,{\bar {x}}}.

Porqueβ^{\displaystyle {\widehat {\beta }}}es la pendiente de la función lineal,β^=broncearse(θ){\displaystyle {\widehat {\beta }}=\tan(\theta )}Por lo tanto, el ánguloθ{\displaystyle \theta }la gráfica de la función hace con elincógnita{\displaystyle {x}}El eje es igual a

θ=arctan(β^){\displaystyle \theta =\arctan({\widehat {\beta }})}.

Interpretación sobre la correlación

En la formulación anterior, observe que cadaincógnitai{\displaystyle x_{i}}es un valor constante ("conocido de antemano"), mientras que elyi{\displaystyle y_{i}}son variables aleatorias que dependen de la función lineal deincógnitai{\displaystyle x_{i}}y el término aleatorioεi{\displaystyle \varepsilon _{i}}Esta suposición se utiliza al derivar el error estándar de la pendiente y al demostrar que no tiene sesgo .

En este marco, cuandoincógnitai{\displaystyle x_{i}}En realidad no es una variable aleatoria , ¿qué tipo de parámetro es la correlación empírica?rincógnitay{\displaystyle r_{xy}}¿Estimación? El problema es que para cada valor i tendremos:mi(incógnitai)=incógnitai{\displaystyle E(x_{i})=x_{i}}yVar(incógnitai)=0{\displaystyle Var(x_{i})=0}. Una posible interpretación derincógnitay{\displaystyle r_{xy}}es imaginar queincógnitai{\displaystyle x_{i}}define una variable aleatoria extraída de la distribución empírica de los valores x en nuestra muestra. Por ejemplo, si x tuviera 10 valores de los números naturales : [1,2,3...,10], entonces podemos imaginar que x es una distribución uniforme discreta . Bajo esta interpretación, todosincógnitai{\displaystyle x_{i}}tienen la misma expectativa y alguna varianza positiva. Con esta interpretación podemos pensar enrincógnitay{\displaystyle r_{xy}}como estimador de la correlación de Pearson entre la variable aleatoria y y la variable aleatoria x (tal como la acabamos de definir).

Propiedades numéricas

  1. La línea de regresión pasa por el punto del centro de masa ,(incógnita¯,y¯){\displaystyle ({\bar {x}},\,{\bar {y}})}, si el modelo incluye un término de intersección (es decir, no se fuerza a pasar por el origen).
  2. La suma de los residuos es cero si el modelo incluye un término de intersección: i=1norteε^i=0.{\displaystyle \sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}=0.}
  3. Los residuos y los valores de x no están correlacionados (independientemente de si existe o no un término de intersección en el modelo), lo que significa: i=1norteincógnitaiε^i=0{\displaystyle \sum _{i=1}^{n}x_{i}{\widehat {\varepsilon }}_{i}\;=\;0}
  4. La relación entreρincógnitay{\displaystyle \rho _{xy}}(el coeficiente de correlación para la población ) y las varianzas poblacionales dey{\displaystyle y}(σy2{\displaystyle \sigma _{y}^{2}}) y el término de error deε{\displaystyle \varepsilon }(σε2{\displaystyle \sigma _{\varepsilon }^{2}}) es: [ 10 ] : 401σε2=(1ρincógnitay2)σy2{\displaystyle \sigma _{\varepsilon }^{2}=(1-\rho _{xy}^{2})\sigma _{y}^{2}} Para valores extremos deρincógnitay{\displaystyle \rho _{xy}}Esto es evidente por sí mismo. ¿Desde cuándo?ρincógnitay=0{\displaystyle \rho _{xy}=0}entoncesσε2=σy2{\displaystyle \sigma _{\varepsilon }^{2}=\sigma _{y}^{2}}. Y cuandoρincógnitay=1{\displaystyle \rho _{xy}=1}entoncesσε2=0{\displaystyle \sigma _{\varepsilon }^{2}=0}.

Propiedades estadísticas

La descripción de las propiedades estadísticas de los estimadores obtenidos mediante regresión lineal simple requiere el uso de un modelo estadístico . Lo que sigue se basa en la suposición de que el modelo es válido y que las estimaciones son óptimas. También es posible evaluar las propiedades bajo otras suposiciones, como la inhomogeneidad , pero esto se analiza en otro apartado.

Imparcialidad

Los estimadoresα^{\displaystyle {\widehat {\alpha }}}yβ^{\displaystyle {\widehat {\beta }}}son imparciales .

Para formalizar esta afirmación debemos definir un marco en el que estos estimadores sean variables aleatorias. Consideramos los residuos ε i como variables aleatorias extraídas independientemente de alguna distribución con media cero. En otras palabras, para cada valor de x , el valor correspondiente de y se genera como una respuesta media α + βx más una variable aleatoria adicional ε llamada término de error , igual a cero en promedio. Bajo tal interpretación, los estimadores de mínimos cuadradosα^{\displaystyle {\widehat {\alpha }}}yβ^{\displaystyle {\widehat {\beta }}}Serán variables aleatorias cuyas medias serán iguales a los "valores verdaderos" α y β . Esta es la definición de un estimador insesgado.

Varianza de la respuesta media

Dado que los datos en este contexto se definen como pares ( x , y ) para cada observación, la respuesta media en un valor dado de x , digamos x d , es una estimación de la media de los valores de y en la población en el valor de x de x d , es decirmi^(yincógnitad)y^d{\displaystyle {\hat {E}}(y\mid x_{d})\equiv {\hat {y}}_{d}\!}. La varianza de la respuesta media viene dada por: [ 11 ]

Var(α^+β^incógnitad)=Var(α^)+(Varβ^)incógnitad2+2incógnitadCov(α^,β^).{\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)=\operatorname {Var} \left({\hat {\alpha }}\right)+\left(\operatorname {Var} {\hat {\beta }}\right)x_{d}^{2}+2x_{d}\operatorname {Cov} \left({\hat {\alpha }},{\hat {\beta }}\right).}

Esta expresión se puede simplificar a

Var(α^+β^incógnitad)=σ2(1metro+(incógnitadincógnita¯)2(incógnitaiincógnita¯)2),{\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)=\sigma ^{2}\left({\frac {1}{m}}+{\frac {\left(x_{d}-{\bar {x}}\right)^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right),}

donde m es el número de puntos de datos.

Para demostrar esta simplificación, se puede utilizar la identidad

i(incógnitaiincógnita¯)2=iincógnitai21metro(iincógnitai)2.{\displaystyle \sum _{i}(x_{i}-{\bar {x}})^{2}=\sum _{i}x_{i}^{2}-{\frac {1}{m}}\left(\sum _{i}x_{i}\right)^{2}.}

Varianza de la respuesta prevista

La distribución de respuesta predicha es la distribución predicha de los residuos en el punto dado x d . Por lo tanto, la varianza viene dada por

Var(yd[α^+β^incógnitad])=Var(yd)+Var(α^+β^incógnitad)2Cov(yd,[α^+β^incógnitad])=Var(yd)+Var(α^+β^incógnitad).{\displaystyle {\begin{aligned}\operatorname {Var} \left(y_{d}-\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)&=\operatorname {Var} (y_{d})+\operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)-2\operatorname {Cov} \left(y_{d},\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)\\&=\operatorname {Var} (y_{d})+\operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right).\end{aligned}}}

La segunda línea se deduce del hecho de queCov(yd,[α^+β^incógnitad]){\displaystyle \operatorname {Cov} \left(y_{d},\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)}es cero porque el nuevo punto de predicción es independiente de los datos utilizados para ajustar el modelo. Además, el términoVar(α^+β^incógnitad){\displaystyle \operatorname {Var} \left({\hat {\alpha }}+{\hat {\beta }}x_{d}\right)}Se calculó previamente para la respuesta media.

DesdeVar(yd)=σ2{\displaystyle \operatorname {Var} (y_{d})=\sigma ^{2}}(un parámetro fijo pero desconocido que puede estimarse), la varianza de la respuesta predicha viene dada por

Var(yd[α^+β^incógnitad])=σ2+σ2(1metro+(incógnitadincógnita¯)2(incógnitaiincógnita¯)2)=σ2(1+1metro+(incógnitadincógnita¯)2(incógnitaiincógnita¯)2).{\displaystyle {\begin{aligned}\operatorname {Var} \left(y_{d}-\left[{\hat {\alpha }}+{\hat {\beta }}x_{d}\right]\right)&=\sigma ^{2}+\sigma ^{2}\left({\frac {1}{m}}+{\frac {\left(x_{d}-{\bar {x}}\right)^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right)\\[4pt]&=\sigma ^{2}\left(1+{\frac {1}{m}}+{\frac {(x_{d}-{\bar {x}})^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right).\end{aligned}}}

Intervalos de confianza

Las fórmulas dadas en la sección anterior permiten calcular las estimaciones puntuales de α y β , es decir, los coeficientes de la línea de regresión para el conjunto de datos dado. Sin embargo, esas fórmulas no nos dicen cuán precisas son las estimaciones, es decir, cuánto se ajustan los estimadores.α^{\displaystyle {\widehat {\alpha }}}yβ^{\displaystyle {\widehat {\beta }}}Varían de una muestra a otra para el tamaño de muestra especificado. Se diseñaron intervalos de confianza para proporcionar un conjunto plausible de valores para las estimaciones que se podrían obtener si se repitiera el experimento un número muy grande de veces.

El método estándar para construir intervalos de confianza para los coeficientes de regresión lineal se basa en el supuesto de normalidad, que se justifica si:

  1. Los errores en la regresión se distribuyen normalmente (el llamado supuesto clásico de regresión ), o
  2. el número de observaciones n es suficientemente grande, en cuyo caso el estimador tiene una distribución aproximadamente normal.

Este último caso se justifica por el teorema del límite central .

Suposición de normalidad

Bajo el primer supuesto anterior, el de la normalidad de los términos de error, el estimador del coeficiente de pendiente tendrá una distribución normal con media β y varianzaσ2/i(incógnitaiincógnita¯)2,{\textstyle \sigma ^{2}\left/\sum _{i}(x_{i}-{\bar {x}})^{2}\right.,}donde σ 2 es la varianza de los términos de error (véase Demostraciones que involucran mínimos cuadrados ordinarios ). Al mismo tiempo, la suma de los residuos al cuadrado Q se distribuye proporcionalmente a χ 2 con n − 2 grados de libertad, e independientemente deβ^{\displaystyle {\widehat {\beta }}}Esto nos permite construir un valor t .

t=β^βsβ^  tnorte2,{\displaystyle t={\frac {{\widehat {\beta }}-\beta }{s_{\widehat {\beta }}}}\ \sim \ t_{n-2},}

dónde

sβ^=1norte2i=1norteε^i2i=1norte(incógnitaiincógnita¯)2{\displaystyle s_{\widehat {\beta }}={\sqrt {\frac {{\frac {1}{n-2}}\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}}

es el estimador de error estándar insesgado del estimadorβ^{\displaystyle {\widehat {\beta }}}.

Este valor t tiene una distribución t de Student con n − 2 grados de libertad. Usándolo podemos construir un intervalo de confianza para β :

β[β^sβ^tnorte2, β^+sβ^tnorte2],{\displaystyle \beta \in \left[{\widehat {\beta }}-s_{\widehat {\beta }}t_{n-2}^{*},\ {\widehat {\beta }}+s_{\widehat {\beta }}t_{n-2}^{*}\right],}

con un nivel de confianza (1 − γ ) , dondetnorte2{\displaystyle t_{n-2}^{*}}es el(1γ2)-th{\displaystyle \scriptstyle \left(1\;-\;{\frac {\gamma }{2}}\right){\text{-th}}}cuantil de la distribución t n −2 . Por ejemplo, si γ = 0,05 , entonces el nivel de confianza es del 95 %.

De manera similar, el intervalo de confianza para el coeficiente de intersección α viene dado por

α[α^sα^tnorte2, α^+sα^tnorte2],{\displaystyle \alpha \in \left[{\widehat {\alpha }}-s_{\widehat {\alpha }}t_{n-2}^{*},\ {\widehat {\alpha }}+s_{\widehat {\alpha }}t_{n-2}^{*}\right],}

con un nivel de confianza (1 − γ ), donde

sα^=sβ^1nortei=1norteincógnitai2=1norte(norte2)(i=1norteε^i2)i=1norteincógnitai2i=1norte(incógnitaiincógnita¯)2{\displaystyle s_{\widehat {\alpha }}=s_{\widehat {\beta }}{\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}x_{i}^{2}}}={\sqrt {{\frac {1}{n(n-2)}}\left(\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}\right){\frac {\sum _{i=1}^{n}x_{i}^{2}}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}}}}

Regresión estadounidense "cambios en el desempleo - crecimiento del PIB" con intervalos de confianza del 95%.

Los intervalos de confianza para α y β nos dan una idea general de dónde es más probable que se encuentren estos coeficientes de regresión. Por ejemplo, en la regresión de la ley de Okun que se muestra aquí, las estimaciones puntuales son:

α^=0,859,β^=1.817.{\displaystyle {\widehat {\alpha }}=0.859,\qquad {\widehat {\beta }}=-1.817.}

Los intervalos de confianza del 95% para estas estimaciones son:

α[0,76,0,96],β[2.06,1,58].{\displaystyle \alpha \in \left[\,0.76,0.96\right],\qquad \beta \in \left[-2.06,-1.58\,\right].}

Para representar gráficamente esta información, en forma de bandas de confianza alrededor de la línea de regresión, es necesario proceder con cuidado y tener en cuenta la distribución conjunta de los estimadores. Se puede demostrar [ 12 ] que en el nivel de confianza (1  γ ) la banda de confianza tiene forma hiperbólica dada por la ecuación 

(α+βξ)[α^+β^ξ±tnorte2(1norte2ε^i2)(1norte+(ξincógnita¯)2(incógnitaiincógnita¯)2)].{\displaystyle (\alpha +\beta \xi )\in \left[\,{\widehat {\alpha }}+{\widehat {\beta }}\xi \pm t_{n-2}^{*}{\sqrt {\left({\frac {1}{n-2}}\sum {\widehat {\varepsilon }}_{i}^{\,2}\right)\cdot \left({\frac {1}{n}}+{\frac {(\xi -{\bar {x}})^{2}}{\sum (x_{i}-{\bar {x}})^{2}}}\right)}}\,\right].}

Cuando el modelo asumió que la intersección es fija e igual a 0 (α=0{\displaystyle \alpha =0}), el error estándar de la pendiente se convierte en:

sβ^=1norte1i=1norteε^i2i=1norteincógnitai2{\displaystyle s_{\widehat {\beta }}={\sqrt {{\frac {1}{n-1}}{\frac {\sum _{i=1}^{n}{\widehat {\varepsilon }}_{i}^{\,2}}{\sum _{i=1}^{n}x_{i}^{2}}}}}}

Con:ε^i=yiy^i{\displaystyle {\hat {\varepsilon }}_{i}=y_{i}-{\hat {y}}_{i}}

Suposición asintótica

La segunda hipótesis alternativa establece que cuando el número de puntos en el conjunto de datos es suficientemente grande, la ley de los grandes números y el teorema del límite central se vuelven aplicables, y entonces la distribución de los estimadores es aproximadamente normal. Bajo esta hipótesis, todas las fórmulas derivadas en la sección anterior siguen siendo válidas, con la única excepción de que el cuantil t* n −2 de la distribución t de Student se reemplaza por el cuantil q* de la distribución normal estándar . Ocasionalmente , la fracción 1 / n −2 se reemplaza por 1 / n . Cuando n es grande , tal cambio no altera los resultados de manera apreciable.

Ejemplo numérico

Este conjunto de datos proporciona la masa corporal promedio de las mujeres en función de su estatura en una muestra de mujeres estadounidenses de entre 30 y 39 años. Si bien el artículo sobre mínimos cuadrados ordinarios (MCO) argumenta que sería más apropiado realizar una regresión cuadrática con estos datos, en este caso se aplica el modelo de regresión lineal simple.

En este conjunto de datos hay n = 15 puntos. Los cálculos manuales comenzarían hallando las siguientes cinco sumas:

Sincógnita=iincógnitai=24,76,Sy=iyi=931.17,Sincógnitaincógnita=iincógnitai2=41.0532,Syy=iyi2=58498.5439,Sincógnitay=iincógnitaiyi=1548.2453{\displaystyle {\begin{aligned}S_{x}&=\sum _{i}x_{i}\,=24.76,&\qquad S_{y}&=\sum _{i}y_{i}\,=931.17,\\[5pt]S_{xx}&=\sum _{i}x_{i}^{2}=41.0532,&\;\;\,S_{yy}&=\sum _{i}y_{i}^{2}=58498.5439,\\[5pt]S_{xy}&=\sum _{i}x_{i}y_{i}=1548.2453&\end{aligned}}}

Estas cantidades se utilizarían para calcular las estimaciones de los coeficientes de regresión y sus errores estándar.

β^=norteSincógnitaySincógnitaSynorteSincógnitaincógnitaSincógnita2=61.272α^=1norteSyβ^1norteSincógnita=39.062sε2=1norte(norte2)[norteSyySy2β^2(norteSincógnitaincógnitaSincógnita2)]=0,5762sβ^2=nortesε2norteSincógnitaincógnitaSincógnita2=3.1539sα^2=sβ^21norteSincógnitaincógnita=8.63185{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {nS_{xy}-S_{x}S_{y}}{nS_{xx}-S_{x}^{2}}}=61.272\\[8pt]{\widehat {\alpha }}&={\frac {1}{n}}S_{y}-{\widehat {\beta }}{\frac {1}{n}}S_{x}=-39.062\\[8pt]s_{\varepsilon }^{2}&={\frac {1}{n(n-2)}}\left[nS_{yy}-S_{y}^{2}-{\widehat {\beta }}^{2}(nS_{xx}-S_{x}^{2})\right]=0.5762\\[8pt]s_{\widehat {\beta }}^{2}&={\frac {ns_{\varepsilon }^{2}}{nS_{xx}-S_{x}^{2}}}=3.1539\\[8pt]s_{\widehat {\alpha }}^{2}&=s_{\widehat {\beta }}^{2}{\frac {1}{n}}S_{xx}=8.63185\end{aligned}}}

Gráfica de puntos y líneas de mínimos cuadrados lineales en el ejemplo numérico de regresión lineal simple.

El cuantil 0,975 de la distribución t de Student con 13 grados de libertad es t * 13 = 2,1604 , y por lo tanto los intervalos de confianza del 95% para α y β son

α[α^t13sα^]=[45.4, 32.7]β[β^t13sβ^]=[57.4, 65.1]{\displaystyle {\begin{aligned}&\alpha \in [\,{\widehat {\alpha }}\mp t_{13}^{*}s_{\widehat {\alpha }}\,]=[\,{-45.4},\ {-32.7}\,]\\[5pt]&\beta \in [\,{\widehat {\beta }}\mp t_{13}^{*}s_{\widehat {\beta }}\,]=[\,57.4,\ 65.1\,]\end{aligned}}}

También se puede calcular el coeficiente de correlación producto-momento :

r^=norteSincógnitaySincógnitaSy(norteSincógnitaincógnitaSincógnita2)(norteSyySy2)=0,9946{\displaystyle {\widehat {r}}={\frac {nS_{xy}-S_{x}S_{y}}{\sqrt {(nS_{xx}-S_{x}^{2})(nS_{yy}-S_{y}^{2})}}}=0.9946}

Alternativas

Cálculo de los parámetros de un modelo lineal minimizando el error cuadrático.

En la regresión lineal simple (RLS), existe un supuesto subyacente de que solo la variable dependiente contiene error de medición; si la variable explicativa también se mide con error, entonces la regresión simple no es apropiada para estimar la relación subyacente porque estará sesgada debido a la dilución de la regresión .

Otros métodos de estimación que pueden utilizarse en lugar de los mínimos cuadrados ordinarios incluyen las mínimas desviaciones absolutas (que minimizan la suma de los valores absolutos de los residuos) y el estimador de Theil-Sen (que elige una línea cuya pendiente es la mediana de las pendientes determinadas por pares de puntos de la muestra).

La regresión de Deming (mínimos cuadrados totales) también encuentra una línea que se ajusta a un conjunto de puntos de muestra bidimensionales, pero (a diferencia de los mínimos cuadrados ordinarios, las desviaciones absolutas mínimas y la regresión de pendiente mediana) no es realmente un caso de regresión lineal simple, porque no separa las coordenadas en una variable dependiente y una independiente y podría potencialmente devolver una línea vertical como ajuste. Esto puede conducir a un modelo que intenta ajustarse más a los valores atípicos que a los datos.

Ajuste de línea

El ajuste de línea es el proceso de construir una línea recta que se ajuste de la mejor manera a una serie de puntos de datos.

Existen varios métodos, teniendo en cuenta:

Regresión lineal simple sin término de intersección (regresor único)

A veces es apropiado forzar que la línea de regresión pase por el origen, porque se supone que x e y son proporcionales. Para el modelo sin el término de intersección, y = βx , el estimador MCO para β se simplifica a

β^=i=1norteincógnitaiyii=1norteincógnitai2=incógnitay¯incógnita2¯{\displaystyle {\widehat {\beta }}={\frac {\sum _{i=1}^{n}x_{i}y_{i}}{\sum _{i=1}^{n}x_{i}^{2}}}={\frac {\overline {xy}}{\overline {x^{2}}}}}

Sustituyendo ( xh , yk ) en lugar de ( x , y ) se obtiene la regresión a través de ( h , k ) :

β^=i=1norte(incógnitaih)(yik)i=1norte(incógnitaih)2=(incógnitah)(yk)¯(incógnitah)2¯=incógnitay¯kincógnita¯hy¯+hkincógnita2¯2hincógnita¯+h2=incógnitay¯incógnita¯y¯+(incógnita¯h)(y¯k)incógnita2¯incógnita¯2+(incógnita¯h)2=Cov(incógnita,y)+(incógnita¯h)(y¯k)Var(incógnita)+(incógnita¯h)2,{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-h)(y_{i}-k)}{\sum _{i=1}^{n}(x_{i}-h)^{2}}}={\frac {\overline {(x-h)(y-k)}}{\overline {(x-h)^{2}}}}\\[6pt]&={\frac {{\overline {xy}}-k{\bar {x}}-h{\bar {y}}+hk}{{\overline {x^{2}}}-2h{\bar {x}}+h^{2}}}\\[6pt]&={\frac {{\overline {xy}}-{\bar {x}}{\bar {y}}+({\bar {x}}-h)({\bar {y}}-k)}{{\overline {x^{2}}}-{\bar {x}}^{2}+({\bar {x}}-h)^{2}}}\\[6pt]&={\frac {\operatorname {Cov} (x,y)+({\bar {x}}-h)({\bar {y}}-k)}{\operatorname {Var} (x)+({\bar {x}}-h)^{2}}},\end{aligned}}}

donde Cov y Var se refieren a la covarianza y la varianza de los datos de la muestra (sin corregir el sesgo). La última forma mostrada anteriormente ilustra cómo el desplazamiento de la línea desde el centro de masa de los puntos de datos afecta la pendiente.

Véase también

Referencias

  1. Seltman, Howard J. (2008-09-08). Diseño y análisis experimental (PDF) . pág.  227.
  2. "Muestreo estadístico y regresión: regresión lineal simple" . Universidad de Columbia . Consultado el 17 de octubre de 2016. Cuando se utiliza una variable independiente en una regresión, se denomina regresión simple; (...)
  3. Lane, David M. Introducción a la estadística (PDF) . pág. 462. 
  4. Zou KH; Tuncali K; Silverman SG (2003). "Correlación y regresión lineal simple" . Radiology . 227 ( 3): 617– 22. doi : 10.1148/radiol.2273011499 . ISSN 0033-8419 . OCLC 110941167. PMID 12773666 .   
  5. Altman, Naomi; Krzywinski, Martin (2015). " Regresión lineal simple" . Nature Methods . 12 (11): 999– 1000. doi : 10.1038/nmeth.3627 . ISSN 1548-7091 . OCLC 5912005539. PMID 26824102. S2CID 261269711 .    
  6. Kenney, JF y Keeping, ES (1962) "Regresión lineal y correlación". Cap. 15 en Matemáticas de la estadística , Pt. 1, 3.ª ed. Princeton, NJ: Van Nostrand, pp. 252–285
  7. 1 2 Muthukrishnan, Gowri (17 de junio de 2018). "Matemáticas detrás de la regresión polinomial, Muthukrishnan" . Matemáticas detrás de la regresión polinomial . Recuperado el 30 de enero de 2024 .
  8. "Matemáticas de la regresión polinomial" . Regresión polinomial, una clase de regresión de PHP .
  9. "Cálculo, Matemáticas y Estadística - Kit de Habilidades Académicas, Universidad de Newcastle" . Regresión lineal simple . Consultado el 30 de enero de 2024 .
  10. Valliant, Richard, Jill A. Dever y Frauke Kreuter. Herramientas prácticas para el diseño y la ponderación de muestras de encuestas. Nueva York: Springer, 2013.
  11. Draper, NR; Smith, H. (1998). Análisis de regresión aplicada (3.ª ed.). John Wiley. ISBN  0-471-17082-8.
  12. Casella, G. y Berger, RL (2002), "Inferencia estadística" (2.ª edición), Cengage, ISBN 978-0-534-24312-8, págs. 558–559.
  • Explicación de Wolfram MathWorld sobre el ajuste por mínimos cuadrados y cómo calcularlo.
  • Matemáticas de la regresión simple (Robert Nau, Universidad de Duke)