
En estadística , la regresión lineal simple ( RLS ) es un modelo de regresión lineal con una sola variable explicativa . [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] Es decir, se refiere a puntos de muestra bidimensionales con una variable independiente y una variable dependiente (convencionalmente, las coordenadas x e y en un sistema de coordenadas cartesianas ) y encuentra una función lineal (una línea recta no vertical ) que, con la mayor precisión posible, predice los valores de la variable dependiente en función de la variable independiente. El adjetivo simple se refiere al hecho de que la variable de resultado está relacionada con un único predictor.
Es común estipular que se utilice el método de mínimos cuadrados ordinarios (MCO): la precisión de cada valor predicho se mide por su residuo al cuadrado (distancia vertical entre el punto del conjunto de datos y la línea ajustada), y el objetivo es minimizar la suma de estas desviaciones al cuadrado. En este caso, la pendiente de la línea ajustada es igual a la correlación entre y y x corregida por la razón de las desviaciones estándar de estas variables. La intersección de la línea ajustada es tal que la línea pasa por el centro de masa ( x , y ) de los puntos de datos.
Formulación y cálculo
Consideremos la función del modelo que describe una línea con pendiente β e intersección con el eje y α . En general, dicha relación puede no cumplirse exactamente para la población en gran medida no observada de valores de las variables independientes y dependientes; llamamos errores a las desviaciones no observadas de la ecuación anterior . Supongamos que observamos n pares de datos y los llamamos {( x i , y i ), i = 1, ..., n }. Podemos describir la relación subyacente entre y i y x i que involucra este término de error ε i mediante
Esta relación entre los parámetros subyacentes verdaderos (pero no observables) α y β y los puntos de datos se denomina modelo de regresión lineal.
El objetivo es encontrar valores estimados.ypara los parámetros α y β que proporcionarían el "mejor" ajuste en cierto sentido para los puntos de datos. Como se mencionó en la introducción, en este artículo el "mejor" ajuste se entenderá como en el método de mínimos cuadrados : una línea que minimiza la suma de los residuos al cuadrado (véase también Errores y residuos ).(diferencias entre los valores reales y predichos de la variable dependiente y ), cada una de las cuales viene dada por, para cualquier valor de parámetro candidatoy,
En otras palabras,yResuelva el siguiente problema de minimización :
donde la función objetivo Q es:
Al expandir para obtener una expresión cuadrática enypodemos derivar valores minimizadores de los argumentos de la función, denotadosy: [ 6 ]
Aquí hemos introducido
- ycomo el promedio de x i e y i , respectivamente
- ycomo las desviaciones en x i e y i con respecto a sus respectivas medias.
Fórmulas ampliadas
Las ecuaciones anteriores son eficientes para usar si la media de las variables x e y () son conocidos. Si las medias no se conocen en el momento del cálculo, puede ser más eficiente utilizar la versión ampliada de laecuaciones. Estas ecuaciones expandidas pueden derivarse de las ecuaciones de regresión polinómica más generales [ 7 ] [ 8 ] definiendo el polinomio de regresión como de orden 1, como sigue.
El sistema de ecuaciones lineales anterior puede resolverse directamente o mediante ecuaciones independientes.Se pueden obtener expandiendo las ecuaciones matriciales anteriores. Las ecuaciones resultantes son algebraicamente equivalentes a las mostradas en el párrafo anterior y se muestran a continuación sin demostración. [ 9 ] [ 7 ]
Interpretación
Relación con la matriz de covarianza muestral
La solución puede reformularse utilizando elementos de la matriz de covarianza :
dónde
- r xy es el coeficiente de correlación muestral entre x e y.
- s x y s y son las desviaciones estándar muestrales no corregidas de x e y.
- yson la varianza muestral y la covarianza muestral , respectivamente
Sustituyendo las expresiones anteriores poryen la solución original produce
Esto demuestra que r xy es la pendiente de la línea de regresión de los puntos de datos estandarizados (y que esta línea pasa por el origen). Dado queEntonces, si x es una medición y y es una medición de seguimiento del mismo elemento, entonces esperamos que y (en promedio) esté más cerca de la medición media que del valor original de x. Este fenómeno se conoce como regresión a la media .
Generalizar elEn notación, podemos escribir una barra horizontal sobre una expresión para indicar el valor promedio de esa expresión sobre el conjunto de muestras. Por ejemplo:
Esta notación nos permite una fórmula concisa para r xy :
El coeficiente de determinación ("R cuadrado") es igual acuando el modelo es lineal con una sola variable independiente. Consulte el coeficiente de correlación de la muestra para obtener más detalles.
Interpretación sobre la pendiente
Multiplicando todos los miembros de la suma en el numerador por :(sin modificarlo):
Podemos ver que la pendiente (tangente del ángulo) de la línea de regresión es el promedio ponderado deesa es la pendiente (tangente del ángulo) de la línea que conecta el i-ésimo punto con el promedio de todos los puntos, ponderado porporque cuanto más alejado esté el punto, más "importante" será, ya que pequeños errores en su posición afectarán más a la pendiente que lo conecta con el punto central.
Interpretación sobre la intersección
El parámetroes la intersección de la función lineal. Por lo tanto, el-La intersección de la función encontrada con regresión lineal simple es
.
Porquees la pendiente de la función lineal,Por lo tanto, el ángulola gráfica de la función hace con elEl eje es igual a
.
Interpretación sobre la correlación
En la formulación anterior, observe que cadaes un valor constante ("conocido de antemano"), mientras que elson variables aleatorias que dependen de la función lineal dey el término aleatorioEsta suposición se utiliza al derivar el error estándar de la pendiente y al demostrar que no tiene sesgo .
En este marco, cuandoEn realidad no es una variable aleatoria , ¿qué tipo de parámetro es la correlación empírica?¿Estimación? El problema es que para cada valor i tendremos:y. Una posible interpretación dees imaginar quedefine una variable aleatoria extraída de la distribución empírica de los valores x en nuestra muestra. Por ejemplo, si x tuviera 10 valores de los números naturales : [1,2,3...,10], entonces podemos imaginar que x es una distribución uniforme discreta . Bajo esta interpretación, todostienen la misma expectativa y alguna varianza positiva. Con esta interpretación podemos pensar encomo estimador de la correlación de Pearson entre la variable aleatoria y y la variable aleatoria x (tal como la acabamos de definir).
Propiedades numéricas
- La línea de regresión pasa por el punto del centro de masa ,, si el modelo incluye un término de intersección (es decir, no se fuerza a pasar por el origen).
- La suma de los residuos es cero si el modelo incluye un término de intersección:
- Los residuos y los valores de x no están correlacionados (independientemente de si existe o no un término de intersección en el modelo), lo que significa:
- La relación entre(el coeficiente de correlación para la población ) y las varianzas poblacionales de() y el término de error de() es: [ 10 ] : 401 Para valores extremos deEsto es evidente por sí mismo. ¿Desde cuándo?entonces. Y cuandoentonces.
Propiedades estadísticas
La descripción de las propiedades estadísticas de los estimadores obtenidos mediante regresión lineal simple requiere el uso de un modelo estadístico . Lo que sigue se basa en la suposición de que el modelo es válido y que las estimaciones son óptimas. También es posible evaluar las propiedades bajo otras suposiciones, como la inhomogeneidad , pero esto se analiza en otro apartado.
Imparcialidad
Los estimadoresyson imparciales .
Para formalizar esta afirmación debemos definir un marco en el que estos estimadores sean variables aleatorias. Consideramos los residuos ε i como variables aleatorias extraídas independientemente de alguna distribución con media cero. En otras palabras, para cada valor de x , el valor correspondiente de y se genera como una respuesta media α + βx más una variable aleatoria adicional ε llamada término de error , igual a cero en promedio. Bajo tal interpretación, los estimadores de mínimos cuadradosySerán variables aleatorias cuyas medias serán iguales a los "valores verdaderos" α y β . Esta es la definición de un estimador insesgado.
Varianza de la respuesta media
Dado que los datos en este contexto se definen como pares ( x , y ) para cada observación, la respuesta media en un valor dado de x , digamos x d , es una estimación de la media de los valores de y en la población en el valor de x de x d , es decir. La varianza de la respuesta media viene dada por: [ 11 ]
Esta expresión se puede simplificar a
donde m es el número de puntos de datos.
Para demostrar esta simplificación, se puede utilizar la identidad
Varianza de la respuesta prevista
La distribución de respuesta predicha es la distribución predicha de los residuos en el punto dado x d . Por lo tanto, la varianza viene dada por
La segunda línea se deduce del hecho de quees cero porque el nuevo punto de predicción es independiente de los datos utilizados para ajustar el modelo. Además, el términoSe calculó previamente para la respuesta media.
Desde(un parámetro fijo pero desconocido que puede estimarse), la varianza de la respuesta predicha viene dada por
Intervalos de confianza
Las fórmulas dadas en la sección anterior permiten calcular las estimaciones puntuales de α y β , es decir, los coeficientes de la línea de regresión para el conjunto de datos dado. Sin embargo, esas fórmulas no nos dicen cuán precisas son las estimaciones, es decir, cuánto se ajustan los estimadores.yVarían de una muestra a otra para el tamaño de muestra especificado. Se diseñaron intervalos de confianza para proporcionar un conjunto plausible de valores para las estimaciones que se podrían obtener si se repitiera el experimento un número muy grande de veces.
El método estándar para construir intervalos de confianza para los coeficientes de regresión lineal se basa en el supuesto de normalidad, que se justifica si:
- Los errores en la regresión se distribuyen normalmente (el llamado supuesto clásico de regresión ), o
- el número de observaciones n es suficientemente grande, en cuyo caso el estimador tiene una distribución aproximadamente normal.
Este último caso se justifica por el teorema del límite central .
Suposición de normalidad
Bajo el primer supuesto anterior, el de la normalidad de los términos de error, el estimador del coeficiente de pendiente tendrá una distribución normal con media β y varianzadonde σ 2 es la varianza de los términos de error (véase Demostraciones que involucran mínimos cuadrados ordinarios ). Al mismo tiempo, la suma de los residuos al cuadrado Q se distribuye proporcionalmente a χ 2 con n − 2 grados de libertad, e independientemente deEsto nos permite construir un valor t .
dónde
es el estimador de error estándar insesgado del estimador.
Este valor t tiene una distribución t de Student con n − 2 grados de libertad. Usándolo podemos construir un intervalo de confianza para β :
con un nivel de confianza (1 − γ ) , dondees elcuantil de la distribución t n −2 . Por ejemplo, si γ = 0,05 , entonces el nivel de confianza es del 95 %.
De manera similar, el intervalo de confianza para el coeficiente de intersección α viene dado por
con un nivel de confianza (1 − γ ), donde

Los intervalos de confianza para α y β nos dan una idea general de dónde es más probable que se encuentren estos coeficientes de regresión. Por ejemplo, en la regresión de la ley de Okun que se muestra aquí, las estimaciones puntuales son:
Los intervalos de confianza del 95% para estas estimaciones son:
Para representar gráficamente esta información, en forma de bandas de confianza alrededor de la línea de regresión, es necesario proceder con cuidado y tener en cuenta la distribución conjunta de los estimadores. Se puede demostrar [ 12 ] que en el nivel de confianza (1 − γ ) la banda de confianza tiene forma hiperbólica dada por la ecuación
Cuando el modelo asumió que la intersección es fija e igual a 0 (), el error estándar de la pendiente se convierte en:
Con:
Suposición asintótica
La segunda hipótesis alternativa establece que cuando el número de puntos en el conjunto de datos es suficientemente grande, la ley de los grandes números y el teorema del límite central se vuelven aplicables, y entonces la distribución de los estimadores es aproximadamente normal. Bajo esta hipótesis, todas las fórmulas derivadas en la sección anterior siguen siendo válidas, con la única excepción de que el cuantil t* n −2 de la distribución t de Student se reemplaza por el cuantil q* de la distribución normal estándar . Ocasionalmente , la fracción 1 / n −2 se reemplaza por 1 / n . Cuando n es grande , tal cambio no altera los resultados de manera apreciable.
Ejemplo numérico
Este conjunto de datos proporciona la masa corporal promedio de las mujeres en función de su estatura en una muestra de mujeres estadounidenses de entre 30 y 39 años. Si bien el artículo sobre mínimos cuadrados ordinarios (MCO) argumenta que sería más apropiado realizar una regresión cuadrática con estos datos, en este caso se aplica el modelo de regresión lineal simple.
En este conjunto de datos hay n = 15 puntos. Los cálculos manuales comenzarían hallando las siguientes cinco sumas:
Estas cantidades se utilizarían para calcular las estimaciones de los coeficientes de regresión y sus errores estándar.

El cuantil 0,975 de la distribución t de Student con 13 grados de libertad es t * 13 = 2,1604 , y por lo tanto los intervalos de confianza del 95% para α y β son
También se puede calcular el coeficiente de correlación producto-momento :
Alternativas

En la regresión lineal simple (RLS), existe un supuesto subyacente de que solo la variable dependiente contiene error de medición; si la variable explicativa también se mide con error, entonces la regresión simple no es apropiada para estimar la relación subyacente porque estará sesgada debido a la dilución de la regresión .
Otros métodos de estimación que pueden utilizarse en lugar de los mínimos cuadrados ordinarios incluyen las mínimas desviaciones absolutas (que minimizan la suma de los valores absolutos de los residuos) y el estimador de Theil-Sen (que elige una línea cuya pendiente es la mediana de las pendientes determinadas por pares de puntos de la muestra).
La regresión de Deming (mínimos cuadrados totales) también encuentra una línea que se ajusta a un conjunto de puntos de muestra bidimensionales, pero (a diferencia de los mínimos cuadrados ordinarios, las desviaciones absolutas mínimas y la regresión de pendiente mediana) no es realmente un caso de regresión lineal simple, porque no separa las coordenadas en una variable dependiente y una independiente y podría potencialmente devolver una línea vertical como ajuste. Esto puede conducir a un modelo que intenta ajustarse más a los valores atípicos que a los datos.
Ajuste de línea
El ajuste de línea es el proceso de construir una línea recta que se ajuste de la mejor manera a una serie de puntos de datos.
Existen varios métodos, teniendo en cuenta:
- Distancia vertical: Regresión lineal simple
- Resistencia a valores atípicos : Regresión lineal simple robusta
- Distancia perpendicular : Regresión ortogonal (esto no es invariante a la escala, es decir, cambiar las unidades de medida da como resultado una línea diferente).
- Distancia geométrica ponderada: regresión de Deming
- Enfoque invariante a la escala: Regresión del eje principal. Esto permite errores de medición en ambas variables y proporciona una ecuación equivalente si se modifican las unidades de medida.
Regresión lineal simple sin término de intersección (regresor único)
A veces es apropiado forzar que la línea de regresión pase por el origen, porque se supone que x e y son proporcionales. Para el modelo sin el término de intersección, y = βx , el estimador MCO para β se simplifica a
Sustituyendo ( x − h , y − k ) en lugar de ( x , y ) se obtiene la regresión a través de ( h , k ) :
donde Cov y Var se refieren a la covarianza y la varianza de los datos de la muestra (sin corregir el sesgo). La última forma mostrada anteriormente ilustra cómo el desplazamiento de la línea desde el centro de masa de los puntos de datos afecta la pendiente.
Véase también
- Matriz de diseño § Regresión lineal simple
- Estimación de tendencia lineal
- Regresión lineal segmentada
- Demostraciones que involucran mínimos cuadrados ordinarios : derivación de todas las fórmulas utilizadas en este artículo en el caso multidimensional general.
- Estimador de Newey-West
Referencias
- ↑ Seltman, Howard J. (2008-09-08). Diseño y análisis experimental (PDF) . pág. 227.
- ↑ "Muestreo estadístico y regresión: regresión lineal simple" . Universidad de Columbia . Consultado el 17 de octubre de 2016.
Cuando se utiliza una variable independiente en una regresión, se denomina regresión simple; (...)
- ↑ Lane, David M. Introducción a la estadística (PDF) . pág. 462.
- ↑ Zou KH; Tuncali K; Silverman SG (2003). "Correlación y regresión lineal simple" . Radiology . 227 ( 3): 617– 22. doi : 10.1148/radiol.2273011499 . ISSN 0033-8419 . OCLC 110941167. PMID 12773666 .
- ↑ Altman, Naomi; Krzywinski, Martin (2015). " Regresión lineal simple" . Nature Methods . 12 (11): 999– 1000. doi : 10.1038/nmeth.3627 . ISSN 1548-7091 . OCLC 5912005539. PMID 26824102. S2CID 261269711 .
- ↑ Kenney, JF y Keeping, ES (1962) "Regresión lineal y correlación". Cap. 15 en Matemáticas de la estadística , Pt. 1, 3.ª ed. Princeton, NJ: Van Nostrand, pp. 252–285
- 1 2 Muthukrishnan, Gowri (17 de junio de 2018). "Matemáticas detrás de la regresión polinomial, Muthukrishnan" . Matemáticas detrás de la regresión polinomial . Recuperado el 30 de enero de 2024 .
- ↑ "Matemáticas de la regresión polinomial" . Regresión polinomial, una clase de regresión de PHP .
- ↑ "Cálculo, Matemáticas y Estadística - Kit de Habilidades Académicas, Universidad de Newcastle" . Regresión lineal simple . Consultado el 30 de enero de 2024 .
- ↑ Valliant, Richard, Jill A. Dever y Frauke Kreuter. Herramientas prácticas para el diseño y la ponderación de muestras de encuestas. Nueva York: Springer, 2013.
- ↑ Draper, NR; Smith, H. (1998). Análisis de regresión aplicada (3.ª ed.). John Wiley. ISBN 0-471-17082-8.
- ↑ Casella, G. y Berger, RL (2002), "Inferencia estadística" (2.ª edición), Cengage, ISBN 978-0-534-24312-8, págs. 558–559.
Enlaces externos
- Explicación de Wolfram MathWorld sobre el ajuste por mínimos cuadrados y cómo calcularlo.
- Matemáticas de la regresión simple (Robert Nau, Universidad de Duke)
- Ajuste de curvas
- Análisis de regresión
- estadística paramétrica