
En el modelado estadístico , el análisis de regresión es un método estadístico para estimar la relación entre una variable dependiente (a menudo llamada variable de resultado o respuesta , o etiqueta en la jerga del aprendizaje automático) y una o más variables independientes (a menudo llamadas regresores , predictores , covariables , variables explicativas o características ). [ 1 ] [ 2 ]
La forma más común de análisis de regresión es la regresión lineal , en la que se encuentra la línea (o una combinación lineal más compleja ) que mejor se ajusta a los datos según un criterio matemático específico. Por ejemplo, el método de mínimos cuadrados ordinarios calcula la única línea (o hiperplano ) que minimiza la suma de las diferencias al cuadrado entre los datos reales y esa línea (o hiperplano). Por razones matemáticas específicas (véase regresión lineal ), esto permite al investigador estimar la esperanza condicional (o valor promedio de la población ) de la variable dependiente cuando las variables independientes toman un conjunto dado de valores. Las formas menos comunes de regresión utilizan procedimientos ligeramente diferentes para estimar parámetros de localización alternativos (p. ej., regresión de cuantiles o análisis de condición necesaria [ 3 ] ) o estimar la esperanza condicional en una colección más amplia de modelos no lineales (p. ej., regresión no paramétrica ).
El análisis de regresión se utiliza principalmente para dos propósitos conceptualmente distintos. En primer lugar, se emplea ampliamente para la predicción y la previsión , donde su uso se solapa considerablemente con el campo del aprendizaje automático . En segundo lugar, en algunas situaciones, el análisis de regresión puede utilizarse para inferir relaciones causales entre las variables independientes y dependientes. Es importante destacar que las regresiones por sí solas solo revelan relaciones entre una variable dependiente y un conjunto de variables independientes en un conjunto de datos fijo. Para utilizar las regresiones para la predicción o para inferir relaciones causales, respectivamente, el investigador debe justificar cuidadosamente por qué las relaciones existentes tienen poder predictivo en un nuevo contexto o por qué una relación entre dos variables tiene una interpretación causal. Esto último es especialmente importante cuando los investigadores pretenden estimar relaciones causales utilizando datos observacionales . [ 4 ] [ 5 ]
Historia
La primera forma de regresión se observó en el trabajo de Isaac Newton en 1700, mientras estudiaba los equinoccios , a quien se le atribuye la introducción de un "análisis de regresión lineal embrionario", ya que "no solo realizó el promedio de un conjunto de datos, 50 años antes que Tobias Mayer , sino que al sumar los residuos a cero, obligó a la línea de regresión a pasar por el punto promedio. También distinguió entre dos conjuntos de datos no homogéneos y pudo haber pensado en una solución óptima en términos de sesgo, aunque no en términos de efectividad". [ 6 ] Anteriormente, utilizó un método de promedio en su trabajo de 1671 sobre los anillos de Newton , lo cual no tenía precedentes en ese momento. [ 7 ]
El método de mínimos cuadrados fue publicado por Legendre en 1805, [ 8 ] y por Gauss en 1809. [ 9 ] Tanto Legendre como Gauss aplicaron el método al problema de determinar, a partir de observaciones astronómicas, las órbitas de los cuerpos alrededor del Sol (principalmente cometas, pero también más tarde los planetas menores recién descubiertos en ese entonces ). Gauss publicó un desarrollo posterior de la teoría de mínimos cuadrados en 1821, [ 10 ] incluyendo una versión del teorema de Gauss-Markov .
El término "regresión" fue acuñado por Francis Galton en el siglo XIX para describir un fenómeno biológico. El fenómeno era que las alturas de los descendientes de ancestros altos tienden a regresar hacia un promedio normal (un fenómeno también conocido como regresión a la media ). [ 11 ] [ 12 ] Para Galton, la regresión tenía solo este significado biológico, [ 13 ] [ 14 ] pero su trabajo fue extendido posteriormente por Udny Yule y Karl Pearson a un contexto estadístico más general. [ 15 ] [ 16 ] En el trabajo de Yule y Pearson, se asume que la distribución conjunta de las variables de respuesta y explicativas es gaussiana . Esta suposición fue debilitada por RA Fisher en sus trabajos de 1922 y 1925. [ 17 ] [ 18 ] [ 19 ] Fisher asumió que la distribución condicional de la variable de respuesta es gaussiana, pero la distribución conjunta no necesariamente lo es. En este sentido, la suposición de Fisher se acerca más a la formulación de Gauss de 1821.
En las décadas de 1950 y 1960, los economistas utilizaban calculadoras de escritorio electromecánicas para calcular regresiones. Antes de 1970, a veces se tardaba hasta 24 horas en obtener el resultado de una regresión. [ 20 ]
Los métodos de regresión siguen siendo un área de investigación activa. En las últimas décadas, se han desarrollado nuevos métodos para la regresión robusta , la regresión que involucra respuestas correlacionadas como series temporales y curvas de crecimiento , la regresión en la que el predictor (variable independiente) o las variables de respuesta son curvas, imágenes, gráficos u otros objetos de datos complejos, métodos de regresión que admiten varios tipos de datos faltantes, regresión no paramétrica , métodos bayesianos para regresión, regresión en la que las variables predictoras se miden con error, regresión con más variables predictoras que observaciones e inferencia causal con regresión. El análisis de regresión moderno se realiza típicamente con paquetes de software estadístico y hojas de cálculo en computadoras, así como en calculadoras científicas y gráficas portátiles .
Modelo de regresión
En la práctica, los investigadores primero seleccionan un modelo que desean estimar y luego utilizan el método elegido (por ejemplo, mínimos cuadrados ordinarios ) para estimar los parámetros de ese modelo. Los modelos de regresión incluyen los siguientes componentes:
- Los parámetros desconocidos , a menudo denotados como un escalar o un vector.
- Las variables independientes , que se observan en los datos y a menudo se denotan como un vector(dóndedenota una fila de datos).
- La variable dependiente , que se observa en los datos y a menudo se denota utilizando el escalar.
- Los términos de error , que no se observan directamente en los datos y a menudo se denotan utilizando el escalar.
En diversos campos de aplicación , se utilizan diferentes terminologías en lugar de variables dependientes e independientes .
La mayoría de los modelos de regresión proponen quees una función ( función de regresión ) dey, conrepresentando un término de error aditivo que puede sustituir a determinantes no modelados deo ruido estadístico aleatorio:
En el modelo de regresión estándar, las variables independientesSe supone que están libres de errores. El modelo de errores en las variables se puede utilizar si se supone que las variables independientes contienen errores. Se pueden realizar otras modificaciones al modelo de regresión estándar para tener en cuenta diversos escenarios, como situaciones que involucran variables omitidas , variables de confusión o endogeneidad .
El objetivo de los investigadores es estimar la funciónque mejor se ajuste a los datos. Para realizar un análisis de regresión, la forma de la funcióndebe especificarse. A veces la forma de esta función se basa en el conocimiento sobre la relación entreyque no se basa en los datos. Si no se dispone de dicho conocimiento, una forma flexible o conveniente parase elige. Por ejemplo, una regresión univariante simple puede proponer, lo que sugiere que el investigador creeque sea una aproximación razonable para el proceso estadístico que genera los datos.
Una vez que los investigadores determinan su modelo estadístico preferido , diferentes formas de análisis de regresión proporcionan herramientas para estimar los parámetros.. Por ejemplo, el método de mínimos cuadrados (incluida su variante más común, los mínimos cuadrados ordinarios ) encuentra el valor deque minimiza la suma de los errores cuadráticos. Un método de regresión determinado proporcionará en última instancia una estimación de, generalmente denotadopara distinguir la estimación del valor real (desconocido) del parámetro que generó los datos. Utilizando esta estimación, el investigador puede entonces usar el valor ajustado.para predecir o para evaluar la precisión del modelo al explicar los datos. Si el investigador está intrínsecamente interesado en la estimacióno el valor previstodependerá del contexto y sus objetivos. Como se describe en mínimos cuadrados ordinarios , los mínimos cuadrados se utilizan ampliamente porque la función estimadase aproxima a la esperanza condicional. [ 9 ] Sin embargo, las variantes alternativas (por ejemplo, las desviaciones absolutas mínimas o la regresión de cuantiles ) son útiles cuando los investigadores quieren modelar otras funciones..
Debe haber datos suficientes para estimar un modelo de regresión. Por ejemplo, supongamos que un investigador tiene acceso afilas de datos con una variable dependiente y dos variables independientes:Supongamos además que el investigador desea estimar un modelo lineal bivariado mediante mínimos cuadrados :. Si el investigador solo tiene acceso apuntos de datos, entonces podrían encontrar infinitas combinacionesque expliquen los datos igualmente bien: se puede elegir cualquier combinación que satisfaga, todo lo cual conduce ay son, por lo tanto, soluciones válidas que minimizan la suma de los residuos al cuadrado . Para entender por qué hay infinitas opciones, tenga en cuenta que el sistema deLas ecuaciones deben resolverse para 3 incógnitas, lo que hace que el sistema sea subdeterminado . Alternativamente, se pueden visualizar infinitos planos tridimensionales que pasan porpuntos fijos.
De manera más general, para estimar un modelo de mínimos cuadrados conparámetros distintos, uno debe tenerpuntos de datos distintos. Si, entonces generalmente no existe un conjunto de parámetros que se ajusten perfectamente a los datos. La cantidadAparece con frecuencia en el análisis de regresión y se denomina grados de libertad del modelo. Además, para estimar un modelo de mínimos cuadrados, las variables independientesdeben ser linealmente independientes : no se debe poder reconstruir ninguna de las variables independientes sumando y multiplicando las variables independientes restantes. Como se discutió en mínimos cuadrados ordinarios , esta condición garantiza quees una matriz invertible y por lo tanto tiene una solución única.existe.
Supuestos subyacentes
En sí misma, una regresión es simplemente un cálculo realizado sobre un conjunto de datos. Para interpretar la regresión resultante como un modelo estadístico significativo que cuantifique relaciones del mundo real, los investigadores suelen basarse en una serie de supuestos clásicos . Estos supuestos suelen incluir:
- La muestra es representativa de la población en general.
- Las variables independientes se miden sin error.
- Las desviaciones del modelo tienen un valor esperado de cero, condicionado a las covariables:
- La varianza de los residuoses constante en todas las observaciones ( homoscedasticidad ).
- Los residuosno están correlacionados entre sí. Matemáticamente, la matriz de varianza-covarianza de los errores es diagonal .
Un puñado de condiciones son suficientes para que el estimador de mínimos cuadrados posea propiedades deseables: en particular, los supuestos de Gauss-Markov implican que las estimaciones de los parámetros serán insesgadas , consistentes y eficientes en la clase de estimadores lineales insesgados. Los profesionales han desarrollado una variedad de métodos para mantener algunas o todas estas propiedades deseables en entornos del mundo real, porque es poco probable que estos supuestos clásicos se cumplan exactamente. Por ejemplo, modelar errores en las variables puede conducir a estimaciones razonables de las variables independientes que se miden con errores. Los errores estándar consistentes con la heterocedasticidad permiten la varianza decambiar en función de los valores deLos errores correlacionados que existen dentro de subconjuntos de datos o que siguen patrones específicos pueden manejarse utilizando errores estándar agrupados, regresión ponderada geográficamente o errores estándar de Newey-West , entre otras técnicas. Cuando las filas de datos corresponden a ubicaciones en el espacio, la elección de cómo modelardentro de las unidades geográficas puede tener consecuencias importantes. [ 21 ] [ 22 ] El subcampo de la econometría se centra principalmente en desarrollar técnicas que permitan a los investigadores llegar a conclusiones razonables del mundo real en entornos del mundo real, donde los supuestos clásicos no se cumplen exactamente.
Regresión lineal
En la regresión lineal, la especificación del modelo es que la variable dependiente,es una combinación lineal de los parámetros (pero no necesariamente lineal en las variables independientes ). Por ejemplo, en la regresión lineal simple para modelarEn los puntos de datos hay una variable independiente:y dos parámetros,y:
- línea recta:
En la regresión lineal múltiple, existen varias variables independientes o funciones de variables independientes.
Agregar un término enAl aplicar la regresión anterior se obtiene:
- parábola:
Esto sigue siendo una regresión lineal; aunque la expresión del lado derecho es cuadrática en la variable independiente.es lineal en los parámetros,y
En ambos casos,es un término de error y el subíndiceindexa una observación particular.
Volviendo al caso de la línea recta: dado un muestreo aleatorio de la población, estimamos los parámetros de la población y obtenemos el modelo de regresión lineal de la muestra:
El residual ,, es la diferencia entre el valor de la variable dependiente predicho por el modelo,y el verdadero valor de la variable dependiente,. Un método de estimación es el de mínimos cuadrados ordinarios . Este método obtiene estimaciones de parámetros que minimizan la suma de los residuos al cuadrado , SSR :
La minimización de esta función da como resultado un conjunto de ecuaciones normales , un conjunto de ecuaciones lineales simultáneas en los parámetros, que se resuelven para obtener los estimadores de los parámetros,.

En el caso de regresión simple, las fórmulas para las estimaciones de mínimos cuadrados son:
dóndees la media (promedio) de lavalores yes la media de lavalores.
Bajo el supuesto de que el término de error poblacional tiene una varianza constante, la estimación de dicha varianza viene dada por:
Esto se denomina error cuadrático medio (ECM) de la regresión. El denominador es el tamaño de la muestra reducido por el número de parámetros del modelo estimados a partir de los mismos datos.pararegresores osi se utiliza una intercepción. [ 23 ] En este caso,por lo tanto el denominador es.
Los errores estándar de las estimaciones de los parámetros vienen dados por
Bajo el supuesto adicional de que el término de error poblacional tiene una distribución normal, el investigador puede utilizar estos errores estándar estimados para crear intervalos de confianza y realizar pruebas de hipótesis sobre los parámetros poblacionales .
modelo lineal general
En el modelo de regresión múltiple más general, hayvariables independientes:
dóndees el-ésima observación sobre la-ésima variable independiente. Si la primera variable independiente toma el valor 1 para todas,, entoncesse denomina intercepto de regresión .
Las estimaciones de parámetros de mínimos cuadrados se obtienen deecuaciones normales. El residuo se puede escribir como
Las ecuaciones normales son
En notación matricial, las ecuaciones normales se escriben como
donde elelemento dees, elelemento del vector columnaesy elelemento dees. De este modoes,es, yesLa solución es
Diagnóstico
Una vez construido un modelo de regresión, es importante confirmar su bondad de ajuste y la significación estadística de los parámetros estimados. Entre las comprobaciones de bondad de ajuste más comunes se incluyen el coeficiente de determinación (R²) , el análisis del patrón de residuos y las pruebas de hipótesis. La significación estadística se puede comprobar mediante una prueba F del ajuste global, seguida de pruebas t para cada parámetro.
La interpretación de estas pruebas de diagnóstico depende en gran medida de los supuestos del modelo. Si bien el análisis de los residuos puede invalidar un modelo, los resultados de una prueba t o una prueba F a veces son más difíciles de interpretar si se incumplen dichos supuestos. Por ejemplo, si el término de error no sigue una distribución normal, en muestras pequeñas los parámetros estimados no se ajustarán a distribuciones normales, lo que complica la inferencia. Sin embargo, con muestras relativamente grandes, se puede recurrir al teorema del límite central , de modo que la prueba de hipótesis pueda realizarse mediante aproximaciones asintóticas.
Variables dependientes limitadas
En econometría , suelen aparecer variables dependientes limitadas , que son variables de respuesta categóricas o que están restringidas a un rango determinado.
La variable de respuesta puede ser discontinua ("limitada" a estar en algún subconjunto de la recta real). Para variables binarias (cero o uno), si el análisis procede con regresión lineal por mínimos cuadrados, el modelo se llama modelo de probabilidad lineal . Los modelos no lineales para variables dependientes binarias incluyen el modelo probit y el modelo logit . El modelo probit multivariado es un método estándar para estimar una relación conjunta entre varias variables dependientes binarias y algunas variables independientes. Para variables categóricas con más de dos valores, existe el logit multinomial . Para variables ordinales con más de dos valores, existen los modelos logit ordenado y probit ordenado . Los modelos de regresión censurada pueden usarse cuando la variable dependiente solo se observa a veces, y los modelos de corrección de Heckman pueden usarse cuando la muestra no se selecciona aleatoriamente de la población de interés.
Una alternativa a estos procedimientos es la regresión lineal basada en la correlación policórica (o poliserial) entre las variables categóricas. Estos procedimientos difieren en los supuestos sobre la distribución de las variables en la población. Si la variable es positiva con valores bajos y representa la repetición de un evento, se pueden utilizar modelos de conteo como la regresión de Poisson o el modelo binomial negativo .
regresión no lineal
Cuando la función del modelo no es lineal con respecto a los parámetros, la suma de los cuadrados debe minimizarse mediante un procedimiento iterativo. Esto introduce numerosas complicaciones que se resumen en el apartado « Diferencias entre mínimos cuadrados lineales y no lineales» .
Predicción (interpolación y extrapolación)

Los modelos de regresión predicen un valor de la variable Y a partir de valores conocidos de las variables X. La predicción dentro del rango de valores del conjunto de datos utilizado para el ajuste del modelo se conoce informalmente como interpolación . La predicción fuera de este rango se conoce como extrapolación . La extrapolación depende en gran medida de los supuestos de la regresión. Cuanto más se aleje la extrapolación de los datos, mayor será la probabilidad de que el modelo falle debido a las diferencias entre los supuestos y los datos de la muestra o los valores reales.
Un intervalo de predicción que representa la incertidumbre puede acompañar a la predicción puntual. Dichos intervalos tienden a expandirse rápidamente a medida que los valores de la(s) variable(s) independiente(s) se salen del rango cubierto por los datos observados.
Por tales razones y otras, algunos tienden a decir que podría ser imprudente emprender una extrapolación. [ 25 ]
Selección de modelos
La suposición de una forma particular para la relación entre Y y X constituye otra fuente de incertidumbre. Un análisis de regresión bien realizado incluirá una evaluación de la concordancia entre la forma supuesta y los datos observados, pero solo dentro del rango de valores disponibles de las variables independientes. Esto implica que cualquier extrapolación depende en gran medida de las suposiciones sobre la forma estructural de la relación de regresión. Si este conocimiento incluye el hecho de que la variable dependiente no puede salirse de un cierto rango de valores, se puede utilizar para seleccionar el modelo, incluso si el conjunto de datos observados no presenta valores particularmente cercanos a dichos límites. Las implicaciones de este paso de elegir una forma funcional apropiada para la regresión pueden ser significativas al considerar la extrapolación. Como mínimo, garantiza que cualquier extrapolación derivada de un modelo ajustado sea realista (o acorde con lo conocido).
Cálculos de potencia y tamaño de la muestra
No existen métodos generalmente aceptados para relacionar el número de observaciones con el número de variables independientes en el modelo. Un método propuesto por Good y Hardin es, dóndees el tamaño de la muestra,es el número de variables independientes yes el número de observaciones necesarias para alcanzar la precisión deseada si el modelo tuviera solo una variable independiente. [ 26 ] Por ejemplo, un investigador está construyendo un modelo de regresión lineal utilizando un conjunto de datos que contiene 1000 pacientes (). Si el investigador decide que se necesitan cinco observaciones para definir con precisión una línea recta (), entonces el número máximo de variables independientes () el modelo puede soportar es 4, porque
- .
Otros métodos
Si bien los parámetros de un modelo de regresión generalmente se estiman utilizando el método de mínimos cuadrados, también se han utilizado otros métodos, entre los que se incluyen:
- Métodos bayesianos , por ejemplo, regresión lineal bayesiana.
- Regresión porcentual, para situaciones en las que se considera más apropiado reducir los errores porcentuales . [ 27 ]
- Desviaciones absolutas mínimas , que es más robusto en presencia de valores atípicos, lo que lleva a la regresión de cuantiles.
- La regresión no paramétrica requiere un gran número de observaciones y es computacionalmente intensiva.
- Optimización de escenarios , que da lugar a modelos predictivos de intervalo.
Software
Todos los principales paquetes de software estadístico realizan análisis e inferencias de regresión por mínimos cuadrados . La regresión lineal simple y la regresión múltiple mediante mínimos cuadrados se pueden realizar en algunas hojas de cálculo y calculadoras. Si bien muchos paquetes de software estadístico pueden realizar diversos tipos de regresión no paramétrica y robusta, estos métodos están menos estandarizados. Los distintos paquetes de software implementan métodos diferentes, y un método con un nombre determinado puede implementarse de forma distinta en diferentes paquetes. Se ha desarrollado software de regresión especializado para su uso en campos como el análisis de encuestas y la neuroimagen.
Véase también
- El cuarteto de Anscombe
- Ajuste de curvas
- Teoría de la estimación
- Pronóstico
- Fracción de varianza no explicada
- Aproximación de funciones
- Modelo lineal generalizado
- Kriging (un algoritmo de estimación de mínimos cuadrados lineales)
- regresión local
- Problema de unidad areal modificable
- Spline de regresión adaptativa multivariante
- Distribución normal multivariada
- coeficiente de correlación de Pearson
- Cuasi-varianza
- Intervalo de predicción
- Validación de regresión
- Regresión robusta
- Regresión segmentada
- Procesamiento de señales
- regresión por pasos
- Geometría del taxi
- Estimación de tendencia lineal
Referencias
- ↑ Yan, Xin; Su, Xiaogang (2009). Análisis de regresión lineal: teoría y computación . World Scientific Publishing. págs. 2–3 . ISBN 9789812834102.
- ↑ Freund, Rudolf J.; Mohr, Donna L.; Wilson, William J. (2010). Métodos estadísticos . Elsevier Science. pág. 323. ISBN 9780080961033.
- ↑ Análisis de las condiciones necesarias
- ↑ David A. Freedman (27 de abril de 2009). Modelos estadísticos: teoría y práctica . Cambridge University Press. ISBN 978-1-139-47731-4.
- ↑ R. Dennis Cook; Crítica de Sanford Weisberg y análisis de influencia en la regresión , Metodología Sociológica , vol. 13 (1982), págs. 313-361
- ↑ Belenkiy, Ari; Echague, Eduardo Vila (2008). "A tientas hacia el análisis de regresión lineal: el análisis de Newton de las observaciones del equinoccio de Hiparco". arXiv : 0810.4948 [ physics.hist-ph ].
- ↑ Buchwald, Jed Z.; Feingold, Mordechai (2013). Newton y el origen de la civilización . Princeton University Press . págs. 90–93 , 101–103 . ISBN 978-0-691-15478-7.
- ↑ AM Legendre . Nouvelles méthodes pour la détermination des orbites des comètes , Firmin Didot, París, 1805. "Sur la Méthode des moindres quarrés" aparece como apéndice.
- 1 2 Capítulo 1 de: Angrist, JD, & Pischke, JS (2008). Econometría mayormente inofensiva: un compañero para el empirista . Princeton University Press.
- ^ Gauss, CF (1821-1823). Theoria combineis observeum erroribus minimis obnoxiae - a través de Google Books.
- ↑ Mogull, Robert G. (2004). Estadística aplicada de segundo semestre . Kendall/Hunt Publishing Company. pág. 59. ISBN 978-0-7575-1181-3.
- ↑ Galton, Francis (1989). "Parentesco y correlación (reimpreso en 1989)" . Statistical Science . 4 (2): 80– 86. doi : 10.1214/ss/1177012581 . JSTOR 2245330 .
- ↑ Francis Galton . «Leyes típicas de la herencia», Nature 15 (1877), 492–495, 512–514, 532–533. (Galton utiliza el término «reversión» en este artículo, que trata sobre el tamaño de los guisantes).
- ↑ Francis Galton. Discurso presidencial, Sección H, Antropología. (1885) (Galton utiliza el término "regresión" en este artículo, que trata sobre la estatura de los seres humanos).
- ↑ Yule, G. Udny (1897). "Sobre la teoría de la correlación" . Journal of the Royal Statistical Society . 60 (4): 812– 54. doi : 10.2307/2979746 . JSTOR 2979746 .
- ↑ Pearson, Karl ; Yule, GU; Blanchard, Norman; Lee, Alice (1903). "La ley de la herencia ancestral" . Biometrika . 2 (2): 211– 236. doi : 10.1093/biomet/2.2.211 . JSTOR 2331683 .
- ↑ Fisher, RA (1922). "La bondad de ajuste de las fórmulas de regresión y la distribución de los coeficientes de regresión" . Journal of the Royal Statistical Society . 85 (4): 597– 612. doi : 10.2307/2341124 . JSTOR 2341124. PMC 1084801 .
- ↑ Ronald A. Fisher (1970). Métodos estadísticos para investigadores (Duodécima ed.). Edimburgo : Oliver and Boyd. ISBN 978-0-05-002170-5.
- ↑ Aldrich, John (2005). "Fisher y la regresión" (PDF) . Statistical Science . 20 (4): 401– 417. doi : 10.1214/088342305000000331 . JSTOR 20061201 .
- ↑ Rodney Ramcharan. Regresiones: ¿Por qué los economistas están obsesionados con ellas? Marzo de 2006. Consultado el 3 de diciembre de 2011.
- ↑ Fotheringham, A. Stewart; Brunsdon, Chris; Charlton, Martin (2002). Regresión ponderada geográficamente: el análisis de relaciones espacialmente variables ( Edición reimpresa). Chichester, Inglaterra: John Wiley. ISBN 978-0-471-49616-8.
- ↑ Fotheringham, AS; Wong, DWS (1 de enero de 1991). "El problema de la unidad areal modificable en el análisis estadístico multivariado". Environment and Planning A. 23 ( 7): 1025– 1044. Bibcode : 1991EnPlA..23.1025F . doi : 10.1068/a231025 . S2CID 153979055 .
- ↑ Steel, RGD y Torrie, JH, Principios y procedimientos de estadística con especial referencia a las ciencias biológicas. , McGraw Hill , 1960, página 288.
- ↑ Rouaud, Mathieu (2013). Probabilidad, estadística y estimación (PDF) . pág. 60.
- ↑ Chiang, CL, (2003) Métodos estadísticos de análisis , World Scientific. ISBN 981-238-310-7- página 274, sección 9.7.4 "interpolación frente a extrapolación"
- ↑ Good, PI ; Hardin, JW (2009). Errores comunes en estadística (y cómo evitarlos) (3.ª ed.). Hoboken, Nueva Jersey: Wiley. p. 211. ISBN 978-0-470-45798-6.
- ↑ Tofallis, C. (2009). "Regresión porcentual por mínimos cuadrados" . Journal of Modern Applied Statistical Methods . 7 : 526–534 . doi : 10.2139/ssrn.1406472 . hdl : 2299/965 . SSRN 1406472 .
Lecturas adicionales
- William H. Kruskal y Judith M. Tanur , eds. (1978), "Hipótesis lineales", Enciclopedia internacional de estadística . Free Press, vol. 1,
- Evan J. Williams, "I. Regresión", págs. 523–41.
- Julian C. Stanley , "II. Análisis de varianza", págs. 541–554.
- Lindley, DV (1987). "Análisis de regresión y correlación", New Palgrave: A Dictionary of Economics , vol. 4, págs. 120-23.
- Birkes, David y Dodge, Y. , Métodos alternativos de regresión . ISBN 0-471-56881-3
- Chatfield, C. (1993) " Cálculo de pronósticos por intervalos ", Journal of Business and Economic Statistics, 11. pp. 121–135.
- Draper, NR; Smith, H. (1998). Análisis de regresión aplicada (3.ª ed.). John Wiley. ISBN 978-0-471-17082-2.
- Fox, J. (1997). Análisis de regresión aplicada, modelos lineales y métodos relacionados. Sage
- Hardle, W., Regresión no paramétrica aplicada (1990), ISBN 0-521-42950-1
- Meade, Nigel; Islam, Towhidul (1995). "Intervalos de predicción para pronósticos de curvas de crecimiento". Journal of Forecasting . 14 (5): 413– 430. doi : 10.1002/for.3980140502 .
- A. Sen, M. Srivastava, Análisis de regresión : teoría, métodos y aplicaciones , Springer-Verlag, Berlín, 2011 (4.ª edición).
- T. Strutz: Ajuste de datos e incertidumbre (Una introducción práctica a los mínimos cuadrados ponderados y más allá) . Vieweg+Teubner, ISBN 978-3-8348-1022-9.
- Stulp, Freek y Olivier Sigaud. Muchos algoritmos de regresión, un modelo unificado: una revisión. Neural Networks, vol. 69, septiembre de 2015, pp. 60–79. https://doi.org/10.1016/j.neunet.2015.05.005 .
- Malakooti, B. (2013). Sistemas de operaciones y producción con objetivos múltiples . John Wiley & Sons.
- Chicco, Davide; Warrens, Matthijs J.; Jurman, Giuseppe (2021). "El coeficiente de determinación R-cuadrado es más informativo que SMAPE, MAE, MAPE, MSE y RMSE en la evaluación del análisis de regresión" . PeerJ Ciencias de la Computación . 7 (e623): e623. doi : 10.7717/peerj-cs.623 . PMC 8279135 . PMID 34307865 .
Enlaces externos
- "Análisis de regresión" , Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
- Primeros usos: Regresión – historia básica y referencias
- ¿Para qué se utiliza la regresión múltiple? – Regresión múltiple
- Regresión de datos débilmente correlacionados : cómo pueden aparecer errores de regresión lineal cuando el rango de Y es mucho menor que el rango de X.
- Análisis de regresión