Articulo de referencia

mínimos cuadrados ponderados

Los mínimos cuadrados ponderados ( WLS ), también conocidos como regresión lineal ponderada , [ 1 ] [ 2 ] son ​​una generalización de los mínimos cuadrados ordinarios y la regre...

Los mínimos cuadrados ponderados ( WLS ), también conocidos como regresión lineal ponderada , [ 1 ] [ 2 ] son ​​una generalización de los mínimos cuadrados ordinarios y la regresión lineal en la que se incorpora a la regresión el conocimiento de la varianza desigual de las observaciones ( heterocedasticidad ). Los WLS son también una especialización de los mínimos cuadrados generalizados , cuando todos los elementos fuera de la diagonal de la matriz de covarianza de los errores son nulos.

Formulación

El ajuste de un modelo a un punto de datos se mide por su residuo ,ri{\displaystyle r_{i}}, definida como la diferencia entre un valor medido de la variable dependiente,yi{\displaystyle y_{i}}y el valor predicho por el modelo,F(incógnitai,β){\displaystyle f(x_{i},{\boldsymbol {\beta }})}: ri(β)=yiF(incógnitai,β).{\displaystyle r_{i}({\boldsymbol {\beta }})=y_{i}-f(x_{i},{\boldsymbol {\beta }}).}

Si los errores no están correlacionados y tienen varianza igual, entonces la función S(β)=iri(β)2,{\displaystyle S({\boldsymbol {\beta }})=\sum _{i}r_{i}({\boldsymbol {\beta }})^{2},} se minimiza enβ^{\displaystyle {\boldsymbol {\sombrero {\beta }}}}, de tal manera queSβj(β^)=0{\displaystyle {\frac {\partial S}{\partial \beta _{j}}}({\hat {\boldsymbol {\beta }}})=0}.

El teorema de Gauss-Markov muestra que, cuando esto es así,β^{\displaystyle {\sombrero {\boldsymbol {\beta }}}}es un estimador lineal insesgado óptimo ( BLUE ). Sin embargo, si las mediciones no están correlacionadas pero tienen diferentes incertidumbres, se podría adoptar un enfoque modificado. Aitken demostró que cuando se minimiza una suma ponderada de residuos al cuadrado,β^{\displaystyle {\sombrero {\boldsymbol {\beta }}}}es AZUL si cada peso es igual al recíproco de la varianza de la medición S=i=1norteWiiri2,Wii=1σi2{\displaystyle {\begin{aligned}S&=\sum _{i=1}^{n}W_{ii}{r_{i}}^{2},&W_{ii}&={\frac {1}{{\sigma _{i}}^{2}}}\end{aligned}}}

Las ecuaciones de gradiente para esta suma de cuadrados son 2iWiiF(incógnitai,β)βjri=0,j=1,,metro{\displaystyle -2\sum _{i}W_{ii}{\frac {\partial f(x_{i},{\boldsymbol {\beta }})}{\partial \beta _{j}}}r_{i}=0,\quad j=1,\ldots ,m}

que, en un sistema de mínimos cuadrados lineales, dan las ecuaciones normales modificadas , i=1nortek=1metroincógnitaijWiiincógnitaikβ^k=i=1norteincógnitaijWiiyi,j=1,,metro.{\displaystyle \sum _{i=1}^{n}\sum _{k=1}^{m}X_{ij}W_{ii}X_{ik}{\hat {\beta }}_{k}=\sum _{i=1}^{n}X_{ij}W_{ii}y_{i},\quad j=1,\ldots ,m\,.} La matrizincógnita{\displaystyle X}Lo anterior se define en la discusión correspondiente sobre mínimos cuadrados lineales .

Cuando los errores de observación no están correlacionados y la matriz de ponderación , W = Ω −1 , es diagonal, estos pueden escribirse como (incógnitaTWincógnita)β^=incógnitaTWy.{\displaystyle \mathbf {\left(X^{\textsf {T}}WX\right){\hat {\boldsymbol {\beta }}}=X^{\textsf {T}}Wy} .}

Si los errores están correlacionados, el estimador resultante es el BLUE si la matriz de ponderación es igual a la inversa de la matriz de varianza-covarianza de las observaciones.

Cuando los errores no están correlacionados, es conveniente simplificar los cálculos factorizando la matriz de pesos comowii=Wii{\displaystyle w_{ii}={\sqrt {W_{ii}}}}Las ecuaciones normales se pueden escribir entonces de la misma forma que los mínimos cuadrados ordinarios: (incógnitaTincógnita)β^=incógnitaTy{\displaystyle \mathbf {\left(X'^{\textsf {T}}X'\right){\hat {\boldsymbol {\beta }}}=X'^{\textsf {T}}y'} \,}

donde definimos la siguiente matriz y vector escalados: incógnita=diagnóstico(w)incógnita,y=diagnóstico(w)y=yσ.{\displaystyle {\begin{aligned}\mathbf {X'} &=\operatorname {diag} \left(\mathbf {w} \right)\mathbf {X} ,\\\mathbf {y'} &=\operatorname {diag} \left(\mathbf {w} \right)\mathbf {y} =\mathbf {y} \oslash \mathbf {\sigma } .\end{aligned}}}

Este es un tipo de transformación blanqueadora ; la última expresión implica una división por entradas .

Para sistemas de mínimos cuadrados no lineales, un argumento similar muestra que las ecuaciones normales deben modificarse de la siguiente manera. (JTWJ)Δβ=JTWΔy.{\displaystyle \mathbf {\left(J^{\textsf {T}}WJ\right)\,{\boldsymbol {\Delta }}\beta =J^{\textsf {T}}W\,{\boldsymbol {\Delta }}y} .\,}

Note that for empirical tests, the appropriate W is not known for sure and must be estimated. For this feasible generalized least squares (FGLS) techniques may be used; in this case it is specialized for a diagonal covariance matrix, thus yielding a feasible weighted least squares solution.

If the uncertainty of the observations is not known from external sources, then the weights could be estimated from the given observations. This can be useful, for example, to identify outliers. After the outliers have been removed from the data set, the weights should be reset to one.[3]

Motivation

In some cases the observations may be weighted—for example, they may not be equally reliable. In this case, one can minimize the weighted sum of squares: arg minβi=1nwi|yij=1mXijβj|2=arg minβW12(yXβ)2.{\displaystyle {\underset {\boldsymbol {\beta }}{\operatorname {arg\ min} }}\,\sum _{i=1}^{n}w_{i}\left|y_{i}-\sum _{j=1}^{m}X_{ij}\beta _{j}\right|^{2}={\underset {\boldsymbol {\beta }}{\operatorname {arg\ min} }}\,\left\|W^{\frac {1}{2}}\left(\mathbf {y} -X{\boldsymbol {\beta }}\right)\right\|^{2}.} where wi > 0 is the weight of the ith observation, and W is the diagonal matrix of such weights.

The weights should, ideally, be equal to the reciprocal of the variance of the measurement. (This implies that the observations are uncorrelated. If the observations are correlated, the expression S=kjrkWkjrj{\textstyle S=\sum _ {k} \ sum _ {j}r_ {k} W_ {kj} r_ {j} \,} applies. In this case the weight matrix should ideally be equal to the inverse of the variance-covariance matrix of the observations).[3] The normal equations are then: (XTWX)β^=XTWy.{\displaystyle \left(X^{\textsf {T}}WX\right){\hat {\boldsymbol {\beta }}}=X^{\textsf {T}}W\mathbf {y} .}

This method is used in iteratively reweighted least squares.

Solution

Parameter errors and correlation

The estimated parameter values are linear combinations of the observed values β^=(XTWX)1XTWy.{\displaystyle {\hat {\boldsymbol {\beta }}}=(X^{\textsf {T}}WX)^{-1}X^{\textsf {T}}W\mathbf {y} .}

Therefore, an expression for the estimated variance-covariance matrix of the parameter estimates can be obtained by error propagation from the errors in the observations. Let the variance-covariance matrix for the observations be denoted by M and that of the estimated parameters by Mβ. Then Mβ=(XTWX)1XTWMWTX(XTWTX)1.{\displaystyle M^{\beta }=\left(X^{\textsf {T}}WX\right)^{-1}X^{\textsf {T}}WMW^{\textsf {T}}X\left(X^{\textsf {T}}W^{\textsf {T}}X\right)^{-1}.}

When W = M−1, this simplifies to Mβ=(XTWX)1.{\displaystyle M^{\beta }=\left(X^{\textsf {T}}WX\right)^{-1}.}

When unit weights are used (W = I, the identity matrix), it is implied that the experimental errors are uncorrelated and all equal: M = σ2I, where σ2 is the a priori variance of an observation. In any case, σ2 is approximated by the reduced chi-squaredχν2{\displaystyle \chi _{\nu }^{2}}: Mβ=χν2(XTWX)1,χν2=S/ν,{\displaystyle {\begin{aligned}M^{\beta }&=\chi _{\nu }^{2}\left(X^{\textsf {T}}WX\right)^{-1},\\\chi _{\nu }^{2}&=S/\nu ,\end{aligned}}}

where S is the minimum value of the weighted objective function: S=rTWr=W12(yXβ^)2.{\displaystyle S=r^{\textsf {T}}Wr=\left\|W^{\frac {1}{2}}\left(\mathbf {y} -X{\hat {\boldsymbol {\beta }}}\right)\right\|^{2}.}

The denominator, ν=nm{\displaystyle \nu =n-m}, es el número de grados de libertad ; véase grados de libertad efectivos para generalizaciones en el caso de observaciones correlacionadas.

En todos los casos, la varianza de la estimación del parámetroβ^i{\displaystyle {\hat {\beta }}_{i}}es dado porMETROiiβ{\displaystyle M_{ii}^{\beta }}y la covarianza entre las estimaciones de los parámetrosβ^i{\displaystyle {\hat {\beta }}_{i}}yβ^j{\displaystyle {\hat {\beta }}_{j}}es dado porMETROijβ{\displaystyle M_{ij}^{\beta }}La desviación estándar es la raíz cuadrada de la varianza.σi=METROiiβ{\displaystyle \sigma _{i}={\sqrt {M_{ii}^{\beta }}}}y el coeficiente de correlación viene dado porρij=METROijβ/(σiσj){\displaystyle \rho _{ij}=M_{ij}^{\beta }/(\sigma _{i}\sigma _{j})}Estas estimaciones de error reflejan únicamente errores aleatorios en las mediciones. La verdadera incertidumbre en los parámetros es mayor debido a la presencia de errores sistemáticos , que, por definición, no pueden cuantificarse. Cabe señalar que, si bien las observaciones pueden no estar correlacionadas, los parámetros suelen estar correlacionados .

Límites de confianza de los parámetros

A menudo se asume , a falta de evidencia concreta pero recurriendo frecuentemente al teorema del límite central —véase Distribución normal#Ocurrencia y aplicaciones— que el error en cada observación pertenece a una distribución normal con una media de cero y desviación estándarσ{\displaystyle \sigma }Bajo esa suposición, se pueden derivar las siguientes probabilidades para una estimación de un único parámetro escalar en términos de su error estándar estimado.smiβ{\displaystyle se_{\beta }}(presentado aquí ):

  • 68% que el intervaloβ^±smiβ{\displaystyle {\hat {\beta }}\pm se_{\beta }}abarca el verdadero valor del coeficiente
  • 95% de que el intervaloβ^±2smiβ{\displaystyle {\hat {\beta }}\pm 2se_{\beta }}abarca el verdadero valor del coeficiente
  • 99% de que el intervaloβ^±2.5smiβ{\displaystyle {\hat {\beta }}\pm 2.5se_{\beta }}abarca el verdadero valor del coeficiente

La suposición no es descabellada cuando n  >> m . Si los errores experimentales se distribuyen normalmente, los parámetros pertenecerán a una distribución t de Student con nm grados de libertad . Cuando nm, la distribución t de Student se aproxima a una distribución normal. Sin embargo, cabe señalar que estos límites de confianza no pueden tener en cuenta el error sistemático. Además, los errores de los parámetros deben citarse con una sola cifra significativa, ya que están sujetos a error de muestreo . [ 4 ]     

Cuando el número de observaciones es relativamente pequeño, la desigualdad de Chebyshev puede utilizarse como límite superior para las probabilidades, independientemente de cualquier suposición sobre la distribución de los errores experimentales: las probabilidades máximas de que un parámetro se desvíe más de 1, 2 o 3 desviaciones estándar de su valor esperado son del 100%, 25% y 11% respectivamente.

Valores residuales y correlación

Los residuos están relacionados con las observaciones por r^=yincógnitaβ^=yHy=(IH)y,{\displaystyle \mathbf {\hat {r}} =\mathbf {y} -X{\hat {\boldsymbol {\beta }}}=\mathbf {y} -H\mathbf {y} =(I-H)\mathbf {y} ,}

donde H es la matriz idempotente conocida como matriz sombrero : H=incógnita(incógnitaTWincógnita)1incógnitaTW,{\displaystyle H=X\left(X^{\textsf {T}}WX\right)^{-1}X^{\textsf {T}}W,}

y I es la matriz identidad . La matriz de varianza-covarianza de los residuos, M r, viene dada por METROr=(IH)METRO(IH)T.{\displaystyle M^{\mathbf {r} }=(I-H)M(I-H)^{\textsf {T}}.}

Por lo tanto, los residuos están correlacionados, incluso si las observaciones no lo están.

CuandoW=METRO1{\displaystyle W=M^{-1}}, METROr=(IH)METRO.{\displaystyle M^{\mathbf {r} }=(I-H)M.}

La suma de los valores residuales ponderados es igual a cero siempre que la función del modelo contenga un término constante. Multiplique por la izquierda la expresión de los residuos por X T W T : incógnitaTWr^=incógnitaTWyincógnitaTWincógnitaβ^=incógnitaTWy(incógnitaTWincógnita)(incógnitaTWincógnita)1incógnitaTWy=0.{\displaystyle X^{\textsf {T}}W{\hat {\mathbf {r} }}=X^{\textsf {T}}W\mathbf {y} -X^{\textsf {T}}WX{\hat {\boldsymbol {\beta }}}=X^{\textsf {T}}W\mathbf {y} -\left(X^{\rm {T}}WX\right)\left(X^{\textsf {T}}WX\right)^{-1}X^{\textsf {T}}W\mathbf {y} =\mathbf {0} .}

Digamos, por ejemplo, que el primer término del modelo es una constante, de modo queincógnitai1=1{\displaystyle X_{i1}=1}para todo i . En ese caso se deduce que imetroincógnitai1Wir^i=imetroWir^i=0.{\displaystyle \sum _{i}^{m}X_{i1}W_{i}{\hat {r}}_{i}=\sum _{i}^{m}W_{i}{\hat {r}}_{i}=0.}

Así pues, en el ejemplo motivacional anterior, el hecho de que la suma de los valores residuales sea igual a cero no es accidental, sino que es consecuencia de la presencia del término constante α en el modelo.

Si el error experimental sigue una distribución normal , entonces, debido a la relación lineal entre los residuos y las observaciones, los residuos también deberían seguirla [ 5 ]. Sin embargo, dado que las observaciones son solo una muestra de la población de todas las observaciones posibles, los residuos deberían pertenecer a una distribución t de Student . Los residuos estudentizados son útiles para realizar una prueba estadística de un valor atípico cuando un residuo en particular parece ser excesivamente grande.

Véase también

Referencias

  1. "Regresión ponderada" . Archivado del original el 21/04/2022 . Consultado el 16/10/2018 .
  2. "Visualizar una regresión ponderada" .
  3. 1 2 Strutz, T. (2016). "3". Ajuste de datos e incertidumbre (Una introducción práctica a los mínimos cuadrados ponderados y más allá) . Springer Vieweg. ISBN 978-3-658-11455-8.
  4. Mandel, John (1964). El análisis estadístico de datos experimentales . Nueva York: Interscience.
  5. Mardia, KV; Kent, JT; Bibby, JM (1979). Análisis multivariante . Nueva York: Academic Press. ISBN 0-12-471250-9.