Articulo de referencia

estimador de error cuadrático medio mínimo

En estadística y procesamiento de señales , un estimador de mínimo error cuadrático medio ( estimador MMSE ) es un método de estimación que minimiza el error cuadrático medio (M...

En estadística y procesamiento de señales , un estimador de mínimo error cuadrático medio ( estimador MMSE ) es un método de estimación que minimiza el error cuadrático medio (MSE), una medida común de la calidad del estimador, de los valores ajustados de una variable dependiente . En el contexto bayesiano , MMSE se refiere más específicamente a la estimación con una función de pérdida cuadrática . En este caso, el estimador MMSE viene dado por la media posterior del parámetro a estimar. Dado que la media posterior es difícil de calcular, la forma del estimador MMSE suele estar restringida a una determinada clase de funciones. Los estimadores MMSE lineales son una opción popular debido a su facilidad de uso, cálculo y versatilidad. Esto ha dado lugar a muchos estimadores populares, como el filtro de Wiener-Kolmogorov y el filtro de Kalman .

Motivación

El término MMSE se refiere más específicamente a la estimación en un entorno bayesiano con una función de coste cuadrática. La idea básica del enfoque bayesiano para la estimación surge de situaciones prácticas en las que a menudo disponemos de información previa sobre el parámetro a estimar. Por ejemplo, podemos tener información previa sobre el rango que puede tomar el parámetro; o podemos tener una estimación anterior del parámetro que queremos modificar cuando se dispone de una nueva observación; o las estadísticas de una señal aleatoria real, como el habla. Esto contrasta con el enfoque no bayesiano, como el estimador insesgado de mínima varianza (MVUE), donde no se asume que se conozca absolutamente nada sobre el parámetro de antemano y que no tiene en cuenta tales situaciones. En el enfoque bayesiano, dicha información previa se captura mediante la función de densidad de probabilidad previa de los parámetros; y, basándose directamente en el teorema de Bayes , nos permite realizar mejores estimaciones posteriores a medida que se dispone de más observaciones. Así, a diferencia del enfoque no bayesiano, donde se asume que los parámetros de interés son deterministas pero constantes desconocidas, el estimador bayesiano busca estimar un parámetro que es en sí mismo una variable aleatoria . Además, la estimación bayesiana también puede abordar situaciones en las que la secuencia de observaciones no es necesariamente independiente. Por lo tanto, la estimación bayesiana proporciona otra alternativa al MVUE. Esto resulta útil cuando el MVUE no existe o no se puede encontrar.

Definición

Dejarincógnita{\displaystyle x}ser unnorte×1{\displaystyle n\times 1}variable vectorial aleatoria oculta, y deje quey{\displaystyle y}ser unmetro×1{\displaystyle m\times 1}Variable vectorial aleatoria conocida (la medición u observación), ambas no necesariamente de la misma dimensión. Un estimadorincógnita^(y){\displaystyle {\hat {x}}(y)}deincógnita{\displaystyle x}es cualquier función de la medicióny{\displaystyle y}El vector de error de estimación viene dado pormi=incógnita^incógnita{\displaystyle e={\hat {x}}-x}y su error cuadrático medio (ECM) viene dado por la traza de la matriz de covarianza del error.

MSE=tr{mi{(incógnita^incógnita)(incógnita^incógnita)T}}=mi{(incógnita^incógnita)T(incógnita^incógnita)},{\displaystyle \operatorname {MSE} =\operatorname {tr} \left\{\operatorname {E} \{({\hat {x}}-x)({\hat {x}}-x)^{T}\}\right\}=\operatorname {E} \{({\hat {x}}-x)^{T}({\hat {x}}-x)\},}

donde la expectativami{\displaystyle \operatorname {E} }es tomadoincógnita{\displaystyle x}condicionado ay{\displaystyle y}. Cuandoincógnita{\displaystyle x}es una variable escalar, la expresión MSE se simplifica ami{(incógnita^incógnita)2}{\displaystyle \operatorname {E} \left\{({\hat {x}}-x)^{2}\right\}}. Tenga en cuenta que el MSE puede definirse de forma equivalente de otras maneras, ya que

tr{mi{mimiT}}=mi{tr{mimiT}}=mi{miTmi}=i=1nortemi{mii2}.{\displaystyle \operatorname {tr} \left\{\operatorname {E} \{ee^{T}\}\right\}=\operatorname {E} \left\{\operatorname {tr} \{ee^{T}\}\right\}=\operatorname {E} \{e^{T}e\}=\sum _{i=1}^{n}\operatorname {E} \{e_{i}^{2}\}.}

El estimador MMSE se define entonces como el estimador que logra el MSE mínimo:

incógnita^MMSE(y)=argininaincógnita^MSE.{\displaystyle {\hat {x}}_{\operatorname {MMSE} }(y)=\operatorname {argmin} _{\hat {x}}\operatorname {MSE} .}

Propiedades

  • Cuando las medias y las varianzas son finitas, el estimador MMSE está definido de forma única [ 1 ] y viene dado por:
incógnita^MMSE(y)=mi{incógnitay}.{\displaystyle {\hat {x}}_{\operatorname {MMSE} }(y)=\operatorname {E} \{x\mid y\}.}
En otras palabras, el estimador MMSE es la esperanza condicional deincógnita{\displaystyle x}dado el valor observado conocido de las mediciones. Además, dado queincógnita^METROMETROSmi{\displaystyle {\hat {x}}_{\mathrm {MMSE} }}es la media posterior, la matriz de covarianza del errordomi=mi{(incógnita^incógnita)(incógnita^incógnita)T}{\displaystyle C_{e}=\operatorname {E} \{({\hat {x}}-x)({\hat {x}}-x)^{T}\}}es igual a la covarianza posteriordoincógnita|Y{\displaystyle C_{X|Y}}matriz,
domi=doincógnita|Y{\displaystyle C_{e}=C_{X|Y}}.
  • El estimador MMSE es insesgado (bajo los supuestos de regularidad mencionados anteriormente):
mi{incógnita^MMSE(y)}=mi{mi{incógnitay}}=mi{incógnita}.{\displaystyle \operatorname {E} \{{\hat {x}}_{\operatorname {MMSE} }(y)\}=\operatorname {E} \{\operatorname {E} \{x\mid y\}\}=\operatorname {E} \{x\}.}
norte(incógnita^MMSEincógnita)dnorte(0,I1(incógnita)),{\displaystyle {\sqrt {n}}({\hat {x}}_{\operatorname {MMSE} }-x)\xrightarrow {d} {\mathcal {N}}\left(0,I^{-1}(x)\right),}
dóndeI(incógnita){\displaystyle I(x)}es la información de Fisher deincógnita{\displaystyle x}Por lo tanto, el estimador MMSE es asintóticamente eficiente .
  • El principio de ortogonalidad : Cuandoincógnita{\displaystyle x}es un escalar, un estimador restringido a tener cierta formaincógnita^=gramo(y){\displaystyle {\hat {x}}=g(y)}es un estimador óptimo, es decirincógnita^MMSE=gramo(y),{\displaystyle {\hat {x}}_{\operatorname {MMSE} }=g^{*}(y),}si y solo si
mi{(incógnita^MMSEincógnita)gramo(y)}=0{\displaystyle \operatorname {E} \{({\hat {x}}_{\operatorname {MMSE} }-x)g(y)\}=0}
a pesar degramo(y){\displaystyle g(y)}en un subespacio lineal cerradoV={gramo(y)gramo:RmetroR,mi{gramo(y)2}<+}{\displaystyle {\mathcal {V}}=\{g(y)\mid g:\mathbb {R} ^{m}\rightarrow \mathbb {R} ,\operatorname {E} \{g(y)^{2}\}<+\infty \}}de las mediciones. Para vectores aleatorios, dado que el MSE para la estimación de un vector aleatorio es la suma de los MSE de las coordenadas, encontrar el estimador MMSE de un vector aleatorio se descompone en encontrar los estimadores MMSE de las coordenadas de X por separado:
mi{(gramoi(y)incógnitai)gramoj(y)}=0,{\displaystyle \operatorname {E} \{(g_{i}^{*}(y)-x_{i})g_{j}(y)\}=0,}
para todo i y j . Dicho de forma más concisa, la correlación cruzada entre el error de estimación mínimoincógnita^MMSEincógnita{\displaystyle {\hat {x}}_{\operatorname {MMSE} }-x}y el estimadorincógnita^{\displaystyle {\hat {x}}}debería ser cero,
mi{(incógnita^MMSEincógnita)incógnita^T}=0.{\displaystyle \operatorname {E} \{({\hat {x}}_{\operatorname {MMSE} }-x){\hat {x}}^{T}\}=0.}
  • Siincógnita{\displaystyle x}yy{\displaystyle y}Si son conjuntamente gaussianas , entonces el estimador MMSE es lineal, es decir, tiene la formaWy+b{\displaystyle Wy+b}para matrizW{\displaystyle W}y constanteb{\displaystyle b}Esto se puede demostrar directamente utilizando el teorema de Bayes. En consecuencia, para hallar el estimador MMSE, basta con hallar el estimador MMSE lineal.

Estimador MMSE lineal

En muchos casos, no es posible determinar la expresión analítica del estimador MMSE. Dos enfoques numéricos básicos para obtener la estimación MMSE dependen de encontrar la esperanza condicional.mi{incógnitay}{\displaystyle \operatorname {E} \{x\mid y\}}o encontrar los mínimos del MSE. La evaluación numérica directa de la esperanza condicional es computacionalmente costosa, ya que a menudo requiere integración multidimensional, generalmente realizada mediante métodos de Monte Carlo . Otro enfoque computacional consiste en buscar directamente los mínimos del MSE utilizando técnicas como los métodos de descenso de gradiente estocástico ; pero este método aún requiere la evaluación de la esperanza. Si bien estos métodos numéricos han sido fructíferos, es posible obtener una expresión analítica para el estimador MMSE si estamos dispuestos a hacer algunas concesiones.

Una posibilidad es abandonar los requisitos de optimalidad total y buscar una técnica que minimice el MSE dentro de una clase particular de estimadores, como la clase de estimadores lineales. Por lo tanto, postulamos que la esperanza condicional deincógnita{\displaystyle x}dadoy{\displaystyle y}es una función lineal simple dey{\displaystyle y},mi{incógnitay}=Wy+b{\displaystyle \operatorname {E} \{x\mid y\}=Wy+b}donde la medicióny{\displaystyle y}es un vector aleatorio,W{\displaystyle W}es una matriz yb{\displaystyle b}es un vector. Esto puede verse como la aproximación de Taylor de primer orden demi{incógnitay}{\displaystyle \operatorname {E} \{x\mid y\}}El estimador MMSE lineal es el estimador que logra el mínimo MSE entre todos los estimadores de esta forma. Es decir, resuelve el siguiente problema de optimización:

minW,bMSEcalleincógnita^=Wy+b.{\displaystyle \min _{W,b}\operatorname {MSE} \qquad {\text{s.t.}}\qquad {\hat {x}}=Wy+b.}

Una ventaja de este estimador MMSE lineal es que no es necesario calcular explícitamente la función de densidad de probabilidad posterior deincógnita{\displaystyle x}. Dicho estimador lineal solo depende de los dos primeros momentos deincógnita{\displaystyle x}yy{\displaystyle y}. Por lo tanto, aunque puede ser conveniente suponer queincógnita{\displaystyle x}yy{\displaystyle y}Si ambas distribuciones son gaussianas, no es necesario asumir que la distribución supuesta tiene momentos de primer y segundo orden bien definidos. La forma del estimador lineal no depende del tipo de distribución subyacente supuesta.

La expresión para óptimob{\displaystyle b}yW{\displaystyle W}está dado por:

b=incógnita¯Wy¯,{\displaystyle b={\bar {x}}-W{\bar {y}},}
W=doincógnitaYdoY1.{\displaystyle W=C_{XY}C_{Y}^{-1}.}

dóndeincógnita¯=mi{incógnita}{\displaystyle {\bar {x}}=\operatorname {E} \{x\}},y¯=mi{y},{\displaystyle {\bar {y}}=\operatorname {E} \{y\},}eldoincógnitaY{\displaystyle C_{XY}}es la matriz de covarianza cruzada entreincógnita{\displaystyle x}yy{\displaystyle y}, eldoY{\displaystyle C_{Y}}es la matriz de autocovarianza dey{\displaystyle y}.

Por lo tanto, la expresión para el estimador MMSE lineal, su media y su autocovarianza viene dada por

incógnita^=doincógnitaYdoY1(yy¯)+incógnita¯,{\displaystyle {\hat {x}}=C_{XY}C_{Y}^{-1}(y-{\bar {y}})+{\bar {x}},}
mi{incógnita^}=incógnita¯,{\displaystyle \operatorname {E} \{{\hat {x}}\}={\bar {x}},}
doincógnita^=doincógnitaYdoY1doYincógnita,{\displaystyle C_{\hat {X}}=C_{XY}C_{Y}^{-1}C_{YX},}

donde eldoYincógnita{\displaystyle C_{YX}}es la matriz de covarianza cruzada entrey{\displaystyle y}yincógnita{\displaystyle x}.

Por último, la covarianza del error y el error cuadrático medio mínimo alcanzable por dicho estimador son:

domi=doincógnitadoincógnita^=doincógnitadoincógnitaYdoY1doYincógnita,{\displaystyle C_{e}=C_{X}-C_{\hat {X}}=C_{X}-C_{XY}C_{Y}^{-1}C_{YX},}
LMMSE=tr{domi}.{\displaystyle \operatorname {LMMSE} =\operatorname {tr} \{C_{e}\}.}
Derivación mediante el principio de ortogonalidad

Consideremos el estimador MMSE lineal óptimo dado por:incógnita^=Wy+b{\displaystyle {\hat {x}}=Wy+b}, donde se nos exige encontrar la expresión paraW{\displaystyle W}yb{\displaystyle b}. Se requiere que el estimador MMSE sea insesgado. Esto significa que,

mi{incógnita^}=mi{incógnita}.{\displaystyle \operatorname {E} \{{\hat {x}}\}=\operatorname {E} \{x\}.}

Conectando la expresión paraincógnita^{\displaystyle {\hat {x}}}arriba, obtenemos

b=incógnita¯Wy¯,{\displaystyle b={\bar {x}}-W{\bar {y}},}

dóndeincógnita¯=mi{incógnita}{\displaystyle {\bar {x}}=\operatorname {E} \{x\}}yy¯=mi{y}{\displaystyle {\bar {y}}=\operatorname {E} \{y\}}. Por lo tanto, podemos reescribir el estimador como

incógnita^=W(yy¯)+incógnita¯{\displaystyle {\hat {x}}=W(y-{\bar {y}})+{\bar {x}}}

y la expresión para el error de estimación se convierte en

incógnita^incógnita=W(yy¯)(incógnitaincógnita¯).{\displaystyle {\hat {x}}-x=W(y-{\bar {y}})-(x-{\bar {x}}).}

A partir del principio de ortogonalidad, podemos tenermi{(incógnita^incógnita)(yy¯)T}=0{\displaystyle \operatorname {E} \{({\hat {x}}-x)(y-{\bar {y}})^{T}\}=0}, donde tomamosgramo(y)=yy¯{\displaystyle g(y)=y-{\bar {y}}}. Aquí el término del lado izquierdo es

mi{(incógnita^incógnita)(yy¯)T}=mi{(W(yy¯)(incógnitaincógnita¯))(yy¯)T}=Wmi{(yy¯)(yy¯)T}mi{(incógnitaincógnita¯)(yy¯)T}=WdoYdoincógnitaY.{\displaystyle {\begin{aligned}\operatorname {E} \{({\hat {x}}-x)(y-{\bar {y}})^{T}\}&=\operatorname {E} \{(W(y-{\bar {y}})-(x-{\bar {x}}))(y-{\bar {y}})^{T}\}\\&=W\operatorname {E} \{(y-{\bar {y}})(y-{\bar {y}})^{T}\}-\operatorname {E} \{(x-{\bar {x}})(y-{\bar {y}})^{T}\}\\&=WC_{Y}-C_{XY}.\end{aligned}}}

Cuando igualamos a cero, obtenemos la expresión deseada paraW{\displaystyle W}como

W=doincógnitaYdoY1.{\displaystyle W=C_{XY}C_{Y}^{-1}.}

EldoincógnitaY{\displaystyle C_{XY}}es la matriz de covarianza cruzada entre X e Y, ydoY{\displaystyle C_{Y}}es la matriz de autocovarianza de Y. Dado quedoincógnitaY=doYincógnitaT{\displaystyle C_{XY}=C_{YX}^{T}}, la expresión también puede reescribirse en términos dedoYincógnita{\displaystyle C_{YX}}como

WT=doY1doYincógnita.{\displaystyle W^{T}=C_{Y}^{-1}C_{YX}.}

Por lo tanto, la expresión completa para el estimador MMSE lineal es

incógnita^=doincógnitaYdoY1(yy¯)+incógnita¯.{\displaystyle {\hat {x}}=C_{XY}C_{Y}^{-1}(y-{\bar {y}})+{\bar {x}}.}

Desde la estimaciónincógnita^{\displaystyle {\hat {x}}}es en sí misma una variable aleatoria conmi{incógnita^}=incógnita¯{\displaystyle \operatorname {E} \{{\hat {x}}\}={\bar {x}}}, también podemos obtener su autocovarianza como

doincógnita^=mi{(incógnita^incógnita¯)(incógnita^incógnita¯)T}=Wmi{(yy¯)(yy¯)T}WT=WdoYWT.{\displaystyle {\begin{aligned}C_{\hat {X}}&=\operatorname {E} \{({\hat {x}}-{\bar {x}})({\hat {x}}-{\bar {x}})^{T}\}\\&=W\operatorname {E} \{(y-{\bar {y}})(y-{\bar {y}})^{T}\}W^{T}\\&=WC_{Y}W^{T}.\\\end{aligned}}}

Poniendo la expresión paraW{\displaystyle W}yWT{\displaystyle W^{T}}, obtenemos

doincógnita^=doincógnitaYdoY1doYincógnita.{\displaystyle C_{\hat {X}}=C_{XY}C_{Y}^{-1}C_{YX}.}

Por último, la covarianza del error de estimación MMSE lineal vendrá dada por

domi=mi{(incógnita^incógnita)(incógnita^incógnita)T}=mi{(incógnita^incógnita)(W(yy¯)(incógnitaincógnita¯))T}=mi{(incógnita^incógnita)(yy¯)T}0WTmi{(incógnita^incógnita)(incógnitaincógnita¯)T}=mi{(W(yy¯)(incógnitaincógnita¯))(incógnitaincógnita¯)T}=mi{(incógnitaincógnita¯)(incógnitaincógnita¯)T}Wmi{(yy¯)(incógnitaincógnita¯)T}=doincógnitaWdoYincógnita.{\displaystyle {\begin{aligned}C_{e}&=\operatorname {E} \{({\hat {x}}-x)({\hat {x}}-x)^{T}\}\\&=\operatorname {E} \{({\hat {x}}-x)(W(y-{\bar {y}})-(x-{\bar {x}}))^{T}\}\\&=\underbrace {\operatorname {E} \{({\hat {x}}-x)(y-{\bar {y}})^{T}\}} _{0}W^{T}-\operatorname {E} \{({\hat {x}}-x)(x-{\bar {x}})^{T}\}\\&=-\operatorname {E} \{(W(y-{\bar {y}})-(x-{\bar {x}}))(x-{\bar {x}})^{T}\}\\&=\operatorname {E} \{(x-{\bar {x}})(x-{\bar {x}})^{T}\}-W\operatorname {E} \{(y-{\bar {y}})(x-{\bar {x}})^{T}\}\\&=C_{X}-WC_{YX}.\end{aligned}}}

El primer término de la tercera línea es cero debido al principio de ortogonalidad. Dado queW=doincógnitaYdoY1{\displaystyle W=C_{XY}C_{Y}^{-1}}, podemos reescribirdomi{\displaystyle C_{e}}en términos de matrices de covarianza como

domi=doincógnitadoincógnitaYdoY1doYincógnita.{\displaystyle C_{e}=C_{X}-C_{XY}C_{Y}^{-1}C_{YX}.}

Podemos reconocer que esto es lo mismo quedomi=doincógnitadoincógnita^.{\displaystyle C_{e}=C_{X}-C_{\hat {X}}.}Por lo tanto, el error cuadrático medio mínimo alcanzable por dicho estimador lineal es

LMMSE=tr{domi}{\displaystyle \operatorname {LMMSE} =\operatorname {tr} \{C_{e}\}}.

Caso univariado

Para el caso especial en que ambosincógnita{\displaystyle x}yy{\displaystyle y}son escalares, las relaciones anteriores se simplifican a

incógnita^=σincógnitaYσY2(yy¯)+incógnita¯=ρσincógnitaσY(yy¯)+incógnita¯,{\displaystyle {\hat {x}}={\frac {\sigma _{XY}}{\sigma _{Y}^{2}}}(y-{\bar {y}})+{\bar {x}}=\rho {\frac {\sigma _{X}}{\sigma _{Y}}}(y-{\bar {y}})+{\bar {x}},}
σmi2=σincógnita2σincógnitaY2σY2=(1ρ2)σincógnita2,{\displaystyle \sigma _{e}^{2}=\sigma _{X}^{2}-{\frac {\sigma _{XY}^{2}}{\sigma _{Y}^{2}}}=(1-\rho ^{2})\sigma _{X}^{2},}

dóndeρ=σincógnitaYσincógnitaσY{\displaystyle \rho ={\frac {\sigma _{XY}}{\sigma _{X}\sigma _{Y}}}}es el coeficiente de correlación de Pearson entreincógnita{\displaystyle x}yy{\displaystyle y}.

Las dos ecuaciones anteriores nos permiten interpretar el coeficiente de correlación como la pendiente normalizada de la regresión lineal.

(incógnita^incógnita¯σincógnita)=ρ(yy¯σY){\displaystyle \left({\frac {{\hat {x}}-{\bar {x}}}{\sigma _{X}}}\right)=\rho \left({\frac {y-{\bar {y}}}{\sigma _{Y}}}\right)}

o como raíz cuadrada de la razón de dos varianzas

ρ2=σincógnita2σmi2σincógnita2=σincógnita^2σincógnita2{\displaystyle \rho ^{2}={\frac {\sigma _{X}^{2}-\sigma _{e}^{2}}{\sigma _{X}^{2}}}={\frac {\sigma _{\hat {X}}^{2}}{\sigma _{X}^{2}}}}.

Cuandoρ=0{\displaystyle \rho =0}, tenemosincógnita^=incógnita¯{\displaystyle {\hat {x}}={\bar {x}}}yσmi2=σincógnita2{\displaystyle \sigma _{e}^{2}=\sigma _{X}^{2}}En este caso, no se obtiene información nueva de la medición, lo que puede disminuir la incertidumbre enincógnita{\displaystyle x}. Por otro lado, cuandoρ=±1{\displaystyle \rho =\pm 1}, tenemosincógnita^=σincógnitaYσY(yy¯)+incógnita¯{\displaystyle {\hat {x}}={\frac {\sigma _{XY}}{\sigma _{Y}}}(y-{\bar {y}})+{\bar {x}}}yσmi2=0{\displaystyle \sigma _{e}^{2}=0}. Aquíincógnita{\displaystyle x}está completamente determinado pory{\displaystyle y}, según lo indicado por la ecuación de la línea recta.

Cálculo

Se puede utilizar un método estándar como la eliminación de Gauss para resolver la ecuación matricial paraW{\displaystyle W}. Un método numéricamente más estable lo proporciona el método de descomposición QR . Dado que la matrizdoY{\displaystyle C_{Y}}es una matriz simétrica definida positiva,W{\displaystyle W}se puede resolver dos veces más rápido con la descomposición de Cholesky , mientras que para sistemas dispersos grandes el método del gradiente conjugado es más efectivo. La recursión de Levinson es un método rápido cuandodoY{\displaystyle C_{Y}}También es una matriz de Toeplitz . Esto puede ocurrir cuandoy{\displaystyle y}es un proceso estacionario en sentido amplio . En tales casos estacionarios, estos estimadores también se denominan filtros de Wiener-Kolmogorov .

Estimador MMSE lineal para procesos de observación lineales

Modelemos además el proceso subyacente de observación como un proceso lineal:y=Aincógnita+z{\displaystyle y=Ax+z}, dóndeA{\displaystyle A}es una matriz conocida yz{\displaystyle z}es un vector de ruido aleatorio con la mediami{z}=0{\displaystyle \operatorname {E} \{z\}=0}y covarianza cruzadadoincógnitaZ=0{\displaystyle C_{XZ}=0}Aquí se requerirán la media y las matrices de covarianza.

mi{y}=Aincógnita¯,{\displaystyle \operatorname {E} \{y\}=A{\bar {x}},}
doY=AdoincógnitaAT+doZ,{\displaystyle C_{Y}=AC_{X}A^{T}+C_{Z},}
doincógnitaY=doincógnitaAT.{\displaystyle C_{XY}=C_{X}A^{T}.}

Por lo tanto, la expresión para la matriz del estimador MMSE linealW{\displaystyle W}modifica aún más a

W=doincógnitaAT(AdoincógnitaAT+doZ)1.{\displaystyle W=C_{X}A^{T}(AC_{X}A^{T}+C_{Z})^{-1}.}

Poner todo en la expresión paraincógnita^{\displaystyle {\hat {x}}}, obtenemos

incógnita^=doincógnitaAT(AdoincógnitaAT+doZ)1(yAincógnita¯)+incógnita¯.{\displaystyle {\hat {x}}=C_{X}A^{T}(AC_{X}A^{T}+C_{Z})^{-1}(y-A{\bar {x}})+{\bar {x}}.}

Por último, la covarianza del error es

domi=doincógnitadoincógnita^=doincógnitadoincógnitaAT(AdoincógnitaAT+doZ)1Adoincógnita.{\displaystyle C_{e}=C_{X}-C_{\hat {X}}=C_{X}-C_{X}A^{T}(AC_{X}A^{T}+C_{Z})^{-1}AC_{X}.}

La diferencia significativa entre el problema de estimación tratado anteriormente y los de mínimos cuadrados y estimación de Gauss-Markov es que el número de observaciones m , (es decir, la dimensión dey{\displaystyle y}) no tiene por qué ser al menos tan grande como el número de incógnitas, n , (es decir, la dimensión deincógnita{\displaystyle x}). La estimación para el proceso de observación lineal existe siempre que la matriz m por m(AdoincógnitaAT+doZ)1{\displaystyle (AC_{X}A^{T}+C_{Z})^{-1}}existe; este es el caso para cualquier m si, por ejemplo,doZ{\displaystyle C_{Z}}es definida positiva. Físicamente, la razón de esta propiedad es que, dado queincógnita{\displaystyle x}Ahora que es una variable aleatoria, es posible formar una estimación significativa (a saber, su media) incluso sin mediciones. Cada nueva medición simplemente proporciona información adicional que puede modificar nuestra estimación original. Otra característica de esta estimación es que para m < n , no es necesario que haya error de medición. Por lo tanto, podemos tenerdoZ=0{\displaystyle C_{Z}=0}, porque mientrasAdoincógnitaAT{\displaystyle AC_{X}A^{T}}Si es definida positiva, la estimación aún existe. Por último, esta técnica puede manejar casos donde el ruido está correlacionado.

Forma alternativa

Se puede obtener una forma de expresión alternativa utilizando la identidad matricial.

doincógnitaAT(AdoincógnitaAT+doZ)1=(ATdoZ1A+doincógnita1)1ATdoZ1,{\displaystyle C_{X}A^{T}(AC_{X}A^{T}+C_{Z})^{-1}=(A^{T}C_{Z}^{-1}A+C_{X}^{-1})^{-1}A^{T}C_{Z}^{-1},}

lo cual se puede establecer mediante la postmultiplicación por(AdoincógnitaAT+doZ){\displaystyle (AC_{X}A^{T}+C_{Z})}y premultiplicando por(ATdoZ1A+doincógnita1),{\displaystyle (A^{T}C_{Z}^{-1}A+C_{X}^{-1}),}para obtener

W=(ATdoZ1A+doincógnita1)1ATdoZ1,{\displaystyle W=(A^{T}C_{Z}^{-1}A+C_{X}^{-1})^{-1}A^{T}C_{Z}^{-1},}

y

domi=(ATdoZ1A+doincógnita1)1.{\displaystyle C_{e}=(A^{T}C_{Z}^{-1}A+C_{X}^{-1})^{-1}.}

DesdeW{\displaystyle W}ahora se puede escribir en términos dedomi{\displaystyle C_{e}}comoW=domiATdoZ1{\displaystyle W=C_{e}A^{T}C_{Z}^{-1}}, obtenemos una expresión simplificada paraincógnita^{\displaystyle {\hat {x}}}como

incógnita^=domiATdoZ1(yAincógnita¯)+incógnita¯.{\displaystyle {\hat {x}}=C_{e}A^{T}C_{Z}^{-1}(y-A{\bar {x}})+{\bar {x}}.}

En esta forma, la expresión anterior se puede comparar fácilmente con mínimos cuadrados ponderados , estimación de Gauss-Markov y regresión de cresta . En particular, cuandodoincógnita1=0{\displaystyle C_{X}^{-1}=0}, correspondiente a una varianza infinita de la información a priori sobreincógnita{\displaystyle x}, el resultadoW=(ATdoZ1A)1ATdoZ1{\displaystyle W=(A^{T}C_{Z}^{-1}A)^{-1}A^{T}C_{Z}^{-1}}es idéntico a la estimación de mínimos cuadrados lineales ponderados condoZ1{\displaystyle C_{Z}^{-1}}como la matriz de pesos. Además, si los componentes dez{\displaystyle z}no están correlacionados y tienen varianza igual, de modo quedoZ=σ2I,{\displaystyle C_{Z}=\sigma ^{2}I,}dóndeI{\displaystyle I}es una matriz identidad, entoncesW=(ATA)1AT{\displaystyle W=(A^{T}A)^{-1}A^{T}}es idéntico a la estimación de mínimos cuadrados ordinarios. Cuando se dispone de información a priori comodoincógnita=σincógnita2I{\displaystyle C_{X}=\sigma _{X}^{2}I}y elz{\displaystyle z}no están correlacionados y tienen la misma varianza quedoZ=σZ2I{\displaystyle C_{Z}=\sigma _{Z}^{2}I}, tenemosW=(ATA+λI)1AT{\displaystyle W=(A^{T}A+\lambda I)^{-1}A^{T}}, dóndeλ=σZ2/σincógnita2{\displaystyle \lambda =\sigma _{Z}^{2}/\sigma _{X}^{2}}, que es idéntica a la solución de regresión de cresta.

Estimación secuencial lineal MMSE

En muchas aplicaciones en tiempo real, los datos de observación no están disponibles en un único lote. En cambio, las observaciones se realizan de forma secuencial. Un posible enfoque consiste en utilizar las observaciones secuenciales para actualizar una estimación anterior a medida que se dispone de datos adicionales, lo que da lugar a estimaciones más precisas. Una diferencia crucial entre la estimación por lotes y la estimación secuencial es que esta última requiere una suposición de Markov adicional.

En el marco bayesiano, dicha estimación recursiva se facilita fácilmente utilizando la regla de Bayes. Dadok{\displaystyle k}observaciones,y1,,yk{\displaystyle y_{1},\ldots ,y_{k}}, la regla de Bayes nos da la densidad posterior deincógnitak{\displaystyle x_{k}}como

pag(incógnitak|y1,,yk)pag(yk|incógnita,y1,,yk1)pag(incógnitak|y1,,yk1)=pag(yk|incógnitak)pag(incógnitak|y1,,yk1).{\displaystyle {\begin{aligned}p(x_{k}|y_{1},\ldots ,y_{k})&\propto p(y_{k}|x,y_{1},\ldots ,y_{k-1})p(x_{k}|y_{1},\ldots ,y_{k-1})\\&=p(y_{k}|x_{k})p(x_{k}|y_{1},\ldots ,y_{k-1}).\end{aligned}}}

Elpag(incógnitak|y1,,yk){\displaystyle p(x_{k}|y_{1},\ldots ,y_{k})}se denomina densidad posterior,pag(yk|incógnitak){\displaystyle p(y_{k}|x_{k})}se denomina función de verosimilitud, ypag(incógnitak|y1,,yk1){\displaystyle p(x_{k}|y_{1},\ldots ,y_{k-1})}es la densidad previa del k -ésimo paso de tiempo. Aquí hemos asumido la independencia condicional deyk{\displaystyle y_{k}}a partir de observaciones previasy1,,yk1{\displaystyle y_{1},\ldots ,y_{k-1}}dadoincógnita{\displaystyle x}como

pag(yk|incógnitak,y1,,yk1)=pag(yk|incógnitak).{\displaystyle p(y_{k}|x_{k},y_{1},\ldots ,y_{k-1})=p(y_{k}|x_{k}).}

Esta es la suposición de Markov.

La estimación MMSEincógnita^k{\displaystyle {\hat {x}}_{k}}Dado que la k -ésima observación es entonces la media de la densidad posteriorpag(incógnitak|y1,,yk){\displaystyle p(x_{k}|y_{1},\ldots ,y_{k})}. Con la falta de información dinámica sobre cómo el estadoincógnita{\displaystyle x}Dado que cambia con el tiempo, haremos una suposición adicional de estacionariedad sobre la distribución a priori:

pag(incógnitak|y1,,yk1)=pag(incógnitak1|y1,,yk1).{\displaystyle p(x_{k}|y_{1},\ldots ,y_{k-1})=p(x_{k-1}|y_{1},\ldots ,y_{k-1}).}

Por lo tanto, la densidad previa para el paso de tiempo k es la densidad posterior del paso de tiempo ( k -1). Esta estructura nos permite formular un enfoque recursivo para la estimación.

En el contexto del estimador MMSE lineal, la fórmula para la estimación tendrá la misma forma que antes:incógnita^=doincógnitaYdoY1(yy¯)+incógnita¯.{\displaystyle {\hat {x}}=C_{XY}C_{Y}^{-1}(y-{\bar {y}})+{\bar {x}}.}Sin embargo, las matrices de media y covarianza deincógnita{\displaystyle X}yY{\displaystyle Y}será necesario reemplazarlos por otros de la densidad anterior.pag(incógnitak|y1,,yk1){\displaystyle p(x_{k}|y_{1},\ldots ,y_{k-1})}y probabilidadpag(yk|incógnitak){\displaystyle p(y_{k}|x_{k})}, respectivamente.

Para la densidad previapag(incógnitak|y1,,yk1){\displaystyle p(x_{k}|y_{1},\ldots ,y_{k-1})}, su media viene dada por la estimación MMSE anterior,

incógnita¯k=mi[incógnitak|y1,,yk1]=mi[incógnitak1|y1,,yk1]=incógnita^k1{\displaystyle {\bar {x}}_{k}=\mathrm {E} [x_{k}|y_{1},\ldots ,y_{k-1}]=\mathrm {E} [x_{k-1}|y_{1},\ldots ,y_{k-1}]={\hat {x}}_{k-1}},

y su matriz de covarianza viene dada por la matriz de covarianza de error anterior,

doincógnitak|Y1,,Yk1=doincógnitak1|Y1,,Yk1=domik1,{\displaystyle C_{X_{k}|Y_{1},\ldots ,Y_{k-1}}=C_{X_{k-1}|Y_{1},\ldots ,Y_{k-1}}=C_{e_{k-1}},}

de acuerdo con las propiedades de los estimadores MMSE y el supuesto de estacionariedad.

De manera similar, para el proceso de observación lineal, la media de la probabilidadpag(yk|incógnitak){\displaystyle p(y_{k}|x_{k})}es dado pory¯k=Aincógnita¯k=Aincógnita^k1{\displaystyle {\bar {y}}_{k}=A{\bar {x}}_{k}=A{\hat {x}}_{k-1}}y la matriz de covarianza es la misma que antes

doYk|incógnitak=Adoincógnitak|Y1,,Yk1AT+doZ=Adomik1AT+doZ.{\displaystyle {\begin{aligned}C_{Y_{k}|X_{k}}&=AC_{X_{k}|Y_{1},\ldots ,Y_{k-1}}A^{T}+C_{Z}=AC_{e_{k-1}}A^{T}+C_{Z}.\end{aligned}}}.

La diferencia entre el valor previsto deYk{\displaystyle Y_{k}}, según lo dado pory¯k=Aincógnita^k1{\displaystyle {\bar {y}}_{k}=A{\hat {x}}_{k-1}}y su valor observadoyk{\displaystyle y_{k}}da el error de prediccióny~k=yky¯k{\displaystyle {\tilde {y}}_{k}=y_{k}-{\bar {y}}_{k}}, que también se denomina innovación o residuo. Es más conveniente representar el MMSE lineal en términos del error de predicción, cuya media y covarianza sonmi[y~k]=0{\displaystyle \mathrm {E} [{\tilde {y}}_{k}]=0}ydoY~k=doYk|incógnitak{\displaystyle C_{{\tilde {Y}}_{k}}=C_{Y_{k}|X_{k}}}.

Por lo tanto, en la fórmula de actualización de la estimación, debemos reemplazarincógnita¯{\displaystyle {\bar {x}}}ydoincógnita{\displaystyle C_{X}}porincógnita^k1{\displaystyle {\hat {x}}_{k-1}}ydomik1{\displaystyle C_{e_{k-1}}}, respectivamente. Además, deberíamos reemplazary¯{\displaystyle {\bar {y}}}ydoY{\displaystyle C_{Y}}pory¯k1{\displaystyle {\bar {y}}_{k-1}}ydoY~k{\displaystyle C_{{\tilde {Y}}_{k}}}. Por último, reemplazamosdoincógnitaY{\displaystyle C_{XY}}por

doincógnitakYk|Y1,,Yk1=domik1Y~k=domik1AT.{\displaystyle {\begin{aligned}C_{X_{k}Y_{k}|Y_{1},\ldots ,Y_{k-1}}&=C_{e_{k-1}{\tilde {Y}}_{k}}=C_{e_{k-1}}A^{T}.\end{aligned}}}

Por lo tanto, tenemos la nueva estimación como una nueva observación.yk{\displaystyle y_{k}}llega como

incógnita^k=incógnita^k1+domik1Y~kdoY~k1(yky¯k)=incógnita^k1+domik1AT(Adomik1AT+doZ)1(ykAincógnita^k1){\displaystyle {\begin{aligned}{\hat {x}}_{k}&={\hat {x}}_{k-1}+C_{e_{k-1}{\tilde {Y}}_{k}}C_{{\tilde {Y}}_{k}}^{-1}(y_{k}-{\bar {y}}_{k})\\&={\hat {x}}_{k-1}+C_{e_{k-1}}A^{T}(AC_{e_{k-1}}A^{T}+C_{Z})^{-1}(y_{k}-A{\hat {x}}_{k-1})\end{aligned}}}

y la nueva covarianza de error como

domik=domik1domik1AT(Adomik1AT+doZ)1Adomik1.{\displaystyle C_{e_{k}}=C_{e_{k-1}}-C_{e_{k-1}}A^{T}(AC_{e_{k-1}}A^{T}+C_{Z})^{-1}AC_{e_{k-1}}.}

Desde el punto de vista del álgebra lineal, para la estimación secuencial, si tenemos una estimaciónincógnita^1{\displaystyle {\hat {x}}_{1}}basado en mediciones que generan espacioY1{\displaystyle Y_{1}}Luego, tras recibir otro conjunto de mediciones, debemos restar de estas la parte que se podía prever a partir del resultado de las primeras mediciones. En otras palabras, la actualización debe basarse en la parte de los nuevos datos que es ortogonal a los datos anteriores.

El uso repetido de las dos ecuaciones anteriores a medida que se dispone de más observaciones conduce a técnicas de estimación recursivas. Las expresiones se pueden escribir de forma más compacta como

Wk=domik1AT(Adomik1AT+doZ)1,{\displaystyle W_{k}=C_{e_{k-1}}A^{T}(AC_{e_{k-1}}A^{T}+C_{Z})^{-1},}
incógnita^k=incógnita^k1+Wk(ykAincógnita^k1),{\displaystyle {\hat {x}}_{k}={\hat {x}}_{k-1}+W_{k}(y_{k}-A{\hat {x}}_{k-1}),}
domik=(IWkA)domik1.{\displaystyle C_{e_{k}}=(I-W_{k}A)C_{e_{k-1}}.}

La matrizWk{\displaystyle W_{k}}A menudo se le denomina factor de ganancia de Kalman. La formulación alternativa del algoritmo anterior dará como resultado

domik1=domik11+ATdoZ1A,{\displaystyle C_{e_{k}}^{-1}=C_{e_{k-1}}^{-1}+A^{T}C_{Z}^{-1}A,}
Wk=domikATdoZ1,{\displaystyle W_{k}=C_{e_{k}}A^{T}C_{Z}^{-1},}
incógnita^k=incógnita^k1+Wk(ykAincógnita^k1),{\displaystyle {\hat {x}}_{k}={\hat {x}}_{k-1}+W_{k}(y_{k}-A{\hat {x}}_{k-1}),}

La repetición de estos tres pasos a medida que se dispone de más datos da lugar a un algoritmo de estimación iterativo. La generalización de esta idea a casos no estacionarios da origen al filtro de Kalman . Los tres pasos de actualización descritos anteriormente constituyen, de hecho, el paso de actualización del filtro de Kalman.

Caso especial: observaciones escalares

Como un caso especial importante, se puede derivar una expresión recursiva fácil de usar cuando en cada k -ésimo instante de tiempo el proceso de observación lineal subyacente produce un escalar tal queyk=akTincógnitak+zk{\displaystyle y_{k}=a_{k}^{T}x_{k}+z_{k}}, dóndeak{\displaystyle a_{k}}es un vector columna conocido de n por 1 cuyos valores pueden cambiar con el tiempo,incógnitak{\displaystyle x_{k}}es un vector columna aleatorio de n por 1 que se va a estimar, yzk{\displaystyle z_{k}}es un término de ruido escalar con varianzaσk2{\displaystyle \sigma _{k}^{2}}Después de la ( k +1)-ésima observación, el uso directo de las ecuaciones recursivas anteriores proporciona la expresión para la estimación.incógnita^k+1{\displaystyle {\hat {x}}_{k+1}}como:

incógnita^k+1=incógnita^k+wk+1(yk+1ak+1Tincógnita^k){\displaystyle {\hat {x}}_{k+1}={\hat {x}}_{k}+w_{k+1}(y_{k+1}-a_{k+1}^{T}{\hat {x}}_{k})}

dóndeyk+1{\displaystyle y_{k+1}}es la nueva observación escalar y el factor de gananciawk+1{\displaystyle w_{k+1}}es un vector columna de n por 1 dado por

wk+1=domikak+1σk+12+ak+1Tdomikak+1.{\displaystyle w_{k+1}={\frac {C_{e_{k}}a_{k+1}}{\sigma _{k+1}^{2}+a_{k+1}^{T}C_{e_{k}}a_{k+1}}}.}

Eldomik+1{\displaystyle C_{e_{k+1}}}es la matriz de covarianza de errores de n por n dada por

domik+1=(Iwk+1ak+1T)domik.{\displaystyle C_{e_{k+1}}=(I-w_{k+1}a_{k+1}^{T})C_{e_{k}}.}

Aquí no se requiere inversión de matriz. Además, el factor de ganancia,wk+1{\displaystyle w_{k+1}}, depende de nuestra confianza en la nueva muestra de datos, medida por la varianza del ruido, en comparación con la de los datos anteriores. Los valores iniciales deincógnita^{\displaystyle {\hat {x}}}ydomi{\displaystyle C_{e}}se toman como la media y la covarianza de la función de densidad de probabilidad a priori deincógnita{\displaystyle x}.

Enfoques alternativos: Este importante caso especial también ha dado lugar a muchos otros métodos iterativos (o filtros adaptativos ), como el filtro de mínimos cuadrados medios y el filtro recursivo de mínimos cuadrados , que resuelve directamente el problema de optimización MSE original utilizando descensos de gradiente estocásticos . Sin embargo, dado que el error de estimaciónmi{\displaystyle e}Como no se puede observar directamente, estos métodos intentan minimizar el error cuadrático medio de predicción.mi{y~Ty~}{\displaystyle \mathrm {E} \{{\tilde {y}}^{T}{\tilde {y}}\}}Por ejemplo, en el caso de observaciones escalares, tenemos el gradiente.incógnita^mi{y~2}=2mi{y~a}.{\displaystyle \nabla _{\hat {x}}\mathrm {E} \{{\tilde {y}}^{2}\}=-2\mathrm {E} \{{\tilde {y}}a\}.}Por lo tanto, la ecuación de actualización para el filtro de mínimos cuadrados viene dada por

incógnita^k+1=incógnita^k+ηkmi{y~kak},{\displaystyle {\hat {x}}_{k+1}={\hat {x}}_{k}+\eta _{k}\mathrm {E} \{{\tilde {y}}_{k}a_{k}\},}

dóndeηk{\displaystyle \eta _{k}}es el tamaño del paso escalar y la esperanza se aproxima mediante el valor instantáneo.mi{aky~k}aky~k{\displaystyle \mathrm {E} \{a_{k}{\tilde {y}}_{k}\}\approx a_{k}{\tilde {y}}_{k}}Como podemos observar, estos métodos evitan la necesidad de matrices de covarianza.

Caso especial: escalar desconocido

También se puede derivar otra expresión recursiva importante y fácil de usar cuando en cada k -ésimo instante de tiempo el proceso de observación lineal subyacente produce un vector tal queyk=akincógnitak+zk{\displaystyle y_{k}=a_{k}x_{k}+z_{k}}, dóndeak{\displaystyle a_{k}}es un vector columna conocido de m por 1 cuyos valores pueden cambiar con el tiempo,incógnitak{\displaystyle x_{k}}es un escalar desconocido que debe estimarse, yzk{\displaystyle z_{k}}es un término de ruido de m por 1 con covarianzadoZk=σk2I{\displaystyle C_{Z_{k}}=\sigma _{k}^{2}I}. Después de la ( k +1)-ésima observación, utilizando la forma alternativa de las ecuaciones recursivas anteriores, la covarianza del error escalarσmik+12{\displaystyle \sigma _{e_{k+1}}^{2}}es dado por

σmik+12=(1σmik2+ak+1TdoZk+11ak+1)1=(1σmik2+ak+1Tak+1σk+12)1.{\displaystyle \sigma _{e_{k+1}}^{2}=\left({\frac {1}{\sigma _{e_{k}}^{2}}}+a_{k+1}^{T}C_{Z_{k+1}}^{-1}a_{k+1}\right)^{-1}=\left({\frac {1}{\sigma _{e_{k}}^{2}}}+{\frac {a_{k+1}^{T}a_{k+1}}{\sigma _{k+1}^{2}}}\right)^{-1}.}

El factor de gananciawk+1{\displaystyle w_{k+1}}ahora es un vector fila de 1 por m dado por

wk+1=σmik+12ak+1TdoZk+11=σmik+12σk+12ak+1T.{\displaystyle w_{k+1}=\sigma _{e_{k+1}}^{2}a_{k+1}^{T}C_{Z_{k+1}}^{-1}={\frac {\sigma _{e_{k+1}}^{2}}{\sigma _{k+1}^{2}}}a_{k+1}^{T}.}

Por último, dado el nuevo vector de observaciónyk+1{\displaystyle y_{k+1}}la estimaciónincógnita^k+1{\displaystyle {\hat {x}}_{k+1}}es

incógnita^k+1=incógnita^k+wk+1(yk+1ak+1incógnita^k).{\displaystyle {\hat {x}}_{k+1}={\hat {x}}_{k}+w_{k+1}(y_{k+1}-a_{k+1}{\hat {x}}_{k}).}

Caso especial: observación vectorial con ruido no correlacionado

En muchas aplicaciones prácticas, el ruido de observación no está correlacionado. Es decir,doZ{\displaystyle C_{Z}}es una matriz diagonal. En tales casos, es ventajoso considerar los componentes dey{\displaystyle y}como mediciones escalares independientes, en lugar de mediciones vectoriales. Esto nos permite reducir el tiempo de cálculo procesando elmetro×1{\displaystyle m\times 1}vector de medición comometro{\displaystyle m}Mediciones escalares. El uso de la fórmula de actualización escalar evita la inversión de matrices en la implementación de las ecuaciones de actualización de covarianza, mejorando así la robustez numérica frente a errores de redondeo. La actualización se puede implementar iterativamente como:

wk+1()=domik()Ak+1()TdoZk+1()+Ak+1()domik()(Ak+1()T){\displaystyle w_{k+1}^{(\ell )}={\frac {C_{e_{k}}^{(\ell )}A_{k+1}^{(\ell )T}}{C_{Z_{k+1}}^{(\ell )}+A_{k+1}^{(\ell )}C_{e_{k}}^{(\ell )}(A_{k+1}^{(\ell )T})}}}
domik+1()=(Iwk+1()Ak+1())domik(){\displaystyle C_{e_{k+1}}^{(\ell )}=(I-w_{k+1}^{(\ell )}A_{k+1}^{(\ell )})C_{e_{k}}^{(\ell )}}
incógnita^k+1()=incógnita^k(1)+wk+1()(yk+1()Ak+1()incógnita^k(1)){\displaystyle {\hat {x}}_{k+1}^{(\ell )}={\hat {x}}_{k}^{(\ell -1)}+w_{k+1}^{(\ell )}(y_{k+1}^{(\ell )}-A_{k+1}^{(\ell )}{\hat {x}}_{k}^{(\ell -1)})}

dónde=1,2,,metro{\displaystyle \ell =1,2,\ldots ,m}, utilizando los valores inicialesdomik+1(0)=domik{\displaystyle C_{e_{k+1}}^{(0)}=C_{e_{k}}}yincógnita^k+1(0)=incógnita^k{\displaystyle {\hat {x}}_{k+1}^{(0)}={\hat {x}}_{k}}Las variables intermediasdoZk+1(){\displaystyle C_{Z_{k+1}}^{(\ell )}}es el{\displaystyle \ell }-ésimo elemento diagonal de lametro×metro{\displaystyle m\times m}matriz diagonaldoZk+1{\displaystyle C_{Z_{k+1}}}; mientrasAk+1(){\displaystyle A_{k+1}^{(\ell )}}es el{\displaystyle \ell }-fila demetro×norte{\displaystyle m\times n}matrizAk+1{\displaystyle A_{k+1}}. Los valores finales sondomik+1(metro)=domik+1{\displaystyle C_{e_{k+1}}^{(m)}=C_{e_{k+1}}}yincógnita^k+1(metro)=incógnita^k+1{\displaystyle {\hat {x}}_{k+1}^{(m)}={\hat {x}}_{k+1}}.

Ejemplos

Ejemplo 1

Tomaremos como ejemplo un problema de predicción lineal . Sea una combinación lineal de variables aleatorias escalares observadas.z1,z2{\displaystyle z_{1},z_{2}}yz3{\displaystyle z_{3}}se utilizará para estimar otra variable aleatoria escalar futuraz4{\displaystyle z_{4}}de tal manera quez^4=i=13wizi{\displaystyle {\hat {z}}_{4}=\sum _{i=1}^{3}w_{i}z_{i}}. Si las variables aleatoriasz=[z1,z2,z3,z4]T{\displaystyle z=[z_{1},z_{2},z_{3},z_{4}]^{T}}son variables aleatorias gaussianas reales con media cero y su matriz de covarianza dada por

cobertura(Z)=mi[zzT]=[1234258938610491015],{\displaystyle \operatorname {cov} (Z)=\operatorname {E} [zz^{T}]=\left[{\begin{array}{cccc}1&2&3&4\\2&5&8&9\\3&8&6&10\\4&9&10&15\end{array}}\right],}

Entonces nuestra tarea es encontrar los coeficienteswi{\displaystyle w_{i}}de tal manera que produzca una estimación lineal óptima.z^4{\displaystyle {\hat {z}}_{4}}.

En términos de la terminología desarrollada en las secciones anteriores, para este problema tenemos el vector de observacióny=[z1,z2,z3]T{\displaystyle y=[z_{1},z_{2},z_{3}]^{T}}, la matriz estimadoraW=[w1,w2,w3]{\displaystyle W=[w_{1},w_{2},w_{3}]}como un vector fila y la variable estimadaincógnita=z4{\displaystyle x=z_{4}}como una magnitud escalar. La matriz de autocorrelacióndoY{\displaystyle C_{Y}}se define como

doY=[mi[z1,z1]mi[z2,z1]mi[z3,z1]mi[z1,z2]mi[z2,z2]mi[z3,z2]mi[z1,z3]mi[z2,z3]mi[z3,z3]]=[123258386].{\displaystyle C_{Y}=\left[{\begin{array}{ccc}E[z_{1},z_{1}]&E[z_{2},z_{1}]&E[z_{3},z_{1}]\\E[z_{1},z_{2}]&E[z_{2},z_{2}]&E[z_{3},z_{2}]\\E[z_{1},z_{3}]&E[z_{2},z_{3}]&E[z_{3},z_{3}]\end{array}}\right]=\left[{\begin{array}{ccc}1&2&3\\2&5&8\\3&8&6\end{array}}\right].}

La matriz de correlación cruzadadoYincógnita{\displaystyle C_{YX}}se define como

doYincógnita=[mi[z4,z1]mi[z4,z2]mi[z4,z3]]=[4910].{\displaystyle C_{YX}=\left[{\begin{array}{c}E[z_{4},z_{1}]\\E[z_{4},z_{2}]\\E[z_{4},z_{3}]\end{array}}\right]=\left[{\begin{array}{c}4\\9\\10\end{array}}\right].}

Ahora resolvemos la ecuación.doYWT=doYincógnita{\displaystyle C_{Y}W^{T}=C_{YX}}invirtiendodoY{\displaystyle C_{Y}}y premultiplicando para obtener

doY1doYincógnita=[4,851.710,1421.710,4280,28570,1420,28570,1429][4910]=[2,570,1420,5714]=WT.{\displaystyle C_{Y}^{-1}C_{YX}=\left[{\begin{array}{ccc}4.85&-1.71&-0.142\\-1.71&0.428&0.2857\\-0.142&0.2857&-0.1429\end{array}}\right]\left[{\begin{array}{c}4\\9\\10\end{array}}\right]=\left[{\begin{array}{c}2.57\\-0.142\\0.5714\end{array}}\right]=W^{T}.}

Entonces tenemosw1=2,57,{\displaystyle w_{1}=2.57,}w2=0,142,{\displaystyle w_{2}=-0.142,}yw3=.5714{\displaystyle w_{3}=.5714} como los coeficientes óptimos paraz^4{\displaystyle {\hat {z}}_{4}}Calcular el error cuadrático medio mínimo da como resultadomimin2=mi[z4z4]WdoYincógnita=15WdoYincógnita=.2857{\displaystyle \left\Vert e\right\Vert _{\min }^{2}=\operatorname {E} [z_{4}z_{4}]-WC_{YX}=15-WC_{YX}=.2857}. [ 2 ] Nótese que no es necesario obtener una inversa de matriz explícita dedoY{\displaystyle C_{Y}}para calcular el valor deW{\displaystyle W}La ecuación matricial se puede resolver mediante métodos bien conocidos, como el método de eliminación de Gauss. Un ejemplo más breve y no numérico se puede encontrar en el principio de ortogonalidad .

Ejemplo 2

Consideremos un vectory{\displaystyle y}formado por tomanorte{\displaystyle N}observaciones de un parámetro escalar fijo pero desconocidoincógnita{\displaystyle x}perturbado por ruido gaussiano blanco. Podemos describir el proceso mediante una ecuación lineal.y=1incógnita+z{\displaystyle y=1x+z}, dónde1=[1,1,,1]T{\displaystyle 1=[1,1,\ldots ,1]^{T}}Dependiendo del contexto quedará claro si1{\displaystyle 1}representa un escalar o un vector. Supongamos que sabemos[incógnita0,incógnita0]{\displaystyle [-x_{0},x_{0}]}ser el rango dentro del cual el valor deincógnita{\displaystyle x}va a caer. Podemos modelar nuestra incertidumbre deincógnita{\displaystyle x}mediante una distribución uniforme previa sobre un intervalo[incógnita0,incógnita0]{\displaystyle [-x_{0},x_{0}]}y por lo tantoincógnita{\displaystyle x}tendrá variación deσincógnita2=incógnita02/3.{\displaystyle \sigma _{X}^{2}=x_{0}^{2}/3.}. Sea el vector de ruidoz{\displaystyle z}estar distribuido normalmente comonorte(0,σZ2I){\displaystyle N(0,\sigma _{Z}^{2}I)}dóndeI{\displaystyle I}es una matriz identidad.incógnita{\displaystyle x}yz{\displaystyle z}son independientes ydoincógnitaZ=0{\displaystyle C_{XZ}=0}Es fácil ver que

mi{y}=0,doY=mi{yyT}=σincógnita211T+σZ2I,doincógnitaY=mi{incógnitayT}=σincógnita21T.{\displaystyle {\begin{aligned}&\operatorname {E} \{y\}=0,\\&C_{Y}=\operatorname {E} \{yy^{T}\}=\sigma _{X}^{2}11^{T}+\sigma _{Z}^{2}I,\\&C_{XY}=\operatorname {E} \{xy^{T}\}=\sigma _{X}^{2}1^{T}.\end{aligned}}}

Por lo tanto, el estimador MMSE lineal viene dado por

incógnita^=doincógnitaYdoY1y=σincógnita21T(σincógnita211T+σZ2I)1y.{\displaystyle {\begin{aligned}{\hat {x}}&=C_{XY}C_{Y}^{-1}y\\&=\sigma _{X}^{2}1^{T}(\sigma _{X}^{2}11^{T}+\sigma _{Z}^{2}I)^{-1}y.\end{aligned}}}

Podemos simplificar la expresión utilizando la forma alternativa paraW{\displaystyle W}como

incógnita^=(1T1σZ2I1+1σincógnita2)11T1σZ2Iy=1σZ2(norteσZ2+1σincógnita2)11Ty=σincógnita2σincógnita2+σZ2/nortey¯,{\displaystyle {\begin{aligned}{\hat {x}}&=\left(1^{T}{\frac {1}{\sigma _{Z}^{2}}}I1+{\frac {1}{\sigma _{X}^{2}}}\right)^{-1}1^{T}{\frac {1}{\sigma _{Z}^{2}}}Iy\\&={\frac {1}{\sigma _{Z}^{2}}}\left({\frac {N}{\sigma _{Z}^{2}}}+{\frac {1}{\sigma _{X}^{2}}}\right)^{-1}1^{T}y\\&={\frac {\sigma _{X}^{2}}{\sigma _{X}^{2}+\sigma _{Z}^{2}/N}}{\bar {y}},\end{aligned}}}

dónde paray=[y1,y2,,ynorte]T{\displaystyle y=[y_{1},y_{2},\ldots ,y_{N}]^{T}}tenemosy¯=1Tynorte=i=1norteyinorte.{\displaystyle {\bar {y}}={\frac {1^{T}y}{N}}={\frac {\sum _{i=1}^{N}y_{i}}{N}}.}

De manera similar, la varianza del estimador es

σincógnita^2=doincógnitaYdoY1doYincógnita=(σincógnita2σincógnita2+σZ2/norte)σincógnita2.{\displaystyle \sigma _{\hat {X}}^{2}=C_{XY}C_{Y}^{-1}C_{YX}={\Big (}{\frac {\sigma _{X}^{2}}{\sigma _{X}^{2}+\sigma _{Z}^{2}/N}}{\Big )}\sigma _{X}^{2}.}

Por lo tanto, el MMSE de este estimador lineal es

LMMSE=σincógnita2σincógnita^2=(σZ2σincógnita2+σZ2/norte)σincógnita2norte.{\displaystyle \operatorname {LMMSE} =\sigma _{X}^{2}-\sigma _{\hat {X}}^{2}={\Big (}{\frac {\sigma _{Z}^{2}}{\sigma _{X}^{2}+\sigma _{Z}^{2}/N}}{\Big )}{\frac {\sigma _{X}^{2}}{N}}.}

Para muy grandesnorte{\displaystyle N}, vemos que el estimador MMSE de un escalar con distribución a priori uniforme puede aproximarse mediante el promedio aritmético de todos los datos observados.

incógnita^=1nortei=1norteyi,{\displaystyle {\hat {x}}={\frac {1}{N}}\sum _{i=1}^{N}y_{i},}

mientras que la varianza no se verá afectada por los datosσincógnita^2=σincógnita2,{\displaystyle \sigma _{\hat {X}}^{2}=\sigma _{X}^{2},}y el LMMSE de la estimación tenderá a cero.

Sin embargo, el estimador es subóptimo ya que está restringido a ser lineal. Si la variable aleatoria fueraincógnita{\displaystyle x}Si también hubiera sido gaussiana, entonces el estimador habría sido óptimo. Nótese que la forma del estimador permanecerá sin cambios, independientemente de la distribución a priori deincógnita{\displaystyle x}, siempre y cuando la media y la varianza de estas distribuciones sean las mismas.

Ejemplo 3

Consideremos una variación del ejemplo anterior: Dos candidatos se presentan a unas elecciones. Sea la fracción de votos que un candidato recibirá el día de las elecciones.incógnita[0,1].{\displaystyle x\in [0,1].}Por lo tanto, la fracción de votos que recibirá el otro candidato será1incógnita.{\displaystyle 1-x.}Tomaremosincógnita{\displaystyle x}como una variable aleatoria con una distribución previa uniforme sobre[0,1]{\displaystyle [0,1]}para que su media seaincógnita¯=1/2{\displaystyle {\bar {x}}=1/2}y la varianza esσincógnita2=1/12.{\displaystyle \sigma _{X}^{2}=1/12.}Unas semanas antes de las elecciones, dos encuestadoras independientes realizaron dos sondeos de opinión pública. El primer sondeo reveló que es probable que el candidato obtengay1{\displaystyle y_{1}}fracción de votos. Dado que siempre existe algún error debido al muestreo finito y a la metodología de encuesta particular adoptada, el primer encuestador declara que su estimación tiene un error.z1{\displaystyle z_{1}}con media y varianza ceroσZ12.{\displaystyle \sigma _{Z_{1}}^{2}.}De manera similar, el segundo encuestador declara que su estimación esy2{\displaystyle y_{2}}con un errorz2{\displaystyle z_{2}}con media y varianza ceroσZ22.{\displaystyle \sigma _{Z_{2}}^{2}.}Cabe señalar que, salvo la media y la varianza del error, la distribución del error no está especificada. ¿Cómo se deben combinar las dos encuestas para obtener la predicción de voto para el candidato en cuestión?

Al igual que en el ejemplo anterior, tenemos

y1=incógnita+z1y2=incógnita+z2.{\displaystyle {\begin{aligned}y_{1}&=x+z_{1}\\y_{2}&=x+z_{2}.\end{aligned}}}

Aquí, ambosmi{y1}=mi{y2}=incógnita¯=1/2{\displaystyle \operatorname {E} \{y_{1}\}=\operatorname {E} \{y_{2}\}={\bar {x}}=1/2}. Por lo tanto, podemos obtener la estimación LMMSE como la combinación lineal dey1{\displaystyle y_{1}}yy2{\displaystyle y_{2}}como

incógnita^=w1(y1incógnita¯)+w2(y2incógnita¯)+incógnita¯,{\displaystyle {\hat {x}}=w_{1}(y_{1}-{\bar {x}})+w_{2}(y_{2}-{\bar {x}})+{\bar {x}},}

donde los pesos vienen dados por

w1=1/σZ121/σZ12+1/σZ22+1/σincógnita2,w2=1/σZ221/σZ12+1/σZ22+1/σincógnita2.{\displaystyle {\begin{aligned}w_{1}&={\frac {1/\sigma _{Z_{1}}^{2}}{1/\sigma _{Z_{1}}^{2}+1/\sigma _{Z_{2}}^{2}+1/\sigma _{X}^{2}}},\\w_{2}&={\frac {1/\sigma _{Z_{2}}^{2}}{1/\sigma _{Z_{1}}^{2}+1/\sigma _{Z_{2}}^{2}+1/\sigma _{X}^{2}}}.\end{aligned}}}

Aquí, dado que el término del denominador es constante, la encuesta con menor error recibe mayor peso para predecir el resultado de la elección. Por último, la varianza deincógnita^{\displaystyle {\hat {x}}}es dado por

σincógnita^2=1/σZ12+1/σZ221/σZ12+1/σZ22+1/σincógnita2σincógnita2,{\displaystyle \sigma _{\hat {X}}^{2}={\frac {1/\sigma _{Z_{1}}^{2}+1/\sigma _{Z_{2}}^{2}}{1/\sigma _{Z_{1}}^{2}+1/\sigma _{Z_{2}}^{2}+1/\sigma _{X}^{2}}}\sigma _{X}^{2},}

lo cual haceσincógnita^2{\displaystyle \sigma _{\hat {X}}^{2}}más pequeño queσincógnita2.{\displaystyle \sigma _{X}^{2}.}Por lo tanto, el LMMSE viene dado por

LMETROMETROSmi=σincógnita2σincógnita^2=11/σZ12+1/σZ22+1/σincógnita2.{\displaystyle \mathrm {LMMSE} =\sigma _{X}^{2}-\sigma _{\hat {X}}^{2}={\frac {1}{1/\sigma _{Z_{1}}^{2}+1/\sigma _{Z_{2}}^{2}+1/\sigma _{X}^{2}}}.}

En general, si tenemosnorte{\displaystyle N}encuestadores, entoncesincógnita^=i=1nortewi(yiincógnita¯)+incógnita¯,{\displaystyle {\hat {x}}=\sum _{i=1}^{N}w_{i}(y_{i}-{\bar {x}})+{\bar {x}},}donde el peso para el i -ésimo encuestador viene dado porwi=1/σZi2j=1norte1/σZj2+1/σincógnita2{\displaystyle w_{i}={\frac {1/\sigma _{Z_{i}}^{2}}{\sum _{j=1}^{N}1/\sigma _{Z_{j}}^{2}+1/\sigma _{X}^{2}}}}y el LMMSE viene dado porLMETROMETROSmi=1j=1norte1/σZj2+1/σincógnita2.{\displaystyle \mathrm {LMMSE} ={\frac {1}{\sum _{j=1}^{N}1/\sigma _{Z_{j}}^{2}+1/\sigma _{X}^{2}}}.}

Ejemplo 4

Supongamos que un músico está tocando un instrumento y que el sonido es recibido por dos micrófonos, cada uno ubicado en dos lugares diferentes. Sea la atenuación del sonido debida a la distancia en cada micrófono.a1{\displaystyle a_{1}}ya2{\displaystyle a_{2}}, que se suponen constantes conocidas. De manera similar, sea el ruido en cada micrófonoz1{\displaystyle z_{1}}yz2{\displaystyle z_{2}}, cada uno con media cero y varianzasσZ12{\displaystyle \sigma _{Z_{1}}^{2}}yσZ22{\displaystyle \sigma _{Z_{2}}^{2}}respectivamente. Seaincógnita{\displaystyle x}denota el sonido producido por el músico, que es una variable aleatoria con media cero y varianzaσincógnita2.{\displaystyle \sigma _{X}^{2}.}¿Cómo se debe combinar la música grabada con estos dos micrófonos, una vez sincronizada entre sí?

Podemos modelar el sonido recibido por cada micrófono como

y1=a1incógnita+z1y2=a2incógnita+z2.{\displaystyle {\begin{aligned}y_{1}&=a_{1}x+z_{1}\\y_{2}&=a_{2}x+z_{2}.\end{aligned}}}

Aquí ambosmi{y1}=mi{y2}=0{\displaystyle \operatorname {E} \{y_{1}\}=\operatorname {E} \{y_{2}\}=0}. Por lo tanto, podemos combinar los dos sonidos como

y=w1y1+w2y2{\displaystyle y=w_{1}y_{1}+w_{2}y_{2}}

donde el i -ésimo peso se da como

wi=ai/σZi2jaj2/σZj2+1/σincógnita2.{\displaystyle w_{i}={\frac {a_{i}/\sigma _{Z_{i}}^{2}}{\sum _{j}a_{j}^{2}/\sigma _{Z_{j}}^{2}+1/\sigma _{X}^{2}}}.}

Véase también

Notas

  1. "Error cuadrático medio (ECM)" . www.probabilitycourse.com . Consultado el 9 de mayo de 2017 .
  2. Luna y Stirling.

Lecturas adicionales

  • Johnson, D. "Estimadores de mínimo error cuadrático medio" . Connexions. Archivado desde Estimadores de mínimo error cuadrático medio, el original, el 25 de julio de 2008. Recuperado el 8 de enero de 2013 .{{cite web}}: Comprobar |url=valor ( ayuda )
  • Jaynes, ET (2003). Teoría de la probabilidad: La lógica de la ciencia . Cambridge University Press. ISBN 978-0521592710.
  • Bibby, J.; Toutenburg, H. (1977). Predicción y estimación mejorada en modelos lineales . Wiley. ISBN 9780471016564.
  • Lehmann, EL; Casella, G. (1998). «Capítulo 4». Teoría de la estimación puntual (2.ª  ed.). Springer. ISBN 0-387-98502-6.
  • Kay, SM (1993). Fundamentos del procesamiento estadístico de señales: Teoría de la estimación . Prentice Hall. pp. 344–350 . ISBN  0-13-042268-1.
  • Luenberger, DG (1969). «Capítulo 4, Estimación por mínimos cuadrados». Optimización mediante métodos de espacio vectorial (1.ª  ed.). Wiley. ISBN 978-0471181170.
  • Moon, TK; Stirling, WC (2000). Métodos matemáticos y algoritmos para el procesamiento de señales (1.ª  ed.). Prentice Hall. ISBN 978-0201361865.
  • Van Trees, HL (1968). Detección, estimación y teoría de la modulación, parte I. Nueva York: Wiley. ISBN 0-471-09517-6.
  • Haykin, SO (2013). Teoría de filtros adaptativos (5.ª  ed.). Prentice Hall. ISBN 978-0132671453.