En estadística y procesamiento de señales , un estimador de mínimo error cuadrático medio ( estimador MMSE ) es un método de estimación que minimiza el error cuadrático medio (MSE), una medida común de la calidad del estimador, de los valores ajustados de una variable dependiente . En el contexto bayesiano , MMSE se refiere más específicamente a la estimación con una función de pérdida cuadrática . En este caso, el estimador MMSE viene dado por la media posterior del parámetro a estimar. Dado que la media posterior es difícil de calcular, la forma del estimador MMSE suele estar restringida a una determinada clase de funciones. Los estimadores MMSE lineales son una opción popular debido a su facilidad de uso, cálculo y versatilidad. Esto ha dado lugar a muchos estimadores populares, como el filtro de Wiener-Kolmogorov y el filtro de Kalman .
Motivación
El término MMSE se refiere más específicamente a la estimación en un entorno bayesiano con una función de coste cuadrática. La idea básica del enfoque bayesiano para la estimación surge de situaciones prácticas en las que a menudo disponemos de información previa sobre el parámetro a estimar. Por ejemplo, podemos tener información previa sobre el rango que puede tomar el parámetro; o podemos tener una estimación anterior del parámetro que queremos modificar cuando se dispone de una nueva observación; o las estadísticas de una señal aleatoria real, como el habla. Esto contrasta con el enfoque no bayesiano, como el estimador insesgado de mínima varianza (MVUE), donde no se asume que se conozca absolutamente nada sobre el parámetro de antemano y que no tiene en cuenta tales situaciones. En el enfoque bayesiano, dicha información previa se captura mediante la función de densidad de probabilidad previa de los parámetros; y, basándose directamente en el teorema de Bayes , nos permite realizar mejores estimaciones posteriores a medida que se dispone de más observaciones. Así, a diferencia del enfoque no bayesiano, donde se asume que los parámetros de interés son deterministas pero constantes desconocidas, el estimador bayesiano busca estimar un parámetro que es en sí mismo una variable aleatoria . Además, la estimación bayesiana también puede abordar situaciones en las que la secuencia de observaciones no es necesariamente independiente. Por lo tanto, la estimación bayesiana proporciona otra alternativa al MVUE. Esto resulta útil cuando el MVUE no existe o no se puede encontrar.
Definición
Dejarser unvariable vectorial aleatoria oculta, y deje queser unVariable vectorial aleatoria conocida (la medición u observación), ambas no necesariamente de la misma dimensión. Un estimadordees cualquier función de la mediciónEl vector de error de estimación viene dado pory su error cuadrático medio (ECM) viene dado por la traza de la matriz de covarianza del error.
donde la expectativaes tomadocondicionado a. Cuandoes una variable escalar, la expresión MSE se simplifica a. Tenga en cuenta que el MSE puede definirse de forma equivalente de otras maneras, ya que
El estimador MMSE se define entonces como el estimador que logra el MSE mínimo:
Propiedades
- Cuando las medias y las varianzas son finitas, el estimador MMSE está definido de forma única [ 1 ] y viene dado por:
- En otras palabras, el estimador MMSE es la esperanza condicional dedado el valor observado conocido de las mediciones. Además, dado quees la media posterior, la matriz de covarianza del errores igual a la covarianza posteriormatriz,
- .
- El estimador MMSE es insesgado (bajo los supuestos de regularidad mencionados anteriormente):
- El estimador MMSE es asintóticamente insesgado y converge en distribución a la distribución normal:
- dóndees la información de Fisher dePor lo tanto, el estimador MMSE es asintóticamente eficiente .
- El principio de ortogonalidad : Cuandoes un escalar, un estimador restringido a tener cierta formaes un estimador óptimo, es decirsi y solo si
- a pesar deen un subespacio lineal cerradode las mediciones. Para vectores aleatorios, dado que el MSE para la estimación de un vector aleatorio es la suma de los MSE de las coordenadas, encontrar el estimador MMSE de un vector aleatorio se descompone en encontrar los estimadores MMSE de las coordenadas de X por separado:
- para todo i y j . Dicho de forma más concisa, la correlación cruzada entre el error de estimación mínimoy el estimadordebería ser cero,
- SiySi son conjuntamente gaussianas , entonces el estimador MMSE es lineal, es decir, tiene la formapara matrizy constanteEsto se puede demostrar directamente utilizando el teorema de Bayes. En consecuencia, para hallar el estimador MMSE, basta con hallar el estimador MMSE lineal.
Estimador MMSE lineal
En muchos casos, no es posible determinar la expresión analítica del estimador MMSE. Dos enfoques numéricos básicos para obtener la estimación MMSE dependen de encontrar la esperanza condicional.o encontrar los mínimos del MSE. La evaluación numérica directa de la esperanza condicional es computacionalmente costosa, ya que a menudo requiere integración multidimensional, generalmente realizada mediante métodos de Monte Carlo . Otro enfoque computacional consiste en buscar directamente los mínimos del MSE utilizando técnicas como los métodos de descenso de gradiente estocástico ; pero este método aún requiere la evaluación de la esperanza. Si bien estos métodos numéricos han sido fructíferos, es posible obtener una expresión analítica para el estimador MMSE si estamos dispuestos a hacer algunas concesiones.
Una posibilidad es abandonar los requisitos de optimalidad total y buscar una técnica que minimice el MSE dentro de una clase particular de estimadores, como la clase de estimadores lineales. Por lo tanto, postulamos que la esperanza condicional dedadoes una función lineal simple de,donde la mediciónes un vector aleatorio,es una matriz yes un vector. Esto puede verse como la aproximación de Taylor de primer orden deEl estimador MMSE lineal es el estimador que logra el mínimo MSE entre todos los estimadores de esta forma. Es decir, resuelve el siguiente problema de optimización:
Una ventaja de este estimador MMSE lineal es que no es necesario calcular explícitamente la función de densidad de probabilidad posterior de. Dicho estimador lineal solo depende de los dos primeros momentos dey. Por lo tanto, aunque puede ser conveniente suponer queySi ambas distribuciones son gaussianas, no es necesario asumir que la distribución supuesta tiene momentos de primer y segundo orden bien definidos. La forma del estimador lineal no depende del tipo de distribución subyacente supuesta.
La expresión para óptimoyestá dado por:
dónde,eles la matriz de covarianza cruzada entrey, eles la matriz de autocovarianza de.
Por lo tanto, la expresión para el estimador MMSE lineal, su media y su autocovarianza viene dada por
donde eles la matriz de covarianza cruzada entrey.
Por último, la covarianza del error y el error cuadrático medio mínimo alcanzable por dicho estimador son:
Consideremos el estimador MMSE lineal óptimo dado por:, donde se nos exige encontrar la expresión paray. Se requiere que el estimador MMSE sea insesgado. Esto significa que,
Conectando la expresión paraarriba, obtenemos
dóndey. Por lo tanto, podemos reescribir el estimador como
y la expresión para el error de estimación se convierte en
A partir del principio de ortogonalidad, podemos tener, donde tomamos. Aquí el término del lado izquierdo es
Cuando igualamos a cero, obtenemos la expresión deseada paracomo
Eles la matriz de covarianza cruzada entre X e Y, yes la matriz de autocovarianza de Y. Dado que, la expresión también puede reescribirse en términos decomo
Por lo tanto, la expresión completa para el estimador MMSE lineal es
Desde la estimaciónes en sí misma una variable aleatoria con, también podemos obtener su autocovarianza como
Poniendo la expresión paray, obtenemos
Por último, la covarianza del error de estimación MMSE lineal vendrá dada por
El primer término de la tercera línea es cero debido al principio de ortogonalidad. Dado que, podemos reescribiren términos de matrices de covarianza como
Podemos reconocer que esto es lo mismo quePor lo tanto, el error cuadrático medio mínimo alcanzable por dicho estimador lineal es
- .
Caso univariado
Para el caso especial en que ambosyson escalares, las relaciones anteriores se simplifican a
dóndees el coeficiente de correlación de Pearson entrey.
Las dos ecuaciones anteriores nos permiten interpretar el coeficiente de correlación como la pendiente normalizada de la regresión lineal.
o como raíz cuadrada de la razón de dos varianzas
- .
Cuando, tenemosyEn este caso, no se obtiene información nueva de la medición, lo que puede disminuir la incertidumbre en. Por otro lado, cuando, tenemosy. Aquíestá completamente determinado por, según lo indicado por la ecuación de la línea recta.
Cálculo
Se puede utilizar un método estándar como la eliminación de Gauss para resolver la ecuación matricial para. Un método numéricamente más estable lo proporciona el método de descomposición QR . Dado que la matrizes una matriz simétrica definida positiva,se puede resolver dos veces más rápido con la descomposición de Cholesky , mientras que para sistemas dispersos grandes el método del gradiente conjugado es más efectivo. La recursión de Levinson es un método rápido cuandoTambién es una matriz de Toeplitz . Esto puede ocurrir cuandoes un proceso estacionario en sentido amplio . En tales casos estacionarios, estos estimadores también se denominan filtros de Wiener-Kolmogorov .
Estimador MMSE lineal para procesos de observación lineales
Modelemos además el proceso subyacente de observación como un proceso lineal:, dóndees una matriz conocida yes un vector de ruido aleatorio con la mediay covarianza cruzadaAquí se requerirán la media y las matrices de covarianza.
Por lo tanto, la expresión para la matriz del estimador MMSE linealmodifica aún más a
Poner todo en la expresión para, obtenemos
Por último, la covarianza del error es
La diferencia significativa entre el problema de estimación tratado anteriormente y los de mínimos cuadrados y estimación de Gauss-Markov es que el número de observaciones m , (es decir, la dimensión de) no tiene por qué ser al menos tan grande como el número de incógnitas, n , (es decir, la dimensión de). La estimación para el proceso de observación lineal existe siempre que la matriz m por mexiste; este es el caso para cualquier m si, por ejemplo,es definida positiva. Físicamente, la razón de esta propiedad es que, dado queAhora que es una variable aleatoria, es posible formar una estimación significativa (a saber, su media) incluso sin mediciones. Cada nueva medición simplemente proporciona información adicional que puede modificar nuestra estimación original. Otra característica de esta estimación es que para m < n , no es necesario que haya error de medición. Por lo tanto, podemos tener, porque mientrasSi es definida positiva, la estimación aún existe. Por último, esta técnica puede manejar casos donde el ruido está correlacionado.
Forma alternativa
Se puede obtener una forma de expresión alternativa utilizando la identidad matricial.
lo cual se puede establecer mediante la postmultiplicación pory premultiplicando porpara obtener
y
Desdeahora se puede escribir en términos decomo, obtenemos una expresión simplificada paracomo
En esta forma, la expresión anterior se puede comparar fácilmente con mínimos cuadrados ponderados , estimación de Gauss-Markov y regresión de cresta . En particular, cuando, correspondiente a una varianza infinita de la información a priori sobre, el resultadoes idéntico a la estimación de mínimos cuadrados lineales ponderados concomo la matriz de pesos. Además, si los componentes deno están correlacionados y tienen varianza igual, de modo quedóndees una matriz identidad, entonceses idéntico a la estimación de mínimos cuadrados ordinarios. Cuando se dispone de información a priori comoy elno están correlacionados y tienen la misma varianza que, tenemos, dónde, que es idéntica a la solución de regresión de cresta.
Estimación secuencial lineal MMSE
En muchas aplicaciones en tiempo real, los datos de observación no están disponibles en un único lote. En cambio, las observaciones se realizan de forma secuencial. Un posible enfoque consiste en utilizar las observaciones secuenciales para actualizar una estimación anterior a medida que se dispone de datos adicionales, lo que da lugar a estimaciones más precisas. Una diferencia crucial entre la estimación por lotes y la estimación secuencial es que esta última requiere una suposición de Markov adicional.
En el marco bayesiano, dicha estimación recursiva se facilita fácilmente utilizando la regla de Bayes. Dadoobservaciones,, la regla de Bayes nos da la densidad posterior decomo
Else denomina densidad posterior,se denomina función de verosimilitud, yes la densidad previa del k -ésimo paso de tiempo. Aquí hemos asumido la independencia condicional dea partir de observaciones previasdadocomo
Esta es la suposición de Markov.
La estimación MMSEDado que la k -ésima observación es entonces la media de la densidad posterior. Con la falta de información dinámica sobre cómo el estadoDado que cambia con el tiempo, haremos una suposición adicional de estacionariedad sobre la distribución a priori:
Por lo tanto, la densidad previa para el paso de tiempo k es la densidad posterior del paso de tiempo ( k -1). Esta estructura nos permite formular un enfoque recursivo para la estimación.
En el contexto del estimador MMSE lineal, la fórmula para la estimación tendrá la misma forma que antes:Sin embargo, las matrices de media y covarianza deyserá necesario reemplazarlos por otros de la densidad anterior.y probabilidad, respectivamente.
Para la densidad previa, su media viene dada por la estimación MMSE anterior,
- ,
y su matriz de covarianza viene dada por la matriz de covarianza de error anterior,
de acuerdo con las propiedades de los estimadores MMSE y el supuesto de estacionariedad.
De manera similar, para el proceso de observación lineal, la media de la probabilidades dado pory la matriz de covarianza es la misma que antes
- .
La diferencia entre el valor previsto de, según lo dado pory su valor observadoda el error de predicción, que también se denomina innovación o residuo. Es más conveniente representar el MMSE lineal en términos del error de predicción, cuya media y covarianza sony.
Por lo tanto, en la fórmula de actualización de la estimación, debemos reemplazarypory, respectivamente. Además, deberíamos reemplazarypory. Por último, reemplazamospor
Por lo tanto, tenemos la nueva estimación como una nueva observación.llega como
y la nueva covarianza de error como
Desde el punto de vista del álgebra lineal, para la estimación secuencial, si tenemos una estimaciónbasado en mediciones que generan espacioLuego, tras recibir otro conjunto de mediciones, debemos restar de estas la parte que se podía prever a partir del resultado de las primeras mediciones. En otras palabras, la actualización debe basarse en la parte de los nuevos datos que es ortogonal a los datos anteriores.
El uso repetido de las dos ecuaciones anteriores a medida que se dispone de más observaciones conduce a técnicas de estimación recursivas. Las expresiones se pueden escribir de forma más compacta como
La matrizA menudo se le denomina factor de ganancia de Kalman. La formulación alternativa del algoritmo anterior dará como resultado
La repetición de estos tres pasos a medida que se dispone de más datos da lugar a un algoritmo de estimación iterativo. La generalización de esta idea a casos no estacionarios da origen al filtro de Kalman . Los tres pasos de actualización descritos anteriormente constituyen, de hecho, el paso de actualización del filtro de Kalman.
Caso especial: observaciones escalares
Como un caso especial importante, se puede derivar una expresión recursiva fácil de usar cuando en cada k -ésimo instante de tiempo el proceso de observación lineal subyacente produce un escalar tal que, dóndees un vector columna conocido de n por 1 cuyos valores pueden cambiar con el tiempo,es un vector columna aleatorio de n por 1 que se va a estimar, yes un término de ruido escalar con varianzaDespués de la ( k +1)-ésima observación, el uso directo de las ecuaciones recursivas anteriores proporciona la expresión para la estimación.como:
dóndees la nueva observación escalar y el factor de gananciaes un vector columna de n por 1 dado por
Eles la matriz de covarianza de errores de n por n dada por
Aquí no se requiere inversión de matriz. Además, el factor de ganancia,, depende de nuestra confianza en la nueva muestra de datos, medida por la varianza del ruido, en comparación con la de los datos anteriores. Los valores iniciales deyse toman como la media y la covarianza de la función de densidad de probabilidad a priori de.
Enfoques alternativos: Este importante caso especial también ha dado lugar a muchos otros métodos iterativos (o filtros adaptativos ), como el filtro de mínimos cuadrados medios y el filtro recursivo de mínimos cuadrados , que resuelve directamente el problema de optimización MSE original utilizando descensos de gradiente estocásticos . Sin embargo, dado que el error de estimaciónComo no se puede observar directamente, estos métodos intentan minimizar el error cuadrático medio de predicción.Por ejemplo, en el caso de observaciones escalares, tenemos el gradiente.Por lo tanto, la ecuación de actualización para el filtro de mínimos cuadrados viene dada por
dóndees el tamaño del paso escalar y la esperanza se aproxima mediante el valor instantáneo.Como podemos observar, estos métodos evitan la necesidad de matrices de covarianza.
Caso especial: escalar desconocido
También se puede derivar otra expresión recursiva importante y fácil de usar cuando en cada k -ésimo instante de tiempo el proceso de observación lineal subyacente produce un vector tal que, dóndees un vector columna conocido de m por 1 cuyos valores pueden cambiar con el tiempo,es un escalar desconocido que debe estimarse, yes un término de ruido de m por 1 con covarianza. Después de la ( k +1)-ésima observación, utilizando la forma alternativa de las ecuaciones recursivas anteriores, la covarianza del error escalares dado por
El factor de gananciaahora es un vector fila de 1 por m dado por
Por último, dado el nuevo vector de observaciónla estimaciónes
Caso especial: observación vectorial con ruido no correlacionado
En muchas aplicaciones prácticas, el ruido de observación no está correlacionado. Es decir,es una matriz diagonal. En tales casos, es ventajoso considerar los componentes decomo mediciones escalares independientes, en lugar de mediciones vectoriales. Esto nos permite reducir el tiempo de cálculo procesando elvector de medición comoMediciones escalares. El uso de la fórmula de actualización escalar evita la inversión de matrices en la implementación de las ecuaciones de actualización de covarianza, mejorando así la robustez numérica frente a errores de redondeo. La actualización se puede implementar iterativamente como:
dónde, utilizando los valores inicialesyLas variables intermediases el-ésimo elemento diagonal de lamatriz diagonal; mientrases el-fila dematriz. Los valores finales sony.
Ejemplos
Ejemplo 1
Tomaremos como ejemplo un problema de predicción lineal . Sea una combinación lineal de variables aleatorias escalares observadas.yse utilizará para estimar otra variable aleatoria escalar futurade tal manera que. Si las variables aleatoriasson variables aleatorias gaussianas reales con media cero y su matriz de covarianza dada por
Entonces nuestra tarea es encontrar los coeficientesde tal manera que produzca una estimación lineal óptima..
En términos de la terminología desarrollada en las secciones anteriores, para este problema tenemos el vector de observación, la matriz estimadoracomo un vector fila y la variable estimadacomo una magnitud escalar. La matriz de autocorrelaciónse define como
La matriz de correlación cruzadase define como
Ahora resolvemos la ecuación.invirtiendoy premultiplicando para obtener
Entonces tenemosy como los coeficientes óptimos paraCalcular el error cuadrático medio mínimo da como resultado. [ 2 ] Nótese que no es necesario obtener una inversa de matriz explícita depara calcular el valor deLa ecuación matricial se puede resolver mediante métodos bien conocidos, como el método de eliminación de Gauss. Un ejemplo más breve y no numérico se puede encontrar en el principio de ortogonalidad .
Ejemplo 2
Consideremos un vectorformado por tomaobservaciones de un parámetro escalar fijo pero desconocidoperturbado por ruido gaussiano blanco. Podemos describir el proceso mediante una ecuación lineal., dóndeDependiendo del contexto quedará claro sirepresenta un escalar o un vector. Supongamos que sabemosser el rango dentro del cual el valor deva a caer. Podemos modelar nuestra incertidumbre demediante una distribución uniforme previa sobre un intervaloy por lo tantotendrá variación de. Sea el vector de ruidoestar distribuido normalmente comodóndees una matriz identidad.yson independientes yEs fácil ver que
Por lo tanto, el estimador MMSE lineal viene dado por
Podemos simplificar la expresión utilizando la forma alternativa paracomo
dónde paratenemos
De manera similar, la varianza del estimador es
Por lo tanto, el MMSE de este estimador lineal es
Para muy grandes, vemos que el estimador MMSE de un escalar con distribución a priori uniforme puede aproximarse mediante el promedio aritmético de todos los datos observados.
mientras que la varianza no se verá afectada por los datosy el LMMSE de la estimación tenderá a cero.
Sin embargo, el estimador es subóptimo ya que está restringido a ser lineal. Si la variable aleatoria fueraSi también hubiera sido gaussiana, entonces el estimador habría sido óptimo. Nótese que la forma del estimador permanecerá sin cambios, independientemente de la distribución a priori de, siempre y cuando la media y la varianza de estas distribuciones sean las mismas.
Ejemplo 3
Consideremos una variación del ejemplo anterior: Dos candidatos se presentan a unas elecciones. Sea la fracción de votos que un candidato recibirá el día de las elecciones.Por lo tanto, la fracción de votos que recibirá el otro candidato seráTomaremoscomo una variable aleatoria con una distribución previa uniforme sobrepara que su media seay la varianza esUnas semanas antes de las elecciones, dos encuestadoras independientes realizaron dos sondeos de opinión pública. El primer sondeo reveló que es probable que el candidato obtengafracción de votos. Dado que siempre existe algún error debido al muestreo finito y a la metodología de encuesta particular adoptada, el primer encuestador declara que su estimación tiene un error.con media y varianza ceroDe manera similar, el segundo encuestador declara que su estimación escon un errorcon media y varianza ceroCabe señalar que, salvo la media y la varianza del error, la distribución del error no está especificada. ¿Cómo se deben combinar las dos encuestas para obtener la predicción de voto para el candidato en cuestión?
Al igual que en el ejemplo anterior, tenemos
Aquí, ambos. Por lo tanto, podemos obtener la estimación LMMSE como la combinación lineal deycomo
donde los pesos vienen dados por
Aquí, dado que el término del denominador es constante, la encuesta con menor error recibe mayor peso para predecir el resultado de la elección. Por último, la varianza dees dado por
lo cual hacemás pequeño quePor lo tanto, el LMMSE viene dado por
En general, si tenemosencuestadores, entoncesdonde el peso para el i -ésimo encuestador viene dado pory el LMMSE viene dado por
Ejemplo 4
Supongamos que un músico está tocando un instrumento y que el sonido es recibido por dos micrófonos, cada uno ubicado en dos lugares diferentes. Sea la atenuación del sonido debida a la distancia en cada micrófono.y, que se suponen constantes conocidas. De manera similar, sea el ruido en cada micrófonoy, cada uno con media cero y varianzasyrespectivamente. Seadenota el sonido producido por el músico, que es una variable aleatoria con media cero y varianza¿Cómo se debe combinar la música grabada con estos dos micrófonos, una vez sincronizada entre sí?
Podemos modelar el sonido recibido por cada micrófono como
Aquí ambos. Por lo tanto, podemos combinar los dos sonidos como
donde el i -ésimo peso se da como
Véase también
Notas
Lecturas adicionales
- Johnson, D. "Estimadores de mínimo error cuadrático medio" . Connexions. Archivado desde Estimadores de mínimo error cuadrático medio, el original, el 25 de julio de 2008. Recuperado el 8 de enero de 2013 .
{{cite web}}: Comprobar|url=valor ( ayuda ) - Jaynes, ET (2003). Teoría de la probabilidad: La lógica de la ciencia . Cambridge University Press. ISBN 978-0521592710.
- Bibby, J.; Toutenburg, H. (1977). Predicción y estimación mejorada en modelos lineales . Wiley. ISBN 9780471016564.
- Lehmann, EL; Casella, G. (1998). «Capítulo 4». Teoría de la estimación puntual (2.ª ed.). Springer. ISBN 0-387-98502-6.
- Kay, SM (1993). Fundamentos del procesamiento estadístico de señales: Teoría de la estimación . Prentice Hall. pp. 344–350 . ISBN 0-13-042268-1.
- Luenberger, DG (1969). «Capítulo 4, Estimación por mínimos cuadrados». Optimización mediante métodos de espacio vectorial (1.ª ed.). Wiley. ISBN 978-0471181170.
- Moon, TK; Stirling, WC (2000). Métodos matemáticos y algoritmos para el procesamiento de señales (1.ª ed.). Prentice Hall. ISBN 978-0201361865.
- Van Trees, HL (1968). Detección, estimación y teoría de la modulación, parte I. Nueva York: Wiley. ISBN 0-471-09517-6.
- Haykin, SO (2013). Teoría de filtros adaptativos (5.ª ed.). Prentice Hall. ISBN 978-0132671453.
- Desviación estadística y dispersión
- Rendimiento de la estimación puntual
- Estimación de la señal