En estadística, el error cuadrático medio de predicción ( MSPE ), también conocido como error cuadrático medio de las predicciones , de un procedimiento de suavizado , ajuste de curvas o regresión es el valor esperado de los errores de predicción al cuadrado ( PE ), la diferencia al cuadrado entre los valores ajustados implícitos por la función predictiva.y los valores del verdadero valor (no observable) g . Es una medida inversa del poder explicativo dey puede utilizarse en el proceso de validación cruzada de un modelo estimado. Se requeriría el conocimiento de g para calcular el MSPE con exactitud; en la práctica, el MSPE se estima. [ 1 ]
Formulación
Si el procedimiento de suavizado o ajuste tiene una matriz de proyección (es decir, matriz sombrero) L , que mapea el vector de valores observadosal vector de valores predichosEntonces, PE y MSPE se formulan como:
El MSPE se puede descomponer en dos términos: el sesgo al cuadrado (error medio) de los valores ajustados y la varianza de los valores ajustados:
La cantidad SSPE = n MSPE se llama suma de errores de predicción al cuadrado . El error de predicción cuadrático medio es la raíz cuadrada de MSPE: RMSPE = √ MSPE .
Cálculo del MSPE sobre datos fuera de la muestra
El error cuadrático medio de predicción se puede calcular con exactitud en dos contextos. Primero, con una muestra de datos de longitud n , el analista de datos puede ejecutar la regresión solo sobre q puntos de datos (con q < n ), reservando los otros n – q puntos de datos con el propósito específico de usarlos para calcular el MSPE estimado del modelo fuera de la muestra (es decir, sin usar los datos que se usaron en el proceso de estimación del modelo). Dado que el proceso de regresión se adapta a los q puntos de la muestra, normalmente el MSPE dentro de la muestra será menor que el MSPE fuera de la muestra calculado sobre los n – q puntos reservados. Si el aumento en el MSPE fuera de la muestra en comparación con dentro de la muestra es relativamente pequeño, eso hace que el modelo se vea favorablemente. Y si se comparan dos modelos, el que tenga el MSPE más bajo sobre los n – q puntos de datos fuera de la muestra se ve más favorablemente, independientemente del rendimiento relativo de los modelos dentro de la muestra. En este contexto, el error cuadrático medio (MSPE) fuera de la muestra es exacto para los puntos de datos fuera de la muestra sobre los que se calculó, pero es simplemente una estimación del MSPE del modelo para la población mayoritariamente no observada de la que se extrajeron los datos.
En segundo lugar, con el paso del tiempo, el analista de datos puede disponer de más datos, y entonces se puede calcular el MSPE sobre estos nuevos datos.
Estimación del MSPE en la población
Cuando el modelo se ha estimado sobre todos los datos disponibles sin reservar ninguno, el MSPE del modelo sobre toda la población de datos mayoritariamente no observados se puede estimar de la siguiente manera.
Para el modelodónde, uno puede escribir
Utilizando valores de datos dentro de la muestra, el primer término del lado derecho es equivalente a
De este modo,
Sies conocido o bien estimado por, se hace posible estimar el MSPE mediante
Colin Mallows defendió este método en la construcción de su estadístico de selección de modelos C p , que es una versión normalizada del MSPE estimado:
donde p es el número de parámetros estimados p yse calcula a partir de la versión del modelo que incluye todos los regresores posibles. Con esto concluye esta demostración.
Véase también
Referencias
- ↑ Pindyck, Robert S .; Rubinfeld, Daniel L. (1991). «Pronóstico con modelos de series temporales» . Modelos econométricos y pronósticos económicos (3.ª ed.). Nueva York: McGraw-Hill. págs. 516-535 . ISBN 0-07-050098-3.
- Rendimiento de la estimación puntual
- Desviación estadística y dispersión
- Funciones de pérdida