Articulo de referencia

desviación cuadrática media

La desviación cuadrática media ( RMSD ) o el error cuadrático medio ( RMSE ) es una medida frecuentemente utilizada para cuantificar la diferencia entre los valores observados y...

La desviación cuadrática media ( RMSD ) o el error cuadrático medio ( RMSE ) es una medida frecuentemente utilizada para cuantificar la diferencia entre los valores observados y una estimación de los mismos (por ejemplo, la relación entre valores reales y predichos en tareas de regresión del aprendizaje automático ). Esta desviación suele ser simplemente una diferencia de escalares ; también puede generalizarse a las longitudes vectoriales de un desplazamiento , como en el concepto bioinformático de desviación cuadrática media de las posiciones atómicas .

RMSD de una muestra

La desviación cuadrática media (RMSD) de una muestra es la media cuadrática de las diferencias entre los valores observados y los predichos. Estas desviaciones se denominan residuos cuando los cálculos se realizan sobre la muestra de datos utilizada para la estimación (y, por lo tanto, siempre se refieren a una estimación) y se denominan errores (o errores de predicción) cuando se calculan fuera de la muestra (es decir, sobre el conjunto completo, haciendo referencia a un valor real en lugar de una estimación). La RMSD sirve para agregar las magnitudes de los errores en las predicciones para varios puntos de datos en una única medida de poder predictivo. La RMSD es una medida de precisión , para comparar los errores de pronóstico de diferentes modelos para un conjunto de datos particular y no entre conjuntos de datos, ya que depende de la escala. [ 1 ]

El RMSD siempre es no negativo, y un valor de 0 (que casi nunca se alcanza en la práctica) indicaría un ajuste perfecto a los datos. En general, un RMSD menor es mejor que uno mayor. Sin embargo, las comparaciones entre diferentes tipos de datos no serían válidas, ya que la medida depende de la escala de los números utilizados.

La desviación cuadrática media (RMSD) es la raíz cuadrada del promedio de los errores al cuadrado. El efecto de cada error sobre la RMSD es proporcional a su magnitud; por lo tanto, los errores mayores tienen un efecto desproporcionadamente grande sobre la RMSD. En consecuencia, la RMSD es sensible a los valores atípicos . [ 2 ] [ 3 ]

Fórmulas

Estimador

La desviación cuadrática media (RMSD) de un estimador con respecto a un parámetro estimado se define como la raíz cuadrada del error cuadrático medio : θ^{\displaystyle {\sombrero {\theta }}}θ{\displaystyle \theta }RMSD(θ^)=MSE(θ^)=mi((θ^θ)2).{\displaystyle \operatorname {RMSD} ({\hat {\theta }})={\sqrt {\operatorname {MSE} ({\hat {\theta }})}}={\sqrt {\operatorname {E} {\big (}({\hat {\theta }}-\theta )^{2}{\big )}}}.}

Para un estimador insesgado , el RMSD es la raíz cuadrada de la varianza , conocida como desviación estándar .

Muestras

Si X 1 , ..., X n es una muestra de una población con un verdadero valor medio , entonces el RMSD de la muestra esincógnita0{\displaystyle x_{0}}

RMSD=1nortei=1norte(incógnitaiincógnita0)2{\displaystyle \operatorname {RMSD} ={\sqrt {{\frac {1}{n}}\sum _{i=1}^{n}(X_{i}-x_{0})^{2}}}}.

La desviación cuadrática media (RMSD) de los valores predichos para los tiempos t de la variable dependiente de una regresión con variables observadas durante T tiempos, se calcula para T predicciones diferentes como la raíz cuadrada de la media de los cuadrados de las desviaciones:y^t{\displaystyle {\hat {y}}_{t}}yt,{\displaystyle y_{t},}

RMSD=t=1T(yty^t)2T.{\displaystyle \operatorname {RMSD} ={\sqrt {\frac {\sum _{t=1}^{T}(y_{t}-{\hat {y}}_{t})^{2}}{T}}}.}

(Para regresiones sobre datos transversales , el subíndice t se reemplaza por i y T se reemplaza por n ).

En algunas disciplinas, el RMSD se utiliza para comparar las diferencias entre dos cosas que pueden variar, ninguna de las cuales se acepta como el "estándar". Por ejemplo, al medir la diferencia promedio entre dos series temporales y , la fórmula se convierte enincógnita1,t{\displaystyle x_{1,t}}incógnita2,t{\displaystyle x_{2,t}}

RMSD=t=1T(incógnita1,tincógnita2,t)2T.{\displaystyle \operatorname {RMSD} ={\sqrt {\frac {\sum _{t=1}^{T}(x_{1,t}-x_{2,t})^{2}}{T}}}.}

Normalización

La normalización del RMSD facilita la comparación entre conjuntos de datos o modelos con diferentes escalas. Aunque no existe un método de normalización consistente en la literatura, las opciones comunes son la media o el rango (definido como el valor máximo menos el valor mínimo) de los datos medidos: [ 4 ]

norteRMETROSD=RMETROSDymáximoymin{\displaystyle \mathrm {NRMSD} ={\frac {\mathrm {RMSD} }{y_{\max }-y_{\min }}}}o .norteRMETROSD=RMETROSDy¯{\displaystyle \mathrm {NRMSD} ={\frac {\mathrm {RMSD} }{\bar {y}}}}

Este valor se conoce comúnmente como desviación cuadrática media normalizada o error cuadrático medio normalizado (NRMSD o NRMSE), y suele expresarse como un porcentaje, donde los valores más bajos indican una menor varianza residual. También se denomina coeficiente de variación o RMS porcentual . En muchos casos, especialmente para muestras pequeñas, el rango de la muestra puede verse afectado por su tamaño, lo que dificulta las comparaciones.

Otro método posible para que la desviación cuadrática media (RMSD) sea una medida de comparación más útil es dividirla por el rango intercuartil (RIC). Al dividir la RMSD por el RIC, el valor normalizado se vuelve menos sensible a los valores extremos de la variable objetivo.

RMETROSDIQR=RMETROSDIQR{\displaystyle \mathrm {RMSDIQR} ={\frac {\mathrm {RMSD} }{IQR}}} dóndeIQR=Q3Q1{\displaystyle IQR=Q_{3}-Q_{1}}

donde CDF −1 es la función cuantil .Q1=CDF1(0,25){\displaystyle Q_{1}={\text{CDF}}^{-1}(0.25)}Q3=CDF1(0,75),{\displaystyle Q_{3}={\text{CDF}}^{-1}(0.75),}

Al normalizar por el valor medio de las mediciones, se puede utilizar el término coeficiente de variación de la RMSD, CV(RMSD), para evitar ambigüedad. [ 5 ] Esto es análogo al coeficiente de variación con la RMSD tomando el lugar de la desviación estándar .

doV(RMETROSD)=RMETROSDy¯.{\displaystyle \mathrm {CV(RMSD)} ={\frac {\mathrm {RMSD} }{\bar {y}}}.}

Aplicaciones

Véase también

Referencias

  1. Hyndman, Rob J.; Koehler, Anne B. (2006). "Otra mirada a las medidas de precisión de pronóstico". International Journal of Forecasting . 22 (4): 679– 688. CiteSeerX 10.1.1.154.9771 . doi : 10.1016/j.ijforecast.2006.03.001 . S2CID 15947215 .  
  2. Pontius, Robert; Thontteh, Olufunmilayo; Chen, Hao (2008). "Componentes de información para la comparación de múltiples resoluciones entre mapas que comparten una variable real" (PDF) . Environmental Ecological Statistics . 15 (2): 111– 142. Bibcode : 2008EnvES..15..111P . doi : 10.1007/s10651-007-0043-y . S2CID 21427573 . 
  3. Willmott, Cort; Matsuura, Kenji (2006). "Sobre el uso de medidas de error dimensionales para evaluar el rendimiento de los interpoladores espaciales". Revista Internacional de Ciencias de la Información Geográfica . 20 (1): 89– 102. Bibcode : 2006IJGIS..20...89W . doi : 10.1080/13658810500286976 . S2CID 15407960 . 
  4. "Wiki del Programa de Investigación de Ensenadas Costeras (CIRP) - Estadísticas" . Consultado el 4 de febrero de 2015 .
  5. "Preguntas frecuentes: ¿Qué es el coeficiente de variación?" . Consultado el 19 de febrero de 2019 .
  6. Armstrong, J. Scott; Collopy, Fred (1992). "Medidas de error para generalizar sobre métodos de pronóstico: comparaciones empíricas" (PDF) . International Journal of Forecasting . 8 (1): 69– 80. CiteSeerX 10.1.1.423.508 . doi : 10.1016/0169-2070(92)90008-w . S2CID 11034360 .  
  7. Anderson, MP; Woessner, WW (1992). Modelado aplicado de aguas subterráneas: simulación de flujo y transporte advectivo (2.ª ed.). Academic Press. 
  8. Modelo de red neuronal de conjunto
  9. ANSI/BPI-2400-S-2012: Práctica estándar para la cualificación estandarizada de predicciones de ahorro energético en viviendas completas mediante calibración con el historial de consumo energético.
  10. https://kalman-filter.com/root-mean-square-error
Obtenido de " https://en.wikipedia.org/w/index.php?title=Root_mean_square_deviation&oldid=1345654531 "