En estadística, las medidas de escala robustas son métodos que cuantifican la dispersión estadística en una muestra de datos numéricos , a la vez que resisten los valores atípicos . Estas se diferencian de las medidas de escala convencionales o no robustas, como la desviación estándar muestral , que se ven muy afectadas por los valores atípicos.
Las estadísticas robustas más comunes son el rango intercuartil (RIC) y la desviación absoluta mediana (DAM). También se han desarrollado estimadores robustos alternativos, como los basados en diferencias por pares y la mediana de varianza ponderada.
Estas estadísticas robustas se utilizan particularmente como estimadores de un parámetro de escala y presentan las ventajas de robustez y eficiencia superior en datos contaminados, a costa de una eficiencia inferior en datos limpios de distribuciones como la distribución normal. Para ilustrar la robustez, la desviación estándar puede hacerse arbitrariamente grande aumentando exactamente una observación (tiene un punto de ruptura de 0, ya que puede contaminarse con un solo punto), un defecto que no comparten las estadísticas robustas.
Cabe señalar que, en ámbitos como las finanzas, la suposición de normalidad puede conllevar una exposición excesiva al riesgo, y que puede ser necesaria una mayor parametrización para mitigar los riesgos que presenta la curtosis anormal .
Métodos de estimación
Las medidas de escala robustas pueden utilizarse como estimadores de propiedades de la población, ya sea para la estimación de parámetros o como estimadores de su propio valor esperado .
Por ejemplo, se utilizan estimadores robustos de escala para estimar la desviación estándar poblacional , generalmente multiplicándola por un factor de escala para convertirla en un estimador insesgado y consistente ; véase parámetro de escala: estimación . Por ejemplo, el rango intercuartil puede convertirse en un estimador insesgado y consistente para la desviación estándar poblacional si los datos siguen una distribución normal y la medida se divide por: dóndees la función de error inversa.
En otras situaciones, resulta más conveniente considerar una medida de escala robusta como un estimador de su propio valor esperado , interpretado como una alternativa a la desviación estándar poblacional como medida de escala. Por ejemplo, la desviación absoluta mediana (DAM) de una muestra de una distribución de Cauchy estándar es un estimador de la DAM poblacional, que en este caso es 1, mientras que la varianza poblacional no existe.
Eficiencia estadística
Los estimadores robustos suelen tener una eficiencia estadística inferior a la de los estimadores convencionales para datos extraídos de una distribución sin valores atípicos, como una distribución normal. Sin embargo, presentan una eficiencia superior para datos extraídos de una distribución mixta o de una distribución con colas pesadas , para las cuales no se deben utilizar medidas no robustas como la desviación estándar.
Por ejemplo, para datos extraídos de la distribución normal, la desviación absoluta mediana es un 37 % tan eficiente como la desviación estándar de la muestra, mientras que el estimador de Rousseeuw-Croux Q n es un 88 % tan eficiente como la desviación estándar de la muestra.
estimadores robustos comunes
Una de las medidas de escala más comunes y robustas es el rango intercuartil (RIC), que es la diferencia entre el percentil 75 y el percentil 25 de una muestra; este es el rango recortado al 25 % , un ejemplo de estimador L. También se pueden utilizar otros rangos recortados, como el rango interdecil (rango recortado al 10 %).
Para una distribución gaussiana, el IQR está relacionado con, la desviación estándar , como: [ 1 ]
Otra medida de escala robusta de uso común es la desviación absoluta mediana (DAM), la mediana de los valores absolutos de las diferencias entre los valores de los datos y la mediana general del conjunto de datos; para una distribución gaussiana, la DAM está relacionada concomo: [ 2 ] Para obtener más detalles, visite la sección sobre la relación con la desviación estándar en el artículo principal sobre MAD.
S n y Q n
Rousseeuw y Croux [ 3 ] propusieron 2 alternativas a la desviación absoluta mediana, motivadas por dos de sus debilidades:
- Es ineficiente (37% de eficiencia) en distribuciones gaussianas .
- Calcula una estadística simétrica sobre una estimación de ubicación, por lo que no tiene en cuenta la asimetría .
Proponen dos estadísticas alternativas basadas en diferencias por pares: S n y Q n.
S n se define como: Q n se define como: [ 4 ]
Dónde:
- El factor 2,2219 es una constante de consistencia,
- El conjuntoconsiste en todas las diferencias absolutas por pares entre las observaciones.y, y
- El subíndicerepresenta elestadística de orden n, o
Estos se pueden calcular en un tiempo de O ( n log n ) y un espacio de O ( n ).
Ninguno de estos métodos requiere estimación de ubicación , ya que se basan únicamente en diferencias entre valores. Ambos son más eficientes que el MAD bajo una distribución gaussiana: S n tiene una eficiencia del 58%, mientras que Q n tiene una eficiencia del 82%.
Para una muestra de una distribución normal, S n es aproximadamente insesgado para la desviación estándar de la población incluso con tamaños de muestra muy modestos (<1% de sesgo para n = 10).
Para una muestra grande de una distribución normal, 2,22 Q n es aproximadamente insesgado para la desviación estándar de la población. Para muestras pequeñas o moderadas, el valor esperado de Q n bajo una distribución normal depende notablemente del tamaño de la muestra, por lo que se utilizan factores de corrección para muestras finitas (obtenidos de una tabla o de simulaciones) para calibrar la escala de Q n .
La varianza media de ponderación doble
Al igual que S n y Q n , la varianza media biponderada está diseñada para ser robusta sin sacrificar demasiada eficiencia. Se define como: [ 5 ]
donde I es la función indicadora , Q es la mediana muestral de X i y
Su raíz cuadrada es un estimador robusto de la escala, ya que los puntos de datos se ponderan a la baja a medida que aumenta su distancia de la mediana, y los puntos que se encuentran a más de 9 unidades MAD de la mediana no tienen ninguna influencia.
La eficiencia del método biweight se ha estimado en un 84,7 % para conjuntos de 20 muestras extraídas de distribuciones generadas sintéticamente con curtosis adicional ("colas alargadas"). Para distribuciones gaussianas, su eficiencia se ha estimado en un 98,2 %. [ 6 ]
Profundidad de escala de ubicación
Mizera y Müller extendieron el enfoque ofrecido por Rousseeuw y Hubert al proponer un estimador robusto basado en profundidad para la ubicación y la escala simultáneamente, llamado profundidad de ubicación-escala. Se define de la siguiente manera: [ 7 ]
Dónde:
- es una abreviatura de,
- ydepender de una densidad fija
Sugieren que la versión más manejable de la profundidad de escala de localización es la basada en la distribución t de Student.
Intervalos de confianza
Un intervalo de confianza robusto es una modificación robusta de los intervalos de confianza , lo que significa que se modifican los cálculos no robustos del intervalo de confianza para que no se vean gravemente afectados por observaciones atípicas o anómalas en un conjunto de datos.
Ejemplo
En el proceso de pesar 1000 objetos, en condiciones prácticas, es fácil creer que el operador podría cometer un error de procedimiento y, por lo tanto, reportar una masa incorrecta (incurriendo así en un tipo de error sistemático ). Supongamos que hay 100 objetos y el operador los pesa todos, uno por uno, y repite todo el proceso diez veces. Entonces, el operador puede calcular una desviación estándar muestral para cada objeto y buscar valores atípicos . Cualquier objeto con una desviación estándar inusualmente grande probablemente tenga un valor atípico en sus datos. Estos pueden eliminarse mediante varias técnicas no paramétricas. Si el operador repitiera el proceso solo tres veces, simplemente tomar la mediana de las tres mediciones y usar σ daría un intervalo de confianza. Los 200 pesajes adicionales solo sirvieron para detectar y corregir el error del operador y no hicieron nada para mejorar el intervalo de confianza. Con más repeticiones, se podría usar una media truncada , descartando los valores más grandes y más pequeños y promediando el resto. Se podría utilizar un cálculo bootstrap para determinar un intervalo de confianza más estrecho que el calculado a partir de σ, y así obtener algún beneficio a pesar de la gran cantidad de trabajo adicional.
Estos procedimientos son robustos frente a errores de procedimiento que no se modelan mediante la suposición de que la balanza tiene una desviación estándar σ fija y conocida. En aplicaciones prácticas donde pueden ocurrir errores ocasionales del operador o la balanza puede fallar, no se pueden dar por sentados los supuestos en los que se basan los cálculos estadísticos simples. Antes de confiar en los resultados de 100 objetos pesados solo tres veces cada uno para obtener intervalos de confianza calculados a partir de σ, es necesario comprobar y eliminar un número razonable de valores atípicos (verificando la suposición de que el operador es cuidadoso y corrigiendo el hecho de que no es perfecto), y comprobar la suposición de que los datos realmente tienen una distribución normal con desviación estándar σ.
Simulación por ordenador
El análisis teórico de dicho experimento es complicado, pero es fácil configurar una hoja de cálculo que extraiga números aleatorios de una distribución normal con desviación estándar σ para simular la situación; esto se puede hacer en Microsoft Excel usando =NORMINV(RAND(),0,σ)), como se discute en [ 8 ] y las mismas técnicas se pueden usar en otros programas de hojas de cálculo como en OpenOffice.org Calc y gnumeric .
Tras eliminar los valores atípicos evidentes, se podría restar la mediana de los otros dos valores para cada objeto y examinar la distribución de los 200 números resultantes. Debería ser normal, con una media cercana a cero y una desviación estándar ligeramente mayor que σ. Un cálculo sencillo mediante una hoja de cálculo de Monte Carlo revelaría valores típicos para la desviación estándar (entre el 105 % y el 115 % de σ). O bien, se podría restar la media de cada triplete a los valores y examinar la distribución de 300 valores. La media es idénticamente cero, pero la desviación estándar debería ser algo menor (entre el 75 % y el 85 % de σ).
Véase también
Referencias
- ↑ "Rango intercuartil" . NIST . Consultado el 30 de marzo de 2022 .
- ↑ Pham-Gia, T.; Hung, TL (2001-10-01). "Las desviaciones absolutas media y mediana" . Mathematical and Computer Modelling . 34 (7): 921– 936. doi : 10.1016/S0895-7177(01)00109-1 . ISSN 0895-7177 .
- ↑ Rousseeuw, Peter J.; Croux, Christophe (diciembre de 1993), "Alternativas a la desviación absoluta mediana", Journal of the American Statistical Association , 88 (424), American Statistical Association: 1273–1283 , doi : 10.2307/2291267 , JSTOR 2291267
- ↑ Croux, Christophe; Rousseeuw, Peter J. (1992). «Algoritmos eficientes en tiempo para dos estimadores de escala altamente robustos» . En Dodge, Yadolah; Whittaker, Joe (eds.). Estadística computacional . Heidelberg: Physica-Verlag HD. pp. 411–428 . doi : 10.1007/978-3-662-26811-7_58 . ISBN 978-3-662-26811-7.
- ↑ "Biweight Midvariance" . www.itl.nist.gov . Consultado el 18 de mayo de 2025 .
- ↑ Kafadar, Karen (1983). "La eficiencia del biweight como estimador robusto de la ubicación" . Journal of Research of the National Bureau of Standards . 88 (2): 105– 116. doi : 10.6028 / jres.088.006 . ISSN 0160-1741 . PMC 6768164. PMID 34566098 .
- ↑ Mizera, I.; Müller, CH (2004), "Profundidad de escala de localización", Journal of the American Statistical Association , 99 (468): 949– 966, doi : 10.1198/016214504000001312.
- ↑ Wittwer, JW, "Simulación de Monte Carlo en Excel: una guía práctica" , 1 de junio de 2004
- Estadísticas sólidas
- Desviación estadística y dispersión
- Estadísticas de escala