Articulo de referencia

Análisis de frecuencia acumulada

Distribución de frecuencia acumulada, distribución de probabilidad acumulada adaptada e intervalos de confianza. El análisis de frecuencia acumulada consiste en analizar la frec...

Distribución de frecuencia acumulada, distribución de probabilidad acumulada adaptada e intervalos de confianza.

El análisis de frecuencia acumulada consiste en analizar la frecuencia acumulada de ocurrencia de valores de un fenómeno inferiores a un valor de referencia. El fenómeno puede depender del tiempo o del espacio. La frecuencia acumulada también se denomina frecuencia de no excedencia .

El análisis de frecuencia acumulada se realiza para comprender con qué frecuencia un determinado fenómeno (característica) se encuentra por debajo de un valor específico. Esto puede ayudar a describir o explicar una situación en la que interviene el fenómeno, o a planificar intervenciones, por ejemplo, en la protección contra inundaciones. [ 1 ]

Esta técnica estadística permite determinar la probabilidad de que un evento como una inundación se repita en un período de tiempo futuro, basándose en la frecuencia con la que ocurrió en el pasado. Puede adaptarse para incorporar factores como el cambio climático, que provoca inviernos más lluviosos y veranos más secos.

Principios

Definiciones

El análisis de frecuencia [ 2 ] es el análisis de con qué frecuencia ocurre un fenómeno observado en un rango determinado.

El análisis de frecuencia se aplica a un registro de longitud N de datos observados X 1 , X 2 , X 3 . . . X N sobre un fenómeno variable X . El registro puede depender del tiempo (por ejemplo, la precipitación medida en un punto) o del espacio (por ejemplo, el rendimiento de los cultivos en un área) o de otro tipo.

La frecuencia acumulada M Xr de un valor de referencia Xr es la frecuencia con la que los valores observados X son menores o iguales a Xr .

La frecuencia acumulada relativa Fc se puede calcular a partir de:

Fc = M Xr / N

donde N es el número de datos

En resumen, esta expresión puede describirse como:

Fc = M / N

Cuando Xr = X min , donde X min es el único valor mínimo observado, se encuentra que Fc = 1/ N , porque M = 1. Por otro lado, cuando Xr = X max , donde X max es el único valor máximo observado, se encuentra que Fc = 1 , porque M = N. Por lo tanto, cuando Fc = 1, esto significa que Xr es un valor tal que todos los datos son menores o iguales a Xr .

En porcentaje, la ecuación se lee:

Fc (%) = 100 M / N

Estimación de probabilidad

A partir de la frecuencia acumulada

La probabilidad acumulada Pc de que X sea menor o igual que Xr se puede estimar de varias maneras sobre la base de la frecuencia acumulada M.

Una forma es utilizar la frecuencia acumulada relativa Fc como estimación.

Otra forma es tener en cuenta la posibilidad de que, en casos excepcionales, X pueda tomar valores mayores que el máximo observado X max . Esto se puede hacer dividiendo la frecuencia acumulada M entre N + 1 en lugar de N. La estimación queda entonces de la siguiente manera:

Pc = M / ( N +1)

También existen otras propuestas para el denominador (véase la representación gráfica de las posiciones ).

Mediante técnica de clasificación

Probabilidades acumuladas clasificadas

La estimación de la probabilidad se facilita al clasificar los datos.

Cuando los datos observados de X se ordenan en orden ascendente ( X 1X 2X 3 ≤ ⋯ ≤ X N , el mínimo primero y el máximo último), y Ri es el número de rango de la observación Xi , donde el subíndice i indica el número de serie en el rango de datos ascendentes, entonces la probabilidad acumulada se puede estimar mediante:

Pc = Ri / ( N + 1)

Por otro lado, cuando los datos observados de X se ordenan de forma descendente , con el máximo primero y el mínimo al final, y Rj es el número de rango de la observación Xj , la probabilidad acumulada se puede estimar mediante:

Pc = 1 − Rj / ( N + 1)

Ajuste de distribuciones de probabilidad

Distribuciones continuas

Diferentes distribuciones de probabilidad normal acumulativa con sus parámetros

Para presentar la distribución de frecuencia acumulada como una ecuación matemática continua en lugar de un conjunto discreto de datos, se puede intentar ajustarla a una distribución de probabilidad acumulada conocida. [ 2 ] [ 3 ] Si se logra, la ecuación conocida es suficiente para informar la distribución de frecuencia y no se requerirá una tabla de datos. Además, la ecuación facilita la interpolación y la extrapolación. Sin embargo, se debe tener cuidado al extrapolar una distribución de frecuencia acumulada, ya que esto puede ser fuente de errores. Un posible error es que la distribución de frecuencia ya no siga la distribución de probabilidad seleccionada más allá del rango de los datos observados.

Cualquier ecuación que dé el valor 1 al integrarse desde un límite inferior hasta un límite superior que concuerde bien con el rango de datos, puede utilizarse como distribución de probabilidad para el ajuste. En la sección de distribuciones de probabilidad se puede encontrar una muestra de distribuciones de probabilidad que pueden utilizarse .

Las distribuciones de probabilidad se pueden ajustar mediante varios métodos, [ 2 ] por ejemplo:

  • el método paramétrico, determinando parámetros como la media y la desviación estándar a partir de los datos X utilizando el método de los momentos , el método de máxima verosimilitud y el método de los momentos ponderados por probabilidad .
  • el método de regresión, linealizando la distribución de probabilidad a través de una transformación y determinando los parámetros a partir de una regresión lineal de la Pc transformada (obtenida a partir de la clasificación) sobre los datos X transformados .

Aplicación de ambos tipos de métodos utilizando, por ejemplo

A menudo se observa que varias distribuciones se ajustan bien a los datos y no producen resultados significativamente diferentes, mientras que las diferencias entre ellas pueden ser pequeñas en comparación con la amplitud del intervalo de confianza. [ 2 ] Esto ilustra que puede ser difícil determinar qué distribución ofrece mejores resultados. Por ejemplo, los conjuntos de datos con distribución aproximadamente normal pueden ajustarse a un gran número de distribuciones de probabilidad diferentes. [ 4 ] mientras que las distribuciones con asimetría negativa pueden ajustarse a distribuciones normales cuadradas y a distribuciones de Gumbel reflejadas. [ 5 ]

Distribución de frecuencia acumulada con una discontinuidad

Distribuciones discontinuas

En ocasiones, es posible ajustar un tipo de distribución de probabilidad a la parte inferior del rango de datos y otro tipo a la parte superior, separados por un punto de quiebre, con lo que se mejora el ajuste general.

La figura ofrece un ejemplo de una útil introducción a la distribución discontinua de datos de precipitación en el norte de Perú, donde el clima está sujeto al fenómeno de El Niño, asociado a la corriente del Pacífico . Cuando El Niño se extiende al sur de Ecuador y entra en el océano a lo largo de la costa peruana, el clima en el norte de Perú se vuelve tropical y húmedo. Cuando El Niño no llega a Perú, el clima es semiárido. Por esta razón, las precipitaciones más intensas presentan una distribución de frecuencia diferente a la de las precipitaciones más intensas.

Predicción

Incertidumbre

Cuando se deriva una distribución de frecuencia acumulada a partir de un registro de datos, cabe preguntarse si puede utilizarse para predicciones. [ 6 ] Por ejemplo, dada una distribución de caudales fluviales para los años 1950–2000, ¿puede utilizarse esta distribución para predecir con qué frecuencia se superará un determinado caudal fluvial en los años 2000–50? La respuesta es sí, siempre que las condiciones ambientales no cambien. Si las condiciones ambientales cambian, como por ejemplo alteraciones en la infraestructura de la cuenca del río o en el patrón de precipitaciones debido a cambios climáticos, la predicción basada en el registro histórico está sujeta a un error sistemático . Incluso cuando no hay un error sistemático, puede haber un error aleatorio , porque por casualidad los caudales observados durante 1950–2000 pueden haber sido superiores o inferiores a lo normal, mientras que, por otro lado, los caudales de 2000 a 2050 pueden por casualidad ser inferiores o superiores a lo normal. Cuestiones relacionadas con esto se han explorado en el libro El cisne negro .

Intervalos de confianza

Distribuciones binomiales para Pc = 0,1 (azul), 0,5 (verde) y 0,8 (rojo) en una muestra de tamaño N = 20. La distribución es simétrica solo cuando Pc = 0,5.
Intervalos de confianza binomiales del 90% en escala logarítmica.

La teoría de la probabilidad puede ayudar a estimar el rango en el que se encuentra el error aleatorio. En el caso de la frecuencia acumulada, solo existen dos posibilidades: que se supere un valor de referencia X o que no se supere. La suma de la frecuencia de superación y la frecuencia acumulada es 1 o 100%. Por lo tanto, la distribución binomial puede utilizarse para estimar el rango del error aleatorio.

Según la teoría normal, la distribución binomial se puede aproximar y, para valores grandes de N, la desviación estándar Sd se puede calcular de la siguiente manera:

Sd = Pc (1 − Pc )/ N

donde Pc es la probabilidad acumulada y N es el número de datos. Se observa que la desviación estándar Sd disminuye a medida que aumenta el número de observaciones N.

La determinación del intervalo de confianza de Pc se realiza mediante la prueba t de Student ( t ). El valor de t depende del número de datos y del nivel de confianza de la estimación del intervalo de confianza. A continuación, se obtienen los límites de confianza inferior ( L ) y superior ( U ) de Pc en una distribución simétrica a partir de:

L = PctSd
U = Pc + tSd

Esto se conoce como intervalo de Wald . [ 7 ] Sin embargo, la distribución binomial solo es simétrica alrededor de la media cuando Pc = 0,5 , pero se vuelve asimétrica y cada vez más sesgada cuando Pc se aproxima a 0 o 1. Por lo tanto, por aproximación, Pc y 1− Pc pueden usarse como factores de ponderación en la asignación de t.Sd a L y U  :

L = Pc − 2⋅ PctSd
U = Pc + 2⋅(1− Pc )⋅ tSd

donde se puede ver que estas expresiones para Pc = 0,5 son las mismas que las anteriores.

Notas

Período de devolución

Periodos de retorno y zona de confianza. La curva de los periodos de retorno aumenta exponencialmente.

La probabilidad acumulada Pc también puede denominarse probabilidad de no excedencia . La probabilidad de excedencia Pe (también llamada función de supervivencia ) se obtiene a partir de:

Pe = 1 − Pc

El período de retorno T se define como:

T = 1/ Pe

e indica el número esperado de observaciones que deben repetirse para encontrar un valor de la variable en estudio mayor que el valor utilizado para T. Los límites de confianza superior ( TU ) e inferior ( TL ) de los períodos de retorno se pueden encontrar respectivamente como:

T U = 1 / (1− U )
T L = 1 / (1− L )

Para valores extremos de la variable en estudio, U se aproxima a 1 y pequeños cambios en U originan grandes cambios en T U. Por lo tanto, el período de retorno estimado de los valores extremos está sujeto a un gran error aleatorio. Además, los intervalos de confianza encontrados son válidos para una predicción a largo plazo. Para predicciones a corto plazo, los intervalos de confianza UL y T UT L pueden ser más amplios. Junto con la certeza limitada (menos del 100%) utilizada en la prueba t , esto explica por qué, por ejemplo, una precipitación que ocurre cada 100 años podría ocurrir dos veces en 10 años.

Nueve curvas de periodo de retorno de muestras de 50 años a partir de un registro teórico de 1000 años (línea base).

La noción estricta de periodo de retorno solo tiene sentido cuando se trata de un fenómeno dependiente del tiempo, como la precipitación puntual. En ese caso, el periodo de retorno corresponde al tiempo de espera previsto hasta que se produzca de nuevo el evento excepcional. El periodo de retorno tiene la misma dimensión que el tiempo para el que cada observación es representativa. Por ejemplo, cuando las observaciones se refieren a precipitaciones diarias, el periodo de retorno se expresa en días, y para precipitaciones anuales, en años.

Necesidad de cinturones de confianza

La figura muestra la variación que puede ocurrir al obtener muestras de una variable que sigue una determinada distribución de probabilidad. Los datos fueron proporcionados por Benson. [ 1 ]

El intervalo de confianza que rodea una curva experimental de frecuencia acumulada o período de retorno da una idea de la región en la que se puede encontrar la distribución verdadera.

Además, aclara que la distribución de probabilidad que mejor se ajusta, hallada experimentalmente, puede desviarse de la distribución verdadera.

Histograma

Histograma derivado de la distribución de probabilidad acumulativa adaptada
Histograma y función de densidad de probabilidad, derivados de la distribución de probabilidad acumulada, para una distribución logística .

Los datos observados se pueden organizar en clases o grupos con número de serie k. Cada grupo tiene un límite inferior (Lk) y un límite superior (Uk). Cuando la clase (k) contiene mk datos y el número total de datos es N , entonces la frecuencia relativa de la clase o grupo se obtiene a partir de:

Fg ( L k < XU k ) = m k / N

o brevemente:

Fg k = m / N

o en porcentaje:

Fg (%) = 100 m / N

La representación de todas las frecuencias de clase da como resultado una distribución de frecuencias o histograma . Los histogramas, incluso cuando se elaboran a partir del mismo registro, son diferentes para distintos límites de clase.

El histograma también puede derivarse de la distribución de probabilidad acumulada ajustada:

Pg k = Pc ( U k ) − Pc ( L k )

Puede existir una diferencia entre Fg k y Pg k debido a las desviaciones de los datos observados con respecto a la distribución ajustada (véase la figura azul).

A menudo se desea combinar el histograma con una función de densidad de probabilidad , como se muestra en la imagen en blanco y negro.

Véase también

Referencias

  1. 1 2 Benson, MA 1960. Características de las curvas de frecuencia basadas en un registro teórico de 1000 años. En: T. Dalrymple (ed.), Análisis de frecuencia de inundaciones. US Geological Survey Water Supply paper 1543-A, pp. 51–71
  2. 1 2 3 4 Análisis de frecuencia y regresión . Capítulo 6 en: HP Ritzema (ed., 1994), Principios y aplicaciones del drenaje , Publ. 16, pp. 175–224, Instituto Internacional para la Recuperación y Mejora de Tierras (ILRI), Wageningen, Países Bajos. ISBN 90-70754-33-9Descarga gratuita desde la página web.bajo el n.º 12, o directamente como PDF  :
  3. David Vose, Ajuste de distribuciones a datos
  4. Ejemplo de un conjunto de datos con distribución aproximadamente normal al que se pueden ajustar un gran número de distribuciones de probabilidad diferentes,
  5. Los histogramas de frecuencia asimétricos hacia la izquierda (negativamente) se pueden ajustar a funciones de probabilidad de Gumbel cuadradas normales o reflejadas.
  6. Silvia Masciocchi, 2012, Métodos estadísticos en física de partículas, Lección 11, Semestre de invierno 2012/13, GSI Darmstadt.
  7. Wald, A.; J. Wolfowitz (1939). "Límites de confianza para funciones de distribución continuas" . The Annals of Mathematical Statistics . 10 (2): 105– 118. doi : 10.1214/aoms/1177732209 .
  8. Ghosh, BK (1979). "Una comparación de algunos intervalos de confianza aproximados para el parámetro binomial". Journal of the American Statistical Association . 74 (368): 894– 900. doi : 10.1080/01621459.1979.10481051 .
  9. Blyth, CR; HA Still (1983). "Intervalos de confianza binomiales". Journal of the American Statistical Association . 78 (381): 108– 116. doi : 10.1080/01621459.1983.10477938 .
  10. Agresti, A.; B. Caffo (2000). "Intervalos de confianza simples y efectivos para proporciones y diferencias de proporciones que resultan de la suma de dos éxitos y dos fracasos". The American Statistician . 54 (4): 280– 288. doi : 10.1080/00031305.2000.10474560 . S2CID 18880883 . 
  11. Wilson, EB (1927). "Inferencia probable, la ley de sucesión e inferencia estadística". Journal of the American Statistical Association . 22 (158): 209– 212. doi : 10.1080/01621459.1927.10502953 .
  12. Hogg, RV (2001). Probabilidad e inferencia estadística (6.ª ed.). Prentice Hall, NJ: Upper Saddle River.