Articulo de referencia

Ajuste de la distribución de probabilidad

El ajuste de distribuciones de probabilidad , o simplemente ajuste de distribución, consiste en ajustar una distribución de probabilidad a una serie de datos relativos a la medi...

El ajuste de distribuciones de probabilidad , o simplemente ajuste de distribución, consiste en ajustar una distribución de probabilidad a una serie de datos relativos a la medición repetida de un fenómeno variable. El objetivo del ajuste de distribución es predecir la probabilidad o pronosticar la frecuencia de ocurrencia de la magnitud del fenómeno en un intervalo determinado.

Existen numerosas distribuciones de probabilidad (véase la lista de distribuciones de probabilidad ), algunas de las cuales se ajustan mejor a la frecuencia observada de los datos que otras, dependiendo de las características del fenómeno y de la distribución. Se supone que la distribución que mejor se ajusta a los datos proporciona buenas predicciones. Por lo tanto, al ajustar una distribución, es necesario seleccionar una que se adapte bien a los datos.

Selección de distribución

Diferentes formas de la distribución normal simétrica dependiendo de la media μ y la varianza σ²

La selección de la distribución apropiada depende de la presencia o ausencia de simetría del conjunto de datos con respecto a la tendencia central .

Distribuciones simétricas

Cuando los datos se distribuyen simétricamente alrededor de la media, mientras que la frecuencia de aparición de los datos más alejados de la media disminuye, se puede optar, por ejemplo, por la distribución normal , la distribución logística o la distribución t de Student . Las dos primeras son muy similares, mientras que la última, con un grado de libertad, tiene "colas más pesadas", lo que significa que los valores más alejados de la media aparecen con mayor frecuencia (es decir, la curtosis es mayor). La distribución de Cauchy también es simétrica.

Distribuciones asimétricas hacia la derecha

Desviación hacia la izquierda y hacia la derecha.

Cuando los valores mayores tienden a alejarse más de la media que los menores, se tiene una distribución asimétrica hacia la derecha (es decir, asimetría positiva ). Por ejemplo, se puede elegir la distribución log-normal (es decir, los valores logarítmicos de los datos se distribuyen normalmente ), la distribución log-logística (es decir, los valores logarítmicos de los datos siguen una distribución logística ), la distribución de Gumbel , la distribución exponencial , la distribución de Pareto , la distribución de Weibull , la distribución de Burr o la distribución de Fréchet . Las últimas cuatro distribuciones están acotadas a la izquierda.

Distribuciones asimétricas hacia la izquierda

Cuando los valores más pequeños tienden a estar más alejados de la media que los valores más grandes, se tiene una distribución asimétrica hacia la izquierda (es decir, hay asimetría negativa), se puede seleccionar, por ejemplo, la distribución normal cuadrada (es decir, la distribución normal aplicada al cuadrado de los valores de los datos), [ 1 ] la distribución de Gumbel invertida (reflejada), [ 1 ] la distribución de Dagum (distribución de Burr reflejada) o la distribución de Gompertz , que está acotada a la izquierda.

Técnicas de ajuste

Existen las siguientes técnicas de ajuste de distribución: [ 2 ]

Distribución acumulativa de Gumbel ajustada a las precipitaciones máximas de un día de octubre en Surinam mediante el método de regresión con banda de confianza añadida

Generalización de las distribuciones

Es habitual transformar los datos logarítmicamente para ajustar distribuciones simétricas (como la normal y la logística ) a datos que siguen una distribución asimétrica positiva (es decir, asimétrica a la derecha, con media mayor que la moda y con una cola derecha más larga que la izquierda); véanse la distribución lognormal y la distribución loglogística . Un efecto similar se puede lograr calculando la raíz cuadrada de los datos.

Para ajustar una distribución simétrica a datos que obedecen a una distribución asimétrica negativa (es decir, asimétrica hacia la izquierda, con media < moda , y con una cola derecha más corta que la cola izquierda), se podrían utilizar los valores al cuadrado de los datos para lograr el ajuste.

De forma más general, se pueden elevar los datos a una potencia p para ajustar distribuciones simétricas a datos que obedecen a una distribución de cualquier asimetría, donde p < 1 cuando la asimetría es positiva y p > 1 cuando la asimetría es negativa. El valor óptimo de p se encuentra mediante un método numérico . Este método puede consistir en asumir un rango de valores de p , luego aplicar repetidamente el procedimiento de ajuste de distribución para todos los valores de p asumidos y, finalmente, seleccionar el valor de p para el cual la suma de los cuadrados de las desviaciones de las probabilidades calculadas con respecto a las frecuencias medidas ( chi cuadrado ) es mínima.

La generalización mejora la flexibilidad de las distribuciones de probabilidad y aumenta su aplicabilidad en el ajuste de distribuciones. [ 6 ]

La versatilidad de generalización permite, por ejemplo, ajustar conjuntos de datos con distribución aproximadamente normal a un gran número de distribuciones de probabilidad diferentes, [ 7 ] mientras que las distribuciones con asimetría negativa pueden ajustarse a distribuciones normales cuadradas y distribuciones de Gumbel reflejadas. [ 8 ]

Inversión de la asimetría

(A) Distribución de probabilidad de Gumbel asimétrica hacia la derecha y (B) Distribución de probabilidad reflejada de Gumbel asimétrica hacia la izquierda.

Las distribuciones asimétricas pueden invertirse (o reflejarse) sustituyendo en la expresión matemática de la función de distribución acumulativa (F) por su complemento: F'=1-F, obteniendo así la función de distribución complementaria (también llamada función de supervivencia ) que proporciona una imagen especular. De esta forma, una distribución asimétrica hacia la derecha se transforma en una distribución asimétrica hacia la izquierda y viceversa.

La técnica de inversión de asimetría aumenta el número de distribuciones de probabilidad disponibles para el ajuste de distribuciones y amplía las oportunidades de ajuste de distribuciones.

Cambio de distribuciones

Algunas distribuciones de probabilidad, como la exponencial , no admiten valores negativos ( X ). Sin embargo, cuando hay datos negativos, estas distribuciones aún pueden usarse reemplazando X por Y = X - Xm , donde Xm es el valor mínimo de X. Este reemplazo representa un desplazamiento de la distribución de probabilidad en dirección positiva, es decir, hacia la derecha, porque Xm es negativo. Después de completar el ajuste de la distribución de Y , los valores de X correspondientes se obtienen a partir de X = Y + Xm , lo que representa un desplazamiento inverso de la distribución en dirección negativa, es decir, hacia la izquierda. La técnica de desplazamiento de la distribución aumenta la probabilidad de encontrar una distribución de probabilidad que se ajuste correctamente.

Distribuciones compuestas

Distribución compuesta (discontinua) con banda de confianza [ 9 ]

Existe la opción de utilizar dos distribuciones de probabilidad diferentes, una para el rango de datos inferior y otra para el superior, como por ejemplo la distribución de Laplace . Los rangos están separados por un punto de quiebre. El uso de tales distribuciones de probabilidad compuestas (discontinuas) puede ser oportuno cuando los datos del fenómeno estudiado se obtuvieron bajo dos conjuntos de condiciones diferentes. [ 6 ]

Incertidumbre de predicción

Análisis de incertidumbre con bandas de confianza utilizando la distribución binomial [ 10 ]

Las predicciones de ocurrencia basadas en distribuciones de probabilidad ajustadas están sujetas a incertidumbre , que surge de las siguientes condiciones:

  • La verdadera distribución de probabilidad de los eventos puede desviarse de la distribución ajustada, ya que la serie de datos observada puede no ser totalmente representativa de la probabilidad real de ocurrencia del fenómeno debido a errores aleatorios.
  • La ocurrencia de eventos en otra situación o en el futuro puede desviarse de la distribución ajustada, ya que esta ocurrencia también puede estar sujeta a error aleatorio.
  • Un cambio en las condiciones ambientales puede provocar un cambio en la probabilidad de ocurrencia del fenómeno.
Variaciones de nueve curvas de período de retorno de muestras de 50 años a partir de un registro teórico de 1000 años (línea base), datos de Benson [ 11 ]

Una estimación de la incertidumbre en el primer y segundo caso puede obtenerse con la distribución de probabilidad binomial, utilizando, por ejemplo, la probabilidad de excedencia Pe (es decir, la probabilidad de que el evento X sea mayor que un valor de referencia Xr de X ) y la probabilidad de no excedencia Pn (es decir, la probabilidad de que el evento X sea menor o igual que el valor de referencia Xr , también llamada probabilidad acumulada ). En este caso, solo existen dos posibilidades: o bien se produce la excedencia o bien no se produce. Esta dualidad es la razón por la que la distribución binomial es aplicable.

Con la distribución binomial se puede obtener un intervalo de predicción . Dicho intervalo también estima el riesgo de fallo, es decir, la probabilidad de que el evento previsto permanezca fuera del intervalo de confianza. El análisis de confianza o riesgo puede incluir el período de retorno T=1/Pe, como se hace en hidrología .

Varianza de las funciones de probabilidad ajustadas bayesianas

Se puede utilizar un enfoque bayesiano para ajustar un modelo.PAG(incógnita|θ){\displaystyle P(x|\theta )}tener una distribución previaPAG(θ){\displaystyle P(\theta )}para el parámetroθ{\displaystyle \theta }Cuando uno tiene muestrasincógnita{\displaystyle X}que se extraen independientemente de la distribución subyacente entonces se puede derivar la llamada distribución posteriorPAG(θ|incógnita){\displaystyle P(\theta |X)}Esta distribución posterior se puede utilizar para actualizar la función de probabilidad de masa para una nueva muestra.incógnita{\displaystyle x}dadas las observacionesincógnita{\displaystyle X}, uno obtiene

PAGθ(incógnita|incógnita):=dθ PAG(incógnita|θ) PAG(θ|incógnita).{\displaystyle P_{\theta }(x|X):=\int d\theta \ P(x|\theta )\ P(\theta |X).}

También se puede determinar la varianza de la función de masa de probabilidad recién obtenida. La varianza para una función de masa de probabilidad bayesiana se puede definir como

σPAGθ(incógnita|incógnita)2:=dθ [PAG(incógnita|θ)PAGθ(incógnita|incógnita)]2 PAG(θ|incógnita).{\displaystyle \sigma _{P_{\theta }(x|X)}^{2}:=\int d\theta \ \left[P(x|\theta )-P_{\theta }(x|X)\right]^{2}\ P(\theta |X).}

Esta expresión para la varianza se puede simplificar sustancialmente (suponiendo muestras extraídas independientemente). Definiendo la "función de masa de probabilidad propia" como

PAGθ(incógnita|{incógnita,incógnita})=dθ PAG(incógnita|θ) PAG(θ|{incógnita,incógnita}),{\displaystyle P_{\theta }(x|\left\{X,x\right\})=\int d\theta \ P(x|\theta )\ P(\theta |\left\{X,x\right\}),}

se obtiene para la varianza [ 12 ]

σPAGθ(incógnita|incógnita)2=PAGθ(incógnita|incógnita)[PAGθ(incógnita|{incógnita,incógnita})PAGθ(incógnita|incógnita)].{\displaystyle \sigma _{P_{\theta }(x|X)}^{2}=P_{\theta }(x|X)\left[P_{\theta }(x|\left\{X,x\right\})-P_{\theta }(x|X)\right].}

La expresión para la varianza implica un ajuste adicional que incluye la muestra.incógnita{\displaystyle x}de interés.

Lista de distribuciones de probabilidad clasificadas según su grado de ajuste.
Histograma y densidad de probabilidad de un conjunto de datos que se ajusta a la distribución GEV.

Bondad de ajuste

Al clasificar el grado de ajuste de varias distribuciones, se puede obtener una idea de qué distribución es aceptable y cuál no.

Histograma y función de densidad

A partir de la función de distribución acumulativa (CDF) se puede derivar un histograma y la función de densidad de probabilidad (PDF).

Véase también

Referencias

  1. 1 2 Los histogramas de frecuencia asimétricos hacia la izquierda (negativamente) se pueden ajustar a funciones de probabilidad normales cuadradas o de Gumbel reflejadas. En línea:
  2. Análisis de frecuencia y regresión . Capítulo 6 en: HPRitzema (ed., 1994), Principios y aplicaciones del drenaje , Publ. 16, pp. 175–224, Instituto Internacional para la Recuperación y Mejora de Tierras (ILRI), Wageningen, Países Bajos. ISBN 9070754339Descarga gratuita desde la página web.bajo el n.º 12, o directamente como PDF  :
  3. H. Cramér, "Métodos matemáticos de estadística", Princeton Univ. Press (1946)
  4. Hosking, JRM (1990). "Momentos L: análisis y estimación de distribuciones mediante combinaciones lineales de estadísticas de orden". Journal of the Royal Statistical Society, Serie B. 52 ( 1): 105–124 . JSTOR 2345653 . 
  5. Aldrich, John (1997). "RA Fisher y la creación de la máxima verosimilitud 1912–1922" . Statistical Science . 12 (3): 162– 176. doi : 10.1214/ss/1030037906 . MR 1617519 . 
  6. 1 2 3 Software para distribuciones de probabilidad generalizadas y compuestas. Revista Internacional de Métodos Matemáticos y Computacionales, 4, 1-9o
  7. Ejemplo de un conjunto de datos con distribución aproximadamente normal al que se pueden ajustar un gran número de distribuciones de probabilidad diferentes,
  8. Los histogramas de frecuencia asimétricos hacia la izquierda (negativamente) se pueden ajustar a funciones de probabilidad de Gumbel cuadradas normales o reflejadas.
  9. Introducción a las distribuciones de probabilidad compuestas
  10. Predicciones de frecuencia y sus límites de confianza binomiales. En: Comisión Internacional de Riego y Drenaje, Sesión Técnica Especial: Aspectos Económicos del Control de Inundaciones y Medidas No Estructurales, Dubrovnik, Yugoslavia, 1988. Disponible en línea.
  11. Benson, MA 1960. Características de las curvas de frecuencia basadas en un registro teórico de 1000 años. En: T. Dalrymple (Ed.), Análisis de frecuencia de inundaciones. US Geological Survey Water Supply Paper, 1543-A, pp. 51-71.
  12. Pijlman; Linnartz (2023). "Varianza de la verosimilitud de los datos" . Actas de SITB 2023 : 34.