En teoría de la probabilidad e informática , una probabilidad logarítmica es simplemente el logaritmo de una probabilidad . [ 1 ] El uso de probabilidades logarítmicas significa representar probabilidades en una escala logarítmica , en lugar del intervalo unitario estándar .
Dado que las probabilidades de eventos independientes se multiplican y los logaritmos convierten la multiplicación en suma, las probabilidades logarítmicas de eventos independientes se suman. Por lo tanto, las probabilidades logarítmicas son prácticas para los cálculos y tienen una interpretación intuitiva en términos de la teoría de la información : el valor esperado negativo de las probabilidades logarítmicas es la entropía de la información de un evento. De manera similar, las probabilidades se transforman a menudo a la escala logarítmica, y la probabilidad logarítmica correspondiente puede interpretarse como el grado en que un evento respalda un modelo estadístico . La probabilidad logarítmica se utiliza ampliamente en implementaciones de cálculos con probabilidad y se estudia como un concepto en sí mismo en algunas aplicaciones de la teoría de la información, como el procesamiento del lenguaje natural .
Motivación
Representar las probabilidades de esta manera tiene varias ventajas prácticas:
- Velocidad. Dado que la multiplicación es más costosa que la suma, el producto de un gran número de probabilidades suele ser más rápido si se representan en forma logarítmica. (La conversión a forma logarítmica es costosa, pero solo se realiza una vez). La multiplicación surge del cálculo de la probabilidad de que ocurran múltiples eventos independientes: la probabilidad de que ocurran todos los eventos independientes de interés es el producto de las probabilidades de todos estos eventos.
- Precisión. El uso de probabilidades logarítmicas mejora la estabilidad numérica cuando las probabilidades son muy pequeñas, debido a la forma en que las computadoras aproximan los números reales . [ 1 ]
- Sencillez. Muchas distribuciones de probabilidad tienen una forma exponencial. Al tomar el logaritmo de estas distribuciones, se elimina la función exponencial, descomponiendo el exponente. Por ejemplo, el logaritmo de la probabilidad de la función de densidad de probabilidad de la distribución normal es en lugar de . Los logaritmos de probabilidad facilitan algunas manipulaciones matemáticas.
- Optimización. Dado que la mayoría de las distribuciones de probabilidad comunes —en particular la familia exponencial— son solo logarítmicamente cóncavas , [ 2 ] [ 3 ] y la concavidad de la función objetivo juega un papel clave en la maximización de una función como la probabilidad, los optimizadores funcionan mejor con probabilidades logarítmicas.
Cuestiones de representación
La función logaritmo no está definida para cero, por lo que las probabilidades logarítmicas solo pueden representar probabilidades distintas de cero. Dado que el logaritmo de un número en un intervalo es negativo, a menudo se utilizan probabilidades logarítmicas negativas. En ese caso, las probabilidades logarítmicas en las siguientes fórmulas se invertirían .
Se puede seleccionar cualquier base para el logaritmo.
Manipulaciones básicas
En esta sección denominaremos probabilidades en espacio logarítmico y, de forma abreviada:
El producto de probabilidades corresponde a una suma en el espacio logarítmico.
La suma de probabilidades es un poco más compleja de calcular en el espacio logarítmico, ya que requiere el cálculo de un exponente y un logaritmo.
Sin embargo, en muchas aplicaciones, la multiplicación de probabilidades (que da la probabilidad de que ocurran todos los eventos independientes) se usa con más frecuencia que su suma (que da la probabilidad de que ocurra al menos uno de eventos mutuamente excluyentes). Además, en algunas situaciones se puede evitar el costo de calcular la suma simplemente usando la probabilidad más alta como aproximación. Dado que las probabilidades son no negativas, esto proporciona un límite inferior. Esta aproximación se usa a la inversa para obtener una aproximación continua de la función max .
Adición en el espacio del registro
La fórmula anterior es más precisa que , siempre que se aproveche la asimetría en la fórmula de suma. debe ser el mayor (menos negativo) de los dos operandos. Esto también produce el comportamiento correcto si uno de los operandos es un infinito negativo de punto flotante , que corresponde a una probabilidad de cero.
Esta cantidad es indeterminada y dará como resultado NaN . Esta es la respuesta deseada.
La fórmula anterior por sí sola producirá incorrectamente un resultado indeterminado en el caso de que ambos argumentos sean . Esto debe comprobarse por separado para devolver .
Por razones numéricas, se debe utilizar una función que calcule ( log1p ) directamente.
Véase también
Referencias
- 12Piech, Chris. "Probability for Computer scientists - Log probabilities". Retrieved 20 July 2023.
- ↑Kass, Robert E.; Vos, Paul W. (1997). Geometrical Foundations of Asymptotic Inference. New York: John Wiley & Sons. p. 14. ISBN 0-471-82668-5.
- ↑Papadopoulos, Alecos (September 25, 2013). "Why we always put log() before the joint pdf when we use MLE (Maximum likelihood Estimation)?". Stack Exchange.
- Logarithms
- Mathematics of computing