La inferencia bayesiana ( / ˈ b eɪ z i ə n / BAY -zee-ən o / ˈ b eɪ ʒ ən / BAY -zhən ) [ 1 ] es un método de inferencia estadística en el que se utiliza el teorema de Bayes para calcular la probabilidad de una hipótesis, dada la evidencia previa , y actualizarla a medida que se dispone de más información . Fundamentalmente, la inferencia bayesiana utiliza una distribución previa para estimar las probabilidades posteriores. La inferencia bayesiana es una técnica importante en estadística , y especialmente en estadística matemática . La actualización bayesiana es particularmente importante en el análisis dinámico de una secuencia de datos . La inferencia bayesiana ha encontrado aplicación en una amplia gama de actividades, incluyendo ciencia , ingeniería , filosofía , medicina , deporte , psicología [ 2 ] y derecho . En la filosofía de la teoría de la decisión , la inferencia bayesiana está estrechamente relacionada con la probabilidad subjetiva, a menudo llamada " probabilidad bayesiana ".
Introducción a la regla de Bayes

Explicación formal
La inferencia bayesiana deriva la probabilidad posterior como consecuencia de dos antecedentes : una probabilidad previa y una " función de verosimilitud " derivada de un modelo estadístico para los datos observados. La inferencia bayesiana calcula la probabilidad posterior según el teorema de Bayes :
dónde
- Se refiere a cualquier hipótesis cuya probabilidad pueda verse afectada por los datos (denominados evidencia más adelante). A menudo existen hipótesis contrapuestas, y la tarea consiste en determinar cuál es la más probable.
- , la probabilidad previa , es la estimación de la probabilidad de la hipótesis antes de que se observen los datos , la evidencia actual.
- La evidencia corresponde a nuevos datos que no se utilizaron para calcular la probabilidad previa.
- La probabilidad posterior es la probabilidad de que se dé , es decir, después de que se haya observado . Esto es lo que queremos saber: la probabilidad de una hipótesis dada la evidencia observada.
- es la probabilidad de observar dado y se llama verosimilitud . Como función de con fijo, indica la compatibilidad de la evidencia con la hipótesis dada. La función de verosimilitud es una función de la evidencia, , mientras que la probabilidad posterior es una función de la hipótesis, .
- A veces se le denomina probabilidad marginal o "evidencia del modelo". Este factor es el mismo para todas las hipótesis posibles que se estén considerando (como se evidencia en el hecho de que la hipótesis no aparece en ninguna parte del símbolo, a diferencia de todos los demás factores) y, por lo tanto, no influye en la determinación de las probabilidades relativas de las diferentes hipótesis.
- (De lo contrario, uno tiene .)
Para diferentes valores de , solo los factores y , ambos en el numerador, afectan el valor de – la probabilidad posterior de una hipótesis es proporcional a su probabilidad previa (su probabilidad inherente) y a la probabilidad recién adquirida (su compatibilidad con la nueva evidencia observada).
En los casos en que ("no "), la negación lógica de , es una probabilidad válida, la regla de Bayes se puede reescribir de la siguiente manera:
porque
y
Esto centra la atención en el término
Si ese término es aproximadamente 1, entonces la probabilidad de la hipótesis dada la evidencia, , es aproximadamente , aproximadamente 50% probable, es decir, igualmente probable o no probable. Si ese término es muy pequeño, cercano a cero, entonces la probabilidad de la hipótesis, dada la evidencia, es cercana a 1 o la hipótesis condicional es bastante probable. Si ese término es muy grande, mucho mayor que 1, entonces la hipótesis, dada la evidencia, es bastante improbable. Si la hipótesis (sin considerar la evidencia) es improbable, entonces es pequeño (pero no necesariamente astronómicamente pequeño) y es mucho mayor que 1 y este término se puede aproximar como y las probabilidades relevantes se pueden comparar directamente entre sí.
Una forma rápida y sencilla de recordar la ecuación sería usar la regla de la multiplicación :
Alternativas a la actualización bayesiana
La actualización bayesiana es ampliamente utilizada y computacionalmente conveniente. Sin embargo, no es la única regla de actualización que podría considerarse racional.
Ian Hacking señaló que los argumentos tradicionales del " libro holandés " no especificaban la actualización bayesiana: dejaban abierta la posibilidad de que las reglas de actualización no bayesianas pudieran evitar los libros holandeses. Hacking escribió: [ 3 ] "Y ni el argumento del libro holandés ni ningún otro en el arsenal personalista de pruebas de los axiomas de probabilidad implican la suposición dinámica. Ninguno implica el bayesianismo. Por lo tanto, el personalista requiere que la suposición dinámica sea bayesiana. Es cierto que, en coherencia, un personalista podría abandonar el modelo bayesiano de aprendizaje a partir de la experiencia. La sal podría perder su sabor."
De hecho, existen reglas de actualización no bayesianas que también evitan los libros holandeses (como se discute en la literatura sobre " cinemática de la probabilidad ") tras la publicación de la regla de Richard C. Jeffrey , que aplica la regla de Bayes al caso en que a la evidencia misma se le asigna una probabilidad. [ 4 ] Las hipótesis adicionales necesarias para requerir de forma única la actualización bayesiana se han considerado sustanciales, complicadas e insatisfactorias. [ 5 ]
Inferencia sobre posibilidades exclusivas y exhaustivas
Si la evidencia se utiliza simultáneamente para actualizar las creencias sobre un conjunto de proposiciones exclusivas y exhaustivas, la inferencia bayesiana puede considerarse como una acción sobre esta distribución de creencias en su conjunto.
Formulación general

Supongamos que un proceso genera eventos independientes e idénticamente distribuidos , pero se desconoce la distribución de probabilidad . Sea el espacio de eventos el estado actual de creencia para este proceso. Cada modelo está representado por el evento . Se especifican las probabilidades condicionales para definir los modelos. es el grado de creencia en . Antes del primer paso de inferencia, es un conjunto de probabilidades previas iniciales . Estas deben sumar 1, pero por lo demás son arbitrarias.
Supongamos que se observa que el proceso genera . Para cada , la distribución a priori se actualiza a la distribución a posteriori . Del teorema de Bayes : [ 6 ]
Tras observar nuevas pruebas, este procedimiento podrá repetirse.
Múltiples observaciones
Para una secuencia de observaciones independientes e idénticamente distribuidas , se puede demostrar por inducción que la aplicación repetida de lo anterior es equivalente a donde
Formulación paramétrica: motivación de la descripción formal
Al parametrizar el espacio de modelos, la creencia en todos ellos puede actualizarse en un solo paso. La distribución de la creencia sobre el espacio de modelos puede considerarse entonces como una distribución de la creencia sobre el espacio de parámetros. Las distribuciones en esta sección se expresan como continuas, representadas por densidades de probabilidad, como es habitual. Sin embargo, la técnica es igualmente aplicable a distribuciones discretas.
Sea el vector que abarca el espacio de parámetros. Sea la distribución previa inicial sobre , donde es un conjunto de parámetros de la distribución previa misma, o hiperparámetros . Sea una secuencia de observaciones de eventos independientes e idénticamente distribuidas , donde todas se distribuyen como para algún . El teorema de Bayes se aplica para encontrar la distribución posterior sobre :
dónde
Descripción formal
Definiciones
- , un punto de datos en general. Esto puede ser un vector de valores.
- , el parámetro de la distribución del punto de datos, es decir, . Esto puede ser un vector de parámetros.
- , el hiperparámetro de la distribución de parámetros, es decir, . Esto puede ser un vector de hiperparámetros.
- es la muestra, un conjunto de puntos de datos observados, es decir, .
- , un nuevo dato cuya distribución debe predecirse.
Inferencia bayesiana
- La distribución previa es la distribución del/de los parámetro(s) antes de que se observen los datos, es decir , . La distribución previa puede no ser fácil de determinar; en tal caso, una posibilidad puede ser utilizar la distribución previa de Jeffreys para obtener una distribución previa antes de actualizarla con observaciones más recientes.
- La distribución muestral es la distribución de los datos observados condicionada a sus parámetros, es decir , . Esto también se denomina verosimilitud , especialmente cuando se considera como una función del/de los parámetro(s), a veces escrito .
- La probabilidad marginal (a veces también denominada evidencia ) es la distribución de los datos observados marginalizada sobre el/los parámetro(s), es decir, cuantifica la concordancia entre los datos y la opinión del experto, en un sentido geométrico que puede precisarse. [ 7 ] Si la probabilidad marginal es 0, entonces no hay concordancia entre los datos y la opinión del experto y no se puede aplicar la regla de Bayes.
- La distribución posterior es la distribución del/de los parámetro(s) después de tener en cuenta los datos observados. Esta se determina mediante la regla de Bayes , que constituye el núcleo de la inferencia bayesiana:
Esto se expresa en palabras como "la probabilidad posterior es proporcional a la probabilidad multiplicada por la probabilidad previa", o a veces como "la probabilidad posterior = probabilidad multiplicada por la probabilidad previa, sobre la evidencia".
- En la práctica, para casi todos los modelos bayesianos complejos utilizados en el aprendizaje automático, la distribución posterior no se obtiene en forma cerrada, principalmente porque el espacio de parámetros puede ser muy amplio o porque el modelo bayesiano conserva cierta estructura jerárquica formulada a partir de las observaciones y el parámetro . En tales situaciones, es necesario recurrir a técnicas de aproximación. [ 8 ]
- Caso general: Sea la distribución condicional de dado y sea la distribución de . La distribución conjunta es entonces . La distribución condicional de dado se determina entonces por
Existence and uniqueness of the needed conditional expectation is a consequence of the Radon–Nikodym theorem. This was formulated by Kolmogorov in his famous book from 1933. Kolmogorov underlines the importance of conditional probability by writing "I wish to call attention to ... and especially the theory of conditional probabilities and conditional expectations ..." in the Preface.[9] The Bayes theorem determines the posterior distribution from the prior distribution. Uniqueness requires continuity assumptions.[10] Bayes' theorem can be generalized to include improper prior distributions such as the uniform distribution on the real line.[11] Modern Markov chain Monte Carlo methods have boosted the importance of Bayes' theorem including cases with improper priors.[12]
Bayesian prediction
- The posterior predictive distribution is the distribution of a new data point, marginalized over the posterior:
- The prior predictive distribution is the distribution of a new data point, marginalized over the prior:
Bayesian theory calls for the use of the posterior predictive distribution to do predictive inference, i.e., to predict the distribution of a new, unobserved data point. That is, instead of a fixed point as a prediction, a distribution over possible points is returned. Only this way is the entire posterior distribution of the parameter(s) used. By comparison, prediction in frequentist statistics often involves finding an optimum point estimate of the parameter(s)—e.g., by maximum likelihood or maximum a posteriori estimation (MAP)—and then plugging this estimate into the formula for the distribution of a data point. This has the disadvantage that it does not account for any uncertainty in the value of the parameter, and hence will underestimate the variance of the predictive distribution.
En algunos casos, la estadística frecuentista puede sortear este problema. Por ejemplo, los intervalos de confianza y de predicción en estadística frecuentista, cuando se construyen a partir de una distribución normal con media y varianza desconocidas, se construyen utilizando una distribución t de Student . Esto estima correctamente la varianza, debido a que (1) la media de variables aleatorias con distribución normal también tiene una distribución normal, y (2) la distribución predictiva de un dato con distribución normal, media y varianza desconocidas, utilizando distribuciones a priori conjugadas o no informativas, tiene una distribución t de Student. Sin embargo, en estadística bayesiana, la distribución predictiva posterior siempre se puede determinar con exactitud, o al menos con un nivel de precisión arbitrario cuando se utilizan métodos numéricos.
Ambos tipos de distribuciones predictivas tienen la forma de una distribución de probabilidad compuesta (al igual que la verosimilitud marginal ). De hecho, si la distribución a priori es una distribución a priori conjugada , de modo que las distribuciones a priori y a posteriori pertenecen a la misma familia, se puede observar que ambas distribuciones predictivas, a priori y a posteriori, también pertenecen a la misma familia de distribuciones compuestas. La única diferencia radica en que la distribución predictiva a posteriori utiliza los valores actualizados de los hiperparámetros (aplicando las reglas de actualización bayesianas descritas en el artículo sobre distribuciones a priori conjugadas ), mientras que la distribución predictiva a priori utiliza los valores de los hiperparámetros que aparecen en la distribución a priori.
Propiedades matemáticas
Interpretación del factor
Es decir, si el modelo fuera cierto, la evidencia sería más probable de lo que predice el estado actual de creencia. Lo contrario ocurre cuando la creencia disminuye. Si la creencia no cambia , la evidencia es independiente del modelo. Si el modelo fuera cierto, la evidencia sería exactamente tan probable como predice el estado actual de creencia.
El gobierno de Cromwell
Si entonces . Si y , entonces . Esto puede interpretarse como que las condenas firmes son insensibles a las pruebas en contra.
La primera se deduce directamente del teorema de Bayes. La segunda se puede derivar aplicando la primera regla al evento "no " en lugar de " ", obteniendo "si , entonces ", de donde se deduce inmediatamente el resultado.
Comportamiento asintótico de la posterior
Consideremos el comportamiento de una distribución de creencias a medida que se actualiza un gran número de veces con ensayos independientes e idénticamente distribuidos . Para probabilidades previas suficientemente buenas, el teorema de Bernstein-von Mises establece que, en el límite de ensayos infinitos, la distribución posterior converge a una distribución gaussiana independiente de la distribución previa inicial bajo ciertas condiciones que Joseph L. Doob describió y demostró rigurosamente por primera vez en 1948, a saber, si la variable aleatoria en consideración tiene un espacio de probabilidad finito . Los resultados más generales fueron obtenidos posteriormente por el estadístico David A. Freedman, quien publicó en dos artículos de investigación fundamentales en 1963 [ 13 ] y 1965 [ 14 ] cuándo y bajo qué circunstancias se garantiza el comportamiento asintótico de la distribución posterior. Su artículo de 1963 trata, al igual que Doob (1949), el caso finito y llega a una conclusión satisfactoria. Sin embargo, si la variable aleatoria tiene un espacio de probabilidad infinito pero numerable (es decir, correspondiente a un dado con infinitas caras), el artículo de 1965 demuestra que para un subconjunto denso de distribuciones a priori el teorema de Bernstein-von Mises no es aplicable. En este caso, casi con seguridad no hay convergencia asintótica. Más adelante, en las décadas de 1980 y 1990, Freedman y Persi Diaconis continuaron trabajando en el caso de espacios de probabilidad numerables infinitos. [ 15 ] En resumen, puede haber ensayos insuficientes para suprimir los efectos de la elección inicial, y especialmente para sistemas grandes (pero finitos) la convergencia podría ser muy lenta.
Priores conjugados
En su forma parametrizada, la distribución a priori suele asumirse que proviene de una familia de distribuciones denominadas distribuciones a priori conjugadas . La utilidad de una distribución a priori conjugada radica en que la distribución a posteriori correspondiente pertenecerá a la misma familia, y el cálculo puede expresarse de forma cerrada .
Estimaciones de parámetros y predicciones
A menudo se desea utilizar una distribución posterior para estimar un parámetro o variable. Varios métodos de estimación bayesiana seleccionan medidas de tendencia central de la distribución posterior.
Para problemas unidimensionales, existe una mediana única para problemas continuos prácticos. La mediana posterior resulta atractiva como estimador robusto . [ 16 ]
Si existe una media finita para la distribución posterior, entonces la media posterior es un método de estimación. [ 17 ]
Tomar el valor con la mayor probabilidad define la estimación a posteriori máxima (MAP): [ 18 ]
Hay ejemplos en los que no se alcanza ningún máximo, en cuyo caso el conjunto de estimaciones MAP está vacío .
Existen otros métodos de estimación que minimizan el riesgo posterior (pérdida posterior esperada) con respecto a una función de pérdida , y estos son de interés para la teoría de la decisión estadística que utiliza la distribución muestral (estadística frecuentista). [ 19 ]
La distribución predictiva posterior de una nueva observación (que es independiente de las observaciones anteriores) está determinada por [ 20 ].
Ejemplos
Probabilidad de una hipótesis
Supongamos que hay dos tazones llenos de galletas. El tazón n.° 1 tiene 10 galletas con chispas de chocolate y 30 galletas simples, mientras que el tazón n.° 2 tiene 20 de cada una. Fred elige un tazón al azar y luego elige una galleta al azar, lo que significa que no hay razón para creer que Fred trate un tazón de manera diferente al otro, y lo mismo ocurre con las galletas. La galleta resulta ser simple. En cuanto a la probabilidad de que Fred la haya elegido del tazón n.° 1, ese es un ejemplo de un problema que se puede abordar mediante inferencia bayesiana.
Intuitivamente, parece claro que la respuesta debería ser más de la mitad, ya que hay más galletas simples en el tazón n.° 1. La respuesta precisa la proporciona el teorema de Bayes. Sea que corresponda al tazón n.° 1 y al tazón n.° 2. Se sabe que los tazones son idénticos desde el punto de vista de Fred, por lo tanto , y ambos deben sumar 1, así que ambos son iguales a 0,5. El evento es la observación de una galleta simple. A partir del contenido de los tazones, se sabe que y la fórmula de Bayes produce entonces
Antes de que se observe la galleta de Fred, la probabilidad de que Fred haya elegido el tazón n.° 1 era la probabilidad previa Al reconocer la galleta, la estimación mejor informada de Fred (de cualquier observador) se actualiza a
Hacer una predicción

Un arqueólogo trabaja en un yacimiento que se cree data del período medieval, entre los siglos XI y XVI. Sin embargo, se desconoce con exactitud cuándo estuvo habitado. Se han encontrado fragmentos de cerámica, algunos vidriados y otros decorados. Se estima que, si el yacimiento estuvo habitado a principios de la Edad Media, el 1% de la cerámica estaría vidriada y el 50% decorada, mientras que si estuvo habitado a finales de la Edad Media, el 81% estaría vidriada y el 5% decorada. ¿Qué grado de certeza puede tener el arqueólogo sobre la fecha de ocupación a medida que se desentierran los fragmentos?
Se debe calcular el grado de creencia en la variable continua (siglo), utilizando el conjunto discreto de eventos como evidencia. La información del párrafo anterior arroja para la probabilidad del vidriado y para la probabilidad de la decoración; sus complementos son Suponiendo una variación lineal del vidriado y la decoración con el tiempo y que estas variables son independientes, la probabilidad de cada evento es
Cuando se descubre un nuevo fragmento de un tipo determinado , eso significa más información para la investigación y, a través del teorema de Bayes, una inferencia bayesiana actualizada hacia un mayor grado de creencia (o confianza) en la estimación de los arqueólogos. Suponiendo una distribución a priori uniforme de , y que los ensayos son independientes e idénticamente distribuidos ,
En el gráfico se muestra una simulación por ordenador del cambio de creencia a medida que se desentierran 50 fragmentos. En la simulación, el yacimiento estuvo habitado alrededor de 1420, o . Al calcular el área bajo la porción relevante del gráfico para 50 ensayos, el arqueólogo puede decir que hay prácticamente ninguna posibilidad de que el yacimiento estuviera habitado en los siglos XI y XII, aproximadamente un 1% de probabilidad de que estuviera habitado durante el siglo XIII, un 63% de probabilidad durante el siglo XIV y un 36% durante el siglo XV. El teorema de Bernstein-von Mises afirma aquí la convergencia asintótica a la distribución "verdadera" porque el espacio de probabilidad correspondiente al conjunto discreto de eventos es finito (véase la sección anterior sobre el comportamiento asintótico de la distribución posterior).
En estadística frecuentista y teoría de la decisión
Abraham Wald ofreció una justificación desde la teoría de la decisión para el uso de la inferencia bayesiana , demostrando que todo procedimiento bayesiano único es admisible . A la inversa, todo procedimiento estadístico admisible es un procedimiento bayesiano o un límite de procedimientos bayesianos. [ 21 ]
Wald caracterizó los procedimientos admisibles como procedimientos bayesianos (y límites de los procedimientos bayesianos), convirtiendo el formalismo bayesiano en una técnica central en áreas de inferencia frecuentista como la estimación de parámetros , la prueba de hipótesis y el cálculo de intervalos de confianza . [ 22 ] [ 23 ] [ 24 ] Por ejemplo:
- "Bajo ciertas condiciones, todos los procedimientos admisibles son procedimientos bayesianos o límites de procedimientos bayesianos (en diversos sentidos). Estos resultados notables, al menos en su forma original, se deben esencialmente a Wald. Son útiles porque la propiedad de ser bayesiano es más fácil de analizar que la admisibilidad." [ 21 ]
- "En teoría de la decisión, un método bastante general para probar la admisibilidad consiste en exhibir un procedimiento como una solución bayesiana única." [ 25 ]
- En los primeros capítulos de este trabajo, se utilizaron distribuciones previas con soporte finito y los procedimientos bayesianos correspondientes para establecer algunos de los teoremas principales relacionados con la comparación de experimentos. Los procedimientos bayesianos con respecto a distribuciones previas más generales han desempeñado un papel muy importante en el desarrollo de la estadística, incluida su teoría asintótica. Existen muchos problemas en los que un vistazo a las distribuciones posteriores, para distribuciones previas adecuadas, proporciona información inmediatamente interesante. Además, esta técnica es prácticamente inevitable en el análisis secuencial. [ 26 ]
- "Un hecho útil es que cualquier regla de decisión bayesiana obtenida al tomar una distribución a priori adecuada sobre todo el espacio de parámetros debe ser admisible" [ 27 ].
- "Un área importante de investigación en el desarrollo de ideas de admisibilidad ha sido la de los procedimientos convencionales de la teoría del muestreo, y se han obtenido muchos resultados interesantes." [ 28 ]
Selección de modelos
Bayesian methodology also plays a role in model selection where the aim is to select one model from a set of competing models that represents most closely the underlying process that generated the observed data. In Bayesian model comparison, the model with the highest posterior probability given the data is selected. The posterior probability of a model depends on the evidence, or marginal likelihood, which reflects the probability that the data is generated by the model, and on the prior belief of the model. When two competing models are a priori considered to be equiprobable, the ratio of their posterior probabilities corresponds to the Bayes factor. Since Bayesian model comparison is aimed on selecting the model with the highest posterior probability, this methodology is also referred to as the maximum a posteriori (MAP) selection rule [29] or the MAP probability rule.[30]
Probabilistic programming
While conceptually simple, Bayesian methods can be mathematically and numerically challenging. Probabilistic programming languages (PPLs) implement functions to easily build Bayesian models together with efficient automatic inference methods. This helps separate the model building from the inference, allowing practitioners to focus on their specific problems and leaving PPLs to handle the computational details for them.[31][32][33]
Applications
Statistical data analysis
See the separate Wikipedia entry on Bayesian statistics, specifically the statistical modeling section in that page.
Computer applications
Bayesian inference has applications in artificial intelligence and expert systems. Bayesian inference techniques have been a fundamental part of computerized pattern recognition techniques since the late 1950s.[34] There is also an ever-growing connection between Bayesian methods and simulation-based Monte Carlo techniques since complex models cannot be processed in closed form by a Bayesian analysis, while a graphical model structure may allow for efficient simulation algorithms like the Gibbs sampling and other Metropolis–Hastings algorithm schemes.[35] Recently Bayesian inference has gained popularity among the phylogenetics community for these reasons; a number of applications allow many demographic and evolutionary parameters to be estimated simultaneously.
Aplicada a la clasificación estadística , la inferencia bayesiana se ha utilizado para desarrollar algoritmos de identificación de correo no deseado . Algunas aplicaciones que emplean la inferencia bayesiana para el filtrado de spam son CRM114 , DSPAM , Bogofilter , SpamAssassin , SpamBayes , Mozilla , XEAMS y otras. La clasificación de spam se trata con mayor detalle en el artículo sobre el clasificador bayesiano ingenuo .
La inferencia inductiva de Solomonoff es la teoría de la predicción basada en observaciones; por ejemplo, predecir el siguiente símbolo a partir de una serie de símbolos dada. El único supuesto es que el entorno sigue alguna distribución de probabilidad desconocida pero computable . Es un marco inductivo formal que combina dos principios bien estudiados de la inferencia inductiva: la estadística bayesiana y la navaja de Occam . [ 36 ] La probabilidad a priori universal de Solomonoff para cualquier prefijo p de una secuencia computable x es la suma de las probabilidades de todos los programas (para una computadora universal) que computan algo que comienza con p . Dado algún p y cualquier distribución de probabilidad computable pero desconocida de la que se muestrea x , la probabilidad a priori universal y el teorema de Bayes se pueden usar para predecir las partes aún no vistas de x de manera óptima. [ 37 ] [ 38 ]
Bioinformática y aplicaciones sanitarias
La inferencia bayesiana se ha aplicado en diferentes aplicaciones bioinformáticas , incluido el análisis de expresión génica diferencial. [ 39 ] La inferencia bayesiana también se utiliza en un modelo general de riesgo de cáncer, llamado CIRI (Índice de Riesgo Individualizado Continuo), donde se incorporan mediciones en serie para actualizar un modelo bayesiano que se construye principalmente a partir del conocimiento previo. [ 40 ] [ 41 ]
Aplicaciones cosmológicas y astrofísicas
El enfoque bayesiano ha sido fundamental para los avances recientes en cosmología y aplicaciones astrofísicas, [ 42 ] [ 43 ] y se extiende a una amplia gama de problemas astrofísicos, incluyendo la caracterización de exoplanetas (como el ajuste de la atmósfera para k2-18b [ 44 ] ), restricciones de parámetros con datos cosmológicos, [ 45 ] y calibración en experimentos astrofísicos. [ 46 ]
En cosmología, se emplea frecuentemente con técnicas computacionales como la cadena de Markov Monte Carlo (MCMC) y el algoritmo de muestreo anidado para analizar conjuntos de datos complejos y navegar por el espacio de parámetros de alta dimensión. Una aplicación notable es a los datos CMB de Planck 2018 para la inferencia de parámetros. [ 45 ] Los seis parámetros cosmológicos base en el modelo Lambda-CDM no son predichos por una teoría, sino que se ajustan a partir de datos del fondo cósmico de microondas (CMB) a un modelo cosmológico elegido (el modelo Lambda-CDM). [ 47 ] El código bayesiano para cosmología `cobaya` [ 48 ] configura ejecuciones cosmológicas e interfaces de probabilidades cosmológicas, código de Boltzmann, [ 49 ] [ 50 ] que calcula las anisotropías CMB predichas para cualquier conjunto dado de parámetros cosmológicos, con MCMC o muestreador anidado.
Este marco computacional no se limita al modelo estándar, sino que también es esencial para probar teorías cosmológicas alternativas o extendidas, como las teorías con energía oscura temprana [ 51 ] o las teorías de gravedad modificada que introducen parámetros adicionales más allá del modelo Lambda-CDM. La comparación bayesiana de modelos puede emplearse para calcular la evidencia a favor de modelos alternativos, proporcionando una base estadística para evaluar si los datos los respaldan frente al modelo Lambda-CDM estándar [ 52 ] .
En la sala del tribunal
La inferencia bayesiana puede ser utilizada por los jurados para acumular de manera coherente la evidencia a favor y en contra de un acusado, y para ver si, en su totalidad, cumple con su umbral personal de " más allá de toda duda razonable ". [ 53 ] [ 54 ] [ 55 ] El teorema de Bayes se aplica sucesivamente a toda la evidencia presentada, y la distribución posterior de una etapa se convierte en la distribución previa para la siguiente. El beneficio de un enfoque bayesiano es que proporciona al jurado un mecanismo racional e imparcial para combinar la evidencia. Puede ser apropiado explicar el teorema de Bayes a los jurados en forma de probabilidades , ya que las probabilidades de apuestas se comprenden más ampliamente que las probabilidades. Alternativamente, un enfoque logarítmico , reemplazando la multiplicación por la suma, podría ser más fácil de manejar para un jurado.

Si no hay dudas sobre la existencia del delito, sino solo sobre la identidad del culpable, se ha sugerido que la probabilidad a priori debe ser uniforme en toda la población que califica. [ 56 ] Por ejemplo, si 1000 personas pudieran haber cometido el delito, la probabilidad a priori de culpabilidad sería de 1/1000.
El uso del teorema de Bayes por parte de los jurados es controvertido. En el Reino Unido, un perito de la defensa explicó el teorema de Bayes al jurado en el caso R v Adams . El jurado dictó sentencia condenatoria, pero el caso fue apelado alegando que no se habían proporcionado medios para recopilar pruebas a los jurados que no deseaban utilizar el teorema de Bayes. El Tribunal de Apelación confirmó la condena, pero también opinó que «introducir el teorema de Bayes, o cualquier método similar, en un juicio penal sumerge al jurado en ámbitos teóricos y complejos inapropiados e innecesarios, desviándolo de su tarea principal».
Gardner-Medwin [ 57 ] sostiene que el criterio en el que debe basarse un veredicto en un juicio penal no es la probabilidad de culpabilidad, sino la probabilidad de la evidencia, dado que el acusado es inocente (similar a un valor p frecuentista ). Argumenta que si se va a calcular la probabilidad posterior de culpabilidad mediante el teorema de Bayes, se debe conocer la probabilidad previa de culpabilidad. Esto dependerá de la incidencia del delito, que es una evidencia poco común en un juicio penal. Consideremos las siguientes tres proposiciones:
- A – Los hechos y testimonios conocidos podrían haber surgido si el acusado es culpable.
- B – Los hechos y testimonios conocidos podrían haber surgido si el acusado es inocente.
- C – El acusado es culpable.
Gardner-Medwin sostiene que el jurado debe creer tanto A como no B para poder condenar. Que A y no B implique la veracidad de C , pero lo contrario no es cierto. Es posible que B y C sean ambas verdaderas, pero en este caso argumenta que un jurado debería absolver, aun sabiendo que dejará en libertad a algunos culpables. Véase también la paradoja de Lindley .
epistemología bayesiana
La epistemología bayesiana es un movimiento que aboga por la inferencia bayesiana como medio para justificar las reglas de la lógica inductiva.
Karl Popper y David Miller han rechazado la idea del racionalismo bayesiano, es decir, el uso de la regla de Bayes para hacer inferencias epistemológicas: [ 58 ] Es propenso al mismo círculo vicioso que cualquier otra epistemología justificacionista , porque presupone lo que intenta justificar. Según esta visión, una interpretación racional de la inferencia bayesiana la vería simplemente como una versión probabilística de la falsación , rechazando la creencia, comúnmente sostenida por los bayesianos, de que la alta probabilidad alcanzada por una serie de actualizaciones bayesianas probaría la hipótesis más allá de toda duda razonable, o incluso con una probabilidad mayor que 0.
Otro
- El método científico se interpreta a veces como una aplicación de la inferencia bayesiana. Desde esta perspectiva, la regla de Bayes guía (o debería guiar) la actualización de las probabilidades sobre hipótesis condicionadas a nuevas observaciones o experimentos . [ 59 ] La inferencia bayesiana también se ha aplicado para tratar problemas de programación estocástica con información incompleta por Cai et al. (2009). [ 60 ]
- La teoría de búsqueda bayesiana se utiliza para buscar objetos perdidos.
- Inferencia bayesiana en filogenia
- Herramienta bayesiana para el análisis de metilación
- Los enfoques bayesianos del funcionamiento cerebral investigan el cerebro como un mecanismo bayesiano.
- Inferencia bayesiana en estudios ecológicos [ 61 ] [ 62 ]
- La inferencia bayesiana se utiliza para estimar parámetros en modelos cinéticos químicos estocásticos [ 63 ].
- Inferencia bayesiana en econofísica para divisas o predicción de cambios de tendencia en cotizaciones financieras [ 64 ]
- Inferencia bayesiana en marketing
- Inferencia bayesiana en el aprendizaje motor
- La inferencia bayesiana se utiliza en la estadística probabilística para resolver problemas numéricos.
Bayes e inferencia bayesiana
El problema considerado por Bayes en la Proposición 9 de su ensayo " Un ensayo para resolver un problema en la doctrina de las probabilidades " es la distribución posterior para el parámetro a (la tasa de éxito) de la distribución binomial .
Historia
El término « bayesiano » se refiere a Thomas Bayes (1701-1761), quien demostró que se podían establecer límites probabilísticos para un evento desconocido. [ 65 ] Sin embargo, fue Pierre-Simon Laplace (1749-1827) quien introdujo (como Principio VI) lo que ahora se conoce como el teorema de Bayes y lo utilizó para abordar problemas en mecánica celeste , estadística médica, fiabilidad y jurisprudencia . [ 66 ] La inferencia bayesiana temprana, que utilizaba distribuciones a priori uniformes siguiendo el principio de Laplace de razón insuficiente , se denominó probabilidad inversa (porque infiere hacia atrás desde las observaciones a los parámetros, o desde los efectos a las causas). [ 67 ] Después de la década de 1920, la probabilidad inversa fue suplantada en gran medida por un conjunto de métodos que llegaron a denominarse estadística frecuentista . [ 67 ]
En el siglo XX, las ideas de Laplace se desarrollaron aún más en dos direcciones distintas, dando lugar a corrientes objetivas y subjetivas en la práctica bayesiana. En la corriente objetiva (o "no informativa"), el análisis estadístico depende únicamente del modelo asumido, los datos analizados [ 68 ] y el método de asignación de la distribución a priori, que difiere entre los distintos profesionales bayesianos objetivos. En la corriente subjetiva (o "informativa"), la especificación de la distribución a priori depende de la creencia —las proposiciones sobre las que se basa el análisis— que puede resumir información de expertos, estudios previos, etc.
En la década de 1980, se produjo un crecimiento espectacular en la investigación y las aplicaciones de los métodos bayesianos, atribuido principalmente al descubrimiento de los métodos de Monte Carlo de cadena de Markov , que eliminaron muchos de los problemas computacionales, y a un creciente interés en aplicaciones complejas y no estándar. [ 69 ] A pesar del crecimiento de la investigación bayesiana, la mayor parte de la enseñanza de pregrado todavía se basa en la estadística frecuentista. [ 70 ] No obstante, los métodos bayesianos son ampliamente aceptados y utilizados, como por ejemplo en el campo del aprendizaje automático . [ 71 ]
Véase también
Referencias
Citas
- ↑ "Bayesiano" . Diccionario Merriam-Webster.com . Merriam-Webster. OCLC 1032680871 .
- ↑ Griffiths, Thomas (24 de julio de 2024). "Modelos bayesianos de cognición" .
- ↑ Hacking, Ian (diciembre de 1967). "Probabilidad personal ligeramente más realista". Filosofía de la ciencia . 34 (4): 316. doi : 10.1086/288169 . S2CID 14344339 .
- ↑ "Teorema de Bayes (Enciclopedia de Filosofía de Stanford)" . Plato.stanford.edu . Consultado el 5 de enero de 2014 .
- ↑ van Fraassen, B. (1989) Leyes y simetría , Oxford University Press. ISBN 0-19-824860-1.
- ↑ Gelman, Andrew; Carlin, John B.; Stern, Hal S.; Dunson, David B.; Vehtari, Aki; Rubin, Donald B. (2013). Análisis de datos bayesianos , tercera edición. Chapman and Hall/CRC. ISBN 978-1-4398-4095-5.
- ↑ de Carvalho, Miguel; Page, Garritt; Barney, Bradley (2019). "Sobre la geometría de la inferencia bayesiana" (PDF) . Análisis bayesiano . 14 (4): 1013‒1036. doi : 10.1214/18-BA1112 . S2CID 88521802 .
- ↑ Lee, Se Yoon (2021). "Inferencia variacional mediante muestreador de Gibbs y ascenso de coordenadas: una revisión desde la teoría de conjuntos". Communications in Statistics – Theory and Methods . 51 (6): 1549– 1568. arXiv : 2008.01006 . doi : 10.1080/03610926.2021.1921214 . S2CID 220935477 .
- ↑ Kolmogorov, AN (1933) [1956]. Fundamentos de la teoría de la probabilidad . Chelsea Publishing Company.
- ↑ Tjur, Tue (1980). Probabilidad basada en medidas de radón . Archivo de Internet. Chichester [Inglaterra]; Nueva York : Wiley. ISBN 978-0-471-27824-5.
- ^ Taraldsen, Gunnar; Tufto, Jarle; Lindqvist, Bo H. (24 de julio de 2021). "Antes impropios y posteriores impropios" . Revista escandinava de estadística . 49 (3): 969– 991. doi : 10.1111/sjos.12550 . hdl : 11250/2984409 . ISSN 0303-6898 . S2CID 237736986 .
- ↑ Robert, Christian P.; Casella, George (2004). Métodos estadísticos de Monte Carlo . Springer. ISBN 978-1-4757-4145-2OCLC 1159112760 .
- ↑ Freedman, DA (1963). "Sobre el comportamiento asintótico de las estimaciones de Bayes en el caso discreto" . The Annals of Mathematical Statistics . 34 (4): 1386– 1403. doi : 10.1214/aoms/1177703871 . JSTOR 2238346 .
- ↑ Freedman, DA (1965). "Sobre el comportamiento asintótico de las estimaciones bayesianas en el caso discreto II" . The Annals of Mathematical Statistics . 36 (2): 454– 456. doi : 10.1214/aoms/1177700155 . JSTOR 2238150 .
- ↑ Robins, James; Wasserman, Larry (2000). "Condicionamiento, probabilidad y coherencia: una revisión de algunos conceptos fundamentales". Journal of the American Statistical Association . 95 (452): 1340– 1346. doi : 10.1080/01621459.2000.10474344 . S2CID 120767108 .
- ↑ Sen, Pranab K. ; Keating, JP; Mason, RL (1993). La medida de cercanía de Pitman: una comparación de estimadores estadísticos . Filadelfia: SIAM.
- ↑ Choudhuri, Nidhan; Ghosal, Subhashis; Roy, Anindya (1 de enero de 2005). «Métodos bayesianos para la estimación de funciones». Manual de estadística . Pensamiento bayesiano. Vol. 25. págs. 373–414 . CiteSeerX 10.1.1.324.3052 . doi : 10.1016/s0169-7161(05)25013-7 . ISBN 978-0-444-51539-1.
- ↑ "Estimación de Máximo A Posterior (MAP)" . www.probabilitycourse.com . Consultado el 2 de junio de 2017 .
- ↑ Yu, Angela. "Introducción a la teoría de la decisión bayesiana" (PDF) . cogsci.ucsd.edu/ . Archivado del original (PDF) el 28 de febrero de 2013.
- ↑ Hitchcock, David. "Diapositiva estadística sobre la distribución predictiva posterior" (PDF) . stat.sc.edu .
- 1 2 Bickel y Doksum (2001, pág. 32)
- ↑ Kiefer, J. ; Schwartz R. (1965). "Carácter bayesiano admisible de las pruebas T 2 -, R 2 - y otras pruebas totalmente invariantes para problemas normales multivariados" . Annals of Mathematical Statistics . 36 (3): 747– 770. doi : 10.1214/aoms/1177700051 .
- ↑ Schwartz, R. (1969). "Pruebas bayesianas propias invariantes para familias exponenciales" . Annals of Mathematical Statistics . 40 : 270–283 . doi : 10.1214/aoms/1177697822 .
- ↑ Hwang, JT y Casella, George (1982). "Conjuntos de confianza minimax para la media de una distribución normal multivariada" (PDF) . Annals of Statistics . 10 (3): 868– 881. doi : 10.1214/aos/1176345877 .
- ↑ Lehmann, Erich (1986). Prueba de hipótesis estadísticas (Segunda edición). (véase la página 309 del capítulo 6.7 "Admisibilidad" y las páginas 17-18 del capítulo 1.8 "Clases completas")
- ↑ Le Cam, Lucien (1986). Métodos asintóticos en la teoría de la decisión estadística . Springer-Verlag. ISBN 978-0-387-96307-5.(Del capítulo 12: Distribuciones posteriores y soluciones bayesianas, pág. 324)
- ↑ Cox, DR ; Hinkley, DV (1974). Estadística teórica . Chapman and Hall. pág. 432. ISBN 978-0-04-121537-3.
- ↑ Cox, DR ; Hinkley, DV (1974). Estadística teórica . Chapman and Hall. pág. 433. ISBN 978-0-04-121537-3.)
- ↑ Stoica, P.; Selen, Y. (2004). "Una revisión de las reglas del criterio de información". IEEE Signal Processing Magazine . 21 (4): 36– 47. doi : 10.1109/MSP.2004.1311138 . S2CID 17338979 .
- ↑ Fatermans, J.; Van Aert, S.; den Dekker, AJ (2019). "La regla de probabilidad a posteriori máxima para la detección de columnas de átomos a partir de imágenes HAADF STEM". Ultramicroscopy . 201 : 81–91 . arXiv : 1902.05809 . doi : 10.1016 /j.ultramic.2019.02.003 . PMID 30991277. S2CID 104419861 .
- ↑ Bessiere, P., Mazer, E., Ahuactzin, JM, & Mekhnacha, K. (2013). Programación bayesiana (1.ª edición) Chapman and Hall/CRC.
- ↑ Daniel Roy (2015). "Programación probabilística" . probabilistic-programming.org . Archivado del original el 10 de enero de 2016. Consultado el 2 de enero de 2020 .
- ↑ Ghahramani, Z (2015). "Aprendizaje automático probabilístico e inteligencia artificial" . Nature . 521 (7553): 452– 459. Bibcode : 2015Natur.521..452G . doi : 10.1038 / nature14541 . PMID 26017444. S2CID 216356 .
- ↑ Fienberg, Stephen E. (2006-03-01). "¿Cuándo se convirtió la inferencia bayesiana en "bayesiana"?" . Análisis Bayesiano . 1 (1). doi : 10.1214/06-BA101 .
- ↑ Jim Albert (2009). Computación bayesiana con R, segunda edición . Nueva York, Dordrecht, etc.: Springer. ISBN 978-0-387-92297-3.
- ↑ Rathmanner, Samuel; Hutter, Marcus; Ormerod, Thomas C (2011). "Un tratado filosófico de inducción universal" . Entropía . 13 (6): 1076– 1136. arXiv : 1105.5721 . Bibcode : 2011Entrp..13.1076R . doi : 10.3390/e13061076 . S2CID 2499910 .
- ↑ Hutter, Marcus; He, Yang-Hui; Ormerod, Thomas C (2007). "Sobre la predicción universal y la confirmación bayesiana". Theoretical Computer Science . 384 (2007): 33– 48. arXiv : 0709.1516 . Bibcode : 2007arXiv0709.1516H . doi : 10.1016/j.tcs.2007.05.016 . S2CID 1500830 .
- ↑ Gács, Peter; Vitányi, Paul MB (2 de diciembre de 2010). "Raymond J. Solomonoff 1926-2009". CiteSeerX 10.1.1.186.8268 .
- ↑ Robinson, Mark D & McCarthy, Davis J & Smyth, Gordon K edgeR: un paquete de Bioconductor para el análisis de expresión diferencial de datos de expresión génica digital, Bioinformatics.
- ↑ «CIRI» . ciri.stanford.edu . Consultado el 11 de agosto de 2019 .
- ↑ Kurtz, David M.; Esfahani, Mohammad S.; Scherer, Florian; Soo, Joanne; Jin, Michael C.; Liu, Chih Long; Newman, Aaron M.; Dührsen, Ulrich; Hüttmann, Andreas (2019-07-25). "Perfil de riesgo dinámico utilizando biomarcadores tumorales seriados para la predicción personalizada de resultados" . Cell . 178 ( 3): 699–713.e19. doi : 10.1016/j.cell.2019.06.011 . ISSN 1097-4172 . PMC 7380118. PMID 31280963 .
- ↑ Trotta, Roberto (2017). "Métodos bayesianos en cosmología". arXiv : 1701.01467 [ astro-ph.CO ].
- ↑ Staicova, Denitsa (2025). "Métodos modernos de muestreo bayesiano para la inferencia cosmológica: un estudio comparativo" . Universe . 11 (2): 68. arXiv : 2501.06022 . Bibcode : 2025Univ...11...68S . doi : 10.3390/universe11020068 .
- ^ Madhusudhan, Nikku; Constantinou, Savvas; Holmberg, Mans; Sarkar, Subhajit; Piette, Anjali AA; Moisés, Julianne I. (2025). "Nuevas restricciones sobre DMS y DMDS en la atmósfera de K2-18 b de JWST MIRI" . La revista astrofísica . 983 (2): L40. arXiv : 2504.12267 . Código Bib : 2025ApJ...983L..40M . doi : 10.3847/2041-8213/adc1c8 .
- 1 2 Aghanim, N.; et al. (2020). " Resultados de Planck 2018". Astronomía y Astrofísica . 641 : A6. arXiv : 1807.06209 . Bibcode : 2020A & A...641A...6P . doi : 10.1051/0004-6361/201833910 .
- ↑ Anstey, Dominic; De Lera Acedo, Eloy; Handley, Will (2021). "Un marco bayesiano general para el modelado del primer plano y la corrección de la cromaticidad para experimentos globales de 21 cm" . Monthly Notices of the Royal Astronomical Society . 506 (2): 2041–2058 . arXiv : 2010.09644 . doi : 10.1093/mnras/stab1765 .
- ↑ Lewis, Antony; Bridle, Sarah (2002). "Parámetros cosmológicos a partir de datos del CMB y otros datos: un enfoque de Monte Carlo". Physical Review D . 66 (10) 103511. arXiv : astro-ph/0205436 . Bibcode : 2002PhRvD..66j3511L . doi : 10.1103/PhysRevD.66.103511 .
- ↑ "Cobaya, un código para el análisis bayesiano en cosmología — documentación de cobaya 3.5.7" . cobaya.readthedocs.io . Consultado el 23 de julio de 2025 .
- ↑ "CAMB — Documentación del código para anisotropías en el fondo de microondas (CAMB) 1.6.1" . camb.readthedocs.io . Consultado el 23 de julio de 2025 .
- ↑ Lesgourgues, Julien (2011). "El sistema de resolución de anisotropía lineal cósmica (CLASS) I: descripción general". arXiv : 1104.2932 [ astro-ph.IM ].
- ↑ Hill, J. Colin; McDonough, Evan; Toomey, Michael W.; Alexander, Stephon (2020). "La energía oscura temprana no restablece la concordancia cosmológica". Physical Review D . 102 (4) 043507. arXiv : 2003.07355 . Bibcode : 2020PhRvD.102d3507H . doi : 10.1103/PhysRevD.102.043507 .
- ↑ Trotta, Roberto (2008). "Bayes en el cielo: inferencia bayesiana y selección de modelos en cosmología". Contemporary Physics . 49 (2): 71– 104. arXiv : 0803.4089 . Bibcode : 2008ConPh..49...71T . doi : 10.1080/00107510802066753 .
- ↑ Dawid, A. P. y Mortera, J. (1996) "Análisis coherente de la evidencia de identificación forense". Journal of the Royal Statistical Society , Serie B, 58, 425–443.
- ↑ Foreman, L. A.; Smith, A. F. M., y Evett, I. W. (1997). "Análisis bayesiano de datos de perfilado de ácido desoxirribonucleico en aplicaciones de identificación forense (con discusión)". Journal of the Royal Statistical Society , Serie A, 160, 429–469.
- ↑ Robertson, B. y Vignaux, G. A. (1995) Interpretación de la evidencia: Evaluación de la ciencia forense en los tribunales . John Wiley and Sons. Chichester. ISBN 978-0-471-96026-3.
- ↑ Dawid, AP (2001) Teorema de Bayes y la ponderación de pruebas por jurados . Archivado el 1 de julio de 2015 en Wayback Machine.
- ↑ Gardner-Medwin, A. (2005) "¿Qué probabilidad debería considerar el jurado?". Significance , 2 (1), marzo de 2005.
- ↑ Miller, David (1994). Racionalismo crítico . Chicago: Open Court. ISBN 978-0-8126-9197-9.
- ↑ Howson y Urbach (2005), Jaynes (2003)
- ↑ Cai, XQ; Wu, XY; Zhou, X. (2009). "Programación estocástica sujeta a fallos repetidos con información incompleta". Operations Research . 57 (5): 1236– 1249. doi : 10.1287/opre.1080.0660 .
- ↑ Ogle, Kiona; Tucker, Colin; Cable, Jessica M. (2014-01-01). "Más allá de los modelos de mezcla lineal simple: partición isotópica basada en procesos de procesos ecológicos". Ecological Applications . 24 (1): 181– 195. Bibcode : 2014EcoAp..24..181O . doi : 10.1890/1051-0761-24.1.181 . ISSN 1939-5582 . PMID 24640543 .
- ↑ Evaristo, Jaivime; McDonnell, Jeffrey J.; Scholl, Martha A.; Bruijnzeel, L. Adrian; Chun, Kwok P. (2016-01-01). "Perspectivas sobre la absorción de agua por las plantas a partir de mediciones de isótopos de agua del xilema en dos cuencas tropicales con condiciones de humedad contrastantes". Hydrological Processes . 30 (18): 3210– 3227. Bibcode : 2016HyPr...30.3210E . doi : 10.1002/hyp.10841 . ISSN 1099-1085 . S2CID 131588159 .
- ↑ Gupta, Ankur; Rawlings, James B. (abril de 2014). "Comparación de métodos de estimación de parámetros en modelos cinéticos químicos estocásticos: ejemplos en biología de sistemas" . AIChE Journal . 60 (4): 1253– 1268. Bibcode : 2014AIChE..60.1253G . doi : 10.1002/aic.14409 . ISSN 0001-1541 . PMC 4946376. PMID 27429455 .
- ↑ Schütz, N.; Holschneider, M. (2011). "Detección de cambios de tendencia en series temporales mediante inferencia bayesiana". Physical Review E . 84 (2) 021120. arXiv : 1104.3448 . Bibcode : 2011PhRvE..84b1120S . doi : 10.1103/PhysRevE.84.021120 . PMID 21928962 . S2CID 11460968 .
- ↑ Stigler, Stephen (1982). "Inferencia bayesiana de Thomas Bayes". Journal of the Royal Statistical Society . 145 (2): 250– 58. doi : 10.2307/2981538 . JSTOR 2981538 .
- ↑ Stigler, Stephen M. (1986). «Capítulo 3» . Historia de la estadística . Harvard University Press. ISBN 978-0-674-40340-6.
- 1 2 Fienberg, Stephen E. (2006). "¿Cuándo se convirtió la inferencia bayesiana en 'bayesiana'?" . Análisis bayesiano . 1 (1): 1–40 [p. 5]. doi : 10.1214/06-ba101 .
- ↑ Bernardo, José-Miguel (2005). "Análisis de referencias". Manual de estadística . Vol. 25. pp. 17–90 .
- ↑ Wolpert, R. L. (2004). " Una conversación con James O. Berger". Statistical Science . 19 (1): 205– 218. CiteSeerX 10.1.1.71.6112 . doi : 10.1214/088342304000000053 . MR 2082155. S2CID 120094454 .
- ↑ Bernardo, José M. (2006). "Introducción a la estadística matemática bayesiana" (PDF) . Icots-7 .
- ↑ Bishop, CM (2007). Reconocimiento de patrones y aprendizaje automático . Nueva York: Springer. ISBN 978-0-387-31073-2.
Fuentes
- Aster, Richard; Borchers, Brian y Thurber, Clifford (2012). Estimación de parámetros y problemas inversos , Segunda edición, Elsevier. ISBN 0123850487, ISBN 978-0123850485
- Bickel, Peter J. y Doksum, Kjell A. (2001). Estadística matemática, volumen 1: temas básicos y selectos (segunda edición, reimpresión actualizada de 2007) . Pearson Prentice-Hall. ISBN 978-0-13-850363-5.
- Box, G. E. P. y Tiao, G. C. (1973). Inferencia bayesiana en el análisis estadístico , Wiley, ISBN 0-471-57428-7
- Edwards, Ward (1968). "Conservadurismo en el procesamiento de la información humana". En Kleinmuntz, B. (ed.). Representación formal del juicio humano . Wiley.
- Edwards, Ward (1982). Daniel Kahneman ; Paul Slovic ; Amos Tversky (eds.). «Juicio bajo incertidumbre: heurísticas y sesgos». Science . 185 ( 4157): 1124– 1131. Bibcode : 1974Sci...185.1124T . doi : 10.1126/science.185.4157.1124 . PMID 17835457. S2CID 143452957.
Capítulo: Conservadurismo en el procesamiento de la información humana (fragmento)
. - Jaynes E. T. (2003) Teoría de la probabilidad: La lógica de la ciencia , CUP. ISBN 978-0-521-59271-0( Enlace a la edición fragmentaria de marzo de 1996 ).
- Howson, C. y Urbach, P. (2005). Razonamiento científico: el enfoque bayesiano (3.ª ed.). Open Court Publishing Company . ISBN 978-0-8126-9578-6.
- Phillips, LD; Edwards, Ward (octubre de 2008). «Capítulo 6: Conservadurismo en una tarea simple de inferencia de probabilidad ( Journal of Experimental Psychology (1966) 72: 346-354)». En Jie W. Weiss; David J. Weiss (eds.). A Science of Decision Making: The Legacy of Ward Edwards . Oxford University Press. pág. 536. ISBN 978-0-19-532298-9.
Lecturas adicionales
- Para un informe completo sobre la historia de la estadística bayesiana y los debates con los enfoques frecuentistas, consulte Vallverdu, Jordi (2016). Bayesians Versus Frequentists A Philosophical Debate on Statistical Reasoning . Nueva York: Springer. ISBN 978-3-662-48638-2.
- Clayton, Aubrey (agosto de 2021). La falacia de Bernoulli: ilógica estadística y la crisis de la ciencia moderna . Columbia University Press. ISBN 978-0-231-55335-3.
Elemental
Los siguientes libros se enumeran en orden ascendente de sofisticación probabilística:
- Stone, JV (2013), "La regla de Bayes: una introducción tutorial al análisis bayesiano", Descargue el primer capítulo aquí , Sebtel Press, Inglaterra.
- Dennis V. Lindley (2013). Comprender la incertidumbre, edición revisada (2.ª ed.). John Wiley. ISBN 978-1-118-65012-7.
- Colin Howson y Peter Urbach (2005). Razonamiento científico: El enfoque bayesiano (3.ª ed.). Open Court Publishing Company . ISBN 978-0-8126-9578-6.
- Berry, Donald A. (1996). Estadística: Una perspectiva bayesiana . Duxbury. ISBN 978-0-534-23476-8.
- Morris H. DeGroot y Mark J. Schervish (2002). Probabilidad y estadística (tercera ed.). Addison-Wesley. ISBN 978-0-201-52488-8.
- Bolstad, William M. (2007) Introducción a la estadística bayesiana : Segunda edición, John Wiley ISBN 0-471-27020-2
- Winkler, Robert L (2003). Introducción a la inferencia y decisión bayesiana (2.ª ed.). Probabilistic. ISBN 978-0-9647938-4-2.Libro de texto clásico actualizado. La teoría bayesiana se presenta de forma clara.
- Lee, Peter M. Estadística bayesiana: una introducción . Cuarta edición (2012), John Wiley ISBN 978-1-1183-3257-3
- Carlin, Bradley P. y Louis, Thomas A. (2008). Métodos bayesianos para el análisis de datos, tercera edición . Boca Raton, FL: Chapman and Hall/CRC. ISBN 978-1-58488-697-6.
- Gelman, Andrew ; Carlin, John B.; Stern, Hal S.; Dunson, David B.; Vehtari, Aki; Rubin, Donald B. (2013). Análisis de datos bayesianos, tercera edición . Chapman and Hall/CRC. ISBN 978-1-4398-4095-5.
Nivel intermedio o avanzado
- Berger, James O (1985). Teoría de la decisión estadística y análisis bayesiano . Springer Series in Statistics (Segunda ed.). Springer-Verlag. Bibcode : 1985sdtb.book.....B . ISBN 978-0-387-96098-2.
- Bernardo, José M. ; Smith, Adrian F. M. (1994). Teoría bayesiana . Wiley.
- DeGroot, Morris H. , Decisiones estadísticas óptimas . Wiley Classics Library. 2004. (Publicado originalmente (1970) por McGraw-Hill.) ISBN 0-471-68029-X.
- Schervish, Mark J. (1995). Teoría de la estadística . Springer-Verlag. ISBN 978-0-387-94546-0.
- Jaynes, ET (1998). Teoría de la probabilidad: La lógica de la ciencia .
- O'Hagan, A. y Forster, J. (2003). Teoría avanzada de la estadística de Kendall , Volumen 2B: Inferencia bayesiana . Arnold, Nueva York. ISBN 0-340-52922-9.
- Robert, Christian P (2007). La elección bayesiana: desde los fundamentos de la teoría de la decisión hasta la implementación computacional ( edición de bolsillo). Springer. ISBN 978-0-387-71598-8.
- Pearl, Judea . (1988). Razonamiento probabilístico en sistemas inteligentes: redes de inferencia plausible , San Mateo, CA: Morgan Kaufmann.
- Pierre Bessière et al. (2013). " Programación bayesiana ". Prensa CRC. ISBN 9781439880326
- Francisco J. Samaniego (2010). "Una comparación de los enfoques bayesiano y frecuentista para la estimación". Springer. Nueva York, ISBN 978-1-4419-5940-9
Enlaces externos
- "Enfoque bayesiano de los problemas estadísticos" , Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
- Estadística bayesiana de Scholarpedia.
- Introducción a la probabilidad bayesiana de la Universidad Queen Mary de Londres.
- Notas matemáticas sobre estadística bayesiana y el método de Monte Carlo de cadenas de Markov
- Lista de lecturas bayesianas archivada el 25/06/2011 en Wayback Machine , categorizada y anotada por Tom Griffiths.
- A. Hajek y S. Hartmann: Epistemología bayesiana , en: J. Dancy et al. (eds.), Un compañero de la epistemología. Oxford: Blackwell 2010, 93–106.
- S. Hartmann y J. Sprenger: Epistemología bayesiana , en: S. Bernecker y D. Pritchard (eds.), Routledge Companion to Epistemology. Londres: Routledge 2010, 609–620.
- Enciclopedia de Filosofía de Stanford : "Lógica inductiva"
- Teoría de la confirmación bayesiana (PDF)
- ¿Qué es el aprendizaje bayesiano?
- Datos, incertidumbre e inferencia : introducción informal con muchos ejemplos, libro electrónico (PDF) disponible gratuitamente en causaScientia.
- Inferencia bayesiana
- Lógica y estadística
- Pronóstico estadístico
- argumentos probabilísticos