La computación bayesiana aproximada ( ABC ) constituye una clase de métodos computacionales basados en la estadística bayesiana que pueden utilizarse para estimar las distribuciones posteriores de los parámetros del modelo.
En toda inferencia estadística basada en modelos , la función de verosimilitud es fundamental, ya que expresa la probabilidad de los datos observados bajo un modelo estadístico particular y, por lo tanto, cuantifica el respaldo que los datos brindan a valores específicos de los parámetros y a la elección entre diferentes modelos. Para modelos simples, generalmente se puede derivar una fórmula analítica para la función de verosimilitud. Sin embargo, para modelos más complejos, puede resultar difícil obtener una fórmula analítica o la evaluación de la función de verosimilitud puede ser computacionalmente muy costosa.
Los métodos ABC evitan la evaluación de la función de verosimilitud. De esta forma, amplían el ámbito de los modelos para los que se puede considerar la inferencia estadística. Si bien los métodos ABC tienen una sólida base matemática, inevitablemente implican suposiciones y aproximaciones cuyo impacto debe evaluarse cuidadosamente. Además, el mayor dominio de aplicación de los métodos ABC agrava los desafíos de la estimación de parámetros y la selección de modelos .
ABC ha ganado popularidad rápidamente en los últimos años y en particular para el análisis de problemas complejos que surgen en las ciencias biológicas , por ejemplo en genética de poblaciones , ecología , epidemiología , biología de sistemas y propagación de radio . [ 1 ]
Historia
Las primeras ideas relacionadas con ABC se remontan a la década de 1980. Donald Rubin , al analizar la interpretación de enunciados bayesianos en 1984, [ 2 ] describió un mecanismo de muestreo hipotético que produce una muestra de la distribución posterior . Este esquema era más bien un experimento mental conceptual para demostrar qué tipo de manipulaciones se realizan al inferir las distribuciones posteriores de los parámetros. La descripción del mecanismo de muestreo coincide exactamente con la del esquema de rechazo ABC , y este artículo puede considerarse el primero en describir la computación bayesiana aproximada. Sin embargo, Francis Galton construyó un quincunx de dos etapas a finales del siglo XIX que puede verse como una implementación física de un esquema de rechazo ABC para una sola incógnita (parámetro) y una sola observación. [ 3 ] Otro punto premonitorio fue planteado por Rubin al argumentar que, en la inferencia bayesiana, los estadísticos aplicados no deberían conformarse únicamente con modelos analíticamente manejables, sino considerar métodos computacionales que les permitan estimar la distribución posterior de interés. De esta manera, se puede considerar una gama más amplia de modelos. Estos argumentos son particularmente relevantes en el contexto de ABC.
En 1984, Peter Diggle y Richard Gratton sugirieron utilizar un esquema de simulación sistemática para aproximar la función de verosimilitud en situaciones donde su forma analítica es intratable . [ 4 ] Su método se basaba en definir una cuadrícula en el espacio de parámetros y usarla para aproximar la verosimilitud ejecutando varias simulaciones para cada punto de la cuadrícula. La aproximación se mejoraba luego aplicando técnicas de suavizado a los resultados de las simulaciones. Si bien la idea de usar la simulación para la prueba de hipótesis no era nueva, [ 5 ] [ 6 ] Diggle y Gratton aparentemente introdujeron el primer procedimiento que utilizaba la simulación para hacer inferencia estadística en una circunstancia donde la verosimilitud es intratable.
Aunque el enfoque de Diggle y Gratton abrió una nueva frontera, su método aún no era exactamente idéntico a lo que ahora se conoce como ABC, ya que buscaba aproximar la probabilidad en lugar de la distribución posterior. Un artículo de Simon Tavaré y coautores fue el primero en proponer un algoritmo ABC para la inferencia posterior. [ 7 ] En su trabajo fundamental, se consideró la inferencia sobre la genealogía de datos de secuencias de ADN, y en particular el problema de decidir la distribución posterior del tiempo hasta el ancestro común más reciente de los individuos muestreados. Dicha inferencia es analíticamente intratable para muchos modelos demográficos, pero los autores presentaron formas de simular árboles coalescentes bajo los modelos putativos. Se obtuvo una muestra de la distribución posterior de los parámetros del modelo aceptando/rechazando propuestas basadas en la comparación del número de sitios segregantes en los datos sintéticos y reales. Este trabajo fue seguido por un estudio aplicado sobre el modelado de la variación en el cromosoma Y humano por Jonathan K. Pritchard y coautores utilizando el método ABC. [ 8 ] Finalmente, Mark Beaumont y sus coautores establecieron el término computación bayesiana aproximada, [ 9 ] extendiendo aún más la metodología ABC y analizando la idoneidad del enfoque ABC más específicamente para problemas en genética de poblaciones. Desde entonces, ABC se ha extendido a aplicaciones fuera de la genética de poblaciones, como la biología de sistemas, la epidemiología y la filogeografía .
La computación bayesiana aproximada puede entenderse como una especie de versión bayesiana de la inferencia indirecta . [ 10 ] [ 11 ]
Se han desarrollado varios enfoques eficientes basados en Monte Carlo para realizar muestreos de la distribución posterior ABC con fines de estimación y predicción. Una opción popular es el algoritmo SMC Samplers [ 12 ] [ 13 ] [ 14 ] adaptado al contexto ABC en el método (SMC-ABC). [ 15 ] [ 11 ] [ 16 ] [ 17 ]
Método
Motivación
Una encarnación común del teorema de Bayes relaciona la probabilidad condicional (o densidad) de un valor de parámetro particular.datos proporcionadosa la probabilidad dedadopor la regla
- ,
dóndedenota la posterior,la probabilidad,lo anterior, yla evidencia (también denominada probabilidad marginal o probabilidad predictiva previa de los datos). Tenga en cuenta que el denominadorestá normalizando la probabilidad total de la densidad posteriora uno y se puede calcular de esa manera.
La información previa representa creencias o conocimientos (como por ejemplo, restricciones físicas) sobreantesestá disponible. Dado que la distribución a priori reduce la incertidumbre, las estimaciones a posteriori tienen menos varianza, pero podrían estar sesgadas. Por conveniencia, la distribución a priori a menudo se especifica eligiendo una distribución particular entre un conjunto de familias de distribuciones bien conocidas y manejables, de modo que tanto la evaluación de las probabilidades a priori como la generación aleatoria de valores deson relativamente sencillos. Para ciertos tipos de modelos, es más pragmático especificar la distribución a priori.utilizando una factorización de la distribución conjunta de todos los elementos deen términos de una secuencia de sus distribuciones condicionales. Si uno solo está interesado en las plausibilidades posteriores relativas de diferentes valores dela evidenciaPuede ignorarse, ya que constituye una constante de normalización que se cancela para cualquier razón de probabilidades posteriores. Sin embargo, sigue siendo necesario evaluar la probabilidad.y el anteriorPara numerosas aplicaciones, es computacionalmente costoso , o incluso completamente inviable, evaluar la probabilidad, [ 18 ] lo que motiva el uso de ABC para sortear este problema.
El algoritmo de rechazo ABC
Todos los métodos basados en ABC aproximan la función de verosimilitud mediante simulaciones, cuyos resultados se comparan con los datos observados. [ 19 ] [ 11 ] [ 20 ] [ 21 ] [ 22 ] Más específicamente, con el algoritmo de rechazo ABC —la forma más básica de ABC— primero se muestrea un conjunto de puntos de parámetros de la distribución previa. Dado un punto de parámetro muestreado, un conjunto de datosLuego se simula bajo el modelo estadístico.especificado por. Si el generadoes demasiado diferente de los datos observados, el valor del parámetro muestreado se descarta. En términos precisos,es aceptado con toleranciasi:
- ,
donde la medida de distanciadetermina el nivel de discrepancia entreybasado en una métrica dada (por ejemplo, distancia euclidiana ). Por lo general, es necesaria una tolerancia estrictamente positiva, ya que la probabilidad de que el resultado de la simulación coincida exactamente con los datos (evento) es insignificante salvo en aplicaciones triviales de ABC, que en la práctica llevarían al rechazo de casi todos los puntos de parámetros muestreados. El resultado del algoritmo de rechazo de ABC es una muestra de valores de parámetros distribuidos aproximadamente según la distribución posterior deseada y, lo que es crucial, se obtiene sin necesidad de evaluar explícitamente la función de verosimilitud.

Estadísticas descriptivas
La probabilidad de generar un conjunto de datoscon una pequeña distancia aPor lo general, disminuye a medida que aumenta la dimensionalidad de los datos. Esto conlleva una disminución sustancial en la eficiencia computacional del algoritmo básico de rechazo ABC mencionado anteriormente. Un enfoque común para mitigar este problema es reemplazarcon un conjunto de estadísticas descriptivas de menor dimensión, que se seleccionan para capturar la información relevante enEl criterio de aceptación en el algoritmo de rechazo ABC se convierte en:
- .
Si las estadísticas descriptivas son suficientes con respecto a los parámetros del modelo, el aumento de eficiencia obtenido de esta manera no introduce ningún error. [ 23 ] De hecho, por definición, la suficiencia implica que toda la información enacerca dees capturado por.
Como se explica más adelante , fuera de la familia exponencial de distribuciones , suele ser imposible identificar un conjunto finito de estadísticas suficientes. Sin embargo, en aplicaciones donde se realiza inferencia con métodos ABC, a menudo se utilizan estadísticas descriptivas informativas, aunque posiblemente insuficientes.
Ejemplo

Un ejemplo ilustrativo es un sistema biestable que puede caracterizarse mediante un modelo oculto de Markov (HMM) sujeto a ruido de medición. Dichos modelos se emplean para muchos sistemas biológicos: se han utilizado, por ejemplo, en el desarrollo, la señalización celular , la activación /desactivación, el procesamiento lógico y la termodinámica del no equilibrio . Por ejemplo, el comportamiento del factor de transcripción Sonic hedgehog (Shh) en Drosophila melanogaster puede modelarse con un HMM. [ 24 ] El modelo dinámico (biológico) consta de dos estados: A y B. Si la probabilidad de una transición de un estado al otro se define comoen ambas direcciones, entonces la probabilidad de permanecer en el mismo estado en cada paso de tiempo es. La probabilidad de medir el estado correctamente es(y a la inversa, la probabilidad de una medición incorrecta es).
Debido a las dependencias condicionales entre estados en diferentes momentos, el cálculo de la probabilidad de los datos de series temporales es algo tedioso, lo que ilustra la motivación para usar ABC. Un problema computacional para ABC básico es la gran dimensionalidad de los datos en una aplicación como esta. La dimensionalidad se puede reducir usando la estadística de resumen., que es la frecuencia de conmutaciones entre los dos estados. La diferencia absoluta se utiliza como medida de distancia.con tolerancia. La inferencia posterior sobre el parámetropuede hacerse siguiendo los cinco pasos presentados en.
Paso 1: Suponga que los datos observados forman la secuencia de estados AAAABAABBAAAAAABAAAA, que se genera utilizandoy. La estadística descriptiva asociada —el número de cambios entre los estados en los datos experimentales— es.
Paso 2: Suponiendo que no se sabe nada sobre, una distribución a priori uniforme en el intervalose emplea. El parámetroSe supone que es conocido y fijo al valor generador de datos., pero en general también podría estimarse a partir de las observaciones. Un total deLos puntos de los parámetros se extraen de la distribución a priori y el modelo se simula para cada uno de los puntos de los parámetros., lo que resulta ensecuencias de datos simulados. En este ejemplo,, con cada parámetro dibujado y conjunto de datos simulado registrado en la Tabla 1, columnas 2-3 . En la práctica,Sería necesario que fuera mucho mayor para obtener una aproximación adecuada.
Paso 3: Se calcula la estadística descriptiva para cada secuencia de datos simulados..
Paso 4: La distancia entre las frecuencias de transición observadas y simuladasse calcula para todos los puntos de parámetros. Puntos de parámetros para los cuales la distancia es menor o igual ase aceptan como muestras aproximadas de la parte posterior.

Paso 5: La distribución posterior se aproxima con los puntos de parámetros aceptados. La distribución posterior debe tener una probabilidad no despreciable para los valores de los parámetros en una región alrededor del valor verdadero deen el sistema si los datos son suficientemente informativos. En este ejemplo, la probabilidad posterior se divide equitativamente entre los valores 0,08 y 0,43.
Las probabilidades posteriores se obtienen mediante ABC con grandesmediante la utilización de la estadística descriptiva (cony) y la secuencia completa de datos (con). Estos se comparan con la verdadera posterior, que se puede calcular de forma exacta y eficiente utilizando el algoritmo de Viterbi . La estadística de resumen utilizada en este ejemplo no es suficiente, ya que la desviación de la posterior teórica es significativa incluso bajo el estricto requisito deSe necesitaría una secuencia de datos observados mucho más larga para obtener una distribución posterior concentrada alrededor de, el verdadero valor de.
Este ejemplo de aplicación de ABC utiliza simplificaciones con fines ilustrativos. Existen aplicaciones más realistas de ABC en un número creciente de artículos revisados por pares. [ 20 ] [ 21 ] [ 22 ] [ 25 ] [ 26 ]
Comparación de modelos con ABC
Fuera de la estimación de parámetros, el marco ABC se puede utilizar para calcular las probabilidades posteriores de diferentes modelos candidatos. [ 27 ] [ 28 ] [ 29 ] En tales aplicaciones, una posibilidad es utilizar el muestreo por rechazo de manera jerárquica. Primero, se muestrea un modelo de la distribución a priori para los modelos. Luego, se muestrean los parámetros de la distribución a priori asignada a ese modelo. Finalmente, se realiza una simulación como en ABC de un solo modelo. Las frecuencias de aceptación relativas para los diferentes modelos ahora aproximan la distribución posterior para estos modelos. Nuevamente, se han propuesto mejoras computacionales para ABC en el espacio de modelos, como la construcción de un filtro de partículas en el espacio conjunto de modelos y parámetros. [ 29 ]
Una vez estimadas las probabilidades posteriores de los modelos, se pueden aprovechar al máximo las técnicas de comparación de modelos bayesianos . Por ejemplo, para comparar las plausibilidades relativas de dos modelos.ySe puede calcular su razón posterior, que está relacionada con el factor de Bayes.:
- .
Si las probabilidades a priori del modelo son iguales, es decir,—el factor de Bayes es igual a la razón posterior.
En la práctica, como se explica más adelante , estas medidas pueden ser muy sensibles a la elección de las distribuciones previas de los parámetros y las estadísticas descriptivas, por lo que las conclusiones sobre la comparación de modelos deben extraerse con precaución.
Peligros y soluciones
Como ocurre con todos los métodos estadísticos, la aplicación de los métodos basados en ABC a problemas de modelado reales requiere inherentemente una serie de supuestos y aproximaciones. Por ejemplo, establecer el parámetro de tolerancia.A cero garantiza un resultado exacto, pero normalmente hace que los cálculos sean prohibitivamente costosos. Por lo tanto, los valores deEn la práctica, se utilizan valores mayores que cero, lo que introduce un sesgo. Asimismo, normalmente no se dispone de estadísticas suficientes y, en su lugar, se utilizan otras estadísticas descriptivas, lo que introduce un sesgo adicional debido a la pérdida de información. Otras fuentes de sesgo —por ejemplo, en el contexto de la selección de modelos— pueden ser más sutiles. [ 23 ] [ 31 ]
Al mismo tiempo, algunas de las críticas dirigidas a los métodos ABC, en particular en el campo de la filogeografía , [ 30 ] [ 32 ] [ 33 ] no son específicas de ABC y se aplican a todos los métodos bayesianos o incluso a todos los métodos estadísticos (por ejemplo, la elección de la distribución previa y los rangos de parámetros). [ 20 ] [ 34 ] Sin embargo, debido a la capacidad de los métodos ABC para manejar modelos mucho más complejos, algunos de estos inconvenientes generales son de particular relevancia en el contexto de los análisis ABC.
Esta sección analiza estos riesgos potenciales y revisa las posibles maneras de abordarlos.
Aproximación de la parte posterior
Una cantidad no despreciableviene con el precio que uno muestra deen lugar de la verdadera posteriorCon una tolerancia suficientemente pequeña y una medida de distancia razonable, la distribución resultantea menudo debería aproximarse a la distribución objetivo real.razonablemente bien. Por otro lado, una tolerancia lo suficientemente grande como para que cada punto en el espacio de parámetros sea aceptado producirá una réplica de la distribución previa. Hay estudios empíricos de la diferencia entreycomo función de, [ 35 ] [ 11 ] y resultados teóricos para un valor superiorlímite dependiente para el error en las estimaciones de parámetros. [ 36 ] La precisión de la posterior (definida como la pérdida cuadrática esperada) proporcionada por ABC en función deTambién se ha investigado. [ 37 ] Sin embargo, la convergencia de las distribuciones cuandoLa aproximación a cero, y cómo depende de la medida de distancia utilizada, es un tema importante que aún requiere mayor investigación. En particular, sigue siendo difícil distinguir los errores introducidos por esta aproximación de los errores debidos a una especificación incorrecta del modelo. [ 20 ]
En un intento de corregir parte del error debido a un valor distinto de ceroSe ha sugerido el uso de regresión lineal ponderada local con ABC para reducir la varianza de las estimaciones posteriores. [ 9 ] El método asigna ponderaciones a los parámetros según la concordancia entre los resúmenes simulados y los observados, y realiza una regresión lineal entre los resúmenes y los parámetros ponderados en las proximidades de los resúmenes observados. Los coeficientes de regresión obtenidos se utilizan para corregir los parámetros muestreados en la dirección de los resúmenes observados. Se sugirió una mejora mediante regresión no lineal utilizando un modelo de red neuronal de propagación directa. [ 38 ] Sin embargo, se ha demostrado que las distribuciones posteriores obtenidas con estos enfoques no siempre son consistentes con la distribución previa, lo que llevó a una reformulación del ajuste de regresión que respeta la distribución previa. [ 39 ]
Finalmente, inferencia estadística utilizando ABC con una tolerancia distinta de cero.no es inherentemente defectuoso: bajo el supuesto de errores de medición, el óptimoDe hecho, se puede demostrar que no es cero. [ 37 ] [ 40 ] En efecto, el sesgo causado por una tolerancia distinta de cero puede caracterizarse y compensarse introduciendo una forma específica de ruido en las estadísticas descriptivas. Se ha establecido la consistencia asintótica para este "ABC ruidoso", junto con fórmulas para la varianza asintótica de las estimaciones de los parámetros para una tolerancia fija. [ 37 ]
Selección y suficiencia de las estadísticas descriptivas
Las estadísticas descriptivas pueden utilizarse para aumentar la tasa de aceptación de ABC para datos de alta dimensión. Las estadísticas suficientes de baja dimensión son óptimas para este propósito, ya que capturan toda la información relevante presente en los datos de la forma más simple posible. [ 22 ] [ 41 ] [ 42 ] Sin embargo, las estadísticas suficientes de baja dimensión suelen ser inalcanzables para modelos estadísticos donde la inferencia basada en ABC es más relevante y, en consecuencia, suele ser necesario algún método heurístico para identificar estadísticas descriptivas de baja dimensión útiles. El uso de un conjunto de estadísticas descriptivas mal elegidas a menudo conduce a intervalos de credibilidad inflados debido a la pérdida de información implícita, [ 22 ] lo que también puede sesgar la discriminación entre modelos. Existe una revisión de métodos para elegir estadísticas descriptivas, [ 43 ] que puede proporcionar una guía valiosa en la práctica.
Una forma de capturar la mayor parte de la información presente en los datos sería utilizar muchas estadísticas, pero la precisión y estabilidad del método ABC parecen disminuir rápidamente con un número creciente de estadísticas descriptivas. [ 20 ] [ 22 ] En cambio, una mejor estrategia es centrarse únicamente en las estadísticas relevantes; la relevancia depende del problema de inferencia en su conjunto, del modelo utilizado y de los datos disponibles. [ 44 ]
Se ha propuesto un algoritmo para identificar un subconjunto representativo de estadísticas de resumen, evaluando iterativamente si una estadística adicional introduce una modificación significativa de la posterior. [ 45 ] Uno de los desafíos aquí es que un gran error de aproximación ABC puede influir fuertemente en las conclusiones sobre la utilidad de una estadística en cualquier etapa del procedimiento. Otro método [ 44 ] se descompone en dos pasos principales. Primero, se construye una aproximación de referencia de la posterior minimizando la entropía . Luego, se evalúan conjuntos de resúmenes candidatos comparando las posteriores aproximadas ABC con la posterior de referencia.
Con ambas estrategias, se selecciona un subconjunto de estadísticas de un gran conjunto de estadísticas candidatas. En cambio, el enfoque de regresión de mínimos cuadrados parciales utiliza información de todas las estadísticas candidatas, cada una ponderada adecuadamente. [ 46 ] Recientemente, un método para construir resúmenes de manera semiautomática ha alcanzado un interés considerable. [ 37 ] Este método se basa en la observación de que la elección óptima de estadísticas de resumen, al minimizar la pérdida cuadrática de las estimaciones puntuales de los parámetros, se puede obtener a través de la media posterior de los parámetros, que se aproxima realizando una regresión lineal basada en los datos simulados. Se han obtenido estadísticas de resumen para la selección de modelos utilizando regresión logística multinomial en datos simulados, tratando los modelos competidores como la etiqueta a predecir. [ 47 ]
Se ha propuesto un marco unificador basado en la minimización de la entropía posterior esperada (EPE) para guiar la selección de estadísticas resumen. [ 48 ] Este enfoque demuestra que minimizar la EPE es matemáticamente equivalente a maximizar la información mutua entre resúmenes y parámetros o minimizar la divergencia esperada de Kullback-Leibler con respecto a la distribución posterior verdadera para aproximarla. Además, se demuestra que otras estrategias comunes, como minimizar el riesgo de Bayes, maximizar la información de Fisher y la selección de modelos probabilísticos, son casos especiales o límites de muestras grandes de este marco.
Los métodos para identificar estadísticas descriptivas que también permitan evaluar simultáneamente su influencia en la aproximación de la distribución posterior serían de gran utilidad. [ 49 ] Esto se debe a que la elección de las estadísticas descriptivas y la elección de la tolerancia constituyen dos fuentes de error en la distribución posterior resultante. Estos errores pueden distorsionar la clasificación de los modelos y también pueden conducir a predicciones incorrectas.
Factor de Bayes con ABC y estadísticas descriptivas
Se ha demostrado que la combinación de estadísticas de resumen insuficientes y ABC para la selección de modelos puede ser problemática. [ 23 ] [ 31 ] De hecho, si se deja que el factor de Bayes se base en la estadística de resumenser denotado por, la relación entreytoma la forma: [ 23 ]
- .
Por lo tanto, una estadística descriptivaes suficiente para comparar dos modelosysi y solo si :
- ,
lo cual resulta en queTambién queda claro en la ecuación anterior que podría haber una gran diferencia entreysi no se cumple la condición, como se puede demostrar con ejemplos de juguetes. [ 23 ] [ 28 ] [ 31 ] Fundamentalmente, se demostró que la suficiencia paraopor sí solo, o para ambos modelos, no garantiza la suficiencia para clasificar los modelos. [ 23 ] Sin embargo, también se demostró que cualquier estadística de resumen suficiente para un modeloen el que ambosyson anidados es válido para clasificar los modelos anidados . [ 23 ]
El cálculo de los factores de Bayes enPor lo tanto, puede resultar engañoso para fines de selección de modelos, a menos que la relación entre los factores de Bayes enyEstarían disponibles, o al menos podrían aproximarse razonablemente bien. Alternativamente, recientemente se han derivado condiciones necesarias y suficientes sobre las estadísticas descriptivas para una elección consistente del modelo bayesiano, [ 50 ] que pueden proporcionar una guía útil.
Sin embargo, este problema solo es relevante para la selección de modelos cuando se ha reducido la dimensión de los datos. La inferencia basada en ABC, en la que se comparan directamente los conjuntos de datos reales —como ocurre en algunas aplicaciones de biología de sistemas (por ejemplo, véase [ 51 ] )—, evita este problema.
Controles de calidad indispensables
Como se desprende de la discusión anterior, cualquier análisis ABC requiere decisiones y compensaciones que pueden tener un impacto considerable en sus resultados. Específicamente, la elección de modelos/hipótesis en competencia, el número de simulaciones, la elección de estadísticas descriptivas o el umbral de aceptación no pueden basarse actualmente en reglas generales, sino que el efecto de estas decisiones debe evaluarse y probarse en cada estudio. [ 21 ]
Se han propuesto varios enfoques heurísticos para el control de calidad de ABC, como la cuantificación de la fracción de la varianza de los parámetros explicada por las estadísticas descriptivas. [ 21 ] Una clase común de métodos tiene como objetivo evaluar si la inferencia produce resultados válidos, independientemente de los datos observados. Por ejemplo, dado un conjunto de valores de parámetros, que generalmente se extraen de las distribuciones previa o posterior de un modelo, se puede generar un gran número de conjuntos de datos artificiales. De esta manera, la calidad y robustez de la inferencia ABC se pueden evaluar en un entorno controlado, midiendo qué tan bien el método de inferencia ABC elegido recupera los valores reales de los parámetros, y también los modelos si se consideran simultáneamente múltiples modelos estructuralmente diferentes.
Otro tipo de métodos evalúa si la inferencia fue exitosa a la luz de los datos observados, por ejemplo, comparando la distribución predictiva posterior de las estadísticas descriptivas con las estadísticas descriptivas observadas. [ 21 ] Además, las técnicas de validación cruzada [ 52 ] y las comprobaciones predictivas [ 53 ] [ 54 ] representan estrategias futuras prometedoras para evaluar la estabilidad y la validez predictiva fuera de la muestra de las inferencias ABC. Esto es particularmente importante al modelar grandes conjuntos de datos, porque entonces el soporte posterior de un modelo particular puede parecer abrumadoramente concluyente, incluso si todos los modelos propuestos son, de hecho, representaciones deficientes del sistema estocástico subyacente a los datos de observación. Las comprobaciones predictivas fuera de la muestra pueden revelar posibles sesgos sistemáticos dentro de un modelo y proporcionar pistas sobre cómo mejorar su estructura o parametrización.
Recientemente se han propuesto enfoques fundamentalmente novedosos para la selección de modelos que incorporan el control de calidad como un paso integral del proceso. ABC permite, por definición, la estimación de las discrepancias entre los datos observados y las predicciones del modelo, con respecto a un conjunto completo de estadísticas. Estas estadísticas no son necesariamente las mismas que las utilizadas en el criterio de aceptación. Las distribuciones de discrepancia resultantes se han utilizado para seleccionar modelos que concuerdan con muchos aspectos de los datos simultáneamente [ 55 ] , y la inconsistencia del modelo se detecta a partir de resúmenes contradictorios y codependientes. Otro método basado en el control de calidad para la selección de modelos emplea ABC para aproximar el número efectivo de parámetros del modelo y la desviación de las distribuciones predictivas posteriores de los resúmenes y parámetros [ 56 ] . El criterio de información de desviación se utiliza entonces como medida del ajuste del modelo. También se ha demostrado que los modelos preferidos en función de este criterio pueden entrar en conflicto con aquellos respaldados por factores de Bayes . Por esta razón, es útil combinar diferentes métodos para la selección de modelos para obtener conclusiones correctas.
Los controles de calidad son factibles y, de hecho, se realizan en muchos trabajos basados en ABC, pero para ciertos problemas, la evaluación del impacto de los parámetros relacionados con el método puede resultar compleja. Sin embargo, cabe esperar que el uso cada vez mayor de ABC proporcione una comprensión más profunda de las limitaciones y la aplicabilidad del método.
Los riesgos generales en la inferencia estadística se ven exacerbados en ABC.
Esta sección analiza riesgos que, estrictamente hablando, no son exclusivos del método ABC, pero que también son relevantes para otros métodos estadísticos. Sin embargo, la flexibilidad que ofrece el método ABC para analizar modelos muy complejos hace que su análisis sea sumamente pertinente en este contexto.
Distribución previa y rangos de parámetros
La especificación del rango y la distribución previa de los parámetros se beneficia enormemente del conocimiento previo sobre las propiedades del sistema. Una crítica ha sido que en algunos estudios "los rangos y distribuciones de los parámetros se estiman únicamente en función de la opinión subjetiva de los investigadores" [ 57 ] , lo cual está relacionado con las objeciones clásicas a los enfoques bayesianos [ 58 ] .
Con cualquier método computacional, normalmente es necesario restringir los rangos de parámetros investigados. Los rangos de parámetros deberían definirse, de ser posible, en función de las propiedades conocidas del sistema estudiado, pero para aplicaciones prácticas puede ser necesario realizar una estimación fundamentada. Sin embargo, existen resultados teóricos sobre distribuciones a priori objetivas , que pueden basarse, por ejemplo, en el principio de indiferencia o en el principio de máxima entropía . [ 59 ] [ 60 ] Por otro lado, los métodos automatizados o semiautomatizados para elegir una distribución a priori a menudo producen densidades impropias . Como la mayoría de los procedimientos ABC requieren generar muestras a partir de la distribución a priori, las distribuciones a priori impropias no son directamente aplicables a ABC.
Al elegir la distribución a priori, también se debe tener en cuenta el propósito del análisis. En principio, las distribuciones a priori poco informativas y uniformes, que exageran nuestra ignorancia subjetiva sobre los parámetros, aún pueden generar estimaciones razonables de los mismos. Sin embargo, los factores de Bayes son muy sensibles a la distribución a priori de los parámetros. Las conclusiones sobre la elección del modelo basadas en el factor de Bayes pueden ser engañosas a menos que se considere cuidadosamente la sensibilidad de dichas conclusiones a la elección de las distribuciones a priori.
Un número reducido de modelos
Los métodos basados en modelos han sido criticados por no cubrir exhaustivamente el espacio de hipótesis. [ 33 ] De hecho, los estudios basados en modelos a menudo giran en torno a un pequeño número de modelos, y debido al alto costo computacional para evaluar un solo modelo en algunos casos, puede ser difícil cubrir una gran parte del espacio de hipótesis.
Un límite superior para el número de modelos candidatos considerados viene determinado por el considerable esfuerzo necesario para definir los modelos y elegir entre muchas opciones alternativas. [ 21 ] No existe un procedimiento específico de ABC comúnmente aceptado para la construcción de modelos, por lo que se utilizan la experiencia y el conocimiento previo. [ 22 ] Si bien serían beneficiosos procedimientos más robustos para la elección y formulación de modelos a priori , no existe una estrategia universal para el desarrollo de modelos en estadística: la caracterización sensata de sistemas complejos siempre requerirá una gran cantidad de trabajo de investigación y el uso del conocimiento experto del dominio del problema.
Algunos detractores del ABC sostienen que, dado que solo unos pocos modelos —elegidos subjetivamente y probablemente todos erróneos— pueden considerarse de manera realista, los análisis ABC proporcionan una visión limitada. [ 33 ] Sin embargo, existe una distinción importante entre identificar una hipótesis nula plausible y evaluar el ajuste relativo de hipótesis alternativas. [ 20 ] Dado que las hipótesis nulas útiles, que potencialmente pueden ser ciertas, rara vez pueden plantearse en el contexto de modelos complejos, la capacidad predictiva de los modelos estadísticos como explicaciones de fenómenos complejos es mucho más importante que la prueba de una hipótesis nula estadística en este contexto. También es común promediar los modelos investigados, ponderados según su plausibilidad relativa, para inferir características del modelo (por ejemplo, valores de parámetros) y hacer predicciones.
Grandes conjuntos de datos
Los conjuntos de datos grandes pueden constituir un cuello de botella computacional para los métodos basados en modelos. Se señaló, por ejemplo, que en algunos análisis basados en ABC, parte de los datos deben omitirse. [ 33 ] Varios autores han argumentado que los conjuntos de datos grandes no son una limitación práctica, [ 21 ] [ 58 ] aunque la gravedad de este problema depende en gran medida de las características de los modelos. Varios aspectos de un problema de modelado pueden contribuir a la complejidad computacional, como el tamaño de la muestra, el número de variables o características observadas, la resolución temporal o espacial, etc. Sin embargo, con el aumento de la capacidad de cómputo, este problema será potencialmente menos importante.
En lugar de muestrear parámetros para cada simulación a partir de la distribución a priori, se ha propuesto como alternativa combinar el algoritmo de Metropolis-Hastings con ABC, lo que, según se informó, resultó en una tasa de aceptación más alta que para ABC simple. [ 49 ] Naturalmente, este enfoque hereda las cargas generales de los métodos MCMC, como la dificultad para evaluar la convergencia, la correlación entre las muestras de la distribución a posteriori, [ 35 ] y una paralelización relativamente baja. [ 21 ]
Asimismo, las ideas de los métodos de Monte Carlo secuencial (SMC) y Monte Carlo poblacional (PMC) se han adaptado al contexto ABC. [ 35 ] [ 61 ] La idea general es aproximarse iterativamente a la distribución posterior a partir de la distribución previa mediante una secuencia de distribuciones objetivo. Una ventaja de estos métodos, en comparación con ABC-MCMC, es que las muestras de la distribución posterior resultante son independientes. Además, con los métodos secuenciales, los niveles de tolerancia no deben especificarse antes del análisis, sino que se ajustan de forma adaptativa. [ 62 ]
Es relativamente sencillo paralelizar varios pasos en algoritmos ABC basados en muestreo por rechazo y métodos secuenciales de Monte Carlo . También se ha demostrado que los algoritmos paralelos pueden acelerar significativamente la inferencia basada en MCMC en filogenética [ 63 ] , lo que podría ser un enfoque viable también para los métodos basados en ABC. Sin embargo, es muy probable que un modelo adecuado para un sistema complejo requiera una computación intensiva, independientemente del método de inferencia elegido, y corresponde al usuario seleccionar el método más apropiado para la aplicación en cuestión.
Maldición de la dimensionalidad
Los conjuntos de datos de alta dimensión y los espacios de parámetros de alta dimensión pueden requerir la simulación de un número extremadamente grande de puntos de parámetros en estudios basados en ABC para obtener un nivel razonable de precisión en las inferencias posteriores. En tales situaciones, el costo computacional aumenta considerablemente y, en el peor de los casos, puede hacer que el análisis computacional sea intratable. Estos son ejemplos de fenómenos bien conocidos, que generalmente se engloban bajo el término general de maldición de la dimensionalidad . [ 64 ]
Para evaluar la gravedad con la que la dimensionalidad de un conjunto de datos afecta el análisis en el contexto de ABC, se han derivado fórmulas analíticas para el error de los estimadores de ABC en función de la dimensión de las estadísticas descriptivas. [ 65 ] [ 66 ] Además, Blum y François han investigado cómo la dimensión de las estadísticas descriptivas se relaciona con el error cuadrático medio para diferentes ajustes de corrección al error de los estimadores de ABC. También se argumentó que las técnicas de reducción de dimensionalidad son útiles para evitar la maldición de la dimensionalidad, debido a una estructura subyacente potencialmente de menor dimensión de las estadísticas descriptivas. [ 65 ] Motivados por minimizar la pérdida cuadrática de los estimadores de ABC, Fearnhead y Prangle han propuesto un esquema para proyectar datos (posiblemente de alta dimensión) en estimaciones de las medias posteriores de los parámetros; estas medias, que ahora tienen la misma dimensión que los parámetros, se utilizan como estadísticas descriptivas para ABC. [ 66 ]
ABC puede utilizarse para inferir problemas en espacios de parámetros de alta dimensión, aunque se debe tener en cuenta la posibilidad de sobreajuste (por ejemplo, véanse los métodos de selección de modelos en [ 55 ] y [ 56 ] ). Sin embargo, la probabilidad de aceptar los valores simulados para los parámetros bajo una tolerancia dada con el algoritmo de rechazo ABC suele disminuir exponencialmente con el aumento de la dimensionalidad del espacio de parámetros (debido al criterio de aceptación global). [ 22 ] Aunque ningún método computacional (basado en ABC o no) parece ser capaz de romper la maldición de la dimensionalidad, recientemente se han desarrollado métodos para manejar espacios de parámetros de alta dimensión bajo ciertas suposiciones (por ejemplo, basados en la aproximación polinómica en cuadrículas dispersas, [ 67 ] lo que podría reducir considerablemente los tiempos de simulación para ABC). Sin embargo, la aplicabilidad de tales métodos depende del problema, y la dificultad de explorar espacios de parámetros no debe subestimarse en general. Por ejemplo, la introducción de la estimación global de parámetros determinista llevó a informes de que los óptimos globales obtenidos en varios estudios previos de problemas de baja dimensión eran incorrectos. [ 68 ] Para ciertos problemas, por lo tanto, podría ser difícil saber si el modelo es incorrecto o, como se mencionó anteriormente , si la región explorada del espacio de parámetros es inapropiada. [ 33 ] Enfoques más pragmáticos consisten en reducir el alcance del problema mediante la reducción del modelo, [ 22 ] la discretización de variables y el uso de modelos canónicos como los modelos ruidosos. Los modelos ruidosos aprovechan la información sobre la independencia condicional entre variables. [ 69 ]
Software
Actualmente existen varios paquetes de software disponibles para la aplicación del método ABC a clases particulares de modelos estadísticos.
La idoneidad de cada paquete de software depende de la aplicación específica, del entorno del sistema informático y de los algoritmos necesarios.
Véase también
Referencias
Este artículo fue adaptado de la siguiente fuente bajo una licencia CC BY 4.0 ( 2013 ) ( informes de revisión ): Mikael Sunnåker; Alberto Giovanni Busetto; Elina Numminen; Jukka Corander; Matthieu Foll; Christophe Dessimoz (2013). "Computación bayesiana aproximada" . PLOS Computational Biology . 9 (1) e1002803. doi : 10.1371/JOURNAL.PCBI.1002803 . ISSN 1553-734X . PMC 3547661. PMID 23341757. Wikidata Q4781761 .
- ↑ Bharti, A; Briol, F.-X.; Pedersen, T (2021). "Un método general para calibrar modelos estocásticos de canales de radio con núcleos". IEEE Transactions on Antennas and Propagation . 70 (6): 3986– 4001. arXiv : 2012.09612 . doi : 10.1109/TAP.2021.3083761 . S2CID 233880538 .
- ↑ Rubin, DB (1984). "Cálculos de frecuencia justificables y relevantes desde el punto de vista bayesiano para el estadístico aplicado" . The Annals of Statistics . 12 (4): 1151– 1172. doi : 10.1214/aos/1176346785 .
- ↑ Véase la figura 5 en Stigler, Stephen M. (2010). "Darwin, Galton y la Ilustración estadística". Journal of the Royal Statistical Society. Serie A (Estadística en la sociedad) . 173 (3): 469– 482. doi : 10.1111/j.1467-985X.2010.00643.x . ISSN 0964-1998 . S2CID 53333238 .
- ↑ Diggle, PJ (1984). "Métodos de Monte Carlo de inferencia para modelos estadísticos implícitos". Journal of the Royal Statistical Society, Serie B. 46 ( 2): 193– 227. doi : 10.1111/j.2517-6161.1984.tb01290.x .
- ↑ Bartlett, MS (1963). "El análisis espectral de procesos puntuales". Journal of the Royal Statistical Society, Serie B. 25 ( 2): 264– 296. doi : 10.1111/j.2517-6161.1963.tb00508.x .
- ↑ Hoel, DG; Mitchell, TJ (1971). "La simulación, ajuste y prueba de un modelo estocástico de proliferación celular". Biometrics . 27 ( 1): 191– 199. doi : 10.2307/2528937 . JSTOR 2528937. PMID 4926451 .
- ↑ Tavaré, S; Balding, DJ; Griffiths, RC; Donnelly, P (1997). "Inferencia de tiempos de coalescencia a partir de datos de secuencias de ADN" . Genetics . 145 ( 2): 505– 518. doi : 10.1093/genetics/145.2.505 . PMC 1207814. PMID 9071603 .
- ↑ Pritchard, JK; Seielstad, MT; Perez-Lezaun, A; et al. (1999). "Crecimiento poblacional de los cromosomas Y humanos: un estudio de los microsatélites del cromosoma Y" . Biología molecular y evolución . 16 (12): 1791– 1798. doi : 10.1093/oxfordjournals.molbev.a026091 . PMID 10605120 .
- 1 2 Beaumont, MA; Zhang, W; Balding, DJ (2002). " Computación bayesiana aproximada en genética de poblaciones" . Genetics . 162 (4): 2025– 2035. doi : 10.1093/genetics/162.4.2025 . PMC 1462356. PMID 12524368 .
- ↑ Christopher C Drovandi (2018). "ABC e inferencia indirecta". arXiv : 1803.01999 [ stat.CO ].
- 1 2 3 4 Peters, Gareth (2009). "Avances en computación bayesiana aproximada y metodología de muestreo transdimensional" . SSRN Electronic Journal . doi : 10.2139/ssrn.3785580 . hdl : 1959.4/50086 . ISSN 1556-5068 .
- ↑ Del Moral, Pierre; Doucet, Arnaud; Jasra, Ajay (2006). "Muestreadores secuenciales de Monte Carlo". Revista de la Real Sociedad de Estadística. Serie B (Metodología Estadística) . 68 (3): 411– 436. arXiv : cond-mat/0212648 . doi : 10.1111/j.1467-9868.2006.00553.x . ISSN 1369-7412 . JSTOR 3879283 .
- ↑ Del Moral, Pierre; Doucet, Arnaud; Peters, Gareth (2004). "Sequential Monte Carlo Samplers CUED Technical Report" . SSRN Electronic Journal . doi : 10.2139/ssrn.3841065 . ISSN 1556-5068 .
- ↑ Peters, Gareth (2005). "Temas en muestreadores secuenciales de Monte Carlo" . Revista electrónica SSRN . doi : 10.2139/ssrn.3785582 . ISSN 1556-5068 .
- ↑ Sisson, SA; Fan, Y.; Tanaka, Mark M. (2007-02-06). "Monte Carlo secuencial sin probabilidades" . Actas de la Academia Nacional de Ciencias . 104 ( 6): 1760– 1765. Bibcode : 2007PNAS..104.1760S . doi : 10.1073/pnas.0607208104 . ISSN 0027-8424 . PMC 1794282. PMID 17264216 .
- ↑ Peters, GW; Sisson, SA; Fan, Y. (2012-11-01). "Inferencia bayesiana sin verosimilitud para modelos α-estables" . Computational Statistics & Data Analysis . 1er número de Annals of Computational and Financial Econometrics. 56 (11): 3743– 3756. doi : 10.1016/j.csda.2010.10.004 . ISSN 0167-9473 .
- ↑ Peters, Gareth W.; Wüthrich, Mario V.; Shevchenko, Pavel V. (2010-08-01). "Método de la escalera de cadenas: bootstrap bayesiano versus bootstrap clásico" . Insurance: Mathematics and Economics . 47 (1): 36– 51. arXiv : 1004.2548 . doi : 10.1016/j.insmatheco.2010.03.007 . ISSN 0167-6687 .
- ↑ Busetto AG, Buhmann J. Estimación estable de parámetros bayesianos para sistemas dinámicos biológicos; 2009. IEEE Computer Society Press pp. 148-157.
- ↑ Hunter, Dawn (2006-12-08). "Inferencia bayesiana, muestreo de Monte Carlo y riesgo operacional" . Journal of Operational Risk . 1 (3): 27– 50. doi : 10.21314/jop.2006.014 .
- 1 2 3 4 5 6 Beaumont, MA (2010). "Computación bayesiana aproximada en evolución y ecología". Annual Review of Ecology, Evolution, and Systematics . 41 : 379– 406. doi : 10.1146/annurev-ecolsys-102209-144621 .
- 1 2 3 4 5 6 7 8 Bertorelle, G; Benazzo, A; Mona, S (2010). "ABC como un marco flexible para estimar la demografía en el espacio y el tiempo: algunos inconvenientes, muchas ventajas" . Molecular Ecology . 19 (13): 2609– 2625. Bibcode : 2010MolEc..19.2609B . doi : 10.1111 / j.1365-294x.2010.04690.x . PMID 20561199. S2CID 12129604 .
- 1 2 3 4 5 6 7 8 Csilléry, K; Blum, MGB; Gaggiotti, OE; François, O (2010). "Computación bayesiana aproximada (ABC) en la práctica". Trends in Ecology & Evolution . 25 (7): 410– 418. Bibcode : 2010TEcoE..25..410C . doi : 10.1016/j.tree.2010.04.001 . PMID 20488578 . S2CID 13957079 .
- 1 2 3 4 5 6 7 Didelot, X; Everitt, RG; Johansen, AM; Lawson, DJ (2011). "Estimación sin verosimilitud de la evidencia del modelo" . Análisis bayesiano . 6 : 49–76 . doi : 10.1214/11-ba602 .
- ↑ Lai, K; Robertson, MJ; Schaffer, DV (2004). "El sistema de señalización Sonic Hedgehog como un interruptor genético biestable" . Biophys. J. 86 ( 5): 2748– 2757. Bibcode : 2004BpJ....86.2748L . doi : 10.1016/ s0006-3495 (04)74328-3 . PMC 1304145. PMID 15111393 .
- ↑ Marin, JM; Pudlo, P; Robert, CP; Ryder, RJ (2012). "Métodos computacionales bayesianos aproximados". Statistics and Computing . 22 (6): 1167– 1180. arXiv : 1101.0955 . doi : 10.1007/s11222-011-9288-2 . S2CID 40304979 .
- ↑ Robert, Christian P. (2016). "Computación bayesiana aproximada: una revisión de resultados recientes". En Cools, R.; Nuyens, D. (eds.). Métodos de Monte Carlo y cuasi-Monte Carlo . Springer Proceedings in Mathematics & Statistics. Vol. 163. pp. 185–205 . arXiv : 1506.08292 . doi : 10.1007/978-3-319-33507-0_7 . ISBN 978-3-319-33505-6.
- ↑ Wilkinson, RG (2007). Estimación bayesiana de los tiempos de divergencia de los primates, tesis doctoral, Universidad de Cambridge.
- 1 2 Grelaud, A; Marin, JM; Robert, C; Rodolphe, F; Tally, F (2009). "Métodos sin verosimilitud para la elección de modelos en campos aleatorios de Gibbs". Análisis bayesiano . 3 : 427–442 .
- 1 2 Toni, Tina; Stumpf, Michael PH (2010). "Selección de modelos basada en simulación para sistemas dinámicos en biología de sistemas y poblaciones" . Bioinformática . 26 ( 1): 104– 110. arXiv : 0911.1705 . doi : 10.1093/bioinformatics/btp619 . PMC 2796821. PMID 19880371 .
- 1 2 Templeton, AR (2009). "¿Por qué se sigue utilizando un método que falla? La respuesta" . Evolution . 63 (4): 807– 812. Bibcode : 2009Evolu..63..807T . doi : 10.1111/ j.1558-5646.2008.00600.x . PMC 2693665. PMID 19335340 .
- 1 2 3 Robert, CP; Cornuet, JM; Marin, JM; Pillai, NS (2011). "Falta de confianza en la elección aproximada del modelo de computación bayesiana" . Proc Natl Acad Sci USA . 108 (37): 15112– 15117. Bibcode : 2011PNAS..10815112R . doi : 10.1073/pnas.1102900108 . PMC 3174657. PMID 21876135 .
- ↑ Templeton, AR (2008). "Análisis de clados anidados: un método ampliamente validado para una fuerte inferencia filogeográfica" . Molecular Ecology . 17 (8): 1877– 1880. Bibcode : 2008MolEc..17.1877T . doi : 10.1111/j.1365-294x.2008.03731.x . PMC 2746708. PMID 18346121 .
- 1 2 3 4 5 Templeton, AR (2009). "Prueba de hipótesis estadística en filogeografía intraespecífica: análisis filogeográfico de clados anidados frente a computación bayesiana aproximada" . Molecular Ecology . 18 (2): 319– 331. Bibcode : 2009MolEc..18..319T . doi : 10.1111/j.1365-294x.2008.04026.x . PMC 2696056. PMID 19192182 .
- ↑ Berger, JO; Fienberg, SE; Raftery, AE; Robert, CP (2010). "Inferencia filogeográfica incoherente" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 107 (41): E157. Bibcode : 2010PNAS..107E.157B . doi : 10.1073/pnas.1008762107 . PMC 2955098. PMID 20870964 .
- 1 2 3 Sisson, SA; Fan, Y; Tanaka, MM (2007). "Monte Carlo secuencial sin probabilidades" . Proc Natl Acad Sci USA . 104 (6): 1760– 1765. Bibcode : 2007PNAS..104.1760S . doi : 10.1073/pnas.0607208104 . PMC 1794282. PMID 17264216 .
- ↑ Dean, Thomas A.; Singh, Sumeetpal S.; Jasra, Ajay; Peters, Gareth W. (2011). "Estimación de parámetros para modelos ocultos de Markov con verosimilitudes intratables". arXiv : 1103.5399 [ math.ST ].
- 1 2 3 4 Fearnhead, Paul; Prangle, Dennis (2010). "Construcción de estadísticas resumidas para computación bayesiana aproximada: ABC semiautomático". arXiv : 1004.1112 [ stat.ME ].
- ↑ Blum, M; Francois, O (2010). "Modelos de regresión no lineal para computación bayesiana aproximada". Stat Comp . 20 : 63–73 . arXiv : 0809.4178 . doi : 10.1007/s11222-009-9116-0 . S2CID 2403203 .
- ↑ Leuenberger, C; Wegmann, D (2009). "Computación bayesiana y selección de modelos sin verosimilitudes" . Genetics . 184 ( 1): 243– 252. doi : 10.1534/genetics.109.109058 . PMC 2815920. PMID 19786619 .
- ↑ Wilkinson, Richard David (2013). "La computación bayesiana aproximada (ABC) proporciona resultados exactos bajo el supuesto de error del modelo". Aplicaciones estadísticas en genética y biología molecular . 12 (2): 129– 141. arXiv : 0811.3355 . doi : 10.1515/sagmb-2013-0010 . PMID 23652634 .
- ↑ Peters, Gareth William; Wuthrich, Mario V.; Shevchenko, Pavel V. (2009). "Método de la escalera de cadenas: Bootstrap bayesiano frente a Bootstrap clásico". Revista electrónica SSRN . arXiv : 1004.2548 . doi : 10.2139/ssrn.2980411 . ISSN 1556-5068 .
- ↑ Peters, GW; Sisson, SA; Fan, Y. (2009-12-23). "Inferencia bayesiana sin verosimilitud para modelos alfa-estables". arXiv : 0912.4729 [ stat.CO ].
- ↑ Blum, MGB; Nunes, MA; Prangle, D.; Sisson, SA (2013). "Una revisión comparativa de los métodos de reducción de dimensión en la computación bayesiana aproximada". Statistical Science . 28 (2). arXiv : 1202.3819 . Bibcode : 2013StaSc..28TS406B . doi : 10.1214/12-STS406 .
- 1 2 Nunes, MA; Balding, DJ (2010). "Sobre la selección óptima de estadísticas de resumen para el cálculo bayesiano aproximado". Stat Appl Genet Mol Biol . 9 : Artículo 34. doi : 10.2202/1544-6115.1576 . PMID 20887273 . S2CID 207319754 .
- ↑ Joyce, P; Marjoram, P (2008). "Estadística aproximadamente suficiente y computación bayesiana". Stat Appl Genet Mol Biol . 7 (1): Artículo 26. doi : 10.2202/1544-6115.1389 . PMID 18764775 . S2CID 38232110 .
- ↑ Wegmann, D; Leuenberger, C; Excoffier, L (2009). "Computación bayesiana aproximada eficiente acoplada con Monte Carlo de cadena de Markov sin verosimilitud" . Genetics . 182 ( 4): 1207– 1218. doi : 10.1534/genetics.109.102509 . PMC 2728860. PMID 19506307 .
- ↑ Prangle, Dennis; Fearnhead, Paul; Cox, Murray P.; Biggs, Patrick J.; French, Nigel P. (2014). "Selección semiautomática de estadísticas descriptivas para la elección de modelos ABC". Stat Appl Genet Mol Biol . 13 (1): 67– 82. arXiv : 1302.5624 . doi : 10.1515/sagmb-2013-0012 . PMID 24323893 .
- ↑ Hoffmann, Till; Onnela, Jukka-Pekka (2026). "Unifying Summary Statistic Selection for Approximate Bayesian Computation" . Statistics and Computing . 36 : 70. doi : 10.1007/s11222-025-10808-2 . PMC 12847231 .
- 1 2 Marjoram, P; Molitor, J; Plagnol, V; Tavare, S (2003). "Cadena de Markov Monte Carlo sin verosimilitudes" . Proc Natl Acad Sci USA . 100 (26): 15324– 15328. Bibcode : 2003PNAS..10015324M . doi : 10.1073/pnas.0306899100 . PMC 307566. PMID 14663152 .
- ↑ Marin, J. -M.; Pillai, N.; Robert, CP; Rousseau, J. (2011). "Estadísticas relevantes para la elección de modelos bayesianos". arXiv : 1110.4700 [ math.ST ].
- ↑ Toni, T; Welch, D; Strelkowa, N; Ipsen, A; Stumpf, M (2007). "Esquema aproximado de cálculo bayesiano para inferencia de parámetros y selección de modelos en sistemas dinámicos" . JR Soc Interface . 6 (31): 187– 202. doi : 10.1098/rsif.2008.0172 . PMC 2658655. PMID 19205079 .
- ↑ Arlot, S; Celisse, A (2010). "Una revisión de los procedimientos de validación cruzada para la selección de modelos". Statistics Surveys . 4 : 40–79 . arXiv : 0907.4728 . doi : 10.1214/09-ss054 . S2CID 14332192 .
- ↑ Dawid, A. "Situación actual y desarrollos potenciales: algunas opiniones personales: teoría estadística: el enfoque presecuencial". Journal of the Royal Statistical Society, Serie A. 1984 : 278–292 .
- ↑ Vehtari, A; Lampinen, J (2002). "Evaluación y comparación de modelos bayesianos mediante densidades predictivas de validación cruzada". Neural Computation . 14 (10): 2439– 2468. Bibcode : 2002NeCom..14.2439V . CiteSeerX 10.1.1.16.3206 . doi : 10.1162/08997660260293292 . PMID 12396570 . S2CID 366285 .
- 1 2 Ratmann, O; Andrieu, C; Wiuf, C; Richardson, S (2009). "Crítica de modelos basada en inferencia libre de verosimilitud, con una aplicación a la evolución de redes de proteínas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 106 ( 26): 10576– 10581. Bibcode : 2009PNAS..10610576R . doi : 10.1073/pnas.0807882106 . PMC 2695753. PMID 19525398 .
- 1 2 Francois, O; Laval, G (2011). "Criterios de información de desviación para la selección de modelos en computación bayesiana aproximada". Stat Appl Genet Mol Biol . 10 : Artículo 33. arXiv : 1105.0269 . Bibcode : 2011arXiv1105.0269F . doi : 10.2202/1544-6115.1678 . S2CID 11143942 .
- ↑ Templeton, AR (2010). "Inferencia coherente e incoherente en filogeografía y evolución humana" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 107 ( 14): 6376– 6381. Bibcode : 2010PNAS..107.6376T . doi : 10.1073/pnas.0910647107 . PMC 2851988. PMID 20308555 .
- 1 2 Beaumont, MA; Nielsen, R; Robert, C; Hey, J; Gaggiotti, O; et al. (2010). " En defensa de la inferencia basada en modelos en filogeografía" . Molecular Ecology . 19 (3): 436– 446. Bibcode : 2010MolEc..19..436B . doi : 10.1111/j.1365-294x.2009.04515.x . PMC 5743441. PMID 29284924 .
- ↑ Jaynes ET (1968) Probabilidades a priori. IEEE Transactions on Systems Science and Cybernetics 4.
- ↑ Berger, JO (2006). "El caso del análisis bayesiano objetivo" . Análisis bayesiano . 1 (páginas 385–402 y 457–464): 385–402 . doi : 10.1214/06-BA115 .
- ↑ Beaumont, MA; Cornuet, JM; Marin, JM; Robert, CP (2009). "Computación bayesiana aproximada adaptativa". Biometrika . 96 (4): 983– 990. arXiv : 0805.2256 . doi : 10.1093/biomet/asp052 . S2CID 16579245 .
- ↑ Del Moral P, Doucet A, Jasra A (2011) Un método adaptativo secuencial de Monte Carlo para computación bayesiana aproximada. Estadística y computación.
- ↑ Feng, X; Buell, DA; Rose, JR; Waddellb, PJ (2003). "Algoritmos paralelos para inferencia filogenética bayesiana". Journal of Parallel and Distributed Computing . 63 ( 7–8 ): 707–718 . CiteSeerX 10.1.1.109.7764 . doi : 10.1016/s0743-7315(03)00079-0 .
- ↑ Bellman R (1961) Procesos de control adaptativo: una visita guiada: Princeton University Press.
- 1 2 Blum MGB (2010) Computación bayesiana aproximada: una perspectiva no paramétrica, Journal of the American Statistical Association (105): 1178-1187
- 1 2 Fearnhead, P; Prangle, D (2012). "Construcción de estadísticas descriptivas para el cálculo bayesiano aproximado: cálculo bayesiano aproximado semiautomático". Journal of the Royal Statistical Society, Serie B . 74 (3): 419– 474. CiteSeerX 10.1.1.760.7753 . doi : 10.1111/j.1467-9868.2011.01010.x . S2CID 53861241 .
- ↑ Gerstner, T; Griebel, M (2003). "Cuadrícula de producto tensorial adaptativa a la dimensión". Computing . 71 : 65– 87. CiteSeerX 10.1.1.16.2434 . doi : 10.1007/s00607-003-0015-5 . S2CID 16184111 .
- ↑ Singer, AB; Taylor, JW; Barton, PI; Green, WH (2006). "Optimización dinámica global para la estimación de parámetros en cinética química". J Phys Chem A . 110 (3): 971– 976. Bibcode : 2006JPCA..110..971S . doi : 10.1021/jp0548873 . PMID 16419997 .
- ↑ Cárdenas, IC (2019). "Sobre el uso de redes bayesianas como un enfoque de metamodelado para analizar incertidumbres en el análisis de estabilidad de taludes". Georisk: Evaluación y gestión de riesgos para sistemas de ingeniería y geopeligros . 13 (1): 53– 65. Bibcode : 2019GAMRE..13...53C . doi : 10.1080/17499518.2018.1498524 . S2CID 216590427 .
- ↑ Klinger, E.; Rickert, D.; Hasenauer, J. (2017). pyABC: inferencia distribuida sin verosimilitud.
- ↑ Salvatier, John; Wiecki, Thomas V.; Fonnesbeck, Christopher (2016). "Programación probabilística en Python usando PyMC3" . PeerJ Computer Science . 2 e55. arXiv : 1507.08050 . doi : 10.7717/peerj-cs.55 .
- ↑ Cornuet, JM; Santos, F; Beaumont, M; et al. (2008). "Inferir la historia de la población con DIY ABC: un enfoque fácil de usar para la computación bayesiana aproximada" . Bioinformatics . 24 ( 23): 2713– 2719. doi : 10.1093/bioinformatics/btn514 . PMC 2639274. PMID 18842597 .
- ↑ Csilléry, K; François, O; Blum, MGB (2012). "abc: un paquete de R para computación bayesiana aproximada (ABC)". Methods in Ecology and Evolution . 3 (3): 475– 479. arXiv : 1106.2793 . Bibcode : 2012MEcEv...3..475C . doi : 10.1111/j.2041-210x.2011.00179.x . S2CID 16679366 .
- ↑ Csillery, K; Francois, O; Blum, MGB (21 de febrero de 2012). "Computación bayesiana aproximada (ABC) en R: una viñeta" (PDF) . Recuperado el 10 de mayo de 2013 .
- ↑ Jabot, F; Faure, T; Dumoulin, N (2013). "EasyABC: realización de esquemas de muestreo de computación bayesiana aproximada eficientes utilizando R." Methods in Ecology and Evolution . 4 (7): 684– 687. Bibcode : 2013MEcEv...4..684J . doi : 10.1111/2041-210X.12050 .
- ↑ Jabot, F; Faure, T; Dumoulin, N (2013-06-03). "EasyABC: una viñeta" (PDF) . Archivado del original (PDF) el 18-08-2016 . Recuperado el 19-07-2016 .
- ↑ Liepe, J; Barnes, C; Cule, E; Erguler, K; Kirk, P; Toni, T; Stumpf, MP (2010). " ABC-SysBio: computación bayesiana aproximada en Python con soporte para GPU" . Bioinformatics . 26 (14): 1797–1799 . doi : 10.1093/bioinformatics/btq278 . PMC 2894518. PMID 20591907 .
- ↑ Wegmann, D; Leuenberger, C; Neuenschwander, S; Excoffier, L (2010). "ABCtoolbox: un conjunto de herramientas versátil para cálculos bayesianos aproximados" . BMC Bioinformatics . 11 116. doi : 10.1186/1471-2105-11-116 . PMC 2848233. PMID 20202215 .
- ↑ Hickerson, MJ; Stahl, E; Takebayashi, N (2007). "msBayes: Pipeline para probar historias filogeográficas comparativas usando computación bayesiana aproximada jerárquica" . BMC Bioinformatics . 8 (268): 1471– 2105. doi : 10.1186/1471-2105-8-268 . PMC 1949838. PMID 17655753 .
- ↑ Lopes, JS; Balding, D; Beaumont, MA (2009). "PopABC: un programa para inferir parámetros demográficos históricos". Bioinformatics . 25 (20): 2747– 2749. doi : 10.1093/bioinformatics/btp487 . PMID 19679678 .
- ↑ Tallmon, DA; Koyuk, A; Luikart, G; Beaumont, MA (2008). "PROGRAMAS INFORMÁTICOS: onesamp: un programa para estimar el tamaño efectivo de la población mediante computación bayesiana aproximada". Molecular Ecology Resources . 8 (2): 299– 301. Bibcode : 2008MolER...8..299T . doi : 10.1111/j.1471-8286.2007.01997.x . PMID 21585773 . S2CID 9848290 .
- ↑ Foll, M; Baumont, MA; Gaggiotti, OE (2008). "Un enfoque de computación bayesiana aproximada para superar los sesgos que surgen al usar marcadores AFLP para estudiar la estructura de la población" . Genetics . 179 ( 2): 927– 939. doi : 10.1534/genetics.107.084541 . PMC 2429886. PMID 18505879 .
- ↑ Bray, TC; Sousa, VC; Parreira, B; Bruford, MW; Chikhi, L (2010). "2BAD: una aplicación para estimar las contribuciones parentales durante dos eventos de mezcla independientes". Molecular Ecology Resources . 10 (3): 538– 541. Bibcode : 2010MolER..10..538B . doi : 10.1111/j.1755-0998.2009.02766.x . hdl : 10400.7/205 . PMID 21565053 . S2CID 6528668 .
- ↑ Kangasrääsiö, Antti; Lintusaari, Jarno; Skytén, Kusti; Järvenpää, Marko; Vuollekoski, Henri; Gutmann, Michael; Vehtari, Aki; Corander, Jukka; Kaski, Samuel (2016). "ELFI: motor para inferencias sin probabilidades" (PDF) . Taller NIPS 2016 sobre avances en inferencia bayesiana aproximada . arXiv : 1708.00707 . Código Bib : 2017arXiv170800707L .
- ↑ Dutta, R; Schoengens, M; Pacchiardi, L; Ummadisingu, A; Widmer, N; Onnela, JP; Mira, A (2021). "ABCpy: Una perspectiva de computación de alto rendimiento para la computación bayesiana aproximada" . Journal of Statistical Software . 100 (7). arXiv : 1711.04694 . doi : 10.18637/jss.v100.i07 . S2CID 88516340 .
Enlaces externos
- Darren Wilkinson (31 de marzo de 2013). "Introducción a la computación bayesiana aproximada" . Recuperado el 31 de marzo de 2013 .
- Rasmus Bååth (20 de octubre de 2014). "Datos diminutos, computación bayesiana aproximada y los calcetines de Karl Broman" . Recuperado el 22 de enero de 2015 .
- Artículos de Wikipedia publicados en literatura revisada por pares
- Artículos de Wikipedia publicados en PLOS Computational Biology
- Artículos revisados por pares externos
- Artículos de Wikipedia publicados en literatura revisada por pares (J2W)
- estadística bayesiana
- Aproximaciones estadísticas