Articulo de referencia

red bayesiana

Una red bayesiana (también conocida como red de Bayes , red bayesiana , red de creencias o red de decisión ) es un modelo gráfico probabilístico que representa un conjunto de va...

Una red bayesiana (también conocida como red de Bayes , red bayesiana , red de creencias o red de decisión ) es un modelo gráfico probabilístico que representa un conjunto de variables y sus dependencias condicionales mediante un grafo acíclico dirigido (DAG). [ 1 ] Si bien es una de las diversas formas de notación causal , las redes causales son casos especiales de redes bayesianas. Las redes bayesianas son ideales para tomar un evento ocurrido y predecir la probabilidad de que cualquiera de varias posibles causas conocidas haya sido el factor contribuyente. Por ejemplo, una red bayesiana podría representar las relaciones probabilísticas entre enfermedades y síntomas. Dados los síntomas, la red puede usarse para calcular las probabilidades de la presencia de diversas enfermedades.

Los algoritmos eficientes pueden realizar inferencias y aprendizaje en redes bayesianas. Las redes bayesianas que modelan secuencias de variables ( por ejemplo , señales de voz o secuencias de proteínas ) se denominan redes bayesianas dinámicas . Las generalizaciones de las redes bayesianas que pueden representar y resolver problemas de decisión en condiciones de incertidumbre se denominan diagramas de influencia .

Modelo gráfico

Formalmente, las redes bayesianas son grafos acíclicos dirigidos (DAG) cuyos nodos representan variables en el sentido bayesiano : pueden ser cantidades observables, variables latentes , parámetros desconocidos o hipótesis. Cada arista representa una dependencia condicional directa. Cualquier par de nodos que no estén conectados (es decir, que no haya una ruta que conecte un nodo con el otro) representan variables que son condicionalmente independientes entre sí. Cada nodo está asociado con una función de probabilidad que toma, como entrada, un conjunto particular de valores para las variables padre del nodo y da (como salida) la probabilidad (o distribución de probabilidad, si corresponde) de la variable representada por el nodo. Por ejemplo, simetro{\displaystyle m}Los nodos padres representanmetro{\displaystyle m}Variables booleanas , entonces la función de probabilidad podría representarse mediante una tabla de2metro{\displaystyle 2^{m}}entradas, una entrada para cada uno de los2metro{\displaystyle 2^{m}}posibles combinaciones de padres. Se pueden aplicar ideas similares a grafos no dirigidos y posiblemente cíclicos, como las redes de Markov .

Ejemplo

Una red bayesiana simple con tablas de probabilidad condicional

Supongamos que queremos modelar las dependencias entre tres variables: el aspersor (o, más precisamente, su estado: si está encendido o apagado), la presencia o ausencia de lluvia y si el césped está mojado o no. Observemos que dos eventos pueden provocar que el césped se moje: un aspersor activo o la lluvia. La lluvia tiene un efecto directo en el uso del aspersor (es decir, cuando llueve, el aspersor generalmente no está activo). Esta situación se puede modelar con una red bayesiana (que se muestra a la derecha). Cada variable tiene dos valores posibles: V (verdadero) y F (falso).

La función de probabilidad conjunta es, por la regla de la cadena de probabilidad ,

Pr(GRAMO,S,R)=Pr(GRAMOS,R)Pr(SR)Pr(R){\displaystyle \Pr(G,S,R)=\Pr(G\mid S,R)\Pr(S\mid R)\Pr(R)}

donde G = "Césped mojado (verdadero/falso)", S = "Aspersor encendido (verdadero/falso)" y R = "Llueve (verdadero/falso)".

El modelo puede responder preguntas sobre la presencia de una causa dada la presencia de un efecto (la llamada probabilidad inversa), como "¿Cuál es la probabilidad de que esté lloviendo, dado que el césped está mojado?", utilizando la fórmula de probabilidad condicional y sumando sobre todas las variables de perturbación :

Pr(R=TGRAMO=T)=Pr(GRAMO=T,R=T)Pr(GRAMO=T)=incógnita{T,F}Pr(GRAMO=T,S=incógnita,R=T)incógnita,y{T,F}Pr(GRAMO=T,S=incógnita,R=y){\displaystyle \Pr(R=T\mid G=T)={\frac {\Pr(G=T,R=T)}{\Pr(G=T)}}={\frac {\sum _{x\in \{T,F\}}\Pr(G=T,S=x,R=T)}{\sum _{x,y\in \{T,F\}}\Pr(G=T,S=x,R=y)}}}

Utilizando la expansión para la función de probabilidad conjuntaPr(GRAMO,S,R){\displaystyle \Pr(G,S,R)}y las probabilidades condicionales de las tablas de probabilidad condicional (TPC) indicadas en el diagrama, se puede evaluar cada término en las sumas del numerador y el denominador. Por ejemplo,

Pr(GRAMO=T,S=T,R=T)=Pr(GRAMO=TS=T,R=T)Pr(S=TR=T)Pr(R=T)=0,99×0,01×0,2=0,00198.{\displaystyle {\begin{aligned}\Pr(G=T,S=T,R=T)&=\Pr(G=T\mid S=T,R=T)\Pr(S=T\mid R=T)\Pr(R=T)\\&=0.99\times 0.01\times 0.2\\&=0.00198.\end{aligned}}}

Luego, los resultados numéricos (con subíndices de los valores de las variables asociadas) son:

Pr(R=TGRAMO=T)=0,00198TTT+0,1584TFT0,00198TTT+0,288TTF+0,1584TFT+0.0TFF=891249135,77%.{\displaystyle \Pr(R=T\mid G=T)={\frac {0.00198_{TTT}+0.1584_{TFT}}{0.00198_{TTT}+0.288_{TTF}+0.1584_{TFT}+0.0_{TFF}}}={\frac {891}{2491}}\approx 35.77\%.}

Para responder a una pregunta de intervención, como "¿Cuál es la probabilidad de que llueva, dado que regamos el césped?", la respuesta está regida por la función de distribución conjunta posterior a la intervención.

Pr(S,Rhacer(GRAMO=T))=Pr(SR)Pr(R){\displaystyle \Pr(S,R\mid {\text{do}}(G=T))=\Pr(S\mid R)\Pr(R)}

obtenido al eliminar el factorPr(GRAMOS,R){\displaystyle \Pr(G\mid S,R)}de la distribución previa a la intervención. El operador do fuerza que el valor de G sea verdadero. La probabilidad de lluvia no se ve afectada por la acción:

Pr(Rhacer(GRAMO=T))=Pr(R).{\displaystyle \Pr(R\mid {\text{do}}(G=T))=\Pr(R).}

Para predecir el impacto de encender el aspersor:

Pr(R,GRAMOhacer(S=T))=Pr(R)Pr(GRAMOR,S=T){\displaystyle \Pr(R,G\mid {\text{do}}(S=T))=\Pr(R)\Pr(G\mid R,S=T)}

con el términoPr(S=TR){\displaystyle \Pr(S=T\mid R)}Se eliminó, lo que demuestra que la acción afecta al césped pero no a la lluvia.

Estas predicciones pueden no ser factibles dadas las variables no observadas, como en la mayoría de los problemas de evaluación de políticas. El efecto de la acciónhacer(incógnita){\displaystyle {\text{do}}(x)}Sin embargo, aún se puede predecir siempre que se cumpla el criterio de puerta trasera. [ 2 ] [ 3 ] Afirma que, si se puede observar un conjunto Z de nodos que separa d [ 4 ] (o bloquea) todos los caminos de puerta trasera de X a Y , entonces

Pr(Y,Zhacer(incógnita))=Pr(Y,Z,incógnita=incógnita)Pr(incógnita=incógnitaZ).{\displaystyle \Pr(Y,Z\mid {\text{do}}(x))={\frac {\Pr(Y,Z,X=x)}{\Pr(X=x\mid Z)}}.}

Un camino de puerta trasera es aquel que termina con una flecha hacia X. Los conjuntos que satisfacen el criterio de puerta trasera se denominan "suficientes" o "admisibles". Por ejemplo, el conjunto Z  = R es admisible para predecir el efecto de S = T sobre G , porque R separa d el (único) camino de puerta trasera SRG. Sin embargo, si S no se observa, ningún otro conjunto separa d este camino y el efecto de encender el aspersor ( S = T ) sobre el césped ( G ) no se puede predecir a partir de observaciones pasivas. En ese caso, P ( G | do( S = T )) no está "identificado". Esto refleja el hecho de que, al carecer de datos de intervención, la dependencia observada entre S y G se debe a una conexión causal o es espuria (dependencia aparente que surge de una causa común, R ). (véase la paradoja de Simpson ) .             

Para determinar si se identifica una relación causal a partir de una red bayesiana arbitraria con variables no observadas, se pueden utilizar las tres reglas del " cálculo do " [ 2 ] [ 5 ] y comprobar si todos los términos do se pueden eliminar de la expresión de esa relación, confirmando así que la cantidad deseada es estimable a partir de datos de frecuencia. [ 6 ]

El uso de una red bayesiana puede ahorrar cantidades considerables de memoria en comparación con tablas de probabilidad exhaustivas, si las dependencias en la distribución conjunta son escasas. Por ejemplo, una forma ingenua de almacenar las probabilidades condicionales de 10 variables de dos valores como una tabla requiere espacio de almacenamiento para210=1024{\displaystyle 2^{10}=1024}valores. Si la distribución local de ninguna variable depende de más de tres variables principales, la representación de la red bayesiana almacena como máximo1023=80{\displaystyle 10\cdot 2^{3}=80}valores.

Una ventaja de las redes bayesianas es que resulta intuitivamente más fácil para un ser humano comprender (un conjunto reducido de) dependencias directas y distribuciones locales que las distribuciones conjuntas completas.

Inferencia y aprendizaje

Las redes bayesianas realizan tres tareas de inferencia principales:

  1. Inferir variables no observadas
  2. Aprendizaje de parámetros para las distribuciones de probabilidad de cada nodo en la red.
  3. Aprendizaje de la estructura de la red gráfica

Inferir variables no observadas

Dado que una red bayesiana constituye un modelo completo para sus variables y sus relaciones, puede utilizarse para responder a consultas probabilísticas sobre ellas. Por ejemplo, la red puede emplearse para actualizar el conocimiento del estado de un subconjunto de variables cuando se observan otras variables (las variables de evidencia ). Este proceso de cálculo de la distribución posterior de las variables, dada la evidencia, se denomina inferencia probabilística. La distribución posterior proporciona una estadística suficiente universal para aplicaciones de detección, al elegir valores para el subconjunto de variables que minimicen alguna función de pérdida esperada, como la probabilidad de error de decisión. Por lo tanto, una red bayesiana puede considerarse un mecanismo para aplicar automáticamente el teorema de Bayes a problemas complejos.

Los métodos de inferencia exacta más comunes son: eliminación de variables , que elimina (por integración o suma) las variables no observadas no consultadas una por una distribuyendo la suma sobre el producto; propagación de árbol de clique , que almacena en caché el cálculo para que se puedan consultar muchas variables a la vez y se pueda propagar nueva evidencia rápidamente; y condicionamiento recursivo y búsqueda AND/OR, que permiten un intercambio espacio-tiempo y coinciden con la eficiencia de la eliminación de variables cuando se utiliza suficiente espacio. Todos estos métodos tienen una complejidad que es exponencial en el ancho del árbol de la red . Los algoritmos de inferencia aproximada más comunes son muestreo de importancia , simulación MCMC estocástica , eliminación de minicubetas, propagación de creencias en bucle , propagación de creencias generalizada y métodos variacionales .

Aprendizaje de parámetros

Para especificar completamente la red bayesiana y, por lo tanto, representar completamente la distribución de probabilidad conjunta , es necesario especificar para cada nodo X la distribución de probabilidad de X condicionada a sus padres . La distribución de X condicionada a sus padres puede tener cualquier forma. Es común trabajar con distribuciones discretas o gaussianas , ya que esto simplifica los cálculos. A veces, solo se conocen las restricciones de la distribución; entonces se puede usar el principio de máxima entropía para determinar una única distribución, aquella con la mayor entropía dadas las restricciones. (Análogamente, en el contexto específico de una red bayesiana dinámica , la distribución condicional para la evolución temporal del estado oculto se especifica comúnmente para maximizar la tasa de entropía del proceso estocástico implícito).

A menudo, estas distribuciones condicionales incluyen parámetros desconocidos que deben estimarse a partir de datos, por ejemplo, mediante el método de máxima verosimilitud . La maximización directa de la verosimilitud (o de la probabilidad posterior ) suele ser compleja debido a variables no observadas. Un enfoque clásico para este problema es el algoritmo de expectativa-maximización , que alterna el cálculo de los valores esperados de las variables no observadas, condicionados a los datos observados, con la maximización de la verosimilitud completa (o posterior), suponiendo que los valores esperados calculados previamente son correctos. Bajo condiciones de regularidad leves, este proceso converge hacia los valores de máxima verosimilitud (o máxima posterior) para los parámetros.

Un enfoque bayesiano más completo para los parámetros consiste en tratarlos como variables adicionales no observadas y calcular una distribución posterior completa sobre todos los nodos condicionada a los datos observados, para luego integrar los parámetros. Este enfoque puede ser costoso y generar modelos de gran dimensión, lo que hace que los métodos clásicos de ajuste de parámetros sean más manejables.

Estructurar el aprendizaje

En el caso más sencillo, un experto define una red bayesiana que luego se utiliza para realizar inferencias. En otras aplicaciones, la tarea de definir la red es demasiado compleja para los humanos. En este caso, la estructura de la red y los parámetros de las distribuciones locales deben aprenderse a partir de los datos.

Aprender automáticamente la estructura gráfica de una red bayesiana (BN) es un desafío que se persigue dentro del aprendizaje automático . La idea básica se remonta a un algoritmo de recuperación desarrollado por Rebane y Pearl [ 7 ] y se basa en la distinción entre los tres patrones posibles permitidos en un DAG de 3 nodos:

Los dos primeros representan las mismas dependencias (incógnita{\displaystyle X}yZ{\displaystyle Z}son independientes dadoY{\displaystyle Y}) y son, por lo tanto, indistinguibles. Sin embargo, el colisionador puede identificarse de forma única, ya queincógnita{\displaystyle X}yZ{\displaystyle Z}son marginalmente independientes y todos los demás pares son dependientes. Por lo tanto, si bien los esqueletos (los gráficos despojados de flechas) de estas tres ternas son idénticos, la direccionalidad de las flechas es parcialmente identificable. La misma distinción se aplica cuandoincógnita{\displaystyle X}yZ{\displaystyle Z}tienen padres comunes, excepto que primero se debe condicionar sobre esos padres. Se han desarrollado algoritmos para determinar sistemáticamente el esqueleto del grafo subyacente y, luego, orientar todas las flechas cuya direccionalidad está dictada por las independencias condicionales observadas. [ 2 ] [ 8 ] [ 9 ] [ 10 ]

Un método alternativo de aprendizaje estructural utiliza una búsqueda basada en optimización. Requiere una función de puntuación y una estrategia de búsqueda. Una función de puntuación común es la probabilidad posterior de la estructura dados los datos de entrenamiento, como el BIC o el BDeu. El tiempo requerido para una búsqueda exhaustiva que devuelva una estructura que maximice la puntuación es superexponencial en el número de variables. Una estrategia de búsqueda local realiza cambios incrementales destinados a mejorar la puntuación de la estructura. Un algoritmo de búsqueda global como el Monte Carlo de cadena de Markov (MCMC) puede evitar quedar atrapado en mínimos locales . Encontrar una estructura que maximice la información mutua , típicamente restringiendo el conjunto de candidatos padres a k nodos [ 11 ] [ 12 ] [ 13 ] o encontrando un k óptimo en una base de nodo por nodo, [ 14 ] es una técnica que logra consistentemente puntuaciones altas en conjuntos de datos de referencia.

Un método particularmente rápido para el aprendizaje exacto de BN consiste en plantear el problema como un problema de optimización y resolverlo mediante programación entera . Durante la resolución, se añaden restricciones de aciclicidad al programa entero (PI) en forma de planos de corte . [ 15 ] Este método puede manejar problemas con hasta 100 variables.

Para abordar problemas con miles de variables, se requiere un enfoque diferente. Uno de ellos consiste en muestrear primero un ordenamiento y luego encontrar la estructura BN óptima con respecto a ese ordenamiento. Esto implica trabajar en el espacio de búsqueda de los posibles ordenamientos, lo cual resulta conveniente ya que es menor que el espacio de estructuras de red. Posteriormente, se muestrean y evalúan múltiples ordenamientos. Este método ha demostrado ser el mejor disponible en la literatura cuando el número de variables es muy grande. [ 16 ]

Otro método consiste en centrarse en la subclase de modelos descomponibles, para los cuales el MLE tiene una forma cerrada. Entonces es posible descubrir una estructura consistente para cientos de variables. [ 17 ]

El aprendizaje de redes bayesianas con ancho de árbol limitado es necesario para permitir una inferencia exacta y manejable, ya que la complejidad de la inferencia en el peor de los casos es exponencial en el ancho de árbol k (bajo la hipótesis del tiempo exponencial). Sin embargo, como propiedad global del grafo, aumenta considerablemente la dificultad del proceso de aprendizaje. En este contexto, es posible utilizar K-trees para un aprendizaje efectivo. [ 18 ]

Introducción a la estadística

Datos proporcionadosincógnita{\displaystyle x\,\!}y parámetroθ{\displaystyle \theta }, un análisis bayesiano simple comienza con una probabilidad a priori ( prior )pag(θ){\displaystyle p(\theta )}y probabilidadpag(incógnitaθ){\displaystyle p(x\mid \theta )}para calcular una probabilidad posteriorpag(θincógnita)pag(incógnitaθ)pag(θ){\displaystyle p(\theta \mid x)\propto p(x\mid \theta )p(\theta )}.

A menudo el anterior enθ{\displaystyle \theta }depende a su vez de otros parámetrosφ{\displaystyle \varphi }que no se mencionan en la probabilidad. Por lo tanto, el anteriorpag(θ){\displaystyle p(\theta )}debe ser reemplazado por una probabilidadpag(θφ){\displaystyle p(\theta \mid \varphi )}y un anteriorpag(φ){\displaystyle p(\varphi )}sobre los parámetros recientemente introducidosφ{\displaystyle \varphi }es necesario, lo que resulta en una probabilidad posterior

pag(θ,φincógnita)pag(incógnitaθ)pag(θφ)pag(φ).{\displaystyle p(\theta ,\varphi \mid x)\propto p(x\mid \theta )p(\theta \mid \varphi )p(\varphi ).}

Este es el ejemplo más simple de un modelo bayesiano jerárquico .

El proceso puede repetirse; por ejemplo, los parámetrosφ{\displaystyle \varphi }puede depender a su vez de parámetros adicionalesψ{\displaystyle \psi \,\!}, que requieren su propio prior. Finalmente, el proceso debe terminar, con priors que no dependan de parámetros no mencionados.

Ejemplos introductorios

Dadas las cantidades medidasincógnita1,,incógnitanorte{\displaystyle x_{1},\dots ,x_{n}\,\!}cada uno con errores distribuidos normalmente de desviación estándar conocidaσ{\displaystyle \sigma \,\!},

incógnitainorte(θi,σ2){\displaystyle x_{i}\sim N(\theta _{i},\sigma ^{2})}

Supongamos que estamos interesados ​​en estimar laθi{\displaystyle \theta _{i}}. Un enfoque sería estimar elθi{\displaystyle \theta _{i}}utilizando un enfoque de máxima verosimilitud ; dado que las observaciones son independientes, la verosimilitud se factoriza y la estimación de máxima verosimilitud es simplemente

θi=incógnitai.{\displaystyle \theta _{i}=x_{i}.}

Sin embargo, si las cantidades están relacionadas, de modo que, por ejemplo, el individuoθi{\displaystyle \theta _{i}}Si se han extraído ellos mismos de una distribución subyacente, entonces esta relación destruye la independencia y sugiere un modelo más complejo, por ejemplo,

incógnitainorte(θi,σ2),{\displaystyle x_{i}\sim N(\theta _{i},\sigma ^{2}),}
θinorte(φ,τ2),{\displaystyle \theta _{i}\sim N(\varphi ,\tau ^{2}),}

con antecedentes impropiosφdepartamento{\displaystyle \varphi \sim {\text{flat}}},τdepartamento(0,){\displaystyle \tau \sim {\text{flat}}\in (0,\infty )}. Cuandonorte3{\displaystyle n\geq 3}, este es un modelo identificado (es decir, existe una solución única para los parámetros del modelo), y las distribuciones posteriores de los individualesθi{\displaystyle \theta _{i}}tenderán a alejarse o contraerse de las estimaciones de máxima verosimilitud hacia su media común. Esta contracción es un comportamiento típico en los modelos bayesianos jerárquicos.

Restricciones sobre los antecedentes

Se necesita cierto cuidado al elegir las distribuciones a priori en un modelo jerárquico, particularmente en variables de escala en niveles superiores de la jerarquía, como la variableτ{\displaystyle \tau \,\!}En el ejemplo, las distribuciones previas habituales, como la distribución previa de Jeffreys , a menudo no funcionan porque la distribución posterior no será normalizable y las estimaciones realizadas minimizando la pérdida esperada serán inadmisibles .

Definiciones y conceptos

Se han ofrecido varias definiciones equivalentes de una red bayesiana. Para lo siguiente, sea G = ( V , E ) un grafo acíclico dirigido (DAG) y sea X = ( X v ), vV un conjunto de variables aleatorias indexadas por V .

Definición de factorización

X es una red bayesiana con respecto a G si su función de densidad de probabilidad conjunta (con respecto a una medida de producto ) puede escribirse como un producto de las funciones de densidad individuales, condicionadas a sus variables parentales: [ 19 ]

pag(incógnita)=vVpag(incógnitav|incógnitaPensilvania(v)){\displaystyle p(x)=\prod _{v\in V}p\left(x_{v}\,{\big |}\,x_{\operatorname {pa} (v)}\right)}

donde pa( v ) es el conjunto de padres de v (es decir, aquellos vértices que apuntan directamente a v a través de una sola arista).

Para cualquier conjunto de variables aleatorias, la probabilidad de cualquier miembro de una distribución conjunta se puede calcular a partir de probabilidades condicionales utilizando la regla de la cadena (dado un orden topológico de X ) de la siguiente manera: [ 19 ]

PAG(incógnita1=incógnita1,,incógnitanorte=incógnitanorte)=v=1nortePAG(incógnitav=incógnitavincógnitav+1=incógnitav+1,,incógnitanorte=incógnitanorte){\displaystyle \operatorname {P} (X_{1}=x_{1},\ldots ,X_{n}=x_{n})=\prod _{v=1}^{n}\operatorname {P} \left(X_{v}=x_{v}\mid X_{v+1}=x_{v+1},\ldots ,X_{n}=x_{n}\right)}

Utilizando la definición anterior, esto se puede escribir como:

PAG(incógnita1=incógnita1,,incógnitanorte=incógnitanorte)=v=1nortePAG(incógnitav=incógnitavincógnitaj=incógnitaj para cada incógnitaj que es un padre de incógnitav){\displaystyle \operatorname {P} (X_{1}=x_{1},\ldots ,X_{n}=x_{n})=\prod _{v=1}^{n}\operatorname {P} (X_{v}=x_{v}\mid X_{j}=x_{j}{\text{ for each }}X_{j}\,{\text{ that is a parent of }}X_{v}\,)}

La diferencia entre las dos expresiones radica en la independencia condicional de las variables respecto de cualquiera de sus no descendientes, dados los valores de sus variables progenitoras.

Propiedad local de Markov

X es una red bayesiana con respecto a G si satisface la propiedad de Markov local : cada variable es condicionalmente independiente de sus no descendientes dadas sus variables progenitoras: [ 20 ]

incógnitavincógnitaVDelaware(v)incógnitaPensilvania(v)a pesar de vV{\displaystyle X_{v}\perp \!\!\!\perp X_{V\,\smallsetminus \,\operatorname {de} (v)}\mid X_{\operatorname {pa} (v)}\quad {\text{for all }}v\in V}

donde de( v ) es el conjunto de descendientes y V  \  de( v ) es el conjunto de no descendientes de v .

Esto puede expresarse en términos similares a la primera definición, como

PAG(incógnitav=incógnitavincógnitai=incógnitai para cada incógnitai que no es descendiente de incógnitav)=PAG(incógnitav=incógnitavincógnitaj=incógnitaj para cada incógnitaj que es un padre de incógnitav){\displaystyle {\begin{aligned}&\operatorname {P} (X_{v}=x_{v}\mid X_{i}=x_{i}{\text{ for each }}X_{i}{\text{ that is not a descendant of }}X_{v}\,)\\[6pt]={}&P(X_{v}=x_{v}\mid X_{j}=x_{j}{\text{ for each }}X_{j}{\text{ that is a parent of }}X_{v}\,)\end{aligned}}}

El conjunto de padres es un subconjunto del conjunto de no descendientes porque el grafo es acíclico .

Estructura de independencia marginal

En general, se sabe que aprender una red bayesiana a partir de datos es NP-difícil . [ 21 ] Esto se debe en parte a la explosión combinatoria de enumerar DAGs a medida que aumenta el número de variables. Sin embargo, se pueden aprender ideas sobre una red bayesiana subyacente a partir de datos en tiempo polinomial centrándose en su estructura de independencia marginal: [ 22 ] mientras que las declaraciones de independencia condicional de una distribución modelada por una red bayesiana están codificadas por un DAG (de acuerdo con la factorización y las propiedades de Markov anteriores), sus declaraciones de independencia marginal —las declaraciones de independencia condicional en las que el conjunto de condicionamiento está vacío— están codificadas por un grafo no dirigido simple con propiedades especiales como intersección igual y números de independencia .

Desarrollo de redes bayesianas

El desarrollo de una red bayesiana suele comenzar con la creación de un DAG G tal que X satisfaga la propiedad de Markov local con respecto a G. A veces, se trata de un DAG causal . Se evalúan las distribuciones de probabilidad condicional de cada variable dadas sus variables progenitoras en G. En muchos casos, en particular cuando las variables son discretas, si la distribución conjunta de X es el producto de estas distribuciones condicionales, entonces X es una red bayesiana con respecto a G. [ 23 ]

manta de Markov

La manta de Markov de un nodo es el conjunto de nodos que incluye a sus padres, sus hijos y cualquier otro padre de sus hijos. La manta de Markov hace que el nodo sea independiente del resto de la red; la distribución conjunta de las variables en la manta de Markov de un nodo es suficiente para calcular la distribución del nodo. X es una red bayesiana con respecto a G si cada nodo es condicionalmente independiente de todos los demás nodos de la red, dada su manta de Markov . [ 20 ]

d -separación

Esta definición puede hacerse más general definiendo la separación "d" de dos nodos, donde d significa direccional. [ 2 ] Primero definimos la separación "d" de un sendero y luego definiremos la separación "d" de dos nodos en términos de eso.

Sea P un camino desde el nodo u hasta el nodo v . Un camino es una ruta sin bucles y no dirigida (es decir, se ignoran todas las direcciones de las aristas) entre dos nodos. Se dice que P está d -separado por un conjunto de nodos Z si se cumple alguna de las siguientes condiciones:

  • P contiene (pero no necesita ser completamente) una cadena dirigida,metrov{\displaystyle u\cdots \leftarrow m\leftarrow \cdots v}ometrov{\displaystyle u\cdots \rightarrow m\rightarrow \cdots v}, de tal manera que el nodo medio m esté en Z ,
  • P contiene un tenedor,metrov{\displaystyle u\cdots \leftarrow m\rightarrow \cdots v}, de tal manera que el nodo medio m esté en Z , o
  • P contiene un tenedor invertido (o colisionador),metrov{\displaystyle u\cdots \rightarrow m\leftarrow \cdots v}, de tal manera que el nodo medio m no está en Z y ningún descendiente de m está en Z.

Los nodos u y v están separados por una distancia d si todos los caminos entre ellos están separados por una distancia d . Si u y v no están separados por una distancia d, están conectados por una distancia d.

X es una red bayesiana con respecto a G si, para cualesquiera dos nodos u , v :

incógnitaincógnitavincógnitaZ{\displaystyle X_{u}\perp \!\!\!\perp X_{v}\mid X_{Z}}

donde Z es un conjunto que separa d a u y v . (La manta de Markov es el conjunto mínimo de nodos que separa d al nodo v de todos los demás nodos).

Redes causales

Aunque las redes bayesianas se utilizan a menudo para representar relaciones causales , esto no tiene por qué ser así: una arista dirigida de u a v no requiere que X v dependa causalmente de X u . Esto se demuestra por el hecho de que las redes bayesianas en los grafos:

abdoyabdo{\displaystyle a\rightarrow b\rightarrow c\qquad {\text{and}}\qquad a\leftarrow b\leftarrow c}

son equivalentes: es decir, imponen exactamente los mismos requisitos de independencia condicional.

Una red causal es una red bayesiana con el requisito de que las relaciones sean causales. La semántica adicional de las redes causales especifica que si un nodo X es provocado activamente a estar en un estado dado x (una acción escrita como do( X  = x )), entonces la función de densidad de probabilidad cambia a la de la red obtenida al cortar los enlaces de los padres de X a X , y establecer X al valor causado x . [ 2 ] Utilizando esta semántica, se puede predecir el impacto de las intervenciones externas a partir de datos obtenidos antes de la intervención. 

Complejidad de inferencia y algoritmos de aproximación

En 1990, mientras trabajaba en la Universidad de Stanford en grandes aplicaciones bioinformáticas, Cooper demostró que la inferencia exacta en redes bayesianas es NP-difícil . [ 24 ] Este resultado impulsó la investigación sobre algoritmos de aproximación con el objetivo de desarrollar una aproximación manejable a la inferencia probabilística. En 1993, Paul Dagum y Michael Luby demostraron dos resultados sorprendentes sobre la complejidad de la aproximación de la inferencia probabilística en redes bayesianas. [ 25 ] Primero, demostraron que ningún algoritmo determinista manejable puede aproximar la inferencia probabilística dentro de un error absoluto ɛ  <  1/2. Segundo, demostraron que ningún algoritmo aleatorio manejable puede aproximar la inferencia probabilística dentro de un error absoluto ɛ  <  1/2 con una probabilidad de confianza mayor que  1/2.

Casi al mismo tiempo, Roth demostró que la inferencia exacta en redes bayesianas es de hecho #P-completa (y por lo tanto tan difícil como contar el número de asignaciones satisfactorias de una fórmula de forma normal conjuntiva (FNC)) y que la inferencia aproximada dentro de un factor 2 n 1− ɛ para cada ɛ > 0, incluso para redes bayesianas con arquitectura restringida, es NP-difícil. [ 26 ] [ 27 ]

En términos prácticos, estos resultados de complejidad sugirieron que, si bien las redes bayesianas eran representaciones ricas para aplicaciones de IA y aprendizaje automático, su uso en aplicaciones reales a gran escala debería atenuarse mediante restricciones estructurales topológicas, como las redes bayesianas ingenuas, o mediante restricciones en las probabilidades condicionales. El algoritmo de varianza acotada [ 28 ] desarrollado por Dagum y Luby fue el primer algoritmo de aproximación rápida demostrable para aproximar eficientemente la inferencia probabilística en redes bayesianas con garantías en la aproximación del error. Este potente algoritmo requería la restricción menor de que las probabilidades condicionales de la red bayesiana estuvieran acotadas lejos de cero y uno por1/pag(norte){\displaystyle 1/p(n)}dóndepag(norte){\displaystyle p(n)}era cualquier polinomio del número de nodos en la red,norte{\displaystyle n}.

Software

Entre los programas informáticos más destacados para redes bayesianas se incluyen:

  • OpenBUGS – Desarrollo de código abierto de WinBUGS.
  • SPSS Modeler : software comercial que incluye una implementación para redes bayesianas.
  • Stan (software) – Stan es un paquete de código abierto para obtener inferencia bayesiana utilizando el muestreador No-U-Turn (NUTS), [ 29 ] una variante del Monte Carlo hamiltoniano.
  • WinBUGS : Una de las primeras implementaciones computacionales de muestreadores MCMC. Ya no recibe mantenimiento.

Historia

El término red bayesiana fue acuñado por Judea Pearl en 1985 para enfatizar: [ 30 ]

  • la naturaleza a menudo subjetiva de la información de entrada
  • la dependencia del condicionamiento bayesiano como base para actualizar la información
  • la distinción entre modos de razonamiento causal y evidencial [ 31 ]

A finales de la década de 1980, el Razonamiento probabilístico en sistemas inteligentes de Pearl [ 32 ] y el Razonamiento probabilístico en sistemas expertos de Neapolitan [ 33 ] resumieron sus propiedades y los establecieron como un campo de estudio.

Véase también

Notas

  1. Ruggeri, Fabrizio; Kenett, Ron S.; Faltin, Frederick W., eds. (14 de diciembre de 2007). Enciclopedia de estadística en calidad y fiabilidad (1.ª  ed.). Wiley. pág.  1. doi : 10.1002/9780470061572.eqr089 . ISBN 978-0-470-01861-3.
  2. 1 2 3 4 5 Pearl, Judea (2000). Causalidad: Modelos, razonamiento e inferencia . Cambridge University Press . ISBN 978-0-521-77362-1OCLC 42291253 
  3. "El criterio de la puerta trasera" (PDF) . Consultado el 18 de septiembre de 2014 .
  4. "d-Separación sin lágrimas" (PDF) . Consultado el 18 de septiembre de 2014 .
  5. Pearl J (1994). "Un cálculo probabilístico de acciones" . En Lopez de Mantaras R, Poole D (eds.). Actas de la décima conferencia internacional sobre incertidumbre en inteligencia artificial UAI'94 . San Mateo, CA: Morgan Kaufmann . pp. 454–462 . arXiv : 1302.6835 . Bibcode : 2013arXiv1302.6835P . ISBN  1-55860-332-8.
  6. Shpitser I, Pearl J (2023). "Identificación de distribuciones de intervención condicional". En Dechter R, Richardson TS (eds.). Perspectivas combinatorias y algebraicas sobre la estructura de independencia marginal de las redes bayesianas . Vol. 14. Corvallis, OR: AUAI Press. pp. 437–444 . arXiv : 1206.6876 . doi : 10.2140/astat.2023.14.233 .  {{cite book}}: |journal=ignorado ( ayuda )
  7. Rebane G, Pearl J (1987). "La recuperación de poliárboles causales a partir de datos estadísticos". Actas del 3er Taller sobre Incertidumbre en IA . Seattle, WA. págs. 222–228 . arXiv : 1304.2736 . {{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  8. Spirtes P, Glymour C (1991). "Un algoritmo para la recuperación rápida de grafos causales dispersos" (PDF) . Social Science Computer Review . 9 (1): 62– 72. CiteSeerX 10.1.1.650.2922 . doi : 10.1177/089443939100900106 . S2CID 38398322 .  
  9. ^ Spirtes P, Glymour CN, Scheines R (1993). Causación, predicción y búsqueda (1ª ed.). Springer-Verlag. ISBN  978-0-387-97979-3.
  10. Verma T, Pearl J (1991). "Equivalencia y síntesis de modelos causales" . En Bonissone P, Henrion M, Kanal LN, Lemmer JF (eds.). UAI '90 Actas de la Sexta Conferencia Anual sobre Incertidumbre en Inteligencia Artificial . Elsevier. pp. 255–270 . ISBN  0-444-89264-8.
  11. Sahami, Mehran (1996-08-02). "Aprendizaje de clasificadores bayesianos de dependencia limitada" . Actas de la Segunda Conferencia Internacional sobre Descubrimiento de Conocimiento y Minería de Datos . KDD'96. Portland, Oregon: AAAI Press: 335–338 .
  12. Friedman N, Geiger D, Goldszmidt M (noviembre de 1997). "Clasificadores de redes bayesianas" . Machine Learning . 29 ( 2–3 ): 131–163 . doi : 10.1023/A:1007465528199 .
  13. Friedman N, Linial M, Nachman I, Pe'er D (agosto de 2000). "Uso de redes bayesianas para analizar datos de expresión". Journal of Computational Biology . 7 ( 3–4 ): 601–20 . CiteSeerX 10.1.1.191.139 . doi : 10.1089/106652700750050961 . PMID 11108481 .  
  14. Rubio, Arcadio; Gámez, José Antonio (12 de julio de 2011). "Aprendizaje flexible de clasificadores de redes bayesianas con k-dependencia" . Actas de la 13.ª conferencia anual sobre computación genética y evolutiva . GECCO '11. Nueva York, NY, EE. UU.: Association for Computing Machinery. pp. 1219–1226 . doi : 10.1145/2001576.2001741 . ISBN  978-1-4503-0557-0.
  15. Cussens J (2011). "Aprendizaje de redes bayesianas con planos de corte" (PDF) . Actas de la 27.ª Conferencia Anual sobre Incertidumbre en Inteligencia Artificial : 153–160 . arXiv : 1202.3713 . Bibcode : 2012arXiv1202.3713C . Archivado del original el 27 de marzo de 2022.
  16. Scanagatta M, de Campos CP, Corani G, Zaffalon M (2015). "Aprendizaje de redes bayesianas con miles de variables" . NIPS-15: Avances en sistemas de procesamiento de información neuronal . Vol. 28. Curran Associates. pp. 1855–1863 .  
  17. Petitjean F, Webb GI, Nicholson AE (2013). Escalado del análisis log-lineal a datos de alta dimensión (PDF) . Conferencia Internacional sobre Minería de Datos. Dallas, TX, EE. UU.: IEEE.
  18. M. Scanagatta, G. Corani, CP de Campos y M. Zaffalon. Aprendizaje de redes bayesianas con ancho de árbol limitado con miles de variables. En NIPS-16: Avances en sistemas de procesamiento de información neuronal 29, 2016.
  19. 1 2 Russell y Norvig 2003 , pág. 496.
  20. 1 2 Russell y Norvig 2003 , pág. 499.
  21. Chickering, David M.; Heckerman, David; Meek, Christopher (2004). "El aprendizaje de redes bayesianas con muestras grandes es NP-difícil" (PDF) . Journal of Machine Learning Research . 5 : 1287–1330 .
  22. Deligeorgaki, Danai; Markham, Alex; Misra, Pratik; Solus, Liam (2023). "Perspectivas combinatorias y algebraicas sobre la estructura de independencia marginal de las redes bayesianas". Algebraic Statistics . 14 (2): 233– 286. arXiv : 2210.00822 . doi : 10.2140/astat.2023.14.233 .
  23. Neapolitan RE (2004). Learning Bayesian networks . Prentice Hall. ISBN 978-0-13-012534-7.
  24. Cooper GF (1990). "La complejidad computacional de la inferencia probabilística mediante redes bayesianas" (PDF) . Inteligencia Artificial . 42 ( 2–3 ): 393–405 . doi : 10.1016/0004-3702(90)90060-d . S2CID 43363498 . 
  25. Dagum P , Luby M (1993). "Aproximar la inferencia probabilística en redes bayesianas de creencias es NP-difícil". Inteligencia Artificial . 60 (1): 141– 153. CiteSeerX 10.1.1.333.1586 . doi : 10.1016/0004-3702(93)90036-b . 
  26. D. Roth, Sobre la dificultad del razonamiento aproximado , IJCAI (1993)
  27. D. Roth, Sobre la dificultad del razonamiento aproximado , Inteligencia Artificial (1996)
  28. Dagum P , Luby M (1997). "Un algoritmo de aproximación óptimo para la inferencia bayesiana" . Inteligencia Artificial . 93 ( 1– 2): 1– 27. CiteSeerX 10.1.1.36.7946 . doi : 10.1016/s0004-3702(97)00013-1 . Archivado del original el 06-07-2017 . Recuperado el 19-12-2015 . 
  29. Hoffman, Matthew D.; Gelman, Andrew (2011). "The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo". arXiv : 1111.4246 [ stat.CO ].
  30. Pearl J (1985). Redes bayesianas: un modelo de memoria autoactivada para el razonamiento basado en evidencias (Informe técnico de la UCLA CSD-850017) . Actas de la 7.ª Conferencia de la Sociedad de Ciencias Cognitivas, Universidad de California, Irvine, CA. págs. 329–334 . Consultado el 1 de mayo de 2009 . 
  31. Bayes T , Price (1763). "Un ensayo para resolver un problema en la doctrina de las probabilidades" . Philosophical Transactions of the Royal Society . 53 : 370– 418. doi : 10.1098/rstl.1763.0053 .
  32. Pearl J (15 de septiembre de 1988). Razonamiento probabilístico en sistemas inteligentes . San Francisco, CA: Morgan Kaufmann . pág. 1988. ISBN  978-1-55860-479-7.
  33. Neapolitan RE (1989). Razonamiento probabilístico en sistemas expertos: teoría y algoritmos . Wiley. ISBN 978-0-471-61840-9.

Referencias

  • Ben Gal I (2007). "Redes bayesianas" (PDF) . En Ruggeri F, Kennett RS, Faltin FW (eds.). Página de soporte . Enciclopedia de estadística en calidad y fiabilidad . John Wiley & Sons . doi : 10.1002/9780470061572.eqr089 . ISBN 978-0-470-01861-3Archivado del original (PDF) el 23-11-2016 . Consultado el 27-08-2007 .
  • Bertsch McGrayne S (2011). La teoría que no quería morir . New Haven: Yale University Press .
  • Borgelt C, Kruse R (marzo de 2002). Modelos gráficos: métodos para el análisis y la minería de datos . Chichester, Reino Unido : Wiley . ISBN 978-0-470-84337-6.
  • Borsuk ME (2008). «Informática ecológica: redes bayesianas». En Jørgensen, Sven Erik , Fath, Brian (eds.). Enciclopedia de Ecología . Elsevier. ISBN 978-0-444-52033-3.
  • Castillo E, Gutiérrez JM, Hadi AS (1997). «Aprendizaje de redes bayesianas». Sistemas expertos y modelos de redes probabilísticas . Monografías en informática. Nueva York: Springer-Verlag . pp. 481–528 . ISBN  978-0-387-94858-4.
  • Comley JW, Dowe DL (junio de 2003). "Redes bayesianas generales y lenguajes asimétricos" . Actas de la 2.ª Conferencia Internacional de Hawái sobre Estadística y Campos Relacionados .
  • Comley JW, Dowe DL (2005). «Longitud mínima del mensaje y redes bayesianas generalizadas con lenguajes asimétricos» . En Grünwald PD, Myung IJ, Pitt MA (eds.). Avances en la longitud mínima de descripción: teoría y aplicaciones . Serie de procesamiento de información neuronal. Cambridge, Massachusetts : Bradford Books ( MIT Press ) (publicado en abril de 2005). pp. 265–294 . ISBN  978-0-262-07262-5.(Este artículo coloca árboles de decisión en nodos internos de redes bayesianas utilizando la longitud mínima del mensaje ( MML ).
  • Darwiche A (2009). Modelado y razonamiento con redes bayesianas . Cambridge University Press . ISBN 978-0-521-88438-9.
  • Dowe, David L. (31 de mayo de 2011). «Modelos gráficos de redes bayesianas híbridas: consistencia estadística, invariancia y unicidad» (PDF) . Filosofía de la estadística . Elsevier. pp. 901–982 . ISBN  978-0-08-093096-1.
  • Fenton N, Neil ME (noviembre de 2007). "Gestión de riesgos en el mundo moderno: aplicaciones de redes bayesianas" (PDF) . Informe de transferencia de conocimiento de la Sociedad Matemática de Londres y la Red de Transferencia de Conocimiento para Matemáticas Industriales . Londres (Inglaterra) : Sociedad Matemática de Londres . Archivado del original (PDF) el 14 de mayo de 2008. Consultado el 29 de octubre de 2008 .
  • Fenton N, Neil ME (23 de julio de 2004). «Combinación de evidencia en el análisis de riesgos mediante redes bayesianas» (PDF) . Boletín del Safety Critical Systems Club . Vol.  13, n.º  4. Newcastle upon Tyne , Inglaterra. págs. 8-13 . Archivado del original (PDF) el 27 de septiembre de 2007. 
  • Gelman A, Carlin JB, Stern HS, Rubin DB (2003). «Parte II: Fundamentos del análisis de datos bayesiano: Cap. 5 Modelos jerárquicos» . Análisis de datos bayesiano . CRC Press . págs.  120–. ISBN 978-1-58488-388-3.
  • Heckerman, David (1 de marzo de 1995). «Tutorial sobre aprendizaje con redes bayesianas» . En Jordan, Michael Irwin (ed.). Aprendizaje en modelos gráficos . Computación adaptativa y aprendizaje automático. Cambridge, Massachusetts : MIT Press (publicado en 1998). pp. 301–354 . ISBN  978-0-262-60032-3Archivado del original el 19 de julio de 2006. Consultado el 15 de septiembre de 2006 .{{cite book}}: CS1 maint: bot: estado de URL original desconocido ( enlace ) :También aparece como Heckerman, David (marzo de 1997). "Redes bayesianas para minería de datos". Minería de datos y descubrimiento de conocimiento . 1 (1): 79– 119. doi : 10.1023/A:1009730122752 . S2CID 6294315 . 
Una versión anterior se publicó en Microsoft Research el 1 de marzo de 1995. El artículo trata sobre el aprendizaje de parámetros y estructuras en redes bayesianas.
  • Jensen FV, Nielsen TD (6 de junio de 2007). Redes bayesianas y grafos de decisión . Serie de Ciencias de la Información y Estadística (2.ª  ed.). Nueva York : Springer-Verlag . ISBN 978-0-387-68281-5.
  • Karimi K, Hamilton HJ (2000). "Encontrando relaciones temporales: redes bayesianas causales vs. C4.5" (PDF) . Duodécimo Simposio Internacional sobre Metodologías para Sistemas Inteligentes .
  • Korb KB, Nicholson AE (diciembre de 2010). Inteligencia artificial bayesiana . CRC Computer Science & Data Analysis (2.ª  ed.). Chapman & Hall ( CRC Press ). doi : 10.1007/s10044-004-0214-5 . ISBN 978-1-58488-387-6. S2CID 22138783 . 
  • Lunn D, Spiegelhalter D, Thomas A, Best N (noviembre de 2009). "El proyecto BUGS: Evolución, crítica y direcciones futuras". Statistics in Medicine . 28 (25): 3049– 67. doi : 10.1002/sim.3680 . PMID 19630097. S2CID 7717482 .  
  • Neil M, Fenton N, Tailor M (agosto de 2005). Greenberg, Michael R. (ed.). "Uso de redes bayesianas para modelar pérdidas operativas esperadas e inesperadas" ( PDF) . Risk Analysis . 25 (4): 963– 72. Bibcode : 2005RiskA..25..963N . doi : 10.1111/j.1539-6924.2005.00641.x . PMID 16268944. S2CID 3254505 .  
  • Pearl J (septiembre de 1986). "Fusión, propagación y estructuración en redes de creencias". Inteligencia Artificial . 29 (3): 241– 288. doi : 10.1016/0004-3702(86)90072-X .
  • Pearl J (1988). Razonamiento probabilístico en sistemas inteligentes: redes de inferencia plausible . Serie Representación y razonamiento (2.ª edición  ). San Francisco, California : Morgan Kaufmann . ISBN 978-0-934613-73-6.
  • Pearl J , Russell S (noviembre de 2002). «Redes bayesianas». En Arbib MA (ed.). Manual de teoría cerebral y redes neuronales . Cambridge, Massachusetts : Bradford Books ( MIT Press ). págs. 157-160 . ISBN  978-0-262-01197-6.
  • Russell, Stuart J.; Norvig , Peter (2003), Inteligencia artificial: un enfoque moderno (2.ª  ed.), Upper Saddle River, Nueva Jersey: Prentice Hall, ISBN 0-13-790395-2.
  • Zhang NL, Poole D (mayo de 1994). "Un enfoque simple para los cálculos de redes bayesianas" (PDF) . Actas de la Décima Conferencia Bienal Canadiense de Inteligencia Artificial (AI-94). : 171– 178.Este artículo presenta la eliminación de variables para redes de creencias.

Lecturas adicionales

  • Conrady S, Jouffe L (1 de julio de 2015). Redes bayesianas y BayesiaLab: una introducción práctica para investigadores . Franklin, Tennessee: Bayesian USA. ISBN 978-0-9965333-0-0.
  • Charniak E (Invierno de 1991). "Redes bayesianas sin lágrimas" (PDF) . Revista AI .
  • Kruse R, Borgelt C, Klawonn F, Moewes C, Steinbrecher M, Held P (2013). Inteligencia computacional Una introducción metodológica . Londres: Springer-Verlag. ISBN 978-1-4471-5012-1.
  • Borgelt C, Steinbrecher M, Kruse R (2009). Modelos gráficos: representaciones para el aprendizaje, el razonamiento y la minería de datos (Segunda  edición). Chichester: Wiley. ISBN 978-0-470-74956-2.
  • Introducción a las redes bayesianas y sus aplicaciones contemporáneas.
  • Tutorial en línea sobre redes bayesianas y probabilidad.
  • Aplicación web para crear redes bayesianas y ejecutarlas mediante el método de Monte Carlo.
  • Redes bayesianas de tiempo continuo
  • Redes bayesianas: explicación y analogía
  • Tutorial en directo sobre el aprendizaje de redes bayesianas
  • Un modelo bayesiano jerárquico para el manejo de la heterogeneidad de muestras en problemas de clasificación proporciona un modelo de clasificación que tiene en cuenta la incertidumbre asociada con la medición de muestras replicadas.
  • Modelo jerárquico de Naive Bayes para manejar la incertidumbre de la muestra. Archivado el 28/09/2007 en Wayback Machine , muestra cómo realizar la clasificación y el aprendizaje con variables continuas y discretas con mediciones replicadas.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Bayesian_network&oldid=1361608168 "