Articulo de referencia

núcleo de Markov

En teoría de la probabilidad , un núcleo de Markov (también conocido como núcleo estocástico o núcleo de probabilidad ) es una aplicación que, en la teoría general de los proces...

En teoría de la probabilidad , un núcleo de Markov (también conocido como núcleo estocástico o núcleo de probabilidad ) es una aplicación que, en la teoría general de los procesos de Markov, desempeña el papel que desempeña la matriz de transición en la teoría de los procesos de Markov con un espacio de estados finito . [ 1 ]

Definición formal

Dejar(incógnita,A){\displaystyle (X,{\mathcal {A}})}y(Y,B){\displaystyle (Y,{\mathcal {B}})}ser espacios medibles . Un núcleo de Markov con fuente(incógnita,A){\displaystyle (X,{\mathcal {A}})}y objetivo(Y,B){\displaystyle (Y,{\mathcal {B}})}, a veces escrito comoκ:(incógnita,A)(Y,B){\displaystyle \kappa :(X,{\mathcal {A}})\to (Y,{\mathcal {B}})} , es una funciónκ:B×incógnita[0,1]{\displaystyle \kappa :{\mathcal {B}}\times X\to [0,1]} con las siguientes propiedades:

  1. Para cada (fijo)B0B{\displaystyle B_{0}\in {\mathcal {B}}}, el mapaincógnitaκ(B0,incógnita){\displaystyle x\mapsto \kappa (B_{0},x)}esA{\displaystyle {\mathcal {A}}}- medible
  2. Para cada (fijo)incógnita0incógnita{\displaystyle x_{0}\in X}, el mapaBκ(B,incógnita0){\displaystyle B\mapsto \kappa (B,x_{0})}es una medida de probabilidad en(Y,B){\displaystyle (Y,{\mathcal {B}})}

En otras palabras, se asocia a cada puntoincógnitaincógnita{\displaystyle x\in X}una medida de probabilidadκ(dy|incógnita):Bκ(B,incógnita){\displaystyle \kappa (dy|x):B\mapsto \kappa (B,x)}en(Y,B){\displaystyle (Y,{\mathcal {B}})}de tal manera que, para cada conjunto medibleBB{\displaystyle B\in {\mathcal {B}}}, el mapaincógnitaκ(B,incógnita){\displaystyle x\mapsto \kappa (B,x)}es medible con respecto a laσ{\displaystyle \sigma }-álgebraA{\displaystyle {\mathcal {A}}}. [ 2 ]

Ejemplos

Paseo aleatorio simple sobre los números enteros

Llevarincógnita=Y=Z{\displaystyle X=Y=\mathbb {Z} }, yA=B=PAG(Z){\displaystyle {\mathcal {A}}={\mathcal {B}}={\mathcal {P}}(\mathbb {Z} )}(el conjunto de potencias deZ{\displaystyle \mathbb {Z} }). Entonces, un núcleo de Markov está completamente determinado por la probabilidad que asigna a los elementos únicos.{metro},metroY=Z{\displaystyle \{m\},\,m\in Y=\mathbb {Z} }para cadanorteincógnita=Z{\displaystyle n\in X=\mathbb {Z} }:

κ(B|norte)=metroBκ({metro}|norte),norteZ,BB{\displaystyle \kappa (B|n)=\sum _{m\in B}\kappa (\{m\}|n),\qquad \forall n\in \mathbb {Z} ,\,\forall B\in {\mathcal {B}}}.

Ahora el paseo aleatorio κ{\displaystyle \kappa } que va hacia la derecha con probabilidadpag{\displaystyle p} y a la izquierda con probabilidad1pag{\displaystyle 1-p}se define por

κ({metro}|norte)=pagδmetro,norte+1+(1pag)δmetro,norte1,norte,metroZ{\displaystyle \kappa (\{m\}|n)=p\delta _{m,n+1}+(1-p)\delta _{m,n-1},\quad \forall n,m\in \mathbb {Z} }

dóndeδ{\displaystyle \delta }es la delta de Kronecker . Las probabilidades de transiciónPAG(metro|norte)=κ({metro}|norte){\displaystyle P(m|n)=\kappa (\{m\}|n)}para el paseo aleatorio son equivalentes al núcleo de Markov.

Procesos de Markov generales con espacio de estados numerable

En términos más generales, tomeincógnita{\displaystyle X}yY{\displaystyle Y}ambos contables yA=PAG(incógnita), B=PAG(Y){\displaystyle {\mathcal {A}}={\mathcal {P}}(X),\ {\mathcal {B}}={\mathcal {P}}(Y)}. Nuevamente, un núcleo de Markov se define por la probabilidad que asigna a los conjuntos unitarios para cadaiincógnita{\displaystyle i\in X}

κ(B|i)=jBκ({j}|i),iincógnita,BB{\displaystyle \kappa (B|i)=\sum _{j\in B}\kappa (\{j\}|i),\qquad \forall i\in X,\,\forall B\in {\mathcal {B}}},

Definimos un proceso de Markov definiendo una probabilidad de transición.PAG(j|i)=Kji{\displaystyle P(j|i)=K_{ji}}donde los númerosKji{\displaystyle K_{ji}}definir una matriz estocástica (contable)(Kji){\displaystyle (K_{ji})}es decir

Kji0,(j,i)Y×incógnita,jYKji=1,iincógnita.{\displaystyle {\begin{aligned}K_{ji}&\geq 0,\qquad &\forall (j,i)\in Y\times X,\\\sum _{j\in Y}K_{ji}&=1,\qquad &\forall i\in X.\\\end{aligned}}}

Luego definimos

κ({j}|i)=Kji=PAG(j|i),iincógnita,BB{\displaystyle \kappa (\{j\}|i)=K_{ji}=P(j|i),\qquad \forall i\in X,\quad \forall B\in {\mathcal {B}}}.

Nuevamente, la probabilidad de transición, la matriz estocástica y el núcleo de Markov son reformulaciones equivalentes.

Núcleo de Markov definido por una función de núcleo y una medida

Dejarν{\displaystyle \nu }ser una medida en(Y,B){\displaystyle (Y,{\mathcal {B}})}, yk:Y×incógnita[0,]{\displaystyle k:Y\times X\to [0,\infty ]}una función medible con respecto al productoσ{\displaystyle \sigma }-álgebraAB{\displaystyle {\mathcal {A}}\otimes {\mathcal {B}}}de tal manera que

Yk(y,incógnita)ν(dy)=1,incógnitaincógnita{\displaystyle \int _{Y}k(y,x)\nu (\mathrm {d} y)=1,\qquad \forall x\in X},

entoncesκ(dy|incógnita)=k(y,incógnita)ν(dy){\displaystyle \kappa (dy|x)=k(y,x)\nu (dy)}es decir, el mapeo

{κ:B×incógnita[0,1]κ(B|incógnita)=Bk(y,incógnita)ν(dy){\displaystyle {\begin{cases}\kappa :{\mathcal {B}}\times X\to [0,1]\\\kappa (B|x)=\int _{B}k(y,x)\nu (\mathrm {d} y)\end{cases}}}

define un núcleo de Markov. [ 3 ] Este ejemplo generaliza el ejemplo del proceso de Markov contable dondeν{\displaystyle \nu }era la medida de conteo . Además, abarca otros ejemplos importantes como los núcleos de convolución, en particular los núcleos de Markov definidos por la ecuación del calor . Este último ejemplo incluye el núcleo gaussiano enincógnita=Y=R{\displaystyle X=Y=\mathbb {R} }conν(dincógnita)=dincógnita{\displaystyle \nu (dx)=dx}Medida estándar de Lebesgue y

kt(y,incógnita)=12πtmi(yincógnita)2/(2t2).{\displaystyle k_{t}(y,x)={\frac {1}{{\sqrt {2\pi }}t}}e^{-(y-x)^{2}/(2t^{2})}.}

Funciones medibles

Llevar(incógnita,A){\displaystyle (X,{\mathcal {A}})}y(Y,B){\displaystyle (Y,{\mathcal {B}})}espacios medibles arbitrarios, y dejemosF:incógnitaY{\displaystyle f:X\to Y}ser una función medible. Ahora definaκ(dy|incógnita)=δF(incógnita)(dy){\displaystyle \kappa (dy|x)=\delta _{f(x)}(dy)}es decir

κ(B|incógnita)=1B(F(incógnita))=1F1(B)(incógnita)={1si F(incógnita)B0de lo contrario{\displaystyle \kappa (B|x)=\mathbf {1} _{B}(f(x))=\mathbf {1} _{f^{-1}(B)}(x)={\begin{cases}1&{\text{if }}f(x)\in B\\0&{\text{otherwise}}\end{cases}}}a pesar deBB{\displaystyle B\in {\mathcal {B}}}.

Tenga en cuenta que la función indicadora1F1(B){\displaystyle \mathbf {1} _{f^{-1}(B)}}esA{\displaystyle {\mathcal {A}}}-medible para todosBB{\displaystyle B\in {\mathcal {B}}}si y solo siF{\displaystyle f}es medible.

Este ejemplo nos permite concebir un núcleo de Markov como una función generalizada con un valor (en general) aleatorio en lugar de un valor fijo. Es decir, se trata de una función multivaluada donde los valores no tienen el mismo peso.

Como ejemplo menos obvio, tomemosincógnita=norte,A=PAG(norte){\displaystyle X=\mathbb {N} ,{\mathcal {A}}={\mathcal {P}}(\mathbb {N} )}, y(Y,B){\displaystyle (Y,{\mathcal {B}})}los números realesR{\displaystyle \mathbb {R} }con el álgebra sigma estándar de conjuntos de Borel . Entonces

κ(B|norte)={1B(0)norte=0Pr(ξ1++ξincógnitaB)norte0{\displaystyle \kappa (B|n)={\begin{cases}\mathbf {1} _{B}(0)&n=0\\\Pr(\xi _{1}+\cdots +\xi _{x}\in B)&n\neq 0\\\end{cases}}}

dóndeincógnita{\displaystyle x}es el número de elementos en el estadonorte{\displaystyle n},ξi{\displaystyle \xi _{i}} son variables aleatorias i.i.d. (generalmente con media 0) y donde1B{\displaystyle \mathbf {1} _{B}}es la función indicadora . Para el caso simple de lanzamientos de moneda, esto modela los diferentes niveles de un tablero de Galton .

Composición de núcleos de Markov

Dados los espacios medibles(incógnita,A){\displaystyle (X,{\mathcal {A}})}, (Y,B){\displaystyle (Y,{\mathcal {B}})}Consideramos un núcleo de Markovκ:B×incógnita[0,1]{\displaystyle \kappa :{\mathcal {B}}\times X\to [0,1]} como un morfismoκ:incógnitaY{\displaystyle \kappa :X\to Y}. Intuitivamente, en lugar de asignar a cada unoincógnitaincógnita{\displaystyle x\in X}un punto claramente definidoyY{\displaystyle y\in Y}El núcleo asigna un punto "difuso" enY{\displaystyle Y}que solo se conoce con cierto grado de incertidumbre, al igual que las mediciones físicas reales. Si tenemos un tercer espacio medible(Z,do){\displaystyle (Z,{\mathcal {C}})}y núcleos de probabilidadκ:incógnitaY{\displaystyle \kappa :X\to Y}yλ:YZ{\displaystyle \lambda :Y\to Z}, podemos definir una composiciónλκ:incógnitaZ{\displaystyle \lambda \circ \kappa :X\to Z}mediante la ecuación de Chapman-Kolmogorov

(λκ)(dz|incógnita)=Yλ(dz|y)κ(dy|incógnita){\displaystyle (\lambda \circ \kappa )(dz|x)=\int _{Y}\lambda (dz|y)\kappa (dy|x)}.

La composición es asociativa por el Teorema de Convergencia Monótona y la función identidad considerada como un núcleo de Markov (es decir, la medida delta). κ1(dincógnita|incógnita)=δincógnita(dincógnita){\displaystyle \kappa _{1}(dx'|x)=\delta _{x}(dx')}) es la unidad para esta composición.

Esta composición define la estructura de una categoría en los espacios medibles con núcleos de Markov como morfismos, definida por primera vez por Lawvere, [ 4 ] la categoría de núcleos de Markov .

Espacio de probabilidad definido por la distribución de probabilidad y un núcleo de Markov

Una composición de un espacio de probabilidad(incógnita,A,PAGincógnita){\displaystyle (X,{\mathcal {A}},P_{X})}y un núcleo de probabilidadκ:(incógnita,A)(Y,B){\displaystyle \kappa :(X,{\mathcal {A}})\to (Y,{\mathcal {B}})} define un espacio de probabilidad(Y,B,PAGY=κPAGincógnita){\displaystyle (Y,{\mathcal {B}},P_{Y}=\kappa \circ P_{X})}donde la medida de probabilidad viene dada por

PAGY(B)=incógnitaBκ(dy|incógnita)PAGincógnita(dincógnita)=incógnitaκ(B|incógnita)PAGincógnita(dincógnita)=miPAGincógnitaκ(B|).{\displaystyle P_{Y}(B)=\int _{X}\int _{B}\kappa (dy|x)P_{X}(dx)=\int _{X}\kappa (B|x)P_{X}(dx)=\mathbb {E} _{P_{X}}\kappa (B|\cdot ).}

Propiedades

producto semidirecto

Dejar(incógnita,A,PAG){\displaystyle (X,{\mathcal {A}},P)}sea ​​un espacio de probabilidad y κ{\displaystyle \kappa }un núcleo de Markov de (incógnita,A){\displaystyle (X,{\mathcal {A}})}para algunos(Y,B){\displaystyle (Y,{\mathcal {B}})}Entonces existe una medida única Q{\displaystyle Q}en (incógnita×Y,AB){\displaystyle (X\times Y,{\mathcal {A}}\otimes {\mathcal {B}})}, de tal manera que:

Q(A×B)=Aκ(B|incógnita)PAG(dincógnita),AA,BB.{\displaystyle Q(A\times B)=\int _{A}\kappa (B|x)\,P(dx),\quad \forall A\in {\mathcal {A}},\quad \forall B\in {\mathcal {B}}.}

Distribución condicional regular

Dejar(S,Y){\displaystyle (S,Y)}ser un espacio Borel ,incógnita{\displaystyle X}a(S,Y){\displaystyle (S,Y)}variable aleatoria con valor en el espacio de medidas(Ω,F,PAG){\displaystyle (\Omega ,{\mathcal {F}},P)}yGRAMOF{\displaystyle {\mathcal {G}}\subseteq {\mathcal {F}}}un sub-σ{\displaystyle \sigma }-álgebra. Entonces existe un núcleo de Markovκ{\displaystyle \kappa }de(Ω,GRAMO){\displaystyle (\Omega ,{\mathcal {G}})}a(S,Y){\displaystyle (S,Y)}, de tal manera queκ(,B){\displaystyle \kappa (\cdot ,B)}es una versión de la expectativa condicionalmi[1{incógnitaB}GRAMO]{\displaystyle \mathbb {E} [\mathbf {1} _{\{X\in B\}}\mid {\mathcal {G}}]}por cadaBY{\displaystyle B\in Y}, es decir

PAG(incógnitaBGRAMO)=mi[1{incógnitaB}GRAMO]=κ(,B),PAG-comoBY.{\displaystyle P(X\in B\mid {\mathcal {G}})=\mathbb {E} \left[\mathbf {1} _{\{X\in B\}}\mid {\mathcal {G}}\right]=\kappa (\cdot ,B),\qquad P{\text{-a.s.}}\,\,\forall B\in Y.}

Se denomina distribución condicional regular deincógnita{\displaystyle X}dadoGRAMO{\displaystyle {\mathcal {G}}}y no está definido de forma única.

Generalizaciones

Los núcleos de transición generalizan los núcleos de Markov en el sentido de que para todoincógnitaincógnita{\displaystyle x\in X}, el mapa

Bκ(B|incógnita){\displaystyle B\mapsto \kappa (B|x)}

Puede ser cualquier tipo de medida (no negativa), no necesariamente una medida de probabilidad.

  • Núcleo de Markov en nLab .

Referencias

  1. Reiss, RD (1993). Un curso sobre procesos puntuales . Springer Series in Statistics. doi : 10.1007/978-1-4613-9308-5 . ISBN 978-1-4613-9310-8.
  2. Klenke, Achim (2014). Teoría de la probabilidad: Un curso completo . Universitext (2.ª ed.). Springer. p. 180. doi : 10.1007/978-1-4471-5361-0 . ISBN   978-1-4471-5360-3.
  3. Erhan, Cinlar (2011). Probabilidad y estocástica . Nueva York: Springer. págs. 37–38 . ISBN  978-0-387-87858-4.
  4. FW Lawvere (1962). "La categoría de mapeos probabilísticos" (PDF) .
  • Bauer, Heinz (1996), Teoría de la probabilidad , de Gruyter, ISBN 3-11-013935-9
§36. Núcleos y semigrupos de núcleos

Véase también