
En teoría de la probabilidad , los procesos de Dirichlet (llamados así por la distribución asociada a Peter Gustav Lejeune Dirichlet ) son una familia de procesos estocásticos cuyas realizaciones son distribuciones de probabilidad . En otras palabras, un proceso de Dirichlet es una distribución de probabilidad cuyo rango es, a su vez, un conjunto de distribuciones de probabilidad. Se utiliza frecuentemente en inferencia bayesiana para describir el conocimiento previo sobre la distribución de variables aleatorias : la probabilidad de que dichas variables se distribuyan según una u otra distribución particular.
Por ejemplo, un solo dado representa una función de masa de probabilidad (FMP), por lo que una bolsa de 100 dados reales es una colección de FMP aleatorias: al introducir la mano en la bolsa y sacar un dado, se extrae una FMP aleatoria, muestreando así esa colección de FMP. Una bolsa de dados fabricada con un proceso rudimentario hace 100 años probablemente contendrá dados que se desvían enormemente de la FMP uniforme, mientras que una bolsa de dados de última generación utilizados por los casinos de Las Vegas puede tener imperfecciones apenas perceptibles. Dicha colección de FMP puede modelarse mediante una distribución sobre FMP, como la distribución de Dirichlet. [ 1 ]
El proceso de Dirichlet se especifica mediante una distribución base.y un número real positivodenominado parámetro de concentración (también conocido como parámetro de escala). La distribución base es el valor esperado del proceso, es decir, el proceso de Dirichlet dibuja distribuciones "alrededor" de la distribución base de la misma manera que una distribución normal dibuja números reales alrededor de su media. Sin embargo, incluso si la distribución base es continua , las distribuciones extraídas del proceso de Dirichlet son casi con seguridad discretas . El parámetro de escala especifica cuán fuerte es esta discretización: en el límite de, todas las realizaciones se concentran en un único valor, mientras que en el límite deLas realizaciones se vuelven continuas. Entre los dos extremos, las realizaciones son distribuciones discretas con cada vez menos concentración.aumenta.
El proceso de Dirichlet también puede considerarse la generalización de dimensión infinita de la distribución de Dirichlet . Del mismo modo que la distribución de Dirichlet es la distribución a priori conjugada para la distribución categórica , el proceso de Dirichlet es la distribución a priori conjugada para distribuciones discretas no paramétricas infinitas . Una aplicación particularmente importante de los procesos de Dirichlet es como distribución de probabilidad a priori en modelos de mezcla infinitos .
El proceso de Dirichlet fue introducido formalmente por Thomas S. Ferguson en 1973. [ 2 ] Desde entonces se ha aplicado en minería de datos y aprendizaje automático , entre otros para procesamiento del lenguaje natural , visión por computadora y bioinformática .
Introducción
Los procesos de Dirichlet se utilizan habitualmente al modelar datos que tienden a repetir valores anteriores de una forma denominada "los ricos se hacen más ricos". Específicamente, supongamos que la generación de valorespuede simularse mediante el siguiente algoritmo.
- Aporte:(una distribución de probabilidad llamada distribución base),(un número real positivo llamado parámetro de escala )
- Para:
a) Con probabilidad dibujardeb ) Con probabilidad colocar, dóndees el número de observaciones previas de. (Formalmente,dónde(denota el número de elementos en el conjunto.)
Al mismo tiempo, otro modelo común para los datos es que las observacionesSe supone que son independientes e idénticamente distribuidas (i.i.d.) según alguna distribución (aleatoria).El objetivo de introducir los procesos de Dirichlet es poder describir el procedimiento descrito anteriormente en este modelo i.i.d.
ElLas observaciones en el algoritmo no son independientes , ya que tenemos que considerar los resultados anteriores al generar el siguiente valor. Sin embargo, son intercambiables . Este hecho se puede demostrar calculando la distribución de probabilidad conjunta de las observaciones y notando que la fórmula resultante solo depende de cuálLos valores aparecen entre las observaciones y cuántas repeticiones tiene cada una. Debido a esta intercambiabilidad, se aplica el teorema de representación de De Finetti y esto implica que las observacionesson condicionalmente independientes dada una distribución (latente). Estees una variable aleatoria en sí misma y tiene una distribución. Esta distribución (sobre distribuciones) se llama proceso de Dirichlet (En resumen, esto significa que obtenemos un procedimiento equivalente al algoritmo anterior:
- Dibuja una distribuciónde
- Realizar observacionesindependientemente de.
En la práctica, sin embargo, dibujar una distribución concretaEs imposible, ya que su especificación requiere una cantidad infinita de información. Este es un fenómeno común en el contexto de la estadística bayesiana no paramétrica, donde una tarea típica consiste en aprender distribuciones en espacios de funciones, que involucran, en la práctica, un número infinito de parámetros. La clave reside en que, en muchas aplicaciones, las distribuciones de dimensión infinita aparecen únicamente como un recurso computacional intermedio y no son necesarias ni para la especificación inicial de las creencias previas ni para la formulación de la inferencia final.
Definición formal
Dado un conjunto medible S , una distribución de probabilidad base H y un número real positivo, el proceso de Dirichletes un proceso estocástico cuya trayectoria de muestra (o realización , es decir, una secuencia infinita de variables aleatorias extraídas del proceso) es una distribución de probabilidad sobre S , tal que se cumple lo siguiente. Para cualquier partición finita medible de S , denotada,
dóndedenota la distribución de Dirichlet y la notaciónsignifica que la variable aleatoriatiene la distribución.
Puntos de vista alternativos
Existen varias visiones equivalentes del proceso de Dirichlet. Además de la definición formal anterior, el proceso de Dirichlet puede definirse implícitamente mediante el teorema de De Finetti , como se describe en la primera sección; esto se conoce a menudo como el proceso del restaurante chino . Una tercera alternativa es el proceso de ruptura de palos , que define el proceso de Dirichlet de forma constructiva escribiendo una distribución muestreada del proceso como, dóndeson muestras de la distribución base,es una función indicadora centrada en(cero en todas partes excepto en) y else definen mediante un esquema recursivo que toma muestras repetidamente de la distribución beta..
El proceso del restaurante chino
Una metáfora muy utilizada para el proceso de Dirichlet se basa en el llamado proceso del restaurante chino . La metáfora es la siguiente:
Imaginemos un restaurante chino al que entran clientes. Un nuevo cliente se sienta en una mesa con una probabilidad proporcional al número de clientes que ya están sentados allí. Además, un cliente abre una nueva mesa con una probabilidad proporcional al parámetro de escala.Después de que ingresen infinitos clientes, se obtiene una distribución de probabilidad sobre un número infinito de mesas para elegir. Esta distribución de probabilidad sobre las mesas es una muestra aleatoria de las probabilidades de las observaciones extraídas de un proceso de Dirichlet con parámetro de escala..
Si uno asocia extrae de la medida basecon cada tabla, la distribución resultante sobre el espacio muestrales una muestra aleatoria de un proceso de Dirichlet. El proceso del restaurante chino está relacionado con el esquema de muestreo de la urna de Pólya , que produce muestras de distribuciones finitas de Dirichlet.
Debido a que los clientes se sientan en una mesa con una probabilidad proporcional al número de clientes que ya están sentados en ella, se pueden deducir dos propiedades del DP:
- El proceso de Dirichlet presenta una propiedad de autorrefuerzo: cuanto más a menudo se haya muestreado un valor determinado en el pasado, más probable será que se vuelva a muestrear.
- Incluso sies una distribución sobre un conjunto no numerable , hay una probabilidad no nula de que dos muestras tengan exactamente el mismo valor porque la masa de probabilidad se concentrará en un pequeño número de tablas.
El proceso de romper palos
Un tercer enfoque del proceso de Dirichlet es la llamada visión del proceso de ruptura de palos. Conceptualmente, esto implica romper y descartar repetidamente una fracción aleatoria (muestreada de una distribución Beta) de un "palo" que inicialmente tiene una longitud de 1. Recuerde que las extracciones de un proceso de Dirichlet son distribuciones sobre un conjuntoComo se indicó anteriormente, la distribución obtenida es discreta con probabilidad 1. En la perspectiva del proceso de ruptura de palos, utilizamos explícitamente la discreción y damos la función de masa de probabilidad de esta distribución discreta (aleatoria) como:
dóndees la función indicadora que se evalúa a cero en todas partes, excepto enDado que esta distribución es aleatoria en sí misma, su función de masa está parametrizada por dos conjuntos de variables aleatorias: las ubicacionesy las probabilidades correspondientesA continuación, presentamos sin demostración cuáles son estas variables aleatorias.
Las ubicacionesson independientes e idénticamente distribuidas según, la distribución base del proceso de Dirichlet. Las probabilidadesse obtienen mediante un procedimiento similar a la rotura de un palo de longitud unitaria (de ahí su nombre):
dóndeson variables aleatorias independientes con distribución beta. El parecido con 'romper palos' se puede ver al considerarcomo la longitud de un trozo de palo. Comenzamos con un palo de longitud unitaria y en cada paso rompemos una porción del palo restante segúny asignar este trozo roto aLa fórmula se puede entender al observar que después de que los primeros k − 1 valores tienen sus porciones asignadas, la longitud del resto del palo es y esta pieza está rota segúny se le asigna.
El más pequeñoEs decir, quedará menos material para los valores subsiguientes (en promedio), lo que dará como resultado distribuciones más concentradas.
El proceso de ruptura de palos es similar a la construcción donde se muestrea secuencialmente de distribuciones beta marginales para generar una muestra de una distribución de Dirichlet . [ 4 ]
El proyecto de la urna de Pólya
Otra forma de visualizar el proceso de Dirichlet y el proceso del restaurante chino es como un esquema de urna de Pólya modificado , a veces llamado esquema de muestreo de Blackwell-MacQueen . Imaginemos que comenzamos con una urna llena debolas negras. A continuación procedemos de la siguiente manera:
- Cada vez que necesitamos hacer una observación, sacamos una bola de la urna.
- Si la bola es negra, generamos un nuevo color (que no sea negro) de forma uniforme, etiquetamos una nueva bola con este color, la dejamos caer en la urna junto con la bola que extrajimos y devolvemos la bola del color que generamos.
- De lo contrario, etiqueta una bola nueva con el color de la bola que sacamos, deja caer la bola nueva en la urna junto con la bola que sacamos y devuelve la bola del color que observamos.
La distribución resultante sobre los colores es la misma que la distribución sobre las mesas en el proceso del restaurante chino. Además, cuando sacamos una bola negra, si en lugar de generar un nuevo color, elegimos un valor aleatorio de una distribución base.y usar ese valor para etiquetar la nueva bola, la distribución resultante sobre las etiquetas será la misma que la distribución sobre los valores en un proceso de Dirichlet.
Utilizar como distribución previa
El proceso de Dirichlet puede utilizarse como distribución previa para estimar la distribución de probabilidad que genera los datos. En esta sección, consideramos el modelo.
La distribución del proceso de Dirichlet satisface la conjugación previa , la consistencia posterior y el teorema de Bernstein-von Mises . [ 5 ]
conjugación previa
En este modelo, la distribución posterior es nuevamente un proceso de Dirichlet. Esto significa que el proceso de Dirichlet es una distribución a priori conjugada para este modelo. La distribución posterior viene dada por
dóndeSe define a continuación.
Consistencia posterior
Si adoptamos la visión frecuentista de la probabilidad, creemos que existe una distribución de probabilidad verdadera.que generó los datos. Entonces resulta que el proceso de Dirichlet es consistente en la topología débil , lo que significa que para cada vecindario débilde, la probabilidad posterior deconverge a.
Teorema de Bernstein-Von Mises
Para interpretar los conjuntos creíbles como conjuntos de confianza, se necesita un teorema de Bernstein-von Mises . En el caso del proceso de Dirichlet, comparamos la distribución posterior con el proceso empírico.. Suponeres un-Clase Donsker, es decir
para algunos puente brownianoSupongamos también que existe una funciónde tal manera quede tal manera que, entonces,casi seguro
Esto implica que los conjuntos creíbles que construya son conjuntos de confianza asintóticos, y que la inferencia bayesiana basada en el proceso de Dirichlet es asintóticamente también una inferencia frecuentista válida.
Uso en modelos de mezcla de Dirichlet

Para comprender qué son los procesos de Dirichlet y el problema que resuelven, consideremos el ejemplo de la agrupación de datos . Es común suponer que los puntos de datos se distribuyen de forma jerárquica, donde cada punto pertenece a un grupo (elegido al azar) y los miembros de un grupo se distribuyen aleatoriamente dentro de ese grupo.
Ejemplo 1
Por ejemplo, podríamos estar interesados en cómo votarán las personas sobre varias preguntas en unas próximas elecciones. Un modelo razonable para esta situación podría ser clasificar a cada votante como liberal, conservador o moderado y luego modelar el evento de que un votante diga "Sí" a una pregunta en particular como una variable aleatoria de Bernoulli, cuya probabilidad depende del grupo político al que pertenece. Al observar cómo se emitieron los votos en años anteriores sobre leyes similares, se podría ajustar un modelo predictivo utilizando un algoritmo de agrupamiento simple como k -means . Sin embargo, ese algoritmo requiere conocer de antemano el número de grupos que generaron los datos. En muchas situaciones, no es posible determinar esto con anticipación, e incluso cuando podemos asumir razonablemente un número de grupos, aun así querríamos poder verificar esta suposición. Por ejemplo, en el ejemplo de votación anterior, la división en liberal, conservador y moderado podría no ser lo suficientemente precisa; atributos como la religión, la clase social o la raza también podrían ser cruciales para modelar el comportamiento del votante, lo que resultaría en más grupos en el modelo.
Ejemplo 2
Como otro ejemplo, podríamos estar interesados en modelar las velocidades de las galaxias utilizando un modelo simple que suponga que las velocidades están agrupadas, por ejemplo, asumiendo que cada velocidad se distribuye según la distribución normal., donde elLa observación pertenece a lacúmulo de galaxias con velocidad esperada común. En este caso, no es nada obvio cómo determinar a priori cuántos cúmulos (de velocidades comunes) debería haber, y cualquier modelo para esto sería muy dudoso y debería contrastarse con los datos. Al usar una distribución a priori de proceso de Dirichlet para la distribución de los medios de los cúmulos, evitamos la necesidad de especificar explícitamente de antemano cuántos cúmulos hay, aunque el parámetro de concentración aún lo controla implícitamente.
Consideremos este ejemplo con más detalle. Un primer modelo ingenuo consiste en presuponer que existengrupos de velocidades con distribución normal y varianza fija conocida común. Que denota el evento que elLa observación está en elth clúster comoPodemos escribir este modelo como:
Es decir, asumimos que los datos pertenecen agrupos distintos con mediasy esoes la probabilidad previa (desconocida) de que un punto de datos pertenezca al grupoclúster th. Suponemos que no tenemos información inicial que distinga los clústeres, lo cual se captura mediante la distribución a priori simétrica.. Aquídenota la distribución de Dirichlet ydenota un vector de longituddonde cada elemento es 1. Además, asignamos distribuciones previas independientes e idénticas.a cada una de las medias de clúster, dondepuede ser cualquier distribución paramétrica con parámetros denotados como. Los hiperparámetrosySe consideran constantes fijas conocidas, elegidas para reflejar nuestras creencias previas sobre el sistema. Para comprender la conexión con las distribuciones a priori de los procesos de Dirichlet, reescribimos este modelo de una forma equivalente pero más sugerente:
En lugar de imaginar que a cada punto de datos se le asigna primero un clúster y luego se extrae de la distribución asociada a ese clúster, ahora pensamos que cada observación está asociada con un parámetro.extraído de alguna distribución discretacon apoyo en elsignifica. Es decir, ahora estamos tratando elcomo si se hubieran extraído de la distribución aleatoriay nuestra información previa se incorpora al modelo mediante la distribución sobre distribuciones.
Ahora nos gustaría ampliar este modelo para que funcione sin especificar previamente un número fijo de clústeres.Matemáticamente, esto significa que nos gustaría seleccionar una distribución previa aleatoria.donde los valores de los clústeres significannuevamente se distribuyen independientemente segúny la distribución sobrees simétrico sobre el conjunto infinito de clústeres. Esto es precisamente lo que logra el modelo:
Con esto en mente, podemos comprender mejor las ventajas computacionales del proceso de Dirichlet. Supongamos que quisiéramos dibujarobservaciones del modelo ingenuo con exactamenteclústeres. Un algoritmo sencillo para hacer esto sería dibujarvalores dede, una distribucióndey luego, para cada observación, muestrear independientemente el clúster.con probabilidady el valor de la observación segúnEs fácil ver que este algoritmo no funciona en el caso de que permitamos clústeres infinitos porque esto requeriría muestrear un parámetro de dimensión infinita.Sin embargo, todavía es posible tomar muestras de las observaciones.Por ejemplo, se puede utilizar la representación del restaurante chino que se describe a continuación y calcular la probabilidad de que se utilicen clústeres y se cree un nuevo clúster. Esto evita tener que especificarlo explícitamente.Otras soluciones se basan en una truncación de clústeres: se introduce un límite superior (alto) para el número real de clústeres y los números de clústeres superiores al límite inferior se tratan como un solo clúster.
Ajustar el modelo descrito anteriormente basándose en los datos observados.significa encontrar la distribución posteriorsobre las probabilidades de clúster y sus medias asociadas. En el caso de dimensión infinita, es obviamente imposible escribir la distribución posterior explícitamente. Sin embargo, es posible extraer muestras de esta distribución posterior utilizando un muestreador de Gibbs modificado . [ 6 ] Este es el hecho crítico que hace que la distribución previa del proceso de Dirichlet sea útil para la inferencia .
Aplicaciones del proceso de Dirichlet
Los procesos de Dirichlet se utilizan frecuentemente en la estadística bayesiana no paramétrica . "No paramétrico" aquí no significa un modelo sin parámetros, sino un modelo en el que las representaciones crecen a medida que se observan más datos. Los modelos bayesianos no paramétricos han ganado considerable popularidad en el campo del aprendizaje automático debido a la flexibilidad mencionada anteriormente, especialmente en el aprendizaje no supervisado . En un modelo bayesiano no paramétrico, las distribuciones a priori y a posteriori no son distribuciones paramétricas, sino procesos estocásticos. [ 7 ] El hecho de que la distribución de Dirichlet sea una distribución de probabilidad en el simplex de conjuntos de números no negativos que suman uno la convierte en una buena candidata para modelar distribuciones sobre distribuciones o distribuciones sobre funciones. Además, la naturaleza no paramétrica de este modelo lo convierte en una candidata ideal para problemas de agrupamiento donde el número distinto de clústeres se desconoce de antemano. Además, el proceso de Dirichlet también se ha utilizado para desarrollar una mezcla de modelos expertos, en el contexto de algoritmos de aprendizaje supervisado (configuraciones de regresión o clasificación). Por ejemplo, mezclas de expertos en procesos gaussianos, donde el número de expertos necesarios debe inferirse a partir de los datos. [ 8 ] [ 9 ]
Como las extracciones de un proceso de Dirichlet son discretas, un uso importante es como probabilidad previa en modelos de mezcla infinita . En este caso,es el conjunto paramétrico de distribuciones de componentes. El proceso generativo consiste, por lo tanto, en que se extrae una muestra de un proceso de Dirichlet y, para cada punto de datos, a su vez, se extrae un valor de esta distribución de muestra y se utiliza como distribución de componente para ese punto de datos. El hecho de que no haya límite al número de componentes distintos que se pueden generar hace que este tipo de modelo sea apropiado para el caso en que el número de componentes de la mezcla no esté bien definido de antemano. Por ejemplo, el modelo de mezcla infinita de gaussianas, [ 10 ] así como los modelos de regresión de mezcla asociados, p. ej. [ 11 ]
La naturaleza infinita de estos modelos también los hace adecuados para aplicaciones de procesamiento del lenguaje natural , donde a menudo es deseable tratar el vocabulario como un conjunto discreto e infinito.
El proceso de Dirichlet también puede utilizarse para pruebas de hipótesis no paramétricas, es decir, para desarrollar versiones bayesianas no paramétricas de las pruebas de hipótesis no paramétricas clásicas, como la prueba de signos , la prueba de suma de rangos de Wilcoxon , la prueba de rangos con signo de Wilcoxon , etc. Por ejemplo, se han desarrollado versiones bayesianas no paramétricas de la prueba de suma de rangos de Wilcoxon y la prueba de rangos con signo de Wilcoxon utilizando el proceso de Dirichlet impreciso , un proceso de Dirichlet con ignorancia previa.
Distribuciones relacionadas
- El proceso de Pitman-Yor es una generalización del proceso de Dirichlet para acomodar colas de ley de potencias.
- El proceso de Dirichlet jerárquico extiende el proceso de Dirichlet ordinario para modelar datos agrupados.
Referencias
- ↑ Frigyik, Bela A.; Kapila, Amol; Gupta, Maya R. "Introducción a la distribución de Dirichlet y procesos relacionados" (PDF) . Consultado el 2 de septiembre de 2021 .
- ↑ Ferguson, Thomas (1973). "Análisis bayesiano de algunos problemas no paramétricos" . Annals of Statistics . 1 (2): 209– 230. doi : 10.1214/aos/1176342360 . MR 0350949 .
- ↑ "Proceso de Dirichlet y distribución de Dirichlet: esquema del restaurante Polya y proceso del restaurante chino" .
- ↑ Para la demostración, véase Paisley, John (agosto de 2010). «Una demostración sencilla de la construcción de ruptura de palos del proceso de Dirichlet» (PDF) . Universidad de Columbia . Archivado del original (PDF) el 22 de enero de 2015.
- ↑ Aad van der Vaart , Subhashis Ghosal (2017). Fundamentos de la inferencia bayesiana no paramétrica . Cambridge University Press. ISBN 978-0-521-87826-5.
- ↑ Sudderth, Erik (2006). Modelos gráficos para el reconocimiento y seguimiento de objetos visuales (PDF) (Ph.D.). MIT Press.
- ↑ Nils Lid Hjort ; Chris Holmes, Peter Müller; Stephen G. Walker (2010). Bayesian Nonparametrics . Cambridge University Press. ISBN 978-0-521-51346-3.
- ↑ Sotirios P. Chatzis, "Un modelo de proceso gaussiano de variable latente con priors de proceso de Pitman-Yor para clasificación multiclase", Neurocomputing, vol. 120, pp. 482–489, noviembre de 2013. doi : 10.1016/j.neucom.2013.04.029
- ↑ Sotirios P. Chatzis, Yiannis Demiris, "Mezclas no paramétricas de procesos gaussianos con comportamiento de ley de potencias", IEEE Transactions on Neural Networks and Learning Systems, vol. 23, n.º 12, págs. 1862–1871, dic. 2012. doi : 10.1109/TNNLS.2012.2217986
- ↑ Rasmussen, Carl (2000). "El modelo de mezcla gaussiana infinita" (PDF) . Avances en sistemas de procesamiento de información neuronal . 12 : 554–560 .
- ↑ Sotirios P. Chatzis, Dimitrios Korkinof y Yiannis Demiris, «Un enfoque bayesiano no paramétrico para el aprendizaje robótico mediante demostración», Robotics and Autonomous Systems, vol. 60, n.º 6, págs. 789-802, junio de 2012. doi : 10.1016/j.robot.2012.02.005
Enlaces externos
- Introducción a la distribución de Dirichlet y procesos relacionados por Frigyik, Kapila y Gupta
- Descripción general de Yee Whye Teh sobre los procesos de Dirichlet.
- Página web del taller NIPS 2003 sobre métodos bayesianos no paramétricos.
- Tutorial de Michael Jordan para NIPS 2005: Métodos bayesianos no paramétricos: procesos de Dirichlet, procesos de restaurante chino y todo eso.
- Resumen de Peter Green sobre la construcción de procesos de Dirichlet.
- Artículo de Peter Green sobre modelos probabilísticos de procesos de Dirichlet con implicaciones para el modelado y análisis estadístico.
- Tutorial de Zoubin Ghahramani para la UAI 2005 sobre métodos bayesianos no paramétricos.
- Software GIMM para realizar análisis de clústeres utilizando modelos de mezcla infinita.
- Un ejemplo sencillo de agrupamiento mediante el proceso de Dirichlet. Por Zhiyuan Weng.
- Procesos estocásticos
- estadística bayesiana no paramétrica