Articulo de referencia

Vector de probabilidad

En matemáticas y estadística , un vector de probabilidad o vector estocástico es un vector con entradas no negativas que suman uno. Detrás de cada vector de probabilidad subyace...

En matemáticas y estadística , un vector de probabilidad o vector estocástico es un vector con entradas no negativas que suman uno.

Detrás de cada vector de probabilidad subyace un experimento que puede producir un resultado. Para conectar este experimento con las matemáticas, se introduce una variable aleatoria discreta , que es una función que asigna un valor numérico a cada resultado posible. Por ejemplo, si el experimento consiste en lanzar un dado, los posibles valores de esta variable aleatoria son los enteros 1, 2, ..., 6. El vector de probabilidad asociado tiene seis componentes, cada una de las cuales representa la probabilidad de obtener el resultado correspondiente. De forma más general, un vector de probabilidad de longitud n representa la distribución de probabilidades entre los n posibles resultados numéricos de una variable aleatoria. [ 1 ]

El vector nos da la función de masa de probabilidad de esa variable aleatoria, que es la forma estándar de caracterizar una distribución de probabilidad discreta . [ 2 ]

Ejemplos

Aquí hay algunos ejemplos de vectores de probabilidad. Los vectores pueden ser columnas o filas. [ 3 ]

  • incógnita0=[0,50,250,25],{\displaystyle x_{0}={\begin{bmatrix}0.5\\0.25\\0.25\end{bmatrix}},}
  • incógnita1=[010],{\displaystyle x_{1}={\begin{bmatrix}0\\1\\0\end{bmatrix}},}
  • incógnita2=[0,650,35],{\displaystyle x_{2}={\begin{bmatrix}0.65&0.35\end{bmatrix}},}
  • incógnita3=[0,30,50,070.10,03].{\displaystyle x_{3}={\begin{bmatrix}0.3&0.5&0.07&0.1&0.03\end{bmatrix}}.}

Propiedades

  • La media de los componentes de cualquier vector de probabilidad es1/norte{\displaystyle 1/n}. [ 4 ]
pag=norteσ2+1norte{\displaystyle \|p\|={\sqrt {\,n\sigma ^{2}+{\tfrac {1}{n}}\,}}}.
  • Esta expresión para la longitud alcanza su valor mínimo de1norte{\displaystyle {\tfrac {1}{\sqrt {n}}}}cuando todos los componentes son iguales, conpagi=1/norte{\displaystyle p_{i}=1/n}. [ 3 ]
  • El vector de probabilidad más largo tiene el valor 1 en un solo componente y 0 en todos los demás, y tiene una longitud de 1. [ 3 ]
  • El vector más corto corresponde a la máxima incertidumbre, y el más largo a la máxima certeza.
  • La varianzaσ2{\displaystyle \sigma ^{2}}de un vector de probabilidadpag=(pag1,pag2,,pagnorte){\displaystyle p=(p_{1},p_{2},\ldots ,p_{n})}Satisface:
σ2[0,norte1norte2].{\displaystyle \sigma ^{2}\in \left[\,0,\,{\tfrac {n-1}{n^{2}}}\,\right].}
El límite inferior se produce cuando todos los componentes son iguales.pagi=1/norte{\displaystyle p_{i}=1/n}y el límite superior cuando un componente es igual a1{\displaystyle 1}y el resto son0{\displaystyle 0}. [ 6 ]

Importancia de los límites de la varianza

Los límites de la varianza muestran que a medida que aumenta el número de resultados posiblesnorte{\displaystyle n}A medida que aumenta, la varianza necesariamente disminuye hacia cero. Como resultado, la incertidumbre asociada con cualquier resultado individual aumenta porque los componentes del vector de probabilidad se vuelven más iguales. En el trabajo empírico, esto a menudo motiva agrupar los resultados para reducirnorte{\displaystyle n}Aunque esto descarta cierta información contenida en los resultados originales, permite revelar la estructura más general de la distribución. La disminución de la varianza con el aumento denorte{\displaystyle n}refleja la misma tendencia hacia la uniformidad que subyace a la entropía en la teoría de la información y la mecánica estadística . [ 7 ]

Geometría del simplex de probabilidad

Un simplex es el objeto geométrico más simple que ocupa completamente la región de una dimensión dada definida por sus vértices. Se construye como la envoltura convexa de n puntos afínmente independientes: paranorte=2{\displaystyle n=2}es un segmento de línea, paranorte=3{\displaystyle n=3}un triángulo, paranorte=4{\displaystyle n=4}un tetraedro , y así sucesivamente.

El simplex de probabilidad (o simplex estándar ) es el ejemplo canónico de un simplex. Se obtiene tomando los n vectores base estándar.mi1=(1,0,0,,0),mi2=(0,1,0,,0),mi3=(0,0,1,0,,0), {\displaystyle e_{1}=(1,0,0,\ldots ,0),\quad e_{2}=(0,1,0,\ldots ,0),\quad e_{3}=(0,0,1,0,\ldots ,0),\ \ldots } como vértices y formando su envoltura convexa: Δnorte1={pagRnortepagi0, i=1nortepagi=1}.{\displaystyle \Delta _{n-1}=\{\,p\in \mathbb {R} ^{n}\mid p_{i}\geq 0,\ \sum _{i=1}^{n}p_{i}=1\,\}.}

Esto es un(norte1){\displaystyle (n-1)}simplex -dimensional situado en el hiperplano afínipagi=1{\displaystyle \sum _{i}p_{i}=1}. Una variable aleatoria connorte{\displaystyle n}Los posibles resultados viven naturalmente en esto(norte1){\displaystyle (n-1)}-simplex en lugar de unnorte{\displaystyle n}-símplex, porque el requisito de que todas las probabilidades sumen 1 elimina un grado de libertad.

Los componentespagi{\displaystyle p_{i}}Estas coordenadas sirven como coordenadas baricéntricas , lo que confiere a este simplex una interpretación inmediata en la teoría de la probabilidad: cada vértice corresponde a un resultado determinado, y cada punto interior representa una mezcla o distribución sobre los n resultados. Cada posible distribución de probabilidad discreta sobre n resultados corresponde a un único punto de este simplex, y, a la inversa, cada punto del simplex define una distribución única. El movimiento hacia un vértice a lo largo de las coordenadas baricéntricas corresponde a una mayor certeza sobre el resultado, mientras que el movimiento hacia el centro representa una mayor incertidumbre derivada de una distribución más uniforme.

El simplex de probabilidad sirve como el simplex canónico enRnorte{\displaystyle \mathbb {R} ^{n}}, puesto que cualquier otro simplex puede obtenerse a partir de él mediante una transformación afín , lo que lo convierte en la referencia estándar para análisis geométricos y probabilísticos. [ 8 ] [ 9 ]

Propiedades del simplex de probabilidad

Cada vector de probabilidad de dimensión n se encuentra dentro de un simplex de ( n − 1) dimensiones. La envoltura convexa de este simplex no forma una superficie suave que cambie gradualmente enRnorte{\displaystyle \mathbb {R} ^{n}}En cambio, tiene vértices afilados, aristas rectas y caras planas.

  • Probabilidad cero:

Asignar una probabilidad cero a un resultado corresponde a pasar a una cara de menor dimensión del simplex, ya que ese resultado ya no es posible.

  • Agregar un vértice:

Agregar un nuevo resultado posible a la variable aleatoria incrementa n en uno e introduce una nueva dimensión ortogonal. Aparece un nuevo vértice en esa dimensión, y cada cara del símplex anterior se combina con este vértice para formar una nueva faceta de una dimensión superior. Por ejemplo, cuando un triángulo (2-símplex) adquiere un nuevo vértice, al conectarlo a cada una de sus tres aristas se forman tres nuevas facetas triangulares, creando un tetraedro. En el siguiente paso, agregar otro vértice produciría un 4-símplex, cuyas facetas son tetraedros.

  • Hiperplano afín:

El simplex de probabilidad se encuentra en el hiperplano afín.ipagi=1{\displaystyle \sum _{i}p_{i}=1}enRnorte{\displaystyle \mathbb {R} ^{n}}Su vector normal esa=(1,1,,1){\displaystyle a=(1,1,\ldots ,1)}con normaa=norte{\displaystyle \|a\|={\sqrt {n}}}Por lo tanto, todos los puntos del hiperplano se encuentran dentro del ortante positivo a la misma distancia perpendicular.1/norte{\displaystyle 1/{\sqrt {n}}}desde el origen. Esto se debe a que la proyección de cualquier punto en el hiperplano sobre su vector normala{\displaystyle a}es constante, por definición de un plano. La distancia euclidiana desde el origen a los puntos individuales del plano varía, pero la longitud de su proyección perpendicular (la componente a lo largo dea{\displaystyle a}) permanece fijo. La independencia afín implica que los puntos de definición en el hiperespacio se ubican en relación unos con otros, no con respecto al origen como en el caso de la independencia lineal. Esto permite que los objetos afínmente independientes “floten” con respecto al origen, ya que su ecuación de definición incluye un término constante que especifica su desplazamiento a lo largo de la dirección normal. Al cambiar esta constante, el objeto completo se traslada paralelamente a sí mismo, conservando sus relaciones internas a la vez que cambia su posición en el espacio.

  • Centroide:

El centroide, que corresponde a la distribución uniforme, es =(1/norte,1/norte,,1/norte){\displaystyle u=(1/n,1/n,\ldots ,1/n)}Se encuentra a una distancia tanto euclidiana como perpendicular.=1/norte{\displaystyle \|u\|=1/{\sqrt {n}}}desde el origen, ya que la línea desde el origen hasta el centroide coincide con el vector normal del simplex. Cada vértice está a una distancia euclidiana igual.(norte1)/norte{\displaystyle {\sqrt {(n-1)/n}}}desde el centroide.

  • Conteniendo hipercubo:

El simplex de probabilidad ( n − 1)-dimensional se encuentra completamente dentro del hipercubo unitario n- dimensional. Ese hipercubo tiene un contenido total (o medida) de una unidad. Sin embargo, el significado de esa medida cambia con la dimensión: un cuadrado unitario (dimensión 2) tiene un área de uno (1 × 1 = 1), un cubo unitario (dimensión 3) tiene un volumen de uno (1 × 1 × 1 = 1), y un hipercubo unitario de dimensión 4 tiene una medida de uno (1⁴ = 1), y así sucesivamente. Aunque el contenido total permanece constante, la longitud de la diagonal euclidiana del cubo aumenta a medida quenorte{\displaystyle {\sqrt {n}}}, por lo que el hipercubo se vuelve geométricamente “más disperso” [ 10 ] a medida que n aumenta: sus vértices se alejan más aunque su contenido no cambie. El simplex de probabilidad ocupa solo una delgada sección ( n − 1)-dimensional a través de este hipercubo, formando una sección transversal a una distancia perpendicular de1/norte{\displaystyle 1/{\sqrt {n}}}desde el origen. [ 8 ] [ 9 ]

  • Volumen (Contenido):

El(norte1){\displaystyle (n-1)}El contenido (volumen) dimensional del simplex de probabilidad estándar se puede calcular utilizando la fórmula del determinante de Gram para el volumen del simplex. Eligiendo el vérticeminorte{\displaystyle e_{n}}Como punto base, los vértices restantes definen vectores de aristas.

vi=miiminorte,i=1,,norte1,{\displaystyle v_{i}=e_{i}-e_{n},\qquad i=1,\dots ,n-1,}

que se encuentran en el(norte1){\displaystyle (n-1)}Hiperplano afín de dimensión donde las coordenadaspagi{\displaystyle p_{i}}la suma es igual a uno. El paralelepípedo generado por estos vectores tiene contenido

Volpagara=det(GRAMO),{\displaystyle \operatorname {Vol} _{\mathrm {para} }={\sqrt {\det(G)}},}

dóndeGRAMO{\displaystyle G}es la matriz de GramGRAMOij=vivj{\displaystyle G_{ij}=v_{i}\cdot v_{j}}Esta matriz de Gram tiene determinantenorte{\displaystyle n}. [ 11 ] [ 12 ] Dado que este simplex ocupa exactamente1/(norte1)¡{\displaystyle 1/(n-1)!}del volumen de su paralelepípedo, su contenido es

Vnorte1=norte(norte1)¡.{\displaystyle V_{n-1}={\frac {\sqrt {n}}{(n-1)!}}.}

Esta cantidad disminuye factorialmente connorte{\displaystyle n}, por lo que aunque el simplex se encuentra dentro de la unidadnorte{\displaystyle n}-cubo (que tiene volumen 1), la fracción del volumen del hipercubo contenida en el simplex se vuelve superexponencialmente pequeña a medida quenorte{\displaystyle n}aumenta.

Véase también

Referencias

  1. Bertsekas, DP y Tsitsiklis, JN (2008). Introducción a la probabilidad (2.ª ed.). Athena Scientific. Disponible como apuntes de clase del MIT en formato PDF . Capítulo 2, pág. 3.
  2. ^ Jacobs, Konrad (1992), Estocástico discreto , Basler Lehrbücher [Libros de texto de Basilea], vol.  3, Birkhäuser Verlag, Basilea, pág.  45, doi : 10.1007/978-3-0348-8645-1 , ISBN 3-7643-2591-7, MR 1139766 .
  3. 1 2 3 Lee, Geoffrey (2016). "MATH1014 Álgebra Lineal Lección 10 Notas" (PDF) . Universidad Nacional Australiana . Recuperado el 16 de octubre de 2025 .
  4. StatisticsHowTo, Vector de probabilidad: definición, ejemplos, propiedades
  5. "Longitud de un vector de probabilidad" . CrossValidated . 2021. Consultado el 16 de octubre de 2025 .
  6. Bertsekas, DP y Tsitsiklis, JN (2008). Introducción a la probabilidad . 2.ª ed. Athena Scientific. pp. 53–54.
  7. Se necesita la fuente. Probablemente Cover & Thomas
  8. 1 2 Boyd, Stephen; Vandenberghe, Lieven (2004). Optimización convexa (PDF) . Cambridge University Press. pág. 32. 
  9. 1 2 Murphy, Kevin P. (2022). Aprendizaje automático probabilístico: una introducción . MIT Press. pág. 108. 
  10. “Más disperso” en este contexto significa que dos puntos elegidos al azar en el hipercubo unitario n -dimensional tienen una distancia esperada de raíz cuadrática media entre sí denorte/6{\displaystyle {\sqrt {n/6}}}, de modo que a medida que n aumenta, la separación promedio entre puntos aleatorios crece proporcionalmente anorte{\displaystyle {\sqrt {n}}}.
  11. Cover, Thomas M.; Thomas, Joy A. (2006). "12". Elementos de la teoría de la información (2.ª ed.). Wiley. 
  12. Gallier, Jean; Quaintance, Jocelyn (2020). "7.8". Álgebra lineal y optimización con aplicaciones al aprendizaje automático (PDF) . Springer.