Articulo de referencia

Valores E

En las pruebas de hipótesis estadísticas , los valores E cuantifican la evidencia en los datos en contra de una hipótesis nula (por ejemplo, "la moneda es justa" o, en un contex...

En las pruebas de hipótesis estadísticas , los valores E cuantifican la evidencia en los datos en contra de una hipótesis nula (por ejemplo, "la moneda es justa" o, en un contexto médico, "este nuevo tratamiento no tiene efecto"). Constituyen una alternativa más sólida a los valores P , subsanando algunas de las deficiencias de estos últimos.

A diferencia de los valores p, los valores e permiten la continuación opcional: los valores e de experimentos posteriores (por ejemplo, ensayos clínicos sobre el mismo tratamiento) pueden multiplicarse simplemente para obtener un nuevo valor e, denominado "producto", que representa la evidencia del experimento conjunto. Esto funciona incluso si, como suele ocurrir en la práctica, la decisión de realizar experimentos posteriores depende de forma vaga y desconocida de los datos observados en experimentos anteriores, y no se sabe de antemano cuántos ensayos se llevarán a cabo: el valor e resultante sigue siendo una cantidad significativa, lo que permite realizar pruebas con control del error de tipo I. Por este motivo, los valores e y su extensión secuencial, el proceso e , son los componentes básicos de los métodos estadísticos válidos en cualquier momento (por ejemplo, secuencias de confianza). Otra ventaja sobre los valores p es que cualquier promedio ponderado de valores e sigue siendo un valor e, incluso si los valores e individuales son arbitrariamente dependientes. Esta es una de las razones por las que los valores e también han demostrado ser herramientas útiles en las pruebas múltiples . [ 1 ]

Los valores E pueden interpretarse de varias maneras: primero, un valor E puede interpretarse como un reescalamiento de una prueba que se presenta en una escala más apropiada que facilita su fusión. [ 2 ] Segundo, el recíproco de un valor E es un valor p, pero no cualquier valor p: un valor p especial para el cual un rechazo "en el nivel p" conserva una garantía generalizada de error de tipo I. [ 3 ] Tercero, son generalizaciones amplias de las razones de verosimilitud y también están relacionados con los factores de Bayes , aunque son distintos de ellos . Cuarto, tienen una interpretación como apuestas. Quinto, en un contexto secuencial, también pueden interpretarse como incrementos de supermartingalas no negativas . El interés en los valores E se ha disparado desde 2019, cuando se acuñó el término "valor E" y varios grupos de investigación lograron resultados revolucionarios. El primer artículo de revisión apareció en 2023. [ 4 ]

Definición y fundamentos matemáticos

Sea la hipótesis nulaH0{\displaystyle H_{0}}se dará como un conjunto de distribuciones para los datosY{\displaystyle Y}. GeneralmenteY=(incógnita1,,incógnitaτ){\displaystyle Y=(X_{1},\ldots ,X_{\tau })}con cadaincógnitai{\displaystyle X_{i}}un único resultado yτ{\displaystyle \tau }un tamaño de muestra fijo o un tiempo de parada. Nos referiremos a tales Y{\displaystyle Y}, que representan la secuencia completa de resultados de un experimento estadístico, como una muestra o lote de resultados. Pero en algunos casosY{\displaystyle Y}También puede tratarse de una serie de resultados no ordenados o de un único resultado.

Una variable e o estadístico e es una variable aleatoria no negativa.mi=mi(Y){\displaystyle E=E(Y)}de tal manera que bajo todasPAGH0{\displaystyle P\in H_{0}}, su valor esperado está limitado por 1:

miPAG[mi]1{\displaystyle {\mathbb {E} }_{P}[E]\leq 1}.

El valor tomado por la variable emi{\displaystyle E}Se denomina valor e . En la práctica, el término valor e (un número) se usa a menudo cuando en realidad se hace referencia a la variable e subyacente (una variable aleatoria, es decir, una función medible de los datos).

Interpretaciones

Como la interpretación continua de una prueba

Una prueba para una hipótesis nulaH0{\displaystyle H_{0}}Tradicionalmente se modela como una funciónϕ{\displaystyle \phi }desde los datos hasta{no rechazar H0, rechazar H0}{\displaystyle \{{\text{not reject }}H_{0},{\text{ reject }}H_{0}\}}Una pruebaϕα{\displaystyle \phi _{\alpha }}Se dice que es válido para el nivelα{\displaystyle \alpha }si

PAG(ϕα=rechazar H0)α, por cada PAGH0.{\displaystyle P(\phi _{\alpha }={\text{reject }}H_{0})\leq \alpha ,{\text{ for every }}P\in H_{0}.}

Esto se resume de forma clásica y conveniente como una función.ϕα{\displaystyle \phi _{\alpha }}desde los datos hasta{0,1}{\displaystyle \{0,1\}}que satisface

miPAG[ϕα]α, por cada PAGH0{\displaystyle \mathbb {E} ^{P}[\phi _{\alpha }]\leq \alpha ,{\text{ for every }}P\in H_{0}}.

Además, esto a veces se generaliza para permitir la aleatorización externa al dejar que la pruebaϕα{\displaystyle \phi _{\alpha }}tomar valor en[0,1]{\displaystyle [0,1]}Aquí, su valor se interpreta como una probabilidad con la que posteriormente se debería rechazar la hipótesis.

Un problema al modelar una prueba de esta manera es que el espacio de decisión tradicional{no rechazar H0, rechazar H0}{\displaystyle \{{\text{not reject }}H_{0},{\text{ reject }}H_{0}\}}o {0,1}{\displaystyle \{0,1\}}no codifica el nivelα{\displaystyle \alpha }en el que se realiza la pruebaϕα{\displaystyle \phi _{\alpha }}rechazos. Esto es, en el mejor de los casos, extraño, porque un rechazo al nivel del 1% es una afirmación mucho más sólida que un rechazo al nivel del 10%. Un espacio de decisión más adecuado parece ser{no rechazar H0, rechazar H0 en el nivel α}{\displaystyle \{{\text{not reject }}H_{0},{\text{ reject }}H_{0}{\text{ at level }}\alpha \}}.

El valor e puede interpretarse como la solución a este problema. De hecho, podemos reescalar desde{0,1}{\displaystyle \{0,1\}}a{0,1/α}{\displaystyle \{0,1/\alpha \}}y[0,1]{\displaystyle [0,1]}a[0,1/α]{\displaystyle [0,1/\alpha ]}al reescalar la prueba según su nivel:

εα=ϕα/α{\displaystyle \varepsilon _{\alpha }=\phi _{\alpha }/\alpha },

donde denotamos una prueba en esta escala de evidencia porεα{\displaystyle \varepsilon _{\alpha }}para evitar confusiones. Dicha prueba es entonces válida si

miPAG[εα]1, por cada PAGH0{\displaystyle \mathbb {E} ^{P}[\varepsilon _{\alpha }]\leq 1,{\text{ for every }}P\in H_{0}}.

Es decir: es válido si es un valor e.

De hecho, esto revela que los valores e están limitados a[0,1/α]{\displaystyle [0,1/\alpha ]}son pruebas aleatorias reescaladas, que se interpretan continuamente como evidencia en contra de la hipótesis. El valor e estándar que toma valor en[0,]{\displaystyle [0,\infty ]}aparece como una generalización de una prueba de nivel 0. [ 2 ]

Esta interpretación demuestra que los valores E son fundamentales para las pruebas: son equivalentes a las pruebas, apenas veladas por un reescalamiento. Desde esta perspectiva, puede resultar sorprendente que los valores E típicos se vean muy diferentes de las pruebas tradicionales: maximizar el objetivo

miQ[εα]{\displaystyle \mathbb {E} ^{Q}[\varepsilon _{\alpha }]}

para una hipótesis alternativaH1={Q}{\displaystyle H_{1}=\{Q\}}produciría pruebas tradicionales al estilo Neyman-Pearson. De hecho, esto maximiza la probabilidad bajoQ{\displaystyle Q}esoεα=1/α{\displaystyle \varepsilon _{\alpha }=1/\alpha }.

Pero si interpretamos continuamente el valor de la pruebaεα{\displaystyle \varepsilon _{\alpha }}como evidencia en contra de la hipótesis, entonces también podríamos estar interesados ​​en maximizar diferentes objetivos como

miQ[registroεα]{\displaystyle \mathbb {E} ^{Q}[\log \varepsilon _{\alpha }]}.

Esto produce pruebas que son notablemente diferentes de las pruebas tradicionales de Neyman-Pearson, y más adecuadas cuando se combinan mediante la multiplicación ya que son positivas con probabilidad 1 bajoQ{\displaystyle Q}Desde este punto de vista, la principal innovación del valor electrónico en comparación con las pruebas tradicionales es maximizar un objetivo de potencia diferente. [ 2 ]

Como valores p con una garantía de error de tipo I más fuerte dependiente de los datos

Para cualquier variable emi{\displaystyle E} y cualquier0<α1{\displaystyle 0<\alpha \leq 1}y todoPAGH0{\displaystyle P\in H_{0}}, sostiene que

PAG(mi1α)=PAG(1/miα) () α{\displaystyle P\left(E\geq {\frac {1}{\alpha }}\right)=P(1/E\leq \alpha )\ {\overset {(*)}{\leq }}\ \alpha }.

Esto significapag=1/mi{\displaystyle p^{\prime }=1/E}es un valor p válido. Además, la prueba basada en el valor e con nivel de significanciaα{\displaystyle \alpha }, que rechazaPAG0{\displaystyle P_{0}}sipagα{\displaystyle p^{\prime }\leq \alpha }, tiene un error de tipo I acotado porα{\displaystyle \alpha }Sin embargo, mientras que con los valores p estándar la desigualdad (*) anterior suele ser una igualdad (con datos continuos) o casi una igualdad (con datos discretos), esto no ocurre con las variables e. Esto hace que las pruebas basadas en valores e sean más conservadoras (con menor potencia) que las basadas en valores p estándar.

A cambio de este conservadurismo, el valor ppag=1/mi{\displaystyle p^{\prime }=1/E}viene con una garantía más sólida. En particular, para cada nivel de significancia que posiblemente dependa de los datos.α~>0{\displaystyle {\widetilde {\alpha }}>0}, tenemos

mi[PAG(pagα~α~)α~]1,{\displaystyle \mathbb {E} \left[{\frac {P(p^{\prime }\leq {\widetilde {\alpha }}\mid {\widetilde {\alpha }})}{\widetilde {\alpha }}}\right]\leq 1,}

si y solo simi[1/pag]1{\displaystyle \mathbb {E} [1/p^{\prime }]\leq 1}. Esto significa que un valor p satisface esta garantía si y solo si es el recíproco.1/mi{\displaystyle 1/E}de una variable emi{\displaystyle E}. [ 3 ]

La interpretación de esta garantía es que, en promedio, la distorsión relativa del error de tipo IPAG(pagα~α~)/α~{\displaystyle P(p^{\prime }\leq {\widetilde {\alpha }}\mid {\widetilde {\alpha }})/{\widetilde {\alpha }}}causado por el uso de un nivel dependiente de los datosα~{\displaystyle {\widetilde {\alpha }}}Se controla para cada elección del nivel de significancia dependiente de los datos. Los valores p tradicionales solo satisfacen esta garantía para niveles independientes de los datos o preespecificados.

Esta garantía más fuerte también se denomina post-hocα{\displaystyle \alpha }Error de tipo I , ya que permite elegir el nivel de significancia después de observar los datos: post-hoc. Un valor p que satisface esta garantía también se denomina valor p post-hoc . Comopag{\displaystyle p^{\prime }}es un valor p post-hoc si y solo sipag=1/mi{\displaystyle p^{\prime }=1/E}para algún valor emi{\displaystyle E}Es posible considerar esto como una definición alternativa de un valor E.

Bajo este error de tipo I post-hoc, el problema de elegir el nivel de significanciaα{\displaystyle \alpha }desaparece: podemos simplemente elegir el nivel más pequeño dependiente de los datos en el que rechazamos la hipótesis igualándolo al valor p post-hoc:α~=pag{\displaystyle {\widetilde {\alpha }}=p^{\prime }}De hecho, en este nivel dependiente de los datos tenemos

mi[PAG(pagpagpag)pag]=mi[1pag]1,{\displaystyle \mathbb {E} \left[{\frac {P(p^{\prime }\leq p^{\prime }\mid p^{\prime })}{p^{\prime }}}\right]=\mathbb {E} \left[{\frac {1}{p^{\prime }}}\right]\leq 1,}

desde1/pag{\displaystyle 1/p^{\prime }}es una variable e. En consecuencia, podemos rechazar verdaderamente a nivelpag{\displaystyle p^{\prime }}y aún así mantener la garantía de error de tipo I post-hoc. Para un valor p tradicionalpag{\displaystyle p}, rechazar en el nivel p no conlleva tal garantía.

Además, un valor p post hoc hereda las propiedades opcionales de continuación y fusión de los valores e. Pero en lugar de un promedio ponderado aritmético, un promedio armónico ponderado de valores p post hoc sigue siendo un valor p post hoc.

Como generalizaciones de razones de verosimilitud

DejarH0={PAG0}{\displaystyle H_{0}=\{P_{0}\}}Sea una hipótesis nula simple.Q{\displaystyle Q}ser cualquier otra distribución enY{\displaystyle Y}y dejar

mi:=q(Y)pag0(Y){\displaystyle E:={\frac {q(Y)}{p_{0}(Y)}}}

sea ​​su razón de verosimilitud. Entoncesmi{\displaystyle E}es una variable e. Por el contrario, cualquier variable e relativa a una simple nulaH0={PAG0}{\displaystyle H_{0}=\{P_{0}\}}se puede escribir como una razón de verosimilitud con respecto a alguna distribuciónQ{\displaystyle Q}Por lo tanto, cuando la hipótesis nula es simple, las variables e coinciden con las razones de verosimilitud. Sin embargo, también existen variables e para hipótesis nulas compuestas generales, y en ese caso pueden considerarse generalizaciones de las razones de verosimilitud. Las dos principales formas de construir variables e, UI y RIPr (véase más adelante), dan lugar a expresiones que también son variaciones de las razones de verosimilitud.

Otras dos generalizaciones estándar de la razón de verosimilitud son (a) la razón de verosimilitud generalizada, tal como se utiliza en la prueba de razón de verosimilitud clásica estándar, y (b) el factor de Bayes . Es importante destacar que ni (a) ni (b) son variables e en general: las razones de verosimilitud generalizadas en el sentido (a) no son variables e a menos que la alternativa sea simple (véase más adelante en "inferencia universal"). Los factores de Bayes son variables e si la hipótesis nula es simple. Para ver esto, observe que, siQ={Qθ:θΘ}{\displaystyle {\mathcal {Q}}=\{Q_{\theta }:\theta \in \Theta \}}representa un modelo estadístico yw{\displaystyle w}una densidad previa enΘ{\displaystyle \Theta }, entonces podemos establecerQ{\displaystyle Q}como se indicó anteriormente para ser la distribución marginal de Bayes con densidad

q(Y)=qθ(Y)w(θ)dθ{\displaystyle q(Y)=\int q_{\theta }(Y)w(\theta )d\theta }

y luegomi=q(Y)/pag0(Y){\displaystyle E=q(Y)/p_{0}(Y)}es también un factor de Bayes deH0{\displaystyle H_{0}}vs.H1:=Q{\displaystyle H_{1}:={\mathcal {Q}}}Si la hipótesis nula es compuesta, entonces algunas variables e especiales pueden escribirse como factores de Bayes con algunas distribuciones a priori muy especiales, pero la mayoría de los factores de Bayes que se encuentran en la práctica no son variables e y muchas variables e que se encuentran en la práctica no son factores de Bayes. [ 4 ]

Como apuestas

Supongamos que puedes comprar un boleto por 1 unidad monetaria, con una ganancia no negativa.mi=mi(Y){\displaystyle E=E(Y)}. Las declaraciones "mi{\displaystyle E}"es una variable e" y "si la hipótesis nula es verdadera, no esperas ganar dinero si participas en esta apuesta" son lógicamente equivalentes. Esto se debe a quemi{\displaystyle E}Ser una variable e significa que la ganancia esperada al comprar el boleto es el pago menos el costo, es decir mi1{\displaystyle E-1}, que tiene expectativas0{\displaystyle \leq 0}. Basándonos en esta interpretación, el valor e del producto para una secuencia de pruebas puede interpretarse como la cantidad de dinero que se ha ganado apostando secuencialmente con pagos dados por las variables e individuales y reinvirtiendo siempre todas las ganancias. [ 5 ]

La interpretación de las apuestas se hace particularmente visible si reescribimos una variable e como mi:=1+λU{\displaystyle E:=1+\lambda U}dónde U{\displaystyle U}tiene expectativas 0{\displaystyle \leq 0}bajo todo PAGH0{\displaystyle P\in H_{0}}y λR{\displaystyle \lambda \in {\mathbb {R} }}se elige de modo que mi0{\displaystyle E\geq 0}como Cualquier variable e puede escribirse en el 1+λU{\displaystyle 1+\lambda U}Aunque con hipótesis nulas paramétricas , escribirlo como una razón de verosimilitud suele ser matemáticamente más conveniente. 1+λU{\displaystyle 1+\lambda U}Por otro lado, la forma suele ser más conveniente en entornos no paramétricos . Como ejemplo prototípico, [ 6 ] considérese el caso que Y=(incógnita1,,incógnitanorte){\displaystyle Y=(X_{1},\ldots ,X_{n})}con elincógnitai{\displaystyle X_{i}}tomando valores en el intervalo acotado[0,1]{\displaystyle [0,1]}. De acuerdo aH0{\displaystyle H_{0}}, elincógnitai{\displaystyle X_{i}}son i.i.d. según una distribuciónPAG{\displaystyle P}con significaμ{\displaystyle \mu }; no hay otras suposiciones sobrePAG{\displaystyle P}se hacen. Entonces podemos construir primero una familia de variables e para resultados individuales,mii,λ:=1+λ(incógnitaiμ){\displaystyle E_{i,\lambda }:=1+\lambda (X_{i}-\mu )}, para cualquierλ[1/(1μ),1/μ]{\displaystyle \lambda \in [-1/(1-\mu ),1/\mu ]}(estos son los λ{\displaystyle \lambda }para quémii,λ{\displaystyle E_{i,\lambda }}(se garantiza que es no negativo). Entonces podemos definir una nueva variable e para el vector de datos completo.Y{\displaystyle Y}al tomar el producto

mi:=i=1nortemii,λ˘|incógnitai1{\displaystyle E:=\prod _{i=1}^{n}E_{i,{\breve {\lambda }}|X^{i-1}}},

dóndeλ˘|incógnitai1{\displaystyle {\breve {\lambda }}|X^{i-1}}es una estimación paraλ{\displaystyle {\lambda }}, basándose únicamente en datos pasadosincógnitai1=(incógnita1,,incógnitai1){\displaystyle X^{i-1}=(X_{1},\ldots ,X_{i-1})}y diseñado para hacer mii,λ{\displaystyle E_{i,\lambda }}lo más amplio posible en el sentido de "e-power" o "GRO" (véase más abajo). Waudby-Smith y Ramdas utilizan este enfoque para construir intervalos de confianza "no paramétricos" para la media que tienden a ser significativamente más estrechos que los basados ​​en métodos más clásicos como los límites de Chernoff, Hoeffding y Bernstein . [ 6 ]

Una propiedad fundamental: continuación opcional

Los valores E son más adecuados que los valores p cuando se prevén pruebas de seguimiento que impliquen la misma hipótesis nula con datos o configuraciones experimentales diferentes. Esto incluye, por ejemplo, la combinación de resultados individuales en un metaanálisis . La ventaja de los valores E en este contexto es que permiten una continuación opcional. De hecho, se han empleado en lo que podría ser el primer metaanálisis totalmente "en línea" del mundo con control explícito del error de tipo I. [ 7 ]

De manera informal, la continuación opcional implica que el producto de cualquier número de valores e,mi(1),mi(2),{\displaystyle E_{(1)},E_{(2)},\ldots }, definido en muestras independientes Y(1),Y(2),{\displaystyle Y_{(1)},Y_{(2)},\ldots }, es en sí mismo un valor e, incluso si se permite que la definición de cada valor e dependa de todos los resultados anteriores, e independientemente de la regla que se utilice para decidir cuándo dejar de recopilar nuevas muestras (por ejemplo, para realizar nuevos ensayos). De ello se deduce que, para cualquier nivel de significancia 0<α<1{\displaystyle 0<\alpha <1}, si la hipótesis nula es verdadera, entonces la probabilidad de que un producto de valores e llegue a ser mayor que1/α{\displaystyle 1/\alpha }está delimitado porα{\displaystyle \alpha }Por lo tanto, si decidimos combinar las muestras observadas hasta ahora y rechazar la hipótesis nula si el valor e del producto es mayor que1/α{\displaystyle 1/\alpha }, entonces nuestra probabilidad de error de tipo I permanece limitada porα{\displaystyle \alpha }Decimos que las pruebas basadas en valores e siguen siendo seguras (válidas de tipo I) bajo continuación opcional .

Matemáticamente, esto se demuestra mostrando primero que las variables e del producto forman una martingala discreta en el tiempo no negativa en la filtración generada por Y(1),Y(2),{\displaystyle Y_{(1)},Y_{(2)},\ldots } (las variables individuales e son entonces incrementos de esta martingala). Los resultados se derivan entonces del teorema de parada opcional de Doob y la desigualdad de Ville .

Ya utilizamos implícitamente variables electrónicas de producto en el ejemplo anterior, donde definimos variables electrónicas en función de resultados individuales.incógnitai{\displaystyle X_{i}}y diseñó un nuevo valor electrónico tomando productos. Por lo tanto, en el ejemplo, los resultados individualesincógnitai{\displaystyle X_{i}}desempeñan el papel de "lotes" (muestras completas) Y(j){\displaystyle Y_{(j)}}arriba, y por lo tanto podemos incluso realizar una parada opcional "dentro" del lote original.Y{\displaystyle Y}: podemos detener el análisis de datos en cualquier resultado individual (no solo en un "lote de resultados") que nos guste, por cualquier motivo, y rechazarlo si el producto hasta ahora excede1/α{\displaystyle 1/\alpha }No todas las variables electrónicas están definidas para lotes de resultados.Y{\displaystyle Y}Sin embargo, se puede descomponer como un producto de valores e por resultado de esta manera. Si esto no es posible, no podemos utilizarlos para la detención opcional (dentro de una muestra).Y{\displaystyle Y}) pero solo para continuación opcional (de una muestra)Y(j){\displaystyle Y_{(j)}}al siguienteY(j+1){\displaystyle Y_{(j+1)}}etcétera).

Construcción y optimización

Si establecemosmi:=1{\displaystyle E:=1}Independientemente de los datos, obtenemos un valor e trivial : es una variable e por definición, pero nunca nos permitirá rechazar la hipótesis nula. Este ejemplo muestra que algunas variables e pueden ser mejores que otras, en un sentido que se definirá más adelante. Intuitivamente, una buena variable e es aquella que tiende a ser grande (mucho mayor que 1) si la alternativa es verdadera. Esto es análogo a la situación con los valores p: tanto los valores e como los valores p pueden definirse sin hacer referencia a una alternativa, pero si hay una alternativa disponible, nos gustaría que fueran pequeños (valores p) o grandes (valores e) con alta probabilidad . En las pruebas de hipótesis estándar, la calidad de una prueba válida se formaliza mediante la noción de potencia estadística, pero esta noción debe modificarse adecuadamente en el contexto de los valores e. [ 4 ] [ 8 ]

La noción estándar de calidad de una variable electrónica en relación con una alternativa dadaH1{\displaystyle H_{1}}, utilizado por la mayoría de los autores en el campo, es una generalización del criterio de Kelly en economía y (dado que exhibe estrechas relaciones con el poder clásico) a veces se denomina poder e ; [ 9 ] la variable e óptima en este sentido se conoce como log-óptima o tasa de crecimiento óptima (a menudo abreviada como GRO [ 8 ] ). En el caso de una alternativa simpleH1={Q}{\displaystyle H_{1}=\{Q\}}, la potencia electrónica de una variable electrónica dadaS{\displaystyle S}se define simplemente como la expectativa miQ[registromi]{\displaystyle {\mathbb {E} }_{Q}[\log E]}; en el caso de alternativas compuestas, existen varias versiones (por ejemplo, caso absoluto en el peor de los casos, caso relativo en el peor de los casos) [ 8 ] de e-power y GRO.

Alternativa simple, hipótesis nula simple: razón de verosimilitud

DejarH0={PAG0}{\displaystyle H_{0}=\{P_{0}\}}yH1={Q}{\displaystyle H_{1}=\{Q\}}ambos sean simples. Entonces la razón de verosimilitud variable e mi=q(Y)/pag0(Y){\displaystyle E=q(Y)/p_{0}(Y)}tiene potencia electrónica máxima en el sentido anterior, es decir, es GRO. [ 4 ]

Alternativa simple, nula compuesta: proyección de información inversa (RIPr)

Dejar H1={Q}{\displaystyle H_{1}=\{Q\}}sea ​​simple yH0={PAGθ:θΘ0}{\displaystyle H_{0}=\{P_{\theta }:\theta \in \Theta _{0}\}}ser compuesto, de tal manera que todos los elementos deH0H1{\displaystyle H_{0}\cup H_{1}}tienen densidades (denotadas por letras minúsculas) relativas a la misma medida subyacente. Grünwald et al. muestran que bajo condiciones de regularidad débil, la variable e de GRO existe, es esencialmente única y está dada por

mi:=q(Y)pagQ(Y){\displaystyle E:={\frac {q(Y)}{p_{\curvearrowleft Q}(Y)}}}

dóndepagQ{\displaystyle p_{\curvearrowleft Q}}es la Proyección de Información Inversa (RIPr) de Q{\displaystyle Q}hasta la envoltura convexa de H0{\displaystyle H_{0}}. [ 8 ] Bajo condiciones de regularidad adicionales (y en todos los casos prácticamente relevantes encontrados hasta ahora), pagQ{\displaystyle p_{\curvearrowleft Q}}viene dada por una densidad marginal de Bayes : existe una distribución específica y única.W{\displaystyle W}en Θ0{\displaystyle \Theta _{0}}de tal manera que pagQ(Y)=Θ0pagθ(Y)dW(θ){\displaystyle p_{\curvearrowleft Q}(Y)=\int _{\Theta _{0}}p_{\theta }(Y)dW(\theta )}.

Alternativa simple, nula compuesta: inferencia universal (IU)

En el mismo contexto que el anterior, [ 10 ] muestran que, bajo ninguna condición de regularidad,

mi=q(Y)sorberPAGH0pag(Y)(=q(Y)pagθ^Y(Y)){\displaystyle E={\frac {q(Y)}{\sup _{P\in H_{0}}p(Y)}}\left(={\frac {q(Y)}{{p}_{{\hat {\theta }}\mid Y}(Y)}}\right)}

es una variable e (con la segunda igualdad cumpliéndose si el MLE ( estimador de máxima verosimilitud ) θ^Y{\displaystyle {\hat {\theta }}\mid Y}basado en datosY{\displaystyle Y}siempre está bien definido). Esta forma de construir variables e se ha denominado método de inferencia universal (UI) , donde "universal" se refiere al hecho de que no se requieren condiciones de regularidad.

Alternativa compuesta, nulo simple

Ahora dejemos H0={PAG}{\displaystyle H_{0}=\{P\}}sea ​​simple y H1={Qθ:θΘ1}{\displaystyle H_{1}=\{Q_{\theta }:\theta \in \Theta _{1}\}}ser compuesto, de tal manera que todos los elementos deH0H1{\displaystyle H_{0}\cup H_{1}}tienen densidades relativas a la misma medida subyacente. Ahora existen dos formas genéricas y estrechamente relacionadas de obtener variables e que se aproximan al crecimiento óptimo (redefinidas adecuadamente [ 4 ] para compuesto).H1{\displaystyle H_{1}}): el método de mezclas de Robbins y el método de sustitución , originalmente debido a Wald [ 11 ] pero, en esencia, redescubierto por Philip Dawid como "sustitución prequential" [ 12 ] y Jorma Rissanen como " MDL predictivo " [ 13 ] . El método de mezclas esencialmente equivale a "ser bayesiano sobre el numerador" (la razón por la que no se llama "método bayesiano" es que, cuando tanto la hipótesis nula como la alternativa son compuestas, el numerador a menudo puede no ser una marginal bayesiana): postulamos cualquier distribución previaW{\displaystyle W}enΘ1{\displaystyle \Theta _{1}}y establecer

q¯W(Y):=Θ1qθ(Y)dW(θ){\displaystyle {\bar {q}}_{W}(Y):=\int _{\Theta _{1}}q_{\theta }(Y)dW(\theta )}

y utilice la variable eq¯W(Y)/pag(Y){\displaystyle {\bar {q}}_{W}(Y)/p(Y)}.

Para explicar el método de conexión, supongamos queY=(incógnita1,,incógnitanorte){\displaystyle Y=(X_{1},\ldots ,X_{n})}dónde incógnita1,incógnita2,{\displaystyle X_{1},X_{2},\ldots } constituir un proceso estocástico y dejar θ˘incógnitai{\displaystyle {\breve {\theta }}\mid X^{i}}ser un estimador de θΘ1{\displaystyle \theta \in \Theta _{1}}basado en datos incógnitai=(incógnita1,,incógnitai){\displaystyle X^{i}=(X_{1},\ldots ,X_{i})} parai0{\displaystyle i\geq 0}En la práctica, normalmente se toma un estimador de máxima verosimilitud "suavizado" (como, por ejemplo, los coeficientes de regresión en la regresión de cresta ), establecido inicialmente en algún "valor predeterminado".θ˘incógnita0:=θ0{\displaystyle {\breve {\theta }}\mid X^{0}:=\theta _{0}}Ahora se construye recursivamente una densidad q¯θ˘{\displaystyle {\bar {q}}_{\breve {\theta }}}paraincógnitanorte{\displaystyle X^{n}} al establecer q¯θ˘(incógnitanorte)=i=1norteqθ˘incógnitai1(incógnitaiincógnitai1){\displaystyle {\bar {q}}_{\breve {\theta }}(X^{n})=\prod _{i=1}^{n}q_{{\breve {\theta }}\mid X^{i-1}}(X_{i}\mid X^{i-1})}.

En efecto, tanto el método de mezclas como el método de sustitución pueden considerarse como el aprendizaje de una instancia específica de la alternativa que explique bien los datos. [ 4 ]

Nulo compuesto y alternativo

En configuraciones paramétricas , podemos simplemente combinar los métodos principales para la alternativa compuesta (obteniendo q¯θ˘{\displaystyle {\bar {q}}_{\breve {\theta }}}oq¯W{\displaystyle {\bar {q}}_{W}}) con los métodos principales para el nulo compuesto (UI o RIPr, utilizando la distribución única q¯θ˘{\displaystyle {\bar {q}}_{\breve {\theta }}}o q¯W{\displaystyle {\bar {q}}_{W}}como alternativa). Tenga en cuenta en particular que cuando se utiliza el método de complemento junto con el método de interfaz de usuario, la variable e resultante tendrá el siguiente aspecto:

i=1norteqθ˘incógnitai1(incógnitai)qθ^incógnitanorte(incógnitanorte){\displaystyle {\frac {\prod _{i=1}^{n}q_{{\breve {\theta }}\mid X^{i-1}}(X_{i})}{q_{{\hat {\theta }}\mid X^{n}}(X^{n})}}}

que se asemeja, pero sigue siendo fundamentalmente diferente, de la razón de verosimilitud generalizada tal como se utiliza en la prueba clásica de razón de verosimilitud .

La ventaja del método UI en comparación con RIPr es que (a) se puede aplicar siempre que el MLE se pueda calcular de manera eficiente; en muchos de estos casos, no se sabe si/cómo se puede calcular la proyección de información inversa; y (b) que proporciona "automáticamente" no solo una variable e sino un proceso e completo (véase más abajo): si reemplazamosnorte{\displaystyle n}en la fórmula anterior por un tiempo de parada generalτ{\displaystyle \tau }, la relación resultante sigue siendo una variable e; para la proyección de información inversa, esta generación automática de procesos e solo se cumple en casos especiales.

Su principal desventaja en comparación con RIPr es que puede ser sustancialmente subóptimo en términos del criterio e-power/GRO, lo que significa que conduce a pruebas que también tienen menos potencia estadística clásica que los métodos basados ​​en RIPr. Por lo tanto, para entornos en los que el método RIPr es computacionalmente factible y conduce a procesos e, es preferible. Estos incluyen la prueba z, la prueba t y las regresiones lineales correspondientes, pruebas de k muestras con distribuciones de Bernoulli, Gaussiana y Poisson y la prueba de log-rank ( hay un paquete de R disponible para un subconjunto de estas), así como pruebas de independencia condicional bajo una suposición de modelo-X . [ 14 ] Sin embargo, en muchos otros problemas de pruebas estadísticas, actualmente (2023) se desconoce si existen implementaciones rápidas de la proyección de información inversa, y es muy posible que no existan (por ejemplo, modelos lineales generalizados sin la suposición de modelo-X).

En entornos no paramétricos (como al probar una media como en el ejemplo anterior, o al realizar pruebas no paramétricas de 2 muestras), a menudo es más natural considerar variables e de la 1+λU{\displaystyle 1+\lambda U}tipo. Sin embargo, aunque superficialmente parecen muy diferentes de las razones de verosimilitud, a menudo pueden interpretarse como tales y, a veces, incluso pueden reinterpretarse como la implementación de una versión de la construcción RIPr. [ 4 ]

Finalmente, en la práctica, a veces se recurre a combinaciones matemáticamente o computacionalmente convenientes de RIPr, UI y otros métodos. [ 4 ] Por ejemplo, RIPr se aplica para obtener variables e óptimas para pequeños bloques de resultados y luego se multiplican para obtener variables e para muestras más grandes; estas variables e funcionan bien en la práctica, pero ya no pueden considerarse óptimas.

Un tercer método de construcción: calibración p-a-e (y e-a-p)

Existen funciones que convierten valores p en valores e. [ 15 ] [ 16 ] [ 17 ] Dichas funciones se denominan calibradores p-a-e . Formalmente, un calibrador es una función decreciente no negativa.F:[0,1][0,]{\displaystyle f:[0,1]\rightarrow [0,\infty ]}que, al aplicarse a una variable p (una variable aleatoria cuyo valor es un valor p ), produce una variable e. Un calibradorF{\displaystyle f}Se dice que domina a otro calibrador.gramo{\displaystyle g}siFgramo{\displaystyle f\geq g}y esta dominación es estricta si la desigualdad es estricta. Un calibrador admisible es aquel que no está estrictamente dominado por ningún otro calibrador. Se puede demostrar que para que una función sea un calibrador, debe tener una integral de como máximo 1 sobre la medida de probabilidad uniforme .

Una familia de calibradores admisibles viene dada por el conjunto de funciones {Fκ:0<κ<1}{\displaystyle \{f_{\kappa }:0<\kappa <1\}}conFκ(pag):=κpagκ1{\displaystyle f_{\kappa }(p):=\kappa p^{\kappa -1}}Otro calibrador se obtiene integrandoκ{\displaystyle \kappa }:

01κpagκ1dκ=1pag+pagregistropagpag(registropag)2{\displaystyle \int _{0}^{1}\kappa p^{\kappa -1}d\kappa ={\frac {1-p+p\log p}{p(-\log p)^{2}}}}

Por el contrario, un calibrador e-to-p transforma los valores e de nuevo en variables p. Curiosamente, el siguiente calibrador supera a todos los demás calibradores e-to-p:

F(t):=min(1,1/t){\displaystyle f(t):=\min(1,1/t)}.

Aunque de importancia teórica, la calibración no se utiliza mucho en el diseño práctico de variables e, ya que las variables e resultantes a menudo están lejos de ser óptimas para el crecimiento en cualquier caso dado.H1{\displaystyle H_{1}}. [ 8 ]

Procesos electrónicos

Definición

Ahora consideremos los datos.incógnita1,incógnita2,{\displaystyle X_{1},X_{2},\ldots }llegando secuencialmente, constituyendo un proceso estocástico de tiempo discreto . Seami1,mi2,{\displaystyle E_{1},E_{2},\ldots }ser otro proceso de tiempo discreto donde para cadanorte,minorte{\displaystyle n,E_{n}}puede escribirse como una función (medible) de la primera(incógnita1,,incógnitanorte){\displaystyle (X_{1},\ldots ,X_{n})}resultados. Llamamosmi1,mi2,{\displaystyle E_{1},E_{2},\ldots }un proceso electrónico si por algún tiempo de paradaτ,miτ{\displaystyle \tau ,E_{\tau }}es una variable e, es decir, para todosPAGH0:miPAG[miτ]1{\displaystyle P\in H_{0}:{\mathbb {E} }_{P}[E_{\tau }]\leq 1}.

En los casos básicos, el tiempo de parada puede definirse mediante cualquier regla que determine, en cada tamaño de muestranorte{\displaystyle n}, basándose únicamente en los datos observados hasta el momento, decidir si se debe dejar de recopilar datos o no. Por ejemplo, esto podría ser "detenerse cuando se hayan observado cuatro resultados consecutivos mayores que 1", "detenerse ennorte=100{\displaystyle n=100}", o el nivel-α{\displaystyle \alpha }-regla agresiva , "detente tan pronto como puedas rechazar en el nivelα{\displaystyle \alpha }-nivel, es decir, en el más pequeñonorte{\displaystyle n}de tal manera que minorte1/α{\displaystyle E_{n}\geq 1/\alpha }", y así sucesivamente. Con los procesos electrónicos, obtenemos una variable electrónica con cualquier regla de este tipo. Fundamentalmente, el analista de datos puede desconocer la regla utilizada para detenerse. Por ejemplo, su jefe puede indicarle que detenga la recopilación de datos y ella puede desconocer el motivo exacto; sin embargo, obtiene una variable electrónica válida y un control de errores de tipo I. Esto contrasta marcadamente con el análisis de datos basado en valores p (que se vuelve inválido si las reglas de detención no se determinan de antemano) o con el análisis secuencial clásico de estilo Wald (que funciona con datos de longitud variable, pero, de nuevo, con tiempos de detención que deben determinarse de antemano). En casos más complejos, el tiempo de detención debe definirse en relación con algún filtrado ligeramente reducido , pero esto no supone una gran restricción en la práctica. En particular, el nivel-α{\displaystyle \alpha }La regla agresiva siempre está permitida. Debido a esta validez bajo parada opcional, los procesos electrónicos son el componente fundamental de las secuencias de confianza, también conocidas como intervalos de confianza válidos en cualquier momento. [ 18 ] [ 4 ]

Técnicamente, los procesos electrónicos son generalizaciones de las supermartingalas de prueba , que son supermartingalas no negativas con valor inicial 1: cualquier supermartingala de prueba constituye un proceso electrónico, pero no al revés.

Construcción

Los procesos electrónicos se pueden construir de varias maneras. A menudo, se comienza con un valor electrónico.mii{\displaystyle E_{i}}paraincógnitai{\displaystyle X_{i}}cuya definición puede depender de datos previos, es decir,

a pesar dePAGH0:miPAG[mii|incógnita1,,incógnitai1]1{\displaystyle P\in H_{0}:{\mathbb {E} }_{P}[E_{i}|X_{1},\ldots ,X_{i-1}]\leq 1}

(de nuevo, en problemas de prueba complejos esta definición debe modificarse un poco utilizando filtraciones reducidas). Luego el proceso del productoMETRO1,METRO2,{\displaystyle M_{1},M_{2},\ldots }conMETROnorte=mi1×mi2×minorte{\displaystyle M_{n}=E_{1}\times E_{2}\cdots \times E_{n}}es una supermartingala de prueba y, por lo tanto, también un proceso e (nótese que ya utilizamos esta construcción en el ejemplo descrito en "valores e como apuestas" más arriba: para fijoλ{\displaystyle \lambda }, los valores emii,λ{\displaystyle E_{i,\lambda }}no dependían de datos pasados, sino que mediante el usoλ=λ˘|incógnitai1{\displaystyle \lambda ={\breve {\lambda }}|X^{i-1}}(dependiendo del pasado, se volvieron dependientes de los datos pasados).

Otra forma de construir un proceso electrónico es utilizar la construcción de inferencia universal descrita anteriormente para los tamaños de muestra.1,2,{\displaystyle 1,2,\ldots }La secuencia resultante de valores emi1,mi2,{\displaystyle E_{1},E_{2},\ldots }será entonces siempre un proceso electrónico. [ 4 ]

Historia

Históricamente, los valores e aparecen implícitamente como bloques de construcción de supermartingalas no negativas en el trabajo pionero sobre métodos de confianza válidos en cualquier momento del conocido matemático Herbert Robbins y algunos de sus estudiantes. [ 18 ] La primera vez que los valores e (o algo muy parecido) se tratan como una cantidad de interés independiente es por otro conocido matemático, Leonid Levin , en 1976, dentro de la teoría de la aleatoriedad algorítmica. Con la excepción de las contribuciones del pionero V. Vovk en varios artículos con varios colaboradores (por ejemplo, [ 16 ] [ 15 ] ), y una reinvención independiente del concepto en un campo completamente diferente, [ 19 ] el concepto no se popularizó hasta 2019, cuando, en tan solo unos meses, aparecieron en arXiv varios artículos pioneros de varios grupos de investigación (las publicaciones de revistas correspondientes a las que se hace referencia más adelante a veces aparecen años después). En estos, el concepto finalmente recibió un nombre apropiado ("Valor S" [ 8 ] y "Valor E" [ 17 ] en versiones posteriores de su artículo [ 8 ] también se adaptó "Valor E"); describiendo sus propiedades generales [ 17 ] , dos formas genéricas de construirlos [ 10 ] y su estrecha relación con las apuestas [ 5 ] ). Desde entonces, el interés de los investigadores de todo el mundo ha ido en aumento. En 2023 apareció el primer artículo de revisión sobre "métodos seguros y válidos en cualquier momento", en el que los valores E desempeñan un papel central [ 4 ] .

Referencias

  1. Wang, Ruodu; Ramdas, Aaditya (1 de julio de 2022). "Control de la tasa de falsos descubrimientos con valores E" . Journal of the Royal Statistical Society Series B: Statistical Methodology . 84 (3): 822– 852. arXiv : 2009.02824 . doi : 10.1111/rssb.12489 . ISSN 1369-7412 . 
  2. 1 2 3 Koning, Nick W. (2024). "Pruebas continuas". arXiv : 2409.05654 [ math.ST ].
  3. 1 2 Koning, Nick W. (2024). "Prueba de hipótesis α post hoc y el valor p post hoc". arXiv : 2312.08040 [ math.ST ].
  4. 1 2 3 4 5 6 7 8 9 10 11 Ramdas, Aaditya; Grünwald, Peter; Vovk, Vladimir; Shafer, Glenn (2023-11-01). "Estadística basada en la teoría de juegos e inferencia segura y válida en cualquier momento". Statistical Science . 38 (4). arXiv : 2210.01948 . doi : 10.1214/23-sts894 . ISSN 0883-4237 . 
  5. 1 2 Shafer, Glenn (2021-04-01). "Probar mediante apuestas: una estrategia para la comunicación estadística y científica". Journal of the Royal Statistical Society Series A: Statistics in Society . 184 (2): 407– 431. doi : 10.1111/rssa.12647 . ISSN 0964-1998 . 
  6. 1 2 Waudby-Smith, Ian; Ramdas, Aaditya (2023-02-16). "Estimación de medias de variables aleatorias acotadas mediante apuestas". Journal of the Royal Statistical Society Series B: Statistical Methodology . 86 : 1– 27. arXiv : 2010.09686 . doi : 10.1093/jrsssb/qkad009 . ISSN 1369-7412 . 
  7. Ter Schure, JA (Judith); Ly, Alexander; Belin, Lisa; Benn, Christine S.; Bonten, Marc JM; Cirillo, Jeffrey D.; Damen, Johanna AA; Fronteira, Inês; Hendriks, Kelly D. (2022-12-19). "Vacuna BACillus Calmette-Guérin para reducir las infecciones y hospitalizaciones por COVID-19 en trabajadores de la salud: una revisión sistemática en curso y un metaanálisis prospectivo ALL-IN de datos de participantes individuales de ensayos controlados aleatorios". medRxiv 10.1101/2022.12.15.22283474 . 
  8. 1 2 3 4 5 6 7 Grünwald, Peter; De Heide, Rianne; Koolen, Wouter (2024). "Pruebas seguras" . Revista de la Royal Statistical Society, Serie B.
  9. ^ Wang, Qiuqi; Wang, Ruodu; Ziegel, Johanna (2022). "E-backtesting". Revista Electrónica SSRN . doi : 10.2139/ssrn.4206997 . ISSN 1556-5068 . 
  10. 1 2 Wasserman, Larry; Ramdas, Aaditya; Balakrishnan, Sivaraman (2020-07-06). "Inferencia universal" . Actas de la Academia Nacional de Ciencias . 117 ( 29): 16880– 16890. arXiv : 1912.11436 . Bibcode : 2020PNAS..11716880W . doi : 10.1073/pnas.1922664117 . ISSN 0027-8424 . PMC 7382245. PMID 32631986 .   
  11. Wald, Abraham (1947). Análisis secuencial (Sección 10.10) . J. Wiley & Sons, Incorporated.
  12. Dawid, AP (15 de julio de 2004). "Análisis precuelacional". Enciclopedia de Ciencias Estadísticas . doi : 10.1002/0471667196.ess0335 . ISBN 978-0-471-15044-2.
  13. Rissanen, J. (julio de 1984). "Codificación universal, información, predicción y estimación". IEEE Transactions on Information Theory . 30 (4): 629– 636. Bibcode : 1984ITIT...30..629R . doi : 10.1109/tit.1984.1056936 . ISSN 0018-9448 . 
  14. Candès, Emmanuel; Fan, Yingying; Janson, Lucas; Lv, Jinchi (2018-01-08). "Banning for Gold: 'Model-X' Knockoffs for High Dimensional Controlled Variable Selection". Journal of the Royal Statistical Society Series B: Statistical Methodology . 80 (3): 551– 577. arXiv : 1610.02351 . doi : 10.1111/rssb.12265 . ISSN 1369-7412 . 
  15. 1 2 Shafer, Glenn; Shen, Alexander; Vereshchagin, Nikolai; Vovk, Vladimir (2011-02-01). "Prueba de martingalas, factores de Bayes y valores p". Statistical Science . 26 (1). arXiv : 0912.4269 . doi : 10.1214/10-sts347 . ISSN 0883-4237 . 
  16. 1 2 Vovk, VG (enero de 1993). "Una lógica de la probabilidad, con aplicación a los fundamentos de la estadística". Journal of the Royal Statistical Society, Serie B (Metodológica) . 55 (2): 317– 341. doi : 10.1111/j.2517-6161.1993.tb01904.x . ISSN 0035-9246 . 
  17. 1 2 3 Vovk, Vladimir; Wang, Ruodu (2021-06-01). "Valores E: Calibración, combinación y aplicaciones". The Annals of Statistics . 49 (3). arXiv : 1912.06116 . doi : 10.1214/20-aos2020 . ISSN 0090-5364 . 
  18. 1 2 Darling, DA; Robbins, Herbert (julio de 1967). "Secuencias de confianza para la media, la varianza y la mediana" . Actas de la Academia Nacional de Ciencias . 58 (1): 66– 68. Bibcode : 1967PNAS...58...66D . doi : 10.1073/pnas.58.1.66 . ISSN 0027-8424 . PMC 335597. PMID 16578652 .   
  19. Zhang, Yanbao; Glancy, Scott; Knill, Emanuel (22 de diciembre de 2011). "Análisis de datos asintóticamente óptimo para rechazar el realismo local". Physical Review A. 84 ( 6) 062118. arXiv : 1108.2468 . Bibcode : 2011PhRvA..84f2118Z . doi : 10.1103/physreva.84.062118 . ISSN 1050-2947 . 
Obtenido de " https://en.wikipedia.org/w/index.php?title=E-values&oldid=1338396591 "