La prueba de razón de probabilidad secuencial (SPRT) es una prueba de hipótesis secuencial específica , desarrollada por Abraham Wald [ 1 ] y posteriormente probada como óptima por Wald y Jacob Wolfowitz [ 2 ] . El resultado de Neyman y Pearson de 1933 inspiró a Wald a reformularla como un problema de análisis secuencial. El lema de Neyman-Pearson, por el contrario, ofrece una regla práctica para cuando se han recopilado todos los datos (y se conoce su razón de verosimilitud).
Aunque originalmente se desarrolló para su uso en estudios de control de calidad en el ámbito de la fabricación, el SPRT se ha formulado para su uso en pruebas computarizadas de examinados humanos como criterio de terminación. [ 3 ] [ 4 ] [ 5 ]
Teoría
Al igual que en las pruebas de hipótesis clásicas , SPRT comienza con un par de hipótesis, por ejemplo:ypara la hipótesis nula y la hipótesis alternativa respectivamente. Deben especificarse de la siguiente manera:
El siguiente paso es calcular la suma acumulada de la razón de verosimilitud logarítmica ,, a medida que llegan nuevos datos: con, entonces, para=1,2,...,
La regla de parada es un esquema de umbral simple:
- : continuar el seguimiento ( desigualdad crítica )
- : Aceptar
- : Aceptar
dóndey() dependen de los errores de tipo I y tipo II deseados ,yPueden elegirse de la siguiente manera:
y
En otras palabras,yEs necesario decidirlo de antemano para establecer los umbrales adecuadamente. El valor numérico dependerá de la aplicación. La razón por la que se trata solo de una aproximación es que, en el caso discreto, la señal puede cruzar el umbral entre muestras. Por lo tanto, dependiendo de la penalización por cometer un error y la frecuencia de muestreo , se podrían establecer umbrales más estrictos. Los límites exactos son correctos en el caso continuo.
Ejemplo
Un ejemplo clásico es la estimación de parámetros de una función de distribución de probabilidad . Consideremos la distribución exponencial :
Las hipótesis son
Entonces, la función de verosimilitud logarítmica (LLF) para una muestra es
La suma acumulativa de las LLF para todos los x es
Por consiguiente, la regla de parada es:
Después de reorganizar finalmente encontramos
Los umbrales son simplemente dos líneas paralelas con pendienteEl muestreo debe detenerse cuando la suma de las muestras se salga de la región de muestreo continuo .
Aplicaciones
Fabricación
La prueba se realiza sobre la métrica de proporción y comprueba que una variable p sea igual a uno de dos puntos deseados, p₁ o p₂ . La región entre estos dos puntos se conoce como región de indiferencia (RI). Por ejemplo, supongamos que se está realizando un estudio de control de calidad en un lote de widgets de una fábrica. La gerencia desea que el lote tenga un 3 % o menos de widgets defectuosos, pero un 1 % o menos es el lote ideal que pasaría la prueba sin problemas. En este ejemplo, p₁ = 0,01 y p₂ = 0,03 , y la región entre ellos es la RI porque la gerencia considera que estos lotes son marginales y no tiene inconveniente en clasificarlos de cualquier manera. Se tomarían muestras de widgets del lote de uno en uno (análisis secuencial) hasta que la prueba determine, dentro de un nivel de error aceptable, que el lote es ideal o debe rechazarse.
Pruebas a examinados humanos
El SPRT es actualmente el método predominante para clasificar a los examinados en una prueba de clasificación computarizada (CCT) de longitud variable . Los dos parámetros, p1 y p2 , se especifican determinando un umbral para los examinados en la métrica de proporción de respuestas correctas y seleccionando un punto por encima y otro por debajo de dicho umbral. Por ejemplo, supongamos que el umbral se establece en el 70% para una prueba. Podríamos seleccionar p1 = 0,65 y p2 = 0,75 . La prueba evalúa entonces la probabilidad de que la puntuación real de un examinado en esa métrica sea igual a uno de esos dos puntos. Si se determina que el examinado está en el 75%, aprueba, y suspende si se determina que está en el 65%.
Estos puntos no se especifican de forma completamente arbitraria. Un puntaje de corte siempre debe establecerse con un método legalmente defendible, como un procedimiento Angoff modificado . Nuevamente, la región de indiferencia representa la región de puntajes que el diseñador de la prueba acepta en ambos sentidos (aprobado o reprobado). El parámetro superior p2 es conceptualmente el nivel más alto que el diseñador de la prueba está dispuesto a aceptar para un reprobado (porque todos los que están por debajo de él tienen una buena probabilidad de reprobar), y el parámetro inferior p1 es el nivel más bajo que el diseñador de la prueba está dispuesto a aceptar para un aprobado (porque todos los que están por encima de él tienen una probabilidad decente de aprobar). Si bien esta definición puede parecer una carga relativamente pequeña, consideremos el caso de alto riesgo de una prueba de licencia para médicos: ¿en qué punto debemos considerar que alguien está en uno de estos dos niveles?
Si bien la SPRT se aplicó por primera vez a las pruebas en la época de la teoría clásica de los tests , como se menciona en el párrafo anterior, Reckase (1983) sugirió que se utilizara la teoría de respuesta al ítem para determinar los parámetros p1 y p2 . El punto de corte y la región de indiferencia se definen en la métrica de habilidad latente (theta) y se traducen a la métrica de proporción para su cálculo. Desde entonces, la investigación sobre la CCT ha aplicado esta metodología por varias razones:
- Los bancos de ítems grandes tienden a calibrarse con la Teoría de Respuesta al Ítem (TRI).
- Esto permite una especificación más precisa de los parámetros.
- Al utilizar la función de respuesta del ítem para cada ítem, se puede permitir fácilmente que los parámetros varíen entre los ítems.
Detección de resultados médicos anómalos
Spiegelhalter et al. [ 6 ] demostraron que la SPRT puede utilizarse para monitorizar el desempeño de médicos, cirujanos y otros profesionales sanitarios, de forma que se detecten precozmente resultados potencialmente anómalos. Demostraron cómo podría haber ayudado a identificar a Harold Shipman como asesino mucho antes de que fuera identificado oficialmente. [ 6 ]
Extensiones
MaxSPRT
Más recientemente, en 2011, se introdujo una extensión del método SPRT denominada Prueba de Razón de Probabilidad Secuencial Maximizada (MaxSPRT) [ 7 ] . La característica principal de MaxSPRT es que permite una hipótesis alternativa compuesta unilateral y la introducción de un límite superior de parada. El método se ha utilizado en varios estudios de investigación médica [ 8 ] .
Véase también
Referencias
- ↑ Wald, Abraham (junio de 1945). "Pruebas secuenciales de hipótesis estadísticas" . Anales de estadística matemática . 16 (2): 117– 186. doi : 10.1214/aoms/1177731118 . JSTOR 2235829 .
- ↑ Wald, A.; Wolfowitz, J. (1948). "Características óptimas de la prueba de razón de probabilidad secuencial" . The Annals of Mathematical Statistics . 19 (3): 326– 339. doi : 10.1214/aoms/1177730197 . JSTOR 2235638 .
- ↑ Ferguson, Richard L. (1969). El desarrollo, la implementación y la evaluación de una prueba ramificada asistida por computadora para un programa de instrucción individualizada . Tesis doctoral inédita, Universidad de Pittsburgh.
- ↑ Reckase, MD (1983). Un procedimiento para la toma de decisiones mediante pruebas personalizadas. En DJ Weiss (Ed.), Nuevos horizontes en las pruebas: Teoría de los rasgos latentes y pruebas adaptativas computarizadas (pp. 237-254). Nueva York: Academic Press.
- ↑ Eggen, TJHM (1999). "Selección de ítems en pruebas adaptativas con la prueba de razón de probabilidad secuencial". Medición psicológica aplicada . 23 (3): 249– 261. doi : 10.1177/01466219922031365 . S2CID 120780131 .
- 1 2 Spiegelhalter, David; Grigg, Olivia; Kinsman, Robin; Treasure, Tom (2003-02-01). "Pruebas de razón de probabilidad secuencial ajustadas al riesgo: aplicaciones a Bristol, Shipman y cirugía cardíaca en adultos" . International Journal for Quality in Health Care . 15 (1): 7– 13. doi : 10.1093/intqhc/15.1.7 . ISSN 1353-4505 .
- ↑ Kulldorff, Martin; Davis, Robert L.; Kolczak†, Margarette; Lewis, Edwin; Lieu, Tracy; Platt, Richard (2011). "Una prueba de razón de probabilidad secuencial maximizada para la vigilancia de la seguridad de medicamentos y vacunas" . Análisis secuencial . 30 : 58–78 . doi : 10.1080/07474946.2011.539924 .
- ↑ 2.º párrafo antes del final de la sección 1: http://www.tandfonline.com/doi/full/10.1080/07474946.2011.539924 Una prueba de razón de probabilidad secuencial maximizada para la vigilancia de la seguridad de medicamentos y vacunas Kulldorff, M. et al. Análisis secuencial: métodos de diseño y aplicaciones vol. 30, número 1
Lecturas adicionales
- Ghosh, Bhaskar Kumar (1970). Pruebas secuenciales de hipótesis estadísticas . Lectura: Addison-Wesley .
- Holger Wilker: Sequential-Statistik in der Praxis , BoD, Norderstedt 2012, ISBN 978-3848232529.
Enlaces externos
- Pruebas estadísticas
- Métodos secuenciales
- Psicología matemática