Articulo de referencia

Censura (estadísticas)

En estadística , la censura es una condición en la que el valor de una medición u observación se conoce solo parcialmente. Por ejemplo, supongamos que se realiza un estudio para...

En estadística , la censura es una condición en la que el valor de una medición u observación se conoce solo parcialmente.

Por ejemplo, supongamos que se realiza un estudio para medir el impacto de un fármaco en la tasa de mortalidad . En dicho estudio, se puede saber que la edad de fallecimiento de un individuo es de al menos 75 años (aunque podría ser mayor). Esta situación podría darse si el individuo se retira del estudio a los 75 años o si actualmente tiene esa edad y sigue vivo.

La censura también se produce cuando un valor se encuentra fuera del rango de un instrumento de medición . Por ejemplo, una báscula de baño podría medir solo hasta 140 kg, después de lo cual vuelve a cero y continúa contando. Si se pesa a una persona de 160 kg con la báscula, el observador solo sabría que su peso es 20 mod 140 kg (además de 160 kg, podría pesar 200 kg, 300 kg, 440 kg, etc.).

El problema de los datos censurados, en el que el valor observado de alguna variable se conoce parcialmente, está relacionado con el problema de los datos faltantes , donde el valor observado de alguna variable es desconocido.

La censura no debe confundirse con el concepto relacionado de truncamiento . Con la censura, las observaciones permiten conocer el valor exacto o que este se encuentre dentro de un intervalo . Con el truncamiento, las observaciones nunca arrojan valores fuera de un rango determinado: los valores de la población que se encuentran fuera de dicho rango nunca se observan o, si se observan, nunca se registran. Cabe destacar que, en estadística, el truncamiento no es lo mismo que el redondeo .

Tipos

  • Censura por la izquierda : un dato está por debajo de un valor determinado, pero se desconoce en qué medida.
  • Censura por intervalos : un punto de datos se encuentra en algún lugar de un intervalo entre dos valores.
  • Censura por la derecha : un dato está por encima de un cierto valor, pero se desconoce en qué medida.
  • La censura de tipo I se produce si un experimento tiene un número fijo de sujetos o elementos y se detiene en un momento predeterminado, momento en el que cualquier sujeto restante queda censurado por la derecha.
  • La censura de tipo II se produce si un experimento tiene un número fijo de sujetos o elementos y se detiene cuando se observa que un número predeterminado de ellos ha fallado; los sujetos restantes son entonces censurados por la derecha.
  • La censura aleatoria (o no informativa ) se produce cuando cada sujeto tiene un tiempo de censura estadísticamente independiente de su tiempo de fallo. El valor observado es el mínimo entre el tiempo de censura y el tiempo de fallo; los sujetos cuyo tiempo de fallo es mayor que su tiempo de censura están censurados por la derecha.

La censura por intervalos puede ocurrir cuando la observación de un valor requiere seguimientos o inspecciones. La censura por la izquierda y por la derecha son casos especiales de censura por intervalos, donde el inicio del intervalo se sitúa en cero o el final en infinito, respectivamente.

Los métodos de estimación para usar datos censurados por la izquierda varían, y no todos los métodos de estimación pueden ser aplicables o los más confiables para todos los conjuntos de datos. [ 1 ]

Un error común con los datos de intervalos de tiempo es clasificarlos como intervalos censurados por la izquierda cuando se desconoce el tiempo de inicio. En estos casos, tenemos un límite inferior para el intervalo de tiempo ; por lo tanto, los datos están censurados por la derecha (¡a pesar de que el punto de inicio faltante se encuentra a la izquierda del intervalo conocido cuando se visualiza como una línea de tiempo!).

Análisis

Para el manejo de datos censurados, se pueden utilizar técnicas especiales. Las pruebas con tiempos de falla específicos se codifican como fallas reales; los datos censurados se codifican según el tipo de censura y el intervalo o límite conocido. Existen programas informáticos especializados (a menudo orientados a la confiabilidad ) que permiten realizar una estimación de máxima verosimilitud para estadísticas descriptivas, intervalos de confianza, etc.

Epidemiología

Uno de los primeros intentos de analizar un problema estadístico que involucra datos censurados fue el análisis de Daniel Bernoulli en 1766 sobre datos de morbilidad y mortalidad por viruela para demostrar la eficacia de la vacunación . [ 2 ] Un artículo temprano que utilizó el estimador de Kaplan-Meier para estimar costos censurados fue Quesenberry et al. (1989), [ 3 ] sin embargo, Lin et al. [ 4 ] encontraron que este enfoque era inválido a menos que todos los pacientes acumularan costos con una función de tasa determinista común a lo largo del tiempo, propusieron una técnica de estimación alternativa conocida como el estimador de Lin. [ 5 ]

Pruebas de vida útil

Ejemplo de cinco pruebas replicadas que resultaron en cuatro fallos y un tiempo de suspensión que resultó en censura.

Las pruebas de fiabilidad suelen consistir en realizar una prueba en un artículo (bajo condiciones específicas) para determinar el tiempo que tarda en producirse un fallo.

  • En ocasiones, se prevé y se espera un fallo, pero este no se produce: error del operador, mal funcionamiento del equipo, anomalía en la prueba, etc. El resultado de la prueba no fue el tiempo de fallo deseado, pero puede (y debe) utilizarse como tiempo de finalización. El uso de datos censurados es involuntario, pero necesario.
  • En ocasiones, los ingenieros planifican un programa de pruebas de forma que, tras un determinado límite de tiempo o un número específico de fallos, se interrumpan todas las demás pruebas. Estos periodos de suspensión se consideran datos censurados por la derecha. El uso de datos censurados es intencional.

El análisis de los datos de las pruebas replicadas incluye tanto el tiempo hasta el fallo de los elementos que fallaron como el tiempo de finalización de la prueba para aquellos que no fallaron.

regresión censurada

Un modelo anterior para la regresión censurada , el modelo Tobit , fue propuesto por James Tobin en 1958. [ 6 ]

Probabilidad

La verosimilitud es la probabilidad o densidad de probabilidad de lo observado, vista como una función de los parámetros de un modelo supuesto. Para incorporar datos censurados en la verosimilitud, estos se representan mediante la probabilidad de dichos datos en función de los parámetros del modelo, es decir, una función de la(s) función(es) de distribución acumulada (CDF) en lugar de la densidad o masa de probabilidad.

El caso de censura más general es la censura por intervalos:PAGr(a<incógnitab)=F(b)F(a){\displaystyle Pr(a<x\leqslant b)=F(b)-F(a)}, dóndeF(incógnita){\displaystyle F(x)}es la función de distribución acumulada (CDF) de la distribución de probabilidad, y los dos casos especiales son:

  • Censura de izquierda:Pr(<incógnitab)=F(b)F()=F(b)0=F(b)=Pr(incógnitab){\displaystyle \Pr(-\infty <x\leq b)=F(b)-F(-\infty )=F(b)-0=F(b)=\Pr(x\leq b)}
  • censura de derecha:Pr(a<incógnita)=F()F(a)=1F(a)=1Pr(incógnitaa)=Pr(incógnita>a){\displaystyle \Pr(a<x\leq \infty )=F(\infty )-F(a)=1-F(a)=1-\Pr(x\leq a)=\Pr(x>a)}

Para distribuciones de probabilidad continuas:Pr(a<incógnitab)=PAGr(a<incógnita<b){\displaystyle \Pr(a<x\leq b)=Pr(a<x<b)}

Ejemplo

Supongamos que estamos interesados ​​en los tiempos de supervivencia,T1,T2,,Tnorte{\displaystyle T_{1},T_{2},\dots ,T_{n}}pero no observamosTi{\displaystyle T_{i}}a pesar dei{\displaystyle i}En cambio, observamos

CuandoTi>Ui,Ui{\displaystyle T_{i}>U_{i},U_{i}}se denomina tiempo de censura . [ 7 ]

Si los tiempos de censura son constantes conocidas, entonces la probabilidad es

L=i,δi=1F(i)i,δi=0S(i){\displaystyle L=\prod _{i,\delta _{i}=1}f(u_{i})\prod _{i,\delta _{i}=0}S(u_{i})}

dóndeF(i){\displaystyle f(u_{i})}es la función de densidad de probabilidad evaluada eni{\displaystyle u_{i}}, yS(i){\displaystyle S(u_{i})}es la probabilidad de queTi{\displaystyle T_{i}}es mayor quei{\displaystyle u_{i}}, denominada función de supervivencia .

Esto se puede simplificar definiendo la función de riesgo , la fuerza instantánea de mortalidad, como

λ()=F()S(){\displaystyle \lambda (u)={\frac {f(u)}{S(u)}}}

entonces

F()=λ()S().{\displaystyle f(u)=\lambda (u)S(u).}

Entonces

L=iλ(i)δiS(i).{\displaystyle L=\prod _{i}\lambda (u_{i})^{\delta _{i}}S(u_{i}).}

Para la distribución exponencial , esto se vuelve aún más simple, porque la tasa de riesgo,λ{\displaystyle \lambda }, es constante yS()=exp(λ){\displaystyle S(u)=\exp(-\lambda u)}. Entonces:

L(λ)=λkexp(λii),{\displaystyle L(\lambda )=\lambda ^{k}\exp \left(-\lambda \sum _{i}u_{i}\right),}

dóndek=iδi{\textstyle k=\sum _{i}\delta _{i}}.

A partir de esto podemos calcular fácilmenteλ^{\displaystyle {\sombrero {\lambda }}}, la estimación de máxima verosimilitud (EMV) deλ{\displaystyle \lambda }, de la siguiente manera:

(λ)=registro(L(λ))=kregistro(λ)λii.{\displaystyle \ell (\lambda )=\log(L(\lambda ))=k\log(\lambda )-\lambda \sum _{i}u_{i}.}

Entonces

ddλ=kλii.{\displaystyle {\frac {d\ell }{d\lambda }}={\frac {k}{\lambda }}-\sum _{i}u_{i}.}

Establecemos esto en 0 y resolvemos paraλ{\displaystyle \lambda }Llegar:

λ^=kii.{\displaystyle {\hat {\lambda }}={\frac {k}{\sum _{i}u_{i}}}.}

De forma equivalente, el tiempo medio hasta el fallo es:

1λ^=iik.{\displaystyle {\frac {1}{\hat {\lambda }}}={\frac {\sum _{i}u_{i}}{k}}.}

Esto difiere del estimador de máxima verosimilitud estándar para la distribución exponencial en que las observaciones censuradas se consideran solo en el numerador.

Véase también

Referencias

  1. Helsel, D. (2010). "Mucho ruido y pocas nueces: la incorporación de no detecciones en la ciencia" . Annals of Occupational Hygiene . 54 (3): 257– 262. doi : 10.1093/annhyg/mep092 . PMID 20032004 . 
  2. ^ Bernoulli, D. (1766). "Essai d'une nouvelle analyse de la mortalité causée par la petite vérole". Memoria. Matemáticas. Phy. Acad. Roy. Ciencia. París ,reimpreso en Bradley (1971) 21 y Blower (2004)
  3. Quesenberry, CP Jr.; et al. (1989). "Análisis de supervivencia de la hospitalización entre pacientes con síndrome de inmunodeficiencia adquirida" . American Journal of Public Health . 79 (12): 1643– 1647. doi : 10.2105/AJPH.79.12.1643 . PMC 1349769. PMID 2817192 .   
  4. Lin, DY; et al. (1997). "Estimación de los costos médicos a partir de datos de seguimiento incompletos". Biometrics . 53 (2): 419– 434. doi : 10.2307/2533947 . JSTOR 2533947 . PMID 9192444 .   
  5. Wijeysundera, HC; et al. (2012). "Técnicas para estimar los costos de atención médica con datos censurados: una visión general para el investigador de servicios de salud" . ClinicoEconomics and Outcomes Research . 4 : 145–155 . doi : 10.2147/CEOR.S31552 . PMC 3377439. PMID 22719214 .   
  6. Tobin, James (1958). "Estimación de relaciones para variables dependientes limitadas" (PDF) . Econometrica . 26 (1): 24– 36. doi : 10.2307/1907382 . JSTOR 1907382 . 
  7. Lu Tian, ​​Construcción de verosimilitud, inferencia para distribuciones de supervivencia paramétricas (PDF) , Wikidata Q98961801 .

Lecturas adicionales

  • Blower, S. (2004), D, Bernoulli's " "Un intento de un nuevo análisis de la mortalidad causada por la viruela y de las ventajas de la inoculación para prevenirla" (PDF) . Archivado del original (PDF) el 08-08-2017 . Recuperado el 25-06-2019 . (146 KiB )  ", Reseñas de Virología Médica , 14 : 275–288
  • Bradley, L. (1971). Inoculación de la viruela: una controversia matemática del siglo XVIII . Nottingham. ISBN 0-902031-23-6.{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  • Mann, NR ; et  al. (1975). Métodos para el análisis estadístico de datos de fiabilidad y vida útil . Nueva York: Wiley. ISBN 047156737X.
  • Bagdonavicius, V., Kruopis, J., Nikulin, MS (2011), "Pruebas no paramétricas para datos censurados", Londres, ISTE/WILEY, ISBN 9781848212893.
  • "Manual de estadística para ingeniería", NIST/SEMATEK,