Articulo de referencia

Suavizado aditivo

En estadística , el suavizado aditivo , también llamado suavizado de Laplace [ 1 ] o suavizado de Lidstone , es una técnica utilizada para suavizar datos de conteo, eliminando p...

En estadística , el suavizado aditivo , también llamado suavizado de Laplace [ 1 ] o suavizado de Lidstone , es una técnica utilizada para suavizar datos de conteo, eliminando problemas causados ​​por ciertos valores que tienen 0 ocurrencias. Dado un conjunto de conteos de observacionesincógnita=incógnita1,incógnita2,,incógnitad{\displaystyle \mathbf {x} =\langle x_{1},x_{2},\ldots ,x_{d}\rangle }de und{\displaystyle d}Distribución multinomial de -dimensiones connorte{\displaystyle N}En los ensayos, una versión "suavizada" de los recuentos proporciona el estimador.

θ^i=incógnitai+αnorte+αd(i=1,,d),{\displaystyle {\hat {\theta }}_{i}={\frac {x_{i}+\alpha }{N+\alpha d}}\qquad (i=1,\ldots ,d),}

donde el recuento suavizadoincógnita^i=norteθ^i{\displaystyle {\hat {x}}_{i}=N{\hat {\theta }}_{i}}y el "pseudocuenta" α  >  0 es un parámetro de suavizado , donde α  =  0 corresponde a la ausencia de suavizado (este parámetro se explica en la sección  Pseudocuenta más adelante). El suavizado aditivo es un tipo de estimador de contracción , ya que la estimación resultante estará entre la probabilidad empírica ( frecuencia relativa ).incógnitai/norte{\displaystyle x_{i}/N}y la probabilidad uniforme1/d.{\displaystyle 1/d.}Las opciones comunes para α son 0 (sin suavizado), + 1 2 (la distribución a priori de Jeffreys ) o 1 ( regla de sucesión de Laplace ), [ 2 ] [ 3 ] pero el parámetro también puede establecerse empíricamente en función de los datos observados.

Desde un punto de vista bayesiano , esto corresponde al valor esperado de la distribución posterior , utilizando una distribución de Dirichlet simétrica con parámetro α como distribución a priori . En el caso especial donde el número de categorías es 2, esto es equivalente a utilizar una distribución beta como distribución a priori conjugada para los parámetros de la distribución binomial .

Historia

Laplace ideó esta técnica de suavizado cuando intentó estimar la probabilidad de que el sol saliera mañana. Su razonamiento fue que, incluso con una muestra grande de días con el sol saliendo, todavía no podemos estar completamente seguros de que el sol seguirá saliendo mañana (conocido como el problema del amanecer ). [ 4 ]

Pseudocontador

Un pseudoconteo es una cantidad (generalmente no un número entero, a pesar de su nombre) que se agrega al número de casos observados para cambiar la probabilidad esperada en un modelo de esos datos, cuando no se sabe que es cero. Se llama así porque, en términos generales, un pseudoconteo de valorα{\displaystyle \alpha }pesa en la distribución posterior de manera similar a como cada categoría tiene un recuento adicional deα{\displaystyle \alpha }. Si el número de ocurrencias de cada elementoi{\displaystyle i}esincógnitai{\displaystyle x_{i}}fuera denorte{\displaystyle N}muestras, la probabilidad empírica del eventoi{\displaystyle i}es

pagi,empírico=incógnitainorte,{\displaystyle p_{i,{\text{empirical}}}={\frac {x_{i}}{N}},}

pero la probabilidad posterior cuando se suaviza aditivamente es

pagi,α-alisado=incógnitai+αnorte+αd,{\displaystyle p_{i,\alpha {\text{-smoothed}}}={\frac {x_{i}+\alpha }{N+\alpha d}},}

como si fuera a aumentar cada recuentoincógnitai{\displaystyle x_{i}}porα{\displaystyle \alpha }a priori.

Dependiendo del conocimiento previo, que a veces es un valor subjetivo, un pseudoconteo puede tener cualquier valor finito no negativo. Puede ser cero (o la posibilidad ignorada) solo si es imposible por definición, como la posibilidad de que un dígito decimal de π sea una letra, o una posibilidad física que se rechazaría y, por lo tanto, no se contaría, como que una computadora imprima una letra al ejecutar un programa válido para π , o excluirse y no contarse por falta de interés, como si solo interesaran los ceros y los unos. Generalmente, también existe la posibilidad de que ningún valor sea computable u observable en un tiempo finito (véase el problema de la parada ). Pero al menos una posibilidad debe tener un pseudoconteo distinto de cero, de lo contrario no se podría calcular ninguna predicción antes de la primera observación. Los valores relativos de los pseudoconteos representan las probabilidades esperadas previas relativas de sus posibilidades. La suma de los pseudoconteos, que puede ser muy grande, representa el peso estimado del conocimiento previo en comparación con todas las observaciones reales (una por cada) al determinar la probabilidad esperada.

En cualquier conjunto de datos o muestra observada , existe la posibilidad, especialmente con eventos de baja probabilidad y con conjuntos de datos pequeños, de que un posible evento no ocurra. Su frecuencia observada es, por lo tanto, cero, lo que aparentemente implica una probabilidad de cero. Esta simplificación excesiva es inexacta y a menudo poco útil, particularmente en técnicas de aprendizaje automático basadas en probabilidad , como las redes neuronales artificiales y los modelos ocultos de Markov . Al ajustar artificialmente la probabilidad de eventos raros (pero no imposibles) para que dichas probabilidades no sean exactamente cero, se evitan los problemas de frecuencia cero . Véase también la regla de Cromwell .

Elección del pseudoconteo

Información previa débilmente informativa

Un método común consiste en sumar 1 a cada número observado de eventos, incluyendo las posibilidades de conteo cero. Esto a veces se denomina regla de sucesión de Laplace . Este método equivale a asumir una distribución previa uniforme sobre las probabilidades de cada evento posible (que abarca el simplex donde cada probabilidad está entre 0 y 1, y todas suman 1).

Utilizando el enfoque previo de Jeffreys , se debe agregar un pseudoconteo de la mitad a cada resultado posible.

Los pseudocuentos deben establecerse en uno o medio solo cuando no haya ningún conocimiento previo ( véase el principio de indiferencia) . Sin embargo, dado el conocimiento previo adecuado, la suma debe ajustarse en proporción a la expectativa de que las probabilidades previas se consideren correctas, a pesar de la evidencia en contrario ( véase el análisis posterior ). Los valores más altos son apropiados siempre que haya conocimiento previo de los valores verdaderos (por ejemplo, para una moneda en perfecto estado); los valores más bajos, siempre que haya conocimiento previo de que existe un posible sesgo, pero de grado desconocido (por ejemplo, para una moneda doblada).  

intervalo frecuentista

Una forma de motivar los pseudocuentos, particularmente para datos binomiales, es a través de una fórmula para el punto medio de una estimación de intervalo , particularmente un intervalo de confianza de proporción binomial . La más conocida se debe a Edwin Bidwell Wilson , en Wilson (1927) : el punto medio del intervalo de puntuación de Wilson correspondiente az{\displaystyle z} las desviaciones estándar en ambos lados son

norteS+znorte+2z{\displaystyle {\frac {n_{S}+z}{n+2z}}}

Tomandoz=2{\displaystyle z=2}desviaciones estándar para aproximar un intervalo de confianza del 95% ( z1,96{\displaystyle z\approx 1.96}) produce un pseudoconteo de 2 para cada resultado, por lo que 4 en total, conocido coloquialmente como la "regla de más cuatro":

norteS+2norte+4{\displaystyle {\frac {n_{S}+2}{n+4}}}

Este es también el punto medio del intervalo Agresti-Coull ( Agresti y Coull 1998 ) .

Tasas de incidencia conocidas

A menudo, el sesgo de una población de ensayo desconocida se prueba comparándola con una población de control con parámetros conocidos (tasas de incidencia).μ=μ1,μ2,,μd.{\displaystyle {\boldsymbol {\mu }}=\langle \mu _{1},\mu _{2},\ldots ,\mu _{d}\rangle .}En este caso la probabilidad uniforme1/d{\displaystyle 1/d}debe sustituirse por la tasa de incidencia conocida de la población de control.μi{\displaystyle \mu _{i}}Para calcular el estimador suavizado:

θ^i=incógnitai+μiαdnorte+αd(i=1,,d).{\displaystyle {\hat {\theta }}_{i}={\frac {x_{i}+\mu _{i}\alpha d}{N+\alpha d}}\qquad (i=1,\ldots ,d).}

Como comprobación de consistencia, si el estimador empírico resulta ser igual a la tasa de incidencia, es decirμi=incógnitai/norte,{\displaystyle \mu _{i}=x_{i}/N,}El estimador suavizado es independiente deα{\displaystyle \alpha }y también es igual a la tasa de incidencia.

Aplicaciones

Clasificación

El suavizado aditivo es un componente común de los clasificadores bayesianos ingenuos .

Modelado estadístico del lenguaje

En un modelo de bolsa de palabras para el procesamiento del lenguaje natural y la recuperación de información, los datos consisten en el número de ocurrencias de cada palabra en un documento. El suavizado aditivo permite asignar probabilidades distintas de cero a las palabras que no aparecen en la muestra. Diversos estudios han demostrado que el suavizado aditivo es más eficaz que otros métodos de suavizado de probabilidad en varias tareas de recuperación, como la retroalimentación de pseudorrelevancia basada en modelos de lenguaje y los sistemas de recomendación . [ 5 ] [ 6 ]

Véase también

Referencias

  1. CD Manning, P. Raghavan y H. Schütze (2008). Introducción a la recuperación de información . Cambridge University Press, pág. 260.
  2. Jurafsky, Daniel; Martin, James H. (junio de 2008). Procesamiento del habla y del lenguaje (2.ª  ed.). Prentice Hall. pág.  132. ISBN 978-0-13-187321-6.
  3. Russell, Stuart; Norvig, Peter (2010). Inteligencia artificial: un enfoque moderno (2.ª ed.). Pearson Education, Inc. pág. 863.  
  4. Lección 5 | Aprendizaje automático (Stanford) a la 1 h 10 min de la lección
  5. Hazimeh, Hussein; Zhai, ChengXiang (2015). "Análisis axiomático de métodos de suavizado en modelos de lenguaje para retroalimentación de pseudorrelevancia" . Actas de la Conferencia Internacional de 2015 sobre la Teoría de la Recuperación de Información . págs. 141–150 . doi : 10.1145/2808194.2809471 . hdl : 2142/92709 . ISBN  978-1-4503-3833-2.
  6. Valcarce, Daniel; Parapar, Javier; Barreiro, Álvaro (2016). «Suavizado aditivo para el modelado de lenguaje basado en relevancia de sistemas de recomendación» . Actas de la 4ª Conferencia Española sobre Recuperación de Información . pp. 1–8 . doi : 10.1145/2934732.2934737 . ISBN  978-1-4503-4141-7.

Fuentes

  • Wilson, EB (1927). "Inferencia probable, la ley de sucesión e inferencia estadística". Journal of the American Statistical Association . 22 (158): 209– 212. doi : 10.1080/01621459.1927.10502953 . JSTOR 2276774 . 
  • Agresti, Alan; Coull, Brent A. (1998). "Lo aproximado es mejor que lo 'exacto' para la estimación por intervalos de proporciones binomiales". The American Statistician . 52 (2): 119– 126. doi : 10.2307/2685469 . JSTOR 2685469. MR 1628435 .  
  • SF Chen, J Goodman (1996). " Un estudio empírico de técnicas de suavizado para el modelado del lenguaje ". Actas de la 34ª reunión anual de la Asociación de Lingüística Computacional .
  • Pseudocuentas
    • Interpretación bayesiana de los regularizadores de pseudocuentos
  • Un vídeo que explica el uso del suavizado aditivo en un clasificador Naïve Bayes.