Articulo de referencia

Estimación de densidad de núcleo variable

En estadística , la estimación de densidad de núcleo adaptativa o de "ancho de banda variable" es una forma de estimación de densidad de núcleo en la que el tamaño de los núcleo...

En estadística , la estimación de densidad de núcleo adaptativa o de "ancho de banda variable" es una forma de estimación de densidad de núcleo en la que el tamaño de los núcleos utilizados en la estimación varía según la ubicación de las muestras o la ubicación del punto de prueba. Es una técnica particularmente eficaz cuando el espacio muestral es multidimensional. [ 1 ]

Razón fundamental

Dado un conjunto de muestras,{incógnitai}{\displaystyle \lbrace {\vec {x}}_{i}\rbrace }, deseamos estimar la densidad,PAG(incógnita){\displaystyle P({\vec {x}})}, en un punto de prueba,incógnita{\displaystyle {\vec {x}}}:

PAG(incógnita)WnortehD{\displaystyle P({\vec {x}})\approx {\frac {W}{nh^{D}}}}
W=i=1nortewi{\displaystyle W=\sum _ {i=1}^{n}w_ {i}}
wi=K(incógnitaincógnitaih){\displaystyle w_{i}=K\left({\frac {{\vec {x}}-{\vec {x}}_{i}}{h}}\right)}

donde n es el número de muestras, K es el "núcleo" , h es su ancho y D es el número de dimensiones enincógnita{\displaystyle {\vec {x}}}. El núcleo puede considerarse como un filtro lineal simple .

El uso de un ancho de filtro fijo puede implicar que, en regiones de baja densidad, todas las muestras se concentren en los extremos del filtro con una ponderación muy baja, mientras que en regiones de alta densidad se encontrará un número excesivo de muestras en la región central con una ponderación cercana a la unidad. Para solucionar este problema, variamos el ancho del núcleo en diferentes regiones del espacio muestral. Existen dos métodos para ello: estimación por globo y estimación puntual. En un estimador por globo, el ancho del núcleo varía según la ubicación del punto de prueba. En un estimador puntual, el ancho del núcleo varía según la ubicación de la muestra. [ 1 ]

Para los estimadores multivariados, el parámetro h puede generalizarse para variar no solo el tamaño, sino también la forma del núcleo. Este enfoque más complejo no se abordará aquí.

Estimadores de globos

Un método común para variar el ancho del núcleo consiste en hacerlo inversamente proporcional a la densidad en el punto de prueba:

h=k[nortePAG(incógnita)]1/D{\displaystyle h={\frac {k}{\left[nP({\vec {x}})\right]^{1/D}}}}

donde k es una constante. Si sustituimos hacia atrás la PDF estimada, y asumiendo una función de núcleo gaussiano , podemos demostrar que W es una constante: [ 2 ]

W=kD(2π)D/2{\displaystyle W=k^{D}(2\pi )^{D/2}}

Una derivación similar es válida para cualquier núcleo cuya función de normalización sea del orden h D , aunque con un factor constante diferente en lugar del término (2 π) D/2 . Esto produce una generalización del algoritmo de k vecinos más cercanos . Es decir, una función de núcleo uniforme devolverá la técnica KNN. [ 2 ]

El error tiene dos componentes: un término de varianza y un término de sesgo. El término de varianza se define como: [ 1 ]

mi1=PAGK2nortehD{\displaystyle e_{1}={\frac {P\int K^{2}}{nh^{D}}}}.

El término de sesgo se obtiene evaluando la función aproximada en el límite cuando el ancho del núcleo se vuelve mucho mayor que el espaciado de la muestra. Al utilizar una expansión de Taylor para la función real, el término de sesgo desaparece:

mi2=h2norte2PAG{\displaystyle e_{2}={\frac {h^{2}}{n}}\nabla ^{2}P}

De este modo, se puede obtener un ancho de núcleo óptimo que minimice el error de cada estimación.

Uso para clasificación estadística

El método es particularmente efectivo cuando se aplica a la clasificación estadística . Hay dos maneras en que podemos proceder: la primera es calcular las PDF de cada clase por separado, usando diferentes parámetros de ancho de banda, y luego compararlas como en Taylor. [ 3 ] Alternativamente, podemos dividir la suma en función de la clase de cada muestra:

PAG(j,incógnita)1nortei=1,doi=jnortewi{\displaystyle P(j,{\vec {x}})\approx {\frac {1}{n}}\sum _{i=1,c_{i}=j}^{n}w_{i}}

donde c i es la clase de la i- ésima muestra. La clase del punto de prueba se puede estimar mediante máxima verosimilitud .

  • akde1d.m - Archivo m de Matlab para la estimación adaptativa de la densidad del núcleo unidimensional.
  • libAGF - Una biblioteca de C++ para la estimación adaptativa multivariante de la densidad del núcleo.
  • akde.m Archivado el 9 de febrero de 2017 en Wayback Machine : función de Matlab para la estimación de la densidad del núcleo variable multivariante (de alta dimensión).

Referencias

  1. 1 2 3 D. G. Terrell; DW Scott (1992). "Estimación de densidad de núcleo variable" . Annals of Statistics . 20 (3): 1236– 1265. doi : 10.1214/aos/1176348768 .
  2. 1 2 Mills, Peter (2011). "Clasificación estadística eficiente de mediciones satelitales". International Journal of Remote Sensing . 32 (21): 6109– 6132. arXiv : 1202.2194 . Bibcode : 2011IJRS...32.6109M . doi : 10.1080/01431161.2010.507795 . S2CID 88518570 . 
  3. Taylor, Charles (1997). "Clasificación y estimación de densidad de kernel". Vistas in Astronomy . 41 (3): 411– 417. Bibcode : 1997VA.....41..411T . doi : 10.1016/s0083-6656(97)00046-9 .