Articulo de referencia

Estimadores de dependencia simple promediados

Los estimadores de dependencia de un solo atributo ( AODE ) son una técnica de aprendizaje de clasificación probabilística . Se desarrollaron para abordar el problema de indepen...

Los estimadores de dependencia de un solo atributo ( AODE ) son una técnica de aprendizaje de clasificación probabilística . Se desarrollaron para abordar el problema de independencia de atributos del popular clasificador bayesiano ingenuo . Con frecuencia, generan clasificadores sustancialmente más precisos que el bayesiano ingenuo a costa de un modesto aumento en la cantidad de cálculos. [ 1 ]

El clasificador AODE

AODE busca estimar la probabilidad de cada clase y dado un conjunto específico de características x 1 , ... x n , P( y | x 1 , ... x n ). Para ello utiliza la fórmula

PAG^(yincógnita1,incógnitanorte)=i:1inorteF(incógnitai)metroPAG^(y,incógnitai)j=1nortePAG^(incógnitajy,incógnitai)yYi:1inorteF(incógnitai)metroPAG^(y,incógnitai)j=1nortePAG^(incógnitajy,incógnitai){\displaystyle {\hat {P}}(y\mid x_{1},\ldots x_{n})={\frac {\sum _{i:1\leq i\leq n\wedge F(x_{i})\geq m}{\hat {P}}(y,x_{i})\prod _{j=1}^{n}{\hat {P}}(x_{j}\mid y,x_{i})}{\sum _{y^{\prime }\in Y}\sum _{i:1\leq i\leq n\wedge F(x_{i})\geq m}{\hat {P}}(y^{\prime },x_{i})\prod _{j=1}^{n}{\hat {P}}(x_{j}\mid y^{\prime },x_{i})}}}

dóndePAG^(){\displaystyle {\hat {P}}(\cdot )}denota una estimación dePAG(){\displaystyle P(\cdot )},F(){\displaystyle F(\cdot )}es la frecuencia con la que aparece el argumento en los datos de muestra y m es una frecuencia mínima especificada por el usuario con la que debe aparecer un término para poder utilizarse en la suma externa. En la práctica reciente, m suele establecerse en 1.

Derivación del clasificador AODE

Buscamos estimar P( y | x 1 , ... x n ). Por definición de probabilidad condicional

PAG(yincógnita1,incógnitanorte)=PAG(y,incógnita1,incógnitanorte)PAG(incógnita1,incógnitanorte).{\displaystyle P(y\mid x_{1},\ldots x_{n})={\frac {P(y,x_{1},\ldots x_{n})}{P(x_{1},\ldots x_{n})}}.}

Para cualquier1inorte{\displaystyle 1\leq i\leq n},

PAG(y,incógnita1,incógnitanorte)=PAG(y,incógnitai)PAG(incógnita1,incógnitanortey,incógnitai).{\displaystyle P(y,x_{1},\ldots x_{n})=P(y,x_{i})P(x_{1},\ldots x_{n}\mid y,x_{i}).}

Bajo el supuesto de que x 1 , ... x n son independientes dados y y x i , se deduce que

PAG(y,incógnita1,incógnitanorte)=PAG(y,incógnitai)j=1nortePAG(incógnitajy,incógnitai).{\displaystyle P(y,x_{1},\ldots x_{n})=P(y,x_{i})\prod _{j=1}^{n}P(x_{j}\mid y,x_{i}).}

Esta fórmula define una forma especial del Estimador de Dependencia Única (EDO), una variante del clasificador bayesiano ingenuo que asume una independencia menor (y, por lo tanto, potencialmente menos perjudicial) que la del propio Bayes ingenuo. En consecuencia, cada EDO debería generar un estimador menos sesgado que el Bayes ingenuo. Sin embargo, dado que las estimaciones de probabilidad base están condicionadas por dos variables en lugar de una, se forman a partir de menos datos (los ejemplos de entrenamiento que satisfacen ambas variables) y, por lo tanto, es probable que presenten mayor varianza. El AODE reduce esta varianza promediando las estimaciones de todos estos EDO.

Características del clasificador AODE

Al igual que el clasificador bayesiano ingenuo, AODE no realiza selección de modelos ni utiliza parámetros ajustables. Por consiguiente, presenta una baja varianza. Admite el aprendizaje incremental, mediante el cual el clasificador se puede actualizar de forma eficiente con la información de nuevos ejemplos a medida que estén disponibles. Predice probabilidades de clase en lugar de predecir una sola clase, lo que permite al usuario determinar el grado de confianza con el que se puede realizar cada clasificación. Su modelo probabilístico puede gestionar directamente situaciones en las que faltan algunos datos.

AODE tiene complejidad computacionalO(lnorte2){\displaystyle O(ln^{2})}en el tiempo de entrenamiento yO(knorte2){\displaystyle O(kn^{2})} at classification time, where n is the number of features, l is the number of training examples and k is the number of classes. This makes it infeasible for application to high-dimensional data. However, within that limitation, it is linear with respect to the number of training examples and hence can efficiently process large numbers of training examples.

Implementations

The free Wekamachine learning suite includes an implementation of AODE.

See also

References

  1. Webb, G. I., J. Boughton, and Z. Wang (2005). "Not So Naive Bayes: Aggregating One-Dependence Estimators". Machine Learning, 58(1), 5–24. doi:10.1007/s10994-005-4258-6