Articulo de referencia

tasa de error de Bayes

En la clasificación estadística , la tasa de error de Bayes es la tasa de error más baja posible para cualquier clasificador de un resultado aleatorio (en, por ejemplo, una de d...

En la clasificación estadística , la tasa de error de Bayes es la tasa de error más baja posible para cualquier clasificador de un resultado aleatorio (en, por ejemplo, una de dos categorías) y es análoga al error irreducible. [ 1 ] [ 2 ]

Existen varios enfoques para la estimación de la tasa de error bayesiana. Un método busca obtener límites analíticos que dependen intrínsecamente de los parámetros de distribución y, por lo tanto, son difíciles de estimar. Otro enfoque se centra en las densidades de clase, mientras que un tercer método combina y compara varios clasificadores. [ 2 ]

La tasa de error de Bayes tiene un uso importante en el estudio de patrones y técnicas de aprendizaje automático . [ 3 ]

Definición

Mohri, Rostamizadeh y Talwalkar lo definen como

Dada una distribuciónD{\displaystyle {\mathcal {D}}}encimaincógnita×Y{\displaystyle {\mathcal {X}}\times {\mathcal {Y}}}, el error de BayesR{\displaystyle R^{*}}se define como el ínfimo de los errores alcanzados por las funciones mediblesh:incógnitaY{\displaystyle h:{\mathcal {X}}\to {\mathcal {Y}}}:
R=infh:h mensurableR(h){\displaystyle R^{*}=\inf \limits _{h:h{\text{ medible}}}R(h)}
Una hipótesis h con R(h) = R * se denomina hipótesis bayesiana o clasificador bayesiano .

Determinación de errores

En términos de aprendizaje automático y clasificación de patrones, las etiquetas de un conjunto de observaciones aleatorias se pueden dividir en dos o más clases. Cada observación se denomina instancia y la clase a la que pertenece es la etiqueta . La tasa de error bayesiana de la distribución de datos es la probabilidad de que una instancia sea clasificada erróneamente por un clasificador que conoce las probabilidades reales de clase dados los predictores.

Para un clasificador multiclase , el error de predicción esperado se puede calcular de la siguiente manera: [ 3 ]

miPAGmi=miincógnita[k=1KL(dok,do^(incógnita))PAG(dok|incógnita)]{\displaystyle EPE=E_{x}[\sum _{k=1}^{K}L(C_{k},{\hat {C}}(x))P(C_{k}|x)]}

dóndeincógnita{\displaystyle x}es el ejemplo,mi[]{\displaystyle E[]}el valor esperado,dok{\displaystyle C_{k}}es una clase en la que se clasifica una instancia,PAG(dok|incógnita){\displaystyle P(C_{k}|x)}es la probabilidad condicional de etiquetak{\displaystyle k}por ejemploincógnita{\displaystyle x}, yL(){\displaystyle L()}es la función de pérdida 0-1 :

L(incógnita,y)=1δincógnita,y={0si incógnita=y1si incógnitay,{\displaystyle L(x,y)=1-\delta _{x,y}={\begin{cases}0&{\text{si }}x=y\\1&{\text{si }}x\neq y\end{cases}},} dóndeδincógnita,y{\displaystyle \delta _{x,y}}es el delta de Kronecker .

Cuando el estudiante conoce la probabilidad condicional, entonces una solución es:

do^B(incógnita)=argmáximok{1...K}PAG(dok|incógnita=incógnita){\displaystyle {\hat {C}}_{B}(x)=\arg \max _{k\in \{1...K\}}P(C_{k}|X=x)}

Esta solución se conoce como clasificador bayesiano.

El error de predicción esperado correspondiente se denomina tasa de error de Bayes:

Bmi=miincógnita[k=1KL(dok,do^B(incógnita))PAG(dok|incógnita)]=miincógnita[k=1, dokdo^B(incógnita)KPAG(dok|incógnita)]=miincógnita[1PAG(do^B(incógnita)|incógnita)],{\displaystyle BE=E_{x}[\sum _{k=1}^{K}L(C_{k},{\hat {C}}_{B}(x))P(C_{k}|x)]=E_{x}[\sum _{k=1,\ C_{k}\neq {\hat {C}}_{B}(x)}^{K}P(C_{k}|x)]=E_{x}[1-P({\hat {C}}_{B}(x)|x)],}

donde la suma puede omitirse en el último paso debido a la consideración del evento de contador. Por definición del clasificador de Bayes, maximizaPAG(do^B(incógnita)|incógnita){\displaystyle P({\hat {C}}_{B}(x)|x)}y, por lo tanto, minimiza el error de Bayes BE.

El error de Bayes es distinto de cero si las etiquetas de clasificación no son deterministas, es decir, existe una probabilidad distinta de cero de que una instancia dada pertenezca a más de una clase. [ 4 ] En un contexto de regresión con error cuadrático, el error de Bayes es igual a la varianza del ruido. [ 3 ]

Prueba de minimalidad

La prueba de que la tasa de error de Bayes es realmente la mínima posible y que, por lo tanto, el clasificador de Bayes es óptimo, se puede encontrar en la página de Wikipedia sobre el clasificador de Bayes .

Reglas de complemento para clasificadores binarios

Una regla de sustitución utiliza una estimación de la probabilidad posterior.η{\displaystyle \eta }para formar una regla de clasificación. Dado un estimadoη~{\displaystyle {\tilde {\eta }}}, la tasa de error bayesiano en exceso del clasificador asociado está limitada superiormente por:

2mi[|η(incógnita)η~(incógnita)|].{\displaystyle 2\mathbb {E} [|\eta (X)-{\tilde {\eta }}(X)|].}

Para ver esto, observe que el exceso de error de Bayes es igual a 0 donde los clasificadores coinciden, e igual a2|η(incógnita)1/2|{\displaystyle 2|\eta (X)-1/2|}donde no están de acuerdo. Para formar el límite, observe queη~{\displaystyle {\tilde {\eta }}}es al menos hasta donde1/2{\displaystyle 1/2}cuando los clasificadores no coinciden.

Véase también

Referencias

  1. Fukunaga, Keinosuke (1990). Introducción al reconocimiento estadístico de patrones . págs.  3, 97. ISBN 0122698517.
  2. 1 2 K. Tumer, K. (1996) "Estimación de la tasa de error de Bayes mediante la combinación de clasificadores" en Actas de la 13.ª Conferencia Internacional sobre Reconocimiento de Patrones , Volumen 2, 695–699
  3. 1 2 3 Hastie, Trevor (2009). Los elementos del aprendizaje estadístico (2.ª ed.). Springer. pág. 21. ISBN   978-0387848570.
  4. Mohri, Mehryar ; Rostamizadeh, Afshin ; Talwalkar, Ameet (2018). Fundamentos del aprendizaje automático (2ª ed.) . pag. 22.