Dada una población cuyos miembros pertenecen a uno de varios conjuntos o clases diferentes , una regla de clasificación o clasificador es un procedimiento mediante el cual se predice que cada elemento del conjunto de la población pertenece a una de las clases. [ 1 ] Una clasificación perfecta es aquella en la que cada elemento de la población se asigna a la clase a la que realmente pertenece. El clasificador bayesiano es el clasificador que asigna clases de forma óptima basándose en los atributos conocidos (es decir, características o regresores) de los elementos que se van a clasificar.
Un tipo especial de regla de clasificación es la clasificación binaria , para problemas en los que solo hay dos clases.
Reglas de clasificación de pruebas
Dado un conjunto de datos que consta de pares x e y , donde x denota un elemento de la población e y la clase a la que pertenece, una regla de clasificación h ( x ) es una función que asigna a cada elemento x una clase predicha.Una clasificación binaria es aquella en la que la etiqueta y solo puede tomar uno de dos valores.
Las etiquetas verdaderas y i pueden conocerse, pero no necesariamente coincidirán con sus aproximaciones.En una clasificación binaria, los elementos que no se clasifican correctamente se denominan falsos positivos y falsos negativos.
Algunas reglas de clasificación son funciones estáticas. Otras pueden ser programas informáticos. Un clasificador informático puede aprender o implementar reglas de clasificación estáticas. Para un conjunto de datos de entrenamiento, las etiquetas verdaderas y j son desconocidas, pero es un objetivo primordial para el procedimiento de clasificación que la aproximaciónlo mejor posible, donde la calidad de esta aproximación debe juzgarse en función de las propiedades estadísticas o probabilísticas de la población general de la que se extraerán las observaciones futuras.
Dada una regla de clasificación, una prueba de clasificación es el resultado de aplicar dicha regla a una muestra finita del conjunto de datos inicial.
Clasificación binaria y multiclase
La clasificación puede considerarse como dos problemas distintos: la clasificación binaria y la clasificación multiclase . En la clasificación binaria, una tarea mejor comprendida, solo intervienen dos clases, mientras que la clasificación multiclase implica asignar un objeto a una de varias clases. [ 2 ] Dado que se han desarrollado muchos métodos de clasificación específicamente para la clasificación binaria, la clasificación multiclase suele requerir el uso combinado de varios clasificadores binarios. Un punto importante es que, en muchos problemas prácticos de clasificación binaria, los dos grupos no son simétricos; en lugar de la precisión general, interesa la proporción relativa de los diferentes tipos de errores. Por ejemplo, en las pruebas médicas, un falso positivo (detección de una enfermedad cuando no está presente) se considera diferente de un falso negativo (no detección de una enfermedad cuando sí está presente). En las clasificaciones multiclase, las clases pueden considerarse simétricamente (todos los errores son equivalentes) o asimétricamente, lo que resulta considerablemente más complejo.
Los métodos de clasificación binaria incluyen la regresión probit y la regresión logística . Los métodos de clasificación multiclase incluyen la regresión probit multinomial y la regresión logit multinomial .
Matriz de confusión y clasificadores

Cuando la función de clasificación no es perfecta, aparecerán resultados falsos. En el ejemplo de la imagen de la derecha, hay 20 puntos en el lado izquierdo de la línea (lado verdadero), pero solo 8 de ellos eran verdaderos. En una situación similar, en el lado derecho de la línea (lado falso), hay 16 puntos, pero 4 de ellos se marcaron erróneamente como verdaderos. Utilizando la ubicación de los puntos, podemos construir una matriz de confusión para expresar los valores. Podemos usar 4 métricas diferentes para expresar los 4 resultados posibles: verdadero positivo (VP), falso positivo (FP), falso negativo (FN) y verdadero negativo (VN).
Falsos positivos
Los falsos positivos se producen cuando una prueba informa erróneamente un resultado positivo. Por ejemplo, una prueba médica para detectar una enfermedad puede dar un resultado positivo, indicando que el paciente padece la enfermedad aunque no la tenga. Un falso positivo se suele representar como la unidad superior derecha (Condición negativa x Resultado de la prueba positivo) en una matriz de confusión .
Falsos negativos
Por otro lado, los falsos negativos se producen cuando una prueba informa erróneamente un resultado negativo. Por ejemplo, una prueba médica para una enfermedad puede arrojar un resultado negativo, indicando que el paciente no padece la enfermedad, aunque en realidad sí la padezca. El falso negativo se suele representar como la unidad inferior izquierda (Condición positiva X resultado de la prueba negativo) en una matriz de confusión .
Verdaderos positivos
Los verdaderos positivos se producen cuando una prueba informa correctamente un resultado positivo. Por ejemplo, una prueba médica para una enfermedad puede arrojar un resultado positivo que indica que el paciente padece la enfermedad. Esto se demuestra cuando la prueba del paciente confirma la existencia de la enfermedad. Un verdadero positivo se suele representar como la unidad superior izquierda (Condición positiva x Resultado de la prueba positivo) en una matriz de confusión .
Verdaderos negativos
Un resultado negativo verdadero se produce cuando una prueba informa correctamente un resultado negativo. Por ejemplo, una prueba médica para una enfermedad puede dar un resultado positivo, lo que indica que el paciente no padece la enfermedad. Esto se demuestra cuando la prueba del paciente también informa que no tiene la enfermedad. El resultado negativo verdadero se suele representar como la unidad inferior derecha (Condición negativa X resultado de la prueba negativo) en una matriz de confusión .
Aplicación con el teorema de Bayes
También podemos calcular los verdaderos positivos, falsos positivos, verdaderos negativos y falsos negativos utilizando el teorema de Bayes . El uso del teorema de Bayes nos ayuda a describir la probabilidad de un evento (teoría de la probabilidad) , basándonos en el conocimiento previo de las condiciones que podrían estar relacionadas con dicho evento. A continuación se muestran las cuatro clasificaciones utilizando el siguiente ejemplo.
- Si un paciente sometido a la prueba no tiene la enfermedad, el resultado será positivo el 5% de las veces, o con una probabilidad de 0,05.
- Supongamos que solo el 0,1% de la población padece esa enfermedad, de modo que un paciente seleccionado al azar tiene una probabilidad previa de 0,001 de tenerla.
- Sea A la condición en la que el paciente tiene la enfermedad.
- Sea ¬ A la condición en la que el paciente no tiene la enfermedad.
- Sea B la evidencia de un resultado positivo en la prueba.
- Sea ¬ B la evidencia de un resultado negativo en la prueba.
En términos de verdaderos positivos, falsos positivos, falsos negativos y verdaderos negativos:
- Un falso positivo es la probabilidad P de que ¬ A (el paciente no tiene la enfermedad) y luego B (el paciente da positivo en la prueba de la enfermedad), también expresada como P ( ¬ A |B).
- Un falso negativo es la probabilidad P de que A (el paciente tenga la enfermedad) y luego ¬ B (el paciente dé negativo en la prueba de la enfermedad), también expresada como P ( A | ¬ B ).
- Un verdadero positivo es la probabilidad P de que A (el paciente tenga la enfermedad) y luego B (el paciente dé positivo en la prueba de la enfermedad), también expresada como P ( A | B ).
- Un verdadero negativo es la probabilidad P de que ¬ A (el paciente no tiene la enfermedad) y luego ¬ B (el paciente da negativo en la prueba de la enfermedad), también expresada como P ( ¬ A | ¬ B ).
Falsos positivos
Podemos usar el teorema de Bayes para determinar la probabilidad de que un resultado positivo sea en realidad un falso positivo. Observamos que si una enfermedad es poco común, la mayoría de los resultados positivos pueden ser falsos positivos, incluso si la prueba es relativamente precisa.
Ingenuamente, uno podría pensar que solo el 5% de los resultados positivos de las pruebas son falsos, pero eso es completamente erróneo, como veremos.
Supongamos que solo el 0,1% de la población padece esa enfermedad, de modo que un paciente seleccionado al azar tiene una probabilidad previa de 0,001 de tenerla.
Podemos utilizar el teorema de Bayes para calcular la probabilidad de que un resultado positivo en una prueba sea un falso positivo.
y por lo tanto, la probabilidad de que un resultado positivo sea un falso positivo es aproximadamente 1 − 0,019 = 0,98, o 98%.
A pesar de la aparente alta precisión de la prueba, la incidencia de la enfermedad es tan baja que la gran mayoría de los pacientes que dan positivo no la padecen. No obstante, la proporción de pacientes que dan positivo y que sí tienen la enfermedad (0,019) es 19 veces mayor que la proporción de personas que aún no se han realizado la prueba y que la padecen (0,001). Por lo tanto, la prueba no es inútil y repetirla podría mejorar la fiabilidad del resultado.
Para reducir el problema de los falsos positivos, una prueba debe ser muy precisa al informar un resultado negativo cuando el paciente no tiene la enfermedad. Si la prueba informa un resultado negativo en pacientes sin la enfermedad con una probabilidad de 0,999, entonces
de modo que 1 − 0,5 = 0,5 ahora es la probabilidad de un falso positivo.
Falsos negativos
Podemos utilizar el teorema de Bayes para determinar la probabilidad de que el resultado negativo sea en realidad un falso negativo, utilizando el ejemplo anterior:
La probabilidad de que un resultado negativo sea un falso negativo es de aproximadamente 0,0000105 o 0,00105%. Cuando una enfermedad es poco común, los falsos negativos no representan un problema importante para la prueba.
Pero si el 60% de la población tuviera la enfermedad, entonces la probabilidad de un falso negativo sería mayor. Con la prueba anterior, la probabilidad de un falso negativo sería
La probabilidad de que un resultado negativo sea un falso negativo aumenta a 0,0155 o 1,55%.
Verdaderos positivos
Podemos utilizar el teorema de Bayes para determinar la probabilidad de que el resultado positivo sea en realidad un verdadero positivo, utilizando el ejemplo anterior:
- Si un paciente sometido a la prueba tiene la enfermedad, el resultado es positivo el 99% de las veces, o con una probabilidad de 0,99.
- Si un paciente sometido a la prueba no tiene la enfermedad, el resultado será positivo el 5% de las veces, o con una probabilidad de 0,05.
- Supongamos que solo el 0,1% de la población padece esa enfermedad, de modo que un paciente seleccionado al azar tiene una probabilidad previa de 0,001 de tenerla.
Sea A la condición en la que el paciente tiene la enfermedad, y B la evidencia de un resultado positivo en la prueba. Entonces, la probabilidad de que el paciente realmente tenga la enfermedad dado un resultado positivo en la prueba es:
La probabilidad de que un resultado positivo sea un verdadero positivo es de aproximadamente 0,019%.
Verdaderos negativos
También podemos usar el teorema de Bayes para calcular la probabilidad de un verdadero negativo. Usando los ejemplos anteriores:
- Si un paciente sometido a la prueba tiene la enfermedad, el resultado es positivo el 99% de las veces, o con una probabilidad de 0,99.
La probabilidad de que un resultado negativo sea un verdadero negativo es de 0,9999494 o 99,99 %. Dado que la enfermedad es poco frecuente y la tasa de positivos a positivos es alta, al igual que la tasa de negativos a negativos, esto generará una alta tasa de verdaderos negativos.
Medición de un clasificador con sensibilidad y especificidad
Al entrenar un clasificador, se puede querer medir su rendimiento utilizando las métricas bien aceptadas de sensibilidad y especificidad. Puede ser instructivo comparar el clasificador con un clasificador aleatorio que lanza una moneda en función de la prevalencia de una enfermedad. Supongamos que la probabilidad de que una persona tenga la enfermedad esy la probabilidad de que no lo hagan esSupongamos entonces que tenemos un clasificador aleatorio que adivina que el paciente tiene la enfermedad con esa misma probabilidad.y supone que no lo hace con la misma probabilidad.
La probabilidad de un verdadero positivo es la probabilidad de que el paciente tenga la enfermedad multiplicada por la probabilidad de que el clasificador aleatorio acierte con esto, o. Con un razonamiento similar, la probabilidad de un falso negativo es. Según las definiciones anteriores, la sensibilidad de este clasificador es. Con un razonamiento similar, podemos calcular la especificidad como.
Así pues, aunque la medida en sí es independiente de la prevalencia de la enfermedad, el rendimiento de este clasificador aleatorio sí depende de ella. El clasificador puede tener un rendimiento similar al de este clasificador aleatorio, pero con una moneda mejor ponderada (mayor sensibilidad y especificidad). Por lo tanto, estas medidas pueden verse influenciadas por la prevalencia de la enfermedad. Una medida alternativa de rendimiento es el coeficiente de correlación de Matthews , para el cual cualquier clasificador aleatorio obtendrá una puntuación media de 0.
La extensión de este concepto a clasificaciones no binarias produce la matriz de confusión .
Véase también
Notas
Referencias
- ↑ Artículo de Mathworld sobre pruebas estadísticas
- ↑ Har-Peled, S. , Roth, D., Zimak, D. (2003) "Clasificación con restricciones para clasificación y jerarquización multiclase". En: Becker, B., Thrun, S., Obermayer, K. (Eds.) Avances en sistemas de procesamiento de información neuronal 15: Actas de la conferencia de 2002 , MIT Press. ISBN 0-262-02550-7
- Clasificación estadística