En el aprendizaje automático , la clasificación de una clase ( OCC ), también conocida como clasificación unaria o modelado de clases , es un enfoque para el entrenamiento de clasificadores binarios en el que solo se utilizan ejemplos de una de las dos clases. [ 1 ]
Algunos ejemplos incluyen la monitorización de las cajas de engranajes de los helicópteros, [ 2 ] [ 3 ] [ 4 ] la predicción de fallos de motor, [ 5 ] o la evaluación del estado operativo de una central nuclear como «normal»: [ 6 ] En tales escenarios, hay pocos, o ningún, ejemplo de los estados catastróficos del sistema —valores atípicos raros— que componen la segunda clase. Alternativamente, la clase en la que se centra puede abarcar un subconjunto pequeño y coherente de los datos y el entrenamiento puede basarse en un enfoque de cuello de botella de información . [ 7 ]
En la práctica, los contraejemplos de la segunda clase pueden utilizarse en rondas posteriores de entrenamiento para perfeccionar aún más el algoritmo.
Descripción general
El término clasificación de una clase (OCC) fue acuñado por Moya y Hush (1996) [ 8 ] y se pueden encontrar muchas aplicaciones en la literatura científica , por ejemplo, detección de valores atípicos , detección de anomalías y detección de novedades . Una característica de la OCC es que utiliza solo puntos de muestra de la clase asignada, por lo que no se requiere estrictamente un muestreo representativo para las clases no objetivo. [ 9 ]
Introducción

La clasificación de una clase (OCC) basada en SVM se basa en identificar la hiperesfera más pequeña (con radio r y centro c) que consta de todos los puntos de datos. [ 10 ] Este método se llama Descripción de Datos de Vectores de Soporte (SVDD). Formalmente, el problema se puede definir en la siguiente forma de optimización restringida ,
Sin embargo, la formulación anterior es muy restrictiva y sensible a la presencia de valores atípicos. Por lo tanto, se formula una formulación flexible que permite la presencia de valores atípicos, como se muestra a continuación.
A partir de las condiciones de Karush-Kuhn-Tucker para la optimalidad, obtenemos:
donde las 's son la solución del siguiente problema de optimización:
sujeto a,
La introducción de la función kernel proporciona flexibilidad adicional al algoritmo SVM de una clase (OSVM). [ 11 ]
Aprendizaje PU (Positivo No Etiquetado)
Un problema similar es el aprendizaje PU , en el que se construye un clasificador binario mediante aprendizaje semisupervisado a partir únicamente de puntos de muestra positivos y sin etiquetar . [ 12 ]
En el aprendizaje PU, se asume que hay dos conjuntos de ejemplos disponibles para el entrenamiento: el conjunto positivo y un conjunto mixto , que se supone que contiene muestras tanto positivas como negativas, pero sin que estén etiquetadas como tales. Esto contrasta con otras formas de aprendizaje semisupervisado, donde se asume que hay disponible un conjunto etiquetado que contiene ejemplos de ambas clases, además de muestras sin etiquetar. Existen diversas técnicas para adaptar los clasificadores supervisados al entorno de aprendizaje PU, incluidas variantes del algoritmo EM . El aprendizaje PU se ha aplicado con éxito a texto , [ 13 ] [ 14 ] [ 15 ] series temporales, [ 16 ] tareas bioinformáticas , [ 17 ] [ 18 ] y datos de teledetección . [ 19 ]
Aproches
Se han propuesto varios enfoques para resolver la clasificación de una sola clase (OCC). Estos enfoques se pueden distinguir en tres categorías principales: estimación de densidad , métodos de frontera y métodos de reconstrucción . [ 6 ]
Métodos de estimación de densidad
Los métodos de estimación de densidad se basan en estimar la densidad de los puntos de datos y establecer un umbral. Estos métodos se basan en la suposición de distribuciones, como la gaussiana o la de Poisson . Posteriormente, se pueden utilizar pruebas de discordancia para evaluar los nuevos objetos. Estos métodos son robustos ante la varianza de escala.
El modelo gaussiano [ 20 ] es uno de los métodos más sencillos para crear clasificadores de una sola clase. Debido al Teorema del Límite Central (TLC) [ 21 ] , estos métodos funcionan mejor cuando hay un gran número de muestras y se ven afectados por pequeños errores independientes. La distribución de probabilidad para un objeto d-dimensional viene dada por:
Donde es la media y es la matriz de covarianza . Calcular la inversa de la matriz de covarianza ( ) es la operación más costosa, y en los casos en que los datos no están escalados correctamente, o los datos tienen direcciones singulares, se utiliza la pseudoinversa para aproximar la inversa, y se calcula como . [ 22 ]
Métodos de frontera
Los métodos de contorno se centran en establecer límites alrededor de un conjunto de puntos, denominados puntos objetivo. Estos métodos buscan optimizar el volumen. Al basarse en distancias, no son robustos ante variaciones de escala. Algunos ejemplos clave son el método de los centros K, NN-d y SVDD.
Centros K
En el algoritmo K-center, [ 23 ] se colocan bolas pequeñas con radio igual para minimizar la distancia máxima de todas las distancias mínimas entre los objetos de entrenamiento y los centros. Formalmente, se minimiza el siguiente error:
El algoritmo utiliza un método de búsqueda hacia adelante con inicialización aleatoria, donde el radio se determina por la distancia máxima del objeto que cualquier bola dada debe capturar. Después de que se determinan los centros, para cualquier objeto de prueba dado la distancia se puede calcular como,
Métodos de reconstrucción
Los métodos de reconstrucción utilizan el conocimiento previo y el proceso de generación para construir un modelo que se ajuste mejor a los datos. Los nuevos objetos pueden describirse en términos del estado del modelo generador. Algunos ejemplos de métodos de reconstrucción para OCC son la agrupación k-means , la cuantización vectorial de aprendizaje, los mapas autoorganizados, etc.
Aplicaciones
Clasificación de documentos
El paradigma básico de la Máquina de Vectores de Soporte (SVM) se entrena con ejemplos positivos y negativos; sin embargo, diversos estudios han demostrado que existen muchas razones válidas para utilizar únicamente ejemplos positivos. Cuando el algoritmo SVM se modifica para usar solo ejemplos positivos, el proceso se denomina clasificación de una sola clase. Una situación en la que este tipo de clasificación podría resultar útil para el paradigma SVM es al intentar identificar los sitios web de interés de un usuario basándose únicamente en su historial de navegación.
Estudios biomédicos
La clasificación de una sola clase puede ser particularmente útil en estudios biomédicos donde a menudo los datos de otras clases pueden ser difíciles o imposibles de obtener. Al estudiar datos biomédicos, puede ser difícil y/o costoso obtener el conjunto de datos etiquetados de la segunda clase que sería necesario para realizar una clasificación de dos clases. Un estudio de The Scientific World Journal encontró que el enfoque de tipicidad es el más útil en el análisis de datos biomédicos porque se puede aplicar a cualquier tipo de conjunto de datos (continuo, discreto o nominal). [ 24 ] El enfoque de tipicidad se basa en la agrupación de datos examinando los datos y colocándolos en grupos nuevos o existentes. [ 25 ] Para aplicar la tipicidad a la clasificación de una sola clase para estudios biomédicos, cada nueva observación, , se compara con la clase objetivo, , y se identifica como un valor atípico o un miembro de la clase objetivo. [ 24 ]
Detección de deriva conceptual no supervisada
La clasificación de una clase tiene similitudes con la detección de deriva conceptual no supervisada, ya que ambas buscan identificar si los datos no vistos comparten características similares a los datos iniciales. Un concepto se define como la distribución de probabilidad fija de la que se extraen los datos. En la detección de deriva conceptual no supervisada, el objetivo es detectar si la distribución de datos cambia sin utilizar etiquetas de clase. En la clasificación de una clase, el flujo de datos no es importante. Los datos no vistos se clasifican como típicos o atípicos según sus características, independientemente de si pertenecen o no al concepto inicial. Sin embargo, la detección de deriva no supervisada monitorea el flujo de datos y señala una deriva si hay una cantidad significativa de cambios o anomalías. La detección de deriva conceptual no supervisada puede identificarse como la forma continua de la clasificación de una clase. [ 26 ] Los clasificadores de una clase se utilizan para detectar derivas conceptuales. [ 27 ]
Véase también
Referencias
- ^ Oliveri P (agosto de 2017). "Modelado de clases en química analítica de alimentos: desarrollo, muestreo, optimización y problemas de validación - Un tutorial". Analytica Chimica Acta . 982 : 9–19 . Bibcode : 2017AcAC..982....9O . doi : 10.1016/j.aca.2017.05.013 . hdl : 11567/881059 . PMID 28734370 .
- ^ Japkowicz N, Myers C, Gluck M (1995). "Un enfoque de detección de novedades para la clasificación". pp. 518– 523. CiteSeerX 10.1.1.40.3663 .
- ^ Japkowicz N (1999). Aprendizaje de conceptos en ausencia de contraejemplos: un enfoque de clasificación basado en la autoasociación (Tesis). Universidad de Rutgers.
- ^ Japkowicz N (2001). "Aprendizaje binario supervisado versus no supervisado mediante redes neuronales de alimentación directa" (PDF) . Machine Learning . 42 : 97–122 . doi : 10.1023/A:1007660820062 . S2CID 7298189 .
- ^ Petsche T, Marcantonio A, Darken C, Hanson S, Kuhn G, Santoso I (1996). "Un autoasociador de red neuronal para la predicción de fallas en motores de inducción" (PDF) . NIPS.
- ^ a b Tax D (2001). Clasificación de una clase: Aprendizaje de conceptos en ausencia de contraejemplos (PDF) (tesis doctoral). Países Bajos: Universidad de Delft.
- ^ Crammer, Koby (2004). "Una aguja en un pajar" . Vigésimo primera conferencia internacional sobre aprendizaje automático - ICML '04 . pág. 26. doi : 10.1145/1015330.1015399 . ISBN 978-1-58113-838-2. S2CID 8736254 .
- ^ Moya, M.; Hush, D. (1996). "Restricciones de red y optimización multiobjetivo para la clasificación de una clase". Redes neuronales . 9 (3): 463– 474. doi : 10.1016/0893-6080(95)00120-4 .
- ^ Rodionova OY, Oliveri P, Pomerantsev AL (2016-12-15). "Enfoques rigurosos y flexibles para la clasificación de una sola clase". Chemometrics and Intelligent Laboratory Systems . 159 : 89–96 . doi : 10.1016/j.chemolab.2016.10.002 . hdl : 11567/864539 .
- ^ Zineb, Noumir; Honeine, Paul; Richard, Cedue (2012). "Sobre métodos sencillos de clasificación de una sola clase". Actas del Simposio Internacional de Teoría de la Información del IEEE . IEEE, 2012.
- ^ Khan, Shehroz S.; Madden, Michael G. (2010). "Un estudio de las tendencias recientes en la clasificación de una sola clase". En Coyle, Lorcan; Freyne, Jill (eds.). Inteligencia artificial y ciencia cognitiva . Lecture Notes in Computer Science. Vol. 6206. Springer Berlin Heidelberg. pp. 188–197 . doi : 10.1007/978-3-642-17080-5_21 . hdl : 10379/1472 . ISBN 978-3-642-17080-5. S2CID 36784649 .
- ^ Liu, Bing (2007). Minería de datos web . Springer. pp. 165–178 .
- ^ Bing Liu; Wee Sun Lee; Philip S. Yu y Xiao-Li Li (2002). Clasificación parcialmente supervisada de documentos de texto . ICML. págs. 8–12 .
- ^ Hwanjo Yu; Jiawei Han; Kevin Chen-Chuan Chang (2002). PEBL: aprendizaje basado en ejemplos positivos para la clasificación de páginas web mediante SVM . ACM SIGKDD.
- ^ Xiao-Li Li y Bing Liu (2003). Aprendizaje para clasificar texto utilizando datos positivos y no etiquetados . IJCAI.
- ^ Minh Nhut Nguyen; Xiao-Li Li y See-Kiong Ng (2011). Aprendizaje positivo sin etiquetas para la clasificación de series temporales . IJCAI.
- ^ Peng Yang; Xiao-Li Li; Jian-Ping Mei; Chee-Keong Kwoh y See-Kiong Ng (2012). Aprendizaje positivo sin etiquetar para la identificación de genes de enfermedades . Bioinformática, volumen 28 (20).
- ^ Bugnon, LA; Yones, C.; Milone, DH y Stegmayer, G. (2020). "Descubrimiento a nivel genómico de pre-miRNAs: comparación de enfoques recientes basados en aprendizaje automático". Oxford Bioinformatics . 22 (3). doi : 10.1093/bib/bbaa184 . PMID 32814347 .
- ^ Li, W.; Guo, Q.; Elkan, C. (febrero de 2011). "Un algoritmo de aprendizaje positivo y sin etiquetar para la clasificación de una clase de datos de teledetección". IEEE Transactions on Geoscience and Remote Sensing . 49 (2): 717– 725. Bibcode : 2011ITGRS..49..717L . doi : 10.1109/TGRS.2010.2058578 . ISSN 0196-2892 . S2CID 267120 .
- ^ Bishop, Christopher M.; Bishop, Profesor de Computación Neuronal Christopher M. (23 de noviembre de 1995). Redes neuronales para el reconocimiento de patrones . Clarendon Press. ISBN 978-0-19-853864-6.
- ^ Ullman, Neil R (2017-01-01). Estadística elemental .
- ^ "Introducción a las Matemáticas Aplicadas" . Librería de SIAM . Consultado el 29 de abril de 2019 .
- ^ Ypma, Alejandro; Duin, Robert PW (1998). "Objetos de soporte para la aproximación de dominios". En Niklasson, Lars; Bodén, Mikael; Ziemke, Tom (eds.). ICANN 98 . Perspectivas de la computación neuronal. Springer Londres. págs. 719– 724. doi : 10.1007/978-1-4471-1599-1_110 . ISBN 978-1-4471-1599-1.
- ^ a b Irigoien I, Sierra B, Arenas C (2014). "Hacia la aplicación de métodos de clasificación de una sola clase a datos médicos" . TheScientificWorldJournal . 2014 730712. doi : 10.1155/2014/730712 . PMC 3980920. PMID 24778600 .
- ^ Irigoien I, Arenas C (julio de 2008). "INCA: nueva estadística para estimar el número de conglomerados e identificar unidades atípicas". Statistics in Medicine . 27 (15): 2948–73 . doi : 10.1002/sim.3143 . PMID 18050154. S2CID 24791212 .
- ^ Gözüaçık, Ömer; Can, Fazli (noviembre de 2020). "Aprendizaje de conceptos mediante clasificadores de una clase para la detección implícita de deriva en flujos de datos en evolución". Artificial Intelligence Review . 54 (5): 3725– 3747. doi : 10.1007/s10462-020-09939-x . hdl : 11693/77042 . S2CID 229506136 .
- ^ Krawczyk, Bartosz; Woźniak, Michał (2015). "Clasificadores de una clase con aprendizaje incremental y olvido para flujos de datos con deriva conceptual" . Soft Computing . 19 (12): 3387–3400 . doi : 10.1007/s00500-014-1492-5 . S2CID 207011971 .
- Clasificación estadística
- Algoritmos de clasificación