La selección de características de mínima redundancia es un algoritmo frecuentemente utilizado para identificar con precisión las características de genes y fenotipos , y reducir su relevancia. Generalmente se describe, junto con la selección de características relevantes, como Mínima Redundancia Máxima Relevancia (mRMR). Este método fue propuesto por primera vez en 2003 por Hanchuan Peng y Chris Ding, [ 1 ] seguido de una formulación teórica basada en la información mutua, junto con la primera definición de información mutua multivariada, publicada en IEEE Trans. Pattern Analysis and Machine Intelligence en 2005. [ 2 ]
La selección de características , uno de los problemas básicos del reconocimiento de patrones y el aprendizaje automático , identifica subconjuntos de datos relevantes para los parámetros utilizados y se denomina normalmente Máxima Relevancia . Estos subconjuntos suelen contener información relevante pero redundante, y mRMR intenta solucionar este problema eliminando dichos subconjuntos redundantes. mRMR tiene diversas aplicaciones en áreas como el diagnóstico del cáncer y el reconocimiento de voz .
Las características pueden seleccionarse de diversas maneras. Un método consiste en seleccionar aquellas que presentan la mayor correlación con la variable de clasificación . Esto se conoce como selección de máxima relevancia. Se pueden utilizar numerosos algoritmos heurísticos , como las selecciones secuenciales hacia adelante, hacia atrás o flotantes.
Por otro lado, se pueden seleccionar características que estén muy alejadas entre sí, pero que aún presenten una alta correlación con la variable de clasificación. Este método, denominado selección de mínima redundancia y máxima relevancia (mRMR, por sus siglas en inglés), ha demostrado ser más eficaz que la selección de máxima relevancia.
Como caso particular, la correlación puede sustituirse por la dependencia estadística entre variables. La información mutua permite cuantificar dicha dependencia. En este caso, se demuestra que mRMR es una aproximación para maximizar la dependencia entre la distribución conjunta de las características seleccionadas y la variable de clasificación.
Se han probado diferentes medidas de redundancia y relevancia. Un estudio reciente comparó varias medidas en el contexto de imágenes biomédicas. [ 3 ]
Referencias
- ↑ Chris Ding y Hanchuan Peng, " Selección de características de mínima redundancia a partir de datos de expresión génica de microarrays ". 2.ª Conferencia de Bioinformática de la Sociedad de Computación del IEEE (CSB 2003), 11-14 de agosto de 2003, Stanford, CA, EE. UU. Páginas 523-529.
- ↑ Peng, HC, Long, F., y Ding, C., " Selección de características basada en información mutua: criterios de dependencia máxima, relevancia máxima y redundancia mínima ", IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 27, n.º 8, págs. 1226–1238, 2005.
- ↑ Auffarth, B., Lopez, M., Cerquides, J. (2010). Comparación de medidas de redundancia y relevancia para la selección de características en la clasificación de tejidos en imágenes de TC. Avances en Minería de Datos. Aplicaciones y Aspectos Teóricos. págs. 248-262. Springer. http://www.csc.kth.se/~auffarth/publications/redrel.pdf
Enlaces externos
- Peng, HC, Long, F., y Ding, C., " Selección de características basada en información mutua: criterios de dependencia máxima, relevancia máxima y redundancia mínima ", IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 27, n.º 8, págs. 1226–1238, 2005.
- Chris Ding y Hanchuan Peng, « Selección de características con mínima redundancia a partir de datos de expresión génica de microarrays ». 2.ª Conferencia de Bioinformática de la Sociedad de Computación del IEEE (CSB 2003), 11-14 de agosto de 2003, Stanford, CA, EE. UU. Páginas 523-529.
- Penglab mRMR
- algoritmos de aprendizaje automático