Feature Selection Toolbox (FST) es un software principalmente para la selección de características en el dominio del aprendizaje automático , [1] escrito en C++ , desarrollado en el Instituto de Teoría de la Información y Automatización (UTIA), de la Academia Checa de Ciencias .
Versión 1
La primera generación de Feature Selection Toolbox (FST1) fue una aplicación de Windows con una interfaz de usuario que permitía a los usuarios aplicar varios métodos de selección de características subóptimos, óptimos y basados en mezclas en datos almacenados en un formato de archivo plano de texto propietario trivial. [2]
Versión 3
La tercera generación de Feature Selection Toolbox (FST3) fue una biblioteca sin interfaz de usuario, escrita para ser más eficiente y versátil que la FST1 original. [3]
FST3 admite varias tareas estándar de minería de datos , más específicamente, preprocesamiento y clasificación de datos , pero su enfoque principal está en la selección de características . En el contexto de selección de características, implementa varias técnicas comunes y menos usuales, con especial énfasis en la implementación enhebrada de varios métodos de búsqueda secuencial (una forma de escalada de colinas ). Los métodos implementados incluyen clasificación de características individuales, búsqueda flotante, búsqueda oscilante (adecuada para problemas de muy alta dimensión) en forma aleatoria o determinista, métodos óptimos de tipo de rama y límite , criterios de distancia de clase probabilística, varios estimadores de precisión de clasificadores, optimización del tamaño del subconjunto de características, selección de características con pesos de características preespecificados, conjuntos de criterios, métodos híbridos, detección de todas las soluciones equivalentes u optimización de dos criterios. FST3 está más especializado que el software popular como Waikato Environment for Knowledge Analysis Weka , RapidMiner o PRTools. [4]
De manera predeterminada, las técnicas implementadas en la caja de herramientas se basan en el supuesto de que los datos están disponibles como un único archivo plano en un formato propietario simple o en formato Weka ARFF, donde cada punto de datos se describe mediante una cantidad fija de atributos numéricos. FST3 se proporciona sin interfaz de usuario y está destinado a ser utilizado por usuarios familiarizados tanto con el aprendizaje automático como con la programación en C++ . El software FST1 más antiguo es más adecuado para experimentos simples o fines educativos porque se puede utilizar sin necesidad de codificar en C++.
Historia
- En 1999, se inició el desarrollo de la primera versión de Feature Selection Toolbox en UTIA como parte de una tesis doctoral. Originalmente, se desarrolló en el entorno C++ de Optima++ (posteriormente rebautizado como Power++).
- En 2002, el desarrollo de la primera generación de FST se suspendió, principalmente debido al fin del soporte de Sybase al entorno de desarrollo utilizado en ese momento.
- Entre 2002 y 2008, el núcleo FST se recodificó y se utilizó para experimentación de investigación únicamente dentro de UTIA.
- En 2009, comenzó la tercera recodificación del kernel FST desde cero.
- En 2010, FST3 se puso a disposición del público en forma de biblioteca C++ sin interfaz gráfica de usuario. La página web que lo acompaña recopila enlaces relacionados con la selección de funciones, referencias, documentación y el FST1 original disponible para descargar.
- En 2011, una actualización de FST3 a la versión 3.1 incluyó nuevos métodos (en particular, una novedosa clasificación de características que tiene en cuenta las dependencias y es adecuada para problemas de reconocimiento de dimensiones muy altas) y mejoras en el código central.
Véase también
- Selección de funciones
- Reconocimiento de patrones
- Aprendizaje automático
- Minería de datos
- OpenNN , biblioteca de redes neuronales abiertas para análisis predictivo
- Weka , un software Java de código abierto , completo y popular, de la Universidad de Waikato
- RapidMiner , anteriormente Yet Another Learning Environment (YALE), un marco de aprendizaje automático comercial
- Herramientas de relaciones públicas de la Universidad Tecnológica de Delft
- Infosel++ se especializa en selección de características basada en teoría de la información
- Tooldiag, una caja de herramientas de reconocimiento de patrones de C++
- Lista de software de análisis numérico
Referencias
- ^ Petr Somol; Jana Novovičová; Pavel Pudil (2010). "Selección eficiente de subconjuntos de características y optimización del tamaño de subconjuntos" (PDF) . Avances recientes en reconocimiento de patrones, INTECH . pp. 75– 97. ISBN 978-953-7619-90-9.
- ^ Petr Somol; Pavel Pudil (2002). "Caja de herramientas de selección de características" (PDF) . Reconocimiento de patrones vol. 35, n.º 12, Elsevier . págs. 2749– 2759.
- ^ Petr Somol; Pavel Vacha; Stanislav Mikeš; Jan Hora; Pável Pudil; Pavel Zid (2010). "Introducción a la Caja de herramientas de selección de funciones 3: la biblioteca de C++ para búsqueda de subconjuntos, modelado y clasificación de datos" (PDF) . Tecnología UTIA. Informe N° 2287 . págs . 1–12 . Consultado el 2 de noviembre de 2010 .
- ^ Herramientas de relaciones públicas
Enlaces externos
Sitio web oficial