Articulo de referencia

Regresión simbólica

Árbol de expresiones tal como puede utilizarse en la regresión simbólica para representar una función. La regresión simbólica ( RS ) es un tipo de análisis de regresión que busc...

Árbol de expresiones tal como puede utilizarse en la regresión simbólica para representar una función.

La regresión simbólica ( RS ) es un tipo de análisis de regresión que busca en el espacio de expresiones matemáticas el modelo que mejor se ajuste a un conjunto de datos determinado, tanto en términos de precisión como de simplicidad.

No se proporciona ningún modelo en particular como punto de partida para la regresión simbólica. En cambio, las expresiones iniciales se forman combinando aleatoriamente bloques matemáticos básicos como operadores matemáticos , funciones analíticas , constantes y variables de estado . Por lo general, la persona que opera el sistema especificará un subconjunto de estos elementos básicos, pero esto no es un requisito de la técnica. El problema de la regresión simbólica para funciones matemáticas se ha abordado con una variedad de métodos, incluyendo la recombinación de ecuaciones, más comúnmente mediante programación genética , [ 1 ] así como métodos más recientes que utilizan métodos bayesianos [ 2 ] y redes neuronales . [ 3 ] Otro método alternativo no clásico a la regresión simbólica se denomina Universal Functions Originator (UFO), que tiene un mecanismo, un espacio de búsqueda y una estrategia de construcción diferentes. [ 4 ] Otros métodos, como el aprendizaje exacto, intentan transformar el problema de ajuste en un problema de momentos en un espacio de funciones naturales, generalmente construido en torno a generalizaciones de la función Meijer-G . [ 5 ]

Al no requerir la especificación a priori de un modelo, la regresión simbólica no se ve afectada por el sesgo humano ni por lagunas desconocidas en el conocimiento del dominio . Intenta descubrir las relaciones intrínsecas del conjunto de datos, permitiendo que los patrones en los propios datos revelen los modelos apropiados, en lugar de imponer una estructura de modelo que se considere matemáticamente manejable desde una perspectiva humana. La función de aptitud que impulsa la evolución de los modelos tiene en cuenta no solo las métricas de error (para asegurar que los modelos predigan los datos con precisión), sino también medidas de complejidad especiales, [ 6 ] asegurando así que los modelos resultantes revelen la estructura subyacente de los datos de una manera comprensible desde una perspectiva humana. Esto facilita el razonamiento y favorece las probabilidades de obtener información sobre el sistema generador de datos, además de mejorar la generalización y el comportamiento de extrapolación al prevenir el sobreajuste . La precisión y la simplicidad pueden dejarse como dos objetivos separados de la regresión —en cuyo caso las soluciones óptimas forman un frente de Pareto— o pueden combinarse en un único objetivo mediante un principio de selección de modelos como la longitud de descripción mínima .

Se ha demostrado que la regresión simbólica es un problema NP-difícil . [ 7 ] Sin embargo, si la ecuación buscada no es demasiado compleja, es posible resolver el problema de regresión simbólica de forma exacta generando todas las funciones posibles (construidas a partir de un conjunto predefinido de operadores) y evaluándolas en el conjunto de datos en cuestión. [ 8 ]

Diferencia con la regresión clásica

Mientras que las técnicas de regresión convencionales buscan optimizar los parámetros para una estructura de modelo predefinida, la regresión simbólica evita imponer supuestos previos y, en cambio, infiere el modelo a partir de los datos. En otras palabras, intenta descubrir tanto la estructura del modelo como sus parámetros.

Este enfoque tiene la desventaja de requerir un espacio de búsqueda mucho mayor, ya que no solo el espacio de búsqueda en la regresión simbólica es infinito, sino que además existe un número infinito de modelos que se ajustan perfectamente a un conjunto de datos finito (siempre que la complejidad del modelo no esté limitada artificialmente). Esto significa que un algoritmo de regresión simbólica podría tardar más en encontrar un modelo y una parametrización adecuados que las técnicas de regresión tradicionales. Esto puede mitigarse limitando el conjunto de bloques de construcción proporcionados al algoritmo, en función del conocimiento existente del sistema que generó los datos; pero, en definitiva, el uso de la regresión simbólica es una decisión que debe sopesarse con el conocimiento que se tiene del sistema subyacente.

No obstante, esta característica de la regresión simbólica también presenta ventajas: dado que el algoritmo evolutivo requiere diversidad para explorar eficazmente el espacio de búsqueda, es probable que el resultado sea una selección de modelos con puntuaciones altas (y su correspondiente conjunto de parámetros). El análisis de esta colección podría proporcionar una mejor comprensión del proceso subyacente y permite al usuario identificar una aproximación que se ajuste mejor a sus necesidades en términos de precisión y simplicidad.

Evaluación comparativa

SRBench

En 2021, SRBench [ 9 ] se propuso como un gran banco de pruebas para la regresión simbólica. En sus inicios, SRBench incluía 14 métodos de regresión simbólica, otros 7 métodos de aprendizaje automático y 252 conjuntos de datos de PMLB . El banco de pruebas pretende ser un proyecto vivo: fomenta la presentación de mejoras, nuevos conjuntos de datos y nuevos métodos para mantenerse al día sobre el estado del arte en regresión simbólica.

Concurso SRBench 2022

En 2022, SRBench anunció la competición «Interpretable Symbolic Regression for Data Science», que tuvo lugar en la conferencia GECCO en Boston, Massachusetts. La competición enfrentó a nueve algoritmos líderes de regresión simbólica en un conjunto novedoso de problemas de datos y consideró diferentes criterios de evaluación. La competición se organizó en dos pistas: una con datos sintéticos y otra con datos reales. [ 10 ]

Pista sintética

En la pista sintética, los métodos se compararon según cinco propiedades: redescubrimiento de expresiones exactas; selección de características; resistencia a óptimos locales; extrapolación; y sensibilidad al ruido. Las clasificaciones de los métodos fueron:

  1. QLattice
  2. PySR (Regresión simbólica en Python)
  3. uDSR (Optimización Simbólica Profunda)

Pista del mundo real

En la fase práctica, se entrenaron métodos para construir modelos predictivos interpretables para el pronóstico a 14 días de casos, hospitalizaciones y muertes por COVID-19 en el estado de Nueva York. Estos modelos fueron revisados ​​por un experto en la materia, quien les asignó calificaciones de confiabilidad y los evaluó en cuanto a precisión y simplicidad. La clasificación de los métodos fue la siguiente:

  1. uDSR (Optimización Simbólica Profunda)
  2. QLattice
  3. motor genético (Motor Genético)

Métodos no estándar

La mayoría de los algoritmos de regresión simbólica evitan la explosión combinatoria mediante la implementación de algoritmos evolutivos que mejoran iterativamente la expresión de mejor ajuste a lo largo de muchas generaciones. Recientemente, los investigadores han propuesto algoritmos que utilizan otras tácticas en IA .

Silviu-Marian Udrescu y Max Tegmark desarrollaron el algoritmo "AI Feynman", [ 11 ] [ 12 ] que intenta la regresión simbólica entrenando una red neuronal para representar la función misteriosa, y luego realiza pruebas contra la red neuronal para intentar dividir el problema en partes más pequeñas. Por ejemplo, siF(incógnita1,...,incógnitai,incógnitai+1,...,incógnitanorte)=gramo(incógnita1,...,incógnitai)+h(incógnitai+1,...,incógnitanorte){\displaystyle f(x_{1},...,x_{i},x_{i+1},...,x_{n})=g(x_{1},...,x_{i})+h(x_{i+1},...,x_{n})}Las pruebas contra la red neuronal pueden reconocer la separación y proceder a resolverla.gramo{\displaystyle g}yh{\displaystyle h}por separado y con diferentes variables como entradas. Este es un ejemplo de divide y vencerás , que reduce el tamaño del problema para que sea más manejable. AI Feynman también transforma las entradas y salidas de la función misteriosa para producir una nueva función que se puede resolver con otras técnicas, y realiza un análisis dimensional para reducir el número de variables independientes involucradas. El algoritmo fue capaz de "descubrir" 100 ecuaciones de The Feynman Lectures on Physics , mientras que un software líder que utiliza algoritmos evolutivos, Eureqa , resolvió solo 71. AI Feynman, a diferencia de los métodos clásicos de regresión simbólica, requiere un conjunto de datos muy grande para entrenar primero la red neuronal y está naturalmente sesgado hacia ecuaciones que son comunes en la física elemental.

Véase también

Referencias

  1. Michael Schmidt; Hod Lipson (2009). "Destilando leyes naturales de forma libre a partir de datos experimentales" . Science . 324 (5923) . Asociación Estadounidense para el Avance de la Ciencia: 81– 85. Bibcode : 2009Sci...324...81S . CiteSeerX 10.1.1.308.2245 . doi : 10.1126/science.1165893 . PMID 19342586. S2CID 7366016 .   
  2. Ying Jin; Weilin Fu; Jian Kang; Jiadong Guo; Jian Guo (2019). "Regresión simbólica bayesiana". arXiv : 1910.08892 [ estad.ME ].
  3. 1 2 Silviu-Marian Udrescu; Max Tegmark (2020). "AI Feynman: Un método inspirado en la física para la regresión simbólica" . Science_Advances . 6 (16) eaay2631. Asociación Estadounidense para el Avance de la Ciencia. arXiv : 1905.11481 . Bibcode : 2020SciA....6.2631U . doi : 10.1126/sciadv.aay2631 . PMC 7159912. PMID 32426452 .  
  4. Ali R. Al-Roomi; Mohamed E. El-Hawary (2020). "Universal Functions Originator" . Applied Soft Computing . 94 106417. Elsevier BV doi : 10.1016/j.asoc.2020.106417 . ISSN 1568-4946 . S2CID 219743405 .  
  5. Benedict WJ Irwin (2021). "Una representación natural de funciones para el aprendizaje exacto" (PDF) (Preimpresión). doi : 10.21203/rs.3.rs-149856/v1 . S2CID 234014141 . 
  6. Ekaterina J. Vladislavleva; Guido F. Smits; Dick Den Hertog (2009). "Orden de no linealidad como medida de complejidad para modelos generados por regresión simbólica mediante programación genética de Pareto" (PDF) . IEEE Transactions on Evolutionary Computation . 13 (2): 333– 349. Bibcode : 2009ITEC...13..333V . doi : 10.1109/tevc.2008.926486 . S2CID 12072764 . 
  7. Virgolin, Marco; Pissis, Solon P. (2022). "La regresión simbólica es NP-difícil" . Transactions on Machine Learning Research . arXiv : 2207.01018 .
  8. Bartlett, Deaglan; Desmond, Harry; Ferreira, Pedro (2023). "Regresión simbólica exhaustiva". IEEE Transactions on Evolutionary Computation . 28 (4): 1. arXiv : 2211.11461 . doi : 10.1109/TEVC.2023.3280250 . S2CID 253735380 . 
  9. La Cava, William; Orzechowski, Patryk; Burlacu, Bogdan; de Franca, Fabricio; Virgolin, Marco; Jin, Ying; Kommenda, Michael; Moore, Jason (2021). "Métodos de regresión simbólica contemporáneos y su rendimiento relativo" . Actas de la sección sobre conjuntos de datos y puntos de referencia de los Sistemas de Procesamiento de Información Neuronal . 1. arXiv : 2107.14351 .
  10. Michael Kommenda; Guillermo La Cava; Maimuna Majumder; Fabricio Olivetti de Francia; Marco Virgolín. "Concurso SRBench 2022: Regresión simbólica interpretable para la ciencia de datos" .
  11. Udrescu, Silviu-Marian; Tegmark, Max (2020-04-17). "AI Feynman: Un método inspirado en la física para la regresión simbólica" . Science Advances . 6 (16) eaay2631. arXiv : 1905.11481 . Bibcode : 2020SciA....6.2631U . doi : 10.1126/sciadv.aay2631 . ISSN 2375-2548 . PMC 7159912. PMID 32426452 .   
  12. Udrescu, Silviu-Marian; Tan, Andrew; Feng, Jiahai; Neto, Orisvaldo; Wu, Tailin; Tegmark, Max (2020-12-16). "AI Feynman 2.0: Regresión simbólica óptima de Pareto que explota la modularidad de grafos". arXiv : 2006.10782 [ cs.LG ].

Lecturas adicionales

  • Mark J. Willis; Hugo G. Hiden; Ben McKay; Gary A. Montague; Peter Marenbach (1997). "Programación genética: Introducción y panorama general de las aplicaciones" (PDF) . Publicaciones de la Conferencia IEE . IEE . págs. 314–319 . 
  • Wouter Minnebo; Sean Stijven (2011). "Capítulo 4: Regresión simbólica" (PDF) . Potenciando la computación del conocimiento con selección de variables (tesis de maestría). Universidad de Amberes .
  • John R. Koza; Martin A. Keane; James P. Rice (1993). "Mejora del rendimiento del aprendizaje automático mediante el descubrimiento automático de funciones facilitadoras aplicadas a un problema de identificación de sistemas simbólicos" (PDF) . Conferencia Internacional IEEE sobre Redes Neuronales . San Francisco: IEEE . págs. 191–198 . 
  • Ivan Zelinka (2004). "Regresión simbólica: una visión general" .
  • Hansueli Gerber (1998). "Regresión simbólica simple mediante programación genética" .(Applet de Java) — aproxima una función mediante la evolución de combinaciones de operadores aritméticos simples, utilizando algoritmos desarrollados por John Koza .
  • Katya Vladislavleva. "Regresión simbólica: descubrimiento de funciones y más" . Archivado del original el 18 de diciembre de 2014.
  • Mentron