Articulo de referencia

Ray Solomonoff

[[MIT]] [[University of Saarland]] Dalle Molle Institute for Artificial Intelligence"},"notable_works":{"wt":"\"A Formal Theory of Inductive Inference\" (1964), concept of Algor...

Ray Solomonoff (25 de julio de 1926 - 7 de diciembre de 2009) [ 1 ] [ 2 ] fue un matemático estadounidense que inventó la probabilidad algorítmica , [ 3 ] su Teoría General de la Inferencia Inductiva (también conocida como Inferencia Inductiva Universal), [ 4 ] y fue fundador de la teoría de la información algorítmica . [ 5 ] Fue un creador de la rama de la inteligencia artificial basada en el aprendizaje automático , la predicción y la probabilidad . Distribuyó el primer informe sobre aprendizaje automático no semántico en 1956. [ 6 ]

Solomonoff describió por primera vez la probabilidad algorítmica en 1960, publicando el teorema que dio origen a la complejidad de Kolmogorov y a la teoría de la información algorítmica . Presentó estos resultados por primera vez en una conferencia en Caltech en 1960, [ 7 ] y en un informe de febrero de 1960, "Un informe preliminar sobre una teoría general de la inferencia inductiva". [ 8 ] Aclaró estas ideas con mayor detalle en sus publicaciones de 1964, "Una teoría formal de la inferencia inductiva", Parte I [ 9 ] y Parte II. [ 10 ]

La probabilidad algorítmica es una combinación formalizada matemáticamente de la navaja de Occam , [ 11 ] [ 12 ] [ 13 ] [ 14 ] y el Principio de Explicaciones Múltiples. [ 15 ] Es un método independiente de la máquina para asignar un valor de probabilidad a cada hipótesis (algoritmo/programa) que explica una observación dada, donde la hipótesis más simple (el programa más corto) tiene la probabilidad más alta y las hipótesis cada vez más complejas reciben probabilidades cada vez más pequeñas.

Solomonoff fundó la teoría de la inferencia inductiva universal , que se basa en sólidos fundamentos filosóficos [ 4 ] y tiene sus raíces en la complejidad de Kolmogorov y la teoría de la información algorítmica . La teoría utiliza la probabilidad algorítmica en un marco bayesiano . La distribución a priori universal se aplica a la clase de todas las medidas computables; ninguna hipótesis tendrá una probabilidad cero. Esto permite utilizar la regla de Bayes (de causalidad) para predecir el siguiente evento más probable en una serie de eventos, y su probabilidad. [ 10 ]

Aunque es más conocido por la probabilidad algorítmica y su teoría general de la inferencia inductiva , a lo largo de su vida realizó muchos otros descubrimientos importantes, la mayoría de ellos orientados a su objetivo en inteligencia artificial: desarrollar una máquina que pudiera resolver problemas difíciles utilizando métodos probabilísticos.

Historia de vida hasta 1964

Ray Solomonoff nació el 25 de julio de 1926 en Cleveland, Ohio , hijo de inmigrantes judíos rusos Phillip Julius y Sarah Mashman Solomonoff. Asistió a la escuela secundaria Glenville , donde se graduó en 1944. Ese mismo año se unió a la Armada de los Estados Unidos como instructor de electrónica. De 1947 a 1951 estudió en la Universidad de Chicago con profesores como Rudolf Carnap y Enrico Fermi , y se graduó con una maestría en física en 1951.

Desde sus primeros años estuvo motivado por la pura alegría del descubrimiento matemático y por el deseo de explorar donde nadie había ido antes [ 16 ] . A la edad de 16 años, en 1942, comenzó a buscar un método general para resolver problemas matemáticos.

En 1952 conoció a Marvin Minsky , John McCarthy y otros interesados ​​en la inteligencia artificial. En 1956, Minsky, McCarthy y otros organizaron la Conferencia de Investigación de Verano sobre Inteligencia Artificial de Dartmouth , a la que Solomonoff fue uno de los diez invitados originales; él, McCarthy y Minsky fueron los únicos que permanecieron durante todo el verano. Fue para este grupo que la Inteligencia Artificial fue reconocida como ciencia. En aquel entonces, las computadoras podían resolver problemas matemáticos muy específicos, pero poco más. Solomonoff quería abordar una cuestión más amplia: cómo lograr que las máquinas fueran más inteligentes en general y cómo las computadoras podían utilizar la probabilidad para este fin.

Historial laboral hasta 1964

Escribió tres artículos, dos con Anatol Rapoport , entre 1950 y 1952, [ 17 ] que se consideran los primeros análisis estadísticos de redes.

Fue uno de los diez participantes del Proyecto de Investigación de Verano sobre Inteligencia Artificial de Dartmouth de 1956. Escribió y distribuyó un informe entre los asistentes: «Una máquina de inferencia inductiva». [ 6 ] En él, consideraba el aprendizaje automático como probabilístico, haciendo hincapié en la importancia de las secuencias de entrenamiento y en el uso de partes de soluciones previas a problemas para construir soluciones de prueba para nuevos problemas. Publicó una versión de sus hallazgos en 1957. [ 18 ] Estos fueron los primeros artículos que se escribieron sobre aprendizaje automático probabilístico.

A finales de la década de 1950, inventó los lenguajes probabilísticos y sus gramáticas asociadas. [ 19 ] Un lenguaje probabilístico asigna un valor de probabilidad a cada cadena posible.

La generalización del concepto de gramáticas probabilísticas lo llevó a descubrir en 1960 la probabilidad algorítmica y la teoría general de la inferencia inductiva.

Antes de la década de 1960, el método habitual para calcular la probabilidad se basaba en la frecuencia: la proporción de resultados favorables respecto al número total de ensayos. En su publicación de 1960, y de forma más exhaustiva en sus publicaciones de 1964, Solomonoff revisó profundamente esta definición de probabilidad. Denominó a esta nueva forma de probabilidad "Probabilidad Algorítmica" y demostró cómo utilizarla para la predicción en su teoría de la inferencia inductiva. Como parte de este trabajo, sentó las bases filosóficas para el uso de la regla de causalidad de Bayes en la predicción.

El teorema fundamental de lo que más tarde se denominaría Complejidad de Kolmogorov formaba parte de su Teoría General. En 1960, escribió: «Consideremos una secuencia muy larga de símbolos... Consideraremos que dicha secuencia de símbolos es "simple" y tendrá una alta probabilidad a priori si existe una descripción muy breve de esta secuencia, utilizando, por supuesto, algún método de descripción estipulado. Más exactamente, si utilizamos únicamente los símbolos 0 y 1 para expresar nuestra descripción, asignaremos la probabilidad 2 N a una secuencia de símbolos si su descripción binaria más corta posible contiene N dígitos». [ 20 ]

La probabilidad se refiere a una máquina de Turing universal específica . Solomonoff demostró en 1964 que la elección de la máquina, si bien podría añadir un factor constante, no alteraría significativamente las razones de probabilidad. Estas probabilidades son independientes de la máquina.

En 1965, el matemático ruso Kolmogorov publicó de forma independiente ideas similares. Al conocer el trabajo de Solomonoff, lo reconoció, y durante varios años, la obra de Solomonoff fue más conocida en la Unión Soviética que en Occidente. Sin embargo, el consenso general en la comunidad científica era asociar este tipo de complejidad con Kolmogorov, quien se centraba más en la aleatoriedad de una secuencia. La probabilidad algorítmica y la inducción universal (de Solomonoff) se asociaron con Solomonoff, cuyo enfoque era la predicción: la extrapolación de una secuencia.

Más adelante, en la misma publicación de 1960, Solomonoff describe su extensión de la teoría del código más corto único. Esta es la probabilidad algorítmica. Afirma: «Parecería que si hay varios métodos diferentes para describir una secuencia, a cada uno de estos métodos se le debería dar algún peso al determinar la probabilidad de esa secuencia». [ 21 ] Luego muestra cómo se puede usar esta idea para generar la distribución de probabilidad a priori universal y cómo permite el uso de la regla de Bayes en la inferencia inductiva. La inferencia inductiva, al sumar las predicciones de todos los modelos que describen una secuencia particular, usando pesos adecuados basados ​​en las longitudes de esos modelos, obtiene la distribución de probabilidad para la extensión de esa secuencia. Este método de predicción se conoce desde entonces como inducción de Solomonoff .

Amplió su teoría, publicando varios informes que culminaron en las publicaciones de 1964. Los artículos de 1964 ofrecen una descripción más detallada de la probabilidad algorítmica y la inducción de Solomonoff, presentando cinco modelos diferentes, incluido el modelo conocido popularmente como distribución universal.

Historial laboral desde 1964 hasta 1984.

Otros científicos que habían asistido a la Conferencia de Verano de Dartmouth de 1956 (como Newell y Simon ) desarrollaban la rama de la Inteligencia Artificial que utilizaba máquinas regidas por reglas condicionales, basadas en hechos. Solomonoff, por su parte, desarrollaba la rama de la Inteligencia Artificial centrada en la probabilidad y la predicción; su visión específica de la IA describía máquinas regidas por la distribución de probabilidad algorítmica. La máquina genera teorías, junto con sus probabilidades asociadas, para resolver problemas, y, a medida que surgen nuevos problemas y teorías, actualiza la distribución de probabilidad de dichas teorías.

En 1968 halló una prueba de la eficacia de la probabilidad algorítmica, [ 22 ] pero, principalmente debido a la falta de interés general en aquel momento, no la publicó hasta 10 años después. En su informe, publicó la prueba del teorema de convergencia.

En los años posteriores a su descubrimiento de la probabilidad algorítmica, se centró en cómo utilizar esta probabilidad y la inducción de Solomonoff en la predicción real y la resolución de problemas para la IA. También quería comprender las implicaciones más profundas de este sistema de probabilidad.

Un aspecto importante de la probabilidad algorítmica es que es completa e incomputable.

En el informe de 1968, demuestra que la Probabilidad Algorítmica es completa ; es decir, si existe alguna regularidad descriptible en un conjunto de datos, la Probabilidad Algorítmica la descubrirá eventualmente, requiriendo una muestra relativamente pequeña de dichos datos. La Probabilidad Algorítmica es el único sistema de probabilidad conocido que es completo de esta manera. Como consecuencia necesaria de su completitud, es incomputable . La incomputabilidad se debe a que algunos algoritmos —un subconjunto de aquellos que son parcialmente recursivos— nunca pueden evaluarse completamente porque llevaría demasiado tiempo. Pero estos programas al menos serán reconocidos como posibles soluciones. Por otro lado, cualquier sistema computable es incompleto . Siempre habrá descripciones fuera del espacio de búsqueda de ese sistema, que nunca serán reconocidas ni consideradas, incluso en un tiempo infinito. Los modelos de predicción computables ocultan este hecho al ignorar dichos algoritmos.

En muchos de sus artículos describió cómo buscar soluciones a los problemas y, en los años setenta y principios de los ochenta, desarrolló lo que él consideraba la mejor manera de actualizar la máquina.

Sin embargo, el uso de la probabilidad en la IA no tuvo un camino fácil. En los primeros años de la IA, su relevancia era problemática. Muchos en la comunidad de IA consideraban que la probabilidad no era útil en su trabajo. Si bien el área del reconocimiento de patrones sí utilizaba una forma de probabilidad, debido a la falta de una teoría generalizada sobre cómo incorporarla en cualquier campo de la IA, la mayoría de los campos ni siquiera la utilizaban.

Sin embargo, hubo investigadores como Pearl y Peter Cheeseman que argumentaron que la probabilidad podría utilizarse en la inteligencia artificial.

Hacia 1984, en una reunión anual de la Asociación Estadounidense para la Inteligencia Artificial (AAAI), se decidió que la probabilidad no era relevante en absoluto para la IA.

Se formó un grupo de protesta y, al año siguiente, se celebró un taller en la reunión de la AAAI dedicado a "Probabilidad e incertidumbre en la IA". Este taller anual se ha mantenido hasta la actualidad. [ 23 ]

Como parte de la protesta en el primer taller, Solomonoff presentó un documento sobre cómo aplicar la distribución universal a problemas de IA [ 24 ]. Esta fue una versión temprana del sistema que ha estado desarrollando desde entonces.

En ese informe, describió la técnica de búsqueda que había desarrollado. En los problemas de búsqueda, el mejor orden de búsqueda es el tiempo.Ti/PAGi{\displaystyle T_{i}/P_{i}}, dóndeTi{\displaystyle T_{i}}es el tiempo necesario para probar el ensayo yPAGi{\displaystyle P_{i}}es la probabilidad de éxito de ese ensayo. Él lo llamó el "Tamaño del Salto Conceptual" del problema. La técnica de búsqueda de Levin se aproxima a este orden, [ 25 ] y por eso Solomonoff, quien había estudiado el trabajo de Levin, llamó a esta técnica de búsqueda Lsearch.

Historial laboral: los últimos años

En otros artículos exploró cómo limitar el tiempo necesario para buscar soluciones, escribiendo sobre la búsqueda con recursos limitados. El espacio de búsqueda está limitado por el tiempo disponible o el costo computacional, en lugar de recortar el espacio de búsqueda como se hace en algunos otros métodos de predicción, como la Longitud Mínima de Descripción .

A lo largo de su trayectoria profesional, Solomonoff se preocupó por los posibles beneficios y peligros de la IA, tema que abordó en numerosos informes publicados. En 1985, analizó una posible evolución de la IA, proponiendo una fórmula para predecir cuándo alcanzaría el "Punto Infinito". [ 26 ] Este trabajo forma parte de la historia del pensamiento sobre una posible singularidad tecnológica .

Originalmente, los métodos de inducción algorítmica extrapolaban secuencias ordenadas de cadenas. Se necesitaban métodos para trabajar con otros tipos de datos.

Un informe de 1999, [ 27 ] generaliza la distribución universal y los teoremas de convergencia asociados a conjuntos no ordenados de cadenas y un informe de 2008, [ 28 ] a pares no ordenados de cadenas.

En 1997, [ 29 ] 2003 y 2006 demostró que la incomputabilidad y la subjetividad son características necesarias y deseables de cualquier sistema de inducción de alto rendimiento.

En 1970 fundó su propia empresa unipersonal, Oxbridge Research, donde continuó su investigación, salvo algunos periodos en otras instituciones como el MIT, la Universidad de Saarland en Alemania y el Instituto Dalle Molle de Inteligencia Artificial en Lugano, Suiza. En 2003 fue el primer galardonado con el Premio Kolmogorov por el Centro de Investigación de Aprendizaje por Computadora (CLRC) del Royal Holloway, Universidad de Londres , donde impartió la conferencia inaugural. Solomonoff fue profesor visitante en el CLRC.

En 2006, participó como ponente en AI@50 , la Conferencia de Inteligencia Artificial de Dartmouth: "Los próximos cincuenta años", que conmemoraba el quincuagésimo aniversario del grupo de estudio de verano original de Dartmouth. Solomonoff fue uno de los cinco participantes originales que asistieron.

En febrero de 2008, pronunció el discurso de apertura en la Conferencia "Tendencias Actuales en la Teoría y Aplicación de la Informática" (CTTACS), celebrada en la Universidad de Notre Dame en Líbano. Posteriormente, impartió una breve serie de conferencias y comenzó a investigar nuevas aplicaciones de la probabilidad algorítmica.

La probabilidad algorítmica y la inducción de Solomonoff tienen muchas ventajas para la inteligencia artificial. La probabilidad algorítmica proporciona estimaciones de probabilidad extremadamente precisas. Estas estimaciones pueden revisarse mediante un método fiable para que sigan siendo aceptables. Utiliza el tiempo de búsqueda de forma muy eficiente. Además de las estimaciones de probabilidad, la probabilidad algorítmica "tiene para la IA otro valor importante: su multiplicidad de modelos nos da muchas formas diferentes de entender nuestros datos;

Una descripción de la vida y obra de Solomonoff anterior a 1997 se encuentra en "The Discovery of Algorithmic Probability", Journal of Computer and System Sciences, Vol. 55, No. 1, pp. 73–88, agosto de 1997. El artículo, así como la mayoría de los demás mencionados aquí, están disponibles en su sitio web, en la página de publicaciones .

En un artículo publicado el año de su muerte, una revista científica afirmó sobre Solomonoff: «Un científico muy convencional comprende su ciencia utilizando un único "paradigma actual": la forma de comprensión más de moda en la actualidad. Un científico más creativo comprende su ciencia de muchas maneras y puede crear con mayor facilidad nuevas teorías y nuevas formas de comprensión cuando el "paradigma actual" ya no se ajusta a los datos actuales». [ 30 ]

En 2011, como parte de un volumen exhaustivo sobre teoría de la información algorítmica e inteligencia artificial —Aleatoriedad a través de la computación: algunas respuestas, más preguntas [ 31 ] — publicó su artículo final, junto con otras figuras notables en esos campos como Gregory Chaitin o Jürgen Schmidhuber , en el que reflexionó sobre el potencial de la probabilidad algorítmica para lograr la IA general y la IA fuerte. [ 32 ]

Véase también

  • Ming Li y Paul Vitanyi , en su obra "Una introducción a la complejidad de Kolmogorov y sus aplicaciones" (Springer-Verlag, Nueva York, 2008), incluyen notas históricas sobre Solomonoff, así como una descripción y un análisis de su trabajo.
  • La inteligencia artificial universal de Marcus Hutter

Referencias

  1. "Ray Solomonoff, 1926–2009 «  La Tercera Conferencia sobre Inteligencia Artificial General" . Archivado del original el 7 de agosto de 2011 . Consultado el 12 de diciembre de 2009 .
  2. Markoff, John (9 de enero de 2010). "Ray Solomonoff, pionero en inteligencia artificial, muere a los 83 años" . The New York Times . Consultado el 11 de enero de 2009 .
  3. Vitanyi, Paul; Legg, Shane; Hutter, Marcus (2007). "Probabilidad algorítmica" . Scholarpedia . 2 (8): 2572. Bibcode : 2007SchpJ...2.2572H . doi : 10.4249/scholarpedia.2572 . hdl : 1885/15013 .
  4. 1 2 Samuel Rathmanner y Marcus Hutter . Un tratado filosófico de inducción universal. Entropy, 13(6):1076–1136, 2011.
  5. Vitanyi, P. " Obituario: Ray Solomonoff, padre fundador de la teoría de la información algorítmica"
  6. 1 2 "Una máquina de inferencia inductiva", Dartmouth College, NH, versión del 14 de agosto de 1956. (copia escaneada en PDF del original)
  7. Artículo de la conferencia sobre "Sistemas Cerebrales y Computadoras", Instituto Tecnológico de California, 8-11 de febrero de 1960, citado en "Una Teoría Formal de la Inferencia Inductiva, Parte 1, 1964, pág. 1.
  8. Solomonoff, R., " Informe preliminar sobre una teoría general de la inferencia inductiva ", Informe V-131, Zator Co., Cambridge, Ma. 4 de febrero de 1960, revisión , noviembre de 1960.
  9. Solomonoff, R., " Una teoría formal de la inferencia inductiva, parte I " Information and Control , vol. 7, n.º 1, págs. 1-22, marzo de 1964.
  10. 1 2 Solomonoff, R., " Una teoría formal de la inferencia inductiva, parte II " Information and Control , vol. 7, n.º 2, págs. 224-254, junio de 1964.
  11. Inducción: De Kolmogorov y Solomonoff a De Finetti y de vuelta a Kolmogorov JJ McCall – Metroeconomica, 2004 – Wiley Online Library.
  12. Fundamentos de la navaja de Occam y la parsimonia en el aprendizaje (de ricoh.com) D Stork – Taller NIPS 2001, 2001
  13. La navaja de Occam como base formal para una teoría física (de arxiv.org) AN Soklakov – Foundations of Physics Letters, 2002 – Springer
  14. Más allá de la prueba de Turing de uclm.es J HERNANDEZ-ORALLO – Journal of Logic, Language, and …, 2000 – dsi.uclm.es
  15. Ming Li y Paul Vitanyi, Una introducción a la complejidad de Kolmogorov y sus aplicaciones. Springer-Verlag, Nueva York, 2008, pág. 339 y ss.
  16. "El descubrimiento de la probabilidad algorítmica", Journal of Computer and System Sciences, vol. 55, n.º 1, págs. 73-88 (versión en PDF)
  17. " Un método exacto para el cálculo de la conectividad de redes aleatorias ", Boletín de Biofísica Matemática , Vol. 14, pág. 153, 1952.
  18. «Una máquina de inferencia inductiva», Actas de la Convención IRE, Sección sobre Teoría de la Información, Parte 2, págs. 56-62. (versión en PDF)
  19. " Informe de progreso sobre máquinas que aprenden a traducir idiomas y recuperar información ", Avances en Documentación y Biblioteconomía, Vol. III, parte 2, págs. 941-953. (Actas de una conferencia celebrada en septiembre de 1959).
  20. "Informe preliminar sobre una teoría general de la inferencia inductiva", 1960, pág. 1
  21. "Informe preliminar sobre una teoría general de la inferencia inductiva", 1960, pág. 17
  22. "Sistemas de inducción basados ​​en la complejidad, comparaciones y teoremas de convergencia" IEEE Trans. on Information Theory Vol. IT-24, No. 4, pp. 422–432, julio de 1978. (versión en PDF)
  23. " La distribución universal y el aprendizaje automático ", Conferencia Kolmogorov, 27 de febrero de 2003, Royal Holloway, Universidad de Londres. The Computer Journal, vol. 46, n.º 6, 2003.
  24. " La aplicación de la probabilidad algorítmica a problemas en inteligencia artificial ", en Kanal y Lemmer (Eds.), Incertidumbre en inteligencia artificial, , Elsevier Science Publishers BV, pp 473–491, 1986.
  25. ^ Levin, LA, "Problemas de búsqueda universal", en Problemy Peredaci Informacii 9, págs. 115-116, 1973
  26. "La escala temporal de la inteligencia artificial: reflexiones sobre los efectos sociales", Human Systems Management, vol. 5, págs. 149-153, 1985 (versión en PDF)
  27. "Dos tipos de inducción probabilística", The Computer Journal, vol. 42, n.º 4, 1999. (versión en PDF)
  28. "Tres tipos de inducción probabilística, distribuciones universales y teoremas de convergencia" 2008. (versión en PDF)
  29. "El descubrimiento de la probabilidad algorítmica", Journal of Computer and System Sciences, vol. 55, n.º 1, págs. 73-88 (versión en PDF)
  30. "Probabilidad algorítmica, teoría y aplicaciones", en Teoría de la información y aprendizaje estadístico, editado por Frank Emmert-Streib y Matthias Dehmer, Springer Science and Business Media, 2009, pág. 11
  31. Zenil, Hector (2011). Aleatoriedad a través de la computación . World Scientific. doi : 10.1142/7973 . Recuperado el 31 de julio de 2025 .
  32. Solomonoff, Ray J. (2011). "Probabilidad algorítmica: su descubrimiento, sus propiedades y su aplicación a la IA fuerte". En Hector Zenil (ed.). Aleatoriedad mediante computación: algunas respuestas, más preguntas . World Scientific. pp. 149–157 . doi : 10.1142/9789814327756_0011 . Consultado el 31 de julio de 2025 . 
  • Página principal de Ray Solomonoff
  • Para una descripción detallada de la probabilidad algorítmica, consulte "Probabilidad algorítmica" de Hutter, Legg y Vitanyi en la Scholarpedia.
  • Ray Solomonoff (1926–2009) 85.ª conferencia conmemorativa, Melbourne, Australia, noviembre/diciembre de 2011 y Actas, "Probabilidad algorítmica y amigos. Predicción bayesiana e inteligencia artificial", Springer, LNAI/LNCS 7070 .
  • El 14 de diciembre de 2011 se celebró el aniversario de la fundación del pionero del aprendizaje automático.