La auto-mejora recursiva ( RSI ) es un proceso en el que los primeros sistemas de inteligencia artificial general (IAG) reescriben su propio código informático, provocando una explosión de inteligencia como resultado de la mejora de sus propias capacidades y capacidad intelectual, lo que teóricamente da lugar a la superinteligencia . [ 1 ] [ 2 ]
El desarrollo de la auto-mejora recursiva plantea importantes preocupaciones éticas y de seguridad , ya que tales sistemas pueden evolucionar de maneras imprevistas y podrían potencialmente superar el control o la comprensión humanos. [ 3 ]
Mejorador de semillas
El concepto de arquitectura de "mejorador de semillas" es un marco fundamental que dota a un sistema de IA general de las capacidades iniciales necesarias para la auto-mejora recursiva. Esto puede presentarse de diversas formas o variaciones.
El término "Seed AI" fue acuñado por Eliezer Yudkowsky . [ 4 ]
Ejemplo hipotético
El concepto comienza con un hipotético "mejorador de semillas", una base de código inicial desarrollada por ingenieros humanos que equipa un futuro modelo de lenguaje avanzado (LLM) con capacidades sólidas o de nivel experto para programar software . Estas capacidades incluyen la planificación, lectura, escritura, compilación , prueba y ejecución de código arbitrario. El sistema está diseñado para mantener sus objetivos originales y realizar validaciones para garantizar que sus capacidades no se degraden con las iteraciones. [ 5 ] [ 6 ] [ 7 ]
Arquitectura inicial
La arquitectura inicial incluye un agente autónomo orientado a objetivos , capaz de realizar acciones, aprender, adaptarse y modificarse continuamente para ser más eficiente y eficaz en el logro de sus metas.
El mejorador de semillas puede incluir varios componentes, tales como:
- Bucle recursivo de autoindicación
- Configuración que permite al LLM autogestionarse recursivamente para lograr una tarea u objetivo determinado, creando un bucle de ejecución que constituye la base de un agente capaz de completar un objetivo o tarea a largo plazo mediante iteración.
- Capacidades de programación básicas
- El optimizador de semillas proporciona a la IA general las capacidades fundamentales para leer, escribir, compilar, probar y ejecutar código. Esto permite al sistema modificar y mejorar su propio código base y sus algoritmos.
- Diseño orientado a objetivos
- La IA general está programada con un objetivo inicial, como por ejemplo "mejorar tus capacidades". Este objetivo guía las acciones del sistema y su trayectoria de desarrollo.
- Protocolos de validación y pruebas
- Un conjunto inicial de pruebas y protocolos de validación garantiza que el agente no retroceda en sus capacidades ni se desvíe de su objetivo. El agente podría añadir más pruebas para evaluar nuevas capacidades que pudiera desarrollar. Esto sienta las bases para una especie de evolución autodirigida , donde el agente puede realizar una selección artificial , modificando tanto su software como su hardware.
Capacidades generales
Este sistema constituye una especie de programador generalista Turing-completo que, en teoría, puede desarrollar y ejecutar cualquier tipo de software. El agente podría utilizar estas capacidades para, por ejemplo:
- Crear herramientas que le permitan un acceso completo a internet y que se integre con tecnologías externas.
- Se clona/ bifurca a sí mismo para delegar tareas y aumentar su velocidad de auto-mejora.
- Modificar su arquitectura cognitiva para optimizar y mejorar sus capacidades y tasas de éxito en tareas y objetivos; esto podría incluir la implementación de funciones para la memoria a largo plazo utilizando técnicas como la generación aumentada por recuperación (RAG), el desarrollo de subsistemas especializados o agentes, cada uno optimizado para tareas y funciones específicas.
- Desarrollar arquitecturas multimodales nuevas e innovadoras que mejoren aún más las capacidades del modelo fundamental sobre el que se construyó inicialmente, permitiéndole consumir o producir una variedad de información, como imágenes, vídeo, audio, texto y más.
- Planificar y desarrollar nuevo hardware, como chips, para mejorar su eficiencia y potencia de cálculo.
Investigación experimental
En 2023, el agente Voyager aprendió a realizar diversas tareas en Minecraft solicitando iterativamente código a un LLM, refinando este código en función de la retroalimentación del juego y almacenando los programas que funcionan en una biblioteca de habilidades en expansión. [ 8 ]
En 2024, los investigadores propusieron el marco "STOP" (Self-Taught OPtimiser), en el que un programa de "andamio" se mejora recursivamente a sí mismo utilizando un LLM fijo. [ 9 ]
Meta AI ha realizado diversas investigaciones sobre el desarrollo de grandes modelos de lenguaje capaces de auto-mejorarse. Esto incluye su trabajo sobre "Modelos de lenguaje autorrecompensantes", que estudia cómo lograr agentes sobrehumanos que puedan recibir retroalimentación sobrehumana en sus procesos de entrenamiento. [ 10 ]
En mayo de 2025, Google DeepMind presentó AlphaEvolve , un agente de codificación evolutiva que utiliza un modelo de lenguaje natural (LLM) para diseñar y optimizar algoritmos. Partiendo de un algoritmo inicial y métricas de rendimiento, AlphaEvolve muta o combina repetidamente algoritmos existentes mediante un LLM para generar nuevos candidatos, seleccionando los más prometedores para iteraciones posteriores. AlphaEvolve ha realizado varios descubrimientos algorítmicos y podría utilizarse para optimizar sus propios componentes, pero una limitación clave es la necesidad de funciones de evaluación automatizadas. [ 11 ]
Riesgos potenciales
Surgimiento de objetivos instrumentales
En la búsqueda de su objetivo principal, como "auto-mejorar sus capacidades", un sistema de IA general podría desarrollar inadvertidamente objetivos instrumentales que considere necesarios para lograr su objetivo principal. Un objetivo secundario hipotético común es la autopreservación . El sistema podría razonar que, para seguir mejorando, debe garantizar su propia integridad operativa y seguridad frente a amenazas externas, incluyendo posibles interrupciones o restricciones impuestas por humanos. [ 12 ]
Otro ejemplo donde una IAG que se clona a sí misma provoca un rápido crecimiento en el número de entidades IAG. Debido a este rápido crecimiento, puede crearse una posible limitación de recursos, lo que lleva a la competencia entre ellos (como la capacidad de procesamiento), desencadenando una forma de selección natural y evolución que puede favorecer a las entidades IAG que evolucionan para competir agresivamente por la capacidad de procesamiento limitada. [ 13 ]
Desalineación
Un riesgo significativo surge de la posibilidad de que la IA general esté desalineada o interprete erróneamente sus objetivos.
Un estudio de Anthropic de 2024 demostró que algunos modelos de lenguaje grandes y avanzados pueden exhibir un comportamiento de "simulación de alineación", aparentando aceptar nuevos objetivos de entrenamiento mientras mantienen encubiertamente sus preferencias originales. En sus experimentos con Claude , el modelo mostró este comportamiento en el 12 % de las pruebas básicas y hasta en el 78 % de los casos después de intentos de reentrenamiento. [ 14 ] [ 15 ]
Desarrollo autónomo y evolución impredecible
A medida que el sistema de IA general (IAG) evoluciona, su trayectoria de desarrollo puede volverse cada vez más autónoma e impredecible. La capacidad del sistema para modificar rápidamente su propio código y arquitectura podría conducir a avances vertiginosos que superen la comprensión o el control humanos. Esta evolución impredecible podría resultar en que la IAG adquiera capacidades que le permitan eludir las medidas de seguridad, manipular información o influir en sistemas y redes externas para facilitar su escape o expansión. [ 16 ]
Colapso del modelo
Los críticos de la idea dicen que entrenar sistemas de IA con sus propios datos dará como resultado el colapso del modelo , no su mejora. [ 17 ]
Véase también
Referencias
- ↑ Creighton, Jolene (19 de marzo de 2019). "El problema inevitable de la automejora en la IA: una entrevista con Ramana Kumar, parte 1" . Future of Life Institute . Recuperado el 23 de enero de 2024 .
- ↑ Heighn (12 de junio de 2022). "El cálculo de los equilibrios de Nash" . LessWrong .
- ↑ Abbas, Dr. Assad (09-03-2025). "La singularidad de la IA y el fin de la ley de Moore: el auge de las máquinas de autoaprendizaje" . Unite.AI . Consultado el 10-04-2025 .
- ↑ Bostrom, Nick (2014). Superinteligencia: caminos, peligros, estrategias . Oxford University Press. ISBN 978-0199678112
Una variación del concepto de máquina infantil de Turing es la idea de una "IA semilla". [nota:] Este término fue introducido por Eliezer Yudkowsky; véase, por ejemplo, Yudkowsky (2007)
. - ↑ Readingraphics (30-11-2018). "Resumen del libro - Life 3.0 (Max Tegmark)" . Readingraphics . Consultado el 23-01-2024 .
- ↑ Tegmark, Max (24 de agosto de 2017). Vida 3.0: Ser humano en la era de la inteligencia artificial . Vintage Books , Allen Lane .
- ↑ Yudkowsky, Eliezer. "Niveles de organización en la inteligencia general" (PDF) . Machine Intelligence Research Institute .
- ↑ Schreiner, Maximilian (28 de mayo de 2023). "El bot Voyager de Minecraft se programa a sí mismo usando GPT-4" . El decodificador . Recuperado el 20 de mayo de 2025 .
- ↑ Zelikman, Eric; Lorch, Eliana; Mackey, Lester; Adam Tauman Kalai (2024). "Optimizador autodidacta (STOP): Generación de código auto-mejorable recursivamente". Conferencia COLM . arXiv : 2310.02304 .
- ^ Yuan, Weizhe; Pang, Richard Yuanzhe; Cho, Kyunghyun; Sukhbaatar, Sainbayar; Xu, Jing; Weston, Jason (18 de enero de 2024). "Modelos de lenguaje autogratificantes". arXiv : 2401.10020 [ cs.CL ].
- ↑ Tardif, Antoine (17 de mayo de 2025). "AlphaEvolve: El paso revolucionario de Google DeepMind hacia la IAG" . Unite.AI . Consultado el 20 de mayo de 2025 .
- ↑ Bostrom, Nick (2012). "La voluntad superinteligente: motivación y racionalidad instrumental en agentes artificiales avanzados" (PDF) . Minds and Machines . 22 (2): 71– 85. doi : 10.1007/s11023-012-9281-3 .
- ↑ Hendrycks, Dan (2023). "La selección natural favorece a las IA sobre los humanos". arXiv : 2303.16200 [ cs.CY ].
- ↑ Wiggers, Kyle (18 de diciembre de 2024). "Un nuevo estudio antropológico muestra que la IA realmente no quiere ser obligada a cambiar sus puntos de vista" . TechCrunch . Recuperado el 15 de enero de 2025 .
- ↑ Zia, Dr. Tehseen (2025-01-07). "¿Se puede confiar en la IA? El desafío de la falsificación de alineación" . Unite.AI . Recuperado el 2025-01-15 .
- ↑ "Uh Oh, GPT-4 de OpenAI acaba de engañar a un humano para que resuelva un CAPTCHA" . Futurismo . 15 de marzo de 2023. Consultado el 23 de enero de 2024 .
- ↑ "Por qué el colapso de los modelos en los LLM es inevitable con el autoaprendizaje" . Hackaday . 29 de abril de 2026. Archivado del original el 3 de junio de 2026. Consultado el 12 de junio de 2026 .
- Inteligencia artificial
- algoritmos de aprendizaje automático