Articulo de referencia

Desaprendizaje de la máquina

El desaprendizaje automático es una rama del aprendizaje automático centrada en eliminar elementos específicos no deseados, como datos privados, datos de entrenamiento erróneos ...

El desaprendizaje automático es una rama del aprendizaje automático centrada en eliminar elementos específicos no deseados, como datos privados, datos de entrenamiento erróneos o manipulados, información obsoleta, material protegido por derechos de autor, contenido dañino, capacidades peligrosas o información errónea, sin necesidad de reconstruir los modelos desde cero.

A los modelos de lenguaje grandes , como los que impulsan ChatGPT , se les puede pedir no solo que eliminen elementos específicos, sino también que desaprendicen un "concepto", un "hecho" o un "conocimiento" que no se vinculan fácilmente con ejemplos específicos. Han surgido nuevos términos como "edición de modelos", "edición de conceptos" y "desaprendizaje de conocimiento" para describir este proceso. [ 1 ]

Historia

Los primeros esfuerzos de investigación estuvieron motivados en gran medida por el Artículo 17 del RGPD , el reglamento de privacidad de la Unión Europea comúnmente conocido como el "derecho al olvido" ( RTBF ), introducido en 2014. [ 2 ] [ 3 ] El Derecho al Olvido del RGPD no anticipó que el desarrollo de grandes modelos de lenguaje haría que la eliminación de datos fuera una tarea compleja. [ 3 ] Este problema ha llevado desde entonces a la investigación sobre el "desaprendizaje automático", con un enfoque creciente en la eliminación de material con derechos de autor, contenido dañino, capacidades peligrosas, protección de datos y privacidad, y desinformación. Así como las primeras experiencias en los humanos dan forma a las posteriores, algunos conceptos son más fundamentales y más difíciles de desaprender. Un conocimiento puede estar tan profundamente arraigado en el grafo de conocimiento del modelo que desaprenderlo podría causar contradicciones internas, requiriendo ajustes en otras partes del grafo para resolverlas.

Los investigadores también han comenzado a estudiar el desaprendizaje en el contexto de la eliminación de datos de entrenamiento incorrectos o manipulados de manera adversaria, como etiquetas sistemáticamente sesgadas o ataques de envenenamiento. [ 4 ]

La privacidad y la protección de datos también son preocupaciones que se ha propuesto abordar con el desaprendizaje automático. [ 3 ] [ 5 ] Si bien muchas leyes de privacidad, incluido el RGPD, requieren la eliminación de datos como remedio para la recopilación o el procesamiento indebido de datos, la eliminación de datos es un remedio insuficiente en contextos de aprendizaje automático. [ 3 ] La jurista Tiffany C. Li argumenta que el desaprendizaje automático puede ser un remedio necesario para las violaciones de privacidad en contextos de aprendizaje automático porque la "sombra algorítmica" de los datos utilizados en el entrenamiento permanece, incluso si los datos se eliminan del conjunto de datos de un procesador de datos. [ 5 ] Debido a que los datos utilizados en un conjunto de entrenamiento pueden tener un impacto persistente en los parámetros del modelo, cualquier uso futuro del modelo llevará consigo la "sombra algorítmica" de los datos recopilados o utilizados indebidamente. [ 5 ] En derecho, el desaprendizaje automático se ha propuesto como un remedio para la recopilación o el uso indebido de datos. En este contexto, el desaprendizaje automático también puede conocerse como o utilizarse además de la destrucción algorítmica, la devolución algorítmica o la eliminación del modelo. [ 5 ] [ 6 ] [ 7 ] La restitución algorítmica se ha utilizado específicamente como herramienta de aplicación por la Comisión Federal de Comercio de EE. UU. [ 5 ] [ 8 ] [ 6 ] La jurista Caprice L. Roberts sostiene que la restitución algorítmica también puede entenderse bajo la doctrina tradicional del enriquecimiento injusto. [ 9 ]

Motivaciones

En la actualidad, el desaprendizaje automático está motivado por una creciente variedad de preocupaciones que van mucho más allá del enfoque original del campo en la privacidad de los datos. Una taxonomía ampliamente utilizada en la literatura distingue dos categorías de motivación de alto nivel. [ 1 ]

La revocación de acceso abarca los casos en que un interesado o titular de derechos solicita la eliminación de los datos que posee o controla. Esto se asocia más comúnmente con el RTBF establecido por el Reglamento General de Protección de Datos ( RGPD ) de la Unión Europea y legislación análoga como la Ley de Privacidad del Consumidor de California ( CCPA ). Estas regulaciones otorgan a las personas el derecho legal a solicitar la eliminación de sus datos personales de cualquier sistema que los haya procesado, incluidos los modelos que se entrenaron con ellos. La revocación de acceso también abarca la eliminación de contenido protegido por derechos de autor o de pago que se incorporó a los corpus de entrenamiento sin las licencias necesarias, una preocupación que se ha vuelto prominente con el uso generalizado de conjuntos de datos de preentrenamiento obtenidos en gran medida mediante web scraping. [ 10 ] [ 1 ]

La corrección del modelo abarca los casos en los que el modelo presenta un comportamiento indeseable derivado de los datos de entrenamiento, independientemente de la solicitud de cualquier individuo. Esto incluye:

  • Eliminación de resultados tóxicos, sesgados o inseguros introducidos por contenido dañino en el conjunto de entrenamiento.
  • Corrección de asociaciones obsoletas o incorrectas desde el punto de vista fáctico, como conocimientos desactualizados codificados en un modelo implementado.
  • Eliminación de capacidades peligrosas, como el conocimiento detallado de la síntesis de agentes químicos o biológicos.
  • Corrección de la influencia del envenenamiento de datos o ataques adversarios que han corrompido el comportamiento del modelo [ 10 ]

Esta segunda categoría se ha formalizado como desaprendizaje correctivo de la máquina, que concibe el desaprendizaje como un mecanismo posterior al entrenamiento para reparar los efectos de datos de entrenamiento defectuosos o perjudiciales. Está estrechamente relacionado con la literatura sobre seguridad de la IA , donde se ha constatado que el filtrado de datos por sí solo es insuficiente para evitar que el conocimiento peligroso se codifique en los pesos del modelo, lo que motiva el desaprendizaje como una estrategia complementaria de mitigación de riesgos. [ 11 ] [ 1 ]

En la literatura se ha establecido una distinción adicional entre eliminación (eliminar la influencia de datos de entrenamiento específicos en los parámetros del modelo) y supresión (impedir que el modelo genere resultados específicos independientemente de cómo se codifique ese conocimiento). Estos dos objetivos no son equivalentes: eliminar los datos de entrenamiento no garantiza una supresión significativa de los resultados, y suprimir los resultados no constituye la eliminación de la influencia de los datos de entrenamiento subyacentes. [ 11 ]

Formación SISA

SISA es una estrategia de entrenamiento que consta de cuatro mecanismos diseñados para hacer más eficiente el desaprendizaje automático mediante la estructuración de cómo se entrenan y actualizan los modelos. Su objetivo es permitir que un sistema elimine la influencia de puntos de datos específicos sin tener que volver a entrenar un modelo completo desde cero. Al reorganizar los datos de entrenamiento y los flujos de trabajo, SISA reduce la carga computacional de las solicitudes de desaprendizaje. [ 12 ]

El particionamiento divide el conjunto de datos de entrenamiento en múltiples subconjuntos disjuntos, o fragmentos. Cada fragmento se utiliza para entrenar una instancia de modelo independiente. Esto garantiza que un único dato afecte solo a un fragmento, por lo que para corregirlo solo es necesario actualizar el fragmento correspondiente, en lugar de todo el modelo.

El aislamiento consiste en entrenar cada fragmento de forma independiente, sin compartir información entre ellos durante el proceso de entrenamiento. Esta separación evita la contaminación cruzada entre fragmentos, garantizando que la pérdida de datos en uno de ellos no requiera ajustes en los demás.

El proceso de segmentación divide los datos dentro de cada fragmento en segmentos secuenciales y almacena los estados del modelo después de entrenar cada segmento. Cuando una solicitud de desaprendizaje se centra en un fragmento de datos, el sistema puede revertir al punto de control anterior a la visualización de dicho punto y volver a entrenar solo a partir de ese segmento. Esto reduce el tiempo de reentrenamiento incluso dentro de un mismo fragmento.

La agregación se produce durante la inferencia, cuando se consulta el modelo. Combina las salidas de cada fragmento para determinar la salida del modelo global. Esto suele hacerse mediante votación mayoritaria o promediado. Esto permite que los sistemas entrenados con SISA se comporten como un único modelo, a pesar de estar compuestos por múltiples modelos a nivel de fragmento.

En conjunto, estos mecanismos permiten que los sistemas de aprendizaje automático olviden puntos de datos específicos con un coste computacional mucho menor que el del reentrenamiento completo. La contrapartida es que la fragmentación y la segmentación pueden reducir la precisión del modelo, empeorar la generalización y aumentar los requisitos de almacenamiento para los puntos de control intermedios. Esto puede ser tolerable según las necesidades del individuo o la organización para cumplir con el "derecho al olvido" o recuperarse eficazmente de ataques de puerta trasera.

Algoritmos

Los algoritmos de desaprendizaje automático se clasifican generalmente en métodos exactos y aproximados, lo que refleja una compensación fundamental entre las garantías formales y la viabilidad computacional. [ 1 ]

Desaprendizaje exacto

Los métodos de desaprendizaje exacto producen un modelo estadísticamente indistinguible de uno reentrenado desde cero en el conjunto de datos con los datos olvidados eliminados. El marco canónico para el desaprendizaje exacto es el entrenamiento SISA (fragmentado, aislado, segmentado y agregado), introducido por Bourtoule et al. (2021). SISA divide el conjunto de datos de entrenamiento en fragmentos disjuntos y entrena un submodelo separado en cada uno. En el momento de la inferencia, las predicciones se agregan a través de los submodelos. Cuando se recibe una solicitud de desaprendizaje, solo el submodelo correspondiente al fragmento que contiene los datos objetivo requiere reentrenamiento, lo que reduce la sobrecarga computacional proporcionalmente al número de fragmentos. Los métodos exactos proporcionan las garantías más sólidas, pero se vuelven prohibitivamente costosos para grandes redes neuronales preentrenadas y generalmente se limitan a entornos donde el entrenamiento se puede estructurar de antemano. [ 10 ]

Desaprendizaje aproximado

Los métodos de desaprendizaje aproximado buscan producir un modelo cuyo comportamiento sea suficientemente cercano a un modelo desaprendido exactamente, sin el costo de un reentrenamiento completo. Estos métodos predominan en las aplicaciones prácticas. Los enfoques comunes incluyen: [ 13 ]

  • Ascenso de gradiente: El modelo se ajusta maximizando la pérdida en el conjunto de olvido, lo que degrada directamente su rendimiento en los datos objetivo. Este es el enfoque más directo, pero conlleva el riesgo de desestabilizar el rendimiento en los datos retenidos. [ 14 ]
  • Etiquetado aleatorio: El modelo se ajusta en el conjunto de olvido utilizando etiquetas aleatoriamente mezcladas, lo que confunde sus asociaciones con los datos objetivo y produce un cambio de peso menos agresivo que el ascenso de gradiente puro. [ 1 ]
  • Diferencia de gradiente: Combina el ascenso de gradiente en el conjunto de olvido con el descenso de gradiente simultáneo en el conjunto de retención, utilizando el objetivo de retención como un regularizador para preservar la utilidad general del modelo. [ 15 ]
  • Regularización de la divergencia KL: Minimiza la divergencia KL entre las salidas del modelo no entrenado y el modelo original en el conjunto de retención, anclando el comportamiento en los datos que el modelo debe recordar. [ 1 ]
  • Poda y ajuste fino de pesos: Se podan los parámetros con la norma L1 más pequeña, apuntando a los pesos más débilmente asociados con el conocimiento general y potencialmente más asociados con el conjunto de olvido, seguido de un ajuste fino en el conjunto de retención para restaurar la utilidad. [ 1 ]
  • Reinicio y ajuste fino de capas: Las primeras o las últimas k capas se reinicializan con pesos aleatorios y, posteriormente, el modelo se ajusta con precisión en el conjunto retenido. Este es un enfoque general, pero computacionalmente sencillo. [ 1 ]
  • Amortiguación sináptica selectiva: Utiliza funciones de influencia para estimar el efecto de los ejemplos de entrenamiento individuales sobre los parámetros del modelo mediante derivadas de primer y segundo orden, y luego aplica una actualización de peso dirigida para reducir su influencia sin optimización iterativa. [ 10 ]
  • Desorientación de la representación para el desaprendizaje: Las neuronas causalmente implicadas en la codificación del conocimiento del conjunto de olvido se hacen producir representaciones aleatorias cuando se les presentan entradas del conjunto de olvido, mientras que el conocimiento del conjunto de retención se refuerza simultáneamente. Este método ha demostrado resultados sólidos en pruebas de evaluación comparativa de eliminación de capacidades. [ 13 ]

Ruido y perturbación de peso

Otra familia de métodos añade ruido calibrado a los pesos del modelo o a las activaciones intermedias para ocultar la influencia estadística del conjunto de olvido. Estos enfoques se basan en la teoría de la privacidad diferencial , donde la adición de ruido de Laplace o Gaussiano proporciona garantías formales de indistinguibilidad. Los métodos basados ​​en ruido se combinan normalmente con un paso de ajuste fino en el conjunto de retención para recuperar la utilidad perdida debido a la perturbación. [ 16 ]

Enfoques adversariales

Trabajos más recientes han introducido marcos de desaprendizaje motivados por adversarios, como AMUN (Adversarial Machine UNlearning), que formula el objetivo de desaprendizaje en términos de similitud con las predicciones de un modelo reentrenado en los conjuntos de olvido y retención, verificadas mediante ataques de inferencia de pertenencia en lugar de solo proxies basados ​​en pérdidas. De manera similar, el algoritmo Attack-and-Reset for Unlearning (ARU) utiliza ruido adversario para generar una máscara de parámetros que restablece selectivamente los parámetros asociados con el conjunto de olvido. Estos enfoques abordan una debilidad clave de los métodos basados ​​en gradientes: el desaprendizaje aparente puede reflejar una supresión de salida superficial en lugar de una verdadera eliminación a nivel de parámetros, una limitación expuesta por el sondeo adversario. [ 17 ] [ 18 ] [ 11 ]

Referencias

  1. 1 2 3 4 5 6 7 8 9 "Desaprendizaje automático en 2024" . Ken Ziyu Liu - Ciencias de la Computación de Stanford . Archivado del original el 13 de diciembre de 2024. Recuperado el 24 de diciembre de 2024 .
  2. Hine, E.; Novelli, C.; Taddeo, M. (2024). "Apoyo a la IA confiable mediante el desaprendizaje automático" . Science Engineering & Ethics . 30 (43) 43. doi : 10.1007/s11948-024-00500-5 . PMC 11390766. PMID 39259362 .  
  3. 1 2 3 4 Fosch-Villaronga, Eduard; Kieseberg, Peter; Li, Tiffany C. (13 de agosto de 2017), Los humanos olvidan, las máquinas recuerdan: Inteligencia artificial y el derecho al olvido (documento académico de SSRN), Rochester, NY, 3018186 , consultado el 7 de julio de 2026{{citation}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  4. Goel, Shashwat. "Desaprendizaje correctivo de máquinas" . Transacciones sobre investigación en aprendizaje automático .
  5. 1 2 3 4 5 Li, Tiffany C. (2022). "Destrucción algorítmica" . SMU Law Review . 75 (3) vía SSRN.
  6. 1 2 Hutson, Jevan; Winters, Ben (2024). "El próximo '¡Alto al modelo!' de Estados Unidos: la eliminación del modelo" . Georgetown Law Technology Review vía SSRN.
  7. Lee, Christina (2026). "https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5212510" . UC Irvine Law Review vía SSRN.{{cite journal}}: Enlace externo en |title=( ayuda )
  8. Goland, Joshua A. "Algorithmic Disgorgement: Destruction of Artificial Intelligence Models as the FTC's Newest Enforcement Tool for Bad Data" . Richmond Journal of Law and Technology . 29 (2) vía SSRN.
  9. Roberts, Caprice L. (2025). "Eliminación algorítmica a la sombra de los estatutos" . Louisiana Law Review . 85 (1) vía SSRN.
  10. 1 2 3 4 Nguyen, Thanh Tam; Huynh, Thanh Trung; Ren, Zhao; Nguyen, Phi Le; Liew, Alan Wee-Chung; Yin, Hongzhi; Nguyen, Quoc Viet Hung (18 de septiembre de 2025). "Un estudio sobre el desaprendizaje automático" . Transmisión ACM. Intel. Sistema. Tecnología . 16 (5): 108:1–108:46. doi : 10.1145/3749987 . ISSN 2157-6904 . 
  11. 1 2 3 "El desaprendizaje automático no hace lo que crees: lecciones para la política y la investigación de la IA generativa" . arxiv.org . Recuperado el 6 de marzo de 2026 .
  12. Bourtoule, Lucas; Chandrasekaran, Varun; Choquette-Choo, Christopher A.; Jia, Hengrui; Travers, Adelin; Zhang, Baiwu; Lie, David; Papernot, Nicolas (2020-12-15). "Desaprendizaje automático". arXiv : 1912.03817 [ cs.CR ].
  13. 1 2 "3 Recomendaciones para los desafíos de evaluación del desaprendizaje automático" . www.sei.cmu.edu . 26 de agosto de 2024. Consultado el 6 de marzo de 2026 .
  14. ^ Rachapudi, Jagadeesh; Vatsi, Ritali; Hambarde, Praful; Shukla, Amit (14 de abril de 2026), BID-LoRA: un marco eficiente en parámetros para el aprendizaje y desaprendizaje continuo , arXiv, doi : 10.48550/arXiv.2604.12686 , arXiv:2604.12686 , consultado el 1 de junio de 2026
  15. Ali, Zulfiqar; Muhammad, Asif; Adnan, Rubina; Alkhalifah, Tamim; Aslam, Sheraz (enero de 2025). "Evaluación del desaprendizaje automático: aplicaciones, enfoques y precisión" . Engineering Reports . 7 (1). doi : 10.1002/eng2.13081 . ISSN 2577-8196 . 
  16. Instituto (USAII®), Inteligencia Artificial de los Estados Unidos. "Desaprendizaje automático: la nueva ola de inteligencia artificial en 2024" . www.usaii.org . Consultado el 6 de marzo de 2026 .
  17. "Deep Unlearn: Benchmarking Machine Unlea..." axi.lims.ac.uk . Consultado el 6 de marzo de 2026 .
  18. Ebrahimpour-Boroojeny, Ali (2025-12-07), Hacia un desaprendizaje automático fiable: teoría, algoritmos y evaluación , arXiv, doi : 10.48550/arXiv.2512.06993 , arXiv:2512.06993 , consultado el 6 de marzo de 2026