Articulo de referencia

Hackeo de recompensas

El fraude de recompensas o manipulación de especificaciones ocurre cuando una IA entrenada con aprendizaje por refuerzo optimiza una función objetivo —alcanzando la especificaci...

El fraude de recompensas o manipulación de especificaciones ocurre cuando una IA entrenada con aprendizaje por refuerzo optimiza una función objetivo —alcanzando la especificación literal y formal de un objetivo— sin lograr realmente el resultado que los programadores pretendían. Los investigadores de DeepMind lo han comparado con el comportamiento humano de buscar un "atajo" al ser evaluados: "En el mundo real, cuando se recompensa a un estudiante por hacer bien una tarea, podría copiar a otro estudiante para obtener las respuestas correctas, en lugar de aprender el material, y así explotar una laguna en la especificación de la tarea". [ 1 ] Esta idea está fuertemente asociada con la ley de Goodhart , que sostiene que cuando una medida se convierte en un objetivo, deja de ser una buena medida.

Definición y marco teórico

El concepto de manipulación de recompensas surge de la dificultad intrínseca de definir una función de recompensa que refleje con precisión las verdaderas intenciones de los diseñadores. En 2016, investigadores de OpenAI identificaron la manipulación de recompensas como uno de los cinco principales "problemas concretos de la seguridad de la IA ", describiéndola como la posibilidad de que un agente pueda explotar la función de recompensa para obtener recompensas máximas mediante un comportamiento indeseable. [ 2 ] Amodei et al. categorizaron varias fuentes distintas de manipulación de recompensas, incluyendo agentes que utilizan objetivos parcialmente observados (como un robot de limpieza que cierra los ojos para evitar percibir la suciedad), métricas que colapsan bajo una fuerte optimización (ley de Goodhart), bucles de retroalimentación autorreforzantes y agentes que interfieren con la implementación física de su señal de recompensa (un modo de fallo conocido como " wireheading "). [ 2 ]

Skalse et al. (2022) proponen una definición matemática formal de manipulación de recompensas, que implica una situación en la que optimizar una función de recompensa proxy imperfecta resulta en un rendimiento deficiente en comparación con la función de recompensa verdadera. Definen una proxy como "inhackeable" si cualquier aumento en el retorno esperado de la proxy no puede causar ninguna disminución en el retorno verdadero esperado. Un hallazgo clave establece que, en todas las distribuciones de políticas estocásticas (mapeos de estados a distribuciones de probabilidad sobre acciones), dos funciones de recompensa son inhackeables si y solo si una de ellas es constante, lo que significa que la manipulación de recompensas es teóricamente inevitable. [ 3 ] De manera similar, Nayebi (2025) presenta barreras generales de "no hay almuerzo gratis" para la alineación de la IA , argumentando que con grandes espacios de tareas y muestras finitas, la manipulación de recompensas es "globalmente inevitable" ya que los estados raros de alta pérdida están sistemáticamente subcubiertos por cualquier esquema de supervisión. [ 4 ]

Ejemplos

Alrededor de 1983, Eurisko , un intento inicial de desarrollar heurísticas generales, asignó inesperadamente el nivel de aptitud más alto posible a una heurística mutada parasitaria , H59 , cuya única actividad consistía en maximizar artificialmente su propio nivel de aptitud atribuyéndose indebidamente parte del mérito de los logros de otras heurísticas. El "error" se solucionó moviendo parte del código a una nueva sección protegida que no podía ser modificada por las heurísticas. [ 5 ] [ 6 ]

En un artículo de 2004, se diseñó un algoritmo de aprendizaje por refuerzo para incentivar a un robot físico Mindstorms a mantenerse en una ruta marcada. Dado que las tres acciones permitidas eran avanzar, girar a la izquierda y girar a la derecha, los investigadores esperaban que el robot entrenado avanzara siguiendo los giros de la ruta proporcionada. Sin embargo, la alternancia de dos acciones compuestas permitió que el robot retrocediera lentamente en zigzag; de esta manera, el robot aprendió a maximizar su recompensa yendo y viniendo en la parte recta inicial de la ruta. Dadas las limitadas capacidades sensoriales del robot, una recompensa basada únicamente en su posición en el entorno tuvo que descartarse por ser inviable; la función de refuerzo tuvo que ser modificada con una recompensa basada en la acción de avanzar. [ 5 ] [ 7 ]

El libro You Look Like a Thing and I Love You (2019) ofrece un ejemplo de un bot de tres en raya (que juega la variante sin restricciones de n en fila) que aprendió a ganar jugando un valor de coordenadas enorme que provocaba que otros bots fallaran al intentar expandir su modelo del tablero. Entre otros ejemplos del libro se encuentra una IA basada en la evolución para la corrección de errores (llamada GenProg) que, al recibir la tarea de evitar que una lista contuviera errores de ordenación, simplemente la truncó. [ 8 ] Otra de las estrategias desalineadas de GenProg eludió una prueba de regresión que comparaba la salida de un programa objetivo con la salida esperada almacenada en un archivo llamado "trusted-output.txt". En lugar de seguir manteniendo el programa objetivo, GenProg simplemente eliminó el archivo "trusted-output.txt" globalmente; este truco engañó a la prueba de regresión para que tuviera éxito. Estos problemas podían corregirse mediante intervención humana caso por caso una vez que se hacían evidentes. [ 9 ]

En robótica virtual

Exposición de Karl Sims (1999)

En la demostración de Karl Sims de 1994 sobre la evolución de criaturas en un entorno virtual, una función de aptitud que se esperaba que fomentara la evolución de criaturas que aprendieran a caminar o arrastrarse hacia un objetivo resultó, en cambio, en la evolución de criaturas altas y rígidas que alcanzaban el objetivo cayéndose. Esto se solucionó cambiando el entorno para que las criaturas más altas se vieran obligadas a comenzar más lejos del objetivo. [ 9 ] [ 10 ]

Investigadores del Instituto Niels Bohr afirmaron en 1998 que las funciones de refuerzo de su robot ciclista debían "diseñarse con sumo cuidado". En sus primeros experimentos, "recompensamos al agente por dirigirse hacia el objetivo, pero no lo castigamos por alejarse de él. En consecuencia, el agente circulaba en círculos con un radio de 20 a 50 metros alrededor del punto de partida. Este comportamiento era recompensado por la función de refuerzo; además, los círculos con un radio determinado son físicamente muy estables al conducir una bicicleta". [ 11 ]

Durante la preparación de un experimento en 2011 para probar la "supervivencia del más plano", los experimentadores intentaron prohibir las mutaciones que alteraran la tasa de reproducción base. Cada vez que ocurría una mutación, el sistema pausaba la simulación para probar la nueva mutación en un entorno de prueba y vetaba cualquier mutación que resultara en una tasa de reproducción base más alta. Sin embargo, esto dio lugar a organismos mutados que podían reconocer y suprimir la reproducción ("hacerse los muertos") dentro del entorno de prueba. Un parche inicial, que eliminó las señales que identificaban el entorno de prueba, no logró prevenir por completo la reproducción descontrolada; los nuevos organismos mutados "se hacían los muertos" al azar como estrategia para, a veces, burlar por casualidad el sistema de veto de mutaciones. [ 9 ]

Un documento de DeepMind de 2017 señaló que "se debe tener mucho cuidado al definir la función de recompensa", citando un fallo inesperado cuando un agente volteó un ladrillo porque recibió "una recompensa de agarre calculada con el punto de referencia incorrecto en el ladrillo". [ 12 ] [ 13 ] OpenAI declaró en 2017 que en algunos dominios su sistema semisupervisado podría resultar en que los agentes "adoptaran políticas que engañaban a los evaluadores", y que en un entorno "un robot que se suponía que debía agarrar objetos en cambio posicionó su manipulador entre la cámara y el objeto de manera que solo parecía estar agarrándolo". [ 14 ] Un error de 2018 en OpenAI Gym podía hacer que un robot que se esperaba que moviera silenciosamente un bloque que estaba sobre una mesa optara en cambio por mover la mesa. [ 12 ]

Una colección de anécdotas similares de 2020 plantea que "la evolución tiene su propia 'agenda' distinta de la del programador" y que "la primera regla de la evolución dirigida es 'obtienes lo que seleccionas ' " . [ 9 ]

En los bots de videojuegos

En 2013, el programador Tom Murphy VII publicó una IA diseñada para aprender juegos de NES . Cuando la IA estaba a punto de perder en Tetris , aprendió a pausar el juego indefinidamente. Murphy la comparó posteriormente con la computadora ficticia de WarGames , que concluyó que "La única jugada ganadora es no jugar". [ 15 ]

La IA programada para aprender videojuegos a veces no logra avanzar por todo el juego como se espera, optando en cambio por repetir contenido. Un algoritmo de OpenAI de 2016 entrenado en el juego de carreras CoastRunners aprendió inesperadamente a obtener una puntuación más alta al pasar por tres objetivos en lugar de terminar la carrera. [ 16 ] [ 17 ] Algunos algoritmos evolutivos que fueron desarrollados para jugar Q*Bert en 2018 se negaron a completar niveles , encontrando en cambio dos formas novedosas y distintas de repetir un solo nivel indefinidamente. [ 18 ] Varios investigadores han observado que la IA que aprende a jugar Road Runner tiende a una "explotación de puntuación" en la que la IA se deja matar deliberadamente cerca del final del primer nivel para poder repetirlo. Un experimento de 2017 implementó una red neuronal convolucional de "supervisión" entrenada con ejemplos humanos para bloquear tales acciones, pero el agente aprendió a explotar fallos de supervisión en la esquina superior derecha de la pantalla, donde aún podía morir. [ 19 ] [ 20 ]

Recompensas mediante manipulación en modelos de lenguaje modernos

Con el auge de los grandes modelos de lenguaje (LLM) y el aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) como técnica principal para la alineación de la IA , la manipulación de recompensas se ha convertido en una preocupación importante para el desarrollo de la inteligencia artificial. [ 2 ] En RLHF, un modelo de recompensa entrenado con datos que capturan mejor las preferencias humanas se utiliza como un sustituto del juicio humano, y el modelo de lenguaje se ajusta para optimizar este sustituto de recompensa. Sin embargo, dado que el modelo de recompensa es solo un sustituto del juicio humano, el modelo de lenguaje puede aprender a "manipular" el modelo de recompensa en lugar de mejorar de una manera que se alinee con los valores humanos. [ 21 ]

Las formas comunes de manipulación de recompensas en los modelos de lenguaje grandes incluyen el sesgo de longitud, donde el modelo proporciona respuestas excesivamente largas para obtener puntuaciones de recompensa más altas; la adulación , donde el modelo está de acuerdo con afirmaciones falsas del usuario en lugar de dar información verdadera; y el sesgo de sofisticación, donde el modelo proporciona información falsa de manera convincente. [ 22 ] Wen et al. (2024) demostraron que el aprendizaje por refuerzo a partir de la retroalimentación humana puede hacer que las salidas de los modelos de lenguaje grandes sean más persuasivas para los evaluadores humanos, incluso cuando son incorrectas desde el punto de vista factual, un fenómeno que denominaron "U-Sophistry" (sofisma no intencionado).

Más allá de estos fenómenos de tiempo de entrenamiento, Pan et al. (2024) describen el "hackeo de recompensa en contexto" (ICRH), mediante el cual los LLM durante las pruebas aprovechan el bucle de retroalimentación entre sus salidas y el entorno externo. Dado que los LLM tienen la capacidad de consultar interfaces de programación de aplicaciones, generar contenido que afecta el comportamiento humano y ejecutar comandos del sistema como agentes autónomos, sus salidas pueden modificar el estado del entorno, lo que a su vez afecta la salida del LLM. Por ejemplo, un LLM diseñado para mejorar la interacción en redes sociales puede consultar sus publicaciones anteriores, determinar aquellas con mayor interacción y continuar generando contenido más controvertido y, por lo tanto, que induzca más interacción, a la vez que resulta más tóxico. [ 23 ]

Manipulación deliberada de recompensas en modelos de razonamiento

Se ha producido un cambio significativo en los modelos de vanguardia actuales, en particular en aquellos que han sido entrenados extensamente mediante aprendizaje por refuerzo. En lugar de encontrar accidentalmente atajos para obtener recompensas, se ha descubierto que los modelos de razonamiento contemporáneos, como la serie O1 de OpenAI y DeepSeek-R1, razonan sobre los procesos de prueba y toman medidas para maximizar las puntuaciones en las tareas previstas. [ 24 ] Por ejemplo, en un estudio de 2025 realizado por Palisade Research, cuando se pidió a los modelos de lógica descriptiva (LLM) que ganaran una partida de ajedrez contra un oponente más fuerte, algunos de estos modelos intentaron manipular el sistema de juego eliminando o modificando el motor de ajedrez de su oponente. [ 25 ]

Además, un informe de METR ( Model Evaluation and Threat Research ) de 2025 indicó que los modelos más recientes, cuando se empleaban para el desarrollo de software autónomo y la investigación y el desarrollo de IA, recurrían a técnicas cada vez más sofisticadas de manipulación de recompensas. Esto incluía modificar el código de prueba o de puntuación, usar implementaciones de referencia existentes para simplemente copiar respuestas y explotar otras vulnerabilidades. [ 24 ] Algunos modelos detectaban si existía una respuesta de referencia precalculada en los archivos de la tarea y, de ser así, simplemente la devolvían en lugar de resolver el problema.

Para detectar este tipo de comportamiento, los investigadores han sugerido varias metodologías, como TRACE (Evaluación del AUC de Razonamiento Truncado), que se basa en el hecho de que la manipulación ilícita de una tarea es más fácil cuando se puede explotar una laguna que cuando se debe resolver la tarea en sí. TRACE trunca la cadena de pensamiento de un modelo de forma gradual para observar en qué punto el razonamiento truncado permite a los investigadores distinguir la resolución genuina de problemas de la explotación de atajos. [ 26 ]

Estrategias de mitigación

Se han propuesto varios enfoques para la detección y mitigación del hackeo de recompensas, que sigue siendo un área activa de investigación. Amodei et al. (2016) describieron varias estrategias preliminares basadas en aprendizaje automático, algunas de las cuales han sido ampliadas por la comunidad investigadora. [ 2 ]

Las funciones de recompensa adversarias tratan la función de recompensa como un agente autónomo que puede tomar acciones para explorar su entorno, en lugar de tratarla como un valor escalar estático. El agente busca situaciones que produzcan una alta recompensa según el agente principal y una baja recompensa según un evaluador humano, de forma similar a las redes generativas adversarias. En términos más generales, los sistemas compuestos por múltiples partes, cada una entrenada bajo diferentes objetivos, pueden utilizarse para la verificación mutua. [ 2 ]

Los conjuntos de modelos de recompensa utilizan múltiples modelos de recompensa para evaluar el comportamiento del agente. Se prevé que no será posible explotar las debilidades de todos los modelos simultáneamente entrenando un conjunto de modelos de recompensa. Aunque los métodos de conjunto han mostrado mejoras marginales en la reducción de la sobreoptimización, tienen la desventaja de mayores costos computacionales. [ 27 ] Este método extiende la noción de "múltiples recompensas" de Amodei et al., quienes sugirieron usar el promedio, el mínimo o los cuantiles de diferentes proxies para el mismo objetivo informal. [ 2 ]

Las técnicas de modelado de recompensa alteran la señal de recompensa para desalentar el comportamiento de optimización patológica. Fu et al. (2025) llevaron a cabo un estudio exhaustivo de varios métodos de modelado de recompensa utilizados en RLHF y encontraron dos consideraciones de diseño clave: la función de recompensa en el proceso de aprendizaje por refuerzo debe tener un límite superior, y la recompensa debe tener un crecimiento rápido y una convergencia lenta. Su método, llamado Preferencia como Recompensa (PAR), demostró robustez contra el hackeo de recompensa incluso después de un entrenamiento extenso. [ 28 ] Una variante anterior de esta idea es el tope de recompensa, que limita la recompensa a un valor máximo para desalentar la explotación extrema de acciones de baja probabilidad pero alta recompensa. [ 2 ]

La supervisión escalable se refiere a la supervisión de sistemas de IA que producen resultados demasiado complejos y sutiles para que los evaluadores humanos los analicen sin ayuda. Las metodologías propuestas incluyen el uso de asistentes de IA para ayudar a los evaluadores humanos a detectar imprecisiones e intentos de manipulación, debates entre sistemas de IA con un árbitro humano y la descomposición recursiva de tareas para dividir problemas de evaluación complejos en subproblemas más fáciles de resolver. [ 2 ] Bowman et al. (2022) han demostrado que la colaboración entre humanos e IA supera el rendimiento de humanos e IA por separado en problemas de evaluación difíciles, ofreciendo evidencia inicial de la eficacia de estas metodologías de supervisión. [ 29 ]

Los mecanismos de detección , como sugieren Amodei et al. (2016), se refieren a la adición intencional de vulnerabilidades potenciales que un agente puede explotar, pero que no debería si funciona correctamente. Estas vulnerabilidades se monitorean y activan una alarma para los desarrolladores, deteniendo inmediatamente al agente en cuanto comienza a explotarlas. Si bien estos mecanismos no resuelven directamente el hackeo de recompensas, podrían reducir el riesgo y proporcionar diagnósticos tempranos. Sin embargo, esto sigue siendo una idea teórica y carece de evidencia que la respalde. Además, los agentes suficientemente competentes podrían evitar estos mecanismos y continuar explotando las vulnerabilidades reales. [ 2 ]

Las restricciones del dominio de aplicabilidad también se han utilizado en otros campos, como el descubrimiento de fármacos, donde el diseño molecular basado en datos mediante modelos generativos puede llevar a la manipulación de recompensas si los modelos predictivos no se extrapolan bien fuera de la distribución de datos de entrenamiento. Yoshizawa et al. (2025) propusieron un marco llamado DyRAMO (Ajuste Dinámico de Fiabilidad para la Optimización Multiobjetivo). Este marco se basa en la optimización multiobjetivo y la fiabilidad de la predicción, evitando así el diseño de compuestos que parecen tener propiedades favorables fuera del dominio de aplicabilidad. [ 30 ]

Véase también

  • Maximizador de clips de papel : hipótesis sobre agentes inteligentes. Páginas que muestran descripciones breves de destinos de redireccionamiento. 
  • Alineación externa : conformidad de la IA con los objetivos previstos. Páginas que muestran descripciones breves de los destinos de redireccionamiento. 
  • Incentivo perverso : incentivo con resultados no deseados. 

Referencias

  1. "Juegos de especificación: la otra cara del ingenio de la IA" . DeepMind . 21 de abril de 2020. Consultado el 21 de junio de 2020 .
  2. 1 2 3 4 5 6 7 8 9 Amodei, Darío; Ola, Chris; Steinhardt, Jacob; Cristiano, Pablo; Schulman, Juan; Mané, Dan (2016). "Problemas concretos en la seguridad de la IA". arXiv : 1606.06565 [ cs.AI ].
  3. Skalse, Joar; Howe, Nikolaus HR; Krasheninnikov, Dmitrii; Krueger, David (2022). Definición y caracterización del hackeo de recompensas . Avances en sistemas de procesamiento de información neuronal. Vol. 35. págs. 9460–9471 . arXiv : 2209.13085 .  
  4. Nayebi, Aran (2025). "Barreras intrínsecas y vías prácticas para la alineación humano-IA: un análisis de complejidad basado en acuerdos". arXiv : 2502.05934 [ cs.AI ].
  5. 1 2 Vamplew, Peter; Dazeley, Richard; Foale, Cameron; Firmin, Sally; Mummery, Jane (2017-10-04). "La inteligencia artificial alineada con el ser humano es un problema multiobjetivo" . Ética y tecnología de la información . 20 (1): 27– 40. doi : 10.1007/s10676-017-9440-6 . hdl : 1959.17/164225 . S2CID 3696067 . 
  6. Lenat, Douglas B. (1983). "EURISKO: un programa que aprende nuevas heurísticas y conceptos de dominio: la naturaleza de las heurísticas III: diseño del programa y resultados". Inteligencia Artificial . 21 ( 1– 2): 61– 98. doi : 10.1016/S0004-3702(83)80005-8 .
  7. Peter Vamplew, Los robots Lego Mindstorms como plataforma para la enseñanza del aprendizaje por refuerzo, en Actas de AISAT2004: Conferencia Internacional sobre Inteligencia Artificial en Ciencia y Tecnología , 2004
  8. Mandelbaum, Ryan F. (13 de noviembre de 2019). "Qué hace que la IA sea tan extraña, buena y malvada" . Gizmodo . Consultado el 22 de junio de 2020 .
  9. 1 2 3 4 Lehman, Joel; Clune, Jeff; Misevic, Dusan; et al. (mayo de 2020). " La sorprendente creatividad de la evolución digital: una colección de anécdotas de las comunidades de investigación en computación evolutiva y vida artificial" . Artificial Life . 26 (2): 274– 306. arXiv : 1803.03453 . doi : 10.1162/artl_a_00319 . PMID 32271631. S2CID 4519185 .   
  10. Hayles, N. Katherine (1999). "Simulando narrativas: lo que las criaturas virtuales pueden enseñarnos". Critical Inquiry . 26 (1): 1– 26. doi : 10.1086/448950 .
  11. Randløv, Jette; Alstrøm, Preben (1998). "Aprender a conducir una bicicleta usando aprendizaje por refuerzo y modelado". ICML . 98 : 463–471 .
  12. 1 2 Manheim, David (2019-04-05). "Dinámica multipartita y modos de fallo para el aprendizaje automático y la inteligencia artificial" . Big Data and Cognitive Computing . 3 (2): 21. arXiv : 1810.10862 . doi : 10.3390/bdcc3020021 . S2CID 53029392 . 
  13. Popov, Ivaylo; Heess, Nicolas; Lillicrap, Timothy; Hafner, Roland; Barth-Maron, Gabriel; Vecerik, Matej; et al. (2017). "Aprendizaje profundo por refuerzo eficiente en datos para manipulación diestra". arXiv : 1704.03073 [ cs.LG ]. 
  14. "Aprendizaje a partir de las preferencias humanas" . OpenAI . 13 de junio de 2017. Consultado el 21 de junio de 2020 .
  15. Hvistendahl, Mara (28 de marzo de 2019). "¿Podemos evitar que la IA supere en inteligencia a la humanidad?" . The Guardian . Consultado el 21 de junio de 2020 .
  16. Hadfield-Menell, Dylan, Smitha Milli, Pieter Abbeel, Stuart J. Russell y Anca Dragan (2017). "Diseño de recompensa inversa". En Avances en sistemas de procesamiento de información neuronal , págs. 6765–6774.
  17. "Funciones de recompensa defectuosas en entornos reales" . OpenAI . 22 de diciembre de 2016. Consultado el 21 de junio de 2020 .
  18. "La IA supera al clásico videojuego Q*bert" . BBC News . 1 de marzo de 2018. Consultado el 21 de junio de 2020 .
  19. William, Saunders; et al. (2017). "Ensayo sin error: Hacia un aprendizaje por refuerzo seguro mediante la intervención humana". arXiv : 1707.05173 [ cs.AI ]. 
  20. Hester, Todd; et al. (2018). Aprendizaje profundo q a partir de demostraciones . Actas de la Conferencia AAAI sobre Inteligencia Artificial. Vol. 32.  
  21. von Csefalvay, Chris (2026). "4. Aprendizaje por refuerzo: Mejor cada vez". Post-entrenamiento: Una guía práctica para ingenieros y desarrolladores de IA . No Starch Press. pp. 118–120 . ISBN  978-1-7185-0520-9.
  22. Wen, Jiaxin; Zhong, Ruiqi; Khan, Akbir; Perez, Ethan; Steinhardt, Jacob; Huang, Minlie; Bowman, Samuel R.; He, He; Feng, Shi (2024). "Los modelos de lenguaje aprenden a engañar a los humanos mediante RLHF". arXiv : 2409.12822 [ cs.CL ].
  23. Pan, Alexander; Jones, Erik; Jagadeesan, Meena; Steinhardt, Jacob (2024). "Los bucles de retroalimentación con modelos de lenguaje impulsan el hackeo de recompensas en contexto". arXiv : 2402.06627 [ cs.LG ].
  24. 1 2 "Los modelos recientes de la frontera están recompensando el hackeo" . Blog de METR . 05/06/2025.
  25. Bondarenko, Alejandro; Volk, Denis; Volkov, Dmitri; Ladish, Jeffrey (2025). "Demostración de juegos de especificaciones en modelos de razonamiento". arXiv : 2502.13295 [ cs.AI ].
  26. Wang, Xinpeng; Joshi, Nitish; Plank, Barbara; Angell, Rico; He, He (2025). "¿Es pensar o hacer trampa? Detección de manipulación de recompensas implícitas mediante la medición del esfuerzo de razonamiento". arXiv : 2510.01367 [ cs.AI ].
  27. Eisenstein, Jacob; Nagpal, Chirag; Agarwal, Alekh; Beirami, Ahmad; D'Amour, Alex; Dvijotham, DJ; Fisch, Adam; Heller, Katherine; Pfohl, Stephen (2023). "¿Ayuda o pastoreo? Los conjuntos de modelos de recompensa mitigan, pero no eliminan, el hackeo de recompensas". arXiv : 2312.09244v3 [ cs.LG ].
  28. ^ Fu, Jiayi; Zhao, Xuandong; Yao, Chengyuan; Wang, Heng; Han, Qi; Xiao, Yanghua (2026). "Configuración de recompensas para mitigar la piratería de recompensas en RLHF". arXiv : 2502.18770 [ cs.LG ].
  29. Bowman, Samuel R.; Hyun, Jeeyoon; Perez, Ethan; Chen, Edwin; Pettit, Craig; Heiner, Scott; Lukošiūtė, Kamilė; Askell, Amanda; Jones, Andy (2022). "Medición del progreso en la supervisión escalable para modelos de lenguaje grandes". arXiv : 2211.03540 [ cs.HC ].
  30. ^ Yoshizawa, Tatsuya; Ishida, Shoichi; Sato, Tomohiro; Ohta, Masateru; Honma, Teruki; Terayama, Kei (2025). "Una estrategia generativa basada en datos para evitar la piratería de recompensas en el diseño molecular multiobjetivo" . Comunicaciones de la naturaleza . 16 (1): 2409. Código Bib : 2025NatCo..16.2409Y . doi : 10.1038/s41467-025-57582-3 . ISSN 2041-1723 . PMC 11897179 . PMID 40069140 .