El aprendizaje de modelos de acción (a veces abreviado como aprendizaje de acciones ) es un área del aprendizaje automático que se ocupa de la creación y modificación del conocimiento de un agente de software sobre los efectos y las precondiciones de las acciones que se pueden ejecutar dentro de su entorno . Este conocimiento se suele representar en un lenguaje de descripción de acciones basado en lógica y se utiliza como entrada para planificadores automatizados .
El aprendizaje de modelos de acción es importante cuando cambian los objetivos. Cuando un agente ha actuado durante un tiempo, puede utilizar su conocimiento acumulado sobre las acciones en el dominio para tomar mejores decisiones. Por lo tanto, el aprendizaje de modelos de acción difiere del aprendizaje por refuerzo . Permite razonar sobre las acciones en lugar de realizar costosos ensayos en el mundo. [ 1 ] El aprendizaje de modelos de acción es una forma de razonamiento inductivo , donde se genera nuevo conocimiento basado en las observaciones del agente .
La motivación habitual para el aprendizaje de modelos de acción radica en que la especificación manual de modelos de acción para planificadores suele ser una tarea difícil, laboriosa y propensa a errores (especialmente en entornos complejos).
Modelos de acción
Dado un conjunto de entrenamientoque consta de ejemplos, dóndeson observaciones de un estado del mundo a partir de dos pasos de tiempo consecutivosyes una instancia de acción observada en el paso de tiempoEl objetivo del aprendizaje de modelos de acción en general es construir un modelo de acción., dóndees una descripción de la dinámica del dominio en el formalismo de descripción de acciones como STRIPS , ADL o PDDL yes una función de probabilidad definida sobre los elementos de. [ 2 ] Sin embargo, muchos métodos de aprendizaje de acciones de última generación asumen el determinismo y no inducenAdemás del determinismo, los distintos métodos difieren en la forma en que tratan otros atributos del dominio (por ejemplo, la observabilidad parcial o el ruido sensorial).
Métodos de aprendizaje en la acción
Lo último
Los métodos recientes de aprendizaje de acciones adoptan diversos enfoques y emplean una amplia variedad de herramientas de diferentes áreas de la inteligencia artificial y la lógica computacional . Como ejemplo de un método basado en lógica proposicional, podemos mencionar el algoritmo SLAF (Simultaneous Learning and Filtering), [ 1 ] que utiliza las observaciones del agente para construir una fórmula proposicional larga a lo largo del tiempo y posteriormente la interpreta utilizando un solucionador de satisfacibilidad (SAT) . Otra técnica, en la que el aprendizaje se convierte en un problema de satisfacibilidad ( MAX-SAT ponderado en este caso) y se utilizan solucionadores SAT, está implementada en ARMS (Action-Relation Modeling System). [ 3 ] Dos enfoques mutuamente similares, totalmente declarativos para el aprendizaje de acciones se basaron en el paradigma de programación lógica Answer Set Programming (ASP) [ 4 ] y su extensión, Reactive ASP. [ 5 ] En otro ejemplo, se empleó un enfoque de programación lógica inductiva ascendente . [ 6 ] Varias soluciones diferentes no se basan directamente en la lógica. Por ejemplo, el aprendizaje del modelo de acción utilizando un algoritmo de perceptrón [ 7 ] o la búsqueda voraz multinivel sobre el espacio de posibles modelos de acción. [ 8 ] En el artículo anterior de 1992, [ 9 ] el aprendizaje del modelo de acción se estudió como una extensión del aprendizaje por refuerzo .
No obstante, se pueden encontrar otros algoritmos que operan bajo supuestos diferentes: FAMA [ 10 ] puede funcionar incluso cuando faltan algunas observaciones y produce un modelo de planificación general (elevado). Trata el aprendizaje de un modelo de acción como un problema de planificación, asegurándose de que el modelo aprendido coincida con las observaciones dadas. NOLAM [ 11 ] puede aprender modelos de acción generales incluso a partir de datos ruidosos o imperfectos. LOCM [ 12 ] se centra únicamente en el orden de las acciones en los datos, ignorando cualquier detalle sobre los estados entre esas acciones. La familia de métodos de aprendizaje de modelos de acción seguros (SAM) [ 13 ] crea modelos que garantizan que cualquier plan hecho con ellos realmente funcionará en el mundo real. También hay una extensión llamada N-SAM [ 14 ] que puede aprender modelos de acción con condiciones y efectos numéricos.
Además, se pueden utilizar modelos de acción numéricos como N-SAM para mejorar el rendimiento del aprendizaje por refuerzo (RL) a través del algoritmo RAMP. [ 15 ]
Literatura
La mayoría de los artículos de investigación sobre aprendizaje basado en la acción se publican en revistas y congresos centrados en la inteligencia artificial en general (por ejemplo, Journal of Artificial Intelligence Research (JAIR), Artificial Intelligence, Applied Artificial Intelligence (AAI) o AAAI). A pesar de la relevancia mutua de los temas, el aprendizaje basado en modelos de acción no suele abordarse en congresos de planificación como la Conferencia Internacional sobre Planificación y Programación Automatizadas (ICAPS).
Véase también
Referencias
- 1 2 Amir, Eyal; Chang, Allen (2008). "Aprendizaje de modelos de acción deterministas parcialmente observables" . Journal of Artificial Intelligence Research . 33 : 349–402 . arXiv : 1401.3437 . doi : 10.1613/jair.2575 . S2CID 9432224 .
- ↑ Čertický, Michal (2014). "Aprendizaje de modelos de acción en tiempo real con el algoritmo en línea 3SG" . Inteligencia Artificial Aplicada . 28 (7): 690–711 . doi : 10.1080/08839514.2014.927692 . S2CID 8210810 .
- ↑ Yang, Qiang; Kangheng, Wu; Yunfei, Jiang (2007). "Aprendizaje de modelos de acción a partir de ejemplos de planes utilizando MAX-SAT ponderado" . Inteligencia Artificial . 171 ( 2–3 ): 107–143 . CiteSeerX 10.1.1.135.9266 . doi : 10.1016/j.artint.2006.11.005 .
- ↑ Balduccini, Marcelo (2007). "Aprendizaje de descripciones de acciones con A-Prolog: lenguaje de acción C" . Simposio de primavera de la AAAI: formalizaciones lógicas del razonamiento de sentido común : 13–18 .
- ↑ Čertický, Michal (2012). "Aprendizaje de acciones con programación reactiva de conjuntos de respuestas: informe preliminar" . ICAS 2012 : Octava Conferencia Internacional sobre Sistemas Autónomos . pp. 107–111 . ISBN 9781612081878.
- ↑ Benson, Scott (1995). "Aprendizaje inductivo de modelos de acción reactiva". Aprendizaje automático: Actas de la Duodécima Conferencia Internacional .
- ↑ Mourao, Kira; Petrick, Ronald; Steedman, Mark (2010). "Aprendizaje de los efectos de la acción en dominios parcialmente observables" . Frontiers in Artificial Intelligence and Applications . 215 (ECAI 2010): 973–974 . doi : 10.3233/978-1-60750-606-5-973 . hdl : 20.500.11820/810a5579-b991-441a-ad68-af0151689627 .
- ↑ Zettlemoyer, Luke; Pasula, Hanna; Kaelblin, Leslie Pack (2005). "Aprendizaje de reglas de planificación en mundos estocásticos ruidosos" . AAAI : 911–918 .
- ↑ Lin, Long-Ji (1992). "Agentes reactivos de autoaprendizaje basados en aprendizaje por refuerzo, planificación y enseñanza" . Machine Learning . 8 ( 3–4 ): 293–321 . doi : 10.1023/A:1022628806385 .
- ↑ Aineto, Diego; Jiménez Celorrio, Sergio; Onaindia, Eva (2019). "Modelos de acción de aprendizaje con mínima observabilidad" . Inteligencia artificial . 275 : 104– 137. doi : 10.1016/j.artint.2019.05.003 .
- ↑ Lamanna, Leonardo; Serafini, Luciano (2024). Aprendizaje de modelos de acción a partir de trazas ruidosas: un enfoque probabilístico . Conferencia Internacional sobre Planificación y Programación Automatizadas (ICAPS). pp. 342–350 . doi : 10.1609/icaps.v34i1.31493 .
- ↑ Cresswell, Stephen N.; McCluskey, Thomas L.; West, Margaret M. (2013). "Adquisición de modelos de dominio de planificación mediante LOCM" . The Knowledge Engineering Review . 28 (2): 195– 213. doi : 10.1017/S0269888912000422 .
- ↑ Juba, Brendan; Le, Hai S; Stern, Roni (2021). Aprendizaje seguro de modelos de acción elevados (PDF) . Actas de la 18.ª Conferencia Internacional sobre Principios de Representación del Conocimiento y Razonamiento (KR). págs. 379–389 .
- ↑ Mordoch, Argaman; Juba, Brendan; Stern, Roni (2023). Aprendizaje de modelos de acción numérica seguros . Conferencia AAAI sobre inteligencia artificial. Vol. 37. pp. 12079– 12086. doi : 10.1609/aaai.v37i10.26424 .
- ↑ Benyamin, Yarin; Mordoch, Argaman; Shperberg, Shahaf S.; Stern, Roni (2025). "Integración del aprendizaje por refuerzo, el aprendizaje de modelos de acción y la planificación numérica para abordar tareas complejas". arXiv : 2502.13006 [ cs.AI ].
- razonamiento inductivo
- Aprendizaje automático
- minería de datos