scieee AI-readable full text Open interactive document viewer

Deep reinforcement learning para órbitas seguras alrededor de asteroides

Redondo Amaro, Pablo

Abstract

La exploración espacial de asteroides presenta grandes retos debido a la complejidad de operar en un entorno dinámico complejo y a la dificultad de mantener una comunicación constante con la Tierra. En estas misiones, el inevitable retardo en la señal o la imposibilidad de comunicación cuando la Deep Space Network está saturada, puede poner en riesgo la integridad de la sonda. Por ello, resulta fundamental desarrollar sistemas capaces de mantener órbitas seguras de manera autónoma hasta que la conexión pueda establecerse. Este trabajo propone utilizar el algoritmo de aprendizaje por refuerzo profundo Soft Actor-Critic (SAC) para implementar un modo seguro autónomo en sondas orbitando el asteroide Eros 433. Mediante un entorno simulado que representa fielmente el campo gravitatorio del asteroide con un modelo basado en mascon, la sonda aprende estrategias óptimas para mantener la seguridad operativa en ausencia temporal de comunicación.

Full text

Proyecto Fin de Carrera Ingeniería de Telecomunicación Formato de Publicación de la Escuela Técnica Superior de Ingeniería Autor: F. Javier Payán Somet Tutor: Juan José Murillo Fuentes Dep. Teoría de la Señal y Comunicaciones Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2013 Trabajo Fin de Grado Grado en Ingeniería Aeroespacial Deep reinforcement learning para órbitas seguras alrededor de asteroides Autor: Pablo Redondo Amaro Tutor: Julio C. Sánchez Merino Dpto. Ingeniería Aeroespacial y Mecánica de Fluidos Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025 Trabajo Fin de Grado Grado en Ingeniería Aeroespacial Deep reinforcement learning para órbitas seguras alrededor de asteroides Autor: Pablo Redondo Amaro Tutor: Julio C. Sánchez Merino Profesor Permanente Laboral Dpto. Ingeniería Aeroespacial y Mecánica de Fluidos Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025 Trabajo Fin de Grado: Deep reinforcement learning para órbitas seguras alrededor de asteroides Autor: Pablo Redondo Amaro Tutor: Julio C. Sánchez Merino El tribunal nombrado para juzgar el trabajo arriba indicado, compuesto por los siguientes profesores: Presidente: Vocal/es: Secretario: acuerdan otorgarle la calificación de: El Secretario del Tribunal Fecha: Agradecimientos E n primer lugar, quiero expresar mi agradecimiento a todos los profesores que tanto me han enseñado a lo largo de este camino. Agradezco al profesor Jorge Galán-Vioque haberme facilitado el acceso a la máquina virtual del IMUS, lo que ha permitido abordar el problema de forma viable. En especial, quiero agradecer a mi tutor Julio por todo lo que he aprendido de él, por haberme introducido en este campo del Machine Learning que tanto me gusta y por darme la confianza para afrontar el problema con tan buen clima de trabajo. Su orientación ha sido fundamental para superar las barreras del problema. A mis amigos del pueblo les quiero agradecer el apoyo y el haber sido una vía de escape en los momentos difíciles. En especial, a mi amigo Parada, por haber estado siempre a mi lado cuando lo he necesitado, sin importar las circunstancias que le rodearan. A mis amigos de la carrera, no podría haber tenido más suerte. Muchas gracias por haber sido como una piña estos cuatro años, por habernos ayudado en todo y por apoyarnos en los malos momentos. Este camino no hubiera sido lo mismo sin vosotros. A toda mi familia, infinitas gracias por haberme hecho sentir tan apoyado en cada paso que he dado. En especial, quiero expresar mi profundo agradecimiento a mi abuelo por haberme enseñado tanto, haberme motivado siempre a aprender y animarme para afrontar los problemas. Espero que este trabajo le resulte tan interesante como a mí el problema de las vacas. Por último, a mis padres y a mi hermano, mi mayor motivación y mi mayor suerte, siempre. Nada de esto habría sido posible sin vosotros. Gracias por todos los sacrificios que habéis hecho por mí, por parar vuestro mundo cada vez que yo lo he necesitado. Este trabajo es por vosotros. Pablo Redondo Amaro Sevilla, 2025 I Resumen L a exploración espacial de asteroides presenta grandes retos debido a la complejidad de operar en un entorno dinámico complejo y a la dificultad de mantener una comunicación constante con la Tierra. En estas misiones, el inevitable retardo en la señal o la imposibilidad de comunicación cuando la Deep Space Network está saturada, puede poner en riesgo la integridad de la sonda. Por ello, resulta fundamental desarrollar sistemas capaces de mantener órbitas seguras de manera autónoma hasta que la conexión pueda establecerse. Este trabajo propone utilizar el algoritmo de aprendizaje por refuerzo profundo Soft Actor-Critic (SAC) para implementar un modo seguro autónomo en sondas orbitando el asteroide Eros 433. Mediante un entorno simulado que representa fielmente el campo gravitatorio del asteroide con un modelo basado en mascon, la sonda aprende estrategias óptimas para mantener la seguridad operativa en ausencia temporal de comunicación. III XÍndice 3.5.2 Descenso del gradiente 22 3.5.3 Optimizador ADAM 23 4 Orbitado seguro con SAC en 2D 27 4.1 Arquitectura y modelado 27 4.2 Curriculum Learning 29 4.2.1 Problema con masa puntual en 2D 31 Resultados del Entrenamiento 31 4.2.2 Problema con dos masas puntuales en 2D 34 Resultados del entrenamiento 34 4.2.3 Problema con cuatro masas puntuales en 2D 36 Resultados del entrenamiento 37 4.2.4 Problema con modelo mascon en 2D 38 Resultados del entrenamiento 39 4.2.5 Conclusión 42 5 Orbitado seguro con SAC en 3D 45 5.1 Arquitectura y modelado 45 5.2 Curriculum Learning 46 5.2.1 Problema con masa puntual en 3D 48 Resultados del entrenamiento 48 5.2.2 Problema con dos masas puntuales en 3D 49 Resultados del entrenamiento 49 5.2.3 Problema con cuatro masas puntuales en 3D 51 Resultados del entrenamiento 52 5.2.4 Problema con modelo mascon en 3D 52 Resultados del entrenamiento 52 5.2.5 Conclusión 54 6 Conclusiones y trabajo futuro 65 6.1 Conclusiones 65 6.2 Trabajo futuro 66 Índice de Figuras 69 Índice de Tablas 71 Bibliografía 73 1 Introducción Los asteroides son cuerpos celestes que, a diferencia de los planetas, no alcanzaron el equilibrio hidrostático. Por ello, conservan una composición y estructura interna que apenas ha variado en miles de millones de años, lo que los convierte en una línea de investigación clave para el estudio de la evolución del sistema solar. Más allá del valor científico, estos cuerpos también representan una amenaza, por el riesgo de impacto con la Tierra, así como una oportunidad económica gracias a la abundancia de recursos que contienen. 1.1 Intereses en los asteroides D esde los inicios del estudio de la mecánica celeste, la comunidad científica ha ampliado el conocimiento sobre los asteroides gracias a la mejora en técnicas de observación y exploración espacial. Estas investigaciones ofrecen detalles únicos sobre procesos ocurridos en el sistema solar que serían imposibles de obtener a partir de muestras terrestres o meteoritos alterados por la entrada atmosférica. Al interés científico le acompaña un argumento de seguridad planetaria: los impactos de cuerpos próximos a la Tierra no son eventos remotos. El cráter de Chicxulub prueba que asteroides de apenas 10 kilómetros de diámetro modificaron drásticamente la evolución biológica y climática del planeta. También existen registros más recientes de impactos, como el evento de Cheliábinsk en 2013, cuando un meteoroide explotó aproximadamente a veinte kilómetros de altura, liberando una energía de quinientos kilotones, treinta veces mayor que la bomba nuclear de Hiroshima. Posteriormente, algunos fragmentos del objeto cayeron a unos ochenta kilómetros de la ciudad. A día de hoy, se han catalogado más de treinta mil asteroides cercanos a la Tierra (Near-Earth Asteroids, NEA). Según estimaciones basadas en los principales programas de vigilancia óptica (Spacewatch,Catalina y Pan-STARRS), actualmente se conoce en torno al 40% de los NEAs con diámetros superiores a 140 m, un rango suficiente para provocar devastación regional [ 6 ]. Por ello, es necesario desarrollar soluciones para neutralizar esta amenaza. La misión DART (2022) estrelló una sonda espacial contra el asteroide Dimorphos, satélite de Didymos, demostrando así que es técnicamente viable alterar la órbita de un asteroide binario mediante un impacto cinético controlado [ 1 ]. La misión Hera (ESA, 2027) caracterizará in situ la eficiencia real del desvío de Dimorphos y calibrará futuros modelos de defensa planetaria. Recientemente, se ha desatado un interés económico de los mismos en forma de explotación de sus recursos naturales, así como oportunidades de uso para la exploración espacial. Diversos estudios espectrales indican que ciertos asteroides, especialmente los metálicos (tipo M) y algunos silicáticos (tipo S), presentan concentraciones de platino, iridio, cobalto o níquel entre cien y mil veces superiores a las vetas terrestres más ricas. Este potencial ha despertado el interés de consorcios privados y agencias espaciales que ven en la minería extraterrestre una gran oportunidad. Un solo 1 2Capítulo 1. Introducción cuerpo metálico de quinientos metros podría albergar del orden de 4×105 toneladas de Ni-Co y decenas de miles de toneladas de metales del grupo del platino, valoradas en miles de millones de euros. Por su parte, los asteroides carbonáceos son reserva natural de agua y contienen compuestos volátiles que, procesados, abaratarían el costo energético de la logística cis-lunar y de misiones tripuladas de larga duración. Sin embargo, estas misiones de extracción presentan un desafío considerable. Operar en las proximidades de un asteroide impone retos dinámicos que difieren de los que rigen alrededor de planetas o lunas. Sus pequeñas masas implican que con pequeños cambios de velocidad se pueda insertar el vehículo en órbitas de colisión o escape. Además, la forma irregular y la rápida rotación generan campos gravitatorios altamente complejos, cuyas anomalías pueden provocar que, ante un error de modelado, una trayectoria nominal derive de forma inesperada en impacto o escape en cuestión de horas. El control de órbita y proximidad exige, por tanto, maniobras frecuentes de corrección, lo que invita a explorar soluciones capaces de aprender estas maniobras de forma autónoma, tal como plantean los métodos de Machine Learning. 1.2 Machine Learning Los orígenes del Machine Learning (ML) datan de los años 50, cuando el informático Arthur Samuel programó un juego de damas que aprendía de sus propias partidas ajustando pesos numéricos para valorar posiciones, siendo la primera demostración donde un algoritmo podría mejorar su rendimiento sin que haya que diseñar algoritmia específica con intervención humana. Surgía así el ML, una rama de la inteligencia artificial en la que se desarrollan técnicas para permitir a las computadoras aprender de los datos. Entre los algoritmos clásicos de ML se encuentran los árboles de decisión, que dividen los datos en ramas según sus características para tomar decisiones o hacer predicciones, los algoritmos k-NN, aquellos que clasifican comparando con los ejemplos más cercanos del conjunto de entrenamiento, o la regresión lineal, un método que estima una variable dependiente en función de una o más independientes ajustando una línea recta. Estos métodos son útiles y se entrenan con rapidez en problemas sencillos. Poco después, Frank Rosenblatt propuso el perceptrón, un modelo matemático inspirado en la neurona, que ya era capaz de clasificar dígitos sencillos. Aunque su potencia era limitada, inició la idea de entrenar redes con ejemplos en lugar de deducir ecuaciones para cada problema. Durante las décadas de los setenta y los ochenta, el entusiasmo se calmó, puesto que los ordenadores no eran tan potentes como hoy en día y las redes con poca capacidad no podían resolver tareas complejas. Sin embargo, la publicación en 1986 del algoritmo de retropropagación [ 10 ] permitió ajustar capas sucesivas de neuronas calibrando de forma eficiente millones de parámetros, constituyendo así un segundo gran impulso. Surgía así el Deep Learning, un subcampo del Machine Learning donde se emplean redes neuronales profundas capaces de aprender representaciones complejas directamente de los datos. Este algoritmo de retropropagación consiste en ajustar los pesos de una red neuronal comparando la salida con el valor correcto, y luego propagar dicho error hacia atrás mediante la regla de la cadena para corregir la red capa por capa. El salto decisivo llegó en este siglo debido a tres factores determinantes: la enorme cantidad de información capturada hoy en día por sensores, imágenes o registros industriales; la potencia de cálculo que ofrecen las GPU, capaces de entrenar modelos complejos en horas en lugar de meses, años o décadas, y por último, el desarrollo de nuevos métodos matemáticos que facilitan que los sistemas aprendan correctamente, por ejemplo mediante optimizadores adaptativos como Adam. En 2012, una red llamada AlexNet redujo drásticamente el error en la competición de imagen ImageNet, marcando el nacimiento de la era del aprendizaje profundo. Desde entonces, variantes convolucionales son capaces de detectar enfermedades a través de imágenes, el aprendizaje por refuerzo profundo es capaz de derrotar a campeones mundiales en videojuegos, etc. 1.3 Motivación y Objetivo 3 Figura 1.1 Deep Space Network en Canberra, Australia. Créditos: NASA. 1.3 Motivación y Objetivo En esta sección se presentan de forma resumida los motivos clave que justifican el desarrollo de este trabajo, así como la estructura y los contenidos de cada uno de los capítulos posteriores. Se destacan tanto los desafíos específicos que pretende resolver, como el método utilizado para alcanzar los objetivos planteados. 1.3.1 Saturación en la Deep Space Network La vía de comunicación entre una nave más allá de la órbita lunar y los centros de control en Tierra es la Deep Space Network (Figura 1.1); tres complejos de antenas de 34 m y 70 m situadas en California (EEUU), Madrid (España) y Canberra (Australia). Cada estación ve el cielo durante un tercio de día, lo que supone ocho horas de contacto para una nave interplanetaria, que se reduce a bloques de minutos cuando coinciden varias misiones en la misma ventana. El programa Artemis, los róveres marcianos, las sondas a los hielos de Júpiter y Saturno o el retorno de muestras de Bennu, entre otras muchas misiones, han disparado la demanda. Los informes de la NASA, como el DSN Aperture Forecast 2023 [ 8 ], destacan el aumento de la cantidad de datos recopilados y transmitidos en los últimos treinta años, con una demanda que, en ocasiones, supera la oferta en un 40% . Además, a esta congestión, hay que sumarle los eventos inevitables, como eclipses, tormentas geomagnéticas o simples fallos de seguimiento, que dejan a la nave sin telemetría durante horas o días. En este contexto, con una gran saturación en la DSN y dificultades para mantener una comunicación continua con las sondas, resulta de gran importancia dotarlas de capacidad para operar de forma autónoma. 1.3.2 Retraso en las señales Un factor fundamental en las comunicaciones es la distancia, puesto que el tiempo que dura una señal en llegar desde el emisor al receptor es proporcional a la misma. Esto, en transferencias interplanetarias puede no suponer un gran problema debido al tiempo del que se dispone para corregir la maniobra. Sin embargo, en las proximidades de un asteroide o en maniobras críticas como un entry-descent and landing (entrada, descenso y aterrizaje) en Marte, un retraso en la señal implica que no es posible controlar la sonda en tiempo real desde la Tierra. Por ello, es necesario capacitar a la sonda de un modo de funcionamiento autónomo. 4Capítulo 1. Introducción Figura 1.2 Eros 433. Créditos: NASA. 1.3.3 Métodos clásicos frente a aprendizaje por refuerzo Para abordar el problema del control en misiones espaciales en entornos complejos es fundamental elegir adecuadamente el método de control empleado. Existen diversas técnicas tradicionales como los controladores basados en feedback (PID), los cuales son rápidos de calcular pero no son óptimos ni garantizan la seguridad, además de necesitar siempre una referencia. Un método que suele mejorar al PID, es el Linear Quadratic Regulator (LQR), que resuelve un problema cuadrático con dinámica lineal, aunque también necesita una referencia, y tampoco garantiza la seguridad. Para darle solución al problema de la seguridad, surge el método Model Predictive Control (MPC), el cual optimiza continuamente las acciones futuras mediante simulación usando un modelo predictivo del sistema. Sin embargo, estos cálculos son relativamente lentos, puesto que implican resolver problemas de optimización en tiempo real. En este contexto, el Deep Reinforcement Learning (DRL), puede presentar una ventaja para este objetivo. Un algoritmo de DRL aprende a través de un proceso de prueba y error exponiéndose a miles de variaciones del entorno, a diferencia de otros que necesitan un conjunto de datos previamente [ 2 ]. El resultado es una función estado-acción que permite al computador de a bordo consultar rápidamente la acción adecuada sin necesidad de rehacer una optimización de trayectorias. Si bien es cierto que no puede garantizar la seguridad, gracias al mapa estado-acción, su capacidad puede cubrir todo el espacio de estados proporcionando respuestas efectivas incluso ante situaciones imprevistas. 1.3.4 Síntesis y orden del trabajo La saturación de la Deep Space Network debido al crecimiento exponencial de las misiones, el retraso en las señales y la fragilidad de las trayectorias en el entorno gravitatorio de los asteroides, obligan a dotar a las sondas de autonomía. Los algoritmos de DRL presentan una solución a este problema aprendiendo offline, donde el cómputo es costoso pero asumible, puesto que el entrenamiento en la Tierra no es crítico. Luego, importando las redes en el computador, se ejecutan las acciones online con un mínimo costo computacional cuando se pierda la conexión con la Tierra, ya sea por saturación de la DSN o debido a una avería. Este trabajo se centra en aplicar técnicas de DRL, específicamente el algoritmo Soft Actor-Critic (SAC) [ 3 ], para implementar un modo seguro autónomo en sondas que orbitan alrededor del asteroide Eros 433. Este asteroide cercano a la Tierra (NEA), con dimensiones aproximadas de 32 km en su eje mayor y 17 km en los ejes menores, presenta desafíos únicos debido a su geometría irregular y a su complejo campo gravitatorio. Cuenta con una masa de aproximadamente 7.2×1015 kg, dando lugar a un parámetro gravitacional 𝜇Eros =4.465×105𝑚3/𝑠2 . El objetivo principal es analizar si el DRL puede proporcionar un sistema fiable y eficiente capaz de mantener órbitas seguras alrededor de Eros 433, asegurando la autonomía de la sonda para orbitar de forma segura. El presente documento se organiza de la siguiente manera: 1.3 Motivación y Objetivo 5 • Capítulo 1: Se presenta el estado del arte en navegación satelital, así como la motivación y los objetivos del trabajo. • Capítulo 2: Se introducen los fundamentos de la mecánica orbital necesarios para la construcción del entorno de simulación. • Capítulo 3: Se describe el algoritmo Soft Actor-Critic (SAC) y su implementación en código. • Capítulo 4: Se analiza el comportamiento del algoritmo en un entorno simplificado de dos dimensiones alrededor del asteroide. • Capítulo 5: Se extiende el estudio al caso tridimensional, evaluando el rendimiento del algoritmo en condiciones más realistas. • Capítulo 6: Se recogen las conclusiones obtenidas y se plantean posibles líneas de trabajo futuras. 2 Fundamentos de Mecánica Orbital E ste capítulo presenta los fundamentos teóricos necesarios para modelar el movimiento orbital en el entorno del asteroide. Se abordan los sistemas de referencia utilizados para describir la dinámica de la sonda, la formulación matemática de su movimiento y el modelo gravitatorio empleado en la simulación. 2.1 Sistemas de referencia centrados en el asteroide Para describir el movimiento de la sonda con respecto al asteroide es necesario definir un sistema de referencia adecuado. En mecánica orbital se utilizan distintos sistemas de referencia dependiendo del tipo de análisis o misión que se realice. En este trabajo se consideran dos: sistema de referencia inercial centrado en el asteroide y sistema de referencia fijo al asteroide. A continuación, se detallan sus características y ventajas de cada uno según la aplicación a considerar. 2.1.1 Sistema de referencia inercial centrado en el asteroide Tomando como referencia el elipsoide que aproxima la forma del asteroide, se define el sistema de referencia inercial con origen en su centro de masas. Se elige una orientación inicial en la que los ejes 𝑥 e 𝑦 son paralelos a los ejes mayor e intermedio, respectivamente, mientras que el eje 𝑧 completa el triedro a derechas. Este último se alinea con la velocidad angular de rotación del asteroide y por tanto el plano ecuatorial del asteroide está dado por el plano 𝑥𝑦 . Cabe destacar que aunque inicialmente los ejes se alinean con el asteroide, estos no rotan con él, es decir, permanecen fijos en el espacio. De esta manera, la 2◦ Ley de Newton es aplicable directamente, ya que son válidas en sistemas de referencia inerciales. En un sistema que rote con el asteroide, también podrían usarse, pero sería necesario reformularlas incluyendo términos adicionales, como la fuerza centrífuga o la de Coriolis. Por ello, la ventaja de este sistema es que no introduce fuerzas ficticias y permite definir elementos orbitales alrededor del asteroide. La Figura 2.1 muestra el sistema descrito. 2.1.2 Sistema de referencia fijo al asteroide Este sistema de referencia se encuentra rígidamente unido al asteroide, por lo que rota solidariamente con él, y su eje 𝑧 es compartido con el sistema inercial. Por tanto, los ejes 𝑥 e 𝑦 del sistema de referencia fijo en el asteroide giran en el plano ecuatorial con la tasa de rotación del asteroide, esto es, 𝜔=0.00033 𝑟𝑎𝑑/𝑠 . Este sistema mide posiciones geográficas respecto del asteroide por lo que se usa en la detección de colisiones y en el cálculo del campo gravitatorio irregular. La Figura 2.2 muestra el sistema descrito. 7 8Capítulo 2. Fundamentos de Mecánica Orbital Figura 2.1 Sistema de referencia inercial centrado en el asteroide. Figura 2.2 Sistema de referencia fijo al asteroide. 2.1.3 Transformación entre sistemas Para relacionar las coordenadas de un vector en el sistema inercial 𝑁 con las del sistema no inercial 𝑃 , se utiliza una matriz de rotación. Esta transformación se representa mediante la siguiente matriz C𝑃𝑁 , que rota un ángulo 𝐿𝑆𝑇 alrededor del eje 𝑧: C𝑃𝑁 = cos(𝐿𝑆𝑇)sin(𝐿𝑆𝑇)0 −sin(𝐿𝑆𝑇)cos(𝐿𝑆𝑇)0 0 0 1(2.1) donde 𝐿𝑆𝑇 es el Local Sidereal Time (Tiempo sidéreo local) del meridiano principal del asteroide, medido como el ángulo entre la dirección del 𝑥 del sistema inercial y la intersección del meridiano principal con el plano ecuatorial. Este ángulo permite determinar la orientación instantánea del 2.2 Dinámica orbital 9 Figura 2.3 Elementos orbitales. Créditos: Wikipedia. cuerpo en el espacio y relacionar ambos sistemas mediante: ®𝑟𝑃=C𝑃𝑁 · ®𝑟𝑁(2.2) 2.1.4 Elementos orbitales Dado un sistema de referencia inercial, los elementos orbitales, ampliamente usados en la mecánica orbital, son un conjunto de parámetros que describen la forma, orientación y posición de una órbita alrededor de un cuerpo central. Siguiendo la Figura 2.3, los elementos orbitales son los siguientes: •𝑎: Semieje mayor de la elipse. •𝑒: Excentricidad •𝑖: Inclinación. Ángulo entre el plano orbital y el plano de referencia. •Ω : Ascensión recta del nodo ascendente (RAAN). Ángulo medido en el sentido contrario a las agujas del reloj entre la dirección de referencia y la línea de nodos. •𝜔 : Argumento del periapsis. Ángulo desde el nodo ascendente hasta el periapsis, medido en el plano orbital. •𝜃: Anomalía verdadera. Ángulo desde el periapsis hasta la posición de la sonda en la órbita, medido en el plano orbital. 2.2 Dinámica orbital Una vez presentados los sistemas de referencia, se introduce ahora la dinámica orbital. Esta disciplina estudia el movimiento de objetos bajo la influencia de campos gravitatorios, siendo clave en la planificación de trayectorias espaciales y en la estabilidad de órbitas. En este problema, se considera un sistema simplificado de dos cuerpos: el asteroide y la sonda. El estudio se basa en la aplicación de dos principios fundamentales: la Segunda Ley de Newton y la Ley de Gravitación Universal. 16 Capítulo 3. Introducción a Reinforcement Learning Figura 3.1 Diagrama MDP de estados, acciones y recompensas. Estado Ecuación bajo la política 𝑉 𝑉 𝑉𝜋 𝜋 𝜋( ( (𝑠 𝑠 𝑠) ) ) 𝑆00,3[5+0,99𝑉(𝑆1) ] + 0,7[2+0,99𝑉(𝑆2) ] 12.42 𝑆10,4[7+0,99𝑉(𝑆6) ] + 0,2[2+0,99𝑉(𝑆3) ] + 0,4[3+0,99𝑉(𝑆2) ] 9.77 𝑆20,6[4+0,99𝑉(𝑆3) ] + 0,4[6+0,99𝑉(𝑆5) ] 9.55 𝑆31[8+0,99𝑉(𝑆4) ] 8 𝑆4Terminal 0 𝑆5Terminal 0 𝑆6Terminal 0 Tabla 3.1 Valores 𝑉𝜋(𝑠)para cada estado con factor de descuento 𝛾=0.99.. 𝑄(𝑆0, 𝐴)=𝑟(𝑆0, 𝐴) + 𝛾𝑉 (𝑆1) 𝑄(𝑆0, 𝐵)=𝑟(𝑆0, 𝐵) + 𝛾𝑉 (𝑆2) Por lo tanto, la expresión final se obtiene sustituyendo las funciones 𝑄: 𝑉(𝑆0)=𝜋(𝐴|𝑆0) · [𝑟(𝑆0, 𝐴) + 𝛾𝑉 (𝑆1)] + 𝜋(𝐵|𝑆0) · [𝑟(𝑆0, 𝐵) + 𝛾𝑉 (𝑆2)] Finalmente, al sustituir 𝑉(𝑆1) y 𝑉(𝑆2) por sus respectivas expresiones en términos de 𝑄 , se obtiene: 𝑉(𝑆0)=𝜋(𝐴|𝑆0)· "𝑟(𝑆0, 𝐴) + 𝛾∑︁ 𝑎′ 𝜋(𝑎′|𝑆1)𝑄(𝑆1, 𝑎′)#+𝜋(𝐵|𝑆0) · "𝑟(𝑆0, 𝐵) + 𝛾∑︁ 𝑎′ 𝜋(𝑎′|𝑆2)𝑄(𝑆2, 𝑎′)# Este enfoque muestra cómo el cálculo de la función de valor 𝑉(𝑆0) se construye de forma recursiva, definiendo cada estado en función de los estados futuros accesibles bajo la política. Esta información es vital para que el agente tome decisiones que no solo maximizan la recompensa inmediata, sino también la recompensa acumulada promedio. En la Tabla 3.1 se presentan los valores de 𝑉𝜋(𝑠) para cada estado, donde puede observarse de forma explícita la dependencia entre estados que caracteriza este proceso recursivo 3.4 Soft Actor-Critic 17 Figura 3.2 Neurona artificial. 3.4 Soft Actor-Critic En este trabajo se implementa el algoritmo Soft Actor-Critic (SAC), diseñado para espacios continuos de estados y acciones como los considerados en este caso, órbitas y acciones con impulsos en velocidad. En SAC, un actor selecciona las acciones mientras que un crítico las evalúa mediante funciones 𝑄 . Dicho de otro modo, la política decide qué acción ejecutar, mientras que las funciones 𝑄 determinan su valor. En su entrenamiento, SAC incorpora un término adicional de entropía de la política en la función objetivo, lo que fomenta la exploración y ayuda a mitigar el problema del brittleness (fragilidad), un fenómeno en el que la política converge hacia acciones óptimas pero excesivamente sensibles a pequeñas perturbaciones o errores, lo que puede conducir a fallos catastróficos. SAC es un algoritmo Off-Policy, lo que permite reutilizar experiencias pasadas, reduciendo así el costo de simulación y mejorando la estabilidad al disminuir la correlación entre muestras consecutivas, lo que ayuda a evitar el sesgo en la estimación del gradiente. 3.4.1 Aproximación de funciones mediante redes neuronales Dado que el problema es continuo, presenta alta dimensionalidad y no linealidad, es necesario utilizar aproximadores de funciones capaces de modelar relaciones complejas entre las variables de entrada y salida. En este contexto, se emplean redes neuronales, en particular perceptrones multicapa (MLP), que permiten aproximar funciones no lineales mediante la combinación de múltiples capas de neuronas y funciones de activación adecuadas. Tanto la política 𝜋 del agente como las funciones 𝑄del crítico se parametrizan con redes neuronales. La unidad fundamental de estas redes neuronales es la neurona artificial (Figura 3.2), la cual recibe múltiples entradas ponderadas, 𝑤𝑖𝑥𝑖 , aplica un sesgo, 𝑏𝑖 , y luego una función de activación, 𝑓(𝑧), para generar una salida 𝑎. Matemáticamente, se define como: 𝑧= 𝑛 ∑︁ 𝑖=1 𝑤𝑖𝑥𝑖+𝑏𝑖(3.9) 𝑎=𝑓(𝑧)(3.10) Si bien una sola neurona puede modelar relaciones no lineales gracias a la función de activación, las MLP (Figura 3.3) permiten capturar relaciones más complejas al conectar múltiples capas de 18 Capítulo 3. Introducción a Reinforcement Learning Figura 3.3 Perceptrón multicapa. neuronas, aumentando así el número de parámetros. Estas redes están compuestas por una capa de entrada, una o más capas ocultas y una capa de salida, donde cada neurona aplica una función de activación que introduce no linealidad en el modelo. 3.4.2 Ecuación objetivo de SAC El objetivo en SAC no es solo maximizar la recompensa acumulada promedio, sino también la entropía de la política. Por ello, la función objetivo se reformula de la siguiente manera, omitiendo el factor de descuento 𝛾, tal como es habitual en algunas formulaciones del algoritmo: 𝜋∗=argmax 𝜋 𝑇 ∑︁ 𝑡=0 E(𝑠𝑡,𝑎𝑡)∼𝜋𝑟(𝑠𝑡,𝑎𝑡) − 𝛼log𝜋(𝑎𝑡|𝑠𝑡).(3.11) Mientras que la ecuación de Bellman se reformula así: 𝑄𝜋(𝑠, 𝑎)=𝑟(𝑠, 𝑎) + 𝛾E𝑎′∼𝜋[𝑄𝜋(𝑠′, 𝑎′) − 𝛼log𝜋(𝑎′|𝑠′)](3.12) donde 𝛼 es el coeficiente de temperatura, un hiperparámetro que ajusta la importancia relativa de la entropía en el aprendizaje. El término −log𝜋(𝑎′|𝑠′) mide la aleatoriedad de la política, favoreciendo la exploración cuando su valor es mayor. 3.4.3 Entrenamiento del crítico Para que el agente aprenda de manera efectiva es fundamental optimizar las redes neuronales ajustando sus pesos y sesgos. El crítico se basa en dos funciones 𝑄𝑖 que son aproximadas mediante redes neuronales de parámetros 𝜃𝑖 , teniendo de este modo 𝑄𝜃1 y 𝑄𝜃2 . Se emplean dos funciones 𝑄 para atenuar el sesgo optimista que suele producir un único aproximador cuando se retroalimenta con sus propias predicciones. Al introducir dos redes con diferentes parámetros que estiman el valor de la acción y coger el mínimo de los dos valores, se consigue tener una cota más conservadora y un entrenamiento más estable. Dichas redes se entrenan minimizando la diferencia entre sus valores actuales y un objetivo calculado mediante la ecuación de Bellman modificada: 𝑄aprox,¯ 𝜃(𝑠, 𝑎)=𝑟(𝑠, 𝑎) + 𝛾E𝑎′∼𝜋hm´ ın(𝑄¯ 𝜃1(𝑠′, 𝑎′),𝑄 ¯ 𝜃2(𝑠′, 𝑎′)) − 𝛼log𝜋(𝑎′|𝑠′)i(3.13) 3.4 Soft Actor-Critic 19 De esta forma, la función de pérdida para cada red 𝑄𝜃𝑖es la siguiente: 𝐽𝑄𝑖(𝜃𝑖)=1 2E(𝑠,𝑎) ∼ 𝐷h𝑄𝜃𝑖(𝑠,𝑎) − 𝑄aprox,¯ 𝜃𝑖(𝑠,𝑎)2i.(3.14) donde 𝐷 es un buffer que contiene transiciones de experiencias anteriores (𝑠,𝑎,𝑟,𝑠′,𝜓) siendo 𝜓∈ {0,1} el indicador de episodio terminal, que adopta el valor 1 cuando la transición conduce a un estado terminal 𝑠′, formalmente definido en secciones posteriores, y 0 en cualquier otro caso. La optimización de las 𝑄𝜃𝑖 puede volverse inestable si los valores objetivo cambian demasiado rápido. Por ello, es necesario emplear redes objetivo, 𝑄¯ 𝜃𝑖 , que se actualizan suavemente a partir de las redes 𝑄𝜃𝑖 principales, de lo contrario, se podría generar acumulación de errores. Se usa una actualización ponderada controlada por el parámetro 𝜏: ¯ 𝜃←𝜏𝜃 + (1−𝜏)¯ 𝜃(3.15) Esta actualización gradual evita cambios bruscos y mejora la estabilidad del entrenamiento. 3.4.4 Optimización de política La optimización de la política es fundamental para garantizar que, tras el entrenamiento, el agente tome decisiones acertadas que permitan la supervivencia de la sonda en órbita. Para ello, la política 𝜋𝜙 debe equilibrar explotación y exploración durante el entrenamiento. Este equilibrio se refleja en la función de pérdida de la política: 𝐽𝜋(𝜙)=E𝑠∼𝐷hE𝑎∼𝜋𝜙𝛼log𝜋𝜙(𝑎|𝑠) − 𝑄𝜃(𝑠, 𝑎)i(3.16) En ella se puede observar dos términos: el asociado a la entropía y el asociado al valor de la función 𝑄 . El objetivo con el que se emplea esta función es conseguir una política que seleccione acciones con un valor de 𝑄 elevado explotando lo aprendido y, al mismo tiempo, conserve cierto grado de entropía que le permita seguir explorando soluciones alternativas y no quedar atrapada en soluciones subóptimas. 3.4.5 Optimización de coeficiente de temperatura El parámetro 𝛼 controla la importancia del término de entropía en la función objetivo de la política. En lugar de fijarlo a un valor constante, SAC permite ajustarlo dinámicamente durante el entrenamiento para garantizar que el agente mantenga un nivel óptimo de exploración. Este ajuste se realiza minimizando la siguiente función de pérdida: 𝐽(𝛼)=E𝑠∼𝐷,𝑎∼𝜋[−𝛼(log𝜋(𝑎|𝑠) +H0)] (3.17) donde H0 es un nivel de entropía objetivo predefinido (target entropy). Este mecanismo permite que, al inicio del entrenamiento, 𝛼 sea relativamente alto, fomentando la exploración, y que se reduzca progresivamente a medida que el agente aprende, permitiendo una política más determinista en las etapas finales. 3.4.6 Entrenamiento completo SAC El entrenamiento en algoritmos de aprendizaje por refuerzo (RL) comienza con una fase inicial de exploración, en la que se generan acciones aleatorias para llenar el buffer de transiciones. Este paso es fundamental, ya que dota al agente de una variedad suficiente de experiencias sobre diferentes estados, acciones y recompensas, lo cual reduce la probabilidad de converger a soluciones subóptimas. Si el buffer inicial contiene experiencias sesgadas o poco diversas, el agente puede aprender comportamientos no deseados. Por ello, es esencial recopilar una cantidad representativa 20 Capítulo 3. Introducción a Reinforcement Learning de datos que cubran una amplia gama de situaciones antes de iniciar el entrenamiento de las redes. Una vez completado este llenado inicial, el agente comienza el entrenamiento, actualizando las redes neuronales mediante las funciones de pérdida discutidas previamente. Este proceso se basa en muestrear transiciones almacenadas del buffer. Finalmente, es necesario evaluar el desempeño del agente entrenado mediante una etapa de validación o test. Para ello, se utiliza un conjunto separado de condiciones iniciales generadas aleatoriamente y nunca vistas durante el entrenamiento, asegurando que el agente no haya memorizado estados particulares reduciendo el sesgo del rendimiento. A continuación se presenta el algoritmo SAC: Algorithm 1 Entrenamiento del agente con SAC 1: Inicializar el entorno y el replay buffer 2: Inicializar redes 𝑄𝜃1,𝑄𝜃2, sus objetivos 𝑄¯ 𝜃1,𝑄 ¯ 𝜃2y la política 𝜋𝜙 3: Inicializar los optimizadores de todas las redes y el parámetro de entropía 𝛼 4: Fase de exploración: 5: while número de transiciones < 𝑁exploración do 6: Realizar acciones aleatorias, almacenar transiciones (𝑠, 𝑎,𝑟, 𝑠′, 𝜓)en el buffer 7: end while 8: Fase de entrenamiento: 9: for cada episodio do 10: Resetear el entorno, obtener el estado inicial 𝑠0 11: for cada paso do 12: Seleccionar acción 𝑎𝑡∼𝜋𝜙(𝑠𝑡) 13: Ejecutar 𝑎𝑡, recibir 𝑟𝑡,𝑠𝑡+1y𝜓 14: Almacenar (𝑠𝑡, 𝑎𝑡,𝑟𝑡, 𝑠𝑡+1,𝜓)en el buffer 15: Muestrear un mini-batch del buffer y optimizar: redes 𝑄𝜃𝑖 , policy 𝜋𝜙 y coeficiente de temperatura 𝛼. 16: Actualizar redes objetivo 𝑄¯ 𝜃𝑖 17: if done then 18: break 19: end if 20: end for 21: end for 3.5 Conceptos de optimización Enestasección se exponenlos fundamentos matemáticosdelproblemadeoptimizaciónquese plantea al entrenar las redes neuronales. Aunque se exponen los conceptos matemáticos fundamentales, es importante destacar que frameworks modernos de aprendizaje automático como PyTorch o TensorFlow implementan internamente estos algoritmos. Primero se detalla la formulación del back-propagation, clave para ajustar los parámetros de las redes; a continuación se presenta un método elemental para buscar los mínimos de una función y por último, se describe el optimizador empleado en este trabajo. 3.5.1 Backpropagation En el entrenamiento de redes neuronales es necesario calcular los gradientes de las pérdidas, esto es, las derivadas de la función de pérdida respecto a los pesos y los sesgos. Una vez calculados, cualquier optimizador como SGD oADAM los utilizará para actualizar los parámetros. La función de pérdida es una composición profunda de operaciones: las salidas de cada neurona se propagan a la siguiente, de modo que los parámetros quedan entrelazados y no existe una expresión cerrada 3.5 Conceptos de optimización 21 Figura 3.4 Peso que conecta neurona 2 de la capa 3 con neurona 4 de la capa anterior. sencilla para el gradiente ∇𝜃𝐽(𝜃) . Para obtenerlo de manera eficiente se aplica el algoritmo de back-propagation [10], que propaga los errores hacia atrás usando la regla de la cadena. Sea 𝑤𝑙 𝑗𝑘 el peso que conecta la neurona 𝑘 de la capa 𝑙−1 con la neurona 𝑗 de la capa 𝑙 , representado en la Figura 3.4 para mayor claridad, aplicando la regla de la cadena se obtiene: 𝜕𝐽 𝜕𝑤𝑙 𝑗𝑘 =𝜕𝐽 𝜕𝑧𝑙 𝑗 𝜕𝑧𝑙 𝑗 𝜕𝑤𝑙 𝑗𝑘 (3.18) Definiendo el error de la neurona como 𝛿𝑙 𝑗=𝜕𝐽/𝜕𝑧𝑙 𝑗 y recordando que la suma ponderada de una neurona es la siguiente: 𝑧𝑙 𝑗=∑︁ 𝑘 𝑤𝑙 𝑗𝑘𝑎𝑙−1 𝑘+𝑏𝑙 𝑗(3.19) donde 𝑎𝑙−1 𝑘son las salidas de la capa anterior, la Ecuación 3.18 se puede reescribir como: 𝜕𝐽 𝜕𝑤𝑙 𝑗𝑘 =𝛿𝑙 𝑗𝑎𝑙−1 𝑘(3.20) Análogamente para el sesgo, teniendo en cuenta que es un término independiente en cada neurona, resulta: 𝜕𝐽 𝜕𝑏𝑙 𝑗 =𝜕𝐽 𝜕𝑧𝑙 𝑗 𝜕𝑧𝑙 𝑗 𝜕𝑏𝑙 𝑗 =𝛿𝑙 𝑗·1=𝛿𝑙 𝑗(3.21) Por tanto, una vez establecida esta relación, únicamente queda definir el error de las neuronas en cada capa para poder calcular las derivadas deseadas. Se comienza por calcular el error 𝛿𝐿 𝑗 en la capa de salida 𝐿: 𝛿𝐿 𝑗=𝜕𝐽 𝜕𝑎𝐿 𝑗 𝜕𝑎𝐿 𝑗 𝜕𝑧𝐿 𝑗 (3.22) La primera derivada indica cómo cambia la función de pérdida cuando cambia la activación 𝑎𝐿 𝑗 ; 22 Capítulo 3. Introducción a Reinforcement Learning la segunda corresponde directamente a la derivada de la función de activación aplicada. Como ejemplo, adoptando como función de pérdida el error cuadrático medio: 𝐽=1 2∑︁ 𝑗𝑎𝐿 𝑗−𝑦𝑗2,𝜕𝐽 𝜕𝑎𝐿 𝑗 =𝑎𝐿 𝑗−𝑦𝑗(3.23) y empleando como ejemplo la función de activación sigmoide: 𝜎(𝑧)=1 1+𝑒−𝑧, 𝜎′(𝑧)=𝜎(𝑧)1−𝜎(𝑧)(3.24) Entonces el error de la capa de salida se puede expresar como: 𝛿𝐿 𝑗=𝜕𝐽 𝜕𝑎𝐿 𝑗 𝜕𝑎𝐿 𝑗 𝜕𝑧𝐿 𝑗 =𝑎𝐿 𝑗−𝑦𝑗𝜎′𝑧𝐿 𝑗(3.25) Una vez definido los errores de la última capa, se vuelve a usar la regla de la cadena para propagar hasta la capa inicial. El error de una neurona 𝑘de la capa 𝑙se puede expresar en función del error de las neuronas 𝑗en la capa siguiente 𝑙+1: 𝛿𝑙 𝑘=𝜕𝐽 𝜕𝑧𝑙 𝑘 =∑︁ 𝑗 𝜕𝐽 𝜕𝑧𝑙+1 𝑗 𝜕𝑧𝑙+1 𝑗 𝜕𝑧𝑙 𝑘 =∑︁ 𝑗 𝛿𝑙+1 𝑗 𝜕𝑧𝑙+1 𝑗 𝜕𝑧𝑙 𝑘 (3.26) Para evaluar dicha derivada, basta notar que: 𝑧𝑙+1 𝑗=∑︁ 𝑘 𝑤𝑙+1 𝑗𝑘 𝑎𝑙 𝑘+𝑏𝑙+1 𝑗=∑︁ 𝑘 𝑤𝑙+1 𝑗𝑘 𝜎(𝑧𝑙 𝑘) + 𝑏𝑙+1 𝑗(3.27) donde se aprecia que la única dependencia con 𝑧𝑙 𝑘 es la función de activación, de modo que el término de derivada anterior se puede escribir como: 𝜕𝑧𝑙+1 𝑗 𝜕𝑧𝑙 𝑘 =𝑤𝑙+1 𝑗𝑘 𝜎′𝑧𝑙 𝑘(3.28) Finalmente, sustituyendo estas expresiones en la Ecuación 3.26, se obtiene: 𝛿𝑙 𝑘=𝜎′𝑧𝑙 𝑘∑︁ 𝑗 𝑤𝑙+1 𝑗𝑘 𝛿𝑙+1 𝑗(3.29) En síntesis, estas expresiones permiten calcular los gradientes de todos los pesos y sesgos de la red aplicando la regla de la cadena de forma recursiva desde la capa de salida 𝐿hasta la inicial. 3.5.2 Descenso del gradiente Una vez determinados los gradientes para todos los pesos y sesgos, se debe emplear un algoritmo de optimización que utilice dichos gradientes para actualizar los parámetros. Al igual que en una función de una sola variable se anula la derivada 𝑓′(𝑥) para localizar máximos o mínimos, en dos variables se anulan las derivadas parciales de la función 𝑓(𝑥,𝑦). Reunidas, forman el gradiente: ∇𝑓(𝑥,𝑦)=©« 𝜕 𝑓 𝜕𝑥 𝜕 𝑓 𝜕𝑦 ª®®¬ (3.30) 3.5 Conceptos de optimización 23 Figura 3.5 Superficie 𝑧=𝑓(𝑥,𝑦)(función peaks) y proyección del vector −∇ 𝑓(𝑥1,𝑦1)sobre ella . Esta definición matemática es fundamental puesto que el vector resultante indica la dirección de máximo crecimiento local de la función, mientras que su opuesto, −∇ 𝑓(𝑥,𝑦) , señala la dirección de máximo descenso. Para ilustrarlo de forma visual, considérese la función peaks de Matlab. En la Figura 3.5 se representa dicha superficie y, sobre un punto inicial (𝑥1,𝑦1) , se dibuja el vector −∇ 𝑓(𝑥1,𝑦1) proyectado sobre la misma. Puede apreciarse cómo ese vector apunta directamente hacia un mínimo local de la función. A partir de esta propiedad, el método de descenso del gradiente consiste en actualizar los valores de las variables mediante la siguiente regla iterativa: (𝑥𝑘+1, 𝑦𝑘+1)=(𝑥𝑘, 𝑦𝑘) −𝜂∇𝑓(𝑥𝑘, 𝑦𝑘)(3.31) donde 𝜂 es el learning rate (LR), un parámetro que regula la magnitud del desplazamiento que se realiza en cada iteración. Si el LR es demasiado grande puede sobrepasar el mínimo y volverse inestable. Por el contrario, un LR muy pequeño mejora la estabilidad pero también ralentiza la convergencia y puede dificultar la exploración del espacio de parámetros, lo que favorece la convergencia a mínimos locales cercanos al punto inicial. En definitiva, bajo ciertas condiciones, como continuidad y derivabilidad de la función, así como un LR adecuado, la secuencia generada converge a un punto donde el gradiente se anula. Aunque se utiliza un caso bidimensional por motivos visuales, este razonamiento es extensible al caso general de 𝑛 variables, donde el gradiente tiene 𝑛 componentes y apunta en la dirección de mayor incremento de la función en el espacio R𝑛 . 3.5.3 Optimizador ADAM El descenso del gradiente ofrece una base teórica clara, pero en el entrenamiento práctico de redes neuronales presenta varias limitaciones: • Costo por iteración. En el entrenamiento de redes, calcular la pérdida media sobre el conjunto de 𝑁 datos de entrenamiento ∇𝜃𝐽(𝜃)=1 𝑁Í𝑁 𝑖=1∇𝜃ℓ𝑖 exige un coste de O(𝑁) siendo 𝑁 el tamaño del buffer completo. Para 𝑁grande, este cálculo es prohibitivo. • Gradiente ruidoso. En la práctica se recurre al mini-batch Stochastic Gradient Descent (MB-SGD). Se calcula el gradiente con un lote reducido B𝑡 de tamaño 𝐵≪𝑁 , dando lugar al gradiente 𝑔𝑡=1 𝐵Í𝑗∈B𝑡∇𝜃ℓ𝑗 , que es sólo un estimador del gradiente verdadero. Al variar B𝑡 24 Capítulo 3. Introducción a Reinforcement Learning Figura 3.6 Comparación SGD sin momento vs con momento. Fuente:[9]. en cada iteración, 𝑔𝑡 fluctúa y añade ruido, provocando oscilaciones e inestabilidad numérica, tal como se aprecia en la Figura 3.6 para el caso de SGD sin momento. • Escala desigual entre parámetros. La magnitud de los componentes de 𝑔𝑡 pueden diferir varios órdenes, por lo que un único learning rate produce pasos excesivos en unas coordenadas e insignificantes en otras. El optimizador Adam (Adaptive Moment Estimation) [ 4 ] aborda simultáneamente los problemas anteriores mediante: • Promedio exponencial del gradiente (Primer momento). Se emplea un promedio exponencial del gradiente que, al incorporar parte de su valor anterior, actúa como un filtro de inercia: reduce la varianza del mini-batch, amortigua las oscilaciones y refuerza las direcciones coherentes de descenso, todo ello sin añadir coste computacional adicional excesivo respecto al cálculo del gradiente del mini-batch. Esta primera técnica se representa en la siguiente ecuación: 𝑚𝑡=𝛽1𝑚𝑡−1+ (1−𝛽1)𝑔𝑡(3.32) con valor típico 𝛽1=0.9. En la Figura 3.6 se aprecia que el uso del momento reduce las oscilaciones y acelera la convergencia, al permitir pasos más largos y estables en la dirección de descenso predominante. •Promedio exponencial del cuadrado del gradiente (Segundo momento). Se calcula el vector 𝑣𝑡 como un promedio exponencial del cuadrado del gradiente. Con ello, posteriormente se consigue reescalar cada componente para que todos los parámetros avancen con un LR efectivo comparable. Esta técnica reduce el impacto de la escala desigual en los diferentes parámetros. Se representa en la siguiente ecuación: 𝑣𝑡=𝛽2𝑣𝑡−1+ (1−𝛽2)𝑔2 𝑡(3.33) con valor típico 𝛽2=0.999. • Actualización adaptativa. Finalmente, cada parámetro se actualiza mediante las siguientes ecuaciones: ˆ𝑚𝑡=𝑚𝑡 1−𝛽𝑡 1 ,ˆ𝑣𝑡=𝑣𝑡 1−𝛽𝑡 2 (3.34) 𝜃𝑡+1=𝜃𝑡−𝛼ˆ𝑚𝑡 √︁ˆ𝑣𝑡+𝜀(3.35) Debido a que los valores iniciales 𝑚0 y 𝑣0 son nulos, durante las primeras iteraciones ambos promedios subestiman la media real del gradiente y de su cuadrado. Por ello se aplica la corrección de sesgo (Ecuación 3.34), obteniéndose ˆ𝑚𝑡 y ˆ𝑣𝑡 . Con 𝛼=10−3 y 𝜖=10−8 como valores típicos, la Ecuación 3.35 actualiza los parámetros: el momento corregido ˆ𝑚𝑡 se divide por √︁ˆ𝑣𝑡+𝜖 . Así se combinan la inercia del primer momento con el escalado adaptativo 3.5 Conceptos de optimización 25 que brinda el segundo, mientras 𝜖 garantiza estabilidad numérica incluso cuando ˆ𝑣𝑡 es muy pequeño. En síntesis, Adam combina estabilidad, velocidad de convergencia y adaptación por parámetro, lo que lo convierte en la elección idónea para el entrenamiento de las redes empleadas en este trabajo. 32 Capítulo 4. Orbitado seguro con SAC en 2D 0 1000 2000 3000 4000 5000 Episodios 5000 10000 15000 20000 25000 30000 35000 Duración por episodio (s) Figura 4.5 Duración de los episodios en problema 2D con una masa puntual. 0 1000 2000 3000 4000 5000 Episodios 15 10 5 0 5 10 15 20 25 Retorno acumulado Figura 4.6 Retorno acumulado por episodio en problema 2D con una masa puntual. episodios tienden a alargarse, lo cual indica que el agente evita eventos terminales, y el retorno crece rápidamente, señal de que la política aprende a que la sonda sobreviva durante la duración del episodio. Con la política ya entrenada, se realiza una fase de validación para evaluar su comportamiento ante nuevas condiciones iniciales no vistas durante el entrenamiento. Para ello, se genera un conjunto de 500 estados iniciales aleatorios y se comparan los resultados de dos experimentos: ejecutando acciones aleatorias, y ejecutando acciones seleccionadas por la política. La Figura 4.7 y la Figura 4.8 muestran la estadística de eventos y las trayectorias correspondientes al test con acciones aleatorias. A continuación, se evalúa el mismo conjunto de condiciones iniciales pero aplicando la política aprendida. Los resultados se muestran en la Figura 4.9. En este caso, todos los episodios finalizan por truncamiento, lo que indica que el agente ha aprendido a evitar eventos terminales y además, las trayectorias se concentran en una región segura, logrando así órbitas 4.2 Curriculum Learning 33 Figura 4.7 Estadística del test con acciones aleatorias en problema 2D con una masa puntual. 60 40 20 0 20 40 60 X [km] 60 40 20 0 20 40 60 Y [km] Eros Trayectorias generadas con acciones aleatorias Colisión Escape Truncado Figura 4.8 Trayectorias del test con acciones aleatorias en problema 2D con una masa puntual. estables. Esto indica que la política ha desarrollado un comportamiento efectivo. Estos resultados confirman que el agente ha logrado aprender una estrategia de control eficaz para mantener órbitas alrededor del asteroide, incluso ante condiciones no experimentadas previamente. 34 Capítulo 4. Orbitado seguro con SAC en 2D 60 40 20 0 20 40 60 X [km] 60 40 20 0 20 40 60 Y [km] Eros Trayectorias con Policy entrenada Colisión Escape Truncado Figura 4.9 Trayectorias del test con la política entrenada en problema 2D con una masa puntual. 4.2.2 Problema con dos masas puntuales en 2D En este segundo escenario, el entorno gravitatorio se modela mediante dos masas puntuales, cuyos parámetros gravitacionales son respectivamente el 60% y 40% del total del asteroide Eros 433. Estas masas se sitúan sobre el eje x del sistema de referencia, a distancias de 8km y −12km del centro de masas, respectivamente. Tanto la condición de reinicio del entorno como la función de recompensa permanecen sin modificaciones respecto al caso anterior. Sin embargo, la condición de colisión se modifica puesto que en este escenario y en los siguientes, 𝑓(𝑥,𝑦)=0 representa la elipse de semieje mayor igual a 16 km y semieje menor igual a 8.5 km, con el propósito de aproximar la geometría alargada del asteroide. Conviene señalar que en este y en los siguientes escenarios, el análisis se realiza en el plano 𝑧𝑥, por lo que no se considera la rotación del asteroide en esta fase. Resultados del entrenamiento El proceso de entrenamiento comienza igual que el anterior, con una fase de exploración aleatoria. En la Figura 4.10 se presenta la distribución de los eventos obtenidos durante el llenado inicial del buffer, compuesto también por 10.000 pasos de simulación, que en este caso suponen 334 episodios. Una vez completado el llenado inicial, se procede el entrenamiento, pero a diferencia del caso anterior, los pesos y sesgos de las redes neuronales se inicializan importando los del caso anterior. Dado que se trata de un caso más complejo, las redes se entrenan durante diez mil episodios y se adjuntan algunas gráficas representativas. En la Figura 4.11 se muestra la función de pérdida de las funciones 𝑄 por episodio, donde puede observarse la convergencia del algoritmo debido a la disminución asintótica de la misma conforme avanza el entrenamiento. Por su parte, la Figura 4.12 presenta la evolución de la pérdida de la política, la cual alcanza un valor estable, lo que indica que se ha logrado un equilibrio entre las estimaciones de las funciones 𝑄 y la entropía del sistema. La Figura 4.13 ilustra la evolución del coeficiente de temperatura, 4.2 Curriculum Learning 35 Figura 4.10 Estadística del buffer inicial en problema 2D con dos masas puntuales. 0 2000 4000 6000 8000 10000 Episodios 10 4 10 3 10 2 10 1 100 101 Q Loss Figura 4.11 Función de pérdida de redes 𝑄en problema 2D con dos masas puntuales. parámetro que regula el equilibrio entre exploración y explotación en la selección de acciones. Al inicio, dicho coeficiente adopta valores altos para fomentar la exploración del espacio de estados, y posteriormente disminuye progresivamente, lo que permite que la política se vuelva más determinista a medida que converge hacia una solución. Por último, en la Figura 4.14 y Figura 4.15 se presenta el tiempo por episodio y la recompensa acumulada, las cuales, como el caso anterior, tienden a maximizarse. Con la política ya entrenada, se lleva a cabo la fase de validación. Para ello, se genera un conjunto de 500 estados iniciales aleatorios y se comparan los resultados obtenidos en dos situaciones: en ausencia de control (sin aplicar ninguna acción), y utilizando la política entrenada para seleccionar las acciones. La Figura 4.16 y la Figura 4.17 muestran la estadística de eventos y las trayectorias correspondientes al test en total ausencia de control. A continuación, se evalúa el mismo conjunto de condiciones iniciales aplicando la política aprendida. El agente muestra buen comportamiento ante el aumento de dificultad en el entorno, 36 Capítulo 4. Orbitado seguro con SAC en 2D 0 2000 4000 6000 8000 10000 Episodios 65 60 55 50 45 40 35 30 Policy Loss Figura 4.12 Función de pérdida de la política en problema 2D con dos masas puntuales. 0 2000 4000 6000 8000 10000 Episodios 10 1 100 Alfa Figura 4.13 Coeficiente de temperatura en problema 2D con dos masas puntuales. asegurando la supervivencia de la sonda con un 100% de episodios truncados, encontrando órbitas estables. De este modo, se confirma que se ha logrado aprender una estrategia eficaz para sobrevivir reduciéndose la probabilidad de colisión de 31.4% a0% en el test-set. 4.2.3 Problema con cuatro masas puntuales en 2D En este tercer escenario, el entorno gravitatorio se modela mediante cuatro masas puntuales, dos de ellas en el eje 𝑥 dispuestas a 10.5 km y -13.5 km del centro de masas, cuyos parámetros gravitacionales son el 45% y 35% del total de Eros 433, respectivamente. Se introduce en este escenario dos masas puntuales en el eje 𝑦 , cuyos parámetros son igual al 10% del total del mismo asteroide, y se encuentran a 6 km y -6 km del centro de masas respectivamente. 4.2 Curriculum Learning 37 0 2000 4000 6000 8000 10000 Episodios 5000 10000 15000 20000 25000 30000 35000 Duración por episodio (s) Figura 4.14 Duración de los episodios en problema 2D con dos masas puntuales. 0 2000 4000 6000 8000 10000 Episodios 20 10 0 10 20 Retorno acumulado Figura 4.15 Retorno acumulado por episodio en problema 2D con una masa puntual. Resultados del entrenamiento Al igual que en los casos anteriores, se importan los parámetros de las redes del caso anterior, se llena el buffer de transiciones aleatorias y se entrena durante cinco mil episodios. Una vez entrenado, se procede a testear la política con 500 episodios. La Figura 4.19 y Figura 4.20 recogen los resultados en ausencia de control, donde se observa un 45.7% de colisiones, mientras que al implementar las decisiones del agente, reducimos las colisiones al 0%. La Figura 4.21 confirma el éxito del agente encontrando órbitas estables y asegurando la supervivencia de la sonda en el test-set de varias masas en los dos ejes. 38 Capítulo 4. Orbitado seguro con SAC en 2D Figura 4.16 Estadística del test en ausencia de control en problema 2D con dos masas puntuales. 60 40 20 0 20 40 60 X [km] 60 40 20 0 20 40 60 Y [km] Eros Trayectorias aleatorias Colisión Escape Truncado Figura 4.17 Trayectorias del test en ausencia de control en problema 2D con dos masas puntuales. 4.2.4 Problema con modelo mascon en 2D En este último escenario, el entorno gravitatorio se modela mediante una distribución de 101 mascon representando el campo gravitatorio de Eros 433 de un modo más preciso. 4.2 Curriculum Learning 39 60 40 20 0 20 40 60 X [km] 60 40 20 0 20 40 60 Y [km] Eros Trayectorias con Policy entrenada Colisión Escape Truncado Figura 4.18 Trayectorias del test con política en problema 2D con dos masas puntuales. Figura 4.19 Estadística del test en ausencia de control en problema 2D con cuatro masas puntuales. Resultados del entrenamiento Siguiendo el proceso anterior, y tras completar el entrenamiento, en la Figura 4.22 y la Figura 4.23 se observa la facilidad que tiene el agente para aprender en este último escenario debido al método curriculum learning con el que se ha procedido, lo que permite al agente empezar el entrenamiento con cierta ventaja debido al mapeado que ya tiene de la dinámica del entorno. Se presenta también la media de las acciones por episodio, en la que se refleja el comportamiento 40 Capítulo 4. Orbitado seguro con SAC en 2D 60 40 20 0 20 40 60 X [km] 60 40 20 0 20 40 60 Y [km] Eros Trayectorias en ausencia de control Colisión Escape Truncado Figura 4.20 Trayectorias del test en ausencia de control en problema 2D con cuatro masas puntuales. 60 40 20 0 20 40 60 X [km] 60 40 20 0 20 40 60 Y [km] Eros Trayectorias con Policy entrenada Colisión Escape Truncado Figura 4.21 Trayectorias del test con política en problema 2D con cuatro masas puntuales. 4.2 Curriculum Learning 41 0 2000 4000 6000 8000 10000 Episodios 34500 35000 35500 36000 36500 37000 37500 Duración por episodio (s) Figura 4.22 Duración de los episodios en problema mascon 2D. 0 2000 4000 6000 8000 10000 Episodios 16 18 20 22 24 26 Retorno acumulado Figura 4.23 Retorno acumulado por episodio en problema mascon 2D. esperado, mayores acciones al principio y una tendencia decreciente de las mismas conforme avanza el entrenamiento. Con esto se confirma la efectividad de la penalización por acciones en la recompensa, que conduce al agente a minimizar el combustible usado en cada decisión. Por último, se testea la efectividad del agente para 500 episodios aleatorios. La Figura 4.25 y la Figura 4.26 recogen los resultados de orbitar sin tomar el control de la sonda, que se traduce en un 25.4% de colisiones Tras implementar al agente en la toma de decisiones, se consigue reducir el porcentaje de colisiones a 0% en el test-set y mantener a la sonda en órbitas estables. 48 Capítulo 5. Orbitado seguro con SAC en 3D 0 2000 4000 6000 8000 10000 12000 14000 Episodios 5000 10000 15000 20000 25000 30000 35000 Duración por episodio (s) Figura 5.3 Duración de los episodios en problema 3D con una masa puntual. 5.2.1 Problema con masa puntual en 3D Extrapolando los escenarios anteriores a esta ampliación, en este primer escenario, se le presenta al agente una masa puntual en tres dimensiones con el mismo parámetro gravitacional que el asteroide Eros 433. En este escenario, la función 𝑓(𝑥,𝑦,𝑧)=0 de colisión representa una esfera de radio igual a 16 km. Resultados del entrenamiento Siguiendo el mismo procedimiento que en fases anteriores, se llena el buffer inicial con transiciones aleatorias. Tras quince mil episodios de entrenamiento, se analiza la evolución de la duración de los episodios (Figura 5.3), la recompensa acumulada por episodio (Figura 5.4) y la acción media aplicada (Figura 5.5). Se observa una reducción efectiva de las acciones, aunque se evidencian diferencias notables en la evolución de la duración de los episodios y de la recompensa acumulada respecto al caso bidimensional. Si bien se mantiene una tendencia general positiva, el comportamiento no resulta tan estable ni preciso como en las fases anteriores. Esta diferencia se atribuye a la ampliación del espacio de estados y acciones, así como a la incorporación de la rotación del asteroide, lo que incrementa la complejidad del problema y dificulta garantizar la seguridad en todos los posibles escenarios. Tras el entrenamiento, se pone a prueba al agente con tres sets de 500 episodios con semillas diferentes. La Figura 5.6 recoge los resultados de los test, mientras que la Figura 5.7 y la Figura 5.8 presentan las trayectorias en el primer set de test, en ausencia de control y con la implantación de la política. Se observa que el agente no logra igualar el rendimiento obtenido mediante la dinámica natural del sistema. Dado el incremento en la complejidad del entorno y el buen comportamiento que, por sí solo, presenta la evolución sin control frente a una masa puntual, este resultado es coherente. No obstante, también se confirma que el agente ha aprendido una política efectiva, ya que un agente no entrenado presentaría un comportamiento significativamente inferior, como se muestra en la Figura 5.9. Asimismo, en la Figura 5.10 se muestran los resultados de las trayectorias tanto en ausencia de control como bajo el guiado del agente, representados en función de la excentricidad e inclinación inicial correspondientes al reset en cada episodio. 5.2 Curriculum Learning 49 0 2000 4000 6000 8000 10000 12000 14000 Episodios 10 5 0 5 10 15 20 25 Retorno acumulado Figura 5.4 Retorno acumulado por episodio en problema 3D con una masa puntual. 0 2000 4000 6000 8000 10000 12000 14000 Episodes 0.2 0.3 0.4 0.5 0.6 Acción media por episodio (m/s) Figura 5.5 Acción media por episodio en problema 3D con una masa puntual. 5.2.2 Problema con dos masas puntuales en 3D En este nuevo escenario se consideran dos masas puntuales cuyos parámetros gravitacionales corresponden, respectivamente, al 60% y al 40% del valor total de Eros 433. Estas se redistribuyen de modo que el centro de masas se sitúa en el origen del sistema de referencia: la masa asociada al 60% se ubica a 8 km y la del 40% a -12 km, ambas en el eje 𝑥 . La condición de colisión se redefine puesto que en este escenario, así como en los siguientes, 𝑓(𝑥,𝑦,𝑧)=0 representa un elipsoide de semieje mayor de 16 km y semiejes intermedio y menor de 8.5 km. Resultados del entrenamiento Tras importar los parámetros de las redes del caso anterior, llenar el buffer inicial y entrenar al agente durante quince mil episodios, se presentan a continuación algunas gráficas de interés. La 50 Capítulo 5. Orbitado seguro con SAC en 3D Figura 5.6 Comparativa en problema 3D con masa puntual: ausencia de control vs política. 40 30 20 10 010 20 30 40 X [km] 40 30 20 10 0 10 20 30 40 Y [km] 40 30 20 10 0 10 20 30 40 Z [km] Trayectorias en ausencia de control truncadas Figura 5.7 Trayectorias en ausencia de control en primer set del problema 3D con una masa puntual. Figura 5.11 muestra la evolución de la función pérdida del crítico 𝑄 , donde se observa una caída de dos órdenes de magnitud durante los primeros quinientos episodios, seguido de una convergencia en torno a 0.1, lo que indica un comportamiento estable en la aproximación de la ecuación de Bellman. Por su parte, la Figura 5.12 muestra cómo la función de pérdida de la política alcanza una zona estable, destacando que el incremento final no implica un comportamiento anómalo. En la Figura 5.13 se aprecia una deriva suave del coeficiente de temperatura, lo que introduce cierto grado de entropía en las acciones. Esto impulsa al agente a explorar acciones menos frecuentes, incluso con valores de 𝑄 menores, lo que provoca un aumento en la función de pérdida de la política. Este efecto se va amortiguando hasta que alrededor del episodio 14000 se da un pico donde la entropía supera el target entropy, lo que da lugar a una disminución del coeficiente de temperatura, así como de la función de pérdida de la política y de la 𝑄. Se testea la eficiencia del agente de igual modo con tres sets de 500 episodios. La Figura 5.14 muestra los resultados de los test, mientras que las Figuras 5.15 y 5.16 ilustran, respectivamente, las trayectorias en ausencia de control y con la política aplicada en el tercer conjunto de pruebas. En este segundo escenario, sí se consigue mejorar los resultados ante la dinámica natural, 5.2 Curriculum Learning 51 40 30 20 10 010 20 30 40 X [km] 40 30 20 10 0 10 20 30 40 Y [km] 40 30 20 10 0 10 20 30 40 Z [km] Trayectorias acabadas en colisión con política entrenada (a) Colisión. 40 30 20 10 010 20 30 40 X [km] 40 30 20 10 0 10 20 30 40 Y [km] 40 30 20 10 0 10 20 30 40 Z [km] Trayectorias acabadas en escape con política entrenada (b) Escape. 40 30 20 10 010 20 30 40 X [km] 40 30 20 10 0 10 20 30 40 Y [km] 40 30 20 10 0 10 20 30 40 Z [km] Trayectorias truncadas con política entrenada (c) Truncado. Figura 5.8 Trayectorias con política entrenada en primer set del problema 3D con una masa puntual. reduciéndose el porcentaje de colisiones de un 11.93% de media en los tres sets, a un 2.27% . Sin embargo, aunque en el cómputo general se hayan mejorado los resultados, se ha producido un aumento de los escapes, del 0% al 4.3% . Resulta de especial interés analizar si el agente es capaz de corregir aquellos episodios que, bajo la dinámica naural, terminaban en colisión. En la Figura 5.17 se observa que, de todas las trayectorias que inicialmente colisionaban sin control, solo una no logra ser corregida por el agente. Esta corresponde a una órbita con excentricidad inicial de 0.085 e inclinación inicial 15◦ aproximadamente. Además, destaca la región de inclinaciones comprendida entre 130◦ y 180◦ , donde se producen 29 colisiones ( 50% ) en ausencia de control, mientras que al agente solo fracasa en 2 episodios. 5.2.3 Problema con cuatro masas puntuales en 3D En este tercer escenario, el entorno gravitatorio se modela mediante cuatro masas puntuales. Dos de ellas se sitúan sobre el eje 𝑥 , a 10.5 km y −13.5 km del origen, con parámetros gravitacionales 52 Capítulo 5. Orbitado seguro con SAC en 3D Figura 5.9 Resultados con política no entrenada en primer set del problema 3D con una masa puntual. equivalentes al 45% y 35% del valor total de Eros 433, respectivamente. Las otras dos masas se introducen sobre el eje 𝑦 , ambas con un 10% del parámetro gravitacional de Eros, ubicadas simétricamente a 6 km y −6km del origen. Resultados del entrenamiento Siguiendo el mismo procedimiento aplicado en los casos anteriores, se procede al testeo de la política entrenada. En la Figura 5.18 se presenta la comparación entre los resultados obtenidos sin control y aquellos con la política entrenada. Las Figuras 5.19 y 5.20 muestran las trayectorias asociadas al primer set de test, en los casos sin intervención y con la política aplicada, respectivamente. En este cuarto escenario se observa una mejora notable respecto al caso anterior, atribuida al incremento de la complejidad del entorno, lo que provoca un mayor número de colisiones en ausencia de control. En particular, se logra reducir el porcentaje medio de colisiones, de un 16.27% a un 2.2% . En términos generales, se consigue aumentar los episodios truncados, del 83.73% al 94.13% . No obstante, aún existe margen de mejora, ya que el porcentaje de escapes ha aumentado del 0% al 3.67% de media en los tests. Por otra parte, en la Figura 5.21 se aprecia que todas las trayectorias colisionadas con dinámica natural, son controladas con éxito por el agente. En particular, en la región de inclinaciones entre 125◦ y 180◦ donde originalmente se registran 34 colisiones ( 43.59% ), el agente supera con éxito todos los episodios. De igual modo, en la región comprendida entre 0◦ y 30◦ en la que se produce 27 colisiones por dinámica natural ( 34.62% ), el número de colisiones se reduce a una sola gracias al control del agente. 5.2.4 Problema con modelo mascon en 3D Se presenta el último escenario, donde el entorno gravitatorio se modela mediante una distribución de 101 mascons dispuestos en tres dimensiones para representar el campo gravitatorio de Eros 433 con gran precisión. Resultados del entrenamiento Una vez completados los procedimientos correspondientes, se procede a evaluar el comportamiento del agente en el entorno mascon. La Figura 5.22 recoge los resultados de las órbitas, tanto en 5.2 Curriculum Learning 53 0.00 0.02 0.04 0.06 0.08 0.10 Excentricidad inicial 0 25 50 75 100 125 150 175 Inclinación inicial [°] En ausencia de control 0.00 0.02 0.04 0.06 0.08 0.10 Excentricidad inicial 0 25 50 75 100 125 150 175 Inclinación inicial [°] Política entrenada Figura 5.10 Comparativa de resultados según condiciones iniciales en primer set en problema 3D con una masa puntual. ausencia de control como con la política implantada, mientras que la Figura 5.23 y la Figura 5.24 presentan las trayectorias en el primer set. En esta comparativa no se observa una mejoría en términos generales puesto que, en ausencia de control, se obtiene un 97.53% de episodios truncados, mientras que a través de las acciones de la política, se consigue un 94.6% de episodios truncados. Sin embargo, sí se observa una mejora significativa en la reducción de las colisiones, que se reducen del 2.47% al 1.1% . No obstante, esta mejora se ve contrarrestada por el aumento del porcentaje de escapes, que pasa del 0% al 4.4% , impidiendo mejorar los resultados en el cómputo general. En la Figura 5.25 se aprecia que todas las trayectorias que inicialmente acababan en colisión, son controladas con éxito por el agente. Por otra parte, se observa que 8 de las 14 colisiones en ausencia de control ( 57.14% ) se da en órbitas cuya inclinación inicial es menor de 30◦ , donde el control del agente lleva solo a 2 colisiones. Igualmente en la región media entre inclinaciones de 50◦ y 125◦ no se dan colisiones en ausencia de control y, sin embargo, el agente presenta peor control puesto que produce 4 colisiones. 54 Capítulo 5. Orbitado seguro con SAC en 3D 0 2000 4000 6000 8000 10000 12000 14000 Episodios 10 1 100 101 Q Loss Figura 5.11 Función de pérdida de redes 𝑄en problema 3D con dos masas puntuales. 0 2000 4000 6000 8000 10000 12000 14000 Episodios 20 15 10 5 0 Policy Loss Figura 5.12 Función de pérdida de la política en problema 3D con dos masas puntuales. 5.2.5 Conclusión En este capítulo se ha evaluado el desempeño del agente en un entorno de mayor complejidad al extender el problema al espacio tridimensional. Este cambio conlleva una mayor dificultad para mapear todos los posibles estados, lo cual se refleja en los resultados obtenidos. Aquellos escenarios en los que la dinámica natural conduce mayoritariamente a colisiones, la implementación del agente logra mejorar la supervivencia de la sonda. Sin embargo, en situaciones donde la evolución sin control tiende principalmente al truncamiento, si bien se consigue reducir en cierta medida el riesgo de colisión, también se observa un incremento en el número de escapes. Por tanto, en aquellos escenarios con mayor margen de mejora, el agente entrenado logra superar el comportamiento que se obtendría únicamente con la dinámica natural. Asimismo, se concluye que, en base a los resultados en función de la excentricidad e inclinación inicial, las órbitas más cercanas al plano ecuatorial, 5.2 Curriculum Learning 55 0 2000 4000 6000 8000 10000 12000 14000 Episodios 10 1 100 Alfa Figura 5.13 Coeficiente de temperatura en problema 3D con dos masas puntuales. Figura 5.14 Comparativa en problema 3D con dos masas puntuales: ausencia de control vs política. son las más propensas a colisión. También resulta relevante destacar los tiempos de entrenamiento y evaluación obtenidos en cada uno de los escenarios simulados. Estos fueron ejecutados en la máquina del IMUS para el entrenamiento, y en un equipo con procesador AMD Ryzen 7 para la evaluación, tal y como se recoge en la Tabla 5.3. Se observa que, a pesar del elevado coste computacional asociado al entrenamiento de las redes neuronales, una vez completado este proceso, su ejecución durante la fase de evaluación resulta eficiente en términos de tiempo. 56 Capítulo 5. Orbitado seguro con SAC en 3D 40 30 20 10 010 20 30 40 X [km] 40 30 20 10 0 10 20 30 40 Y [km] 40 30 20 10 0 10 20 30 40 Z [km] Trayectorias en ausencia de control acabadas en colisión (a) Colisión. 40 30 20 10 010 20 30 40 X [km] 40 30 20 10 0 10 20 30 40 Y [km] 40 30 20 10 0 10 20 30 40 Z [km] Trayectorias en ausencia de control truncadas (b) Truncado. Figura 5.15 Trayectorias en ausencia de control en tercer set del problema 3D con dos masas puntuales. Escenario Tiempo entrenamiento Tiempo evaluación Episodios Masa puntual 27 h 35 min 0.358 ms 15000 Dos masas puntuales 27 h 15 min 0.427 ms 15000 Cuatro masas puntuales 27 h 25 min 0.365 ms 15 000 Modelo mascon 45 h 20 min 0.363 ms 15 000 Tabla 5.3 Tiempos de entrenamiento y evaluación en problemas 3D. 5.2 Curriculum Learning 57 40 30 20 10 010 20 30 40 X [km] 40 30 20 10 0 10 20 30 40 Y [km] 40 30 20 10 0 10 20 30 40 Z [km] Trayectorias acabadas en colisión con política entrenada (a) Colisión. 40 30 20 10 010 20 30 40 X [km] 40 30 20 10 0 10 20 30 40 Y [km] 40 30 20 10 0 10 20 30 40 Z [km] Trayectorias acabadas en escape con política entrenada (b) Escape. 40 30 20 10 010 20 30 40 X [km] 40 30 20 10 0 10 20 30 40 Y [km] 40 30 20 10 0 10 20 30 40 Z [km] Trayectorias truncadas con política entrenada (c) Truncado. Figura 5.16 Trayectorias con política entrenada en tercer set del problema 3D con dos masas puntuales. 64 Capítulo 5. Orbitado seguro con SAC en 3D 0.00 0.02 0.04 0.06 0.08 0.10 Excentricidad inicial 0 25 50 75 100 125 150 175 Inclinación inicial [º] En ausencia de control 0.00 0.02 0.04 0.06 0.08 0.10 Excentricidad inicial 0 25 50 75 100 125 150 175 Inclinación inicial [°] Política entrenada Figura 5.25 Comparativa de resultados según condiciones iniciales en primer set del problema mascon 3D. 6 Conclusiones y trabajo futuro En este trabajo se ha desarrollado un algoritmo de Deep Reinforcement Learning llamado Soft Actor-Critic para el orbitado seguro de una sonda alrededor del asteroide Eros 433. Se ha desarrollado un proceso de aprendizaje basado en la filosofía curriculum learning que entrena progresivamente al agente en entornos de mayor dificultad partiendo de la solución anterior. 6.1 Conclusiones A partir del trabajo realizado y los resultados obtenidos, se han deducido las siguientes conclusiones: • La elección del sistema de referencia es determinante para garantizar la formulación del problema como un proceso de decisión de Markov. Dado que el vector de estado se ha definido como (®𝑟, ®𝑣) , expresado en coordenadas inerciales no sería posible predecir el siguiente estado, al no estar disponible la orientación del asteroide. Esto ha obligado a emplear un sistema fijo al asteroide, donde la posición y velocidad relativa contienen la información necesaria para preservar la propiedad de Markov. Por tanto, el uso de coordenadas fijas al asteroide es una necesidad impuesta por la definición del estado y la observabilidad del sistema. Alternativamente, en coordenadas inerciales se podría haber incluido explícitamente el tiempo 𝑡 desde una orientación conocida del asteroide al vector de estado (®𝑟, ®𝑣,𝑡) que también permitiría cumplir con la propiedad de Markov. • La función de recompensa supone un factor fundamental en el entrenamiento, puesto que es la que va a guiar al agente a encontrar la solución óptima. Estas deben ser diseñadas con gran cuidado para incentivar al agente a cumplir su objetivo. A su vez, deben asegurar que el agente no aprenda patrones erróneos, como impactar antes de tiempo por no tener suficiente incentivo para buscar nuevas soluciones, o arriesgar muchas maniobras por no castigar con la suficiente fuerza acciones más extremas. Se ha empleado una función de recompensa que reduce su valor al acercarse a situaciones indeseadas, como la colisión o el escape. Ello establece un cierto margen de seguridad que aumenta la robustez frente a fallos catastróficos en episodios no explorados. • Se confirma la eficacia del plan de curriculum learning, especialmente en la fase 2D, donde se conseguía asegurar el truncamiento desde el inicio del entrenamiento en los escenarios de mayor complejidad al partirse de uno anterior más simple. • Los tiempos de entrenamiento son muy elevados, superando las 24 horas en todos los escenarios tridimensionales. No obstante, en una aplicación real, este proceso se llevaría a cabo en Tierra, donde se dispone de mayor margen temporal. En contraste con este alto coste de entrenamiento, los tiempos de evaluación son muy reducidos, inferiores a la milésima de 65 66 Capítulo 6. Conclusiones y trabajo futuro segundo, que es precisamente lo que se requiere una vez que el agente está implementado en el computador de a bordo. • Analizando los resultados del modelo mascon en 2D frente al 3D, se puede apreciar los planos con mayor y menor riesgo de colisión. En 2D, el porcentaje de colisiones era del 25.4% mientras que en el 3D, de media en los tres sets, suponía el 2.47% . Este resultado se debe a la distribución de masas del propio asteroide. En el problema 2D proyectado en el plano 𝑧𝑥 , la distribución de masas, vista desde la sonda, difiere notablemente de una masa puntual debido al alargamiento del asteroide, induciendo perturbaciones más intensas en el campo gravitatorio. En cambio, al ampliar al problema tridimensional, la proyección en el plano 𝑦𝑧 muestra una configuración más cercana a la radial simétrica, lo que se traduce en un campo gravitatorio más uniforme. Así, el plano 𝑦𝑧 aparece como el de menor riesgo de colisión, mientras que los restantes planos concentran la mayor probabilidad de impacto. Este hecho también es respaldado por las gráficas de puntos en función de la excentricidad e inclinación inicial. De ellas, se puede concluir que las órbitas más cercanas al plano ecuatorial, esto es, el plano 𝑥𝑦, son las más propensas a acabar en colisión. • Se concluye que el agente ha entrenado correctamente puesto que siempre se produce una mejora respecto al comportamiento con acciones aleatorias. En el modelo 2D, el entorno plano representa un problema de menor complejidad, por lo que el agente es capaz de asegurar el 100% de truncamiento en los tests. Sin embargo, en 3D, el problema se vuelve más complejo, puesto que los posibles pares estado-acción se multiplican y además, hay que sumarle la rotación del asteroide, que añade bastante dificultad. Por ello, aunque el agente aprende correctamente, no consigue garantizar el truncamiento al 100% , lo que conlleva que la mejora de los resultados se da en aquellos escenarios donde naturalmente hay mayor riesgo de impacto, y por tanto, mayor margen de mejora. Cabe destacar también que un escape no supone la pérdida completa del vehículo, por lo que sería preferible ante una colisión. 6.2 Trabajo futuro Los resultados confirman los logros obtenidos, pero también las limitaciones en el algoritmo. Por ello, se presenta una serie de futuras mejoras: • Tras analizar la diferencia de resultados en el modelo mascon, tanto en 2D como en 3D, una posible mejora consistiría en hacer un estudio de las regiones 3D donde realmente el algoritmo SAC ayuda, es decir, buscar las zonas donde verdaderamente hay riesgo de colisión o escape, y explotarlas para poder usar el agente en esas regiones. • Un hecho probado en los resultados del problema 3D, es la identificación de un evento como escape. El número de escapes, ha perjudicado en cierto modo los resultados obtenidos puesto que, aunque se producían mejoras en las colisiones, en el cómputo general no se apreciaban debido al incremento de los escapes. Este tema presenta una futura línea de trabajo para poder perfeccionar el algoritmo, puesto que, tal como está definido el evento escape, puede haber episodios identificados como eventos terminales cuando realmente no hay certeza de ello. Por ejemplo, al basar el evento de escape en una condición puramente geométrica, no se puede identificar si la sonda está escapando o si está en una órbita cuyo radio de apogeo es lo suficientemente grande como para sobrepasar ese límite de cincuenta kilómetros. Por ello, una posible mejora sería complementar la condición geométrica con un término proporcional a la energía, la cual se puede relacionar con el escape. • Incluir una salvaguarda que, en zonas especialmente críticas, integre la órbita tras cada maniobra propuesta: si la trayectoria prevista conduce a colisión o escape, el sistema ejecutaría automáticamente una maniobra correctiva mínima. Este chequeo añade carga de cálculo a 6.2 Trabajo futuro 67 bordo, pero resulta mucho menos costoso que un proceso completo de optimización, ya que sólo implica propagar una órbita. • Para aproximar aún más el experimento a un escenario operativo, cabría incorporar un sistema de navegación que estime en tiempo real la posición de la sonda y utilice dichas observaciones en la simulación. A partir de esas medidas, se podrían añadir algoritmos de estimación de actitud de modo que el agente considere la orientación del vehículo al calcular cada maniobra. Esto sería útil para misiones en las que se requiere controlar la orientación de la sonda, como un apuntado continuo al asteroide o a cualquier otro objetivo de interés. • Se podría extender el trabajo a una misión de descent and landing, donde habría que reconsiderar la función de recompensa. Esta debería fomentar llegar a un punto objetivo de la superficie sin colisionar antes, pero a su vez, debería incentivar también llegar garantizando la seguridad operativa en el aterrizaje, esto es, aterrizar con la velocidad deseada. La dinámica se mantendría igual y los tiempos de cada step se reducirían conforme se acerca el vehículo a la superficie, con el fin de tener un control más continuo. Índice de Figuras 1.1 Deep Space Network en Canberra, Australia. Créditos: NASA 3 1.2 Eros 433. Créditos: NASA 4 2.1 Sistema de referencia inercial centrado en el asteroide 8 2.2 Sistema de referencia fijo al asteroide 8 2.3 Elementos orbitales. Créditos: Wikipedia 9 2.4 Modelo Mascon 11 2.5 Modelo Mascon de Eros 433 11 3.1 Diagrama MDP de estados, acciones y recompensas 16 3.2 Neurona artificial 17 3.3 Perceptrón multicapa 18 3.4 Peso que conecta neurona 2 de la capa 3 con neurona 4 de la capa anterior 21 3.5 Superficie 𝑧=𝑓(𝑥,𝑦)(función peaks) y proyección del vector −∇ 𝑓(𝑥1,𝑦1)sobre ella 23 3.6 Comparación SGD sin momento vs con momento. Fuente:[9] 24 4.1 Red neuronal política 𝜋para problema 2D 27 4.2 Red neuronal 𝑄para problema 2D 28 4.3 Función de recompensa para Δ𝑣=030 4.4 Estadística del buffer inicial en problema 2D con una masa puntual 31 4.5 Duración de los episodios en problema 2D con una masa puntual 32 4.6 Retorno acumulado por episodio en problema 2D con una masa puntual 32 4.7 Estadística del test con acciones aleatorias en problema 2D con una masa puntual 33 4.8 Trayectorias del test con acciones aleatorias en problema 2D con una masa puntual 33 4.9 Trayectorias del test con la política entrenada en problema 2D con una masa puntual 34 4.10 Estadística del buffer inicial en problema 2D con dos masas puntuales 35 4.11 Función de pérdida de redes 𝑄en problema 2D con dos masas puntuales 35 4.12 Función de pérdida de la política en problema 2D con dos masas puntuales 36 4.13 Coeficiente de temperatura en problema 2D con dos masas puntuales 36 4.14 Duración de los episodios en problema 2D con dos masas puntuales 37 4.15 Retorno acumulado por episodio en problema 2D con una masa puntual 37 4.16 Estadística del test en ausencia de control en problema 2D con dos masas puntuales 38 4.17 Trayectorias del test en ausencia de control en problema 2D con dos masas puntuales 38 4.18 Trayectorias del test con política en problema 2D con dos masas puntuales 39 4.19 Estadística del test en ausencia de control en problema 2D con cuatro masas puntuales 39 4.20 Trayectorias del test en ausencia de control en problema 2D con cuatro masas puntuales 40 4.21 Trayectorias del test con política en problema 2D con cuatro masas puntuales 40 69 70 Índice de Figuras 4.22 Duración de los episodios en problema mascon 2D 41 4.23 Retorno acumulado por episodio en problema mascon 2D 41 4.24 Acción media por episodio en problema mascon 2D 42 4.25 Estadística del test en ausencia de control en problema mascon 2D 42 4.26 Trayectorias en ausencia de control en problema mascon 2D 43 4.27 Trayectorias con política entrenada en problema mascon 2D 43 5.1 Red neuronal política 𝜋para problema 3D 45 5.2 Red neuronal 𝑄para problema 3D 46 5.3 Duración de los episodios en problema 3D con una masa puntual 48 5.4 Retorno acumulado por episodio en problema 3D con una masa puntual 49 5.5 Acción media por episodio en problema 3D con una masa puntual 49 5.6 Comparativa en problema 3D con masa puntual: ausencia de control vs política 50 5.7 Trayectorias en ausencia de control en primer set del problema 3D con una masa puntual 50 5.8 Trayectorias con política entrenada en primer set del problema 3D con una masa puntual 51 5.9 Resultados con política no entrenada en primer set del problema 3D con una masa puntual 52 5.10 Comparativa de resultados según condiciones iniciales en primer set en problema 3D con una masa puntual 53 5.11 Función de pérdida de redes 𝑄en problema 3D con dos masas puntuales 54 5.12 Función de pérdida de la política en problema 3D con dos masas puntuales 54 5.13 Coeficiente de temperatura en problema 3D con dos masas puntuales 55 5.14 Comparativa en problema 3D con dos masas puntuales: ausencia de control vs política 55 5.15 Trayectorias en ausencia de control en tercer set del problema 3D con dos masas puntuales 56 5.16 Trayectorias con política entrenada en tercer set del problema 3D con dos masas puntuales 57 5.17 Comparativa de resultados según condiciones iniciales en tercer set en problema 3D con dos masas puntuales 58 5.18 Comparativa en problema 3D con cuatro masas puntuales: ausencia de control vs política 59 5.19 Trayectorias en ausencia de control en segundo set del problema 3D con cuatro masas puntuales 59 5.20 Trayectorias con política entrenada en segundo set del problema 3D con cuatro masas puntuales 60 5.21 Comparativa de resultados según condiciones iniciales en segundo set del problema 3D con cuatro masas puntuales 61 5.22 Comparativa en problema 3D con modelo mascon: ausencia de control vs política 62 5.23 Trayectorias en ausencia de control en primer set del problema mascon 3D 62 5.24 Trayectorias con política entrenada en primer set del problema mascon 3D 63 5.25 Comparativa de resultados según condiciones iniciales en primer set del problema mascon 3D 64 Índice de Tablas 3.1 Valores 𝑉𝜋(𝑠)para cada estado con factor de descuento 𝛾=0.99. 16 4.1 Parámetros orbitales iniciales utilizados en el entorno en 2D. 30 4.2 Parámetros y configuraciones de entrenamiento utilizados en problemas 2D 31 4.3 Tiempos de entrenamiento y evaluación en problemas 2D 44 5.1 Parámetros orbitales iniciales utilizados en el entorno en 3D. 47 5.2 Parámetros y configuraciones de entrenamiento utilizados en problemas 3D 47 5.3 Tiempos de entrenamiento y evaluación en problemas 3D 56 71 Bibliografía [1] R. T. Daly, C. M. Ernst, O. S. Barnouin, et al. Successful kinetic impact into an asteroid for planetary defence. Nature, 616:443–447, 2023. [2] Majid Ghasemi and Dariush Ebrahimi. Introduction to reinforcement learning. 2024. Disponible en: https://arxiv.org/abs/2408.07712. [3] Tuomas Haarnoja, Aurick Zhou, Kristian Hartikainen, George Tucker, Sehoon Ha, Jie Tan, Vikash Kumar, Henry Zhu, Abhishek Gupta, Pieter Abbeel, and Sergey Levine. Soft actor-critic algorithms and applications. 2019. Disponible en: https://arxiv.org/abs/1812.05905. [4] Diederik P. Kingma and Jimmy Ba. Adam: A method for stochastic optimization. 2017. Disponible en: https://arxiv.org/abs/1412.6980. [5] Diederik P. Kingma and Max Welling. Auto-encoding variational bayes. 2022. Disponible en: https://arxiv.org/abs/1312.6114. [6] A. Mainzer, Paul Abell, James Bauer, William Bottke, Bonnie Buratti, Sean Carey, Desireé Cotto-Figueroa, R. Cutri, D. Dahlen, Peter Eisenhardt, Y. Fernandez, Roberto Furfaro, Tommy Grav, T. Hoffman, Michael Kelley, Yoonyoung Kim, J. Kirkpatrick, Christopher Lawler, and Gregory Zengilowski. The near-earth object surveyor mission. The Planetary Science Journal, 4:224, 12 2023. [7] John R. Martin and Hanspeter Schaub. Reinforcement learning and orbit-discovery enhanced by small-body physics-informed neural network gravity models. In AAS/AIAA Astrodynamics Specialist Conference, Charlotte, NC, 2022. American Astronautical Society. AAS 22-2272. [8] NASA Office of Inspector General. Audit of nasa’s deep space network. Technical Report IG-23-016, NASA Office of Inspector General, July 2023. [9] Víctor Román. Gradient descent extensions to your deep learning models, 2020. Towards Data Science. [10] David E. Rumelhart, Geoffrey E. Hinton, and Ronald J. Williams. Learning representations by back-propagating errors. Nature, 323:533–536, 1986. 73