Deep reinforcement learning para órbitas seguras alrededor de asteroides
Abstract
La exploración espacial de asteroides presenta grandes retos debido a la complejidad de operar en un entorno dinámico complejo y a la dificultad de mantener una comunicación constante con la Tierra. En estas misiones, el inevitable retardo en la señal o la imposibilidad de comunicación cuando la Deep Space Network está saturada, puede poner en riesgo la integridad de la sonda. Por ello, resulta fundamental desarrollar sistemas capaces de mantener órbitas seguras de manera autónoma hasta que la conexión pueda establecerse. Este trabajo propone utilizar el algoritmo de aprendizaje por refuerzo profundo Soft Actor-Critic (SAC) para implementar un modo seguro autónomo en sondas orbitando el asteroide Eros 433. Mediante un entorno simulado que representa fielmente el campo gravitatorio del asteroide con un modelo basado en mascon, la sonda aprende estrategias óptimas para mantener la seguridad operativa en ausencia temporal de comunicación.