scieee AI-readable full text Open interactive document viewer

Ajuste del continuo de QSOs a alto corrimiento del rojo

Balme Hidalgo, María José

Abstract

Las técnicas de reconstrucción del continuo de cuásares son fundamentales para la elaboración de mapas de densidad, a partir de los cuales es posible inferir parámetros cosmológicos como la constante de Hubble o la cantidad de materia oscura en el Universo. Paralelamente, el desarrollo de nuevos instrumentos espectroscópicos permite obtener datos de cuásares con mayor precisión y abundancia, contribuyendo así a mejorar estos estudios. El presente trabajo tiene como objetivo implementar en el método QSANNdRA (Quasar Spectra from Artificial Neural Network based predictive Regression Algorithm) los datos generados por el simulador de WEAVE (WHT Enhanced Area Velocity Explorer), un telescopio espectroscópico actualmente en construcción. QSANNdRA es un algoritmo de reconstrucción del continuo basado en redes neuronales y técnicas de regresión. Tras dicha implementación, se ha observado que la mayoría de los cuásares presentan una desviación inferior al 100% respecto del continuo teórico proporcionado por WEAVE. Además, se ha comprobado que el rendimiento de QSANNdRA-WEAVE mejora en función de parámetros como la relación señal-ruido, el corrimiento al rojo o el ensayo operativo del que provienen los datos. En particular, para la versión con snr > 3, el mejor resultado se ha obtenido para el cuásar OpR3F7N100, con una desviación del 4,98 %. De forma general, los mejores ajustes se alcanzan con snr > 4, siendo especialmente relevantes los resultados en la región del bosque de Lyman alfa, de gran importancia para el estudio de la materia oscura. Por todo ello, se concluye que la implementación de los datos de WEAVE en QSANNdRA ha sido satisfactoria, y se subraya la necesidad de seguir perfeccionando las técnicas de ajuste del continuo con el fin de reducir su error en futuros conjuntos de datos.

Full text

TRABAJO FIN DE GRADO Ajuste del continuo de QSOs a alto corrimiento del rojo Realizado por Mar´ıa Jos´e Balme Hidalgo Para la obtenci´on del t´ıtulo de Grado en F´ısica Dirigido por Jos´e O˜norbe Bernis En el departamento de F´ısica At´omica, Molecular y Nuclear Convocatoria de julio, curso 2024/25 Para la Mar´ıa Jos´e de 20 a˜nos que so˜n´o con hacer un TFG de astrof´ısica, aqu´ı est´a la prueba Para la Mar´ıa Jos´e de 16 a˜nos que so˜n´o con ser astrof´ısica, estamos a un paso m´as cerca Para la Mar´ıa Jos´e de 13 a˜nos que so˜n´o con ser f´ısica, lo hemos conseguido Agradecimientos A Lola, Luis, ´ Alvaro y Miguel, doy gracias a la vida por haber elegido esta carrera y haberme encontrado con vosotros. Gracias por vivir conmigo cada momento de frustraci´on antes de un examen y de alegr´ıa al sacar m´as de un 5. Por cada desayuno y caf´e que nos hemos tomado a lo largo de los a˜nos. Por haberos convertido en mi familia en la facultad y fuera de ella. Gracias por formar parte de esta etapa universitaria, sin vosotros no habr´ıa sido lo mismo. A mi madre, gracias por luchar por m´ı todos los d´ıas. Gracias por darme todo lo que no pudiste tener. Por alegrarte por cada logro que consegu´ıa y por preocuparte por m´ı en los momentos no tan buenos. Gracias por confiar en que tomar´ıa las mejores decisiones. Gracias por ser mi madre. A Juan, gracias por creer en m´ı m´as de lo que yo hago. Por apoyarme durante todo este ´ultimo a˜no, a pesar de la distancia y todo lo que hemos pasado. Gracias por escucharme y sacarme una sonrisa cuando m´as lo necesitaba. Por todo el cari˜no que me das. Gracias por aparecer en mi vida y vivirla a mi lado. Te quiero. A mi tutor Jos´e, gracias por toda la ayuda que me has brindado, sin ti no hubiese sido posible. Gracias por todas las videollamadas Sevilla-Par´ıs, por todas las respuestas en teams a horas no muy decentes, por las palabras de ´animo en cada reuni´on y por involucrarte tanto en este trabajo. Gracias por ser el mejor tutor de TFG que nunca jam´as habr´ıa so˜nado. Gracias, por ense˜narme lo que es la astrof´ısica. A la Facultad: Antonio, Felipe, Fany, Pablo, Raquel y ASEF. Por permitirme vivir la experiencia universitaria m´as all´a de las aulas. Gracias por creer en todas las actividades que propusimos. Gracias por ense˜narme lo que es la divulgaci´on y lo bonito que es compartir la f´ısica. Abuelo, est´es donde est´es, espero que est´es orgulloso de m´ı. i Resumen Las t´ecnicas de reconstrucci´on del continuo de cu´asares son fundamentales para la elaboraci´on de mapas de densidad, a partir de los cuales es posible inferir par´ametros cosmol´ogicos como la constante de Hubble o la cantidad de materia oscura en el Universo. Paralelamente, el desarrollo de nuevos instrumentos espectrosc´opicos permite obtener datos de cu´asares con mayor precisi´on y abundancia, contribuyendo as´ı a mejorar estos estudios. El presente trabajo tiene como objetivo implementar en el m´etodo QSANNdRA (Quasar Spectra from Artificial Neural Network based predictive Regression Algorithm) los datos generados por el simulador de WEAVE (WHT Enhanced Area Velocity Explorer), un telescopio espectrosc´opico actualmente en construcci´on. QSANNdRA es un algoritmo de reconstrucci´on del continuo basado en redes neuronales y t´ecnicas de regresi´on. Tras dicha implementaci´on, se ha observado que la mayor´ıa de los cu´asares presentan una desviaci´on inferior al 100 % respecto del continuo te´orico proporcionado por WEAVE. Adem´as, se ha comprobado que el rendimiento de QSANNdRA-WEAVE mejora en funci´on de par´ametros como la relaci´on se˜nal-ruido, el corrimiento al rojo o el ensayo operativo del que provienen los datos. En particular, para la versi´on con snr >3, el mejor resultado se ha obtenido para el cu´asar OpR3F7N100, con una desviaci´on del 4,98 %. De forma general, los mejores ajustes se alcanzan con snr >4, siendo especialmente relevantes los resultados en la regi´on del bosque de Lyman alfa, de gran importancia para el estudio de la materia oscura. Por todo ello, se concluye que la implementaci´on de los datos de WEAVE en QSANNdRA ha sido satisfactoria, y se subraya la necesidad de seguir perfeccionando las t´ecnicas de ajuste del continuo con el fin de reducir su error en futuros conjuntos de datos. Palabras clave: QSANNdRA, WEAVE, Reconstrucci´on del Continuo de Cu´asares, Corrimiento al Rojo, Bosque de Lyman Alfa, Aprendizaje Autom´atico ii Abstract Quasar continuum reconstruction techniques are fundamental for creating density maps, from which cosmological parameters such as the Hubble constant or the amount of dark matter in the Universe can be inferred. Concurrently, the development of new spectroscopic instruments allows for the acquisition of quasar data with higher precision and abundance, thereby improving these studies. This work aims to implement in the QSANNdRA method (Quasar Spectra from Artificial Neural Network based predictive Regression Algorithm) the data generated by the WEAVE simulator (WHT Enhanced Area Velocity Explorer), a spectroscopic telescope currently under construction. QSANNdRA is a continuum reconstruction algorithm based on neural networks and regression techniques. After this implementation, it was observed that most quasars exhibit a deviation lower than 100 % relative to the theoretical continuum provided by WEAVE. Furthermore, the performance of QSANNdRA-WEAVE improves depending on parameters such as the signal-to-noise ratio, redshift, and the operational run from which the data originate. In particular, for the version with snr >3, the best result was obtained for quasar OpR3F7N100, with a deviation of 4.98 %. Overall, the best fits are achieved with snr >4, with especially relevant results in the Lyman alpha forest region, which is crucial for the study of dark matter. Therefore, it is concluded that the implementation of WEAVE data into QSANNdRA has been successful, and the need to continue improving continuum fitting techniques to reduce errors in future datasets is emphasized. Keywords: QSANNdRA, WEAVE, Quasar Continuum Reconstruction, Redshift, Lyman-alpha forest, Machine Learning iii ´ Indice general 1 Introducci´on ................................ 1 2 Marco Te´orico ............................... 3 2.1. Introducci´on cosmol´ogica . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3 2.2. Qu´e es un cu´asar (QSO) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5 3 Metodolog´ıa ................................. 15 3.1. M´etodos de reconstrucci´on de espectros de emisi´on de QSOs . . . . . . . . 15 3.2. QSANNdRA................................... 19 3.3. ProyectoWEAVE-QSO............................. 22 3.4. Muestradedatos ................................ 25 3.5. Adaptaci´on de los datos simulados de WEAVE-QSO a QSANNdRA . . . . 27 4 Resultados .................................. 31 4.1. Erroressistem´aticos............................... 31 4.2. Umbral se˜nal-ruido snr > 3 .......................... 33 4.3. Umbral se˜nal-ruido snr > 4 .......................... 41 5 Discusi´on y conclusiones ........................ 43 Bibliograf´ıa ................................... 47 iv 1. Introducci´on Uno de los retos m´as importantes en la astrof´ısica y la cosmolog´ıa de este siglo es comprender de qu´e est´a compuesto el Universo y c´omo evoluciona. Con este objetivo, por un lado, se busca reducir el error de los par´ametros fundamentales que definen el modelo cosmol´ogico actual, mientras que por otro lado se aspira a entender qu´e es la materia y energ´ıa oscura que forman el Universo. Una de las formas de obtener esta informaci´on es a trav´es del estudio de la evoluci´on del campo de densidad. Sin embargo, observacionalmente, es imposible obtener informaci´on directa de ese campo, por lo que necesitamos calcularlo a trav´es de diversos trazadores. La densidad media del Universo es muy baja, de forma que tendemos a utilizar trazadores de muy alta densidad como las galaxias. No obstante, tambi´en podemos escoger como trazador a los cu´asares u objetos casi estelares. Los cu´asares son objetos descubiertos en el siglo pasado y considerados como los objetos visibles m´as brillantes y lejanos del universo, en cuyos espectros se encuentra el bosque de Lyman alfa. El bosque de Lyman alfa es un conjunto de l´ıneas de absorci´on del hidr´ogeno neutro que se corresponde con zonas del medio intergal´actico y a partir del cual podemos recrear los mapas de densidad. Para acceder a la cantidad de hidr´ogeno neutro presente en el bosque de Lyman alfa es necesario poder construir el espectro de emisi´on un cu´asar sin absorciones. Es decir, si conocemos el espectro intr´ınseco de un cu´asar, podremos encontrar la diferencia entre las emisiones del mismo y las absorciones de hidr´ogeno que han ocurrido entre el cu´asar y nosotros debido a la interacci´on de la radiaci´on del cu´asar con el medio intergal´actico. A lo largo de las ´ultimas d´ecadas se han creado diversos m´etodos de reconstrucci´on del continuo o espectro intr´ınseco de un cu´asar (Bosman et al.,2021). Los m´as novedosos son aquellos que utilizan un an´alisis de componentes principales o redes neuronales, ya que son los que menos errores obtienen. La incertidumbre asociada al ajuste del continuo representa el mayor desaf´ıo al ser la principal fuente de error sistem´atico en la estimaci´on precisa de par´ametros cosmol´ogicos como la constante de Hubble y la cantidad de materia oscura en el Universo. Aparte del m´etodo utilizado para reconstruir el continuo, otra de las claves para conseguir cada vez errores menores, es la muestra sobre la que se emplea dicho m´etodo. Es decir, otro de los puntos clave, son los datos observacionales alrededor de los cuales se crean los algoritmos de ajuste. El m´etodo utilizado en este trabajo es un algoritmo destinado a estimar espectros de cu´asares basado en redes neuronales denominadoQSANNdRA 1 (Quasar Spectra from Artificial Neural Network based predictive Regression Algorithm) (ˇ Durovˇcikova et al.,2020). Este algoritmo ya ha probado su validez con miles de datos del SDSS (Sloan Digital Sky Survey) pero, a medida que va avanzando la tecnolog´ıa, se van creando nuevos telescopios e instrumentos astron´omicos que permiten recopilar informaci´on cada vez m´as precisa. Por ello, otro de los retos t´ecnicos m´as importantes en la astrof´ısica moderna es la evaluaci´on constante de la validez de estos algoritmos de ajuste aplicados a los datos obtenidos por los pr´oximos instrumentos. Uno de estos nuevos instrumentos es WEAVE (WHT Enhance Area Velocity Explorer), dise˜nado para elaborar diferentes sondeos astron´omicos espectrosc´opicos enfocados en galaxias, cu´asares y evoluci´on cosmol´ogica que se est´a siendo construido en La Palma (Jin et al.,2022). En este marco se engloba WEAVE-QSO, uno de los sondeos de WEAVE que recopilar´a cu´asares con una densidad mayor que otros sondeos realizados en cu´asares anteriormente. Es decir, obtendremos un n´umero mayor de datos con una precisi´on mayor. Gracias a esto, podremos observar una mayor cantidad de cu´asares y, a partir de sus continuos, extraer informaci´on del bosque de Lyman alfa en el medio intergal´actico. Y as´ı reconstruir el campo de densidad a partir de la absorci´on de hidr´ogeno neutro. Asimismo, estudiando sus propiedades estad´ısticas, seremos capaces de disminuir el error en el c´alculo de la constante de Hubble y profundizar en el conocimiento actual de la materia oscura. El objetivo de este trabajo es estimar el desempe˜no de QSANNdRA sobre los datos observacionales generados por el simulador de WEAVE para, por un lado, comprobar la eficacia de QSANNdRA en la predicci´on del continuo de cu´asares de WEAVE y, por otro lado, observar posibles errores en los datos simulados de WEAVE y as´ı subsanarlos para la puesta en marcha de WEAVE. En concreto, se pretende estudiar en profundidad cu´asares a alto corrimiento al rojo, dado que ofrecen mayor informaci´on sobre el bosque de Lyman alpha. Este estudio servir´a para demostrar la importancia de probar y entrenar t´ecnicas de reconstrucci´on del continuo de una gran cantidad de cu´asares de forma sistem´atica. El estudio comenzar´a en el Cap´ıtulo 2 donde se explicar´an conceptos b´asicos de la astronom´ıa y se har´a una introducci´on a los cu´asares: qu´e son, c´omo es su estructura y por qu´e son importantes. El Cap´ıtulo 3 contendr´a la metodolog´ıa del trabajo, donde se comentar´an diversos m´etodos de reconstrucci´on del continuo de cu´asares como el an´alisis de componentes principales. En dicho cap´ıtulo, se presentar´a WEAVE, as´ı como se ver´an algunas de sus caracter´ısticas t´ecnicas. Asimismo, se entrar´a m´as en detalle del funcionamiento de QSANNdRA y cu´ales han sido las variaciones necesarias para llegar a la versi´on aplicada a WEAVE, QSANNdRA-WEAVE. Posteriormente, en el Cap´ıtulo 4, se presentar´an los resultados obtenidos y se discutir´a el error en funci´on de algunas magnitudes como la se˜nal-ruido o el corrimiento al rojo. Y, finalmente, en el Cap´ıtulo 5 se har´a una discusi´on y conclusi´on de todo el trabajo realizado. 2 2. Marco Te´orico 2.1. Introducci´on cosmol´ogica 2.1.1. El corrimiento al rojo Seg´un el efecto Doppler, si una fuente de luz se mueve con una velocidad valej´andose respecto al observador, dicha fuente de luz presentar´a un corrimiento espectral hacia longitudes de ondas mayores. En el contexto cosmol´ogico, podr´ıamos usar la base del efecto Doppler para describir la expansi´on del Universo. La expansi´on del Universo provoca que los sistemas que lo componen se alejen cada vez m´as los unos de los otros. Es por ello que, cuanto m´as lejos est´e un objeto de nosotros, m´as r´apido observaremos que se aleja. Seg´un la Ley de Hubble-Lemaˆıtre, v=H0D podemos obtener la distancia a la que se encuentra un objeto respecto a su observador, D, que se mueve con una velocidad va trav´es de la constante de Hubble H0. Esta constante nos permite medir la expansi´on del Universo. Sin embargo, para objetos que se mueven a velocidades muy altas respecto de nosotros conviene utilizar otra escala para medir la distancia a la que se encuentran. Es por ello que utilizamos el corrimiento al rojo cosmol´ogico. De forma an´aloga al efecto Doppler, el corrimiento al rojo cosmol´ogico est´a causado por la expansi´on del espacio a medida que la luz viaja a trav´es de ´el, por lo que para grandes distancias, la elongaci´on total de la longitud de onda de un fot´on depende de la evoluci´on a lo largo del tiempo del ritmo de expansi´on del Universo. Por ello, es m´as pr´actico utilizar el corrimiento al rojo que la distancia entre el objeto y el observador. Matem´aticamente: z=λobservada −λemitida λemitida =Robservada −Remitida Remitida (2.1) siendo Rel tama˜no del Universo. Por lo que: 1 + z=λobservada λemitida Asimismo, podemos definir el factor de expansi´on, de forma que R= 1,0, como: 3 siendo Fν, el flujo luminoso, ν, la frecuencia de la radiaci´on recibida y α,la pendiente espectral. A partir de la ley de potencia podemos aproximar el continuo a una banda ancha de longitudes de onda donde la pendiente espectral α, pertenece al rango [0,0,5], siendo com´un un valor de α=1/3 (Carroll and Ostlie,2019). Sin embargo, esta aproximaci´on no nos basta para describir el espectro de un cu´asar, ya que a su continuo se le superponen procesos de emisi´on y absorci´on que el disco de acreci´on por s´ı solo no puede explicar. M´as all´a del disco caliente de acreci´on, podemos encontrarnos un disco delgado cuyo ancho aumenta con la distancia del centro del cu´asar. Su superficie es c´oncava, resultado de la irradiaci´on que sufre por parte del disco caliente o interno. Aproximadamente alrededor de los 105RSdesde el agujero negro seg´un Carroll and Ostlie (2019), el disco finalmente se fracciona en diversas nubes peque˜nas. Otros procesos de emisi´on El chorro central Casi todos los AGN y cu´asares con una fuerte emisi´on en ondas de radio eyectan chorros de materia desde sus centros (Figura 2.2). Estos chorros ayudan al cu´asar a transportar la enorme cantidad de energ´ıa que emiten. Dependiendo del lugar de la observaci´on, distinguiremos un chorro muy luminoso dado que se dirige a nosotros, mientras que su “anti-chorro” ser´a casi imperceptible al tener una direcci´on de la velocidad de emisi´on opuesta a nuestra l´ınea de visi´on. Sin embargo, en los cu´asares, el plano de observaci´on y el plano donde se observan los dos chorros sin ning´un efecto Doppler apreciable son paralelos. La zona de producci´on de radiaci´on X y l´ıneas anchas Aparte del continuo, en un cu´asar tambi´en hay emisi´on de energ´ıa en forma de rayos X o rayos gamma. La emisi´on de esta radiaci´on X o gamma es el resultado de la incidencia de la radiaci´on del continuo del cu´asar en la zona final del disco de acreci´on, as´ı como en las nubes exteriores en las que se divide el mismo. Como se ha comentado anteriormente, el disco de acreci´on cada vez que nos alejamos m´as del centro del cu´asar, m´as se va ensanchando, al disminuir tanto su temperatura como su densidad. Esto provoca una disminuci´on de la energ´ıa de los ´atomos conforme se van localizando m´as lejos del agujero negro. Cuando la radiaci´on del continuo del cu´asar incide en el extremo del disco, los electrones de los ´atomos presentes absorben o dispersan dicha radiaci´on, lo que da lugar a una reemisi´on en forma de rayos X de baja energ´ıa. Una parte de los fotones de la radiaci´on X de baja energ´ıa, a medida que se van dispersando y avanzando hacia el exterior del cu´asar, choc´andose con los electrones 10 Figura 2.3: Estructura de un cu´asar seg´un el modelo unificado de AGN, adaptada de Carroll and Ostlie (2019). En ella se identifican el chorro de materia eyectado desde el n´ucleo, el disco central de acreci´on y la regi´on de nubes que genera l´ıneas anchas al final del disco de acreci´on. Tambi´en se representan tanto el toro, el cual opaca parte de la radiaci´on producida por el cu´asar como las nubes ionizadas en el exterior del toro que generan l´ıneas estrechas del espectro presentes en el medio. A trav´es de estas colisiones, los fotones van ganando energ´ıa, generando una radiaci´on X de alta energ´ıa. Este es el llamado efecto Compton invertido. Tras sucesivos choques, la energ´ıa de los fotones puede aumentar hasta producir radiaci´on gamma, como se observa en el cu´asar 3C 273 (Carroll and Ostlie, 2019). Esta es, adem´as de una zona de producci´on de rayos X o gamma, una de las principales zonas donde se produce el ensanchamiento de las l´ıneas de emisi´on del cu´asar. Este ensanchamiento es producido tanto por efecto Doppler t´ermico, como por las colisiones entre part´ıculas. El efecto Doppler t´ermico no es espec´ıfico de esta regi´on, ya que la distorsi´on de la longitud de onda de los fotones ocurre en cualquier zona cuya temperatura sea diferente al cero absoluto. Sin embargo, la colisi´on de part´ıculas, responsable del aumento de energ´ıa de la radiaci´on X, es tambi´en la causa del ensanchamiento de las l´ıneas de emisi´on de un cu´asar en las regiones externas del disco de acreci´on. El toro La regi´on que genera las l´ıneas anchas de emisi´on del cu´asar debe ser un conjunto de nubes de gas parcialmente ionizado en vez de ser un medio homog´eneo (Carroll and 11 Figura 2.4: Espectro observacional de un cu´asar tras atravesar el medio intergal´actico (l´ınea negra). En ´el se observan las distintas l´ıneas debidas a estructuras intergal´acticas, as´ı como la emisi´on intr´ınseca del cu´asar (l´ınea roja continua y discontinua). Fuente: Hamburger Sternwarte, Universidad de Hamburgo, proyecto Observational Astronomy. Extra´ıdo de: https://hsweb.hs.uni-hamburg.de/projects/observationalastronomy/qsoal/qsoabs.jpg (´ultimo acceso: 01/07/2025) Ostlie,2019). Las nubes que producen las l´ıneas anchas solo forman un 1 % de la regi´on del cu´asar y est´an rodeadas por un medio de alta temperatura que previene la dispersi´on de dichas nubes. Seg´un uno de los postulados del modelo unificado, este medio que rodea a las nubes para evitar su dispersi´on debe ser un medio amplio, opaco, de gas y polvo denominado toro y es otro de los causantes de la distorsi´on de las l´ıneas anchas producidas por el final del disco de acreci´on y las nubes. Cabr´ıa pensar que, si el toro se encontrase en la l´ınea de visi´on entre el centro del cu´asar y el observador, la mayor parte de la radiaci´on recibida estar´ıa altamente modificada y no se podr´ıa identificar tan f´acilmente con la de un cu´asar. Es esta la diferencia fundamental entre los tipos de AGN: la l´ınea de visi´on desde la que se observan. Los cu´asares, en concreto, no tienen una influencia directa del toro ya que la l´ınea de visi´on se encuentra entre los chorros y el toro, es decir, podr´ıamos llegar a observar la estructura del cu´asar, evitando la opacidad del toro. 2.2.4. Espectro discreto: Bosque de Lyman alfa En el espectro de un cu´asar tambi´en podemos encontrarnos l´ıneas de absorci´on. Por un lado, un 10 % de dichas l´ıneas son l´ıneas de absorci´on ensanchadas por el efecto Doppler debido a que provienen de fuentes con velocidades superiores a los 104km−1. Se 12 cree que est´an asociadas al propio cu´asar, m´as precisamente a los procesos de reionizaci´on previamente mencionados en el disco de acreci´on. Desde otro punto de vista, tenemos l´ıneas de absorci´on m´as estrechas, observadas en cu´asares de un corrimiento al rojo mayor de 2,2 (z > 2,2). Estas l´ıneas se originan en nubes ionizadas fuera del toro (Figura 2.3). Se trata de regiones de densidades similares a la densidad en nebulosas planetarias (ρ≃1010 m−3) y de temperaturas alrededor de los 104K. No todas estas nubes est´an involucradas en la absorci´on de las l´ıneas, ya que el toro del cu´asar bloquea gran parte de la radiaci´on del cu´asar. Sin embargo, las nubes tambi´en ensanchan las l´ıneas por efecto Doppler, dado que se mueven tanto con respecto de la Tierra como respecto del cu´asar. Por ello, el corrimiento al rojo de estas l´ıneas deber´a de ser menor que el corrimiento al rojo del propio cu´asar. Normalmente, encontraremos estas l´ıneas de absorci´on en longitudes de onda del ultravioleta. Podemos dividirlas en dos grandes grupos: l´ıneas de absorci´on de metales o de hidr´ogeno. Por un lado, las l´ıneas de absorci´on de metales corresponden a metales como el carbono IV y el magnesio II (Figura 2.4). Estos metales se asemejan a aquellos que ocupan el medio intergal´actico, es decir, son elementos pesados que, necesariamente, han sido creados por nucleos´ıntesis estelar (en el n´ucleo de las estrellas). A causa de ello, se piensa que estas l´ıneas deben haberse formado en halos o discos de galaxias localizadas entre el cu´asar y nosotros. Gracias a las observaciones de cu´asares en los rangos ultravioleta y ´optico realizadas a finales del siglo pasado, junto con los avances en simulaciones cosmol´ogicas hidrodin´amicas, se ha descubierto una regi´on gruesa, gaseosa y fotoionizada del medio intergal´actico a alto corrimiento al rojo (z≃3) (Rauch,1998). Esta regi´on colapsa bajo la influencia de la gravedad de la materia oscura formando estructuras aplanadas o filamentarias, siendo la responsable de las l´ıneas de absorci´on de hidr´ogeno que se observan en los espectros de los cu´asares. Esta zona del espectro es conocida como el bosque de Lyman alfa. Debido a la expansi´on del Universo, la luz emitida por los cu´asares se desplaza hacia longitudes de onda mayores (corrimiento al rojo). Sin embargo, las l´ıneas de absorci´on correspondientes al bosque de Lyman alfa (producidas en nubes de hidr´ogeno neutro situadas a diferentes distancias entre el cu´asar y el observador), aparecen desplazadas hacia el azul con respecto a las l´ıneas de emisi´on del cu´asar. Esto se debe a que cada nube absorbe la luz en la longitud de onda correspondiente a su propio corrimiento al rojo, que es menor que el del cu´asar. Como resultado, el espectro del cu´asar muestra un conjunto denso de l´ıneas de absorci´on a diferentes posiciones, formando as´ı el llamado “bosque” de Lyman alfa. Este fen´omeno permite obtener una muestra detallada y tridimensional de la 13 distribuci´on de la materia gaseosa en el Universo. Por lo tanto, el estudio del bosque de Lyman alfa a trav´es de los espectros de cu´asares es una herramienta fundamental para mapear el hidr´ogeno neutro y, en consecuencia, la materia bari´onica. A d´ıa de hoy gracias al estudio de cu´asares a alto corrimiento al rojo z≃3 es posible alcanzar una precisi´on del 5-10 % en cantidades como la fluctuaci´on de la materia y la constante de Hubble en funci´on del corrimiento al rojo, H(z) (Weinberg et al.,2003). Gracias a cu´asares de z∼2−4, el bosque de Lyman alfa es una de las herramientas m´as prometedoras para obtener medidas cosmol´ogicas de alta precisi´on, como la energ´ıa o materia oscura o los mecanismos de inflaci´on del Universo. Esto convierte a estos objetos en instrumentos ideales para rastrear la evoluci´on de la estructura c´osmica y detectar bariones a lo largo de una amplia gama de corrimientos al rojo, aportando informaci´on clave sobre la formaci´on y evoluci´on del Universo. 14 3. Metodolog´ıa 3.1. M´etodos de reconstrucci´on de espectros de emisi´on de QSOs Para poder estudiar el bosque de Lyman alfa y utilizar los cu´asares como rastreadores de la evoluci´on cosmol´ogica del Universo, es fundamental obtener su espectro intr´ınseco. Este espectro est´a compuesto por las emisiones generadas en el propio cu´asar. Sin embargo, antes de llegar hasta nosotros, dicha radiaci´on debe atravesar el medio intergal´actico. Como resultado de esta interacci´on, se incorporan al espectro observado l´ıneas de absorci´on y emisi´on propias del medio, aunque no originadas en el cu´asar. Por ello, es esencial poder distinguir entre las contribuciones espectrales del cu´asar y las del entorno. En consecuencia, resulta imprescindible desarrollar m´etodos capaces de reconstruir con precisi´on el espectro intr´ınseco de los cu´asares. En nuestro caso, nos centramos en el an´alisis del espectro de cu´asares alrededor del pico de Lyman alfa. Las t´ecnicas de reconstrucci´on dividen este espectro en dos partes bien diferenciadas: la parte azul y la parte roja. Para esta separaci´on, tomamos λo= 1220 ˚ A como longitud de onda de referencia. Por un lado, la parte roja del espectro es aquella que se encuentra a la derecha de λoy contiene l´ıneas de emisi´on correspondientes a metales. Aun con estas caracter´ısticas espectrales, se ajusta mejor a una ley de potencia (2.2.3) en comparaci´on con la parte izquierda. Por otro lado, la parte azul es la que se encuentra a la izquierda de λoy que se caracteriza por la presencia del bosque de Lyman alfa, el cual contiene una gran cantidad de l´ıneas de absorci´on de hidr´ogeno neutro. Sin embargo, estos picos de absorci´on se solapan con los picos de emisi´on propios del cu´asar, lo que dificulta su identificaci´on. Si utilizamos m´etodos de ajuste para obtener el continuo de un cu´asar, a la misma vez estaremos obteniendo los picos del bosque de Lyman alfa, a trav´es de la diferencia entre los datos iniciales de emisiones y absorciones y las emisiones propias del cu´asar. En el pasado, los m´etodos de reconstrucci´on del continuo de cu´asares utilizaban la parte roja del espectro para predecir la parte azul a trav´es de una ley de potencia. Es decir, se hac´ıa una extrapolaci´on de los datos a la derecha de λo, ajust´andolos a una ley de potencia (Bosman et al.,2018). Sin embargo, se identific´o que la principal fuente de error en los estudios del bosque de Lyman alfa era el m´etodo por el cual se obten´ıa el continuo. Construyendo as´ı un nuevo objetivo en la astrof´ısica y la cosmolog´ıa: encontrar el m´etodo de reconstrucci´on del continuo m´as preciso. 15 A d´ıa de hoy, existe una gran variedad de m´etodos para obtener el espectro intr´ınseco o continuo de un cu´asar. Se diferencian entre s´ı por el tipo de informaci´on que se extrae de cada uno, los m´etodos matem´aticos que emplean, as´ı como por la cantidad de par´ametros que se pueden variar de un m´etodo a otro. Esto se puede observar en los 13 m´etodos comparados en (Greig et al.,2024). Cada vez m´as se crean nuevos m´etodos, variando par´ametros o modificando sus bases te´oricas, con el objetivo, previamente comentado, de conseguir desviaciones o errores cada vez m´as peque˜nos en las reconstrucciones. De esta forma, se logra reducir los errores en el estudio del bosque de Lyman alfa, lo que a su vez permite obtener estimaciones m´as precisas de par´ametros cosmol´ogicos fundamentales, como la constante de Hubble o la densidad de materia oscura. Los 2 m´etodos m´as utilizados actualmente para la reconstrucci´on del continuo de cu´asares son (Bosman et al.,2021): la extrapolaci´on de una ley de potencia, las t´ecnicas de aprendizaje autom´atico unidas a un an´alisis de componentes principales (PCA) a partir de ajustes por splines. El algoritmo que he utilizado en este trabajo utiliza este ´ultimo, una combinaci´on entre PCA y aprendizaje autom´atico. El PCA obtiene las variables que caracterizan de manera generalizada a un cu´asar y, gracias al aprendizaje autom´atico, podremos encontrar las relaciones no lineales entre dichas variables. Es decir, el uso de redes neuronales nos ayudar´a a aplicar un PCA de manera autom´atica, no lineal, a un gran volumen de datos. 3.1.1. An´alisis de componentes principales (PCA) Los espectros de los cu´asares son una buena muestra para un an´alisis de componentes principales debido a que tienen caracter´ısticas espectrales con altas correlaciones. La base del PCA es puramente matem´atica y puede describir a cualquier sistema. Si representamos matricialmente un sistema, podemos encontrar a trav´es de la diagonalizaci´on de dicha matriz, los N autovectores (¯vi) a partir de los cuales podemos describir cualquier otro sistema (r) con las mismas caracter´ısticas de la manera m´as precisa. r=λ1¯v1+λ2¯v2+... +λN¯vN Los autovalores λi, correspondientes a estos autovectores, representan la varianza de los mismos, de forma que con algunos de los primeros autovectores ya podremos representar con gran precisi´on a un sistema, sin necesidad de utilizarlos todos. De esta forma hemos “reducido” la dimensi´on de las variables con las que podemos describir a un sistema o, en este caso, a un cu´asar. Los pasos comprendidos en un PCA aplicado a un cu´asar son los siguientes (Bosman 16 et al.,2021): 1. Identificar una muestra para la cual se pueda determinar el continuo con gran precisi´on, N. Dicho continuo, q(λ), ser´a dividido en dos partes: el lado azul del espectro (λ < 1220 ˚ A) y el lado rojo (λ > 1220 ˚ A) 2. Descomponer tanto la parte roja como el continuo completo en sus principales componentes. Matem´aticamente, ser´ıa el equivalente a calcular la matriz covariante entre el contino y el flujo medio de todos los cu´asares de la muestra, ¯ F. C(i, j) = 1 N−1 N X n=1 (qn(λi)−¯ F(λi)(qn(λj)−¯ F(λj)) Al diagonalizar dicha matriz, sus autovectores son los componentes principales 3. Se calcula la matriz de peso para el lado rojo as´ı como para el espectro completo W: Wij =Z(qi(λ)−¯ F(λi))pj(λ)dλ Si calculamos las matrices de peso tanto para el espectro completo como solo para el rojo, podremos pasar de una a otra a partir de una matriz de predicci´on, X. De esta forma: Wrojo+azul =X×Wrojo. Es decir, sabremos cu´al es la relaci´on entre la parte roja del espectro y el espectro total y de ah´ı inferir c´omo ser´a la parte azul. Por lo que, gracias a esta matriz de proyecci´on, X, podremos obtener el continuo completo como sigue: 4. Se obtiene la parte roja del continuo del nuevo cu´asar como en el primer paso, qrojo(λ) 5. Se calcula el peso de la parte roja, wi,r =Z(qrojo(λ)−¯ F(λ))pi,rojo(λ)dλ as´ı como del espectro entero wrojo+azul =Xwrojo 6. Finalmente, la predicci´on del ajuste viene dada por: Prediccion(λ) = ¯ F+X i wi,r+api, rojo+azul(λ) Uno de los pasos m´as importantes de este an´alisis es el primero, la selecci´on de la 17 muestra a partir de la cual se obtiene la matriz de proyecci´on X. Obtener una muestra de cu´asares cuyos espectros contengan la suficiente informaci´on como para realizar un buen ajuste es imprescindible. Por un lado, dependiendo del corrimiento al rojo del cu´asar puede que presente una parte roja muy peque˜na de forma que no tengamos la suficiente informaci´on como para predecir el continuo, o presentar una parte azul muy peque˜na de forma que haya muy poco rango de longitudes de ondas que predecir. En cambio, si tenemos una parte azul amplia, quiz´as aunque haya puntos que tengan grandes errores o desviaciones, la media de estas desviaciones, al contar con un n´umero mayor de datos, disminuya con respecto de un rango de longitudes de ondas m´as corto. Por otro lado, otros errores pueden ser introducidos por l´ıneas de emisi´on d´ebiles o una se˜nal-ruido baja, como se ver´a en la presentaci´on de resultados. 3.1.2. T´ecnicas basadas en aprendizaje autom´atico El aprendizaje autom´atico se construye principalmente sobre redes neuronales. Estas redes neuronales se encuentran enlazadas entre s´ı a trav´es de capas. Al proporcionar grandes cantidades de informaci´on a resolver con su correspondiente soluci´on a entre enrejado de capas, las redes neuronales ser´an capaces de encontrar relaciones entre s´ı. De esta forma, al proporcionarle datos de los cuales no sabemos la informaci´on, nuestro sistema de aprendizaje autom´atico ser´a capaz de hacernos una predicci´on de la soluci´on en funci´on de las relaciones que previamente ha identificado. Nosotros podemos obtener relaciones matem´aticas entre dos sistemas si estas relaciones son lineales. Este sistema nos ofrece la posibilidad de construir relaciones no lineales. Sin embargo, uno de los principales inconvenientes de estos sistemas es su falta de transparencia: se comportan como una “caja negra”, en la que conocemos los datos de entrada y salida, pero no los procesos internos que llevan a la predicci´on. Una de las t´ecnicas m´as utilizadas en aprendizaje autom´atico es el algoritmo de bosques aleatorios (random forest algorithm) (Biau and Scornet,2015), propuesto inicialmente por Breiman (2001). Se trata de un m´etodo muy eficaz para tareas de clasificaci´on y regresi´on, que combina m´ultiples ´arboles de decisi´on generados de forma aleatoria, agregando sus predicciones mediante promedios. Este enfoque es capaz de manejar grandes vol´umenes de informaci´on sin perder eficiencia estad´ıstica, y se basa en la estrategia de “dividir y conquistar”: divide el conjunto de datos en m´ultiples subconjuntos, entrena un ´arbol predictivo aleatorio en cada uno y combina las predicciones obtenidas. Entre las caracter´ısticas m´as destacadas del algoritmo se encuentran su aplicabilidad a diferentes tipos de problemas con una cantidad m´ınima de par´ametros a ajustar, as´ı como su capacidad para trabajar eficazmente con muestras peque˜nas y espacios de caracter´ısticas de alta dimensi´on. 18 Actualmente, no existe una formulaci´on matem´atica completa que describa con precisi´on el funcionamiento interno de algoritmos como los bosques aleatorios o las redes neuronales, ya que modelan patrones complejos que no pueden representarse f´acilmente mediante condiciones anal´ıticas o funciones de suavizado. No hay una regla matem´atica clara que indique qu´e par´ametros optimizan su rendimiento. Sin embargo, al mismo tiempo que se han ido desarrollando estas t´ecnicas, tambi´en se han ido estudiando su error estad´ıstico, siendo los resultados m´as celebrados los de Breiman (2001). Dado que no podemos conocer mucho de las matem´aticas detr´as del funcionamiento de las redes neuronales al funcionar como una ‘caja negra”, es crucial saber al menos, c´omo de bien o mal predicen los resultados. Es la forma que tenemos para validar su funcionamiento al no poder comprenderlo desde un punto de vista matem´atico. Es por ello que uno de los objetivos principales de nuestro estudio consiste en, tras obtener el continuo intr´ınseco de un cu´asar, analizar la precisi´on del ajuste como validaci´on del modelo. 3.2. QSANNdRA Seg´un lo visto en la Secci´on 3.1 de la metodolog´ıa, uno de los m´etodos para ajustar cu´asares y obtener su espectro intr´ınseco es el an´alisis por componentes principales (PCA). Una de las herramientas actuales que puede relacionar caracter´ısticas entre dos elementos “diferentes” es el aprendizaje autom´atico o machine learning, de forma an´aloga a la matriz de proyecci´on vista en el Cap´ıtulo 3. Se trata de una herramienta adecuada debido a la complejidad de la f´ısica detr´as de un cu´asar. En otras palabras: no existe ning´un modelo te´orico altamente contrastado con la suficiente precisi´on que pueda explicar las din´amicas y procesos de emisi´on de energ´ıa de un cu´asar. Al igual que ocurre con las estrellas, cuyos procesos de transporte de la energ´ıa no se conocen por completo (Wright et al.,2011). Por lo que, poder modelar por ordenador a trav´es de ecuaciones y leyes el espectro de un cu´asar es una tarea que actualmente la f´ısica no puede realizar a la precisi´on necesaria para determinar valores cosmol´ogicos como la densidad de materia oscura, de modo que nos ayudamos de las redes neuronales para facilitar dicha tarea. QSANNdRA o Quasar Spectra from Artificial Neural Network based predictive Regression Algorithm o en espa˜nol, algoritmo predictivo de regresi´on de espectros de cu´asares a trav´es de redes neuronales artificiales. QSANNdRA es un algoritmo que obtiene el continuo de cu´asares de bajo corrimiento al rojo a trav´es del uso de aprendizaje autom´atico y el an´alisis de componentes principales. QSANNdRA combina 100 redes neuronales artificiales, las cuales extraen correlaciones entre las regiones roja y azul del espectro de un cu´asar para posteriormente predecir el espectro intr´ınseco en un radio de 100 ˚ A alrededor del pico. 19 de que diversos equipos del proyecto pudiesen probar el sistema de procesamiento de datos del instrumento. Las simulaciones se llevaron a cabo mediante distintos ensayos operativos, denominados OpR (Operational Rehearsal). En este trabajo se han utilizado los datos correspondientes a los ensayos OpR3 y el posterior OpR4. Estos datos se encuentran distribuidos en archivos con formato .hdf5, organizados en carpetas numeradas a partir de 0, de modo que, por ejemplo, la carpeta 0 de cada ensayo contiene los mismos cu´asares simulados. Cada uno de los archivos representa una hora de observaci´on del cielo profundo. En el caso del ensayo OpR3, se dispone de 19 carpetas, numeradas del 0 al 18. Por su parte, los datos del OpR4 comprenden ´unicamente las carpetas 0, 7 y 8. Esto se debe a que el OpR4 tuvo como objetivo corregir ciertos errores detectados en el OpR3, por lo que no fue necesario repetir todas las simulaciones, sino que bastaba con simular solo algunas de las carpetas para verificar que los errores hab´ıan sido subsanados. En total, disponemos de 3503 cu´asares simulados, una peque˜na fracci´on de los aproximadamente 450000 cu´asares que WEAVE-QSO tiene previsto observar. Esta limitaci´on se debe a que, hasta la fecha, el simulador no ha generado un mayor volumen de datos. Se˜nal-ruido, snr La relaci´on se˜nal-ruido (s/n o snr) es una magnitud usada tanto en electr´onica como en astrof´ısica para cuantificar la calidad de un dato. Seg´un el ´ambito en el que nos encontremos, hay diferentes maneras de calcularla. Una de ellas ser´ıa dividir la se˜nal que consideramos “buena” entre el ancho del ruido de una funci´on, es decir, aquellos datos no deseados que creemos que est´an perturbando los datos “buenos”. En esta ocasi´on, hemos calculado la se˜nal-ruido de cada dato observacional como el valor absoluto del flujo entre su error, lo cual ser´ıa la inversa del error relativo. Es decir: snr = flujo error(flujo) Posteriormente, para calcular la se˜nal-ruido de un cu´asar completo, hemos calculado la media del snr para cada una de las longitudes de onda del propio cu´asar. Los 3503 cu´asares con los que contamos est´an comprendidos en un rango de corrimientos al rojo entre z= 2 y z≃5,77 (Figura 3.1). Tras un estudio estad´ıstico tambi´en se ha comprobado que el valor m´ınimo de la se˜nal-ruido es snr = 0,60, el valor m´aximo es de snr = 19,42 y el valor medio de snr = 2,34. Sin embargo, el percentil 26 75 % est´a en snr = 3,11, es decir, la mayor´ıa de los cu´asares est´an muy por debajo de una se˜nal-ruido buena o de calidad, ya que no llegan ni a snr = 10. Estas variables, el snr y el corrimiento al rojo, ser´an variables importantes al estudiar los resultados de la desviaci´on del ajuste a realizar. Por un lado, el snr ya que es una interpretaci´on del error de los datos, por lo que influir´a de manera segura en el error de cualquier tratamiento de estos datos. Por otro lado, seg´un el corrimiento al rojo del cu´asar, este estar´a m´as o menos desplazado en el espectro, por lo que para un rango de longitudes de onda concreto no tendremos ciertas partes que son clave para el trabajo. Magnitud aparente en banda r, mr Por otro lado, mr,rmag o la magnitud aparente en banda r, es una medida de la luminosidad de la estrella y es inversamente proporcional a ella, es decir, nos ayuda a determinar cu´an brillante es una estrella desde la Tierra. El filtro en banda r reduce las longitudes de onda que se miden a la parte roja en el rango del visible, consiguiendo una mayor precisi´on. En concreto, el filtro r, es aquel centrado en λ= 7000 ˚ A, altamente utilizado en astrof´ısica extragal´actica. En concreto, en el SDSS, el filtro en banda r estaba centrado en λ= 6166 ˚ A con un ancho a media altura de λ= 1149 ˚ A (Stoughton et al., 2002). En los histogramas (Figura 3.1), se observa que la cantidad de cu´asares con un gran brillo aparente (o de magnitud muy baja) es la minor´ıa. Asimismo, se visualiza que la mayor´ıa de cu´asares tienen un corrimiento al rojo menor de z= 3. Estas dos variables est´an altamente relacionadas ya que, generalmente, los cu´asares que vemos m´as lejos, son los m´as brillantes. Es por ello que en este trabajo se ha mencionado varias veces que los cu´asares son los objetos m´as brillantes y lejanos jam´as descubiertos. Que tengamos tan poca cantidad de datos a alto corrimiento al rojo o baja magnitud es una consecuencia directa de la capacidad de detecci´on de luz de los instrumentos creados por el ser humano. 3.5. Adaptaci´on de los datos simulados de WEAVEQSO a QSANNdRA QSANNdRA es un modelo de ajuste basado en PCA y redes neuronales descrito en ˇ Durovˇcikova et al. (2020). Este trabajo ha consistido en la implementaci´on de los datos del nuevo instrumento WEAVE en el algoritmo para la reconstrucci´on del continuo de cu´asares QSANNdRA. Para ello, he realizado diversas modificaciones al c´odigo de acceso libre QSANNdRA proporcionado por ˇ Durovˇcikova et al. (2020). 27 Figura 3.2: Representaci´on de los datos proporcionados por WEAVE y representados en el sistema en reposo para el cu´asar OpR3F7N100. Se puede observar tanto el continuo inicial, como los datos simulados a partir de dicho continuo y el error de la simulaci´on correspondiente al error observacional de los datos Por otro lado, QSANNdRA realiza una transformaci´on del sistema de referencia de las longitudes de onda, pasando del sistema observacional al sistema en reposo. Esto es necesario porque el rango de longitudes de onda en el sistema en reposo, definido al inicio del algoritmo, var´ıa en el sistema observacional seg´un el corrimiento al rojo de cada cu´asar. Esta transformaci´on facilita la comparaci´on m´as precisa de los espectros de diferentes cu´asares entre s´ı. Los datos de WEAVE simulados vienen inicialmente en el sistema observacional, mientras que el continuo o el ajuste de los mismos viene en el sistema de reposo. Al utilizar QSANNdRA, se han pasado los datos simulados al sistema en reposo para mantener la homogeneidad. Sin embargo, tras homogeneizar el sistema de referencia y observar el resultado, el pico de Lyman alfa esperado en λ= 1615,67 ˚ A estaba desplazado. Inicialmente pensamos que la causa eran los corrimientos al rojo proporcionados por WEAVE. El zque proporciona el simulador de WEAVE no es el corrimiento al rojo recalculado a partir del espectro ya simulados, sino que mantiene el corrimiento al rojo inicial del continuo te´orico utilizado para generar los datos observacionales. Podr´ıamos pensar que esta diferencia no deber´ıa ser significativa, ya que el simulador de WEAVE no deber´ıa desplazar el espectro inicial, sino que deber´ıa a˜nadir l´ıneas de emisi´on, absorci´on y ruido instrumental, generando as´ı un espectro que pueda ser observado por WEAVE una vez est´e en funcionamiento. Para corregir este problema y determinar el corrimiento al rojo verdadero o efectivo de nuestros datos, zefectivo, se ha aplicado la siguiente modificaci´on basada en la ecuaci´on 2.1: 28 zefectivo =λpico 1215,67 −1 λreposo =λobservacional 1 + zefectivo Por otro lado, como se ha mencionado previamente, en QSANNdRA se utiliza una m´ascara que filtra ciertas longitudes de onda, las cuales pertenecen a l´ıneas de emisi´on de metales, utilizada en los datos iniciales del cat´alogo SDSS (Stoughton et al.,2002). En nuestro caso, hemos preferido utilizar como filtro un umbral de se˜nal-ruido de 0,001, por lo que se han eliminado los datos o p´ıxeles cuya se˜nal-ruido fuese mayor de 0,001. Los archivos .hdf5 proporcionados por WEAVE contienen tanto el continuo te´orico como los datos observacionales resultantes de aplicar el simulador, as´ı como los valores de error asociados (Figura 3.2). El continuo generado por WEAVE se encuentra normalizado, pero no est´a expresado en unidades f´ısicas. Por este motivo, una vez se realiza el preprocesamiento de los datos simulados de WEAVE (mediante el cual se obtiene una versi´on suavizada del espectro con menor ruido), es necesario incorporar la funci´on frenorm, definida espec´ıficamente para normalizar el continuo de WEAVE respecto a los datos simulados, los cuales s´ı se encuentran en unidades f´ısicas. frenorm toma tanto el espectro que queremos normalizar (su longitud de onda, su flujo y su corrimiento al rojo, z), como otro espectro (del mismo sistema), que sabemos que est´a normalizado y queremos utilizar de referencia. Inicialmente, calcula el factor de expansi´on a partir de z. Seguidamente, escoge un primer rango de longitudes de onda en el sistema en reposo (λ∈[1140,1480] ˚ A), para comprobar que existen datos de ambos espectros en esa regi´on. Si no encuentra ning´un dato, pasa a otras dos regiones del espectro (λ∈[1700,1830] ˚ A y λ∈[2000,2500] ˚ A) para comprobar si hay datos a normalizar en dicha parte. Si finalmente no encuentra datos en com´un en ambas regiones, informa sobre un error en la normalizaci´on. Si en algunos de los intervalos s´ı hab´ıan datos suficientes para normalizar, calcula el factor de normalizaci´on como: norm =fnormalizado(rangoi) fa normalizar(rangoi) donde norm es el factor de normalizaci´on, fnormalizado(rangoi) y fa normalizar(rangoi) el flujo medio normalizado y el que se quiere normalizar en el rangoi, el intervalo de longitudes de onda en el que s´ı hay datos suficientes como para proceder con la normalizaci´on. Posteriormente, se multiplica norm al flujo a normalizar para obtener la normalizaci´on en unidades f´ısicas. Como consecuencia de la variabilidad en los corrimientos al rojo y del rango fijo de 29 longitudes de onda en el sistema en reposo, al aplicar QSANNdRA, hemos econtrado ciertos problemas. En particular, algunos cu´asares presentan valores de corrimiento al rojo tan elevados o tan bajos que, en el primer caso, no se dispone de datos suficientes en la parte roja del espectro, y en el segundo, ni siquiera se obtienen dos puntos en la parte azul sobre los que se pueda aplicar QSANNdRA. Esto nos lleva a tener que eliminar 102 cu´asares del total de 3503 que ten´ıamos en nuestra muestra inicial de WEAVE. La predicci´on realizada por QSANNdRA tiene dos formatos. Por un lado, QSANNdRA nos proporciona un archivo con 100 valores del flujo normalizado para una misma longitud de onda, resultado de cada uno de los 100 modelos entrenados previamente. Por otro lado, tenemos otro archivo en el que, para cada longitud de onda, tenemos un solo valor del flujo, media de los 100 valores anteriores. El error que hemos considerado en este trabajo proviene de cu´an lejos est´a la predicci´on media del continuo simulado por WEAVE. Es decir, se trata de un bias o desviaci´on respecto del valor esperado. Hay m´ultiples formas de calcular esta diferencia entre el resultado obtenido y el valor esperado. En esta ocasi´on, hemos utilizado la siguiente definici´on: desviacion ( %) = continuo WEAVE −continuo QSANNdRA continuo WEAVE ×100 (3.1) Esta desviaci´on ha sido calculada para cada una de las longitudes de onda, por lo que, posteriormente, hemos calculado la desviaci´on media de un solo cu´asar. De forma que tendremos una visi´on m´as general del cu´asar, conveniente cuando se tiene una gran cantidad de datos que analizar. Al calcular inicialmente estas desviaciones, hemos encontrado cu´asares para los cuales directamente no se pod´ıa realizar el c´alculo debido a longitudes diferentes entre el continuo de WEAVE y el obtenido por QSANNdRA. WEAVE cuenta con una mayor cantidad de datos en el mismo rango de longitudes de onda, por lo cual ha sido necesario hacer una interpolaci´on de los mismos para ajustar la longitud del vector del continuo de WEAVE a la longitud del vector de QSANNdRA. Para llevar a cabo as modificaciones al c´odigo original de QSANNdRA (ˇ Durovˇcikova et al.,2020), he tenido que desarrollar varios archivos en PYTHON. Por un lado los ajustes de QSANNdRA y los pasos previos se han implementado en el archivo JUPYTER NOTEBOOK proporcionado por ˇ Durovˇcikova et al. (2020), el cual tambi´en ha sido modificado. Por otro lado, para la representaci´on gr´afica de los resultados, el c´alculo automatizado de las desviaciones de todos los cu´asares y su visualizaci´on, he escrito scripts independientes. Esto permite ejecutar estos an´alisis y gr´aficas de forma modular, sin necesidad de repetir el proceso ´ıntegro del estudio. Los resultados de los ajustes representados gr´aficamente en funci´on de diversos par´ametros ser´an discutidos a continuaci´on. 30 4. Resultados El resultado final del proceso desarrollado en la metodolog´ıa se puede observar en la Figura 4.1. En ella se representan los datos observacionales simulados (l´ınea gris) y el continuo proporcionado por WEAVE (l´ınea rosa), as´ı como el preprocesado de la parte roja del espectro (l´ınea roja) y el azul o la predicci´on media del continuo de QSANNdRA (l´ınea azul). Tambi´en est´an representadas las 100 predicciones (en azul claro), de forma que rodean a la predicci´on media del azul. Aunque se encuentren representadas, en nuestro estudio no las tendremos en cuenta, ya que nos centraremos en el valor medio. Se observa tambi´en la diferencia del procesado entre la parte roja y la azul. A la parte roja se le ha aplicado un suavizado de forma que se ajusta casi totalmente al continuo o l´ınea rosa. Por otro lado, la l´ınea azul, al estar predicha por la roja no siempre coincide con el continuo, l´ınea rosa. La diferencia se aprecia en la Figura 4.1, donde el pico no tiene la misma intensidad para el continuo de WEAVE en rosa que para el continuo de QSANNdRA en azul. Cabe recordar que, en el estudio de la eficacia del m´etodo, se va a utilizar la definici´on de la desviaci´on presentada en el Cap´ıtulo 3(Ecuaci´on 3.1). A partir de ella, medimos qu´e tan lejos se encuentra la predicci´on realizada por QSANNdRA respecto del continuo o espectro intr´ınseco que utiliza WEAVE para crear los datos observacionales simulados. Este c´alculo se ha realizado para cada longitud de onda y, posteriormente, se ha calculado la media de todas ellas, obteniendo as´ı un valor general para cada cu´asar. De esta forma, obtendremos una primera aproximaci´on sobre la precisi´on de los ajustes. Sin embargo, al analizar visualmente los resultados, observaremos que en algunos cu´asares la desviaci´on calculada no refleja completamente la calidad del ajuste, ya que habr´a zonas mejor ajustadas que otras. Por ello, realizaremos posteriormente un an´alisis detallado de la eficacia del m´etodo en funci´on de cada parte del continuo. A continuaci´on vamos a estudiar los resultados en funci´on de diversos par´ametros, como la se˜nal-ruido, snr, el corrimiento al rojo, zo la parte del continuo ajustada. 4.1. Errores sistem´aticos Anteriormente en el Cap´ıtulo 3, hemos mencionado que hemos tenido que eliminar algunos cu´asares debido a algunos errores. Se tratan de un par de errores que han ocurrido de manera sistem´atica en 102 cu´asares, a los cuales no hemos podido aplicar QSANNdRA. Conviene discutirlos previamente a dar una visi´on general de aquellos cu´asares de WEAVE 31 Figura 4.1: Resultado del ajuste para el cu´asar OpR3F1N73 donde el flujo ha sido normalizado a 1.0 en λ= 1290˚ A (ˇ Durovˇcikova et al.,2020). Se encuentran representados tanto los datos observacionales obtenidos por el simulador de WEAVE (l´ınea gris oscura), el continuo de WEAVE (l´ınea rosa), los datos observacionales suavizados por QSANNdRA (l´ınea roja) como el ajuste predicho por QSANNdRA (l´ınea azul). En la subfigura inferior se observa dicho espectro focalizado en el pico de Lyman alfa y la regi´on del bosque, a λ≃1215˚ A de los cuales s´ı hemos podido reconstruir el continuo. En total, tenemos 102 cu´asares a los cuales no hemos podido aplicar QSANNdRA. Podr´ıamos denominar a este fen´omeno como ”fallo catastr´ofico”. Dentro de ´el, podemos distinguir dos casos: Caso corrimiento al rojo err´oneo: al realizar la correcci´on del pico, se han encontrado ciertos cu´asares para los que la funci´on spline smooth daba error. Esto podr´ıa deberse a un desplazamiento del pico respecto de su valor tabulado, adicional al desplazamiento del pico generalizado para todos los cu´asares. Como consecuencia, el espectro de estos cu´asares no tienen suficiente parte roja para poder predecir la parte azul de forma que todos los cu´asares con (z > 5,5) han sido suprimidos de nuestros resultados. Caso normalizaci´on err´onea: ciertos procesos de normalizaci´on del flujo a trav´es de la funci´on Anorm tienen como valor “Nan”. Una raz´on veros´ımil es el rango de los espectros. Probablemente, el espectro observacional de uno de estos cu´asares no tiene suficientes datos en el rango que se usa para renormalizar el continuo de forma precisa. Dado que no se puede calcular la normalizaci´on a trav´es de Anorm, excluimos a estos cu´asares de la muestra. 32 Figura 4.2: Desviaci´on del ajuste en funci´on de la se˜nal-ruido y el corrimiento al rojo, z, para valores menor al 100 % para la versi´on de QSANNdRA snr > 3. Asimismo, las l´ıneas discontinuas verde y roja representan una desviaci´on del 10 % y 20 % correspondientemente Una vez m´as se verifica la importancia de escoger cu´asares que est´en en un rango de longitudes de onda en el que el pico est´e bien definido con respecto al resto del espectro y que tengan un corrimiento al rojo medio, z∈[2,0,5,5], de forma que su espectro contenga suficiente parte roja y azul para poder calcular la predicci´on. 4.2. Umbral se˜nal-ruido snr > 3 Una de las variables del c´odigo de QSANNdRA es el umbral de se˜nal-ruido, es decir, el snr m´ınimo que deber´an tener todos los cu´asares que utilizaremos para entrenar nuestro modelo. Inicialmente, este valor se fij´o en 3, el valor predeterminado por ˇ Durovˇcikova et al. (2020). 4.2.1. Resultado general Las desviaciones obtenidas con la primera versi´on de QSANNdRA con un snr mayor a 3 se han representado inicialmente en funci´on tanto del snr, como del corrimiento al rojo, z. En la Figura 4.2, se pueden observar ´unicamente valores con desviaciones menores al 100 %. Aunque existan datos que superen este error, se ha escogido este 100 % como criterio para poder estudiar cu´asares con errores comparables entre s´ı. Los cu´asares con errores mayores al 100 % conforman el 53,13 % de la muestra estudiada, con un total de 33 Figura 4.3: Figura similar a la Figura 4.1 pero con los resultados del ajuste para el cu´asar OPR3F1N1 1623 cu´asares. A partir de la Figura 4.2, podr´ıamos concluir que el m´etodo no ha resultado eficaz para la mayor´ıa de los cu´asares, ya que los errores obtenidos en la reconstrucci´on del continuo en la mayor´ıa de los casos han superado el 100 %, un valor relativamente alto para este tipo de an´alisis. Es necesario mencionar que uno de los problemas principales que comparten los cu´asares con desviaciones superiores al 100 % yacen en el rango de longitudes de onda de los mismos. Si un cu´asar tiene un corrimiento al rojo muy alto, su espectro estar´a altamente desplazado hacia la derecha, mientras que si tiene un bajo corrimiento al rojo, su espectro estar´a desplazado hacia la izquierda. Como consecuencia, habr´a regiones del espectro en las que no se disponga de datos dentro del rango de longitudes de onda en reposo. En particular, si se cuenta con una fracci´on muy reducida de la parte roja del espectro, no se tendr´a suficiente informaci´on para predecir correctamente la parte azul. Un ejemplo de ello es el cu´asar 1 del archivo 1 del OpR3 u OPR3F1N1, representado en la Figura 4.3, el cual est´a altamente desplazado a la izquierda, dado que tiene un corrimiento al rojo de z= 2,73. No es lo suficientemente bajo para que no se pueda calcular el continuo pero, como se observa, s´ı es lo suficientemente bajo para que este tenga una desviaci´on del 200,41 %. A continuaci´on, nos centraremos en los cu´asares con errores inferiores al 100 %, con el objetivo de analizar aquellos que presentan datos a lo largo de todo el espectro de longitudes de onda en el sistema de referencia en reposo. Las desviaciones obtenidas en otros trabajos de reconstrucci´on del espectro intr´ınseco de cu´asares en los que se han utilizado m´etodos basados en el an´alisis de componentes principales (PCA) y el aprendizaje autom´atico como Bosman et al. (2021) 34 Figura 4.4: Figura similar a la Figura 4.1 pero con los resultados del ajuste para el cu´asar OPR3F7N100 y como ˇ Durovˇcikova et al. (2020) han logrado desviaciones respecto del valor te´orico del 9,58 % y el 5,5 %, respectivamente. Este ´ultimo m´etodo, ha sido modificado en los ´ultimos a˜nos hasta lograr una desviaci´on del 0,3 % ˇ Durovˇc´ıkov´a et al. (2024). En nuestro caso, el ajuste con menor error respecto del valor te´orico es el cu´asar OpR3F7N100, es decir, el cu´asar n´umero 100 del archivo 7 del ensayo operativo 3 (Figura 4.4). Este cu´asar tiene un snr = 12,93 y, a pesar de tener un corrimiento al rojo de z= 2,17, es el cu´asar con el mejor ajuste de todos. Aun as´ı, este es un buen ejemplo gr´afico de la silueta que debe presentar un cu´asar para que, con alta probabilidad, su predicci´on sea precisa. No es completamente justo comparar este resultado con los obtenidos en la literatura, ya que ellos suelen trabajar con cu´asares de alta relaci´on se˜nal-ruido. En cambio, como se observa en la Secci´on 3.4, nuestro estudio engloba cu´asares con una amplia variedad de valores de snr, destacando especialmente la gran cantidad de cu´asares con bajo snr, lo que a˜nade un error extra a nuestras reconstrucciones. Pero, como se ha dicho con anterioridad, es importante tener una gran cantidad de datos, incluso si eso supone perder calidad o aumentar la desviaci´on de los ajustes, para poder hacer mejores estad´ısticas. De manera cuantitativa, obtenemos 52 cu´asares con desviaciones inferiores al 10 % y 441 con desviaciones menores al 20 %, de un total de 3055 cu´asares ajustados. En la Figura 4.2 se visualizan estos cu´asares: los puntos situados por debajo de la l´ınea discontinua verde corresponden a desviaciones inferiores al 10 %, mientras que los que est´an por debajo de la l´ınea discontinua roja representan cu´asares con errores menores al 20 %. Hemos escogido estos umbrales de error para analizar, por separado, las 35 4.3.1. Resultado general Para el conjunto total del espectro se han encontrado 67 cu´asares con un ajuste con una desviaci´on menor al 10 %, un resultado mejor que con la versi´on anterior. Asimismo, existen 502 cu´asares con un error general menor al 20 %. Es decir, se ve una leve mejora de la versi´on con snr > 4 respecto a la versi´on por defecto, con snr > 3. Para comprobar que esta mejora supone una tendencia al aumentar la se˜nal-ruido umbral ser´ıa necesario hacer una nueva versi´on a snr > 5 y ver si as´ı algunos de los cu´asares que fueron eliminados inicialmente pueden ser recuperados e incluidos de nuevo en el estudio. 4.3.2. Resultados en funci´on del bosque de Lyman alfa o el pico Al hacer la distinci´on entre el bosque de Lyman alfa y el pico, hemos encontrado un resultado con una gran variaci´on respecto a la versi´on inicial (Tabla 4.1). Para el bosque de Lyman alfa, ahora tenemos 75 cu´asares con errores menores al 10 % mientras que para el pico solo tenemos 6. Esta mejora se pone en compromiso al observar el umbral de error del 20 %, donde encontramos 119 cu´asares para el pico y 239 para el bosque. Podr´ıamos pensar que si hici´esemos la versi´on de QSANNdRA a snr > 5, obtendr´ıamos un aumento en el n´umero de cu´asares con desviaciones por debajo del 20 % en el bosque de Lyman alfa. En otras palabras, obtendr´ıamos m´as datos con mayor precisi´on en esa parte del espectro. Por un lado, el n´umero de cu´asares con desviaciones por debajo de los umbrales escogidos para la zona del pico no var´ıan de una versi´on de QSANNdRA a otra (Tabla 4.1). Esto nos llevar´ıa a pensar que la dificultad, anteriormente vista, en el ajuste del pico es independiente del umbral de snr con el que entrenemos a QSANNdRA. Para comprobar esta hip´otesis, ser´ıa necesario calcular las desviaciones en el ajuste del continuo a partir de otras versiones de QSANNdRA a diferentes valores de la se˜nal-ruido. Por otro lado, gracias a esta nueva versi´on, se observa una mejora superior al doble en la reconstrucci´on del bosque de Lyman alfa, en comparaci´on con versiones anteriores. Por lo tanto, si el objetivo final es el estudio del bosque, podemos considerar que esta versi´on representa una mejora significativa. Este resultado tiene sentido si se tiene en cuenta que hemos entrenado a QSANNdRA con datos de menor error y mayor calidad, lo cual refuerza la hip´otesis de que una mejor calidad en los datos de entrada conlleva predicciones m´as precisas y fiables. 42 5. Discusi´on y conclusiones Con el objetivo de mejorar la precisi´on en la determinaci´on de par´ametros cosmol´ogicos fundamentales, como la constante de Hubble o la densidad de materia oscura, resulta esencial desarrollar nuevos m´etodos de reconstrucci´on del continuo de cu´asares, combinando enfoques m´as precisos con datos observacionales actualizados. En este trabajo se ha implementado el m´etodo QSANNdRA, basado en an´alisis de componentes principales y aprendizaje autom´atico mediante un conjunto de 100 redes neuronales, sobre datos simulados del futuro instrumento espectrosc´opico WEAVE. En concreto, se ha aplicado a espectros generados por el simulador oficial de WEAVE, lo que convierte a nuestra implementaci´on (denominada QSANNdRA-WEAVE) en un estudio preliminar para evaluar, por un lado, la viabilidad del uso de QSANNdRA con los datos que proporcionar´a WEAVE, por otro, la calidad de los datos generados modelados por WEAVE y, por ´ultimo, cuantificar el error asociado a su desempe˜no en condiciones realistas. Para el desarrollo de este estudio hemos tenido que realizar diversas modificaciones del c´odigo base para una buena incorporaci´on de los datos de WEAVE, al tener un formato diferente de los datos del SDSS, los datos para los que originalmente estaba dise˜nada QSANNdRA y los que son utilizados en el entrenamiento de las redes neuronales que predicen el continuo. Aparte de modificar el formato de los datos, nos hemos ido encontrando con diversos errores o problemas. Alguno de ellos, como el valor err´oneo del corrimiento al rojo, z, de los espectros de WEAVE, se han podido solventar f´acilmente, haciendo una correcci´on del corrimiento al rojo y obteniendo un nuevo corrimiento al rojo efectivo, zeff. Otro de estos problemas ha sido la normalizaci´on de los datos, la cual no era homog´enea para todos ellos, lo que nos imped´ıa el c´alculo de la desviaci´on del m´etodo y su representaci´on. Para ello, hemos renormalizado los espectros del continuo en unidades f´ısicas y coherentes con el resto de los datos. Sin embargo, existen errores adicionales que provienen directamente de los datos simulados proporcionados por WEAVE. La soluci´on adoptada ha sido excluir los casos m´as problem´aticos, entre los cuales hab´ıa cu´asares que no se pod´ıan normalizar por falta de datos en alguna de las partes del espectro o corrimientos al rojo err´oneos o fuera de nuestro estudios. Estos errores han sido denominados como “errores catastr´oficos” y comprenden un total de 102 cu´asares los cuales han sido descartados de nuestra muestra global. Finalmente, tenemos una muestra a estudiar de 3041 cu´asares sobre la que se ha aplicado el m´etodo, ya adaptado, QSANNdRA-WEAVE. Desde una perspectiva general, los resultados obtenidos muestran errores relativamente elevados en la reconstrucci´on del 43 espectro intr´ınseco. De forma cuantitativa, el 53,13 % de los cu´asares presentan una desviaci´on superior al 100 %. Estas desviaciones exceden considerablemente las desviaciones consideradas como aceptables para un an´alisis cosmol´ogico preciso, por lo que dichos casos han sido excluidos del estudio final. No obstante, se considera relevante incluir esta informaci´on, dado que muestra la importancia de contar con datos de calidad para una reconstrucci´on robusta del continuo. Al analizar en detalle los casos con peor ajuste, se observa que en su mayor´ıa, el origen del error se encuentra en las limitaciones propias de los datos simulados. En particular, muchos espectros presentan un salto en el flujo en la parte roja debido al solapamiento entre los rangos espectrales de los brazos del espectr´ografo de WEAVE, lo que dificulta el suavizado del espectro en esa regi´on y, en consecuencia, dificulta la predicci´on del lado azul. Por otro lado, contamos con alrededor de 400 cu´asares cuyo ajuste tiene un error inferior al 20 % y alrededor de 50 cu´asares por debajo del 10 %. Hemos escogido estos umbrales como las desviaciones alrededor de las cuales obtenemos “buenos” ajustes. Aunque no sea una cifra estad´ısticamente significativa, sugiere que, mediante futuras mejoras en QSANNdRA (como la optimizaci´on del proceso de suavizado en la parte roja del espectro o la modificaci´on del umbral de la se˜nal-ruido), ser´ıa posible seguir reduciendo progresivamente el error en la reconstrucci´on del continuo. Si vamos m´as all´a y comparamos el m´ınimo error obtenido en QSANNdRA-WEAVE con el obtenido inicialmente por QSANNdRA aplicado a los datos del SDSS, encontramos un error del 4,98 % en QSANNdRA-WEAVE y de 0,3 % para QSANNdRA (ˇ Durovˇc´ıkov´a et al., 2024). Es evidente que nuestra aplicaci´on de QSANNdRA a los datos de WEAVE ha obtenido una desviaci´on m´as alta de la que obtuvo ˇ Durovˇc´ıkov´a et al. (2024). Sin embargo, debido a los resultados obtenidos y expuestos previamente, es razonable pensar que, si se sigue trabajando en el desarrollo de QSANNdRA-WEAVE, quiz´as no se alcanza la desviaci´on del 0,3 %, pero quiz´as s´ı se llega a mejorar significativamente nuestra desviaci´on m´ınima. Por tanto, el resultado de nuestro trabajo ha sido una implementaci´on correcta, aunque mejorable, de los datos de WEAVE en QSANNdRA, as´ı como la identificaci´on de ciertos problemas en los datos simulados correspondientes a los ensayos operativos OpR3 y OpR4. Esto permitir´a, por un lado, corregir y mejorar los datos simulados en futuras versiones de los ensayos operativos y, por otro, que una vez WEAVE comience a obtener datos reales, QSANNdRA-WEAVE pueda emplearse para el ajuste del espectro intr´ınseco de cu´asares, teniendo en cuenta las limitaciones detectadas en los datos observacionales. Los estudios posteriores no deben centrarse ´unicamente en mejorar el m´etodo para conseguir el mejor ajuste posible para un solo cu´asares con tal de alcanzar una precisi´on cercana al 0,3 % de ˇ Durovˇc´ıkov´a et al. (2024). Sino que el estudio deber´a centrarse en el desarrollo de QSANNdRA-WEAVE con el objetivo de de reducir el error general en la 44 muestra, especialmente a valores de la se˜nal-ruido aproximadamente entre 3 y 4, obteniendo una muestra lo suficientemente amplia de cu´asares bien ajustados como para permitir c´alculos cosmol´ogicos estad´ısticamente robustos. Algunas de las propuestas para continuar con este trabajo ser´ıan: Uno de los principales errores encontrados en la implementaci´on de los datos de WEAVE en QSANNdRA han sido los propios datos. Es por ello que propondr´ıa utilizar nuevos datos simulados de WEAVE de versiones operativas m´as recientes m´as precisos o que se adec´uen a las especificaciones de longitudes de ondas que ponemos por defecto en QSANNdRA en el sistema de referencia en reposo. As´ı como los datos observacionales que se esperan obtener de WEAVE a finales de 2025 de forma que tambi´en podamos comparar si los datos finalmente observados se corresponden con los simulados. Mediante el uso de datos simulados de mayor calidad o, idealmente, datos observacionales reales, se espera una mejora en la desviaci´on asociada a la reconstrucci´on del continuo. Asimismo, aunque en menor medida, se podr´a comprobar si los errores previamente debido a los datos se han corregido o si han adoptado una forma diferente. El sistema de aprendizaje autom´atico y redes neuronales que utiliza QSANNdRAWEAVE est´a entrenado actualmente con los datos del SDSS. Esto se debe a que son estos los datos con los que se entrenaba a QSANNdRA por defecto y, por otro lado, porque a d´ıa de hoy ser´ıa dif´ıcil entrenar a QSANNdRA con la cantidad de datos tan escasa de datos con los que contamos de WEAVE. No obstante, ser´ıa conveniente entrenar el conjunto de redes neuronales con los mismos datos que se pretenden ajustar, con el objetivo de reducir las desviaciones. Consideramos que el uso de datos procedentes de cat´alogos distintos puede introducir errores adicionales, mientras que emplear datos del mismo cat´alogo, que comparten m´as caracter´ısticas entre s´ı, podr´ıa mejorar la coherencia y precisi´on del ajuste. En este estudio se han creado dos versiones de QSANNdRA-WEAVE, entrenadas con muestras de cu´asares con umbrales de se˜nal-ruido distintos. Ser´ıa interesante crear otras nuevas versiones con umbrales se se˜nal-ruido superiores pero tambi´en inferiores. Por un lado, centrarse en versiones con una mayor relaci´on se˜nal-ruido probablemente permitir´ıa obtener ajustes m´as precisos del continuo de los cu´asares. Por otro lado, tambi´en resulta relevante trabajar en la mejora de los casos con menor se˜nal-ruido, ya que, aunque los ajustes individuales puedan ser de menor calidad, obtendr´ıamos una muestra m´as numerosa de resultados, lo cual es una ventaja importante en estudios estad´ısticos que requieren grandes cantidades de datos. QSANNdRA trabaja con un rango determinado inicialmente de longitudes de onda en el sistema de referencia en reposo. Ciertos cu´asares ubicados dentro de los “errores 45 catastr´oficos” daban error por su rango de longitudes de onda. Modificando el rango de longitudes inicial de QSANNdRA podr´ıamos adecuar los cu´asares de WEAVEQSO al m´etodo para as´ı poder incluir estos cu´asares del “error catastr´ofico”. No solo podr´ıamos aumentar la cantidad de cu´asares analizados, sino que, al ampliar el rango de longitudes de onda estudiadas, se incluir´ıa en general una mayor parte roja de los cu´asares, lo que sentar´ıa una mejor base para la obtenci´on de ajustes m´as precisos. Otra de las innovaciones posibles en QSANNdRA ser´ıa la variaci´on de algunos par´ametros propios de las funciones de QSANNdRA como el “porcentaje de suavizado” o “smooth”. Este en concreto, influye directamente en el suavizado de la parte roja a partir del cual se obtiene el continuo. Se podr´ıa observar si dichas variaciones y modificaciones ayudar´ıan a preparar mejor la parte roja y, por tanto, obtendr´ıamos mejores resultados del ajuste en la parte azul o si resultan ser par´ametros no tan relevantes para el m´etodo. Una de las bases te´oricas del m´etodo de reconstrucci´on del continuo que utiliza QSANNdRA es el aprendizaje autom´atico, incluyendo redes neuronales y bosques aleatorios. Para lograr desviaciones cada vez m´as peque˜nas ser´ıa fundamental un entendimiento m´as profundo de estos algortimos para comprender qu´e otros par´ametros, no necesariamente ligados a la f´ısica de los cu´asares, podr´ıan variarse. Sin embargo, esto probablemente implicar´ıa una modificaci´on sustancial del m´etodo, dando lugar a otro m´etodo independiente de QSANNdRA. Aunque esto se saldr´ıa del marco de este trabajo, seguir´ıa siendo totalmente v´alido para mejorar los estudios cosmol´ogicos. Para concluir, es importante destacar el rendimiento de QSANNdRA-WEAVE al centrarnos exclusivamente en la regi´on del bosque Lyman alfa del espectro. Los ajustes obtenidos muestran mejoras en la reconstrucci´on del bosque tanto respecto del pico como del continuo. Dado que es precisamente en esta zona del bosque donde se extrae la informaci´on clave para calcular la densidad de hidr´ogeno neutro (y, en consecuencia, estimar par´ametros fundamentales de la cosmolog´ıa actual como la constante de Hubble o la fracci´on de materia oscura), consideramos que la versi´on actual de QSANNdRA-WEAVE representa un excelente punto de partida para avanzar en la comprensi´on del Universo. 46 Bibliograf´ıa Sarah E.I. Bosman, Dominika ˇ Durovˇc´ıkov´a, Frederick B. Davies, and Anna Christina Eilers. A comparison of quasar emission reconstruction techniques for z 5.0 lyman and lyman transmission. Monthly Notices of the Royal Astronomical Society, 503: 2077–2096, 5 2021. ISSN 13652966. doi: 10.1093/mnras/stab572. Dominika ˇ Durovˇcikova, Harley Katz, Sarah E.I. Bosman, Frederick B. Davies, Julien Devriendt, and Adrianne Slyz. Reionization history constraints from neural network based predictions of high-redshift quasar continua. Monthly Notices of the Royal Astronomical Society, 493:4256–4275, 4 2020. ISSN 13652966. doi: 10.1093/ mnras/staa505. URL https://ui.adsabs.harvard.edu/abs/2020MNRAS.493.4256D/ abstract. Shoko Jin, Scott C. Trager, Gavin B. Dalton, and J. Alfonso L. Aguerri et al. The widefield, multiplexed, spectroscopic facility weave: Survey design, overview, and simulated implementation. Monthly Notices of the Royal Astronomical Society, 530:2688–2730, 12 2022. doi: 10.1093/mnras/stad557. URL http://arxiv.org/abs/2212.03981http: //dx.doi.org/10.1093/mnras/stad557. Frank H. Shu. Nuclear Energy and Synthesis of the Elements. University Science Books, 1982. ISBN 0-935702-05-9. URL https://archive.org/details/ ThePhysicalUniverseAnIntroductionToAstronomyFrankShu. A. K.. Kembhavi and Jayant Vishnu. Narlikar. Quasars and active galactic nuclei : an introduction. Cambridge University Press, 1999. ISBN 0521479894. Hagai Netzer. The Physics and Evolution of Active Galactic Nuclei. Cambridge University Press, 1 2013. ISBN 9781107021518. doi: 10.1017/CBO9781139109291. URL https://www.cambridge.org/ core/books/physics-and-evolution-of-active-galactic-nuclei/ 2A36453A413D67311D59A8A5CEA7117C. Bradley W. Carroll and Dale A. Ostlie. An Introduction to Modern Astrophysics, Second Edition. Cambridge University Press, 1 2019. ISBN 9781108380980. doi: 10.1017/ 9781108380980. Michael Rauch. The lyman alpha forest in the spectra of qsos. Annual Review of Astronomy and Astrophysics, 36:267–316, 6 1998. doi: 10.1146/annurev.astro.36.1. 47 267. URL http://arxiv.org/abs/astro-ph/9806286http://dx.doi.org/10.1146/ annurev.astro.36.1.267. David H. Weinberg, Romeel Dav’e, Neal Katz, and Juna A. Kollmeier. The lyman-alpha forest as a cosmological tool. pages 157–169, 1 2003. doi: 10.1063/1.1581786. URL http://arxiv.org/abs/astro-ph/0301186http://dx.doi.org/10.1063/1.1581786. Sarah E.I. Bosman, Xiaohui Fan, Linhua Jiang, Sophie Reed, Yoshiki Matsuoka, George Becker, and Martin Haehnelt. New constraints on lymanopacity with a sample of 62 quasarsat z ¿ 5.7. Monthly Notices of the Royal Astronomical Society, 479:1055–1076, 9 2018. ISSN 0035-8711. doi: 10.1093/MNRAS/STY1344. URL https://dx.doi.org/ 10.1093/mnras/sty1344. Bradley Greig, S. E.I. Bosman, F. B. Davies, D. ˇ Durovˇc´ıkov´a, H. Fathivavsari, B. Liu, R. A. Meyer, Z. Sun, V. D’Odorico, S. Gallerani, A. Mesinger, and Y. S. Ting. Blind qso reconstruction challenge: exploring methods to reconstruct the ly emission line of qsos. Monthly Notices of the Royal Astronomical Society, 533:3312–3343, 9 2024. ISSN 13652966. doi: 10.1093/mnras/stae1985. URL https://ui.adsabs.harvard.edu/abs/ 2024MNRAS.533.3312G/abstract. G´erard Biau and Erwan Scornet. A random forest guided tour. Test, 25:197–227, 11 2015. ISSN 11330686. doi: 10.1007/s11749-016-0481-7. URL https://arxiv.org/pdf/1511. 05741. Leo Breiman. Random forests. Machine Learning, 45:5–32, 10 2001. ISSN 08856125. doi: 10.1023/A:1010933404324/METRICS. URL https://link.springer.com/article/ 10.1023/A:1010933404324. Nicholas J. Wright, Jeremy J. Drake, Eric E. Mamajek, and Gregory W. Henry. The stellar-activity-rotation relationship and the evolution of stellar dynamos. Astrophysical Journal, 743:48, 12 2011. ISSN 15384357. doi: 10.1088/0004-637X/743/1/48. URL https://ui.adsabs.harvard.edu/abs/2011ApJ...743...48W/abstract. Chris Stoughton, Robert H. Lupton, Mariangela Bernardi, and Michael R. Blanton et al. Sloan digital sky survey: Early data release. AJ, 123:485–548, 1 2002. ISSN 00046256. doi: 10.1086/324741. URL https://ui.adsabs.harvard.edu/abs/2002AJ... .123..485S/abstract. Fran¸cois Chollet. Keras, 2015. URL https://github.com/fchollet/keras. Dominika ˇ Durovˇc´ıkov´a, Anna-Christina Eilers, Huanqing Chen, Sindhu Satyavolu, Girish Kulkarni, Robert A. Simcoe, Laura C. Keating, Martin G. Haehnelt, and Eduardo Ba˜nados. Chronicling the reionization history at 6 z 7 with emergent quasar damping 48 wings. ApJ, 969:162, 7 2024. ISSN 0004-637X. doi: 10.3847/1538-4357/AD4888. URL https://ui.adsabs.harvard.edu/abs/2024ApJ...969..162D/abstract. 49