scieee AI-readable full text Open interactive document viewer

Análisis del perfil de citoquinas, adipoquinas e inmunoglobulinas en la leche materna en los primeros días de lactancia

Fernández Bargalló, Aina

Abstract

La leche materna es la ingesta bàsica que tiene el bebe para su alimentación y defensa. Es por eso por lo que sus componentes son un tema en contínuo estudio; a pesar que ya se han detectado muchos de ellos, se sabe que hay muchos más componentes por descubrir. Dicha composición va cambiando des que el bebé nace hasta que la leche se puede considerar madura, durante lo que se definen las tres etapas de la leche materna, y es muy importante conocer los detalles en la evolución de su composición. En el caso de este estudio nos centramos en la segunda etapa, la leche de transición, para conocer los cambios en la composición de citoquinas, inmunoglobulinas y adipoquinas en la leche materna en los primeros dias de lactancia además de los posibles factores maternos que pueden influir en estos cambios, a partir de los valores inmunológicos y algunas características personales de 75 pares de madres e hijos.

Full text

Máster Interuniversitario en Estadística e Investigación Operativa UPC-UB Título: Análisis del perfil de citoquinas, adipoquinas e inmunoglobulinas en la leche materna en los primeros días de lactancia Autor: Aina Fernández Bargalló Director: Antonio Miñarro Alonso y Esteban Vegas Lozano Departamento: Dpto. de Genética, Microbiología y Estadística Universidad: Universidad de Barcelona Convocatoria: Ordinaria (junio) Resumen La leche materna es la ingesta b`asica que tiene el bebe para su alimentaci´on y defensa. Es por eso por lo que sus componentes son un tema en cont´ınuo estudio; a pesar que ya se han detectado muchos de ellos, se sabe que hay muchos m´as componentes por descubrir. Dicha composici´on va cambiando des que el beb´e nace hasta que la leche se puede considerar madura, durante lo que se definen las tres etapas de la leche materna, y es muy importante conocer los detalles en la evoluci´on de su composici´on. En el caso de este estudio nos centramos en la segunda etapa, la leche de transici´on, para conocer los cambios en la composici´on de citoquinas, inmunoglobulinas y adipoquinas en la leche materna en los primeros dias de lactancia adem´as de los posibles factores maternos que pueden influir en estos cambios, a partir de los valores inmunol´ogicos y algunas caracter´ısticas personales de 75 pares de madres e hijos. Palabras clave: leche materna, valores inmunol´ogicos, preprocesamiento, an´alisis estad´ıstico Clasificaci´on AMS: 62P10 ´ Indice Introducci´on 1 I. Marco te´orico: La leche materna y su composici´on 2 1. Inmunoglobulinas, citoquinas y adipoquinas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2 2. Composici´on de la leche materna . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3 3. Fases de la leche materna . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4 3.1.Elcalostro ............................................ 5 3.2. Leche de transici´on . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5 3.3.Lalechemadura......................................... 6 II. Dise˜no y objetivos del experimento 7 1.Dise˜nodelexperimento......................................... 7 2.Objetivosdelestudio .......................................... 8 2.1. Objetivo 1: Comparaci´on entre los dos tiempos . . . . . . . . . . . . . . . . . . . . . . . . 8 2.2. Objetivo 2: Factores influyentes en la composici´on de la leche . . . . . . . . . . . . . . . . 8 III. Metodolog´ıa estad´ıstica 9 1. Estad´ıstica descriptiva . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9 2.An´alisisunivariante ........................................... 10 2.1. Prueba de la T de Student . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12 2.2.ModelosdeTobit ........................................ 13 2.3. Prueba de la Chi Cuadrado . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14 2.4.PruebadeFisher......................................... 15 2.5. Suma de rangos de Wilcoxon . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15 2.6. Prueba de rangos y signos de Wilcoxon . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16 3. An´alisis multivariante . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17 3.1. An´alisis de Factores M´ultiples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17 3.2.RandomForest.......................................... 18 IV. Resultados 20 Objetivo 1. Comparaci´on entre los dos tiempos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20 An´alisis descriptivo inicial y transformaci´on de los datos . . . . . . . . . . . . . . . . . . . . . 20 Comparaci´on entre los dos tiempos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 20 An´alisis de Factores M´ultiples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 Objetivo 2. Factores influyentes en la composici´on de la leche. . . . . . . . . . . . . . . . . . . . . . 26 An´alisis descriptivo inicial y transformaci´on de los datos . . . . . . . . . . . . . . . . . . . . . 26 ¿Es la dieta un factor influyente? . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26 Caracterizaci´on de los dos grupos de madres . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 3 V. Presentaci´on de resultados: Dashboard 33 Conclusiones 35 Referencias 36 Anexos 38 Anexo A. Resultados del Objetivo 1 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38 A.1. An´alisis descriptivo inicial . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38 A.2. Comparaci´on entre los dos tiempos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43 A.3. MFA para los dos tiempos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 45 A.4. MFA para el incremento entre tiempos . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48 Anexo B. Resultados del Objetivo 2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49 B.1. An´alisis descriptivo inicial . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49 B.2. Estudio longitudinal: peso, BMI e infecciones . . . . . . . . . . . . . . . . . . . . . . . . 51 B.3. Comparaci´on entre las dos dietas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 52 B.4. Gr´aficos de individuos del MFA para ver la relaci´on de los inmunotipos con la dieta y lasinfecciones......................................... 56 B.5. Comparaci´on entre los dos grupos de madres (con outliers) . . . . . . . . . . . . . . . . . 58 B.6. Comparaci´on entre los dos grupos de madres (sin outliers) . . . . . . . . . . . . . . . . . 62 ´ Indice de figuras 1. Partes que componen un boxplot . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10 2. Gr´afico de los individuos en la primera y segunda dimensiones (MFA de dos tiempos) . . . . 22 3. Gr´afico de los individuos en la primera y segunda dimensiones en el d´ıa 7 (MFA de dos tiempos)................................................ 23 4. Representaci´on parcial de los individuos en la primera y segunda dimensiones (MFA de dos tiempos)................................................ 24 5. Medidas para el ´arbol con madres outliers . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31 6. Medidas para el ´arbol sin madres outliers . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31 7. Captura de pantalla de una pesta˜na del dashboard del primer objetivo . . . . . . . . . . . . . 33 8. Captura de pantalla de una pesta˜na del dashboard del segundo objetivo . . . . . . . . . . . . 34 9. Boxplots m´ultiples: Comparaci´on entre antes y despu´es de la transformaci´on . . . . . . . . . 43 10. MFA para los dos tiempos: Porcentajes de variabilidad explicados por cada dimensi´on . . . . 45 11. MFA para el incremento entre tiempos: Porcentajes de variabilidad explicados por cada dimensi´on ................................................ 48 12. MFA para el incremento entre tiempos: Gr´afico de los individuos (1a y 2a dimensiones) . . . 48 13. Boxplots m´ultiples: Comparaci´on entre antes y despu´es de la transformaci´on (variables num´ericas)................................................ 50 14. Boxplots de la evoluci´on del ´ındice de masa corporal a lo largo de los meses . . . . . . . . . . 51 15. Boxplots del peso a lo largo de los meses . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 51 16. Boxplots de las infecciones a lo largo de los meses . . . . . . . . . . . . . . . . . . . . . . . . . 52 17. Relaci´on de la dieta con los inmunotipos en el gr´afico de individuos . . . . . . . . . . . . . . . 56 18. Relaci´on de las infecciones de los 0 a los 6 meses despu´es del parto con los inmunotipos en elgr´aficodeindividuos........................................ 56 19. Relaci´on de las infecciones de los 0 a los 12 meses despu´es del parto con los inmunotipos en elgr´aficodeindividuos........................................ 57 20. Relaci´on de las infecciones de los 0 a los 24 meses despu´es del parto con los inmunotipos en elgr´aficodeindividuos........................................ 57 ´ Indice de tablas 1. Variables con diferencias entre el d´ıa 7 y el d´ıa 15 . . . . . . . . . . . . . . . . . . . . . . . . . 21 2. Distribuci´on de las madres seg´un los dos inmunotipos . . . . . . . . . . . . . . . . . . . . . . 27 3. Variables con diferencias entre los grupos de madres (con outliers) . . . . . . . . . . . . . . . 28 4. Variables con diferencias entre los grupos de madres (sin outliers) . . . . . . . . . . . . . . . . 29 5. Porcentaje de ceros por variable . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38 6. Estad´ısticos iniciales (immunoglubinas, citoquinas y adipoquinas) . . . . . . . . . . . . . . . . 39 7. Estad´ısticos iniciales (variables calculadas) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40 8. Estad´ısticos despu´es de la transformaci´on (immunoglubinas, citoquina y adipoquinas) . . . . 41 9. Estad´ısticos despu´es de la transformaci´on (variables calculadas) . . . . . . . . . . . . . . . . . 42 10. Resultados de las pruebas para la comparaci´on entre los dos tiempos (immunoglubinas) . . . 43 11. Resultados de las pruebas para la comparaci´on entre los dos tiempos (citoquinas) . . . . . . . 44 12. Resultados de las pruebas para la comparaci´on entre los dos tiempos (adipoquinas) . . . . . . 44 13. Resultados de las pruebas para la comparaci´on entre los dos tiempos (variables calculadas) . 44 14. MFA para los dos tiempos: Contribuci´on de cada variable en cada una de las dimensiones . . 46 15. MFA para los dos tiempos: Correlaci´on de cada variable con cada una de las dimensiones . . 47 16. Estad´ısticos iniciales (variables num´ericas) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49 17. Estad´ısticos despu´es de la transformaci´on (variables num´ericas) . . . . . . . . . . . . . . . . . 50 18. Resultados de las pruebas para la comparaci´on entre las dos dietas (immunoglubinas) . . . . 52 19. Resultados de las pruebas para la comparaci´on entre las dos dietas (citoquinas) . . . . . . . . 53 20. Resultados de las pruebas para la comparaci´on entre las dos dietas (variables calculadas) . . . 54 21. Resultados de las pruebas para la comparaci´on entre las dos dietas (variables num´ericas) . . . 55 22. Resultados de las pruebas para la comparaci´on entre las dos dietas (contadores) . . . . . . . . 55 23. Resultados de las pruebas para la comparaci´on entre las dos dietas (variables categ´oricas) . . 55 24. Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (immunoglubinas) ............................................ 58 25. Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (citoquinas) ............................................... 59 26. Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (adipoquinas) ............................................... 59 27. Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (variablescalculadas) .......................................... 60 28. Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (variablesnum´ericas) .......................................... 61 29. Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (contadores) ................................................ 61 30. Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (variablescateg´oricas).......................................... 61 31. Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (inmunoglobulinas) ........................................... 62 32. Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (citoquinas) ................................................ 63 33. Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (adipoquinas) ............................................... 63 34. Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (variablescalculadas) .......................................... 64 35. Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (variablesnum´ericas) .......................................... 65 36. Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (contadores) ................................................ 65 37. Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (variablescateg´oricas).......................................... 65 7 Introducci´on La composici´on de la leche materna es un campo en continuo estudio; a pesar de haberse descubierto ya muchos de sus componentes, se sabe que a´un quedan muchos que siguen sin conocerse. Estos componentes van cambiando a medida que pasa el tiempo, desde que nace el beb´e hasta llegar a lo que se considera la ”leche madura”. En este estudio nos vamos a enfocar en lo que se conoce como la leche de transici´on, que empieza a generarse a partir del s´eptimo d´ıa despu´es del parto. En esta etapa hay valores inmunol´ogicos muy presentes, como la inmunoglugina IgA, que se encuentra en grandes concentraciones y ha sido la m´as estudiada a lo largo de los a˜nos. No obstante, hay otros valores, como las citoquinas o las adipoquinas, que se encuentran en menores concentraciones, y no suelen tenerse en cuenta en estudios como el que hemos realizado. Es por eso por lo que en este caso, se ha decido incluirlos. Este estudio tiene dos objetivos principales, que se explicar´an con m´as detenimiento en apartados posteriores. Por un lado, se quiere comprobar si hay diferencias en la composici´on de la leche de transici´on en dos momentos del tiempo distintos: el s´eptimo d´ıa despu´es del parto, y el decimoquinto d´ıa despu´es del parto. Por otro lado, se intentar´a determinar qu´e factores influyen en la composici´on de la leche materna. Para ello, hemos realizado este proyecto en colaboraci´on con el departamento de Bioqu´ımica y Fisiolog´ıa de la facultad de Farmacia y Ciencias de los Alimentos (Universidad de Barcelona), que nos ha proporcionado los datos y los conocimientos necesarios para llevar a cabo el estudio, con el instituto de Investigaci´on en Nutrici´on y Seguridad Alimentaria (INSA-UB) y con el Instituto de Agroqu´ımica y Tecnolog´ıa de los Alimentos (IATACSIC). Mi inter´es por el ´area de la bioestad´ıstica y la atractiva oportunidad de colaboraci´on en un estudio con datos reales, cuyos resultados van a ser relevantes para el ´area de estudio, ha sido lo que me ha motivado a escoger este estudio como Trabajo de Fin de M´aster. Este trabajo se divide en cuatro grandes partes. En la primera parte, se ha querido hacer una breve explicaci´on del marco te´orico del trabajo, desde una introducci´on a aquellos valores inmunol´ogicos que se van a contemplar en el estudio, hasta una descripci´on sobre la composici´on de la leche materna y sobre cada una de sus fases. En una segunda parte, se ha descrito c´omo se realiz´o el dise˜no del experimento, y se ha hecho una explicaci´on m´as extensa de los dos objetivos principales del estudio. La cuarta parte est´a dedicada a aquellas metodolog´ıas estad´ısticas que se han usado durante el estudio, haciendo una descripci´on de cada una de ellas y a˜nadiendo una breve explicaci´on de c´omo se puede realizar cada una de las t´ecnicas usando el software estad´ıstico R. En la quinta parte, se presentan los resultados obtenidos en cada uno de los objetivos, despu´es de aplicar las t´ecnicas convenientes de las descritas en el apartado anterior. Adem´as, se incluye una breve explicaci´on de c´omo se han presentado los resultados a los investigadores durante las reuniones que hemos tenido al largo de este estudio para hacer un seguimiento del trabajo realizado e incluir nuevas inquietudes que pudiesen surgir a medida que ´este avanzaba. Todo este trabajo se ha realizado mediante el software estad´ıstico R. 1 I. Marco te´orico: La leche materna y su composici´on Antes de entrar a la parte estad´ıstica del trabajo, conviene hacer una breve explicaci´on de los datos y variables que se van a estudiar en este estudio. En este estudio se van a estudiar diferentes variables que componen la leche materna, as´ı como ciertas caracter´ısticas de las madres y sus hijos durante la etapa de lactancia, para comprobar si la composici´on de la leche en la etapa de transici´on varia entre per´ıodos cortos de tiempo y si hay factores que afecten a dicha composici´on. Debemos saber, antes que nada, que la lactancia materna es el proceso por el que la madre alimenta a su hijo reci´en nacido a trav´es de sus senos, que segregan leche inmediatamente despu´es del parto, que deber´ıa ser el principal alimento del beb´e al menos hasta los dos a˜nos[21]. La leche materna humana se considera la nutrici´on ideal para los reci´en nacidos, ya que no solo contiene los nutrientes necesarios para su crecimiento y desarrollo, sino que tambi´en numerosos factores bioactivos que contribuyen a los efectos beneficiosos de la lactancia materna. Todav´ıa no se han descubierto la totalidad de estos factores, y de hecho la lista cada vez es m´as larga, pero incluye hormonas, factores de crecimiento y citoquinas, entre otros [9]. De hecho, la alimentaci´on exclusiva con leche materna durante los primeros 6 meses de vida, con la lactancia materna continua durante 1 a 2 a˜nos de vida o m´as, se reconoce como el est´andar normativo para la alimentaci´on infantil [6]. Una vez definido en qu´e consiste la lactancia materna, conviene saber qu´e etapas tiene y de qu´e se compone la leche materna. De esta forma tendremos un marco te´orico que nos ayudar´a a comprender mejor los resultados estad´ısticos obtenidos en el estudio. Se cree que un beb´e nace sin microbios en su tracto intestinal, pero dentro de las 24 horas posteriores al nacimiento, ´este est´a poblado. Durante esta transici´on la leche materna juega un papel protector, y contin´ua la exposici´on del beb´e al sistema inmunol´ogico de la madre que empez´o antes del nacimiento [1]. La composici´on de la leche que se segrega cambia notablemente durante el proceso de lactancia, sobretodo durante las dos primeras semanas de vida del beb´e. De hecho, la leche materna se considera un l´ıquido inteligente, ya que se adapta a las necesidades del beb´e en funci´on de sus necesidades nutricionales y su etapa de crecimiento. Es por eso por lo que la Organizaci´on Mundial de la Salud recomienda hacer una lactancia exclusiva de leche materna hasta los seis meses, y luego combinarla con alimento hasta los dos a˜nos. A continuaci´on se van a definir aquellos valores inmunol´ogicos m´as relevantes para el estudio, y seguidamente se va a hacer una explicaci´on de la composici´on de la leche en general, y seguidamente de dicha composici´on en cada una de las fases que conforman este proceso de lactancia. 1. Inmunoglobulinas, citoquinas y adipoquinas En este estudio se ha querido estudiar la concentraci´on de las inmunoglobulinas y de algunas citoquinas y adipoquinas en la composici´on de la leche durante la etapa de transici´on de la leche, que se definir´a m´as adelante. Por lo tanto es conveniente hacer una breve explicaci´on de dichos grupos de compuestos. Antes de eso, conviene decir que, en la literatura, los valores m´as estudiados son los de las inmunoglobulinas, en especial la inmunoglobulina IgA. Aun as´ı, en este estudio se han querido incluir las citoquinas y las adipoquinas, a pesar de estar presentes en concentraciones muy bajas. La informaci´on sobre los niveles maternos de marcadores inmunitarios a los que puede estar expuesta la descendencia se obtiene mediante an´alisis de sangre que se realizan durante el embarazo. Estos marcadores, 2 III. Metodolog´ıa estad´ıstica En este apartado se va a hacer una explicaci´on detallada de aquellas t´ecnicas que posteriormente se aplicar´an para dar respuesta a los dos objetivos descritos. Las t´ecnicas estad´ısticas que se han usado son las siguientes: la representaci´on gr´afica de variables mediante los boxplots, pruebas param´etricas para la significaci´on estad´ıstica (en concreto, la prueba de la T de Student, los modelos Tobit y la prueba de la Chi cuadrado), pruebas no param´etricas para la significaci´on estad´ıstica (en este caso, la prueba de Wilcoxon) y t´ecnicas de an´alisis multivariante, en concreto el an´alisis de factores m´ultiples y el Random Forest. Estas t´ecnicas se han aplicado de formas distintas en funci´on del objetivo que se persiguiera en cada caso. A continuaci´on, se hace una explicaci´on detallada para entender en qu´e consiste cada una de las t´ecnicas, c´omo se han aplicado en cada caso y de qu´e forma se pueden reproducir usando el software estad´ıstico R. 1. Estad´ıstica descriptiva Un primer paso en todo an´alisis estad´ıstico es el de hacer un an´alisis descriptivo inicial. Hay que tener en cuenta que este an´alisis no puede ser igual para las variables num´ericas que para las categ´oricas, ya que de las variables categ´oricas, a pesar de poder observar el n´umero de registros que hay en cada nivel de la variable, no se puede observar c´omo se distribuyen. En cambio, para las variables numericas si que se puede observar, y de hecho es importante hacerlo, su distribuci´on. Para ello, lo m´as com´un es calcular algunos estad´ısticos, como pueden ser la media, la mediana o la desviaci´on est´andar, que ayudan a entender el comportamiento y distribuci´on de cada variable. En el caso de este estudio, se han calculado los siguientes estad´ısticos para cada una de las variables num´ericas del estudio: el n´umero de observaciones, la media, la desviaci´on est´andar, la mediana, el m´ınimo, el m´aximo y el error est´andar. Aun as´ı, tambi´en es muy habitual el uso de m´etodos gr´aficos. A pesar que hay muchos m´etodos, como por ejemplo los histogramas, en este estudio se ha decidido hacer uso de los boxplots. Los boxplots, o diagramas de cajas, son una forma estandarizada de mostrar la distribuci´on de una base de datos basada en cinco estad´ısticos: el m´ınimo, los tres primeros cuartiles y el m´aximo. Adem´as, da informaci´on sobre los outliers, es decir, valores que difieren significativamente del resto. En la figura que se presenta a continuaci´on se puede visualizar su forma y las partes que lo componen. Como se puede ver en el gr´afico, en un boxplot se muestran los valores outliers en forma de bolas, que aparecer´an siempre fuera de la caja y el bigote (que es la l´ınea que une el m´aximo y m´ınimo con la caja, y que se muestra en azul). El m´ınimo aparece en el extremo izquierdo del bigote, y se trata del valor observado m´as peque˜no. Yendo hacia la derecha, aparece el primer cuartil (o percentil 25), que es el n´umero medio entre el m´ınimo y la mediana; as´ı pues, el 25 % de los datos est´an por debajo de este valor. La mediana, que es la l´ınea amarilla de dentro de la caja, indica el valor que est´a en la mitad de los datos, es decir, aquel que deja el 50 % de datos por debajo y el 50 % por encima. Cierra la caja el tercer cuartil, o percentil 75, que deja el 75 % de los datos por debajo y es el valor que est´a en la mitad entre la mediana y el m´aximo. El m´aximo aparece en el extremo derecho, y es el valor observado m´as grande que no se puede determinar como outlier. Aunque en ocasiones el determinar que un valor es outlier (o at´ıpico) y no un m´aximo o un m´ınimo es una cuesti´on subjetiva, normalmente se considera que es un valor at´ıpico cuando se encuentra a m´as de 1,5 veces la distancia del rango intercuart´ılico (que es la amplitud de la caja) del primer o del tercer cuartil (at´ıpico leve), como se muestra en el gr´afico, o a 3 veces esa distancia (at´ıpico extremo). 3https://ichi.pro/es/comprension-de-los-diagramas-de-caja-103551522880849 9 Figura 1: Partes que componen un boxplot 3 As´ı pues, gracias a los boxplots se puede tener informaci´on sobre si los datos est´an bien distribuidos, es decir, la dispersi´on de los datos, y sobre los valores at´ıpicos que aparecen, pero tambi´en sobre la simetr´ıa de los datos, as´ı como de qu´e tan bien se agrupan y si est´an sesgados (y, en el caso que lo est´en, c´omo se sesgan). La dispersi´on de los datos viene dada por el tama˜no de la caja; la simetr´ıa, por la posici´on de la mediana dentro de la caja; y el sesgo, por la largada de las colas (bigotes) de los boxplots. En el caso de este estudio, los boxplots van a tener dos funciones principales: Por un lado, mediante el graficado de los boxplots m´ultiples por cada grupo de variables (inmunoglobulinas, citoquinas, adipoquinas y variables calculadas) se va a visualizar la distribuci´on de los datos, ayud´andonos as´ı a determinar si los datos siguen una distribuci´on Normal o si, por contra, es necesaria alguna transformaci´on para normalizarlos; Por otro lado, se van a graficar los boxplots de cada una de las variables separ´andolas por un grupo de inter´es, que en este caso ser´a cada uno de los tiempos (d´ıa 7 y d´ıa 15) o cada una de las dietas. De esta forma, se van a poder ver las diferencias en la distribuci´on de una misma variable entre d´ıas o entre dietas, por ejemplo. Esto nos servir´a de apoyo a las pruebas param´etricas y no para´etricas que se hagan para determinar si hay diferencias entre los dos grupos. Los boxplots se pueden graficar de forma sencilla en R gracias a la funci´on boxplot, especificando la variable que se quiere estudiar y pudiendo cambiar distintos par´ametros como los colores o la direcci´on de los boxplots (horizontal o vertical). En el caso de que se quieran hacer en funci´on de otra variable, para por ejemplo comparar entre tiempos, basta con especificar ambas variables como se har´ıa en un modelo de regresi´on: boxplot(variable ~ variable grupo) Como ya se ha comentado, no se puede hacer uso de esta t´ecnica para las variables categ´oricas. 2. An´alisis univariante Las pruebas univariantes se centran en una caracter´ıstica o propiedad de los individuos de estudio. En este trabajo, se usar´an tanto pruebas param´etricas como pruebas no param´etricas, que servir´an para determinar si hay diferencias entre dos grupos de estudio, como se detallar´a a continuaci´on. 10 Por un lado, las pruebas param´etricas son una herramienta estad´ıstica que se utiliza para el an´alisis de los factores de la poblaci´on. En concreto, en el caso de este estudio servir´an para comparar si hay diferencias en las medidas de las diversas variables entre dos grupos, que ser´an o bien los dos tiempos o bien los dos tipos de dieta. Este tipo de pruebas se basan en la distribuci´on normal, y por lo tanto, se debe cumplir la condici´on de normalidad de los datos para que sus conclusiones sean fiables. Adem´as, los datos deben cumplir tambi´en con las condiciones de homocedasticidad (es decir, que la variabilidad entre las dos muestras sea uniforme, o dicho de otra forma, que sus varianzas se puedan considerar como iguales) e independencia de los errores (cosa que ocurre cuando los sujetos son asignados de forma aleatoria y se distribuyen de forma normal dentro de cada grupo). Para este estudio se van a utilizar dos pruebas param´etricas distintas: la prueba de la T de Student y los modelos Tobit (que, a pesar de no ser una prueba como tal, tambi´en necesita el cumplimiento de las hip´otesis que se han planteado en el p´arrafo anterior). Adicionalmente, para algunas de las variables se ha realizado la prueba de la chi cuadrado para la comparaci´on de proporciones, debido a que son variables que tan solo toman dos posibles valores (1 si ha sido observado el hecho, y 0 en caso contrario). Concretamente, se va a usar la prueba T de Student para todas las variables excepto para las que forman parte del grupo de las citoquinas. El motivo de esta decisi´on es que en las citoquinas hay un n´umero muy elevado de ceros y en estos casos los modelos Tobit son mas adecuados, como se ver´a a continuaci´on. Adem´as, para aquellas variables que se puedan considerar binarias o contadores (como por ejemplo, si hay o no hay infecci´on) se va a hacer un contraste de proporciones. La hip´otesis nula a contrastar en dichas pruebas es la siguiente: No hay diferencias entre los dos grupos en la variable. Por lo tanto, si se obtiene un p-valor significativo en alguna de las variables, se podr´a asumir que hay diferencias entre los dos grupos de estudio (ya sean los dos tiempos, o las dos dietas). Para todas las pruebas param´etricas realizadas, se ha determinado un nivel de confianza del 95 %, por lo que se va a considerar que una variable es estad´ısticamente significativa cuando su p-valor sea inferior al nivel de significaci´on, igual a 0.05. Por otro lado, las pruebas no param´etricas (o de distribuci´on libre) son aquellas que se aplican a datos que no tienen una organizaci´on normal. La mayor´ıa de las pruebas no param´etricas se basan en la ordenaci´on de las medidas obtenidas, como se ver´a a continuaci´on. Aunque en el caso de este estudio se ha aplicado la transformaci´on correspondiente para poder determinar que los datos siguen una distribuci´on normal, se ha hecho la prueba no param´etrica de forma adicional, lo que nos permitir´a adem´as comparar los resultados de una prueba param´etrica con los que se obtendr´ıan con la prueba no param´etrica. En este caso se ha decidido trabajar con las pruebas de Wilcoxon, que son la alternativa a la prueba T de Student para cuando las poblaciones tienen una distribuci´on que no satisface las condiciones necesarias para hacer una prueba param´etrica. Dichas pruebas trabajan sobre rangos de orden, lo que quiere decir que utiliza las posiciones que ocupan los datos una vez ordenados, por lo que solo es aplicable a variables que tienen valores ordenables. En el caso de estas pruebas, la hip´otesis nula a contrastar dice que No hay diferencias en las medianas de los dos grupos. Por lo tanto, la interpretaci´on es la misma que en el caso de las pruebas param´etricas: si una variable es significativa asumiremos que hay diferencias entre los dos grupos de estudio. 11 En el caso de querer hacer la prueba para muestras independientes, se har´a la prueba de la suma de rangos de Wilcoxon; en cambio, si se quiere hacer sobre datos apareados, la opci´on a escoger es la prueba de rangos y signos de Wilcoxon. Por lo tanto, el procedimiento que se sigue en cada caso es distinto, como se ver´a a continuaci´on. A continuaci´on se va a hacer una explicaci´on de todas las t´ecnicas de an´alisis univariante que se han aplicado. 2.1. Prueba de la T de Student Esta prueba se utiliza para comprobar la igualdad de las medias de dos muestras, o si la media de una muestra es igual a una media te´orica determinada. En el caso de este estudio, se van a realizar dos tipos de pruebas distintos: una para datos apareados, y otra para muestras independientes. En el caso de la comparaci´on entre tiempos se usar´a la prueba para datos apareados, ya que de cada una de las madres se tiene informaci´on de ambos tiempos, por lo que se tienen las medidas de una misma variable dos veces para cada madre (una medida a d´ıa 7 y otra a d´ıa 15). En cambio, en el caso de la comparaci´on entre las dos dietas, se va a realizar la prueba para muestras independientes, ya que cada una de las madres ha seguido uno de los dos tipos de dietas, por lo que de cada madre solo se tendr´a una medida. Aun as´ı, el proceso que se sigue para la realizaci´on de la prueba es el mismo. Primero se deben establecer las hip´otesis a testear: la hip´otesis nula, como se ha comentado anteriormente, es la que considera que no hay diferencia o cambio, por lo que afirma que no hay diferencias entre los grupos. Por otra parte, la hipotesis alternativa considera que el valor real de la media de un grupo es distinto (o superior o inferior, aunque en el caso de este estudio no se usar´an) al valor real de la media del otro grupo. El segundo paso es el del c´alculo del estad´ıstico. En el caso de las muestras independientes, el estad´ıstico t se calcula de la siguiente forma: t=¯ X1−¯ X2 qσ2 1 N1 σ2 2 N2 (1) Donde ¯ X1y¯ X2son las medias en cada grupo; σ2 1yσ2 2son las varianzas del primer y el segundo grupo, respectivamente; y N1yN2es el n´umero de observaciones en cada grupo. En cambio, en el caso de las muestras apareadas, para calcular el estad´ıstico se debe, primero, calcular la diferencia entre las dos muestras (es decir, obtener una nueva variable que sea la diferencia entre la medida del primer grupo y la del siguiente). Una vez obtenida esta diferencia, la f´ormula a seguir para el c´alculo del estad´ıstico es la siguiente: t=¯ XD SD √N (2) Donde ¯ XDes la media de las diferencias; SDes la desviaci´on est´andar de las diferencias; y Nes el n´umero de pares de observaciones. Una vez se tiene el valor del estad´ıstico, se puede proceder buscando dicho valor en la tabla de la T de Student, en funci´on de los grados de libertad que se tengan. Dichos grados de libertad se calculan, en el caso de las muestras independientes, como (N1−1) ∗(N2−1) y, en el caso de muestras apareadas, como N−1. 12 Por lo tanto, basta con relacionar los grados de libertad con el nivel se significaci´on que se est´e considerando en la tabla de la T de Student, y comparar dicho valor con el del estad´ıstico obtenido. Con esto encontraremos el valor cr´ıtico para rechazar la hip´otesis nula, por lo que si el valor del estad´ıstico tque se ha obtenido es mayor que dicho valor cr´ıtico, se rechazar´a la hipotesis nula. Aun as´ı, esta prueba se puede aplicar muy f´acilmente con el software R, usando la funci´on t.test. En ella, adem´as, se puede especificar si se est´a realizando una prueba para muestras independientes o apareadas, mediante el par´ametro paired = , que ser´a TRUE si la prueba es para datos apareados y FALSE en caso contrario. 2.2. Modelos de Tobit Los modelos de regresi´on Tobit son modelos lineales para datos censurados. Por lo tanto, antes de entrar en el detalle de c´omo funciona un modelo Tobit, es conveniente definir qu´e son los datos censurados. Se considera que los datos est´an censurados cuando existe un determinado l´ımite en la variable respuesta a partir del cual a todas las observaciones se les asigna un mismo valor. Hay distintos motivos por los que podemos encontrar datos censurados; uno de ellos es que el instrumento de medida tiene un l´ımite de detecci´on por debajo de lo cual todo valor se considera cero. En el caso de este estudio, por definici´on las variables correspondientes al grupo de las citoquinas tienen una concentraci´on muy baja en la leche materna, como ya se ha visto en apartados anteriores; ´este es el motivo de que la mayor parte de las medidas que se toman sobre variables de este grupo sean iguales a cero. Cuando eso pasa, debido al gran n´umero de valores cero que se tienen, no es conveniente realizar una prueba como la T de Student, ya que los valores iguales a cero pueden provocar un sesgo muy grande, ya que pueden hacer que, a pesar de que la variable que nos interesa estudiar tenga una distribuci´on determinada, los valores que realmente se observen en la muestra no sean representativos. Es por eso por lo que se ha propuesto la alternativa que se presenta en esta secci´on, que son los modelos de Tobit. El objetivo del modelo es describir la relaci´on entre una variable dependiente no negativa y una variable independiente; en el caso de este estudio, por lo tanto, queremos describir la relaci´on entre cada una de las variables del grupo de las citoquinas y los distintos tiempos o las distintas dietas, seg´un el objetivo. Lo que se hace en estos modelos es definir una nueva distribuci´on para la variable censurada a partir de una variable aleatoria original subyacente, que se denominar´a como variable latente, y que aqu´ı se denotar´a como y∗ i. Esta variable latente depende linealmente de la variable independiente que se considere para el modelo (xi) a trav´es de un vector que determina la relaci´on entre ellas, y que denotaremos β. Adem´as, tambi´en se tiene en cuenta un t´ermino de error uipara captar las influencias aleatorias de la relaci´on. Por lo tanto, la variable latente se definir´a como: y∗ i=βxi+ui(3) Es importante tener en cuenta que el coeficiente βno se interpreta como el efecto de xisobre yi, si no que se interpreta como la combinaci´on del cambio en yide aquellos por encima del l´ımite, ponderados por la probabilidad de estar por encima del l´ımite, y el cambio en la probabilidad de estar por encima del l´ımite, ponderado por el valor esperado de yisi es superior 4. 4https://es.wikipedia.org/wiki/Modelo Tobit 13 A partir de esta variable latente, se obtendr´a la nueva distribuci´on de la variable censurada, como: yi=(y∗ isi y∗ i>0 0si y∗ i≤0(4) De esta forma, la nueva variable tomar´a el valor de la variable latente en caso de que ´esta sea superior a cero, y cero en caso contrario. Este modelo se puede aplicar en R usando la funci´on tobit. En este caso, no hay un par´ametro concreto para definir si la muestra es apareada o no lo es; por lo tanto, en el caso de las muestras apareadas, lo que se hace es calcular una nueva variable con la diferencia de las medidas en los distintos grupos (los dos d´ıas, en el caso de este estudio) y hacer la inferencia con una regresi´on que tan solo tiene en cuenta el t´ermino independiente. Por lo tanto, la notaci´on a usar en el caso de muestras apareadas ser´ıa la siguiente: tobit(dif\~~1,left=0,dist='gaussian'); y la que se usar´ıa en el caso de muestras independientes ser´ıa tobit(variable dependiente\~~variable grupo,left=0,dist='gaussian'). En la formulaci´on que se ha especificado, el par´ametro left corresponde al l´ımite inferior de la censura de la variable dependiente, y dist a la distribuci´on que se asume para la variable dependiente, que en este caso se ha determinado como la gaussiana. 2.3. Prueba de la Chi Cuadrado Para aquellas variables categ´oricas y/o binarias del estudio, como las infecciones en distintos tiempos, se ha usado una prueba de independencia basado en la Chi Cuadrado, que consiste en la comparaci´on de proporciones. En estas pruebas, la hip´otesis nula que se plantea es que no existen diferencias entre las proporciones de las poblaciones. Por lo tanto, sigue el mismo esquema que el visto con las dos pruebas anteriores: si una variable es significativa, querr´a decir que hay diferencias entre las proporciones de los distintos grupos. El estad´ıstico que permite hacer dicho contraste es se basa en la Chi cuadrado, y se basa en los valores observados y los esperados. Los esperados se calculan multiplicando las frecuencias marginales y dividendo el producto por n. Estas Eij son estimaciones de las frecuencias absolutas que cabr´ıa esperar en cada casilla bajo el supuesto de que la proporci´on de ´exitos es la obtenida a partir del total de observaciones muestrales sin considerar diferencias entre los dos grupos. El c´alculo del estad´ıstico se hace mediante la siguiente f´ormula: χ2= 2 X j=1 2 X i=1 (Oij −Eij)2 Eij (5) Donde Oij se refiere a los valores observados y Eij a los esperados. Adem´as, irecorre los individuos del primer grupo y jlos del segundo, de forma que I es el n´umero total de individuos en el primer grupo y J el n´umero de individuos del segundo. Dicho estad´ıstico presenta una distribuci´on Chi cuadrado con (I−1) ∗(J−1) grados de libertad. El proceso para determinar el rechazo o aceptaci´on de la hip´otesis nula es el mismo que en el caso de la T de Student, aunque en este caso haciendo uso de la tabla de la Chi Cuadrado: se relacionan los grados de libertad con el nivel se significaci´on que se est´e considerando en la tabla, y se compara dicho valor con el del estad´ıstico obtenido, encontrando as´ı el valor cr´ıtico para rechazar la hip´otesis nula, de forma que si el valor del estad´ıstico es mayor que el valor cr´ıtico, se rechazar´a la hipotesis nula. 14 De nuevo, esta prueba se puede hacer mediante R usando la funci´on prop.test. En este caso, la funci´on necesita dos par´ametros: la tabla de contingencia entre las dos variables (la variable dependiente y la variable con los grupos) y la tabla de frecuencias para la variable dependiente. Otra opci´on para la realizaci´on de la prueba des de R es mediante la funci´on chisq.test; en este caso, tan solo hace falta especificar la tabla de contingencia entre las dos variables que se quieren comparar. 2.4. Prueba de Fisher Igual que la prueba de la Chi Cuadrado, la prueba de Fisher se usa cuando se quiere estudiar si existe asociaci´on entre dos variables cualitativas (si las proporciones de una variable son diferentes dependiendo del valor que tenga la otra variable). En este caso, es un test exacto, y es m´as preciso que la prueba de la Chi Cuadrado u otros tests de independencia cuando el n´umero de eventos esperado por cada grupo es peque˜no. Para poder realizar esta prueba, se deben cumplir las condiciones de aleatoriedad (el muestreo debe haber sido aleatorio), del tama˜no de la muestra (que debe ser menor al 10 % del total de la poblaci´on) y adem´as cada observaci´on debe contribuir ´unicamente a uno de los niveles. En este caso, el p-valor se calcula a partir de la tabla de contingencia entre ambas variables categ´oricas. Concretamente, se calcular´a como: p=(a+b)!(c+d)!(a+c)!(b+d)! a!b!c!d!(6) Donde el signo de exclamaci´on (!) se refiere al operador factorial, a se corresponde con el recuadro superior izquierdo de la tabla de contingencia (por lo tanto, el n´umero de individuos que son del primer grupo de la primera variable y del primer grupo de la segunda), b el recuadro superior derecho (por lo tanto, el n´umero de individuos que son del primer grupo de la primera variable y del segundo grupo de la segunda), c el inferior izquierdo (por lo tanto, el n´umero de individuos que son del segundo grupo de la primera variable y del primer grupo de la segunda) y d el inferior derecho (por lo tanto, el n´umero de individuos que son del segundo grupo de la primera variable y del segundo grupo de la segunda). En R se puede realizar esta prueba mediante la funci´on fisher.test, y solo necesita como par´ametro la tabla de contingencia entre las dos variables categ´oricas. 2.5. Suma de rangos de Wilcoxon Esta prueba no param´etrica tambi´en se puede llamar como la prueba de la U de Mann-Whitney. Como ya se ha comentado, es ´util cuando se tienen dos muestras independientes. Por lo tanto, son muestras que pueden no tener el mismo tama˜no. La prueba se usa para comprobar la heterogeneidad de dos muestras, es decir, si las dos muestras proceden de poblaciones equidistintas (si se pueden considerar iguales o no). La idea principal de la prueba es que, si proceden de la misma poblaci´on, al juntar todas las observaciones y ordenarlas de menor a mayor, cabr´ıa esperar que las observaciones de ambas muestras estuviesen intercaladas aleatoriamente, en lugar de agruparse de modo que las observaciones de una de las pruebas quedasen por encima de las de la otra. Para realizar esta prueba, primero se deben juntar todas las observaciones, ordenarlas y asignarles un n´umero de posici´on (des del 1 hasta el n´umero de observaciones que se tengan). En caso de haber valores repetidos, se les asigna como valor de posici´on la media de las posiciones que ocupan. Seguidamente se calcula el rango para cada uno de los grupos, como el sumatorio de las posiciones que pertenezcan a cada grupo. 15 A continuaci´on se calculan los estad´ısticos U, en base al n´umero de observaciones de cada muestra y del rango. En concreto, se calcular´a un estad´ıstico para cada muestra, de la siguiente manera: U1=n1n2+n1(n1+ 1) 2−R1(7) U2=n1n2+n2(n2+ 1) 2−R2(8) Donde n1yn2son el n´umero de observaciones de la primera y la segunda muestra, respectivamente, y R1 yR2el sumatorio de los rangos de la primera y la segunda muestra, respectivamente. Una vez se ha obtenido el estad´ıstico para cada uno de los grupos, se procede al c´alculo del estad´ıstico U final, como el m´ınimo entre los dos estad´ısticos calculados anteriormente. El proceso para determinar sise debe rechazar o no la hipotesis nula es similar al que se ha visto en las pruebas param´etricas. Se debe mirar el valor de la tabla U de Mann-Whitney, y si el estad´ıstico U es menor que el valor correspondiente en la tabla, la diferencia entre las dos muestras es significativa (y, por lo tanto, hay diferencias entre los dos grupos). En R se puede realizar este test mediante la funci´on wilcox.test, especificando las dos muestras y si se quieren tener en cuenta las dos colas (de forma que se mirar´a si las dos muestras son diferentes) o solo una de ellas (comprobando si una es mayor o menor que la otra), cosa que se puede especificar mediante el par´ametro alternative, que en este caso ser´a igual a two-sided ya que queremos comprobar la diferencia de muestras. 2.6. Prueba de rangos y signos de Wilcoxon Como ya se ha comentado, esta prueba es el equivalente a la prueba T de Student para datos apareados, aunque en lugar de trabajar con las medias trabaja con las medianas. Para llevarla a cabo, igual que pasaba en la prueba de la T de Student primero se debe calcular la diferencia en valor absoluto de cada par de observaciones. Seguidamente, se ordenan estas diferencias y a cada una se le asigna el valor de su posici´on, des de 1 hasta el n´umero de pares de observaciones que se tengan. Igual que en la prueba de suma de rangos, en caso de haber empates se les asigna la media de las posiciones que ocupan. Adem´as, se crea otra variable con el signo de la diferencia: si es m´as grande el valor de la primera muestra, tomar´a valor 1, y en caso contrario, -1. A continuaci´on, se calcula la suma de rangos con signo positivo (1) y, por otro lado, la suma de rangos con signo negativo (-1). Con eso, se calcula el valor del estad´ıstico W, como el m´ınimo entre el sumatorio de los rangos con signo positivo y la suma de los rangos con signo negativo. En este caso, se puede determinar el rachazo o aceptaci´on de la hipotesis nula de dos formas distintas: la primera, que se usa para tama˜nos de muestra peque˜nos (menores a 25 observaciones) se compara el valor del estad´ıstico con el valor de la tabla de Wilcoxon, y si el estad´ıstico cae dentro del intervalo correspondiente en la tabla para ese n´umero de observaciones, la diferencia no es significativa; y la segunda opci´on, que es la que usa R, es asumir que el estad´ıstico se distribuye de forma aproximadamente Normal, de forma que se calcula un nuevo estad´ıstico Z y se compara ´este con el valor de la tabla Normal para el nivel de significaci´on que se ha escogido, rechazando la hipotesis nula si el estad´ıstico calculado es menor que dicho valor. En R se puede realizar esta prueba mediante la misma funci´on que en el caso de la suma de rangos (wilcox.test), aunque en este caso se debe especificar el par´ametro paired = TRUE, y no se contempla el par´ametro referente a la alternativa. 16 3. An´alisis multivariante Para realizar un an´alisis multivariante de los datos, que sirve para la observaci´on y el an´alisis simult´aneos de m´as de una variable respuesta, existen distintas t´ecnicas. En el caso de este estudio, se ha decidido utilizar las t´ecnicas del An´alisis de Factores M´ultiples y el Random Forest. 3.1. An´alisis de Factores M´ultiples El An´alisis de Factores M´ultiples es una t´ecnica estad´ıstica ´util para analizar de forma simult´anea diversas variables. Por lo tanto, es un m´etodo de an´alisis de datos multiariantes, que sirve para resumir y visualizar una tabla de datos compleja en la que los individuos son descritos por varios conjuntos de variables (cuantitativas y / o cualitativas) estructuradas en grupos, teniendo en cuenta la contribuci´on de todos los grupos activos de variables para definir la distancia entre los individuos. El n´umero de variables en cada grupo puede diferir y la naturaleza de las variables (cualitativa o cuantitativa) puede variar de un grupo a otro, pero las variables deben ser de la misma naturaleza en un grupo determinado. Este an´alisis global, donde se consideran simult´aneamente m´ultiples conjuntos de variables, requiere equilibrar las influencias de cada conjunto de variables. Este m´etodo de an´alisis puede ser considerado una generalizaci´on de las t´ecnicas de An´alisis de Componentes Principales (PCA) y de An´alisis de Correspondencias M´ultiples (MCA). De hecho, su n´ucleo de MFA se basa en un an´alisis factorial (PCA en el caso de variables cuantitativas, MCA en el caso de variables cualitativas) en el que las variables se ponderan. Estos pesos son id´enticos para las variables del mismo grupo (y var´ıan de un grupo a otro). T´ecnicamente, MFA asigna a cada variable del grupo j, un peso igual al inverso del primer valor propio del an´alisis (PCA o MCA seg´un el tipo de variable) del grupo j. El objetivo del an´alisis es obtener una imagen integrada de las observaciones y de las relaciones entre los grupos de variables. Una de las aplicaciones del MFA la tenemos con los datos longitudinales, donde los individuos han sido medidos en diversas ocasiones a lo largo del tiempo. En este contexto existen dos posibles enfoques: Crear los grupos con las variables que se han medido en un mismo tiempo. De esta forma cada grupo representa un instante temporal. Crear un grupo para cada variable con todas las medidas de esa variable a los diferentes tiempos. Si tratamos con dos tiempos se puede calcular el incremento y representar los diferentes grupos de variables respecto al incremento. El MFA puede ser complementado por un grupo de variables suplementarias que no intervienen en la definici´on de los ejes pero pueden representarse en el espacio generado por ellos para visualizar una posible relaci´on entre las variables suplementarias y las dimensiones del MFA representadas por los ejes. En R, se puede realizar este an´alisis mediante la funci´on MFA. Con ello, obtendremos un conjunto de gr´aficos que nos servir´an para llegar a distintas conclusiones sobre el an´alisis. Un primer paso que debe seguirse es el de escoger el n´umero de dimensiones con las que se quiere trabajar. Cada dimensi´on explicar´a un determinado porcentaje de variabilidad de los datos, y queda a elecci´on del autor seleccionar el criterio a seguir para determinar el n´umero de dimensiones con las que trabajar. En este estudio, como se ver´a, las dimensiones no explicaban un porcentaje demasiado alto de variabilidad, por lo que nos hemos conformado con que se explicara como m´ınimo el 50 % de dicha variabilidad de los datos. Para saber el porcentaje de variabilidad que cada dimensi´on explica, se puede aplicar la funci´on fviz\_screeplot sobre el objeto MFA creado. Dicha funci´on devuelve un histograma que representa los porcentajes para cada dimensi´on. 17 Por otro lado, mediante la funci´on fviz\_mfa\_ind se consiguen los gr´aficos de los individuos. Esta funci´on tiene un par´ametro (axes) para determinar qu´e par de dimensiones se quieren graficar (ya que al ser un gr´afico en un plano solo es posible graficar dos dimensiones a la vez). Es por eso por lo que se grafican la primera y segunda dimensiones en un gr´afico, la tercera y la cuarta en otro, y as´ı consecutivamente hasta haber graficado todas las dimensiones escogidas. El gr´afico que se obtiene mediante esta funci´on representa cada uno de los individuos del estudio sobre las dimensiones; por lo tanto, se puede observar d´onde se posicionar´ıa cada uno de ellos en el plano. Esto es ´util para observar patrones de comportamiento entre individuos. Adem´as, se pueden graficar los grupos sobre las dimensiones (es decir, observar d´onde se posiciona cada uno de los grupos con respecto a las dimensiones). Esto nos ayudar´a a saber con qu´e dimensi´on est´a m´as relacionado cada uno de los grupos, o dicho de otra forma, cu´al es el grupo que mejor representa cada dimensi´on, ya que cuanto m´as cerca del eje de la dimensi´on est´e un grupo, m´as relac´on tiene con ´esta. Otro gr´afico que es ´util para llegar a conclusiones relevantes es el gr´afico de individuos parciales. En ´el se representa cada uno de los grupos en su posici´on sobre las dimensiones como en el caso de los gr´aficos de individuos, pero en este caso se a˜nade tambi´en la posici´on en la que estar´ıa cada individuo en el caso de tener en cuenta solo uno de los grupos. De esta forma, de cada individuo salen tantas flechas como grupos haya, y en el extremo de dicha flecha aparece un punto que ser´ıa la posici´on del individuo sobre las dimensiones en caso de tener en cuenta solo aqu´el grupo. Es importante recalcar, adem´as, que no todas las variables tienen el mismo peso sobre las dimensiones, por lo que es relevante observar tambi´en la contribuci´on de cada una de ellas sobre las dimensiones, as´ı como la correlaci´on entre cada variable y cada una de las dimensiones. Adicionalmente, en el gr´afico de los individuos se pueden colorear en funci´on de sus caracter´ısticas - por ejemplo, aplicar un color distinto en funci´on de la dieta que cada uno siga, o en funci´on de si ha sufrido o no una infecci´on. Con esto se puede ver si los individuos con las mismas caracter´ısticas se agrupan en el plano de las dimensiones y, por lo tanto, se comportan de forma similar, o no. De esta forma, con el conjunto de informaci´on que se puede observar sobre un objeto MFA, es posible observar comportamientos distintos entre los grupos e incluso entre individuos. Por lo tanto, eso nos es ´util para comprovar si hay una diferencia global entre los grupos, y no tan solo variable a variable como en el caso de las t´ecnicas anteriores. 3.2. Random Forest El m´etodo de Random Forest es un algoritmo de aprendizaje supervisado de predicci´on. Decimos que es un m´etodo de aprendizaje supervisado porque los resultados que se obtienen son conocidos previamente; es decir, en el conjunto de datos se tiene una caracter´ıstica objetivo para cada uno de los registros, que ser´a la que se quiere reproducir con el modelo. Por otra parte, es un m´etodo de predicci´on porque consiste en la elaboraci´on de un modelo predictivo: es ´util para la clasificaci´on, y tambi´en lo es para la regresi´on, permitiendo predecir tanto una variable categ´orica (en el caso de la clasificaci´on) como una variable num´erica (en el caso de la regresi´on). Un Random Forest consiste en la elaboraci´on de un conjunto de ´arboles de decisi´on, combin´andolos con bagging. El bagging es una de las formas que existen para construir un conjunto de modelos de machine learning; cada uno de ellos produce ua predicci´on diferente, y lo que hace el bagging es combinarlos para obtener una ´unica predicci´on. En este m´etodo se consigue que los errores se compensen entre s´ı entrenando cada modelo con subconjuntos del conjunto de entrenamiento, eligi´endolos aleatoriamente. 18 En el caso de este nuevo an´alisis, al analizar la representaci´on los individuos no se ve ninguna agrupaci´on como s´ı pasaba en el an´alisis de los dos tiempos. De hecho, de estos gr´aficos de individuos podemos sacar pocas conclusiones; tan solo ser´ıa relevante comentar que hay individuos outliers, como podr´ıa ser la madre 79, que queda distante de la nube de puntos tanto en la primera y segunda dimensiones como en la tercera.y cuarta. En cuanto a los grupos, de nuevo quedan representados sobre los ejes de forma distinta en funci´on de las dimensiones sobre las que estemos trabajando. Las adipoquinas y las citoquinas contribuyen m´as sobre la primera dimensi´on, en este orden. Por su parte, en la segunda y tercera dimensiones las variables m´as contribuyentes son las inmunoglobulinas y las adipoquinas, casi en el mismo porcentaje. Por ´ultimo, en la cuarta dimensi´on las citoquinas son las variables m´as contribuyentes. Si tenemos en cuenta la contribuci´on en el total de la primera y segunda dimensiones, las adipoquinas son las que tienen un porcentaje de contribuci´on mayor y, de hecho, es mucho mayor que el de los otros dos grupos. En cambio, si se analizan conjuntamente la tercera y cuarta dimensiones son las citoquinas las m´as contribuyentes, aunque con un porcentaje muy similar al del resto de grupos. En cuanto a la representaci´on parcial de los individuos, los gr´aficos que se obtienen en este caso no aportan mucha informaci´on, ya que se sobreponen los individuos y no se pueden sacar conclusiones visuales; es por eso por lo que no se van a incluir en este apartado. Sin embargo, se pueden visualizar en el Anexo. Finalmente, observando la contribuci´on de las distintas variables en cada dimensi´on se ha comprobado que en todas las dimensiones la variable que m´as contribuye forma parte del grupo de adipoquinas. Adem´as, si se estudia la correlaci´on de las variables con los ejes, como se ha hecho en el estudio anterior, se puede ver que las dos ´unicas variables con una correlaci´on alta (cos2 superior al 50 %) son la variable Adiponectin respecto a la dimensi´on 1, y la variable Leptin con respecto a la dimensi´on 2. ´ Estas son, de echo, las dos ´unicas variables que forman parte del grupo de las adipoquinas. As´ı pues, la conclusi´on general que podemos sacar del an´alisis de factores m´ultiples que tiene en cuenta el incremento entre los tiempos es que las adipoquinas tienen mucha variabilidad dentro de dicho incremento, y absorben casi toda la variabilidad de las dimensiones, por lo que quiz´as est´an escondiendo el comportamiento de las otras variables. Teniendo en cuenta que tan solo se dispone de dos variables del grupo de adipoquinas, se ha decidido realizar el mismo estudio eliminando el grupo de las adipoquinas, con el objetivo de ver si, haciendo eso, se puede sacar alguna conclusi´on m´as relevante con respecto a los otros grupos. Para este an´alisis tambi´en se han tenido en cuenta cuatro dimensiones. Al hacer los gr´aficos de los individuos, se ha visualizado una sola nube de puntos en cada uno de ellos; por lo tanto, no se detectan comportamientos distintos en los individuos en los distintos grupos. El grupo de las inmunoglobulinas contribuye m´as en explicar la primera y tercera dimensiones, mientras que el de las citoquinas explica un porcentaje superior en la segunda y cuarta dimensiones; por lo tanto, en este caso s´ı que se observa que hay grupos que dependen m´as en una u otra dimensi´on (recordemos que, incluyendo las adipoquinas, ´estas eran el grupo m´as contribuyente en todas las dimensiones exceptuando la cuarta). Si se analiza la contribuci´on global en la primera y segunda dimensiones, los porcentajes est´an muy igualados en ambos grupos, aunque es m´as contribuyente el de las citoquinas. En el caso de la tercera y cuarta dimensiones, hay m´as distancia entre ellos, siendo superior el de las inmunoglobulinas. Viendo el gr´afico parcial para los individuos, se observa que, en algunos de ellos, como en la madre 79 o la 40 en la primera y segunda dimensiones, el movimiento que se produce si solo se tiene en cuenta uno de los grupos es bastante grande; se detecta que en los individuos outliers este movimiento es mayor que en el caso de los individuos que est´an en el interior de la nube de puntos. 25 Por ´ultimo, en cuanto a la contribuci´on de las variables llama la atenci´on que, a pesar que en la cuarta dimensi´on el grupo predominante son las citoquinas, la variable que consigue contribuir m´as en ella es una inmunoglobulina, en concreto la IgM, con una contribuci´on muy superior a la del resto de variables y que casi duplica la de la segunda variable m´as importante. Por lo tanto, con esta propuesta tampoco se ha conseguido visualizar comportamientos que nos indiquen que haya diferencias entre los grupos a partir de los incrementos en el tiempo. Los resultados del an´alisis, al no presentar conclusiones relevantes, no se incluyen en el cuerpo del trabajo, pero s´ı que se pueden visualizar en el Anexo. Objetivo 2. Factores influyentes en la composici´on de la leche. El segundo objetivo del estudio era el de ver qu´e factores pod´ıan influ´ır en la composici´on de la leche materna. Para poder determinarlo se realizaron una serie de an´alisis que se ver´an a continuaci´on. An´alisis descriptivo inicial y transformaci´on de los datos En este objetivo se incluyeron en el estudio variables que en el objetivo anterior no se hab´ıan tenido en cuenta referentes a las caracter´ısticas de la madre y del beb´e, tales como la dieta que sigui´o la madre o el peso del beb´e (teniendo en cuenta su evoluci´on en distintos d´ıas), entre otras. Estas variables adicionales no son todas num´ericas, como s´ı que pasa en el objetivo anterior. Contamos tambi´en con algunas variables categ´oricas, como la dieta que sigui´o la madre, el g´enero del beb´e, el tipo de parto, si fue el primer parto de la madre o no y la existencia de animales en el n´ucleo familiar, otras variables que se pueden considerar bin´arias, relacionadas con el hecho de haber tenido o no infecciones en distintos momentos del tiempo, y otras que denominaremos como contadores, ya que determinan el n´umero de antibi´oticos o probi´oticos que la madre o el beb´e tomaron. En un primer an´alisis descriptivo sobre las nuevas variables num´ericas, basado en el graficado de los boxplots m´ultiples y el c´alculo de distintos estad´ısticos, se decidi´o que aquellas variables num´ericas tambi´en deb´ıan transformarse para asegurar que segu´ıan una distribuci´on Normal, y se hizo en base al mismo criterio de transformaci´on logar´ıtmica que el presentado en el objetivo anterior. Adicionalmente, se hizo un an´alisis descriptivo sobre aquellas variables de las que se ten´ıa informaci´on en distintos momentos del tiempo (concretamente, el ´ındice de masa corporal y el peso, de los que se ten´ıa informaci´on a los 7 dias, a los 15 dias, al mes, a los seis meses, al a˜no, a los 18 meses y a los dos a˜nos) y de las infecciones (de las que se ten´ıa informaci´on a los 6, 12 y 24 meses). Para ello, se grafic´o cada variable a lo largo del tiempo, tanto en nubes de puntos, a˜nadiendo una l´ınea de tendencia sobre la media, como mediante boxplots. Con ese estudio se pudo ver como, mientras el ´ındice de masa corporal no parece tener una tendencia clara a lo largo del tiempo, el peso va subiendo claramente a lo largo de los meses. En cuanto a las infecciones, se pudo comprobar que la distribuci´on de la variable en el medio a˜no es muy similar a la que tiene en el a˜no y, en cambio, a los dos a˜nos ya varia, pudiendo llegar a tener m´as infecciones, aunque la asimetr´ıa de los datos se mantiene en los tres tiempos. ¿Es la dieta un factor influyente? En un primer momento, se consider´o que aquella variable que m´as pod´ıan influir en la composici´on de la leche materna era el tipo de dieta. Concretamente, cada madre pod´ıa estar realizando un tipo de dieta, el tipo I o el tipo II, y se ten´ıa la sospecha de que esto influ´ıa en la composici´on de la leche. Es por eso por lo que se decidi´o hacer un an´alisis similar al que se hizo en la comparaci´on de los dos tiempos en el primer objetivo para ver si hab´ıa diferencias entre los dos tipos de dieta. 26 Concretamente, se realiz´o un test de la T de Student y un test de Wilcoxon para las variables del grupo de inmunoglobulinas, adipoquinas y las nuevas variables num´ericas a˜nadidas en el estudio; por otra parte, para las citoquinas tambi´en se realiz´o un test de Wilcoxon, aunque en este caso se escogi´o como prueba param´etrica el modelo de Tobit, igual que en el otro objetivo. En el caso de las variables que se pueden considerar contadores se realiz´o un contraste de proporciones, y para las variables categ´oricas una prueba de la Chi Cuadrado y una prueba de Fisher. Aun as´ı, esta idea no di´o los frutos que imagin´abamos, ya que no se encontraron diferencias en ninguna de las variables referentes a las inmunoglobulinas, citoquinas o adipoquinas. S´ı que se observ´o que la variable Ratio pro anti 7 y el tiempo de lactancia tienen diferencias en funci´on del tipo de dieta. Aun as´ı, podemos concluir que no hay diferencias en la composici´on de la leche en funci´on del tipo de dieta. Adicionalmente, se quiso ver si los dos grupos de madres que se definieron en el an´alisis de factores m´ultiples del Objetivo 1 estaban relacionados con la dieta; es decir, si la mayor´ıa de las madres de un grupo realizaban una de las dietas, y las del otro grupo la otra dieta. Para ello, se colorearon las distintas madres sobre el gr´afico de individuos obtenido en funci´on del tipo de dieta que segu´ıan, esperando ver un grupo de un color y el otro del otro. Aun as´ı, tampoco se consigui´o ver un patr´on que nos permita decir que los grupos que se encontraron est´en definidos por el tipo de dieta. Esta ´ultima prueba se realiz´o tambi´en para ver si el hecho de tener o no infecciones pod´ıa caracterizar los grupos, de forma que se defini´o una nueva variable para cada tiempo de infecci´on que en lugar de determinar el n´umero de infecciones, determinaba si habia habido o no infecci´on. Aun as´ı, se observ´o que, en ninguno de los tiempos en los que se observaron las infecciones, no hab´ıa relaci´on entre los dos grupos de madres y el hecho de haber sufrido o no infecciones. Caracterizaci´on de los dos grupos de madres Como se pudo observar en el Objetivo 1 mediante la realizaci´on del an´alisis de factores m´ultiples a dos tiempos, hay dos grupos de madres bien diferenciados y que adem´as tienen comportamientos distintos a lo largo del tiempo. En este apartado, se pretende ver en qu´e variables se pueden observar diferencias entre los dos grupos y qu´e caracter´ısticas tiene cada uno de ellos. Para ello, se han separado las madres en dos grupos, en funci´on de la nube de la Figura 2 a la que pertenecieran. Concretamente, se han definido dos inmunotipos; en cada uno de ellos, se incluyen las siguientes madres: Madres Inmunotipo 1 75 51 103 64 46 53 76 52 40 11 2 105 10 50 61 72 90 86 45 29 73 74 35 78 23 56 44 98 54 94 71 49 20 85 102 70 84 34 38 Inmunotipo 2 30 22 57 79 41 33 60 100 47 80 36 1 3 104 68 17 6 43 65 48 16 67 93 62 9 99 77 28 25 27 12 14 4 42 7 19 Tabla 2: Distribuci´on de las madres seg´un los dos inmunotipos 9 No obstante, y teniendo en cuenta que hay madres que no est´an concretamente dentro de ninguno de los inmunotipos - y que por lo tanto se pueden considerar como outliers - se ha decidido realizar dos veces el mismo estudio: una para los inmunotipos tal y como se han especificado en la tabla anterior, y otro sin tener en cuenta los outliers, de forma que, del inmunotipo 1, no se tendr´ıan en cuenta las madres 51 y 75, y del inmunotipo 2, no se tendr´ıan en cuenta las madres 41, 79, 57, 22 y 30. 9Elaboraci´on propia. 27 An´alisis bivariante: ¿en qu´e variables podemos considerar que los inmunotipos se comportan de forma distinta? Un primer an´alisis que se ha realizado para caracterizar los dos grupos, es el de ver qu´e diferencias hay entre ellos, o dicho de otra forma, en qu´e variables de las que se han incluido en el estudio se puede considerar que los inmunotipos se comportan de forma distinta. Este an´alisis se ha realizado teniendo en cuenta las mismas pruebas que se usaron en el caso del an´alisis bivariante para la comparaci´on de dietas. Dichas pruebas se aplicaron dos veces: una para los datos con valores outliers, y otra sin ellos. Los resultados que se han obtenido no son iguales para los dos conjuntos de datos; aunque hay variables que son estad´ısticamente significativas en ambos casos, no es as´ı en todas. Las tablas que se muestran a continuaci´on presentan un resumen de aquellas variables significativas en cada caso. Variable IC 95 % p-valor (param´etrico) p-valor (no param´etrico) Immunoglubinas Immuno IgG1 7 (1.132,1.575) 2,83E-19 2,65E-12 Immuno IgG 7 (1.196,1.675) 8,01E-18 2,51E-15 Immuno IgG 15 (-1.666,-1.138) 2,04E-16 1,17E-14 Immuno IgG1 15 (-1.706,-1.145) 2,22E-15 1,26E-11 Immuno IgG2 7 (0.882,1.359) 1,10E-13 7,17E-11 Immuno IgE 7 (0.004,0.006) 1,72E-12 3,51E-13 Immuno IgG2 15 (-1.014,-0.589) 1,08E-10 1,25E-08 Immuno IgG4 7 (0.434,0.75) 1,59E-09 4,19E-09 Immuno IgG3 7 (0.367,0.677) 3,81E-09 1,44E-09 Immuno IgE 15 (-0.003,-0.002) 1,66E-08 7,46E-11 Immuno IgG4 15 (-0.668,-0.344) 8,60E-08 3,10E-08 Immuno IgG3 15 (-0.801,-0.414) 1,59E-07 1,27E-11 Citoqunias Cito IL18 7 0,00 0,00 Cito IL22 15 0,00 0,00 Cito IL22 7 0,00 0,00 Cito IL10 15 0,01 0,00 Cito IL12 15 0,01 0,01 Adipoquinas Leptin 7 (-1.25,-0.369) 0,00 0,00 Adiponectin 15 (-0.892,-0.228) 0,00 0,00 Vars. calculadas Immuno Th1 7 (1.171,1.654) 0 0 Immuno Th1 15 (-1.642,-1.11) 0 0 Immuno Th2 7 (0.434,0.75) 0 0 Immuno Th2 15 (-0.643,-0.317) 0 0 Ratio L A 15 (0.047,0.135) 0 0 Ratio L A 7 (-0.083,-0.013) 0,01 0 Ratio Innate acquired 15 (-2.703,-0.346) 0,01 0,02 Pro infl 7 (-1.309,-0.118) 0,02 0,01 pct Th1 7 (-0.033,-0.002) 0,03 0,14 Anti infl 7 (-1.879,-0.057) 0,04 0,02 Vars. num´ericas Altura 7D (0.011,0.047) 0 0,01 Weight 7D (0.009,0.096) 0,02 0,02 Altura 15D (0.003,0.042) 0,02 0,04 Weight 15D (0.008,0.099) 0,02 0,03 Altura 1 MM (0.001,0.042) 0,04 0,05 Contadores Infections 0 24M 0,02 Vars. categ´oricas Primipara 0,03 0,02 Tabla 3: Variables con diferencias entre los grupos de madres (con outliers)10 10Elaboraci´on propia. 28 Variable IC 95 % p-valor (param´etrico) p-valor (no param´etrico) Immunoglubinas Immuno IgG 7 (1.321,1.671) 2,80E-24 3,65E-19 Immuno IgG1 7 (1.192,1.554) 3,91E-23 2,64E-12 Immuno IgG2 7 (1.023,1.36) 1,79E-21 3,69E-12 Immuno IgG 15 (-1.552,-1.159) 6,81E-21 1,46E-16 Immuno IgG1 15 (-1.576,-1.156) 1,08E-19 6,78E-12 Immuno IgE 15 (-0.003,-0.002) 2,33E-16 9,73E-12 Immuno IgE 7 (0.004,0.006) 3,51E-15 1,39E-12 Immuno IgG3 7 (0.464,0.701) 2,72E-14 7,91E-11 Immuno IgG2 15 (-0.982,-0.597) 1,39E-11 4,77E-09 Immuno IgG4 7 (0.423,0.709) 8,63E-10 7,32E-09 Immuno IgG3 15 (-0.605,-0.347) 4,44E-09 7,93E-11 Immuno IgG4 15 (-0.668,-0.34) 5,21E-07 5,75E-08 Citoqunias Cito IL22 15 1,33E-05 9,30E-06 Cito IL22 7 0,00 0,00 Cito IL18 7 0,00 0,03 Cito IL10 15 0,01 0,00 Cito IL18 15 0,02 5,03E-05 Cito IL6 7 0,03 0,02 Cito TNF a 7 0,04 0,00 Adipoquinas Leptin 7 (-1.224,-0.332) 0,00 0,00 Adiponectin 15 (-0.732,-0.107) 0,01 0,02 Vars. calculadas Immuno Th1 7 (1.297,1.651) 0,00 0,00 Immuno Th1 15 (-1.524,-1.124) 0,00 0,00 Immuno Th2 7 (0.423,0.709) 0,00 0,00 Immuno Th2 15 (-0.638,-0.309) 0,00 0,00 Ratio L A 15 (0.038,0.126) 0,00 0,00 Ratio L A 7 (-0.088,-0.014) 0,01 0,00 pct Th1 15 (0.003,0.048) 0,03 0,38 Pro infl 7 (-1.206,-0.059) 0,03 0,03 Ratio Innate acquired 15 (-2.883,-0.09) 0,04 0,05 Cito Th1 7 (0.006,1.123) 0,048 0,00 Vars. num´ericas Altura 7D (0.011,0.048) 0,00 0,01 Weight 7D (0.004,0.094) 0,03 0,04 Weight 15D (0.004,0.1) 0,04 0,06 Vars. categ´oricas Primipara 0,03 0,02 Tabla 4: Variables con diferencias entre los grupos de madres (sin outliers)11 Como hemos comentado, hay variables que son significativas en ambos an´alisis, pero las hay que lo son tan solo en uno de ellos. Por una parte, las inmunoglobulinas que se han detectado como significativas en el estudio con outliers tambi´en han salido significativas en el estudio que no los tiene en cuenta, igual que pasa con las adipoquinas. En cambio, la citoquina IL12 en el tiempo 15 tan solo es significativa cuando se tienen en cuenta los outliers, mientras que la IL18 en el d´ıa 15 y la IL6 y la TNF, ambas en el d´ıa 7, tan solo lo son cuando se eliminan los outliers del estudio. En cuanto a las adipoquinas, ninguna de ellas es significativa en ninguno de los casos, por lo que no hay diferencias entre los inmunotipos de madres en este grupo de variables. Por otro lado, si observamos los resultados de las variables calculadas vemos como, mientras que el porcentaje de Th1 es significativo en el estudio con outliers en el d´ıa 7, en el estudio sin estos valores lo es en el d´ıa 15. Adem´as, hay dos variables m´as que tan solo son significativas en uno de los estudios: el Anti infl en el tiempo 7, que lo es en el estudio con outliers, y el Th1 para las citoquinas en el d´ıa 7, que lo es en el otro. 11Elaboraci´on propia. 29 La altura y el peso son variables con significaci´on en ambos estudios, la primera a d´ıa 7 y la segunda tanto a d´ıa 7 como a d´ıa 15. Aun as´ı, si se incluyen los outliers en el estudio, la altura tambi´en es significativa a d´ıa 15 y al mes, y adem´as, en este caso tambi´en son significativas las infecciones de los cero a los veinticuatro meses. Por ´ultimo, el hecho de ser el primer parto de la madre o no (variable primipara) es significativo en ambos casos, lo que significa que los dos inmunotipos no se comportan igual en esta variable. Random Forest: ¿qu´e variables determinan la pertenencia a un inmunotipo u a otro? Para poder caracterizar los inmunotipos, se ha realizado un Random Forest - de nuevo, para los dos conjuntos de datos: uno con outliers y otro sin ellos. Con eso lo que se pretende es observar qu´e variables son importantes a la hora de determinar a que inmunotipo corresponde una madre. Para ello, se ha separado cada conjunto de datos en dos, de forma que se ha obtenido un conjunto de datos de entrenamiento y uno de testeo para cada estudio. Esto se ha hecho de forma aleatoria, y se han seleccionado 2/3 de los datos para el conjunto de entrenamiento, y el tercio restante para el de testeo. Con los conjuntos de entrenamiento, se han realizado dos estudios mediante el Random Forest. A continuaci´on, usando el conjunto de testeo, se ha comprobado si el modelo obtenido consigue predecir correctamente los datos. Como se ha comentado en el apartado de metodolog´ıa, se ha hecho una imputaci´on de los valores faltantes usando la media ponderada o las categor´ıas m´as populares, dependiendo de la clase de la variable, ya que el Random Forest no se puede realizar si hay valores faltantes en alguna de las variables. En ambos modelos, a partir del vig´esimo ´arbol obtenido, aproximadamente, el error es constante (aunque se han realizado 100 ´arboles, realmente el error en los ochenta ´ultimos es aproximadamente el mismo), as´ı que los modelos a partir de este punto no mejoran. Adem´as, en los dos - tanto el modelo que tiene en cuenta los outliers como el que no los tiene en cuenta - el porcentaje de aciertos conseguido ha sido muy elevado - de hecho, del 100 % al predecir los datos de testeo. Por lo tanto, podemos considerar que hemos conseguido dos modelos que consiguen predecir correctamente a qu´e inmunotipo pertenece cada madre. Adem´as, con la cross-validation que se ha hecho se ha comprobado que la bondad de la predicci´on se mantiene, por lo que sea cual sea el conjunto de datos de entrenamiento que elijamos, la predicci´on sigue siendo igual de buena. Hay dos medidas importantes que se pueden obtener al hacer un Random Forest: el Accuracy( o precisi´on del modelo) y la medida del ´ındice de Gini. Por un lado, la medida de precisi´on es una medida del grado en que una variable mejora la precisi´on del bosque al predecir la clasificaci´on. Los valores m´as altos significan que la variable mejora la predicci´on. En un sentido aproximado, se puede interpretar como una muestra de la cantidad de aumento en la precisi´on de la clasificaci´on que se obtiene al incluir la variable en el modelo. La medida del ´ındice de Gini, por otro lado, es una medida de desorden, y se interpreta de la siguente forma: a mayor medida, mayor importancia tiene la variable en el modelo creado (ya que valores pr´oximos a cero implican un mayor desorden y valores pr´oximos a uno, un menor desorden). Teniendo eso en cuenta, se ha elaborado una tabla que contiene las diez variables m´as importantes en cada uno de los modelos, y que por lo tanto, son las que mejor discriminan entre los dos inmunotipos. Las medidas para cada uno de los modelos que se han efectuado se muestran en los siguientes gr´aficos: 30 Figura 5: Medidas para el ´arbol con madres outliers12 Figura 6: Medidas para el ´arbol sin madres outliers13 Como se puede ver en los gr´aficos, las variables varian de un modelo a otro, tanto en una medida como en la otra. Por lo tanto, dependiendo de si se deciden incluir o no las madres que parecen alejarse de la nube de puntos, las conclusiones que se obtendr´an de este an´alisis ser´an distintas, ya que las variables importantes a la hora de determinar a qu´e grupo pertenece cada madre cambiaran. Este m´etodo nos ha servido para corroborar la caracterizaci´on de los dos inmunotipos; los resultados que se han obtenido son los esperados, ya que coinciden con los resultados del an´alisis de factores m´ultiples mediante el que se visualizaron los inmunotipos, y dicho an´alisis se realiz´o teniendo en cuenta los valores 12Elaboraci´on propia. 13Elaboraci´on propia. 31 inmunol´ogicos, que son las variables que han salido con m´as importancia en el Random Forest. Por lo tanto, no nos interesaban tanto estas variables como las que quedan en segundo plano, que son las de las caracter´ısticas de las madres y los beb´es, ya que esas no se usaron a la hora de definir los inmunotipos. Es relevante, pues, observar que hay otras variables que ayudan a caracterizar los dos inmunotipos. 32 V. Presentaci´on de resultados: Dashboard Como ya se ha comentado, este estudio se ha hecho en colaboraci´on con el departamento de Bioqu´ımica y Fisiolog´ıa de la facultad de Farmacia y Ciencias de los Alimentos (Universidad de Barcelona), el instituto de Investigaci´on en Nutrici´on y Seguridad Alimentaria (INSA-UB) y el Instituto de Agroqu´ımica y Tecnolog´ıa de los Alimentos (IATA-CSIC). Los resultados que se presentan en este trabajo corresponden a los an´alisis estad´ısticos que se han realizado para dar forma a los datos con los que est´an trabajando des de estos departamentos, y poder dar una respuesta estad´ıstica a las preguntas que se formulaban. Con la finalidad de presentar los resultados del estudio de una forma m´as din´amica y visual a los compa˜neros, se han elaborado dos dashboards - uno correspondiente al primer objetivo del estudio, y otro al segundo - que se han ido presentando a los compa˜neros y que han servido para compartir los avances del estudio y futuras propuestas. Dichos dashboards se han realizado des del mismo software R, y contienen, en pesta˜nas distintas, los resultados que se han conseguido en cada uno de los an´alisis realizados. En concreto, en el dashboard del primer objetivo se muestra, en una primera pesta˜na, la base de datos completa. En la siguiente pesta˜na, se puede ver un an´alisis descriptivo de todas las medidas inmunol´ogcas estudiadas en este objetivo, antes y despu´es de aplicarles la transformaci´on logar´ıtmica mediante la que se ha conseguido normalizar los datos. Por otro lado, se pueden ver los resultados de las pruebas bivanriantes para comparar las medidas del d´ıa 7 y del d´ıa 15, tanto num´ericos como gr´aficos, por lo que se presenta tanto la tabla con los p-valores de les pruebas realizadas como los boxplots comparativos entre los dos tiempos. Finalmente, en una ´ultima pesta˜na se presentan los resultados de los tres an´alisis de factores m´ultiples que se han realizado - el an´alisis para los dos tiempos, el an´alisis para el incremento entre tiempos y el an´alisis para el incremento entre tiempos sin tener en cuenta el grupo de las adipoquinas. A continuaci´on se adjunta una imagen de muestra de una de las pesta˜nas de este dashboard, concretamente la perteneciente al an´alisis bivariante de las inmunoglobulinas (aunque no se puede mostrar la p´agina completa por falta de espacio): Figura 7: Captura de pantalla de una pesta˜na del dashboard del primer objetivo14. Como se puede observar, se ha seleccionado la pesta˜na ¸Comparaciones 7 vs 15 dias”; dentro de este nivel, se desglosan cuatro pesta˜nas adicionales, cada una correspondiente a un grupo de variables (inmunoglubinas, citoquinas, adipoquinas y variables calculadas) de forma que el usuario puede decidir sobre cu´al de ellos quiere ver la comparaci´on. Dicho desglose se encuentra tambi´en en el caso de la pesta˜na ”Descriptiva”. 14Elaboraci´on propia. 33 En el caso del MFA, el desglose permite al usuario ver una peque˜na descripci´on de la t´ecnica, as´ı como ver los resultados de los tres an´alisis realizados (para los dos tiempos, para el incremento entre tiempos y ´este ´ultio sin incluir las adipoquinas). Estos resultados se dividen en distintas secciones: resultados gr´aficos, tablas de contribuciones (que incluye la tabla con la contribuci´on de cada variable en cada una de las dimensiones y la tabla con la correlaci´on de las mismas con cada dimensi´on), variables factor map (donde se grafican las variables con una correlaci´on superior a 0.5 sobre las dimensiones) y variables cos2 >0.75 (donde se grafican las variables con una correlaci´on superior a 0.75 sobre las dimensiones, en caso de que haya alguna). Para el segundo objetivo, las dos primeras pesta˜nas contienen la misma informaci´on que en el anterior (a˜nadiendo las variables adicionales que se han tenido en cuenta tan solo en este objetivo, correspondientes a las caracter´ısticas de madres e hijos). En una tercera pesta˜na, se presentan los gr´aficos longitudinales, mediante los que se puede ver la evoluci´on del BMI, el peso y las infecciones a lo largo del tiempo. A continuaci´on, hay los resultados de las pruebas bivariantes para la comparaci´on entre los dos tipos de dieta; igual que en el primer objetivo, dichos resultados se presentan de forma num´erica y tambi´en gr´afica. Seguidamente, se muestra el gr´afico de individuos del an´alisis de factores m´ultiples realizado en el objetivo anterior, difereciando las madres seg´un la dieta o seg´un las infecciones en algun momento del tiempo. Finalmente, en las dos siguientes pesta˜nas se encuentra el an´alisis de caracterizaci´on de los dos inmunotipos de madres (tanto teniendo en cuenta todas las madres del estudio, como eliminando aquellas que se pueden considerar outliers por no estar bien definidas dentro de un grupo concreto). En ellas se encuentra el mismo estudio bivariante que el que se hizo para las dietas, pero esta vez para la comparaci´on entre los dos inmunotipos, adem´as de los resultados del Random Forest que se ha realizado en cada caso. Como en el caso del dashboard anterior, a continuaci´on se presenta una imagen con una de las pesta˜nas que se pueden encontrar en ´el: Figura 8: Captura de pantalla de una pesta˜na del dashboard del segundo objetivo15. En la imagen se puede observar la evoluci´on del ´ındice de masa corporal a lo largo del tiempo, tanto en un gr´afico que representa todos los individuos en cada tiempo y la l´ınea con la media, como con boxplots en cada tiempo. Como se puede observar, est´a dentro de la pesta˜na ”Descriptiva longitudinal”, donde tambi´en se puede encontrar el mismo an´alisis para el peso y para las infecciones. Adem´as, las pesta˜nas correspondientes a la descriptiva, al an´alisis de la dieta, al MFA o los an´alisis de los inmunotipos tienen, a su vez, varias secciones dentro que el usuario puede seleccionar. En este caso, hay m´as niveles porque se tienen m´as tipos de variables - ya que se incluyen las caracter´ısticas de la madre y del beb´e, que pueden ser num´ericas, categ´oricas, o las que hemos considerado como contadores -. 15Elaboraci´on propia. 34 N Media Desv. Est. Mediana M´ınimo M´aximo Error Est. Immuno IgG1 7 log 75 2,0 0,8 1,9 0,5 4,0 0,1 Immuno IgG2 7 log 75 1,7 0,8 1,7 0,5 3,4 0,1 Immuno IgG3 7 log 75 0,6 0,4 0,5 0,0 2,0 0,0 Immuno IgG4 7 log 75 0,5 0,5 0,3 0,0 1,9 0,1 Immuno IgE 7 log 75 0,0 0,0 0,0 0,0 0,0 0,0 Immuno IgA 7 log 75 6,9 0,7 7,0 3,5 7,8 0,1 Immuno IgM 7 log 75 4,3 1,1 4,4 1,4 7,2 0,1 Immuno IgG 7 log 75 2,5 0,9 2,8 1,1 4,5 0,1 Immuno IgG1 15 log 75 1,9 0,9 1,9 0,3 4,6 0,1 Immuno IgG2 15 log 75 1,4 0,6 1,4 0,2 2,7 0,1 Immuno IgG3 15 log 75 0,5 0,5 0,4 0,0 2,7 0,1 Immuno IgG4 15 log 75 0,4 0,4 0,2 0,0 1,5 0,0 Immuno IgE 15 log 75 0,0 0,0 0,0 0,0 0,0 0,0 Immuno IgA 15 log 75 6,6 0,5 6,6 3,5 7,8 0,1 Immuno IgM 15 log 75 3,9 1,3 3,9 1,1 7,2 0,2 Immuno IgG 15 log 75 2,4 0,9 2,4 0,8 4,9 0,1 Cito IL27 7 log 75 0,1 0,4 0,0 0,0 2,8 0,0 Cito IL1b 7 log 75 0,7 1,1 0,0 0,0 5,1 0,1 Cito IL2 7 log 75 0,3 0,8 0,0 0,0 3,5 0,1 Cito IL4 7 log 75 0,1 0,4 0,0 0,0 2,1 0,0 Cito IL5 7 log 75 0,2 0,6 0,0 0,0 2,8 0,1 Cito IL6 7 log 75 2,1 2,0 1,8 0,0 7,0 0,2 Cito IL10 7 log 75 0,3 0,7 0,0 0,0 3,8 0,1 Cito IL12 7 log 75 0,1 0,4 0,0 0,0 3,2 0,0 Cito IL13 7 log 75 0,0 0,2 0,0 0,0 1,4 0,0 Cito IL17 7 log 75 0,2 0,5 0,0 0,0 2,7 0,1 Cito Ifn.g 7 log 75 0,2 0,5 0,0 0,0 2,6 0,1 Cito GM.CSF 7 log 75 0,2 0,6 0,0 0,0 3,9 0,1 Cito TNF.a 7 log 75 0,9 0,8 1,0 0,0 3,1 0,1 Cito IL9 7 log 75 0,2 0,6 0,0 0,0 2,7 0,1 Cito IL23 7 log 75 0,2 0,5 0,0 0,0 2,4 0,1 Cito IL18 7 log 75 2,2 1,2 2,2 0,0 5,2 0,1 Cito IL21 7 log 75 1,5 1,2 1,2 0,0 5,3 0,1 Cito IL22 7 log 75 1,6 1,2 1,6 0,0 3,9 0,1 Cito IL27 15 log 75 0,1 0,6 0,0 0,0 4,9 0,1 Cito IL1b 15 log 75 0,4 1,1 0,0 0,0 6,2 0,1 Cito IL2 15 log 75 0,1 0,3 0,0 0,0 1,8 0,0 Cito IL4 15 log 75 0,0 0,1 0,0 0,0 0,5 0,0 Cito IL5 15 log 75 0,1 0,6 0,0 0,0 3,4 0,1 Cito IL6 15 log 75 1,4 1,8 0,0 0,0 6,7 0,2 Cito IL10 15 log 75 0,3 0,5 0,0 0,0 2,5 0,1 Cito IL12 15 log 75 0,1 0,1 0,0 0,0 0,5 0,0 Cito IL13 15 log 75 0,0 0,1 0,0 0,0 0,8 0,0 Cito IL17 15 log 75 0,1 0,3 0,0 0,0 1,5 0,0 Cito Ifn.g 15 log 75 0,3 0,7 0,0 0,0 3,3 0,1 Cito GM.CSF 15 log 75 0,0 0,2 0,0 0,0 1,5 0,0 Cito TNF.a 15 log 75 0,8 0,6 1,0 0,0 2,3 0,1 Cito IL9 15 log 75 0,1 0,2 0,0 0,0 1,6 0,0 Cito IL23 15 log 75 0,1 0,3 0,0 0,0 1,5 0,0 Cito IL18 15 log 75 2,5 1,3 2,7 0,0 6,0 0,2 Cito IL21 15 log 75 1,3 1,0 1,2 0,0 4,3 0,1 Cito IL22 15 log 75 1,5 1,1 1,7 0,0 4,3 0,1 Leptin 7 log 75 5,9 1,0 5,8 2,9 7,9 0,1 Adiponectin 7 log 75 9,2 0,8 9,3 7,0 10,8 0,1 Leptin 15 log 75 5,9 1,2 6,0 2,2 8,0 0,1 Adiponectin 15 log 75 9,2 0,8 9,3 6,7 11,8 0,1 Tabla 8: Estad´ısticos despu´es de la transformaci´on (immunoglubinas, citoquina y adipoquinas) 41 N Media Desv. Est. Mediana M´ınimo M´aximo Error Est. Ratio L A 7 log 75 0,1 0,1 0,0 0,0 0,4 0,0 Pro infl 7 log 75 3,4 1,3 3,3 1,0 7,0 0,2 Anti infl 7 log 75 2,2 2,0 1,9 0,0 7,0 0,2 Ratio pro anti 7 log 51 1,5 1,4 0,9 0,7 7,1 0,2 Cito Th1 7 log 75 1,5 1,3 1,1 0,0 5,2 0,1 Cito Th2 7 log 75 0,5 1,0 0,0 0,0 3,7 0,1 Cito Rto Th1 Th2 7 log 17 1,0 0,5 1,1 0,0 1,7 0,1 Th17 7 log 75 3,2 1,6 3,4 0,0 7,0 0,2 Th9 7 log 75 0,2 0,6 0,0 0,0 2,7 0,1 Hematopoyetic factors 7 log 75 0,3 0,8 0,0 0,0 4,0 0,1 Innate Immunity 7 log 75 2,6 1,8 2,3 0,0 7,0 0,2 Acquired immunity 7 log 75 0,6 1,1 0,0 0,0 4,0 0,1 Ratio Innate acquired 7 log 39 3,6 2,1 3,6 0,0 7,7 0,3 Immuno Th1 7 log 75 2,5 0,9 2,7 1,0 4,4 0,1 Immuno Th2 7 log 75 0,5 0,5 0,3 0,0 1,9 0,1 Immuno Rto Th1 Th2 7 log 75 3,4 0,8 3,3 1,7 5,0 0,1 pct Th1 7 log 75 4,6 0,0 4,6 4,4 4,6 0,0 pct Th2 7 log 75 1,6 0,6 1,6 0,5 3,0 0,1 pct Rto Th1 Th2 7 log 75 3,4 0,8 3,3 1,7 5,0 0,1 Ratio L A 15 log 75 0,1 0,1 0,0 0,0 0,6 0,0 Pro infl 15 log 75 3,1 1,4 3,1 0,2 6,9 0,2 Anti infl 15 log 75 1,4 1,8 0,1 0,0 6,7 0,2 Ratio pro anti 15 log 44 2,1 1,9 1,3 0,7 7,8 0,3 Cito Th1 15 log 75 1,3 1,2 1,0 0,0 6,2 0,1 Cito Th2 15 log 75 0,2 0,6 0,0 0,0 3,4 0,1 Cito Rto Th1 Th2 15 log 8 1,5 1,1 0,9 0,3 3,3 0,4 Th17 15 log 75 2,8 1,5 2,8 0,0 6,8 0,2 Th9 15 log 75 0,1 0,2 0,0 0,0 1,6 0,0 Hematopoyetic factors 15 log 75 0,2 0,6 0,0 0,0 3,4 0,1 Innate Immunity 15 log 75 1,9 1,7 1,6 0,0 6,8 0,2 Acquired immunity 15 log 75 0,4 0,7 0,0 0,0 2,7 0,1 Ratio Innate acquired 15 log 36 3,7 1,7 3,9 0,2 7,1 0,3 Immuno Th1 15 log 75 2,3 0,9 2,4 0,8 4,9 0,1 Immuno Th2 15 log 75 0,4 0,4 0,2 0,0 1,5 0,0 Immuno Rto Th1 Th2 15 log 75 3,4 0,9 3,4 1,7 5,5 0,1 pct Th1 15 log 75 4,6 0,0 4,6 4,4 4,6 0,0 pct Th2 15 log 75 1,5 0,6 1,5 0,3 3,0 0,1 pct Rto Th1 Th2 15 log 75 3,4 0,9 3,4 1,7 5,5 0,1 Tabla 9: Estad´ısticos despu´es de la transformaci´on (variables calculadas) 42 Figura 9: Boxplots m´ultiples: Comparaci´on entre antes y despu´es de la transformaci´on A.2. Comparaci´on entre los dos tiempos IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Immuno IgA (0.218,0.508) 3,93E-06 1,78E-11 Immuno IgE (0,0.002) 0,006 0,002 Immuno IgG2 (0.066,0.558) 0,014 0,005 Immuno IgM (0.011,0.805) 0,044 0,032 Immuno IgG (-0.168,0.513) 0,316 0,171 Immuno IgG4 (-0.096,0.221) 0,433 0,407 Immuno IgG3 (-0.098,0.203) 0,487 0,242 Immuno IgG1 (-0.257,0.409) 0,653 0,525 Tabla 10: Resultados de las pruebas para la comparaci´on entre los dos tiempos (immunoglubinas) 43 Q1 y Q3 para la diferencia (15-7) p-valor (modelo tobit) p-valor (Wilcoxon) Cito Ifn.g 0 0,003 0,216 Cito IL1b (-0.855,0) 0,004 0,015 Cito IL9 0 0,005 0,239 Cito IL6 (-2.491,0.253) 0,006 0,009 Cito IL10 (-0.142,0.04) 0,006 0,412 Cito IL18 (-0.465,1.307) 0,009 0,030 Cito IL17 0 0,019 0,163 Cito IL5 0 0,048 0,379 Cito IL12 (0,0.095) 0,056 0,584 Cito IL23 0 0,086 0,159 Cito IL2 0 0,154 0,005 Cito IL13 0 0,155 1,000 Cito TNF.a (-0.98,0.815) 0,299 0,230 Cito GM.CSF 0 0,308 0,090 Cito IL27 0 0,308 1,000 Cito IL4 0 0,308 0,114 Cito IL22 (-1.27,1.309) 0,491 0,942 Cito IL21 (-0.889,0.617) 0,756 0,198 Tabla 11: Resultados de las pruebas para la comparaci´on entre los dos tiempos (citoquinas) IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Adiponectin (-0.182,0.109) 0,622 0,905 Leptin (-0.224,0.233) 0,966 0,810 Tabla 12: Resultados de las pruebas para la comparaci´on entre los dos tiempos (adipoquinas) IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Anti infl (0.239,1.293) 0,005 0,006 Innate Immunity (0.209,1.158) 0,005 0,004 Cito Th2 (0.039,0.555) 0,025 0,026 Acquired immunity (0.029,0.563) 0,030 0,066 Th17 (-0.025,0.876) 0,064 0,024 Th9 (-0.025,0.27) 0,103 0,239 Pro infl (-0.067,0.696) 0,105 0,230 Hematopoyetic factors (-0.068,0.39) 0,165 0,184 Ratio pro anti (-1.281,0.33) 0,238 0,068 Cito Th1 (-0.18,0.588) 0,294 0,174 Immuno Th1 (-0.161,0.508) 0,305 0,158 Immuno Th2 (-0.082,0.232) 0,344 0,306 Ratio L A (-0.033,0.017) 0,510 0,710 pct Th1 (-0.009,0.014) 0,675 0,872 pct Rto Th1 Th2 (-0.255,0.17) 0,692 0,581 Immuno Rto Th1 Th2 (-0.255,0.17) 0,692 0,581 Cito Rto Th1 Th2 (-3.816,3.234) 0,756 1,000 pct Th2 (-0.141,0.171) 0,851 0,714 Ratio Innate acquired (-1.1,1.248) 0,896 0,829 Tabla 13: Resultados de las pruebas para la comparaci´on entre los dos tiempos (variables calculadas) 44 A.3. MFA para los dos tiempos Figura 10: MFA para los dos tiempos: Porcentajes de variabilidad explicados por cada dimensi´on 45 Dim.1 Dim.2 Dim.3 Dim.4 Immuno IgG 15 log 7,11 0,01 3,32 0,43 Immuno IgG1 15 log 7,00 0,00 3,21 0,19 Immuno IgG3 15 log 5,79 0,11 2,77 0,19 Immuno IgE 15 log 5,64 0,55 2,45 0,86 Cito Ifn.g 7 log 5,56 0,94 1,04 1,47 Immuno IgG2 15 log 5,17 0,00 2,68 1,97 Immuno IgG4 15 log 4,91 0,04 0,73 1,14 Cito IL18 7 log 3,46 0,04 0,05 0,87 Cito IL6 7 log 3,06 2,12 0,00 1,30 Cito IL22 7 log 2,99 0,04 0,40 3,64 Cito IL17 7 log 2,74 0,00 8,63 0,06 Immuno IgG1 7 log 2,65 8,25 0,00 0,00 Immuno IgG 7 log 2,64 8,96 0,02 0,03 Cito IL5 7 log 2,56 0,34 2,04 0,27 Leptin 7 log 2,55 0,57 0,32 5,04 Cito IL1b 7 log 2,40 3,60 0,45 0,02 Adiponectin 15 log 2,30 0,03 1,53 0,07 Cito IL10 7 log 2,14 2,83 0,98 0,43 Cito IL2 15 log 2,03 1,56 1,53 1,52 Immuno IgG2 7 log 2,03 8,92 0,09 0,06 Immuno IgE 7 log 2,02 8,17 0,07 0,17 Cito GM.CSF 7 log 1,96 0,00 9,47 0,96 Cito IL6 15 log 1,92 1,91 2,99 1,81 Cito IL1b 15 log 1,82 0,59 2,07 3,57 Immuno IgG4 7 log 1,68 7,32 0,05 0,01 Cito IL2 7 log 1,49 0,12 8,82 0,02 Cito IL23 15 log 1,46 0,09 4,32 1,94 Immuno IgG3 7 log 1,41 6,97 0,14 0,13 Cito IL10 15 log 1,40 2,03 2,23 0,55 Cito IL9 7 log 1,26 0,03 5,08 0,01 Cito IL13 7 log 1,24 0,00 6,46 2,41 Cito TNF.a 15 log 1,10 0,00 1,40 7,98 Cito IL13 15 log 0,89 3,08 0,90 0,46 Cito IL12 15 log 0,89 0,36 0,11 6,30 Cito IL27 7 log 0,76 0,10 8,23 1,73 Cito TNF.a 7 log 0,74 5,41 2,85 0,66 Cito IL22 15 log 0,53 3,98 0,25 0,31 Cito IL23 7 log 0,49 0,30 1,73 0,64 Cito IL17 15 log 0,43 1,64 1,16 0,52 Cito IL12 7 log 0,32 0,01 2,71 0,81 Immuno IgA 15 log 0,28 1,99 0,00 2,39 Cito Ifn.g 15 log 0,25 1,91 2,76 8,68 Cito GM.CSF 15 log 0,19 0,02 0,00 0,51 Cito IL9 15 log 0,14 0,03 0,04 0,01 Cito IL21 15 log 0,13 1,48 0,00 2,48 Cito IL27 15 log 0,12 0,03 0,00 0,01 Cito IL18 15 log 0,11 2,72 0,67 8,17 Immuno IgA 7 log 0,10 0,53 0,01 1,09 Cito IL4 7 log 0,04 2,08 0,42 0,74 Cito IL5 15 log 0,03 0,00 0,00 11,51 Cito IL21 7 log 0,02 1,37 0,97 4,47 Adiponectin 7 log 0,02 0,57 1,30 0,03 Cito IL4 15 log 0,01 0,22 0,45 1,54 Immuno IgM 7 log 0,00 1,34 0,09 0,00 Leptin 15 log 0,00 3,57 0,00 3,28 Immuno IgM 15 log 0,00 1,14 0,02 4,55 Tabla 14: MFA para los dos tiempos: Contribuci´on de cada variable en cada una de las dimensiones 46 Dim.1 Dim.2 Dim.3 Dim.4 Cito IL27 7 log 0,27 0,09 0,71 0,27 Cito IL1b 7 log 0,48 0,51 0,17 -0,03 Cito IL2 7 log 0,38 0,09 0,74 0,03 Cito IL4 7 log 0,07 0,39 0,16 -0,18 Cito IL5 7 log 0,49 0,16 0,36 0,11 Cito IL6 7 log 0,54 0,39 0,02 -0,23 Cito IL10 7 log 0,45 0,45 0,25 -0,13 Cito IL12 7 log 0,17 -0,03 0,41 0,18 Cito IL13 7 log 0,34 0,01 0,63 0,32 Cito IL17 7 log 0,51 0,01 0,73 0,05 Cito Ifn.g 7 log 0,73 0,26 0,25 0,25 Cito GM.CSF 7 log 0,43 0,01 0,77 0,20 Cito TNF.a 7 log 0,27 0,63 0,42 -0,16 Cito IL9 7 log 0,35 0,04 0,56 0,02 Cito IL23 7 log -0,22 0,15 0,33 -0,16 Cito IL18 7 log 0,57 0,06 -0,06 0,19 Cito IL21 7 log 0,04 0,32 0,25 -0,43 Cito IL22 7 log 0,53 -0,05 0,16 -0,39 Immuno IgG1 7 log -0,50 0,77 0,00 0,00 Immuno IgG2 7 log -0,44 0,80 -0,07 0,05 Immuno IgG3 7 log -0,37 0,71 -0,09 0,07 Immuno IgG4 7 log -0,40 0,73 0,06 -0,02 Immuno IgE 7 log -0,44 0,77 0,07 -0,08 Immuno IgA 7 log 0,10 0,20 0,03 -0,21 Immuno IgM 7 log -0,01 0,31 0,07 0,00 Immuno IgG 7 log -0,50 0,81 -0,03 0,03 Leptin 7 log 0,49 0,20 -0,14 -0,46 Adiponectin 7 log -0,04 0,20 -0,28 -0,03 Cito IL27 15 log -0,10 0,05 0,00 -0,02 Cito IL1b 15 log 0,41 0,21 -0,36 0,38 Cito IL2 15 log 0,44 0,33 0,31 0,25 Cito IL4 15 log 0,03 -0,12 -0,17 0,25 Cito IL5 15 log -0,05 0,00 -0,01 0,69 Cito IL6 15 log 0,42 0,37 -0,43 0,27 Cito IL10 15 log 0,36 0,38 -0,37 0,15 Cito IL12 15 log -0,29 0,16 -0,08 0,51 Cito IL13 15 log 0,29 0,47 -0,24 0,14 Cito IL17 15 log 0,20 0,34 -0,27 0,15 Cito Ifn.g 15 log 0,15 0,37 -0,41 0,60 Cito GM.CSF 15 log -0,13 -0,03 0,01 0,14 Cito TNF.a 15 log 0,32 0,01 -0,29 0,57 Cito IL9 15 log -0,11 0,05 -0,05 -0,02 Cito IL23 15 log 0,37 -0,08 0,51 0,28 Cito IL18 15 log -0,10 0,44 -0,20 0,58 Cito IL21 15 log -0,11 0,33 0,00 -0,32 Cito IL22 15 log -0,22 0,53 0,12 0,11 Immuno IgG1 15 log 0,81 -0,01 -0,44 -0,09 Immuno IgG2 15 log 0,70 0,01 -0,41 -0,28 Immuno IgG3 15 log 0,74 0,09 -0,41 0,09 Immuno IgG4 15 log 0,68 -0,06 -0,21 -0,22 Immuno IgE 15 log 0,73 0,20 -0,39 -0,19 Immuno IgA 15 log 0,16 0,38 0,01 -0,31 Immuno IgM 15 log 0,00 0,29 -0,04 -0,43 Immuno IgG 15 log 0,82 -0,02 -0,45 -0,13 Leptin 15 log -0,01 0,51 -0,01 -0,37 Adiponectin 15 log 0,47 0,04 -0,31 0,05 Tabla 15: MFA para los dos tiempos: Correlaci´on de cada variable con cada una de las dimensiones 47 A.4. MFA para el incremento entre tiempos Figura 11: MFA para el incremento entre tiempos: Porcentajes de variabilidad explicados por cada dimensi´on Figura 12: MFA para el incremento entre tiempos: Gr´afico de los individuos (1a y 2a dimensiones) 48 Anexo B. Resultados del Objetivo 2 B.1. An´alisis descriptivo inicial N Media Desv. Est. Mediana M´ınimo M´aximo Error Est. Gestational age 75 39,54 1,24 39,86 36,00 41,57 0,14 Pregnancy weight gain 75 11,83 4,28 12,00 -6,40 20,00 0,49 Pre-gestational BMI 75 22,63 3,34 21,89 17,61 35,76 0,39 Breastfeeding time 75 8,30 3,95 9,00 0,00 12,00 0,46 Exclusive breastfeeding 75 4,00 2,14 5,00 0,00 7,00 0,25 Birth weight 75 3,22 0,46 3,19 2,30 4,64 0,05 BMI Z-score at birth 75 -0,37 0,93 -0,38 -2,47 1,97 0,11 Weight 7D 73 3,21 0,42 3,19 2,40 4,32 0,05 BMI Z-score 7D 73 -0,60 0,88 -0,52 -2,32 1,56 0,10 Weight 15D 71 3,46 0,45 3,40 2,43 4,70 0,05 BMI Z-score 15D 71 -0,58 0,94 -0,63 -2,86 1,32 0,11 Weight 1 M 73 4,07 0,53 3,99 3,12 5,53 0,06 BMI Z-score 1 M 73 -0,66 0,96 -0,69 -3,36 1,68 0,11 Weight 2M 72 5,09 0,65 5,03 4,00 6,70 0,08 Weight 4M 72 6,37 0,72 6,31 4,70 7,80 0,09 Weight 6 MM 73 7,39 0,82 7,30 5,55 9,20 0,10 BMI Z-score 6M 73 -0,38 0,83 -0,44 -2,13 1,47 0,10 Weight 12 M 72 9,33 1,02 9,36 7,06 11,52 0,12 BMI Z-score 12 M 72 0,12 0,93 0,24 -2,21 2,10 0,11 Weight 18 M 75 10,71 1,14 10,75 8,50 13,96 0,13 BMI Z-score 18 M 75 0,30 0,92 0,32 -2,43 2,41 0,11 Weight 24M 32 12,09 1,47 11,56 10,30 16,00 0,26 BMI Z-score 24M 32 0,47 1,04 0,28 -1,46 2,44 0,18 Tabla 16: Estad´ısticos iniciales (variables num´ericas) 49 N Media Desv. Est. Mediana M´ınimo M´aximo Error Est. Gestational.age log 75 3,70 0,03 3,71 3,61 3,75 0,00 Pregnancy.weight.gain log 74 2,52 0,35 2,57 1,10 3,05 0,04 Pre.gestational.BMI log 75 3,15 0,13 3,13 2,92 3,60 0,02 Breastfeeding.time log 75 2,10 0,59 2,30 0,00 2,57 0,07 Exclusive.breastfeeding log 75 1,45 0,66 1,79 0,00 2,08 0,08 Birth.weight log 75 1,43 0,11 1,43 1,19 1,73 0,01 BMI.Z.score.at.birth log 58 -0,23 0,73 -0,20 -2,66 1,09 0,10 Weight.7D log 73 1,43 0,10 1,43 1,22 1,67 0,01 BMI.Z.score.7D log 48 -0,39 0,90 -0,23 -2,81 0,94 0,13 Weight.15D log 71 1,49 0,10 1,48 1,23 1,74 0,01 BMI.Z.score.15D log 51 -0,55 1,14 -0,30 -4,61 0,84 0,16 Weight.1.M log 73 1,62 0,10 1,61 1,42 1,88 0,01 BMI.Z.score.1.M log 46 -0,60 1,30 -0,22 -4,61 0,99 0,19 Weight.2M log 72 1,80 0,11 1,80 1,61 2,04 0,01 Weight.4M log 72 1,99 0,10 1,99 1,74 2,18 0,01 Weight.6.MM log 73 2,12 0,10 2,12 1,88 2,32 0,01 BMI.Z.score.6M log 56 -0,29 0,75 -0,18 -2,41 0,90 0,10 Weight.12.M log 72 2,33 0,10 2,34 2,09 2,53 0,01 BMI.Z.score.12.M log 61 0,19 0,60 0,32 -1,20 1,13 0,08 Weight.18.M log 75 2,46 0,10 2,46 2,25 2,71 0,01 BMI.Z.score.18.M log 69 0,18 0,76 0,35 -3,22 1,23 0,09 Weight.24M log 32 2,57 0,11 2,53 2,43 2,83 0,02 BMI.Z.score.24M log 29 0,30 0,71 0,48 -1,17 1,24 0,13 Tabla 17: Estad´ısticos despu´es de la transformaci´on (variables num´ericas) Figura 13: Boxplots m´ultiples: Comparaci´on entre antes y despu´es de la transformaci´on (variables num´ericas) 50 Figura 19: Relaci´on de las infecciones de los 0 a los 12 meses despu´es del parto con los inmunotipos en el gr´afico de individuos Figura 20: Relaci´on de las infecciones de los 0 a los 24 meses despu´es del parto con los inmunotipos en el gr´afico de individuos 57 B.5. Comparaci´on entre los dos grupos de madres (con outliers) IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Immuno IgG1 7 (1.132,1.575) 2,83E-19 2,65E-12 Immuno IgG 7 (1.196,1.675) 8,01E-18 2,51E-15 Immuno IgG 15 (-1.666,-1.138) 2,04E-16 1,17E-14 Immuno IgG1 15 (-1.706,-1.145) 2,22E-15 1,26E-11 Immuno IgG2 7 (0.882,1.359) 1,10E-13 7,17E-11 Immuno IgE 7 (0.004,0.006) 1,72E-12 3,51E-13 Immuno IgG2 15 (-1.014,-0.589) 1,08E-10 1,25E-08 Immuno IgG4 7 (0.434,0.75) 1,59E-09 4,19E-09 Immuno IgG3 7 (0.367,0.677) 3,81E-09 1,44E-09 Immuno IgE 15 (-0.003,-0.002) 1,66E-08 7,46E-11 Immuno IgG4 15 (-0.668,-0.344) 8,60E-08 3,10E-08 Immuno IgG3 15 (-0.801,-0.414) 1,59E-07 1,27E-11 Immuno IgM 7 (-0.257,0.77) 0,32 0,33 Immuno IgM 15 (-0.348,0.912) 0,37 0,25 Immuno IgA 15 (-0.215,0.3) 0,74 0,55 Immuno IgA 7 (-0.285,0.343) 0,86 0,82 Tabla 24: Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (immunoglubinas) 58 p-valor (tobit) p-valor (Wilcoxon) Cito IL18 7 0 0 Cito IL22 15 0 0 Cito IL22 7 0 0 Cito IL10 15 0,01 0 Cito IL12 15 0,01 0,01 Cito Ifn g 7 0,07 0,16 Cito IL17 7 0,09 0,12 Cito IL18 15 0,11 0 Cito IL5 7 0,12 0,11 Cito IL9 15 0,13 0,02 Cito IL9 7 0,14 0,09 Cito TNF a 15 0,15 0,02 Cito IL21 7 0,18 0,92 Cito GM CSF 7 0,18 0,14 Cito IL6 15 0,2 0,51 Cito TNF a 7 0,24 0,01 Cito IL6 7 0,24 0,01 Cito IL21 15 0,36 0,18 Cito IL1b 15 0,36 0,48 Cito IL10 7 0,41 0,7 Cito IL5 15 0,49 0,67 Cito IL1b 7 0,51 0,99 Cito Ifn g 15 0,52 0,65 Cito IL4 7 0,54 0,69 Cito IL2 15 0,54 0,52 Cito IL17 15 0,57 0,49 Cito IL2 7 0,62 0,78 Cito IL12 7 0,87 0,17 Cito IL27 7 0,87 0,95 Cito IL13 15 0,97 0,98 Cito IL23 7 1 0,02 Cito IL23 15 1 0,07 Cito GM CSF 15 1 0,35 Cito IL4 15 1 0,31 Cito IL13 7 NA 0,31 Cito IL27 15 NA 0,35 Tabla 25: Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (citoquinas) IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Leptin 7 (-1.25,-0.369) 0,000 0,000 Adiponectin 7 (-0.185,0.579) 0,308 0,270 Leptin 15 (-0.001,1.085) 0,050 0,013 Adiponectin 15 (-0.892,-0.228) 0,001 0,003 Tabla 26: Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (adipoquinas) 59 IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Immuno Th1 7 (1.171,1.654) 0 0 Immuno Th1 15 (-1.642,-1.11) 0 0 Immuno Th2 7 (0.434,0.75) 0 0 Immuno Th2 15 (-0.643,-0.317) 0 0 Ratio L A 15 (0.047,0.135) 0 0 Ratio L A 7 (-0.083,-0.013) 0,01 0 Ratio Innate acquired 15 (-2.703,-0.346) 0,01 0,02 Pro infl 7 (-1.309,-0.118) 0,02 0,01 pct Th1 7 (-0.033,-0.002) 0,03 0,14 Anti infl 7 (-1.879,-0.057) 0,04 0,02 Hematopoyetic factors 7 (-0.758,-0.009) 0,05 0,03 pct Th1 15 (0,0.04) 0,05 0,56 Cito Rto Th1 Th2 15 (-3.231,0.217) 0,07 0,11 Innate Immunity 15 (-1.488,0.067) 0,07 0,07 Th17 7 (-1.388,0.097) 0,09 0,11 Ratio pro anti 15 (-1.761,0.25) 0,14 0,92 Hematopoyetic factors 15 (-0.066,0.458) 0,14 0,41 Cito Th1 15 (-0.953,0.15) 0,15 0,05 Anti infl 15 (-1.467,0.24) 0,16 0,08 pct Th2 7 (-0.09,0.421) 0,2 0,14 Cito Th1 7 (-0.262,0.94) 0,26 0,02 Innate Immunity 7 (-1.263,0.385) 0,29 0,27 Pro infl 15 (-0.339,1.004) 0,33 0,17 Ratio pro anti 7 (-0.445,1.257) 0,34 0,96 Th9 7 (-0.391,0.145) 0,36 0,09 Immuno Rto Th1 Th2 7 (-0.502,0.197) 0,39 0,14 pct Rto Th1 Th2 7 (-0.502,0.197) 0,39 0,14 pct Th2 15 (-0.434,0.177) 0,4 0,56 Cito Th2 15 (-0.175,0.412) 0,42 1 Cito Th2 7 (-0.623,0.296) 0,48 0,62 Acquired immunity 15 (-0.407,0.21) 0,53 0,01 Th9 15 (-0.08,0.147) 0,55 0,02 Cito Rto Th1 Th2 7 (-0.428,0.671) 0,64 0,66 Ratio Innate acquired 7 (-1.085,1.66) 0,67 0,72 Immuno Rto Th1 Th2 15 (-0.339,0.506) 0,69 0,56 pct Rto Th1 Th2 15 (-0.339,0.506) 0,69 0,56 Th17 15 (-0.578,0.85) 0,7 0,68 Acquired immunity 7 (-0.554,0.44) 0,82 0,51 Tabla 27: Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (variables calculadas) 60 IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Altura 7D (0.011,0.047) 0 0,01 Weight 7D (0.009,0.096) 0,02 0,02 Altura 15D (0.003,0.042) 0,02 0,04 Weight 15D (0.008,0.099) 0,02 0,03 Altura 1 MM (0.001,0.042) 0,04 0,05 Peso tras embarazo (0.001,0.114) 0,05 0,08 BMI Z-score 1 M (-0.069,1.445) 0,07 0,01 BMI Z-score 15D (-0.076,1.228) 0,08 0,16 Altura (-0.005,0.038) 0,13 0,09 Pre-gestational BMI (-0.014,0.102) 0,14 0,29 BMI tras embarazo (-0.013,0.087) 0,14 0,14 Weight 1 M (-0.013,0.083) 0,15 0,13 BMI Z-score at birth (-0.108,0.667) 0,15 0,23 Birth weight (-0.015,0.084) 0,17 0,17 Gestational age (-0.004,0.024) 0,17 0,18 BMI Z-score 7D (-0.382,0.652) 0,6 0,32 Tabla 28: Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (variables num´ericas) p-valor (contraste proporciones) Infections 0 6M 0,85 Infections 0 12M 0,23 Infections 0 24M 0,02 AB 7d-2M (Infant) 0,93 IAB 0,61 PeAB 0,68 PrAB 0,21 AB7d-2M 0,06 Tabla 29: Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (contadores) p-valor (Chi cuadrado) p-valor (Fisher) Primipara 0,03 0,02 Breastfeeding level 0,06 0,06 Breastfeeding 0,12 0,1 Animals 0,53 0,56 Gender 0,87 0,82 Delivery 0,99 0,81 Tabla 30: Resultados de las pruebas para la comparaci´on entre los grupos de madres con outliers (variables categ´oricas) 61 B.6. Comparaci´on entre los dos grupos de madres (sin outliers) IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Immuno IgG 7 (1.321,1.671) 2,80E-24 3,65E-19 Immuno IgG1 7 (1.192,1.554) 3,91E-23 2,64E-12 Immuno IgG2 7 (1.023,1.36) 1,79E-21 3,69E-12 Immuno IgG 15 (-1.552,-1.159) 6,81E-21 1,46E-16 Immuno IgG1 15 (-1.576,-1.156) 1,08E-19 6,78E-12 Immuno IgE 15 (-0.003,-0.002) 2,33E-16 9,73E-12 Immuno IgE 7 (0.004,0.006) 3,51E-15 1,39E-12 Immuno IgG3 7 (0.464,0.701) 2,72E-14 7,91E-11 Immuno IgG2 15 (-0.982,-0.597) 1,39E-11 4,77E-09 Immuno IgG4 7 (0.423,0.709) 8,63E-10 7,32E-09 Immuno IgG3 15 (-0.605,-0.347) 4,44E-09 7,93E-11 Immuno IgG4 15 (-0.668,-0.34) 5,21E-07 5,75E-08 Immuno IgM 7 (-0.299,0.8) 0,37 0,39 Immuno IgM 15 (-0.419,0.976) 0,43 0,2 Immuno IgA 15 (-0.187,0.372) 0,51 0,84 Immuno IgA 7 (-0.318,0.368) 0,88 0,9 Tabla 31: Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (inmunoglobulinas) 62 p-valor (tobit) p-valor (Wilcoxon) Cito IL22 15 1,33E-05 9,30E-06 Cito IL22 7 0 0 Cito IL18 7 0 0,03 Cito IL10 15 0,01 0 Cito IL18 15 0,02 5,03E-05 Cito IL6 7 0,03 0,02 Cito TNF a 7 0,04 0 Cito IL12 15 0,07078765 0,07353838 Cito IL13 15 0,07078765 NA Cito IL21 7 0,14052368 0,62599369 Cito IL9 15 0,20031196 0,05837857 Cito IL17 7 0,22424283 0,28485558 Cito IL6 15 0,25366303 0,73530924 Cito IL5 7 0,25772336 0,26538253 Cito GM CSF 7 0,29389539 0,23894735 Cito Ifn g 15 0,29633577 0,4198717 Cito TNF a 15 0,31381967 0,02674385 Cito IL9 7 0,32031902 0,20217263 Cito Ifn g 7 0,33679605 0,60324133 Cito IL21 15 0,38969076 0,1085043 Cito IL1b 15 0,63377237 0,93749154 Cito IL2 15 0,63377237 NA Cito IL2 7 0,76304712 0,69200138 Cito IL1b 7 0,77448481 0,65374976 Cito IL10 7 0,80075577 0,41951603 Cito IL12 7 0,82555122 0,39813568 Cito IL13 7 0,82555122 NA Cito IL23 7 0,9975721 0,02058654 Cito IL17 15 0,99824778 0,11142409 Cito GM CSF 15 0,99896176 0,37572106 Cito IL4 15 0,99914636 0,2877958 Cito IL5 15 NA 0,11142409 Cito IL23 15 NA 0,12462481 Cito IL4 7 NA 0,19946773 Cito IL27 7 NA 0,37572106 Cito IL27 15 NA 0,37572106 Tabla 32: Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (citoquinas) IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Leptin 7 (-1.224,-0.332) 0,00 0,00 Adiponectin 7 (-0.088,0.657) 0,13 0,07 Leptin 15 (0.087,1.189) 0,02 0,01 Adiponectin 15 (-0.732,-0.107) 0,01 0,02 Tabla 33: Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (adipoquinas) 63 IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Immuno Th1 7 (1.297,1.651) 0 0 Immuno Th1 15 (-1.524,-1.124) 0 0 Immuno Th2 7 (0.423,0.709) 0 0 Immuno Th2 15 (-0.638,-0.309) 0 0 Ratio L A 15 (0.038,0.126) 0 0 Ratio L A 7 (-0.088,-0.014) 0,01 0 pct Th1 15 (0.003,0.048) 0,03 0,38 Pro infl 7 (-1.206,-0.059) 0,03 0,03 Ratio Innate acquired 15 (-2.883,-0.09) 0,04 0,05 Cito Th1 7 (0.006,1.123) 0,048 0 pct Th1 7 (-0.033,0) 0,0531 0,28 Hematopoyetic factors 15 (-0.007,0.527) 0,06 0,06 Anti infl 7 (-1.779,0.037) 0,06 0,05 Pro infl 15 (-0.086,1.271) 0,09 0,04 Th17 7 (-1.336,0.147) 0,11 0,17 Cito Th2 15 (-0.055,0.464) 0,12 0,38 Cito Rto Th1 Th2 15 (-0.055,0.464) 0,12 0,5 Ratio pro anti 15 (-2.082,0.31) 0,14 0,87 Hematopoyetic factors 7 (-0.565,0.084) 0,14 0,08 Innate Immunity 15 (-1.341,0.206) 0,15 0,11 pct Th2 15 (-0.52,0.16) 0,29 0,38 Anti infl 15 (-1.269,0.419) 0,32 0,13 Cito Th1 15 (-0.82,0.29) 0,34 0,08 pct Th2 7 (-0.142,0.4) 0,34 0,28 Ratio pro anti 7 (-0.503,1.379) 0,35 0,57 Th17 15 (-0.432,1.037) 0,41 0,44 Innate Immunity 7 (-1.146,0.506) 0,44 0,53 Immuno Rto Th1 Th2 15 (-0.337,0.606) 0,57 0,38 pct Rto Th1 Th2 15 (-0.337,0.606) 0,57 0,38 Immuno Rto Th1 Th2 7 (-0.471,0.269) 0,59 0,28 pct Rto Th1 Th2 7 (-0.471,0.269) 0,59 0,28 Ratio Innate acquired 7 (-1.156,1.9) 0,62 0,61 Th9 15 (-0.102,0.153) 0,69 0,06 Cito Rto Th1 Th2 7 (-0.626,0.774) 0,82 0,81 Cito Th2 7 (-0.455,0.373) 0,84 0,83 Acquired immunity 15 (-0.266,0.218) 0,85 0,02 Th9 7 (-0.266,0.22) 0,85 0,2 Acquired immunity 7 (-0.441,0.414) 0,95 0,34 Tabla 34: Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (variables calculadas) 64 IC 95 % para la diferencia p-valor (t Student) p-valor (Wilcoxon) Altura 7D (0.011,0.048) 0 0,01 Weight 7D (0.004,0.094) 0,03 0,04 Weight 15D (0.004,0.1) 0,04 0,06 Altura 15D (0,0.041) 0,06 0,09 BMI Z-score 1 M (-0.022,1.57) 0,06 0,01 Peso tras embarazo (-0.004,0.118) 0,07 0,11 Altura 1 MM (-0.002,0.041) 0,08 0,08 BMI Z-score at birth (-0.092,0.721) 0,13 0,18 Weight 1 M (-0.016,0.084) 0,18 0,18 BMI tras embarazo (-0.018,0.089) 0,19 0,19 Gestational age (-0.006,0.024) 0,22 0,31 BMI Z-score 15D (-0.232,0.936) 0,23 0,29 Altura (-0.009,0.036) 0,24 0,14 Birth weight (-0.023,0.08) 0,27 0,25 Pre-gestational BMI (-0.03,0.088) 0,32 0,51 BMI Z-score 7D (-0.486,0.551) 0,9 0,53 Tabla 35: Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (variables num´ericas) p-valor (contraste proporciones) Infections 0 6M 0,88 Infections 0 12M 0,48 Infections 0 24M 0,07 AB 7d-2M (Infant) 0,86 IAB 0,76 PeAB 0,91 PrAB 0,59 AB7d-2M 0,07 Tabla 36: Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (contadores) p-valor (Chi cuadrado) p-valor (Fisher) Gender 0,87 0,82 Delivery 0,99 0,81 Breastfeeding 0,12 0,1 Breastfeeding level 0,06 0,07 Primipara 0,03 0,02 Animals 0,53 0,54 Tabla 37: Resultados de las pruebas para la comparaci´on entre los grupos de madres sin outliers (variables categ´oricas) 65