Bases genéticas de los trastornos del espectro autista: estudio de la variación común y rara
Abstract
En el presente proyecto de tesis se ha abordado el estudio de las bases genéticas de los trastornos del espectro autista (TEA) desde diferentes perspectivas. En primer lugar, se ha llevado a cabo un GBA que ha permitido identificar nuevos loci asociados a los TEA. En segundo lugar, se ha comprobado que las mutaciones postcigóticas (PZMs) tienen un papel importante en la etiología de los TEA y que los genes con PZMs intervienen en mecanismos biológicos diferentes a los de los genes con mutaciones germinales. Finalmente se ha estimado el rendimiento diagnóstico de la secuenciación de exoma completo en una cohorte gallega de TEA.
Full text
TESIS DE DOCTORADO BASES GENÉTICAS DE LOS TRASTORNOS DEL ESPECTRO AUTISTA: ESTUDIO DE LA VARIACIÓN COMÚN Y RARA Aitana Alonso González ESCOLA DE DOUTOTAMENTO INTERNACIONAL PROGRAMA DE DOCTORADO EN MEDICINA MOLECULAR SANTIAGO DE COMPOSTELA AÑO 2020
DECLARACIÓN DEL AUTOR DE LA TESIS Bases genéticas de los trastornos del espectro autista: estudio de la variación común y rara D./Dña. Aitana Alonso González Presento mi tesis, siguiendo el procedimiento adecuado al Reglamento, y declaro que: 1) La tesis abarca los resultados de la elaboración de mi trabajo. 2) En su caso, en la tesis se hace referencia a las colaboraciones que tuvo este trabajo. 3) La tesis es la versión definitiva presentada para su defensa y coincide con la versión enviada en formato electrónico. 4) Confirmo que la tesis no incurre en ningún tipo de plagio de otros autores ni de trabajos presentados por mí para la obtención de otros títulos. En Santiago de Compostela, a 27 de mayo de 2020 Fdo. Aitana Alonso González
AUTORIZACIÓN DEL DIRECTOR / TUTOR DE LA TESIS Bases genéticas de los trastornos del espectro autista: estudio de la variación común y rara D./Dña. Ángel Carracedo Álvarez D./Dña. Cristina Rodriguez Fontenla INFORMAN: Que la presente tesis, corresponde con el trabajo realizado por D/Dña. Aitana Alonso González bajo mi dirección, y a utorizo su presentación, considerando que reúne l os r equisitos exigidos en el R eglamento de Estudios de Doctorado de la USC, y que como director de ésta no incurre en las causas de abstención establecidas en Ley 40/2015. En Santiago de Compotela a 27de mayo de 2020. Fdo. Ángel Carracedo Álvarez Fdo. Cristina Rodríguez Fontenla
Yo, Aitana Alonso González con DNI 54063597G declaro que esta tesis no presenta conflictos de interés. Y para que así conste firmo a día 27 de mayo de 2020 Fdo: Aitana Alonso González.
“Me doy cuenta que, si fuera estable, prudente y estático, viviría en la muerte. Por consiguiente, acepto la confusión, la incertidumbre, el miedo y los altibajos emocionales, porque ese es el precio que estoy dispuesto a pagar por una vida fluida, perpleja y excitante” Carl Rogers
6
AGRADECIMIENTOS Una tesis, es como una carrera de fondo. A lo largo del recorrido, quieres abandonar mil veces, pero las ganas de alcanzar tu objetivo son aún mayores, y por eso, continuas. Sabes que, una vez llegues a la meta, la sensación de superación y satisfacción, harán que el esfuerzo haya merecido la pena. Debo decir, que poca experiencia tengo yo en carreras de fondo, pero al igual que me ha pasado con esta tesis, si conseguí terminar una en mi vida, fue gracias a la gente que corría a mi lado y me acompañó hasta el final, sin quedarse en el camino. Por eso, en primer lugar, quiero agradecer a Ángel por haberme dado la oportunidad de iniciar este recorrido, apostar por mí y permitirme dar mis primeros pasos en el mundo de la genética bajo su dirección. Otra cosa que debo agradecerle, es poner a Cris es mi camino. Espero que recuerdes tu primer “experimento” de dirección de una tesis con cariño, como yo lo haré. Ambas sabemos que, sin ti, esta tesis no habría sido posible. Gracias a todo el equipo de Xenómica, tanto el de la Fundación, como el del CIMUS por ayudarme en todo lo que he necesitado. Gracias a Inés, por haber creído en mí y no haberme dejado tirar la toalla. Gracias a Pancho por todo su tiempo y todo lo que he aprendido con él. Gracias a Cata por darle vida al CIMUS. Gracias a Elena, la mejor compañera de mesa que se puede tener. Como te echo de menos cuando te bajas a cultivos. Gracias a Raquel, por estar siempre dispuesta a resolver dudas. Gracias a Manuel Calaza por habernos ayudado tanto a Cris y a mí al principio. Gracias a Xulio y a Carolina. Os dije que solo estaría unos meses, pero es que he estado muy bien allí. Gracias a Vicente y Cris, mis otros dos grandes compañeros de despacho en la Fundación. Gracias al grupo Coffe, del que forman parte todos los doctorandos, con los que he compartido cabreos y risas. Gracias Montse, Olalla, Jorge, Joja, Pili, Sole y todos los compañeros que siempre han estado ahí para echar una mano.
8 Gracias a todos mis amigos. Si nos los hubiese elegido tan buenos, creo que esta tesis habría quedado en un proyecto sin acabar. Gracias a las doctorandas, Rita, Anael, Marinela y Cris. Esos cafés/cañas me han salvado la vida en más de una ocasión y lo sabéis. Gracias a Cebro. Menudo año te he dado, pero menos mal que nuestros laboratorios no tienen puerta. Gracias a Presidenta, Laura y Cris por haberme ayudado tanto al principio. Gracias a todos y cada uno de los miembros de Agenda Picheleira. No os puedo nombrar a todos, porque me quedo sin sitio, pero habéis sido una de las principales cosas por las que ha merecido la pena esta etapa. Gracias al grupo de Tropical, un reciente descubrimiento sin el que no hubiese podido sobrevivir esta cuarentena ni escribir esta tesis. Gracias a mis Chicas, que son, más que unas amigas, mi familia. Gracias a las Doctoras Sexys, por aceptarme, aunque sea la oveja negra de todos los médicos. Por último, gracias a mi familia, que llegados a este punto estarán pensando que en qué momento me convertí en una cursi. Gracias a mis padres por haberme dado la oportunidad de poder llegar a donde yo quiera. Son, cada uno a su manera, un ejemplo a seguir. Gracias a mi hermana, por ser mi mayor apoyo y siempre estar ahí para cuando la necesito. A todos, GRACIAS
AITANA ALONSO GONZÁLEZ 16 5.2.2 Control de calidad de las muestras y detección de mutaciones de novo ............................................................... 110 5.2.2.1 Procesamiento de datos y anotación de variantes…………………………………………………………...110 5.2.2.2 Control de calidad específico para las muestras……………………………………………………………110 5.2.2.3 Detección de mutaciones de novo ................... 111 5.2.3 Test Transmission and De novo Association (TADA-Denovo) .................................................................... 112 5.2.4 Análisis de enriquecimiento en sets de genes de mutaciones germinales y PZMs ............................................ 114 5.2.5 Análisis de enriquecimiento de ontologías génicas………………………………………………………...115 5.2.6 Análisis de enriquecimiento por tipo celular y análisis de expresión en regiones cerebrales a lo largo del desarrollo……………………………………………………..116 5.3 RESULTADOS ............................................................. 117 5.3.1 Test Transmission and De novo Association (TADA-Denovo) .................................................................... 117 5.3.2 Análisis de enriquecimiento en sets de genes de mutaciones germinales y PZMs ............................................ 123 5.3.3 Análisis de enriquecimiento de ontologías génicas………………………………………………………...128 5.3.4 Análisis de enriquecimiento por tipo celular y análisis de expresión en regiones cerebrales a lo largo del desarrollo……………………………………………………..132 5.4 DISCUSIÓN ................................................................ 138 5.5 CONCLUSIONES ......................................................... 142 6 CAPÍTULO 3………………………………………….145 6.1 OBJETIVO ................................................................. 145
Índice 6.2 MÉTODOS .................................................................. 145 6.2.1 Pacientes y diagnóstico clínico ......................... 145 6.2.2 Extracción de ADN y secuenciación de exoma completo………………………………………………………146 6.2.3 Selección de genes asociados a TND ................ 146 6.2.4 Análisis clínico-genómico................................. 147 6.2.4.1 Anotación, filtrado y clasificación de variantes…………………………………………………………...147 6.2.4.2 Secuenciación Sanger para la validación de variantes genéticas clínicamente relevantes......................... 149 6.2.5 Detección de variantes de novo ........................ 150 6.3 RESULTADOS............................................................. 151 6.3.1 Descripción de la cohorte................................. 151 6.3.2 Descripción del listado de genes asociados a TND…………………………………………………………...153 6.3.3 Clasificación de variantes y rendimiento diagnóstico……………………………………………………154 6.3.3.1 Variantes clínicamente relevantes................... 154 6.3.3.2 Rendimiento diagnóstico y clasificación de pacientes…………………………………………………………...164 6.3.4 Correlación genotipo-fenotipo ......................... 166 6.3.5 Detección de mutaciones de novo en nuevos genes candidatos…………………………………………………….173 6.4 DISCUSIÓN ................................................................ 180 6.5 CONCLUSIONES ......................................................... 185 7 DISCUSIÓN GENERAL ................................................. 187 8 CONCLUSIONES ......................................................... 205 9 BIBLIOGRAFÍA……………………………………….209
AITANA ALONSO GONZÁLEZ 18 10 ANEXOS……………………………………………...233 10.1 ANEXO 1: APROBACIÓN COMITÉ ÉTICO DE INVESTIGACIÓN CLÍNICA DE GALICIA ......................................... 233 10.2 ANEXO 2: HOJA DE INFORMACIÓN PARA LOS PARTICIPANTES .......................................................................... 233 10.3 ANEXO 3: COSENTIMIENTO INFORMADO ................... 233 10.4 ANEXO 4. DESCRIPCIÓN DE LOS GENES CON MUTACIONES GERMINALES OBTENIDOS EN LA COHORTE COMBINADA. .............................................................................. 234 10.5 ANEXO 5. DESCRIPCIÓN DE LOS GENES CON PZMS OBTENIDOS EN LA COHORTE COMBINADA. ................................. 239 10.6 ANEXO 6. SELECCIÓN DE GENES ............................... 242
Índice ÍNDICE DE TABLAS Tabla 1. Criterios diagnósticos para los TEA de acuerdo al DSM-5. ... 4 Tabla 2. Niveles de gravedad de los TEA de acuerdo al DSM-5. ......... 5 Tabla 3. Condiciones comórbidas más frecuentes en los TEA. ........... 8 Tabla 4. Tipos de variantes genéticas clasificadas en función de su frecuencia poblacional, herencia, estructura y localización en el genoma. .................................................................................................. 12 Tabla 5. Principales estudios de ligamiento llevados a cabo en los TEA. ......................................................................................................... 15 Tabla 6. Principales estudios de genes candidatos llevados a cabo en los TEA. ................................................................................................... 18 Tabla 7. Loci que alcanzan el umbral de significación estadística (p > 5 x10-8) en el mayor metaanálisis de GWAS llevado a cabo en los TEA. ................................................................................................................. 22 Tabla 8. Resultados del GBA realizado con MAGMA. ......................... 25 Tabla 9. CNVs recurrentes asociadas a los TEA en la SSC y la cohorte del AGP. .................................................................................................. 30 Tabla 10. Genes de riesgo en los TEA identificados por TADA ordenador por rangos de FDR y número de mutaciones LoF. ............ 40 Tabla 11. Genes de riesgo en los TEA con FDR < 0.1 detectados en el mayor estudio de secuenciación de exoma completo llevado a cabo en los TEA. .............................................................................................. 41
AITANA ALONSO GONZÁLEZ 20 Tabla 12. Resultados obtenidos en los principales estudios en cohortes de TEA donde se analizaron PZMs. ....................................... 44 Tabla 13. Genes portadores de mutaciones PZMs en los TEA. ......... 44 Tabla 14. Clasificación funcional de los genes identificados por TADA (FDR < 01). .............................................................................................. 58 Tabla 15. Principales estudios llevados a cabo en los TEA en los que se ha realizado análisis de redes génicas. .......................................... 62 Tabla 16. Principales síndromes genéticos asociados a los TEA. ..... 65 Tabla 17. Genes más frecuentemente incluidos en paneles. ........... 71 Tabla 18. Bases de datos poblacionales. ............................................ 75 Tabla 19. Bases de datos específicas de enfermedad y de gen ....... 76 Tabla 20. Predictores in silico de patogenicidad. ............................. 77 Tabla 21. Criterios de evidencia ACMG para la clasificación de variantes patogénicas. .......................................................................... 79 Tabla 22. Criterios de evidencia ACMG para la clasificación de variantes benignas. ................................................................................ 79 Tabla 23. Clasificación de variantes según criterios ACMG.............. 80 Tabla 24. Características de las cohortes de TEA incluidas en el metaanálisis de TEA llevado a cabo por el PGC. ................................ 84 Tabla 25. Genes asociados en el GBA realizado con PASCAL y sus principales interactores identificados por FunCoup. ......................... 86 Tabla 26. 20 primeros genes que resultan asociados (ordenador por su p-valor) mediande PASCAL, al usar como input los summary statistics correspondientes al metaanálisis de TEA. .......................... 90
Índice Tabla 27. Genes asociados identificados por PASCAL y MAGMA. ..... 91 Tabla 28. Enriquecimiento de términos GO y rutas KEEG para los genes asociados identificados por PASCAL y sus interactores, de acuerdo a FunCoup. ............................................................................... 95 Tabla 29. Genes asociados identificados por PASCAL e interactores y resultados de dbMDEGA. ..................................................................... 102 Tabla 30. Genes de riesgo en los TEA con mutaciones germinales en la cohorte española. ............................................................................ 118 Tabla 31. Genes de riesgo en los TEA con PZMs en la cohorte española. ............................................................................................... 119 Tabla 32. Genes de riesgo en los TEA con mutaciones germinales en la cohorte combinada. ........................................................................ 121 Tabla 33. Genes de riesgo en los TEA con PZMs en la cohorte combinada. ........................................................................................... 121 Tabla 34. Resultados del análisis de enriquecimiento en sets de genes para los genes con mutaciones germinales (cohorte española). .... 124 Tabla 35. Resultados del análisis de enriquecimiento en sets de genes para los genes con PZMs (cohorte española). ................................... 125 Tabla 36. Resultados del análisis de enriquecimiento en sets genes para los genes con mutaciones germinales (cohorte combinada). . 126 Tabla 37. Resultados del análisis de enriquecimiento en sets de genes para los genes con PZMs (cohorte combinada). ................................ 127 Tabla 38. Niveles de asociación de los 10 tipos celulares neuronales en genes con mutaciones germinales de la cohorte combinada. ... 132 Tabla 39. Niveles de asociación de los 10 tipos celulares neuronales en genes con PZMs de la cohorte combinada. .................................. 134
AITANA ALONSO GONZÁLEZ 22 Tabla 40. Análisis de expresión de genes con mutaciones germinales de la cohorte combinada en diferentes regiones cerebrales y diferentes periodos del neurodesarrollo. .......................................... 135 Tabla 41. Análisis de expresión de genes con PZMs de la cohorte combinada en diferentes regiones cerebrales y diferentes periodos del neudesarrollo. ................................................................................ 135 Tabla 42. Principales características clínicas de la cohorte gallega de TEA (N = 125). ...................................................................................... 153 Tabla 43. Variantes patogénicas detectadas en la cohorte gallega de TEA. ....................................................................................................... 158 Tabla 44. Variantes probablemente patogénicas y variantes de significado incierto posiblemente patogénicas identificadas en la cohorte gallega de TEA. ...................................................................... 163 Tabla 45. Pacientes con variantes clínicamente relevantes. ......... 171 Tabla 46. Variantes de novo detectadas en genes candidatos. ..... 179
Índice ÍNDICE DE FIGURAS Figura 1. Principales estudios de gemelos MC y DC llevados a cabo en los TEA entre 1977 y 2014. ................................................................... 10 Figura 2. La arquitectura genética de los TEA. ................................. 13 Figura 3. Estudios de asociación de genoma completo o GWAS. ..... 21 Figura 4. Manhattan plot que muestra los resultados del mayor GWAS realizado en los TEA hasta la fecha. .................................................... 23 Figura 5. Variantes en el número de copias o CNVs. ......................... 26 Figura 6. Esquema del procesamiento bioinformático en la NGS. ... 33 Figura 7. Ejemplos de mutaciones en regiones codificantes. .......... 37 Figura 8. Contribución de las mutaciones de novo al riesgo en los TEA en la SSC. ................................................................................................ 38 Figura 9. Mutaciones de novo. ............................................................. 42 Figura 10. Representación de elementos no codificantes con función reguladora. ............................................................................................. 46 Figura 11. Representación de los diferentes niveles de estudio de la neurobiología de los TEA. ..................................................................... 51 Figura 12. Esquema de la construcción de una red génica usando dos aproximaciones diferentes. .................................................................. 53
AITANA ALONSO GONZÁLEZ 24 Figura 13. Análisis de redes génicas (PPI) realizado a partir de los genes de riesgo para los TEA identificados por los algoritmos TADA y DAWN. ..................................................................................................... 57 Figura 14. Representación esquemática de los principales eventos que tienen lugar durante el neurodesarrollo. .................................... 60 Figura 15. Algoritmo diagnóstico en los TEA sindrómicos ................ 66 Figura 16. Algoritmo diagnóstico en los TEA no sindrómicos. Herramientas de cribado de primera línea. ........................................ 70 Figura 17. Rendimiento diagnóstico del exoma completo en cohortes con TND y cohortes con TND y otras patologías asociadas, en los estudios seleccionados por Srivastava et al. ...................................... 73 Figura 18. Algoritmo diagnóstico que incorpora la secuenciación de exoma completo en la evaluación clínica de pacientes con TND sin causa conocida propuesto por Srivastava et al. ................................. 74 Figura 19. Plot de asociación de la región donde se localizan NKX2-2 y NXX2-4 realizado con LocusZoom ...................................................... 92 Figura 20. Plots de asociación de las regiones donde se localizan CRHR1-IT1 y LOC644172 (cromosoma 17) y C8orf74 (cromosoma 8). ................................................................................................................. 93 Figura 21. Visualización de la red génica construida con los genes asociados identificados por PASCAL y sus interactores de acuerdo a FunCoup. ................................................................................................. 96 Figura 22. Heatmaps de expresión para los genes asociados en el GBA de PASCAL y sus interactores. .............................................................. 98 Figura 23. Plots representando el análisis de expresión diferencial de sets de genes construidos a partir de los datos de GTEx v7 (53 tejidos) (Figura superior) y los datos de BrainSpan (29 periodos del desarrollo) (Figura inferior). .................................................................................. 100
Índice Figura 24. Manhattan plot mostrando los genes asociados (de riesgo) en los TEA en el análisis de priorización realizado con TADA-Denovo. (en el eje x e y se representan cromosoma y log10 del p-valor para cada gen). ............................................................................................. 122 Figura 25. Manhattan plot mostrando los genes asociados (de riesgo) en los TEA en el análisis de priorización realizado con TADA-Denovo (en el eje x e y se representan cromosoma y log10 del p-valor para cada gen). ............................................................................................. 122 Figura 26. Análisis de enriquecimiento en sets de genes usando mutaciones de novo germinales y PZMs de la cohorte combinada. 128 Figura 27. Scatterplots que representan los 30 procesos biológicos más significativos de la cohorte combinada. .................................... 130 Figura 28. Visualización de los términos GO más significativos en los genes con mutaciones de novo de la cohorte combinada, agrupados por funciones biológicas. .................................................................... 131 Figura 29. Enriquecimiento para tipo celulares de los genes con mutaciones de novo germinales y PZMs en la cohorte combinada (Análisis EWCE) ..................................................................................... 133 Figura 30. Análisis de expresión de genes con mutaciones germinales en regiones cerebrales a lo largo del neurodesarrollo. ................... 136 Figura 31. Análisis de expresión de genes con PZMs en regiones cerebrales a lo largo del neurodesarrollo. ........................................ 137 Figura 32. Flujo de trabajo seguido para la priorización y la detección de variantes clínicamente relevantes. .............................................. 149 Figura 33. Flujo de trabajo seguido para la detección de variantes de novo en genes candidatos. .................................................................. 151 Figura 34. Rendimiento diagnóstico de la secuenciación de exoma completo en una cohorte gallega de TEA (N = 125)......................... 165
AITANA ALONSO GONZÁLEZ 6 Disabilities Monitoring), estimó en 2014 que la prevalencia de los TEA era de 1 afecto por cada 59 no afectos en niños de 8 años en los Estados Unidos. Esta estima significa un incremento de alrededor de un 15% en comparación con los datos ofrecidos por el ADDM en 2012, cuando se calculó una prevalencia de 1 afecto por cada 68 no afectos5. Este aumento en la estima de prevalencia puede deberse a la mejora de las herramientas diagnósticas y al reconocimiento temprano de los síntomas nucleares de los TEA4. Dado que estos criterios son difíciles de homogeneizar entre estudios resulta difícil hacer una estimación de su prevalencia mundial, pero estudios recientes calculan que esta es cercana al 1%6. Por otro lado, la proporción de hombres afectos y mujeres afectas es diferente4,5. Los últimos datos estiman que el ratio por sexo es 3:1, siendo mayor la afectación en hombres que en mujeres7. 2.1.3 Comorbilidades en los TEA La comorbilidad es un término usado para describir la presencia simultánea de dos o más condiciones nosológicas (enfermedades o trastornos) en un mismo individuo. En los TEA, más de un 70% de los individuos afectos tienen comorbilidad con algún otro trastorno clínico o psiquiátrico7. Las condiciones médicas más frecuentes en los TEA son la epilepsia, las alteraciones gastrointestinales y los trastornos del sueño. A su vez, los TEA se acompañan frecuentemente de otros TND, incluyendo la DI, el trastorno por déficit de atención e hiperactividad (TDAH) y trastornos motores, así como trastornos psiquiátricos como la ansiedad, la depresión o el trastorno obsesivo compulsivo (TOC)8 (Tabla 3). El DSM-5 aconseja registrar la información de comorbilidades a la hora de establecer el diagnóstico, de manera que quede recogida qué alteración médica, trastorno genético, TND o trastorno psiquiátrico tiene asociado el paciente con TEA. A su vez, también contempla la necesidad de especificar el nivel cognitivo (presencia de DI o no), el nivel lingüístico, y la presencia o no de catatonia en el paciente2.
Introducción 7 Proporción de individuos afectos Comentarios Trastornos del neurodesarrollo Discapacidad intelectual 45% Las estimas de prevalencia dependen de los criterios diagnósticos y de la definición de inteligencia usada en cada caso (por ejemplo, si las habilidades verbales se usan o no como criterio). Trastornos del lenguaje Variable En el DSM-IV, el retraso en la adquisición del lenguaje se consideraba un criterio diagnóstico de los TEA. Sin embargo, en el DSM-5 ya no se incluye dicho criterio aunque se acepta que los TEA tengan un desarrollo del lenguaje atípico. Trastorno por déficit de atención e hiperactividad 28-44% En el DSM-IV no se aceptaba la posibilidad de un diagnóstico comórbido de los TEA y el TDAH. Esto ya no ocurre en el DSM-5. Tics 14-38% Aproximadamente un 6.5% presenta síndrome de Tourette. Alteraciones motoras <79% Se incluye el retraso motor, la hipotonía, la catatonia, los déficits en la coordinación, planificación y preparación del movimiento, y en la marcha. Alteraciones médicas Epilepsia 8-30% Su frecuencia está aumentada en individuos con DI o trastornos genéticos. Problemas gastrointestinales 9-70% Se incluye la constipación crónica, el dolor abdominal, la diarrea crónica, el reflujo gastro-esofágico. Se incluyen también trastornos como gastritis, esofagitis, enfermedad celiaca, enfermedad de Crohn, enfermedad intestinal inflamatoria o colitis. Alteraciones del sistema inmune <38% Alergias o trastornos autoinmunitarios. Trastornos genéticos 5%-10% Algunos ejemplos son el síndrome X frágil, síndrome de Rett, esclerosis tuberosa, síndrome de Down o fenilcetonuria. Alteraciones del sueño 50-80% Insomnio es el más común. Trastornos psiquiátricos Ansiedad 42-56% Los trastornos más comunes son el trastorno de ansiedad social (fobia social) y el trastorno de ansiedad generalizada. Depresión 12-70% Más frecuente en pacientes adultos que en niños.
AITANA ALONSO GONZÁLEZ 8 Trastorno obsesivo compulsivo 12-17% Es importante distinguir entre comportamientos repetitivos que no se acompañan de pensamientos obsesivos o intrusivos (criterio diagnóstico en los TEA) de los que sí lo hacen (parte del TOC). Trastorno psicótico 12-17% Más frecuente en adultos. Abuso de sustancias 16% Se debe, principalmente, al abuso de sustancias para aliviar la ansiedad. Trastorno oposicionistadesafiante 16-28% Los comportamientos oposicionistas pueden ser una manifestación de la ansiedad, resistencia al cambio, la dificultad para entender el punto de vista del otro y la escasa preocupación del efecto que pueda tener el comportamiento propio en los demás. Trastornos alimenticios 4-5% Puede haber un diagnóstico erróneo de TEA, sobre todo en mujeres, puesto que los trastornos alimenticios se acompañan también de comportamientos rígidos, inflexibilidad cognitiva, alta preocupación por los detalles y por uno mismo. Tabla 3. Condiciones comórbidas más frecuentes en los TEA. (Adaptada de “Autism”, Lancet, 20148). 2.1.4 Factores de riesgo Los TEA son TND complejos que presentan una etiología multifactorial en la cual participan tanto factores genéticos como ambientales. Se calcula que aproximadamente un 17% de su etiología se explica por factores ambientales9. Así, una edad paterna o materna avanzada en el momento de la concepción es un factor de riesgo conocido. Por otro lado, la exposición prenatal a sustancias exógenas (ácido valproico, talidomida, pesticidas químicos o fármacos psiquiátricos) o la presencia de ciertas condiciones biológicas como la obesidad materna o infeccionas maternas durante el embarazo, aumentan el riesgo de TEA. Por último, se han descrito también factores de riesgo postnatales que actúan en los primeros años de vida como infecciones, alergias o exposición de los niños a ciertas drogas10,11. El porcentaje restante de su etiología se explica principalmente por factores genéticos que se tratarán en detalle en el apartado siguiente.
Introducción 9 2.2 GENÉTICA DE LOS TEA 2.2.1 Epidemiología genética. Para cuantificar la importancia que tienen los factores genéticos en la etiología de los TEA se usa el concepto de heredabilidad. La heredabilidad se define como la proporción de la varianza fenotípica que se atribuye a la variación genética en una población determinada12. Las estimas de la heredabilidad varían en un rango de 0 a 1. Un valor cercano a 0 indica que la varianza observada para un determinado carácter biológico en una población se atribuye muy poco a la variación genética existente entre sus individuos. Un valor cercano a 1, en cambio, indica que la varianza observada para un carácter biológico en una población se atribuye en gran medida a la variación genética existente entre sus individuos13. La estima de la heredabilidad se basa en el hecho de que los individuos relacionados por parentesco comparten parte de su genoma. En función del grado de compartición de su genoma (por ejemplo, 50% para parejas de hermanos de mismos padres o 25% para abuelos-nietos), se espera también un grado de compartición fenotípica entre individuos. Sin embargo, se debe tener en cuenta que la expresión de un fenotipo es el resultado de una interacción entre factores genéticos y ambientales. Los estudios en gemelos monocigóticos (MC) y dicigóticos (DC) permiten separar con gran precisión los efectos ambientales de los genéticos. En ese sentido, los gemelos MC comparten el 100% de su genoma, y, por tanto, cualquier variación fenotípica entre parejas de gemelos se debe exclusivamente a factores ambientales. Por otro lado, los gemelos DC comparten el 50% de su genoma. A partir del porcentaje de concordancia fenotípica en gemelos MC se puede calcular la heredabilidad. La concordancia entre gemelos DZ se usa para corregir la estimación anterior13. En los TEA, los estudios en gemelos MC revelan que la concordancia del fenotipo autista es significativamente superior (70- 90%) a la concordancia de gemelos DC (0-30%)14,15. Las estimas de la heredabilidad, sin embargo, difieren mucho entre un estudio y otro, aunque un metaanálisis reciente, que incluyó los principales estudios de
AITANA ALONSO GONZÁLEZ 10 gemelos llevados a cabo en los TEA, la sitúa en torno a un 64-91% (Figura 1)16. Otra aproximación para estimar la heredabilidad consiste en medir la correlación de la enfermedad entre parientes de diferente parentesco procedentes de una muestra aleatoria de la población. Este tipo de estudios tienen la ventaja, con respecto a los estudios de gemelos, de estimar también el riesgo de recurrencia relativa (RR), que se define como el riesgo de padecer la enfermedad si un miembro de la familia se encuentra ya afecto, en comparación con una población control. En los TEA se ha calculado que el RR es de 153 para gemelos MC, 8.2 para gemelos DC, 10.3 para hermanos completos, 3.3 para hermanos maternos, 2.9 para hermanos paternos y 2 para primos17,18. La heredabilidad de los TEA calculada por esta aproximación se estima en un 83%9. Figura 1. Principales estudios de gemelos MC y DC llevados a cabo en los TEA entre 1977 y 2014. En la parte superior de la figura se representan los valores de concordancia fenotípica entre gemelos MC y DC, mientras que en la parte inferior se representan las estimas de heredabilidad obtenidas en cada estudio. (Extraída de Huget and Bourgeron, 2016310, permitido por Springer Nature).
Introducción 11 A partir de todos estos estudios se ha demostrado que en la etiología de los TEA intervienen principalmente factores genéticos, aunque no se puede excluir la influencia, en menor medida, de factores ambientales. Las estimaciones de la elevada heredabilidad de los TEA en los estudios de gemelos y los estudios en familias, han motivado la realización de un número elevado de estudios genéticos cuyo objetivo principal ha sido dilucidar las bases genéticas de estos TND, usando diferentes aproximaciones. 2.2.2 Factores genéticos 2.2.2.1 Arquitectura genética La secuenciación del genoma humano reveló que un 99.9% de nuestro material genético es compartido mientras que solo un 0.1% difiere de un individuo a otro y es lo que se conoce como variación genética19. La variación genética existente entre individuos puede ser respecto a la secuencia del ADN o respecto a la estructura submicroscópica de los cromosomas. Según su frecuencia poblacional puede ser común (frecuencia del alelo menor o MAF > 1%) o rara (MAF < 1%) y según el tipo de herencia puede ser heredada o de novo (Tabla 4)20,21. En general, se asume que la variación común contribuye de manera pequeña o moderada al riesgo de la enfermedad, mientras que las variantes raras tienen un impacto mayor en la aparición de la enfermedad y sus frecuencias alélicas se mantienen bajas como consecuencia de la selección natural negativa. El caso extremo lo constituyen las variantes de novo, que, al surgir espontáneamente en una nueva generación, no tienen tiempo de propagarse en una población si su impacto en el individuo es muy negativo22.
AITANA ALONSO GONZÁLEZ 12 Criterio de clasificación Tipo de variante Frecuencia poblacional Variante común: Cualquier cambio en el genoma de referencia que esté presente en más de un 1% de los individuos de una población. El ejemplo clásico son los SNPs (de sus siglas en inglés Single Nucleotide Polymorphisms) que son variantes de una sola base que se encuentran a una frecuencia superior del 1% en la población. Variante rara: Cualquier cambio en el genoma de referencia que esté presente en menos de un 1% de los individuos de una población. Herencia Variante heredada: Cualquier cambio en el genoma de referencia que esté presente en alguno de los progenitores y se transmita a sus hijos. Variante de novo: Mutación espontánea que surge en el espermatozoide, óvulo o primeras divisiones del cigoto y por tanto, están en el hijo y en ninguno de sus progenitores. Estructura Variantes estructurales: Las variantes estructurales son cambios con respecto a la estructura submicroscópica de los cromosomas. En este grupo se incluyen variantes en el número de copias o CNVs (del inglés, Copy Number Variation) elementos móviles, inversiones y translocaciones. Las CNVs son variantes estructurales que presentan genralmente un tamaño superior a 1000 pb. SNVs (de sus siglas en inglés, Single Nucleotide Variants): Los SNVs son cambios de una sola base con respecto al genoma de referencia que no son comunes en la población. Indels: Los Indels son cambios en el genoma de referencia que incluyen la inserción o deleción de un número pequeño de bases (generalmente su número es inferior a 1000 pb). Codificantes: Cualquier cambio en el genoma de referencia localizado en el 1% del genoma que codifica funcionalmente para proteínas. Localización No codificantes: Cualquier cambio en el genoma de referencia localizado fuera del 1% del genoma que codifica funcionalmente para proteínas y que incluye intrones, elementos reguladores y segmentos intergénicos. Tabla 4. Tipos de variantes genéticas clasificadas en función de su frecuencia poblacional, herencia, estructura y localización en el genoma. (Adaptada de Geschwind et al., 201523)
Introducción 13 La arquitectura genética es la base genética subyacente a la variabilidad fenotípica de un trastorno. El estudio de la arquitectura genética de los TEA, comprende pues, la identificación de todas las variantes genéticas existentes en la población que confieren riesgo en este TND24. Tanto la variación común, como la variación rara, contribuyen al riesgo en el caso de los TEA. Así, un 50% del componente genético de los TEA, se puede explicar por la variación genética común. Las variantes raras, aunque en conjunto tienen una contribución limitada a su heredabilidad, confieren un alto riesgo a nivel individual, lo cual explica la importancia de su estudio (Figura 2)25. Los estudios genéticos que han intentado elucidar la arquitectura genética de los TEA se desarrollarán en los apartados siguientes. Figura 2. La arquitectura genética de los TEA. (Adaptada de Huget and Bourgeron, 2016310, permitido por Springer Nature).
AITANA ALONSO GONZÁLEZ 14 2.2.2.2 Estudios genéticos llevados a cabo en los TEA 2.2.2.2.1 Estudios de ligamiento Los primeros estudios genéticos llevados a cabo en los TEA con el objetivo de identificar variantes de susceptibilidad, fueron los estudios de ligamiento. En la actualidad, estos estudios ya no se realizan, pero tuvieron un papel relevante en la posterior identificación de los primeros genes asociados a los TEA. En los estudios de ligamiento se buscan marcadores genéticos (cuya localización física es conocida) que cosegregan con la enfermedad en familias con varios miembros afectos. Es decir, se identifica qué variante alélica de un marcador genético comparten todos los miembros afectos. Los marcadores seleccionados se encuentran distribuidos aleatoriamente por todo el genoma, lo cual permite no contar con una hipótesis previa de qué regiones o genes podrían estar implicados. Sin embargo, una vez se identifica una región genética de interés, esta se puede delimitar todavía más al cubrirla con más marcadores, lo que permite priorizar después los genes de la región por su función. Inicialmente, los marcadores genéticos empleados en los estudios de ligamiento eran los microsatélites, que son secuencias nucleotídicas de 2 a 6 pares de bases que se repiten de manera consecutiva. Sin embargo, estos han sido sustituidos progresivamente por SNPs en los estudios de ligamiento posteriores26. Los estudios de ligamiento se basan en la transmisión conjunta o cosegregación de marcadores genéticos que se encuentren próximos entre sí, propiedad denominada ligamiento. El ligamiento depende a su vez de la frecuencia de recombinación. El estadístico usado para medir la existencia de ligamiento o no es el LOD score. Este estimador, permite detectar la existencia de ligamiento entre un marcador genético y la variante de susceptibilidad al estimar la frecuencia de recombinación más probable entre los genes de la especie humana26. Los primeros estudios de ligamiento en los TEA incluyeron tamaños muestrales de menos de 300 familias. Estos estudios, pese a su escasa potencia estadística, identificaron numerosas regiones de interés asociadas a los TEA, pero muy pocas se replicaron (Tabla 5)27.
Introducción 15 Estudio Número de familias Región cromosómica identificada Ashley-Koch et al. (1999) 76 7q22.1–q31.2 Auranen et al. (2002 38 3q25–27 Barrett et al. (1999) 75 7q31–33 13 Bartlett et al. (2005) 303 1q23–24 17q11 Buxbaum et al. (2001) 95 2q Cantor et al. (2005) 91 3p14–12 17q11–23 Coon et al. (2005) 1 3q25–27 IMGSAC (2001) 152 2q24–q33 7q 16p IMGSAC (1998) 99 7q Lamb et al. (2005) 219 2,7,9 Liu et al. (2001) 110 5, 19, X McCauley et al. (2005) 158 3p25 17q11 19p13 Philippe et al. (1999) 51 6q21 Risch et al. (1999) 90 (fase 1) y 49 (fase 2) 1 Shao et al. (2002a) 99 3 Vincent et al. (2005) 22 Xq27–28 Yonan et al. (2003) 345 5,11,17 Ylisaukko-Oja et al. (2004) 17 1q21–22 3p14–24 D13q31–33 Ylisaukko-Oja et al. (2006) 314 1p12-q25 3p24–26 4q21–31 6q14–21 7q33–36 8q22–24 17p12-q21 Tabla 5. Principales estudios de ligamiento llevados a cabo en los TEA.(Adaptada de C. Freitag, 200727). Posteriormente, se crearon grandes consorcios como el Autism Genetics Resource Exchange (AGRE) o el Autism Genome Project Consortium (AGP), en los cuales grupos de todo el mundo contribuyeron a la creación de grandes cohortes de TEA. Pese a este incremento del tamaño muestral no se lograron, tampoco, resultados satisfactorios, con la excepción de la identificación de la región 20p1328–30.
AITANA ALONSO GONZÁLEZ 22 En los últimos años, el PGC (de sus siglas en inglés, Psychiatric Genomics Consortium) ha hecho un enorme esfuerzo por incrementar el tamaño muestral de las cohortes incluidas en los GWAS gracias a la colaboración coordinada de multitud de grupos de investigación de todo el mundo. El primer trabajo llevado a cabo por el PGC en los TEA, consistió en un metaanálisis de 14 cohortes independientes, reuniendo un tamaño muestral de 7387 casos y 8567 controles. Pese a este incremento muestral con respecto a los estudios previos, no se identificó ningún SNP que alcanzara el umbral de significación estadística requerido (p < 5 x 10-8). Sin embargo, algunas de las señales marginalmente significativas señalaban a genes con un papel importante en el neurodesarrollo como EXT1, ASTN2, MACROD2, y HDAC4. También se identificó claramente una correlación genética entre la esquizofrenia y los TEA46. Este estudio hizo evidente la necesidad de seguir incrementando el tamaño muestral y el desarrollo de pipelines informáticos que permitieran realizar un correcto control de calidad de los datos, además de una correcta imputación47. El mayor GWAS realizado en los TEA hasta la fecha reunió un tamaño muestral de alrededor de 18000 casos y 28000 controles. Gracias a este incremento se consiguió por primera vez detectar 93 SNPs estadísticamente significativos en 3 loci separados, de los cuales 53 fueron replicados en cohortes independientes (Tabla 7). Index SNPs Chr pb p-valor A1/A2 Genes cercanos rs910805 20 21248116 2.04 x 10 -9 A/G KIZ, XRN2 NKX2-2, NKX2-4 rs10099100 8 10576775 1.07 x 10-8 C/G C8orf74 SOX7 PINX1 rs71190156 20 14836243 2.75 X 10-8 GGTTTTTT /GG MACROD2 Tabla 7. Loci que alcanzan el umbral de significación estadística (p > 5 x10-8) en el mayor metaanálisis de GWAS llevado a cabo en los TEA. (Adaptada de Grove et al., 201948).
Introducción 23 Además, se confirmó un solapamiento genético con esquizofrenia, así como con otros fenotipos, como la depresión mayor o el nivel educativo. La anotación funcional de las variantes asociadas determinó que éstas se localizan principalmente en elementos reguladores involucrados en la regulación de genes expresados durante la corticogénesis48. 2.2.2.2.3.3 Análisis basados en genes (GBA) El principal objetivo de un GWAS, es la detección de alelos que se asocien con una enfermedad y, por tanto, la unidad básica del análisis es el alelo en sí. Otra manera de analizar los resultados de un GWAS es considerar el gen como la unidad básica de análisis en los llamados análisis basados en genes o GBA (de sus siglas en inglés, Gene-Based Analysis). Los GBA, permiten obtener un estadístico para cada uno de los genes del genoma humano (p-valor). Este tipo de análisis tiene ciertas ventajas: 1. Por un lado, se reduce el número de test independientes realizados, ya que en lugar de hacer uno por cada uno de los SNPs analizados en un GWAS se hacen aproximadamente 20000 (uno por cada uno de los genes que hay en nuestro genoma). Figura 4. Manhattan plot que muestra los resultados del mayor GWAS realizado en los TEA hasta la fecha (Extraída de Grove et al., 201948, con permiso de Springer Nature).
AITANA ALONSO GONZÁLEZ 24 2. Por otro lado, al considerar el gen como la unidad básica de estudio, se pueden realizar análisis secundarios, para tratar de identificar los mecanismos moleculares y celulares que están implicados en la enfermedad de estudio49,50. Tradicionalmente, los GBA usaban una aproximación basada en permutaciones, que requiere el uso de genotipos, para el cálculo del estadístico de cada gen. Los GBA más recientes, en cambio, solo necesitan los p-valores de cada SNP incluido en el GWAS (summary statistics). En general, se distinguen dos pasos principales: 1. Un primer paso de anotación génica, en el cual los SNPs se asignan a genes en función del genoma de referencia que se considere y los límites teóricos que se definen para el gen. Por defecto, los GBA suelen considerar el inicio y fin del gen en 50 kb up y downstream. 2. Cálculo del estadístico para cada gen teniendo en cuenta todos los SNPs del gen, o solo los más significativos. Para este paso, es necesario considerar la estructura de LD. Para ello, el método más común se basa en la construcción de matrices de correlación SNP-SNP a partir de datos genotípicos de una población externa cuya estructura genética sea lo más parecida a la empleada en el GWAS original. Algunos ejemplos de GBA son los algoritmos predictivos de VEGAS251, MAGMA52 y PASCAL53. Los dos primeros han sido usados con éxito en los dos metaanálisis llevados a cabo en los TEA por el PGC. Todos ellos permiten el uso de summary statistics como input sin la necesidad de usar la información genotípica y corrigen por LD usando los datos genotípicos del Proyecto 1000 Genomas, aunque el algoritmo empleado es diferente en cada caso. PASCAL aún no se ha usado en datos de TEA, pero su algoritmo ha demostrado ser más rápido y preciso que el de VEGAS o MAGMA53. En el primer trabajo del PGC, en el cual se empleó el algoritmo VEGAS2, no se detectó ningún gen asociado tras la corrección por Bonferroni (p < 2.89 x 10-6). Sin embargo, merece la pena destacar que la región 6p21.1, mostró 3 genes con p-valor = 7 x10-6 (ENPP4, ENPP5, y CLIC5)46.
Introducción 25 En el segundo trabajo del PGC, se empleó el algoritmo MAGMA, y se detectaron 14 genes asociados (Tabla 8)48: Gen Cromosoma MAGMA p-valor tagSNP XRN2 20 9,69 x 10-10 rs 910805 KCNN2 5 1.02 x 10-9 rs 13188074 PLK1S1 20 5.17 x 10-9 rs 910805 MACROD2 20 1.40 x 10-7 rs 71190156 WNT3 17 4.03 x 10-7 rs 142920272 MAPT 17 5.01 x 10-7 rs 142920272 MFHAS1 8 5.58 x 10-7 rs 11249905 XKR6 8 8.01 x 10-7 rs 10099100 MSRA 8 9.15 x 10-6 rs 10099100 CRHR1 17 1.07 x 10-6 rs 142920272 SOX7 8 1.24 x 10-6 rs 10099100 NTM 11 1.32 x 10-6 rs 549507 MMP12 11 2.28 x 10-6 rs 102751102 BLK 8 2.45 x 10-6 rs 2736342 Tabla 8. Resultados del GBA realizado con MAGMA. (Adaptada de Grove et al., 201948). Los GBA no deben entenderse nunca como un sustituto de los estudios GWAS clásicos, sino como herramientas complementarias que permiten acceder a otro nivel de información biológica, el nivel gen.
AITANA ALONSO GONZÁLEZ 26 2.2.2.2.4 Estudios de CNVs 2.2.2.2.4.1 Definición de CNV y herramientas de detección Las CNVs son variaciones estructurales del genoma, las cuales pueden ser ganancias (inserciones, duplicaciones o amplificaciones) o pérdidas (deleciones), en comparación con la secuencia genómica de referencia (Figura 5)54. La implantación durante la última década de nuevas tecnologías de cariotipado molecular (microarrays cromosómicos), como la hibridación genómica comparada o CGH (de sus siglas en inglés, Comparative Genome Hybridization) y los paneles o arrays de SNPs, ha mejorado de manera significativa el poder de detección de este tipo de variantes que hasta entonces habían pasado desapercibidas a las técnicas citogenéticas convencionales, como el cariotipo o la hibridación fluorescente in situ o FISH (de sus siglas en inglés, Fluorescence In Situ Hybridization), que presentan muy baja resolución (orden de megabases (Mb)). Figura 5. Variantes en el número de copias o CNVs. Se muestra una región duplicada a la izquierda y una región delecionada a la derecha, como ejemplos de CNV.
Introducción 27 De especial relevancia fueron los arrays de SNPs, que, aunque en su diseño original estaban pensados para el genotipado en estudios de GWAS, también permiten detectar con gran precisión CNVs de pequeño tamaño en función de la densidad de SNPs incluidos en el array. En este tipo de arrays, los fragmentos de ADN de la muestra diana hibridan con sondas de oligonucleótidos correspondientes a variantes alélicas de SNPs seleccionados. La intensidad de la fluorescencia emitida cuando dichas sondas hibridan con fragmentos del ADN diana se compara con valores de referencia procedentes de un conjunto de individuos control de la misma población y genotipados con la misma tecnología (comparación indirecta), y esto permite identificar deleciones (intensidad inferior en comparación con individuos control) y duplicaciones (intensidad superior en comparación con individuos control). En el caso de los arrays CGH los fragmentos de la muestra diana y la muestra control se marcan con diferentes fluorocromos e hibridan con oligonucleótidos inmovilizados en los arrays. La intensidad de la fluorescencia emitida por los dos tipos de fluorocromos determina los cambios en el número de copias: cuando solo se detecta fluorescencia del fluorocromo control significa que hay una deleción en esa posición de la muestra diana. Cuando la fluorescencia del fluorocromo de la muestra se detecta con mayor intensidad que la del control, significa que hay una duplicación en esa posición en la muestra diana55. No obstante, en los últimos años se han desarrollado nuevas herramientas que permiten la detección de toda clase de variantes estructurales (inserciones, deleciones, duplicaciones, inversiones y translocaciones) a partir de datos de secuenciación de genoma o exoma completo. Además de cubrir todo el espectro la variación estructural, esta aproximación permite detectar variantes de muy pequeño tamaño (< 50 pb)56–59. 2.2.2.2.4.2 Principales estudios de CNVs llevados a cabo en los TEA Las CNVs que se han visto implicadas en la etiología de los TEA han sido CNVs raras (MAF < 1%) ya sean heredadas o de novo.
AITANA ALONSO GONZÁLEZ 28 Previamente al desarrollo de los microarrays cromosómicos, las técnicas citogenéticas clásicas pusieron de manifiesto la implicación de grandes aberraciones cromosómicas en casos graves de TEA60. Sin embargo, no fue hasta 2007 y 2008 cuando dos grupos publicaron importantes trabajos en los cuales se establecía por primera vez una relación causal entre las CNVs de novo y los TEA61,62. Entre 2010 y 2011 tres publicaciones corroboraron estos resultados previos, tras realizar un análisis de CNVs aplicando tecnologías de cariotipado de mayor resolución en dos grandes cohortes de TEA: la del AGP y la Simons Simplex Collection (SSC). Los tres estudios realizaron diseños caso-control incluyendo familias con uno o varios individuos afectos (familias con TEA esporádico o familiar respectivamente), y analizaron el papel de las CNVs raras de novo (≥ 20 kb) en los TEA63–65. Estos primeros trabajos sirvieron para proponer una hipótesis alternativa a la de enfermedad común-variante común, otorgándole mayor peso a la contribución de las variantes raras. De ellos se extrajeron una serie de conclusiones: 1) La frecuencia de CNVs de novo en afectos (5-10%) es significativamente superior a la de no afectos (1-2%), lo cual sugiere una implicación directa de estas variantes en el riesgo de los TEA. 2) La frecuencia de CNVs de novo es superior en individuos procedentes de familias con TEA esporádico que en individuos procedentes de familias con TEA familiar. Este hecho señala la implicación de diferentes mecanismos etiológicos en ambos tipos de TEA, siendo la contribución de CNVs raras heredadas superior en los TEA familiar que los esporádicos. 3) El riesgo que confiere una CNV en los individuos con TEA incrementa a medida que también lo hace su tamaño e implica a un mayor número de genes. Esto ocurre tanto para CNVs de novo como heredadas63–65. En los años posteriores, la inclusión de nuevas familias tanto en la SSC como en la cohorte del AGP, permitió reportar nuevos datos con respecto al papel de las CNVs en los TEA. En el trabajo de Sanders et al., se incluyeron los resultados correspondientes al análisis de la cohorte de la SSC al completo (10220 individuos con TEA procedentes
Introducción 29 de 2591 familias) Esta cohorte, incluye principalmente casos de TEA esporádico, y por tanto las conclusiones que se extraen de él se relacionan específicamente con este tipo. En este trabajo, se observó, una mayor carga de CNVs de novo en mujeres con respecto a los hombres (p = 0.04). Además, las CNVs de novo en mujeres, eran, por lo general, de mayor tamaño y contenían más genes que las CNVs de novo detectadas en hombres (p = 0.01)66. Esta observación apoya la hipótesis propuesta por Jacquemont et al., tan solo un año antes, conocida como el “modelo protector femenino”, en la cual se sugiere que las mujeres requieren una carga mutacional superior que los hombres para lograr el estatus afecto67. Por otro lado, se propusieron dos mecanismos diferentes para entender el impacto que tiene una CNV en la expresión del fenotipo. En el caso de CNVs de gran tamaño (> 7 genes implicados) se sugiere que sean múltiples genes, cada uno con un efecto moderado, los que contribuyan al fenotipo. En el caso de CNVs de novo más pequeñas (≤ 7 genes implicados), es más posible que un único gen sea el responsable de la expresión del fenotipo66. Con respecto a los TEA familiares destaca un estudio desarrollado en 1532 familias con múltiples miembros afectos pertenecientes al AGRE. En él se identificó que en más de dos tercios de las familias en las cuales se detectaba una CNV de alto riesgo, la variante no era compartida por todos los miembros afectos. Esto indica, que al contrario de lo que se esperaba, las CNVs raras heredadas no son causa suficiente para desencadenar los TND y otros eventos genéticos o ambientales han de estar presentes para la expresión del fenotipo68. Tanto en el estudio de Sanders et al., como en otros trabajos previos, se han identificado numerosas CNVs que aparecen de manera recurrente en individuos no emparentados entre sí66,69,70. Estas CNVs se caracterizan por presentar puntos de ruptura idénticos, lo que significa que tienen el mismo tamaño y el mismo contenido genómico71,72. Muchas de estas CNVs, denominadas recurrentes, se han detectado tanto en individuos sanos como en individuos afectos, así como en múltiples trastornos psiquiátricos, lo cual indica que su penetrancia para la expresión del fenotipo es incompleta y su expresividad es variable73,74. El análisis conjunto de los datos del AGP y la SSC,
AITANA ALONSO GONZÁLEZ 30 permitió detectar asociación de diferentes CNVs con los TEA (Tabla 9)66. Banda Región Genes RefSeq Genes p-valor 1q21.1 chr1:146,467,203-147,801,691 13 6 x 10-9 2p16.3 chr2:50,145,643-51,259,674 1 NRXN1 1 X 10-7 3q29 chr3:195,747,398-196,191,434 7 0.07 7q11.23 chr7:72,773,570-74,144,177 22 0.005 7q11.23 chr7:72,773,570-73,158,061 10 0.0002 7q11.23 chr7:73,978,801-74,144,177 2 GTF2I, GTF2IRD1 0.0002 15q12 chr15:26,971,834-27,548,820 3 GABRA5, GABRB3 GABRG3 1 x 10- 10 15q11.2-13.1 chr15:23,683,783-28,446,765 13 1 x 10- 10 15q13.2-13.3 chr15:30,943,512-32,515,849 7 0.005 16p11.2 chr16:29,655,864-30,195,048 27 1 x 10- 10 22q11.21 chr22:18,889,490-21,463,730 45 1 X 10-7 22q13.33 chr22:51,123,505-51,174,548 1 SHANK3 0.07 Tabla 9. CNVs recurrentes asociadas a los TEA en la SSC y la cohorte del AGP. En la tabla se muestran las CNVs recurrentes identificadas en el análisis conjunto de los datos de la SSC y el AGP. Se especifica la banda y región cromosómica donde se localiza cada CNV, número de genes implicados en cada caso y se detallan los genes interrumpidos solo en aquellas CNVs que implican ≤ 3 genes. El p-valor mostrado es un p-valor corregido para múltiples comparaciones (Adaptada de Sanders et al.,201566). Los trabajos mencionados previamente demuestran que los arrays cromosómicos son herramientas eficaces en la detección de CNVs. Sin embargo, la limitación de esta aproximación reside en los intervalos genómicos que hay entre marcador y marcador. Por ese motivo, resulta muy difícil determinar con exactitud los límites de una CNV, o bien detectar CNVs de muy pequeño tamaño. En lo últimos años se han desarrollado numerosos algoritmos que permiten la detección de todo tipo de variantes estructurales a partir de datos de secuenciación de exoma o genoma completo. Destacan, por ejemplo, los trabajos de Poultney et al., y Brandler, et al., donde se analizaron CNVs detectadas a partir de datos generados por secuenciación de exoma completo y genoma completo respectivamente. Con la detección de deleciones y duplicaciones muy
Introducción 31 pequeñas (< 500pb), surgen, además, nuevas hipótesis en lo referente al impacto de las CNVs en el riesgo de los TEA. Brandler et al., por ejemplo, propusieron, a partir de sus resultados, que la diferencia entre casos y controles no esté marcada por un número superior de CNVs de novo en afectos frente a no afectos, como los primeros estudios señalaban, sino por una proporción mayor de genes interrumpidos56,57. 2.2.2.2.5 Secuenciación de nueva generación y estudios de secuenciación. 2.2.2.2.5.1 Evolución de las tecnologías de secuenciación de nueva generación. El precedente para el desarrollo de las tecnologías de secuenciación tuvo lugar en 1977 cuando Frederick Sanger desarrolló la técnica de la “terminación de cadena” para secuenciar la molécula del ADN. Esta tecnología se denomina ahora secuenciación de primera generación o secuenciación Sanger75. La secuenciación Sanger fue la técnica de secuenciación empleada en el Proyecto Genoma Humano, que se desarrolló durante 13 años y culminó con la secuenciación del primer genoma humano en el año 200476,77. Pese al gran avance en el campo de la genética que suponía este éxito, este proyecto puso de manifiesto la necesidad de desarrollar tecnologías más baratas, rápidas y de mayor rendimiento. Por ese motivo, el Instituto Nacional de Investigación del Genoma Humano o NHGRI (de sus siglas en inglés, National Human Genome Research Institute Home) inició un programa cuyo objetivo era la reducción del coste de la secuenciación del genoma humano (en ese momento de 1000$ por genoma) en un plazo de 10 años. Esto permitió el desarrollo y comercialización de las técnicas de secuenciación de nueva generación o NGS (de sus siglas en inglés, Next Generation Sequencing) como alternativa a la secuenciación de Sanger y que el coste del análisis de paneles de genes, exomas completos y genomas completos bajara exponencialmente. Las principales ventajas de las técnicas de NGS con respecto a la secuenciación de primera generación eran las siguientes: 1. El proceso de clonado en bacterias quedó sustituido por la preparación de librerías.
AITANA ALONSO GONZÁLEZ 38 Las SNVs heredadas, aunque de manera más limitada, también contribuyen al riesgo genético en los TEA. Según un estudio de exoma completos donde se analizaron 933 casos y 869 controles, las mutaciones raras autosómicas recesivas (mutaciones LoF homocigotas o heterocigotas compuestas) podrían explicar un 3% de los casos, mientras que las mutaciones raras ligadas al cromosoma X explicarían un 2% de los casos de TEA en varones98. Un estudio reciente, realizado en una cohorte mayor perteneciente al ASC, calcula que este porcentaje es aún superior, y que las mutaciones autosómicas recesivas podrían explicar hasta un 5% del total de los casos99. Además, el análisis de variantes raras bialélicas en los TEA ha permitido identificar genes causales de TEA familiar como: AMT, PEX7, SYNE1, VPS13B, PAH y POMGNT1 CA2, DDHD1, NSUN2, RARB, ROGD1, SLC1A1, USH2A y FEV99,100 . Figura 8. Contribución de las mutaciones de novo al riesgo en los TEA en la SSC. Esta figura, extraída de Ronemus et al., 2014, resume la incidencia de CNVs de novo (tanto deleciones como duplicaciones) y SNVs de novo (mutaciones LoF, mutaciones missense y mutaciones sinónimas) en todos los casos de TEA y controles (hermanos no afectos) pertenecientes a la SSC97. (Extraída de Ronemus et al., 201497, con permiso de Springer Nature).
Introducción 39 Las variantes raras heredadas LoF heterocigotas confieren riesgo tanto en TEA familiar como esporádico. Sin embargo, los estudios genéticos sugieren que por sí solas no son causa suficiente para que se expresen las características fenotípicas propias de los TEA y han de estar presentes otras variantes de riesgo, que interaccionen con ellas, para que esto ocurra. La transmisión de dichas variantes se produce frecuentemente de madres sanas a varones afectos, lo cual apoyaría la hipótesis del “modelo protector femenino” 67,101. Una de las ventajas que ofrecen los estudios de exoma completo frente al cariotipado molecular, es la posibilidad de detectar genes de riesgo. Las CNVs a menudo afectan a numerosos genes y resulta complejo identificar el gen, o los genes causales, implicados en la expresión del fenotipo. Por el contrario, las SNVs permiten indentificar, con mayor precisión, genes de susceptibilidad en los TEA. A partir de los primeros estudios de exoma completo se identificaron 10 genes de riesgo portadores de mutaciones de novo recurrentes: CHD8, GRIN2B, SCN1A, DYRK1A, KATNAL2, RIMS1, SCN2A, ANP ARID1B y TBR190–95. Además, el desarrollo de nuevas aproximaciones para mejorar la detección de indels de novo a partir de los datos de exoma completo de la SSC permitió incorporar dos nuevos genes al listado previo: KMT2E y RIMS196. Sin embargo, el número de genes de riesgo identificados era muy reducido, debido a que solo se estudiaron genes con mutaciones LoF de alto impacto, obviando genes con mutaciones de efecto más moderado. Por ese motivo, los estudios de exoma completo más recientes han incorporado en sus análisis modelos estadísticos capaces de detectar nuevos genes de riesgo, con precisión, a partir de los datos de secuenciación. Uno de los mejores ejemplos, lo constituye el modelo estadístico TADA (Transmission And De Novo Association). La novedad del TADA reside en su capacidad de integración, en el mismo análisis, no solo variantes de novo, sino también variantes heredadas y variantes detectadas en estudios caso-control, al asumir que todas ellas confieren, en mayor o menor medida, riesgo genético102. TADA detecta genes asociados a la enfermedad de estudio teniendo en cuenta su carga mutacional y el riesgo relativo que confiere cada tipo de variante. De
AITANA ALONSO GONZÁLEZ 40 tal manera que, el peso que se le confiere a una variante de novo LoF es superior al de una variante de novo missense, y el peso de esta última es superior al de una variante LoF heredada102. Aunque TADA puede ser usado en cualquier enfermedad, su uso se ha restringido casi en su totalidad a cohortes de TEA, principalmente en la SSC y la cohorte del ASC66,103,104. Así, TADA fue empleado en el primer estudio llevado a cabo por el ASC identificando 33 genes asociados a TEA con un FDR (de sus siglas en inglés False Discovery Rate) < 0.1 (Tabla 10) y 107 genes con un FDR < 0.3102. Mut. LoF FDR < 0.01 0.01< FDR ≤ 0.05 0.05 < FDR ≤ 0.1 ≥2 ADNP, ANK2, ARID1B, CHD8, CUL3, DYRK1A, GRIN2B, KATNAL2, POGZ, SCN2A, SUV420H1, SYNGAP1, TBR1 ASXL3, BCL11A, CACNA2D3, MLL3 ASH1L 1 CTTNBP2, GABRB3, PTEN, RELN APH1A, CD42BPB, ETFB, NAA15, MYO9B, MYT1L, NR3C2, SETD5, TRIO 0 MIB1 VIL1 Tabla 10. Genes de riesgo en los TEA identificados por TADA ordenador por rangos de FDR y número de mutaciones LoF. (Adaptada de Rubeis et al., 2014105) En el último estudio llevado a cabo por el ASC, que constituye el mayor estudio de exoma completo realizado hasta la fecha (12000 afectos), se empleó un modelo de TADA mejorado en base a dos premisas: 1. No todas las variantes de novo LoF tienen un efecto patogénico. Para poder clasificar las variantes LoF en función de su efecto, se usa un score llamado pLI (de sus siglas en inglés, Probability Of Loss-Of-Function Intolerance) que indica la probabilidad de que un gen sea intolerante a una mutación LoF. Cuanto más intolerante sea el gen, más alto será su pLI (pLI > 0.9)106.
Introducción 41 2. La mayoría de las variantes en regiones codificantes son variantes missense. Sin embargo, solo un pequeño porcentaje de estas variantes tiene un efecto funcional, siendo algunas de ellas tan patogénicas como las variantes de novo LoF. Para poder indentificar variantes missense patogénicas se usa el score MPC (de sus siglas en inglés, Missense Badness, PolyPhen-2, Constraint)107. Así, TADA incluye ahora ambos scores (pLI para variantes LoF y MPC para variantes missense) mejorando la sensibilidad y precisión del modelo original. Con esta versión mejorada de TADA, se detectaron 102 genes de riesgo con un FDR < 0.1 (Tabla 11)104. Categoría Genes Genes enriquecidos con variantes raras en cohortes de TEA o de TND GIGYF1, KDM6B, PAX5, TCF7L2, PHF2, CACNA2D3, NR3C2, PTK7, DIP2A Genes previamente asociados a TND (Autosómicos dominantes o autosómicos recesivos) CHD8, SCN2A, SYNGAP1, ADNP, FOXP1, POGZ, ARID1B, SUV420H1, DYRK1A, SLC6A1, GRIN2B, PTEN, SHANK3, MED13L, CHD2, ANKRD11, ANK2, ASH1L, TLK2, CTNNB1, DEAF1, DSCAM, SETD5, KCNQ3, KDM5B, WAC, SHANK2, NRXN1, TBL1XR1, DNMT3A, MYT1L, BCL11A, RAI1, DYNC1H1, KMT2C, GABRB3, SIN3A, MBD5, STXBP1, TBR1, PPP2R5D, PHF21A, SKI, ASXL3, SPAST, SMARCC2, TRIP12, CREBBP, TCF4, CACNA1E, GNAI1, TCF20, FOXP2, NSD1, GFAP, IRF2BPL, SCN1A, TRAF7, KMT2E, NACC1, GABRB2, KCNMA1 Genes nuevos SRPR, RORB, DPYSL2, AP2S1, MKX, MAP1A, CELF4, PHF12, TM9SF4, PRR12, LDB1, EIF3G, KIAA0232, VEZF1, ZMYND8, SATB1, RFX3, PPP5C, TRIM23, ELAVL3, GRIA2, LRRC4C, NUP155, PPP1R9B, HDLBP, TAOK1, UBR1, TEK, CORO1A, HECTD4, NCOA1 Tabla 11. Genes de riesgo en los TEA con FDR < 0.1 detectados en el mayor estudio de secuenciación de exoma completo llevado a cabo en los TEA (Adaptada de Satterstrom et al., 2020104).
AITANA ALONSO GONZÁLEZ 42 2.2.2.2.5.2.1.1 Mutaciones postcigóticas y mosaicismos detectados en estudios de secuenciación de exoma completo. Las mutaciones de novo puede ser de dos tipos: germinales, si la mutación aparece de manera espontánea en células germinales (óvulo o espermatozoide), o postcigóticas (PZMs, de sus siglas en inglés, postzygotic mutations) si surgen espontáneamente durante las primeras divisiones mitóticas de un cigoto. En el caso de las mutaciones germinales el embrión resultante portará la mutación en cada una de sus células. Por el contrario, en el caso de las mutaciones PZMs, el individuo resultante es un mosaico en el cual un número variable de sus células porta la mutación (Figura 9)108. Las PZMs se han visto implicadas en diferentes TND, como la epilepsia, malformaciones corticales o rasopatías109–111. En estos trastornos se ha observado una relación entre la gravedad de los síntomas que padece el individuo afecto y el momento del desarrollo en el cual aparece la mutación, así como los tipos celulares afectos. Por ejemplo, las mutaciones en el gen MECP2 que causan el síndrome de Rett, suelen ser letales en hombres y dominantes en mujeres, pero se a) b) Figura 9. Mutaciones de novo. a) Mutaciones germinales. b) Mutaciones postcigóticas.
Introducción 43 han descrito casos donde las mutaciones en mosaico en varones son compatibles con la vida112. A pesar de que las PZMs han demostrado jugar un papel importante en la etiología de algunos TND, su detección constituye todo un desafío, debido a que son generalmente específicas de tejido, y en concreto, las muestras de tejido cerebral son muy difíciles de obtener. Las técnicas de NGS, sin embargo, han demostrado ser muy eficaces en la detección de mutaciones mosaico a partir de sangre periférica al poseer una mayor profundidad de lectura. La frecuencia del alelo alternativo o AAF (de sus siglas en inglés Alternate Allele Frequency) se puede calcular si se obtiene un número suficiente de reads que contengan el alelo de referencia y el alelo mutado. En condiciones normales, se esperaría un valor de AAF cercano al 50%, pero en el caso de una mutación PZM, este valor se reduce (AAF < 40%), al detectarse un número menor de reads con el alelo mutado. Así, la secuenciación de exoma completo a una profundidad de lectura superior a 200X (cada base se lee 200 veces), es lo suficientemente sensible para detectar PZMs cuyo valor de AAF es solo de un 15%, lo cual significa que la mutación está presente en solo un 25-30% de las células113,114. Los estudios de exoma completo en los TEA han obviado frecuentemente el análisis de PZMs debido a la falta de pipelines adecuados para su detección. Un reanálisis de la SSC al completo, diseñado específicamente para detectar PZMs, determinó que un 22% de las mutaciones de novo son PZMs y que su detección no se estaba realizando115. En la misma línea, un trabajo del ASC en el cual se reanalizaron los datos de exoma completo del consorcio aplicando un pipeline adecuado para la detección de PZMs, determinó que un 80% de estas variantes habían sido obviadas en estudios previos (Tabla 12)116 .
AITANA ALONSO GONZÁLEZ 44 Estudio Krupp et al., 2017 Lim et al., 2017 Número de familias analizadas 2264 5947 % de PZMs detectadas aplicando nuevos pipelines informáticos 22 % 9.7 % % de PZMs sin publicar en estudios previos 70.64 % 83.3 % Tabla 12. Resultados obtenidos en los principales estudios en cohortes de TEA donde se analizaron PZMs. (Adaptada de de Alonso-Gonzalez et al., 2018103). A partir de estos innovadores estudios, se ha calculado que las PZMs contribuyen aproximadamente en un 4% al riesgo genético de los TEA115,116. Así, las PZMs no solo han sido identificadas en genes de riesgo en los TEA, sino que, además, su detección ha permitido identificar nuevos genes candidatos como KLF16 y MSANTD (Tabla 13). Estudio Genes identificados Lim et al., 2017 KLF16, MSANTD2, POLA2, SMARCA4, AZGP1, CNGB3, HNRNPU, SCN2A, EPPK1, CARD11 Krupp et al., 2017 CHD2, CTNBB1, SCN2A, SYNGAP1, ACTL6B, BAZ2B, COL5A3, SSRP1, UNC79 Freed and Pevsner, 2016 KMT2C, NCKAP1, MYH10 Tabla 13. Genes portadores de mutaciones PZMs en los TEA. (Adaptada de Alonso- Gonzalez et al., 2018103). Un análisis en detalle de PZMs no sinónimas, ha revelado que estas se localizan con mayor frecuencia en genes expresados en cerebro y en exones poco tolerantes a variantes LoF. Además, el análisis de expresión espacio temporal en diferentes periodos del neurodesarrollo y en diferentes áreas cerebrales de los genes portadores de PZMs, señaló la amígdala como una nueva área del cerebro de interés en el estudio de los TEA. Esta región no había sido identificada previamente en estudios de secuenciación de exoma completo116. En conclusión, estos estudios preliminares señalan el importante papel que tienen las PZMs en la patogénesis de los TEA. Quedan aún, sin embargo, muchas cuestiones por resolver en relación a estas
Introducción 45 variantes, como, por ejemplo, los procesos biológicos en los cuales están implicadas, o cuál es su impacto en la expresión del fenotipo. 2.2.2.2.5.2.2 Estudios de secuenciación de genoma completo Los estudios de secuenciación de genoma completo son aquellos que secuencian la totalidad del genoma, incluyendo las regiones no codificantes que no están cubiertas en los estudios de exoma completo. Gracias a esta aproximación se puede detectar todo el espectro de la variación genética conocida, incluyendo SNPs, SNVs, indels y variantes estructurales incluyendo; translocaciones, inversiones y CNVs57,117. Tradicionalmente, se pensaba que la variación genética en regiones no codificantes no contribuía al riesgo genético de las enfermedades debido a que no codifica para proteínas funcionales. Sin embargo, el proyecto ENCODE (Encyclopedia of DNA Elements), financiado por el NHGRI, y con el propósito de catalogar y descifrar todos los elementos funcionales del genoma, demostró que el 80.4% del genoma participa en alguna actividad reguladora que implica al RNA y/o a la cromatina. Así pues, gran parte de la variación genética que se encuentra en regiones no codificantes participa en la regulación genética de diferentes procesos relevantes en el neurodesarrollo, como la neurogénesis o la diferenciación celular (Figura 10)118. Además, también se ha comprobado que las regiones reguladoras están sometidas al efecto de la selección natural negativa lo cual sugiere su potencial efecto deletéreo119.
AITANA ALONSO GONZÁLEZ 46 En la figura se pueden ver ampliados algunos detalles importantes del ADN compacto (eucromatina) en el núcleo de una célula eucariota. Los TAD (de sus siglas en inglés, Topologically Associating Domain) son regiones del genoma, donde las secuencias de ADN interactúan entre sí con más frecuencia. Dichas regiones se separan unas de otras gracias gracias a los insulators que actúan de barrera. Los TAD pueden estar inactivos. En ese caso, la cromatina de la región se encontrará en un estado muy compacto gracias a las proteínas de histona. En el caso de estar activos, se favorece la interacción en la región de elementos reguladores, y los genes son activamente transcritos. Los promotores son regiones que se localizan cerca del gen (± 20 pb) y juegan un papel crítico a la hora de iniciar la transcripción del gen. Los enhancers controlan también la expresión del gen, aunque se encuentran muy alejados del mismo (> 100 pb). Los factores de transcripción o TF (de sus siglas en inglés, transcription factor) se unen a ambos reconociendo secuencias específicas y permiten reclutar la maquinaria necesaria para facilitar la transcripción de un gen. Cuando se inicia la transcripción de un gen en regiones codificantes, se genera inicialmente una molécula de ARN precursor que debe ser procesado para dar lugar a ARN maduro que se traducirá a proteína. Sin embargo, hay tipos de ARN que no con codificantes y que tienen también una función reguladora. (Extraída de A. Takata, 2019120, con permiso de John Wiley and sons). La secuenciación de genoma completo es especialmente útil en los casos de TEA en los cuales no se ha encontrado una CNV o una SNV de novo LoF causal. Estos casos, suponen, por tanto, un reto a la hora de esclarecer la causa genética subyacente al TND que padecen. Figura 10. Representación de elementos no codificantes con función reguladora.
Introducción 47 Por ese motivo, en muchos estudios de secuenciación de genoma completo las cohortes estudiadas están enriquecidas con este tipo de casos, lo cual incrementa la posibilidad de encontrar variantes causales en regiones no codificantes121–125. Aun así, se estima que solo un 1- 2.8% de los casos con un exoma completo o array negativo portan una mutación patogénica en regiones reguladoras, por lo que muy pocos se pueden beneficiar de un diagnóstico mediante el estudio de su genoma completo121. Por otro lado, los estudios de genoma completo tienen la capacidad de analizar la totalidad de la arquitectura genética en un solo experimento124,126. Esta posibilidad, es importante de acuerdo a un modelo poligénico recientemente propuesto en los TEA, en el cual, el riesgo genético para este TND surge por el efecto acumulativo de 2 o más variantes de novo localizadas tanto en regiones codificantes como no codificantes. Este modelo rechazaría, por tanto, el modelo monogénico, más estudiado por estudios de exoma completo, en el cual toda la causalidad del trastorno se atribuye a una variante “patogénica”124. Además, se ha visto que la secuenciación de genoma completo aporta una mayor cobertura media de las regiones codificantes88 y esta característica permite identificar mutaciones puntuales que han pasado desapercibidas en un 2.5% de los estudios de exoma completo124. Sin embargo, existen diversos problemas a la hora de analizar estas variantes, como son la cantidad de datos generados en estos estudios (se analizan aproximadamente 3 billones de nucleótidos por genoma) y la dificultad existente para anotarlas funcionalmente al no poder aplicar el código de tripletes, tal y como se hace en las regiones codificantes. Para la anotación funcional de estas variantes, se recurre a múltiples criterios, como pueden ser el grado de conservación genética, el tipo de variante (SNV, indel, o variante estructural) o su localización según la definición de gen de GENCODE (promotores, UTRs, regiones de splicing, etc), pudiendo surgir un gran número de categorías posibles si se combinan todos ellos. Uno de los primeros trabajos en los que se estudió el papel de los elementos reguladores en los TND fue el llevado a cabo por Short, et al. En él, se hizo una secuenciación dirigida de regiones no codificantes
AITANA ALONSO GONZÁLEZ 54 WGCNA (Weighted Gene Co-expression Red Analysis). WGCNA construye una red de coexpresión en la que se identifican módulos de genes con un patrón de expresión muy similar. En cada módulo se identifican los denominados eigengenes mediante herramientas de reducción de variables como el análisis de componentes principales o PCA (de sus siglas en inglés, principal component analysis). Los eigengenes son genes cuyo patrón de expresión es representativo del módulo y por tanto permiten entender el significado biológico del mismo131. Por otro lado, las redes construidas a partir de bases de datos biológicas tienen la desventaja de que a menudo dichos datos no son tejido-específicos, y, por tanto, las interacciones entre genes que se establecen a partir de ellos pueden no reflejar exactamente las condiciones existentes en el tejido cerebral. El ejemplo más común lo constituyen las redes de interacción proteína-proteína o PPI (de sus siglas en inglés, Protein-Protein Interaction). Los datos de PPI proporcionan información de cómo las proteínas interactúan entre sí en diferentes procesos celulares133. Dichos datos se obtienen usando diferentes aproximaciones (bioquímica, química cuántica, dinámica molecular…) y esta información se deposita en diferentes bases de datos como BioGRID, STRING, MINT, KEEG, DIP, HPRD, o IntACt134. La ventaja fundamental de este tipo de redes es la posibilidad de mapear genes de interés en ellas e identificar nuevas asociaciones con otros genes que no habían sido señalados previamente y así ampliar la lista de genes candidatos asociados a una enfermedad. En los últimos años, se han desarrollado herramientas que permiten la construcción de redes génicas a partir de varias fuentes de información existentes130. NETBAG y MAGI, son ejemplos de ello y ambas se han usado con éxito en TND como los TEA y enfermedades psiquiátricas como la esquizofrenia69,135–137. En el caso de NETBAG, la red se construye en base a la probabilidad de que dos genes participen en un mismo fenotipo, como pueden ser los TEA y DI. Para su construcción se usa la ontología génica (GO y KEEG) o información de PPI137. MAGI, por otro lado,
Introducción 55 integra de manera simultánea información de PPI y datos de expresión con datos genéticos136. Los análisis de genes diferencialmente expresados o DEG (de sus siglas en inglés Differentially Expressed Genes) comparan la expresión de miles de genes entre dos grupos (casos y controles) para identificar genes asociados a una enfermedad analizando cada gen individualmente sin tener en cuenta las relaciones existentes entre ellos. Esto da lugar a listas muy largas de genes diferencialmente expresados cuya interpretación es muy compleja. Además, hay que sumarle la dificultad de obtener tejido cerebral humano post-mortem para crear tamaños de muestra lo suficientemente grandes como para diferenciar la variabilidad interindividual de las diferencias de expresión relativas a la enfermedad130. Los análisis de enriquecimiento de genes o GSEA (de sus siglas en inglés, Gene Set Enrichment Analysis) comprueban la sobrerepresentación estadística de un grupo de genes en un set de genes definido a priori. En el análisis se distinguen 3 pasos fundamentales: el cálculo de un score de enriquecimiento, la estimación de la significación estadística del score y la corrección por múltiples test si se analizan muchos sets de genes simultáneamente. Los GSEA utilizan listados de genes que han sido categorizados previamente, generalmente en base a su implicación en rutas biológicas o bien a su identificación como genes de riesgo en una patología. Así, en los estudios de TEA, los genes de riesgo identificados se comparan con listados de genes clasificados según alguno de esos criterios y se comprueba si existe una sobrerrepresentación de estos genes en alguna ruta biológica, para así determinar su posible asociación con el fenotipo130. 2.3.2 Resultados de los principales estudios Los estudios de TEA donde se han realizado análisis de redes génicas han permitido identificar las principales rutas biológicas que participan en la patogénesis de los TEA El trabajo de O´Roak et al., fue pionero a la hora demostrar que los genes de riesgo en TEA participan en procesos biológicos comunes. En él se demostró, que un 39% de los genes de riesgo identificados en
AITANA ALONSO GONZÁLEZ 56 individuos con TEA, interactuaban entre sí en una red de tipo PPI. Dicha red, estaba enriquecida para funciones biológicas relacionadas con el remodelado de la cromatina y la vía de señalización Wnt/βcatenina95. En este primer trabajo, solo se incluyeron genes con mutaciones de novo LoF, pero en estudios posteriores se tuvieron en cuenta otro tipo de variantes que también confieren riesgo en los TND. Así, en el trabajo de Ruzzo et al., se comprobó que tanto la variación rara de novo como la heredada converge en una red de proteínas interconectadas entre sí. Esta red se enriquece en componentes de la familia SWI/SNF, un complejo remodelador de la cromatina durante la neurogénesis cortical126. El análisis de CNVs identificadas en la SSC y la cohorte del AGP, permitió comprobar que también los genes implicados por estas variantes convergen en procesos biológicos relacionados con el neurodesarrollo. Así, en el trabajo de Gilman et al., se observó un enriquecimiento para funciones relacionadas con el desarrollo de las sinapsis, la motilidad neuronal y la guía de los axones137 mientras que en el trabajo de Pinto et al., se detectó un enriquecimiento para funciones ya descritas anteriormente como la transcripción, el remodelado de la cromatina y el desarrollo de las sinapsis, además de otras nuevas como la vía de señalización MAPK69. El estudio de Rubeis et al., llevado a cabo por el ASC, reportó resultados similares identificando 4 módulos enriquecidos para funciones biológicas relacionadas con la formación de las sinapsis, la transcripción y el remodelado de la cromatina (Figura 13)105.
Introducción 57 Los resultados de estos estudios señalan la existencia de dos grupos funcionales de genes: genes involucrados en la regulación de la expresión génica, incluyendo la regulación de la transcripción y el remodelado de la cromatina, y genes involucrados en la comunicación neuronal. Esta división fue corroborada en el trabajo llevado a cabo por Satterstrom et al., en el cual se realizó un análisis de enriquecimiento basándose en ontologías para un listado de 102 genes obtenido con TADA (FDR < 0.1). En efecto, la mayoría de los genes fueron clasificados en alguna de las dos categorías principales (regulación génica y comunicación neuronal). Sin embargo también se identificaron otros módulos relacionados con la organización del citoesqueleto y con cascadas de señalización y/o ubiquitinación (Tabla 14)104. Figura 13. Análisis de redes génicas (PPI) realizado a partir de los genes de riesgo para los TEA identificados por los algoritmos TADA y DAWN. (Extraída de Rubeis et al., 2014105, con permiso de Springer Nature).
AITANA ALONSO GONZÁLEZ 58 Categorías Genes Regulación de la expresión CHD8, ADNP, FOXP1, POGZ, ARID1B, SUV420H1, MED13L, CHD2, ANKRD11, ASH1L, TLK2, DNMT3A, DEAF1, CTNNB1, KDM6B, SETD5, KDM5B, WAC, TBL1XR1, MYT1L, BCL11A, RORB, RAI1, KMT2C, PAX5, MKX, SIN3A, MBD5, CELF4, PHF12, TBR1, PPP2R5D, PHF21A, SKI, ASXL3, SMARCC2, TRIP12 CREBBP, TCF4, TCF20, FOXP2, NSD1, TCF7L2, LDB1, EIF3G, PHF2, VEZF1, IRF2BPL, ZMYND8, SATB1, RFX3, TRAF7, ELAVL3, KMT2E, NR3C2, NACC1, HDLBP, NCOA1 Comunicación neuronal SCN2A, SYNGAP1, SLC6A1, GRIN2B, PTEN, SHANK3, ANK2, DSCAM, KCNQ3, SHANK2, NRXN1, AP2S1, GABRB3, STXBP1, PRR12, CACNA1E, SCN1A, GRIA2, LRRC4C, CACNA2D3, PPP1R9B, GABRB2, KCNMA1, DIP2A Organización del citoesqueleto DYRK1A, DYNC1H1, DPYSL2, MAP1A, SPAST, GFAP, PTK7, TAOK1, CORO1A Otros GIGYF1, SRPR, TM9SF4, GNAI1, KIAA0232, PPP5C, TRIM23, NUP155, UBR1, TEK, HECTD4 Tabla 14. Clasificación funcional de los genes identificados por TADA (FDR < 01). (Adaptada de Satterstrom et al., 2020104). Una vez identificadas las principales rutas biológicas en las cuales intervienen los genes de riesgo de los TEA, la siguiente cuestión que se debe abordar es averiguar cuándo, dónde y en qué tipo celular tienen lugar estos procesos biológicos. Para ello han sido cruciales los estudios donde se han llevado a cabo análisis de redes de coexpresión ya sea con datos derivados directamente de muestras de cerebro post-mortem o bien usando datos de BrainSpan (Tabla 15). De acuerdo a la primera estrategia, en el estudio de Voineagu et al., se buscaron genes diferencialmente expresados entre casos y controles. Así, se hallaron dos módulos de genes diferencialmente expresados en el córtex: en el primer módulo se identificaron genes con menor expresión en los TEA relacionados con la sinapsis, el transporte de vesículas y las proyecciones neuronales; en el segundo módulo se identificaron genes sobreexpresados en los TEA que se relacionan con procesos inflamatorios138. La misma estrategia fue llevada a cabo en una cohorte mayor de casos de TEA obteniéndose resultados muy similares139.
Introducción 59 Así pues, en el estudio con mayor número de muestras de cerebro analizadas se identificaron 24 módulos de coexpresión. De ellos, solo 6 estaban asociados a los TEA. Tres de ellos estaban enriquecidos en genes que participan en funciones sinápticas, mientras que los tres restantes incluyeron genes que participan en funciones relacionadas con procesos inflamatorios140. A partir de estos datos se ha propuesto que una actividad neuronal deficiente pueda estar implicada en la etiología de los TEA mientras que el aumento en la respuesta inflamatoria sea probablemente un proceso biológico secundario138,139. Paralelamente, la construcción de redes de coexpresión a partir de datos disponibles públicamente, ha revelado cómo los genes de riesgo para los TEA se expresan diferencialmente en etapas muy tempranas del neurodesarrollo en el córtex prefrontal, temporal y cerebeloso (Figura 14)141–143. No obstante, otros estudios también señalan otras áreas cerebrales como el cerebelo, el estriado, la amígdala o el tálamo. Así pues, el hecho de que la actividad de los genes de riesgo no se restrinja al córtex explicaría el amplio espectro de síntomas que caracteriza a los TEA142,143. A nivel celular, la expresión de genes de riesgo en los TEA se ha observado preferentemente en neuronas glutamatérgicas del córtex. Sin embargo, dos estudios difirieron localizándolas en su estructura laminar. En el estudio de Willsey et al., se identificaron en las capas 5 y 6141, mientras que en el de Parikshak et al., se observaron en capas superiores144.
AITANA ALONSO GONZÁLEZ 60 El último estudio de exoma completo llevado a cabo por el ASC, integra resultados de diversos estudios y alcanza conclusiones muy similares, destacando la expresión de genes de riesgo en los TEA en el córtex durante etapas tempranas del neurodesarrollo. Sin embargo, al hacer una distinción entre los dos principales grupos de genes (genes reguladores de la expresión génica y genes relacionados con la comunicación neuronal) se distinguieron dos subperiodos de susceptibilidad en los TEA: uno durante el desarrollo fetal temprano, en el que tiene lugar la máxima expresión de los genes reguladores, y otro durante el desarrollo fetal tardío en el que se expresan los genes relacionados con la comunicación neuronal (Figura 14). Una tendencia similar se había observado previamente en otro trabajo, en el cual se distinguieron dos módulos de genes: uno expresado entre las semanas 8 y 14 tras la concepción que incluía genes relacionados con la vía de señalización Wnt/β-catenina y otro expresado en periodos postnatales que incluyó genes relacionados con la función sináptica136. A nivel celular, en el trabajo del ASC, la expresión de los genes de riesgo se localizó en tipos neuronales que incluyeron neuronas excitatorias e inhibitorias, tanto maduras como inmaduras. Este hecho, apoya la teoría de que una función deficiente de los genes relacionados Figura 14. Representación esquemática de los principales eventos que tienen lugar durante el neurodesarrollo. Se detalla el inicio y fin aproximado de los diferentes procesos que participan en el correcto desarrollo neurológico: neurogénesis y diferenciación neuronal, migración neuronal, axogénesis y sinaptogénesis
Introducción 61 con la comunicación neuronal pueda resultar en una alteración del balance excitatorio /inhibitorio, tal y como ha sido defendido por otros autores145. Sin embargo, teniendo en cuenta que los genes reguladores no tienen actividad directa sobre la expresión de genes involucrados en la comunicación neuronal y que su patrón de expresión es diferente a estos, se presupone que los genes reguladores de la expresión génica debe estar involucrados en otros procesos diferentes que tienen lugar en etapas más tempranas del neurodesarrollo como son la neurogénesis o la migración neuronal (Figura 14)104. Los hallazgos de los estudios de genoma completo y GWAS corroboran esta teoría, pues en ellos se han detectado multitud de variantes que afectan a la expresión de genes que desempeñan su función esencialmente durante el desarrollo fetal48,121,124.
AITANA ALONSO GONZÁLEZ 62 Estudio Tipo de Red Alias Principales procesos biológicos O´Roak et al., 2012 PPI NA Remodelado de la cromatina Via de señalización Wnt/β-catenina Krumm et al., 2014 PPI NA Función sináptica, Remodelado de la cromatina Vía de señalización Wnt/β-catenina t Ruzzo et al., 2018 PPI NA complejo SWI/SNF Gilman et al., 2011 PPI NETBAG Desarrollo de las sinapsis Motilidad neuronal Guía axonal Pinto et al., 2014 PPI NETBAG Transcripción y el remodelado de la cromatina, Vía de señalización MAPK Desarrollo de las sinapsis. Rubeis et al., 2013 PPI NA Transcripción y remodelado de la cromatina Función sináptica Voineagu et al., 2011 Co-expresión NA Función sináptica Respuesta inflamatoria Parikshak et al., 2016 Co-expresión NA Función sináptica Respuesta inflamatoria Hormozdiari et al., 2015 PPI MAGI Función sináptica Vía de señalización Wnt/β-catenina Willsey et al., 2013 Co-expresión NA Neuronas glutamatérgicas en láminas 5 y 6 Parikshak et al., 2013 Co-expresión NA Neuronas glutamatérgicas en láminas 2-4 Satterstrom et al., 2019 Co-expresión NA Transcripción y remodelado de la cromatina Función sináptica Tabla 15. Principales estudios llevados a cabo en los TEA en los que se ha realizado análisis de redes génicas. Se indican los principales procesos biológicos que fueron destacados en cada uno de ellos (Adaptada de Joon Yong An and Charles Claudianos, 2016146). Los análisis de redes génicas y los análisis de expresión llevados a cabo en los estudios de TEA, ofrecen pues, en su conjunto, una visión
Introducción 63 clara de los mecanismos biológicos implicados en su patogénesis. Así pues, todos ellos apuntan a que la alteración de procesos biológicos relacionados con la neurogénesis, la migración celular, el establecimiento de las sinapsis y su correcto funcionamiento durante las etapas tempranas del neurodesarrollo están ligados a las manifestaciones cognitivas que aparecen en los TEA. 2.4 AVANCES EN EL DIAGNÓSTICO MOLECULAR DE LOS TEA Los estudios de investigación llevados a cabo en los TEA han generado un enorme conocimiento de sus bases genéticas. Se sabe que los TEA son trastornos complejos en cuya etiología intervienen tanto variantes comunes como variantes raras altamente penetrantes. Además, también se conocen los principales mecanismos biológicos implicados en su patogénesis. Sin embargo, trasladar todo este conocimiento a la práctica clínica sigue suponiendo un reto. En un contexto clínico, el diagnóstico molecular de los TEA se limita a la búsqueda de variantes raras altamente penetrantes en genes con un papel firmemente demostrado en los TND. 2.4.1 Algoritmos diagnósticos en los TEA 2.4.1.1 TEA sindrómico Los TEA sindrómicos son aquellos que se acompañan de un conjunto de características clínicas o psiquiátricas asociadas a un trastorno genético. Aproximadamente un 10% de los pacientes con TEA, pueden presentar un síndrome genético con causa conocida147. Los TEA sindrómicos pueden deberse a alteraciones cromosómicas microscópicas o mutaciones en genes únicos que causan trastornos autosómicos dominantes (AD), recesivos (AR), o ligados al cromosoma X (Tabla 16).
AITANA ALONSO GONZÁLEZ 70 2.4.1.4 Test de cribado de segunda línea La disminución del coste de las técnicas de NGS ha fomentado su implantación en los laboratorios como una herramienta rutinaria de diagnóstico clínico. Existen 3 aplicaciones diferentes de las técnicas de NGS: secuenciación de un panel de genes, secuenciación de exoma completo y secuenciación de genoma completo. La secuenciación de paneles de genes consiste en la secuenciación de un grupo de genes seleccionados por su implicación en una patología de interés. Esta aproximación permite incrementar la profundidad de lectura en las regiones de interés a un bajo coste, así como disminuir la probabilidad de hallazgos incidentales, que no estén relacionados con la enfermedad estudiada165. En el caso de los TEA, no existe un consenso a la hora de crear listados de genes relacionados con el trastorno. En el trabajo de N. Hoang et al., se realizó un estudio comparativo de los paneles ofertados por 21 laboratorios diferentes y encontraron grandes diferencias entre ellos. Los genes incluidos en cada panel variaban en número en un rango entre 11 y 2562 y solo 178 solaparon en al menos 5 paneles. Además, se detectó una falta de información generalizada sobre los criterios empleados para la selección de genes o incluso sobre cuestiones técnicas relacionadas con los análisis llevados a cabo o la interpretación de las variantes (Tabla 17)166. Figura 16. Algoritmo diagnóstico en los TEA no sindrómicos. Herramientas de cribado de primera línea.
Introducción 71 Gen Paneles que incluyen el gen OMIM MECP2 21/21 Encefalopatía (#300673), Discapacidad intelectual (#300260, #300055), síndrome de Rett (#312750), susceptibilidad a TEA (#300496) NLGN4X 20/21 Discapacidad intelectual (#300495), susceptibilidad a síndrome de Asperger (#300497), susceptibilidad a TEA (#300495) CACNA1C 19/21 Síndrome de Brugada 3 (#611875), síndrome de Timothy (#601005) NRXN1 19/21 Síndrome de Pitt-Hopkins-like 2 (#614325), susceptibilidad a esquizofrenia (#614332) PCDH19 19/21 Encefalopatía epiléptica (#300088) PTCHD1 19/21 Suceptibilidad a TEA (#300830) UBE3A 19/21 Síndrome de Angelman (#105830) NLGN3 18/21 susceptibilidad a síndrome de Asperger (#300494), Suceptibilidad a TEA (#300425) PTEN 18/21 Síndrome Bannayan-Riley-Ruvalcaba (#153480), síndrome de Cowden/ Lhermitte-Duclos (#158350); syndrome macrocefalia/TEA (#605309), asociación con macrocefalia y ventriculomegalia (#276950), susceptibilidad a glioma (#613028), meningioma (#607174); cáncer de próstata (#176807) SHANK3 18/21 Síndrome Phelan-McDermid (#606232), esquizofrenia (#613950) CDKL5 17/21 Encefalopatía epiléptica (#300672) CNTNAP2 17/21 Síndrome Pitt-Hopkins like 1 (#610042), susceptibilidad a TEA (#612100) DHCR7 17/21 Síndrome Smith-Lemli-Opitz (#270400) FOXP1 17/21 Discapacidad intellectual con ausencia de lenguaje con o sin rasgos autistas (#613670) NSD1 17/21 Leucemia (#601626), síndrome de Sotos 1 (#117550) ARX 16/21 Encefalopatía epiléptica (#308350), Hidranencefalia con genitales anómalos (#300215), lisencefalia (#300215), Discapacidad intelectual (#300419), síndrome de Partington (#309510), síndrome de Proud (#300004) Tabla 17. Genes más frecuentemente incluidos en paneles. (Adaptada de Hoang et al., 2018166). Pese a las ventajas que puedan ofrecer los paneles de genes en otros trastornos de herencia mendeliana, en los TEA, los beneficios de esta aproximación son limitados debido a la complejidad del trastorno. No solo existe una falta de consenso sobre qué genes se deben seleccionar,
AITANA ALONSO GONZÁLEZ 72 sino que muchos de los genes que contribuyen al riesgo en los TEA permanecen aún sin identificar. A todo ello se le une la elevada heterogeneidad fenotípica de los TEA. Fuera de las formas sindrómicas comentadas en el apartado anterior, resulta muy difícil plantear una hipótesis previa ante un paciente con TEA que a menudo manifiesta comorbilidades asociadas. Además, puede ocurrir que los síntomas asociados a un posible síndrome no se encuentren presentes en el momento de la exploración clínica dificultando aún más el diagnóstico. Así pues, lo más indicado es hacer un exoma completo donde se analizan todos los genes del genoma caracterizados funcionalmente, sin la necesidad de sospecha previa de un diagnóstico167. En la actualidad no existen guías específicas que recomienden cuando usar la secuenciación de exoma completo en los TEA, pero el Colegio Americano de Genética Médica y Genómica o ACMG (de sus siglas en inglés, American College of Medical Genetics and Genomics) recomienda esta aproximación en casos en los que la historia familiar o el fenotipo del paciente sea sugestivo de un trastorno genómico, para fenotipos donde haya una alta heterogeneidad genética o en los casos donde hayan fallado otros test genéticos168. Así, pues, los TEA pueden beneficiarse de la secuenciación de exoma completo, debido a que a menudo reúnen los criterios anteriormente mencionados.
Introducción 73 La secuenciación de exoma completo es usada generalmente como herramienta diagnóstica en casos de TEA cuyo microarray cromosómico ha sido negativo, alcanzando un rendimiento diagnóstico de aproximadamente un 8.4% aunque esta estimación varía enormemente de un estudio a otro, según los criterios de inclusión de la cohorte de estudio (Figura 17)169. Recientemente, un grupo de expertos ha llevado a cabo una revisión sistemática de la literatura con el objetivo de analizar el rendimiento diagnóstico de la secuenciación de exoma completo en los TND frente al de los microarrays cromosómicos. En base a sus resultados, en los que se demuestra un rendimiento diagnóstico del exoma completo significativamente superior al de los microarray (31- 56% vs 15-20%), se recomienda el uso de esta aproximación como primera herramienta diagnóstica en casos de TND cuya causa se desconoce170. Faltan, sin embargo, estudios de coste-eficacia que respalden el uso de la secuenciación de exoma completo como herramienta de primera línea. Figura 17. Rendimiento diagnóstico del exoma completo en cohortes con TND y cohortes con TND y otras patologías asociadas, en los estudios seleccionados por Srivastava et al. (Extraída de Srivastava et al., 2019170, permitido por Springer Nature).
AITANA ALONSO GONZÁLEZ 74 En contraposición con la secuenciación de exoma completo, la secuenciación de genoma completo no es una técnica que se emplee de manera rutinaria en el diagnóstico de los TEA. Pese a que ofrece la ventaja de detectar de toda la variabilidad genética en un solo test, su uso aún es incipiente en la práctica clínica. Así pues, el balance costebeneficio aún no permite colocar esta aproximación en el algoritmo diagnóstico debido a su elevado coste, el tiempo que requiere el análisis de los datos generados y el reto que supone la interpretación de variantes no codificantes, especialmente en el contexto clínico171. 2.4.2 Priorización e interpretación de variantes en datos de secuenciación de exoma completo. Aunque el empleo de técnicas de NGS en el diagnóstico de individuos con TEA es una aproximación cada vez más común, la interpretación de las variantes detectadas sigue suponiendo un reto en este trastorno. El motivo es la ausencia de guías específicas en un trastorno tan complejo, donde fenómenos como la penetrancia incompleta o la expresividad variable son más la norma que la excepción. Por ello, en el contexto clínico, se usan las recomendaciones del ACMG para la interpretación de variantes, pese que estas han sido pensadas para trastornos de herencia mendeliana. Estas guías, elaboradas por un grupo de expertos, pretenden fomentar el uso de una terminología estándar a la hora de clasificar variantes en la comunidad clínica y científica171. Figura 18. Algoritmo diagnóstico que incorpora la secuenciación de exoma completo en la evaluación clínica de pacientes con TND sin causa conocida propuesto por Srivastava et al. (Adaptada de Srivastava et al., 2019170, permitido por Springer Nature).
Introducción 75 En el análisis de un exoma completo se distinguen dos procesos fundamentales: la priorización y la clasificación de las variantes. En el proceso de priorización se determina qué variantes, de entre las miles detectadas, se relacionan con mayor probabilidad con la causa de la enfermedad de interés. Para esta tarea, se parte de un archivo de variantes genéticas anotado, que proporciona información sobre la posición de las variantes en el genoma y su efecto funcional. Así, se pueden obviar rápidamente variantes sinónimas, cuyo impacto en la enfermedad se asume menor, y variantes intrónicas o localizadas en regiones 5´UTR o 3´UTR172. A continuación, se usan múltiples bases de datos, así como la literatura científica para continuar con el proceso de priorización. Existen bases de datos poblacionales, que contienen un catálogo de la variación genética existente en la población humana y que son una fuente de información crucial a la hora de interpretar una variante. Estas bases de datos proporcionan información sobre su frecuencia alélica permitiendo distinguir entre variantes raras o comunes (Tabla 18)173. Base de datos Descripción Exome Aggregation Consortium (ExAC) Contiene información de las variantes detectadas en el exoma completo de aproximadamente 61000 individuos no relacionados entre sí pertenecientes a 6 poblaciones diferentes. Exome Variant Server Contiene información de variantes detectadas en el exoma completo de diversas cohortes de individuos de descendencia europea y afroamericana. 1000 Genomes Project Contiene información de variantes detectadas en la secuenciación del genoma completo de 2504 individuos pertenecientes a 24 poblaciones diferentes. The Genome Aggregation Database (gnomAD) Este proyecto sucede al ExAC, y contiene información de variantes detectadas en 125748 secuencias de exoma completo y 15708 secuencias de genoma completo dbSNP Contiene información de variantes genéticas de aproximadamente <50 pb dbVar Contiene información de variantes estructurales de aproximadamente >50 pb Tabla 18. Bases de datos poblacionales. (Adaptada de Richards et al., 2015173).
AITANA ALONSO GONZÁLEZ 76 También existen bases de datos específicas de enfermedad que contienen variantes detectadas en pacientes y suelen incluir una valoración sobre la patogenicidad de la variante. Otras bases de datos son aquellas específicas de genes, que establecen una conexión entre los genes y la enfermedad. Estas bases de datos hay que usarlas con mucha cautela porque a menudo contienen variantes incorrectamente clasificadas (Tabla 19)172. Base de datos Descripción ClinVar Contiene información de variantes junto a su interpretación clínica y su fenotipo asociado. OMIM Contiene información sobre aproximadamente 15000 genes asociados a trastornos genéticos y proporciona información fenotípica de aproximadamente 5000 trastornos. Human Gene Mutacion Database Contiene anotaciones de variantes publicadas en la literatura Tabla 19. Bases de datos específicas de enfermedad y de gen. (Adaptada de Richards et al., 2015173). Por último, existen una gran cantidad de herramientas que predicen computacionalmente el posible impacto funcional de una variante, ya que no es siempre posible en la rutina clínica recurrir a estudios funcionales. Hay dos categorías principales: herramientas que predicen si una variante missense tiene un impacto funcional en la proteína resultante y herramientas que predicen el efecto de variantes de splicing. Los criterios para medir el impacto de variantes missense se basan generalmente en el grado de conservación entre especies del aminoácido o del nucleótido, la localización del aminoácido en la proteína y las consecuencias bioquímicas de esta sustitución aminoacídica. Las herramientas para medir el impacto de las variantes de splicing predicen la creación o pérdida de sitios de empalme a nivel exónico e intrónico. Generalmente, los predictores combinan diferentes criterios para aumentar la especificidad y sensibilidad de sus algoritmos. No obstante, es recomendable usar más de uno, pues la información que proporciona cada uno de ellos es complementaria (Tabla 20)173 .
Introducción 77 Categoría Nombre Evidencia Predictores variantes missense ConSurf Conservación evolutiva FATHMM Conservación evolutiva MutationAssessor Conservación evolutiva PANTHER Conservación evolutiva PhD-SNP Conservación evolutiva SIFT Conservación evolutiva SNPs&GO Estructura/función de la proteina Align GVGD Estructura/función de la proteína y conservación evolutiva MAPP Estructura/función de la proteína y conservación evolutiva MutationTaster Estructura/función de la proteína y conservación evolutiva MutPred Estructura/función de la proteína y conservación evolutiva Polyphen-2 Estructura/función de la proteína y conservación evolutiva PROVEAN Usa el grado de conservación en la secuencia proteica para predecir el impacto funcional de la variante nsSNPAnalyzer Múltiples alineamiento de secuencia y análisis de estructura proteica Condel Combina SIFT, PolyPhen-2 y MutationAssesor CADD Integra múltiples anotaciones en una sola medida al comparar mutaciones que no son eliminadas mediante selección natural Predictores de splicing GeneSplicer Modelos de Markov Human Splicing Finder Dependiente de la posición MaxEntScan Principio de máxima entropia NetGene2 Red neural NNSplice Red neural FSPLICE Predictor para sitios de splicing específico de especies basado en un modelo de matrices Predictores de nucleótidos conservados GERP Mide el grado se conservación de la secuencia en el genoma humano a partir del alineamiento de 43 genomas de otros vertebrados PhastCons Usa múltiples alineamientos de secuencias procedentes de diversas especies para identificar elementos conservados PhyloP Alineamiento y árboles filogenéticos Tabla 20. Predictores in silico de patogenicidad. (Adaptada de S. Richards et al., 2015173).
AITANA ALONSO GONZÁLEZ 78 Una vez priorizadas las variantes, el ACMG recomienda su clasificación en 5 categorías: patogénicas, probablemente patogénicas, benignas, probablemente benignas y de significado incierto. Existen criterios de clasificación de variantes patogénicas (Tabla 21) y de variantes benignas (Tabla 22)173: Evidencia Categoría Muy alta PVS1. Variantes que llevan a una disrupción total del producto génico: variantes nonsense, variantes missense, variantes en sitios de splicing canónicos ± 1 y 2, variantes en el codón de inicio de la transcripción, variantes que conducen a la deleción de uno o varios exones. Advertencias: Hay variantes LoF que no son patogénicas en algunos genes. Las variantes LoF en el extremo final 3´ se deben interpretar con cautela. Interpretación con cautela de variantes de splicing. Se requiere comprobar su efecto con un análisis funcional del ARNm o el producto proteico. Considerar la presencia de múltiples transcritos cuyo patrón de expresión puede variar de un tejido a otro. Alta PS1. La variante provoca el mismo cambio aminoacídico que otra variante que se ha establecido ya como patogénica. PS2. Variante de novo en un paciente con la enfermedad y sin historia familiar. PS3. Estudios funcionales in vitro y/o in vivo han confirmado el efecto patogénico de la variante en el gen o su producto proteico. PS4. La prevalencia de la variante en individuos afectos es significativamente superior que en individuos no afectos. Moderada PM1. La mutación se localiza en un dominio funcional crítico sin que se hayan descrito variantes benignas en esa posición. PM2. La variante no se ha identificado nunca en controles, o en caso de estar ligada a una enfermedad autosómica recesiva se ha detectado a frecuencias extremadamente bajas. PM3. En trastornos autosómicos recesivos, la variante se encuentra en trans, con respecto a una variante patogénica. PM4. La variante provoca un cambio en la longitud de la proteína como consecuencia de una deleción o inserción en una zona no repetitiva. PM5. Variante que provoca un cambio aminoacídico en una posición donde otro cambio aminoacídico ha sido descrito como patogénico. PM6. La variante se presume de novo pero no hay confirmación en los progenitores.
Introducción 79 Sugestiva PP1. La variante cosegrega con la enfermedad en varios miembros afectos de la misma familia y se localiza en un gen que se ha visto implicado en la enfermedad. PP2. Variante missense en un gen donde se han detectado pocas variantes benignas de este tipo, y, por el contrario, se han reportado otras variantes missense patogénicas. PP3. Muchos predictores de patogenicidad in silico predicen que la variante es patogénica. PP4. El fenotipo del paciente o la historia familiar es muy específico para una enfermedad con una etiología genética simple. PP5. Una fuente de información acreditada ha reportado recientemente la variante como patogénica pero la evidencia para hacerlo aún no está disponible. Tabla 21. Criterios de evidencia ACMG para la clasificación de variantes patogénicas. PVS1: pathogenic very strong; PVS1-4: pathogenic strong 1-4; PM1-M6: pathogenic moderate 1-6; PP1-5: pathogenic supporting 1-5. (Adaptada de Richards et al., 2015173). Evidencia Categoría Suficiente BA1. MAF > 5% en bases de datos poblacionales Alta BS1. MAF superior a lo esperado para la enfermedad BS2. La variante se ha observado en individuos sanos para trastornos autosómicos recesivos (homocigotos), dominantes (heterocigotos) o ligados al cromosoma X (hemicigosis) que tienen alta penetrancia. BS3. Estudios in vitro/in vivo han confirmado el efecto benigno de la variante en el gen o su producto proteico. BS4. La variante no cosegrega en múltiples miembros afectos de una misma familia. Sugestiva BP1. Variante con cambio de sentido en un gen en el cual se han reportado principalmente variantes LoF como causa de enfermedad. BP2. En trastornos autosómicos dominantes altamente penetrantes, la variante se encuentra en trans, con respecto a una variante patogénica, o se observa en cis con respecto a una variante patogénica, sea cual sea la herencia del trastorno. BP3. Deleción o inserción que no provoca un cambio en el marco de lectura en una zona repetitiva sin función conocida. BP4. Muchos predictores de patogenicidad in silico predicen que la variante es benigna. BP5. Variante detectada en un individuo para el cual ya existe un diagnóstico molecular. BP6. Una fuente de información acreditada ha reportado recientemente la variante como benigna pero la evidencia para hacerlo aún no está disponible. BP7. Variante sinónima para la cual los algoritmos predictores de splicing predicen que no hay un impacto funcional. Tabla 22. Criterios de evidencia ACMG para la clasificación de variantes benignas. BA1: benign stand-alone; BS1-4: benign strong 1-4; BP1-7: benign supporting 1-7. (Adaptada de Richards et al., 2015173).
AITANA ALONSO GONZÁLEZ 86 por miRNA comunes y datos de espectrometría de masas cuantitativa (cantidad total de producto proteico en los diferentes tejidos). La información proporcionada por estos 10 niveles de evidencia se integra para obtener un score de confianza con rango entre 0 y 1 que refleja la probabilidad de conexión funcional entre dos genes. Para la construcción de la red génica se consideraron inicialmente solo 6 de los 8 genes asociados, debido a que dos de ellos fueron eliminados por falta de información en FunCoup (Tabla 25). Análisis Pascal Genes principales FunCoup Interactores Tipo de red XRN2 XRN2 DDX21,ILF2,CDKN2AIP,EXO SC8,NOC3L,ACIN1,ILF3,GN L3,KNRNPF,ADAR,LYAR,SN W1,HNRNPK,HNRNPH1,PAR N,SUMO2,DHX15,NOP2,UP F1,ALYREF,RBM39,SYNCRIP ,PTBP1,C14orf166,NONO,H NRNPUL1 PPI Co-participación compleja NKX2-4 NKX2-2 OLIG2 PPI KIZ KCNN CALM1,CALM2,CALM3 PPI KCNN2 NKX2-2 CRHR1-IT1 C8orf74 LOC644172 Tabla 25. Genes asociados en el GBA realizado con PASCAL y sus principales interactores identificados por FunCoup. Algunos de los genes asociados no fueron detectados por FunCoup (señalados en negrita). Los genes para los cuales se encontraron 1 o más interactores se denominan genes principales y se muestran en la segunda columna. La última columna indica el tipo de conexión funcional entre los genes que se usó para construir la red. Los genes asociados y los interactores que no fueron detectados por GENE2FUNC (explicado en el siguiente apartado) están subrayados. La construcción de la red se realizó de acuerdo a 3 parámetros de expansión: el umbral de confianza, el número de pasos para expandir la red y el número de interactores. En primer lugar, solo se incluyeron en la red parejas de genes con un score de confianza ≥ a 0.8. En segundo
Capítulo 1 87 lugar, la expansión de la red se limitó a un solo paso. Es decir, buscando solo genes con alta conexión funcional con el set de genes inicial. Por último, se limitó el número de interactores detectado por FunCoup a 30. Respecto al tipo de algoritmo usado para expandir la red, se permitió la búsqueda de interactores para cualquiera de los genes incluido en el set inicial de manera independiente, sin priorizar la búsqueda en interactores que presentaran una elevada conexión funcional con más de un gen. La representación gráfica de la red génica resultante se realizó mostrando los genes principales y sus interactores como nodos y las conexiones funcionales entre ellos como aristas. La gráfica muestra solo los principales interactores y el tamaño del nodo refleja la importancia del gen en la red. Por último, se realizó un análisis de enriquecimiento de funciones biológicas (rutas KEEG, términos GO para funciones biológicas y términos GO para funciones moleculares) para todos los genes incluidos en la red obteniendo los p-valores correspondientes. La información de este análisis se visualizó también en el gráfico construido por FunCoup de tal manera que los genes partícipes en el proceso biológico seleccionado se representaron en negro. 4.2.5 Anotación funcional GENE2FUNC, una función perteneciente a la herramienta FUMA (Functional Mapping and Annotation of Genome-Wide Association Studies) (http://fuma.ctglab.nl/), se utilizó para anotar funcionalmente los genes asociados y sus interactores. Para ello, se usó como input un listado total de 36 genes (Tabla 25). GENE2FUNC realiza múltiples análisis, pero solo dos de ellos se han considerado en este estudio: visualización del perfil de expresión génica de los genes asociados y sus interactores mediante heatmaps y un análisis de expresión diferencial de set de genes. En ambos casos se emplearon los datos de expresión de GTEx v7 (incluye datos de expresión de 53 tejidos diferentes) y de BrainSpan (incluye datos de expresión en diferentes periodos del desarrollo). En el caso de GTEx v7 la medida de expresión fue el tránscrito por millón o TPM (de sus siglas en inglés, Transcripts Per Million) y en el caso de BrainSpan fueron
AITANA ALONSO GONZÁLEZ 88 lecturas por kilobase por millón o RPKM (de sus siglas en inglés, Read Per Kilobase per Million). El heatmap es la visualización natural de las matrices de expresión génica. Los datos en el heatmap se visualizan en forma de cuadrícula. En ella, cada fila representa un gen y cada columna su condición de expresión, de manera que los colores de cada celda emulan los colores que identifican el nivel de transcripción en los microarrays. Para la construcción de los heatmaps, se utilizó el valor promedio de expresión normalizada por categoría (media cero entre muestras). Esta visualización permite comparar la expresión de un gen en diferentes categorías (en el caso de GTEx, tejidos, y en el caso de BrainSpan, periodos del desarrollo). Así, las celdas rojas muestran una mayor expresión relativa de un gen en esa categoría en comparación con el resto, y el color azul refleja lo contrario. Para el análisis de expresión diferencial (DEG) los sets de genes diferencialmente expresados se calculan previamente realizado un test t-student con dos colas para cada gen y tejido frente al resto de categorías (en el caso de GTEx, tejidos, y en el caso de BrainSpan, periodos del desarrollo). Aquellos genes en los que se obtiene un valor de p < 0.05 tras corregir por Bonferroni y un cambio de expresión absoluto de ≥ 0.58 (log fold change) se definen como genes diferencialmente expresados. Además, también se considera la sobrexpresión o infraexpresión de los sets de genes para cada categoría en función del signo del t-student. Los 36 genes de nuestro estudio fueron contrastados para cada uno de los sets diferencialmente expresados usando un test de probabilidad hipergeométrico. Así, se muestran en rojo aquellos tejidos (GTEx) o periodos del neurodesarrollo (BrainSpan) en los que existe un enriquecimiento significativo de determinados sets de genes (p-valor corregido por Bonferroni ≤ 0.05). 4.2.6 Metaanálisis de expresión génica diferencial en estudios de TEA dbMDEGA se ha utilizado para evaluar la expresión génica diferencial en tejido cerebral entre individuos control e individuos con TEA para los 36 genes incluidos en la Tabla 25174.
Capítulo 1 89 dbMDEGA utiliza los resultados de un metaanálisis del perfil de expresión de 17741 genes en tejido cerebral humano para realizar un análisis de expresión diferencial para cada de estos genes en individuos con TEA. Los datos de expresión génica proceden de 3 estudios de TEA, cuyos resultados se han en depositado en la base de datos GEO (Gene Expression Omnibus): GSE28475175, GSE28521138, y GSE38322176. Para cada uno de los genes asociados y sus interactores se obtuvieron los siguientes valores: p-valor, FDR y medida de heterogeneidad entre los diferentes datos de expresión (I2). 4.3 RESULTADOS 4.3.1 Análisis basados en genes (GBA) El GBA llevado a cabo con PASCAL reveló la asociación de 8 loci con TEA (p-valor < 2.26 x 10-6) (Tabla 26). NKX2-2 y NKX2-4 (ambos localizados en el cromosoma 20) mostraron asociación en comparación con los resultados obtenidos al aplicar el algoritmo MAGMA en los mismos datos. Cercano a ambos genes, se encuentra el SNP índice rs910805 (p-valor = 2.04 x 10-9) (Tabla 27). El plot de asociación de la región, en torno a dicho SNP, mostró 3 niveles diferentes de r2. Así pues, PASCAL logró detectar asociación para ambos genes (NKX2-2 y NKX2-4), aunque se localizan lejos de rs910805. Sin embargo, SNPs de ambos loci se encuentran en moderado LD con dicho SNP índice (Figura 19). PASCAL también detectó asociación de CRHR1-IT1, LOC644172 (ambos localizados en el cromosoma 17) y C8orf74 (en el cromosoma 8). Cabe destacar, que CRHR1-IT1 solapa con una región intrónica de CRHR1 (que había sido previamente identificada por MAGMA) (Figura 20).
AITANA ALONSO GONZÁLEZ 90 Gen Cromosoma Posición de inicio Posición final Número de SNPs p-valor XRN2 20 21283941 21370463 271 3,53 x 10-9 NKX2-4 20 21376004 21378047 143 9,51 x 10-9 PLK1S1 20 21106623 21227258 287 4,69 x10-8 KCNN2 5 113698015 113832197 540 3,89 x 10-7 NKX2-2 20 21491659 21494664 166 7,78 x 10-7 CRHR1-IT1 17 43716340 43723595 26 1,69 x 10-6 C8orf74 8 10530146 10558103 314 1,78 x 10-6 LOC644172 17 43677490 43679748 24 2,15 x 10-6 LRRC37A 17 44372496 44415160 48 2,64 x 10-6 ARL17A 17 44363861 44657088 64 2,82 x 10-6 KANSL1- AS1 17 44270938 44274089 46 2,84 x 10-6 KANSL1 17 44107281 44302740 153 3,07 x 10-6 MAPT-IT1 17 43973148 43976164 50 3,68 x 10-6 SOX7 8 10581277 10697299 752 4,84 x 10-6 MAPT 17 43971747 44105699 100 4,86 x 10-6 CRHR1 17 43697709 43913194 275 5,45 x 10-6 MAPT-AS1 17 43920721 43972879 224 6,14 x 10-6 STH 17 44076615 44077060 37 6,27 x 10-6 SPPL2C 17 43922255 43924438 193 6,57 x 10-6 PINX1 8 10622883 10697299 684 7,78 x 10-6 Tabla 26. 20 primeros genes que resultan asociados (ordenador por su p-valor) mediande PASCAL, al usar como input los summary statistics correspondientes al metaanálisis de TEA. Los genes señalados en negrita son aquellos que alcanzaron el umbral de significación estadística tras la corrección por Bonferroni (p-valor < 2.26 x 10-6). Las columnas muestran gen, cromosoma, así como posición inicial y posición final en pb, el número de SNPs que PASCAL incluyó en el análisis para cada gen, y el p-valor obtenido por PASCAL.
Capítulo 1 91 Gen Cromosoma Posición inicio Posición final p-valor PASCAL /MAGMA SNP índice Genes asociados tras aplicar el algoritmo PASCAL XRN2 20 21283941 21370463 3,53 x 10-9 rs 910805 NKX2-4 20 21376004 21378047 9,51 x 10-9 rs 910805 PLK1S1 20 21106623 21227258 4,69 x10-8 rs 910805 KCNN2 5 113698015 113832197 3,89 x 10-7 rs 13188074 NKX2-2 20 21491659 21494664 7,78 x 10-7 rs 910805 CRHR1-IT1 17 43716340 43723595 1,69 x 10-6 rs 142920272 C8orf74 8 10530146 10558103 1,78 x 10-6 rs 10099100 LOC644172 17 43677490 43679748 2,15 x 10-6 rs 142920272 Genes asociados tras aplicar el algoritmo MAGMA (Grove et al. 2019) XRN2 20 21283942 21370463 9,69 x 10-10 rs 910805 KCNN2 5 113698016 113832197 1.02 x 10-9 rs 13188074 PLK1S1 20 21106624 21227260 5.17 x 10-9 rs 910805 MACROD2 20 13976146 16033842 1.40 x 10-7 rs 71190156 WNT3 17 44841686 44896082 4.03 x 10-7 rs 142920272 MAPT 17 43971748 44105700 5.01 x 10-7 rs 142920272 MFHAS1 8 8641999 8751131 5.58 x 10-7 rs 11249905 XKR6 8 10753654 11058875 8.01 x 10-7 rs 10099100 MSRA 8 9911830 10286401 9.15 x 10-6 rs 10099100 CRHR1 17 43697710 43913194 1.07 x 10-6 rs 142920272 SOX7 8 10581278 10588022 1.24 x 10-6 rs 10099100 NTM 11 131240371 132206716 1.32 x 10-6 rs 549507 MMP12 11 102733464 102745764 2.28 x 10-6 rs 102751102 BLK 8 11351521 11422108 2.45 x 10-6 rs 2736342 Tabla 27. Genes asociados identificados por PASCAL y MAGMA. Se muestran los genes asociados en este estudio y en el trabajo de Grove et al., 201948. Las columnas muestran cromosoma, posición de inicio y final para cada gen, p-valor obtenido por PASCAL o MAGMA y el SNP índice correspondiente a cada gen.
AITANA ALONSO GONZÁLEZ 92 Figura 19. Plot de asociación de la región donde se localizan NKX2-2 y NXX2-4 realizado con LocusZoom
Capítulo 1 93 Figura 20. Plots de asociación de las regiones donde se localizan CRHR1- IT1 y LOC644172 (cromosoma 17) y C8orf74 (cromosoma 8).
AITANA ALONSO GONZÁLEZ 94 Aparte de estos hallazgos, el resto de loci asociados mediante PASCAL ya habían sido reportados previamente cuando el GBA se realizó con MAGMA (Tabla 27). 4.3.2 Análisis de redes FunCoup identificó interactores para los loci asociados a TEA en el GBA realizado con PASCAL. La red génica se construyó utilizando un total de 36 genes (6 genes asociados y 30 interactores) y se detectaron 120 conexiones funcionales totales entre ellos (Tabla 25). El análisis de enriquecimiento para rutas KEEG y términos GO llevado a cabo con los genes que conformaron la red, mostró un enriquecimiento para diferentes procesos biológicos como espliceosoma (q-valor = 3 x 10-4), transporte del ARN (q-valor = 1.09 x 10-3) y unión a ácidos nucleicos (q-valor = 1.09 x 10-14) (Tabla 28 y Figura 21). Términos enriquecidos Genes q-valor Ruta metabólica KEEG Spliceosome DH15, HNRNPK, ACIN1, ALYREF, SNW1 3 x 10-4 RNA transport SUMO2, ACIN1, ALYREF, UPF1 2.8 x 10-3 Función molecular, térmico GO Nucleic acid binding DDX21, ILF2, CDKN2AIP, EXOSC8, NOC3L, ACIN1, ILF3, GNL3, KNRNPF, ADAR, LYAR, SNW1, HNRNPK, HNRNPH1, PARN, SUMO2, DHX15, NOP2, UPF1, ALYREF, RBM39, SYNCRIP, PTBP1, C14orf166, NONO ,HNRNPUL1, XRN2, NKX2-4, NKX2-2 1.09 x 10-14 Heterocyclid compound binding DDX21,ILF2,CDKN2AIP,EXOSC8 ,NOC3L,ACIN1,ILF3,GNL3,KNR NPF,ADAR,LYAR,SNW1,HNRNP K,HNRNPH1,PARN,SUMO2,DHX 15,NOP2,UPF1,ALYREF,RBM39 ,SYNCRIP,PTBP1,C14orf166,N ONO,HNRNPUL1,XRN2,NKX2- 4,NKX2-2 3.88 x 10-10 Organic cyclid compound binding DDX21, ILF2, CDKN2AIP, EXOSC8, NOC3L, ACIN1, ILF3, GNL3, KNRNPF, ADAR, LYAR, 3.88 x 10-10
Capítulo 1 95 SNW1, HNRNPK, HNRNPH1, PARN, SUMO2, DHX15, NOP2, UPF1, ALYREF, RBM39, SYNCRIP,PTBP1,C14orf166,NO NO, HNRNPUL1, XRN2, NKX2- 4, NKX2-2 Protein binding DDX21, ILF2, CDKN2AIP, EXOSC8, ACIN1, ILF3, GNL3, KNRNPF, ADAR, LYAR, SNW1, HNRNPK, HNRNPH1, PARN, SUMO2, DHX15, NOP2, UPF1, ALYREF, RBM39, SYNCRIP, PTBP1, C14orf166, NONO, HNRNPUL1, XRN2, KCNN2, NKX2-2, KIZ, C8orf74 9.94 x 10-4 Binding DDX21,ILF2,CDKN2AIP, EXOSC8, ACIN1,ILF3,GNL3, KNRNPF,ADAR,LYAR, SNW1,HNRNPK, HNRNPH1,PARN,SUMO2, DHX15,NOP2, UPF1, ALYREF, RBM39,SYNCRIP,PTBP1,C14orf 166,NONO, HNRNPUL1, XRN2,KCNN2, NKX2-2,KIZ, C8orf74, NKX2-4, NOC3L 2.81 x 10-2 Chromatin binding NKX2-2, NONO, NOC3L, UPF1, 1.03 x 10-1 Transcription factor binding NKX2-2, HNRNPF, SUMO2, SNW1 1.03 x 10-1 Enzyme binding KIZ, SUMO2,C14orf166, PARN, ACIN1, HNRN,UL1, SNW1 2.54 x 10-1 Hydrolase activity, acting on acid anhydrides DHX15, DDX21,ACIN1,UPF1 3.34 x 10-1 Identical protein binding KCNN2, NONO, EXOSC8, C14orf166,OLIG2 4.21 x 10-1 hydrolase activity XRN2, DHX15,ADAR, DDX21,PARN,ACIN1,UPF1 6.03 x 10-1 Tabla 28. Enriquecimiento de términos GO y rutas KEEG para los genes asociados identificados por PASCAL y sus interactores, de acuerdo a FunCoup. Se muestran en inglés los términos con p-valores más significativos.
AITANA ALONSO GONZÁLEZ 102 SNW1 1,0892706 x 10-1 0.04 0.18 74% HNRNPK 3,13685174 x 10-1 NA NA NA HNRNPH1 6,07006486 x 10-1 NA NA NA PARN 9,01671731 x 10-1 0 0.03 79% SUMO2 8,85347296 x 10-1 0.27 0.39 72% DHX15 2,93250866 x 10-1 0.12 0.38 0% NOP2 7,85747107 x 10-1 NA NA NA UPF1 2,08668839 x 10-1 0.12 0.27 14% ALYREF 2,00036414 x 10-1 NA NA NA RBM39 2,90163509 x 10-1 0.06 0.2 18% SYNCRIP 2,62087002 x 10-1 0.01 0.08 0% PTBP1 9,27312631 x 10-2 0.02 0.13 0% C14orf166 2,91369259 x 10-1 0.36 0.44 58% NONO NA 0.18 0.33 32% HNRNPUL1 4,2805356 x 10-1 NA NA NA CALM1 3,30876236 x 10-1 0.4 0.46 27% CALM2 9,81305815 x 10-1 0.36 0.44 0% CALM3 7,91761032 x 10-1 0.5 0.5 0% OLIG2 4,52957535 x 10-1 0.4 0.46 0% Tabla 29. Genes asociados identificados por PASCAL e interactores y resultados de dbMDEGA. Se muestran los p-valores calculados por PASCAL y los p-valores calculados por dbMDEGA para cada gen. Se muestran también los valores de heterogeneidad entre estudios de expresión (NA = el gen no se encuentra en la base de datos de dbMDEGA). 4.4 DISCUSIÓN El último metaanálisis de GWAS de TEA identificó asociación de diferentes SNPs en los cromosomas 20 (rs910805), 5 (rs13188074), 17 (rs142920272), y 8 (rs10099100) entre otros. En este mismo estudio también se llevó a cabo un GBA empleando el algoritmo MAGMA, que identificó 15 loci que alcanzaron el umbral de significación estadística. Como era de esperar, muchos de estos genes se localizaban muy cerca de los SNPs reportados como asociados en el GWAS, como XRN2 (rs910805) KCNN2 (rs13188074) y KIZ (o PLK1S1) (rs910805)48. Además, el GBA llevado a cabo por PASCAL ha detectado nuevos
Capítulo 1 103 genes en comparación con aquellos reportados por MAGMA: NKX2-2, NKX2-4, CRHR1-IT1, C8orf74 y LOC644172. Sin embargo, estos hallazgos no deben ser considerados como novedosos del todo. Así pues, los SNPs índice localizados en los cromosomas 20 y 8 también mostraron previamente asociación con TEA al realizarse otros análisis. Así, cuando se realizó el análisis MTAG (de sus siglas en inglés multitrait analysis of GWAS) considerando otros fenotipos genéticamente correlacionados con TEA (como esquizofrenia o nivel educativo), se detectó asociación de dichos loci, lo cual sirvió para resaltar la importancia de la región genética y de los genes localizados en ella (KIZ, XRN2, NKX2-2, y NKX2-4)48,177. Este análisis explica por qué NKX2-2 y NKX2-4 se consideraron loci probablemente asociados. Sin embargo, MAGMA no los identificó como loci estadísticamente significativos48. PASCAL, por el contrario, sí fue capaz de detectar estas asociaciones gracias a la aproximación estadística que emplea. Por otro lado, las posiciones cromosómicas de CRHR1-IT1 y de CRHR1 solapan parcialmente, aunque codifican para distintos tránscritos. CRHR1 mostró asociación debido a que está incluido en el listado inicial de genes de referencia que utiliza PASCAL para mapear los SNPs. Por el contrario, el input de MAGMA no incluía este gen. C8orf74 es un hallazgo controvertido, pues, aunque hay SNPs significativos que solapan con el gen, éstos también se encuentran muy cercanos al gen XKR6, que sí mostró asociación en el trabajo previo de Grove et al.,48. Aun así, PASCAL ha demostrado ser una herramienta útil para detectar nuevos genes asociados que se localizan cerca de aquellos reportados previamente por MAGMA. Ambas herramientas, MAGMA y PASCAL, funcionan de manera similar: 1) emplean como input del análisis los summary statistics del metaanálisis de GWAS en lugar de genotipos, 2) el p-valor para cada gen se calcula teniendo en cuenta todos los p-valores de cada uno de los SNPs localizados a lo largo del gen, 3) la corrección por LD se realiza a partir de información externa procedente del panel europeo 1000 Genomas52,53. Sin embargo, la construcción de la matriz de LD (correlación entre SNPs) es ligeramente diferente en ambos métodos. Esto explicaría las pequeñas diferencias encontradas con respecto a los genes que cada GBA señala como asociados. Los p-valores obtenidos para cada gen con PASCAL,
AITANA ALONSO GONZÁLEZ 104 fueron, en general, menos significativos que los obtenidos con MAGMA. Además, el número de genes estadísticamente significativos tras la corrección por Bonferroni fue también menor cuando se usó PASCAL. Todos estos resultados sugieren que PASCAL podría ser un método de GBA más conservador que MAGMA. En base a lo expuesto, en el presente estudio se propone que PASCAL se utilize como una herramienta GBA complementaria a otras existentes, pues ha resultado eficaz a la hora de reportar nuevas asociaciones de genes localizados en la misma región de LD en la cual se localizan otros genes ya previamente asociados por MAGMA. A continuación, se profundizará en algunos aspectos biológicos de los siguientes loci que resultaron asociados: NKX2-2, NKX2-4, CRHR1- IT1, LOC644172, y C8orf74. NKX2-2 y NKX2-4 son miembros de la familia de factores de transcripción homeobox. NKX2-2 codifica para un factor de transcripción implicado en la morfogénesis del sistema nervioso central y su papel es esencial durante la diferenciación, en fases muy tempranas del desarrollo, de poblaciones neuronales que se localizan en el romboencéfalo y la médula espinal178. NKX2-4 (homeobox protein nkx- 2.4) posee también un papel clave durante el desarrollo del cerebro dado que su inhibición en el cerebro anterior promueve la proliferación de progenitores neurales al mismo tiempo que inhibe su diferenciación, resultando todo ello en una neurogénesis deficiente179. Los heatmaps de expresión construidos a partir de los datos de GTEx y BrainSpan, revelaron dos clústeres de expresión en los cuales está incluido el gen NKX2-2. Los genes del primer clúster mostraron una infraexpresión en estados prenatales y una sobreexpresión en el periodo postnatal, mientras que los genes del segundo clúster mostraron una tendencia opuesta. NKX2-2 y su interactor OLIG-2 (oligodendrocyte transcription factor 2) están incluidos en el primer clúster. Este hecho sugiere la existencia de mecanismos de regulación génica diferentes para NKX2- 2 en el cerebro en desarrollo y el cerebro adulto. Así pues, es sabido que NKX2-2 se expresa inicialmente en células precursoras de oligodendrocitos y luego su expresión disminuye. Sin embargo, se ha demostrado que su expresión vuelve a incrementar en etapas posteriores del neurodesarrollo, lo cual permite el mantenimiento de las estructuras
Capítulo 1 105 mielínicas180. Esto hecho es particularmente interesante dado que estudios previos han relacionado la expresión aberrante de genes en oligodendrocitos con la patogénesis de los TEA181,182. Además, NKX2- 2 y OLIG-2 estaban enriquecidos en términos biológicos relacionados con la unión a proteínas, cromatina y factores de transcripción, todos ellos procesos biológicos subyacentes a la patogénesis de los TEA. Sin embargo, cuando se llevó a cabo el metaanálisis de expresión génica diferencial, debe considerarse que ninguno de estos genes mostró diferencias en el perfil de expresión en cerebros de individuos con TEA respecto a cerebros control. Estos resultados señalan la necesidad de realizar estudios funcionales in vivo con estos genes para poder caracterizar completamente sus funciones biológicas y determinar en detalle su posible implicación en la etiología de los TEA. Un segundo clúster de expresión, de acuerdo al heatmap construido con datos de BrainSpan, incluyó a los genes XRN2, sus interactores y CRHR1-IT1. En primer lugar, debe señalarse que FunCoup calculó un número mayor de interactores para XRN2 que para el resto de genes. Esto puede implicar un sesgo en los análisis posteriores que se llevaron a cabo, pero, al mismo tiempo, señala la importancia de este gen si se considera la extensa red de tipo PPI formada en torno a él. Además, XRN2 y una gran parte de sus interactores (CDKN2AIP, ILF3, GNL3 ADAR, LYAR, SNW1, RBM39, SYNCRIP, y PTBP1) mostraron asociación en el metaanálisis de expresión. Esto demuestra la expresión diferencial de estos genes en el cerebro de individuos con TEA en comparación con cerebros control y, por tanto, su potencial papel en la fisiopatología de los TEA138,176,183. Además, el análisis de enriquecimiento en términos biológicos mostró que XRN2 y sus interactores participan en funciones relacionadas con el espliceosoma, el transporte del ARN y la unión a ácidos nucleicos. Todos ellos, constituyen procesos biológicos esenciales en cualquier organismo y son especialmente relevantes en etapas tempranas del desarrollo. Se ha demostrado, además, que XRN2 podría tener un papel en la finalización de la transcripción a través de la degradación del extremo 3´UTR184. CRHR1-IT1 codifica para un long intergenic non-protein coding RNA que se ha asociado recientemente a susceptibilidad al comportamiento antisocial185. CRHR1-IT1, comparte parte de su secuencia con CRHR1,
AITANA ALONSO GONZÁLEZ 106 el cual codifica para el receptor 1 de la hormona liberadora de corticotropina48. CRHR1, constituye el principal componente de la vía hipotalámica-pituitaria-adrenal y se ha demostrado su asociación, en repetidas ocasiones, con la respuesta psicopatológica ante el estrés186. Aunque la función de CRHR1-IT1 permanece aún sin caracterizar, se cree que podría tener un papel en la regulación de la expresión de CRHR1. De esa manera, CRHR1 y CRHR1-IT1 podrían estar involucrados en la modulación del comportamiento y la cognición, ambas características importantes en los TEA175,185,187,188. Sin embargo, el metaanálisis de expresión diferencial entre tejido cerebral de individuos con TEA y tejido cerebral control no reveló ninguna asociación significativa para ninguno de los dos genes. Por último, otros dos genes, C8orf74 y LOC644172, mostraron asociación en el GBA realizado con PASCAL. Se debe señalar que LOC644172, localizado upstream con respecto a CRHR1 y CRHR1- IT1, no fue reconocido ni por FunCoup ni por FUMA, al igual que C8orf74, que forma parte de un marco de lectura abierto o ORF (de sus siglas en inglés Open Reading Frame). Esto se debe a que ambos genes no están caracterizados funcionalmente y, por tanto, no se encuentran incluidos en bases de datos genéticas y/o funcionales. Sin embargo, el metaanálisis del perfil de expresión reveló que C8orf74 mostró una expresión diferencial en cerebros de individuos con TEA en comparación con cerebros control, lo cual indica la necesidad de una mejor caracterización funcional de este gen para conocer cuáles son los mecanismos biológicos en los que está implicado. 4.5 CONCLUSIONES Se ha llevado a cabo un GBA, mediante PASCAL, que ha usado como input los summary statistics del último metaánalisis de GWAS de TEA. Muchos de los loci que resultaron asociados habían sido previamente reportados por MAGMA. Sin embargo, PASCAL también ha identificado nuevos loci asociados en aquellas regiones de LD en las que se localizan muchos de los loci previamente asociados mediante MAGMA. Estos resultados sugieren que PASCAL se puede utilizar como una aproximación GBA complementaria a la hora de extraer
Capítulo 1 107 información adicional (nuevos genes asociados) a partir de los resultados de un GWAS o de un metaanálisis de los mismos. La segunda parte del estudio se ha centrado fundamentalmente en la caracterización biológica de los loci asociados. Así pues, se llevó a cabo la construcción de una red génica y la anotación funcional de dichos loci, incluyendo la construcción de heatmaps de expresión génica y un análisis de expresión diferencial de sets de genes. Ambas aproximaciones han servido para caracterizar el contexto biológico de los genes asociados a TEA y seleccionar así aquellos genes candidatos más adecuados para futuros estudios funcionales.
Capítulo 2 109 5 CAPÍTULO 2 5.1 OBJETIVO En el presente estudio se han detectado mutaciones de novo (germinales y PZMs) en una cohorte española de TEA formada por 360 tríos (probando afecto y ambos progenitores sanos). Las mutaciones de novo detectadas en esta cohorte, se han combinado con un listado de mutaciones de novo previamente publicado por el ASC116. El objetivo principal de este trabajo ha sido explorar si las mutaciones germinales o PZMs tienden a acumularse en diferentes genes de riesgo en los TEA. Además, mediante herramientas bioinformáticas se ha determinado el impacto de estas mutaciones en diferentes jerarquías biológicas, desde el nivel gen, pasando por términos GO y tipos celulares y a través de los periodos del neurodesarrollo, hasta llegar al nivel de áreas cerebrales. 5.2 MÉTODOS 5.2.1 Sujetos de estudio La extracción de ADN a partir de sangre periférica se realizó con el kit Chemagic DNA Blood 100 Kit (PerkinElmer Inc, Massachusetts, USA) siguiendo las indicaciones del fabricante. Los sujetos de Santiago (N = 136) fueron reclutados en el Complejo Hospitalario Universitario de Santiago de Compostela y en entidades gallegas que trabajan con individuos con TEA (ASPANAES, BATA, MENELA y ASPERGA). Los sujetos de Madrid (N = 224), fueron reclutados como parte del programa AMITEA en el servicio de Psiquiatría del Niño y del Adolescente del Hospital Gregorio Marañón. Solo se incluyeron individuos de 3 años o más. Todos los participantes habían sido diagnosticados previamente de TEA por un neurológo pediátrico o un psiquiatra de acuerdo a los criterios diagnósticos del DSM-IV o el DSM-5. Las pruebas diagnósticas ADOS (de sus siglas en inglés, Autism Diagnostic Observation Schedule) y ADI-R (de sus siglas en
AITANA ALONSO GONZÁLEZ 110 inglés, Autism Diagnostic Interview-Revised) también se administraron en los casos en los que fue necesario. El proyecto fue aprobado por el Comité Ético de Investigación Clínica de Galicia (Código 2012/098; Anexo 1). Los progenitores, o en su defecto, los tutores legales, fueron debidamente informados de la naturaleza y el objetivo del estudio, y se requirió la firma del consentimiento informado para su participación en él (Anexos 2 y 3). 5.2.2 Control de calidad de las muestras y detección de mutaciones de novo 5.2.2.1 Procesamiento de datos y anotación de variantes La secuenciación del exoma completo de cada uno de los tríos que forma parte de la cohorte española (N = 360) fue realizada por el ASC (https://genome.emory.edu/ASC/)104. Este consorcio proporcionó un único archivo VCF con los datos de las variaciones en la secuencia exónica en crudo para todos los individuos de la cohorte. La herramienta bcftools se usó para obtener archivos individuales de cada uno de los sujetos de estudio. Estos archivos individuales contienen las variantes en regiones codificantes identificadas para cada individuo y anotadas con la herramienta SnpEff (Genomic variant annotations and functional effect prediction toolbox) versión 4.3T (http://snpeff.sourceforge.net/). 5.2.2.2 Control de calidad específico para las muestras El grado de parentesco familiar en la cohorte española (360 tríos) se obtuvo calculando el número de errores mendelianos en cada trío. Para ello se usó la función “--mendel”, disponible en la herramienta VCFtools (http://vcftools.sourceforge.net/). Aquellas muestras con una media de errores mendelianos con una desviación significativa de la media no se consideraron en análisis posteriores. Para identificar discrepancias entre el sexo nominal y el sexo determinado genéticamente se empleó la opción “--sexcheck” de la herramienta PLINK que permite inferir el sexo de cada una de las muestras a partir de genotipos en los cromosomas X e Y. Finalmente, para identificar muestras outlier se empleó el comando de PLINK “pseq i-stats”. Las muestras en las cuales, alguno de los
Capítulo 2 111 siguientes parámetros: NALT (de sus siglas en inglés, number of nonreference genotypes), NMIN (de sus siglas en inglés, number of genotypes with a minor allele), NHET (de sus siglas en inglés, number of heterozygous genotypes for individual), NVAR (de sus siglas en inglés, total number of called variants for indivdual) y RATE (de sus siglas en inglés, genotyping rate for individual) se desvió más de 4 DE de la media, fueron eliminadas. Consecuentemente, el trío entero se eliminó si alguno de sus miembros era un outlier siguiendo los parámetros anteriormente descritos. Las muestras de la cohorte que pasaron todos los controles de calidad (360 tríos) son las mismas que se han incluido en la publicación de Satterstrom et al.,104. 5.2.2.3 Detección de mutaciones de novo La detección de variantes de novo en la muestra española (360 tríos), definidas como aquellas variantes presentes en el probando y ausentes en los progenitores, se realizó empleando las opciones de filtrado descritas por Lim et al.,116. En este estudio, las variantes que fueron clasificadas como PZMs fueron resecuenciadas mediante tres tecnologías de secuenciación diferentes alcanzando un ratio de validación muy elevado (87%-97%). Así pues, se definieron como mutaciones de novo aquellas variantes con genotipos 1/0 o 1/1 en el probando y 0/0 en los progenitores. Solo se consideraron aquellas variantes con GQ ≥ 20 (calidad del genotipo asignado) y una profundidad de lectura del alelo alternativo ≥ 7. Las variantes con uno o más alelos presentes en la base de datos ExAC (http://exac.broadinstitute.org/) también fueron eliminadas. Además, se eliminaron las variantes separadas por menos de 20 pb y aquellas con un RVIS > 75% (de sus siglas en inglés, Residual Variation Intolerance Score), obtenido de ExAC. SnpEff fue empleado para clasificar las variantes exónicas de acuerdo a la predicción de su impacto en el tránscrito canónico: alto, moderado o bajo. Las variantes de bajo impacto incluyeron variantes sinónimas, las variantes de impacto moderado incluyeron variantes missense, y las variantes de alto impacto incluyeron variantes nonsense.
AITANA ALONSO GONZÁLEZ 118 germinales identificó 12 genes con FDR < 0.3, incluyendo 3 genes (SCN2A, ARID1B y CHD8) con FDR < 0.1 (Tabla 30). (Tabla Suplementaria 16 de Alonso-González et al.,189). El análisis de genes con PZMs identificó 13 genes con FDR < 0.3 (Tabla 31) de los cuales 4 (KMT2C, FRG1, GRIN2B y MAP2K3) tenían un FDR < 0.1. (Tabla Suplementaria 17 de Alonso-González et al.,189) Genes q-valor p-valor SCN2A 0.004 2.76 x 10-7 ARID1B 0.050 2.76 x 10-6 CHD8 0.066 3.31 x 10-6 FIG4 0.103 9.39 x 10-5 RBM15 0.126 1.16 x 10-5 HUWE1 0.148 3.54 x 10-5 KIAA1107 0.188 5.08 x 10-5 VWAS5B1 0.218 5.08 x 10-5 EMCN 0.242 6.13 x 10-5 SH2B2 0.262 7.90 x 10-5 ASMT 0.277 9.34 x 10-5 MYLK4 0.291 9.67 x 10-5 Tabla 30. Genes de riesgo en los TEA con mutaciones germinales en la cohorte española. Los p-valores y q-valores se obtuvieron tras realizar el análisis TADA- Denovo considerando las mutaciones germinales identificadas en la cohorte de TEA española (360 tríos). Solo se muestran los genes con FDR < 0.3.
Capítulo 2 119 Genes q-valor p-valor KMT2C 0.001 4.76 x 10-7 FRG1 0.015 4.46 x 10-7 GRIN2B 0.040 4.76 x 10-7 MAP2K3 0.08 6.67 x 10-6 SRGAP2 0.106 7.62 x 10-6 MBD6 0.124 7.62 x 10-6 POTEB2 0.168 2.57 x 10-5 CALML6 0.200 2.67 x 10-5 PRDX6 0.226 3.05 x 10-5 SSR2 0.245 3.14 x 10-5 VEGFA 0.264 4 x 10-5 CANX 0.278 0.0001 ZNF276 0.290 0.00012 Tabla 31. Genes de riesgo en los TEA con PZMs en la cohorte española. Los pvalores y q-valores se obtuvieron tras realizar el análisis TADA-Denovo considerando las PZMs identificadas en la cohorte de TEA española (360 tríos). Solo se muestran los genes con FDR < 0.3. En la cohorte combinada, el análisis con TADA de genes con mutaciones germinales (N = 1210) identificó 34 genes con FDR < 0.1 (Tabla 32 y Figura 24) y 102 genes con FDR < 0.3. (Tabla Suplementaria 18 de Alonso-González et al.,189). Tres de los genes (SCN2A, ARID1B, CHD8) con mutaciones germinales fueron priorizados por TADA tanto en la cohorte española como la combinada. El análisis de genes con PZMs (N = 362) en la cohorte combinada identificó tres genes (FRG1, KMT2C y NFIA) con FDR < 0.1 y 14 con FDR < 0.3 (Tabla 33 y Figura 25). (Tabla Suplementaria 19 de Alonso- González et al.,189). Solo dos genes, KMT2C y FRG1, mostraron asociación tras la corrección por FDR (< 0.1) tanto en la cohorte combinada como en la cohorte española.
AITANA ALONSO GONZÁLEZ 120 Genes q-valor p-valor SCN2A 5.04 x 10-12 4.13 x 10-8 CHD8 2.40 x 10-5 4.13 x 10-8 ARID1B 5.36 x 10-5 4.13 x 10-8 SLC6A1 0.00015 2.48 x 10-7 SYNGAP1 0.0005 6.61 x 10-7 KDM5B 0.0008 8.26 x 10-7 SUV420H1 0.002 5.37 x 10-6 TRIP12 0.003 5.79 x 10-6 PTEN 0.004 1.14 x 10-5 KATNAL2 0.008 5.01 x 10-5 NRXN1 0.012 5.79 x 10-5 CREBBP 0.02 5.92 x 10-5 CELF4 0.02 6.09 x 10-5 STXBP1 0.02 6.48 x 10-5 DYRK1A 0.02 7.09 x 10-5 CHD2 0.03 0.0001 ANK2 0.03 0.0001 WDFY3 0.03 0.0001 UNC80 0.04 0.0002 CLASP1 0.04 0.0002 TMEM39B 0.05 0.0002 PRKAR1B 0.05 0.0002 USP45 0.05 0.0003 NUAK1 0.06 0.0004 NAA15 0.06 0.0004 FOXP1 0.07 0.0004 ZC3H11A 0.07 0.0004 DPP3 0.07 0.0005 PRKDC 0.08 0.0005 ATP1A1 0.08 0.0005 LRP5 0.09 0.0005 SLC12A3 0.09 0.0006 FBXO18 0.096 0.0006 PTK7 0.0999 0.0007
Capítulo 2 121 Tabla 32. Genes de riesgo en los TEA con mutaciones germinales en la cohorte combinada. Los p-valores y q-valores se obtuvieron tras realizar el análisis TADA- Denovo considerando las mutaciones germinales identificadas en la cohorte de TEA combinada (2103 tríos). Solo se muestran los genes con FDR < 0.1. Genes q-valor p-valor FRG1 0.04 4.14 x 10-3 KMT2C 0.07 0.00018 NFIA 0.09 0.00028 SMARCA4 0.12 0.00052 PRKDC 0.13 0.00055 KLF16 0.15 0.00064 GRIN2B 0.17 0.00095 MAP2K3 0.18 0.00098 HNRNPU 0.21 0.0019 POTEB2 0.23 0.002 RNPC3 0.25 0.002 FAM177A1 0.27 0.002 CALML6 0.28 0.002 CMPK2 0.3 0.003 Tabla 33. Genes de riesgo en los TEA con PZMs en la cohorte combinada. Los pvalores y q-valores se obtuvieron tras realizar el análisis TADA-Denovo considerando PZMs identificadas en la cohorte de TEA combinada (2103 tríos). Solo se muestran los genes con FDR < 0.3.
AITANA ALONSO GONZÁLEZ 122 Figura 25 Manhattan plot mostrando los genes asociados (de riesgo) en los TEA en el análisis de priorización realizado con TADA-Denovo (en el eje x e y se representan cromosoma y log10 del p-valor para cada gen). Se muestran los pvalores obtenidos en el análisis de mutaciones germinales en la cohorte combinada. Figura 24. Manhattan plot mostrando los genes asociados (de riesgo) en los TEA en el análisis de priorización realizado con TADA-Denovo. (en el eje x e y se representan cromosoma y log10 del p-valor para cada gen). Se muestran los p-valores obtenidos en el análisis de PZMs en la cohorte combinada.
Capítulo 2 123 Un total de 17 genes (50%) de entre los genes con mutaciones germinales de la cohorte combinada (34 genes, FDR < 0.1), se identificaron como genes candidatos según los criterios de SFARI (scores 1, 2, 1s y 2s). Además, 11 de esos genes (64.70%) mostraron FDR < 0.1 en análisis TADA previos105. Del resto de genes identificados por TADA (FDR < 0.1) 10 estaban presentes en la base de datos de SFARI (score 3, 4 y 5), y 5 de ellos se habían relacionado previamente con otra enfermedad distinta a TEA en la base de datos OMIM (Anexo 4). El análisis de PZMs mostró asociación de KMT2C (score SFARI s2) así como de otros 3 genes con FDR < 0.1 (NFIA y FRG1). NFIA se había reportado previamente como un posible gen candidato en TEA (score SFARI 4). Sin embargo, FRG1, mostró asociación por primera vez en este análisis. De los restantes genes con FDR < 0.3, SMARCA4, PRKDC, KLF16, y HNRNPU (score SFARI 3 y 4) son genes que habían sido previamente identificados como genes candidatos con valores de FDR entre 0.1 y 0.3 en análisis TADA previos, y GRIN2B había sido reportado en SFARI como un gen de riesgo de alta probabilidad (score 1). (Anexo 5) 5.3.2 Análisis de enriquecimiento en sets de genes de mutaciones germinales y PZMs DNENRICH se empleó para realizar un análisis de enriquecimiento de mutaciones germinales y PZMs en sets de genes (ver métodos) previamente involucrados en la etiología de los TEA y otros TND. En este análisis solo se consideraron mutaciones nonsense y missense y las mutaciones sinónimas fueron eliminadas debido a que contribuyen con poca probabilidad al fenotipo autista. En primer lugar, para el análisis de enriquecimiento se utilizó el listado de genes con mutaciones de novo (germinales y PZMs) de la cohorte española (Tablas Suplementarias 9 y 10 de Alonso-González et al.,189). Los resultados indicaron que los genes con mutaciones germinales (genes con mutaciones germinales = 228; mutaciones germinales = 236) estaban enriquecidos para varios sets de genes: genes diana de FMRP (p-valor = 0.00013); genes conocidos de DI (p-valor = 0.0073); genes intolerantes a mutaciones LoF (p-valor = 0.002); genes SFARI
AITANA ALONSO GONZÁLEZ 124 (p-valor = 1 x 10-6); y genes relacionados con la organización de la cromatina (p-valor = 0.00018) (Tabla 34). Sin embargo, el listado de genes con PZMs (genes con PZMs = 155; PZMs = 164) solo mostró asociación con genes intolerantes a mutaciones LoF (Tabla 35) Sets de genes p-valor Mutaciones observadas Mutaciones esperadas Genes con expresión monoalélica en neuronas en diferenciación 0.6 12 12.502 Genes diana de CELF4 1 0 0.05078 Genes esenciales 0.0709 49 39.968 Genes diana de FMRP 0.00013 39 20.9788 Enhancers candidatos de genes con expresión en el telencéfalo 0.5386 1 0.771873 Gene diana de CHD8 0.226 39 34.4983 Genes conocidos de DI 0.0073 40 27.0286 Genes intolerantes a mutaciones LoF 0.0018 79 58.9156 Gene SFARI 1 x 10-6 49 20.9601 Genes sinápticos 0.3592 14 12.4002 Genes relacionados con la organización de la cromatina 0.00018 24 10.7377 Genes diana de miR-137 0.3251 8 6.49354 Genes diana de miR-128 1 0 0.022676 Genes diana de RBFOX 1 0 0.055409 Tabla 34. Resultados del análisis de enriquecimiento en sets de genes para los genes con mutaciones germinales (cohorte española).
Capítulo 2 125 Sets de genes p-valor Mutaciones observadas Mutaciones esperadas Genes con expresión monoalélica en neuronas en diferenciación 0.9727 4 8.48746 Genes diana de CELF4 1 0 0.034487 Genes esenciales 0.2340 31 27.1352 Genes diana de FMRP 0.0764 20 14.2422 Enhancers candidatos de genes con expresión en el telencéfalo 0.0977 2 0.524631 Gene diana de CHD8 0.0884 30 23.4115 Genes conocidos de DI 0.7554 16 18.3456 Genes intolerantes a mutaciones LoF 0.0283 51 39.9973 Gene SFARI 0.0764 20 14.2361 Genes sinápticos 0.3339 10 8.41702 Genes relacionados con la organización de la cromatina 0.0625 12 7.28793 Genes diana de miR-137 0.8198 3 4.40692 Genes diana de miR-128 1 0 0.015316 Genes diana de RBFOX 1 0 0.037786 Tabla 35. Resultados del análisis de enriquecimiento en sets de genes para los genes con PZMs (cohorte española). El análisis DNENRICH en la cohorte combinada mostró un enriquecimiento de los genes con mutaciones germinales y PZMs para diferentes sets de genes: organización de la cromatina, genes SFARI, genes intolerantes a mutaciones LoF, genes diana de CHD8 y genes esenciales. Además, los genes con mutaciones germinales (genes con mutaciones germinales = 1972; mutaciones germinales = 2270) mostraron también enriquecimiento para genes diana de FMRP (p-valor = 1 x 10-6), genes conocidos de DI (p-valor = 1 x 10-6) y genes sinápticos (p-valor = 4 x 10-6) (Tabla 36 y Figura 26). Los genes con PZMs (genes con PZMs = 624; PZMs = 676) solo mostraron asociación para genes diana de miR-137 (p-valor = 0.0019) (Tabla 37 y Figura 26).
AITANA ALONSO GONZÁLEZ 126 Sets de genes p-valor Mutaciones observadas Mutaciones esperadas Genes con expresión monoalélica en neuronas en diferenciación 0.6999 121 126.324 Genes diana de CELF4 1 0 0.51357 Genes esenciales 1.x 10-6 533 404.162 Genes diana de FMRP 1.x 10-6 331 212.218 Enhancers candidatos de genes con expresión en el telencéfalo 0.0550 13 7.82029 Gene diana de CHD8 3.5 x10-5 420 348.544 Genes conocidos de DI 1.x 10-6 373 273.213 Genes intolerantes a mutaciones LoF 1.x 10-6 733 595.59 Gene SFARI 1.x 10-6 434 211.973 Genes sinápticos 4.x 10-6 180 125.408 Genes relacionados con la organización de la cromatina 1.x 10-6 168 108.449 Genes diana de miR-137 0.1368 75 65.7234 Genes diana de miR-128 1 0 0.22838 Genes diana de RBFOX 0.4299 1 0.562709 Tabla 36. Resultados del análisis de enriquecimiento en sets genes para los genes con mutaciones germinales (cohorte combinada).
Capítulo 2 127 Sets de genes p-valor Mutaciones observadas Mutaciones esperadas Genes con expresión monoalélica en neuronas en diferenciación 0.9744 26 36.4938 Genes diana de CELF4 1 0 0.147914 Genes esenciales 0.0118 140 116.895 Genes diana de FMRP 0.0425 75 61.4294 Enhancers candidatos de genes en el telencéfalo 0.0796 5 2.2672 Genes diana de CHD8 0.0228 120 100.751 Genes conocidos de DI 0.1840 87 79.0127 Genes intolerantes a mutaciones LoF 0.0003 212 172.214 Gene SFARI 1 x 10-7 127 61.2987 Genes sinápticos 0.6109 35 36.2813 Genes relacionados con la organización de la cromatina 0.0106 45 31.3424 Genes diana de miR-137 0.0019 33 19.0234 Genes diana de miR-128 1 0 0.066195 Genes diana de RBFOX 1 0 0.162842 Tabla 37. Resultados del análisis de enriquecimiento en sets de genes para los genes con PZMs (cohorte combinada).
AITANA ALONSO GONZÁLEZ 230 483–496 (2012). 291. McConnell, M. J. et al. Mosaic Copy Number Variation in Human Neurons. Science (80-. ). 342, 632 LP – 637 (2013). 292. King, D. A. et al. Mosaic structural variation in children with developmental disorders. 24, 2733–2745 (2015). 293. King, D. A. et al. Detection of structural mosaicism from targeted and whole-genome sequencing data. 1704–1714 (2017). doi:10.1101/gr.212373.116.Freely 294. Girirajan, S. et al. Phenotypic Heterogeneity of Genomic Disorders and Rare Copy-Number Variants. N. Engl. J. Med. 367, 1321–1331 (2012). 295. Hu, W. F., Chahrour, M. H. & Walsh, C. A. The Diverse Genetic Landscape of Neurodevelopmental Disorders. (2014). doi:10.1146/annurev-genom-090413-025600 296. Girirajan, S. et al. A recurrent 16p12.1 microdeletion supports a twohit model for severe developmental delay. Nat Genet 42, 203–209 (2010). 297. Pizzo, L. et al. Rare variants in the genetic background modulate cognitive and developmental phenotypes in individuals carrying disease-associated variants. Genet. Med. 21, 816–825 (2019). 298. These, D., We, Q. & These, Q. Polygenic transmission disequilibrium confirms that common and rare variation act additively to create risk for autism spectrum disorders. doi:10.1038/ng.3863 299. Bergen, S. E. et al. Joint contributions of rare copy number variants and common SNPs to risk for schizophrenia. Am. J. Psychiatry 176, 29– 35 (2019). 300. I et al. The Genetic Basis of Phenotypic Diversity: Autism as an Extreme Tail of a Complex Dimensional Trait. Intech i, 13 (2012). 301. Stefansson, H. et al. CNVs conferring risk of autism or schizophrenia affect cognition in controls. Nature 505, 361–366 (2014). 302. Robinson, E. B. et al. Autism spectrum disorder severity reflects the average contribution of de novo and familial influences. Proc. Natl. Acad. Sci. U. S. A. 111, 15161–15165 (2014). 303. Ingersoll, B. & Wainer, A. The Broader Autism Phenotype. in Handbook of Autism and Pervasive Developmental Disorders, Fourth Edition (American Cancer Society, 2014). doi:10.1002/9781118911389.hautc02 304. Genetic Aspects of the Broad Autism Phenotype. in The Broad Autism
Bibliografía 231 Phenotype 29, 37–63 (Emerald Group Publishing Limited, 2015). 305. Sasson, N. J., Lam, K. S. L., Parlier, M., Daniels, J. L. & Piven, J. Autism and the broad autism phenotype: Familial patterns and intergenerational transmission. J. Neurodev. Disord. 5, 1–7 (2013). 306. Gerdts, J. A., Bernier, R., Dawson, G. & Estes, A. The broader autism phenotype in simplex and multiplex families. J. Autism Dev. Disord. 43, 1597–1605 (2013). 307. Davidson, J. et al. Expression of the broad autism phenotype in simplex autism families from the simons simplex collection. J. Autism Dev. Disord. 44, 2392–2399 (2014). 308. Dudbridge, F. Power and Predictive Accuracy of Polygenic Risk Scores. 9, (2013). 309. Lambert, S. A., Abraham, G. & Inouye, M. Towards clinical utility of polygenic risk scores. Hum. Mol. Genet. 28, R133–R142 (2019). 310. Huguet, G., Benabou, M. & Bourgeron, T. The Genetics of Autism Spectrum Disorders. in 101–129 (2016). doi:10.1007/978-3-319- 27069-2_11
Anexos 233 10 ANEXOS 10.1 ANEXO 1: APROBACIÓN COMITÉ ÉTICO DE INVESTIGACIÓN CLÍNICA DE GALICIA 10.2 ANEXO 2: HOJA DE INFORMACIÓN PARA LOS PARTICIPANTES 10.3 ANEXO 3: COSENTIMIENTO INFORMADO
AITANA ALONSO GONZÁLEZ 234 10.4 ANEXO 4. DESCRIPCIÓN DE LOS GENES CON MUTACIONES GERMINALES OBTENIDOS EN LA COHORTE COMBINADA. Se muestran los genes con valores de FDR < 0.1. Se incluye la siguiente información: gen ya reconocido como un gen de riesgo de TEA, gen incluido en la base de datos SFARI, gen previamente indentificado en otros análisis TADA y enfermedad OMIM asociada al gen en inglés. Gen q-valor p-valor Gen candidato Gen SFARI Clasificación SFARI TADA previo FDR <0.01 OMIM SCN2A 5.04 x 10-12 4.13 x 10-8 si si 1 si Epileptic encephalopathy, early infantile, 11; Seizures, benign familial infantile, 3 CHD8 2.40 x 10-5 4.13 x 10-8 si si 1s si {Autism, susceptibility to, 18} ARID1B 5.36 x 10-5 4.13 x 10-8 si si 1s si Coffin-siris syndrome 1 SLC6A1 0.00014991 2.48 x 10-7 si si 2s si Myoclonic-atonic epilepsy SYNGAP1 0.000508219 6.61 x 10-7 si si 1s si Mental retardation, autosomal dominant 5 KDM5B 0.000841602 8.26 x 10-7 si si 2s no Mental retardation, autosomal recessive 65
Anexos 235 KMT5B 0.001898533 5.37 x 10-6 si si 1S si Mental retardation, autosomal dominant 51 TRIP12 0.0027703 5.79 x 10-6 si si 1S no Mental retardation, autosomal dominant 49 PTEN 0.004131864 1.14 x 10-5 si si 1S si Cowden syndrome 1;Lhermitte- Duclos syndrome;Macrocephaly/autism syndrome;Prostate cancer, somatic;{Glioma susceptibility 2};{Meningioma} KATNAL2 0.008224845 5.01 x 10-5 si si 1 si NA NRXN1 0.01194415 5.79 x 10-5 si si 2 no Pitt-Hopkins-like syndrome 2; {Schizophrenia, susceptibility to, 17} CREBBP 0.015098004 5.92 x 10-5 no si 5 no Menke-Hennekam syndrome 1;Rubinstein-Taybi syndrome 1 CELF4 0.017826919 6.09 x 10-5 no si 3 no NA STXBP1 0.020341344 6.48 x 10-5 no si 3s NO Epileptic encephalopathy, early infantile, 4 DYRK1A 0.0227959 7.09 x 10-5 si si 1s si Mental retardation, autosomal dominant 7
AITANA ALONSO GONZÁLEZ 236 CHD2 0.025896407 0.00010719 si si 1s no Epileptic encephalopathy, childhood-onset ANK2 0.029572774 0.000136694 si si 1 si Cardiac arrhythmia, ankyrin-B- related; Long QT syndrome 4 WDFY3 0.033145437 0.000147769 si si 2 no ?Microcephaly 18, primary, autosomal dominant UNC80 0.037280204 0.00018595 no si 4 no Hypotonia, infantile, with psychomotor retardation and characteristic facies 2 CLASP1 0.041141977 0.000192149 no si 3 NA TMEM39B 0.045179962 0.000226612 no no NA no NA PRKAR1B 0.049032281 0.000240909 no no NA no NA USP45 0.053777544 0.000349174 no si 3 no NA NUAK1 0.058346344 0.000365372 no si 3 no NA NAA15 0.062733828 0.000387769 si si 1s si Mental retardation, autosomal dominant 50 FOXP1 0.066799738 0.000390331 si si 1s no Mental retardation with language impairment and with or without autistic features
Anexos 237 ZC3H11A 0.07061159 0.00039876 no no NA no NA DPP3 0.074752544 0.000470909 no no NA no NA PRKDC 0.079128953 0.00053124 no si 4 no Immunodeficiency 26, with or without neurologic abnormalities ATP1A1 0.083428257 0.000549008 no si 4s no Charcot-Marie-Tooth disease, axonal, type 2DD; Hypomagnesemia, seizures, and mental retardation 2 LRP5 0.087492397 0.000553223 no no NA no Exudative vitreoretinopathy 4; Hyperostosis, endosteal; Osteopetrosis, autosomal dominant 1; Osteoporosispseudoglioma syndrome; Osteosclerosis; Polycystic liver disease 4 with or without kidney cysts; van Buchem disease, type 2; [Bone mineral density variability 1]; {Osteoporosis} 166710 AD 3 SLC12A3 0.091716102 0.000608099 no no NA no Gitelman syndrome FBXO18 0.095909862 0.000644628 no no NA no NA
AITANA ALONSO GONZÁLEZ 238 PTK7 0.099893315 0.000651157 no si 3 si NA
Anexos 239 10.5 ANEXO 5. DESCRIPCIÓN DE LOS GENES CON PZMS OBTENIDOS EN LA COHORTE COMBINADA. Se muestran los genes con valores de FDR <0.1. Se incluye la siguiente información: gen ya reconocido como un gen de riesgo de TEA, gen incluido en la base de datos SFARI, gen previamente indentificado en otros análisis TADA y enfermedad OMIM asociada al gen en inglés. Gen q-valor p-valor Gen candidato Gen SFARI Clasificación SFARI TADA previo FDR <0.01 OMIM FRG1 0.03504588 1 4.14 x 10-5 no no NA no Facioscapulohumeral muscular dystrophy 1 KMT2C 0.06913070 6 0.000182873 si si s2 si Kleefstra syndrome 2 NFIA 0.09174555 4 0.000279834 no si 4 no Brain malformations with or without urinary tract defects SMARCA4 0.11802403 9 0.000517127 no si 3 no Coffin loris
AITANA ALONSO GONZÁLEZ 246 PTEN score 1 High Confidence Criteria 1.1 {Glioma susceptibility 2}; {Meningioma}; Cowden syndrome 1; Lhermitte- Duclos syndrome; Macrocephaly/autism syndrome; Prostate cancer, somatic 613028; 607174; 158350; 158350; 605309; 176807 NA; AD; AD; AD; AD; NA PTPN11 score 1 High Confidence Criteria 1.1 LEOPARD syndrome 1; Leukemia, juvenile myelomonocytic, somatic; Metachondromatosis; Noonan syndrome 1 151100; 607785; 156250; 163950 AD;NA; AD; AD RAI1 score 1 High Confidence Criteria 1.1 Smith-Magenis syndrome 182290 AD RELN score 1 High Confidence Criteria 1.1 {Epilepsy, familial temporal lobe, 7}; Lissencephaly 2 (Norman-Roberts type) 616436; 257320 AD; AR RERE score 1 High Confidence Criteria 1.1 Neurodevelopmental disorder with or without anomalies of the brain, eye, or heart 616975 AD RIMS1 score 1 High Confidence Criteria 1.1 Cone-rod dystrophy 7 603649 NA SCN1A score 1 High Confidence Criteria 1.1 Epilepsy, generalized, with febrile seizures plus, type 2; Epileptic encephalopathy, early infantile, 6 (Dravet syndrome); Febrile seizures, familial, 3A; Migraine, familial hemiplegic, 3 604403; 607208; 604403; 609634 AD; AD; AD; AD SCN2A score 1 High Confidence Criteria 1.1 Epileptic encephalopathy, early infantile, 11; Seizures, benign familial infantile, 3 613721; 607745 AD; AD SCN8A score 1 High Confidence Criteria 1.1 ?Myoclonus, familial, 2; Cognitive impairment with or without cerebellar ataxia; Epileptic encephalopathy, early infantile, 13; Seizures, benign familial infantile, 5 618364; 614306; 614558; 617080 AD; AD; AD; AD SETBP1 score 1 High Confidence Criteria 1.1 Mental retardation, autosomal dominant 29; Schinzel-Giedion midface retraction syndrome 616078; 269150 AD; AD SETD5 score 1 High Confidence Criteria 1.1 Mental retardation, autosomal dominant 23 615761 AD
Anexos 247 SHANK2 score 1 High Confidence Criteria 1.1 {Autism susceptibility 17} 613436 NA SHANK3 score 1 High Confidence Criteria 1.1 {Schizophrenia 15}; Phelan- McDermid syndrome 613950; 606232 AD; AD SIN3A score 1 High Confidence Criteria 1.1 Witteveen-Kolk syndrome 613406 AD SLC6A1 score 1 High Confidence Criteria 1.1 Myoclonic-atonic epilepsy 616421 AD SPAST score 1 High Confidence Criteria 1.1 Spastic paraplegia 4, autosomal dominant 182601 AD SRCAP score 1 High Confidence Criteria 1.1 Floating-Harbor syndrome 136140 AD STXBP1 score 1 High Confidence Criteria 1.1 Epileptic encephalopathy, early infantile, 4 612164 AD SYNGAP1 score 1 High Confidence Criteria 1.1 Mental retardation, autosomal dominant 5 612621 AD TBR1 score 1 High Confidence Criteria 1.1 Intellectual developmental disorder with autism and speech delay 606053 AD TCF4 score 1 High Confidence Criteria 1.1 Corneal dystrophy, Fuchs endothelial, 3; Pitt-Hopkins syndrome 613267; 610954 AD; AD TRIP12 score 1 High Confidence Criteria 1.1 Mental retardation, autosomal dominant 49 617752 AD TSC2 score 1 High Confidence Criteria 1.1 ?Focal cortical dysplasia, type II, somatic; Lymphangioleiomyomatosis, somatic; Tuberous sclerosis-2 607341; 606690; 613254 NA; NA; AD UBE3A score 1 High Confidence Criteria 1.1 Angelman syndrome 105830 AD UPF3B score 1 High Confidence Criteria 1.1 Mental retardation, X-linked, syndromic 14 300676 XLR
AITANA ALONSO GONZÁLEZ 248 WAC score 1 High Confidence Criteria 1.1 Desanto-Shinawi syndrome 616708 AD WDFY3 score 1 High Confidence Criteria 1.1 ?Microcephaly 18, primary, autosomal dominant 617520 AD ZBTB20 score 1 High Confidence Criteria 1.1 Primrose syndrome 259050 AD ADSL score 1 High Confidence Criteria 1.1 Adenylosuccinase deficiency 103050 AR ALDH5A1 score 1 High Confidence Criteria 1.1 Succinic semialdehyde dehydrogenase deficiency 271980 AR ARX score 1 High Confidence Criteria 1.1 Epileptic encephalopathy, early infantile, 1; Hydranencephaly with abnormal genitalia; Lissencephaly, X-linked 2; Mental retardation, X-linked 29 and others; Partington syndrome; Proud syndrome 308350; 300215; 300215; 300419; 309510; 300004 XLR; XL; XLR; XLR; XL BRAF score 1 High Confidence Criteria 1.1 Adenocarcinoma of lung, somatic; Cardiofaciocutaneous syndrome; Colorectal cancer, somatic; LEOPARD syndrome 3; Melanoma, malignant, somatic; Nonsmall cell lung cancer, somatic; Noonan syndrome 7 211980; 115150; NA; 613707; NA; NA; 613706 NA; AD; NA; AD; NA; NA; AD CACNA1C score 1 High Confidence Criteria 1.1 Brugada syndrome 3; Long QT syndrome 8; Timothy syndrome 611875; 618447; 601005 NA;NA; AD CDKL5 score 1 High Confidence Criteria 1.1 Epileptic encephalopathy, early infantile, 2 300672 XLD CHD7 score 1 High Confidence Criteria 1.1 CHARGE syndrome; Hypogonadotropic hypogonadism 5 with or without anosmia 214800; 612370 AD; AD CREBBP score 1 High Confidence Criteria 1.1 Menke-Hennekam syndrome 1; Rubinstein-Taybi syndrome 1 618332; 180849 NA; AD
Anexos 249 DHCR7 score 1 High Confidence Criteria 1.1 Smith-Lemli-Opitz syndrome 270400 AR DMPK score 1 High Confidence Criteria 1.1 Myotonic dystrophy 1 160900 AD FMR1 score 1 High Confidence Criteria 1.1 Fragile X syndrome; Fragile X tremor/ataxia syndrome; Premature ovarian failure 1 300624; 300623; 311360 XLD; XLD; XL FOXG1 score 1 High Confidence Criteria 1.1 Rett syndrome, congenital variant 613454 AD KIAA2022 score 1 High Confidence Criteria 1.1 Mental retardation, X-linked 98 300912 XLD NF1 score 1 High Confidence Criteria 1.1 Neurofibromatosis, type 1 162200 AD NIPBL score 1 High Confidence Criteria 1.1 Cornelia de Lange syndrome 1 122470 AD NSD1 score 1 High Confidence Criteria 1.1 Leukemia, acute myeloid; Sotos syndrome 1 601626; 117550 AD; AD PACS1 score 1 High Confidence Criteria 1.1 Schuurs-Hoeijmakers syndrome 615009 AD PCDH19 score 1 High Confidence Criteria 1.1 Epileptic encephalopathy, early infantile, 9 300088 XL POMGNT1 score 1 High Confidence Criteria 1.1 Muscular dystrophydystroglycanopathy (congenital with brain and eye anomalies), type A, 3; Muscular dystrophydystroglycanopathy (congenital with mental retardation), type B, 3; Muscular dystrophydystroglycanopathy (limbgirdle), type C, 3; Retinitis pigmentosa 76 253280; 613151; 613157; 617123 AR; AR; AR; AR SLC9A6 score 1 High Confidence Criteria 1.1 Mental retardation, X-linked syndromic, Christianson type 300243 XLD
AITANA ALONSO GONZÁLEZ 250 TSC1 score 1 High Confidence Criteria 1.1 Focal cortical dysplasia, type II, somatic; Lymphangioleiomyomatosis; Tuberous sclerosis-1 607341; 606690; 191100 NA; NA; AD VPS13B score 1 High Confidence Criteria 1.1 Cohen syndrome 216550 AR BRSK2 score 1 High Confidence Criteria 1.1 NA NA NA CACNA1D score 2 Strong Candidate Criteria 2.1 Primary aldosteronism, seizures, and neurologic abnormalities; Sinoatrial node dysfunction and deafness 615474; 614896 AD; AR CACNA1H score 2 Strong Candidate Criteria 2.1 {Epilepsy, childhood absence, susceptibility to, 6}; {Epilepsy, idiopathic generalized, susceptibility to, 6}; Hyperaldosteronism, familial, type IV 611942; 611942; 617027 NA, NA, AD CACNA2D3 score 2 Strong Candidate Criteria 2.1 NA NA NA CC2D1A score 2 Strong Candidate Criteria 2.1 Mental retardation, autosomal recessive 3 608443 AR CEP41 score 2 Strong Candidate Criteria 2.1 Joubert syndrome 15 614464 AR CNTN4 score 2 Strong Candidate Criteria 2.1 NA NA NA CTNND2 score 2 Strong Candidate Criteria 2.1 NA NA NA DOCK8 score 2 Strong Candidate Criteria 2.1 Hyper-IgE recurrent infection syndrome, autosomal recessive 243700; AR DYNC1H1 score 2 Strong Candidate Criteria 2.1 Charcot-Marie-Tooth disease, axonal, type 20; Mental retardation, autosomal dominant 13; Spinal muscular atrophy, lower extremitypredominant 1, AD 614228; 614563; 158600 AD; AD; AD
Anexos 251 ERBIN score 2 Strong Candidate Criteria 2.1 NA NA NA GABRB3 score 2 Strong Candidate Criteria 2.1 {Epilepsy, childhood absence, susceptibility to, 5}; Epileptic encephalopathy, early infantile, 43 612269; 617113 NA; AD GRIK2 score 2 Strong Candidate Criteria 2.1 Mental retardation, autosomal recessive, 6 611092 AR GRIN2A score 2 Strong Candidate Criteria 2.1 Epilepsy, focal, with speech disorder and with or without mental retardation 245570 AD GRIP1 score 2 Strong Candidate Criteria 2.1 Fraser syndrome 3 617667 AR ILF2 score 2 Strong Candidate Criteria 2.1 NA NA NA INTS6 score 2 Strong Candidate Criteria 2.1 NA NA NA KAT2B score 2 Strong Candidate Criteria 2.1 NA NA NA KCNJ10 score 2 Strong Candidate Criteria 2.1 Enlarged vestibular aqueduct, digenic; SESAME syndrome 600791; 612780 AR; AR KDM5B score 2 Strong Candidate Criteria 2.1 Mental retardation, autosomal recessive 65 618109 AR KDM5C score 2 Strong Candidate Criteria 2.1 Mental retardation, X-linked, syndromic, Claes-Jensen type 300534 XLR KDM6A score 2 Strong Candidate Criteria 2.1 Kabuki syndrome 2 300867 XLD KIRREL3 score 2 Strong Candidate Criteria 2.1 NA NA NA LAMB1 score 2 Strong Candidate Criteria 2.1 Lissencephaly 5 615191 AR
AITANA ALONSO GONZÁLEZ 252 MET score 2 Strong Candidate Criteria 2.1 ?Deafness, autosomal recessive 97; {Osteofibrous dysplasia, susceptibility to}; Hepatocellular carcinoma, childhood type, somatic; Renal cell carcinoma, papillary, 1, familial and somatic 616705; 607278; 114550; 605074 AR; AD; NA, NA NLGN4X score 2 Strong Candidate Criteria 2.1 {Asperger syndrome susceptibility, X-linked 2}; {Autism susceptibility, X- linked 2}; Mental retardation, X-linked 300497; 300495; 300495 XL; XL; XL OPHN1 score 2 Strong Candidate Criteria 2.1 Mental retardation, X-linked, with cerebellar hypoplasia and distinctive facial appearance 300486 XLR PAH score 2 Strong Candidate Criteria 2.1 [Hyperphenylalaninemia, non-PKU mild]; Phenylketonuria 261600; 261600 AR; AR RANBP17 score 2 Strong Candidate Criteria 2.1 NA NA NA SMAD4 score 2 Strong Candidate Criteria 2.1 Juvenile polyposis/hereditary hemorrhagic telangiectasia syndrome; Myhre syndrome; Pancreatic cancer, somatic; Polyposis, juvenile intestinal 175050; 139210; 260350; 174900 AD; AD; NA; AD TBL1XR1 score 2 Strong Candidate Criteria 2.1 Mental retardation, autosomal dominant 41; Pierpont syndrome 616944; 602342 AD; AD ZMYND11 score 2 Strong Candidate Criteria 2.1 Mental retardation, autosomal dominant 30 616083 AD MSNP1AS score 2 Strong Candidate Criteria 2.1 CNTNAP2 score 2S Strong Candidate, Syndromic Criteria 2.1, Syndromic {Autism susceptibility 15}; Cortical dysplasia-focal epilepsy syndrome; Pitt- Hopkins like syndrome 1 612100; 610042; 610042 NA; AR; AR DEAF1 score 2S Strong Candidate, Syndromic Criteria 2.1, Syndromic ?Dyskinesia, seizures, and intellectual developmental disorder; Mental retardation, autosomal dominant 24 617171; 615828 AR; AD KAT6A score 2S Strong Candidate, Syndromic Mental retardation, autosomal dominant 32 616268 AD
Anexos 253 Criteria 2.1, Syndromic PRODH score 2S Strong Candidate, Syndromic Criteria 2.1, Syndromic {Schizophrenia, susceptibility to, 4}; Hyperprolinemia, type I 600850; 239500 AD; AR USP7 score 2S Strong Candidate, Syndromic Criteria 2.1, Syndromic NA NA NA DDC score 3 Suggestive Evidence Criteria 3.1 Aromatic L-amino acid decarboxylase deficiency 608643 AR DPYD score 3 Suggestive Evidence Criteria 3.1 5-fluorouracil toxicity; Dihydropyrimidine dehydrogenase deficiency 274270; 274270 AR; AR EIF4E score 3 Suggestive Evidence Criteria 3.1 {Autism, susceptibility to, 19} 615091 NA IL1RAPL1 score 3 Suggestive Evidence Criteria 3.1 Mental retardation, X-linked 21/34 300143 XLR KANK1 score 3 Suggestive Evidence Criteria 3.1 Cerebral palsy, spastic quadriplegic, 2 612900 NA MAOA score 3 Suggestive Evidence Criteria 3.1 {Antisocial behavior}; Brunner syndrome 300615; 300615 XLR; XLR MCPH1 score 3 Suggestive Evidence Criteria 3.1 Microcephaly 1, primary, autosomal recessive 251200 AR MTHFR score 3 Suggestive Evidence Criteria 3.1 {Neural tube defects, susceptibility to}; {Schizophrenia, susceptibility to}; {Thromboembolism, susceptibility to}; {Vascular disease, susceptibility to}; Homocystinuria due to MTHFR deficiency 601634; 181500; 188050; NA; 236250 AR; AD; AD; NA; AR POMT1 score 3 Suggestive Evidence Criteria 3.1 Muscular dystrophydystroglycanopathy (congenital with brain and eye anomalies), type A, 1; Muscular dystrophydystroglycanopathy (congenital with mental 236670; 1 613155; 609308 AR; AR; AR
AITANA ALONSO GONZÁLEZ 254 retardation), type B, 1; Muscular dystrophydystroglycanopathy (limbgirdle), type C, 1 RAB39B score 3 Suggestive Evidence Criteria 3.1 Mental retardation, X-linked 72; Waisman syndrome 300271; 311510 XLR; XLR SLC6A8 score 3 Suggestive Evidence Criteria 3.1 Cerebral creatine deficiency syndrome 1 300352 XLR SLC9A9 score 3 Suggestive Evidence Criteria 3.1 {?Autism susceptibility 16} 613410 NA TSPAN7 score 3 Suggestive Evidence Criteria 3.1 Mental retardation, X-linked 58 300210 XLR ATP1A3 score 3S Suggestive Evidence, SyndromicCriteria 3.1, Syndromic Alternating hemiplegia of childhood 2; CAPOS syndrome; Dystonia-12 614820; 601338; 128235 AD; AD; AD CEP290 score 3S Suggestive Evidence, SyndromicCriteria 3.1, Syndromic ?Bardet-Biedl syndrome 14; Joubert syndrome 5; Leber congenital amaurosis 10; Meckel syndrome 4; Senior- Loken syndrome 6 615991; 610188; 611755; 611134; 610189 AR; AR; NA; AR; AR MEF2C score 3S Suggestive Evidence, Syndromic Criteria 3.1, Syndromic Mental retardation, stereotypic movements, epilepsy, and/or cerebral malformations 613443 AD NR2F1 score 3S Suggestive Evidence, Syndromic Criteria 3.1, Syndromic Bosch-Boonstra-Schaaf optic atrophy syndrome 615722 AD NTNG1 score 3S Suggestive Evidence, Syndromic Criteria 3.1, Syndromic NA NA NA RNF135 score 3S Suggestive Evidence, Syndromic Criteria 3.1, Syndromic NA NA NA RPS6KA3 score 3S Suggestive Evidence, Syndromic Coffin-Lowry syndrome; Mental retardation, X-linked 19 303600; 300844 XLD; XLD
Anexos 255 Criteria 3.1, Syndromic SATB2 score 3S Suggestive Evidence, Syndromic Criteria 3.1, Syndromic Glass syndrome 612313 AD SMC3 score 3S Suggestive Evidence, Syndromic Criteria 3.1, Syndromic Cornelia de Lange syndrome 3 610759 AD SYNE1 score 3S Suggestive Evidence, Syndromic Criteria 3.1, Syndromic Arthrogryposis multiplex congenita, myogenic type; Emery-Dreifuss muscular dystrophy 4, autosomal dominant; Spinocerebellar ataxia, autosomal recessive 8 618484; 612998; 610743 AR; AD; AR HDAC4 score 3S Suggestive Evidence, Syndromic Criteria 3.1, Syndromic Brachydactyly mental retardation syndrome ALG6 score S Syndromic Syndromic Congenital disorder of glycosylation, type Ic 603147 AR GAMT score S Syndromic Syndromic Cerebral creatine deficiency syndrome 2 612736 AR GATM score S Syndromic Syndromic Cerebral creatine deficiency syndrome 3 612718 AR HDAC8 score S Syndromic Syndromic Cornelia de Lange syndrome 5 300882 XLD RAD21 score S Syndromic Syndromic ?Mungan syndrome; Cornelia de Lange syndrome 4 611376; 614701 AR; AD ACSL4 Mental retardation, X-linked 63 300387 XLD ACY1 Aminoacylase 1 deficiency 609924 AR
AITANA ALONSO GONZÁLEZ 262 ROGDI Kohlschutter-Tonz syndrome 226750 AR RPGRIP1L COACH syndrome; Joubert syndrome 7; Meckel syndrome 5 216360; 611560; 611561 AR; AR; AR SGSH Mucopolysaccharidosis type IIIA (Sanfilippo A) 252900 AR SHH Holoprosencephaly 3; Microphthalmia with coloboma 5; Schizencephaly; Single median maxillary central incisor 142945; 611638; 269160; 147250 AD; AD; NA; AD SLC16A2 Allan-Herndon-Dudley syndrome 300523 XL SLC17A5 Salla disease; Sialic acid storage disorder, infantile 604369; 269920 AR; AR SLC1A2 Epileptic encephalopathy, early infantile, 41 617105 AD SLC35C1 Congenital disorder of glycosylation, type Iic 266265 AR SMARCA2 Nicolaides-Baraitser syndrome 601358 AD SMC1A Cornelia de Lange syndrome 2 300590 XLD SNX14 Spinocerebellar ataxia, autosomal recessive 20 616354 AR SOX10 PCWH syndrome; Waardenburg syndrome, type 2E, with or without neurologic involvement; Waardenburg syndrome, type 4C 609136; 611584; 613266 AD; AD; AD SOX11 Coffin-Siris syndrome 9 615866 AD
Anexos 263 STAMBP Microcephaly-capillary malformation syndrome 614261 AR TAF1 Dystonia-Parkinsonism, X- linked; Mental retardation, X- linked, syndromic 33 314250; 300966 XLR; XLR TBC1D20 Warburg micro syndrome 4 615663 AR TCN2 Transcobalamin II deficiency 275350 AR TUBA1A Lissencephaly 3 611603 AD TUBG1 Cortical dysplasia, complex, with other brain malformations 4 615412 AD TUSC3 Mental retardation, autosomal recessive 7 611093 AR UPB1 Beta-ureidopropionase deficiency 613161 AR USP9X Mental retardation, X-linked 99; Mental retardation, X- linked 99, syndromic, femalerestricted 300919; 300968 XLR; XLD ZEB2 Mowat-Wilson syndrome 235730 AD ZNF711 Mental retardation, X-linked 97 300803 XL FMN2 Mental retardation, autosomal recessive 47 616193 AR DEPDC5 Epilepsy, familial focal, with variable foci 1 604364 AD SIK1 Epileptic encephalopathy, early infantile, 30 616341 AD
AITANA ALONSO GONZÁLEZ 264 SHROOM4 Stocco dos Santos X-linked mental retardation syndrome 300434 XL
HOJA DE INFORMACIÓN AL PARTICIPANTE EN UN ESTUDIO DE INVESTIGACIÓN TÍTULO: Contribución a la búsqueda de las causas genéticas de los Trastornos del Espectro Autista. INVESTIGADOR: Ángel Carracedo Álvarez, Director Ejecutivo de la Fundación Pública Galega de Medicina Xenómica Este documento tiene por objeto ofrecerle información sobre un estudio de investigación en el que se le invita a participar. Este estudio se está realizando en la Fundación Pública Galega de Medicina Xenómica y fue aprobado por el Comité Ético de Investigación Clínica de Galicia. Si decide participar en el mismo, debe recibir información personalizada del investigador, leer antes este documento y hacer todas las preguntas que necesite para comprender los detalles sobre el mismo. Si así lo desea, puede llevar el documento, consultarlo con otras personas, y tomarse el tiempo necesario para decidir si participar o no. La participación en este estudio es completamente voluntaria. Vd. puede decidir no participar o, si acepta hacerlo, cambiar de opinión retirando el consentimiento en cualquier momento sin obligación de dar explicaciones. Le aseguramos que esta decisión no afectará a la relación con su médico ni a la asistencia sanitaria a la que Vd. tiene derecho. ¿Cual es el propósito del estudio? Los Trastornos del Espectro Autista (TEA), se caracterizan por ser alteraciones en el desarrollo y funcionamiento cerebral pero las causas que los producen aún no se conocen. Se ha demostrado una alta implicación de factores genéticos en los TEA (80%, en relación con el ambiente), sin embargo en la mayoría de los casos no es posible determinar la alteración genética responsable. Los avances en investigación genómica han cambiado el panorama de la investigación genética del autismo, posibilitando que hasta en una cuarta parte de los casos se pueda encontrar una causa genética potencialmente determinante del cuadro. En esta investigación vamos a emplear técnicas de alta resolución molecular (como son los microarrays o chips de ADN) para analizar cientos de segmentos de DNA distribuidos por todo el genoma humano. Esto posibilitará la detección de anomalías estructurales submicroscópicas que no serían detectables con las técnicas genéticas tradicionales (cariotipo y X- frágil convencional). Para proceder con este estudio, necesitamos analizar el material genético de personas diagnosticadas con TEA, para lo cual será necesario obtener una muestra de su sangre. También será fundamental realizar una evaluación clínica y neuropsicológica exhaustiva de los sujetos a estudio, con vistas a establecer grupos o fenotipos lo más definidos posibles y facilitar así una posible correlación genética. ¿Por qué me ofrecen participar a mí? La selección de las personas invitadas a participar depende de unos criterios que están descritos en el protocolo de la investigación. Estos criterios sirven para seleccionar a la población en la que se responderá el interrogante de la investigación. Vd. es invitado a participar porque cumple eses criterios. Tales criterios consisten en presentar un diagnóstico de trastorno del espectro autista (TEA) y tener una edad comprendida entre los 3 y los 18 años.
El hecho de presentar discapacidad intelectual y/o estar también diagnosticados de otros problemas médicos, neurológicos y psiquiátricos no supondrá impedimento alguno para participar en este estudio. Se espera que participen 200 personas en este estudio. ¿En qué consiste mi participación? Si acepta participar en la presente investigación, le será requerida una muestra de unos 10 ml de sangre, que será utilizada para extraer el ADN. La muestra de ADN pasará a formar parte de una colección de muestras disponible para investigar las bases genéticas del autismo. Será conservada y podrá ser usada posteriormente en otros estudios, salvo que usted manifieste lo contrario señalándolo al final de este documento. Además, se recogerán en un formulario los datos personales y los antecedentes familiares. Esto permitirá a los científicos disponer de muestras para investigar: 1) qué genes influyen en el desarrollo de los TEA o en la protección del desarrollo de los mismos, 2) cómo están influenciados estos genes por el entorno y, 3) qué genes influyen en la eficacia/resistencia a tratamientos específicos. Además de esta extracción de sangre, se le hará una entrevista con instrumentos de valoración clínica (entrevistas diagnósticas y cuestionarios) y cognitiva (pruebas de atención, memoria, funciones ejecutivas, capacidad intelectual,…) que completarán y darán apoyo a la investigación genética. En un primer momento, bastará con una entrevista clínica preliminar (en torno a 1 hora de duración) que confirme el diagnóstico de TEA. Únicamente aquellos sujetos que presenten hallazgos genéticos significativos serán requeridos para una valoración clínica más detallada. Las muestras que nos proporcione estarán codificadas mediante un código de seguridad, que servirá para asociar los datos con Vd. en los supuestos en que esta identificación fuere necesaria para su beneficio y de conformidad con lo previsto en la Ley 14/2007, de Investigación Biomédica, y el y RD1717/2011. Dicho código estará en poder únicamente del personal responsable de la colección. Los investigadores, por tanto, no podrán conocer su identidad personal, pero sí datos como su sexo o edad, manteniendo siempre la debida confidencialidad conforme a la legislación vigente. A partir de las muestras donadas se aislarán las células contenidas en las mismas y se extraerán los ácidos nucleicos sobre los que se realizarán los análisis genéticos; además se obtendrá suero y plasma para estudios fenotípicos. El equipo de Investigación de la Fundación Pública Galega de Medicina Xenómica mantendrá la titularidad de las muestras. Los productos obtenidos de las muestras y los datos asociados a las mismas se archivarán y quedarán custodiados, por un periodo mínimo de 2 años, en las instalaciones de la Fundación Pública Galega de Medicina Xenómica. Los análisis genéticos y fenotípicos realizados serán tratados estadísticamente, exclusivamente para fines de investigación biomédica de acuerdo a lo descrito anteriormente. El promotor o el investigador pueden decidir finalizar el estudio antes de lo previsto o interrumpir su participación por aparición de nueva información relevante, por motivos de seguridad, o por incumplimiento de los procedimientos del estudio. ¿Qué riesgos o inconvenientes tiene? La donación de sangre apenas tiene efectos secundarios; como mucho, podría aparecer un pequeño hematoma en la zona de punción, que desaparecería en unos días.
El no proporcionar su consentimiento no tendrá ninguna consecuencia en su tratamiento clínico. ¿Obtendré algún beneficio por participar? Usted proporcionará las muestras de forma totalmente voluntaria. Su participación no tiene ninguna compensación económica pero tampoco supone gasto alguno para usted. Su atención médica no se verá afectada por el hecho de que participe o no en esta investigación. En el caso de hallarse información que pudiera ser clínicamente relevante para usted o su familia, se le ofrecerá la posibilidad de recibir asesoramiento genético al respecto. Estimamos que entre un 20 y 25 % de los casos podremos encontrar una potencial causa genética (heredada o no ya que hay muchas mutaciones que surgen “de novo) y que en algunos casos sabremos su significado y en otros no. El resultado de esta investigación puede desvelar una mutación (alteración genética) responsable del trastorno (TEA) en el caso de su familia. Este conocimiento puede ser de gran importancia para sus familiares y otras familias afectas. Los resultados de esta investigación que puedan ser de beneficio para usted o su familia le serán comunicados en un informe. Como resultado del análisis genético podría detectarse también información inesperada relativa a otras enfermedades médicas. Únicamente será comunicada aquella información con relevancia clínica y potencialmente beneficiosa para el sujeto/sujetos en cuestión. Si usted no desea recibir información sobre los resultados del análisis genético deberá marcar con una X las casillas correspondientes en el Consentimiento Informado. Un resultado negativo no excluye que el síndrome sea heredable, ya que podría estar causado por una mutación no analizada. Tal y como mencionamos anteriormente, como consecuencia del análisis también es posible que se identifiquen cambios genéticos de significado no claro. De todas formas es importante tener en cuenta que al ser éste un estudio de investigación, el beneficio redundará más a nivel global y científico que personal. Sin embargo los conocimientos obtenidos gracias a los estudios llevados a cabo a partir de sus muestras y datos de las otras muchas personas que participen, supondrán una valiosa fuente de información que revertirá en un mejor conocimiento de estos trastornos posibilitando que en un futuro se desarrollen nuevos métodos de diagnóstico y tratamiento. ¿Recibiré la información que se obtenga del estudio? Si Vd. lo desea, se le facilitará un resumen de los resultados del estudio. También podrá recibir los resultados de las pruebas que se le practiquen si así lo solicita. Estos resultados pueden no tener aplicación clínica ni una interpretación clara, por lo que, si quiere disponer de ellos, deberían ser comentados con un miembro del equipo de investigación responsable del estudio. ¿Se publicaran los resultados de este estudio? Los resultados de este estudio serán publicados en publicaciones científicas para su difusión, pero no se transmitirá ningún dato que pueda llevar a la identificación de los participantes.
¿Cómo se protegerá la confidencialidad de mis datos? El tratamiento, comunicación y cesión de sus datos se hará conforme a lo dispuesto por la Ley Orgánica 15/1999, de 13 de diciembre, de protección de datos de carácter personal. En todo momento, Vd. podrá acceder a sus datos, corregirlos o cancelarlos. Sólo el equipo investigador y las autoridades sanitarias, que tienen deber de guardar la confidencialidad, tendrán acceso a todos los datos recogidos por el estudio. Se podrá transmitir a terceros información que no pueda ser identificada. En el caso de que alguna información sea transmitida a otros países, se realizará con un nivel de protección de los datos equivalente, como mínimo, al exigido por la normativa de nuestro país. Los profesionales responsables de la custodia de las muestras y datos asociados a las mismas garantizarán que la identidad del donante no sea accesible a los investigadores, cuando datos o muestras sean transferidas a un investigador dentro de ese centro o de otro centro. En algunas ocasiones podría ser de utilidad realizar el análisis genético a otros miembros de su familia. En ningún caso serán contactadas otras personas de su familia con este propósito sin su permiso. La información será almacenada en soporte informático. Los datos registrados serán tratados estadísticamente, de forma codificada, para los fines de investigación científica que se describieron anteriormente. ¿Qué ocurrirá con las muestras obtenidas? El responsable de la custodia de las muestras es el Dr. Ángel Carracedo Álvarez, y serán almacenadas en la Fundación Pública Galega de Medicina Xenómica, el tiempo necesario para terminar con esta línea de investigación. Al firmar consentimiento, usted puede optar por autorizar a que se cedan las muestras biológicas a terceros con destino a otros proyectos de investigación relacionados o no con el área de investigación. En ese caso, sus muestras y los datos asociados serán guardados de forma codificada, que quiere decir que poseen un código que se puede relacionar, mediante una información, con la identificación del donante. Esta información está a cargo del investigador principal y sólo pueden acceder a ella los miembros del equipo investigador, representantes del promotor del estudio y las autoridades sanitarias en ejercicio de sus funciones. Sólo se ceden muestras para su utilización en proyectos de investigación que hayan sido valorados positivamente por un Comité de Ética de la Investigación, y autorizados por la autoridad sanitaria. Los datos clínicos relevantes para cruzar con la información genética también podrán ser cedidos. Ningún dato de identificación personal será cedido. ¿Quién me puede dar más información? Para más información puede contactar con la responsable clínica de este proyecto de investigación ( Lorena Gómez Guerrero) en el teléfono de la FPGMX (981951491) o bien dirigirse a la siguiente dirección de correo electrónico: [email protected]
Revocación del consentimiento. Es usted libre de cambiar de opinión en cualquier momento y revocar el presente consentimiento, caso en el que la muestra será destruida. Esto en ningún caso conllevará ningún perjuicio para usted. Muchas gracias por su colaboración. Leí y comprendí el presente documento. Todas mis preguntas sobre la investigación fueron respondidas de forma satisfactoria. D./Dña. , tutor / responsable legal de (NOMBRE DEL NIÑO/A: CÓDIGO DEL NIÑO/A: ) doy mi consentimiento para participar en la presente investigación. El/la participante, El / la representante / tutor legal, El/la investigador/a, Fdo.: Fdo: Fdo.: Fecha: Fecha: Fecha:
DOCUMENTO DE CONSENTIMIENTO PARA LA PARTICIPACIÓN EN UN ESTUDIO DE INVESTIGACIÓN TÍTULO: Contribución a la búsqueda de las causas genéticas de los Trastornos del Espectro Autista Yo, (participante o, en su caso, representante / tutor legal), xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx He leído la hoja de información al participante del estudio arriba mencionado que se me entregó, he podido hablar con el investigador responsable y hacerle todas las preguntas sobre el estudio necesarias para comprender sus condiciones y considero que he recibido suficiente información sobre el estudio. Comprendo que mi participación es voluntaria, y que puedo retirarme del estudio cuando quiera, sin tener que dar explicaciones y sin que esto repercuta en mis cuidados médicos. Accedo a que se utilicen mis datos en las condiciones detalladas en la hoja de información al participante. Presto libremente mi conformidad para participar en el estudio. Autorizo al acceso a toda la información clínica del participante recogida en el servicio gallego de salud Respeto a la conservación y utilización futura de los datos y/o muestras detallada en la hoja de información al participante, Accedo a que mis datos y/o muestras se conserven formando parte de una colección de ADN para la investigación en genética de los trastornos del espectro autista (TEA) en las condiciones mencionadas. Accedo a que los datos y/o muestras se conserven para usos posteriores en líneas de investigación relacionadas con la presente, y en las condiciones mencionadas. En cuanto a los resultados de las pruebas realizadas, DESEO conocer los resultados de mis pruebas DESEO conocer los resultados de mis pruebas en caso de hallarse información médica relevante ajena a la naturaleza del estudio. REVOCO EL PRESENTE CONSENTIMIENTO El/la participante, El / la representante / tutor legal, El/la investigador/a, Fdo.: Fdo: Fdo.: Fecha: Fecha: Fecha: