scieee AI-readable full text Open interactive document viewer

Análisis de alteraciones de splicing en datos de secuenciación NGS: evaluación de dos algoritmos y estudio de eficacia y sensibilidad en muestras diagnósticas

Quintas Rey, Rita

Abstract

Se validan dos herramientas de análisis de alteraciones de splicing en una serie de variantes conocidas de tres genes (CFTR, F8 y F9) y la base de datos ClinVar calculando los valores predictivos positivos o negativos, especificidad, sensibilidad y éxito total. Se emplean las herramientas para estudiar las variantes recogidas en la base de datos interna del laboratorio y se comprueba la concordancia de dichas variantes con su clasificación en Varsome y InterVar realizando los mismos cálculos. Los resultados avalan la introducción de esto algoritmos en la rutina de análisis de exomas con fines diagnósticos. Se propone un protocolo de uso y ejemplos de casos diagnosticados siguiendo dicho protocolo.

Full text

TESE DE DOUTORAMENTO Análisis de alteraciones de splicing en datos de secuenciación NGS: evaluación de dos algoritmos y estudio de eficacia y sensibilidad en muestras diagnósticas. Rita Quintas Rey ESCOLA DE DOUTORAMENTO INTERNACIONAL DA UNIVERSIDADE DE SANTIAGO DE COMPOSTELA PROGRAMA DE DOUTORAMENTO EN MEDICINA MOLECULAR SANTIAGO DE COMPOSTELA ANO 2021 Dna. Rita Quintas Rey Título da tese: Análisis de alteraciones de splicing en datos de secuenciación NGS: evaluación de dos algoritmos y estudio de eficacia y sensibilidad en muestras diagnósticas. Presento a miña tese, seguindo o procedemento axeitado ao Regulamento, e declaro que: 1) A tese abarca os resultados da elaboración do meu traballo. 2) De ser o caso, na tese faise referencia ás colaboracións que tivo este traballo. 3) Confirmo que a tese non incorre en ningún tipo de plaxio doutros autores nin de traballos presentados por min para a obtención doutros títulos. 4) A tese é a versión definitiva presentada para a súa defensa e coincide a versión impresa coa presentada en formato electrónico E comprométome a presentar o Compromiso Documental de Supervisión no caso de que o orixinal non estea na Escola. En Santiago de Compostela, 28 de Xullo de 2021. Sinatura electrónica D. Francisco Barros Angueira En condición de: Director/a Título da tese: Análisis de alteraciones de splicing en datos de secuenciación NGS: Evaluación de dos algoritmos y estudio de eficacia y sensibilidad en muestras diagnósticas. INFORMA: Que a presente tese, correspóndese co traballo realizado por Dna Rita Quintas Rey, baixo a miña dirección/titorización, e a utorizo a súa presentación , considerando que reúne os r equisitos esixidos no R egulamento de Estudos de Doutoramento da USC, e que como director/titor desta non incorre nas causas de abstención establecidas na Lei 40/2015. En Santiago de Compostela, 28 de Xullo de 2021 Sinatura electrónica D. Ángel María Carracedo Álvarez En condición de: Titor/a e director/a Título da tese: Análisis de alteraciones de splicing en datos de secuenciación NGS: Evaluación de dos algoritmos y estudio de eficacia y sensibilidad en muestras diagnósticas INFORMA: Que a presente tese, correspóndese co traballo realizado por Dna Rita Quintas Rey, baixo a miña dirección/titorización, e a utorizo a súa presentación , considerando que reúne os r equisitos esixidos no R egulamento de Estudos de Doutoramento da USC, e que como director/titor desta non incorre nas causas de abstención establecidas na Lei 40/2015. En Santiago de Compostela, 28 de Xullo de 2021 Sinatura electrónica Yo, Rita Quintas Rey, con DNI 36173867L, declaro no tener conflictos de interés en relación a la presente tesis doctoral. En Santiago de Compostela, 06 de octubre de 2021 Fdo: Rita Quintas Rey ABREVIATURAS ACMG-AMP: American College of Medical geneticsAssociation for Molecular Pathology. ADA: Ada Boost. ADN: Ácido desoxirribucleico. ADNc: ADN complementario. ARN: Acido ribonucleico. ARNm : ARN mensajero. ATP: Adenosín trifosfato. BBP: Brach point binding factor (del inglés) fatcor de unión al punto de ramificación. Bed: Browser Extensible Data. BRCA2: Cancer de mama 1 (siglas del inglés). BRCA2: Cancer de mama 2 (siglas del inglés). CADD : Combined Annotation Dependent Depletion. CFTR: Cystic fibrosis transmembrane conductance regulator. CGD: clinical genomic database. CGHa: array de hibridación genómica comparativa (siglas del inglés). CLCN1: Chloride Voltage-Gated Channel 1. CNV: Variación en el número de copias (siglas del inglés). COSMIC: Catalog of Somatic Mutations in Cancer. Csv: Comma Separated Values, archivo separado por comas. dbNSFP: annotation database for non-synonymous SNVs, Base de datos para la anotación de SNVs no sinónimos. dbscSNV: base de datos de varinates de unsolo nucleotido que afectan a una sitio consenso de splicing. dbSNP : Single Nucleotide Polymorphism Database. DDD: Deciphering developmental disorders. dsDNA: ADN de doble cadena (siglas del inglés). EAHAD: European Association for Haemophilia and Allied Disorders. ESE: Potenciador exónico del splicing (siglas en inglés). ESS: Sileciador exónico del splciing (siglas en inglés). ExAC: Exome aggregation consortium. F8: Factor de coagulación 8. F9: Factor de coagulación 9. FPGMX: Fundación pública galega de medicina Xenómica. GATK: Genome Analysis Toolkit. GenomeAD: Genome Aggregation Database. GRCh37: Ensamblaje de referencia de genoma humano 37. GTP: guanosín trifosfato. GTPasa: guanosina trifosfatasa. GWAS : Genome wide association study, estudios de asociación de genoma completo. hg19: genoma humano 19. HGMD: Human gene mutation database. HGVS: human genome variation society. hnRNP : ribonucleoproteínas heterogéneas nucleares (siglas en inglés). HSF: Human splicing finder. ICGC: International Cancer Genome Consortium. INSDC: International Nucleotide Sequence Database Collaboration. ISE: Potenciador exónico del splicing (siglas en inglés). ISS: Silenciador intrónico del splicing (siglas en inglés). Kb: Kilo base. KDa: KiloDalton. MBLN1: Muscleblind Like Splicing Regulator 1. MES: MaxEntScan. NCBI: National Center for Biotechnology Information. NGS: Next generation sequencing. NHGRI: National Human Genome Research Institute. NMD: Degradación del ARN mensajero mediada por mutaciones terminadoras (siglas del inglés). Nt: nucleótido. Pb: Pares de bases. PCR: Reacción en cadena de la polimerasa (siglas del inglés). PH: Homólogo de plekstrina. PPT: test de proteína truncada (siglas del inglés). PSI: percentage of splice in. PWM: Matriz de pesos posicionales (siglas del inglés). qPCR: PCR cuantitativa. RefSeq: Reference sequence. RF: Random forest. RRM : motivo de reconocimiento del ARN (siglas en inglés). Rs: SNP de referencia. rsID: identificación del SNP de referencia. RT-PCR: PCR retrotranscriptasa. SCA: Ataxia espinocerebelosa. scSNV: splicing consensus single nucleotide variant, variante de un solo nucleótido en un sitio consenso de splicing. SF1: factor de splicing. SIFT: Sorting intolerant from tolerant. SNP: Single nucleotide polymorphism. snRNA: ARN pequeño nuclear (siglas en inglés). snRNPs: Ribonucleoproteínas pequeñas nucleares (siglas en inglés). SNV: Single nucleotide variant. Varinate de un solo nucleótido. SPANR: Splicing-based Analysis of Variants. SR: Proteinas ricas en serinaarginina (siglas en inglés). SREs: Elementos reguladores del splicing (siglas del inglés). SSF: Splice site Finder. U2AF: Factor auxiliar U2. URL: Localizador Uniforme de Recursos. VCF: Variant call format, formato de llamada de variantes. WT: wild type. ÍNDICE 1 RESUMEN ......................................................................................................................... 31 2 INTRODUCCIÓN ............................................................................................................. 37 2.1 SECUENCIACIÓN DE NUEVA GENERACIÓN (NGS) EN EL DIAGNÓSTICO GENÉTICO ....... 37 2.2 PROCESO DE CORTE Y EMPALME (SPLICING) ....................................................................... 39 2.2.1 Elementos del splicing .............................................................................................. 43 2.2.2 Splicing alternativo ................................................................................................... 45 2.2.3 Tipos de mutaciones de splicing........................................................................... 48 2.2.4 Repercusión clínica e importancia de variantes de splicing .................... 49 2.3 HERRAMIENTAS DE PREDICCIÓN ........................................................................................... 50 2.3.1 Desarrollo de los algoritmos.................................................................................. 51 2.3.2 Fundamentos de las herramientas seleccionadas ........................................ 59 dbscSNV ................................................................................................................................... 59 Spidex ........................................................................................................................................ 60 2.3.3 Análisis funcional de variantes de splicing...................................................... 60 3 JUSTIFICACIÓN Y OBJETIVOS ................................................................................... 65 4 MATERIAL Y MÉTODOS .............................................................................................. 69 4.1 ANOTACIÓN ............................................................................................................................... 69 4.2 VALIDACIÓN DE LOS ALGORITMOS......................................................................................... 70 4.2.1 Validación en bases de datos de genes conocidos ........................................ 72 CFTR ........................................................................................................................................... 73 F8 ................................................................................................................................................. 75 F9 ................................................................................................................................................. 76 4.2.2 Validación en variantes clasificadas por la base de datos ClinVar ....... 77 Variantes benignas y patogénicas .............................................................................. 78 Variantes benignas, probablemente benignas, probablemente patogénicas y patogénicas ............................................................................................................. 79 4.3 APLICACIÓN EN VARIANTES DETECTADAS POR LA FPGMX ............................................ 80 4.3.1 Comité de ética ............................................................................................................ 82 4.4 APLICABILIDAD CLÍNICA .......................................................................................................... 83 4.4.1 Selección de pacientes .............................................................................................. 83 Estudio de las variantes en ADNc............................................................................... 84 Estudio de portadores ...................................................................................................... 86 5 RESULTADOS .................................................................................................................. 91 5.1 VALIDACIÓN ALGORITMOS ....................................................................................................... 91 5.1.1 Validación en genes individuales ......................................................................... 91 CFTR ........................................................................................................................................... 91 F8 ................................................................................................................................................. 94 F9 ................................................................................................................................................. 96 5.1.2 Validación en variantes clasificadas por la base de datos ClinVar ....... 98 Variantes benignas y patogénicas .............................................................................. 98 Variantes patogénicas, probablemente patogénicas, probablemente benignas y benignas ....................................................................................................................... 100 5.2 APLICACIÓN EN VARIANTES DETECTADAS EN LA FPGMX ............................................ 102 5.2.1 Spidex ............................................................................................................................103 Patogénicas y benignas ................................................................................................. 103 Patogénicas, probablemente patogénicas, probablemente benignas y benignas ................................................................................................................................................ 105 5.2.2 dbscSNV ........................................................................................................................107 ADA Boost ............................................................................................................................ 107 5.2.2.1.1 Patogénicas y benignas ...................................................................................... 107 5.2.2.1.2 Patogénicas probablemente patogénicas, probablemente benignas y benignas ..................................................................................................................................... 109 Random Forest .................................................................................................................. 111 5.2.2.2.1 Patogénicas y benignas ...................................................................................... 111 5.2.2.2.2 Patogénicas, probablemente patogénicas, probablemente benignas y benignas ..................................................................................................................................... 113 5.2.3 Spidex + dbscSNV ......................................................................................................115 5.2.3.1.1 Patogénicas y benignas ...................................................................................... 115 5.2.3.1.2 Patogénicas, probablemente patogénicas, probablemente benignas y benignas ..................................................................................................................................... 117 5.3 PROPUESTA DE PROTOCOLO ................................................................................................ 119 6 DISCUSIÓN .................................................................................................................... 123 6.1 VALIDACIÓN EN GENES INDIVIDUALES .............................................................................. 124 6.1.1 CFTR ...............................................................................................................................124 6.1.2 F8 .....................................................................................................................................127 6.1.3 F9 .....................................................................................................................................130 6.2 VALIDACIÓN EN CLINVAR .................................................................................................... 135 6.3 APLICACIÓN EN VARIANTES DETECTADAS EN LA FPGMX ............................................ 141 6.3.1 ClinVar ..........................................................................................................................141 6.3.2 InterVar ........................................................................................................................144 6.3.3 Varsome ........................................................................................................................146 6.4 APLICABILIDAD CLÍNICA ....................................................................................................... 151 6.4.1 Paciente 1 ....................................................................................................................152 Gen ALS2 ............................................................................................................................... 153 Estudio de la variante en ADNc ................................................................................ 154 Estudio de portadores ................................................................................................... 155 6.4.2 Paciente 2 ....................................................................................................................157 Gen SYNGAP1 ..................................................................................................................... 158 Estudio de la variante en ADNc ................................................................................ 159 Estudio de portadores ................................................................................................... 160 6.4.3 Paciente 3 ....................................................................................................................162 Gen CILK1 ............................................................................................................................. 163 Estudio de la variante en ADNc ................................................................................ 163 Estudio de portadores ................................................................................................... 164 6.4.4 Paciente 4 ....................................................................................................................165 Gen TCF4............................................................................................................................... 166 Estudio de la variante en ADNc ................................................................................ 166 Estudio de portadores ................................................................................................... 167 7 CONCLUSIONES ........................................................................................................... 171 8 BIBLIOGRAFÍA ............................................................................................................ 177 9 ANEXO 1: COMITÉ DE ÉTICA.................................................................................. 203 10 ANEXO 2: TABLAS SUPLEMENTARIAS ............................................................ 205 10.1 VALIDACIÓN EN GENES CONOCIDOS ................................................................................ 205 10.1.1 CFTR ............................................................................................................................205 10.1.2 F8 ..................................................................................................................................207 10.1.3 F9 ..................................................................................................................................209 10.2 VALIDACIÓN EN CLINVAR ................................................................................................. 211 10.3 APLICACIÓN EN VARIANTES DETECTADAS EN LA FPGMX.......................................... 215 10.3.1 Spidex ..........................................................................................................................216 10.3.1.1.1 Patogénicas y benignas ................................................................................... 216 10.3.1.1.2 Patogénicas probablemente patogénicas, probablemente benignas y benignas ..................................................................................................................................... 217 10.3.2 dbscSNV .....................................................................................................................218 ADA Boost ......................................................................................................................... 218 10.3.2.1.1 Patogénicas y benignas ................................................................................... 218 10.3.2.1.2 Patogénicas, probablemente patogénicas, probablemente benignas y benignas ................................................................................................................ 219 Random Forest ............................................................................................................... 220 10.3.2.2.1 Patogénicas y benignas ................................................................................... 220 10.3.2.2.2 Patogénicas probablemente patogénicas, probablemente benignas y benignas ..................................................................................................................................... 221 10.3.3 Spidex + dbscSNV ...................................................................................................222 10.3.3.1.1 Patogénicas y benignas ................................................................................... 222 10.3.3.1.2 Patogénicas, probablemente patogénicas, probablemente benignas y benignas ................................................................................................................ 223 ÍNDICE DE FIGURAS Figura 1. Ensamblaje de los elementos del espliceosoma y proceso de splicing. Basada en el articulo de Abramowicz,A et al., 2018. .......... 42 Figura 2. Ensamblaje de los elementos del espliceosoma a la secuencia de ARN. Adaptado de Abramowicz,A et al., 2018 ............................ 45 Figura 3.Tipos de splicing alternativo (imagen de autoría propia realizada en biorender.com) ............................................................... 47 Figura 4. Número de variantes examinadas para cada algoritmo respecto al total de variantes estudiadas en el gen CFTR. ................ 125 Figura 5. Datos derivados de la validación de los algoritmos en el gen CFTR. ............................................................................................... 126 Figura 6. Número de variantes examinadas para cada algoritmo respecto al total de variantes estudiadas en el gen F8. ..................... 128 Figura 7.Datos derivados de la validación de los algoritmos en el gen F8. ..................................................................................................... 129 Figura 8. Número de variantes examinadas para cada algoritmo respecto a las variantes estudiadas en el gen F9. .............................. 131 Figura 9. Datos derivados de la validación de los algoritmos en el gen F9. ..................................................................................................... 132 Figura 10. Datos derivados de la validación de los algoritmos en variantes clasificadas en ClinVar como benignas y patogénicas. .... 140 Figura 11. Datos derivados de la validación de los algoritmos en variantes clasificadas en ClinVar como benignas, probablemente benignas, probablemente patogénicas y patogénicas ....................... 140 Figura 12. Datos derivados de la aplicación de los algoritmos en variantes clasificadas en ClinVar como benignas, y patogénicas .... 143 Figura 13. Datos derivados de la aplicación de los algoritmos en variantes clasificadas por ClinVar como benignas, probablemente benignas, probablemente patogénicas y patogénicas. ...................... 143 Figura 14. Datos derivados de la aplicación de los algoritmos en variantes clasificadas en InterVar como benignas, y patogénicas. ... 145 RITA QUINTAS REY 32 Para intentar sacar el mayor rendimiento posible a los exomas analizados en el laboratorio y comprobar si podemos aumentar el porcentaje de pacientes con un diagnóstico claro después del análisis de variantes de splicing, seleccionamos dos algoritmos que permiten su automatización con la herramienta de anotación, Spidex (SPANR) y dbscSNV. En primer lugar, comprobamos la actuación de estos dos algoritmos en 3 genes individuales con bases de datos de variantes experimentalmente patogénicas y seleccionamos las variantes benignas de la base de datos dbSNP, eligiendo aquellas localizadas en regiones intrónicas con una frecuencia mayor al 1%. Se calculan los valores predictivos positivos y negativos, sensibilidad, especificidad y éxito total de cada uno de los algoritmos por separados y en conjunto para cada uno de los genes. En segundo lugar, seleccionamos todas las variantes de la base de datos ClinVar y comprobamos la concordancia en la clasificación de las variantes intrónicas descritas en esa base de datos con la asignación de los algoritmos. Se realizan los mismos cálculos que en genes individuales. Por último, aplicamos estos dos algoritmos a todas las variantes detectadas a lo largo de los años en la Fundación Pública Galega de Medicina Xenómica. Se comprueba su concordancia con las bases de datos ClinVar, InterVar y Varsome, realizando los mismos cálculos que anteriormente. Los valores de concordancia en el uso de ambos algoritmos en conjunto para la base de datos ClinVar son peores que en InterVar y Varsome ya que las dos últimas asignan una clasificación siguiendo las guías ACMG-AMP. En InterVar y Varsome la sensibilidad alcanza valores de 97,48% y 92,42%. La especificidad supera el 98% en los dos casos. El valor predictivo positivo no es bueno en ninguna (61,80% en InterVar y 63,49% en Varsome) aunque esto se ve compensado por el valor predictivo positivo que supera el 99,5% y el éxito total de la clasificación de los algoritmos en conjunto supera el 98% en las dos bases de datos, lo que quiere decir que menos de un 2% de las variantes son incorrectamente asignadas. Posteriormente, seleccionamos todas aquellas variantes localizadas en genes asociados al fenotipo del paciente y se procede al Introducción 33 estudio de ARN, cuando sea conveniente, para comprobar la alteración provocada por la variante en el mensajero. Los cálculos de concordancia de ambos algoritmos por separado y en conjunto junto con los nuevos pacientes que han alcanzado un diagnóstico gracias al uso de dichos algoritmos indican que mejoran nuestra capacidad de detección de variantes de splicing. INTRODUCCIÓN RITA QUINTAS REY 36 Introducción 37 2 INTRODUCCIÓN 2.1 SECUENCIACIÓN DE NUEVA GENERACIÓN (NGS) EN EL DIAGNÓSTICO GENÉTICO La secuenciación del genoma humano tardó más de una década en completarse1. En ese lapso de tiempo se lograron grandes mejoras en la capacidad de secuenciación y se crearon las bases tecnológicas que permiten la realización de estudios genómicos a gran escala. La secuenciación de nueva generación ha alcanzado la capacidad de análisis no ya de exomas sino de genomas completos en días2. En la actualidad la secuenciación de exomas se ha convertido en una práctica rutinaria en el diagnóstico genético. Con fines clínicos se estudian las regiones codificantes, así como los límites intrón-exón donde se sitúan las regiones consenso de los sitios de splicing. Aunque esto representa sólo el 2% del genoma2 genera una gran cantidad de datos, acelerando el proceso diagnóstico y aumentando la eficacia del mismo enormemente3. Gracias a la secuenciación de exomas ha habido un aumento en el descubrimiento de genes asociados a diferentes enfermedades4. Uno de los problemas asociados a la secuenciación NGS es que el enriquecimiento de la región secuenciada se realiza antes del análisis, lo que produce un sesgo a la hora de la detección de variantes causales. Esto hace que puedan ser descartadas aquellas cuyo mecanismo no entendemos completamente como las variantes de splicing5. Sin embargo, el mayor problema en la utilización de datos de NGS es la interpretación genotipo-fenotipo3. En la secuenciación de un exoma se obtienen miles de variantes y es importante determinar la relevancia clínica adecuada de cada una de ellas. Esta necesidad de priorización de las variantes lleva al empleo de herramientas y bases de datos adecuadas2. Para aumentar la eficiencia y la fiabilidad de esta predicción funcional de las variantes identificadas se ha propuesto emplear diferentes herramientas in silico6 y bases de datos de información génica (secuencia como RefSeq7, Ensembl8 y dbSNP9, ), RITA QUINTAS REY 38 de datos poblacionales (como GenomeAD10), grado de conservación de la secuencia (PhastConsElement9) y distintos fuentes de información para la predicción de variantes, Human phenotype ontology11, Gene Ontology12, Online mendelian inherited in man (OMIM)13, Genreviews14, Clinical Genomic Database (CGD)15, Human gene medical database (HGMD)16, ClinVar17 o InterVar18 SIFT19 o CADD20. El empleo de herramientas in silico permite el estudio a gran escala de variantes para su priorización y así eliminar un gran número de ellas sin relación con la patología de un paciente y que solo unas pocas requieran validación en el laboratorio. El proceso de identificación de variantes causales entre las miles de variantes resultantes de la secuenciación de un exoma es complejo y la utilización de estas herramientas in silico para la interpretación de dichas variantes no está exenta de problemas21. En 2015 la ACMGAMP (American College of Medical geneticsAssociation for Molecular Pathology) lanzó unas guías para la estandarización de la interpretación de variantes ya implementadas en cualquier laboratorio de rutina22. Aunque estas guías se desarrollaron para obtener una clasificación fiable, pese a la aplicación de los criterios de la ACMGAMP siguen existiendo discrepancias entre laboratorios23, hasta un 66% de variantes se clasifican de forma diferente en distintos laboratorios. Por todo ello se crearon herramientas como InterVar18 y Varsome24, que permiten automatizar el proceso de clasificación siguiendo las guías ACMG-AMP22. La ACGS en 2020 también publicó un manual para seguir las guías ACMG que incluye el uso de herramientas in silico para la predicción de variantes que den lugar a alteraciones siempre y cuando se realicen estudios funcionales posteriores para su clasificación25. Solo un 25-30% de los exomas llegan a un diagnóstico de certeza en paciente con enfermedades que presumimos mendelianas26,27, lo que sugiere que gran parte de ese 70-75% de pacientes sin diagnosticar pueden tener variantes en regiones no codificantes28. De hecho con el paso del tiempo se ha descubierto que los intrones pueden estar envueltos en la regulación de la expresión génica29. El genoma humano contiene aproximadamente tres mil trescientos millones de bases, un 1,2% de esas bases son estrictamente codificantes lo que se define como Introducción 39 exoma30. En humanos los genes poseen una media de ocho exones y 7 intrones que producen una media de tres isoformas31. Es por tanto razonable pensar que no sólo modificaciones a nivel de secuencia, sino también alteraciones que afecten a la regulación del proceso splicing, podrían estar relacionadas con el origen de una gran cantidad de casos32. Las estimas sobre el porcentaje de variantes que afectan al splicing han sido del 15% reportado por Stenson et al., en 200333 al 62% reportado López-Bigas en 200534. Esta disparidad nos da una idea de la complejidad de los procesos implicados en el origen de la enfermedad y también que en los procedimientos de análisis y filtrado de datos genómicos actuales se está descartando un gran número de variantes que podrían ser causales35. Entre los errores de clasificación más comunes en cuanto a variantes que afectan al splicing se encuentran las localizadas en regiones exónicas, en especial las variantes de cambio de sentido (missense) e incluso las variantes sinónimas. En dos estudios los autores llegan a la conclusión de que más del 20% de variantes clasificadas en HGMD como missense son realmente variantes que afectan al splicing 36,37. En el laboratorio se puede estudiar directamente el efecto de las variantes de splicing analizando la secuencia del ARN mensajero extraído de células del paciente. Sin embargo, dado el gran número de variantes potencialmente implicadas en este proceso que se detectan en un mismo paciente, es necesario determinar cuáles deben analizarse. Para ello necesitamos algoritmos predictivos que partiendo de la información de la secuencia intentan predecir el posible efecto en el splicing38. 2.2 PROCESO DE CORTE Y EMPALME (SPLICING) El proceso de corte y empalme (splicing en inglés, término que utilizaremos a lo largo de este trabajjo) fue descubierto en 1977 por Richard J. Roberts39 y Phillip A. Sharp40 simultáneamente estudiando la transcripción de genes del Adenovirus tipo 2, (observan en el microscopio de electrones que fragmentos de ADN no están en el ARN mensajero maduro) hasta ese momento se consideraba que el ADN RITA QUINTAS REY 40 estaba formado por un segmento continuo de genes. Gracias a ese descubrimiento ambos recibieron el premio nobel en 1993. El splicing del pre-ARN mensajero se lleva a cabo en el núcleo por el espliceosoma41 y por medio del mismo, antes de la traducción, se eliminan los intrones del pre-ARNm y se unen lo intrones. En este proceso intervienen numerosos factores que incluyen elementos de la secuencia que definen los límites intrón/exón y elementos reguladores (elementos en cis) y proteínas que se unen a ella (elementos en trans)42. Así, los elementos en cis son: los sitios de splicing 5`y 3’, el punto de ramificación, el tracto de polipirimidinas y los elementos potenciadores o silenciadores exónicos e intrónicos; y los elementos en trans: el espliceosoma complejo formado por formado por 5 ribonucleoproteínas pequeñas nucleares (snRNPs), cada una contiene una unidad de ARN pequeño nuclear (snRNA) de entre 90 y 220 nucleótidos, ricos en ácido uridílico (U1-U6)43 y mas de 150 proteínas, las proteínas ricas en serina–arginina, las proteínas heterogéneas nucleares y el complejo regulatorio. El espliceosoma es un complejo macromolecular formado por más de 150 proteína, y 5 ribonucleoptroínas pequeñas nucleares (snRNPs)44 existen dos tipos, el mayor y el menor en función de los intrones en los que lleven a cabo el splicing. El mayor reconoce los sitios invariables GT(U)-AG (intrones U2) que comprende el 98,7% de los límites intrón/exón45 mientras que el menor reconoce los intrones U12 que se encuentran en menos de un 1% de los exones46. El espliceosoma mayor contiene 5 snRNA (U1, U2, U4, U5 y U6). El espliceosoma menor, es similar, pero las snRNPs que lo forman son: U11, U12, U4atac, U6atac. Cada espliceosoma tiene 4 snRNPs diferentes, pero U5 es común. Las proteínas U11 y U12 se unen a su secuencia diana formando el complejo di-snRNSP47. Este mecanismo se utiliza en intrones U12 dependientes47, que como se dijo anteriormente se encuentran en menos de un 1% de los intrones localizados en alrededor de 50 genes, estos genes también contienen intrones U2 dependientes por lo que necesitan la cooperación de ambos spliceosomas48. Los límites intrón exón son AT(U)-AC y se caracterizan por una gran conservación en su punto de ramificación y en el sitio 5’ y por la falta de tracto de polipirimidinas46. Introducción 41 El proceso de splicing consiste en dos pasos: el primero de reconocimiento de bordes intrón exón y el segundo de 2 transesterificaciones que provocan la escisión del intrón y unión de los exones6. Para el reconocimiento de los bordes intrón exón son necesarios los elementos en cis que ayudan al reconocimiento de los sitios que son los sitios de splicing 3’ y 5’ el punto de ramificación y el tracto de polipirimidinas49. El ensamblaje del espliceosoma es un proceso complejo que se realiza en diferentes pasos hasta dar lugar a un complejo catalítico que puede realizar las dos transesterificaciones que componen el proceso de splicing50 (Figura 1). El ensamblaje comienza con una unión ATP-independiente de U1 al sitio de splicing 5’ del intrón. También se produce la unión de la proteína SF1 /BBP al punto de ramificación y el factor auxiliar U2AF al tracto de polipirimidinas. Estas proteínas están interrelacionadas pues SF1/BBP interactúa con la subunidad U2AF65 por su motivo de reconocimiento de ARN, la subunidad U2AF35 se une al sitio 3’. Todos estos procesos dan lugar a la formación del complejo E del spliceosoma51 (Figura 1). La U2 snRNA se une por complementariedad, de forma ATPdependiente, al punto de ramificación, lo que desplaza a SF1/BPS del punto de ramificación. Formando el complejo A, donde U1 y U2 está asociados al pre-mRNA en el sitio donador y el punto de ramificación respectivamente y U2AF al aceptor. Después se unen U4/U6 y U5 para dar un tri-snRNP, formando el complejo B, todavía inactivo, pero con todas las snRNAs unidas al preARNm52. Para la activación del espliceosoma se liberan U1 y U4 dando lugar al complejo B*53. La afinidad de U6 por el sitio 5’ de splicing y de U2 por complementariedad, desplaza a U1 y permite a U6 unirse a al 5’ss, U2:U6 y U4:U6 son mutuamente excluyentes por lo que al unirse a U2 se elimina U4. La configuración de U2, U5 y U6 determina la formación del complejo catalítico generando el complejo C45. Después de la activación se produce el primer paso del splicing6 (Figura 1). RITA QUINTAS REY 48 2.2.3 Tipos de mutaciones de splicing Las mutaciones que afectan al splicing pueden producirse en intrones o exones y pueden provocar una alteración en los sitios de splicing, crear nuevos o activar sitios crípticos. También pueden alterar secuencias potenciadoras o silenciadoras o alterar la estructura secundaria y evitar así la unión de elementos del espliceosoma94. Los sitios de splicing son secuencias conservadas por lo que cualquier cambio puede evitar la unión de los factores que se unen para llevar a cabo el corte de intrones y empalme de exones. Las alteraciones más comunes son las producidas en las bases +1 y +2 de 5’ y -1 y 12 de 3, siendo las más comunes las producidas en el sitio aceptor95. Normalmente las mutaciones en sitios de splicing, ya sean 3’ o 5’ provocan el salto de uno o varios exones, o bien el salto parcial de un exón (exon skipping)96,97,98. Si la variante debilita el sitio de splicing y activa un sitio críptico, que se utiliza en vez del auténtico, puede llevar a la inclusión de una parte del intrón o a la eliminación de parte del exón99,100. Las variantes intrónicas profundas (deep intronic) normalmente crean un sitio críptico de splicing que es reconocido por el espliceosoma como verdadero, produciendo así la inclusión de un fragmento del intrón (pseudoexón) en el ARN maduro29,101. También pueden crear un elemento regulador y reconocer una secuencia intrónica como exónica produciendo el mismo resultado 102. Variantes intrónicas o exónicas que afectan a elementos reguladores tanto potenciadores como silenciadores pueden alterar el proceso de corte y empalme impidiendo la unión de factores específicos a estas regiones103. La mayoría de mutaciones exónicas que afectan al splicing están incorrectamente clasificadas como sinónimas, de cambio de sentido (missense) o sin sentido (nonsense). Normalmente, estas mutaciones generan dos tránscritos a partir del alelo mutado, uno normal, con un nucleótido modificado, y otro más corto. Si las variantes reportadas introducen un nuevo sitio de splicing o activan uno críptico produciendo la pérdida de un fragmento de exón, también pueden alterar un elemento regulador exónico produciendo el salto del exón104. Las variantes en regiones intrónicas silenciadoras o potenciadoras (ISS y ISE) pueden afectar al splicing reteniendo parte de un intrón por la Introducción 49 activación de un sitio críptico de splicing facilitando la formación de un exón críptico102. Hay solo una veintena de variantes descritas en el punto de ramificación y en el tracto de polipirimidinas que son difíciles de localizar por la degeneración de su secuencia105. Mutaciones en el tracto de polipirimidinas pueden provocar la no unión de la subunidad U2AF65 y la proteína de unión al tracto de polipirimidinas, por lo que también pueden afectar al splicing106. Hay descritas variantes en el tracto de polipirimidinas que producen el salto de un exón107 o la retención de parte de un intrón108. Mutaciones en el punto de ramificación pueden dar lugar al salto de un exón por la alteración en la unión de SF1 y U2 y así alterar el sitio de splicing. Pueden provocar la retención de un intrón o parte de uno si crean un nuevo sitio de splicing109,110. También hay reportadas variantes en el punto de ramificación que provocan el salto de un exón111,112. Variantes en factores que actúan en trans también pueden producir alteraciones como la retención de grandes intrones113. Se han encontrado variaciones que implican el secuestro de algún factor de splicing que hacen que se produzca una regulación negativa como en el caso del secuestro del factor MBNL1 que produce una regulación alterada canal muscular de cloro CLCN1114. Ya que la detección de variantes de splicing directa mediante secuenciación de RNA no es viable en la rutina, es necesaria la aplicación de algoritmos que puedan predecir el efecto de variantes sobre la proteína. Esto se contempla también en las guías de la ACMGAMP animando a los usuarios a utilizar más de un algoritmo para una mejor predicción22. 2.2.4 Repercusión clínica e importancia de variantes de splicing Lord et al.,115, usando datos de secuencia de exomas de probandos reclutados en el Estudio DDD (Deciphering Developmental Disorders, www.ddduk.org) y exomas del ExAC (Exome aggregation consortium), estiman mediante análisis de carga mutacional que un 73% de las mutaciones de splicing se encuentran en sitios canónicos y RITA QUINTAS REY 50 hasta un 27% se encuentran en sitios no canónicos. De ese 27%, un 3540% no aparecen en bases de datos. Lo que quiere decir que el 27% de variantes causales de desórdenes del desarrollo no se encuentran en sitios consenso por lo que se pierden normalmente en el análisis del exoma, lo que puede explicar parte de esa falta de resultados al estudiar el exoma de un paciente. En este mismo estudio observan un patrón en la localización de variantes y el diagnóstico del paciente. Un enriquecimiento en variantes que afectan a los sitios de splicing en pacientes diagnosticados y un enriquecimiento de variantes localizadas en otras regiones que afectan al splicing en pacientes no diagnosticados115. Hoy en día está claro que el porcentaje de la variación que afecta al splicing depende de la complejidad del gen ya que variantes que produzcan alteraciones en el splicing pueden llegar a representar el 50% en algunos genes116. Como vemos, cada vez son más reconocidas las alteraciones patogénicas de splicing, causadas por variantes puntuales en sitios de splicing o elementos reguladores en cis, como mecanismo causal de enfermedades. Desafortunadamente en la rutina diagnóstica las variantes de splicing pueden escaparse de la interpretación debido a la falta de muestras de ARN117. La mejor forma de estudiar las variantes de splicing sería realizar estudios directamente en el ARN, pero teniendo en cuenta el tiempo y los costes que conllevaría realizar este tipo de análisis, añadidos al de los exomas, la alternativa más viable para su detección es la utilización de herramientas in silico. Aunque no eliminan la necesidad de confirmación en el laboratorio, es esperable que reduzcan el número de variantes candidatas para su estudio42. . 2.3 HERRAMIENTAS DE PREDICCIÓN Los algoritmos computacionales para la predicción de genes se empezaron a desarrollar en la década de los 80 del siglo pasado y desde ese momento ha habido muchas mejoras; aunque también hay problemas que siguen sin estar resueltos, como el splicing alternativo o la detección de exones cortos118,119. Introducción 51 El objetivo de las herramientas in silico es permitir el estudio a gran escala de variantes para su priorización y conseguir eliminar la mayoría para que solo unas pocas requieran validación en el laboratorio. Estudian la información de la secuencia para predecir el posible efecto en el splicing38. Uno de los problemas de las herramientas de predicción del splicing es la interpretación del resultado. No hay un estándar para el cambio de la señal al sustituir un alelo ya que la mayoría de las herramientas predicen scores para un sitio de splicing potencial a partir de un input de secuencia de ADN. Además faltan estudios a gran escala para evaluar la capacidad predictiva de los algoritmos5. Los programas que estudian los sitios de splicing son más fiables en su predicción ya que estos sitios son los más conservados y estudiados en humanos. La dificultad aumenta a la hora de encontrar algoritmos de predicción de elementos reguladores (SREs, Splicing regulatory elements)116, el tracto de polipirimidinas y el punto de ramificación por la degeneración de su secuencia105. También es necesario tener en cuenta que el efecto de una variante de splicing específica, depende del tipo de tejido donde se exprese el tránscrito primario y de sus factores específicos120. La gran cantidad de herramientas disponibles hace que la evaluación de todas sea imposible. Es importante realizar una comparativa de la calidad de las predicciones teniendo en cuenta el tipo de algoritmo utilizado119. Una de las formas más utilizadas para el estudio de los algoritmos es en términos de sensibilidad y especificidad que serán los empleados en nuestro trabajo121. 2.3.1 Desarrollo de los algoritmos Las herramientas in silico para la detección de variantes que alteran el splicing se desarrollan teniendo en cuenta diferentes elementos que intervienen en el proceso: señales de splicing, incluyendo sitios de splicing 5’ y 3’ y punto de ramificación, elementos reguladores de splicing (potenciadores y silenciadores intrónicos y exónicos), el espliceosoma y otros elementos que actúan en trans que se unen a elementos en cis122–125 . Los algoritmos para el análisis de variantes de splicing se RITA QUINTAS REY 52 diferencian en : 1) información de la base de datos sobre las secuencias consenso, 2) el modelo estadístico utilizado para el análisis y 3) el método de entrenamiento para aproximaciones de machine learning50. Los sitios de splicing regulan el splicing alternativo mediante su afinidad por U1 y U2 por eso existen numerosos algoritmos para medir la fuerza de estas uniones126. La mayoría son herramientas online sin posibilidad de automatización lo que hace que sean normalmente poco útiles en la práctica clínica, lo interesante es la automatización de los algoritmos. Otra desventaja es la limitación en el tamaño de la secuencia analizada. Además la falta de guías para la interpretación de los resultados dificulta su aplicación a la práctica clínica42. Muchos de los algoritmos no dan un score si no un porcentaje de cambio entre una variante y una secuencia de referencia (WT) por lo que es necesario ajustar el punto de corte 123, lo que implica que para un mismo algoritmo es necesario ajustar el punto de corte según el estudio123,127. Es por ello que son necesarios estudios de su efectividad en grandes cohortes de casos reales. Los algoritmos basados en aprendizaje automático (machine learning) parecen ser los más prometedores en la identificación de algunas variantes significativas35. El proceso de splicing no depende solo de la secuencia de ARN si no que existen factores epigenéticos que regulan la expresión de los genes, proteínas de unión al ARN que actúan en trans, factores ambientales y específicos de tejido, variables que no pueden ser detectadas por ningún algoritmo. La tecnología machine learning se ha utilizado ampliamente en genética entrenando algoritmos para la identificación de sitios de splicing, promotores, potenciadores y silenciadores de splicing y posición de nucleosomas128. Este tipo de aproximación permite a la herramienta “aprender” como reconocer determinados patrones de forma eficiente. Existen numerosos modelos como el árbol de decisión, máquinas de vectores de soporte (SVM), ensemble learning o redes neurales todos ellos aplicados en algunos de los algoritmos explicados a continuación129. La ACMG/AMP publicó en 2015 una guía para la interpretación de variantes, entre las cuales se encuentran las de splicing, donde Introducción 53 aconsejan el uso de algoritmos in silico de predicción para este tipo de variantes y particularmente el uso de más de un algoritmo combinado ya que cada uno tiene ventajas y desventajas frente a otros. Indican también que la mayoría de algoritmos diferencian bien las variantes que afectan al splicing en sitios consenso, obteniendo una sensibilidad del 90-100% y una especificidad del 60-80%, lo que quiere decir que en general la detección es mejor para variantes patogénicas que para las variantes benigas22. En estas guías nombran algunos algoritmos de detección de variantes de splicing: GeneSplicer130, Human Splicing Finder (HSF)131, NetGene2132, MaxEntScan (MES)133, NNSplice134, FSplice (softberry)22. Con los años se han desarrollado nuevos algoritmos que mejoran la actuación de los citados en estas guías. Cada herramienta utiliza diferentes datos y algoritmos, lo que explica las diferencias en su actuación. Existen numerosos algoritmos para la detección de sitios de splicing 3’ y 5’ 42, como ya se ha comentado previamente, al ser los sitios más conservados todos actúan bien en su detección. Los hay que utilizan la matriz de posición creada por Shapiro y Senapathy en 1987135 para calcular la alteración provocada por una variante como SpliceView136 . Otros algoritmos emplean el árbol de decisiones como Genscan137, Gene Splicer130 o Alternative Splice Site Predictor138 que utilizan el modelo de Maximum dependence decomposition. Una metodología que mejora la predicción de los algoritmos anteriores es la que emplea machine learning, como por ejemplo el algoritmo MaxEntScan que utiliza la distribución de máxima entropía. Otras aproximaciones emplean las redes neurales, como las utilizadas en los algoritmos NNSPlice134 o NetGene2139. Más novedosas son las aproximaciones de aprendizaje conjunto (ensemble learning) como el algoritmos dbscSNV utilizado en este trabajo140. El ensemble learning es un metaenfoque general del aprendizaje automático, que busca un mejor rendimiento predictivo al combinar las predicciones de varios modelos. También existen algoritmos para la detección de elementos reguladores de splicing141. Muchos basados en el estudio de oligonucleótido, hexámeros, como ESRsearch142 , Hexplorer143 o Rescue-ESE144. También como en casos anteriores se utilizan las matrices de posición como en las herramientas Skippy145 o ESE- RITA QUINTAS REY 54 Finder146 o los modelos de máxima entropía en el caso de ExonScan147. Otros utilizan también redes neurales como AVISPA148 y SPANR (Spidex)149 también utilizado en este trabajo. Las variantes hasta ahora detectadas en el tracto de polipirimidinas y el punto de ramificación son escasas pero también existen algoritmos para su detección como BBT150, SVM-BPFinder151, LaBranchoR,152 Branchpointer153 todos creados con aproximaciones de inteligencia artificial excepto el branch site analyzer154 que utiliza matrices de posición. Existen herramientas que analizan la conservación de la secuencia a partir de diferentes bases de datos biomédicas como el MutationTaster155. También existen herramientas que combinan diferentes algoritmos como el mutation forecaster (CytoGnomix® Inc) que incluye la herramienta ASSEDA156 que examina variantes puntuales y su repercusión en el ARN mensajero. Un software muy utilizado para el diagnóstico es el Allamut (Interactive Biosoftware) que incluye diferentes algoritmos para la predicción de sitios de splicing y elementos reguladores157. También la herramienta SROOGLE que incluye diferentes algoritmos para la detección de sitios de splicing, punto de ramificación tracto de polipirimidinas y elementos reguladores158. Introducción 55 Sitios de splicing Herramienta Página web Autor AlternativeSpliceS itePrediction (ASSP) http://wangcomputing.com/assp/ Wang (2006)138 AsPic https://algolab.eu/grants/aspic/ Martelli (2011)159 ASSEDA https://www.cytognomix.com/?duka=subscriptio ns-to-the-automated-splice-site-and-exondefinition-server Mucaki (2013)156 CRYP-SKIP http://cryp-skip.img.cas.cz/ Divina (2009)160 dbscSNV https://sites.google.com/site/jpopgen/dbNSFP Jian (2014)140 Fsplice http://www.softberry.com/berry.phtml?topic=fs plice&%20group=programs&subgroup=gfind Softberry GeneSplicer https://ccb.jhu.edu/software/genesplicer/ Pertea (2001)130 GENSCAN http://argonaute.mit.edu/GENSCAN.html Burge and Karlin (1997)130 HAL http://splicing.cs.washington.edu/ Rosenberg (2015)161 MaxEntScan http://hollywood.mit.edu/burgelab/maxent/Xm axentscan_scoreseq.html Yeo & Burge (2004)133 MutPredSplice http://mutpred.mutdb.org/ Mort (2014)162 NetGene2 http://www.cbs.dtu.dk/services/NetGene2/ Hebsgaard (1996)139 Tabla 1. Algoritmos de splicing actualmente disponibles para su aplicación (activos a día 15/07/2021). RITA QUINTAS REY 56 NNSplice https://www.fruitfly.org/seq_tools/splice.html Reese (1997)134 Splice Port http://spliceport.cbcb.umd.edu/ Dogan (2007)163 Splice Predictor http://brendelgroup.org/bioinformatics2go/Spli cePredictor.php Brendel (2004)164 Splice View http://bioinfo.itb.cnr.it/oriel/splice-view.html Basado en Rogozin (1997)136 Splice2Deep https://github.com/SomayahAlbaradei/Splice_D eep Albaradei (2020)165 Spliceman http://fairbrother.biomed.brown.edu/spliceman / Lim and Fairbrother (2012)166 Elementos reguladores de splicing AVISPA https://avispa.biociphers.org/galaxy/ Barash (2013)136 ESE finder http://krainer01.cshl.edu/cgibin/tools/ESE3/esefinder.cgi?process=home Cartegni (2003)136, Smith (2006)167 ESRsearch http://esrsearch.tau.ac.il/ Goren (2006)142 EX-SKIP https://ex-skip.img.cas.cz/ Raponi (2011)168 ExonScan http://hollywood.mit.edu/exonscan/ Wang (2004)147 FAS-ESS http://hollywood.mit.edu/fas-ess/ Wang (2004)147 HEXoSplice http://bioinfo.univ-rouen.fr/HExoSplice_submit/ Ke (2011)143 Introducción 57 HEXplorer https://www2.hhu.de/rna/html/hexplorer_scor e.php Erkelenz (2014) 143 HOT-SKIP https://hot-skip.img.cas.cz/ Raponi (2011)142 Human Splicing Finder http://umd.be/Redirect.html Desmet (2009)131 RESCUE-ESE http://hollywood.mit.edu/burgelab/rescue-ese/ Fairbrother (2002)144 Skippy https://research.nhgri.nih.gov/skippy/index.sht ml Wolfe (2010)145 SPANR (Spidex) http://tools.genes.toronto.edu/ Xiong (2015)149 Punto de ramificación y tracto de polipirimidinas Branch Site Analyzer http://ibis.tau.ac.il/ssat/BranchSite.htm* Kol (2005)154 BBT https://github.com/zhqingit/BPP Zang (2017)150 Branchpointer https://www.bioconductor.org/packages/releas e/bioc/html/branchpointer.html Signal (2018)153 LaBranchoR http://bejerano.stanford.edu/labranchor/ Paggi (2018)152 SVM-BPFinder http://regulatorygenomics.upf.edu/Software/SV M_BP/ Corvelo (2010)151 Estructura secundaria del ARN mFold http://www.unafold.org/ Zuker (2003)169 3 JUSTIFICACIÓN Y OBJETIVOS La secuenciación de nueva generación ha aumentado el número de genes asociados a enfermedades, así como la secuenciación de exomas o genomas completos en cuestión de días. Nuestro conocimiento sobre la información obtenida en este proceso no ha crecido de la misma manera. En este caso siendo la secuenciación de exomas la práctica habitual en la rutina diagnóstica, hemos tratado de mejorar las predicciones de las variantes más infradectectadas, las de splicing. Mediante la utilización de herramientas in silico nuestro objetivo ha sido mejorar la detección de variantes intrónicas implicadas en el proceso de splicing para mejorar el rendimiento diagnóstico de los exomas y aumentar el porcentaje de pacientes diagnosticados. Por ello los objetivos de este trabajo son: 1. Realizar un estudio de las diferentes herramientas de splicing y comprobar cuales son más aptas para incluir en la práctica clínica 2. Validar y comprobar estadísticamente las dos herramientas seleccionadas y validarlas en muestras diagnósticas. 3. Desarrollar un protocolo que incluya las dos herramientas de splicing para su aplicación en la rutina de exomas. 4. Aumentar el número de casos diagnosticados a partir de la implantación de estos algoritmos a la práctica clínica. MATERIAL Y MÉTODOS 4 MATERIAL Y MÉTODOS Para la obtención de los datos analizados en esta tesis fue necesario realizar modificaciones en la anotación empleada en la rutina para incluir los scores de cada uno de los algoritmos. Las predicciones computacionales de sitios de splicing por ADABoost y Random Forest se obtienen de una tabla llamada dbscSNV cuya descarga está disponible en la web de ANNOVAR. La herramienta Spidex es considerado un “Third-party dataset”, lo que quiere decir que es necesario consentir unos términos específicos de licencia para proceder a la descarga de Spidex1.0. Para ello, hay que realizar una petición rellenando un formulario para recibir un URL donde poder descargar los datos y de esa manera incluirlo en la anotación funcional de predicción de variantes de splicing. 4.1 ANOTACIÓN La anotación de los datos de NGS empleados se realizó con ANNOVAR, herramienta escrita en Perl que, dada una lista de variantes con cromosoma, posición inicial y final, alelo de referencia y alelo mutado, puede proporcionar información funcional y poblacional sobre dichas variantes. En todos los casos la anotación se realiza a partir de un archivo VCF (Variant Call Format) o de la identificación de dbSNP (rs), desde el cual se puede extraer la información necesaria para la anotación. En la rutina del laboratorio se lleva a cabo la anotación a tres niveles: gen, región y filtrados con el fin de ayudar a determinar la relevancia del cambio. Para la anotación al nivel de gen se emplearon las bases de datos RefSeq y Ensembl. RefSeq es un conjunto de datos con información genómica, de tránscritos y proteínas que permite conocer la región del genoma donde se sitúa la variante, el gen afectado y el tipo de cambio que tiene lugar a nivel genómico, de tránscrito y proteína. Ensembl es una base de datos de genomas de vertebrados que permite conocer la misma información que RefSeq. RITA QUINTAS REY 70 En el caso de la anotación a nivel de región se utilizaron phastConsElement100way, que permite identificar elementos conservados evolutivamente; y genomicSuperDups, que identifica variantes localizadas en duplicaciones segmentales. La anotación a nivel de filtrado posibilita la obtención de información que puede ser empleada para la selección de variantes candidatas en función de lo reportado en distintas bases de datos. Para las anotaciones específicas de patologías se consultaron bases de datos que recogen información de variantes del genoma asociadas a distintos fenotipos (Human Phenotype Ontology, Gene Ontology, Online Mendelian Inheritance in Man, GeneReviews, Clinical Genomic Database, Human Gene Mutation Database, ClinVar e InterVar). Para anotaciones poblacionales se consultaron bases de datos que contienen frecuencias de las variantes en distintas poblaciones (MaxPop y gnomAD). Se incluyó también el código rs de cada una de las variantes recogidas en dbSNP y anotación de variantes encontradas en estudios de asociación de genoma completo (GWAS, del inglés Genome Wide Association Study). También se consultaron las bases de datos Catalog of Somatic Mutations in Cancer (COSMIC) e International Cancer Genome Consortium (ICGC) para la anotación somática. La versión 4.1 de dbNSFP se utilizó para la anotación funcional, ya que recoge un conjunto de predictores bioinformáticos y bases de datos que contienen información para variantes no sinónimas que se encuentran en el genoma humano. Para la obtención de los datos analizados en esta tesis se relizan modificaciones en la anotación empleada en la rutina. Se seleccionaron para la anotación a nivel de gen, las variaciones localizadas en zonas intrónicas a 300pb del exon adyacente en RefSeq. Se realiza una segunda modificación a nivel de filtrado, ya que es necesario obtener la información de Spidex y dbscSNV para poder incluirla en la tabla anotada e integrar en ella la anotación funcional de predicción de variantes de splicing. 4.2 VALIDACIÓN DE LOS ALGORITMOS Al final del proceso de anotación se obtuvo un archivo tabulado (*.tab) que contenía para cada una de las variantes de las muestras individuales Material y métodos 71 la información procedente de las distintas bases de datos mencionadas anteriormente. La validación de los algoritmos seleccionados (Spidex y dbscSNV) se realiza en diferentes conjuntos de variantes, pero siempre se lleva a cabo en cada uno de ellos por separado y de los dos en conjunto. Esta validación se realiza a partir del recuento de variantes en cada una de las bases de datos utilizadas y posteriormente se realizan las tablas de contingencia necesarias en cada uno de los algoritmos para poder calcular la sensibilidad, especificidad y valores predictivos positivos y negativos de cada uno. Para la validación de los dos algoritmos a estudio se toma como referencia de patogenicidad el umbral indicado en los artículos para cualquiera de los dos algoritmos, en este caso, el 5 absoluto para el algoritmo Spidex y mayor de 0,6 para dbscSNV, tanto para Adaptative boost (ADA) como para Random Forest (RF). Base de datos Patogénico benigno algoritmo score patogénico A B A+B score benigno C D C+D A+C B+D La tabla de contingencia se construye utilizando como “gold estándar” el resultado benigno o patogénico de bases de datos de variantes con descripción clínica (ClinVar, InterVar o Varsome) que irán situados en las columnas. En las filas se colocan las variantes descritas como patogénicas o benignas según cada uno de los algoritmos. Los nombres de cada una de las celdas se definen como A, B, C y D siendo A el verdadero positivo, B falso positivo, C verdadero negativo y D Falso negativo. Valor predictivo positivo: A/(A+B) *100 Es la probabilidad de que la variante sea patogénica si se obtiene un resultado por encima del umbral en el algoritmo. El valor predictivo positivo puede estimarse, por tanto, a partir de la proporción de Tabla 2. Tabla de contingencia y cálculos para la validación cuantitativa de los algoritmos. RITA QUINTAS REY 72 variantes con un resultado patogénico en el algoritmo que finalmente resultaron ser patogénicas. Valor predictivo negativo: D/(D+C)*100 Es la probabilidad de que la variante con score benigno en el algoritmo sea realmente benigna en la base de datos estudiada. Se estima dividiendo el número de variantes verdaderamente benignas entre el total de variantes detectadas por el algoritmo en esa base de datos como benignas. Sensibilidad A/(A+C)*100 Es la probabilidad de clasificar correctamente una variante patogénica, es decir, la probabilidad de que para una variante patogénica se obtenga en el algoritmo un valor por encima del umbral. La sensibilidad es, por lo tanto, la capacidad del test para detectar la variante que realmente afecten al splicing. Especificidad D/(D+B)*100 Es la probabilidad de clasificar correctamente variantes benignas, es decir, la probabilidad de que para una variante benigna se obtenga un score por debajo del umbral. En otras palabras, se puede definir la especificidad como la capacidad para detectar variantes que no afecten al proceso de splicing. Exactitud (tasa de éxito global) (A+D)/(A+B+C+D) Probabilidad de que el algoritmo clasifique correctamente la variante como benigna o patogénica. Es decir, el porcentaje total de variantes correctamente clasificadas en el total de variantes. Los valores de sensibilidad, especificidad, valores predictivos y éxito global se calcularán aplicando las siguientes fórmulas: • Valor predictivo positivo =A/(A+B) *100 • Valor predictivo negativo = D/(D+C)*100 • Sensibilidad = A/(A+C)*100 • Especificidad = D/(D+B)*100 • Exactitud = (A+D) / (A+B+C+D) 4.2.1 Validación en bases de datos de genes conocidos Para comprobar la capacidad de predicción de los dos algoritmos y establecer un punto de corte para diferenciar variantes patogénicas de benignas se seleccionaron tres genes bien conocidos (CFTR, F8 y F9). Material y métodos 73 Estos genes estudiados tienes bases de datos de acceso público en las que es posible descargar un listado de variantes, en su mayoría patogénicas, con diferentes aspectos del fenotipo asociados a la enfermedad y así comprobar la patogenicidad de esas variantes en cada paciente. En los tres casos (CFTR, F8 y F9) la metodología es similar, en primer lugar, para la selección de variantes patogénicas, se escogen entre las bases de datos específicas para cada uno de los genes (cftr2 y EAHAD) las variantes intrónicas de un solo nucleótido para su anotación. La búsqueda de variantes benignas se realiza a partir de la base de datos dbSNP. Para ello es necesario definir la región de estudio en RefSeq que, en este caso, son las regiones intrónicas localizadas hasta +300 pares de bases del exón adyacente. Se seleccionan todas las variantes detectadas y se anotan añadiendo las columnas de los algoritmos seleccionados. Se valida esta metodología repitiendo el mismo proceso para los genes CFTR, F8 y F9. CFTR Para la selección de variantes patogénicas en el gen CFTR se selecciona en la base de datos CFTR2 (www.cftr2.org) la colección de variantes más actualizada en el momento del análisis (tabla del 10 de enero de 2020). La tabla de Excel seleccionada contiene columnas con información de el nombre de la variante en cDNA, el nombre en la proteína, rsID, alelos en CFTR2, la frecuencia alélica en 142.036 variantes identificadas, el porcentaje de insuficiencia pancreática, la clasificación de esa variante en versiones previas y si ha habido cambios con respecto a la actual. El archivo con la lista de variantes seleccionado se encuentra en formato xlsx lo que permite seleccionar las variantes interesantes para el estudio de estos algoritmos. En las 52 variantes finales se seleccionan la columna de rsID para su anotación. En estas bases de datos específicas, como CFTR2, casi la totalidad de las variantes registradas son causales, por lo que no tendríamos variantes benignas con las que comprobar la capacidad de discriminación de los algoritmos para esas variantes. Para la selección de variantes no causales, escogemos las almacenadas en la base de datos dbSNP (versión build 154). Para la selección de las variantes del RITA QUINTAS REY 80 4.3 APLICACIÓN EN VARIANTES DETECTADAS POR LA FPGMX En la Fundación Pública Galega de Medicina Xenómica existe un repositorio en el que se almacenan y actualizan todas las variantes detectadas en cualquier muestra procesada por secuenciación de nueva generación (NGS) desde que empezó a aplicarse esta técnica en la rutina diagnóstica, contando con un total de 3.244.336 variantes recogidas en 22.099 muestras de las cuales 1.598 son exomas. Para la validación de nuestros algoritmos en las variantes detectadas en el laboratorio se anotan las variantes presentes en este repositorio a día 7 de abril de 2021. Todas estas a variantes se procesaron siguiendo los protocolos de análisis establecidos en el laboratorio (fastp, BWA, Picard y GATK en el caso de tecnologías Illumina; TMAP y TVC en el caso de tecnologías Ion Torrent), y se añadió en la anotación con ANNOVAR las columnas correspondientes a las puntuaciones asignadas por cada uno de los algoritmos. Al principio del estudio (mayo 2019) se valoró la inclusión de la clasificación de la base de datos HGMD, pero, debido a que todas las variantes descritas en ella son patogénicas o probablemente patogénicas, al no disponer de variantes benignas descritas no era posible realizar la validación cuantitativa de los algoritmos en esta base de datos y solo era posible calcular el valor de sensibilidad, por lo que se decidió no incluirla en el estudio. La implementación de Varsome como herramienta de consulta en la rutina se produjo a finales de 2020, hecho que permitió añadirla a la validación de los algoritmos. Varsome no es un recurso descargable que pueda introducirse en la anotación, sino que es necesario consultar cada variante en los servidores de Varsome a través de su API (https://api.varsome.com/) e introducir los resultados obtenidos en la tabla anotada manualmente. La interpretación clínica de InterVar se realiza combinando bases de datos disponibles para ANNOVAR de frecuencia poblacional, funcionalidad y patogenicidad a través de su código disponible en https://github.com/WGLab/InterVar. Tras descargar todas las bases de datos necesarias con ANNOVAR, el código de InterVar es capaz de generar una predicción para cualquier variante consultada. Material y métodos 81 ClinVar es un archivo de registros sobre las variaciones humanas y el fenotipo. Las variantes encontradas son reportadas en muestras de pacientes teniendo en cuenta el significado clínico por tanto el número de variantes detectadas por ClinVar es menor que en InterVar y Varsome ya que no son bases de datos que recopile información sobre variantes descritas si no que asigna una clasificación a cualquier variante anotada. InterVar y Varsome clasifican cualquier variante siguiendo las guías de la ACMG/AMP (American College of Medical Genetics and Genomics/Association for Molecular Pathology) de 2015. Para InterVar el input es un archivo .vcf donde se realiza la interpretación en función de 18 criterios. Varsome cuenta con más de 70 referencias cruzadas e incluye información de 30 fuentes externas para la clasificación de variantes según las guías ACMG/AMP. Todos dividen las variantes en diferentes grupos de entre los que se seleccionan en primer lugar las variantes con clasificación benigna o patogénica para cualquiera de las bases de datos, y posteriormente se realizan los mismos contajes teniendo en cuenta las variantes clasificadas como probablemente benignas y probablemente patogénicas. Para obtener la información necesaria para este estudio se anotan todas las variantes detectadas por el laboratorio añadiendo en la anotación a nivel de filtrado las columnas correspondientes a Spidex y dbscSNV. Posteriormente, se seleccionan las variantes que se encuentren en regiones exónicas a ±300bp, y se eliminan aquellas que no hayan podido ser examinadas por ninguna de las dos herramientas. Se realizan las consultas de todas las variantes restantes a Varsome y se introducen los datos en la tabla para realizar los contajes. Se seleccionan todas las variantes con clasificación “benign”, “likely benign”, “likely pathogenic” y/o “pathogenic” en cualquiera de las tres bases de datos consultadas (ClinVar, InterVar y/o Varsome). Se realizan contajes independientes para dbscSNV y Spidex en cada base de datos solo con variantes “benign” y “pathogenic” y también teniendo en cuenta variantes “likely benign” y “likely pathogenic”. Para ello en primer lugar se seleccionan todas las variantes detectadas por Spidex y se realizan contajes de variantes patogénicas y benignas RITA QUINTAS REY 82 en ClinVar, InterVar y Varsome. Posteriormente se realiza el mismo proceso teniendo en cuenta las variantes probablemente benignas y probablemente patogénicas, serán clasificadas como benignas por el algoritmo todas las variantes que en la columna “spidex.dpsi_max_tissue” tengan un número mayor a -5 y menor de 5. Se realiza el mismo proceso con la herramienta dbscSNV considerando benigna por parte del algoritmo cualquier variante con un score menor a 0,6 y patogénica cualquiera mayor o igual a 0,6. Se realizan contajes de forma independiente para la clasificación según Random Forest (“dbscSNV_RF_score “) y AdaBoost (dbscSNV_ADA_score). Por último, se realizan los contajes teniendo en cuenta ambos algoritmos. Para ello se considera benigna cualquier variante que no supere el umbral en ninguno de los scores utilizados, y patogénica cualquier variante que sobrepase el umbral en cualquiera de los tres scores. A partir de los contajes, se realizan las tablas de contingencia correspondientes a cada algoritmo, por separado y en conjunto, para calcular el valor predictivo positivo, valor predictivo negativo, sensibilidad, especificidad y éxito total en las diferentes bases de datos. 4.3.1 Comité de ética El desarrollo del Proyecto se realizará respetando la Declaración de Helsinki de la Asociación Médica Mundial de 1964 sobre principios éticos para las investigaciones médicas en seres humanos, la Orden SCO/256/2007, del 5 de febrero, por la que se establecen los principios y las directrices detalladas de Buena Práctica Clínica y el Convenio relativo a los derechos humanos y la biomedicina), hecho en Oviedo el 4 de abril de 1997 y sucesivas actualizaciones. El proyecto fue aprobado por el Comité Ético de Investigación Clínica de Galicia disponible en el 203 (código 2020/504). Material y métodos 83 4.4 APLICABILIDAD CLÍNICA Las variantes seleccionadas proceden de pacientes a los cuales se les ha realizado previamente un estudio de exoma en la Fundación Pública Galega de Medicina Xenómica. Para la incorporación de casos se definieron con anterioridad unos criterios de inclusión y exclusión que se explicarán a continuación. Siguiendo estos criterios se detectaron un total de 803 variantes en 307 pacientes, de entre los que se seleccionaron aquellos interesantes para ejemplificar la aportación a la práctica clínica de los algoritmos previamente validados. 4.4.1 Selección de pacientes Se seleccionan en la base de datos interna de la Fundación Pública Galega de Medicina Xenómica aquellas variantes pertenecientes a 782 exomas secuenciados hasta marzo de 2019. El conjunto de variantes se recoge en un archivo .vcf que contiene la información necesaria para la anotación con ANNOVAR, que introduce las columnas correspondientes a los scores de los dos algoritmos a estudiar (Spidex y dbscSNV). En primer lugar, se realiza una recopilación de todas las variantes con clasificación patogénica en alguna de las dos herramientas de splicing, es decir, con una puntuación mayor a 0,6 para dbscSNV y mayor o igual a |5| en Spidex. Sobre el total de variantes recogidas se aplican los criterios de inclusión y exclusión para la selección de casos clínicos que se explican a continuación. Se seleccionan todas las variantes intrónicas y de splicing, en la columna “Annotation RefSeq” y que contengan “splice” y/o “intrón”. Se incluyen las variantes de un solo nucleótido. Para ello se seleccionan en las columnas “Ref” y “Alt” todas las variantes con A, C, T, G. Se escogen variantes sin frecuencia poblacional (“MaxPopFreq”=0) y que hayan aparecido en un único individuo del total de casos estudiados en la Fundación Pública Galega de Medicina Xenómica (todas las columnas “vardb_*”=0). Además, se seleccionan aquellas variantes que tengan un fenotipo asociado en “GeneReviews”. Las variantes localizadas en genes no relacionados con el fenotipo del paciente o en regiones exónicas, y también aquellas que pertenezcan a pacientes cuyo diagnóstico es explicado por otra mutación, son excluidas. RITA QUINTAS REY 84 Siguiendo estos criterios se obtienen un total de 803 variantes en 307 pacientes. Cada caso es estudiado de forma individualizada, y se seleccionan aquellos en los que no se ha reportado una causa genética que explique el fenotipo del paciente o cuyo diagnóstico no es concluyente. Se escogen los casos en los que las variantes detectadas están localizadas en genes relacionados con el fenotipo del paciente, y se realiza el reanálisis del exoma secuenciado para comprobar que con la actualización de la anotación actualizada, llevada a cabo en 2021, no se han detectado nuevas variantes exónicas descritas que expliquen el fenotipo del paciente. En el caso de no aparecer ningún nuevo hallazgo, se seleccionan para el estudio las nuevas variantes de splicing detectada por las herramientas dbscSNV y/o Spidex. Los resultados obtenidos se remiten al especialista encargado de cada caso. Tras la valoración clínica se solicita una nueva muestra de sangre periférica al paciente para llevar a cabo el análisis de ADN complementario (ADNc). También se requerirá una muestra a ambos progenitores, en el caso de no existir muestra previa, para comprobar si la variante detectada en el paciente es heredada o “de novo” (estudio de portadores). La secuenciación del ADN se llevará a cabo empleando la secuenciación Sanger. Finalmente se seleccionan 4 pacientes, para los que se ha obtenido muestra de estos y sus progenitores. Para cada uno de los casos seleccionados se busca información de la variante en la literatura y distintas bases de datos, Human Gene Mutation Database (HGMD), ClinVar, GeneReviews y Online Mendelian Inheritance in Man (OMIM), para comprobar su relación con el fenotipo del paciente y comprobar si había sido descrita previamente. Estudio de las variantes en ADNc A los pacientes elegidos para este estudio se les extrae una nueva muestra de sangre periférica, almacenada a 4ºC hasta el momento de la extracción. En primer lugar, se realiza la extracción de ARN a partir con el kit Maxwell®RSC simplyRNA Blood (Promega®) siguiendo el protocolo indicado por el fabricante. La retrotranscripción a ADN complementario se realiza con Invitrogen™ SuperScript™ II Reverse Transcriptase (Thermofisher scientific) siguiendo también las Material y métodos 85 instrucciones de la casa comercial. Para la secuenciación se diseñan cebadores específicos para cada paciente, eligiendo el gen diana y eliminando los intrones del diseño, para ello se utiliza el software Primer3 (http://bioinfo.ut.ee/primer3-0.4.0), con genoma de referencia hg19, que selecciona primers en la secuencia introducida. Una vez elegidos, se comprueba si existe posibilidad de dímeros o de formación de horquillas en la página Netprimer (http://www.premierbiosoft.com/netprimer/). La complementariedad con otras secuencias se comprueba con el software BLAST (https://blast.ncbi.nlm.nih.gov/Blast.cgi) ya que la muestra de partida es cDNA total, no sólo el gen de interés de cada caso. Para cada muestra se realiza una mix (Tabla 3) que contiene el ADNc y los primers para amplificar la región a estudio con las condiciones explicadas en la Tabla 3. Después de amplificar la región diana, se purifican los productos de la PCR anterior con ExoSAP-IT™ (Thermo Fisher Scientific, Massachusetts, USA). Posteriormente, se secuencian con el kit BigDye™ Terminator v3.1 Cycle Sequencing (Thermo Fisher Scientific, Massachusetts, USA). Los productos derivados de la secuenciación fueron purificados con el Optima DTR™ 96-Well Plate Kit (Edge Bio, Maryland, USA). Finalmente, los productos de secuenciación fueron separados mediante electroforesis capilar utilizando el ABI 3730XL DNA Analyzer (Thermo Fisher Scientific, Tabla 3. Mix para cada muestra de estudio y condiciones PCR MIX (25μL) Agua MiliQ 11,375μL 5X Buffer 5μL dNTPs (1,25mM) 4μL Cl2Mg 1,5μL Primer Forward 1μL Primer Reverse 1μL GoTaq Polymerase (5U/μL) 0,125μL ADNc (20-200 ng/μL) 1μL Programa termociclador 94ºC 2' 94ºC 30'' 60>55ºC 30'' 72ºC 1' 94ºC 30'' 55ºC 30'' 72ºC 1' 72ºC 7' 10ºC ∞ RITA QUINTAS REY 86 Massachusetts, USA). Los resultados se analizan con el programa Staden Package software (http://staden.sourceforge.net). Estudio de portadores Se extrae sangre periférica de los progenitores del paciente para realizar la extracción de ADN con el robot Chemagic MSM I utilizando el Chemagic DNA Blood 100 Kit (PerkinElmer Inc, Massachusetts, USA) siguiendo el protocolo indicado por el fabricante. El ADN extraído de sangre periférica se conservó a 4ºC hasta su cuantificación. La cuantificación del ADN se realiza de dos formas: fluorometría y espectrometría. Primero con el Qubit™ fluorometer (Thermo Fisher Scientific, Massachusetts, USA) que utiliza moléculas que emiten fluorescencia al unirse a la diana que puede ser ADN, ARN o proteínas. En este caso se utiliza el kit de ADN bicatenario donde la fluorescencia se producirá al intercalarse en la doble cadena de ADN. Se emplea el Qubit dsDNA Assay Kit (Thermo Fisher Scientific, Massachusetts, USA) siguiendo el protocolo sin modificaciones. En segundo lugar se cuantifica con NanoDrop® 1000 Sectrophotometer (Thermo Fisher Scientific, Massachusetts, USA), espectrofotómetro que no discrimina entre ADN y ARN; pero cuantifica los ácidos nucleicos de la muestra y permite medir la pureza del ADN respecto a la presencia de proteínas (260/280) y contaminantes (260/230). Se diseñan primers específicos para cada paciente mediante el software Primer3 (http://bioinfo.ut.ee/primer3-0.4.0) genoma de referencia hg19, incluyendo en este caso los intrones en la secuencia. Se comprueba la formación de dímeros y horquillas en Netprimer (http://www.premierbiosoft.com/netprimer/). La complementariedad con otras secuencias se comprueba con el software BLAST (https://blast.ncbi.nlm.nih.gov/Blast.cgi). Para cada muestra se realiza una mezcla (Tabla 4) con el ADNc y los primers para introducirla en un termociclador y amplificar la región a estudio con las condiciones detalladas en la Tabla 4. Material y métodos 87 MIX (25μL) Agua MiliQ 11,375μL 5X Buffer 5μL dNTPs (1,25mM) 4μL Cl2Mg 1,5μL Primer Forward 1μL Primer Reverse 1μL GoTaq Polymerase (5U/μL) 0,125μL ADNc (20-200 ng/μL) 1μL Después de la amplificación de la región de interés mediante PCR, se purifica con ExoSAP-IT™ (Thermo Fisher Scientific, Massachusetts, USA). Los productos se secuencian bidireccionalmente con el kit de secuenciación BigDye™ Terminator v3.1 Cycle Sequencing (Thermo Fisher Scientific, Massachusetts, USA). Posteriormente vuelven a ser purificados con el Optima DTR™ 96-Well Plate Kit (Edge Bio, Maryland, USA). Finalmente, los productos de secuenciación fueron separados mediante electroforesis capilar utilizando el ABI 3730XL DNA Analyzer (Thermo Fisher Scientific, Massachusetts, USA). Los resultados se analizan con el programa Staden Package software (http://staden.sourceforge.net). Tabla 4. Mix par cada muestra y condiciones de PCR Programa termociclador 94ºC 2' 94ºC 30'' 60>55ºC 30'' 72ºC 1' 94ºC 30'' 55ºC 30'' 72ºC 1' 72ºC 7' 10ºC ∞ RESULTADOS RITA QUINTAS REY 96 F9 F9 es el gen que da lugar al factor de coagulación IX. Igual en el caso anterior (F8), se han seleccionado las variantes patogénicas recogidas en la base de datos de la EAHAD (European Association for Haemophilia and Allied Disorder), una asociación multidisciplinar de profesionales de la salud que proporciona cuidado para individuos con hemofilia y otros desordenes sanguíneos. Para la validación de los algoritmos en variantes causales del gen F9 se selecciona en coagulation factor database de la EAHAD las variantes puntuales en ese gen, y de ellas las que se encuentren en regiones intrónicas. Se obtiene una tabla de 104 variantes, con fenotipo suave, moderado o severo, pero todas causales, 92 tienen score en alguno de los dos algoritmos. Spidex detecta 81 de esas 92 (88%) variantes y asigna score patogénico a 53 y benigno a 28. DbscSNV detecta 83 variantes. ADA boost considera patogénicas 78 y benignas 5. En el caso de Random Forest 77 patogénicas y 6 benignas. Al tener en cuenta ambos algoritmos se asigna score a 92 variantes de las cuales 80 son patogénicas y 12 benignas. La tabla con el contaje de variantes para cada uno de los algoritmos puede consultarse la Tabla suplementaria 7. Para la validación de los algoritmos en variantes benignas del gen F9 anotamos todas las variantes presentes en dbSNP (versión: build154) con frecuencia mayor al 1% que se encuentren hasta a 300 pares de bases alejadas del exón. Como resultado se obtienen 1559 variantes de las cuales 1.430 son SNVs, de ellas 790 tienen score en alguno de los algoritmos y 568 son intrónicas. Posteriormente se procede a la eliminación de variantes descritas como patogénicas en la EAHAD, el resultado final es una tabla con 544 variantes que deberían ser benignas. El algoritmo Spidex detecta 543 de esas variantes (99.81%), asigna score benigno a 533 de ellas y patogénico a 10. dbscSNV asigna una puntuación tan solo a 19 de esas variantes (3,5%), clasificando en Ada_score y RF_score 18 benignas y 1 patogénicas. Teniendo en cuenta ambos algoritmos se asigna score a las 544 variantes de las cuales 534 son benignas y 10 patogénicas. La tabla con los contajes de las variantes de dbSNP en cada uno de los algoritmos pueden consultarse en la Tabla suplementaria 8. Resultados 97 A partir del contaje de variantes explicado anteriormente se construyen las tablas de contingencia son necesarias para poder calcular los valores predictivos positivo y negativo, sensibilidad, especificidad y éxito total de cada uno de los algoritmos, Tabla suplementaria 9. SPIDEX dbscSNV SPIDEX+ dbscSNV ADA_SCORE RF_SCORE sensibilidad 65,43% 93,98% 92,77% 86,96% Especificidad 98,16% 94,74% 94,74% 98,16% Valor predictivo positivo 84,13% 98,73% 98,72% 88,89% Valor predictivo negativo 95,01% 78,26% 75,00% 97,80% Éxito global 93,91% 94,12% 93,14% 96,54% En la tabla anterior se observa que Spidex es el que tiene peor sensibilidad con un 65,43% mientras que es el que tiene la mayor especificidad (98,16%). El valor predictivo negativo teniendo en cuenta ambos algoritmos es de 97.80% asignando correctamente 534 variantes frente a 12 mal asignadas. El éxito total en la aplicación de ambos algoritmos es de 96,54% lo que quiere decir que asignan una clasificación correcta a 614 variantes de las 636 estudiadas. Tabla 7. Tabla con los valores de los dos algoritmos para el gen F9 RITA QUINTAS REY 98 5.1.2 Validación en variantes clasificadas por la base de datos ClinVar Después de comprobar el comportamiento de los algoritmos en genes individuales con bases de datos especializadas y obtener resultados alentadores sobre su actuación, pasamos a la validación de dichos algoritmos en un mayor número de variantes. Para ello utilizamos las almacenadas en el repositorio ClinVar, archivo de acceso libre que contiene registros de la relación de variantes humanas y el fenotipo asociado a ellas. En ClinVar se encuentran cientos de miles de variantes clasificadas en 5 grupos: benignas, probablemente benignas, significado incierto, probablemente patogénicas y patogénicas. Para este estudio eliminamos las variantes de significado incierto y hacemos dos contajes de variantes, por un lado, teniendo en cuenta solo variantes benignas y patogénicas y, por otro, añadiendo también las variantes probablemente benignas y probablemente patogénicas. Variantes benignas y patogénicas Partimos de una tabla de 422.324 variantes de splicing, en la que seleccionamos variantes intrónicas de un solo nucleótido clasificadas como benignas o patogénicas en regiones intrónicas examinadas por alguno de los tres algoritmos. Spidex permite analizar 98.165 de 99.048 (99,11%), ClinVar clasifica como benignas 59.880 de las cuales el algoritmo Spidex asigna como benignas 58.401 y como patogénicas 1.479 y de las 38.285 patogénicas 19.281 son asignadas como patogénicas por Spidex y 19004 como benignas. El algoritmo dbscSNV examina 14.773 variantes (14,91%). El algoritmo ADA asigna correctamente 5887 variantes benignas según ClinVar y de forma incorrecta 482. ClinVar clasifica como patogénicas 8.404 de las cuales Ada score asigna a 7.970 variantes score patogénico y a 434 benigno. En cuanto al estadístico Random Forest son examinadas también 14.773 variantes de las cuales 6.369 son benignas según la clasificación de ClinVar y Random Forest asigna correctamente su puntuación a 5.979 e incorrectamente a 390. De estas variantes 8.404 son patogénicas según ClinVar y de ellas 7.811 son Resultados 99 asignadas como patogénicas por Random Forest y 593 con score benigno. En cuanto a la aplicación en conjunto de Spidex y dbscSNV se asignan como benignas las variantes que no superen el umbral en ninguno de los tres algoritmos y patogénicas aquellas variantes que superen el umbral en cualquiera de los scores. Entre los dos algoritmos (dbscSNV y Spidex) se asignan scores para un total de 99.048 variantes, 60.293 de ellas benignas en ClinVar, de las cuales se asignan correctamente 58.443 y como patogénicas 1.850. ClinVar clasifica como patogénicas 38.755, de ellas 22.104 son correctamente asignadas y 16.651 son asignadas como benignas. Las tablas con los contajes de las variantes con clasificación benigna o patogénica en ClinVar se pueden consultar en la Tabla suplementaria 10. A partir del contaje de variantes explicado anteriormente se construyen las tablas de contingencia necesarias para poder calcular los valores predictivos positivo y negativo, sensibilidad, especificidad y éxito total de cada uno de los algoritmos (Tabla suplementaria 11). Como se puede comprobar en la tabla anterior la menor sensibilidad es la proporcionada por Spidex (50,36%) que, por el contrario, es el algoritmo con mayor especificidad (97.53%). El valor predictivo negativo presenta valores entre el 75,45% y el 93,13%, siendo en ambos algoritmos de 77,83%. En ambos algoritmos el valor predictivo positivo es alto (aproximadamente del 92,28%-95,24%) siendo en la aplicación conjunta de 92,28%, asignando correctamente como patogénicas 22.104 variantes frente a 1.850 mal asignadas. El éxito total en la aplicación de ambos algoritmos es de un 81,32% lo que SPIDEX dbscSNV SPIDEX+ dbscSNV ADA_SCORE RF_SCORE Sensibilidad 50,36% 94,84% 92,94% 57,04% Especificidad 97,53% 92,43% 93,88% 96,93% Valor predictivo positivo 92,88% 94,30% 95,24% 92,28% Valor predictivo negativo 75,45% 93,13% 90,98% 77,83% Éxito total 79,13% 93,80% 93,35% 81,32% Tabla 8. Tabla con los valores de los dos algoritmos en ClinVar para variantes benignas y patogénicas. RITA QUINTAS REY 100 quiere decir que los algoritmos asignan correctamente 80.547 variantes causales y no causales de las 99.048 totales estudiadas. Variantes patogénicas, probablemente patogénicas, probablemente benignas y benignas Se realiza un segundo contaje de variantes incluyendo las variantes probablemente benignas y probablemente patogénicas. Este se realiza de forma independiente debido a la introducción de un mayor error por no estar clara su clasificación. Partimos de la misma tabla de 422.324, de ellas 278.591 son variantes intrónicas de un solo nucleótido clasificadas como benignas, probablemente benignas, probablemente patogénicas y/o patogénicas según ClinVar. El algoritmo Spidex asigna un score a 276.274 variantes (99,17%). ClinVar clasifica como benignas o probablemente benignas 189.444 variantes de las cuales 184.454 son benignas según Spidex y 4.990 patogénicas. 86.830 variantes son patogénicas o probablemente patogénicas según la clasificación de ClinVar, de ellas 29.789 son correctamente asignadas como patogénicas por Spidex mientras que 57.041 son clasificadas como benignas. DbscSNV asigna un score a 40879 variantes (14,67%). ClinVar clasifica como benignas o probablemente benignas 22.386 de las cuales ADA_score asigna una puntuación benigna a 21.121 y patogénica a 1.265. Del total de 40.879 vairantes, 18.493 son patogénicas según ClinVar siendo 17.073 correctamente asignadas por el estadístico ADAboost y 1.420 asignadas como benignas. En el caso del algoritmo dbscSNV con el estadístico Random Forest son asignadas el mismo número de variantes. 22.386 son benignas o probablemente benignas según ClinVar, Random Forest asigna correctamente 21.354 variantes y 1.032 como patogénicas. ClinVar clasifica como patogénicas o probablemente patogénicas 18.493 variantes, de las cuales 16.711 son correctamente asignadas y 1.782 son asignadas como benignas. Teniendo en cuenta los dos algoritmos se asigna un score a 278.591 variantes de las cuales 190.816 son benignas o probablemente benignas en ClinVar, 184.858 son asignadas correctamente como benignas para los 3 scores y 5.958 como patogénicas para alguno de ellos. En el caso de variantes patogénicas o probablemente patogénicas en ClinVar hay Resultados 101 87.775 variantes de las cuales 36.057 son correctamente asignadas como patogénicas mientras que 51.718 son asignadas como benignas. El contaje de variantes clasificadas como benignas, probablemente benignas, probablemente patogénicas y patogénicas según ClinVar se encuentra en la Tabla suplementaria 12. A partir del recuento de variantes explicado anteriormente se construyen las tablas de contingencia necesarias para poder calcular los valores predictivos positivo y negativo, sensibilidad, especificidad y éxito global de cada uno de los algoritmos (Tabla suplementaria 13). SPIDEX dbscSNV SPIDEX+ dbscSNV ADA_SCORE RF_SCORE Sensibilidad 34,31% 92,32% 90,36% 41,08% Especificidad 97,37% 94,35% 95,39% 96,88% Valor predictivo positivo 85,65% 93,10% 94,18% 85,82% Valor predictivo negativo 76,38% 93,70% 92,30% 78,14% Éxito total 77,55% 93,43% 93,12% 79,30% En el caso de incluir las variantes probablemente benignas y probablemente patogénicas, la menor sensibilidad sigue siendo dada por Spidex (34,31%) que, por el contrario, es el algoritmo con mayor especificidad (97.53%). Los valores predictivos positivos en este caso van desde el 85,65% (Spidex) al 94,18% (dbscSNV_RF). Los valores predictivos negativos son peores yendo del 76,38% (Spidex) al 93,70% (dbscSNV_Adaptative boost). Igual que en los casos anteriores los valores del éxito global también descienden, en el caso de la utilización de ambos algoritmos obtenemos un total de 220.915 variantes benignas y patogénicas correctamente asignadas frente a las 278.691 variantes estudiadas (79,3%). Tabla 9. Tabla con los valores de los dos algoritmos en ClinVar para variantes benignas, probablemente benignas, patogénicas y probablemente patogénicas RITA QUINTAS REY 102 5.2 APLICACIÓN EN VARIANTES DETECTADAS EN LA FPGMX Después de esas primeras validaciones hemos procedido a comprobar la utilidad de los algoritmos en muestras secuenciadas en la Fundación Pública Galega de Medicina Xenómica, para ello utilizamos las variantes encontradas en cualquier muestra secuenciada mediante secuenciación de nueva generación (NGS), un total de 22.099 muestras de las cuales 1.598 fueron exomas. En la Fundación Pública Galega de Medicina Xenómica existe un repositorio donde se registran todas las variantes detectadas en cualquier muestra procesada mediante secuenciación masiva. En marzo de 2021 se recopilaron todas las variantes encontradas hasta ese momento en exomas y se anotaron con esa fecha para poder acceder a una tabla con la información actualizada. De esa colección de variantes seleccionamos todas aquellas con score en alguno de los algoritmos a estudio (Spidex y dbscSNV) que tengan clasificación benigna, probablemente benigna, probablemente patogénica y/o patogénica en alguna de las bases de datos utilizadas (ClinVar, InterVar y Varsome). El número de variantes detectadas por ClinVar es menor que en InterVar y Varsome ya que no son bases de datos que recopilen información sobre variantes descritas si no que asignan una clasificación a cualquier variante anotada siguiendo los criterios ACMG-AMP. Todas las bases de datos anteriores clasifican las variantes en diferentes grupos de entre los que se seleccionan en primer lugar las variantes con clasificación benigna o patogénica para cualquiera de las bases de datos y posteriormente se realizan los mismos contajes teniendo en cuenta las variantes probablemente benignas y probablemente patogénicas. Se recopilaron un total de 3.244.336 variantes en las 22.099 muestras analizadas. Se seleccionaron todas las variantes intrónicas clasificadas como benignas, probablemente benignas, probablemente patogénicas y patogénicas en ClinVar, InterVar y/o Varsome que sean analizables por alguno de los algoritmos obteniendo un total de 397.812 variantes. Se realizaron contajes independientes en ClinVar, InterVar y Varsome teniendo en cuenta las variantes asignadas como patogénicas o benignas para los algoritmos Spidex y dbscSNV por separado y en conjunto. Se realizaron los cálculos estadísticos, teniendo en cuenta los Resultados 103 contajes de variantes patogénicas y benignas. Se calcularon los mismos parámetros incluyendo variantes probablemente patogénicas y probablemente benignas. Una vez recabados todos los datos se realizó un análisis estadístico para comprobar la sensibilidad, especificidad, éxito total, valor predictivo positivo y negativo para ambos algoritmos por separado y en conjunto. La tabla con los contajes para cada uno de los algoritmos en las diferentes bases de datos se puede consultar en la Tabla suplementaria 14. 5.2.1 Spidex Se realizan contajes separados en ClinVar, InterVar y Varsome teniendo en cuenta las variantes asignadas como patogénicas o benignas y variantes que incluyen las probablemente benignas y probablemente patogénicas. Para obtener el número de variantes que pueden ser analizadas se seleccionan de entre las 397.812 variantes las que tengan score en el algoritmo Spidex. Se seleccionan de entre todas las variantes asignadas por cualquiera de los dos algoritmos, las detectadas por el algoritmo Spidex en cada una de ellas y su correcta o incorrecta asignación en cada una de las bases de datos para la realización de los cálculos de valor predictivo positivo y negativo, especificidad, sensibilidad y éxito total. Patogénicas y benignas Se seleccionan en primer lugar las variantes benignas y patogénicas de la lista anterior que tienen una puntuación asignada por el algoritmo Spidex, los contajes de las variantes se encuentran en la Tabla suplementaria 14. ClinVar clasifica un total de 20.264 variantes como benignas o patogénicas de entre todas las variantes detectadas en las 22.099 muestras incluidas en este trabajo. De ellas Spidex puede analizar 20.040 (98,89%). ClinVar clasifica como benignas 19.612 y como patogénicas 428, de entre las benignas Spidex asigna una puntuación por debajo de |5| a 18.991 y patogénico a 621, de las 428 patogénicas RITA QUINTAS REY 104 193 son correctamente asignadas y 235 asignadas como benignas según Spidex. InterVar clasifica un total de 169.468 variantes benignas y patogénicas, Spidex asigna score a 168.612 de ellas (99,49%), InterVar clasifica 165.399 variantes benignas y 3.213 patogénicas, de las 165399 benignas Spidex clasifica como benignas 163.585 variantes mientras que 1.814 son clasificadas como patogénicas. 3.213 variantes patogénicas según InterVar de las cuales Spidex asigna score patogénico a 2.445 y benigno a 768. Varsome clasifica un total de 219.047 variantes patogénicas y benignas. Spidex asigna un escore a 217.795 de ellas (99,42%) de las cuales 212.309 son clasificadas por Varsome como benignas y 5.486 como patogénicas. De entre las benignas Spidex asigna score benigno a 209.671 y patogénico a 2.638. 5.486 variantes patogénicas según Varsome de las cuales Spidex asigna correctamente 3.962 y 1.524 no sobrepasan el umbral. Los contajes de Spidex para las variantes de la base de datos ClinVar, InterVar y Varsome pueden comprobarse en la Tabla suplementaria 14. Las tablas de contingencia realizadas a partir de los contajes de variantes anteriormente descritas que darán lugar a los resultados de la Tabla 10 pueden ser consultadas en Tabla suplementaria 15. ClinVar InterVar Varsome Sensibilidad 45,09% 76,10% 72,22% Especificidad 96,83% 98,90% 98,76% Valor predictivo positivo 23,71% 57,41% 60,03% Valor predictivo negativo 98,78% 99,53% 99,28% Éxito total 95,73% 98,47% 98,09% Como se puede observar en la tabla anterior todos los valores mejoran en InterVar y Varsome respecto a ClinVar. La mejor sensibilidad se da en InterVar con un 76,1%. La especificidad es buena en todas las bases de datos superando el 95% y siendo la mejor la de InterVar con un Tabla 10. Valores calculados para Spidex en variantes benignas y patogénicas para ClinVar, InterVar y Varsome Resultados 105 98,9%. El valor predictivo positivo no es bueno en ninguna de las bases de datos analizadas siendo en ClinVar de un 23,71%, en InterVar 57,41% y mejorando en Varsome hasta el 60,03%. El valor predictivo negativo es del 98,78% en ClinVar y supera el 99% en InterVar y Varsome. El éxito total en la clasificación de variantes por el algoritmo es de 95,73% en ClinVar y supera el 98% en ClinVar y Varsome. Patogénicas, probablemente patogénicas, probablemente benignas y benignas Se parte de una tabla de 397.812 variantes donde todas ellas tienen clasificación de benignas, probablemente benignas, probablemente patogénicas y/o patogénicas en alguna de las tres bases de datos seleccionadas. ClinVar clasifica un total de 33.480 variantes (benignas, probablemente benignas, probablemente patogénicas y patogénicas), Spidex puede analizar 33.096 (98,85%). ClinVar clasifica como benignas y/o probablemente benignas y/o probablemente benignas 28.962 y como patogénicas y/o probablemente patogénicas 4.134. De las clasificadas como benignas y/o probablemente benignas, Spidex asigna score correcto a 27.980 y patogénico a 982, de las 4134 variantes clasificadas por ClinVar como probablemente patogénicas y/o patogénicas 508 son correctamente asignadas y 3.626 asignadas como benignas según Spidex. InterVar clasifica un total de 213.025 variantes benignas, probablemente benignas, probablemente patogénicas y patogénicas con datos de score en alguno de los algoritmos, Spidex asigna una puntuación a 211.931 de ellas (99,49%), InterVar clasifica 207.757 de esas variantes como benignas y/o probablemente benignas. Spidex clasifica como benignas 204.623 variantes mientras que 3.134 son clasificadas como patogénicas. InterVar clasifica como patogénicas 4.174 variantes, Spidex asigna score patogénico a 2.535 y benigno a 1.639. Varsome clasifica un total de 384.005 variantes de las cuales 381.396 pueden ser analizadas por Spidex (99,32%). De entre ellas, Varsome clasifica 372.595 como benignas y/o probablemente benignas y 8.801 como patogénicas y/o probablemente patogénicas. De las RITA QUINTAS REY 112 ClinVar InterVar Varsome Sensibilidad 94,41% 97,58% 97,14% Especificidad 95,12% 96,05% 94,90% Valor predictivo positivo 46,94% 91,07% 88,99% Valor predictivo negativo 99,73% 98,97% 98,74% Éxito total 95,09% 96,50% 95,57% Los valores de dbscSNV_RF para variantes benignas mostrados en la tabla anterior muestran que los peores resultados en general se dan en ClinVar siendo la sensibilidad un 94,41% frente a un 97,58% en InterVar y un 97,14% en Varsome. La especificidad mejora de un 95,12% a un 96,05% en InterVar y desciende en Varsome a un 94,90%. El valor predictivo positivo en ClinVar es de un 46,94%, mejorando en InterVar hasta llegar al 91,07% y en Varsome es de un 88,99%%. El valor predictivo negativo es bueno en todas las bases de datos siendo en ClinVar el mejor con un 99,73%, en InterVar 98,97% y en Varsome 98,74%. El éxito total de la clasificación de dbscSNV_RF es de un 95,09% en ClinVar, 96,50% en InterVar y 95,57% en Varsome Tabla 14. Valores calculados para dbscSNV_RFscore para las variantes clasificadas como benignas y patogénicas en ClinVar, InterVar y Varsome. Resultados 113 5.2.2.2.2 Patogénicas, probablemente patogénicas, probablemente benignas y benignas Se seleccionan las variantes que tienen una puntuación asignada por el algoritmo dbscSNV_RandomForest. ClinVar clasifica un total de 33.480 variantes (benignas, probablemente benignas, probablemente patogénicas y patogénicas), dbscSNV_RF puede analizar 7.515 (22,44%). ClinVar clasifica como benignas y/o probablemente benignas 6.135 y como patogénicas 1.380. De las variantes clasificadas por ClinVar como benignas y/o probablemente benignas dbscSNV_RF asigna correctamente 5.810 y como patogénicas 325. De las 1380 variantes clasificadas por ClinVar como probablemente patogénicas y/o patogénicas 472 son correctamente asignadas y 908 son asignadas como benignas según dbscSNV_RF InterVar clasifica un total de 213.025 variantes benignas, probablemente benignas, probablemente patogénicas y patogénicas detectadas en alguno de los algoritmos, dbscSNV_RF asigna score a 13717 de ellas (6,44%). InterVar clasifica 10.789 de esas variantes como benignas y 2.928 patogénicas. De entre las variantes benignas y/o probablemente benignas el algoritmo dbscSNV_RF clasifica correctamente 10330 variantes como Tal, mientras que 459 son clasificadas como patogénicas. 2928 variantes patogénicas y/o probablemente patogénicas según InterVar de las cuales el algoritmo asigna score patogénico a 2842 y benigno a 86. Varsome clasifica un total de 384.005 variantes benignas, probablemente benignas, probablemente patogénicas y patogénicas. dbscSNV_RF asigna un escore a 31.049 de ellas (8,09%) de las cuales 24.551 son clasificadas por Varsome como benignas y 6.498 como patogénicas. De entre las benignas dbscSNV_RF asigna score benigno a 22.893 y patogénico a 1.658. Varsome clasifica como patogénicas 6.498 variantes de las cuales dbscSNV _RF asigna correctamente 5.838 y 660 no sobrepasan el umbral. Los contajes de dbscSNV_RF para variantes clasificadas como benignas, probablemente benignas, probablemente patogénicas y/o patogénicas según las bases de datos ClinVar, InterVar y Varsome pueden comprobarse en la Tabla suplementaria 14. Las tablas de RITA QUINTAS REY 114 contingencia realizadas a partir de los contajes explicados anteriormente y que dan lugar a los resultados de la Tabla 15 se encuentran en la Tabla suplementaria 20. ClinVar InterVar Varsome Sensibilidad 34,20% 97,06% 89,84% Especificidad 94,70% 95,75% 93,25% Valor predictivo positivo 59,22% 86,10% 77,88% Valor predictivo negativo 86,48% 99,17% 97,20% Éxito total 83,59% 96,03% 92,53% Como se puede observar en la Tabla 15, los valores de sensibilidad son de un 34,20% en ClinVar frente a un 97,07% en InterVar y un 89,84% en Varsome, así como la especificidad que mejora de un 94,70% a un 95,75% en InterVar y desciende en Varsome a un 93,25%. El valor predictivo positivo no es bueno en ninguna de las bases de datos analizadas siendo en ClinVar el peor con un 59,22% y mejorando en Varsome a un 77,88% y en InterVar hasta llegar al 86,10%. El valor predictivo negativo en ClinVar es de un 86,48% mejorando en Varsome a un 97,20% y en InterVar hasta el 99,17%. El éxito total del algoritmo dbscSNV_RF para la clasificación de variantes es de 83,59% en ClinVar, 96,03% en InterVar y 92,53% en Varsome. Tabla 15. Valores calculados para dbscSNV_RFscore para las variantes benignas, probablemente benignas, probablemente patogénicas y patogénicas para ClinVar, InterVar y Varsome Resultados 115 5.2.3 Spidex + dbscSNV Se seleccionan todas las variantes examinadas por cualquiera de las dos herramientas su correcta o incorrecta asignación en cada una de las bases de datos, para la realización de los cálculos de valor predictivo positivo y negativo, especificidad y sensibilidad. En el caso de la utilización de ambos algoritmos en conjunto consideramos patogénica cualquier variante con score patogénico en cualquiera de las 3 columnas de las herramientas (Spidex, dbscSNV_ADA y/o dbscSNV_RF) y benignas todas aquellas variantes que lo sean para todos los algoritmos. Se realizan contajes separados en ClinVar, InterVar y Varsome teniendo en cuenta las variantes correctamente asignadas como patogénicas o benignas en los algoritmos Spidex y dbscSNV. 5.2.3.1.1 Patogénicas y benignas Se seleccionan en primer lugar las variantes benignas y patogénicas de la lista anterior. Del total de 397.017 variantes, 392.017 son clasificadas como benignas o patogénicas en alguna de las tres bases de datos utilizadas. ClinVar clasifica un total de 20.264 variantes benignas y patogénicas. Clasifica como benignas 19.824 variantes y como patogénicas 440, de entre las benignas todos los algoritmos asignan un score por debajo del umbral a 19.017 y patogénico a 807, de las 440 variantes clasificadas por ClinVar como patogénicas 259 son correctamente asignadas y 181 fueron asignadas como benignas para todos los algoritmos. InterVar clasifica un total de 169.468 variantes benignas y patogénicas. 166.054 benignas y 3.414 patogénicas. Entre las benignas todos los algoritmos asignan correctamente 163.997 variantes mientras que 2.057 son clasificadas como patogénicas. De las 3.414 variantes clasificadas por InterVar como patogénicas 3.328 son correctamente asignadas y 86 son asignadas como benignas para todos los algoritmos. Varsome clasifica un total de 219.047 variantes benignas y patogénicas, 213.217 y 5.830 respectivamente. Ambas herramientas clasifican como benignas 210.119 de esas variantes benignas en Varsome y 3.098 asignadas incorrectamente como patogénicas. De RITA QUINTAS REY 116 entre las 5.830 patogénicas, 5388 son correctamente asignadas mientras que 442 son asignadas como benignas por los dos algoritmos. Los contajes de variantes examinadas por los dos algoritmos en conjunto y su asignación de scores para variantes clasificadas como benignas, probablemente benignas, probablemente patogénicas y/o patogénicas según las bases de datos ClinVar, InterVar y Varsome pueden ser comprobadas en la Tabla suplementaria 14. Las tablas de contingencia realizadas a partir de los contajes anteriormente explicados y que dan lugar a los resultados de la Tabla 16 se encuentran en la Tabla suplementaria 21. ClinVar InterVar Varsome Sensibilidad 58,86% 97,48% 92,42% Especificidad 95,93% 98,76% 98,55% Valor predictivo positivo 24,30% 61,80% 63,49% Valor predictivo negativo 99,06% 99,95% 99,79% Éxito total 95,12% 98,74% 98,38% Los valores resultantes del uso de ambos algoritmos en conjunto para variantes benignas y patogénicas se muestran en la tabla anterior. La sensibilidad en ClinVar es de 58,86% en Varsome 92,42 y de 97,48% en InterVar. La especificidad mejora de un 95,93% en ClinVar a un 98,55% y 98,76% en Varsome e InterVar respectivamente. El valor predictivo positivo no es bueno en ninguna de las bases de datos analizadas siendo en ClinVar de un 24,30%, mejorando en InterVar hasta un 61,80% y llegar en Varsome a un 63,49%. El valor predictivo negativo supera el 99% en todos los casos de datos siendo en ClinVar un 99,06, 99,79% en Varsome y 99,96% en InterVar. El éxito total resultante de la clasificación teniendo en cuenta ambos algoritmos es de un 95,12 en ClinVar, 98,74% en InterVar y un 98,38 en Varsome. Tabla 16. Valores calculados para el uso conjunto de Spidex, dbscSNV_RFscore y ADA score para variantes benignas, y patogénicas según ClinVar, InterVar y Varsome. Resultados 117 5.2.3.1.2 Patogénicas, probablemente patogénicas, probablemente benignas y benignas Se parte de la tabla de 397.812 variantes examinadas por alguno de los algoritmos con clasificación benigna, probablemente benigna, probablemente patogénica y/o patogénica en ClinVar, InterVar y/o Varsome. Al realizar los contajes con el uso conjunto de ambas herramientas el número de variantes asignadas en cualquiera de las 3 bases de datos será del 100%. ClinVar clasifica un total de 33.480 variantes, de ellas 29.284 como probablemente benignas y/o benignas y 4.196 como probablemente patogénicas y/o patogénicas. De entre las benignas y/o probablemente benignas, todos los algoritmos asignan un score por debajo del umbral a 28.006 y patogénico a 1.278. ClinVar clasifica como patogénicas 4.196 variantes, de las cuales 751 son correctamente asignadas y 3.445 asignadas como benignas para todos los algoritmos. InterVar clasifica un total de 213.025 variantes, 208.646 probablemente benignas y 4.379 probablemente patogénicas. Entre las variantes benignas y/o probablemente benignas todos los algoritmos asignan correctamente 205.098 variantes mientras que 3.548 son clasificadas como patogénicas. De las 4.379 variantes clasificadas por InterVar como probablemente patogénicas y/o patogénicas, 3.471 son correctamente asignadas y 908 son asignadas como benignas para todos los algoritmos. Varsome clasifica 384.005 variantes, 374.640 como benignas y/o probablemente benignas y 9.365 como patogénicas y/o probablemente patogénicas. Entre las probablemente benignas y/o benignas todos los algoritmos clasifican correctamente 366.770 e incorrectamente 7.870. De entre las patogénicas y /o probablemente patogénicas en Varsome, 9.365 son correctamente asignadas como patogénicas en alguno de los algoritmos 7.142 son correctamente asignadas, mientras que 2.223 son clasificadas como benignas. Los contajes de variantes examinadas por los dos algoritmos en conjunto y su asignación de scores para variantes clasificadas según ClinVar, InterVar y Varsome pueden ser comprobadas en la Tabla suplementaria 14. Las tablas de contingencia realizadas a partir de los RITA QUINTAS REY 118 contajes explicados anteriormente y que dan lugar a los resultados de la Tabla 17 se encuentran en la Tabla suplementaria 22. ClinVar InterVar Varsome Sensibilidad 17,90% 79,26% 76,26% Especificidad 95,64% 98,30% 97,90% Valor predictivo positivo 37,01% 49,45% 47,58% Valor predictivo negativo 89,05% 99,56% 99,40% Éxito total 85,89% 97,91% 97,37% Los valores de la utilización de ambos algoritmos en conjunto para variantes benignas, probablemente benignas, probablemente patogénicas y/o patogénicas, mejoran en InterVar y Varsome respecto a ClinVar. La sensibilidad en ClinVar es de un 17,90%, mejorando en Varsome a un 76,26% hasta alcanzar en InterVar un 79,26%. La Especificidad mejora de un 95,64% en ClinVar a un 98,30% en InterVar y en Varsome un 97,90%. El valor predictivo positivo es bajo en todos los casos, en ClinVar 37,01%, en Varsome 47,58% y un 49,45% en InterVar. El valor predictivo negativo es bueno siendo un 89,05% en ClinVar, 99,40% en Varsome y 99,56% en InterVar. El éxito total de la utilización de ambos algoritmos para la clasificación de variantes es de 85,89% en ClinVar, 97,91% en InterVar y 97,37% en Varsome. Tabla 17. Valores calculados para el uso conjunto de Spidex, dbscSNV_RFscore y ADA score para variantes benignas, probablemente benignas, probablemente patogénicas y patogénicas según ClinVar, InterVar y Varsome Resultados 119 5.3 PROPUESTA DE PROTOCOLO Como resultado final de la presente tesis doctoral, después de hacer una validación interna de las herramientas propuestas (Spidex y dbscSNV) y de aplicar las mismas, a las variantes detectadas en el laboratorio, concluimos que los cálculos de valores predictivos, especificidad, sensibilidad y éxito total son lo suficientemente buenos como para incluir dichas herramientas protocolo de filtrados para el análisis de exomas, que incluya las variantes de splicing. Por ello en primer lugar hemos fijado el umbral que clasifica a una variante como patogénica por los dos algoritmos. En el caso del dbscSNV serían todas aquellas con una puntuación mayor a 0,6 en cualquiera de los scores ADA o RF y para el Spidex todas aquellas con una puntuación superior a |5| en la columna Spidex.dpsi_Max_tissue. Ya que las guías de actuación de la ACMG proponen el uso de diferentes algoritmos utilizaremos ambos. Para ello consideramos patogénicas todas las variantes con una puntuación por encima del umbral para cualquiera de las tres columnas (Spidex.dpsi_Max_tissue mayor que |5| y dbscSNV_ADA/ dbscSNV_RF mayor a 0,6) y benignas a las que no sobrepasen el umbral en ninguna de ellas, de la misma manera que hicimos en todas las pruebas realizadas anteriormente. Lo más complicado a la hora de enfrentarnos a los resultados de un exoma para el diagnóstico de un paciente es la priorización de los miles de variantes obtenidas y la asignación de la relevancia clínica adecuada a cada una de ellas. Para incluir nuestras nuevas herramientas en el proceso diagnóstico el protocolo propuesto es el siguiente: • Crear un panel virtual con los genes asociados al fenotipo reportado por el clínico en el caso de conocerlo. • Seleccionar variantes con frecuencia poblacional menor a 1%. • Seleccionar variantes que no estén recogidas en la base de datos interna en más de 10 muestras (estima para patologías raras, el número es variable en función de las frecuencias en la base de datos). • Eliminación de variantes sinónimas. • Se mantienen variantes intrónicas. • De entre las variantes conservadas después de los filtrados o Se mantienen todas las variantes exónicas RITA QUINTAS REY 120 o Se seleccionan de entre las variantes intrónicas todas aquellas con score patogénico en alguno de los dos algoritmos. Con los resultados obtenidos (variantes exónicas no sinónimas con frecuencia poblacional menor al 1% y que no hayan aparecido en más de 10 muestras en nuestra base de datos interna y variantes intrónicas con una puntuación en los algoritmos Spidex y dbscSNV por encima del umbral), se verifican las variantes obtenidas en un visor genómico para comprobar si tienen una profundidad de lectura adecuada o descartar la posibilidad de artefactos en la secuenciación. El número de variantes que se mantengan después de la verificación serían las que pasarían al siguiente nivel de estudio: • Comprobar en diferentes bases de datos (ClinVar, InterVar, Varsome…) su clasificación y si han sido previamente reportadas. • Estudiar el fenotipo asociado a cada uno de los genes donde se localizan las variantes y observar su concordancia con el fenotipo del paciente. En el caso de que la variante sea de splicing y no haya sido previamente descrita con un análisis de la variante en ARN será necesario confirmar si realmente existe una alteración en el ARN mensajero. En todos los casos pertinentes se ha de solicitar un estudio de portadores para comprobar si la variante es heredada de alguno de los padres o es de novo. DISCUSIÓN RITA QUINTAS REY 128 coagulation factor database existen colecciones de variantes de diferentes genes relacionados con la hemofilia y otras patologías. Relacionadas con el gen F8 se cuentan 3052 variantes, de las cuales 209 están localizadas en regiones intrónicas, las herramientas Spidex y dbscSNV permiten analizar 198. Para la búsqueda de variantes benignas se seleccionan las descritas en dbSNP en regiones intrónicas del gen F8 obteniendo un total de 2020 variantes de un solo nucleótido localizadas en regiones intrónicas de las cuales los algoritmos pueden dar resultados para 1.916. Como se puede ver en la Figura 6, el número total de variantes recopiladas es de 2.229 SNVs no exónicas, de ellas 209 son patogénicas (recogidos e la base de datos de la EAHAD) y 2.020 benignas (seleccionados en dbSNP). De ambas bases de datos los algoritmos son capaces de asignar un score a 198 variantes patogénicas y 1.916 benignas lo que implica que es posible analizar 2.114 de 2.229 variantes (94,84%) con el empleo de estas herramientas. Spidex permite analizar 2.110 variantes (1.916 de dbSNP y 194 de la EAHAD) mientras que dbscSNV permite analizar 266 de las cuales solo 86 son de dbSNP y 180 de la EAHAD (11,93%). 11 de las variantes interpretadas por dbscSNV no han podido ser examinadas por Spidex, dichas variantes se encuentran en el primer exón o en el último y ya que Spidex asigna un score en función de la probabilidad de un exón de excluirse o no en 2229 2103 266 2114 0500 1000 1500 2000 2500 Variantes totales Spidex dbscSNV Spidex+dbscSNV Figura 6. Número de variantes examinadas para cada algoritmo respecto al total de variantes estudiadas en el gen F8. Discusión 129 el splicing necesita exones a ambos lados de la posición para realizar la detección. A simple vista en la Figura 7 parece que los valores calculados son alentadores. Spidex es el que tiene mayor especificidad con un 98,85%, lo que quiere decir que tiene una gran probabilidad de interpretar correctamente una variante no patogénica. También es buena la especificidad de dbscSNV que llega al 91% en Random Forest. Spidex también es el que mejor valor predictivo negativo tiene siendo este de un 96,23% y dbscSNV 86,52% en el caso de ADA_score. Sin embargo, la sensibilidad es el punto débil de este algoritmo Spidex que solo llega al 61,86% mientras que en dbscSNV es mayor del 93% en ADA_score y 91,67% en RF_score. El valor predictivo positivo también desciende en Spidex (84,51%) en relación al dbscSNV (94,92% y 95,93%). Aunque una mayor especificidad va de la mano a un alto valor predictivo negativo y una gran sensibilidad a un gran valor predictivo positivo, en este caso las diferencias de Spidex respecto a dbscSNV en el valor predictivo negativo se deben a que dbscSNV solo examina 86 variantes patogénicas y de ellas 79 (ADA) y 77 (RF) son 61,86% 98,85% 84,51% 96,23% 95,44% 93,33% 89,53% 94,92% 86,52% 92,11% 91,67% 91,86% 95,93% 84,04% 91,73% 87,37% 98,49% 85,64% 98,69% 97,45% SENSIBILIDAD ESPECIFICIDAD VAL OR PRED ICTIVO POSITIVO VALOR PREDICTIVO NEGATIVO ÉXITO GLOBAL SPIDEX dbscSNV ADA_SCORE dbscSNV RF_SCORE SPIDEX+dbscSNV Figura 7. Datos derivados de la validación de los algoritmos en el gen F8. RITA QUINTAS REY 130 correctamente asignadas, con lo que solo tendrían un 9-10% de falsos positivos. El problema es que dbscSNV solo puede asignar un score al 11,93% de las variantes recogidas en las bases de datos por lo que, aunque su información es fiable en cuanto a la detección de variantes patogénicas, la mayoría de las variantes no son posibles de estudiar mediante esta metodología de análisis. El éxito global calcula el porcentaje de acierto en la asignación de un score por parte de los algoritmos que se corresponda con la clasificación de la variante, ya sea benigna o patogénica. El éxito global es bueno para ambos algoritmos, 95,44% en Spidex y 92,11% y 91,734% para los dos algoritmos de dbscSNV (Ada y Random Forest). En la aplicación de ambos algoritmos en conjunto se obtiene una sensibilidad de 87,37%, especificidad de 98,49%, valor predictivo positivo 85,64% y valor negativo 98,69% y un éxito total de 97,45%, lo que quiere decir que menos de un 3% de las variantes detectadas se asignan incorrectamente 6.1.3 F9 El gen F9 codifica para una proteína que da lugar al factor IX sanguíneo. Variantes causales en este gen se asocian a hemofilia tipo B (OMIM#306900) o a trombofilia debido al factor X (OMIM#300807) ambos, desórdenes ligados al cromosoma X de herencia autosómica recesiva caracterizados, igual que en el caso anterior, por sangrados espontáneos y retraso en la cicatrización. La hemofilia tipo B se divide también en tres fenotipos dependiendo de la gravedad que se expresa en función de la actividad de coagulación del factor IX en los individuos. Severa cuando la actividad del factor IX es menor la 1%, moderada cuando se encuentra entre el 1% y el 5% y suave cuando es entre el 6% y el 40%190. El gen F9 se extiende 34Kb en el brazo largo del cromosoma X (Xq27), formado por 8 exones que producen un tránscrito de 2,8KB de las cuales 1,4 darán lugar a la proteína formada por 4 dominios, un Nterminal -ácido carboxiglutámico, 2 dominios similares al factor de crecimiento y un dominio c-terminal serina proteasa191. Para la selección de variantes causales se ha empleado la base de datos de la European Association for Haemophilia and Allied Disorders Discusión 131 (EAHAD, https://eahad.org). En la EAHAD coagulation factor database se encuentra una colección de 1.244 variantes causales detectadas en 4.713 casos estudiados, de las cuales 104 son variantes intrónicas de un solo nucleótido. Las variantes no causales se recogieron de la base de datos dbSNP en la que se seleccionaron 631 variantes intrónicas de un solo nucleótido. En este gen el número de variantes detectadas es menor ya que está compuesto solo por 8 exones mientras que CFTR y F8 tienen 27 y 26 exones respectivamente. Como se puede comprobar en la Figura 8 el número total de variantes recogidas en las dos bases de datos (Coagulation factor database y dbSNP) es de 735, 104 patogénicas y 531 benignas. De entre las 104 patogénicas ambos algoritmos en conjunto interpretan 92 (88,46%). Spidex puede examinar 81 (77,88%) y dbscSNV 83 (79,81%) en los genes anteriormente estudiados Spidex interpretaba más variantes que dbscSNV. Al estar compuesto solo por 9 exones el número de variantes patogénicas pertenecientes al exón 1 y 9 que no pueden ser recogidas por Spidex marcan la diferencia. El porcentaje de variantes asignadas por los algoritmos es menor que en genes anteriores por la misma razón. Las variantes benignas recogidas de dbSNP son 631, de las cuales 544 pueden ser analizadas por los algoritmos (86,21%). Spidex puede analizar 543 (87,01%) y dbscSNV 19 (3,04%) del total de variantes benignas. Dicho de otra manera, Spidex asigna 28,5 veces más 735 624 102 636 0200 400 600 800 Variantes totales Spidex dbscSNV Spidex+dbscSNV Figura 8. Número de variantes examinadas para cada algoritmo respecto a las variantes estudiadas en el gen F9. RITA QUINTAS REY 132 variantes benignas que dbscSNV. En el total de variantes asignadas por ambos algoritmos en conjunto, 636. Spidex detecta un 98,11% mientras que dbscSNV puede asignar una puntuación a un 16,03%. En la Figura 9 se muestran los valores calculados para la validación cuantitativa de cada algoritmo de forma individual y su uso en conjunto. En cuanto al uso individual de los algoritmos, Spidex es el que tiene mayor especificidad superando el 98%, lo que quiere decir que tiene una gran probabilidad de detectar correctamente una variante no patogénica, también es el que mejor valor predictivo negativo tiene siendo este de un 95,01%. Sin embargo, la sensibilidad es el punto débil de este algoritmo siendo en dbscSNV de 93,98% en ADA_score y 92,77% en RF_score y en Spidex 65,43% igual que en los genes anteriores (Figura 5 y Figura 7). El valor predictivo positivo también desciende en Spidex (84,13%) en relación al dbscSNV (98,73% y 98,72%). En cuanto al porcentaje de aciertos en la asignación de un score ya sea la variante benigna o patogénica (éxito total) ambas herramientas tienen valores muy similares en torno al 93-94%, hay que tener en cuenta que, aunque los valores son buenos, el número de variantes asignadas por Spidex es aproximadamente 6 veces mayor que 65.43% 98.16% 84.13% 95.01% 93.91% 93.98% 94.74% 98.73% 78.26% 94.12% 92.77% 94.74% 98.72% 75.00% 93.14% 86.96% 98.16% 88.89% 97.80% 96.54% SE N SI B I L I D A D E SP E C I F I C I D AD VA L O R P R E DI C T I VO P O SI T I VO VA L O R P R ED I C T I VO N E G A T I V O É X I TO G LOB A L SPIDEX dbscSNV ADA_SCORE dbscSNV RF_SCORE SPIDEX+dbscSNV Figura 9. Datos derivados de la validación de los algoritmos en el gen F9. Discusión 133 el de las asignadas por dbscSNV. En la aplicación de ambos algoritmos los valores son buenos con una sensibilidad de 86,96% ,especificidad de 98,16%, valor predictivo positivo de 88,89% y negativo de 97,80% y un valor de éxito total de 96,54%. Los valores obtenidos siguen la misma tendencia ya vista en genes anteriores y son parecidos a los resultados del gen F8, Spidex tiende a asignar variantes benignas y dbscSNV a asignar variantes patogénicas correctamente. Se han publicado estudios realizados sobre el gen F9 que han empleado herramientas in silico para la predicción de variantes de splicing. Aunque uno de ellos busca predecir alteraciones de splicing a partir de variantes exónicas utilizando herramientas in silico como MaxEntScan, SpliceSiteFinder, HumanSplicingFinder y NNSPLICE, no muestran los valores de sensibilidad ni especificidad para las herramientas utilizadas y por ello no se discuten los datos de dicho trabajo con los aquí mostrados192. Un segundo estudio de Meléndez-Aranda et al., 193 utiliza algoritmos de predicción para variantes exónicas como SIFT, Polyphen2, SNAP2, Mutation Assessor, Panther y PROVEAN. En este estudio los valores calculados de especificidad en ningún caso superaron el 26,4%, en este gen todos los algoritmos superan ese nivel de especificidad ya que el porcentaje más bajo es el dado por dbscSNV superando el 94%. En el estudio mencionado, calculan también la sensibilidad de los algoritmos siendo en este caso la mayor de 93,2% y la menor de 82,7%, en las dos herramientas validadas para nuestro estudio se han obtenido valores de sensibilidad en dbscSNV, para el score ADA, que superan a los anteriores, aunque en el caso de Spidex la sensibilidad se reduce a 65,4%. El uso de ambos algoritmos en conjunto proporciona una sensibilidad de 86,96%; si bien esta sensibilidad no es la esperada supera a alguno de los algoritmos del estudio anterior (Polyphen, PROVEAN y Panther)193. Calculan también el éxito total (accuracy) que representa el número de variantes correctamente detectadas para cada uno de los algoritmos ya sean benignas o patogénicas en el artículo: los valores van desde el 81,9% de PROVEAN al 90,2% para SIFT. Los valores de las herramientas Spidex y dbscSNV en conjunto en nuestro estudio han superado el 95% RITA QUINTAS REY 134 en los tres genes estudiados hasta ahora. Meléndez-Aranda et al193., consideran esta especificidad aceptable siempre que la sensibilidad sea alta ya que lo importante es detectar las variantes patogénicas. Sin embargo, una herramienta puede ser igual de útil si detecta perfectamente las variantes benignas ya que elimina un gran número de variantes sin interés diagnóstico y así reducir las variantes que potencialmente necesiten ser validadas para comprobar su patogenicidad. Además, un mayor éxito total de algoritmos como en nuestro caso nos permite confiar en un menor número de variantes mal asignadas ya sean benignas o patogénicas y en nuestro caso con la utilización de ambos algoritmos hay menos de un 5% de variantes incorrectamente clasificadas. Discusión 135 6.2 VALIDACIÓN EN CLINVAR Al comprobar la actuación de los algoritmos en tres genes individuales se observa un comportamiento similar en los genes CFTR, F8 y F9. Siendo Spidex el mejor algoritmo en términos de especificidad dbscSNV en sensibilidad. En el apartado anterior la validación de los algoritmos se realizaba en un set de variantes de tamaño reducido por lo que el siguiente paso es la validación en una colección mayor de variantes. Para ello se seleccionan las variantes recogidas en ClinVar, base de datos pública que recoge registros sobre la relación de las variaciones humanas y el fenotipo asociado a las mismas. ClinVar incluye muchas variantes, con diferentes estatus de veracidad. Entre ellas se encuentran variantes detectadas en diversos grupos consideradas en todos los casos con la misma clasificación que aportan criterios de confirmación, variantes detectadas solo una vez con criterios de confirmación, variantes con muchos suscriptores sin criterios de confirmación o variantes con clasificaciones diferentes en función de el suscriptor esto hace que la clasificación de variantes sea más o menos fiable en función del grupo en el que se encuentre194. La discordancia en la clasificación de variantes puede deberse en parte a artefactos de los propios algoritmos o también a que en ClinVar existen diferentes tipos de registros de variantes y no todos son igual de verídicos ni aportan la misma información, además existen numerosos estudios publicados en los que se rebate la clasificación de ClinVar en cuanto a variantes patogénicas195–199. Se decide separar las variantes a estudio en dos grupos (uno de mayor seguridad en la asignación, formado por variantes descritas estrictamente como patogénicas o benignas, y otro en el que se incluyen también las variantes probablemente patogénicas o benignas). Lo esperado en los datos es que se reduzcan los valores calculados en variantes probablemente patogénicas y probablemente benignas respecto a variantes benignas y patogénicas ya que al introducir variantes no seguras aumentamos el error del gold estándar utilizado por los algoritmos para comprobar la asignación de variantes según su clasificación en ClinVar. En primer lugar, se seleccionan las variantes intrónicas de un solo nucleótido con clasificación benigna y patogénica, según ClinVar, para RITA QUINTAS REY 136 su estudio. Los algoritmos permiten examinar un total de 99.048 variantes, 60.293 benignas y 38.755 patogénicas según la clasificación de ClinVar. Calculamos los valores de sensibilidad, especificidad, valor predictivo positivo y negativo y éxito total de Spidex y dbscSNV para comprobar la actuación de cada uno en esta colección de variantes. En la Figura 10 vemos que Spidex sigue siendo el algoritmo con mejor especificidad, 97,53%, con menos de un 3% de falsos positivos. dbscSNV tiene valores más bajos de especificidad, 92,43% y 93,88% para Ada_score y RF_score respectivamente. También se mantiene la tendencia en dbscSNV de ser el algoritmo con mejor sensibilidad con un valor para Ada_score de 94,84% y para Random Forest de 92,94% mientras que en Spidex solo es de 50,36%. Sigue teniendo también el valor predictivo positivo más alto siendo en el score Ada de 94,80% y en Random Forest 95,24%. La tendencia en los datos cambia en cuanto a los valores predictivos para el algoritmo Spidex, en los genes anteriores (Figura 5, Figura 7 y Figura 9) era el que demostraba un mejor comportamiento en cuanto a valor predictivo negativo, lo que no ocurre en este caso ya que es superado por la herramienta dbscSNV. Para variantes clasificadas según la base de datos ClinVar el valor predictivo negativo de Spidex va de la mano de la baja sensibilidad de este algoritmo. En este set de variantes Spidex asigna un score a un total de 38.285 variantes de 38.755 patogénicas detectadas por ClinVar y de ellas asigna como tal 19.281; por lo que 19.004, un 49,64%, son incorrectamente clasificadas, lo hace que la sensibilidad del algoritmo sea solo del 50,36%. Este mismo número de variantes detectadas incorrectamente es el que da lugar a un valor predictivo negativo tan bajo en comparación con el de los genes anteriores. Spidex tiene un gran valor predictivo positivo para este set de variantes, en comparación con las validaciones anteriores, 92,88%, mientras que en la validación en genes individuales nunca alcanzaba el 85%, esto puede deberse a la baja probabilidad de falsos positivos (menor de un 3%). Aunque exista una probabilidad de falsos negativos casi del 50% el número de variantes clasificadas como benignas por el algoritmo que realmente lo sean es elevado. El aumento de falsos negativos por parte de Spidex que lleva al descenso de la sensibilidad puede deberse a lo mencionado Discusión 137 previamente. Hay mucha literatura publicada sobre variantes incorrectamente descritas en ClinVar, la mayoría clasificadas como patogénicas que con el tiempo se han sido consideradas benignas o de significado incierto. De entre todas las variantes recogidas en ClinVar existen diferentes grados de fiabilidad en las cuales intervienen factores como el número de registros, el criterio para asignar una clasificación o paneles de expertos también influye el momento del registro, variantes registradas en 2014 como patogénicas pueden tener información nueva que las re-clasifique a día de hoy. En la utilización de la base de datos ClinVar como gold standard no se ha tenido en cuenta el tipo de estatus de revisión de las variantes y existen antecedentes que indican numerosos casos en los que variantes clasificadas como patogénicas en ClinVar no lo son realmente. En el artículo de Firth et al., 195 detectan 107 variantes clasificadas por ClinVar como patogénicas o probablemente patogénicas re-clasificadas como probablemente benignas. En otro estudio de Qing Zho & Zhiyu Peng se identifican de 217 variantes patogénicas o probablemente patogénicas en ClinVar de las cuales reclasificaron un 42%, un 2% como factores de riesgo y un 40% las reclasifican como probablemente benignas197. Un estudio de Amalio Telenti también reclasifica variantes detectadas por ClinVar de entre las cuales 855 variantes consideradas patogénicas o probablemente patogénicas pasan a ser de interpretación conflictiva en sus diferentes registros, 466 pasan a formar parte de variantes de significado incierto y 47 a ser benignas194. Todos los estudios anteriores no detectan el número total de variantes mal clasificadas en ClinVar ya que todos parten de una selección variantes previa, o bien no detectadas por otras bases de datos o seleccionadas a partir de genes relacionados con fenotipos de interés. En el estudio de Li et al., donde comparan las clasificaciones de InterVar y ClinVar llegan a la conclusión de que en el grupo de variantes benignas y/o probablemente benignas seleccionadas, la concordancia entre las dos bases de datos es de un 80,9%. Sin embargo, solo un 13,9% de las variantes patogénicas y/o probablemente patogénicas según ClinVar tienen la misma clasificación en InterVar18. Aunque Spidex tenga un 49,36% de falsos negativos si se comprueba el estatus de cada una de ellas este número se verá reducido RITA QUINTAS REY 144 6.3.2 InterVar InterVar (Clinical Interpretation of Genetic Variants) es una herramienta creada para automatizar, a partir de un archivo VCF o una tabla ya anotada, la clasificación de variantes según las guías creadas por la ACMG/AMP en 2015. Se asigna un valor a las variantes siguiendo 18 de los 28 criterios de ACMG/AMP para clasificarlas como benignas, probablemente benignas, significado incierto, probablemente patogénicas y patogénicas18 Esta herramienta es muy utilizada en laboratorio clínicos para mejorar la predicción de variantes. Se han seleccionado todas las variantes intrónicas con score en alguno de los dos algoritmos y con clasificación de benignas, probablemente benignas o probablemente patogénicas en InterVar obteniendo un total de 213025 variantes que se dividen en dos grupos, patogénicas y benignas y un segundo grupo que incluye las variantes probablemente patogénicas y probablemente benignas. Igual que en casos anteriores Spidex permite examinar un 99,49% para los dos grupos de variantes mientras que dbscSNV solo un 5,77% y 6,44%, lo que quiere decir que Spidex asigna entre 17 y 15 veces más variantes que el algoritmo dbscSNV en variantes clasificadas por InterVar. Los valores de la aplicación de los algoritmos en InterVar siguen la misma tendencia que anteriormente. La aplicación de ambos algoritmos en conjunto en el grupo de variantes benignas y patogénicas se observa una sensibilidad 97,48%, una especificidad de 98,76%, un valor predictivo positivo de 61,8%, negativo de 99,95% y un éxito total de 98,74% (Figura 14). En su aplicación a variantes probables, los valores descienden a 79,26%, 98,30%, 49,45%, 99,56% y 97,91% respectivamente (Figura 15). En los dos grupos Spidex es el que mejor especificidad tiene mientras que dbscSNV tiene la mayor sensibilidad, con un descenso en los porcentajes. En particular la sensibilidad de Spidex pasa a ser de solo el 60’63%. Lo que se corresponde también con lo hallado en el trabajo de Yauy et al., 202 en el que estudian diferentes herramientas entre las que se incluyen Spidex y dbscSNV comparándolas con MoBiDIC, herramienta de priorización. En los datos presentados Spidex también es el que presenta mejores valores de especificidad con un 94% y ADA score el de mayor sensibilidad con Discusión 145 un 99%, valores compatibles con los datos mostrados en la Figura 14 y Figura 15202. 76.10% 98.90% 57.41% 99.53% 98.47% 99.61% 94.56% 88.32% 99.83% 96.04% 97.58% 96.05% 91.07% 98.97% 96.50% 97.48% 98.76% 61.80% 99.95% 98.74% SE N SI B I L I D A D E SP E C I F I C I D AD VA L O R P RED I C TI V O P O S I TI V O VA L O R P RED I C TI V O N E G A T I V O É X I TO TOT A L SPIDEX dbscSNV ADA_SCORE dbscSNV RF_SCORE SPIDEX+dbscSNV Figura 14. Datos derivados de la aplicación de los algoritmos en variantes clasificadas en InterVar como benignas, y patogénicas. 60.73% 98.49% 44.72% 99.21% 96.04% 99.01% 94.39% 82.73% 99.72% 95.38% 97.06% 95.75% 86.10% 99.17% 96.03% 79.26% 98.30% 49.45% 99.56% 97.91% SE N SI B I L I D A D E SP E C I F I C I D AD VA L O R P R ED I C T I VO P O S I TI V O VA L O R P R ED I C T I VO N E G A T I V O É X I T O T O TA L SPIDEX dbscSNV ADA_SCORE dbscSNV RF_SCORE SPIDEX+dbscSNV Figura 15. Datos derivados de la aplicación de los algoritmos en variantes clasificadas por InterVar como benignas, probablemente benignas, probablemente patogénicas y patogénicas RITA QUINTAS REY 146 6.3.3 Varsome Varsome es una herramienta publicada en mayo de 2016 para la clasificación de variantes que incluye información de 30 bases de datos externas para dar una clasificación de variantes según las guías ACMG/AMP de 2015 y es posible su uso a partir de un archivo VCF18. Se seleccionaron las variantes intrónicas con score para alguno de los algoritmos que no hayan sido clasificadas como de significado incierto en Varsome, un total de 384.005 variantes. Este número es superior a las detectadas por InterVar. Aunque las dos asignen una clasificación a todas las variantes detectadas, Varsome contiene los 28 criterios de clasificación de la ACMG/AMP mientras que InterVar solo 18 por lo que habrá un mayor número de variantes de significado incierto que no se clasifican en el estudio. Como en los casos anteriores dividimos estas variantes en dos grupos: 1) variantes patogénicas y benignas y 2) variantes que además incluyen las probablemente patogénicas y probablemente benignas. Spidex permite examinar más del 99% en los dos casos mientras que dbscSNV el 6,89% 8,09% respectivamente, por lo que igual que en el caso anterior Spidex interpreta 14,29 y 12,28 veces más variantes que dbscSNV. Los valores resultantes de la aplicación de los algoritmos a variantes clasificadas por la base de datos Varsome son muy similares a los encontrados en InterVar. Con la aplicación de ambos algoritmos en conjunto se consigue una especificidad de 92,42%, una sensibilidad de 98,55%, valor predictivo positivo 63,43%, valor predictivo negativo de 99,79% y éxito total de 98,38% (Figura 16). Al añadir las variantes probablemente benignas y probablemente patogénicas los valores descienden hasta ser 79,26%, 98,30%, 47,58%, 99,4% y 97,37% respectivamente (Figura 17) Igual que en casos anteriores el algoritmo Spidex presenta la mejor especificidad y dbscSNV la mejor sensibilidad lo mismo que encontraron en el estudio anteriormente citado de Yauy et al202. Cabría pensar que los valores de dbscSNV mejorarían en Varsome respecto a otras plataformas de clasificación de variantes ya que utiliza este algoritmo para la predicción de variantes en sitios de splicing, pero adapta los valores siendo el umbral para ADABoost de 0,708 y para Discusión 147 Random Forest de 0,515 mientras nosotros seguimos el umbral marcado por los creadores del algoritmo de 0,6. 72.22% 98.76% 60.03% 99.28% 98.09% 99.14% 93.35% 86.35% 99.61% 95.07% 97.14% 94.90% 88.99% 98.74% 95.57% 92.42% 98.55% 63.49% 99.79% 98.38% SE N SI B I L I D A D E S P E C I F I C I DA D VA LO R P R ED I C T I VO P O S I TI V O VA L O R P R ED I C T I VO N E G A T I V O É X I TO G LOB A L SPIDEX dbscSNV ADA_SCORE dbscSNV RF_SCORE SPIDEX+dbscSNV Figura 16. Datos derivados de la aplicación de los algoritmos en variantes clasificadas por Varsome como benignas, y patogénicas. 50.56% 98.25% 40.61% 98.83% 97.15% 92.80% 91.68% 74.69% 97.96% 91.91% 89.84% 93.25% 77.88% 97.20% 92.53% 76.26% 97.90% 47.58% 99.40% 97.37% SE N SI B I L I DA D E SP EC I F I C I DA D VA L O R P R ED I C T I VO P O S I TI V O VA L O R P R ED I C T I VO N E G A T I V O É X I TO G L O B A L SPIDEX dbscSNV ADA_SCORE dbscSNV RF_SCORE SPIDEX+dbscSNV Figura 17. Datos derivados de la aplicación de los algoritmos en variantes clasificadas en Varsome como benignas, y patogénicas RITA QUINTAS REY 148 Los valores mostrados en los gráficos previos nos dan una idea del funcionamiento de los algoritmos en la rutina. Se puede comprobar que en todos los casos Spidex es el que mayor especificidad tiene y dbscSNV, en concreto el Ada score, el que mejor sensibilidad y que la aplicación de ambos algoritmos en conjunto supera la mayoría de los estudios realizados hasta ahora. Se han realizado numerosas comparaciones entre algoritmos de detección de variantes que afectan al splicing, pero únicamente encontramos dos artículos que contengan las dos herramientas estudiadas en nuestro trabajo. El de Yauy et al202, previamente citado, donde pretenden crear una herramienta de priorización de variantes y para ello llevan a cabo una comparativa de algoritmos de splicing utilizando entre ellos Spidex y dbscSNV. Al comparar los algoritmos por separado en 190 variantes patogénicas de splicing y 3.441 benignas llegan a la conclusión de que la mayor sensibilidad se obtiene con el score Adaptative boost igual que en todas nuestras validaciones y comparaciones y que la mejor especificidad es la de Spidex con un 94%. Aunque los valores difieran al tratarse de un estudio de menos de 4000 variantes y aquí ser aplicados estos mismos algoritmos a cientos de miles, los valores son similares. En todos los casos de variantes patogénicas y benignas la puntuación de Ada es de 87,21% en ClinVar y superior al 99% en InterVar y Varsome. En cambio, la especificidad de Spidex siempre es mejor superando el 98% en las variantes clasificadas por InterVar (Figura 14) y Varsome (Figura 16) y un 96,83% para ClinVar (Figura 12). Todos los datos mostrados son similares al del estudio realizado por Yauy et al202. El artículo de Lord et al., de 2019115realiza un estudio comparativo de dos herramientas nuevas basadas en machine learning (Spidex149 y dbscSNV140) frente al algoritmo más utilizado hasta el momento, MaxEntScan133 (MES). Observan un valor predictivo positivo del 90% aproximadamente para sitios de splicing 5’ y 3’ lo que se semeja a los datos mostrados por dbscSNV en variantes de InterVar y Varsome. Los valores de Spidex mostrados en nuestro estudio son menores porque no se ha tenido en cuenta solo variantes localizadas en sitios de splicing 5’ y 3’ y Spidex detecta variantes hasta a 300 bases de los exones115. Discusión 149 Tang et al.,203 comparan en términos de sensibilidad y especificidad y éxito total los algoritmos ASSP, HSF131, NNSplice134 y MES133 en 2202 variantes patogénicas y 50 benignas localizadas en sitios de splicing; la mejor sensibilidad es de 83,6% (MES) y la peor de 75,9% (NNSpice), el mejor éxito total es el de la herramienta MES que se aproxima al 100203. En nuestro estudio en todos los casos la sensibilidad de dbscSNV ha superado el 90% y la especificidad de Spidex el 95%. El éxito total del uso de ambos algoritmos siempre ha superado el 95% al comparar variantes benignas y patogénicas (Figura 12, Figura 14 y Figura 16). Tubeuf et al. (2020)204, realizan un estudio de diferentes herramientas para la predicción de elementos reguladores del splicing. Comprueban la actuación de los algoritmos QUEPASA205, SPANR (Spidex)158, HEXplorer143 y HAL161 en variantes exónicas. Observan una actuación similar a lo que obtenemos en nuestro estudio, resaltan también la alta especificidad frente a una peor sensibilidad por parte de Spidex como se puede ver en los datos mostrados en los gráficos anteriores (Figura 14, Figura 15, Figura 16 y Figura 17). La conclusión es que Spidex y HAL son los mejores algoritmos para predecir variaciones que afectan a elementos reguladores que provocan el salto del exón adyacente. También observan una mejor clasificación por parte de estas herramientas para variantes no casuales, Valores consistentes con los mostrados en nuestro trabajo. Finalmente eliminan el algoritmo Spidex de sus predicciones por tener una ratio de valores perdidos superior al 50%, inconsistente con lo mostrado en nuestros conjuntos de datos donde Spidex siempre detecta más del 99% de las variantes analizadas. También hay contradicción entre los valores de éxito total mostrados en el estudio de Tubeuf y los nuestros para el algoritmo Spidex, que no superan el 75% en aquel mientras que en el nuestro siempre supera el 90%. La inconsistencia de estos valores puede ser debida a que en nuestro estudio solo se analizan variantes intrónicas por lo que no tenemos datos para contrastar la actuación del algoritmo en regiones exónicas204. Houdayer et al.,123 en un estudio realizado en 2012, comparan la actuación de los algoritmos MaxEntScan (MES) y SpliceSiteFinder (SSF,descatalogado) y su uso conjunto en 327 variantes de significado RITA QUINTAS REY 150 incierto de los genes BRCA1 y BRCA2 obteniendo una sensibilidad de 96% y especificidad del 74% para el MES y un 91% y 87% para el SSF y en su uso conjunto se mantiene una sensibilidad del 96% y especificidad total de 83%123.En cuanto a los algoritmos de forma individual, Spidex nunca alcanza la sensibilidad a la que llegan estos algoritmos en ninguna de las bases de datos utilizadas (variantes benignas y patogénicas 45% en ClinVar (Figura 12), 76’6% en InterVar (Figura 14) y 72,22% en Varsome (Error! Reference source not found.16) y para variantes probablemente benignas y patogénicas los datos descienden a 12,29%, 60,73% y 50,56% respectivamente) pero mejora la especificidad en todas ellas teniendo en cuenta las variantes seguras y no seguras siendo su mínima especificidad de 95,64% en ClinVar (Figura 13) para variantes que incluyen las probablemente patogénicas y benignas. El caso de dbscSNV es diferente, en todas las bases de datos supera el 96% en la clasificación de variantes benignas o patogénicas, desciende para variantes “no seguras” donde en ClinVar llega a ser tan solo del 35% mientras que en InterVar y Varsome supera 97% y el 90%. En cuanto al uso de ambos algoritmos en conjunto, en todos los casos se supera el 95% de especificidad y en el caso de variantes benignas y patogénicas para InterVar y Varsome la sensibilidad es del 97,48% y 92,42%, en ClinVar sin embargo no alcanza el 60%. La sensibilidad disminuye teniendo en cuenta variantes probablemente patogénicas y probablemente benignas a un 17,9% en ClinVar, un 79,26% en InterVar y un 76,26% en Varsome. La sensibilidad es menor en nuestros algoritmos en comparación con lo reportado por Houdayer et al.,123 que seleccionaron las variantes de significado incierto, comprobaron su clasificación según los algoritmos y comprobaron en el laboratorio cada una de ellas. En nuestro caso es imposible comprobar los cientos de miles de variantes disponibles por lo que nos impide conocer su verdadera clasificación. Discusión 151 6.4 APLICABILIDAD CLÍNICA Este trabajo se ha centrado en la detección de variantes intrónicas implicadas en el proceso de splicing para mejorar el rendimiento diagnostico de los exomas y aumentar el porcentaje de pacientes diagnosticados, por ello el resultado final de esta tesis doctoral es un protocolo de filtrados que incluya las herramientas estudiadas y así poder ser aplicado a la páctica clínica. Cuando se aborda el análisis de un exoma, el protocolo normal de filtrados es:1) crear un panel de genes relacionados con el fenotipo del paciente, si procede, 2) eliminar variantes con una frecuencia poblacional mayor a la esperada por el fenotipo (normalmente se eliminan todas las variantes con una frecuencia mayor al 1%), 3) eliminar las variantes sinónimas y 4) seleccionar las variantes exónicas y de splicing. Realizando este tipo de priorización se pierden variantes intrónicas y sinónimas que podrían explicar en algunos casos el fenotipo del paciente. Normalmente los resultados del calling de variantes consideran de splicing aquellas variantes localizadas en las últimas dos bases del exón y hasta 5 bases intrónicas. Sin embargo, tal y como hemos explicado a lo largo de este trabajo, variantes intrónicas y exónicas pueden estar implicadas en el proceso de splicing por lo que eliminando variantes intrónicas podemos perder información de variantes realmente relevantes para el fenotipo del paciente. La utilización de algoritmos in silico especializados en la detección de alteraciones en el splicing podría aumentar el número de variantes incluidas en la priorización y mejorar su predicción. Como hemos mostrado cabe esperar un mayor rendimiento de los datos obtenidos de la secuenciación del exoma si implementamos, tal y como proponemos, un protocolo de filtrados incluyendo en la anotación de variantes los resultados de los dos algoritmos de detección de alteraciones en el splicing aquí estudiados, dbscSNV y Spidex. Este protocolo modificado se ha empleado para reanalizar casos no diagnosticados previamente o con resultados no concluyentes. Aunque el reanálisis de casos secuenciados se está contemplando ya como una actividad rutinaria en los laboratorios, normalmente se realiza cuando surgen nuevos datos fenotípicos que ayuden a caracterizar mejor la enfermedad y consiguientemente a seleccionar mejor el gen o genes a RITA QUINTAS REY 152 analizar. Igualmente, con el transcurso del tiempo se obtiene más información que puede permitir una mejor anotación de las variantes. La incorporación de nuevos métodos de análisis sería una razón más para plantear un reanálisis. Para comprobar si la implementación en la rutina de las herramientas estudiadas en este trabajo rescata pacientes no diagnosticados en nuestro centro recogemos todas las variantes intrónicas detectadas en los pacientes de la Fundación y las anotamos el 10 de marzo de 2020 incluyendo la información de los dos algoritmos seleccionados, Spidex y dbscSNV. De estas variantes, seleccionamos todas aquellas con score patogénico para cualquiera de los dos algoritmos seleccionados. Realizamos un filtrado, en el que se eligen las variantes únicas, es decir con frecuencia igual a 0, que no hayan aparecido en más de una muestra y cuyos genes tengan fenotipo descrito en GeneReviews. Siguiendo estos criterios se detectaron un total de 803 variantes en 307 pacientes. Se comprobó cada una en un visor genómico (IGV) y se estudió la posible relación genotipo-fenotipo. Todas aquellas variantes que se encuentren en genes asociados a enfermedades que coincidan con el fenotipo del paciente, tras consultar con los clínicos, fueron estudiadas más extensamente, incluyendo el análisis de portadores de los progenitores. Este trabajo sigue en curso, presentamos aquí algunos casos como ejemplos de uso y sus resultados y conclusiones. 6.4.1 Paciente 1 Paciente mujer de diez años con alteración de la postura y en la deambulación, con alteración en el tono muscular, gira el pie derecho hacia dentro al caminar. Posteriormente desarrolla paraparesia espástica, macrocefalia que también tiene le padre, hipotonía bucofonatoria sin alteración intelectual de ningún tipo. En el exoma se detectan 50292 variantes de las cuales 1756 tienen una frecuencia poblacional menor al 1%. Al seleccionar variantes que no hayan aparecido en más de 10 pacientes secuenciados en el laboratorio se mantienen 1452, entre las que ninguna es exónica y significativa para el diagnostico, de las cuales intrónicas o de splicing son 764 y de esas intrónicas, variantes de un solo nucleótido son 243 de los cuales Discusión 153 asociados a genes relacionados con alguna enfermedad en OMIM son 78. Sólo 2 tienen score patogénico en alguno de los dos algoritmos: NM_020919.4(ALS2):c.3624+5G>T en homocigosis y la variante NM_014339.7(IL17RA):c.139-1G>A en heterocigosis. La herencia descrita en ambos genes es autosómica recesiva. Se elimina la variante en el gen IL17RA ya que codifica para el receptor A de la interleucina 17, asociado a la inmunodeficiencia tipo 57 (OMIM#613953), que además de no tener relación con el fenotipo de la paciente, al estar en heterocigosis y ser de herencia autosómica recesiva no sería suficiente para provocar la enfermedad. Se propone el causa del fenotipo descrito de la paciente. Gen Variante Spidex dpsi dbscSNV Max_tissue Zscore ADA_score RF_score ALS2 NM_020919.4: exon22:c.3624+5G>T -28,6902 -3,339 0,9999 0,918 La variante se encuentra en homocigosis con una profundidad de lectura de 178 (G=89 y A=89). La cobertura a más de 30X para el gen es de 100% con una profundidad media de 176X. Gen ALS2 El gen ALS2 se encuentra en el brazo largo del cromosoma 2 (2q33) y está compuesto por 34 exones. Existen dos tránscritos asociados a este gen, uno corto de 2.6Kb que da lugar a un polipéptido funcional y otro más largo de 5,5Kb que da lugar a una proteína de 184KD llamada Alsina que tiene tres dominios GEF un N terminal regulador de la condensación de cromatina (RCC1), uno central homólogo a Db1 y Pleckstrina y un C terminal “vacuolar sorting” (VPS9)206,207. No se conoce todavía por que variantes en el mismo dominio dan lugar a fenotipos diferentes o por que el mismo fenotipo puede deberse a variantes en dominios distintos208. El gen ALS2 está asociado a 3 fenotipos de herencia autosómica recesiva, Esclerosis lateral amiotrófica juvenil (OMIM#205100), Tabla 18. Score de los algoritmos de splicing para la variante estudiada en la paciente 1