Sistema de evaluación de variantes genéticas
Abstract
Máster Universitario en Sistemas Inteligentes y Aplicaciones Numéricas en Ingeniería (SIANI)
Full text
UNIVERSIDAD DE LAS PALMAS DE GRAN CANARIA M´aster Oficial en Sistemas Inteligentes y Aplicaciones Num´ericas en Ingenier´ıa Trabajo Final de M´aster Sistema de evaluaci´on de variantes gen´eticas Pascual Lorente Arencibia Tutores Jos´e Juan Hern´andez Cabrera Antonio Tugores Cester 11 de enero de 2016
Agradecimentos Quiero agradecer a los tutores Antonio Tugores Cester y Jos´e Juan Hern´andez Cabrera su ayuda en todo el proceso de este Trabajo. Gracias a los profesores del m´aster. Me han ense˜nado algo m´as que el contenido de los proyectos docentes. Gracias a los compa˜neros de la UICHUMI y del M´aster SIANI. El trabajo siempre se hacer mejor en compa˜n´ıa. Gracias a mi familia por darme un respiro lejos del trabajo. Gracias a Naira, por aguantarme y apoyarme incondicionalmente.
Resumen Las variantes gen´eticas individuales pueden determinar la presencia de enfermedades gen´eticas de etiolog´ıa desconocida y su conocimiento puede ayudar a hacer un diagn´ostico precoz e incluso mejorar el tratamiento. La secuenciaci´on masiva de exoma (NGS), permite conocer un gran n´umero de variantes por paciente como aproximaci´on sin hip´otesis. Para establecer una relaci´on entre una variante y una patolog´ıa hay que evaluar las caracter´ısticas de cada variante y las interacciones que hay entre los genes relacionados con ambas. En este trabajo presentamos un programa inform´atico que eval´ua cada variante y otorga una puntuaci´on a cada gen afectado seg´un sus interacciones y su distancia al fenotipo seleccionado para facilitar la tarea de selecci´on de variantes candidatas.
´ Indice general 1. Introducci´on 1 1.1. Motivaci´on .............................. 1 1.2. Objetivos ............................... 2 1.3. Estructura del ADN ......................... 2 1.4. Variantes gen´eticas .......................... 4 1.5. Tecnolog´ıas de secuenciaci´on .................... 5 1.6. Funciones de los genes ........................ 7 1.7. Software actual ............................ 8 1.7.1. Phenotype Based Gene Analyzer .............. 8 1.7.2. Search Tool for the Retrieval of Interacting Genes/Proteins 9 1.7.3. Sorting Intolerant From Tolerant .............. 10 1.7.4. Polymorphism Phenotyping ................. 10 1.7.5. Variant Effect Predictor ................... 11 2. Estado del arte 12 2.1. Big Data ................................ 12 VI
Pascual Lorente Arencibia ´ INDICE GENERAL 2.2. Business Intelligence ......................... 15 2.3. Inteligencia Artificial ......................... 15 2.4. Interfaz de usuario .......................... 16 3. Desarrollo 19 3.1. Justificaci´on del proyecto ...................... 19 3.2. Recursos ................................ 19 3.3. Data warehouse ............................ 21 3.3.1. HUGO Gene Nomenclature Comitee ............ 21 3.3.2. Online Mendelian Inheritance in Man ........... 22 3.3.3. Human Protein Reference Database ............ 22 3.3.4. Biological General Repository for Interaction Datasets . . 23 3.3.5. Mentha ............................ 23 3.3.6. The Human Protein Atlas .................. 23 3.4. Evaluaci´on de variantes ....................... 23 3.5. Entrada de datos ........................... 26 3.6. Interfaz de usuario .......................... 27 3.6.1. Pantalla de fenotipos ..................... 27 3.6.2. Pantalla de genes ....................... 27 4. Resultados 29 5. Conclusiones 32 5.1. Trabajo futuro ............................ 33 SIANI — ULPGC VII
Pascual Lorente Arencibia ´ INDICE GENERAL A. Obtenci´on de variantes 34 B. Variant Call Format 37 C. Estructura de Poirot 39 D. Consecuencias 41 E. Interacciones 44 SIANI — ULPGC VIII
Pascual Lorente Arencibia CAP´ ITULO 1. INTRODUCCI´ ON Cod´on amino´acido TTT F TCT S TAT Y TGT C TTC F TCC S TAC Y TGC C TTA L TCA S TAA stop TGA stop TTG L TCG S TAG stop TGG W CTT L CCT P CAT H CGT R CTC L CCC P CAC H CGC R CTA L CCA P CAA Q CGA R CTG L CCG P CAG Q CGG R ATT I ACT T AAT N AGT S ATC I ACC T AAC N AGC S ATA I ACA T AAA K AGA N ATG M/start ACG T AAG K AGG N GTT V GCT A GAT D GGT G GTC V GCC A GAC D GGC G GTA V GCA A GAA E GGA G GTG V GCG A GAG W GGG G Tabla 1.1: Tabla de codones. 64 codones codifican 20 amino´acidos y un cod´on de parada. La Metionina funciona tambi´en como cod´on de inicio. Los nombres de los amino´acidos pueden versen en la tabla 1.2. A Alanina C Ciste´ına D ´ Acido asp´artico E´ Acido glut´amico F Fenilalanina G Glicina H Histidina I Isoleucina K Lisina L Leucina M Metionina N Asparagina P Prolina Q Glutamina R Arginina S Serina T Treonina V Valina W Tript´ofano Y Tirosina start Cod´on de inicio stop Cod´on de parada Tabla 1.2: C´odigos de los amino´acidos 1.4. Variantes gen´eticas El 99,99 % del ADN es igual en todos los seres humanos. El 0.01 % restante es lo que hace que seamos diferentes. Estas diferencias son conocidas como variantes y pueden ocurrir en cualquier punto del genoma. Si una variante est´a SIANI — ULPGC 4
Pascual Lorente Arencibia CAP´ ITULO 1. INTRODUCCI´ ON presente en un gen o en sus alrededores, puede producir cambios en la prote´ına generada. Cuando el cambio en la prote´ına tiene efectos negativos sobre el ser humano –una patolog´ıa– se etiqueta como mutaci´on y si el efecto es positivo se denomina ventaja. Las variantes se clasifican seg´un su tama˜no –peque˜nas si tienen menos de 1000 pares de bases y grandes si tienen m´as– y seg´un su morfolog´ıa[3]. Dentro de las variantes peque˜nas encontramos: Single Nucleotide Polymorphism (SNP) Una base es sustituida por otra, sin alterar el tama˜no de la cadena. Como un cod´on es definido por tres bases, es posible que el nuevo cod´on siga codificando el mismo amino´acido –variante sin´onima–, o que haya un cambio en la secuencia de una prote´ına –no sin´onima–. Insertion/Deletion (Indel) Una o varias bases son insertadas o eliminadas de un punto concreto de la cadena. Dependiendo de si la InDel es m´ultiplo de 3, o de la posici´on en el gen en que se encuentra, puede modificar dr´asticamente la prote´ına resultante al alterar la pauta de lectura. Las variantes grandes pueden ser: Copy Number Variation (CNV) Una alteraci´on en el n´umero de veces que aparece un fragmento en el ADN. Puede no estar ninguna vez, o estar dos o m´as veces consecutivas. Translocation Un fragmento de un cromosoma se desplaza de posici´on, en el mismo o en otro cromosoma. Inversion Un fragmento de un cromosoma aparece en la misma posici´on, pero sus bases est´an en orden inverso. 1.5. Tecnolog´ıas de secuenciaci´on Para encontrar las variantes del genoma de una persona, hay que secuenciar su material gen´etico. La secuenciaci´on es el proceso de lectura de la bases nitrogenadas de una cadena de ADN o ARN. Hoy en d´ıa se utilizan dos estrategias: secuenciar poco con mucha calidad o secuenciar mucho con poca calidad. Sanger[4]En 1977, este bioqu´ımico desarroll´o un m´etodo que permit´ıa secuenSIANI — ULPGC 5
Pascual Lorente Arencibia CAP´ ITULO 1. INTRODUCCI´ ON ciar unos cientos de pares de bases (300–1000) en una posici´on determinada. Para ello, se sintetizan dos cadenas artificiales de ADN –cebadores– de unas 17-25 bases de longitud que coinciden con el inicio y el fin del fragmento que se desea secuenciar. Estos cebadores son necesarios para que una polimerasa de ADN copie las cadenas complementarias y termine, aleatoriamente, en posiciones A,C,T o G. Ello se consigue al introducir dideoxinucle´otidos (ddATP, ddGTP, ddCTP, ddTTP) que no permiten elongar la cadena m´as all´a del punto donde se incorporan. Los fragmentos resultantes se separan mediante electrof´eresis en acilamida, detect´andose mediante un sistema radiactivo o fluorescente para cada ddNTP. El resultado es una imagen o gr´afica donde es posible leer la secuencia. Figura 1.2: Secuenciaci´on usando el m´etodo de Sanger. Imagen de Abizar via Wikimedia Commons. Este m´etodo es ideal para variantes conocidas y es el que se utiliza actualmente para el diagn´ostico cl´ınico de enfermedades gen´eticas. Next Generation Sequencing (NGS) No hace referencia a una sola tecnolog´ıa, sino a muchas que han surgido a ra´ız de las mejoras en computaci´on del siglo XXI[5]. El objetivo de la secuenciaci´on de nueva generaci´on es determinar la secuencia de la mayor parte del genoma o el exoma de un individuo. Para ello se fragmenta el ADN en cientos de miles de trozos, shotgun sequencing, que son asociados a una serie de adaptadores predefinidos. Estos SIANI — ULPGC 6
Pascual Lorente Arencibia CAP´ ITULO 1. INTRODUCCI´ ON adaptadores capturan muy bien peque˜nos fragmentos de ADN de entre 40 y 200 pares de bases. Despu´es, estos adaptadores, con los fragmentos de ADN, se escanean por fluorescencia. La m´aquina muestra como resultado decenas de millones de secuencias de entre 40 y 200 pares de bases, sin especificar su posici´on en el ADN. Posteriormente, un ordenador tendr´a que alinear estas secuencias como si montara un puzzle. Si se conoce el genoma de la especie, entonces habr´a una referencia con la que alinear. Si no se conoce, el ADN se reconstruir´a comparando los fragmentos entre s´ı –secuenciaci´on de novo. El alineamiento a˜nade incertidumbres al exoma o genoma secuenciado, porque una cadena puede estar alineada con dos o m´as regiones del ADN, y porque se permite un cierto grado de libertad para que se alineen las secuencias que contienen variantes. Adem´as, los fragmentos son demasiado peque˜nos como para detectar variantes grandes. El proceso computacional de alineamiento y b´usqueda de variantes se detalla en el ap´endice A. El NGS se est´a extendiendo cada vez m´as gracias al abaratamiento de los costes de secuenciaci´on –un exoma humano cuesta alrededor de $1000– y al aumento de las prestaciones computacionales. Sin embargo, la secuenciaci´on por Sanger sigue siendo necesaria para el diagn´ostico de enfermedades gen´eticas conocidas y la confirmaci´on de las variantes determinadas por NGS. La secuenciaci´on masiva de exoma permite realizar estudios sin hip´otesis previa en la zona cuyo significado biol´ogico conocemos[6,7]. Esta estrategia ha sido utilizada con ´exito en algunas pruebas diagn´ostico, siendo capaz de identificar variantes asociadas en, aproximadamente, el 25 % de los pacientes[8, 9,10,11]. 1.6. Funciones de los genes El cat´alogo del genoma est´a bastante completo, ya que existen varias estrategias para determinar si una regi´on del ADN es un gen [12]. Una vez se localiza un gen es posible traducirlo en una cadena de amino´acidos usando la tabla de codones –tabla 1.1– y as´ı conocer la secuencia de la prote´ına. Para determinar cu´al es la funci´on de una prote´ına existen dos estrategias: la gen´etica y la experimental. La gen´etica consiste en introducir una mutaci´on SIANI — ULPGC 7
Pascual Lorente Arencibia CAP´ ITULO 1. INTRODUCCI´ ON en un organismo modelo y comprobar si revela un cambio en una funci´on. La experimental es similar, pero se realizan en un ensayo in vitro. Muchas de estas t´ecnicas han sido descubiertas y desarrolladas gracias al estudio de la Drosophila melanogaster –mosca de la fruta. Este animal posee 4 pares de cromosomas y muchos de sus genes son hom´ologos a los del ser humano. Adem´as, tiene un ciclo de vida muy corto, de 15 a 21 d´ıas, y se reproduce con mucha facilidad[13]. 1.7. Software actual Existen muchos programas que ayudan a establecer la relaci´on entre variante y patolog´ıa o entre gen/prote´ına y funci´on. Presentamos algunos de los m´as relevantes. 1.7.1. Phenotype Based Gene Analyzer Phenotype Based Gene Analyzer (Phenolyzer)[14] es una herramienta que localiza los genes relacionados con enfermedades o fenotipos basados en palabras claves. A Phenolyzer se le pasa un lista de t´erminos de fenotipos y genera una lista de genes cada uno con un valor de la posibilidad de estar relacionado con alguno de los fenotipos. Su algoritmo es sencillo: a trav´es de las palabras clave genera una lista de enfermedades. Despu´es localiza los genes asociados a estas enfermedades y entonces comienza a buscar relaciones gen a gen para hacer crecer el ´arbol. Finalmente, integra toda la informaci´on y genera un valor por cada gen. En la figura 1.3 se puede ver la red de los genes con mayor relaci´on con las enfermedades hypercholesterolemia yobesity. Phenolyzer utiliza las siguientes fuentes: Para enfermedades: Medic disease vocabulary[15] de Comparative Toxicogenomics Database, Disease Ontology[16] de Institute for Genome Sciences SIANI — ULPGC 8
Pascual Lorente Arencibia CAP´ ITULO 1. INTRODUCCI´ ON Figura 1.3: Diagrama de red de Phenolyzer y Disease synonyms[17] de Online Mendelian Inheritance in Man. Para relaciones entre genes y enfermedades: Gene map[17] de Online Mendelian Inheritance in Man (OMIM), Clinical Variant database (ClinVar)[18] de National Center for Biotechnology Information (NCBI), GeneReviews[19] de NCBI, Orphanet[20] y the Genome Wide Association Studies[21]. Para las relaciones gen a gen: Human Protein Relation Database (HPRD)[22], Biosystem[23] de NCBI, Gene Family[24] de Human Genome Organization (HUGO) Gene Nomenclature Committee y Human Transcription Interaction (HTRI). 1.7.2. Search Tool for the Retrieval of Interacting Genes/Proteins Search Tool for the Retrieval of Interacting Genes/Proteins[25] (STRING) es una base de datos de interacciones entre prote´ınas, tanto conocidas como predichas. Estas interacciones pueden ser directas –f´ısicas– o indirectas –funcionales. SIANI — ULPGC 9
Pascual Lorente Arencibia CAP´ ITULO 1. INTRODUCCI´ ON STRING establece una puntuaci´on para cada interacci´on en funci´on de: Vecindad en el genoma Fusiones Coocurrencias en el genoma Coexpresi´on Experimentos Asociaci´on en bases de datos Menci´on en art´ıculos STRING integra datos de estas fuentes para un gran n´umero de organismos, y transfiere informaci´on entre estos organismos cuando puede. En estos momentos contiene 9.643.763 prote´ınas de 2031 organismos. 1.7.3. Sorting Intolerant From Tolerant Sorting Intolerant From Tolerant[26] (SIFT) es un software que predice si un cambio de amino´acido afecta a la funci´on de la prote´ına bas´andose en secuencias hom´ologas –secuencias conservadas en otras especies– y en las propiedades f´ısicoqu´ımicas–ver figura 1.4– de los amino´acidos. Estas propiedades determinan si una sustituci´on de una amino´acido por otro es m´as o menos dr´astica en base al cambio funcional y/o estructural esperado. SIFT sirve tanto para polimorfismos no sin´onimos como para mutaciones creadas en laboratorio. 1.7.4. Polymorphism Phenotyping Polymorphism Phenotyping v2[27] (PolyPhen) es una herramienta que predice el impacto posible de una sustituci´on de amino´acido en la estructura y funci´on de una prote´ına humana usando bas´andose en evidencias f´ısicas y comparativas. Algunas de sus caracter´ısticas son: Alineamiento de secuencias m´ultiples de alta calidad Clasificador probabil´ıstico basado en entrenamiento de m´aquinas SIANI — ULPGC 10
Pascual Lorente Arencibia CAP´ ITULO 1. INTRODUCCI´ ON Figura 1.4: Afinidad f´ısica de los amino´acidos. Los globos agrupan las sustituciones en teor´ıa m´as conservativas en base a la estructura de y propiedades f´ısico-qu´ımicas de las amino´acidos. Optimizado para datos NGS 1.7.5. Variant Effect Predictor Variant Effect Predictor[28] (VEP) es la herramienta de Ensembl para anotar y predecir el impacto de una variante en un gen, transcrito, secuencia de prote´ına o regi´on reguladora. A˜nade m´as de 30 etiquetas a cada variante, incluyendo el gen y transcrito, consecuencia de la variante, frecuencia en otras poblaciones o la predicci´on SIFT y Polyphen. SIANI — ULPGC 11
Cap´ıtulo 2 Estado del arte En el ´ambito de las Ciencias de la Computaci´on se han desarrollado en las ´ultimas d´ecadas disciplinas y herramientas que resultan muy ´utiles para el tratamiento de problemas cuya resoluci´on se basa en manipular grandes vol´umenes de datos. A continuaci´on haremos una breve referencia a aquellos que resultan ´utiles para el problema que tratamos en este documento. 2.1. Big Data Se conoce como Big Data a grandes conjuntos de datos que contiene informaci´on relevante. Cuando se tienen bases de datos de distintas fuentes, hay que tener en cuenta ciertos problemas. En primer lugar, el Sistema de Gesti´on de Bases de Datos (SGBD). Tradicionalmente los datos se han almacenado utilizando SGBD relacionales, que organizan los datos en tablas fuertemente definidas. Son sistemas robustos y con baja tolerancia a errores, ya que no permiten que un mismo dato se almacene en dos lugares diferentes. Podemos ver un peque˜no ejemplo de modelo relacional en la figura 2.1. Sin embargo, con la expansi´on de internet y la aparici´on constante de nuevos datos de distintas fuentes, muchas organizaciones optan por SGBD orientados a documentos, que almacenan los datos en documentos autodefinidos. Estos 12
Pascual Lorente Arencibia CAP´ ITULO 2. ESTADO DEL ARTE Estudiantes Id Nombre e1 Andr´es Garc´ıa e2 Manuel G´omez Asignaturas Id Nombre a1 Matem´aticas a2 F´ısica Estudia id estudiante id asignatura Nota e1 a1 B e2 a1 C e1 a2 A e2 a2 B Figura 2.1: Estructura y tablas de un modelo relacional documentos suelen usar la forma clave-valor, de modo que un documento fuera de sus entorno puede a´un ser comprendido. C´odigo 2.1: Ejemplo de fichero en formato JSON 1{ 2"estudiantes" :[ 3{"id" :"e1","nombre":"Andres Garcia"}, 4{"id" :"e2","nombre":" Manuel Gomez " }, 5], 6"asignaturas" :[ 7{"id" :"a1","nombre":"Matematicas"}, 8{"id" :"a2","nombre":"Fisica"}, 9], 10 "estudia" :[ 11 { 12 "id_est" :"e1", 13 "id_asig" :"a1", 14 "nota" :"B" 15 },{ 16 "id_est" :"e2", SIANI — ULPGC 13
Pascual Lorente Arencibia CAP´ ITULO 3. DESARROLLO cualquier m´aquina que tenga instalada la m´aquina virtual de Java. Hemos utilizado una metodolog´ıa ´agil para el desarrollo. En el a˜no 2001 se cre´o el Manifiesto por el desarrollo ´agil[38] con el objeto de mejorar los resultados en el desarrollo del software, no solo en reducci´on de tiempo, sino tambi´en en n´umero de proyectos exitosos. Estas metodolog´ıas descomponen las tareas en peque˜nos incrementos de planificaci´on m´ınima, donde cada iteraci´on culmina con una entrega del software, aunque est´e incompleta. Esto significa que todas son modelos iterativos e incrementales. De este modo, desde muy temprano se puede liberar una versi´on del software funcional, aunque no completa, permitiendo al cliente probar y usar lo que ya se ha implementado. As´ı, se pueden cambiar, a˜nadir o quitar requisitos desde el principio. Para los desarrolladores es muy f´acil a˜nadir peque˜nos cambios al software, y no hay que esperar mucho tiempo entre un lanzamiento y el siguiente. Estas metodolog´ıas son ideales para proyectos que no tengan los requisitos claros desde un principio, y que puedan usarse aunque solo funcione parte del sistema. Dos de las metodolog´ıas ´agiles m´as populares son Scrum[39] y Extrem Programming[40] . En este proyecto, al no existir m´as que un desarrollador y un cliente, no se aplicar´a estrictamente ninguna metodolog´ıa existente, pero se intentar´a simular las caracter´ısticas principales: Reuniones peri´odicas: Intentar reunirse a diario o, al menos, semanalmente. Estas reuniones servir´an para poner en com´un los progresos y establecer el trabajo pr´oximo. Lanzamientos frecuentes: Lanzar una versi´on de la aplicaci´on al menos una vez al mes. Incrementos progresivos: Cada versi´on debe suponer una mejora significativa respecto a la anterior. Modificaci´on ´agil de requisitos: Asimilaci´on r´apida y positiva de los cambios en los requisitos. SIANI — ULPGC 20
Pascual Lorente Arencibia CAP´ ITULO 3. DESARROLLO 3.3. Data warehouse La tabla 3.1 contiene un resumen de las bases de datos que se han utilizado para crear el data warehouse de Poirot, as´ı como su tipo. La figura 3.1 muestra la estructura l´ogica del mismo. Cada base de datos ha sido descargada desde su fuente y normalizada con un script. Una vez normalizadas, las del mismo tipo se han almacenado juntas como una sola. En general, todas las bases de datos de genes o de interacciones presumen de crear sus datos de manera manual, con revisiones continuas, por lo que podemos esperar un alto grado de precisi´on y pocos errores. En muchos casos, los registros est´an respaldados por uno o varios art´ıculos cient´ıficos. Tipo Nombre Tama˜no Gen–patolog´ıa Omim 6.968 Gen–patolog´ıa HPRD 4.943 Gen–expresi´on HPRD 112.158 Gen–expresi´on ProteinAtlas 677.170 Gen–gen IntAct 225.503 Gen–gen MINT 61.427 Gen–gen dip 64.586 Gen–gen BioGrid 424.954 Gen–gen HPRD 39.240 Tabla 3.1: Registros por base de datos 3.3.1. HUGO Gene Nomenclature Comitee HUGO Gene Nomenclature Comitee (HGNC)[41] es la autoridad encargada de establecer el nombre y el s´ımbolo de cada regi´on identificada del ADN, la mayor´ıa genes. Para todas las bases de datos, se usar´a el s´ımbolo proporcionado por la HGNC como identificador de cada gen. En caso de que la HGNC no tenga nombre para un gen en concreto, se usar´a el que proporcione la base de datos. Hasta la fecha hay 40.527 entradas. SIANI — ULPGC 21
Pascual Lorente Arencibia CAP´ ITULO 3. DESARROLLO Figura 3.1: Estructura del data warehouse 3.3.2. Online Mendelian Inheritance in Man OMIM es una base de datos desarrollada y mantenida por la Universidad de Medicina Johns Hopkins, North Baltimore, que identifica el fenotipo –enfermedad o caracter´ıstica f´ısica– de cada gen. Permite descargar los datos o acceder v´ıa REST API. Tiene 15.513 entradas. 3.3.3. Human Protein Reference Database Human Protein Reference Database (HPRD)[22] es una base de datos que indica c´omo se expresa cada prote´ına en el cuerpo, por lo general listando en qu´e ´organos del cuerpo est´a presente. Est´a financiada por el Institute of BioInformatics. Su ´ultima actualizaci´on es del a˜no 2010, pero sus datos todav´ıa son v´alidos. En total, tiene 112.158 expresiones de genes en fenotipos, 39.240 interacciones entre prote´ınas y 4943 relaciones con patolog´ıas. SIANI — ULPGC 22
Pascual Lorente Arencibia CAP´ ITULO 3. DESARROLLO 3.3.4. Biological General Repository for Interaction Datasets Biological General Repository for Interaction Datasets (BioGrid)[42] es una base de datos que se actualiza mensualmente con interacciones tanto f´ısicas como gen´eticas entre prote´ınas. Tiene un total de 237.045 registros. Est´a desarrollado entre varias universidades de Canad´a y posee servicio REST. 3.3.5. Mentha Mentha[43] es una base de datos creada por la Universidad de Tor Vergata, Italia que, aparte de contener interacciones entre prote´ınas, tiene herramientas online para su visualizaci´on. Tambi´en se alimenta de otras bases de datos. Tiene registradas 385.857 entradas de distintas bases de datos –BioGrid, Mint, IntAct, MatrixDB, DIP–. 3.3.6. The Human Protein Atlas The Human Protein Atlas (ProteinAtlas)[44] es una base de datos con millones de im´agenes en alta resoluci´on que muestran la distribuci´on espacial de las prote´ınas en 44 tejidos humanos normales, 20 cancer´ıgenos y 46 l´ıneas celulares humanas. La base de datos ha sido desarrollada de una manera genoc´entrica con la inclusi´on de todos los genes humanos pronosticados en estudios gen´omicos. Las funciones de b´usqueda permiten realizar consultas complejas sobre perfiles de expresi´on de prote´ınas, clases de prote´ınas y localizaci´on de cromosomas. Esta base de datos tambi´en contiene informaci´on acerca de la presencia de secuencias de ARN en cada tejido. De este modo, el ARN puede confirmar o desmentir la presencia de una prote´ına. 3.4. Evaluaci´on de variantes Para determinar cu´al es el impacto de una variante sobre una enfermedad, Poirot crea un grafo formado por la lista de todas las enfermedades y expresiones que hay en el data warehouse, los genes afectados por al menos una variante, y SIANI — ULPGC 23
Pascual Lorente Arencibia CAP´ ITULO 3. DESARROLLO todos los genes haya interconectados entre cualquier enfermedad y variante. Este grafo es no dirigido –las relaciones no tienen direcci´on– y cada relaci´on contiene todas las interacciones que haya entre dos nodos. La figura 3.2 representa el grafo que utiliza Poirot. El ap´endice Cmuestra el diagrama de clases que representa el grafo en memoria. Enfermedad Gen Gen Gen Gen v1 v1 v2 v3 i1 i1,i2 i1,i2,i3 i1,i2 i1 Figura 3.2: Grafo de interacciones de Poirot Poirot agrupa todas las variantes del mismo gen y obtiene una sola puntuaci´on para el gen en base a la ecuaci´on 3.1: Pgen =α·max(Pvariante) + (1 −α)·max(Pvecino) distancia (3.1) donde αes la proporci´on entre el impacto de las variantes y el impacto de las relaciones. Cuanto m´as alto, m´as se valorar´an las variantes y menos las relaciones. Este factor lo situamos emp´ıricamente en el intervalo [0,8-0,9]. Para el c´alculo del vecino m´aximo, se utilizan solo las interacciones hacia genes con mayor distancia. Pvariante es el valor de una variante, que se calcula por su consecuencia m´as SIANI — ULPGC 24
Pascual Lorente Arencibia CAP´ ITULO 3. DESARROLLO grave: Pvariante =max(Pconsecuencia) (3.2) Las variantes modifican la secuencia gen´etica. Dependiendo de d´onde se encuentre la variante y cu´al sea su forma, puede tener distintas consecuencias. Cada consecuencia tiene una gravedad y un impacto diferente[45]. Para las consecuencias se han establecido cuatro niveles de impacto: alto, moderado, bajo y modificador. El ap´endice Ddetalla el listado de consecuencias y su impacto. La tabla 3.2 indica el valor num´erico de cada una. Consecuencia Valor Alto 1,0 Moderado 0,8 Bajo 0,4 Modificador 0,2 Tabla 3.2: Valor de cada consecuencia Pvecino es el valor de la interacci´on con mayor impacto multiplicado por el valor del gen relacionado. Pvecino =max (Pinteraccion)·Pgen (3.3) Pinteraccion tambi´en es un valor en funci´on del tipo. Los principales tipos de interacci´on son: Interacci´on funcional no necesariamente f´ısica Es el tipo de interacci´on m´as fuerte. Al alterar la cantidad o forma de una prote´ına –mediante una mutaci´on– se observa un cambio en la funci´on de otra. Interacci´on f´ısica no necesariamente funcional Ambas prote´ınas forman parte de uno o varios complejos f´ısicos. Es decir, est´an juntas en la misma estructura. Un cambio en una de ellas no tiene por qu´e afectar al funcionamiento de la otra. Colocalizaci´on sin interacci´on conocida Ambas prote´ınas est´an presentes en la misma fracci´on subcelular, pero no existe evidencia de una interacci´on f´ısica. Una lista m´as detallado con los subtipos de relaciones y su impacto est´a detallada en el ap´endice E. Los valores num´ericos asociados est´an en la tabla 3.3. SIANI — ULPGC 25
Pascual Lorente Arencibia CAP´ ITULO 3. DESARROLLO Interacci´on Valor Alto 0,9 Moderado 0,6 Bajo 0,2 Tabla 3.3: Valor de cada interacci´on Para calcular la distancia utilizamos un algoritmo de inundaci´on. Partimos de cada fenotipo –enfermedad o expresi´on– y lo marcamos como distancia 0. Luego, a cada uno de los nodos conectados directamente le damos distancia 1. Ahora repetimos desde los nodos con distancia 1 y marcamos a sus vecinos con distancia 2, excepto a los que tienen distancia 0 o 1. As´ı hasta que hayamos alcanzado todos los nodos. Si solo queremos saber la distancia a un fenotipo en particular, empezaremos en ese fenotipo. Por ´ultimo, como tanto las enfermedades como las expresiones forman parte del mismo grafo, es interesante la posibilidad de darles una puntuaci´on. Esto servir´a para crear un nuevo ranking con el impacto de cada enfermedad y expresi´on. Pfenotipo =max(Pvecino) (3.4) 3.5. Entrada de datos Lo ´unico que debe introducir el usuario en Poirot es la lista de variantes. Estas estar´an en un fichero VCF que tiene que estar anotado utilizando VEP. En concreto, de cada variante gen´etica se espera que tenga las siguientes etiquetas: SYMBOL Nombre del gen donde se encuentra la variante. SIFTs Valoraci´on de SIFT, un n´umero entre 0 y 1. CONS Consecuencias de la variante, separadas por comas. BIO Biotipo del gen. SIANI — ULPGC 26
Pascual Lorente Arencibia CAP´ ITULO 3. DESARROLLO 3.6. Interfaz de usuario Poirot est´a formado por dos pantallas, la pantalla de fenotipos y la pantalla de genes. 3.6.1. Pantalla de fenotipos La pantalla de fenotipos tiene como objetivo la selecci´on de fenotipos. Para ello, esta pantalla muestra la lista de todos los fenotipos ordenados por su puntuaci´on. Desde aqu´ı, se puede navegar por la lista para seleccionar individualmente cada fenotipo, se pueden filtrar por nombre y se pueden mostrar solo las enfermedades o solo las expresiones. En la imagen 3.3 se distinguen 5 elementos visuales: 1. A la izquierda una lista para la selecci´on de grupo –TODOS, SELECCIONADOS, ENFERMEDAD, EXPRESI´ ON–. 2. Arriba el cuadro de b´usqueda que filtra seg´un se va escribiendo. 3. A la derecha arriba la cabecera de la tabla sirve para ordenar por nombre y puntuaci´on. 4. A la derecha abajo la tabla de fenotipos para seleccionar. 5. Abajo, un bot´on para pasar a la siguiente pantalla. 3.6.2. Pantalla de genes La segunda pantalla es donde m´as tiempo pasar´a el usuario. En ella se muestran los genes m´as probables de afectar a una enfermedad o expresi´on. Est´a formada por los 6 elementos marcados en la figura 3.4: A la izquierda la tabla de genes: Se pueden ordenar por nombre, distancia al fenotipo y valor. A la derecha el elemento principal: el grafo. En ´el se muestran las relaciones entre los genes seleccionados y los fenotipos. Los nodos del grafo se pueden desplazar y seleccionar. Las relaciones se pueden seleccionar. A la derecha abajo: informaci´on de selecci´on. Muestra informaci´on acerca del elemento seleccionado en el grafo. Si se ha seleccionado un gen, se SIANI — ULPGC 27
Pascual Lorente Arencibia CAP´ ITULO 3. DESARROLLO Figura 3.3: Pantalla de fenotipos muestra su nombre completo y su lista de variantes, si se selecciona una relaci´on, la lista de interacciones. A la izquierda arriba un bot´on para volver a la pantalla de fenotipos. A la izquierda abajo, un bot´on para actualizar el grafo con los genes seleccionados. Figura 3.4: Pantalla de genes SIANI — ULPGC 28
Cap´ıtulo 4 Resultados Para demostrar la eficacia de Poirot hemos elegido un paciente cuya asociaci´on entre variante y enfermedad es conocida. Este paciente padece hipercolesterolemia familiar, una patolog´ıa sufrida por una mutaci´on en el gen que codifica para el receptor de las lipoprote´ınas de baja densidad (LDLR). Para este paciente, siguiendo el m´etodo explicado en el ap´endice A, hemos obtenido 540.510 variantes, de las cuales 162.051 tienen una frecuencia en la poblaci´on inferior a 0,05. En una variante patol´ogica es de esperar que su frecuencia en la poblaci´on sea inferior a 1 de cada 20. Al realizar el an´alisis Poirot, se alcanza un total de 6941 enfermedades y 573 expresiones. Si buscamos la hipercolesterolemia familiar, la encontramos en la posici´on 40 –entre el 1 % con m´as valoraci´on, tanto en enfermedades como en el total–, como se puede ver en la tabla 4.1. La lista de genes candidatos a la hipercolesterolemia se muestra en la tabla 4.2, donde se comprueba que efectivamente es el LDLR el gen con m´as valoraci´on. Este gen del cromosoma 19 tiene una deleci´on de tres codones en la posici´on 11.223.963 provocando una inframe deletion, una consecuencia de impacto alto (1,0). La figura 4.1 muestra las interacciones entre los 5 genes m´as valorados y la hipercolesterolemia familiar. Se puede ver que hay una relaci´on directa entre el LDLR y el gen Apolipoprotein B (APOB), un gen que se traduce en una prote´ına que se adhiere a los l´ıpidos y que tambi´en presenta hasta tres variantes 29
Pascual Lorente Arencibia AP´ ENDICE A. OBTENCI´ ON DE VARIANTES java −j a r Gatk . j a r −T HaplotypeCaller \\ −I alineamientos .bam \\ −o variantes . vcf Al final del proceso tendremos un fichero con todas las variantes: variantes.vcf SIANI — ULPGC 36
Ap´endice B Variant Call Format El formato VCF[46] es un formato gen´erico para almacenar informaci´on de polimorfismos en el ADN, como SNPs, InDels y variantes estructurales, as´ı como todo tipo de anotaciones. VCF se puede almacenar comprimido y se puede indexar para acceder r´apidamente a variantes en un rango de posiciones. La cabecera contiene un n´umero arbitrario de l´ıneas que comienzan con los caracteres ## (doble almohadilla). Solo la primera, ##fileformat, y la ´ultima, #CHROM, son obligatorias. Las cabeceras se utilizan para describir de forma est´andar las etiquetas y anotaciones que se utilizan en la secci´on de datos. La ´ultima l´ınea de la cabecera debe escribirse siempre igual, con los nombres de las columnas de datos separados por tabulador, a saber: 37
Pascual Lorente Arencibia AP´ ENDICE B. VARIANT CALL FORMAT CHROM Cromosoma POS Posici´on ID Identificador ´unico de variante REF Alelo de referencia ALT Lista de variantes, separadas por coma QUAL Valor de calidad FILTER Filtros aplicados INFO Lista de anotaciones, separadas por ; (punto y coma). FORMAT [Opcional] Formato de la siguiente columna, etiquetas separadas por : (dos puntos) SAMPLE1 [Opcional] 1 o m´as columnas con la informaci´on representada en FORMAT para distintas muestras. Tabla B.1: Columnas del formato VCF. As´ı es un fichero VCF. ##fileformat=VCFv4.1 ##fileDate=20090805 ##source=myImputationProgramV3.1 ##phasing=partial ##INFO=<ID=DP,Number=1,Type=Integer,Description="Total Depth)) ##FILTER=<ID=s50,Description="Less than 50 % have data)) ##FORMAT=<ID=GT,Number=1,Type=String,Description="Genotype)) #CHROM POS ID REF ALT QUAL FILTER ... 20 14370 rs6054257 G A 29 PASS ... 20 17330 . T A 3 q10 ... 20 1110696 rs6040355 A G,T 67 PASS ... 20 1230237 . T . 47 PASS ... Tabla B.2: Ejemplo de fichero VCF. SIANI — ULPGC 38
Ap´endice C Estructura de Poirot A continuaci´on se describen las clases que forman el n´ucleo de la aplicaci´on. PearlGraph Representa el grafo completo en memoria. Contiene la totalidad de enfermedades, expresiones, genes e interacciones. Pearl Representa un nodo en el PearlGraph. Los tipos de nodos que hay son: GENE, EXPRESSION, DISEASE. PearlRelationship Representa una relaci´on entre dos Pearl. Graph Representa un grafo que se muestra en pantalla. Es un grafo parcial de un PearlGraph. GraphNode Representa un nodo en un Graph. Contiene una Pearl, as´ı como elementos que representan su estado visual: selected, position. GraphRelationship Representa una relaci´on entre dos GraphNode. Contiene 1 o m´as PearlRelationship. GrapFactory A partir de una lista de variantes forma un PearlGraph. ShortestPath A partir de una Pearl, lista todos los caminos de distancia m´as corta entre el nodo y el fenotipo activo–seleccionado– m´as cercano. GraphEvaluator Toma un PearlGraph y una lista de fenotipos (Pearl) y eval´ua cada elemento del grafo en base a los fenotipos. Si no se especifica una lista de fenotipos, los toma todos. Por simplicidad, solo se muestra el diagrama que representa el grafo en la 39
Pascual Lorente Arencibia AP´ ENDICE C. ESTRUCTURA DE POIROT figura C.1. Figura C.1: Diagrama de clases que representa c´omo se almacenan los nodos –perlas– en la aplicaci´on. SIANI — ULPGC 40
Ap´endice D Consecuencias La figura D.1 muestra el nombre que recibe cada variante seg´un su posici´on. A continuaci´on se describe cada una ellas. Se mantiene la descripci´on en ingl´es porque gran parte de los t´erminos no tiene traducci´on al castellano. Figura D.1: Posici´on de cada variante seg´un su consecuencia. Fuente: www.ensembl.org Consecuencias de impacto alto (high): Frameshift variant: A sequence variant which causes a disruption of the translational reading frame, because the number of nucleotides inserted or deleted is not a multiple of three. Stop lost: A sequence variant where at least one base of the terminator codon (stop) is changed, resulting in an elongated transcript. 41
Pascual Lorente Arencibia AP´ ENDICE D. CONSECUENCIAS Start lost: A codon variant that changes at least one base of the canonical start codon. Transcript amplification: A feature amplification of a region containing a transcript. Consecuencias de impacto moderado (Moderate): Inframe insertion: An inframe non synonymous variant that inserts bases into in the coding sequenc Inframe deletion: An inframe non synonymous variant that deletes bases from the coding sequenc. Missense variant: A sequence variant, that changes one or more bases, resulting in a different amino acid sequence but where the length is preserved. Protein altering variant: A sequence variant which is predicted to change the protein encoded in the coding sequence. Regulatory region ablation: A feature ablation whereby the deleted region includes a regulatory region. Consecuencias de impacto bajo (Low): Splice region variant: A sequence variant in which a change has occurred within the region of the splice site, either within 1-3 bases of the exon or 3-8 bases of the intron. Incomplete terminal codon variant: A sequence variant where at least one base of the final codon of an incompletely annotated transcript is changed. Stop retained variant: A sequence variant where at least one base in the terminator codon is changed, but the terminator remains. Synonymous variant: A sequence variant where there is no resulting change to the encoded amino acid. Consecuencias de impacto modificador (Modifier): Coding sequence variant: A sequence variant that changes the coding sequence. Mature miRNA variant: A transcript variant located with the sequence of the mature miRNA. SIANI — ULPGC 42
Pascual Lorente Arencibia AP´ ENDICE D. CONSECUENCIAS 5 prime UTR variant: A UTR variant of the 5’ UTR. 3 prime UTR variant: A UTR variant of the 3’ UTR. Non coding transcript exon variant: A sequence variant that changes non-coding exon sequence in a non-coding transcript. Intron variant: A transcript variant occurring within an intron. NMD transcript variant: A variant in a transcript that is the target of NMD. Non coding transcript variant: A transcript variant of a non coding RNA gene. Upstream gene variant: A sequence variant located 5’ of a gene. Downstream gene variant: A sequence variant located 3’ of a gene. TFBS ablation: A feature ablation whereby the deleted region includes a transcription factor binding site. TFBS amplification: A feature amplification of a region containing a transcription factor binding site. TF binding site variant: A sequence variant located within a transcription factor binding site. Regulatory region amplification: A feature amplification of a region containing a regulatory region. Feature elongation: A sequence variant located within a regulatory region. Regulatory region variant: A sequence variant located within a regulatory region. Feature truncation: A sequence variant that causes the reduction of a genomic feature, with regard to the reference sequence. Intergenic variant: A sequence variant located in the intergenic region, between genes. SIANI — ULPGC 43
Ap´endice E Interacciones Interacci´on funcional no necesariamente f´ısica (alto): additive genetic interaction defined by inequality suppressive genetic interaction defined by inequality synthetic genetic interaction defined by inequality genetic inequality Interacci´on f´ısica no necesariamente funcional (moderado): direct interaction physical association association Interacci´on de colocalizaci´on (bajo): colocalization 44
Bibliograf´ıa [1] Watson J y Crick F. A Structure for Deoxyribose Nucleic Acid. Nature, 171:737–738, 1953. [2] Russell PJ. Genetics. Harper Collins, 4aedici´on, 1996. [3] Feuk L, Carson AR y Scherer SW. Structural variation in the human genome. Nat Rev Genet, 7(2):85–97, 2006. [4] Sanger F y Coulson AR. A rapid method for determining sequences in DNA by primed synthesis with DNA polymerase. J Mol Biol, 94(3):441–448, 1975. [5] Shendure J y Ji H. Next-generation DNA sequencing. Nat Biotech, 26(10):1135–1145, 2008. [6] Bamshad MJ, Ng SB, Bigham AW, Tabor HK, Emond MJ, Nickerson DA et al.Exome sequencing as a tool for Mendelian disease gene discovery. Nat Rev Genet, 12(11):745–755, 2011. [7] Rabbani B, Tekin M y Mahdieh N. The promise of whole-exome sequencing in medical genetics. J Hum Genet, 59(1):5–15, 2014. [8] Cooper DN, Chen JM, Ball EV, Howells K, Mort M, Phillips AD et al. Genes, mutations, and human inherited disease at the dawn of the age of personalized genomics. Hum Mutat, 31(6):631–655, 2010. [9] Lee H, Deignan JL, Dorrani N, Strom SP, Kantarci S, Quintero-Rivera F et al.Clinical exome sequencing for genetic identification of rare Mendelian disorders. JAMA, 312(18):1880–1887, 2014. [10] Yang Y, Muzny DM, Reid JG, Bainbridge MN, Willis A, Ward PA et al. Clinical whole-exome sequencing for the diagnosis of mendelian disorders. N Engl J Med, 369:1502–1511, 2013. 45