scieee AI-readable full text Open interactive document viewer

Repositorio Institucional de Documentos

Abstract

Los principales objetivos de este proyecto fin de carrera son la traducción de ADN a proteínas, la construcción de árboles filogenéticos utilizando proteínas y su comparación con los árboles construidos directamente a partir de secuencias completas de ADN. La filogenética es la disciplina que estudia las relaciones evolutivas entre distintos individuos o especies. El ADN mitocondrial es un tipo especial de ADN que está almacenado en unos orgánulos de la célula llamados mitocondrias. Parte del ADN mitocondrial codifica proteínas. Los árboles filogenéticos se construyen utilizando modelos matemáticos que intentan explicar la evolución real de los individuos. En el caso tratado de ADN mitocondrial, las filogenias son especialmente útiles a la hora de diagnosticar las mutaciones de un paciente como patógenas. Para poder construir estos árboles es necesario identificar las proteínas dentro de la secuencia de ADN mitocondrial y extraer su información. Debido a la falta de homogeneidad en las bases de datos donde se encuentran almacenadas las secuencias es necesaria una primera fase de procesamiento para así poder localizar las proteínas. La comparación de árboles filogenéticos es un tema abierto y candente en la filogenia computacional para el que no se conocen en la actualidad soluciones satisfactorias, por lo que las herramientas existentes no permiten un análisis profundo de los resultados. Futuros desarrollos en el área de comparación de filogenias serán el punto de partida de posteriores investigaciones a partir de las herramientas y resultados obtenidos en este PFC. En este proyecto se trabaja con árboles filogenéticos construidos mediante proteínas, un tema novedoso en investigación por lo que se espera publicar los resultados en breve y que este proyecto sea el punto de partida de futuros estudios. Durante todo el proyecto se ha tenido que dedicar mucho tiempo a la formación en temas de índole biológica. También se ha usado gran cantidad de herramientas bioinformáticas. Se ha conseguido el objetivo de construir los árboles correspondientes a un total de 4.824 secuencias, un número considerado alto en filogenia computacional dado el gran coste computacional de los métodos empleados. Tras compararlos con los árboles de ADN disponibles se ha llegado a la conclusión que son muy distintos, hecho que puede tener varias explicaciones biológicas y que da pie a nuevas investigaciones para dar explicaciones a este suceso. Miguel Lozano, Enrique; Mayordomo Cámara, Elvira; Álvarez Jarreta, Jorge

Full text

Proyecto Fin de Carrera Estudio y análisis de métodos de inferencia filogenética: del ADN a las proteínas Autor: Enrique Miguel Lozano Bajo la dirección de: Elvira Mayordomo Cámara Jorge Álvarez Jarreta Departamento de Informática e Ingeniería de Sistemas Área de Lenguajes y Sistemas Informáticos Escuela de Ingeniería y Arquitectura Universidad de Zaragoza Curso 2012/2013 Noviembre de 2012 i Estudio y análisis de métodos de inferencia filogenética: del ADN a las proteínas RESUMEN Los principales objetivos de este proyecto fin de carrera son la traducción de ADN a proteínas, la construcción de árboles filogenéticos utilizando proteínas y su comparación con los árboles construidos directamente a partir de secuencias completas de ADN. La filogenética es la disciplina que estudia las relaciones evolutivas entre distintos individuos o especies. El ADN mitocondrial es un tipo especial de ADN que está almacenado en unos orgánulos de la célula llamados mitocondrias. Parte del ADN mitocondrial codifica proteínas. Los árboles filogenéticos se construyen utilizando modelos matemáticos que intentan explicar la evolución real de los individuos. En el caso tratado de ADN mitocondrial, las filogenias son especialmente útiles a la hora de diagnosticar las mutaciones de un paciente como patógenas. Para poder construir estos árboles es necesario identificar las proteínas dentro de la secuencia de ADN mitocondrial y extraer su información. Debido a la falta de homogeneidad en las bases de datos donde se encuentran almacenadas las secuencias es necesaria una primera fase de procesamiento para así poder localizar las proteínas. La comparación de árboles filogenéticos es un tema abierto y candente en la filogenia computacional para el que no se conocen en la actualidad soluciones satisfactorias, por lo que las herramientas existentes no permiten un análisis profundo de los resultados. Futuros desarrollos en el área de comparación de filogenias serán el punto de partida de posteriores investigaciones a partir de las herramientas y resultados obtenidos en este PFC. En este proyecto se trabaja con árboles filogenéticos construidos mediante proteínas, un tema novedoso en investigación por lo que se espera publicar los resultados en breve y que este proyecto sea el punto de partida de futuros estudios. Durante todo el proyecto se ha tenido que dedicar mucho tiempo a la formación en temas de índole biológica. También se ha usado gran cantidad de herramientas bioinformáticas. Se ha conseguido el objetivo de construir los árboles correspondientes a un total de 4.824 secuencias, un número considerado alto en filogenia computacional dado el gran coste computacional de los métodos empleados. Tras compararlos con los árboles de ADN disponibles se ha llegado a la conclusión que son muy distintos, hecho que puede tener varias explicaciones biológicas y que da pie a nuevas investigaciones para dar explicaciones a este suceso. ii iii Agradecimientos Parece tan cercano el día en que empecé la carrera, que lo puedo recordar como si fuera ayer. Nunca podré olvidar los primeros momentos, en los que todo era tan nuevo e ilusionante y en los que conocí a tanta gente que me ha acompañado en este largo viaje, algunos de los cuales puedo considerar verdaderos amigos. También quiero acordarme de mis amigos de toda la vida, que siempre han estado ahí para cualquier cosa que he necesitado y con los que he tenido la suerte de compartir tantas experiencias a lo largo de estos años. Por supuesto, agradecer a mis directores, Elvira y Jorge por su apoyo a lo largo del proyecto y por haberme ayudado a llegar al final de este camino. Por último me gustaría agradecer a mi familia el haberme animado siempre. Pero por encima de todo, quiero dar las gracias a mis padres por todos los sacrificios que han hecho por mí. Sin ellos no sería quien soy y nunca habría podido llegar tan lejos. Muchas gracias a todos. iv Índice general 1. Introducción .................................................................................................. 1 1.1. Contexto del proyecto ........................................................................................ 1 1.2. Objetivos ............................................................................................................ 1 1.3. Metodología y herramientas ............................................................................... 2 1.4. Software ............................................................................................................. 2 1.5. Entorno tecnológico ........................................................................................... 3 1.6. Estructura de la memoria ................................................................................... 3 2. Glosario biológico ........................................................................................ 5 3. Preprocesamiento de las secuencias ......................................................... 7 3.1. Estado del arte ................................................................................................... 7 3.2. Alineamiento de secuencias ............................................................................... 8 3.3. Análisis de resultados ........................................................................................ 8 4. Transcripción y traducción ........................................................................ 10 4.1. Estado del arte ................................................................................................. 10 4.2. Transcripción .................................................................................................... 10 4.3. Traducción ....................................................................................................... 10 4.4. Resultados ....................................................................................................... 11 5. Árboles de filogenias ................................................................................. 13 5.1. Estado del arte ................................................................................................. 13 5.2. Construcción de los árboles filogenéticos ........................................................ 13 5.3. Comparación de árboles .................................................................................. 15 5.4. Análisis de los resultados ................................................................................. 15 6. Conclusiones .............................................................................................. 21 6.1. Trabajo realizado ............................................................................................. 21 6.2. Con vistas al futuro .......................................................................................... 21 6.3. De lo profesional a lo personal ......................................................................... 22 Bibliografía ...................................................................................................... 23 v Índice de figuras Figura 5.1: Gráfica de estudio de la evolución del coste temporal de RAxML según incrementa el número de secuencias y su longitud. .............................. 14 vi Índice de tablas Tabla 3.1: Secuencias que contienen gaps en algún gen que codifique proteínas. ........................................................................................................... 9 Tabla 5.1: Porcentaje de similitudes de los árboles filogénicos construidos a partir de proteínas con los de ZARAMIT por cada haplogrupo. ........................ 17 1 1 1. . I In nt tr ro od du uc cc ci ió ón n 1 1. .1 1. . C Co on nt te ex xt to o d de el l p pr ro oy ye ec ct to o El proyecto se ha realizado en el Departamento de Informática e Ingeniería de Sistemas de la Universidad de Zaragoza, dentro del ámbito de la bioinformática [1]. Se han utilizado los resultados del proyecto ZARAMIT [2] sobre ADN mitocondrial humano. En cuanto al contexto biológico del proyecto, se ha trabajado con las proteínas del ADN mitocondrial humano para la construcción de árboles de filogenias que reflejan la evolución de la especie humana. Dicha construcción es de gran importancia dado que el estudio filogenético del ADN mitocondrial permite detectar mutaciones asociadas a enfermedades raras, muchas de las cuales provocan la muerte prematura del individuo. En función de la localización de una secuencia en el árbol generado se puede conocer si las mutaciones presentes en dicha secuencia están asociadas a una enfermedad que pueda afectar al individuo [3]. Por otro lado, el estudio filogenético realizado sobre proteínas, en contraste con el usual estudio de filogenias de ADN, es un tema novedoso, bastante menos desarrollado en la literatura y de gran interés científico-técnico. 1 1. .2 2. . O Ob bj je et ti iv vo os s Una vez situado al lector en el contexto del proyecto, es el momento de explicar los objetivos que lo han guiado. La investigación ha estado centrada en la construcción de árboles filogenéticos a partir de proteínas, para lo que se ha trabajado con la secuencia de ADN mitocondrial humano. El proyecto consta de tres objetivos fundamentales: introducción y formación, alineamiento de secuencias y obtención de proteínas, y obtención de árboles de filogenias creados a partir de proteínas y comparación con los árboles creados directamente a partir de la secuencia completa de ADN mitocondrial (o ADNmt). El primer objetivo es parte de todo proyecto, ya que siempre es necesario obtener información a partir de la cual empezar a trabajar. Pero esta fase ha sido especialmente necesaria en este caso, dado que no hay formación en la carrera en el ámbito de la bioinformática y se ha tenido que adquirir una gran cantidad de conceptos básicos y no tan básicos al comenzar este proyecto. Aunque este objetivo no solo se ha llevado a cabo al inicio del trabajo, sino que prácticamente hasta la finalización del mismo se ha tenido que seguir recopilando información. El segundo objetivo se centra en obtener los datos a partir de los cuales se han construido los árboles de filogenias. Aunque este objetivo se podría haber incluido dentro del siguiente, se ha considerado que era mejor separarlo dado el tiempo que ha durado y la importancia que tiene dentro del proyecto. Para obtener las proteínas de una secuencia de ADN es necesario traducir los nucleótidos de los genes que las codifican en aminoácidos, para lo que se ha 8 3 3. .2 2. . A Al li in ne ea am mi ie en nt to o d de e s se ec cu ue en nc ci ia as s Como se ha comentado anteriormente, se ha usado la herramienta MUSCLE para alinear las secuencias con la rCRS. Para realizar cada alineamiento se tiene que lanzar una ejecución de MUSCLE pasándole como entrada el nombre de los ficheros que contienen la secuencia rCRS y la secuencia a alinear; esto implica que hay que lanzar una ejecución por cada una de las 14.915 secuencias. Dado el excesivo coste temporal de lanzar estas ejecuciones manualmente se ha implementado un programa que llame a MUSCLE y realice un conjunto de acciones adicionales que se detallan a continuación. Cuando MUSCLE alinea cada par de secuencias genera un fichero con extensión .afa en el que aparecen las dos secuencias alineadas una a continuación de la otra. El objetivo es tener un fichero en el que solo esté la secuencia alineada y procesada, por lo que el programa va a eliminar las posiciones de la secuencia a alinear que se correspondan con los gaps introducidos en la rCRS (a excepción del gap de la posición 3.107 que se mantiene por convenio) y generar el nuevo fichero con la secuencia alineada y procesada. Por último, es importante detectar en la secuencia si se han introducido gaps en algún punto de una región correspondiente a un gen, ya que este evento puede estar asociado a anomalías que sería necesario estudiar. Por ello, el programa, antes de eliminar una posición, comprobará si está dentro de un gen, y si lo está, escribirá en un fichero especial la secuencia y la proteína que se codifica en el gen en el que se ha encontrado esta situación. Cabe destacar que el alineamiento de secuencias es un proceso con un coste temporal bastante elevado. El alineamiento de las 14.915 secuencias tardó en ejecutarse aproximadamente una semana. 3 3. .3 3. . A An ná ál li is si is s d de e r re es su ul lt ta ad do os s Una vez terminada la ejecución del programa se han analizado dos cosas: si el alineamiento ha permitido identificar la posición de los genes en las secuencias y si, como se ha comentado en la sección anterior, han aparecido gaps en los genes de las secuencias alineadas. Para comprobar si los 13 genes que codifican las proteínas empiezan en la misma posición en todas las secuencias se ha desarrollado un pequeño programa que escribe en un fichero los nombres de los archivos que contengan secuencias en las que al menos un gen no comience en la misma posición que su correspondiente en la rCRS. Al ejecutarlo se ha creado un fichero que contiene 4.808 secuencias. Este número es bastante elevado, puesto que es prácticamente un tercio del número total de secuencias. Una vez analizados los resultados más a fondo se llega a la conclusión de que los genes que codifican las proteínas empiezan siempre entre 20 posiciones antes y 20 posiciones después que en la rCRS. Esto habrá que tenerlo en cuenta a la hora de obtener los aminoácidos que componen las proteínas (como se verá en el capítulo 4). Un estudio más profundo de las 9 causas por las que es necesario aplicar este umbral resultaría interesante en trabajos futuros, quedando fuera de los objetivos y alcance de este proyecto. Como se ha comentado anteriormente, la aparición de gaps en los genes que codifican las proteínas puede estar asociado a anomalías en la secuencia original. Al analizar el fichero especial que se ha generado se puede observar que éste contiene 6 secuencias. Dado que representan un 0,04% del número total de secuencias recogidas y que un análisis más profundo de los motivos se aleja de los objetivos del proyecto, se ha optado por descartar las secuencias. En la tabla 3.1 se pueden observar los identificadores de GenBank de las secuencias descartadas así como la proteína que codifica el gen en el que se ha encontrado el gap. Identificador Proteína afectada AB055387 CO1 JQ705682 CO2 EF184610 CytB EF184640 ATP8 JF742208 ND2 EF660930 ND3 Tabla 3.1: Secuencias que contienen gaps en algún gen que codifique proteínas. 10 4 4. . T Tr ra an ns sc cr ri ip pc ci ió ón n y y t tr ra ad du uc cc ci ió ón n En este capítulo se va a explicar cómo una vez alineadas las secuencias se han obtenido las proteínas por medio de los procesos de transcripción y traducción. 4 4. .1 1. . E Es st ta ad do o d de el l a ar rt te e La transcripción y la traducción son dos procesos que forman parte de la expresión génica, es decir, son los mecanismos por los cuales una célula es capaz de obtener las proteínas codificadas en los distintos genes del ADN. No se ha considerado necesaria la búsqueda de implementaciones ya existentes de estos procesos. El motivo es doble: por un lado, son mecanismos de baja complejidad cuyo objetivo es la traducción de nucleótidos a aminoácidos, y por otro, esto permite ajustar más adecuadamente el programa a las necesidades del proyecto, como la búsqueda del inicio de los genes entre 20 posiciones antes y 20 después de la posición de inicio en la rCRS. En los siguientes apartados se resumen los procesos de transcripción y traducción y los aspectos más importantes de su implementación. 4 4. .2 2. . T Tr ra an ns sc cr ri ip pc ci ió ón n Básicamente, el proceso de transcripción consiste en usar la información contenida en la secuencia de ADN para sintetizar un tipo de ARN, el ARN mensajero, gracias a una enzima llamada ARN polimerasa. Si se tienen en cuenta las consecuencias de este proceso sobre las secuencias de ADNmt con las que estamos trabajando, el programa ha de realizar dos tareas: la primera consiste en transformar la timina (“T”) en uracilo (“U”) en toda la secuencia. La segunda solo afecta al trozo de secuencia correspondiente al gen que codifica la proteína ND6. Este trozo de secuencia debe ser invertido, es decir, el primer nucleótido pasa a ser el último, el segundo el penúltimo y así sucesivamente; además, cada nucleótido debe cambiarse por su complementario teniendo en cuenta que el complementario del uracilo (“U”) es la adenina (“A”) y el de la citosina (“C”) es la guanina (“G”). 4 4. .3 3. . T Tr ra ad du uc cc ci ió ón n Durante el proceso de traducción, el ARN mensajero sintetizado durante la transcripción da lugar a las proteínas. El encargado de este proceso es el orgánulo llamado ribosoma. En este caso, la traducción provoca que cada conjunto de tres nucleótidos, denominado codón, se transforme en un aminoácido. Por ello, determinar la posición de inicio de un gen es crítico dado que la modificación en la posición de los nucleótidos dentro del codón puede generar un aminoácido distinto al que debería obtenerse. 11 Como se ha visto en el capítulo anterior, se conoce la posición exacta de los genes en aproximadamente dos tercios del total de las secuencias, pero para el tercio restante solamente se sabe que pueden estar a una distancia de 20 posiciones de la situación conocida. Por lo tanto, para cada secuencia hay que comprobar si una vez traducida la terna de nucleótidos, esta coincide con el inicio de la proteína (que conocemos gracias a MITOMAP) y, de no hacerlo, se ha de buscar este inicio 20 posiciones hacia atrás y 20 posiciones hacia delante. Cabe comentar en este apartado una decisión que se ha tomado en lo relativo a la codificación de los aminoácidos. Al coger los nucleótidos en grupos de 3, hay 64 posibles codones, pero varios codones codifican el mismo aminoácido. En total hay 22 aminoácidos distintos de los cuales solo 20 aparecen en el ser humano. Se ha respetado la representación usada para los aminoácidos que forman parte de las proteínas, pero dado que los caracteres terminadores no tienen representación adecuada para este contexto, se ha decidido representarlos mediante una “X”. Se ha tomado esta decisión porque se ha observado que hay ocasiones en las que se producen mutaciones en estos caracteres terminadores, lo que provoca que la secuencia tenga un aminoácido más de lo normal si no codificamos el carácter terminador. Al añadir esta “X” se consigue que todas las secuencias tengan la misma longitud, condición necesaria para la generación de árboles de filogenias que se tratará en el siguiente capítulo. Además, se han detectado secuencias en GenBank a las que les falta algún fragmento, pero que están almacenadas por el valor que aportan las partes que sí están completas. Para indicar esto se rellenan las posiciones desconocidas con el carácter “N” (que no representa ningún nucleótido). Para respetar la longitud de la proteína, siempre que al menos un elemento de la terna de nucleótidos a traducir sea una “N”, se representará el codón con el carácter “X”. 4 4. .4 4. . R Re es su ul lt ta ad do os s Al comprobar si las proteínas se habían generado correctamente se vio que en 99 secuencias una o varias de sus proteínas no empezaban en la misma posición que la rCRS. Al investigar más detalladamente lo que pasaba se pudo comprobar que estas proteínas empezaban con una (o varias) “X”, por lo que la anomalía no era tal, sino que era producida por las secuencias incompletas. Para estudiar el comportamiento temporal del programa se ha calculado el tiempo para los casos mejor y peor. Hay que tener en cuenta que el caso mejor se da cuando no hay que desplazarse por la secuencia durante la traducción, lo que se da en dos de cada tres secuencias. Para el cálculo del tiempo en el caso mejor se ha utilizado la secuencia HQ012252, para la que el programa tardó 0,041751 segundos. Para el caso peor se usó la secuencia EU092740, ya que en 11 de sus 13 proteínas hay que efectuar búsquedas por la secuencia y además 8 de estás búsquedas hay que hacerlas a la derecha de la posición inicial (y el programa busca primero por la izquierda). El programa tardó en este caso 0,088041 segundos. Como se puede ver el tiempo de 12 ejecución del programa por cada secuencia es muy bajo, ya que en ningún caso llega a una décima de segundo. 13 5 5. . Á Ár rb bo ol le es s d de e f fi il lo og ge en ni ia as s A continuación se va a detallar el trabajo realizado para la construcción de los árboles filogenéticos utilizando las proteínas que se han obtenido anteriormente. Por último se va a comentar la comparación de los resultados con los árboles obtenidos directamente a partir de las secuencias de ADN mitocondrial completas del proyecto ZARAMIT [2]. 5 5. .1 1. . E Es st ta ad do o d de el l a ar rt te e Una vez cumplido el segundo objetivo propuesto, se van a utilizar los resultados obtenidos para la construcción de los árboles filogenéticos y su posterior comparación con los árboles obtenidos directamente a partir de las secuencias completas de ADNmt. Dado que el objetivo final requería la comparación de los resultados con árboles reales, se decidió utilizar el árbol creado por el proyecto ZARAMIT a partir de 4.895 secuencias de ADNmt humano. Como se explica más adelante, el tiempo de computación para la construcción de árboles con tantas secuencias es muy elevado y se utilizó la división de haplogrupos del árbol de ZARAMIT para poder trabajar con tiempos de computación más manejables. El proceso de construcción de árboles de filogenias es muy complejo y ha sido, y continúa siendo, un tema muy importante de estudio en el ámbito de la bioinformática [12–14], por lo que se ha optado por utilizar la herramienta más usada para la construcción de árboles filogenéticos, RAxML, en su versión 7.0.3 [6]. Esta herramienta construye los árboles en formato Newick [15], el mismo formato que se usa en el proyecto ZARAMIT, lo que será de gran ayuda en la fase de comparación de árboles. Una vez obtenidos los árboles era necesaria la elección de una herramienta para poder compararlos. Se eligió una de las herramientas del paquete Phylip, en su versión 3.69, llamada TEEDIST [16]. Esta aplicación permite comparar la estructura de dos o más árboles filogenéticos en formato Newick, por lo que se adecúa al objetivo del proyecto perfectamente. En la última parte del capítulo se analizan los resultados obtenidos de esta comparación. 5 5. .2 2. . C Co on ns st tr ru uc cc ci ió ón n d de e l lo os s á ár rb bo ol le es s f fi il lo og ge en né ét ti ic co os s Como se ha comentado en el punto anterior, el coste temporal de la construcción de los árboles filogenéticos es muy elevado. Para que el lector se haga una idea, generar el árbol completo para la proteína ATP6, compuesta por 227 aminoácidos, tiene un coste de 107 horas, es decir, casi 4 días y medio, siendo esta la quinta proteína con menor número de aminoácidos y aproximadamente tres veces más corta que la proteína de mayor longitud. Dado que el coste temporal superaba los objetivos del proyecto, se decidió aprovechar la división en haplogrupos que había sido efectuada por el proyecto ZARAMIT para poder tratar con árboles más manejables desde el punto de 14 vista del coste temporal. Las 4.895 secuencias con las que trabaja ZARAMIT se dividen en 26 haplogrupos de diversos tamaños. Una vez estudiado el funcionamiento de la herramienta que se ha utilizado para generar los árboles, RAxML, se ha visto que los ficheros de entrada tienen que tener formato Phylip, por lo que se ha desarrollado un pequeño programa que traduce los ficheros en los que están guardadas las proteínas a este formato. Adicionalmente, se han creado para cada haplogrupo 13 ficheros, uno por proteína, con las secuencias que pertenecen a cada uno de ellos. Se detectó que la secuencia con identificador FJ770972, incluida en el haplogrupo M, no tiene información de la proteína ATP8, por lo que se ha eliminado del fichero correspondiente. Una vez generados los ficheros, hay que lanzar una ejecución de RAxML por cada uno de los 13 ficheros que contienen las proteínas de los 26 haplogrupos, lo que hace un total de 338 ejecuciones. Para evitar tener que lanzarlas manualmente se ha creado un programa que automatiza esta tarea y mide el tiempo de ejecución de cada uno de los ficheros. Se ha utilizado el modelo evolutivo MtMam ya que es el modelo que resultó más apropiado después de analizar los distintos modelos utilizando la herramienta ProtTest. Este estudio se puede consultar en el anexo C de la memoria. En la figura 5.1 se puede observar una gráfica con los tiempos de ejecución. Figura 5.1: Gráfica de estudio de la evolución del coste temporal de RAxML según incrementa el número de secuencias y su longitud. 15 5 5. .3 3. . C Co om mp pa ar ra ac ci ió ón n d de e á ár rb bo ol le es s Una vez se han generado los árboles se ha pasado a comparar sus estructuras. Con este fin se ha utilizado TREEDIST, una de las herramientas del paquete Phylip. TREEDIST posee dos métricas distintas para la comparativa, pero se ha decidido utilizar la llamada Symmetric Difference [17], que es más precisa con los datos obtenidos en etapas anteriores. La definición de Symmetric Difference entre dos árboles es el número total de cambios que hay que hacer en el primero de los ellos para poder obtener el segundo. Teniendo en cuenta que TREEDIST sólo compara dos árboles si tienen exactamente las mismas secuencias en las hojas, se ha tenido que extraer cada uno de los subárboles de los haplogrupos del árbol de ZARAMIT, ya que en este caso el árbol está formado por las 4.895 secuencias. Para ello se ha desarrollado un programa que para cada haplogrupo crea un fichero en el que se han eliminado del árbol de ZARAMIT las secuencias que no pertenecen a dicho haplogrupo, evitando modificar en modo alguno la estructura del árbol. Con esto se ha conseguido un fichero por cada uno de los haplogrupos, en el que está almacenado su árbol filogénico. El último paso ha sido ejecutar TREEDIST para comparar estos archivos con los que contienen los árboles de filogenias que se han generado por cada una de las 13 proteínas para cada haplogrupo. 5 5. .4 4. . A An ná ál li is si is s d de e l lo os s r re es su ul lt ta ad do os s Una vez evaluados los árboles se ha utilizado la información proporcionada por TREEDIST de la métrica Symmetric Difference para analizar los resultados. Antes de continuar, aclarar que tanto en el manual de TREEDIST como en la bibliografía sobre la métrica utilizada no se trata en ningún momento la evaluación de los resultados, dejando al investigador toda responsabilidad sobre su interpretación. El número de cambios también se puede interpretar como el número de ramas únicas entre los dos árboles, por lo que obtener un resultado impar indica que al menos uno de los árboles no es binario. El total de ramas únicas posibles es de 2*n-6, según la documentación de TREEDIST, donde n es el número de secuencias situadas en las hojas del árbol. Como se conocen los cambios entre cada par de árboles es posible calcular con estos datos el porcentaje de similitud entre ambos. Esta va a ser la medida que vamos a usar para analizar los datos. En la tabla 5.1 se pueden consultar los porcentajes obtenidos para cada uno de los haplogrupos en cada una de las proteínas. Como se puede observar, la tónica es que los árboles no se parezcan demasiado. Estas son todas las conclusiones a las que se puede llegar con las métricas y herramientas actuales. Como se ha comentado en la memoria, la investigación sobre la construcción de árboles de proteínas es bastante escasa. Hasta ahora la investigación se ha centrado en construir árboles para estudiar proteínas específicas, pero no se ha profundizado en el estudio de las proteínas de las secuencias de ADN (o ADNmt, como en este proyecto). Como se ha mostrado, los árboles de ADNmt distan mucho de los árboles construidos 16 directamente a partir de las secuencias de ADN, por lo que podría ser interesante investigar la causa de este suceso. Por último destacar la dificultad de encontrar investigaciones sobre la comparación de árboles filogenéticos. La métrica utilizada fue desarrollada en 1981 por Robinson y Foulds [18] y es la única de la que se ha encontrado la suficiente documentación y herramientas para poder aplicarla, además de utilizar como entrada los árboles en el formato utilizado anteriormente. Cabe la posibilidad de que otras métricas de las que no existe implementación aportase resultados más concretos, pero eso queda fuera de los objetivos de este proyecto. 17 Tabla 5.1: Porcentaje de similitudes de los árboles filogénicos construidos a partir de proteínas con los de ZARAMIT por cada haplogrupo.