scieee Open visual document viewer

Aportación Bioinformática a la Biología de Especies Marinas

Benzekri, Hicham

Abstract

Los recursos marinos son de gran interés económico en todo el mundo. La acuicultura es el sector de producción de alimentos de mayor crecimiento y se espera que en el futuro cercano produzca más alimento para el consumo humano que la pesca de captura. Sin embargo, a diferencia de lo que ha ocurrido en los sectores agrícola, ganadero y avícola donde se han obtenido mejoras en la producción basándose en enfoques modernos de cría sustentados en genómica, las aplicaciones de los principios genéticos para las especies usadas en acuicultura es un campo reciente que ha permitido mejorar el cultivo de sólo unas pocas especies a través de tecnologías clásicas de selección genética como son las cruzas intraespecíficas e interespecíficas. La aplicación de estrategias de cultivo basadas en biotecnologías genómicas podrían tener un gran potencial ya que permitirán obtener mejoras a largo plazo a través de la identificación de diversos marcadores moleculares que faciliten los programas de cultivo selectivo, el desarrollo de peces transgénicos resistentes a enfermedades y/o con mejores índices de crecimiento, así como la aplicación de diversas técnicas moleculares para el diagnóstico y caracterización de patógenos y el diseño de vacunas moleculares más efectivas, fáciles de producir y de administrar. Así que el uso combinado de las diferentes biotecnologías permitirá potenciar la producción de especies acuícolas. Este trabajo de doctorado se ha realizado en el grupo de investigación de la Plataforma Andaluza de Bioinformática bajo la dirección del profesor M. Gonzalo Claros Díaz en cooperación el grupo de investigación de grupo de investigación de IFAPA El Toruño (Cádiz) del Dr. Manuel Manchado Campaña. El objetivo final era de realizar un análisis genómico del lenguado senegalés y el lenguado común además de otras especies afines basándonos sobre los datos de lecturas NGS, encaminado hacia la profundización en el conocimiento del transcriptoma y del genoma de estas especies, así como establecer las herramientas bioinformáticas que resultarán más útiles para dichos estudios. En gran parte, este trabajo ha sido posible gracias al personal y la infraestructura de la Plataforma Andaluza de Bioinformática (PAB), donde es posible acceder a recursos informáticos sin los que parte del trabajo hubiera sido de difícil resolución, además de aprender técnicas de programación, que han permitido que los programas desarrollados en este trabajo puedan ser ejecutados en paralelo.

Full text

AUTOR: Hicham Benzek i h p://o cid.o g/0000-0003-1064-5075 EDITA: Publicaciones y Di ulgación Cien í ica. Uni e sidad de Málaga Es a ob a es á bajo una licencia de C ea i e Commons Reconocimien o-NoCome cial- SinOb aDe i ada 4.0 In e nacional: h p://c ea i ecommons.o g/licenses/by-nc-nd/4.0/legalcode Cualquie pa e de es a ob a se puede ep oduci sin au o ización pe o con el econocimien o y a ibución de los au o es. No se puede hace uso come cial de la ob a y no se puede al e a , ans o ma o hace ob as de i adas. Es a Tesis Doc o al es á deposi ada en el Reposi o io Ins i ucional de la Uni e sidad de Málaga (RIUMA): iuma.uma.es TESIS DOCTORAL APORTACÓN BIOINFORMÁTICA A LA BIOLOGÍA DE ESPECIES MARINAS HICHAM BENZEKRI UNIVERSIDAD DE MÁLAGA Depa amen o de Biología Molecula y Bioquímica Facul ad de Ciencias y Pla a o ma Andaluza de Bioin o má ica Edi icio de Bioinno ación Málaga. junio de 2016 APORTACIÓN BIOINFORMÁTICA A LA BIOLOGÍA DE ESPECIES MARINAS Memo ia p esen ada po : Hicham Benzek i Pa a op a al g ado de Doc o po la Uni e sidad de Málaga Tesis ealizada bajo la di ección del D . M. Gonzalo Cla os Díaz en la Pla a o ma Andaluza de Bioin o má ica y el Depa amen o de Biología Molecula y Bioquímica de la Uni e sidad de Málaga Fdo. Hicham Benzek i Vº.Bº. DIRECTOR DE LA TESIS DOCTORAL: Fdo. M. Gonzalo Cla os Díaz Málaga, 11 de no iemb e de 2015 D. M. Gonzalo Cla os Díaz, In es igado de la Pla a o ma Andaluza de Bioin o má ica y el Depa amen o de Biología Molecula y Bioquímica de la Uni e sidad de Málaga. CERTIFICA: Que Don Hicham Benzek i, Ingenie o ag onomo, ha ealizado bajo mi di ección en el Depa amen o de Biología Molecula y Bioquímica y en la Pla a o ma Andaluza de Bioin o má ica de la Uni e sidad de Málaga, el abajo de in es igación ecogido en la p esen e memo ia de Tesis Doc o al que lle a po í ulo: “Apo ación bioin o má ica a la biología de especies ma inas”. T as la e isión de la p esen e Memo ia se ha es imado opo una su p esen ación an e la Comisión de E aluación co espondien e, po lo que au o izo su exposición y de ensa pa a op a al g ado de Doc o . Y pa a que así cons e, en cumplimien o de las disposiciones legales igen es, i mo el p esen e ce i icado. Málaga, 11 de no iemb e de 2015 El Di ec o de la Tesis, D . D. M. Gonzalo Cla os Díaz 5 AGRADECIMIENTOS Ag adecimien os En p ime luga quie o ag adece de mane a especial y since a al D . M. Gonzalo Cla os Díaz po acep a me pa a ealiza es a esis bajo su di ección y po habe me acili ado los medios pa a pode lle a a cabo es e abajo de in es igación. Le ag adezco sus a en as y ápidas espues as a las di e en es dudas e inquie udes su gidas du an e el desa ollo de es e abajo, su paciencia, con ianza, y odo el apoyo que me ha o ecido. Quie o exp esa ambién mi más since o ag adecimien o al D . Manuel Manchado Campaña, del g upo de in es igación de IFAPA El To uño (Cádiz), po habe inanciado el abajo de esis, po su apoyo y con ianza, y po habe sido an a en o y dispues o a esol e odas mis dudas du an e el pe iodo de in es igación. Ag adezco al D . Oswaldo T elles Salaza po habe me acogido en su depa amen o du an e un pe iodo de es a esis, y a los miemb os de su g upo de in es igación: Nono, Ja ie , Maxi, Johan, Al edo, José Manuel y Vicki, g acias po se me an ú iles en el abajo y po odos esos momen os ag adables que pasamos jun os. A los compañe os de la pla a o ma de bioin o má ica: Rocío, Da ío, Ra a, Noé, Rosa io, Isa, Ped o y Da id, muchas g acias po es a p esen es y se an a en os y amis osos. Nunca ol ida é esos momen os que pasé en es e ambien e an ag adable y lleno de ap endizaje y de buen humo . A Rocío g acias po inicia me en es e mundo de la bioin o má ica y po u ines imable ayuda y apoyo du an e odos es os años. A Noé, g acias po habe me in oducido en el abajo de la esis y po odo los que me has enseñado; a Da ío g acias po se an amable o eciéndome u ayuda en cuan o la necesi aba y po odo lo que me has enseñado; a Ra a g acias po u co dialidad y u ayuda. A los demás compañe os del Edi icio de bioinno ación: Pepi, Diego, Ca los, Xhan i y Rocío g acias po los a os ag adables que pasamos jun os du an e las comidas y po ues a simpa ía y a ec o. A mis g andes amigos que conocí en España: Said, Issam, Vic o y su no ia Luli, y Paco, les ag adezco muchísimo su apoyo y el es a an p esen es en mis momen os di íciles. A mi amilia, mis he manos, mis cuñados, mis sob inos y en especial a mis pad es, ya que sin ellos nada de es o hab ía sido posible. A odos los que con ia on en mí y me apoya on. 7 ACRÓNIMOS Y ABREVIATURAS Ac ónimos y Ab e ia u as ADN: ácido desoxi ibonucleico ARN: ácido ibonucleico ADNc: copia en ácido ibonucleico ARNm: ácido ibonucleico mensaje o ARNnc: ARN no codi ican e ARN : ácido ibonucleico ibosómico ARN : ARN de ans e encia API: in e az de p og amación de aplicaciones BAC: c omosoma a i icial bac e iano BLAST: Basic Local Alignmen Sea ch Tool CPU: Unidad cen al de p ocesamien o CEG : Co e Euka yo ic Genes dATP: i os a o de desoxiadenosina dCTP: i os a o de desoxici idina ddNTP: didesoxinucleó idos i os a o DDBJ: Banco de Da os de ADN de Japón dGTP: i os a o de desoxiguanosina dTTP: i os a o de desoxi imidina EC: Enzyme Commision EBI: Eu opean Bioin o ma ics Ins i u e EMBL: Labo a o io Eu opeo de Biología Molecula ENA: Eu opean Nucleo ide A chi e EST: e ique as de secuencias exp esadas (del inglés Exp essed Sequence Tag ) GB: gigaby e GO: Gene on ology HSP: High-sco ing Segmen Pai s HER: High-en opy egion ID: iden i icado INDEL: inse ciones y deleciones IPR: In e p o JSON: o ma o lige o pa a el in e cambio de da os (del inglés Ja aSc ip objec no a ion ) KEGG: Kyo o Encyclopedia o Genes and Genomes MID: Molecula Iden i ie miRNA: mic oARN MP: lec u as pa eadas de ipo ma e-pai NCBI: Na ional Cen e o Bio echnology In o ma ion NGS: secuenciación de nue a gene ación (del inglés nex gene a ion sequencing ) NHGRI: Na ional Human Genome Resea ch Ins i u e N : nuleó ido OLC: o e lap-layou -consensus ORF: Ma co abie o de lec u a, (del inglés open eading ame ) pb: pa es de bases 14 INDICE GENERAL III.3.1.2. A ay-Jobs ..................................................................................................... 56 III.3.1.3. Gemas de Ruby ............................................................................................. 58 III.3.1.4. Ap ana S udio ..................................................... ¡E o ! Ma cado no de inido. III.3.2. Pa a el ensamblaje de secuencias ..................................................................... 60 III.3.2.1. CAP3 ............................................................................................................. 60 III.3.2.2. Mi a ............................................................................................................... 61 III.3.2.3. EULER-SR .................................................................................................... 62 III.3.2.4. Vel e ............................................................................................................ 62 III.3.2.5. Oases ............................................................................................................. 63 III.3.2.6. SOAPdeno o- ans ........................................................................................ 64 III.3.2.7. CABOG ......................................................................................................... 65 III.3.2.8. Ray ................................................................................................................ 66 III.3.3. Pa a el a amien o y mejo a de los ensamblajes ............................................. 67 III.3.3.1. GAM-NGS .................................................................................................... 67 III.3.3.2. SOAPdeno o Sca olde ................................................................................ 69 III.3.3.3. SSPACE ........................................................................................................ 70 III.3.3.4. SOAPdeno o GapClose ............................................................................... 70 III.3.4. Pa a analiza secuencias .................................................................................. 71 III.3.4.1. SeqT imNex ................................................................................................. 71 III.3.4.2. Full-Leng he Nex ......................................................................................... 72 III.3.4.3. Au oFac ....................................................................................................... 72 III.3.4.4. Basic Local Alignmen Sea ch Tool (BLAST) .............................................. 73 III.3.4.5. Sma3s ............................................................................................................ 74 III.3.4.6. RAST ............................................................................................................ 75 III.3.4.7. Bow ie2 ......................................................................................................... 75 III.3.4.8. Sam ools ........................................................................................................ 76 III.3.4.9. CD-HIT ......................................................................................................... 77 III.3.4.10. MREPS ....................................................................................................... 77 III.3.5.11. Gigabayes .................................................................................................... 78 III.3.4.12. Table .......................................................................................................... 79 III.3.4.13. GE o ........................................................................................................... 79 III.3.4.14. NUCMER .................................................................................................... 79 III.3.5. Sc ip s esc i os ................................................................................................. 79 III.3.5.1. Pa a gene a lec u as a i iciales ................................................................... 80 15 INDICE GENERAL III.3.5.2. Pa a combina dos iche os ACE .................................................................. 80 III.3.5.3. Pa a calcula el amaño de inse o eal en lec u as pa eadas. ...................... 80 III.3.5.4. Pa a elimina ensamblajes e óneos .............................................................. 81 III.3.5.5. Pa a selecciona los ansc i os que ep esen an las sondas de mic oa ay. .. 81 III.3.5.6. Pa a calcula las es adís icas sob e los ma cado es SSR ............................... 81 III.3.5.7. Pa a solapa los con igs genómicos ............................................................... 82 III.3.5.8. Pa a la co ección au omá ica de los ensamblajes (Comine ) ....................... 82 III.3.5.9. Pa a o denamien o de los con igs o sca olds y acabado de los genomas (ICMappe ) ................................................................................................................. 83 III.4. Da os biológicos ...................................................................................................... 83 III.4.1. Secuencias ansc ip ómicas ............................................................................. 83 III.4.1.1. Pa a el ansc ip oma de Solea senegalensis ................................................. 83 III.4.1.2. Pa a el ansc ip oma de Solea solea ............................................................ 84 III.4.1.3. Pa a el ansc ip oma de Tisoch ysis lu ea ................................................... 84 III.4.2. Secuencias genómicas ....................................................................................... 85 III.4.2.1. Secuencias genómicas de Pho obac e ium damselae subsp. piscicida ............ 85 III.4.2.2. Secuencias genómicas de Solea senegalensis .................................................. 85 IV. Resul ados y discusión ................................................................................................. 89 IV.1. Algo i mos p epa a o ios. ....................................................................................... 89 IV.1.1. De inición de nue as especies con aminan es ................................................... 89 IV.1.2. Selección de las condiciones de ensamblaje de no o ......................................... 90 IV.1.2.1. Ensamblaje de ansc ip omas ...................................................................... 90 IV.1.2.2. Ensamblaje de genomas ................................................................................ 94 IV.1.2.3. Combinación de ensamblajes de a ios p og amas ....................................... 99 IV.1.2.4. Tamaño eal del inse o en las lec u as pa eadas ....................................... 101 IV.1.3. CoMine : alidación de ensamblajes ............................................................... 102 IV.1.4. O denamien o de los sca olds y acabado de los genomas ............................... 108 IV.2. Ensamblajes de ansc ip omas .............................................................................. 115 IV.2.1. Es a egia omada como modelo ..................................................................... 115 IV.2.2. T ansc ip omas de Solea senegalensis y Solea solea ........................................ 119 IV.2.2.1. P ep ocesamien o de las lib e ías ................................................................ 119 IV.2.2.2. Ensamblaje ................................................................................................. 120 IV.2.2.3. Ano ación de los ansc ip omas. ................................................................ 125 IV.2.2.4. SoleaDB, una base de da os pa a explo a los ansc ip omas de Solea ..... 126 16 INDICE GENERAL IV.2.2.5. Calidad del ansc ip oma de los dos lenguados .......................................... 130 IV.2.2.6. Análisis compa a i o en e las dos especies de lenguado ............................. 133 IV.2.2.7. Los ansc ip omas de lenguado como uen e de ma cado es molecula es .. 138 IV.2.2.8. Selección de ansc i os pa a un es udio de mic oa ay de oligonucleó idos a ealiza sob e S. senegalensis ..................................................................................... 141 IV.2.3. T ansc ip oma de la mic oalga Tisoch ysis lu ea ............................................ 142 IV.2.3.1. P ep ocesamien o de las lib e ías ................................................................ 142 IV.2.3.2. Ensamblaje .................................................................................................. 144 IV.2.3.3. Ano ación del ansc ip oma e inclusión en base de da os ......................... 145 IV.2.3.4. Análisis del ansc ip oma de Tisoch ysis lu ea .......................................... 146 IV.2.4. T ansc ip oma de Rudi apes decussa us (almeja ina) .................................... 152 IV.2.4.1. P ep ocesamien o de las lib e ías ................................................................ 152 IV.2.4.2. Ensamblaje .................................................................................................. 153 IV.2.4.3. Ano ación e inclusión en base de da os ....................................................... 154 IV.2.4.4. Análisis del ansc ip oma de R. decussa us ............................................... 155 IV.3. Ensamblajes de genoma ......................................................................................... 156 IV.3.1- Genoma de Pho obac e ium damselae subsp. piscicida ................................... 156 IV.3.1.1. P ep ocesamien o de las lec u as b u as ..................................................... 157 IV.3.1.2. Ensamblaje .................................................................................................. 159 IV.3.1.3. Mejo a del ensamblaje ................................................................................. 159 IV.3.1.4. Ano ación de los dos bo ado es de genomas .............................................. 161 IV.3.1.5. Análisis compa a i o en e las dos cepas de P. damselae subsp. piscicida .. 164 IV.3.1.6. Descub imien o de los plásmidos de L091106-03H ...................................... 168 IV.3.2. Genoma del lenguado senegalés ( Solea senegalensis ). ...................................... 170 IV.3.2.1. P ep ocesamien o de las lec u as genómicas b u as .................................... 170 IV.3.2.2. Ensamblaje .................................................................................................. 174 IV.3.2.3. E aluación del genoma ensamblado ............................................................ 177 IV.3.2.3.1. P ueba de compleción de los genes en el ensamblaje ........................ 177 IV.3.2.3.2. Con i mación de la sin enia en e los lenguados ............................... 178 IV.3.2.4. Los supe -sca olds como posibles c omosomas del lenguado senegalés ....... 180 IV.3.2.5. Validación de los supe -sca olds ................................................................. 183 IV.3.2.5.1. Localización de los ansc i os de lenguado. ..................................... 183 IV.3.2.5.2.Validación de los ma cado es molecula es del lenguado senegalés ...... 184 V. Conclusiones ................................................................................................................ 199 17 INDICE GENERAL VI. Bibliog a ía ................................................................................................................ 203 VII. Apéndices ................................................................................................................. 223 Apendice A: Sc ip pa a c ea lec u as a i iciales .......................................................... 223 Apendice B: Sc ip pa a calcula el amaño de inse o en lec u as Illumina a pa i de un iche o de mapeo (SAM) ................................................................................................. 226 Apendice C: Sc ip pa a calcula es adís icas sob e ma cado es SSR a pa i del iche o de salida MREPS ................................................................................................................ 228 Apendice D: So wa e u ilizado en las di e en es e apas del análisis de los ansc ip omas y genomas es udiados ........................................................................................................ 235 INDICE GENERAL 18 19 INTRODUCCIÓN Pa e I In oducción 20 INTRODUCCIÓN 21 INTRODUCCIÓN I. In oducción I.1. La impo ancia de la secuenciación a día de hoy La secuenciación del ADN es el p oceso de de e minación del o den p eciso de nucleó idos en una molécula de ADN. Incluye a odas los mé odos y ecnologías u ilizadas pa a de e mina el o den de cua o bases: adenina, guanina, ci osina y iamina. De e mina la secuencia de ADN es ú il en el es udio de la in es igación básica de los p ocesos biológicos undamen ales. La gené ica molecula ha acele ado signi ica i amen e la in es igación y los descub imien os en biología y causa on una e olución cien í ica en a ios campos:  En el campo de la in es igación médica, el diagnos ico de muchas en e medades es mucho más e icaz. Se puede e alua la suscep ibilidad de las pe sonas a en e medades especí icas y suminis a los medicamen os más adecuados con a es as en e medades.  En el campo legal, las p uebas de pa e nidad y o enses son más p ecisas con las ecnologías de la PCR y secuenciación.  En ganade ía y ag icul u a es á acili ando la mejo a de los animales y ege ales en elación con su capacidad p oduc i a o esis encia a las en e medades. Las écnicas de secuenciación de ADN han e olucionado mucho a lo la go de los úl imos años y han gene ado un g an impac o sob e la in es igación cien í ica aplicada a la biología y a la medicina, donde se ha pasado de secuencia los genes uno a uno de modo manual en los años 80 [1, 2] a p oyec os de secuenciación de mil o más genomas en la ac ualidad [3-5]. En los siguien es apa ados, amos a e cómo se ha pasado de la secuenciación manual de a ios cien os de nucleó idos a la secuenciación au omá ica con capila es y pos e io men e al desa ollo de la secuenciación de nue a gene ación (NGS, del inglés Nex Gene a ion Sequencing). Como la NGS gene a secuencias de 75 a 800 n de uno o a ios millones de moléculas a la ez en eacciones a escala nano ecnológica, p oducen un olumen de secuencias al que su p ocesamien o necesi a la ayuda de la bioin o má ica. La secuenciación de los o ganismos ep esen a la p ime a e apa del p oceso de ob ención de sus ansc ip omas o genomas ano ados ( igu a I.1) 22 INTRODUCCIÓN Figu a I.1: Esquema gene al del lujo de abajo pa a ob ene genomas o ansc ip omas ano ados I.1.1. Secuenciación de ipo Sange , hoy conside ado “clásico”. En 1977 se publica on a la ez el mé odo de secuenciación química de Maxan y Gilbe [6] y el mé odo de secuenciación de e minación de cadena de Sange [7], ambién conocido como mé odo enzimá ico o secuenciación po didesoxinucleó idos. Es e mé odo, esquema izado en la igu a I.2, se basa en la o mación de un ex emo 3’ e minado median e la inco po ación de didesoxinucleó idos i os a o (ddNTP) po lo que la ADN polime asa no puede segui ex endiendo al ca ece de g upo hid oxilo en 3’. La ADN polime asa sin e iza heb as complemen a ias a la que se quie e secuencia , po lo an o necesi a un cebado , un oligonucleó ido diseñado pa a que se hib ide con el ex emo 3’ de és a, además de una mezcla de dNTP (uno de ellos adiac i o) y ddNTP. Pa a lle a a cabo la secuenciación se ealizan cua o eacciones po sepa ado, cada una con un ddNTP di e en e. De es e modo se ob ienen secuencias uncadas en di e en es posiciones de 3’ del nucleó ido co espondien e a cada ubo. Es as moléculas se sepa a an po amaño en una elec o o esis, u ilizando un ca il pa a cada ubo, pa a isualiza el pa ón de bandas del que se puede deduci la secuencia [7]. F ede ick Sange ue p emiado con su segundo Nobel de química en 1980 po su con ibución en la de e minación de las secuencias de los ácidos nucleicos, compa iendo el p emio con Wal e Gilbe y Paul Be g [8], lo que puede da una idea de lo que su écnica Secuenciaci o n P ep ocesamien o Ensamblaje Sange Roche/454 Illumina Ano aci o n Algo i mos o aces Algo i mos OLC Algo i mos basados en De B uijn 23 INTRODUCCIÓN apo ó a la in es igación cien í ica, posibili ando la secuenciación, en e o os, del genoma humano [9, 10]. Figu a I.2: ( omada de h p://mol-biol4mas e s.mas e s.g k aj.o g) Mé odo de secuenciación po didesoxinucleó idos de Sange El mé odo de Sange se adap ó pos e io men e pa a la secuenciación au omá ica en capila es, sus i uyendo el ma caje con isó opos adiac i os po un ma caje con 4 luo oc omos di e en es. Con ello se consiguió ealiza la eacción en un único ubo y mig a la en un solo capila ( igu a I.3-a), años más a de las máquinas pasa on a inco po a a ios capila es (de 4 a 384) pa a pa aleliza es e p oceso. Después de es décadas de con inuo pe eccionamien o, es posible ob ene secuencias de unas 1000 pb con una iabilidad del 99,999 % y con un cos e de unos 0,5 $ po kilobase (Figu a I.4). 30 INTRODUCCIÓN Figu a I.8: ( omada de [34]) Compa ación en e las écnicas de secuenciación (a) ex emos empa ejados (pai ed-end) y (b) pa ejas conjugadas (ma e-pai ) I.2. Recons ucción de agmen os de secuencias I.2.1. P ep ocesamien o. Después de ob ene las lec u as de una secuenciación es indispensable p ep ocesa las pa a elimina los elemen os que p o ienen de la manipulación del ADN o del ARN en el labo a o io. Así se ob end á únicamen e la pa e ú il y se desca an los agmen os de baja calidad, con aminan es, ec o es, adap ado es [35], y o os a e ac os. En las nue as ecnologías, además, es posible encon a o os elemen os nue os que se deben conside a en el p ep ocesamien o. Po ejemplo, el e ique ado con MID (Roche) u o as e ique as implica que hay que e i a las de la secuencia inal, y además hay que usa las pa a ag upa las lec u as po expe imen os. En esumen, la calidad y la iabilidad del pos e io ensamblaje 31 INTRODUCCIÓN depende á de un buen p ep ocesamien o [36] ya que, de o a mane a, los consensos ob enidos pod ían con ene nume osos e o es. Ya exis en p og amas pa a p ep ocesa secuencias de ipo Sange , como SeqClean ( h p://compbio.d ci.ha a d.edu/ gi/so wa e /), Lucy [37], ESTP ep [38] y SeqT im [36]. Algunas he amien as bioin o má icas como TagCleane [39] y No oBa Code (No oc a ) se han diseñado pa a iden i ica los MID y o as e ique as, y clasi ica las secuencias p oceden es de los di e en es expe imen os. En Galaxy [40] ( h ps://usegalaxy.o g ) se puede accede a dis in as he amien as, como po ejemplo Fas QC, G oome , Spli e , e c., pa a mon a un lujo de abajo de limpieza. En cuan o a los con aminan es, los más comunes en el labo a o io suelen se hongos y bac e ias, sob e odo p oceden es de la izos e a [41]. También se conside an con aminan es los es os de ejidos humanos p oceden es de los in es igado es y mic oo ganismos u ilizados con ecuencia en el labo a o io, como E.coli [42] y Ag obac e ium ume aciens [43], es e úl imo sob e odo cuando se abaja con plan as. Cuando se a a de la secuenciación o ganismos animales, ambién se conside an con aminan es los o ganismos que se u ilizan como alimen ación y/o las especies de bac e ias que no malmen e in ec an al o ganismo es udiado. Si no se eliminan las secuencias p oceden es de o ganismos con aminan es se co e el iesgo de conside a las pa e del o ganismo que se es á es udiando [44]. Pa a la de ección y eliminación de secuencias con aminan es exis en p og amas como DeconSeq [45]. Ninguno de los p og amas an e io es se bas a po sí solo pa a un buen p ep ocesamien o. Po eso, pa a la NGS se desa olla on nue as he amien as bioin o má icas especializadas como SeqT im-Nex [46] o el paque e Galaxy [40]. Después del p ep ocesamien o de las lec u as iene la e apa de su ensamblaje en secuencias más la gas. Exis en a ios algo i mos de ensamblaje: I.2.2. Concep os básicos sob e ensamblaje de secuencias Un ensamblaje (o mon aje) de secuencias se e ie e al alineamien o y mezcla de mul iples agmen os de una secuencia de ADN mucho mayo pa a econs ui la secuencia o iginal. En el ensamblaje las lec u as se ag upan en con igs y los con igs en sca olds. Los con igs ep esen an el alineamien o mul iple de lec u as (o agmen os de lec u as). Los sca olds (a eces llamados supe con igs o me acon igs) de inen el o den y la o ien ación de los con igs y las longi udes de los huecos en e los con igs ( igu a I.9). 32 INTRODUCCIÓN Figu a I.9: ( omada de [47]) Es a egia de secuenciación u ilizando secuencias pa eadas. A pa i de las lec u as gene adas en un p oyec o de secuenciación de cualquie ecnología o es a egia, se ob ienen las secuencias consenso de los con igs median e el ensamblaje con un p og ama in o má ico. Las secuencias de los con igs se o ganizan en onces o mando un sca old basándose en la in o mación de las secuencias pa eadas pa a o dena con igs no solapan es. Finalmen e los sca old pueden o dena se igual que el genoma iden i icando en ellos ma cado es que se conozcan en el genoma, como po ejemplo STS, ma cado es molecula es y genes (cí culos ojos) Exis en dos ipos p incipales de ensamblaje: Ensamblaje compa a i o (po mapeo) Basándose en un genoma secuenciado p e iamen e y que suponemos sea simila al que se quie e ensambla . El p ocedimien o básico a a á de coloca cada una de las lec u as en la posición adecuada u ilizando el genoma de e e encia como guía. Ensamblaje de no o In en a econs ui la secuencia de ADN comple a a pa i de las lec u as sin ningún ipo de conocimien o p e io ace ca del genoma a ensambla . Busca lec u as cuyo inal coincida con el p incipio de o a de o ma que se puedan uni pa a o ma agmen os mayo es has a comple a el genoma. I.2.3. Algo i mos o aces ( g eedy ) Los p ime os ensamblado es de NGS u ilizaban algo i mos o aces [48, 49] que aplican heu ís icas en cada ase del algo i mo median e la cuales p e enden busca soluciones pa ciales óp imas y una ope ación básica: dada una lec u a o con ig, añade una lec u a o 33 INTRODUCCIÓN con ig más. Es a ope ación se epi e has a que no sea posible. Cada ope ación u iliza el solapamien o con más pun uación pa a gene a la siguien e unión. La unción de pun uación mide, en e o os indicado es, el núme o de bases coinciden es en el solapamien o. De es a mane a, los con igs c ecen po ex ensión omando la lec u a que se encuen a po el siguien e solapamien o con más pun uación. Los algo i mos o aces pueden a asca se cuando un con ig pun ual oma lec u as que deben se de o os con igs. Los algo i mos o aces son implíci amen e algo i mos de g a os ya que simpli ican d ás icamen e el g a o al conside a sólo los enlaces con más pun uación, como op imización pueden ins ancia sólo un solapamien o po cada lec u a que examinan y pueden ambién desca a cada solapamien o inmedia amen e después de la ex ensión del con ig. Al igual que odos los ensamblado es, los algo i mos o aces necesi an mecanismos pa a e i a inco po a solapamien os alsos en los con igs, un ensamblado que se base en solapamien os alsos uni á secuencias no elacionadas a cualquie lado de una epe ición. El p ime ensamblado desc i o pa a las lec u as co as ue SSAKE [50] que se diseñó pa a lec u as no pa eadas de longi ud uni o me. SHARCGS [51] ambién abaja con longi udes uni o mes, al a cobe u a y lec u as co as no pa eadas, pe o añade una uncionalidad de p e- y posp ocesado a SSAKE. El p ep ocesado il a lec u as e óneas median e comp obación de un núme o mínimo de coincidencias exac as de máxima longi ud en o as lec u as. VCAKE [52] es o o algo i mo de ex ensión i e a i o dis in o a SSAKE y a SHARCGS, puede inco po a coincidencias impe ec as du an e la ampliación de los con igs. VCAKE se u ilizó en combinación con NEWBLER [12] en una in eg ación pa a da os híb idos de Solexa y 454 [53]. O a in eg ación combinó NEWBLER y el CELERA ASSEMBLER [10, 54] pa a da os híb idos de 454 y Sange [55]. Ambas in eg aciones ompen los con igs del p ime ensamblado pa a p oduci pseudolec u as adecuadas pa a el segundo ensamblado . Es a úl ima in eg ación ajus a la cobe u a de lec u a y los indicado es de calidad en las pseudolec u as que gene a, lo cual ayuda al segundo ensamblado a da un peso a los con igs con g an cobe u a desde el p ime ensamblaje. I.2.4. Algo i mos de solapamien o-composición-consenso (OLC). La es a egia OLC (del inglés o e lap-layou -consensus ) ue ampliamen e u ilizada en los ensamblado es pa a da os Sange y ue op imizada pa a genomas g andes en di e sos ipos de so wa e incluyendo el CELERA ASSEMBLER [10, 54], ARACHNE [56] y CAP y PCAP [57], EDENA, CABOG, TIGR, ATLAS, PHRAP, PHUSION y SHORTY, ha sido es udiada ampliamen e [58]. Los ensamblado es que u ilizan es a es a egia es án muy o ien ados a ensamblajes de no o , u ilizan un g a o de solapamien os y ope an ejecu ando es ases: (i). Búsqueda de solapamien os median e la compa ación de lec u as pa eadas odas con a odas. El so wa e p ecalcula los k-me os con enidos en odas las lec u as, selecciona 34 INTRODUCCIÓN los solapamien os candida os que compa en dichos K-me os y calcula las alineaciones u ilizando un K-me o como semilla. El descub imien o de solapamien os es sensible al amaño de los K-me os, a la longi ud mínima de solapamien o y al po cen aje mínimo de iden idad eque ido en dichos solapamien os. El compo amien o de es os pa áme os se e a ec ado po los e o es de secuenciación y una baja cobe u a. Valo es mayo es conducen a una mayo p ecisión pe o con con igs más co os. (ii). La cons ucción y manipulación de un g a o de solapamien os conduce a un diseño del g a o basado en un conjun o de lec u as ep esen a i o, es deci , el g a o no necesi a inclui odas las secuencias base, po lo que es os g a os pueden u iliza se en g andes genomas ya que pueden ajus a el amaño del g a o a la can idad de memo ia que u ilizan. (iii). Gene ación de la secuencia consenso median e un alineamien o múl iple de lec u as, aunque no haya un mé odo e icien e pa a calcula la [59]. Es a ase se puede ejecu a en pa alelo, po con igs. Exis en dos ensamblado es que aplican la es a egia OLC a lec u as co as de las pla a o mas Illumina y SOLiD: el so wa e EDENA [60], que ue desa ollado pa a lec u as no pa eadas de longi ud uni o me, desca a lec u as duplicadas y busca odos los solapamien os pe ec os lib es de e o es. Elimina solapamien os indi iduales que son edundan es con o os solapamien os median e una aplicación del algo i mo de educción de solapamien os ansi i os [61]. El o o so wa e es SHORTY [62] que a a el caso especial donde unas pocas lec u as pueden ac ua como semillas pa a consegui lec u as co as y sus ex emos empa ejados, y median e i e aciones u iliza con igs como semillas pa a gene a nue os con igs. I.2.5. Algo i mos basados en g a os de De B uijn Es a e ce a ap oximación pa a ensamblaje de secuencias se u iliza p incipalmen e pa a lec u as co as de las pla a o mas de SOLiD e Illumina. Se basa en g a os de ecuencias de K-me os pa a a a g andes can idades de lec u as co as, ya que los g a os de K-me os no equie en el análisis de odos los solapamien os median e la comp obación de odos con a odos, ni ampoco es necesa io almacena las lec u as indi iduales en sus solapamien os, ni ampoco comp ime las secuencias epe i i as. Po el con a io, los g a os de K-me os no man ienen secuencias o iginales y son g andes consumido es de memo ia pa a g andes genomas, aunque con los sis emas de memo ia dis ibuida se compo an bas an e bien [63]. Al inal, el g a o de De B uijn hay que esol e lo con una es a egia eule iana ( igu a I.10) que se basa en las siguien es e apas: (i). F agmen ación de las lec u as secuenciadas en una colección de oligome os (K-me os), donde odas las lec u as ienen la misma longi ud (k). Los cebado es edundan es se comp imen en uno solo pa a educi la complejidad del análisis, aunque se conse a la in o mación del núme o de eces que se epi en. Los alo es de k suelen asigna se en e 19 y la longi ud de las lec u as; en la p ác ica, es os alo es suelen escoge se basándose en un 35 INTRODUCCIÓN expe imen o p e io con da os simila es [64]. Es a agmen ación de lec u as e i a el paso limi an e de ene que compa a odas las secuencias en e sí. Figu a I.10: ( omada de h p://www.homolog.us ) Di isión de una lec u a en k-me os y cons ucción de un g a o de De B uijn con el conjun o de k-me os pa a econs ui la lec u a o iginal (ii). Cons ucción de un g a o de De B uijn con el conjun o de k-me os, de modo que cada nodo con iene un k-me o de longi ud k – 1 que se solapa exac amen e en k – 2 nucleó idos con o os nodos. (iii). Búsqueda de los caminos eule ianos que econs uyen la secuencia o iginal de la que p oceden odas las lec u as elacionadas. Es a es a egia se e muy a ec ada po las epe iciones y po los e o es de secuenciación que los ensamblajes po solapamien o [63]. Además, como el ADN es de doble cadena, a la ho a de econs ui los caminos eule ianos puede da se el caso que algún k-me o apa ezca en el sen ido de la ansc ipción y o o en an isen ido, p o ocando secuencias consenso a e ac uales. Algunos ejemplos de los ensamblado es más popula es que u ilizan es a es a egia son Eule -SR [65], Vel e [11], SOAPdeno o [66] y ABySS [67] y el Ray [68] (es e úl imo pe mi e la pa alelización del ensamblaje). I.2.6. Es a egias pa a la secuenciación de ansc ip omas. La secuenciación de pools de ADNc a menudo se u iliza pa a ca ac e iza el ansc ip oma de un o ganismo de un modo ápido y ba a o. El ansc ip oma de un o ganismo engloba al conjun o de genes que se exp esan (EST) en una célula o conjun o de células, que incluyen an o a los ARN que codi ican p o eínas como los no codi ican es (ARNnc). Es e ipo de secuenciación p opo ciona in o mación sob e los genes de un o ganismo a bajo cos e en compa ación con la secuenciación de genomas, ya que solo se 36 INTRODUCCIÓN in es igan las egiones que se ansc iben, en luga del genoma comple o. La gene ación de EST a pa i de ARNm se conside a la es a egia más ecuen e y más ú il pa a descub i genes [69]. En los casos en los que el análisis ansc ip ómico es á en ocado a es udia los genes que codi ican p o eínas, es impo an e u iliza secuencias de ARN en iquecidas en poli - (A)+, ya que de es e modo se educe en g an pa e los ARN no deseados, como los ARN pequeños y los abundan es ARN ibosómicos (ARN ). También es deseable ealiza la no malización de las mues as de ARN, ya que así se educe la apa ición de los ansc i os más abundan es y se aumen a la de los poco abundan es [70]. I.2.7. Es a egias pa a la secuenciación de genomas En la ac ualidad se u ilizan p incipalmen e dos es a egias pa a abo da la secuenciación de genomas, BAC a BAC (c omosomas a i iciales de bac e ias), o median e la secuenciación de odo el genoma (WGS, del inglés whole genome sequencing). La elección de la es a egia más ap opiada depende á del amaño y de la complejidad del genoma que se quie e secuencia , así como de las ecnologías u ilizadas y del p esupues o disponible. O a opción más ba a a y ápida consis e en la secuenciación del ansc ip oma pa a el es udio de los genes que se exp esan (EST, e ique as de secuencias exp esadas, del inglés exp essed sequence ags) en de e minadas condiciones expe imen ales, ú il pa a ob ene in o mación en especies no modelo con genomas complejos. BAC a BAC: El genoma o un c omosoma que se quie e secuencia se ocea en agmen os solapan es de meno amaño (100 a 200 kpb ap oximadamen e) que se clonan en ec o es BAC ( igu a I.11-A.1). Después se seleccionan los BAC y se o denan en un mapa ísico ( igu a I.11-A.2). Al inal, cada BAC se secuencia po sepa ado as una diges ión pa cial con una enzima de es icción que p oduci á agmen os solapan es al aza , en lo que se conoce po el é mino inglés sho gun ( igu a I.11-A.3). Al secuencia los BAC de uno en uno se consigue educi la complejidad del ensamblaje, de modo que es a es a egia puede esul a ú il pa a genomas con g an can idad de epe iciones. Sin emba go, c ea la geno eca de BAC y mapea cada clon sob e el genoma supone una eno me can idad de es ue zo, además de conlle a mucho iempo y un g an cos e económico. Po eso, es a écnica se es á u ilizando cada ez menos ( igu a I.12). WGS: En es a es a egia se e i a la gene ación de geno ecas BAC agmen ando di ec amen e el genoma al aza en elemen os solapan es de meno amaño ( igu a I.11-B.1). Los agmen os se secuencian di ec amen e con ecnologías de NGS ( igu a I.11-B.2), o se clonan p ime o y se secuencian después en el caso de las ecnologías de secuenciación basadas en capila es. Debido a su mayo sencillez, es a es la es a egia de secuenciación de genomas más u ilizada hoy en día ( igu a I.12). A di e encia del caso an e io , aquí oda la complejidad de la secuencia del genoma end á que esol e se con aplicaciones bioin o má icas, ya que no se dispone de ninguna in o mación o ien ado a. 37 INTRODUCCIÓN Figu a I.11: Compa ación de las es a egias de secuenciación (A) BAC a BAC, y (B) WGS Figu a I.12: ( omada de [71]) Núme o de genomas secuenciados cada año desde 1995. (a) Núme o de genomas secuenciados u ilizando WGS y con o as es a egias. (b) Cada columna indica el amaño acumulado (en miles de millones de pa es de bases) de los genomas secuenciados po WGS (columna de la izquie da) y po o os mé odos (columna de la de echa) 38 INTRODUCCIÓN I.3. Ano ación de los ensamblajes I.3.1. Se ano a po simili ud Una ez se han ensamblado los unigenes de un ansc ip oma o se han econs uido las egiones genómicas, se p ocede a ano a las secuencias ya que el in e és de ene las secuencias de un ansc ip oma o de un genoma eside en la ob ención de in o mación biológica que pe mi a segui p o undizando en el uncionamien o de los o ganismos y su elación con el en o no. Es e inc emen o de conocimien o cien í ico pod á pos e io men e aduci se en aplicaciones p ác icas que conlle en bene icios económicos y mejo as en la calidad de ida. La ano ación de genes se lle a a cabo habi ualmen e de un modo au omá ico e in o ma izado. Exis en muchas he amien as bioin o má icas lib es, como Blas [72], que esul a de g an u ilidad pa a encon a pa ecidos signi ica i os con genes conocidos que es án almacenados en las bases de da os. La ano ación po simili ud de secuencia iene algunas limi aciones, en especial en los o ganismos no modelo, donde el núme o de genes con ano aciones es meno , sob e odo po que se basan p incipalmen e en la in o mación que se conoce de especies modelo como A abidopsis haliana [31] y el pez ceb a ( Danio e io ). La ano ación basada en simili ud se á an exac a como la ano ación de las secuencias almacenadas en las bases de da os con las que se compa a. Pa a compa a las secuencias de nucleó idos de los unigenes ob enidos du an e el ensamblaje de un ansc ip oma suele emplea se con ecuencia Blas x con bases de da os que con ienen p o eínas conocidas, como Re Seq_p o ein de GenBank [73] o Swiss-P o y T EMBL, ambas de UniP o [74]. Es as dos bases de da os de secuencias de p o eínas, ienen di e en es ni eles de ano ación. Po ejemplo, Swiss-P o es á e isada manualmen e, y T EMBL, u iliza ano aciones au omá icas p oceden es de e e encias c uzadas [74]. Suele se ecuen e, cuando se abaja con especies no modelo, encon a se una g an can idad de o ólogos de unción desconocida. Además hay que ene en cuen a que si no se oman las p ecauciones adecuadas que consis en en la eliminación de los con aminan es en las lec u as o iginales y de los con igs quime icos, a eces se inco po an a las bases de da os secuencias con e o es de ano ación o secuencias que ealmen e son con aminan es o a e ac os [44]. Si se conside a como buena una secuencia mal ano ada, es e e o ambién se man end á en nues as secuencias ano adas po simili ud. También exis e la posibilidad de ano a con Blas n pa a con i ma que los ansc i os econs uidos con el ensamblaje ue on secuenciados ambién en o os expe imen os de EST. I.3.2. Ano aciones bioin o má icamen e ú iles G acias a la ano ación po simili ud se puede en iquece la in o mación de los ansc i os econs uidos con una de inición y con o os elemen os de ano ación, como la on ología de genes (GO, del inglés Gene On ology ) [75], las u as me abólicas en las que in e ienen los ansc i os, ecogidas en los mapas KEGG [76], los dominios p o eicos egis ados en In e P o [77], y en caso de ene ac i idad enzimá ica, el código de la EC (del 39 INTRODUCCIÓN inglés, Enzyme Commission ), además de o as ano aciones no uncionales como SNP, SSR y miRNA. Gene On ology: El obje i o del conso cio de la GO es p oduci un ocabula io con olado y dinámico, aplicable a odos los se es i os, incluso aunque el conocimien o ace ca de la unción de los genes y de las p o eínas en las células es é en con inuo cambio [75]. Con es e in, se desa olla on es on ologías independien es: p ocesos biológicos, unciones molecula es y componen es celula es. La GO, como odas las on ologías, man iene un lenguaje con olado que es ú il pa a las pe sonas y pa a los o denado es, ya que cada elemen o de la on ología iene un código numé ico (po ejemplo, GO:1234567) p ác ico pa a los análisis bioin o má icos, y una desc ipción in o ma i a pa a los usua ios. Además, la GO man iene una elación je á quica en e sus elemen os. La je a quización de elemen os pe mi e la ano ación a dis in os ni eles, debido al colapsamien o de ano aciones di e en es de la misma ama. Es as on ologías es án disponibles en h p://www.geneon ology.o g/ Mapas KEGG: Los mapas de u as me abólicas de KEGG son diag amas g á icos que ep esen an in e acciones molecula es y edes me abólicas, p ocesos con in o mación gené ica, ambien al, p ocesos celula es, sis emas o gánicos y en e medades humanas [76]. Se pueden consul a en h p://www.genome.jp/kegg/ , y son de g an u ilidad pa a elaciona en e sí los genes que pa icipan en una misma u a, algo muy ú il cuando se ealizan análisis uncionales. Código EC: La Comisión In e nacional pa a Enzimas se c eó en 1956 en la Unión In e nacional de Bioquímica y Biología Molecula pa a e i a que la misma enzima ecibie a di e en es desc ipciones o nomb es. Su unción ue apo a un nomb e desc ip i o sob e la eacción que ca aliza la enzima, y un código único pa a cada unción enzimá ica. Las enzimas se nomb an con cua o núme os sepa ados po pun os, EC 1.2.3.4, donde el p ime núme o da la ca ac e ís ica más gené ica y los siguien es son cada ez más especí icos. Así, el p ime núme o puede oma 6 alo es; 1 pa a oxido educ asas, 2 pa a las ans e asas, 3 pa a las hid olasas, 4 pa a las liasas, 5 pa a las isome asas y 6 pa a las ligasas. Todo lo e e en e con es os códigos se puede encon a en h p://www.chem.qmul.ac.uk/iubmb/enzyme/ . Eso sí, solo las p o eínas con ac i idad enzimá ica end án un código EC. In e P o: La base de da os In e P o in eg a modelos p edic i os de a ios eposi o ios (P am, PRINTS, PROSITE, SMART, P oDom, PIRSF, SUPERFAMILY, PANTHER, CATHGene3D, TIGRFAMs y HAMAP). Cada uno se cen a en di e en es aspec os biológicos o u iliza una me odología dis in a pa a encon a el denominado común de las secuencias. El p opósi o de In e P o es combina los pun os ue es de cada uno de los eposi o ios pa a pone a disposición de la comunidad cien í ica una única uen e con in o mación es uc u ada sob e amilias de p o eínas, dominios y egiones uncionales [77]. In e P o es á disponible en h p://www.ebi.ac.uk/in e p o/ . Exis e una he amien a que se dedica exp esamen e a encon a los dominios In e P o pa a una colección de p o eínas conc e as: In e P oScan ( h p://www.ebi.ac.uk/Tools/p a/ip scan/ ). 46 INTRODUCCIÓN Sis emas ope a i os: UNIX OSX 10.6: Sus comandos se u iliza on pa a la ejecución de p og amas y pa a la isualización y manipulación de da os en gene al. UNIX SLES 10.2.5: Suse Linux En e p ise Se e se u ilizó pa a la ejecución de p og amas en el sis ema de colas de los supe compu ado es Picasso Supe Dome y Picasso - clus e , y pa a la consul a y manipulación de da os en gene al. I.5. In e és económico de las especies ma inas Los ecu sos ma inos son i ales dada la c ecien e demanda mundial de p o eína animal, de i ada del aumen o demog á ico (8 mil millones de se es humanos pa a 2030) y de los hábi os die é icos ac uales, que elacionan la salud y el consumo de pescado [95, 96]. El pescado es conside ado un alimen o undamen al en la die a, ya que apo a p o eínas de ácil diges ión, ácidos g asos esenciales de la se ie n-3 e impo an es mine ales y i aminas, sob e odo A y D [97]. Su consumo ayuda a un adecuado equilib io de ácidos g asos poliinsa u ados n-3/n-6, elacionado con la exp esión génica, lo que p e iene de modo na u al algunas de las ac uales en e medades c ónicas o degene a i as [98]. La p oducción pesque a mundial ha aumen ado de o ma cons an e en las úl imas cinco décadas ( igu a I.14). El suminis o de peces comes ibles se ha inc emen ado a una asa media anual del 3,2 %, supe ando así la asa de c ecimien o de la población mundial del 1,6 %. El consumo apa en e mundial de pescado pe cápi a aumen ó de un p omedio de 9,9 kg en la década de 1960 a 19,2 kg en 2012, según las es imaciones p elimina es [99]. Es e inc emen o no able se ha debido a una combinación de c ecimien o demog á ico, aumen o de los ing esos y u banización, y se ha is o p opiciado po la ue e expansión de la p oducción pesque a y la mayo e icacia de los canales de dis ibución. Una g an pa e de los ecu sos ma inos son ob enidos a pa i de p oduc os de la pesca ex ac i a ( igu a I.14). Mien as la p oducción mundial de es e ipo de pesca conoce una es abilidad en las úl imas décadas, la p oducción de la acuicul u a sigue c eciendo y es á alcanzando mundialmen e un desa ollo espec acula ( igu a I.14), lo que lo con ie e en el sec o alimen a io de más ápido c ecimien o. Es a endencia iene que man ene se o subi , pa a sus en a los ac uales ni eles de consumo de p oduc os pesque os, pues la población mundial sigue su aumen o geomé ico. 47 INTRODUCCIÓN Figu a I.14: ( omada de [99]) P oducción mundial de la pesca de cap u a y la acuicul u a Aunque sea de ela i amen e ecien e apa ición, la acuicul u a se ha ca ac e izado po demanda desde el p incipio una di e si icación de especies que se puedan p oduci indus ialmen e. F u o de es a p ecocidad, se emp endie on de o ma gene alizada nume osas ac uaciones di igidas a conoce las posibilidades de cul i o de un no ablemen e ele ado núme o de peces. Du an e los úl imos es lus os, son más de ein a las especies de peces que han sido obje i o de es udio en el á ea medi e ánea [100]. Sin emba go, es e es ue zo se ha is o poco e lejado en la p oducción acuícola, que con inúa monopolizada po las especies inicialmen e desa olladas, es deci : do ada ( Spa us au a a ) y lubina ( Dicen a chus lab ax ). Las azones pa a es e des ase se pod ían esumi en la di icul ad ecnológica y la inadecuada posición de me cado de las nume osas especies explo adas. En España, es as dos especies jun o con los mejillones o man las especies de acuicul u a pione as y ampliamen e come cializadas. En la igu a I.15 se puede e el alo de la p oducción de és as en compa ación con o as menos come cializadas. Sin emba go, la sa u ación alcanzada en el me cado po su p oducción ha aído consigo la di e si icación de especies acuícolas como el cul i o del besugo ( Pagellus boga a eo ), el pa go ( Pag us pag us ), el abadejo ( Pollachius pollachius ), la co ina ( A gy osomus egius ), el a ún ( Thunnus hynus ) y el lenguado senegalés ( Solea senegalensis , Kaup 1858). És e, jun o con el lenguado común ( Solea solea ), desde los úl imos ein a años apa ecen en el su de Eu opa como unos buenos candida os pa a la di e si icación de los me cados eu opeos. Una ez supe ados los p oblemas iniciales, el lenguado ha demos ado se una p ome edo a especie pa a la acuicul u a ma ina [101]. Exis en es udios elacionados con su acuicul u a en el li o al gadi ano y en es ua ios po ugueses de hace ya más de ein e años [102]. Uno de los p incipales p oblemas con los que se encon ó el cul i o del lenguado en sus inicios ue on las bajas asas de c ecimien o en ju eniles y la apa en e g an suscep ibilidad a en e medades, sob e odo pas eu elosis, ib iosis, mixobac e iosis y en e medades i ales. Es os p oblemas han sido en pa e sol en ados a lo la go del iempo median e la mejo a de las die as y el es udio del es és debido a las g andes densidades de cul i o. Sin emba go 48 INTRODUCCIÓN exis en o os p oblemas elacionados con la ep oducción en cau i idad, el cul i o la a io, la nu ición y la espues a immuni a ia. Las cuales pod ían se sol en ados más ácilmen e median e un conocimien o en p o undidad de los mecanismos molecula es y isiológicos implicados. Figu a I.15: ( omada de [103]) Valo de la p oducción (p ime a en a) de las especies de acuicul u a ma ina (po g upos) en España en 2012, en millones de eu os (JACUMAR) 49 OBJETIVOS Pa e II Obje i os 50 OBJETIVOS OBJETIVOS 51 II. Obje i os El obje i o gene al de es a esis es de mejo a el conocimien o a ni el genómico del lenguado senegalés ( Solea senegalensis ), el lenguado común ( Solea solea ), y de algunas especies a ines a a és de un análisis bioin o má ico y del desa ollo de p o ocolos de almacenamien o de los da os genómicos de es as especies, po el in de suminis a elemen os ú iles que puedan ab i ías en la mejo a gené ica de las mismas. Pa a ello se selecciona án las mejo es he amien as bioin o má icas disponibles y se op imiza á su uso pa a saca un endimien o óp imo de los da os b u os disponibles. Así mismo, se desa olla án aquellas nue as he amien as y lujos de abajo que sean necesa ias pa a acili a el a amien o de los da os y mejo a la calidad de los esul ados. Tan o los da os o iginales como los p ocesados se in eg a án inalmen e en una base de da os pa a o ece a la comunidad cien í ica un ansc ip oma y genoma depu ado con las ano aciones más ú iles. Los obje i os gene ales p esen ados an e io men e pueden desglosa se en los siguien es subobje i os más especí icos: 1- Selección y compa ación de los p og amas de ensamblaje de las secuencias disponibles de una pa e los p og amas especí icos de lec u as la gas, de o a pa e aquellos especí icos de lec u as co as. Además, es ablece un modelo pa a el es eo, selección y op imización de los p og amas de ensamblaje que se an a u iliza y mé odos pa a su uso combinado. 2- Desa ollo de lujos de abajo pa a el ensamblaje del ansc ip oma y del genoma de la especies p oblema de es e abajo. Es os lujos incluyen an o las he amien as disponibles en la bibliog a ía como las he amien as p opias con el in de u iliza los dos ipos de da os (lec u as la gas o co as) o una combinación de ambos, y p opo ciona el esul ado más op imizado pa a la pos e io ano ación. 3- Inclusión la in o mación en una base de da os web p e iamen e desa ollada que pe mi a almacena los da os de modo es uc u ado y ex ensible pa a acili a el acceso a ellos po pa e de la comunidad cien í ica. Apo a unas mejo as a la base de da os an o en los ipos de in o mación disponible como en la in e az, je a quía y o ganización de los da os así que la o ma de accede a ellos. 52 OBJETIVOS Figu a II.1: Esquema de los obje i os. C eación de lujo comple o de ensamblaje de las lec u as de ansc ip omica. Elabo ación de he amien as pa a el es eo y selección p e ia de los ensamblado es usados y o as pa a la pos e aluación y la mejo a de los esul ados. Pos e io men e la in o mación se in eg a en bases de da os disponibles pa a la comunidad cien í ica 53 Pa e III Ma e iales y mé odos 54 MATERIALES Y MÉTODOS MATERIALES Y MÉTODOS 55 III. Ma e iales y mé odos III.1. Equipos in o má icos Du an e el desa ollo de es a esis se han u ilizado a ios o denado es pe sonales y supe compu ado es, odos ellos con sis ema UNIX. Los supe compu ado es o man pa e de la in aes uc u a del Cen o de Supe compu ación y Bioin o má ica que la Uni e sidad de Málaga iene en el edi icio de Bioinno ación del Pa que Tecnológico de Andalucía. Has a 2012, el abajo de es a esis se ealizó en dos supe cumpu ado es: Picasso Supe Dome y Picasso-Clus e . Picasso-clus e : Se a a de un clus e de 80 núcleos In el Xeon E5450 a 3,00 GHz (con a qui ec u a x86) y con 160 GB de RAM, di ididos en 10 blades con 8 núcleos y 2 GB de RAM pa a cada uno. Los blades es án in e conec ados po ed In iniBand. El ges o de colas es PBS P o y el sis ema ope a i o es el Suse Linux En e p ise Se e . 10.2.5. Picasso: se a a de un HP Supe Dome con 128 núcleos In el I anium2 a 1,6 GHz y con 400 GB de memo ia compa ida. O denado y memo ia se encuen an en dos acks conec ados en e sí. Un e ce ack con iene el sis ema ope a i o y el sc a ch (espacio del disco du o pa a el almacenamien o de da os empo ales). El ges o de colas es PBS P o y el sis ema ope a i o es el Suse Linux En e p ise Se e . 10.2.5. A p incipios del año 2013, se ac ualiza on odos los ecu sos de supe compu ación, y odas las maquinas compa en aho a la misma a qui ec u a y es án uni icados con un único sis ema de cola que en ía los abajos a los nodos más adecuados. Las nue as ins alaciones se componen en a ios ipos de máquinas:  Clús e In el E5-2670 con 768 co es a 2.60 GHz po co e y con un RAM o al de 3 TB y dispone de una ed in iniband.  Máquinas de memo ia compa ida con 2 TB de RAM cada una. Tiene 560 co es a 2.40 GHz po co e. Dispone de una ed in iniband.  Clús e AMD Op e on 6176 con 984 co es, 4 TB de RAM y 246 TB de sc a ch.  Clús e de isualización ESX pa a máquinas i uales : o 2 máquinas a 2.66 GHz y 32 GB de RAM cada una. o 3 máquinas a 2.66 GHz y 16 GB de RAM cada una. o 4 máquinas a 2.13 GHz y 124 GB de RAM cada una. o Almacenamien o compa ido con un o al de 750 TB (b u os). 62 MATERIALES Y MÉTODOS Pa a más in o mación consúl ese el manual del p og ama, mencionado al comienzo de es e apa ado. MIRA3 ue uno de los p og amas que u ilizamos pa a ensambla las lec u as la gas de los ansc ip omas a ados en es e abajo. III.3.2.3. EULER-SR EULER [110] es un algo i mo pa a ensamblaje de secuencias co as y de los p ime os que u iliza un camino eule iano implemen ado median e un g a o de B uijn. Según sus au o es iene la en aja con espec o a los mecanismos de diseño po solapamien o de que es mucho más e icaz con las epe iciones ya que en ez de enmasca a las gene a un g a o que pe mi e c ea una es uc u a de epe iciones del genoma pa a pode a a las. El so wa e EULER ue desa ollado pa a lec u as Sange y ue pos e io men e modi icado y denominado EULER-SR [111, 112] pa a lec u as co as de 454 GS20 [9], lec u as co as no pa eadas de Illumina/Solexa [113]. EULER se basa en es p incipios undamen ales:  Rep esen a las lec u as como enlaces y los solapamien os como nodos en un g a o de B uijn.  Realiza un ensamblaje e icien e median e la educción a un p oblema de camino eule iano: cada enlace debe isi a se una sola ez.  Las epe iciones se a an median e el uso de múl iples enlaces pa a una lec u a epe ida. Es ácil de ejecu a , bas a con indica el iche o de en ada y el alo de k-me o que se quie e u iliza pa a ob ene el esul ado en el iche o my_ esul s_ ile. x : Assemble.pl my_ ile. as a kme _ alue > my_ esul s_ ile. x Pa a las secuencias de ansc ip ómica 454, Eule ue el ensamblado de ipo De B uijn que mejo es esul ados de ol ía, po lo que lo u ilizamos como pa e del lujo de abajo del ensamblaje de es e ipo de lec u as. III.3.2.4. Vel e Vel e [11, 114] es un conjun o de algo i mos desa ollados po Daniel R. Ze bino y Ewan Bi ney pa a el a amien o de g a os de de B uijn pa a ensamblaje de secuencias genómicas. Vel e hace un uso bas an e ex enso de he amien as de simpli icación de g a os pa a educi caminos no in e sec an es con nodos simples. Es a simpli icación comp ime el g a o sin pé dida de in o mación. El p og ama ejecu a la ase de simpli icación du an e la 63 MATERIALES Y MÉTODOS cons ucción del g a o y, de nue o, en a ias ocasiones du an e el p oceso de ensamblaje. Es a écnica, in oducida como «eliminación de únicos» pa a g a os de k-me o es simila a la o mación de uni igs en los g a os de solapamien o [61] y en los ensamblado es OLC [61]. La ejecución de Vel e se hace en dos e apas de la o ma siguien e: s un el e h ou _ olde my_kme - as q -longPai ed –sepa a e long_pai ed_ eads1. as q long_pai ed_ eads2. as q -long long_single_ eads. as q -sho Pai ed –sepa a e sho _pai ed_ eads1. as q sho _pai ed_ eads2. as q > salida1 s un el e g Vel e h_29 -exp_co au o -co _cu o 10 > salida2 En la p ime a línea de comando, my_kme se eemplaza con al alo del k-me o, en la úl ima e sión de Vel e es e alo puede i has a 101. – as q es pa a indica que los iche os in oducidos son de ipo . as q. –longPai ed indica que las lec u as son la gas y pa eadas, -sepa a e indica que las pa ejas de lec u as ienen en dos iche os independien es, -long indica que las lec u as son la gas y single, -sho Pai ed indica que las lec u as son co as y pa eadas y po ul imo ou _ olde es el nomb e de ca pe a donde se gua da án los esul ados de la ejecución. En la segunda línea de comando, ou _ olde ep esen a la ca pe a c eada an e io men e, -exp_co indica la cobe u a espe ada y -co _cu o indica la cobe u a mínima. Vel e o mó pa e del es udio que hicimos sob e la compa ación de los p og amas de ensamblaje pa a las lec u as la gas ansc ip omicas y genómicas. III.3.2.5. Oases Oases [115] es un ex ensión de Vel e desa ollada po Ma cel Shulz y Daniel Ze bino, des inada a ensambla lec u as de ansc ip ómica . Oases impo a un ensamblaje p elimina p oducido po Vel e [11, 114], y ag upa los con igs en g upos pequeños llamados loci. Luego ap o echa de las lec u as pa eadas y las lec u as la gas, pa a cons ui iso o mas u ilizando la simili ud en e los g a os de B uijn y los g a os de ayus e (splicing). La ejecución de Oases se compone de es líneas de comando. Las dos p ime as co esponden a una ejecución no mal del Vel e al como se desc ibió más a iba con la di e encia de que en el segundo comando se añade la opción - ead_ kg yes que pe mi e el seguimien o de las posiciones de lec u as en el ensamblaje. En e ce a línea es donde in e iene el Oases ecupe ando los da os p elimina es de Vel e con enidos en ou _ ol de . s un el e h ou _ olde my_kme - as q -longPai ed –sepa a e long_pai ed_ eads1. as q long_pai ed_ eads2. as q -long long_single_ eads. as q -sho Pai ed –sepa a e sho _pai ed_ eads1. as q sho _pai ed_ eads2. as q > salida1 s un el e g ou _ olde - ead_ kg yes > salida2 s un oases ou _ olde -ins_leng h 169 -ins_leng h_sd 47 -min_ ans_lg h 100 -co _cu o 3 -min_pai _coun 20 > salida3 64 MATERIALES Y MÉTODOS En la e ce a línea donde in e iene el p og ama Oases, la opción -min_pai _coun indica el núme o de pa es de lec u as necesa ios pa a conside a una conexión en e dos con igs mon a un sca old. Oases se u ilizó en el ensamblaje de las lec u as de Solea senegalensis y Solea solea con los pa áme os que die on el mejo esul ado en la ase de p uebas. III.3.2.6. SOAPdeno o- ans Es un ensamblado de no o de ansc ip omas basado en el SOAPdeno o2 [116] y u iliza un algo i mo de ensamblaje pa alelizable basado en g a os De B uijn. Es á p epa ado pa a maneja el ayus e al e na i o y a los di e en es ni eles de exp esión en los ansc i os. El paque e el p og ama consis e en dos ejecu ables cuyos la u ilización de uno u o o depende del k-me o usado.  SOAPdeno o-T ans-31kme : pa a k-me os has a 31  SOAPdeno o-T ans-127me : pa a k-me os has a 127 La ejecución del p og ama se e ec úa en cua o e apas de la o ma siguien e: SOAPdeno o-T ans-31kme p eg aph -s con ig_ ile -K 29 -p 16 -d 1 -o my_assembly SOAPdeno o-T ans-31kme con ig -g my_assembly SOAPdeno o-T ans-31kme map -s con ig_ ile -g my_assembly -K 29 -p 16 SOAPdeno o-T ans-31kme sca -g my_assembly -F -p 16  En la p ime a línea donde se u iliza el comando p eg aph , –s indica el iche o de con igu ación donde iene la in o mación ela i a a las lec u as que se an a u iliza ( e desc ipción más abajo), -K indica el alo de k-me o, -p indica el núme o de CPU, -d indica la ecuencia mínima de k-me o a conside a , -o indica el nomb e de ca pe a del p oyec o.  En la segunda línea donde se u iliza el comando con ig se indica el nomb e de la misma ca pe a del p oyec o -g .  En la e ce a línea donde se u iliza el comando map con –s se indica el iche o de con igu ación, con –g la ca pe a del p oyec o con –K el alo de k-me o, con –p el núme o de CPU.  En la cua a línea donde se u iliza el comando sca , -g indica la ca pe a del p oyec o, -F pe mi e ellena los huecos en los sca olds y –p el núme o de CPU. También se puede ejecu a odas las e apas de o ma seguida u ilizando el comando all SOAPdeno o-T ans-31kme all -s con ig_ ile -K 29 -p 16 -d 1 -D 4 -F -o ou pu 65 MATERIALES Y MÉTODOS El iche o de con igu ación iene el siguien e o ma o: #longi ude máxima de las lec u as max_ d_len=150 [LIB] # amaño medio de inse o a g_ins=180 #Si la secuencia se iene que e e i , pone 0 pa a indica que no e e se_seq=0 #En que pa e(s) u iliza la lec u a (escoge 3 pa a u iliza la an o en con igs como en sca olds) asm_ lags=3 #En qué o den las lec u as se u iliza án en el sca olding (se conside a en caso que haya más de una lib e ía de lec u as). ank=1 # Núme o mínimo de pa es de lec u as pa eadas pa a ealiza una conexión. pai _num_cu o =10 #Lec u as pa eadas en o ma o as q (u iliza q1 y q2) q1=pai ed_ eads1. as q q2=pai ed_ eads2. as q #lec u as simples en o ma o as q (u iliza q) q=sequences_illum_454. as q Se pueden añadi más lib e ías esc ibiendo la e ique a [LIB] seguida con los nomb es de lec u as y sus ca ac e ís icas siendo el mismo modelo desc i o a iba. SOAPdeno o- ans ue u ilizado pa a ensambla los da os co os de Illumina de Tisoch ysis lu ea y Rudi apes decussa us III.3.2.7. CABOG CABOG (Cele a Assemble wi h Bes O e lap G aph) [10, 54] es un ensamblado de no o de ipo OLC de secuencias la gas (po ejemplo Sange y 454) de ADN pa a genomas comple os. CABOG ha con ibuido de mane a impo an e al a ance de la genómica, incluyendo el p ime ensamblaje comple o un genoma de un o ganismo mul icelula y el p ime genoma diploide de un indi iduo humano. El so wa e de CABOG es un sis ema modula compues o de múl iples p og amas que in e ac úan a a és de in e aces bien de inidas de al mane a que se puede modi ica el o den secuencias de los p og amas y sus pa áme os pa a cub i necesidades especí icas. La ejecución de CABOG se ealiza con las dos líneas de comando siguien es con es e mismo o den: as qToCA -inse size 5000 1500 -lib a yname my_lib a y - echnology '454' - ype 'sange ' -innie - eads my_single_ eads. as q -ma es my_pai ed_ eads. as q > ou _ ile. g unCA -d my_wo k_ olde -p my_p e ix -uni igge =u g ou _ ile. g 66 MATERIALES Y MÉTODOS En la p ime a línea de comando –inse size indica la in o mación ela i a a los amaños de inse o a sabe la media y la des iación ípica (los dos alo es sepa ados po espacio), -lib a yname indica el nomb e de la lib e ía de lec u as, - echnology indica la ecnología de secuenciación de las lec u as, -innie indica que la o ien ación de las lec u as pa eadas es “Fo wa d-Re e se” (en caso que la o ien ación es “Re e se-Fo wa d”, se especi ica –ou ie ), - eads indica el nomb e del iche o . as q de lec u as single, -ma es indica el nomb e del iche o de lec u as pa eadas, -ou _ ile. g indica el nomb e de iche o de salida . g. Las lec u as pa eadas ienen in e caladas en el mismo iche o . as q. En la segunda línea de comando –d indica el nomb e de la ca pe a del abajo, -p indica el p e ijo de los iche os gene ados, –uni igge indica el modulo u ilizado pa a cons ui uni igs. CABOG o ece es módulos, de los cuales se u iliza solo uno a la ez. El modulo o iginal (u g) es el más adecuado pa a da os de Sange , el módulo “bes o e lap g aph uni igge ” (bog) es el más compa ible con los da os de 454 y el módulo “boga uni igge ” (boga ) es el más compa ible pa a los da os de Illumina. Al inal de la línea de comando se añade el nomb e del iche o . g gene ado an e io men e. CABOG ue u ilizado pa a ensambla las lec u as 454 de Pho obac e ium damselae . III.3.2.8. Ray Ray [68], es un ensamblado que u iliza el g a o de De B uijn pa a cons ui su es uc u a de da os. La p incipal ca ac e ís ica que podemos des aca de es e ensamblado es que es un ensamblado que u iliza memo ia dis ibuida pa a ealiza sus ope aciones. Los o os ensamblado es disponibles, u ilizan memo ia compa ida. Po lo an o el ensamblado Ray u iliza MPI [117] como in e az de paso de mensajes en e odos los nodos que es én uncionando de mane a simul ánea. G acias a es a ca ac e ís ica podemos ap o echa aún más el po encial del supe o denado Picasso, y no end emos que limi a nos a las 16 CPU que con ienen los nodos de cálculo o las 64 CPU que con ienen los nodos bigmem. La ejecución del p og ama Ray se hace de la o ma siguien e: mpiexec -np 256 Ray -k 51 -p my_pai ed_ eads1. as q my_pai ed_ eads2. as q -s my_single_ eads. as q - ou e-messages -connec ion- ype deb uijn - ou ing-g aph-deg ee 4 -o illumina_01 donde –np indica el núme o de CPU u ilizadas, –k indica el alo de k-me o, -p indica los nomb es de los dos iche os de lec u as pa eadas sepa ados po espacio, -s indica el nomb e del iche o de lec u as simples. El p og ama Ray iene una amplia gama de con igu aciones que se pueden consul a en h p://deno oassemble .sou ce o ge.ne /manual.h ml. En caso que se a e de ensamblajes donde se u ilizan g andes can idades de lec u as, con end ía ac i a los ou ing messages , añadiendo a la línea de comando lo siguien e: - ou e-messages -connec ion- ype deb uijn - ou ing-g aph-deg ee 4 67 MATERIALES Y MÉTODOS El g ado de los nodos de g a os u ilizando la opción - ou ing-g aph-deg ee según el núme o de núcleos que se an u iliza al como iene explicado en la abla III.1 Núme o de CPUs G ado de nodos Diáme o de nodos Con igu ación 256 4 4 (4*4*4*4=256) - ou ing-g aph-deg ee 4 512 8 3 (8*8*8) - ou ing-g aph-deg ee 8 1024 4 5 (4*4*4*4*4) - ou ing-g aph-deg ee 4 1024 32 2 (32*32) - ou ing-g aph-deg ee 32 1024 2 10 (2^10) - ou ing-g aph-deg ee 2 Tabla III.1: Con igu ación de los G ados de nodos De B uijn en el p og ama Ray, según el núme o de CPUs u ilizado Ray ue u ilizado pa a ensambla las secuencias de Illumina de Solea seneganensis III.3.3. Pa a el a amien o y mejo a de los ensamblajes III.3.3.1. GAM-NGS En el ensamblaje del genoma de Solea senelgalensis (Apa ado IV.3.2.2) e a necesa io econcilia los con igs p oceden es de las di e en es lib e ías de lec u as Illumina. Pa a ello se u ilizó GAM-NGS [118] que es un p og ama que se u iliza pa a combina dos o más ensamblajes genómicos con el in de mejo a la con igüidad y la exac i ud, y así ob ene un ensamblaje único (de econciliación) con mejo es ca ac e ís icas que los o iginales. Las egiones que ep esen an el mismo locus (llamados bloques) en los ensamblajes se iden i ican a a és del mapeo de las lec u as y se gua dan en un g a o ponde ado. La ase de la combinación se lle a a cabo con la ayuda es e g a o, lo que pe mi e ambién la esolución de las egiones p oblemá icas. Pa a econcilia dos ensamblajes con GAM-NGS es necesa io elegi uno de ellos como «maes o» (ensamblaje de base). El o o se de ini á como «escla o» y que se u iliza á pa a complemen a el p ime o. Pa a econcilia ensamblajes con GAM-NGS se equie e una e apa p e ia de mapeo de las lec u as sob e cada uno de ellos u ilizando Bow ie2 [119], pos e io men e se gene a á un iche o de alineamien o indexado en o ma o bina io, BAM, u ilizando sam ools [120]. Es os dos úl imos p og amas se desc ibi án de o ma más de allada en el apa ado III.3.4. La e apa de mapeo de lec u as se ealiza median e las siguien es líneas de comando: module load bow ie/2.2.4 bow ie2-build - assembly_1. as a my_indexes 68 MATERIALES Y MÉTODOS bow ie2 my_indexes -q -1 pai ed_ eads1. as q -2 pai ed_ eads2. as q -U single_ eads. as q -- e y-sensi i e -p 8 -S assembly_1.sam module load sam ools #con e i el iche o de o ma SAM a o ma o BAM sam ools iew -bS assembly_1.sam > assembly_1.bam #o dena el iche o BAM sam ools so assembly_1.bam so ed.assembly_1 # il a el iche o BAM (elimina las lec u as no mapeadas) sam ools iew -b -F 4 so ed.assembly_1.bam > il e ed.so ed.assembly_1.bam # c ea un index al iche o BAM sam ools index il e ed.so ed.assembly_1.bam La ejecución del p og ama GAM-NGS se ealiza en a ias e apas: PATH=`pwd -P` THREADS_NUM=4 GAM_CREATE=gam-c ea e GAM_MERGE=gam-me ge # E apa 1: C eacion de una ca pe a donde gua da los iche os de salida mkdi -p ${PATH}/gam-ngs_me ge # E apa 2: P epa acion de los iche os de en ada echo -e "${PATH}/Alignmen s/assembly_1/so ed.assembly_1.bam n300 500" >${PATH}/gam-ngs_me ge/assembly_1.pe.lis . x echo -e "${PATH}/Alignmen s/assembly_2/so ed.assembly_2.bam n300 500” >${PATH}/gam-ngs_me ge/assembly_2.pe.lis . x # E apa 3: Cons uccion de los bloques ${GAM_CREATE} --mas e -bam ${PATH}/gam-ngs_me ge/assembly_1.pe.lis . x --sla e-bam ${PATH}/gam-ngs_me ge/assembly_2.pe.lis . x --min-block-size 10 --ou pu ${PATH}/gam-ngs_me ge/ou >${PATH}/gam-ngs_me ge/gam-c ea e.log.ou 2>${PATH}/gam- ngs_me ge/gam-c ea e.log.e # E apa 4: Reconciliacion ${GAM_MERGE} --blocks- ile ${PATH}/gam-ngs_me ge/ou .blocks --mas e -bam ${PATH}/gam- ngs_me ge/assembly_1.pe.lis . x --mas e - as a ${PATH}/Assembly/assembly_1/assembly_1. as a --sla e-bam ${PATH}/gam-ngs_me ge/assembly_2.pe.lis . x --sla e- as a ${PATH}/Assembly/assembly_2/assembly_2. as a --min-block-size 10 --ou pu ${PATH}/gam-ngs_me ge/ou -- h eads ${THREADS_NUM} >${PATH}/gam-ngs_me ge/gam-me ge.log.ou 2>${PATH}/gam-ngs_me ge/gam-me ge.log.e En la e apa 2 se gene a en un a chi o de con igu ación donde se imp imen los nomb es de iche os del mapeo con sus u as así que el amaño de inse o mínimo y máximo. 69 MATERIALES Y MÉTODOS En la e apa 3, --mas e -bam indica el nomb e del iche o BAM de mapeo de las lec u as sob e el ensamblaje conside ado como maes o, --sla e-bam indica el nomb e del iche o BAM de mapeo de las lec u as sob e el ensamblaje conside ado como escla o. En la e apa 4, --mas e - as a indica el iche o de con igs o sca olds del ensamblaje maes o, --sla e- as a indica indica el iche o de con igs o sca olds del ensamblaje escla o, --min-block-size indica el núme o de lec u as mínimo pa a conside a un bloque , --ou pu indica el p e ijo de los iche os de salida, y con -- h eads se indica el núme o de co es a u iliza . III.3.3.2. SOAPdeno o Sca olde En el ensamblaje del genoma de Solea senegalensis (Apa ado IV.3.2.2) eníamos disponibles muchas lib e ías de lec u as que ue on ap o echadas pa a uni ica los con igs. Uno de los p og amas que u ilizamos pa a es e p opósi o ue SOAPdeno o Sca olde que ealmen e es un módulo del p og ama de ensamblaje genómico SOAPdeno o [116] que se u iliza pa a uni los con igs p eensamblados con SOAPdeno o, sin emba go ambién puede usa se pa a uni con igs gene ados po o os ensamblado es. La ejecución del p og ama equie e una p epa ación p e ia de los con igs u ilizando la he amien a inalFusion ( h ps://sou ce o ge.ne /p ojec s/soapdeno o2/ iles/P epa e/ ), lo cual se hace con la siguien e línea de comando: inalFusion -g Sca -K 31 -c con igs. as a -D donde –g indica el p e ijo de pa a la salida, -K indica el amaño de k-me o, -c indica el iche o de con igs y con -D se ac i a el modo de p epa ación de los con igs. Se gene a an a ios iche os que ienen el p e ijo Sca . La uni icación de los con igs ( sca olding ) se ealiza con las siguien es líneas de comando: # mapeo de las lec u as sob e los con igs SOAPdeno o-63me map -p 16 -s con ig -g Sca 1>map.log 2>map.e # uni icacion de los con igs SOAPdeno o-63me sca -p 16 -g Sca -N 600000000 -F 1>sca .log 2>sca .e donde –p indica el núme o de co es a u iliza , -s indica el iche o de con igu ación ( éase el de alle de es e iche o en el apa ado III.3.2.6) –g indica el p e ijo de los iche os gene ados en la e apa de p epa ación, -N indica el amaño espe ado del genoma y con –F se ac i a el elleno de los huecos en los sca olds 70 MATERIALES Y MÉTODOS III.3.3.3. SSPACE En los lujos de abajo de los ensamblajes genómicos de Pho obac e ium damselae (Apa ado IV.3.1.2) y Solea senegalensis (Apa ado IV.3.2.2) e a necesa io uni ica los sca olds ap o echando de la in o mación de las lec u as disponibles. Pa a ello u ilizamos SSPACE [121] que es un p og ama independien e que si e pa a el sca olding de los con igs p eensamblados median e el uso de lec u as pa eadas y iene la en aja de se u ilizado ambién pa a uni sca olds . Es e p og ama u iliza la in o mación del mapeo de las lec u as pa eadas sob e los con igs o sca olds pa a e alua el o den, la dis ancia en e ellos y la o ien ación po el in de es ablece conexiones en e los mimos. La ejecución de SSPACE se ealiza con una sola línea de comando de la siguien e o ma: SSPACE_S anda d_ 3.0.pl -l lib a ies. x -s con igs. as a -T 16 donde –l indica el nomb e de un iche o de ex o incluyendo la in o mación sob e las lec u as pa eadas que se u iliza án en la uni icación de los con igs o sca olds , –s indica el nomb e del iche o de con igs o sca olds de en ada, -T indica el núme o de CPU a u iliza . El iche o lib e ies. x iene el siguien e o ma o: lib1 bow ie lib1_pai ed_ eads1. as q lib1_pai ed_ eads2. as q 3000 0.25 FR lib2 bow ie lib2_pai ed_ eads1. as q lib2_pai ed_ eads2. as q 8000 0.25 FR donde la columna 1 co esponde el nomb e de la lib e ía, la columna 2 co esponde al p og ama u ilizado pa a mapea las lec u as sob e los con igs o sca olds en el cual se puede elegi Bow ie [119] o BWA [122] las columnas 3 y 4 co esponden a los nomb es de iche os de lec u as pa eadas, las columnas 5 y 6 co esponden al amaño de inse o de las lec u as pa eadas y el e o mínimo pe mi ido en el amaño de inse o espec i amen e. Po ejemplo pa a un amaño de inse o 3000 y un e o de 0,25, la dis ancia en e las lec u as puede ene un e o de 3000 * 0,25 = 750 en ambos sen idos. La úl ima columna se e ie e a la o ien ación de las lec u as pa eadas (FR: di ec a-in e sa, RF: in e sa-di ec a, FF: di ec a - di ec a, RR: in e sa-in e sa) III.3.3.4. SOAPdeno o GapClose SOAPdeno o GapClose ( h p://sou ce o ge.ne /p ojec s/soapdeno o2/ iles/ GapClose ) es un p og ama incluido en el paque e de SOAPdeno o que se u iliza pa a ce a los huecos (indicado con N yux apues as) que se c ean du an e la e apa de sca olding con SOAPdeno o Sca olde o con o o ensamblado . Es á des inado a genomas g andes de plan as y animales aunque ambién unciona bien pa a genomas de bac e ias y hongos. La ejecución de es e p og ama se ealiza con la siguien e o den: GapClose -b con ig_ ile -a sca olds. as a -l 155 - 64 -o gap_closed_sca olds. as a 71 MATERIALES Y MÉTODOS donde –b indica el nomb e del iche o de con igu ación especí ico a SOAPdeno o ( e se el de alle de es e iche o apa ado III.3.2.6), -a indica el nomb e del iche o de sca olds de en ada –l indica la longi ud máxima de las lec u as (es e alo puede oma un alo máximo de 155), - indica el núme o de co es a u iliza , y -o el nomb e del iche o de salida. SOAPdeno o GapClose se u ilizó en el lujo de abajo de los ensamblajes genómicos de Pho obac e ium damselae y Solea senegalensis , pa a ellena los huecos con nucleó idos pa a mejo a la calidad de los sca olds. III.3.4. Pa a analiza secuencias III.3.4.1. SeqT imNex An es de p ocede al ensamblaje de las lec u as Roche/454 y Illumina an o ansc ip omicas como genómicas ue necesa io p ep ocesa las pa a desca a los agmen os de baja calidad, con aminan es, ec o es, adap ado es, y o os a e ac os, pa a ello u ilizamos SeqT imNex . Se a a de una he amien a pa a el p ep ocesamien o de secuencias de nue a gene ación desa ollada en la Pla a o ma Andaluza de Bioin o má ica. Se puede u iliza po línea de comandos, como se icio web basado en REST y como he amien a web. Pa a más in o mación éase su po al h p://www.scbi.uma.es/ seq imnex . A con inuación se mues a un ejemplo de la ejecución de SeqT imNex a a és del sis ema de colas de Picasso. # se inicializa SeqT imNex en el Clus e . ~seq imnex /ini _en # se ecogen las CPU asignadas. s un hos name -s > wo ke s seq imnex - my_ empla e. x -Q pai ed_seq1. as q,pai ed_seq2. as q -w wo ke s en la que - indica que el iche o my_ empla e. x es una plan illa en la que se de allan los pa áme os que se desean u iliza . En la e sión web del p og ama se o ecen plan illas con alo es po omisión pa a a ias si uaciones (genómica, ansc ip ómica, amplicones, secuencias de plan as, e c.). El pa áme o -w indica que el p og ama se ejecu a á en los núcleos con las ID que se ecogen en el iche o wo ke s . Con -Q se indican los nomb es de los iche os con las secuencias (con iene consul a la ayuda del p og ama pa a e más opciones y o ma os de en ada). 78 MATERIALES Y MÉTODOS III.3.5.11. Gigabayes Pa a de ec a las a iaciones gené icas SNP en los ensamblajes de las lec u as Roche/454 se u ilizó Gigabayes [131] que es un p og ama op imizado pa a el análisis de millones de lec u a NGS alineados a una secuencia consenso que puede se un ansc i o o un ADN genómico. El descub imien o de los SNP con Gigabayes se hace a a és del análisis de un iche o .ACE que es un iche o de alineamien o de las lec u as sob e la secuencia del consenso, el cual lo gene an la mayo ía de los ensamblado es OLC. El análisis de Gigabayes se hace en dos e apas. En la p ime a e apa se c ea el iche o bina io a pa i de los da os de alineamien o de las lec u as y en la segunda se analiza la in o mación con enida en es e iche o bina io. gigaBuild -- d my_ ile. as a -- q my_ ile.qual --ace ./my_ ile.ace --gig my_ ile.ace.gig gigaBayes --gig my_ ile.ace.gig --g new ile.ace.g --ancho --ploidy diploid -- indel --debug --CRL 4 --PSL 0.9 --log my_ ile.ace.log  En la p ime a línea de comando -- d indica el iche o de lec u as u ilizado en el ensamblaje , -- q indica el iche o de calidades, --ace indica el iche o de alineamien o y --gig indica iche o bina io de salida.  En la segunda línea de comando --gig indica iche o bina io gene ado an e io men e, --g indica un iche o de ipo .g que se gene al du an e el análisis, --ancho indica la u ilización de secuencia de anclaje pa a busca el polimo ismo. --ploidy se e ie e a la ploidía del o ganismo (“haploid” o ”diploid”), la opción --debug pe mi e que se mues en mensajes de depu ación del p og ama. - -CRL indica la cobe u a mínima en una posición pa a se conside ada. --PSL indica el alo mínimo de p obabilidad de un SNP pa a que se mues e en el in o me, -- log indica el iche o de salida donde se imp ime oda la in o mación ela i a a los SNPs encon ados. Pa a inclui en el análisis la búsqueda de los Indels se añade la opción --indel . Gigabayes se u ilizó pa a descub i los SNP en los p oyec os de ensamblaje de Solea senegalensis donde se u iliza on únicamen e las lec u as de 454/Roche. 79 MATERIALES Y MÉTODOS III.3.4.12. Table Se a a de una he amien a g á ica in e ac i a pa a la isualización de ensamblajes [132]. Admi e mul i ud de o ma os di e en es: ACE, AFG, MAQ, SOAP2, SAM, BAM, FASTA, FASTQ y GFF3. Puede desca ga se en h p://bioin .sc i.ac.uk/ able / y es muy sencillo de u iliza , an solo hay que ab i el p og ama y elegi el iche o de ensamblaje que se quie e isualiza . Table se u ilizó pa a la isualización de los ensamblajes de lec u as Roche/454 y pa a obse a las co ección apo adas po el p og ama CoMine (Apa ado IV.1.3) III.3.4.13. GE o Pa a pode comp oba la colinealidad de los genomas de Solea senegalensis y Cynoglossus semilae is (Apa ado V.3.2.3.2), usamos GE o ( h ps://genome olu ion.o g /CoGe/GE o.pl ) [133] que es una he amien a web diseñada pa a compa a egiones genómicas en e múl iples o ganismos u ilizando di e en es algo i mos de compa ación, lo cual pe mi e de iden i ica pa ones en la e olución de los genomas. III.3.4.14. NUCMER En el ensamblaje del genoma de Solea senegalensis ( Apa ado IV.3.2.2), e a necesa io alinea los con igs po el in de combina aquellos que solapan en e ellos. Pa a ello se u ilizó NUCMER que es un p og ama del paque e MUMme [134] muy u ilizado el alineamien o global de genomas en e os que sean comple os o en es ado de bo ado y que iene la en aja de se muy ápido en sus a eas de alineamien o. Se ejecu a con los dos siguien es o denes sucesi os: nucme -p nucme e e ence_genome. as a que y_genome. as a show-coo ds -T nucme .del a > nucme .coo ds En la p ime a línea, e e ence_genome. as a indica el nomb e del iche o as a que incluye al genoma escogido como e e encia, que y_genome. as a indica el nomb e del iche o as a que incluye al genoma en el cual se busca án alineamien os con el p ime genoma. Con es a línea se gene a el iche o nucme .del a III.3.5. Sc ip s esc i os En es e apa ado se desc iben los sc ip s que ue on esc i os a lo la go de es e abajo pa a a a y p ocesa los da os genómicos de las especies es udiadas. 80 MATERIALES Y MÉTODOS III.3.5.1. Pa a gene a lec u as a i iciales Es e sc ip esc i o en pe l (apéndice A), se u iliza á en el apa ado IV.1.2 pa a gene a lec u as a i iciales po el in de es ea los p og amas de ensamblaje. Se ejecu a con la o den: gene a e_a i _ d.pl sequences. as a 300 500 30 donde el p ime pa áme o ep esen a el nomb e del iche o de secuencias de donde se ex ae án las lec u as a i iciales, el segundo pa áme o ep esen a la longi ud mínima de las lec u as, el e ce pa áme o la longi ud máxima y el cua o pa áme o la cobe u a de las lec u as. Es e sc ip se u ilizó pa a c ea secuencias a i iciales pa a u iliza las en la e i icación de los p og amas de ensamblaje de lec u as la gas. III.3.5.2. Pa a combina dos iche os ACE Es un sc ip en Ruby que combina dos iche os ACE de MIRA y CAP3 ( e apa ado IV.1.2.3 más adelan e). U iliza la gema scbi_ace (apa ado III.3.1.2) y se ejecu a de la siguien e mane a: combine_ace_ iles. b assembly_cap3.ace assembly_mi a.ace mi a_ eads_index donde el p ime pa áme o ep esen a el nomb e del iche o ACE de CAP3 el segundo pa áme o ep esen a el nomb e del iche o ACE de MIRA, y el e ce pa áme o el índice de los iden i icado es de secuencias de MIRA Es e sc ip se u ilizó pa a combina los iche os ACE de MIRA y CAP3 en los ensamblajes de algunas e siones del ansc ip oma Solea senegalensis donde solo se u iliza ón lec u as 454/Roche. III.3.5.3. Pa a calcula el amaño de inse o eal en lec u as pa eadas. Es e sc ip esc i o en Ruby (apéndice B) u iliza el iche o SAM de mapeo de una lib e ía de lec u as sob e una e e encia (que puede se un ensamblaje p elimina de es as lec u as o mado de con igs) pa a calcula el amaño de inse o eal de es a lib e ía. El sc ip se u iliza de la siguien e o ma: inse _size_ om_sam. b mapping_ ile.sam en el que mapping_ ile.sam ep esen a el nomb e del iche o de mapeo p e iamen e mencionado. Es e sc ip ue u ilizado pa a calcula el amaño de inse o eal en las lec u as pa eadas (Roche/454 o Illumina) u ilizadas en es e abajo. 81 MATERIALES Y MÉTODOS III.3.5.4. Pa a elimina ensamblajes e óneos Es e sc ip esc i o en Ruby eco e el esul ado de alineamien o Blas en e los ansc i os p oceden es de lec u as co as con los p oceden es de las lec u as la gas (conside ados como más iables) y en e los ansc i os p oceden es de lec u as co as de ec a aquellos que ienen una es uc u a sen ido/an isen ido pa a pode elimina los. Se ejecu a de la siguien e o ma: misassembled_ asc ip s. b blas _alignmen 95 80 donde el p ime pa áme o indica el iche o Blas de alineamien o, el segundo indica el po cen aje de iden idad mínimo pa a conside a un alineamien o, y el e ce o la longi ud de alineamien o mínimo. Es e sc ip se u ilizó en los lujos de abajo de los ensamblajes de ansc ip omica pa a elimina los ensamblajes e óneos en los con igs p oceden es de los ensamblajes illumina. III.3.5.5. Pa a selecciona los ansc i os que ep esen an las sondas de mic oa ay. Es un sc ip en Ruby que u iliza el esul ado de Full-Leng he Nex y el de dos p edic o es de secuencias codi ican es: es code [135] y ORF p edic o [136] ( h p://p o eomics.ysu.edu/ ools/O P edic o .h ml ), pa a selecciona au omá icamen e los ansc i os que ep esen a án las sondas pa a un expe imen o de mic oa ays. La ejecución se ealiza de la siguien e o ma: ln2mic oa ay. b ln_anno a ion_ ile es _code_ ile o _p edic o _ ile ansc ip s. as a 44000 donde ln_anno a ion_ ile indica el nomb e del iche o de ano ación de Full-Leng he Nex , es _code_ ile indica el nomb e del iche o la salida de es code, o _p edic o _ ile indica el nomb e del iche o de salida del p og ama ORF p edic o , ansc ip s. as a indica el nomb e del iche o as a de ansc i os y con el ul imo pa áme o se indica el núme o de ansc i os eque idos pa a el mic oa ay. Es e sc ip se u ilizó pa a selecciona los ansc i os de Solea senegalensis que se en ia on pa a ealiza un expe imen o de mic oa ays III.3.5.6. Pa a calcula las es adís icas sob e los ma cado es SSR Es un sc ip esc i o en Ruby (apéndice C) que se u iliza pa a eco e el iche o de salida de MREPS (apa ado III.3.4.10) que si e pa a de de ección de ma cado es SSR en un ansc ip oma, y desde ello calcula es adís icas sob e es os ma cado es an o los que es án den o del ORF como aquellos que es án en la UTR. 82 MATERIALES Y MÉTODOS La ejecución de es e sc ip se ealiza de la siguien e o ma: ss s_s a s. b m eps_ ile ansc ip s_ids ln_p _seqs donde m eps_ ile indica el nomb e del iche o de salida de MREPS, ansc ip s_ids indica el nomb e de un iche o que incluye a los iden i icado es de ansc i os (un id po línea) de los cuales se ob end án las es adís icas de los SSR incluidos en los mismos. ln_p _seqs indica el nomb e del iche o de ano ación de Full-Leng he Nex Es e sc ip se u ilizó pa a ex ae las es adís icas sob e los ma cado es SSR de ec ados en los ansc ip omas es udiados. III.3.5.7. Pa a solapa los con igs genómicos En los ensamblajes genómicos, los con igs pueden compa i zonas comunes en sus bo des. És as se pueden de ec a con un p og ama de alineamien o global como NUCMER (apa ado III.3.4.14). Con es e sc ip en Ruby se u iliza el esul ado de NUCMER pa a solapa los con igs según unos c i e ios bien de inidos y u ilizando la in o mación de sin enia con ICMappe ( e apa ado III.3.5.9 a con inuación) de dos especies ce canas di e en es. Globalmen e, hay dos c i e ios pa a solapa los con igs: sea que engan unos alineamien os muy es ic os (longi ud y po cen aje de iden idad del alineamien o muy al os), o que es os pa áme os sean mínimos y que los dos con igs se encuen an con iguos sob e la base de la sin enia con especies ce canas. Después de ob ene el iche o de coo denadas del alineamien o del genoma consigo mismo u ilizando NUCMER, la ejecución del sc ip se ealiza de la siguien e o ma: con igs_o lp. b –n nucme .coo ds –l 100 –i 80 – species_1.o de ing –s species_2.o de ing –c con igs. as a donde –n indica el nomb e del iche o de coo denadas que ep esen an el alineamien o de NUCMER. –l indica la longi ud mínima inicial de alineamien o ( il o p elimina ), -i indica el po cen aje de iden idad inicial mínimo ( il o p elimina ), - y –s indican la in o mación de o denamien o sob e la base de la sin enia con dos especies ce canas. Con –c se indica el nomb e del iche o de con igs en los cuales se ealiza an los solapamien os. Es e sc ip ue u ilizado pa a combina los con igs solapan es del genoma de Solea senegalensis. III.3.5.8. Pa a la co ección au omá ica de los ensamblajes (Comine ) Es e p og ama es a desc i o de o ma de allada más adelan e en el apa ado IV.1.3. Su ejecución se ealiza de es a o ma: 83 MATERIALES Y MÉTODOS comine . b –a assembly.ace – 40 –e 2 –l 40 -p donde –a indica el iche o ACE a analiza – indica la longi ud máxima a eco a en po cen aje de la lec u a, -e indica el po cen aje mínimo de los e o es en las lec u as pa a es a sea conside ada. –l indica la longi ud mínima de lec u as a conside a en el ensamblaje nue o, -p es pa a gene a un plo sob e la zonas de dis ibución de los e o es. III.3.5.9. Pa a o denamien o de los con igs o sca olds y acabado de los genomas (ICMappe ) Es e p og ama esc i o en Pe l o dena los con igs o sca olds de un bo ado de genoma basándose en una e e encia; es a desc i o de o ma de allada más adelan e en el apa ado IV.1.4; ICMappe en se ejecu a en dos e apas: Alineamien o Blas en e los con igs o sca olds y un genoma de e e encia acabado: blas n - ask 'blas n' –db e e ence. as a -que y sca olds. as a –dus no -culling_limi 1 -ou m '6 qseqid sacc piden leng h qs a qend ss a send qlen slen ss and' > esul .blas O denamien o de los con igs o sca olds: icmappe .pl – esul .blas –m 100 –d 7000 –g 10000 donde – indica el nomb e del iche o de salida del alineamien o Blas en e el bo ado de genoma y la e e encia, -m indica el alineamien o mínimo a conside a , -d y –g espec i amen e indican la sepa ación máxima de las diagonales donde se ubican los HSP y la longi ud máxima de los huecos en e los HSP (debajo de es os dos pa áme os, los HSP se pueden conside a den o del mismo clus e ). Es e p og ama se u ilizó en el ensamblaje del genoma de Solea senegalensis donde nos ue ú il pa a con i ma la con igüidad de los con igs solapan es y los sca olds uni icados omando como e e encia el genoma de Cynoglossus semilae is . También se u ilizó pa a cons ui los supe -sca olds de Solea senegalensis sob e la base de los c omosomas de Cynoglossus semilae is III.4. Da os biológicos III.4.1. Secuencias ansc ip ómicas III.4.1.1. Pa a el ansc ip oma de Solea senegalensis Los da os u ilizados consis ie on en lec u as la gas de 454/Roche y lec u as co as de Illumina. 84 MATERIALES Y MÉTODOS Lec u as 454/Roche: 14 lib e ías simples, en e ellas 12 co esponden a 3 zonas del o ganismo que son es ículo/o a io, hipó isis y el hipo álamo, una al sis ema inmuni a io y una al sis ema de osmo egulación. El núme o o al de lec u as ue 5 663 225 con una longi ud media de 757 n Lec u as Illumina: Es a lec u as p o ienen de expe imen os de RNAseq que incluyen a un expe imen o empo al donde se ob u ie on mues as en los di e en es es adios de desa ollo de S. senegalensis (hue os, emb iones, la as, y es adio me amó ico) y o os expe imen os de incubación en di e en es sus ancias: AR (ácido e inoico), ATRA (all- ans AR), DEAB (4-die hyl amino-benzaldehyde), DMSO (dime hyl sul oxide) y TTNPB (agonis a de a s) . Se seleccionó una mues a de cada condición expe imen al pa a o ma un o al de 37 mues as que co esponden a lec u as co as pa eadas de Illumina de longi ud inicial 2 x 76 n . III.4.1.2. Pa a el ansc ip oma de Solea solea Pa a es e expe imen o las lec u as u ilizadas son exclusi amen e de Illumina ob enidas de un expe imen o de RNAseq donde se usa on a amien os análogos a los del expe imen o de RNAseq de S. senegalensis (apa ado an e io ) y consis en en 43 lib e ías de lec u as ipo pa eadas de longi ud inicial 2 x 100 n . III.4.1.3. Pa a el ansc ip oma de Tisoch ysis lu ea Se u iliza on an o da os de 454/Roche como de Illumina, y las ca ac e ís icas de las lec u as po cada lib e ía se mues an en abla III.2. Tabla III.2: Ca ac e ís icas de las lec u as b u as u ilizadas en el ensamblaje del ansc ip oma de Tisoch ysis lu ea Tecnología Índice de la lib e ía Nº de lib e ías No malización Tipo Tamaño de inse o (n ) Longi ud de lec u as (n ) Nº de lec u as Illumina 1 3 Si PE 150 2 x 100 925 682 496 2 7 No PE 150 2 x 76 612 903 376 454 1 2 Si SE - 547 1 151 067 2 1 No SE - 505 781 III.4.1.4. Pa a el ansc ip oma de Rudi apes decussa us Se u ilizó una sola lib e ía de 127 327 692 lec u as Illumina pa eadas de ipo PE y de longi ud inicial 2 x 75 n . 85 MATERIALES Y MÉTODOS III.4.2. Secuencias genómicas III.4.2.1. Secuencias genómicas de Pho obac e ium damselae subsp. piscicida Se u iliza on exclusi amen e secuencias de 454/Roche ( abla III.3) Tabla III.3: Ca ac e ís icas de las lec u as b u as u ilizadas en el ensamblaje de Pho obac e ium damselae subsp. piscicida Cepa Tecnología Índice de las lib e ías Nº de lib e ías Tipo Tamaño de inse o Longi ud de lec u as (n ) Nº de lec u as L091106-03H 454 1 1 MP 8 kb 509 148 622 2 1 SE - 1 195 297 269 DI21 454 1 2 MP 8 kb 445 433 717 2 1 SE - 550 187 433 III.4.2.2. Secuencias genómicas de Solea senegalensis En es e ensamblaje se u iliza on an o lec u as de 454/Roche como de Illumina, las ca ac e ís icas de las di e en es lib e ías u ilizadas se ilus an en la abla III.4 Tabla III.4: Ca ac e ís icas de las lec u as b u as u ilizadas en el ensamblaje del genoma de Solea senegalensis Tecnología Índice de la s lib e ías Nº de lib e ías Tipo Sexo Tamaño de inse o Longi ud de lec u as (n ) Nº de lec u as Illumina 1 27 PE Hemb as 350 2 x 100 2 x 152 869 031 542 2 6 PE Hemb as 300 2 x 100 1 005 527 592 3 12 MP Hemb as 3 kb 2 x 100 1 109 021 114 454 1 4 MP Hemb as 3 kb 551 2 103 984 2 9 MP Hemb as 8 kb 546 5 236 315 3 1 MP Hemb as 20 kb 579 1 018 187 86 RESULTADOS Y DISCUSIÓN 87 RESULTADOS Y DISCUSIÓN Pa e IV Resul ados y discusión 94 RESULTADOS Y DISCUSIÓN IV.1.2.2. Ensamblaje de genomas A con inuación se e aluó la capacidad de los 4 p og amas del apa ado an e io pa a ensambla lec u as a i iciales genómicas, y ambién se añadió el p og ama CABOG, especí ico pa a ensambla genomas de más de 100 Kb. La e aluación se lle ó a cabo con el p o ocolo expe imen al ilus ado de la igu a IV.2, muy simila al u ilizado en la pa e de ansc ip ómica, con la di e encia que la alo ación de las ca ac e ís icas del ensamblaje u ilizaba di e en es c i e ios que son el N50, N90 y la cohe encia en e los con igs y la secuencia o iginal. El N50 es un alo de inido como la longi ud del con ig (siemp e pa iendo desde el con ig de mayo amaño) a pa i del cual es á con enido el 50% de los nucleó idos ensamblados [140], en el caso de N90 es 90%. N50 y N90 son pa áme os muy u ilizados pa a e alua la calidad de los bo ado es de genomas ya que dan una idea sob e la longi ud de los con igs espec o a la longi ud o al. Las lec u as a i iciales simples se c ea on en pun os alea o ios del genoma y con longi udes alea o ias en e 300 y 500 pb pa a que sean lo más pa ecidas a las lec u as eales de 454. Las lec u as ex aídas se deja on como exac as (sin e o es) pa a simpli ica los ensamblajes y deja como única a ian e la complejidad del genoma del o ganismo, y pa a pe mi i una comp obación p ecisa de los con igs esul an es. En la igu a IV.3 se mues a una compa ación en e la dis ibución de las ecuencias de las cobe u as de lec u as eales (SRR097627) de Saccha omyces ce e isiae con una cobe u a apa en e de 4X mapeadas sob e el c omosoma III de es a especie y lec u as a i iciales ex aídas desde el c omosoma III con la misma cobe u a. Según emos, las lec u as a i iciales ienen una dis ibución no mal de ecuencias de cobe u as muy pa ecida a aquella en las lec u as eales. Po an o, el c i e io con el que se gene an las lec u as a i iciales simula en buena medida a un expe imen o de secuenciación. Las mues as del genoma u ilizadas incluyen odo o pa e del genoma de 3 o ganismos con longi ud y g ado de complejidad c ecien e ( abla IV.4) pa a e el compo amien o de los p og amas de ensamblaje en e a di e en es ipos de genomas y e alua su capacidad a ensambla las zonas epe i i as. 95 RESULTADOS Y DISCUSIÓN Figu a IV.2: Las di e en es e apas de comp obación de un p og ama de ensamblaje de lec u as genómicas. Figu a IV.3: Dis ibución de la cobe u a de lec u as eales y a i iciales cuando la cobe u a es de 4X sob e el c omosoma III de le adu a Tabla IV.4: Mues as de genoma u ilizadas pa a la e aluación de los p og amas O ganismo Secuencia u ilizada Longi ud En e obac e ia phage λ Todo el genoma 48 502 pb Saccha omyces ce e isiae C omosoma 3 316 617 pb Homo sapiens C omosoma 14 (ex emo) 500 000 pb 96 RESULTADOS Y DISCUSIÓN En la abla IV.5 se ecogen los esul ados de con igs esul an es de los ensamblajes pa a las secuencias genómicas indicadas en la abla IV.4. También se indican las ca ac e ís icas básicas de esos con igs y su calidad (basada en las iden idades encon adas po Blas en e el con ig y la secuencia o iginal). Así, un con ig se conside a “bueno” si iene sea un alineamien o único o a ios alineamien os que es án en el mismo o den en el con ig y en la secuencia o iginal. Pa a los con ig “buenos” se incluye o o índice de calidad, que es el núme o de huecos ( gaps ) al se indicado es de la discon inuidad del alineamien o en e el con ig y la secuencia o iginal; cuan os menos huecos, mejo es la econs ucción. Se mues an solo los esul ados co espondien es a la cobe u a 30X po el mismo mo i o que con las p uebas pa a ansc ip ómica. Respec o al bac e ió ago λ de las En e obac e ia, cuyo genoma es ela i amen e simple, los ensamblajes ue on ápidos y odos los p og amas p oduje on un único con ig cuyo amaño es aba muy ce ca del amaño del genoma. En odos los casos el con ig se alineó con la secuencia o iginal, sin huecos ( abla IV.5-A). CAP3, MIRA y EULER p oduje on el esul ado más ce cano al espe ado. En el caso del c omosoma III de Saccha omyces ce e isiae ( abla IV.5-B), cuya secuencia es más la ga y que lle a más epe iciones que el bac e ió ago, los p og amas p oduje on un bo ado de genoma con a ios con igs, pe o con cobe u a al a espec o a la secuencia o iginal (En e 97,8% en EULER y 99,9% en MIRA). El mal esul ado de EULER se debe a que gene ó el bo ado de genoma más agmen ado (49 con igs) con alineamien os discon inuos con la secuencia o iginal (7 huecos, mien as que los o os ensamblado es no p esen an ninguno). CAP3, MIRA y CABOG gene a on un núme o de con igs más educido con el meno núme o po pa e de CAP3 (2 con igs). Po an o, pa ece que EULER no a a se un buen ensamblado de secuencias genómicas. Respec o al c omosoma humano ( abla IV.5-C), aunque la cobe u a de lec u as ue la misma que en los casos an e io es, los p og amas se mos a on más conse ado es y p oduje on más con igs en gene al. CAP3 gene ó menos con igs que los demás p og amas, pe o solo 8 de sus 9 con igs ue on “buenos”, y uno de los “buenos” enía un hueco. En la igu a IV.4 se ilus a la es uc u a del Con ig9 gene ado po CAP3 en compa ación con la secuencia o iginal. El o den in e ido de los alineamien os en e el con ig y la secuencia o iginal y los e o es que se obse an en las lec u as ensambladas indican que los ex emos 3’ y 5’ de es a zona del genoma compa en una secuencia epe i i a que hizo equi oca se al ensamblado . En el caso de VELVET y EULER el bo ado de genoma gene ado ue mucho más agmen ado que los demás (368 y 2 564 con igs espec i amen e). Solo 94 (3,7%) de los con igs de EULER ue on supe io es a 500 pb. De es os 94 con igs, 2 ue on malos y los demás, a pesa de se “buenos”, incluían 20 huecos, mien as que VELVET gene ó 368 con igs, 35 (9,5%) de ellos supe io es a 500 pb, y odos ue on “buenos” y sin huecos. MIRA u o cla amen e el mejo esul ado con meno núme o de con igs, y mayo N50 (298 365), además odos sus con igs ue on “buenos”, ca ecían de huecos y cub ían oda la secuencia del genoma o iginal (100,4%). CABOG u o un esul ado pa ecido al de MIRA, aunque con meno N50 (108 539) y meno cobe u a de la secuencia o iginal (94,2%). Po an o, pa ece 97 RESULTADOS Y DISCUSIÓN que MIRA y CABOG son los ensamblado es más idóneos pa a econs ui secuencias genómicas de al a complejidad. Tabla IV.5: Resul ados de la e aluación de los p og amas de ensamblaje de no o de secuencias genómicas con una cobe u a 30X (A) En e obac e ia phage λ Pa e del genoma: Todo Nº de lec u as a i iciales (30X): 3 643 Tiempo de ejecución (s) Con igs Con igs “buenos” Nº > 500 n N50 N90 Nº Suma (n ) Cob. (%)* Huecos CAP3 73 1 1 48 415 - 1 48 415 99,8 MIRA 75 1 1 48 415 1 48 415 99,8 0 CABOG 78 1 1 48 347 - 1 48 347 99,7 0 VELVET 39 1 1 48 409 - 1 48 409 99,8 0 EULER 10 1 1 48 415 - 1 48 415 99,8 0 (B) Saccha omyces ce e isiae Pa e del genoma: C omosoma 3 Nº de lec u as a i iciales (30X): 23 789 Tiempo de ejecución (s) Con igs Con igs “buenos” Nº > 500 n N50 N90 Nº Suma (n ) Cob. (%)* Huecos CAP3 640 2 2 302 907 11 907 2 314 814 99,4 0 MIRA 496 5 5 186 396 23 565 5 316 298 99,9 0 CABOG 528 4 4 185 448 23 205 4 313 165 98,9 0 VELVET 300 21 6 114 172 70 111 6 312 719 98,8 0 EULER 82 49 9 69 034 21 783 9 309 615 97,8 7 (C) Homo sapiens Pa e del genoma: úl imos 500kb del c omosoma 14 Nº de lec u as a i iciales (30X): 37 581 Tiempo de ejecución (s) Con igs Con igs “buenos” Nº > 500 n N50 N90 Nº Suma (n ) Co . (%)* Huecos CAP3 1 586 9 9 149 272 33 754 8 416 534 83,3 1 MIRA 1 430 7 7 298 365 193 585 7 502 085 100,4 0 CABOG 677 13 13 108 539 29 820 13 470 800 94,2 0 VELVET 596 368 35 49 352 1 554 35 468 406 93,7 0 EULER 152 2 564 94 1 642 72 92 275 654 55,1 20 (*) Po cen aje del genoma o iginal cubie o po los con igs ensamblados 98 RESULTADOS Y DISCUSIÓN Figu a IV.4: Ejemplo de e o de ensamblaje de ec ado en el Con ig9 del ensamblaje CAP3 pa a el agmen o del c omosoma 14 del genoma humano Pa a comp oba si el compo amien o de los ensamblado es pod ía se dependien e de la cobe u a, analizamos el núme o de huecos que p esen aban los con igs “buenos” p oducidos en el caso del genoma humano ( abla IV.5-C) pa a cobe u as que an de 5X a 60X ( abla IV.6). En el caso de CAP3, MIRA y EULER se no a un aumen o de huecos cuando la cobe u a e a baja, aunque EULER siemp e p odujo huecos en odas las condiciones analizadas. Tabla IV.6: Núme o de huecos en los con igs “buenos” según la cobe u a en el caso del agmen o de c omosoma 14 humano Cobe u a 5x 10x 20x 30x 40x 50x 60x CAP3 4 1 3 1 2 0 1 MIRA 8 1 1 0 0 0 0 CABOG 0 0 0 0 0 0 0 VELVET 1 1 0 0 0 0 0 EULER 13 25 28 20 12 13 9 En conclusión, los p og amas de ensamblaje es udiados se mos a on e icien es pa a ensambla genomas simples, mien as que en genomas más complejos se ponen de mani ies o mejo sus di e encias. En e ellos des acan MIRA y CABOG al p oduci el mejo esul ado en cuan o a núme o de con igs y su calidad. Como ecomendación, con iene u iliza MIRA con una cobe u a ≥30X. Pa a ensamblajes con poca cobe u a o que és a sea poco homogénea, es más ecomendable u iliza CABOG ya que gene a con igs más iables en es as condiciones. 99 RESULTADOS Y DISCUSIÓN IV.1.2.3. Combinación de ensamblajes de a ios p og amas Pues o que no hay p og ama bioin o má ico óp imo pa a ningún p oblema biológico, un buen c i e io consis e en combina los esul ados de dis in os algo i mos con los mismos da os. En el caso de los ensamblajes, pa ece con enien e combina los con igs de dos o más p og amas de ensamblaje pa a ob ene el mejo ensamblaje posible. Ensamblajes de ansc ip oma En el apa ado IV.1.2.1 hemos is o que los p og amas MIRA (algo i mo de ipo OLC) y EULER (algo i mo de De B uijn) gene a on los mejo es ansc ip omas. Así, suponiendo que hay lec u as que se ensambla án mejo con un algo i mo que con o o, de inimos un mé odo pa a econcilia los con igs de es os dos ensamblado es pa a saca un solo ansc ip oma. Pa a es e p opósi o u ilizamos CAP3, un p og ama inicialmen e des inado a ensambla lec u as de ipo Sange y ap o pa a ensambla secuencias la gas como los con igs esul an es de un ensamblaje de ansc i os. Como esul ado end emos supe con igs donde hab á con igs de MIRA y EULER, y singulones que son con igs que no encon a on con quién alinea se. La combinación de es os dos g upos de secuencias espe amos que de uel a un ansc ip oma inal mejo que el de cualquie a de los ensamblado es po sepa ado ( igu a IV.5). Figu a IV.5: Reconciliación en e los con igs de MIRA y EULER u ilizando CAP3 La alidación de es a es a egia ue ealizada en nues o labo a o io po Noé Fe nández Pozo [87] pa a ensambla el ansc ip oma de Pinus pinas e y p esen a lo a la comunidad cien í ica en la base de da os Eu oPineDB [141]. En la abla IV.7 se obse a cómo el ensamblaje en supe con igs con CAP3 de uel e un núme o de singulones más supe con igs meno que la suma de con igs de EULER y MIRA po sepa ado (p ime a ila de la abla), y hay mayo núme o y po cen aje de ansc i os comple os y únicos. También se ha alidado pos e io men e en nues o labo a o io con o os ansc ip omas, an o de especies animales como ege ales [140, 142, 143]. 100 RESULTADOS Y DISCUSIÓN Tabla IV.7: Compa ación del ensamblaje de lec u as de 454/Roche pa a gene a el ansc ip oma de Pinus pinas e . La abla es á sacada del manusc i o en p epa ación del p og ama Full-Leng he Nex (Seoane e al, en p epa ación) Los p og amas CAP3 y MIRA u ilizan el o ma o ACE pa a inclui a los da os de las lec u as que han pe mi ido o ma la secuencia consenso del con ig, mien as que EULER no u iliza es e o ma o. Pensando en que el ensamblaje en o ma o ACE pod ía se i pa a inspecciona la calidad de ensamblaje de un ansc i o ( éase más adelan e, apa ado IV.1.3), y que ambién pod ía se i pa a de ec a SNP con GigaBayes [131], decidimos c ea un ACE de los supe con igs gene ados po CAP3, como se ilus a en la igu a IV.6. Pa a ello, se desa olló un sc ip en Ruby ( éase ma e iales y mé odos; apa ado III.3.5.2) que impo a la in o mación de los dos iche os ACE y en el iche o ACE del CAP3 eemplaza los con igs del MIRA con las lec u as ensambladas que les co esponden ( igu a IV.6). Figu a IV.6: Combinación de los iche os ACE de MIRA y CAP3. Los con igs de MIRA (A) se eemplazan con las lec u as que les co esponden (B) pa a gene a un nue o iche o ACE (C) 101 RESULTADOS Y DISCUSIÓN Ensamblajes de genoma En los ensamblajes de genoma, no es an ácil hace una usión de ensamblajes, ya que puede causa un bo ado de genoma con duplicaciones. Además, iene que hace se con un p og ama di e en e, GAM-NGS [118], en el que hay que de ini un ensamblaje de e e encia o maes o, que luego se puede ex ende con o o ensamblaje que denominan “escla o”. Compa a i emen e a o os p og amas p obados como GARM [144], GAM-NGS iene la en aja de u iliza la in o mación de mapeo las secuencias de lec u as sob e los con igs o sca olds pa a de ini egiones llamadas “bloques” que ep esen an el mismo locus en e los di e en es con igs o sca ods , lo cual pe mi e una usión más iable de es os. Dado que cada ez se secuencian menos genomas con 454/Roche y más con secuencias co as de Illumina (cuyos ensamblado es incluyen di e en es e siones de algo i mos basados en los g a os de De B uijn), o a mane a de combina dis in os ensamblajes es usa di e en es k -me os y combina los. Algunos ensamblado es, como SOAPdeno o [66] lo hacen po sí solos, mien as que o os, como T ini y, solo son capaces de usa un k -me . En los p óximos capí ulos e emos con más de alle la es a egia seguida pa a ensambla el genoma de una bac e ia con 454/Roche, y el del lenguado combinando 454/Roche e Illumina. IV.1.2.4. Tamaño eal del inse o en las lec u as pa eadas Pa a pode o dena los con igs ob enidos se u ilizan lec u as pa eadas, con las que de inimos los sca olds . El amaño de inse o en las lec u as pa eadas (PE o MP) a ía de una lib e ía a o a según las pla a o mas de secuenciación y el p o ocolo expe imen al u ilizado. La mayo ía de los p og amas de ensamblaje y de sca olding equie en inclui la media y la des iación ípica del amaño eal de los inse os. Pa a ob ene es e alo , desa ollamos un sc ip en Ruby ( éase ma e iales y mé odos; apa ado III.3.5.3) con el que ensamblamos lec u as pa eadas que sigue el p o ocolo ilus ado en la igu a IV.7. Las secuencias pa eadas usadas pa a el ensamblaje se mapean con Bow ie sob e los con igs esul an es pa a medi a qué dis ancia caen los ex emos de las secuencias pa eadas y así es ima el amaño medio y la des iación ípica. 102 RESULTADOS Y DISCUSIÓN Figu a IV.7: P o ocolo u ilizado pa a calcula la media y la des iación ípica del amaño de inse o en lec u as pa eadas. El p og ama usado pa a el ensamblaje es, en cada caso, el que equie e los alo es de amaño de inse o, como po ejemplo, CABOG IV.1.3. CoMine : alidación de ensamblajes En cualquie ipo de ensamblaje de no o exis en e o es. La iden i icación de los ensamblajes e óneos cons i uye una a ea di ícil debido a la g an can idad de da os y a la a iación de la calidad de es os da os po culpa de complicaciones mecánicas y bioquímicas de los secuenciado es. Pa a la econs ucción de un ansc ip oma o genoma iable, la co ección de e o es en los ensamblajes equie e es ue zos adicionales de alidación manual [145]. La mane a habi ual de medi la calidad de los ensamblajes se basa en es adís icas simples, como el con ig más la go, la longi ud media de los con ig, la suma de las longi udes y el N50. De hecho, se suele da p e e encia a los con igs la gos [146], sin epa a muchas eces en que puedan se quimé icos o esul an es de un ensamblaje e óneo. Se han desa ollado alidado es de ensamblajes basados en pa áme os más complejos, como es Hawkeye [147]. Si e pa a acili a la inspección isual de los ensamblajes en el que se mues an los pun os de con lic o pa a educi al mínimo el iempo dedicado a la iden i icación, edición y co ección. A di e encia de o os edi o es de con igs como GAP5 [148], Hawkeye combina p edic o es compu acionales con isualización in e ac i a. Su p incipal p oblema es á en que es manual, po lo que pie de u ilidad a medida que aumen a la can idad de con igs de un ensamblaje. Po eso, aunque la inspección isual y edición manual sean mé odos e icaces, es os pueden cons i ui unas a eas engo osas, pa icula men e pa a ensamblajes con los da os de secuenciación de nue a gene ación (NGS), po es a azón se desa olló un p og ama de alidación au omá ica de los con igs basado en c i e ios independes, llamado amos alida e [146]. No obs an e, es a he amien a solo ma caba las egiones que apa ecían mal ensambladas, y la co ección equie e una nue a isualización y una edición manual u ilizando Hawkeye . 103 RESULTADOS Y DISCUSIÓN En es e abajo nos plan eamos la de ección de e o es de ensamblaje y su co ección au omá ica, pa a lo que desa ollamos un p og ama llamado CoMine ( e se el apa ado III.3.5.8 de ma e iales y mé odos) que ue p og amado en Ruby y comp obado en un iMac dual co e a 3,06 GHz con 4 Gb de RAM. El p og ama lee y esc ibe ensamblajes en el o ma o ACE [149], que es un o ma o gene ado po a ios p og amas basados en el algo i mo OLC como los adicionales Ph ap, CAP3 y GAP4-5, y los desa ollados pa a la NGS de lec u as la gas (Newble , CABOG, A achne, Minimus y TIGR Assemble ). Con el obje i o de inc emen a la iabilidad del ensamblaje sin la in e ención humana, el algo i mo de CoMine se di ide en 4 e apas p incipales ( igu a IV.8): (i) descub imien o de las egiones de al a en opía (HER, po High-en opy egion ); (ii) iden i icación de las lec u as con lic i as; (iii) edición de las lec u as ( eco e o eliminación); (i ) e i icación del con ig y esc i u a del nue o iche o ACE. Figu a IV.8: ( omada de [150]) Flujo de abajo del algo i mo de CoMine . A. Descub imien o de las egiones de al a en opía e iden i icación de las lec u as con lic i as. B: Edición o eliminación de las lec u as con lic i as en un con ig según la dis ibución de e o es. C: Una ez edi adas las lec u as con lic i as, se e i ica la cobe u a del con ig. Es e se di ide en dos o más con igs si es necesa io, luego se gua da en el iche o ACE Veamos cada una de es as e apas con más de alle: (i) Descub imien o de HER: El obje i o de es a e apa es localiza los agmen os donde las lec u as no alinean pe ec amen e. Se eligió una medida pa a de ini la calidad de un alineamien o, la en opía de la secuencia consenso en la posición i [- H(i)] al como se desc ibió en [151]. Se calcula en onces la ecuencia de cada uno de los 4 nucleó idos en cada posición de la secuencia consenso, lo que se u iliza pa a calcula la en opía en cada posición del consenso. Los SNP y disco dancias 110 RESULTADOS Y DISCUSIÓN Figu a IV.13: Esquema del lujo de abajo del p og ama ICMappe 111 RESULTADOS Y DISCUSIÓN Figu a IV.14: Esquema de las di e en es e apas del a amien o de los HSPs de Blas con ICMappe . A: clus e ización de los HSP po diagonal y po longi ud de huecos (gaps). B: Fo mación de alineamien os esumidos po cada clús e . C: Eliminación de las epe iciones y o denamien o de las secuencias del bo ado de genoma 112 RESULTADOS Y DISCUSIÓN Figu a IV.15: Do plo ejemplo de un alineamien o en e con igs genómicos eales de una cepa de la bac e ia Lac ococcus ga ieae y una cepa de Lac ococcus lac is ( e e encia). An es del a amien o con ICMappe (A) los agmen os de alineamien o son pequeños y dispe sos además que se no a la exis encia de muchos alineamien os epe idos. Después del a amien o ICMappe (B), los alineamien os esumidos apa ecen más la gos, de hecho son más ep esen a i os del con ig ya que cub en zonas de la e e encia más g andes, lo que pe mi e un posicionamien o más iable del con ig. De o a pa e se elimina on los alineamien os epe i i os, los cuales p obablemen e ue on un p oduc o de zonas epe i i as en e los dos genomas Pa a comp oba las posibilidades de ICMappe , se compa a on sus esul ados con los de 3 p og amas del mismo ipo, que son Oslay [154], P ojec o 2 [155] y Mau e Aligne [156]. Los da os u ilizados consis ie on en bo ado es de genomas a i iciales (con igs) c eados a pa i del genoma acabado de a ias bac e ias. En la c eación de los con igs a i iciales se incluye on sepa aciones o solapamien os con longi udes alea o ias pa a ene una es uc u a de bo ado de genoma pa ecida a los casos eales. Como e e encia se u iliza on cepas de la misma especie o de especies di e en es del mismo géne o. La e aluación de la p ecisión del o denamien o consis ió en compa a el o den de los con igs es ablecido po los p og amas con su o den eal ya conocido. En es e es udio, pa a alinea los con igs a i iciales con a el genoma de e e encia se u ilizó el la e sión 2.2.20 de Blas con la siguien e con igu ación: -F F pa a desac i a el p og ama “DUST” de econocimien o de secuencias de baja complejidad y e i a que se in e umpe el alineamien o Blas en es as zonas; -G 5, pa a a ec a el alo 5 al cos e po ab i huecos lo que pe mi e educi los huecos en los alineamien o, y -E 10 pa a a ec a el alo 10 al cos e po ex ende los huecos lo que pe mi e educi la longi ud de los huecos abie os. El es o de pa áme os se deja on po de ec o. Tal como se obse a en la abla IV.9, ICMappe y Mau e aligne gene an mejo es esul ados que los dos demás p og amas, En caso de la especie Mycobac e ium ube culosis CDC1551, a la di e encia de los demás p og amas, ICMappe u o un po cen aje de o denamien o de 100% en los dos casos donde la e e encia e a una cepa de la misma especie. En gene al ICMappe u o una p ecisión de o denamien o supe io o igual que Mau e aligne 113 RESULTADOS Y DISCUSIÓN y muy supe io que P ojec o 2 y Oslay, excep o el caso de la bac e ia Lac ococcus lac is subsp, c emo is MG1363, donde ICMappe u o una p ecisión de o denamien o in e io a Mau e aligne (95.58% y 98.57% espec i amen e). Tabla IV.9: Po cen aje de pa es de bases o ales co ec amen e o denadas u ilizando ICMappe y es o os p og amas. (B: Bo ado de genoma, R: Re e encia) Suma de longi udes de los con igs co ec amen e o denados po cada p og ama Nº con igs a i iciales Suma de bases ICMappe Mau e aligne P ojec o 2 Oslay B: Mycobac e ium ube culosis CDC1551 144 4 311 730 4 311 730 4 307 728 4 292 255 4 244 863 R: Mycobac e ium ube culosis H37R 100% 99,9% 99,54% 98,44% B: Mycobac e ium ube culosis CDC1551 144 4 311 730 4 311 730 4 295 761 4 290 321 4 252 754 R: Mycobac e ium ube culosis KZN 100% 99,62% 99,50% 98,63% B: Mycobac e ium ube culosis CDC1551 144 4 311 730 3 942 363 3 919 573 3 028 947 3 549 569 R: Mycobac e ium a ium 104 91,43% 90,90% 70,24% 82,32% B: Lac ococcus lac is subsp, c emo is MG1363 88 2 497 652 2 387 292 2 461 938 2 087 813 2 319 609 R: Lac ococcus lac is subsp. lac is Il1403 95,58% 98,57% 83,59% 92,87% B: S ep ococcus pneumoniae 670-6B 77 2 197 707 2 122 247 2 122 247 1 993 147 2 111 903 R: S ep ococcus pneumoniae G54 96,56% 96,56% 90,69% 96,09% B: Bacillus amylolique aciens DSM7 140 3 920 736 3 888 585 3 880 362 3 234 464 3 878 842 R: Bacillus amylolique aciens FZB42 99,17% 98,97% 82,49% 98,93% B: Bacillus hu ingiensis BMB171 183 5 254 098 5 241 972 5 074 150 4 924 055 5 139 721 R: Bacillus hu ingiensis se o a konkukian s . 97-27 99,76% 96,57% 93,71% 97,82% B: Bacillus hu ingiensis BMB171 NC_014171 183 5 254 098 5 160 653 5 176 617 4 889 963 5 007 363 R: Bacillus hu ingiensis s . Al Hakam 98,22% 98,52% 93,06% 95,3% B: Esche ichia coli 536 154 4 795 594 4 667 799 4 616 347 4 023 816 4 474 579 R: Esche ichia coli 55989 97,33% 96,26% 83,9% 93,3% Valo medio del po cen aje de los con igs co ec amen e o denados 97,6% 97,3% 88,5% 94,9% Po o a pa e, se compa ó el iempo de ejecución de ICMappe con Mau e aligne (el p og ama que gene ó el esul ado más pa ecido). La abla IV.10 mues a el iempo anscu ido du an e odas las e apas del p oceso (en caso de ICMappe , se incluye a iempo anscu ido du an e la e apa del alineamien o Blas ). En odos los casos se obse a una di e encia g ande en e los iempos de ejecución de los dos p og amas. ICMappe llegó a se 20 eces más ápido que Mau e aligne . Es a di e encia en el iempo de ejecución eside en el hecho de que Mau e aligne u iliza su p opio algo i mo de alineamien o y ejecu a a ios ciclos de o denamien o después de los cuales escoge el mejo esul ado basándose en c i e ios p ees ablecidos, mien as que ICMappe de una pa e ap o echa de la apidez del algo i mo Blas y de o a pa e ealiza la a ea de o denamien o en un ciclo único y e icaz. 114 RESULTADOS Y DISCUSIÓN Tabla IV.10: Compa ación en e los iempos de odas las e apas de ejecución de los p og amas ICMappe y Mau e aligne Tamaño del genoma Tiempo global de ejecución (s) ICMappe Mau e aligne Mycobac e ium ube culosis CDC1551 4 311 730 27 105 Lac ococcus lac is subsp, c emo is MG1363 2 497 652 5 98 S ep ococcus pneumoniae 670-6B 2 197 707 5 57 Bacillus amylolique aciens DSM7 3 920 736 7 61 Valo medio del iempo de ejecución (s) 11 80 Con a iamen e a Mau e aligne que es a des inado a genomas de amaño pequeño, especialmen e los genomas mic obianos [156], ICMappe ue capaz de o dena an o bo ado es de genomas de mic oo ganismos como bo ado es de genomas g andes de euca io as. Ej. Genoma de Solea senegalensis (Apa ado IV.3.2 a con inuación) 115 RESULTADOS Y DISCUSIÓN IV.2. Ensamblajes de ansc ip omas IV.2.1. Es a egia omada como modelo Los ensamblajes y ano aciones del ansc ip oma ealizados en es e abajo se basa on sob e una lujo de abajo que se desa olló en nues o g upo de in es igación [87] pa a el ansc ip oma del pino ( Pinus pinas e ; igu a IV.16) P ep ocesamien o: Las lec u as se p ep ocesan con SeqT imNex , desa ollado ambién en nues o labo a o io a pa i de SeqT im [152] ( h p://www.scbi.uma.es/seq imnex / ; [46]) Ensamblaje: A con inuación se desc ibe la es a egia del p ocesamien o y ensamblaje que se u ilizó pa a el ansc ip oma del pino ( igu a IV.17). Se pueden dis ingui dos pa es: ensamblaje, p opiamen e dicho, y econciliación. El ensamblaje de lec u as la gas se ealiza con el mé odo desc i o en el apa ado IV.1.2.3 basado en la combinación de los ensamblajes de MIRA [109] y EULER [110], el cual ue op imizado pa a ex ae la máxima in o mación de las lec u as y que és a sea iable. El ensamblaje de lec u as co as se ealiza con el p og ama ABySS [67] u ilizando una se ie de k-me os de 43 a 73. Los con igs de es e ensamblaje se ag upan con CD-HIT [129] y después TGICL [157] a in de elimina las edundancias gene adas p incipalmen e po la u ilización de múl iples k-me os. La econciliación inal consis e en un ensamblaje CAP3 [105] de los g upos de secuencias ú iles p oceden es de los ensamblajes an e io es que son los siguien es: (i) Con igs de MIRA (ii) Deb is de MIRA que son codi ican es (el es o se conside an a e ac os de secuenciación) (iii) Con igs de EULER sob e los que mapean lec u as (i ) Con igs de EULER sob e los que no mapean lec u as, pe o son codi ican es (el es o se conside an a e ac os de ensamblaje) ( ) Con igs ag upados de ABySS. El ensamblaje da luga a supe con igs y singulones que se jun a án pa a o ma el ansc ip oma inal al como se explicó más de alladamen e en el apa ado IV.1.2.3. Ve i icación: Es e paso se ealiza con Full-Leng he Nex [87] que si e pa a e alua de un modo ápido si el ensamblaje iene una buena p opo ción de genes comple os, si es á muy agmen ado o si posiblemen e con iene un al o núme o de secuencias sin in o mación 116 RESULTADOS Y DISCUSIÓN biológica. Es a e i icación puede u iliza se an o pa a e alua la calidad del ansc ip oma inal como pa a e alua la calidad de los ensamblajes de lec u as pa a pode op imiza los con el ajus e de los pa áme os de ensamblaje. Full-Leng he Nex , después de las ul imas mejo as (Seoane e al., en p epa ación) iene la posibilidad de c ea un ansc ip oma ep esen a i o que incluye los genes ano ados únicos y los codi ican es pu a i os. De es e modo se educe la agmen ación del ansc ip oma que después esul a más manejable y se mejo a la calidad de los esul ados en los es udios pos e io es (po ejemplo de RNAseq). Figu a IV.16: ( omada de [87]): Flujo de abajo p opues o pa a ob ene un ansc ip oma de pino ano ado a pa i de lec u as de NGS y de ipo Sange . Las secuencias de ipo Sange se p ep ocesan con SeqT im y las de NGS con SeqT imNex . Todas las lec u as limpias se ensamblan jun as con MIRA, y las secuencias limpias de NGS se ensamblan además con Eule - SR, pe o sin mezcla los di e en es expe imen os. Luego se e-ensamblan los con igs de Eule -SR y MIRA u ilizando CAP3, pos e io men e se e i ican los unigenes del ensamblaje con Full- Leng he Nex y si se conside a que el ensamblaje es co ec o, se ano an los unigenes ob enidos con Au oFac , Blas 2GO, Gigabayes y MREPS Ano ación: La ano ación que se p opuso en el lujo ( igu a IV.16) se comple a con los p og amas Au oFac , Blas 2GO, Gigabayes y MREPS. De es e modo, los ansc i os quedan ano ados con es desc ipciones del p oduc o del gen, que pe mi en a los in es igado es con i ma si 117 RESULTADOS Y DISCUSIÓN es p og amas que usan dis in os c i e ios pa a ano ación coinciden en la in o mación encon ada. También se añaden é minos GO, códigos EC, In e P o, u as KEGG, SNP y SSR que pe mi i án ealiza es udios compu e izados de los esul ados con p og amas de en iquecimien o biológico o de ección de posibles ma cado es molecula es pa a mejo a gené ica. Figu a IV.17: ( omada de [158]) Esquema del lujo de abajo del p ocesamien o, ensamblaje y econciliación de las lec u as 454 y Illumina de Pinus pinas e Gene ación de una base de da os: El p ime p o o ipo de base de da os ansc ip ómica desa ollada po nues o labo a o io ue Eu oPineDB [141], que poco después ue mejo ada y ampliada en Sus ainPine [158] ( igu a IV.18). Es án basadas en Ruby On Rails al y como se desc ibe en ma e ial y mé odos (apa ado I.3.4.1). La p incipal mejo a en e las dos es á en que la web, la base de da os p opiamen e dicha, y los cálculos se alojan en una es uc u a de 3 máquinas i uales [46] pa a agiliza su uso. También se mejo ó el sis ema de paginación in e na y la o ma de na ega po el con enido a base de abulado es in e ac i os. 118 RESULTADOS Y DISCUSIÓN Figu a IV.18: Base de da os de Sus ainPineDB en su es ado inicial. A: A qui ec u a de la base de da os. B: Página de inicio. C: página de ano aciones 119 RESULTADOS Y DISCUSIÓN IV.2.2. T ansc ip omas de Solea senegalensis y Solea solea El lenguado senegalés ( Solea senegalensis ) y el lenguado común ( Solea solea ) son dos especies de peces planos impo an es desde el pun o de is a económico y e olu i o, an o en la pesca como en la acuicul u a. A pesa de la disponibilidad de algunos ecu sos genómicos que se desc ibie on ecien emen e, se necesi an aún más expe imen os de secuenciación pa a es ablece un ansc ip oma comple o y ep esen a i o. Po o a pa e, un análisis compa a i o del ansc ip oma de ambas especies puede ayuda a en ende la e olución de pez plano. IV.2.2.1. P ep ocesamien o de las lib e ías Un o al 37 y 43 lib e ías de Illumina de Solea senegalensis y Solea solea espec i amen e (1 800 millones de lec u as) y 14 lib e ías adicionales de Roche/454 pa a Solea senegalensis (5,6 millones de lec u as) ue on p epa adas en el labo a o io del g upo de in es igación de IFAPA El To uño (Cádiz). En la abla IV.11 se p esen a un esumen del p ep ocesamien o con SeqT imNex de las lec u as Roche/454 e Illumina de odas las lib e ías que se pusie on a nues a disposición. Se obse a que la mayo ía de las lec u as pa eadas ue on ú iles (83,3% y 79,5% en S. senegalensis y S. solea espec i amen e). La uen e de con aminaciones más impo an es ue de secuencias ibosómicas y mi ocond iales. O os con aminan es menos ep esen ados en los da os de Illumina ue on secuencias de los o ganismos u ilizados pa a la nu ición de las la as (a emias (8-21%) y o i e os (2-4%), p incipalmen e) y o os mic oo ganismos di e en es, p incipalmen e de hongos. Tabla IV.11: Resumen del p e-p ocesamien o de las lec u as o iginales de los ansc ip omas de S. senegalensis y S. solea 126 RESULTADOS Y DISCUSIÓN Figu a IV.24: Flujo de abajo de la ano ación de los ansc ip omas de lenguado IV.2.2.4. SoleaDB, una base de da os pa a explo a los ansc ip omas de Solea SoleaDB ue cons uida sob e la base de Sus ainPineDB pa a almacena los dis in os ensamblajes de los ansc ip omas de S. senegalensis y S. solea , y los di e en es ipos de ano aciones. En la igu a IV.25 se puede obse a el esquema de las ablas de la base de da os en SoleaDB y en la igu a IV.26 se mues an unas cap u as de pan alla de la in e az web. Las p incipales mejo as de Sus ainPineDB aplicadas en SoleaDB ue on las siguien es: (i) Mejo a en el modo de acceso a los da os de ano aciones. En e ec o, aho a se puede accede a las ano aciones especí icas a cada e sión del ansc ip oma en una es uc u a con pes añas ho izon ales que pe mi en isualiza de o ma independien e la in o mación ela i a a cada e sión del ansc ip oma ( igu a IV.26-B). (ii) Se añadie on es adís icas comple as sob e cada ensamblaje y sus ano aciones, la cual se puede consul a en la página “Assembly in o”. (iii) En la lis a de ansc i os, se añadió la posibilidad de busca po nomb e de ansc i os o po ano aciones y de o a pa e se implemen ó una unción que pe mi e esal a las palab as cla es comunes en e las desc ipciones de los 3 p og amas de ano ación, lo que pe mi e al usua io de localiza ácilmen e las desc ipciones comunes. (i ) En la página donde se p esen a la in o mación sob e el ansc i o, se añadió un campo de cu ación donde se pueden in oduci no as o in o mación sob e el ansc i o en cues ión. ( ) En la página de la in o mación sob e el ensamblaje, se implemen ó una he amien a que pe mi e ex ae oda la 127 RESULTADOS Y DISCUSIÓN Figu a IV.25: Esquema de las ablas de base de da os SoleaDB que gua dan las misma es uc u a u ilizada en Sus aPineDB con algunos elemen os adicionales 128 RESULTADOS Y DISCUSIÓN in o mación ú il sob e una lis a de ansc i os y expo a la a un iche o en o ma o abulado, el cual se puede ab i con p og amas como Excel ( igu a IV.26-C). ( i) En la página de los KEGG se inco po ó la posibilidad de isualiza las mapas de las u as me abólicas en las cuales se esal an en colo e de los códigos ECs p opios de la especie es udiada. En la igu a IV.27 se puede obse a un ejemplo de los mapas KEGG a los que se puede accede desde la web. 129 RESULTADOS Y DISCUSIÓN Figu a IV.26: Cap u as de pan alla de la in e az de la base de da os SoleaDB. A: Po ada de la web. B: Ilus ación de la pes aña “Assemblies” en la que se mues a oda la in o mación sob e odas las e siones de ansc ip omas y sub e siones. C: cap u a de la pa e de pan alla que co esponde a la pes aña “Assembly in o” donde hay in o mación gene al sob e el ansc ip oma, así como iche os desca gables y he amien as 130 RESULTADOS Y DISCUSIÓN Figu a IV.27: Mapa de KEGG de la u a del me abolismo de alanina, aspa a o y glu ama o, en el que las enzimas ano adas en S. senegalensis apa ecen esal adas en e de. IV.2.2.5. Calidad del ansc ip oma de los dos lenguados Un análisis de allado del esul ado de ano ación Full-Leng he Nex ( abla IV.14) e ela p ime o que, a pesa del núme o muy ele ado de los ansc i os, el núme o de a e ac os ue muy bajo. Segundo, que el ansc ip oma de S. senegalensis 4 mejo ó con espec o a la 3 en é minos longi ud de los ansc i os y núme o de los ORF comple os, aunque ambas e siones p esen a on un núme o simila de ID di e en es de o ólogos, lo que mues a la impo ancia de u iliza muchos ejidos pa a la p epa ación de las lib e ías Roche/454 a la ho a de ob ene una mayo ep esen ación de los genes. Te ce o, el núme o de los ORFs comple os di e en es ue al o y simila en e los ansc ip omas de las dos especies ( abla IV.14 “Di e en comple e ORFs”), poniendo de mani ies o que los ansc ip omas de lenguado son igual de iables. Finalmen e, S. senegalensis 4 u o meno núme o de ID de o ólogos y meno núme o de ORF comple os di e en es que S. solea 1 lo que puede se debido a una mayo 131 RESULTADOS Y DISCUSIÓN agmen ación en S. senegalensis ya que, según pa ece, los da os de Roche/454 solo con ibuye on en inc emen a la o ología en el ensamblaje inal. Tabla IV.14: ( omada de [143]) : Ca ac e ís icas de los ansc ip omas ensamblados de S. senegalensis y S. solea El al o núme o de lec u as u ilizadas en el ensamblaje de los dos ansc ip omas de lenguado puede habe a o ecido la acumulación de e o es [162, 165]. La e aluación de la iabilidad del ansc i o se basó inicialmen e en el mapeo de las lec u as ú iles de dos lib e ías alea o ias de cada ansc ip oma u ilizando Bow ie2 [119]. Como el 96,7%-98% de las lec u as mapea on sob e los ansc i os, los e o es de ensamblaje pueden conside a se insigni ican es. Cu iosamen e, el ansc i o más la go de los ansc ip omas de S. senegalensis 4 y S. solea 1 no es un a e ac o, ya que en ambas especies co esponde a una p o eína pa ecida a la i ina cuyo ARNm es muy la go (94 446 bp) y que an e io men e ya se ha ensamblado en la ilapia (Núme o de acceso XM_005460929). El hecho de que es e ansc i o es 6 eces más la go en S. senegalensis 4 que en S. senegalensis 3 supone la con ibución impo an e de las lec u as co as en el ensamblaje inal. Los ansc i os sin o ólogo como uen e de nue os ansc i os de lenguado. El al o núme o de ansc i os sin o ólogo ( abla IV.14) me eció un análisis más p o undo. En unción del índice de es code [135], más del 91% de los ansc i os son desconocidos (“Unknown”), lo que puede explica en buena pa e la al a de o ología. Pa a 132 RESULTADOS Y DISCUSIÓN e i ica el o igen de es os ansc i os desconocidos, se mapea on lec u as genómicas (desde a ias lib e ías genómicas de S. senegalensis disponibles en nues o labo a o io) sob e los ansc i os desconocidos de S. senegalensis 4, lo que dio luga a 462 568 (91,25%) ansc i os desconocidos mapeados (440 385 con más de 10 lec u as). Es e al o po cen aje de mapeo indica que es as secuencias no ue on a e ac os de ensamblaje y que pueden co esponde a agmen os genómicos o ansc i os inmadu os que copu i ican con los ansc i os madu os. Po o a pa e, en e 7,30% y 8,37% de los ansc i os sin o ólogo en S. senegalensis 4 y S. solea 1, espec i amen e, algunos mos a on un índice Tes code >0,94 ( abla IV.14, “Pu a i e new ansc ip s”), po lo que ienen al a p obabilidad de se ansc i os codi ican es. La acción no edundan e de es os ansc i os (14 451 y 15 503 ansc i os en S. senegalensis 4 y S. solea 1, espec i amen e; abla IV.14), sob e la base de la ausencia de o ólogos en la base de da os UniP o KB, sal o que sean con aminan es de especies no secuenciadas aún, pueden conside a se p o eínas (o agmen os de p o eínas) “nue as” de lenguado. T ansc ip oma de e e encia en cada especie de lenguado El núme o al o de ansc i os ensamblados indicó una sob ees imación de los ansc ip omas de lenguado cuando se compa an con o os eleós eos [159, 160]. P obablemen e, la sob e alo ación enga de los ansc i os que pueden ep esen a alelos, pa álogos, ansc i os agmen ados, iso o mas o secuencias al e na i as de ayus e, ARNm inmadu os o incluso una combinación de ellos. Po lo an o, pa a los es udios de es os ansc ip omas con iene u iliza el ansc ip oma de e e encia gene ado po Full- Leng he Nex que incluye un núme o de ansc i os mucho más educido y ce cano al eó ico. El ansc ip oma de e e encia pa a S. senegalensis ( S. senegalensis 4.1) consis ió en 59 514 ansc i os y pa a S. solea ( S. solea 1.1) consis ió en 54 005 ansc i os ( abla IV.14, úl ima ila) Pa a e i ica la ep esen a i idad de los ansc i os que cons i uyen los ansc ip omas de e e encia, se mapea on las lec u as ú iles ( abla IV.11) sob e los dos ansc ip omas de e e encia. Como esul ado, el 82,3-87,5% de las lec u as mapea on sob e los ansc i os, mien as que el 76,5-93,3% de los ansc i os ecibie on el mapeo de más de una lec u a, lo que mues a que es os ansc i os ep esen an adecuadamen e el ansc ip oma. O a e i icación del ansc ip oma de e e encia ( 4.1 y 1.1) se basó en un análisis de o ología con el pez ceb a (43 132 en adas disponibles en Re Seq y 42 555 en ENSEMBL) u ilizando Top-blas . En S. senegalensis 4.1, 39 851 ansc i os de e e encia ue on o ólogos a 21 542 en adas Re Seq y 20 753 en adas Ensembl de pez ceb a ( igu a IV.28, izquie da). En S. solea 1.1, 34 949 ansc i os de e e encia ue on o ólogos a 20 594 en adas Re Seq y 19 632 en adas Ensembl de pez ceb a ( igu a IV.28, de echa). Es os núme os mues an que un cie o núme o de alelos, ARNm inmadu os y genes especí icos de linaje (incluso algunos ansc i os quimé icos no de ec ados) pudie on habe sido incluidos en el ansc ip oma de e e encia. Po o a pa e, como el núme o de ID de Re Seq y Ensembl co esponde casi a la mi ad de los ansc i os de lenguado, es p obable que se hayan incluido ambos alelos de cada gen en el ansc ip oma de e e encia. Es a hipó esis ambién es á sopo ada po el hecho de que las mues as analizadas co esponden a animales sil es es y a la as, que son 133 RESULTADOS Y DISCUSIÓN mayo i a iamen e he e ocigo os. Es impo an e señala que el núme o de los ID di e en es de pez ceb a en Re Seq o Ensembl es ce ca de los 21 000 epo ados ecien emen e en o o lenguado ( Cynoglossus semilae is ) y no son an di e en es de los 26 206 genes que ue on ecien emen e epo ados en pez ceb a [159, 166]. En onces, se puede suge i que los ansc ip omas de e e encia de lenguado desa ollados en es e abajo cub en la mayo ía de los genes del lenguado. Figu a IV.28: Ano ación de los ansc ip omas de e e encia con los o ólogos de pez ceb a u ilizando los ID de Re Seq y Ensembl Sse: núme o de ansc i os de Solea senegalensis con un ID; Sso: núme o de ansc i os de Solea solea con un ID. R: núme o de ID únicos de Re Seq; E: núme o de ID únicos de Ensembl IV.2.2.6. Análisis compa a i o en e las dos especies de lenguado Un análisis compa a i o en e los ansc ip omas de las dos especies de lenguado puede e ela nue as pis as sob e su biología y e olución y p opo ciona o os elemen os pa a con i ma la ep esen a i idad de su ansc ip oma de e e encia. S. solea y S. senegalensis mues an una cla a simili ud uncional Pa a comp oba la simili ud de los dos lenguados desde el pun o de is a uncional, compa amos la abundancia de los é minos GO de los ansc i os con o ólogo de la abla IV.14. La dis ibución de los é minos GO po ca ego ías en e las dos especies de lenguado e eló que e an simila es ( igu a IV.29). El núme o más al o de ansc i os ano ados con p ocesos biológicos ue asociado con p ocesos me abólicos (15,2%) y celula es (22,2%) ( igu a IV.29-A). En componen es celula es, las ca ego ías más ep esen adas ue on células (36,3%) y o gánulos (22,1%) ( igu a IV.29-B). En unción molecula , el mayo núme o de ansc i os ano ados ue en la ca ego ía de ac i idad ca alí ica (30,4%) ( igu a IV.29-C). Cu iosamen e, las ac i idades egulado as de canales y an ioxidan es ue on ep esen adas solo en S. senegalensis. La ausencia de es as dos ac i idades en S. solea segu amen e se o igina de la secuenciación de las mues as o del p oceso del ensamblaje, sob e odo que es án muy poco ep esen adas en S. senegalensis , aunque no podemos desca a la exis encia de una 134 RESULTADOS Y DISCUSIÓN Figu a IV.29: ( omada de [143]) dis ibución de los Gos en los dos ansc ip omas según los p ocesos biológicos (A), componen es celula es (B) y unción molecula (C) 135 RESULTADOS Y DISCUSIÓN azón biológica. En conclusión, los ansc ip omas de lenguado son apa en emen e simila es del pun o de is a biológico y uncional. S. solea y S. senegalensis mues an una al a simili ud de los genes O a compa ación de los ansc ip omas de lenguado se basó en su pa ecido con una e ce a especie que hace de e e encia, o sea, en la o ología con pez ceb a. La igu a IV.30 mues a que el 78,4% de los ansc i os o ólogos en los lenguados con un o ólogo en pez ceb a u ie on una simili ud ≥95% a ni el de nucleó ido, y 1 437 de ellos e an idén icos a 100%. Como se espe aba, los ansc i os sin o ología con pez ceb a u ie on un g ado de iden idad meno (92-96%; igu a IV.30). Hay que señala que 41 ansc i os sin o ólogo u ie on la misma secuencia y 49 ansc i os mos a on 99% de iden idad en e las dos especies de lenguado. Todos es os da os demues an el al o ni el de simili ud en e los dos ansc ip omas de lenguado. Suponiendo que los ansc i os de lenguado que compa en el mismo o ólogo de pez ceb a ambién pueden conside a se como o ólogos de lenguado, un o al de 39 851 ansc i os de e e encia en S. senegalensis y 34 949 ansc i os de e e encia en S. solea compa en 17 562 IDs pa a Re Seq y 17 031 IDs pa a Ensembl, lo cual e leja cla amen e el al o ni el de o ología en e es as dos especies de lenguado, y de nue o sugie e que en el ansc ip oma de e e encia es án incluidos los dos alelos de cada gen (al habe ap oximadamen e el doble de ansc i os de lenguado que ID de pez ceb a). Figu a IV.30: ( omada de [143]): Dis ibución de los ni eles de simili ud en e los ansc ip omas de e e encia de los dos lenguados pa a los ansc i os con (ba as neg as) o sin (ba as g is) o ólogo de pez ceb a S. solea y S. senegalensis con ienen ansc i os especí icos del lenguado y de peces planos. Los o ólogos e dade os en e ambas especies de lenguado se ob u ie on después de ealiza un Blas ecip oco en e los ansc ip omas de e e encia. En es e análisis, dos 142 RESULTADOS Y DISCUSIÓN IV.2.3. T ansc ip oma de la mic oalga Tisoch ysis lu ea El po encial económico de las mic oalgas es á en c ecimien o con inuo [176]. Sus aplicaciones son múl iples y an desde la pu i icación de las aguas has a la alimen ación animal y humana [177]. Isoch ysis galbana ecien emen e llamada Tisoch ysis lu ea (Tiso) [178] es una mic oalga muy u ilizada en el sec o de acuacul u a como uen e de p o eínas y i aminas. Po eso se u iliza en la die a alimen a ia de las la as y la ase ju enil de los peces. Es udios sob e el ansc ip oma pe mi i ían amplia la in es igación sob e a ios aspec os como el me abolismo y el ciclo de ida de es a especie. IV.2.3.1. P ep ocesamien o de las lib e ías Las mues as de Tisoch ysis lu ea secuenciadas se p epa a on en el labo a o io del g upo de in es igación de IFAPA El To uño (Cádiz). El esumen del p ep ocesamien o con SeqT imNex de las lec u as no malizadas y sin no maliza ob enidas con las ecnologías Roche/454 e Illumina ( igu a IV.33) se p esen a en la abla IV.17. Los con aminan es más ep esen ados ue on el plas idio, el RNA ibosómico y o os mic oo ganismos, especialmen e hongos como Aspe gillus nige y Schizosaccha omyces pombe. El po cen aje de lec u as no no malizadas ú iles ue al o pa a Roche/454 y muy al o pa a Illumina (69,9% y 93,0% espec i amen e) mien as que en las lec u as no malizadas es os po cen ajes ue on bas an e bajos an o pa a Roche/454 como pa a Illumina (32,4% y 31,8% espec i amen e). Es os bajos po cen ajes de lec u as no malizadas ú iles se deben al exceso de secuencias con aminadas (52,3% en Roche/454 y 51% en Illumina) de las cuales, la mayo pa e ue on lec u as del plas idio. 143 RESULTADOS Y DISCUSIÓN Figu a IV.33: Es a egia de p e-p ocesamien o, ensamblaje y la econciliación del ansc ip oma de Tisoch ysis lu ea Tabla IV.17: Resumen del p ep ocesamien o de las lec u as o iginales del ansc ip oma de T. lu ea Re e encia a la igu a IV.33 Roche/454 Illumina To al lec u as #1 No malizadas 1 151 067 925 682 496 No no malizadas 505 781 612 903 376 Longi ud media No malizadas 547 100 No no malizadas 76 Lec u as echazadas #2 No malizadas 602 104 (66,2%) 628 141 506 (68%) No no malizadas 48 828 (25,7%) 34 565 829 (5,6%) Con aminación No malizadas 602 104 (52,3%) 472 474 387 (51%) No no malizadas 48 828 (9,7%) 21 926 541 (3,6%) To al de lec u as ú iles #3 No malizadas 373 149 (32,4%) 294 921 874 (31,8%) No no malizadas 353 784 (69,9%) 569 737 072 (93,0%) Lec u as pa eadas No malizadas - 205 762 484 (22,2%) No no malizadas - 555 513 714 (90,9%) Lec u as simples No malizadas - 89 159 390 (9,6%) No no malizadas - 14 223 358 (2,3%) Longi ud media No malizadas 233 84 No no malizadas 67 144 RESULTADOS Y DISCUSIÓN IV.2.3.2. Ensamblaje El ansc ip oma de T. lu ea ue inicialmen e ensamblado siendo el mismo p o ocolo u ilizado pa a el ansc ip oma de Solea senegalensis (apa ado IV.2.2.2) donde se emplea on las lec u as Roche/454 y las lec u as Illumina no malizadas. Con es o se ob u o la e sión 1 del ansc ip oma de la mic oalga. Pa a ob ene más cobe u a del ansc ip oma y más genes comple os, se ealizó o o ensamblaje donde se añadie on las lec u as no no malizadas (RNA-seq). En es e segundo ensamblaje se aplicó el mismo p o ocolo u ilizado pa a ensambla el ansc ip oma de S. senegalensis (Apa ado IV.2.2.2), excep o en la pa e del ensamblaje de las lec u as co as donde Oases ue eemplazado po SOAPdeno o-T ans [179] ya que es e e a más ápido pa a ensambla g andes can idades de lec u as [161], como en es e caso. De hecho SOAPdeno o-T ans ue capaz de ensambla odas las lib e ías Illumina (no malizadas y no no malizadas) jun as en menos de 1 día, lo cual no ue posible con Oases u ilizando el k-me o 23 debido a que el p oceso de ensamblaje ue in e umpido al consumi el iempo máximo asignado a los p ocesos encolados (una semana) ( igu a IV.33). En la abla IV.18 se mues a el núme o de secuencias en cada e apa del p o ocolo del ensamblaje así como las ca ac e ís icas del ansc ip oma gene ado. El núme o o al de ansc i os ue 149 517 con una longi ud media de 499. Tabla IV.18: Núme o de secuencias en cada e apa del ensamblaje de T. lu ea y las ca ac e ís icas de la e sión 1 del ansc ip oma Re e encia a la igu a IV.33 454 Con igs de MIRA #4 27 668 Con igs de EULER Mapeados #6 12 067 No mapeados codi ican es #7 71 Con igs o ales 454 #8 39 806 Illumina Con igs de SOAPdeno o #10 191 682 Secuencias ú iles #11 190 473 Reconciliación CAP3 #9 149 517 145 RESULTADOS Y DISCUSIÓN Limpieza adicional aplicada sob e de los ansc i os. Aunque las mues as secuenciadas p ocedían de un cul i o homogéneo (poca a iabilidad gené ica), el núme o de ansc i os ue muy supe io al núme o de p o eínas de la hap o i a más ce cana Emiliania huxleyi (39 125). Es o nos hizo sospecha que los ansc i os pod ían inclui secuencias que no e an de T. lu ea . Po lo an o, ealizamos una nue a búsqueda de con aminan es que consis ió, en un p ime luga , en alinea los ansc i os con a el genoma humano ya que es e po su amaño muy g ande no es aba incluido en la base de da os de con aminan es de SeqT imNex . Un o al de 37 130 secuencias se alinea on con el genoma de humano y po lo an o ue on desca adas. En un segundo luga , el es o de los ansc i os ue on compa ados con a la colección de nucleó idos ( Nucleo ide collec ion n /n ) de NCBI u ilizando blas n ( h p://blas .ncbi.nlm.nih.go /Blas .cgi ), lo cual pe mi ió desca a o as 42 082 secuencias de las cuales algunas ue on de la bac e ia Ko dia algicida, pe o la mayo ía ue on de plan as . Después de es a segunda “limpieza” de con aminan es que, según nos cons ó, p ocedía de las lib e ías de Illumina sin no maliza , el núme o inal de ansc i os se quedó en 70 306, los cuales o ma on la e sión 2 del ansc ip oma. En la abla IV.19 se mues a una compa ación en e las dos e siones 1 y 2 de T. lue a. Se no a que aunque el núme o de ansc i os se edujo a más de la mi ad, el núme o de ansc i os con amaño supe io es a 500 n pe maneció casi in a iable, po lo que la mayo ía de los ansc i os eliminados como con aminan es desde la e sión 1 en su o alidad e an pequeños (<500 n ). La eliminación de es os elemen os con aminan es hizo que la longi ud media de los ansc i os pasa a de 499 pb a 904 pb y el N50 de 1447 a 1646. Tabla IV.19: Ca ac e ís icas de las dos e siones del ansc ip oma de T. lu ea T. lu ea 1 T. lu ea 2 T ansc i os 149 517 70 306 Nº ansc i os > 500 n 37 417 36 385 Longi ud media 499 904 N50 1447 1646 T ansc i o más la go 10 309 10 309 IV.2.3.3. Ano ación del ansc ip oma e inclusión en base de da os En la ano ación del ansc ip oma de T. lu ea ( 1 y 2) se aplicó el mismo lujo de abajo u ilizado en Solea senegalensis (apa ado IV.2.2.3). Los da os de ano ación esul an es ue on incluidos en la base de da os Isoch ysisDB ( h p://www.scbi.uma.es/isoch ysisdb/ ) cuya po ada se mues a en la igu a IV.34. La es uc u a y la in e az de la base de da os se basó en SoleaDB, la de Solea senegalensis (apa ado IV.2.2.4). 146 RESULTADOS Y DISCUSIÓN Figu a IV.34: Po ada de la base de da os Isoch ysisDB IV.2.3.4. Análisis del ansc ip oma de Tisoch ysis lu ea En la igu a IV.35 se mues a la dis ibución de longi udes de los ansc i os en la e sión 2 del ansc ip oma. Se no a una abundancia de los ansc i os con longi udes en e 100 y 300 n , En el ma gen de longi udes supe io es a 300 y has a 2 000 n , el núme o de ansc i os ue bas an e uni o me. Figu a IV.35: dis ibución de las longi udes de los ansc i os de T. lu ea 2 147 RESULTADOS Y DISCUSIÓN En la abla IV.20 se mues a el esumen del análisis con Full-Leng he Nex del ansc ip oma de T. lu ea 2. Se no a que la g an mayo ía de ansc i os ue on alidos, ya que los a e ac os o ma on solo 4,7% del ansc ip oma. El po cen aje de los ansc i os ano ados con un ID de o ólogo ue 34%, de es os IDs de o ólogos 47,6% ue on únicos y 23,2% ue on comple os únicos. La pa e más g ande de los ansc i os ue on sin o ólogo (65,2%), aunque una buena pa e de ellos (42,9%) ue on codi ican es po lo que ep esen a on los nue os ansc i os o bien o mas inmadu as y uncadas de o os ansc i os conocidos ( esul ados no mos ados). Después de la eliminación los a e ac os y la esolución de las quime as, el ansc ip oma global se quedó con 69 800 ansc i os. De es os, Full- Leng he Nex seleccionó 23 671 ansc i os que o ma on el ansc ip oma ep esen a i o. Tabla IV.20: Ca ac e ís icas del ansc ip oma ensamblado de T. lu ea 2 T ansc i os % Nº de ansc i os 70 306 A e ac os 3 339 4,7 T ansc i os alidos 70 306 100 >500pb 35 554 50,6 >200pb 50 035 71,2 T ansc i o más la go 10 309 - T ansc i os con o ólogo 23 939 34,0 Di e en es o ólogos IDs 11 392 47,6 ORFs comple os 9 199 38,4 ORFs comple os di e en es 5 546 23,2 C- e minus 6 661 27,8 N- e minus 2 764 11,5 In e nal 5 315 22,2 ARNs no codi ican es pu a i os 27 0,0 T ansc i os sin o ólogo 45 834 65,2 Nue os ansc i os pu a i os 19 645 42,9 Desconocidos 26 189 57,1 T ansc ip oma de e e encia 23 671 - A pa i del ansc ip oma global ( e sión 2), 6 889 secuencias ue on ano adas con al menos un GO. El análisis de las unciones p oceden es de la ano ación con los é minos GO ( igu a IV.36) mues a que el núme o más al o de ansc i os ano ados con p ocesos biológicos ue asociado con p ocesos celula es (26%) y me abólicos (24%) ( igu a IV.36-A). En lo que se e ie e a los componen es celula es, las ca ego ías más ep esen adas ue on células (35%) y o gánulos delimi ados con memb anas (19%) ( igu a IV.36-B). Respec o a la unción molecula , el mayo núme o de ansc i os ano ados ue en la ca ego ía de ac i idad ca alí ica (52%) y ijación a ecep o es (36%) ( igu a IV.36-C). Po o o lado, 790 ansc i os ue on asignados a un mapa de KEGG uni e sal. Globalmen e, las enzimas que in e ienen en las u as más impo an es como aquellas del me abolismo del ni ógeno, de la o osín esis y del me abolismo de azúca ( igu a IV.37) es aban bien ep esen adas en los mapas de KEGG 148 RESULTADOS Y DISCUSIÓN Figu a IV.36 : Dis ibución de los GO del ansc ip oma de T. lu ea según los p ocesos biológicos (A), componen es celula es (B) y unción molecula (C) 149 RESULTADOS Y DISCUSIÓN Figu a IV.37: Ru as me abólicas elacionadas con el me abolismo del ni ógeno (A), ijación de ca bono (B) y el me abolismo de azúca (C) según KEGG, en donde apa ecen las enzimas de odos los o ganismos. Se esal an en e de las enzimas de T. lu ea 150 RESULTADOS Y DISCUSIÓN Ma cado es SSR con enidos en el ansc ip oma de T. lu ea Po la impo ancia que ienen los ma cado es molecula es en la explo ación del genoma y en la mejo a gené ica, en la abla IV.21 se p esen an algunas es adis as sob e los ma cado es SSR encon ados en la e sión 2 del ansc ip oma global y en el de e e encia. Se obse a que en ambos casos las epe iciones inucleo ídicas ue on los SSR más abundan es seguidas con las epe iciones dinucleo ídicas y supe io es a e a-nucleó idos («SSR, o os»). Tabla IV.21: Es adís icas de los SSR pa a el ansc ip oma global y de e e encia de T. lu ea T ansc ip oma global T ansc ip oma de e e encia T ansc i os con algún SSR 9 500 4 650 SSR o ales 12 277 5 937 SSR di-nucleo ídicos 2 677 1 068 SSR i- nucleo ídicos 5 280 2 865 SSR e a- nucleo ídicos 1 763 8 40 SSR, o os 2 557 1 164 Mo i o más abundan e GA (644) GA (254) Compa ación de T. lue a con o as especies. El ansc ip oma de e e encia de T. lu ea 2 ue compa ado con las p o eínas de 6 mic oalgas ce canas (2 clo ó i as, 2 glauco i as, una odó i as y una hap o i a). El núme o de p o eínas pa a cada mic oalga y el núme o de les genes homólogos en e T. lu ea y es as mic oalgas de e e encia se mues an en la igu a IV.38. Como se espe aba, al se Emiliana huxleyi una especie del mismo linaje y muy ce cana de T. lu ea, iene la p opo ción más al a de genes homólogos con T. lu ea (43%). Es a p opo ción se edujo al 18% con las mic oalgas de e e encia de o os linajes. Po o a pa e, el ansc ip oma de e e encia de T. lu ea ue compa ado con las p o eínas Re Seq y Ensembl de E. huxleyi. ( igu a IV.39), mos ando que 10 216 ansc i os ue on o ólogos a 8 170 en adas Re Seq y 8 109 en adas de Ensembl. Muchas haplo i as, incluida E. huxleyi, se sabe que ienen un ciclo de ida haplodiplon e en el cual ambas ases haploide y diploide son capaces de una ep oducción asexual [180]. En T. lu ea , el ni el de ploidía no es á desc i o [181]. En cul i o, los Isoch ysidaceae ienen un único mo o ipo sin calci icación y se c ee que la calci icación de la ase diploide se implicó solo una ez en el o igen de los cocoli ó o os y apa en emen e desapa eció emp ano en la his o ia e olu i a de los Isoch ysidaceae [182]. Así, los genes encon ados en T. lu ea son p obablemen e de la e apa haploide aunque no podemos se segu os de ello. La ealización de más es udios sob e el ciclo de ida de es a especie pueden o ece más conocimien os sob e la in e acción de los alelos y la unción de sus genes. 151 RESULTADOS Y DISCUSIÓN Figu a IV.38: Análisis compa a i o del ansc ip oma de e e encia de T. lu ea con las p o eínas de mic oalgas de e e encia. Los amaños de los cí culos son ela i os al núme o de ansc i os o p o eínas. Códigos de colo es: e de: clo ó i as, ama illo: odó i as, na anja: glauco i as, azul: hap o i as. Los núme os en los cí culos pe i é icos o man la p opo ción (%) de los genes de los o ganismos de e e encia homólogos con T. lu ea. Los núme os en los cí culos in e io es o man la p opo ción (%) de los genes de T. lu ea homólogos con los o ganismos de e e encia Figu a IV.39: Ano ación del ansc ip ma de e e encia con los o ólogos de Emiliania huxleyi u ilizando los IDs de Re Seq y Ensembl