scieee Open visual document viewer

Métodos y flujos de trabajo para el ánálisis taxonómico de datos metagenómicos

Rodríguez Brazzarola, Pablo

Abstract

Todas las plantas y animales tienen comunidades microbianas estrechamente asociadas que hacen que los nutrientes, metales y vitaminas necesarios estén disponibles para su huésped, contribuyendo esencialmente a la vida en la Tierra. El campo inherentemente complejo que tiene como objetivo comprender las contribuciones de estas microbiotas a la biósfera se conoce como metagenómica. Uno de los principales objetivos en este campo de investigación es determinar la composición de los organismos presentes en una muestra ambiental. Para ello, se han desarrollado diversas herramientas, la mayoría de ellas basadas en los resultados de búsqueda de similitud obtenidos al comparar un conjunto de secuencias biológicas contra una base de datos. Aunque el campo ha avanzado significativamente desde su inicio, todavía hay otros asuntos por resolver como tratar con variantes genómicas y detectar secuencias repetidas que podrían pertenecer a diferentes especies en una mezcla de organismos desiguales y desconocidos. Los distintos enfoques al analizar una muestra de metagenoma dan lugar a preguntarse si el análisis de una muestra con lecturas (fragmentos cortos de ADN producto de procedimientos de secuenciación) proporciona una mayor comprensión del metagenoma que con contigs (lecturas superpuestas que se han ensamblado juntas). El ensamblaje produce fragmentos genómicos más grandes, pero conlleva el riesgo de producir contigs a partir de lecturas de diferentes organismos. Por otro lado, las lecturas son más cortas y por ello su significación estadística es más difícil de evaluar, pero son más numerosas. En este proyecto, evaluamos y comparamos la calidad de cada una de estas alternativas para establecer el enfoque de datos que proporciona los mejores resultados en términos de informar la abundancia relativa de especies dentro de una muestra...

Full text

2 ESCUELA TÉCNICA SUPERIOR DE INGENIERÍA INFORMÁTICA GRADO EN INGENIERÍA DE LA SALUD MÉTODOS Y FLUJOS DE TRABAJO PARA EL ANÁLISIS TAXONÓMICO DE DATOS METAGENÓMICOS METHODS AND WORKFLOWS FOR THE TAXONOMIC ANALYSIS OF METAGENOMIC DATA Realizado po Pablo Rod íguez B azza ola Tu o izado po Oswaldo T elles Salaza Depa amen o A qui ec u a de Compu ado es UNIVERSIDAD DE MÁLAGA MÁLAGA, JUNIO 2018 Fecha de ensa: El Sec e a io del T ibunal 3 RESUMEN Todas las plan as y animales ienen comunidades mic obianas es echamen e asociadas que hacen que los nu ien es, me ales y i aminas necesa ios es én disponibles pa a su huésped, con ibuyendo esencialmen e a la ida en la Tie a. El campo inhe en emen e complejo que iene como obje i o comp ende las con ibuciones de es as mic obio as a la biós e a se conoce como me agenómica. Uno de los p incipales obje i os en es e campo de in es igación es de e mina la composición de los o ganismos p esen es en una mues a ambien al. Pa a ello, se han desa ollado di e sas he amien as, la mayo ía de ellas basadas en los esul ados de búsqueda de simili ud ob enidos al compa a un conjun o de secuencias biológicas con a una base de da os. Aunque el campo ha a anzado signi ica i amen e desde su inicio, oda ía hay o os asun os po esol e como a a con a ian es genómicas y de ec a secuencias epe idas que pod ían pe enece a di e en es especies en una mezcla de o ganismos desiguales y desconocidos. Los dis in os en oques al analiza una mues a de me agenoma dan luga a p egun a se si el análisis de una mues a con lec u as ( agmen os co os de ADN p oduc o de p ocedimien os de secuenciación) p opo ciona una mayo comp ensión del me agenoma que con con igs (lec u as supe pues as que se han ensamblado jun as). El ensamblaje p oduce agmen os genómicos más g andes, pe o conlle a el iesgo de p oduci con igs a pa i de lec u as de di e en es o ganismos. Po o o lado, las lec u as son más co as y po ello su signi icación es adís ica es más di ícil de e alua , pe o son más nume osas. En es e p oyec o, e aluamos y compa amos la calidad de cada una de es as al e na i as pa a es ablece el en oque de da os que p opo ciona los mejo es esul ados en é minos de in o ma la abundancia ela i a de especies den o de una mues a. Pa a alida los esul ados, gene amos conjun os de da os de lec u a sin é icos que pe enecen a o ganismos p e iamen e iden i icados man eniendo las dis ibuciones de abundancia ela i a. Pos e io men e, los ensamblamos en un conjun o de con igs y ealizamos un análisis axonómico con ambos en oques. Debido a que podemos as ea el o igen de las colecciones de lec u as, ambién se puede medi la calidad de es as asignaciones con un conjun o de he amien as desa olladas pa a demos a que el análisis con lec u as p opo ciona una ep esen ación más con iable de las especies en una mues a que usando los con igs, especialmen e en casos que p esen an una al a a iabilidad genómica. Espe amos que las he amien as desa olladas con ibuyan a mejo es soluciones en me agenómica y que b inden apoyo a los in es igado es que abajan en dicho campo. Palab as cla e: lujo de abajo, me agenómica, asignación axonómica; análisis de secuenciación; compa ación me agenómica, ensamblaje de ADN. 4 ABSTRACT All plan s and animals ha e closely associa ed mic obial communi ies ha make necessa y nu ien s, me als, and i amins a ailable o hei hos , essen ially con ibu ing o all li e on Ea h. The inhe en ly complex ield ha aims o unde s and he con ibu ions o hese mic obio as o he biosphe e is known as me agenomics. One o he p ima y goals in his esea ch ield is o de e mine he composi ion o o ganisms p esen in an en i onmen al sample. In o de o do so, di e se ools ha e been de eloped, mos o hem based on he simila i y sea ch esul s ob ained om compa ing a se o biological sequences agains a da abase. Al hough he ield has ad anced signi ican ly since i s beginning, he e s ill a e a ai s o sol e such as dealing wi h genomic a ian s and de ec ing epea ed sequences ha could belong o di e en species in a mix u e o une en and unknown ep esen a ion o o ganisms in he sample. The dis inc app oaches when analyzing a me agenome sample gi e ise o he ques ion o whe he analyzing a sample wi h eads (sho agmen s o DNA p oduc o sequencing p ocedu es) p o ides u he unde s anding o he me agenome han wi h con igs (o e lapping eads ha ha e been assembled oge he ). The assembly yields la ge genomic agmen s bu bea s he isk o p oducing con igs om eads o di e en o ganisms. On he o he hand, eads a e sho e and he e o e hei s a is ical signi icance is ha de o asses, bu he e is a la ge numbe o hem. In his p ojec , we assess and compa e he quali y o each o hese al e na i es o es ablish he da a-app oach ha p o ides he bes esul s in e ms o epo ing he ela i e abundance o species wi hin a sample. To alida e he esul s, we gene a e syn he ic ead da ase s ha belong o p e iously iden i ied o ganisms main aining he ela i e abundance dis ibu ions. A e wa ds, we assemble hese in o a se o con igs and pe o m a axonomic analysis on bo h app oaches. Since we can ace he o igin o he eads collec ions we a e able o measu e he quali y o hese assignmen s wi h a se o de eloped ools in o de o demons a e ha analyzing wi h eads p o ide a mo e us wo hy ep esen a ion o he species in a sample han using con igs, especially in cases ha p esen a high genomic a iabili y. We expec he de eloped ools will con ibu e o be e solu ions in me agenomics p o iding suppo o esea che s wo king in such ield. Keywo ds: wo k low; me agenomics; axonomic assignmen ; sequencing analysis; me agenome compa ison, DNA assembly. 5 TABLE OF CONTENTS Execu i e Summa y 8 CHAPTER 1. INTRODUCTION 10 1.1 Mo i a ion 10 1.2 Objec i es 12 CHAPTER 2. STATE OF THE ART 14 2.1 Me agenomic Taxonomic Analysis App oaches 14 2.1.1 Reads App oach 14 2.1.2 Con igs App oach 15 2.2 Challenges in Me agenomic Taxonomic Analysis 15 2.3 Me agenome Analysis Packages 17 2.3.1 MEGAN 17 2.3.2 FANTOM 18 2.3.3 MG-RAST 18 2.3.4 META-GECKO 19 CHAPTER 3. ANALYSIS AND DESIGN 20 3.1 Analysis o gene al equisi es 20 3.2 Wo k low design 21 3.3 De eloped so wa e ools and sc ip s 22 CHAPTER 4. METHODS AND IMPLEMENTATION 25 4.1 Gene al De ini ions 25 4.2 De ec ing di e ences be ween axonomic analysis app oaches: Reads and Con igs 26 CHAPTER 5. RESULTS AND DISCUSSION 29 5.1 Compa ison wi h he O iginal Rela i e Abundance o Species 31 5.2 Roo Mean Squa e E o (RMSE) a e he Taxonomical Analysis 32 5.3 Inconsis encies Found 33 5.4 Inconsis ency Resolu ion 34 5.5 Co e age and Mapping Compa ison agains he Re e ence Da abase 35 5.6 Con usion Ma ices and Pe o mance Me ics based on he Co ec Assessmen o a Taxon o each Sequence 35 CHAPTER 6. CONCLUSIONS 38 6 6.1 Conclusiones 39 6.2 Ongoing wo k 41 6.3 Acknowledgmen s 42 CHAPTER 7. BIBLIOGRAPHY 43 7 Execu i e Summa y Me agenomics is a ield ha aims o s udy an uncul u ed biological sample aken di ec ly om i s o iginal en i onmen . This a ea o esea ch p esen s many mo e challenges han adi ional genomics, such as he une en and unknown abundance o species and he ac ha no all species will be comple ely ep esen ed by he eads gene a ed om he sequencing expe imen . One o he main goals in his ield is o analyze he composi ion o species wi hin a sample. This s udy is known as a axonomic analysis and mul iple app oaches ha e been designed o his pu pose. Two o he mos common ones a e (1) using eads (gene a ed om he sequencing expe imen ) o (2) using con igs (ob ained by assembling he eads). E en hough he goal is he same, each app oach p o ides di e en esul s, and o he bes o ou knowledge, he e is no s udy add essing such di e ence. The e o e he e is a need o assess and compa e he quali y o hese axonomic assignmen s in o de o ob ain he bes possible esul s in me agenomic axonomic analysis. One o he p oblems ha a ise when a emp ing o compa e a axonomic assignmen om a eal me agenomic sample is he ac ha he eal ela i e abundance o species is unknown. To sol e his p oblem we ha e p epa ed a so wa e ha gene a es a me agenomic syn he ic da ase o eads om a selec ion o genomes and speci ying he abundance o eads pe genome. A e wa ds, hese eads a e assembled in o con igs. In his p ojec , we pe o m he axonomic analysis o a me agenomic sample wi h he eads and con igs app oach. This is execu ed in o de o ob ain se e al indica o s by applying a se o de eloped so wa e ools. ha measu e he quali y o he analysis, enabling a compa ison be ween hese di e en app oaches. To acili a e he use o hese ools, an au oma ic pipeline has been made a ailable. Las ly we p esen wo use cases ha apply he de eloped so wa e ools wi h he in en o alida ing and consolida ing an app op ia e p ocedu e o ob ain he bes possible esul s 8 when pe o ming a me agenomic axonomic analysis, whe he i is wi h he eads o wi h he con igs app oach. In addi ion, his p ojec has been de eloped unde he g oup “Bioin o ma ics and In o ma ion Technologies Labo a o y” (BITLAB), pa o he Depa amen o de A qui ec u a de Compu ado es, Uni e sidad de Málaga and p esen ed in he 6 h In e na ional Wo k-Con e ence on Bioin o ma ics and Biomedical Enginee ing (IWBBIO 2018). 9 Independen o he app oach, he e a e issues ha a ise in me agenomics ha do no come up in adi ional genomics. Fo ins ance, a me agenomic sample will p esen an une en and unknown dis ibu ion o species. This implies ha i is no possible o measu e he accu acy o a axonomic assignmen om a eal me agenomic sample since he ela i e abundance o species is uncha ed. Ano he issue is ha mos communi ies a e e y di e se, he e o e mos genomes a e no comple ely ep esen ed by he eads. The e is also he noise ha can be gene a ed du ing he sequencing expe imen due o a i ac s, bad quali y eads o sequencing e o s. The in o ma ic analysis is much mo e complex when dealing wi h epea ed sequences om simila o ganism; and de ec ing genomic a ian s o species ha ha e no ye been sequenced wi hin a sample. Addi ionally, assembly e o s mus be aken in o accoun when pe o ming he con igs app oach. Fo example, dis inc eads ha belong o he same gene o genome may no o e lap, and i hey do i is no always no iceable whe he hey a e om he same o di e en genomes (See Figu e 3). The e is also he possibili y o gene a ing con igs om o e lapping in e -species eads, also known as chime ic con igs (See Figu e 4). Figu e 4. Reads om he same gene ha do no o e lap. 16 Figu e 5. Reads om di e en genomes assembled in o a chime ic con ig. 2.3 Me agenome Analysis Packages The in e p e a ion o me agenomics da a is impo an o unde s anding he ecosys em unc ioning and assessing di e ences be ween di e en en i onmen al samples. The ollowing sec ion p esen some o mos popula ools used o explo e me agenomic da a in axonomic and unc ional con ex . 2.3.1 MEGAN MEGAN (ME agGenome ANalyze ) is a e y easy o use, comp ehensi e mic obiome analysis ool. I can be applied o analyze me agenomic (DNA), me a ansc ip omic (RNA), pep ide sequences and amplicon da a (16S RNA). The ins alla ion is e y simple and s aigh o wa d. The Communi y Edi ion o MEGAN is ee so wa e ha con ains all ea u es equi ed o pe o m analysis o mic obiome samples. The Ul ima e Edi ion is buil on op o he ee edi ion, howe e i p o ides ex a ea u es, a command-line in e ace, and a se o command-line ools o cus omize classi ica ion schemes and mapping iles used o he p og am. The communi y webpage is e y ac i e and p o ides suppo o bo h edi ions. The aim o MEGAN is o p o ide a ool o s udying he axonomic con en o a se o DNA eads, gene ally om a me agenomic p ojec . As a p ep ocessing s ep, a sequence 17 alignmen o all eads agains a e e ence da abase is equi ed o p oduce an inpu ile o he p og am. This so wa e acili a es an in e ac i e explo a ion o he NCBI axonomy which consis s o o e one million axa. The main applica ion o he p og am is o pa se and analyze he esul s o an alignmen o a se o nucleo ide sequences agains one o mo e e e ence da abases. The ypical p og ams o his alignmen a e BLASTN [10], BLASTX [11] o simila ools such as DIAMOND [12] o compa e agains genome speci ic da abases. The esul s o such analysis is a axonomic p o iling o he sample om which he sequences we e collec ed. MEGAN p o ides di e en algo i hms o assign each sequence a axon on some le el in he NCBI [13] hie a chy, based on hei hi s o known sequences eco ded in he alignmen ile. This so wa e also p o ides a unc ional analysis using a numbe o di e en classi ica ion sys ems, bu o he Communi y Edi ion only an ea ly 2011 e sion o KEGG [14] is a ailable. The Ul ima e Edi ion con ains an up- o-da e e sion o KEGG. 2.3.2 FANTOM FANTOM (Func ional ANd Taxonomic analysis O Me agenomes) is a so wa e o he analysis o quan i a i e me agenomics da a. This ool allows o an explo a o y and compa a i e analysis o me agenomics da a in eg a ed wi h me ada a in o ma ion and biological da abases. The so wa e is implemen ed in Py hon, he e o e is pla o m independen . 2.3.3 MG-RAST MG-RAST (Me aGenomic Rapid Anno a ion using Subsys ems Technology) is an au oma ed pla o m ha has se ed as a public esou ce o anno a ion and analysis o me agenomic sequence da a, p o iding a eposi o y o o e 150,000 da ase s (o e 60 e a-base-pai s) wi h mo e han 23,000 publicly a ailable. 18 This se e allows use s o upload aw me agenomic sequence da a in FASTQ o FASTA o ma . Assessmen s o sequence quali y and anno a ion wi h espec o mul iple e e ence da abases a e pe o med au oma ically wi h minimal inpu om he use . Pos -anno a ion analysis and isualiza ion a e also possible di ec ly h ough he web in e ace o wi h R packages ha u ilize he MG-RAST API o easily download da a om any s age in he MG-RAST p ocessing pipeline. This ool p o ides suppo o sho gun and amplicon me agenomic samples, as well as me a ansc ip omes. 2.3.4 META-GECKO A so wa e amewo k de eloped by Pe ez-Wohl eil e al. ha p o ides di e en mapping al e na i es agains e e ence da abases, mapping eads o e unanno a ed egions o genomes. Mo eo e , i p o ides e idence o he species p esen in me agenomics by mapping eads o speci ic egions o genomes. In addi ion, his wo k low is an open pla o m composed o an expandable se o sepa a e modules, which enables an easy inco po a ion o new p ocessing ools. 19 CHAPTER 3. ANALYSIS AND DESIGN In his sec ion we will explain he he equisi es ha should be accomplished in o de ha he ools used and de eloped o his p ojec wo k p ope ly. Mo eo e , he de eloped so wa e ools will be b ie ly desc ibed. 3.1 Analysis o gene al equisi es In his sec ion, he speci ica ions ega ding he so wa e used in his p ojec a e desc ibed: 1. Pla o m: a. This p ojec was designed unde he Ubun u 16.04.4 LTS, howe e i is suppo ed in o he UNIX en i onmen s. 2. Base equi emen s: a. UNIX sys em shell b. Py hon 3.5.2 c. GNU Compile Collec ion (gcc) d. R 3.3.4 e. pd la ex (Fo PDF epo ) 3. Thi d-pa y so wa e: a. G inde [15] (Ve sion 0.5.4) b. MEGAHIT [16] (Ve sion 1.0.5) c. MEGAN 6 (Ve sion 6.10.13) d. BLASTN (Ve sion 2.7.1) A de ailed explana ion o he p ocedu e o ins all he equi ed hi d-pa y so wa e is a ailable in he gi hub (h ps://gi hub.com/pab odb a/RACKi /) eposi o y o his p ojec . 20 3.2 Wo k low design The wo k low has been designed wi h he in en o analyzing he le els o conco dance be ween he eads and he con igs hey assemble and e ie e eliable compa ison esul s (conco dance le els and compa ison me ics a e de ailed in he nex chap e ). One o he equi emen s o es ablish a alid compa ison is o know be o ehand he ela i e abundance o species in a sample. This is achie ed by selec ing a se o genomes and he abundance dis ibu ion so ha G inde c ea es a syn he ic eads da ase . Such da ase is gene a ed in he FASTQ o ma , he e o e i is pipelined o a BASH sc ip ha con e s his ile in o a FASTA o ma . Once o ma ed, he p oduced mul i- as a ile o syn he ic eads a e assembled in o con igs using MEGAHIT, an assemble de eloped o la ge and complex me agenomic Nex Gene a ion Sequencing (NGS) eads. A e wa ds, bo h se s o sequences ( eads and con igs) a e mapped agains a e e ence da abase o acqui e he possible species ha each sequence came om. These esul s a e hen ed o MEGAN, a mic obiome analysis ool ha applies he Las Common Ances o (LCA) algo i hm o assign each sequence o a axa. Finally, he e ie ed in o ma ion om p e ious s eps is p ocessed by he de eloped oolki in o de o gene a e a se o esul s ha assesses he quali y o he axa assigned o he eads and con igs and p o ides s a is ical insigh abou such esul s (See igu e 6). 21 Figu e 6. Read assembly and Taxonomic Analysis Compa ison wo k low. Red: File Gene a ed om Reads. Yellow: File gene a ed om Con igs. Blue: Thi d-Pa y so wa e. Ligh g een: P op ie a y so wa e. G een: Da abases. 3.3 De eloped so wa e ools and sc ip s The de eloped p op ie a y so wa e o sc ip s a e lis ed below accompanied by a b ie explana ion. ●Da a p ep ocessing: ○FASTQ o FASTA con e e : A sc ip p og ammed in BASH ha ecei es a FASTQ ile as inpu , con e s i o a FASTA o ma and ou pu s such ile. FASTQ and FASTA a e wo di e en iles o s o e sequencing in o ma ion. The main di e ence is FASTQ con ains addi ional in o ma ion on he quali y o each base (nucleo ide) and he ce ain y o he lec u e. 22 ○BLAST Resul Pa se : The de eloped wo k low in e connec s se e al modules ha ex ac di e en in o ma ion om BLAST esul s. Because o his we ha e designed a pipeline composed o a small p og am de eloped in C and some BASH sc ip s ha equi es as inpu he esul o a BLAST compa ison in i s ypical o ma and pa ses i s in o ma ion in o a ab delimi ed ile o educe i s size and acili a e i s p ocessing o he o he ools. ●Analysis Tools: ○Reads Agains Con igs Py hon Toolki : These a e a se o ools de eloped in Py hon ha equi es di e en inpu s om o he ools applied in his wo k low in o de o quali y he conco dance le els and quan i y he quali y o he axonomic assignmen s om wo di e en app oaches. This is pe o med by pipelining he ools as desc ibed below: ■One ool ga he s he eads ha we e assembled in o each con ig om a pa sed BLAST esul o he eads agains he nucleo ide sequence o con igs, used as a e e ence da abase. This gene a es wo dic iona ies: one ha associa es he ID o he eads o he ID o he assembled con ig; and ano he one ha co ela es he ID o he con ig wi h all he eads ha assembled i . ■The second so wa e i s loads he axonomic assignmen s o he eads app oach and con igs app oach. Then, i gene a es he dic iona y o con igs associa ed o he ead ha assembles i . A e wa ds, i e ie es he inconsis encies be ween he assignmen o each o he ela ionships in he dic iona y based on a speci ied axonomic ank. This ool ou pu s he ID o he sequences o each o he inconsis encies ound, classi ies hem ( his classi ica ion is desc ibed in Chap e 4), and speci ies he axonomic ank in which hese inconsis encies a e esol ed. ■This so wa e gene a es a con usion ma ix o each genome in he e e ence da abase (mul iple 1 s All compa isons) and popula es i om he Pa sed Blas Resul gene a ed om he oolki . A e wa ds i calcula es di e en s a is ical measu emen s such as accu acy, sensi i i y, speci ici y, p ecision and allou (de ailed desc ip ion in Chap e 4). 23 ○UniseqDBCo e age: This so wa e de eloped in C, ecei es he e e ence da abase and he p ima y sequence alignmen esul s. A e wa ds, om he bes ma ches in he mapping, he wid h co e age o he da abase mapping and he a e age o op sco ing ma ches is calcula ed (de ailed desc ip ion in he Chap e 4). ○Reads Agains Con igs R Sc ip : This R sc ip e ie es all he esul s om he p e iously desc ibed de eloped ools and he MEGAN axonomic analysis esul s, in o de o gene a e a epo wi h he plo s ha can be analyzed by he esea che o compa e di e en app oaches. 24 CHAPTER 4. METHODS AND IMPLEMENTATION The de ini ions, p ocedu es and algo i hms employed o compa e eads and con igs when analyzing a me agenomic sample a e desc ibe in his sec ion. To achie e a easonable compa ison we ha e de ined a se o condi ions ha desc ibe he axonomic conco dance on a speci ic axonomic ank be ween each ead and he con ig (handled as one sequence) i assembles. 4.1 Gene al De ini ions Le R be he se composed by he Reads. Le C be he se composed by he Con igs. Each Read can only be assembled in o one Con ig. { , , ... , }C|R|R= 1 2 n⋀| < | i∈R⋀ci∈C .. ci⊆R⋀c1⋂c2⋂.⋂cn= Ø Le S be he se o composed Reads and Con igs sequences. Le T be he se composed by he Taxa in a axonomic ank and None. R, } S = { C⋀s∈S⋀ ∈T axon (s)T→ In o de o de ec chime ic con igs, we ha e de ined he ollowing le els o conco dance o a con ig and he ead ha assembles o classi y hem: ●Consis ency (C): Bo h, ead and con ig, ha e he same axon assigned o we e no assigned a all. axon (Read) T axon (Con ig)T= ●Weak Inconsis ency (WI): Ei he he ead o he con ig has been assigned o a axon while he o he one was no assigned o any. These ela ionships a e classi ied based on which sequence was unassigned. I will be a Weak Inconsis ency by Read (WIR) g an ed ha he ead does no ma ch o a axon in a speci ic axonomic ank. Howe e , 25 Figu e 10. Rela i e abundance o species in a me agenomic o iginal da ase (g een), eads ( ed) and con igs (blue) o he: (le ) ully syn he ic da ase and ( igh ) semi syn he ic da ase . The plo s om Figu e 10 a e aes he ically pleasing and desc ibe he esul s o he axonomic analysis o each app oach. Howe e , we can obse e ha o he FSD, he nume ous amoun o species complica e he analysis o hese esul s. Howe e , o he SSD, he ela i e abundance o he eads is clea ly much mo e simila o he o iginal one han he con igs. we mus calcula e a measu emen ha allows us o es ablish he di e ence be ween he ela i e abundance es ima ed by each app oach o p ope ly compa e hem. To achie e ha , we calcula e he Roo Mean Squa e E o as desc ibed in he ollowing sec ion. 5.2 Roo Mean Squa e E o (RMSE) a e he Taxonomical Analysis The RMSE is calcula ed o bo h eads and con igs app oach using he o iginal da ase as e e ence. A lowe RMSE implies ha he axonomic analysis ob ained om such app oach, desc ibes wi h mo e p ecision he ideal abundance o species in he me agenomic sample (Table 1). Da ase RMSE o FSD RMSE o SSD Reads 0.3187 0.4031 32 Con igs 0.3858 4.2534 Table 1. Roo Mean Squa ed E o o he assignmen o species o eads and con igs compa ed o he o iginal da ase o bo h use cases. F om Table 1, we can obse e ha he eads p o ide a lowe RMSE han he con igs in bo h use cases. F om hese esul s we can clea up he con usion abou which app oach p o ides mo e insigh abou he p ope axonomic assignmen o species. In Figu e 10 i was e y ha d o depic which app oach was be e o he FSD, howe e he RMSE sugges ha he eads p o ide a be e axonomic assignmen han he con igs. Mo eo e , his measu emen con i m ha he eads p o ide a mo e p ecise epo o he species wi hin he SSD. 5.3 Inconsis encies Found A conco dance le el is es ablished o each o he associa ions be ween each ead and he con ig i assembles. Iden i ying he ypes o o inconsis encies aids us a he momen o de e mining he eason behind he RMSE. I he e a e mo e weak inconsis encies a he species axonomic ank, hen mos o he eads o con igs in ol ed we e assigned o a axon in a highe and less speci ic axonomic ank. he de ec ed inconsis encies and he pe cen age o ela ionships hey ep esen a e shown in he Table 2. Type o Inconsis ency Found on FSD (%) Found on SSD (%) Weak Inconsis ency by Read 21,393 (4.10) 4,003 (0.80) Weak Inconsis ency by Con ig 24,183 (4.64) 1,622 (0.32) Ha d Inconsis ency 4,464 (0.84) 2,231 (0.45) 33 Table 2. Numbe o inconsis encies ound o each use case a he species axonomic ank. 5.4 Inconsis ency Resolu ion The p e iously ound inconsis encies can always be sol ed by selec ing a highe axonomic ank, since i co e s a b oade ange o axa ha a sequence can be assigned. Fo bo h use cases, he sequences belong o bac e ias, he e o e he disc epancy be ween he assignmen o a con ig and he ead ha assembles i will always be so ed ou in he axonomic ank “Domain”. This can be app ecia ed in Figu e 10. Figu e 10. Pe cen age o inconsis encies sol ed a di e en axonomic anks. In bo h use cases, o e 50% o he inconsis encies a e esol ed i he desi ed axonomic g oup o analyze is he amily. On he le : inconsis ency esolu ion o he ully syn he ic da ase . On he igh : inconsis ency esolu ion o he semi syn he ic da ase The he e ogenei y o he samples make i so a no iceable amoun o he con igs a e chime ic. This con i ms ha he inconsis encies a ise due o he in insic di icul y o he assembly p ocess. These esul s sugges ha he eads associa ed o a SI a e used o assemble chime ic con igs. Mo eo e , we can obse e ha hese chime ic con igs a e mo e o en gene a ed om eads om eads ha belong o di e en o ganisms wi hin he same amily axonomy (o e 50% o he SI). 34 5.5 Co e age and Mapping Compa ison agains he Re e ence Da abase Fo each use case, he a io o op sco ing ma ches a e pe o ming he p ima y sequence alignmen agains he e e ence da abase and he pe cen age o nucleo ides co e ed by he ull se o sequences is desc ibed in he Table 3. Measu emen FSD SSD Reads Con igs Reads Con igs Ra io o Ma ches pe Sequence 7.05 7.50 4.52 8.38 % Co e age o Da abase 21.21 7.16 5.59 3.37 Common % wi hin Use Case 6.42 3.03 Common Co e age % agains Con igs 89.66 No Applicable 89.91 No Applicable Table 3. Mapping and co e age compa ison be ween eads and con igs o each use case. In bo h o he use cases, he eads ob ain a lowe a e age o op sco ing ma ches han he con igs. This ends o happen due o he assembly noise gene a ed by o ming con igs om eads ha belong o di e en species. Mo eo e , i is no ewo hy ha o e 85% o he nucleo ides co e ed by con igs a e also co e ed by eads, ye eads co e a wide ange o he da abase. This means ha eads p o ide mo e in o ma ion ha may be o in e es depending on he goal o he me agenomic expe imen . 5.6 Con usion Ma ices and Pe o mance Me ics based on he Co ec Assessmen o a Taxon o each Sequence 35 Bo h use cases ul il he p e equisi e o calcula e his measu emen s, which is o know he genome o which each ead was o igina ed om. The esul s o he s a is ical pe o mance ma ices a e desc ibed in he Table 4. The bes app oach is he one ha p o ides: a highe accu acy, sensi i i y, speci ici y and p ecision; and a lowe allou . Da ase Accu acy Sensi i i y Speci ici y P ecision Fallou SSD Reads 19.04 % 1.06 % 99.49 % 90.26 % 0.51 % Con igs 12.68 % 0.67 % 99.20 % 85.44 % 0.80 % FSD Reads 13,43 % 2,29x10-6 % 99,99 % 13,43 % 9,52x10-5 % Con igs 8,81 % 1,42x10-6 % 99,98 % 8,81 % 15,28x10-5 % Table 4. Con usion ma ices o species a e age and pe o mance me ics A sequence can map o mul iple genomes om he e e ence da abase wi h he same iden i y, simila i y, leng h and e- alue. This occu s because he eads could ha e o igina ed o a egion which is e y simila wi hin di e en genomes. Fo ins ance, di e en s ains o he same species ha e an almos iden ical genome. Mo eo e , i he ead was o igina ed om an o hologous gene egion, di e en species wi h he same common ances o may sha e ha nucleo ide sequence. Because o his ac , he sensi i i y and speci ici y a e e y ex eme. The explana ion o hese alues is ha , o each con usion ma ix (one o each genome in he e e ence da abase), one sequence can only map o o he o iginal genome (TP) once, howe e mul iple ma ches o one sequence cause mul iple FP. Fu he mo e, he numbe o TN becomes ex emely high in compa ison o he o he due o he ac ha one sequence be conside ed as a TN o each sequence in he e e ence da abase ha i does no ma ch o, as long as i does no belong om i . E en wi h e y es ic i e co e age, simila i y and e- alue h esholds, almos all he sequences ma ch o a genome, he e o e he numbe o FN is ex emely low. 36 Almos all he sequences a e mapped a leas once, and since e e y map is conside ed a posi i e, we sugges ha he mos eliable measu emen a e he one ha e alua e he posi i e a e, such as p ecision ( ue posi i e a e) and allou ( alse posi i e a e). As obse ed om he ob ained esul s, he eads app oach ob ain be e measu emen s in compa ison o he con igs app oach. 37 CHAPTER 6. CONCLUSIONS A me agenomic axonomic assignmen aims o de e mine he composi ion o o ganism p esen in an uncul u ed biological sample aken di ec ly om i s o iginal en i onmen . The analysis o me agenomes p esen mo e challenges han adi ional genomics, such as: he une en and unknown abundance o species, and he ac ha no all he species will be comple ely ep esen ed by he eads om he sequencing expe imen . Hence, i equi es mo e accu a e, e ined and compu a ionally expensi e me hods. Howe e , i p o ides an in-dep h and unbiased me hod o ob aining genomic in o ma ion, whe eas adi ional mic obiology p esen s and inhe en bias since cul u e me hods can only con i m he p esence o mic oo ganisms ha can g ow on he selec ed media. As i was men ioned, he main goal o his p ojec is o de e mine which app oach was mo e app op ia e when pe o ming a me agenomic axonomic analysis, using ei he eads o using con igs. In o de o do so, we i s ha e designed, implemen ed and applied a wo k low (RACKi ) o ob ain and alida e he esul s by applying he scien i ic me hod. Such wo k low was de eloped o: gene a e syn he ic da ase s composed o a use speci ied abundance o species; assemble hem in o con igs; map using such eads and con igs agains he same e e ence da abase; pe o m a axonomic analysis applying a las common ances o algo i hm o each app oach; and calcula e se e al indica o s om he p e ious s eps which enable a alid compa ison be ween bo h al e na i es. The de eloped wo k low RACKi was execu ed o wo di e en use cases ( ully syn he ic and semi-syn he ic da ase s). Bo h analysis sugges ha he eads app oach p o ide a mo e p ecise assignmen o axa and a ela i e abundance o species esembles o a la ge ex en o he one ha belongs o he o iginal me agenomic sample han using he con igs app oach. Such ou come sugges s ha he bes da a-app oach o ob ain a mo e accu a e me agenomic axonomic analysis a e ob ained wi h he eads app oach. 38 These esul s conjec u e ha he con igs app oach p esen s challenges du ing he assembly p ocess due o se e al easons. To begin wi h, he quali y o he assembly will a y s ongly on he leng h and quali y o he eads. Ano he issue is ha he numbe o con igs will a y based on hei leng h and how many eads a e used o assemble such con ig. Likewise, a no iceable amoun o eads ha belong o di e en species a e pu oge he in o chime ic con igs as a esul o he g ea he e ogenei y o species in a me agenomic sample. A he momen o assigning a axon o each sequence, hese p e iously men ioned issues ha e a nega i e impac o he con ig app oach because each con ig is handled as one sequence al hough i was o med by many eads, mis ep esen ing he o iginal sample. In conclusion, we expec ha he exis ing mode n ools and algo i hms o sol e p oblems in me agenomics will p o ide suppo o esea che s wo king in he me agenomics ield. Howe e , hese ools p esen sho comings which a e di icul o sol e due o he in insic complexi y o analyzing a me agenomic sample. The e o e, i is pe inen o p ope ly iden i y and add ess such d awbacks o de elop upg aded ools in he u u e o ob ain a be e unde s anding abou he con ibu ions o mic obio as o he heal h o he plane , hei oles in human heal h, and he consequences o human ac i i ies owa ds he biosphe e. Acco dingly, he esul s ob ained in his p ojec sugges ha he me agenomic assembly is a e y challenging p ocess caused by se e al issues ha a ise in his ield, and ha he eads app oach p o ides u he unde s anding o a me agenomic sample han he con igs app oach in his cu en day and age. In addi ion, his s udy has been p esen ed a he 6 h In e na ional Wo k-Con e ence on Bioin o ma ics and Biomedical Enginee ing (IWBBIO 2018)[20] and has been selec ed o be ex ended and submi ed o BMC Bioin o ma ics, a high impac ac o jou nal, as a esea ch a icle. I is cu en ly unde inspec ion a he ime o w i ing hese conclusions. 6.1 Conclusiones Un análisis axonómico en me agenómica iene como obje i o de e mina la composición de los o ganismos p esen es en una mues a biológica no cul i ada omada di ec amen e de su medio na u al. El análisis de los me agenomas p esen a más desa íos que 39 la genómica adicional, ales como: la abundancia desconocida y desigual de especies, y el hecho de que no odas las especies es a án comple amen e ep esen adas po las lec u as del expe imen o de secuenciación. Po lo an o, equie e mé odos más p ecisos, e inados y compu acionalmen e cos osos. Sin emba go, p opo ciona un mé odo p o undo e impa cial pa a ob ene in o mación genómica, mien as que la mic obiología adicional p esen a un sesgo inhe en e, ya que los mé odos de cul i o solo pueden con i ma la p esencia de mic oo ganismos que pueden c ece en los medios seleccionados. Como se mencionó an e io men e, el obje i o p incipal de es e p oyec o es de e mina qué en oque es más ap opiado cuando se ealiza un análisis axonómico en me agenómica, usando lec u as o usando con igs. Pa a hace lo, p ime o hemos diseñado, implemen ado y aplicado un lujo de abajo (RACKi ) pa a ob ene y alida los esul ados aplicando el mé odo cien í ico. Tal lujo de abajo se desa olló pa a: gene a conjun os de da os sin é icos compues os de una abundancia de especies especi icada po el usua io; ensambla los en con igs; mapea usando ales lec u as y con igs con a la misma base de da os de e e encia; ealiza un análisis axonómico aplicando un algo i mo del ances o común más bajo pa a cada en oque; y calcula a ios indicado es de los pasos an e io es que pe mi en una compa ación álida en e ambas al e na i as. El lujo de abajo desa ollado RACKi se ejecu ó pa a dos casos de uso di e en es (conjun os de da os o almen e sin é icos y semisin é icos). Ambos análisis sugie en que el en oque de lec u a p opo ciona una asignación más p ecisa de los axones y una abundancia ela i a de especies se pa ece en mayo medida a la que pe enece a la mues a me agenómica o iginal que u ilizando el en oque de con igs. Tal esul ado sugie e que el mejo en oque de da os pa a ob ene un análisis axonómico me agenómico más p eciso se ob iene con el en oque de lec u as. Es os esul ados conje u an que el en oque de con igs p esen a desa íos du an e el p oceso de ensamblaje debido a a ias azones. Pa a empeza , la calidad del conjun o a ia á conside ablemen e según la longi ud y la calidad de las lec u as. O o p oblema es que el núme o de con igs a ia á en unción de su longi ud y la can idad de lec u as que se u ilizan pa a ensambla dicho con ig. Del mismo modo, una no able can idad de lec u as que 40 pe enecen a di e en es especies se jun an en con igs quimé icos como esul ado de la g an he e ogeneidad de especies en una mues a me agenómica. En el momen o de asigna un axón a cada secuencia, es os p oblemas mencionados an e io men e ienen un impac o nega i o pa a el en oque de con ig po que cada con ig se maneja como una secuencia, aunque se o mó po muchas lec u as, e gi e sando la ep esen ación de la mues a o iginal. En conclusión, espe amos que las he amien as y algo i mos mode nos exis en es pa a esol e p oblemas en me agenómica b inden apoyo a los in es igado es que abajan en el campo de la me agenómica. Sin emba go, es as he amien as p esen an de iciencias que son di íciles de esol e debido a la complejidad in ínseca del análisis de una mues a me agenómica. Po lo an o, es pe inen e iden i ica y abo da adecuadamen e ales incon enien es pa a desa olla he amien as mejo adas en el u u o a in de comp ende mejo las con ibuciones de las mic obio as a la salud del plane a, sus unciones en la salud humana y las consecuencias de las ac i idades humanas hacia la biós e a. En consecuencia, los esul ados ob enidos en es e p oyec o sugie en que, a día de hoy, el ensamblaje me agenómico es un p oceso muy desa ian e causado po a ios p oblemas que su gen en es e campo, y que el en oque de lec u a p opo ciona una mayo comp ensión de una mues a me agenómica que el en oque con igs. Además, es e es udio ue p esen ado en la 6 a Con e encia In e nacional de T abajo sob e Bioin o má ica e Ingenie ía Biomédica (IWBBIO 2018) y ha sido seleccionado pa a se ex endido y p esen ado a BMC Bioin o ma ics, una e is a de al o impac o, como a ículo de in es igación. Ac ualmen e es á bajo inspección en el momen o de esc ibi es as conclusiones. 6.2 Ongoing wo k In e ms o u u e wo k, he oolki is being applied o compa e he quali y o di e en me agenomic assembly ools and o compa e he quali y o he assembly using di e en pa ame e s. Likewise, adjus ing he p esen ed wo k low o compa e he unc ional analysis be ween he eads and con igs app oach would be e y in e es ing o es ablish a p ope me hodology when analyzing me agenomic samples. Mo eo e , he compa ison be ween he eads and con igs app oach will be ca ied ou wi h mo e use cases in o de o es ablish a 41