scieee Open visual document viewer

DoOP: databases of Orthologous Promoters, collections of clusters of orthologous upstream sequences from chordates and plants

Barta, Endre; Sebestyén, Endre; Pálfy, Tamás; Tóth, Gábor; Ortutay, Csaba P.; Patthy, László

Full text

DoOP: Da abases o O hologous P omo e s, collec ions o clus e s o o hologous ups eam sequences om cho da es and plan s End e Ba a*, End e Sebes ye ´n, Tama ´sB.Pa ´l y, Ga ´bo To ´ h, Csaba P. O u ay and La ´szlo ´Pa hy 1 Ag icul u al Bio echnology Cen e , Go ¨do ¨llo } , Szen -Gyo ¨ gyi Albe u. 4, H-2100, Hunga y and 1 Ins i u e o Enzymology, Biological Resea ch Cen e o he Hunga ian Academy o Sciences, Budapes , Ka olina  uu 29, H-1113, Hunga y Recei ed Augus 15, 2004; Re ised Sep embe 29, 2004; Accep ed Oc obe 13, 2004 ABSTRACT DoOP (h p://doop.abc.hu/) is a da abase o euka yo ic p omo e sequences (ups eam egions) aiming o acili a e he ecogni ion o egula o y si es con- se ed be ween species. The anno a ed i s exons o human and A abidopsis haliana genes we e used as que ies in BLAST sea ches o collec he mos closely ela ed o hologous i s exon sequences om Cho da a and Vi idiplan ae species. Up o 3000 bp DNA segmen s ups eam om hese i s exons cons i u e he clus e s in he cho da e and plan sec ions o he Da abase o O hologous P omo e s. Release 1.0 o DoOP con ains 21 061 cho da e clus e s om 284 di e en species and 7548 plan clus e s om 269 di e en species. The da abase can be used o ind and e ie e p omo e sequences o a gi en gene om a ious species and i is also sui able o see he mos i ial conse ed sequence blocks in he o hologous ups eam egions. Use s can sea ch DoOP wi h ei he seq- uence o ex (anno a ion) o ind p omo e clus e s o a ious genes. In addi ion o he sequence da a, he posi ions o he conse ed sequence blocks de i ed om mul iple alignmen s, he posi ions o epe i i e elemen s and he posi ions o ansc ip ion s a si es known om he Euka yo ic P omo e Da abase (EPD) can be iewed g aphically. INTRODUCTION Regula ion o ansc ip ion ini ia ion was among he i s success ul a ge s o bioin o ma ic analyses. I is unequi ocal ha his egula ion always in ol es he binding o one o mo e ansc ip ion ac o s o some pa s o he p omo e egion (he e e e ed o as he egion ups eam om he ansc ip ion s a si e o a gene), called ansc ip ion ac o binding si es (TFBSs) (1). The sequence o he p omo e egion o genes can be de e mined expe imen ally, as well as he less exac posi ions and scope o hose egions whe e he di e en an- sc ip ion ac o s bind o he DNA. Al hough he expe imen al app oach is e y di icul and slow, and in mos cases gi es a a he ambiguous esul , i soon had yielded enough da a o s a collec ing hem in o da abases (2,3). F om he bioin o m- a ic poin o iew, i was easy o suppose ha p edic ing TFBSs would simply imply inding ma ches be ween expe i- men ally known TFBSs and he p omo e sequence. I became clea e y soon, howe e , ha i was mo e complica ed, and e en using sophis ica ed me hods o de ining TFBSs such as posi ion-speci ic weigh ma ices ga e unsa is ac o y esul s in mos cases (4). Besides he expe imen al app oaches o iden i y TFBSs in he p omo e egions, se e al mos ly s ing-based s a is ical me hods ha e been de eloped o allow hei ab ini io p edic- ion. As inpu , hese me hods can use p omo e sequences o a se o ei he co- egula ed o o hologous genes. The i s app oach has been applied wi h some success o example in yeas , whe e he in silico da a a e in good ag eemen wi h ei he he expe imen al esul s (5) o a se o well- cha ac e ized p omo e s (6,7). The second app oach whe e a se o o hologous p omo e s a e used o ind conse ed o o e - ep esen ed mo i s is called phylogene ic oo p in ing (8). Se e al examples p o e ha his is a good s a ing poin o disco e TFBSs (9–12). The lack o a publicly accessible o hologous p omo e da abase has hinde ed he widesp ead use o he phylogene ic oo p in ing app oach. The bes known Euka yo ic P omo e Da abase (EPD) (13) ocuses a he on he speci ic ea u es o *To whom co espondence should be add essed. Tel: +36 28 526112; Fax: +36 28 526101; Email: [email p o ec ed] P esen add ess: Csaba P. O u ay, Ins i u e o Medical Technology, Uni e si y o Tampe e, F-33014 Tampe e, Finland The online e sion o his a icle has been published unde an open access model. Use s a e en i led o use, ep oduce, dissemina e, o display he open access e sion o his a icle o non-comme cial pu poses p o ided ha : he o iginal au ho ship is p ope ly and ully a ibu ed; he Jou nal and Ox o d Uni e si y P ess a e a ibu ed as he o iginal place o publica ion wi h he co ec ci a ion de ails gi en; i an a icle is subsequen ly ep oduced o dissemina ed no in i s en i e y bu only in pa o as a de i a i e wo k his mus be clea ly indica ed. Fo comme cial e-use pe missions, please con ac jou nals.[email p o ec ed]. ª2005, he au ho s Nucleic Acids Resea ch, Vol. 33, Da abase issue ªOx o d Uni e si y P ess 2005; all igh s ese ed D86–D90 Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue doi:10.1093/na /gki097 he p omo e egions, such as ansc ip ion s a si es (TSSs), TATA-boxes, e c. han on de ining o hologous se s o p omo e s. The Hema opoiesis P omo e Da abase (HemoPDB) (14) con ains linked o hologous p omo e s, bu only o hose genes ha a e in ol ed in hema opoiesis. The e a e se e al me hods o clus e o hologous genes such as he COG da a- base a he Na ional Cen e o Bio echnology In o ma ion (NCBI) (15), he INPARANOID p og am (16) o he O hoMCL (17). They a e all based on an all-agains -all BLAST sea ch o p o ein sequences, hus i is di icul o use hei da a o e ie e p omo e sequences. The Ensembl Genome B owse (18) p o ides links o o hologous genes, bu hey a e limi ed o he species in ol ed in he Ensembl sys em. The CORG da abase (19) also p o ides o hologous p omo e sequences, bu ini ially only om he human and mouse genomes and po en ially om he species in ol ed in he Ensembl sys em. We belie e ha all a emp s o iden i y unc ionally impo - an mo i s in ups eam cis- egula o y egions o genes can la gely bene i om a collec ion o o hologous p omo e sequences. Once we ha e a se o o hologous ups eam egions, we can loca e known TFBSs, o y o p edic new ones applying ab ini io me hods, o simply sea ch o conse ed egions. Se e al me hods and da abases a e a ailable o ca y ou hese asks (20), bu hey always equi e a se o o hologous genes. We p esen he e he i s e sion o he Da abase o O ho- logous P omo e s (DoOP), which p o ides clus e s o o ho- logous pu a i e p omo e s wi hin he phylum Cho da a and kingdom Vi idiplan ae. The cho da e and plan sec ions o DoOP a e based on he NCBI gene anno a ion (21) o he human and A abidopsis haliana genomes, espec i ely. We use he i s o he i s wo exons o genes as a que y in a BLAST (22) sea ch o ind o hologous i s exons. Sub- sequen ly, we ex ac he 500, 1000 and 3000 bp ups eam egions o hese o hologous i s exons o build he DoOP clus e s. A low cha depic ing he gene a ion o he DoOP da abases can be seen in Figu e 1. The aim o he DoOP is o p o ide esea che s wi h se s o o hologous p omo e s o acili a e he analysis o egula o y egions, including he disco e y o conse ed non-coding mo i s. CONSTRUCTION OF THE DoOP DATABASE Sea ching o o hologs We chose Homo sapiens (NCBI Human Build 34 a ailable om p:// p.ncbi.nih.go /genomes/H_sapiens) and A. hali- ana ( p:// p.ncbi.nih.go /genomes/A abidopsis_ haliana/) as e e ence species o he cho da e and plan da abases, espec - i ely. The i s c i ical s ep o he da abase c ea ion was o choose he mos sui able que y sequences. We analyzed he genome anno a ions p o ided by he NCBI, and decided o di ide he que y ypes in o six main ca ego ies. These ypes o que ies a e dis inguished acco ding o he s a ing posi ion o he i s mRNA exon wi h espec o he p o ein-coding (CDS) sequence and he leng h o he i s coding exon (Figu e 2). In he BLAST sea ches we used coding sequences whene e i was possible (Figu e 2, ypes 1–4), because he 50-un ansla ed egion (50-UTR) sequences a e usually less conse ed han he coding egions. Howe e , in ypes 5nand 6n, we had o use he sequence o he anno a ed 50 ully UTR exons. To imp o e sensi i i y, we used he sequences o he i s wo exons ( ype 6n) o he i s wo coding exons ( ypes 2 and 4) i he leng h o he i s exon was <50 bp (Figu e 2). Fo building he local BLAST da abases, we used he gss, h gs, n and wgs sec ions o he NCBI BLAST da abases ( p:// p.ncbi.nih.go /blas /db/) and he whole genome sequences o mouse, a , ugu, zeb a ish om Ensembl ( p:// p.ensembl.o g/pub) ha we e a ailable a he end o Ma ch 2004. We buil wo da abases by emo ing all mRNA (cDNA) sequences om bo h, and he non-cho da e sequen- ces om he cho da e da abase and he non-Vi idiplan ae sequences om he plan da abase u ilizing he NCBI axid–gi numbe , phylum–kingdom assignmen sys em ( p:// p.ncbi.nih.go /pub/ axonomy/). In he case o he e e ence species, he 3000 bp ups eam egion wi h he i s o he i s DIALIGN Repea Maske sequences Figu e 1. The da a low o he gene a ion o he cho da e DoOP da abase. The same me hod is used in he case o he plan DoOP da abase, excep he sou ce BLAST da abase comes om all Vi idiplan ae sequences and he que y sequences a e gene a ed based on he NCBI A. haliana anno a ion. Figu e 2. Di e en ypes o genes acco ding o he posi ions o he i s mRNA and coding (cds) exons. The ypes 5 and 6 all in o di e en subca ego ies based on he numbe o he i s coding exon. I i is he second as in his igu e, we call i ype 52 o 62, bu o he wise we a e e e ing o hem gene ally as 5no 6n. The posi ions o he que y sequences ela i e o he i s exons a e ma ked wi h g een boxes, while he 500, 1000 and 3000 bp ups eam egions ha ha e been pu in o he da abase a e ma ked wi h ed boxes. Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue D87 wo exons co esponding o he selec ed que y sequence was used in he da abase. The de ails o he da abase c ea ion, sea ching and p ocessing can be ound a he DoOP web pages (h p://doop.abc.hu/de ails.h ml). P ocessing he da abase We analyzed he esul s o BLAST sea ches using Pe l sc ip s u ilizing BioPe l modules (23). Fi s , we had made a esul s able (Figu e 1) using a minimum h eshold alue o 50% o iden i y and 75% o he combined hi leng h compa ed o he que y leng h. In he nex s ep, we selec ed he bes sui able o hologous hi s wi h he ollowing simple algo i hm. In each species ha had mo e han one hi , he hi wi h he bes sco e was chosen. I he e we e wo o mo e hi s wi h iden ical sco es om a species, he sequence ha ex ended u hes o he 50di ec ion ela i e o he hi was chosen (i.e. he one ha had a longe ups eam egion). A e he mos o ho- logous hi s we e de e mined, 500, 1000 and 3000 bp long ups eam sequences we e ex ac ed om he o iginal da abase sequences i a ailable. In his pape we e e o he se o o hologous sequences as a clus e . In o de o ind conse ed egions wi hin he clus e s, we gene a ed mul iple alignmen s. Since local alignmen s a e be e o his pu pose, we chose he DIALIGN2 p og am ha implemen s a segmen -based alignmen algo i hm (24). The conse ed mo i s we e ex ac ed om he consensus sequences o he DIALIGN2 esul s using a Pe l sc ip . The pu a i e in e spe sed epea s we e iden i ied in he clus e sequences using he Repea Maske p og am (A. F. A. Smi and P. G een, h p:// epea maske .genome.washing on.edu/) wi h he app op ia e epea lib a ies ob ained om Repbase Upda e (25). Posi ions o he TSSs as anno a ed in he EPD da abase we e de e mined in he wo e e ence species using a BLAST-based pai ing o EPD sequences wi h he co espond- ing DoOP en y. A simila me hod was used o he cho da e da abase o e ie e Ensembl links and de ini ions o genes. The posi ions o he epea s and he conse ed mo i s along wi h o he in o ma ion such as he posi ions o he anno a ed 50-UTRs o ypes 3 and 4 (Figu e 2), and he TSSs we e compiled oge he in a g aphics ile using BioPe l. The da a ob ained du ing da abase p ocessing we e ed in o a MySQL da abase. CONTENTS OF THE CURRENT RELEASE Release 1.0 o DoOP da abank con ains p ac ically wo dis inc da abases, he plan and he cho da e. They bo h e lec he sequence and anno a ion da a ha we e a ailable a he end o Ma ch 2004. The plan da abase con ains 7548 clus e s ha ha e sequences om a leas wo species. This numbe e e s o he clus e s con aining up o 500 bp p omo e egions. The numbe is lowe in he case o he 1000 and 3000 bp clus e s (1088 and 973, espec i ely), because many hi s, especially hose om he Whole Genome Sho gun sequences sec ion, con ain <500 bp o p omo e sequence depending on he posi- ion o he hi wi hin he sequence en y. Mos o he plan clus e s con ain sequences only om A. haliana and B assica ole acea. The e a e only 1096 clus e s ha con ain p omo e sequences o a leas one species ou side he B assicaceae amily. The cho da e da abase con ains 21 061 500 bp, 20 009 1000 bp and 18 911 3000 bp p omo e egion clus e s. The e a e 15 178 clus e s whe e a leas one en y exis s om a amily o he han Hominidae. A de ailed da abase s a is ics is a ailable in he DoOP web pages. DATABASE ACCESS AND WEB CONTENT The in o ma ion ha is s o ed in he DoOP da abases can be accessed eely om he DoOP websi e a h p://doop.abc.hu/. A e selec ing he cho da e o he plan da abase sec ion, use s can sea ch o a speci ic clus e o o a g oup o clus e s. The e a e ou ex sea ch ields, whe e use s can en e a speci ic clus e ID, o a scien i ic axon name, o a species axonomy ID ( axid) om he NCBI Taxonomy da abase, o a keywo d o sea ch in he de ini ion lines o he clus e s. I is also possible o selec a clus e (i.e. a gene) by a as BLAT (26) sea ch using any cDNA sequence om he e e ence species (H.sapiens o A. haliana) as a que y. In he nex s ep use s can selec any clus e o u he iewing om he esul s lis . In he clus e iew (Figu e 3), among o he da a he e is a g aphical ep e- sen a ion o he clus e sequences showing he species names, possible 50-UTR and TSS in he e e ence sequence, any epe- i i e sequences and conse ed mo i s. By de aul he clus e iew s a s wi h he clus e o 500 bp long p omo e egions (Figu e 3), bu use s can selec he 1000 o 3000 bp p omo e clus e s, oo. I is also possible o iew and sa e he mul iple alignmen s and he FASTA o ma sequences o he clus e s and he sequences o he conse ed mo i s. CONCLUSIONS AND PERSPECTIVES The p ima y aim o he DoOP is o p o ide an easy way o ob ain clus e s o o hologous p omo e sequences. These clus- e sequences can be a sou ce o a mo e de ailed analysis o possible p omo e elemen s, including TFBSs. The da a p o ided by he DoOP web se e is also sui able o a d a iew o he conse ed mo i s in he p omo e egions o di e en genes. Ou me hod o ind o hologous ups eam egions elies on wo impo an sou ces. The i s is he genome anno a ion o he e e ence species (H.sapiens and A. haliana). Undoub - edly, we need o ha e he exac posi ions o he i s exons, including he 50-UTR egions. We know ha he anno a ion we had used is a om being comple e. Fo example, he e a e s ill a lo o anno a ed genes (4031 in he human genome da abase) whe e he s a ing poin s o he i s coding and mRNA exons a e he same ( ypes 1 and 2 in Figu e 2), which is e y unlikely in i o. We expec ha he genome anno a ion o hese wo e e ence species will be s eadily be e ed, he eby imp o ing subsequen eleases o DoOP as well. The second impo an ac o o ou wo k is he a ailable genomic sequences, especially he numbe o comple e gen- omes. I is p o en ha he mo e he sequences a e a ailable o phylogene ic oo p in ing, he be e he esul ha can be achie ed (27). The si ua ion o he cho da e da abase is qui e p omising, since al eady se e al mammalian whole gen- ome sequences ha e been de e mined, and he e a e qui e a ew ongoing p ojec s, oo. Un o una ely, he e a e only wo comple ed genomes om plan s, A. haliana and ice. We hope howe e ha he sequence da a appea ing om he D88 Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue ongoing plan genome sequencing p ojec s such as Medicago unca ula,Populus ichoca pa o oma o, will imp o e he plan DoOP da abase signi ican ly. This is he i s elease o he DoOP da abase. The nex mino upda e will be a ailable by he end o 2004. We plan o gene a e wo da abases pe yea in he u u e, which will e lec he sequence and anno a ion da a a ailable a he end o Ma ch and Sep embe . Ou plans o imp o e he DoOP da abase include e ining he BLAST sea ches o be mo e sensi i e, using o he me hods o mul iple alignmen s and o de ec conse ed mo i s wi hin he clus e s, o elying mo e on he da a o o he da abases such as Ensembl. Figu e 3. Examples o he DoOP da a iews. In he pic u e o he clus e he boxes numbe ed om m1 o m13 show he conse ed mo i s, he black box shows a p edic ed epe i i e elemen , while he blue box shows he 50-UTR. Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue D89 The me hod we ha e de eloped he e could also be applicable o he gene a ion o DoOP da abases based on o he e e ence species, such as he yeas o he ui ly. ACKNOWLEDGEMENTS This wo k was suppo ed by Bio echnology 2001 g an BIO-0117/01 om he Cen al Technical De elopmen Ta ge Funds (Hunga y). The ecipien s o ‘Bolyai Fellowship’ awa ded by he Hunga ian Academy o Sciences we e E.B. and G.T. REFERENCES 1. Ficke ,J.W. and Ha zigeo giou,A.C. (1997) Euka yo ic p omo e ecogni ion. Genome Res.,7, 861–878. 2. Wingende ,E., Chen,X., F icke,E., Ge e s,R., Hehl,R., Liebich,I., K ull,M., Ma ys,V., Michael,H., Ohnhause ,R. e al. (2001) The TRANSFAC sys em on gene exp ession egula ion. Nucleic Acids Res., 29, 281–283. 3. Lesco ,M., Dehais,P., Thijs,G., Ma chal,K., Mo eau,Y., Van de Pee ,Y., Rouze,P. and Rombau s,S. (2002) Plan CARE, a da abase o plan cis-ac ing egula o y elemen s and a po al o ools o in silico analysis o p omo e sequences. Nucleic Acids Res., 30, 325–327. 4. Rombau s,S., Flo quin,K., Lesco ,M., Ma chal,K., Rouze,P. and Van de Pee ,Y. (2003) Compu a ional app oaches o iden i y p omo e s and cis- egula o y elemen s in plan genomes. Plan Physiol., 132, 1162–1176. 5. an Helden,J., del Olmo,M. and Pe ez-O in,J.E. (2000) S a is ical analysis o yeas genomic downs eam sequences e eals pu a i e polyadenyla ion signals. Nucleic Acids Res.,28, 1000–1010. 6. Ae s,S., Van Loo,P., Thijs,G., Mo eau,Y. and De Moo ,B. (2003) Compu a ional de ec ion o cis- egula o y modules. Bioin o ma ics, 19 (Suppl 2), II5–II14. 7. F i h,M.C., Fu,Y., Yu,L., Chen,J.F., Hansen,U. and Weng,Z. (2004) De ec ion o unc ional DNA mo i s ia s a is ical o e - ep esen a ion. Nucleic Acids Res.,32, 1372–1381. 8. Blanche e,M., Schwikowski,B. and Tompa,M. (2002) Algo i hms o phylogene ic oo p in ing. J. Compu . Biol.,9, 211–223. 9. Lenha d,B., Sandelin,A., Mendoza,L., Engs om,P., Ja ebo g,N. and Wasse man,W.W. (2003) Iden i ica ion o conse ed egula o y elemen s by compa a i e genome analysis. J. Biol.,2, 13. 10. Ge encse ,A., Ba a,E., Boa,S., Kas anis,P., Bosze,Z. and Whi elaw,C.B. (2002) Compa a i e analysis on he s uc u al ea u es o he 50 lanking egion o kappa-casein genes om six di e en species. Gene . Sel. E ol.,34, 117–128. 11. Solo ye ,V.V. and Shahmu ado ,I.A. (2003) P omH: p omo e s iden i ica ion using o hologous genomic sequences. Nucleic Acids Res., 31, 3540–3545. 12. Bo elli,D., McAuli e,J., O cha enko,D., Lewis,K.D., O cha enko,I., Pach e ,L. and Rubin,E.M. (2003) Phylogene ic shadowing o p ima e sequences o ind unc ional egions o he human genome. Science, 299, 1391–1394. 13. Schmid,C.D., P az,V., Delo enzi,M., Pe ie ,R. and Buche ,P. (2004) The Euka yo ic P omo e Da abase EPD: he impac o in silico p ime ex ension. Nucleic Acids Res.,32, D82–D85. 14. Poha ,T.T., Sun,H. and Da ulu i,R.V. (2004) HemoPDB: Hema opoiesis P omo e Da abase, an in o ma ion esou ce o ansc ip ional egula ion in blood cell de elopmen . Nucleic Acids Res.,32, D86–D90. 15. Ta uso ,R.L., Fedo o a,N.D., Jackson,J.D., Jacobs,A.R., Ki yu in,B., Koonin,E.V., K ylo ,D.M., Mazumde ,R., Mekhedo ,S.L., Nikolskaya,A.N. e al. (2003) The COG da abase: an upda ed e sion includes euka yo es. BMC Bioin o ma ics,4, 41. 16. Remm,M., S o m,C.E. and Sonnhamme ,E.L. (2001) Au oma ic clus e ing o o hologs and in-pa alogs om pai wise species compa isons. J. Mol. Biol.,314, 1041–1052. 17. Li,L., S oecke ,C.J.,J and Roos,D.S. (2003) O hoMCL: iden i ica ion o o hologg oups o euka yo icgenomes.Genome Res.,13, 2178–2189. 18. Hammond,M.P. and Bi ney,E. (2004) Genome in o ma ion esou ces—de elopmen s a Ensembl. T ends Gene .,20, 268–272. 19. Die e ich,C., Wang,H., Ra ei schak,K., Luz,H. and Ving on,M. (2003) CORG: a da abase o COmpa a i e Regula o y Genomics. Nucleic Acids Res.,31, 55–57. 20. Iye ,L. (2004) Conse a ion-enhanced p edic ion o ansc ip ion ac o binding si es. B ie . Bioin o ma ics,5, 90–92. 21. P ui ,K.D., Ta uso a,T. and Maglo ,D.R. (2003) NCBI Re e ence Sequencep ojec :upda eandcu en s a us.NucleicAcidsRes.,31,34–37. 22. Al schul,S.F., Madden,T.L., Scha e ,A.A., Zhang,J., Zhang,Z., Mille ,W. and Lipman,D.J. (1997) Gapped BLAST and PSI-BLAST: a new gene a ion o p o ein da abase sea chp og ams. Nucleic Acids Res., 25, 3389–3402. 23. S ajich,J.E., Block,D., Boulez,K., B enne ,S.E., Che i z,S.A., Dagdigian,C., Fuellen,G., Gilbe ,J.G., Ko ,I., Lapp,H. e al. (2002) The Biope l oolki : Pe l modules o he li e sciences. Genome Res., 12, 1611–1618. 24. Mo gens e n,B. (1999) DIALIGN 2: imp o emen o he segmen - o-segmen app oach o mul iple sequence alignmen . Bioin o ma ics,15, 211–218. 25. Ju ka,J. (2000) Repbase upda e: a da abase and an elec onic jou nal o epe i i e elemen s. T ends Gene .,16, 418–420. 26. Ken ,W.J. (2002) BLAT— he BLAST-like alignmen ool. Genome Res., 12, 656–664. 27. Thomas,J.W., Touchman,J.W., Blakesley,R.W., Bou a d,G.G., Becks om-S e nbe g,S.M., Ma gulies,E.H., Blanche e,M., Siepel,A.C., Thomas,P.J., McDowell,J.C. e al. (2003) Compa a i e analyses o mul i-species sequences om a ge ed genomic egions. Na u e, 424, 788–793. D90 Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue