DoOP: Da abases o O hologous P omo e s,
collec ions o clus e s o o hologous ups eam
sequences om cho da es and plan s
End e Ba a*, End e Sebes ye
´n, Tama
´sB.Pa
´l y, Ga
´bo To
´ h, Csaba P. O u ay and
La
´szlo
´Pa hy
1
Ag icul u al Bio echnology Cen e , Go
¨do
¨llo
}
, Szen -Gyo
¨ gyi Albe u. 4, H-2100, Hunga y and
1
Ins i u e o Enzymology,
Biological Resea ch Cen e o he Hunga ian Academy o Sciences, Budapes , Ka olina
uu 29, H-1113, Hunga y
Recei ed Augus 15, 2004; Re ised Sep embe 29, 2004; Accep ed Oc obe 13, 2004
ABSTRACT
DoOP (h p://doop.abc.hu/) is a da abase o euka yo ic
p omo e sequences (ups eam egions) aiming o
acili a e he ecogni ion o egula o y si es con-
se ed be ween species. The anno a ed i s
exons o human and A abidopsis haliana genes
we e used as que ies in BLAST sea ches o collec
he mos closely ela ed o hologous i s exon
sequences om Cho da a and Vi idiplan ae species.
Up o 3000 bp DNA segmen s ups eam om hese
i s exons cons i u e he clus e s in he cho da e
and plan sec ions o he Da abase o O hologous
P omo e s. Release 1.0 o DoOP con ains 21 061
cho da e clus e s om 284 di e en species and
7548 plan clus e s om 269 di e en species. The
da abase can be used o ind and e ie e p omo e
sequences o a gi en gene om a ious species and
i is also sui able o see he mos i ial conse ed
sequence blocks in he o hologous ups eam
egions. Use s can sea ch DoOP wi h ei he seq-
uence o ex (anno a ion) o ind p omo e clus e s
o a ious genes. In addi ion o he sequence da a,
he posi ions o he conse ed sequence blocks
de i ed om mul iple alignmen s, he posi ions o
epe i i e elemen s and he posi ions o ansc ip ion
s a si es known om he Euka yo ic P omo e
Da abase (EPD) can be iewed g aphically.
INTRODUCTION
Regula ion o ansc ip ion ini ia ion was among he i s
success ul a ge s o bioin o ma ic analyses. I is unequi ocal
ha his egula ion always in ol es he binding o one o mo e
ansc ip ion ac o s o some pa s o he p omo e egion (he e
e e ed o as he egion ups eam om he ansc ip ion s a
si e o a gene), called ansc ip ion ac o binding si es
(TFBSs) (1). The sequence o he p omo e egion o genes
can be de e mined expe imen ally, as well as he less exac
posi ions and scope o hose egions whe e he di e en an-
sc ip ion ac o s bind o he DNA. Al hough he expe imen al
app oach is e y di icul and slow, and in mos cases gi es
a a he ambiguous esul , i soon had yielded enough da a o
s a collec ing hem in o da abases (2,3). F om he bioin o m-
a ic poin o iew, i was easy o suppose ha p edic ing
TFBSs would simply imply inding ma ches be ween expe i-
men ally known TFBSs and he p omo e sequence. I became
clea e y soon, howe e , ha i was mo e complica ed, and
e en using sophis ica ed me hods o de ining TFBSs such as
posi ion-speci ic weigh ma ices ga e unsa is ac o y esul s in
mos cases (4).
Besides he expe imen al app oaches o iden i y TFBSs in
he p omo e egions, se e al mos ly s ing-based s a is ical
me hods ha e been de eloped o allow hei ab ini io p edic-
ion. As inpu , hese me hods can use p omo e sequences o
a se o ei he co- egula ed o o hologous genes. The i s
app oach has been applied wi h some success o example
in yeas , whe e he in silico da a a e in good ag eemen
wi h ei he he expe imen al esul s (5) o a se o well-
cha ac e ized p omo e s (6,7). The second app oach whe e
a se o o hologous p omo e s a e used o ind conse ed
o o e - ep esen ed mo i s is called phylogene ic oo p in ing
(8). Se e al examples p o e ha his is a good s a ing poin o
disco e TFBSs (9–12).
The lack o a publicly accessible o hologous p omo e
da abase has hinde ed he widesp ead use o he phylogene ic
oo p in ing app oach. The bes known Euka yo ic P omo e
Da abase (EPD) (13) ocuses a he on he speci ic ea u es o
*To whom co espondence should be add essed. Tel: +36 28 526112; Fax: +36 28 526101; Email: [email p o ec ed]
P esen add ess:
Csaba P. O u ay, Ins i u e o Medical Technology, Uni e si y o Tampe e, F-33014 Tampe e, Finland
The online e sion o his a icle has been published unde an open access model. Use s a e en i led o use, ep oduce, dissemina e, o display he open access
e sion o his a icle o non-comme cial pu poses p o ided ha : he o iginal au ho ship is p ope ly and ully a ibu ed; he Jou nal and Ox o d Uni e si y P ess
a e a ibu ed as he o iginal place o publica ion wi h he co ec ci a ion de ails gi en; i an a icle is subsequen ly ep oduced o dissemina ed no in i s en i e y bu
only in pa o as a de i a i e wo k his mus be clea ly indica ed. Fo comme cial e-use pe missions, please con ac jou nals.[email p o ec ed].
ª2005, he au ho s
Nucleic Acids Resea ch, Vol. 33, Da abase issue ªOx o d Uni e si y P ess 2005; all igh s ese ed
D86–D90 Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue
doi:10.1093/na /gki097
he p omo e egions, such as ansc ip ion s a si es (TSSs),
TATA-boxes, e c. han on de ining o hologous se s o
p omo e s. The Hema opoiesis P omo e Da abase (HemoPDB)
(14) con ains linked o hologous p omo e s, bu only o hose
genes ha a e in ol ed in hema opoiesis. The e a e se e al
me hods o clus e o hologous genes such as he COG da a-
base a he Na ional Cen e o Bio echnology In o ma ion
(NCBI) (15), he INPARANOID p og am (16) o he
O hoMCL (17). They a e all based on an all-agains -all
BLAST sea ch o p o ein sequences, hus i is di icul o
use hei da a o e ie e p omo e sequences. The Ensembl
Genome B owse (18) p o ides links o o hologous genes,
bu hey a e limi ed o he species in ol ed in he Ensembl
sys em. The CORG da abase (19) also p o ides o hologous
p omo e sequences, bu ini ially only om he human and
mouse genomes and po en ially om he species in ol ed in
he Ensembl sys em.
We belie e ha all a emp s o iden i y unc ionally impo -
an mo i s in ups eam cis- egula o y egions o genes can
la gely bene i om a collec ion o o hologous p omo e
sequences. Once we ha e a se o o hologous ups eam
egions, we can loca e known TFBSs, o y o p edic
new ones applying ab ini io me hods, o simply sea ch o
conse ed egions. Se e al me hods and da abases a e a ailable
o ca y ou hese asks (20), bu hey always equi e a se o
o hologous genes.
We p esen he e he i s e sion o he Da abase o O ho-
logous P omo e s (DoOP), which p o ides clus e s o o ho-
logous pu a i e p omo e s wi hin he phylum Cho da a and
kingdom Vi idiplan ae. The cho da e and plan sec ions
o DoOP a e based on he NCBI gene anno a ion (21) o
he human and A abidopsis haliana genomes, espec i ely.
We use he i s o he i s wo exons o genes as a que y in a
BLAST (22) sea ch o ind o hologous i s exons. Sub-
sequen ly, we ex ac he 500, 1000 and 3000 bp ups eam
egions o hese o hologous i s exons o build he DoOP
clus e s. A low cha depic ing he gene a ion o he DoOP
da abases can be seen in Figu e 1. The aim o he DoOP is o
p o ide esea che s wi h se s o o hologous p omo e s
o acili a e he analysis o egula o y egions, including he
disco e y o conse ed non-coding mo i s.
CONSTRUCTION OF THE DoOP DATABASE
Sea ching o o hologs
We chose Homo sapiens (NCBI Human Build 34 a ailable
om p:// p.ncbi.nih.go /genomes/H_sapiens) and A. hali-
ana ( p:// p.ncbi.nih.go /genomes/A abidopsis_ haliana/) as
e e ence species o he cho da e and plan da abases, espec -
i ely. The i s c i ical s ep o he da abase c ea ion was o
choose he mos sui able que y sequences. We analyzed he
genome anno a ions p o ided by he NCBI, and decided o
di ide he que y ypes in o six main ca ego ies. These ypes o
que ies a e dis inguished acco ding o he s a ing posi ion o
he i s mRNA exon wi h espec o he p o ein-coding (CDS)
sequence and he leng h o he i s coding exon (Figu e 2).
In he BLAST sea ches we used coding sequences whene e i
was possible (Figu e 2, ypes 1–4), because he 50-un ansla ed
egion (50-UTR) sequences a e usually less conse ed han
he coding egions. Howe e , in ypes 5nand 6n, we had o
use he sequence o he anno a ed 50 ully UTR exons. To
imp o e sensi i i y, we used he sequences o he i s wo
exons ( ype 6n) o he i s wo coding exons ( ypes 2 and 4)
i he leng h o he i s exon was <50 bp (Figu e 2).
Fo building he local BLAST da abases, we used he gss,
h gs, n and wgs sec ions o he NCBI BLAST da abases
( p:// p.ncbi.nih.go /blas /db/) and he whole genome
sequences o mouse, a , ugu, zeb a ish om Ensembl
( p:// p.ensembl.o g/pub) ha we e a ailable a he end o
Ma ch 2004. We buil wo da abases by emo ing all mRNA
(cDNA) sequences om bo h, and he non-cho da e sequen-
ces om he cho da e da abase and he non-Vi idiplan ae
sequences om he plan da abase u ilizing he NCBI
axid–gi numbe , phylum–kingdom assignmen sys em ( p://
p.ncbi.nih.go /pub/ axonomy/). In he case o he e e ence
species, he 3000 bp ups eam egion wi h he i s o he i s
DIALIGN
Repea Maske
sequences
Figu e 1. The da a low o he gene a ion o he cho da e DoOP da abase.
The same me hod is used in he case o he plan DoOP da abase, excep he
sou ce BLAST da abase comes om all Vi idiplan ae sequences and he que y
sequences a e gene a ed based on he NCBI A. haliana anno a ion.
Figu e 2. Di e en ypes o genes acco ding o he posi ions o he i s mRNA
and coding (cds) exons. The ypes 5 and 6 all in o di e en subca ego ies based
on he numbe o he i s coding exon. I i is he second as in his igu e, we call
i ype 52 o 62, bu o he wise we a e e e ing o hem gene ally as 5no 6n. The
posi ions o he que y sequences ela i e o he i s exons a e ma ked wi h g een
boxes, while he 500, 1000 and 3000 bp ups eam egions ha ha e been pu in o
he da abase a e ma ked wi h ed boxes.
Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue D87
wo exons co esponding o he selec ed que y sequence was
used in he da abase. The de ails o he da abase c ea ion,
sea ching and p ocessing can be ound a he DoOP web
pages (h p://doop.abc.hu/de ails.h ml).
P ocessing he da abase
We analyzed he esul s o BLAST sea ches using Pe l sc ip s
u ilizing BioPe l modules (23). Fi s , we had made a esul s
able (Figu e 1) using a minimum h eshold alue o 50% o
iden i y and 75% o he combined hi leng h compa ed o he
que y leng h. In he nex s ep, we selec ed he bes sui able
o hologous hi s wi h he ollowing simple algo i hm. In each
species ha had mo e han one hi , he hi wi h he bes sco e
was chosen. I he e we e wo o mo e hi s wi h iden ical
sco es om a species, he sequence ha ex ended u hes
o he 50di ec ion ela i e o he hi was chosen (i.e. he
one ha had a longe ups eam egion). A e he mos o ho-
logous hi s we e de e mined, 500, 1000 and 3000 bp long
ups eam sequences we e ex ac ed om he o iginal da abase
sequences i a ailable.
In his pape we e e o he se o o hologous sequences as
a clus e . In o de o ind conse ed egions wi hin he clus e s,
we gene a ed mul iple alignmen s. Since local alignmen s a e
be e o his pu pose, we chose he DIALIGN2 p og am ha
implemen s a segmen -based alignmen algo i hm (24). The
conse ed mo i s we e ex ac ed om he consensus
sequences o he DIALIGN2 esul s using a Pe l sc ip . The
pu a i e in e spe sed epea s we e iden i ied in he clus e
sequences using he Repea Maske p og am (A. F. A. Smi
and P. G een, h p:// epea maske .genome.washing on.edu/)
wi h he app op ia e epea lib a ies ob ained om Repbase
Upda e (25). Posi ions o he TSSs as anno a ed in he EPD
da abase we e de e mined in he wo e e ence species using a
BLAST-based pai ing o EPD sequences wi h he co espond-
ing DoOP en y. A simila me hod was used o he cho da e
da abase o e ie e Ensembl links and de ini ions o genes.
The posi ions o he epea s and he conse ed mo i s along
wi h o he in o ma ion such as he posi ions o he anno a ed
50-UTRs o ypes 3 and 4 (Figu e 2), and he TSSs we e
compiled oge he in a g aphics ile using BioPe l. The da a
ob ained du ing da abase p ocessing we e ed in o a MySQL
da abase.
CONTENTS OF THE CURRENT RELEASE
Release 1.0 o DoOP da abank con ains p ac ically wo
dis inc da abases, he plan and he cho da e. They bo h e lec
he sequence and anno a ion da a ha we e a ailable a he end
o Ma ch 2004. The plan da abase con ains 7548 clus e s ha
ha e sequences om a leas wo species. This numbe e e s
o he clus e s con aining up o 500 bp p omo e egions. The
numbe is lowe in he case o he 1000 and 3000 bp clus e s
(1088 and 973, espec i ely), because many hi s, especially
hose om he Whole Genome Sho gun sequences sec ion,
con ain <500 bp o p omo e sequence depending on he posi-
ion o he hi wi hin he sequence en y. Mos o he plan
clus e s con ain sequences only om A. haliana and B assica
ole acea. The e a e only 1096 clus e s ha con ain p omo e
sequences o a leas one species ou side he B assicaceae
amily. The cho da e da abase con ains 21 061 500 bp,
20 009 1000 bp and 18 911 3000 bp p omo e egion clus e s.
The e a e 15 178 clus e s whe e a leas one en y exis s om
a amily o he han Hominidae. A de ailed da abase s a is ics
is a ailable in he DoOP web pages.
DATABASE ACCESS AND WEB CONTENT
The in o ma ion ha is s o ed in he DoOP da abases can be
accessed eely om he DoOP websi e a h p://doop.abc.hu/.
A e selec ing he cho da e o he plan da abase sec ion, use s
can sea ch o a speci ic clus e o o a g oup o clus e s. The e
a e ou ex sea ch ields, whe e use s can en e a speci ic
clus e ID, o a scien i ic axon name, o a species axonomy
ID ( axid) om he NCBI Taxonomy da abase, o a keywo d o
sea ch in he de ini ion lines o he clus e s. I is also possible o
selec a clus e (i.e. a gene) by a as BLAT (26) sea ch using
any cDNA sequence om he e e ence species (H.sapiens o
A. haliana) as a que y. In he nex s ep use s can selec any
clus e o u he iewing om he esul s lis . In he clus e
iew (Figu e 3), among o he da a he e is a g aphical ep e-
sen a ion o he clus e sequences showing he species names,
possible 50-UTR and TSS in he e e ence sequence, any epe-
i i e sequences and conse ed mo i s. By de aul he clus e
iew s a s wi h he clus e o 500 bp long p omo e egions
(Figu e 3), bu use s can selec he 1000 o 3000 bp p omo e
clus e s, oo. I is also possible o iew and sa e he mul iple
alignmen s and he FASTA o ma sequences o he clus e s
and he sequences o he conse ed mo i s.
CONCLUSIONS AND PERSPECTIVES
The p ima y aim o he DoOP is o p o ide an easy way o
ob ain clus e s o o hologous p omo e sequences. These clus-
e sequences can be a sou ce o a mo e de ailed analysis o
possible p omo e elemen s, including TFBSs. The da a
p o ided by he DoOP web se e is also sui able o a d a
iew o he conse ed mo i s in he p omo e egions o
di e en genes.
Ou me hod o ind o hologous ups eam egions elies on
wo impo an sou ces. The i s is he genome anno a ion o
he e e ence species (H.sapiens and A. haliana). Undoub -
edly, we need o ha e he exac posi ions o he i s exons,
including he 50-UTR egions. We know ha he anno a ion
we had used is a om being comple e. Fo example, he e a e
s ill a lo o anno a ed genes (4031 in he human genome
da abase) whe e he s a ing poin s o he i s coding and
mRNA exons a e he same ( ypes 1 and 2 in Figu e 2),
which is e y unlikely in i o. We expec ha he genome
anno a ion o hese wo e e ence species will be s eadily
be e ed, he eby imp o ing subsequen eleases o DoOP as
well. The second impo an ac o o ou wo k is he a ailable
genomic sequences, especially he numbe o comple e gen-
omes. I is p o en ha he mo e he sequences a e a ailable o
phylogene ic oo p in ing, he be e he esul ha can be
achie ed (27). The si ua ion o he cho da e da abase is
qui e p omising, since al eady se e al mammalian whole gen-
ome sequences ha e been de e mined, and he e a e qui e
a ew ongoing p ojec s, oo. Un o una ely, he e a e only
wo comple ed genomes om plan s, A. haliana and ice.
We hope howe e ha he sequence da a appea ing om he
D88 Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue
ongoing plan genome sequencing p ojec s such as Medicago
unca ula,Populus ichoca pa o oma o, will imp o e he
plan DoOP da abase signi ican ly.
This is he i s elease o he DoOP da abase. The nex
mino upda e will be a ailable by he end o 2004. We plan
o gene a e wo da abases pe yea in he u u e, which will
e lec he sequence and anno a ion da a a ailable a he end
o Ma ch and Sep embe . Ou plans o imp o e he DoOP
da abase include e ining he BLAST sea ches o be mo e
sensi i e, using o he me hods o mul iple alignmen s and
o de ec conse ed mo i s wi hin he clus e s, o elying
mo e on he da a o o he da abases such as Ensembl.
Figu e 3. Examples o he DoOP da a iews. In he pic u e o he clus e he boxes numbe ed om m1 o m13 show he conse ed mo i s, he black box shows
a p edic ed epe i i e elemen , while he blue box shows he 50-UTR.
Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue D89
The me hod we ha e de eloped he e could also be applicable
o he gene a ion o DoOP da abases based on o he e e ence
species, such as he yeas o he ui ly.
ACKNOWLEDGEMENTS
This wo k was suppo ed by Bio echnology 2001 g an
BIO-0117/01 om he Cen al Technical De elopmen
Ta ge Funds (Hunga y). The ecipien s o ‘Bolyai
Fellowship’ awa ded by he Hunga ian Academy o
Sciences we e E.B. and G.T.
REFERENCES
1. Ficke ,J.W. and Ha zigeo giou,A.C. (1997) Euka yo ic p omo e
ecogni ion. Genome Res.,7, 861–878.
2. Wingende ,E., Chen,X., F icke,E., Ge e s,R., Hehl,R., Liebich,I.,
K ull,M., Ma ys,V., Michael,H., Ohnhause ,R. e al. (2001) The
TRANSFAC sys em on gene exp ession egula ion. Nucleic Acids Res.,
29, 281–283.
3. Lesco ,M., Dehais,P., Thijs,G., Ma chal,K., Mo eau,Y.,
Van de Pee ,Y., Rouze,P. and Rombau s,S. (2002) Plan CARE,
a da abase o plan cis-ac ing egula o y elemen s and a po al o
ools o in silico analysis o p omo e sequences. Nucleic Acids Res.,
30, 325–327.
4. Rombau s,S., Flo quin,K., Lesco ,M., Ma chal,K., Rouze,P. and
Van de Pee ,Y. (2003) Compu a ional app oaches o iden i y p omo e s
and cis- egula o y elemen s in plan genomes. Plan Physiol.,
132, 1162–1176.
5. an Helden,J., del Olmo,M. and Pe ez-O in,J.E. (2000) S a is ical
analysis o yeas genomic downs eam sequences e eals pu a i e
polyadenyla ion signals. Nucleic Acids Res.,28, 1000–1010.
6. Ae s,S., Van Loo,P., Thijs,G., Mo eau,Y. and De Moo ,B. (2003)
Compu a ional de ec ion o cis- egula o y modules. Bioin o ma ics,
19 (Suppl 2), II5–II14.
7. F i h,M.C., Fu,Y., Yu,L., Chen,J.F., Hansen,U. and Weng,Z. (2004)
De ec ion o unc ional DNA mo i s ia s a is ical o e - ep esen a ion.
Nucleic Acids Res.,32, 1372–1381.
8. Blanche e,M., Schwikowski,B. and Tompa,M. (2002) Algo i hms o
phylogene ic oo p in ing. J. Compu . Biol.,9, 211–223.
9. Lenha d,B., Sandelin,A., Mendoza,L., Engs om,P., Ja ebo g,N. and
Wasse man,W.W. (2003) Iden i ica ion o conse ed egula o y
elemen s by compa a i e genome analysis. J. Biol.,2, 13.
10. Ge encse ,A., Ba a,E., Boa,S., Kas anis,P., Bosze,Z. and Whi elaw,C.B.
(2002) Compa a i e analysis on he s uc u al ea u es o he 50 lanking
egion o kappa-casein genes om six di e en species. Gene . Sel.
E ol.,34, 117–128.
11. Solo ye ,V.V. and Shahmu ado ,I.A. (2003) P omH: p omo e s
iden i ica ion using o hologous genomic sequences. Nucleic Acids Res.,
31, 3540–3545.
12. Bo elli,D., McAuli e,J., O cha enko,D., Lewis,K.D., O cha enko,I.,
Pach e ,L. and Rubin,E.M. (2003) Phylogene ic shadowing o p ima e
sequences o ind unc ional egions o he human genome. Science,
299, 1391–1394.
13. Schmid,C.D., P az,V., Delo enzi,M., Pe ie ,R. and Buche ,P. (2004)
The Euka yo ic P omo e Da abase EPD: he impac o in silico p ime
ex ension. Nucleic Acids Res.,32, D82–D85.
14. Poha ,T.T., Sun,H. and Da ulu i,R.V. (2004) HemoPDB: Hema opoiesis
P omo e Da abase, an in o ma ion esou ce o ansc ip ional
egula ion in blood cell de elopmen . Nucleic Acids Res.,32,
D86–D90.
15. Ta uso ,R.L., Fedo o a,N.D., Jackson,J.D., Jacobs,A.R., Ki yu in,B.,
Koonin,E.V., K ylo ,D.M., Mazumde ,R., Mekhedo ,S.L.,
Nikolskaya,A.N. e al. (2003) The COG da abase: an upda ed e sion
includes euka yo es. BMC Bioin o ma ics,4, 41.
16. Remm,M., S o m,C.E. and Sonnhamme ,E.L. (2001) Au oma ic
clus e ing o o hologs and in-pa alogs om pai wise species
compa isons. J. Mol. Biol.,314, 1041–1052.
17. Li,L., S oecke ,C.J.,J and Roos,D.S. (2003) O hoMCL: iden i ica ion
o o hologg oups o euka yo icgenomes.Genome Res.,13, 2178–2189.
18. Hammond,M.P. and Bi ney,E. (2004) Genome in o ma ion
esou ces—de elopmen s a Ensembl. T ends Gene .,20, 268–272.
19. Die e ich,C., Wang,H., Ra ei schak,K., Luz,H. and Ving on,M. (2003)
CORG: a da abase o COmpa a i e Regula o y Genomics.
Nucleic Acids Res.,31, 55–57.
20. Iye ,L. (2004) Conse a ion-enhanced p edic ion o ansc ip ion ac o
binding si es. B ie . Bioin o ma ics,5, 90–92.
21. P ui ,K.D., Ta uso a,T. and Maglo ,D.R. (2003) NCBI Re e ence
Sequencep ojec :upda eandcu en s a us.NucleicAcidsRes.,31,34–37.
22. Al schul,S.F., Madden,T.L., Scha e ,A.A., Zhang,J., Zhang,Z.,
Mille ,W. and Lipman,D.J. (1997) Gapped BLAST and PSI-BLAST:
a new gene a ion o p o ein da abase sea chp og ams. Nucleic Acids Res.,
25, 3389–3402.
23. S ajich,J.E., Block,D., Boulez,K., B enne ,S.E., Che i z,S.A.,
Dagdigian,C., Fuellen,G., Gilbe ,J.G., Ko ,I., Lapp,H. e al. (2002)
The Biope l oolki : Pe l modules o he li e sciences. Genome Res.,
12, 1611–1618.
24. Mo gens e n,B. (1999) DIALIGN 2: imp o emen o he
segmen - o-segmen app oach o mul iple sequence alignmen .
Bioin o ma ics,15, 211–218.
25. Ju ka,J. (2000) Repbase upda e: a da abase and an elec onic jou nal o
epe i i e elemen s. T ends Gene .,16, 418–420.
26. Ken ,W.J. (2002) BLAT— he BLAST-like alignmen ool. Genome Res.,
12, 656–664.
27. Thomas,J.W., Touchman,J.W., Blakesley,R.W., Bou a d,G.G.,
Becks om-S e nbe g,S.M., Ma gulies,E.H., Blanche e,M., Siepel,A.C.,
Thomas,P.J., McDowell,J.C. e al. (2003) Compa a i e analyses o
mul i-species sequences om a ge ed genomic egions. Na u e,
424, 788–793.
D90 Nucleic Acids Resea ch, 2005, Vol. 33, Da abase issue