INTERNATIONAL DOCTORAL
SCHOOL OF THE USC
Alba
Reguei a Iglesias
PhD Thesis
Limi a ions o 16S RNA gene
as phylogene ic ma ke : a
la ge-scale me a-omics analysis
o plaque mic obio a in
pe iodon al diseases
San iago de Compos ela, 2022
Doc o al P og amme in Den al Science
DOCTORAL
THESIS
Limi a ions o 16S RNA gene as phylogene ic
ma ke : a la ge-scale me a-omics analysis o
plaque mic obio a in pe iodon al diseases
Alba Reguei a Iglesias
INTERNATIONAL PHD SCHOOL OF THE UNIVERSITY OF SANTIAGO DE COMPOSTELA
PHD PROGRAMME IN DENTAL SCIENCE
SANTIAGO DE COMPOSTELA
2022
DECLARACIÓNDELAUTOR/ADELATESIS
D./Dña.AlbaReguei aIglesias
Tí ulodela esis:Limi a ionso 16S RNAgeneasphylogene icma ke :ala ge‐scaleme a‐omics
analysiso plaquemic obio ainpe iodon aldiseases
P esen omi esis,siguiendoelp ocedimien oadecuadoalReglamen oydecla oque:
1) La esisaba calos esul adosdelaelabo acióndemi abajo.
2) Dese elcaso,enla esissehace e e enciaalascolabo acionesque u oes e abajo.
3) Con i moquela esisnoincu eenningún ipodeplagiodeo osau o esnide abajos
p esen adospo mípa alaob encióndeo os í ulos.
4) La esisesla e siónde ini i ap esen adapa asude ensaycoincidela e siónimp esaconla
p esen adaen o ma oelec ónico.
Ymecomp ome oap esen a elComp omisoDocumen aldeSupe isiónenelcasoqueelo iginalno
es édeposi adoenlaEscuela.
EnSan iagodeCompos ela,02de eb e ode2022.
Fi maelec ónica
AUTORIZACIÓN
DE LOS
DIRECTORES
DE LA TESIS
Limi a ions o 16S RNA gene as phylogene ic ma ke : a la ge-scale me a-omic
analysis o plaque mic obio a in pe iodon al diseases
Dª. Inmaculada Tomás Ca mona
D. Ja ie Tamames De la Hue a
D. Víc o Manuel A ce Vázquez
INFORMA/N:
Que la p esen e esis, se co esponde con el abajo ealizado po Dª. Alba Reguei a Iglesias, bajo
nues a di ección, y a
u o izamos
su
p esen ación
, conside ando
que eúne l os
equisi os
exigidos en el R
eglamen o
de Es udios de
Doc o ado de la USC,
y
que
como di ec o es de
es a
no incu e en las causas de
abs ención
es ablecidas
en la Ley
40/2015.
De acue do con lo indicado en el Reglamen o de Es udios de Doc o ado, decla amos ambién que
la p esen e esis doc o al es idónea pa a se de endida en base a la modalidad Monog á ica con
ep oducción de publicaciones, en los que la pa icipación de la doc o anda ue decisi a pa a su
elabo ación y las publicaciones se ajus an al Plan de In es igación.
En San iago de Compos ela, 2 de Feb e o de 2022
“No hing in li e is o be ea ed, i is only o be unde s ood. Now is he ime o unde s and
mo e, so ha we may ea less.”
Ma ie Cu ie
Acknowledgmen s
A mi u o a la D a. Inmaculada Tomás, po la dedicación, minuciosidad, y pasión pues as
en cada abajo ealizado, que han sido una uen e de inspi ación y mo i ación cons an es pa a
que e da lo mejo de mí. Pode con a con la capacidad y expe iencia de una in es igado a
excepcional, en un ámbi o de con ianza y abajo en equipo; ha sido un p i ilegio. Las
enseñanzas académicas y humanas ansmi idas a lo la go de es os años son incalculables.
G acias.
A mis di ec o es el D . Ja ie Tamames y el D . Víc o Manuel A ce, g andes
in es igado es, po su pa icipación en el desa ollo de es e abajo.
Al equipo de la D a. Ma ía José Ca e a, pe enecien e al Cen o de In es igación Singula
en Tecnologías In eligen es la Uni e sidad de San iago de Compos ela (CiTIUS);
especialmen e a Ca los Balsa y a La a Vázquez, po los conocimien os bioin o má icos y
es adís icos, y po el iempo apo ados pa a que es a Tesis haya salido adelan e.
A la D a. Ma a Rel as po la apo ación de mues as o ales, y a la D a. Manuela Alonso
po lle a a cabo los análisis de labo a o io ealizados en es a Tesis.
A odas mis compañe as de la Unidad de Pacien es con Necesidades Especiales coo dinada
po la D a. Tomás, po odos los momen os compa idos; y en especial, a T iana Blanco po su
labo en la selección de los pacien es y en la ecogida de mues as. Es un place o ma pa e
un equipo con pe sonas an ma a illosas.
A mi pila undamen al: mi amilia; a mis amigas, y a José, po habe me acompañado
du an e es e la go y, a eces complicado, camino. G acias po apoya me cuando decidí segui
es a u a y compa i conmigo la elicidad de cada pequeño paso hacia delan e. Pe o, sob e odo,
g acias po es a ahí pa a le an a me cuando el sende o se acomplejaba y el en usiasmo
desapa ecía, y po siemp e eco da me que puedo hace lo que me p oponga.
7
Resumo da Tese
“Limi acións do xene ARN 16S como ma cado iloxené ico: unha
análise me a-ómica a g an escala da mic obio a da placa nas
en e midades pe iodon ais”
INTRODUCIÓN
O e mo “en e midades pe iodon ais” e í ese a unha se ie de condición di e en es iniciadas
pola biopelícula den al que a ec an ós ecidos que odean e sopo an os den es (1). A xenxi i e
é unha in lamación localizada que non se es ende ó apa ello de unión pe iodon al e é e e síbel
educindo os ni eis de placa (2). Sen emba go, en indi iduos suscep íbeis, se non é a ada pode
p og esa a pe iodon i e, a cal se ca ac e iza pola des ución g adual do apa ello de unión do
den e (1). Es as pa oloxías xo den cando se pe de o equilib io en e a biopelícula mic obiana e
o sis ema inmune debido ben a unha disbiosis ou a unha eacción esaxe ada do hóspede ós
mic obios. Ademais, a ópanse en e as en e midades o ais máis p e alecen es e con maio es
consecuencias en odo o mundo (3), cunha p e alencia global da pe iodon i e se e a en 2015
do 7.4% (4). No mesmo ano, as es imacións pa a España e ela on que un 5% da poboación
adul a de en e 34 e 44 anos e un 10% en e 65 e 74, i e on bolsas pe iodon ais p o undas (≥6
mm) (5).
A pe iodon i e exe ce un e ec o nega i o sob e a calidade de ida das pe soas que a
padecen, especialmen e naquelas con pe iodon i e se e a, comp ome endo aspec os
elacionados an o coa unción como coa es é ica (6). Especi icamen e, se non se aplica ningún
a amen o, os esul ados poden le a á pe da de den es, un de e io o do endemen o
mas iga o io, un peo es ado nu icional, unha meno au oes ima e, incluso, pode e e ec os
nega i os sob e a saúde xe al (7). En elación con is o, dende hai anos obse ouse que unha
se ie de en e midades e a eccións sis émicas poden a ec a o apa ello de inse ción pe iodon al.
Na ac ualidade, unha g an can idade de in es igacións apoian es a elación bidi eccional en e
a pe iodon i e e as en e midades ca dio ascula es (8), a diabe es melli us (9), as a eccións
ALBA REGUEIRA IGLESIAS
8
espi a o ias (10), a a i e euma oide (11), a en e midade de Alzheime (12) e os esul ados
ad e sos do emba azo (13).
O inicio e p og eso da pe iodon i e es án elacionados con múl iples ac o es e iolóxicos e
ac o es de isco modi icables e non modi icables (7,14), sendo de especial impo ancia a
in e acción en e os mic oo ganismos locais e a espos a inmune do hóspede. Como
consecuencia, o desen ol emen o de en oques e apéu icos e ec i os equi e a iden i icación
dos p incipais mic obios e ma cado es do hóspede asociados á pe iodon i e.
Poñendo o oco sob e o compoñen e mic obiano, o noso coñecemen o da e ioloxía e
pa oxénese das en e midades pe iodon ais cambiou ó longo do empo g azas 1) á hipó ese de
que es as condicións es án causadas po biopelículas e non po mic obios nun es ado
planc ónico, 2) ó emp ego de concep os ecolóxicos pa a es uda a mic obio a o al (a poboación
de mic oo ganismos que coloniza unha pa e do copo) e, especialmen e, 3) ás mello as
ecnolóxicas nos mé odos emp egados pa a es uda os mic obios p esen es nas mos as o ais
(15).
XUSTIFICACIÓN E OBXECTIVOS
Os eno mes a ances p oducidos no campo da mic obioloxía nas úl imas décadas debido ó
desen ol emen o e implan ación das ecnoloxías de secuenciación de p óxima xe ación son
innegables (16). De xei o especí ico, a secuenciación do xene ARN ibosomal (ARN ) 16S,
conside ado po moi os como o ma cado iloxené ico de ini i o g azas p incipalmen e á súa
p esenza ubicua en bac e ias e a queas e á in e calación de zonas conse adas e a iábeis (17);
pe mi iu es uda as comunidades mic obianas complexas como a o al a p o undidades sen
p eceden es (18).
Non obs an e, os esul ados de in es igación poden e se a ec ados po múl iples on es de
posibles nesgos du an e cada paso do luxo de aballo da secuenciación do xene ARN 16S
(19-21). A selección do pa de cebado es é un deses pasos (19-21). Os cebado es cons úense
en base a secuencias de consenso, pe o poden p esen a disco dancias con algúns axons que
poden le a á sob e- ou in a ep esen ación dun g upo mic obiano conc e o (22). En
consecuencia, o uso dun cebado non ap opiado pode ía da como esul ado conclusións
Resumo da ese
9
biolóxicas cues ionables sob e o nicho a es uda (22). Sen emba go, non hai ningunha análise
sob e a cobe u a dos cebado es emp egados pa a de ec a os mic oo ganismos p oca io as que
habi an na boca humana, en endendo como cobe u a a po cen axe de coincidencias pa a un
de e minado g upo de secuencias/ ango axonómico.
Po ou o lado, algúns nesgos asociados co luxo de aballo da secuenciación son
limi acións inhe en es do p opio xene (23). De ei o, nun p imei o exemplo, a ios au o es
demos a on a exis encia de múl iples copias do xene ARN 16S nos xenomas p oca io as (24-
29), o que a ec a as es imanzas de abundancia baseadas en con as do xene de xei o que axons
cun meno núme o de xenes enden a se in aes imados e aqueles cun maio núme o son
sob ees imados (24,27). En segundo luga , as no e exións a iábeis do xene eñen di e en es
g aos de he e oxeneidade de secuencia (26,30). Ademais, algunhas especies di e en es pode
en amplicóns coinciden es (en inglés ma ching amplicons, MAs), de inidos como aqueles
cunha simili ude do 100% e o mesmo núme o de nucleó idos. Ou as especies, pola con a,
compa en secuencias al amen e simila es, incluso po iba do comunmen e emp egado limia
do 97% pa a cons uí unidades ope acionais axonómicas (ope a ional axonomic uni s, OTUs)
(27,31), o que signi ica que poden se ag upadas de o ma e ónea no mesmo OTU. Es e
ag upamen o a ec a á cons ución das áboas de OTUs e, po ex ensión, ás asignacións
axonómicas e ós esul ados de di e sidade. Con odo, a pesa das cues ións mencionadas
an e io men e, non se ealiza on in es igacións exhaus i as sob e a mello manei a de a alia
o núme o de xenes in axenómicos do ARN 16S nas bac e ias e a queas que ocupan a ca idade
o al, nin sob e o impac o que en o cebado elixido pa a as di e en es exións na de ección de
MAs ou de amplicóns moi simila es de axons dis in os. Ademais, segue sendo necesa io a alia
a cues ión de can os axons o ais di e en es e que especies o ais especí icas poden ag upa se
e oneamen e no mesmo OTU, en unción do cebado u ilizado.
A compa ación dos es udos do mic obioma pe iodon al baseados na secuenciación é
con o e ida polas signi ica i as di e enzas me odolóxicas en pasos ele an es den o do luxo
de aballo ípico. É amplamen e coñecido que cada ecnoloxía de secuenciación unciona de
xei o di e en e na elación en e a lonxi ude da lec u a, o endemen o da secuencia e a axa de
e o (21), sendo Illumina p e e ible a Roche 454 e Ion To en (19). Tamén, como
mencionamos an e io men e, as di e en es exións a iábeis e, en consecuencia, os amplicóns
ALBA REGUEIRA IGLESIAS
10
de i ados delas eñen dis in os g aos de he e oxeneidade de secuencia (26,30). En
consecuencia, pa ece cues ionable a compa ación das secuencias de mos as o ais ob idas
median e ecnoloxías de secuenciación e exións xené icas dis in as. Con odo, a a a da a
ningunha in es igación a aliou as secuencias ob idas en es udos sob e o mic obioma
pe iodon al p esen e en di e en es condicións de saúde, en pa icula as xe adas median e a
pla a o ma de al o endemen o Illumina e dis inguidas pola exión do xene ARN 16S máis
ampli icada.
Debido á al a de e idencia sob e as cues ións sinaladas an e io men e, es a Tese iña os
seguin es obxec i os:
1) Analiza in silico a cobe u a dos pa es de cebado es emp egados nos es udos baseados
na secuenciación da mic obio a o al; pa a iso u iliza anse dúas bases de da os especí icas pa a
a boca que con eñen secuencias do xene ARN 16S de especies bac e ianas e de a queas.
2) Analiza in silico o núme o de xenes ARN 16S nos xenomas comple os das especies
bac e ianas e de a queas que habi an na boca humana. Ademais, a alia como o uso de
di e en es pa es de cebado es di ixidos a exións dis in as a ec a á de ección de MAs de axons
di e en es, iden i icando así as especies o ais que eñen MAs.
3) Analiza in silico o endemen o de di e en es pa es de cebado es de dis in as exións
pa a iden i ica dis in as especies p oca io as o ais con alo es de simili ude do amplicón do
xene ARN 16S ≥97%, es ablecendo así as especies o ais que poden ag upa se e oneamen e
no mesmo OTU.
4) Analiza os pe ís da comunidade mic obiana na placa sup axinxi al e subxinxi al de
2045 doen es con di e en es condicións pe iodon ais (sans, xenxi i e, pe iodon i e e
pe iodon i e a ada) en elación coa di e sidade bac e iana, os pa óns de edes de co-
oco encia e os modelos p edi i os; sendo as secuencias u ilizadas da pla a o ma Illumina, cun
en oque na exión 3-4, e a adas co mesmo p o ocolo bioin o má ico.
Resumo da ese
11
OBXECTIVO 1. A aliación in silico e selección dos mello es cebado es do xene ARN 16S
pa a o seu uso na secuenciación de p óxima xe ación pa a de ec a bac e ias e a queas
o ais
1.1 MATERIAL E MÉTODOS
A a és da base de da os PubMed e u ilizando o so wa e es a ís ico R (32) e o paque e
RISmed (33), ealizá onse p ocu as au omá icas pa a elabo a unha lis axe de: 1) cebado es dos
xenes ARN 16S emp egados pa a de ec a e ampli ica bac e ias e a queas en mos as o ais
an es da secuenciación masi a; e 2) especies de a queas que habi an na boca humana. T as
aplica écnicas a anzadas de análise de ex o a ódolos esumos desca gados u ilizando o
paque e m de R (34), quedamos con 129 es udos sob e bac e ias e 16 sob e a queas que
implicaban o uso de polo menos un cebado di e en e do xene ARN 16S, e con 53 a igos que
con iñan in o mación sob e especies o ais de a queas.
Iden i icá onse un o al de 444 cebado es do xene ARN 16S: 204 di ec os ( o wa d, F),
230 e e sos ( e e se, R) e 12 non iden i icados (uniden i ied, UI). Deles, 278 ob i é onse das
p ocu as en PubMed e 166 ex aé onse do a igo de Klindwo h e al. (35). A ódolos cebado es
asignóuselles un iden i icado único baseado na súa p ocedencia -"OP" pa a os cebado es o ais
e "KP" pa a os de Klindwo h (35)- e a súa di ección (F, R ou UI), seguido dun núme o de es
díxi os. T ala compa ación das secuencias 5'-3' de ódolos cebado es, iden i icá onse 75 coas
mesmas secuencias; o que nos deixou con 369 cebado es do xene do ARN 16S di e en es. Po
ou a banda, ob i emos 177 nomes di e en es de especies de a queas o ais.
A base de da os de Escapa e al. (36), que inclúe 223.143 a ian es da secuencia do
amplicón (amplicon sequence a ian s, ASVs) das secuencias do xene ARN 16S, con én e os
de ano ación que an imposible calcula a posición co ec a dos cebado es den o de cada
secuencia en caso de coincidencia. Co obxec i o de mello ala, desen ol emos sc ip s en Py hon
(37) e Bash (38). P imei o, as secuencias do xene do ARN 16S das ASV do mesmo ni el
xe á quico sepa á onse en 769 a qui os as a di e en es. Despois, inse iuse un iden i icado de
especie a ódalas secuencias an es da xe a quía axonómica. As secuencias da mesma xe a quía
aliñá onse simul aneamen e u ilizando Clus al Omega (39) con a un conxun o de secuencias
do xene ARN 16S de Esche ichia coli. Tódolos ocos c eados po Clus al Omega (39) o on
eliminados, sal o os inse idos dende o inicio a a o p imei o nucleó ido de cada secuencia. Os
ALBA REGUEIRA IGLESIAS
12
a qui os as a aliñados combiná onse nun único a qui o pa a c ea unha base de da os de ASVs
comple amen e aliñadas, sendo a posición un o p imei o nucleó ido de E. coli J01859.1. Po
úl imo, eco á onse as secuencias aliñadas con bases nunha posición in e io á do p imei o
nucleó ido de J01859.1, e aquelas con nucleó idos po en iba da posición 2000.
A con inuación, na base de da os de nucleó idos non edundan es do Cen o Nacional de
In o mación Bio ecnolóxica (Na ional Cen e o Bio echnology In o ma ion, NCBI) (40),
p ocu amos os xenomas comple os das 177 especies de a queas o ais. A a és dun sc ip en
Py hon (37) e cos iden i icado es, puidemos desca ga 193 xenomas de Re Seq (41) e oi o de
GenBank (42). O sc ip comple ouse co módulo sea ch_16S.py (43), baseado no algo i mo de
Edga (44), que nos pe mi iu: de ec a e ex ae as secuencias do xene ARN 16S dos xenomas
comple os desca gados, elimina ódalas secuencias epe idas e almacena as a ian es
iden i icadas nun a qui o as a. O módulo e a in eg ación da e amen a "The En ez
P og amming U ili ies (E-u ili ies)" (45) en Biopy hon (46) pe mi iu ob e e asigna ácil e
au oma icamen e o ango axonómico comple o ós xenes. Ademais, buscá onse as secuencias
do xene do ARN 16S das especies sen iden i icado es xenómicos comple os (47-49).
Finalmen e, ódalas secuencias do xene ag upá onse nun único a qui o as a.
As secuencias nes e a qui o o on emp egadas pa a ace BLASTN (50,51) con a a base
de da os de nucleó idos non edundan es do NCBI (40). A con inuación, u ilizando unha
cobe u a de busca ≥98% e unha po cen axe de iden idade ≥99%, desca gá onse as secuencias
do xene ARN 16S e as exións aliñadas cos xenomas comple os; e ambos ipos de secuencias
o on a adas como ASVs. A base de da os de a queas o ais c eouse u ilizando ou o sc ip , e
con én 2842 ASVs. As secuencias da base de da os o on aliñadas e mello adas seguindo os
mesmos pasos que na base de bac e ias.
Pa a le a a cabo a análise in silico dos cebado es, de iní onse as cobe u as a ni el de
a ian e ( a ian co e age, VC): po cen axe de coincidencias dun cebado conc e o en elación
co o al de secuencias da base de da os; e a ni el de especie (species co e age, SC): po cen axe
de especies con coincidencias en polo menos unha das súas a ian es de secuencia cando se
u iliza un cebado conc e o. As coincidencias en e cebado es e secuencias das bases de da os
a aliá onse aplicando as exp esións egula es do módulo egex (52) de Py hon (37).
Resumo da ese
13
Os cebado es indi iduais cunha SC ≥75,00% o on escollidos e ódalas combinacións
posibles en e F e R o on iden i icadas. Es imouse a lonxi ude media en e es as dúas posicións
pa a clasi ica os pa es de cebado es nunha das es ca ego ías de lonxi ude media dos
amplicóns: 1) cu a (sho , S)= 100 a 300 pa es de bases (base pai s, bps); 2) media (medium,
M)= 301 a 600; e 3) longa (long, L)= >600. Tódolos pa es de cebado es ob idos o on a aliados
con espec o ás bases de da os de bac e ias e a queas, o que nos pe mi iu de e mina se e an
especí icos de dominio ou pa a ambos.
1.2 RESULTADOS
Un o al de 148 e 65 cebado es indi iduais i e on alo es de SC de bac e ias e a queas
≥75,00%, espec i amen e. T as aplica os c i e ios de o mación de pa es de cebado es, 3993
combinacións bac e ianas e 645 de a queas o on posibles. Delas, 156 es i e on epe idas pa a
ambos dominios, e o es o o on especí icas de dominio.
Pa es de cebado es especí icos de bac e ias
Na ca ego ía de lonxi ude S, 139 pa es iñan alo es de SC bac e iana ≥95,00% ( ango=
99,09% - 95,19%), men es que 33 amén iñan unha SC de a queas de 0,00%. Es es úl imos
ampli icaban as exións xénicas 3-4 ou 5-7 e i e on alo es de SC bac e iana que oscila on
en e o 97,92% e o 95,58%, o que signi icou que non se cub i on en e 16 e 34 especies de
bac e ias o ais. Pa a a maio ía deles, a lonxi ude media dos seus amplicóns oi de ó edo de
186 ( ango= 189 - 182). Des aca o pa OP_F009-OP_R030 da exión 5-7, cunha lonxi ude
media de 297 e un alo de SC bac e iano do 96,88%, polo que só 24 especies de bac e ias o ais
non o on cube as po es e pa .
Na ca ego ía de lonxi ude M, 68 pa es de cebado es iñan alo es de SC bac e iana
≥95,00% ( ango= 98,83% - 95,06%), dos cales 45 iñan unha SC de a queas de 0,00%. Os seus
alo es de SC bac e iana amén oscila on no ango an e io o que signi icou que en e no e e
38 especies non o on cube as. Ademais, es es pa es di ixíanse ás exións xénicas 3-5, 3-6 ou
4-7, e iñan lonxi udes de lec u a medias en e 566 e 454. Dos pa es coas maio es lonxi udes
medias de amplicón, os que p opo ciona on a mello cobe u a o on, po o de: KP_F051-
OP_R030; OP_F021-OP_R030; KP_F048-OP_R073; KP_F051-KP_R053; OP_F021-
KP_R053; e OP_F050-OP_R073 ( ango de SC bac e iana= 98,83% - 96,23%; ango de
ALBA REGUEIRA IGLESIAS
14
lonxi ude de lec u a media= 566 - 546). Es es ampli ica on as exións 3-6 ou 4-7 e non cub i on
en e no e e 29 especies de bac e ias.
Na ca ego ía de lonxi ude L, 20 pa es de iñan alo es de SC bac e iana ≥95,00% ( ango=
97,14% - 95,06%), e 17 amén iñan un alo de SC de a queas de 0,00%. Es es úl imos pa es
iñan o mesmo ango de SC bac e iano e deixaban en e 22 e 38 especies sen cub i . Todos eles
di ixíanse á exión xénica 3-7 e iñan unha lonxi ude media de lec u a de en e 772 e 732. Os
cebado es co mello equilib io en e a lonxi ude media de lec u a e a cobe u a o on KP_F048-
KP_R074 (SC bac e iana= 97,01%; lonxi ude media de lec u a= 767); e OP_F050-KP_R074
(96,36%; 766). Con odo, houbo opcións in e esan es con lonxi udes >1000 bps e alo es de
SC bac e iana ≥90,00% ( ango de SC bac e iana= 93,37% - 90,64%; ango de lonxi ude media
de lec u a= 1066 - 1059). Nes e sen ido, KP_F048-KP_R060, KP_F048-KP_R076 e KP_F048-
OP_R121 da exión 3-9 iñan lonxi udes de lec u a medias de 1061, 1060 e 1060,
espec i amen e, e alo es de SC bac e iana do 93,37%; deixando sen cub i 51 especies de
bac e ias o ais.
Pa es de cebado es especí icos de a queas
Na ca ego ía de lonxi ude S, 12 cebado es iñan alo es de SC de a queas ≥95,00% ( ango=
98,45% - 95,36%). Deles, oi o iñan alo es de SC bac e ianas do 0,00%: OP_F066-KP_R013;
KP_F059-KP_R013; KP_F016-KP_R002; KP_F018-KP_R003; OP_F066-KP_R006;
KP_F018-OP_R102; KP_F059-KP_R006; e KP_F018-KP_R002. A súa SC de a queas oscilou
en e o 95,88% e o 95,36%, i e on lonxi udes de lec u a medias de 275 a 144, ampli ica on as
exións xénicas 3 ou 5-6 e, po úl imo, non cub i on en e oi o e no e especies de a queas o ais.
Dezano e pa es de cebado es na ca ego ía de lonxi ude M iñan alo es de SC de a queas
≥95,00% ( ango= 97,42% - 95,36%). En e eles, no e iñan amén un alo de SC bac e iana
do 0,00%: KP_F018-KP_R031; KP_F018-KP_R032; KP_F018-KP_R035; KP_F018-
OP_R020; KP_F018-OP_R070; KP_F020-KP_R006; KP_F020-KP_R013; KP_F016-
KP_R032; e OP_F114-KP_R006. Es es ampli icaban as exións 3-5 ou 3-6 e i e on unha
lonxi ude media de amplicón de 551 a 414. Os pa es cub i on en e 95,88% e 95,36% das
especies de a queas, deixando en e oi o e no e sen cub i .
Resumo da ese
15
Só un pa de cebado es na ca ego ía de >600 bps iña un alo SC ≥95,00% na base de
da os de a queas: OP_F114-KP_R013; o cal amén iña un alo de SC bac e iana do 0,00%.
Es e pa ampli icaba a exión 3-6, i o unha lonxi ude media de 679 e non de ec ou oi o especies
de a queas. Vin e e se e pa es de cebado es iñan unha SC de a queas ≥90,00%, unha SC
bac e iana de 0,00% e unha lonxi ude media >679, e 10 dos cales e an supe io es a 1100 ( ango
de lonxi ude media= 1131 - 681). Deles, o mello equilib io en e a cobe u a e a lonxi ude
media do amplicón a opouse en: KP_F016-KP_R066; KP_F016-KP_R063; KP_F018-
KP_R066; e KP_F018-KP_R063. A SC de a queas oi do 92,78% pa a os dous p imei os pa es
e do 93,81% pa a os dous segundos, deixando 14 ou 12 especies, espec i amen e, sen cub i .
Todos es es di ixíanse á exión 3-9 e iñan, po o de, lonxi udes medias de amplicón de 1129,
1128, 1119 e 1118.
Pa es de cebado es de bac e ias e a queas
Dez pa es da ca ego ía S iñan alo es de SC bac e iana e de a queas ≥95,00% ( ango=
95,97% - 95,32%; e 99,48% - 97,94%, espec i amen e). A súa lonxi ude media oscilou en e
288 e 284 e odos ampli ica on a exión 4-5: KP_F020-KP_R031; KP_F020-OP_R070;
KP_F020-KP_R032; KP_F020-KP_R035; KP_F020-OP_R020; KP_F020-KP_R038;
KP_F020-OP_R010; KP_F020-OP_R014; KP_F020-OP_R036; e KP_F020-OP_R048. O
núme o de especies bac e ianas e de a queas non cube as po es es pa es oscilou en e 31 e 36;
e en e unha e ca o, espec i amen e.
Na ca ego ía M, dous cebado es iñan alo es de SC bac e iana e de a queas ≥95,00%:
OP_F114-OP_R070 (SC bac e iana= 95,58%; SC de a quea= 98,45%); e OP_F114-KP_R031
(95,71%; 98,45%). Ambos ampli ica on a exión 3-5 e i e on lonxi udes medias de 460 e 457,
espec i amen e. Non cub i on 33 (OP_F114-KP_R031) ou 34 (OP_F114-OP_R070) especies
bac e ianas e es de a queas. Ó baixa o co e a SC ≥90,00%, a opamos seis pa es cunha
secuencia media máis longa. En e eles des acou OP_F114-OP_R073, cunha lonxi ude media
de 549, di ixíase á exión xénica 3-6 e p esen aba uns alo es de SC de bac e ias e a queas do
94,80% e o 93,30%, espec i amen e. Non cub iu 40 especies de bac e ias e 13 de a queas.
Ningún pa de cebado es da ca ego ía L i o alo es SC ≥95,00% en ningunha das bases
de da os. Pola con a, 28 iñan SC bac e ianas e de a queas ≥90,00% ( ango= 94,54% - 90,64%;
e 96,91% - 96,39%, espec i amen e). Es es ampli ica on as exións 3-9, 4-9 ou 5-9, iñan
ALBA REGUEIRA IGLESIAS
16
lonxi udes medias en e 622 e 1063, e non cub ían de 42 a 72 especies bac e ianas e de seis a
se e de a queas. A combinación de OP_F066 con KP_R060, KP_R076 e OP_R121 p oduciu os
alo es de cobe u a máis al os, e odos eles di ixí onse á exión 5-9. Es es cebado es non
cub i on 42 especies de bac e ias e 6 de a queas. Con odo, as súas lonxi udes medias o on
623, 622 e 622, espec i amen e. Os pa es de cebado es o mados po OP_F114 con KP_R060,
KP_R076 ou OP_R121, da exión 3-9, p esen aban un mello equilib io en e os esul ados de
cobe u a (SC bac e iana= 91,42%, SC de a queas= 96,91%) e as lonxi udes medias das
secuencias (1063, 1062 e 1062). Sesen a e seis bac e ias e seis a queas non o on de ec adas.
1.3 CONCLUSIÓNS
Tendo en con a as es ca ego ías de lonxi ude media do amplicón, os pa es de cebado es
coa mello cobe u a es imada pa a de ec a as bac e ias o ais di ixí onse ás exións 3-4, 4-7 e
3-7, e o on: KP_F048-OP_R043 (posición do pa de cebado es pa a E. coli J01859.1: 342-
529), KP_F051-OP_R030 (514-1079) e KP_F048-OP_R030 (342-1079). Pa a a de ección de
a queas o ais, os pa es con mello cobe u a ampli ica on as exións 5-6, 3-6 e 3-6, e o on:
OP_F066-KP_R013 (784-inde inido), KP_F020-KP_R013 (518-inde inido) e OP_F114-
KP_R013 (340-inde inido). Os pa es coa mello cobe u a dos dominios de bac e ias e a queas
conxun amen e a opá onse nas exións 4-5, 3-5 e 5-9, e o on: KP_F020-KP_R032 (518-801),
OP_F114-KP_R031 (340-801) e OP_F066-OP_R121 (784-1405). Os pa es de cebado es coa
mello cobe u a iden i icados nes e es udo non se a opan en e os máis emp egados na
li e a u a sob e o mic obioma o al.
Resumo da ese
23
Nos a qui os as a, ódalas secuencias incluían un iden i icado de especie (SPn) e un
iden i icado de a ian e (Vn) na súa cabecei a e, amén, a cabecei a de cada secuencia incluía
a xe a quía axonómica a a o ni el da a ian e den o de cada especie. Finalmen e ob i é onse
os amplicóns in silico de 186 especies de bac e ias o ais e 135 de a queas.
Po ou o lado, desen ol euse un sc ip co w appe Ncbiblas nCommandline de Biopy hon
(46) pa a manexa BLAST+ 2.11 (57) en modo local dende Biopy hon. Is o pe mi iu ans e i
acilmen e os da os ob idos nos aliñamen os pa a a súa pos e io análise en Py hon (37). Os
pa áme os de aliñación con igu á onse pa a que osen os mesmos que os p ede e minados en
MegaBLAST (58). Tódalas secuencias pe encen es ó mesmo a qui o as a pa a o mesmo pa
de cebado es aliñá onse en e si; pa a iso, cada a qui o as a inse iuse como suxei o e consul a
en BLASTN (51) pa a ob e a po cen axe de simili ude en e amplicóns in silico pe encen es
a di e en es especies o ais.
Dos esul ados ob idos, seleccioná onse os amplicóns in silico cunha cobe u a de aliñación
do 100% das secuencias de consul a e cun alo de simili ude ≥97%. Dos aliñamen os ob idos,
desca á onse os seguin es po non se de in e ese: 1) amplicóns in silico co mesmo
iden i icado único (SPn + Vn); 2) amplicóns in silico co mesmo iden i icado de especie; e 3)
aliñacións duplicadas.
Se dúas especies di e en es iñan máis dun alo de simili ude de amplicón in silico ≥97%
(amplicon simila i y alue ≥97%, ASI97) en e elas, elixíase un ó aza . Os esul ados dos pa es
de especies al amen e simila es almacená onse emp egando os módulos de Py hon (37) pandas
(56) e xlsxw i e (59) .
A con inuación, c eouse unha ma iz de simili ude pa a cada pa de cebado es. Median e
un sc ip en R (32) calculamos pa a cada pa de cebado es 1) o núme o de especies con polo
menos un ASI97 con ou as especies; 2) o núme o o al de ASI97 en e especies di e en es; 3)
o núme o medio e máximo de ASI97 po especie.
Tamén se es imou pa a cada pa de cebado es a po cen axe de especies de ec adas (SC) e
a po cen axe de especies de ec adas sen ASI97 (species co e age wi h no ASI97, SC-NASI97).
ALBA REGUEIRA IGLESIAS
24
Es e úl imo pa áme o emp egouse como c i e io pa a selecciona aqueles cebado es asociados
a un meno núme o de especies o ais que puidesen es a ag upadas de o ma e ónea.
Po úl imo, desc ibí onse os pa es de especies que mos aban un ASI97 e a aliouse se
pe encían a xéne os ou angos axonómicos supe io es di e en es.
3.2 RESULTADOS
Os pa es de cebado es di ixidos ás bac e ias ob i e on unha media de 91,88 (49,40%)
especies bac e ianas cun ASI97 e unha media de 153,46 ASI97 con especies dis in as. No caso
dos di ixidos a a queas, es as ci as o on de 65,60 (48,59%) e 162,26, espec i amen e. Se se
exclúen os cebado es máis u ilizados na li e a u a sob e o mic obioma o al, os de lonxi udes de
amplicón cu as (a di e enza das po cen axes de SC) i e on os alo es máis baixos de SC-
NASI97 an o pa a as bac e ias (S= 39,54%) como pa a a queas (S= 40,44%) en compa ación
cos cebado es de lonxi ude media e longa (M= 45,82% e 46,35%, espec i amen e; L= 48,39%
e 44,32%, espec i amen e).
Polo que espec a ós pa es de cebado es especí icos pa a bac e ias, o núme o de especies
bac e ianas cun ASI97 e o núme o o al de ASI97 oscilou en e 37 e 32 cun dos cebado es máis
u ilizados, KP_F031-KP_R021 (M; SC-NASI97= 54,30%), e 120 e 277 con OP_F066-
KP_R040 (S; SC-NASI97= 24,19%), espec i amen e. Es e úl imo cebado amén i o o alo
SC-NASI97 máis baixo, men es que OP_F053-KP_R020 de ec ou o maio núme o de especies
sen ASI97 (M; SC-NASI97= 65,05%). Ademais, excep o OP_F053-KP_R020, ódolos
cebado es especí icos de bac e ias iñan un núme o máximo de ASI97/especies supe io a cinco
( ango= 15 - 4 ASI97/especies).
En can o ós pa es de cebado es especí icos pa a a queas, o núme o de especies de a queas
cun ASI97 e o núme o o al de ASI97 oscilou en e 24 e 96 co amplamen e u ilizado KP_F014-
KP_R011 (L; SC- NASI97= 12,59%) e 89 e 240 con OP_F066-KP_R013 (S; SC-NASI97=
29,63%), espec i amen e. O p imei o cebado de ec ou o meno núme o de especies sen
ASI97, e KP_F018-KP_R002 o maio (S; SC- NASI97= 51,11%). Ademais, ódolos cebado es
especí icos pa a a queas iñan un núme o máximo de ASI97/especie ≥10 ( ango= 13 - 10
ASI97/especie).
Resumo da ese
25
Emp egando os pa es de cebado es pa a bac e ias e a queas, o núme o de especies
bac e ianas e de a queas cun ASI97 e o núme o o al de ASI97 oscilou en e 84 e 60 e 118 e
126, espec i amen e, con OP_F114-KP_R002 (S; SC-NASI≥97= 47. 31% pa a bac e ias e
54,81% pa a a queas) a 124 e 95 e 239 e 286, espec i amen e, con OP_F066-OP_R073 (S;
SC-NASI≥97= 31,18% pa a bac e ias e 22,96% pa a a queas). Es e úl imo cebado amén
de ec ou o meno núme o de especies sen ASI97 e OP_F114-KP_R031 o maio (M; SC-
NASI97= 51,08% pa a bac e ias e 53,33% pa a a queas). A maio ía das combinacións de
cebado es de bac e ias e a queas iñan un núme o máximo de ASI97/especies ≥10 ( ango= 14
- 9 ASI/especies e 14 - 11 ASI/especies pa a ámbolos dous dominios, espec i amen e).
Dou a banda, 149 (80,11%) das especies de bac e ias o ais e 108 (80,00%) das especies
de a queas o ais a aliadas iñan un ASI97 con polo menos unha especie dis in a. En e elas
des acan pola súa ele ancia na ca idade o al as bac e ias: Campylobac e concisus,
Campylobac e cu us, Ro hia den oca iosa, S ep ococcus mi is, S ep ococcus mu ans,
S ep ococcus o alis, e Tanne ella o sy hia; e as a queas: Halo i ax ube , Me hanosalsum
zhiliniae, Me hanosa cina ba ke i, Me hanosa cina mazei, e Me hanosa cina acuola a; en e
ou as. Ademais, houbo 30 especies bac e ianas e 27 de a queas que puide on ag upa se cun
máximo de ≥10 especies di e en es cando se emp ega on ódolos pa es de cebado es analizados.
A maio ía des as pe encían ós xéne os bac e ianos: S ep ococcus and S aphylococcus; e de
a queas: Me hanosa cina, The mocococcus, and Py ococcus. Pola con a, 37 (19,89%)
especies bac e ianas e 27 (20,00%) de a queas non iñan ASI≥97% con ou os axons o ais.
Tódolos p ime s di ixidos a bac e ias pe mi í onnos de ec a 4450 elacións dous a dous
en e 408 pa es de especies bac e ianas di e en es cun ASI97. Dezaoi o des es pa es de especies
o on ob idos cos 29 pa es de cebado es a aliados ( ecuencia= 29; núme o de eces que un pa
de axons eñen un ASI97 nos di e en es pa es de cebado es), e pe encían ós xéne os
Ac inomyces, Lac obacillus, Neisse ia, S aphylococcus, e S ep ococcus. Sen emba go, 50
pa es de especies con ASI97 só se de ec a on cun p ime ( ecuencia= 1). Aínda que as elacións
dous a dous implicaban maio i a iamen e a especies dos mesmos xéne os (3641; 81,82%), 809
elacións (18,18%) es aban cons i uídas po axons de xéne os di e en es. A combinación de
especies de Klebsiella con ou as de C onobac e oi a máis ecuen e ( ecuencia= 99), seguida
de Klebsiella-Se a ia, Esche ichia-Klebsiella, C onobac e -Esche ichia e Agg ega ibac e -
ALBA REGUEIRA IGLESIAS
26
Haemophilus ( ecuencias= 67 - 28). En can o ós angos axonómicos supe io es, 293 (6,58%)
elacións dé onse en e pa es de especies cun ASI97 pe encen es a amilias dis in as e mesmo
houbo 26 (0,58%) elacións en e pa es de especies cun ASI97 de o des dis in as.
Os cebado es di ixidos a a queas pe mi i on de ec a 3232 elacións dous a dous en e 340
pa es de especies de a queas di e en es cun ASI97. Tódolos pa es de cebado es analizados
iden i ica on se e pa es de especies ( ecuencia= 20), que pe encían ós xéne os
Me hanob e ibac e e Me hanocaldococcus. Houbo 66 pa es de especies de ec adas unha soa
ez po un só pa de cebado es ( ecuencia= 1). Unha ez máis, a maio ía das elacións de dous
a dous o on en e especies a queas do mesmo xéne o (2359, 72,99%), pe o 873 (27,01%)
elacións implicaban pa es de axons cun ASI97 de xéne os dis in os. A combinación de
especies de Py ococcus e The mococcus oi a máis ecuen e ( ecuencia= 428), seguida de
Palaeococcus e The mococcus ( ecuencia= 109). Pa a os angos axonómicos supe io es, 35
(1,08%) elacións e an pa es de especies cun ASI97 de amilias dis in as, es (0,09%) de o des,
e unha de clases (0,03%) dis in as.
3.3 CONCLUSIÓNS
Os pa es de cebado es a aliados di ixidos a bac e ias e/ou a quexas de ec a on unha media
de máis de 150 OTU po enciais que pode ían con e especies di e en es, cando se u ilizou o
limia de simili ude do ≥97%. Segundo o pa áme o SC-NASI97, os mello es pa es de
cebado es o on OP_F053-KP_R020 pa a bac e ias ( exión 1-3; posición pa a E. coli J01859.1:
9-356); KP_F018-KP_R002 pa a a queas (4; inde inido-532); e OP_F114-KP_R031 pa a
ambas (3-5; 340-801).
Ó edo do 80% das especies de bac e ias e a queas o ais analizadas iñan un ASI97 con
polo menos ou a especie dis in a. Es as especies al amen e simila es desempeñan dis in as
uncións na mic obio a o al e pe encen a xéne os bac e ianos como Campylobac e , Ro hia,
S ep ococcus e Tanne ella, e a xéne os de a queas como Halo i ax, Me hanosalsum e
Me hanosa cina. Ademais, o 20% e o 30% das elacións de simili ude dous a dous
es ablecé onse en e especies de di e en es xéne os bac e ianos e de a queas, espec i amen e.
Mesmo axons de amilias, o des e clases dis in as puide on ag upa se no mesmo OTU
po encial.
Resumo da ese
27
Independen emen e do pa de cebado es emp egado, a ag upación de secuencias cunha
simili ude ≥97% p opo ciona unha desc ición inexac a das especies o ais bac e ianas e de
a queas, o que pode a ec a en g an medida ós pa áme os de di e sidade mic obiana. Como
esul ado, a ag upación de OTUs condiciona a c edibilidade das asociacións en e algunhas
especies o ais e ce as condicións de saúde e en e midade. Is o limi a de xei o signi ica i o a
compa a i a dos esul ados da di e sidade mic obiana epo ados na li e a u a do mic obioma
o al.
ALBA REGUEIRA IGLESIAS
28
OBXECTIVO 4. Unha análise me a-ómica a g an escala da mic obio a da placa nas
en e midades pe iodon ais
4.1 MATERIAL E MÉTODOS
Un o al de 120 pa icipan es: 55 pe iodon almen e sans e 65 a ec ados po pe iodon i e
non a ada; que cump ían os c i e ios de inclusión p ees ablecidos o on ec u ados. Os
diagnós icos pe iodon ais o on ealizados po dous den is as expe imen ados. A p esenza de
saúde pe iodon al ou de pe iodon i e c ónica xene alizada de mode ada a g a e es ableceuse
segundo in o mación clínica e adiog á ica, aplicando c i e ios p e iamen e publicados (60,61).
Unha ou dúas semanas despois do exame inicial, ecollé onse mos as de placa subxinxi al de
ódolos pa icipan es.
O ADN o al das mos as oi ex aído e illado pa a a alia a súa calidade e concen ación.
Nes e pun o, excluí onse dúas mos as subxinxi ales do g upo san po non cump i os equisi os
de calidade e concen ación. A con inuación, ealizouse unha ampli icación po eacción en
cadea da polime asa (PCR) da exión 3-4 do xene ARN 16S (62) A secuenciación le ouse a
cabo na pla a o ma Illumina MiSeq con lec u as de 2x300 bps. As secuencias ob idas
deposi á onse no a qui o de lec u as de secuencias (sequence ead a chi e, SRA) (63) co
núme o de acceso PRJNA773202.
Dou a banda, amén se incluí on na nosa in es igación es udos p e ios sob e a di e sidade
mic obiana na placa sup axinxi al e subxinxi al en indi iduos adul os con di e en es
condicións pe iodon ais. Inco po á onse ódolos es udos que emp ega on cebado es da exión
3-4, a ecnoloxía de secuenciación Illumina, e iñan acceso ao eposi o io das secuencias. O
es ánda de e e encia pa a o diagnós ico dunha a ección pe iodon al podía basea se unicamen e
en pa áme os clínicos ou clínicos e adiog á icos, independen emen e dos c i e ios de
e e encia diagnós icos aplicados; pe o iña que se epo ado. Ademais, seleccioná onse
aquelas in es igacións nas que os me ada os de in e ese po mos a es aban co ec amen e
asignados no eposi o io; e pa a os que as secuencias almacenadas cump ían c i e ios adicionais
de inclusión e exclusión.
En xullo de 2021 ealizá onse 120 buscas en cada unha das bases de da os elec ónicas
PubMed, Scopus e Embase pa a iden i ica es udos de secuenciación median e Illumina sob e
Resumo da ese
29
o mic obioma pe iodon al u ilizando dous conxun os de e mos elacionados con: 1) condicións
de saúde pe iodon al, nichos o ais e mic obio a; e 2) a ecnoloxía de secuenciación do xene
ARN 16S. Realizá onse p ocu as adicionais na base de da os SRA (63) pa a ga an i que
examina amos ódolos posibles biop oxec os de in e ese.
A manipulación dos da os iden i icados nas p ocu as ealizouse u ilizando o so wa e R
(32), e os esul ados de cada unha almacená onse indi idualmen e nun a qui o x . (PubMed)
ou cs . (Scopus e Embase). Os duplicados o on de ec ados e eliminados. A con inuación, os
esumos analizá onse de xei o compu acional median e se e conxun os de e mos posi i os
u ilizando os paque es m e a amen o da linguaxe na u al (na u al language p ocessing, NLP)
(34,64) e cada un ecibiu 100 ou un pun o po cada e mo p esen e. As publicacións con
pun uacións p ede inidas seleccioná onse pa a as pos e io es a aliacións manuais dos seus
esumos e ex o comple o. O p oceso au oma izado de ex acción de da os alidouse
p e iamen e nunha se ie limi ada de a igos que cump ían os c i e ios de inclusión.
Os iden i icado es dos biop oxec os dos a igos seleccionados emp egá onse pa a accede
á base de da os do SRA (63) e ó selec o de execucións “SRA un selec o ”
(h ps://www.ncbi.nlm.nih.go / aces/s udy/). En ón, desca gá onse e a aliá onse as áboas de
me ada os alí deposi adas. Os au o es o on con ac ados nos casos necesa ios pa a ob e os
me ada os ou con ins de acla ación. Nes e pun o, o noso biop oxec o, PRJNA773202,
engadiuse ó o al.
Coa in o mación da base de da os SRA (63) cons uíuse manualmen e unha áboa de
me ada os pa a cada un dos biop oxec os, que incluía in o mación sob e aspec os elacionados
an o co biop oxec o como coas a iables demog á icas e clínicas dos doen es ós que pe encía
cada mos a.
En elación coas secuencias almacenadas, pa a cada biop oxec o desca gouse a lis a de
iden i icado es (lis as de acceso) co esponden e ás mos as de in e ese en o ma o x . Pa a
desca ga e almacena as secuencias coas mencionadas lis as de acceso, ins alouse o so wa e
g a uí o SRA Toolki (65) en modo local. A con inuación desen ol euse un sc ip en Bash (38)
en combinación cos comandos p e e ch e as q-dump do SRA Toolki . As mos as de placas de
ALBA REGUEIRA IGLESIAS
30
cada biop oxec o almacená onse en a qui os as q indi iduais pa a a súa pos e io
manipulación.
O p ep ocesamen o e a a aliación da calidade das secuencias de cada a qui o as q
ealizá onse con USEARCH (66). As secuencias o on aliñadas e ensambladas, acep ándose un
máximo de cinco desaxus es e unha po cen axe mínima de simili ude do 90% pa a os 2x250
bps, e 10 bps e o 80% pa a os 2x300 bps. Pe mi í onse un máximo de dous desaxus es na
secuencia de cada cebado indi idual e ca o nun pa . Po úl imo, desca á onse as secuencias
cun e o máximo espe ado >1 ou cunha lonxi ude mínima <300 bps.
Tódolos a qui os as a dun de e minado biop oxec o usioná onse usando Bash (38). Is o,
mais un sc ip desen ol ido en R (32), pe mi iunos c ea un a qui o de g upo pa a cada
biop oxec o. Execu á onse os comandos sc een. seqs e unique. seqs de mo hu (67) pa a ob e
o a qui o de nomes de cada biop oxec o. A con inuación, ódolos a qui os as a de ódolos
biop oxec os usioná onse nun único a qui o, xun o cos a qui os "g upos" e "nomes" pa a
o ma os a qui os “me a-omics”.
A con inuación, ealizouse un il ado de baixa abundancia, no que se elimina on as
secuencias das mos as globais con alo es de abundancia <500 econ os. Aplicouse o pipeline
de mo hu (67) pa a ASVs con lixei as modi icacións, incluíndo a aplicación da base de da os
especí ica o al pa a a clasi icación axonómica de ASVs desc i a po Escapa e al. (36).
Pe mi í onse as secuencias cunha lonxi ude >400; e eliminá onse as que iñan máis de oi o
homopolíme os, as que se conside a on quime as as aplica o algo i mo VSEARCH de mo hu
(67,68) e as clasi icadas como axons descoñecidos no ni el xe á quico máis al o. As secuencias
non se ag upa on en ningún ni el xa que o noso obxec i o e a iden i ica e clasi ica o maio
núme o posible de secuencias no ni el ASV.
Unha ez comple ado o pipeline de mo hu (67), expo á onse os seguin es a qui os me a-
ómicos a R-bioconduc o (69) pa a a súa pos e io análise: a áboa de econ o, a xe a quía
axonómica a ni el ASV, a á bo e iloxené ica e a áboa de me ada os.
Resumo da ese
31
Ademais, dous au o es a alia on de xei o independen e a calidade dos me ada os dos
biop oxec os incluídos na nosa in es igación emp egando unha lis a de comp obación que
deseñamos pa a es e in, a cal con iña 19 a iables elacionadas cos da os dispoñibles sob e os
suxei os da mos a. Segundo a pun uación ob ida, os biop oxec os clasi icá onse como: baixa
calidade= 0,00 - 0,33; calidade media= 0,34 - 0,66; e al a calidade= 0,67 - 1,00.
Tamén se a aliou o núme o de mos as po biop oxec o e o núme o medio de secuencias
po mos a en cada p oxec o como pa áme o de calidade. O núme o medio de secuencias
di idiuse po 10.000 e es e pa áme o denominouse pun uación media da secuencia (a e age
sequence sco e, ASS). Os alo es de ASS in e p e á onse como ep esen a i os de 1) <0,25,
secuencias de moi baixa can idade; 2) 0,25 - 0,75, - secuencias de baixa can idade; 3) 0,75 - 1,0
- secuencias de can idade acep able; 4) 1,0 - 2,0 - secuencias de al a can idade; e 5) >2,0 -
secuencias de moi al a can idade.
Po úl imo, a análise es a ís ica dos da os de secuenciación do ARN 16S a ni el ASV
ealizouse segundo o p o ocolo p opos o po McMu die e Holmes (70), u ilizando
implemen acións en R que incluían os paque es phyloseq, DESeq2 e mic obiome (71-73).
Pa a elimina as mos as cun baixo núme o de secuencias, excluí onse aquelas con menos
de 2500 (n= 62), polo que queda on 2124 mos as. A con inuación, c eá onse g upos segundo
o ipo de placa den al e o es ado de saúde pe iodon al dos pa icipan es, ob éndose un o al de
11 g upos (o denados al abe icamen e):
1) Placa sup axinxi al, saúde pe iodon al, si ios sans (Sup_x0HHx; n= 210).
2) Placa sup axinxi al, xenxi i e, si ios en e mos (Sup_x0GDx; n= 79).
3) Placa sup axinxi al, pe iodon i e, si ios en e mos (Sup_x0PDx; n= 493).
4) Placa sup axinxi al, pe iodon i e, si ios en e mos a ados (Sup_x1PDx; n= 81).
5) Placa subxinxi al, saúde pe iodon al, si ios sans (Sub_x0HHx; n= 155).
6) Placa subxinxi al, xenxi i e, si ios en e mos (Sub_x0GDx; n= 20).
7) Placa subxinxi al, pe iodon i e, si ios sans (Sub_x0PHx; n= 62).
8) Placa subxinxi al, pe iodon i e, zonas en e mas (Sub_x0PDx; n= 768).
9) Placa subxinxi al, pe iodon i e, si ios en e mos a ados (Sub_x1PDx; n= 197).
ALBA REGUEIRA IGLESIAS
32
10) Placa submucosa, pe i-implan i e, si ios sans (Imp_x0IHx; n= 18).
11) Placa submucosa, pe i-implan i e, si ios en e mos ( Imp_x0IDx; n= 41).
Os g upos Sub_x0GDx, Imp_x0IHx e Imp_x0IDx eliminá onse debido ó seu baixo amaño
de mos a (n= <50), deixando un o al de 2045 mos as pa a analiza .
A elación en e as di e en es condicións de saúde pe iodon al e a mic obio a da placa
in es igouse dende a ias pe spec i as. En p imei o luga , u ilizá onse os paque es phyloseq e
mic obiome pa a ob e os da os de di e sidade al a (71,73). Como indicado es da iqueza de
axons, calculá onse o econ o absolu o de ASVs e o índice de cobe u a do 95%.
De e miná onse os índices de Shannon e Pielou como indicado es de di e sidade e
uni o midade (74,75). U ilizouse a U de Mann-Whi ney pa a as análises compa a i as.
Segundo, emp egouse unha análise de compoñen es p incipais (p incipal componen
analysis, PCA) pa a isualiza a ag upación das mos as de placas en elación co seu es ado de
saúde. O paque e mixOmics (76) emp egouse pa a ob e os g á icos de dispe sión das dúas
compoñen es p incipais baseadas na abundancia ela i a das ASVs, amosando os cen oides de
cada g upo clínico e as elipses que ep esen an o in e alo de con ianza do 96%. U ilizouse
unha análise non pa amé ica mul i a ian e pe mu ada da a ianza (pe mu a ional mul i a ia e
analysis o a iance, PERMANOVA) (77) pa a medi as di e enzas a ni el de comunidade en e
os g upos. Es as análises ealizá onse co paque e egan (78).
Te cei o, u ilizouse o paque e mic obiome (73) pa a iden i ica as ASVs cen ais ou do
núcleo p esen es cunha axa de p e alencia de ≥75% en cada ipo de placa e cada condición
pe iodon al.
En cua o luga , u ilizouse o paque e DESeq2 (72) pa a iden i ica as ASV cos cambios
máis signi ica i os na abundancia di e encial pa a as dis in as condicións pe iodon ais. As
abundancias di e enciais medí onse co alo log2 oldchange (log2 FC), e as di e en es
condicións compa á onse u ilizando a p oba de Wald coa co ección de Benjamini-Hochbe g.
As medidas o on es a is icamen e signi ica i as se o p axus ado e a <0,01.
Resumo da ese
39
En can o ás p edi o as da en e midade, cen ándonos nos alo es de abundancia ela i a
obse ados en Sub_x0PDx, as ASVs máis ele an es o on Pep os ep ococcaceae [XI][G-5]
saphenum ASV129, Dialis e pneumosin es ASV194, Desul obulbus HMT041 ASV149 e
Mogibac e ium imidum ASV640. A p imei a ASV amén p edixo si ios a ados e sans na
pe iodon i e ó compa a ambos modelos coa saúde pe iodon al, men es que a segundo e a
e cei a amén p edixe on a pe iodon i e a ada.
Dos esul ados de i ados dos modelos p edi i os sob e a placa subxinxi al, F. nuclea um
subsp. icen ii oi a p incipal especie que mos ou un endemen o p edi i o opos o. A ASV do
núcleo e al amen e abundan e ASV10 oi unha o e p edi o a da pe iodon i e de ec ado en
a ios modelos. Con odo, houbo ou as ASVs menos abundan es que p edixe on
simul aneamen e an o a saúde como a pe iodon i e.
En can o ás ASVs p edi o as da saúde na placa “sup a” e “sub”, des acan pola súa
abundancia as seguin es: R. den oca iosa ASV2, Haemophilus pa ain luenzae ASV3, ASV78,
ASV45, e ASV46, Kingella o alis ASV66, S ep ococcus es ibula is ASV27 e Ac inomyces
HMT170 ASV119. Algunhas des as ASVs amén se compo a on como o es disc iminan es
de si ios sans na pe iodon i e.
En can o ás p edi o as da pe iodon i e en ambas placas, a ibúese especial a ención polos
seus alo es de abundancia a: T. o sy hia ASV15, Fili ac o alocis ASV19, T eponema
den icola ASV38 e ASV150, F e ibac e ium as idiosum ASV97, Pep os ep ococcaceae
[XI][G-4] HMT369 ASV124, S ep ococcus anginosus ASV142, e Pep os ep ococcaceae
[XI][G-6] noda um ASV189. Tamén, F. as idiosum ASV97 e S. anginosus ASV142 o on
p edi o as de xenxi i e na placa sup axinxi al. Todos es es axons p edixe on a pe iodon i e
a ada na placa subxinxi al, e T. o sy hia ASV15 mesmo na sup axinxi al.
As ASVs dos xéne os Allop e o ella, Fusobac e ium, Gemella, G anulica ella,
Lachnoanae obaculum e Ruminococcaceae [G-1] disc imina on di e en es condicións clínicas
en e ambas placas, eme xendo como p edi o as da xenxi i e na placa sup axinxi al e da saúde
na subxinxi al. Exemplos dis o o on: Fusobac e ium pe iodon icum ASV11,
Lachnoanae obaculum umeaense ASV152 e G anulica ella elegans ASV207.
ALBA REGUEIRA IGLESIAS
40
Cen ándonos na co espondencia dos esul ados dos modelos p edi i os das p incipais
ASVs con espec o ós seus espec i os esul ados na abundancia di e encial, de ec á onse
nume osas inconsis encias biolóxicas nes a úl ima. Na placa sup axinxi al, 17 das 21 ASVs
p edi o as de saúde p esen aban abundancias di e enciais, e o 88,23% (15/17) delas amosaban
abundancias signi ica i amen e ele adas an o en saúde como en pe iodon i e. Das 25 ASVs
p edi o as de en e midade, 22 e an di e encialmen e abundan es e, delas, ca o (18,18%) iñan
una endencia a ni eis ele ados nas dúas condicións opos as.
Na placa subxinxi al, 29 das 31 ASVs p edi o as de saúde o on di e encialmen e
abundan es, cun 31,03% (9/29) amosando abundancias signi ica i amen e ele adas an o en
saúde como en pe iodon i e. Das 31 ASVs p edi o as de en e midade, 30 amosa on abundancias
di e enciais e, delas, es (10,00%) p esen a on ni eis signi ica i amen e ele ados nas dúas
condicións opos as.
En ámbolos dous ipos de placa, 28 das 32 ASVs p edi o as de saúde amosa on abundancia
di e encial e, delas, o 71,42% (20/28) o on di e encialmen e abundan es an o pa a a saúde
como pa a a pe iodon i e. As 15 ASVs p edi o as de en e midade en ambas placas amén o on
di e encialmen e abundan es e, delas, es (20,0%) iñan ni eis signi ica i amen e ele ados en
ámbalas dúas condicións clínicas.
4.3 CONCLUSIÓNS
A iqueza bac e iana asociada á pe iodon i e é maio que na saúde pe iodon al na placa
sup axinxi al e meno na subxinxi al; a uni o midade é maio na en e midade que na saúde en
ambos os nichos. A mic obio a sup axinxi al é máis ica e di e sa que a súa homóloga
subxinxi al pa a o mesmo es ado de saúde pe iodon al. A es u u a da comunidade bac e iana
é di e en e pa a as dis in as condicións pe iodon ais na placa sup axinxi al e subxinxi al, así
como pa a o mesmo es ado de saúde en e os dous nichos.
O núcleo da mic obio a da placa sup axinxi al e subxinxi al non pe mi e ca ac e iza a
saúde e a en e midade pe iodon al, o que e ela a g an he e oxeneidade da mic obio a o al. A
po cen axe da comunidade bac e iana da placa den al que se o ganiza en edes de co-oco encia
a ni el de ASV é moi pequena; a ede da pe iodon i e non a ada da placa sup axinxi al é máis
Resumo da ese
41
ex ensa e con én máis nodos, in e conexións e g upos bac e ianos in e conec ados que a súa
homóloga subxinxi al. As p incipais ASV cla e nas edes de saúde pe iodon al da placa
sup axinxi al son R. den oca iosa ASV2 e S. o alis subsp. den isani clade 058 ASV1. O eixo
p incipal nas edes de pe iodon i e non a adas da placa sup axinxi al é S. sanguinis ASV228;
e na placa subxinxi al, é T. o sy hia ASV15. Os p incipais axons cla e na ede de pe iodon i e
a ada do nicho subxinxi al son T. o sy hia ASV15, F. nuclea um subsp. incen ii ASV10 e
S. o alis subsp. den isani clade 058 ASV1.
Unha pequena p opo ción dos axons sup a e subxinxi ales eñen unha capacidade
des acada pa a dis ingui en e as condicións pe iodon ais, e unha po cen axe ele an e son
memb os da mic obio a cen al. Dende o pun o de is a da me axenómica clínica, a placa
sup axinxi al é un mello bioma cado bac e iano que o seu homólogo subxinxi al pa a
di e encia a saúde pe iodon al da pe iodon i e non a ada e a ada.
As p incipais ASVs p edi o as da saúde pe iodon al na placa sup axinxi al e subxinxi al
son R. den oca iosa ASV2; H. pa ain luenzae ASV3, ASV78, ASV45 e ASV46; K. o alis
ASV66; S. es ibula is ASV27; e A. HMT170 ASV119. Pola con a, as p incipais ASVs
p edi o as da pe iodon i e en ámbolos ipos de placa son: T. o sy hia ASV15; F. alocis ASV19;
T. den icola ASV38 e ASV150; F. as idiosum ASV97; P. HMT369 ASV124; S. anginosus
ASV142; e P. noda um ASV189. Des as, F. as idiosum ASV97 e S. anginosus ASV142 amén
ac ua on como p edi o as de xenxi i e no nicho sup axinxi al.
ALBA REGUEIRA IGLESIAS
42
REFERENCIAS
(1) Kinane DF, S a hopoulou PG, Papapanou PN. Pe iodon al diseases. Na Re Dis P ime s.
2017 Jun;3:17038. doi: 10.1038/n dp.2017.38.
(2) Chapple ILC, Mealey BL, Van Dyke TE, Ba old PM, Dommisch H, Eickholz P, e al.
Pe iodon al heal h and gingi al diseases and condi ions on an in ac and a educed
pe iodon ium: consensus epo o wo kg oup 1 o he 2017 Wo ld Wo kshop on he
Classi ica ion o Pe iodon al and Pe i-Implan Diseases and Condi ions. J Pe iodon ol. 2018
Jun;89 Suppl 1:S74-84. doi: 10.1002/JPER.17-0719.
(3) Pe es MA, Macphe son LMD, Weyan RJ, Daly B, Ven u elli R, Ma hu MR, e al. O al
diseases: a global public heal h challenge. Lance . 2019 Jul;394(10194):249-60.
(4) Kassebaum NJ, Smi h AGC, Be nabé E, Fleming TD, Reynolds AE, Vos T, e al. Global,
egional, and na ional p e alence, incidence, and disabili y-adjus ed li e yea s o o al
condi ions o 195 coun ies, 1990–2015: a sys ema ic analysis o he global bu den o
diseases, inju ies, and isk ac o s. J Den Res. 2017 Ap ;96(4):380-7.
(5) B a o-Pé ez M, Alme ich-Silla J, Ausina-Má quez V, A ilés-Gu ié ez P, Blanco-González
J, Cano ea-Díaz E, e al. O al heal h su ey in Spain 2015. RCOE. 2016 Jun;21(Suppl 1):8-48.
Spanish.
(6) Fe ei a MC, Dias-Pe ei a A, B anco-de-Almeida LS, Ma ins CC, Pai a SM. Impac o
pe iodon al disease on quali y o li e: a sys ema ic e iew. J Pe iodon Res. 2017
Aug;52(4):651-65.
(7) Chapple ILC, Boucha d P, Cage i MG, Campus G, Ca a M, Cocco F, e al. In e ac ion o
li es yle, beha iou o sys emic diseases wi h den al ca ies and pe iodon al diseases: consensus
epo o g oup 2 o he join EFP/ORCA wo kshop on he bounda ies be ween ca ies and
pe iodon al diseases. J Clin Pe iodon ol. 2017 Ma ;44 Suppl 18:S39-51. doi:
10.1111/jcpe.12685.
Resumo da ese
43
(8) Ca izales-Sepúl eda EF, O daz-Fa ías A, Ve a-Pineda R, Flo es-Ramí ez R. Pe iodon al
disease, sys emic in lamma ion and he isk o ca dio ascula disease. Hea Lung Ci c. 2018
No ;27(11):1327-34.
(9) Nascimen o G, Lei e F, Ves e gaa d P, Scheu z F, López R. Does diabe es inc ease he isk
o pe iodon i is? A sys ema ic e iew and me a- eg ession analysis o longi udinal p ospec i e
s udies. Ac a Diabe ol. 2018 Jul;55(7):653-67.
(10) Gomes-Filho I, C uz SSD, T indade SC, Passos-Soa es J, Ca alho-Filho P, Figuei edo
ACMG, e al. Pe iodon i is and espi a o y diseases: a sys ema ic e iew wi h me a-analysis.
O al Dis. 2020 Ma ;26(2):439-46.
(11) Fuggle NR, Smi h TO, Kaul A, So a N. Hand o mou h: a sys ema ic e iew and me a-
analysis o he associa ion be ween heuma oid a h i is and pe iodon i is. F on Immunol. 2016
Ma ;7:80. doi: 10.3389/ immu.2016.00080.
(12) Lei a Y, Domínguez C, Seoane J, Seoane-Rome o J, Pías-Pele ei o JM, Takkouche B, e
al. Is pe iodon al disease associa ed wi h alzheime 's disease? A sys ema ic e iew wi h me a-
analysis. Neu oepidemiology. 2017;48(1-2):21-31.
(13) Ide M, Papapanou PN. Epidemiology o associa ion be ween ma e nal pe iodon al disease
and ad e se p egnancy ou comes – sys ema ic e iew. J Clin Pe iodon ol. 2013 Ap ;40 Suppl
14:S181-94. doi: 10.1111/jcpe.12063.
(14) AlJehani YA. Risk ac o s o pe iodon al disease: e iew o he li e a u e. In J Den . 2021
Feb;2021:8735071. doi: 10.1155/2021/8735071.
(15) Teles R, Teles F, F ias-Lopez J, Pas e B, Ha ajee A. Lessons lea ned and unlea ned in
pe iodon al mic obiology. Pe iodon ol 2000. 2013 Jun;62(1):95-162.
(16) A genomic app oach o mic obiology. Na Re Gene . 2019 Jun;20(6):311. doi:
10.1038/s41576-019-0131-5.
ALBA REGUEIRA IGLESIAS
44
(17) del Rosa io-Rodicio M, del Ca men-Mendoza M. Bac e ial iden i ica ion by 16S RNA
sequencing: a ionale, me hodology and applica ions in clinical mic obiology. En e m In ecc
Mic obiol Clin. 2004 Ap ;22(4):238-45. Spanish.
(18) Zau a E. Nex -gene a ion sequencing app oaches o unde s anding he o al mic obiome.
Ad Den Res. 2012 Sep;24(2):81-5.
(19) Nea ing JT, Comeau AM, Langille MGI. Iden i ying biases and hei po en ial solu ions
in human mic obiome s udies. Mic obiome. 2021 May;9(1):113. doi: 10.1186/s40168-021-
01059-0.
(20) Robinson CK, B o man RM, Ra el J. In icacies o assessing he human mic obiome in
epidemiologic s udies. Ann Epidemiol. 2016 May;26(5):311-21.
(21) de la Cues a-Zuluaga J, Escoba JS. Conside a ions o op imizing mic obiome analysis
using a ma ke gene. F on Nu . 2016 Aug;3:26. doi: 10.3389/ nu .2016.00026.
(22) Hamady M, Knigh R. Mic obial communi y p o iling o human mic obiome p ojec s:
ools, echniques, and challenges. Genome Res. 2009 Jul;19(7):1141-52.
(23) Rajendh an J, Gunaseka an P. Mic obial phylogeny and di e si y: small subuni ibosomal
RNA sequence analysis and beyond. Mic obiol Res. 2011 Feb;166(2):99-110.
(24) Acinas SG, Ma celino LA, Klepac-Ce aj V, Polz MF. Di e gence and edundancy o 16S
RNA sequences in genomes wi h mul iple n ope ons. J Bac e iol. 2004 May;186(9):2629-
35.
(25) Pei AY, Obe do WE, Nossa CW, Aga wal A, Chokshi P, Ge z EA, e al. Di e si y o
16S RNA genes wi hin indi idual p oka yo ic genomes. Appl En i on Mic obiol. 2010
Jun;76(12):3886-97.
Resumo da ese
45
(26) Sun D, Jiang X, Wu QL, Zhou N. In agenomic he e ogenei y o 16S RNA genes causes
o e es ima ion o p oka yo ic di e si y. Appl En i on Mic obiol. 2013 Oc ;79(19):5962-9.
(27) Vě o ský T, Bald ian P. The a iabili y o he 16S RNA gene in bac e ial genomes and
i s consequences o bac e ial communi y analyses. PLoS One. 2013;8(2):e57923. doi:
10.1371/jou nal.pone.0057923.
(28) Case RJ, Bouche Y, Dahllö I, Holms öm C, Dooli le WF, Kjellebe g S. Use o 16S
RNA and poB genes as molecula ma ke s o mic obial ecology s udies. Appl En i on
Mic obiol. 2007 Jan;73(1):278-88.
(29) Lee ZM, Bussema C 3 d, Schmid TM. nDB: documen ing he numbe o RNA and
RNA genes in bac e ia and a chaea. Nucleic Acids Res. 2009 Jan;37(Da abase issue):D489-
93. doi: 10.1093/na /gkn689.
(30) Johnson JS, Spakowicz DJ, Hong BY, Pe e sen LM, Demkowicz P, Chen L, e al.
E alua ion o 16S RNA gene sequencing o species and s ain-le el mic obiome analysis. Na
Commun. 2019 No ;10(1):5029. doi: 10.1038/s41467-019-13036-1.
(31) Schloss PD. Amplicon sequence a ian s a i icially spli bac e ial genomes in o sepa a e
clus e s. mSphe e. 2021 Aug;6(4):e0019121. doi: 10.1128/mSphe e.00191-21.
(32) R Co e Team. R: a language and en i onmen o s a is ical compu ing. Vienna, Aus ia:
R Founda ion o S a is ical Compu ing; 2021; A ailable a : h ps://www.R-p ojec .o g/.
(33) Ko alchik S. RISmed: download con en om NCBI da abases. 2017; A ailable a :
h p://www.CRAN.R-p ojec .o g/.
(34) Feine e , I., Ho nik, K., Meye , D. Tex mining in as uc u e in R. J S a So w. 2008
Ma ;25(5):1-54. doi: 10.18637/jss. 025.i05.
ALBA REGUEIRA IGLESIAS
46
(35) Klindwo h A, P uesse E, Schwee T, Peplies J, Quas C, Ho n M, e al. E alua ion o
gene al 16S ibosomal RNA gene PCR p ime s o classical and nex -gene a ion sequencing-
based di e si y s udies. Nucleic Acids Res. 2013 Jan;41(1):e1. doi: 10.1093/na /gks808.
(36) F Escapa I, Huang Y, Chen T, Lin M, Koka as A, Dewhi s FE, e al. Cons uc ion o
habi a -speci ic aining se s o achie e species-le el assignmen in 16S RNA gene da ase s.
Mic obiome. 2020 May;8(1):65. doi: 10.1186/s40168-020-00841-w.
(37) Py hon So wa e Founda ion. Py hon. 2020; A ailable a : h p://www.py hon.o g/.
(38) GNU P. F ee So wa e Founda ion. Bash. 2020; A ailable a : h p://www.gnu.o g/.
(39) Sie e s F, Wilm A, Dineen D, Gibson TJ, Ka plus K, Li W, e al. Fas , scalable gene a ion
o high-quali y p o ein mul iple sequence alignmen s using Clus al Omega. Mol Sys Biol. 2011
Oc ;7:539. doi: 10.1038/msb.2011.75.
(40) NCBI Resou ce Coo dina o s. Da abase esou ces o he Na ional Cen e o
Bio echnology In o ma ion. Nucleic Acids Res. 2016 Jan;44(D1):D7-19. doi:
10.1093/na /gk 1290.
(41) O'Lea y NA, W igh MW, B is e JR, Ciu o S, Haddad D, McVeigh R, e al. Re e ence
sequence (Re Seq) da abase a NCBI: cu en s a us, axonomic expansion, and unc ional
anno a ion. Nucleic Acids Res. 2016 Jan;44(D1): D733-45. doi: 10.1093/na /gk 1189.
(42) Cla k K, Ka sch-Miz achi I, Lipman DJ, Os ell J, Saye s EW. GenBank. Nucleic Acids
Res. 2016 Jan;44:D67-72. doi: 10.1093/na /gk 1276.
(43) Lyalina S. Sea ch 16S py algo i hm. 2019; A ailable a :
h ps://gi hub.com/slyalina/sea ch_16S_py.
(44) Edga R. SEARCH_16S: a new algo i hm o iden i ying 16S ibosomal RNA genes in
con igs and ch omosomes. P ep in a bioRxi 2017:124131. doi: 10.1101/124131.
Resumo da ese
47
(45) Na ional Cen e o Bio echnology In o ma ion. En ez p og amming u ili ies help. 2010;
A ailable a : h ps://www.ncbi.nlm.nih.go /books/NBK25501/.
(46) Cock PJ, An ao T, Chang JT, Chapman BA, Cox CJ, Dalke A, e al. Biopy hon: eely
a ailable Py hon ools o compu a ional molecula biology and bioin o ma ics. Bioin o ma ics.
2009 Jun;25(11):1422-23.
(47) Na ional Cen e o Bio echnology In o ma ion. NCBI Re Seq a ge ed loci p ojec .
A chaea FTP. 2008. p:// p.ncbi.nlm.nih.go / e seq/Ta ge edLoci/A chaea/.
(48) Quas C, P uesse E, Yilmaz P, Ge ken J, Schwee T, Ya za P, e al. The SILVA ibosomal
RNA gene da abase p ojec : imp o ed da a p ocessing and web-based ools. Nucleic Acids Res.
2013 Jan;41(Da abase issue):D590-6. doi: 10.1093/na /gks1219.
(49) Pa ks DH, Chu ochina M, Chaumeil P, Rinke C, Mussig AJ, Hugenhol z P. A comple e
domain- o-species axonomy o bac e ia and a chaea. Na Bio echnol. 2020 Sep;38(9):1079-
86.
(50) Mo gulis A, Coulou is G, Ray selis Y, Madden TL, Aga wala R, Schä e AA. Da abase
indexing o p oduc ion MegaBLAST sea ches. Bioin o ma ics. 2008 Aug;24(16):1757-64.
(51) Chen Y, Ye W, Zhang Y, Xu Y. High speed BLASTN: an accele a ed MegaBLAST sea ch
ool. Nucleic Acids Res. 2015 Sep;43(16):7762-8.
(52) Ba ne M. egex. 2020; A ailable a : h ps://pypi.o g/.
(53) F Escapa I, Chen T, Huang Y, Gaja e P, Dewhi s FE, Lemon KP. New insigh s in o human
nos il mic obiome om he expanded Human O al Mic obiome Da abase (eHOMD): a
esou ce o he mic obiome o he human ae odiges i e ac . mSys ems. 2018
Dec;3(6):e00187-18. doi: 10.1128/mSys ems.00187-18.
ALBA REGUEIRA IGLESIAS
48
(54) Schoch CL, Ciu o S, Dom ache M, Ho on CL, Kannan S, Kho anskaya R, e al. NCBI
Taxonomy: a comp ehensi e upda e on cu a ion, esou ces and ools. Da abase (Ox o d). 2020
Jan;2020:baaa062. doi: 10.1093/da abase/baaa062.
(55) Ha is CR, Millman KJ, an de Wal , S é an J, Gomme s R, Vi anen P, Cou napeau D,
e al. A ay p og amming wi h NumPy. Na u e. 2020 Sep;585(7825):357-62.
(56) McKinney W. Da a S uc u es o s a is ical compu ing in Py hon. In: an de Wal S,
Millman J, edi o s. P oceedings o he 9 h Py hon in Science Con e ence; 2010; Aus in. Texas:
SciPy; 2010. doi: 10.25080/Majo a-92b 1922-00a.
(57) Camacho C, Coulou is G, A agyan V, Ma N, Papadopoulos J, Beale K, e al. BLAST+:
a chi ec u e and applica ions. BMC Bioin o ma ics. 2009 Dec;10:421. doi: 10.1186/1471-
2105-10-421.
(58) Al schul SF, Gish W, Mille W, Mye s EW, Lipman DJ. Basic local alignmen sea ch ool.
J Mol Biol. 1990 Oc ;215(3):403-10.
(59) McNama a J. xlsxw i e . 2013; A ailable a : h ps://xlsxw i e . ead hedocs.io/.
(60) A mi age GC. De elopmen o a classi ica ion sys em o pe iodon al diseases and
condi ions. Ann Pe iodon ol. 1999 Dec;4(1):1-6.
(61) Page RC, Eke PI. Case de ini ions o use in popula ion-based su eillance o pe iodon i is.
J Pe iodon ol. 2007 Jul;78(7 Suppl):1387-99.
(62) Willis JR, González-To es P, Pi is AA, Beja ano LA, Cozzu o L, And eu-Soma illa N,
e al. Ci izen science cha s wo majo “s oma o ypes” in he o al mic obiome o adolescen s
and e eals links wi h habi s and d inking wa e composi ion. Mic obiome. 2018 Dec;6(1):218.
doi: 10.1186/s40168-018-0592-3.
55
Thesis summa y
“Limi a ions o 16S RNA gene as phylogene ic ma ke : a la ge-
scale me a-omics analysis o plaque mic obio a in pe iodon al diseases”
The i s objec i e o he p esen Thesis was o analyse in silico he co e age o he 16S
ibosomal RNA ( RNA) gene p ime s used o s udy he composi ion o he o al mic obio a,
using wo da abases con aining 16S RNA sequences om o al bac e ia and a chaea; and o
desc ibe he bes p ime pai s o each domain.
Sea ches we e conduc ed in PubMed o c ea e a lis o 1) 16S RNA gene p ime s used in
sequencing-based s udies o he o al mic obiome, and 2) o al-a chaea species inhabi ing he
human mou h. The indi idual p ime s ound we e e alua ed agains a p e iously epo ed
da abase o 16S RNA sequences om o al bac e ia, which was modi ied by ou g oup; and a
sel -c ea ed o al-a chaea da abase, cons uc ed based on he lis o o al-a chaeal species. Bo h
da abases con ained he genomic a ian s de ec ed o each included species. P ime s we e
e alua ed a he a ian and species le els, and hose wi h a species co e age (SC) ≥75.00%
we e selec ed o he pai analyses. All possible combina ions o o wa d and e e se p ime s
we e iden i ied and e alua ed agains he wo da abases.
A o al o 369 dis inc indi idual p ime s we e ound in he li e a u e. A e applying he
p ime -pai o ma ion c i e ia, 4638 p ime pai s we e iden i ied. The bes bac e ia-speci ic
pai s a ge ed he 3-4, 4-7, and 3-7 16S RNA gene egions, wi h SC le els o 98.83% - 97.14%;
meanwhile, he op imum a chaea-speci ic p ime pai s ampli ied egions 5-6, 3-6, and 3-6, wi h
SC es ima es o 95.88%. Finally, he bes pai s o de ec ing bo h domains a ge ed egions 4-
5, 3-5, and 5-9, and p oduced SC alues o 95.71% - 94.54% and 99.48% - 96.91% o bac e ia
and a chaea, espec i ely.
ALBA REGUEIRA IGLESIAS
56
Gi en he h ee amplicon leng h ca ego ies (100-300, 301-600, and >600 base pai s), he
p ime pai s wi h he bes co e age alues o de ec ing o al bac e ia we e: KP_F048-OP_R043
( egion 3-4; p ime pai posi ion o Esche ichia coli J01859.1: 342-529), KP_F051-OP_R030
(4-7; 514-1079), and KP_F048-OP_R030 (3-7; 342-1079). Fo de ec ing o al a chaea, hese
we e: OP_F066-KP_R013 (5-6; 784-unde ined), KP_F020-KP_R013 (3-6; 518-unde ined),
and OP_F114-KP_R013 (3-6; 340-unde ined). Las ly, o de ec ing bo h domains hey we e:
KP_F020-KP_R032 (4-5; 518-801), OP_F114-KP_R031 (3-5; 340-801), and OP_F066-
OP_R121 (5-9; 784-1405). The p ime pai s wi h he bes co e age iden i ied he ein a e no
among hose desc ibed mos widely in he o al mic obiome li e a u e.
The pu pose o he second s udy was o e alua e he numbe o 16S RNA genes in he
comple e genomes o all he bac e ial and a chaeal species e e de ec ed in he human o al
ca i y; and o assess how he use o di e en p ime pai s would a ec he de ec ion and
classi ica ion o edundan amplicons and ma ching amplicons (MAs) om di e en axa.
A o al o 709 comple e genomes (518 o al bac e ia, 191 o al a chaea) we e downloaded
om he NCBI da abase, and hei comple e 16S RNA genes we e ex ac ed. The o al numbe
o genes and a ian s pe genome we e calcula ed. Nex , 33 p ime pai s selec ed om objec i e
1 and 6 commonly employed in he o al li e a u e we e used agains all he genomes o ob ain
amplicons. Fo each p ime pai , we calcula ed he numbe o 16S RNA gene amplicons,
a ian s, genomes, and species de ec ed, as well as he pe cen age o co e age a he species
le el wi h no ma ching amplicons (SC-NMA).
In o al, 94.1% o o al bac e ia and 52.59% o o al a chaea had mo e han one 16S RNA
gene in hei espec i e genomes. Be ween 46.70% - 1.29% o he bac e ial species and be ween
38.89% - 4.65% o he a chaeal species de ec ed by he e alua ed p ime pai s had MAs,
a ec ing ele an gene a p esen in he o al en i onmen such as Ac inomyces, Fusobac e ium,
Lac obacillus, Me hanosa cina, S aphylococcus, and S ep ococcus. The bes p ime pai s we e
(SC-NMA; egion; p ime pai posi ion o Esche ichia coli J01859.1): KP_F048-OP_R030 o
bac e ia (93.55%; 3-7; 342-1079), KP_F018-KP_R063 o a chaea (89.63%; 3-9; unde ined-
1506), and OP_F114_OP_R121 o bo h bac e ia and a chaea (92.52%; 3-9; 340-1405).
Thesis summa y
57
In addi ion o he 16S RNA gene edundancy, he conside able p esence o MAs mus be
con olled o ensu e he accu a e in e p e a ion o mic obial di e si y da a. The SC-NMA is a
mo e use ul pa ame e han he con en ional co e age pe cen age o selec ing he bes p ime
pai s. The pe o mance o he p ime pai s o de ec non-MA species inc eases as he a e age
leng h o he amplicons inc eases; none o hese being he mos widely used p ime pai s in he
o al li e a u e. The choice o p ime pai signi ican ly a ec s di e si y es ima es and axonomic
classi ica ion, condi ioning he compa abili y o o al mic obiome s udies using di e en p ime
pai s.
The aims o he hi d s udy we e o e alua e in silico he co e age o a se o p e iously
selec ed p ime pai s o de ec o al species ha ing 16S RNA sequence segmen s wi h ≥97%
simila i y; and o desc ibe o al species wi h highly simila sequence segmen s and de e mine
whe he hey belong o dis inc gene a o o he highe axonomic anks.
Thi y-nine p ime pai s we e employed o ob ain he in silico amplicons om he comple e
genomes o 186 bac e ial and 135 a chaeal species. Each as a ile o he same p ime pai was
inse ed as subjec and que y in BLASTN o ob aining he simila i y pe cen age be ween
amplicons belonging o di e en o al species. Amplicons wi h 100% alignmen co e age o he
que y sequences and wi h a simila i y alue ≥97% (ASI97) we e selec ed. Fo each p ime , he
species co e age wi h no ASI97 (SC-NASI97) was calcula ed.
Based on he SC-NASI97 pa ame e , he bes p ime pai s we e OP_F053-KP_R020 o
bac e ia ( egion 1-3; p ime pai posi ion o Esche ichia coli J01859.1: 9-356); KP_F018-
KP_R002 o a chaea (4; unde ined-532); and OP_F114-KP_R031 o bo h (3-5; 340-801).
A ound 80% o he o al-bac e ia and o al-a chaea species analysed had an ASI97 wi h a leas
one o he species. These e y simila species play di e en oles in he o al mic obio a and
belong o bac e ial gene a such as Campylobac e , Ro hia, S ep ococcus, and Tanne ella, and
a chaeal gene a such as Halo i ax, Me hanosalsum, and Me hanosa cina. Mo eo e , ~20% and
~30% o hese wo-by- wo simila i y ela ionships we e es ablished be ween species om
di e en bac e ial and a chaeal gene a, espec i ely. E en axa om dis inc amilies, o de s,
and classes could be g ouped in he same possible ope a ional axonomic uni (OTU).
ALBA REGUEIRA IGLESIAS
58
Rega dless o he p ime pai used, sequence clus e ing wi h a 97% simila i y p o ides an
inaccu a e desc ip ion o o al-bac e ial and o al-a chaeal species, which can g ea ly a ec
mic obial di e si y pa ame e s. As a esul , OTU clus e ing condi ions he c edibili y o
associa ions be ween some o al species and ce ain heal h and disease condi ions. This
signi ican ly limi s he compa abili y o he mic obial di e si y indings epo ed in o al
mic obiome li e a u e.
Las ly, he ou h objec i e was o analyse he sup agingi al and subgingi al plaque
mic obio a a amplicon sequence a ian (ASV) le el o di e en pe iodon al condi ions
(pe iodon al heal h, gingi i is, and un ea ed and ea ed pe iodon i is) in e ms o bac e ial
di e si y, co-occu ence ne wo ks, and p edic i e models.
A o al o 120 pa ien s (55 con ols, 65 pe iodon i is) we e selec ed o subgingi al plaque
collec ion. Sequencing o he 3-4 16S RNA gene egion was pe o med in Illumina MiSeq.
The ob ained sequences and me ada a we e uploaded o he sequence ead a chi e (SRA).
Sea ches we e pe o med in PubMed, Scopus, Embase, and he SRA o iden i y p e iously
published Illumina 3-4 sequencing s udies on he sup agingi al and subgingi al plaque
mic obiome in dis inc pe iodon al condi ions. Resea ch ha me he c i e ia o sequences and
me ada a we e included in he me a-omics analysis, comp ising a o al o 2045 samples.
Sequences we e p ocessed unde he same bioin o ma ics p o ocol, which included he ASV-
le el classi ica ion and he use o an o al-speci ic da abase o axonomic classi ica ion. The
s a is ical analysis was conduc ed using he phyloseq, DESeq2, mic obiome, mixOmics egan,
SpiecEasi, and ig aph packages.
Bac e ial ichness associa ed wi h pe iodon i is was highe han in heal h in sup agingi al
plaque and lowe in subgingi al, bu e enness was highe in disease in bo h niches. The
sup agingi al mic obio a was iche and mo e di e se han he subgingi al o he same
pe iodon al condi ion. The s uc u e o he bac e ial communi y di e ed among condi ions in
he sup a- and subgingi al plaque, as well as o he same heal h s a us be ween he wo niches.
In addi ion, he co e mic obio a o den al plaque did no allow he cha ac e isa ion o
pe iodon al heal h and disease; and he p opo ion o he bac e ial communi y o ganised in co-
occu ence ne wo ks a he ASV le el was e y small. Howe e , a small p opo ion o sup a-
Thesis summa y
59
and subgingi al axa had ou s anding abili y o dis inguish be ween pe iodon al condi ions, and
a ele an pe cen age o hem we e co e membe s. Sup agingi al plaque was a be e bac e ial
bioma ke han subgingi al o disc imina ing pe iodon al heal h om un ea ed and ea ed
pe iodon i is. The main heal h-p edic o ASVs in sup agingi al and subgingi al plaque we e:
Ro hia den oca iosa ASV2, Haemophilus pa ain luenzae ASV3, ASV78, ASV45, and ASV46,
Kingella o alis ASV66, S ep ococcus es ibula is ASV27, and Ac inomyces HMT170
ASV119. The main p edic o ASVs o pe iodon i is in den al plaque we e: Tanne ella o sy hia
ASV15, Fili ac o alocis ASV19, T eponema den icola ASV38 and ASV150, F e ibac e ium
as idiosum ASV97, Pep os ep ococcaceae [XI][G-4] HMT369 ASV124, S ep ococcus
anginosus ASV142, and Pep os ep ococcaceae [XI][G-6] noda um ASV189.
INTRODUCTION
63
In oduc ion
I.1. PERIODONTITIS: EPIDEMIOLOGY, DIAGNOSIS AND CLASSIFICATION
The e m “pe iodon al diseases” e e s o se e al di e en ch onic in lamma o y condi ions
ha a ec he issue su ounding and suppo ing he ee h (1). Pa hologies a ise when he
balance be ween he mic obial bio ilm and he immune sys em is los , whe he due o dysbiosis
(bio ilm imbalance) o an o e eac ion o he hos o he mic obes p esen (1). This is a ma e
o conce n since he 2016 es ima es o he Wo ld Heal h O ganisa ion (WHO) epo ha o al
condi ions, including pe iodon al diseases, a e he 10 h cause o yea s o heal hy li e los due o
disabili y (YLDs) globally (2).
Gingi i is is a localised in lamma ion o he gums ha o igina es om he bac e ia p esen
in he den al plaque deposi ed on he ee h and he gingi a (1). The condi ion mani es s
clinically wi h swelling, edness, bleeding on p obing (BOP), and discom o du ing he p obing
p ocess. Pa ien s also usually ha e symp oms like bleeding and swollen ed gums, pain,
hali osis, and di icul ies when ea ing (3). Gingi i is does no , howe e , ex end o he
pe iodon al a achmen appa a us (cemen um, pe iodon al ligamen , and al eola bone) and is
e e sible by educing plaque le els (3).
In suscep ible indi iduals, un ea ed gingi i is can p og ess o pe iodon i is (1), which is
cha ac e ised by he g adual des uc ion o he oo h-suppo ing appa a us. Conside able
damage o bo h he connec i e issue ib es and he apical ex ension o he junc ional epi helium
in esponse o he accumula ion o plaque is e iden in ad anced pe iodon al lesions. The bone
des uc ion p oduced a his ad anced s age c ea es he pe iodon al pocke s ha a e he hallma k
o he disease (1). In a clinical explo a ion, pe iodon i is mani es s wi h edness, a changed
ex u e and swelling o he ma gin o he gums, BOP, he inc eased dep h o he pe iodon al
pocke s, he des uc ion o he ligamen and al eola bone, he ecession o he ma ginal
gingi a, inc eased oo h mobili y, and, e en ually, oo h loss (4).
ALBA REGUEIRA IGLESIAS
64
Figu e 1. Schema ic ep esen a ion o heal hy gingi a, gingi i is, ea ly- o-mode a e pe iodon i is, and
ad anced pe iodon i is. The image was aken om Kinane e al. (1) wi h he pe mission o Sp inge Na u e.
I.1.1. Epidemiology
Pe iodon al diseases a e a signi ican public heal h conce n, being among he mos p e alen
and consequen ial o al condi ions wo ldwide (5). In 2015, he global p e alence o se e e
pe iodon i is was es ima ed o be 7.4%, wi h 538 million cases (6). In he US, 42.2% o den a e
adul s ≥30 yea s old had some ca ego y o pe iodon i is, wi h 7.8% a ec ed by he se e e
disease (7). In hose ≥65 yea s, hese igu es inc eased o 68% and 11%, espec i ely (8).
Acco ding o da a om he 2015 O al Heal h Su ey, 5% o he adul popula ion in Spain
aged om 34 o 44 yea s old and 10% o hose be ween 65 and 74 had deep pe iodon al pocke s
(≥6 mm) (9). The p e alences o mode a e pocke s (4-5 mm) in hese g oups we e 18.5% and
27.0%, espec i ely. Al hough hese ou comes had no changed subs an ially om he p e ious
su ey in 2010 (10), he e was an inc ease in he p esence o mode a e pocke s, which may
signi y a likely wo sening pe iodon al s a us in hese age g oups in subsequen yea s (9).
I.1.2. Impac on quali y o li e
Pe iodon i is has been associa ed wi h a nega i e e ec on he quali y o li e, especially in
pa ien s wi h se e e pe iodon i is, comp omising aspec s ela ed o bo h unc ion and aes he ics
(11). Speci ically, i no ea men is p o ided, ou comes can include oo h loss, impai ed
mas ica o y pe o mance, a poo e nu i ional s a us, lowe sel -es eem and quali y o li e, and
nega i e e ec s on gene al heal h (12). The disease may also be a sou ce o social inequali y
(4).
In oduc ion
71
I.2. PERIODONTITIS AND ITS IMPLICATIONS FOR GENERAL HEALTH
Se e al sys emic diseases and condi ions, bo h inhe en and acqui ed, can a ec he
pe iodon al a achmen appa a us, causing he loss o pe iodon al issue (32). This damage can
ei he 1) in luence he cou se o pe iodon i is, o 2) a ec pe iodon al-suppo i e issue,
i espec i e o den al plaque bio ilm-induced in lamma ion (18). The i s case includes bo h
a e diso de s, in which pe iodon i is is a mani es a ion o he sys emic condi ion i sel (e.g.,
gene ic diso de s), as well as mo e common diseases (e.g., diabe es melli us). The damage in
he second case a ises om e y a e condi ions, many o which a e neoplasms (32). In his
sec ion o he hesis, howe e , he ocus is on he ela ionship be ween pe iodon i is and
common sys emic pa hologies.
As long ago as 2000, Williams and O enbache (37) used he e m “Pe iodon al Medicine”
o de ine a hen apidly eme ging b anch o pe iodon ology based on da a ha es ablished a
s ong ela ionship be ween pe iodon al and sys emic heal h o disease. Today, he e is a
con incing body o scien i ic e idence ha is suppo i e o his no ion o a wo-way
ela ionship be ween pe iodon i is and ca dio ascula diseases (38), diabe es melli us (39),
espi a o y condi ions (40), heuma oid a h i is (41), Alzheime ’s disease (42) and ad e se
p egnancy ou comes (43). Fu he mo e, ecen yea s ha e seen an inc ease in esea ch linking
pe iodon i is o o he diso de s such as me abolic synd ome (44), obesi y (45), ch onic kidney
disease (46), and o odiges i e cance s, including hose o he o al ca i y, gas oin es inal ac ,
and panc eas (47).
ALBA REGUEIRA IGLESIAS
72
Figu e 2. Rep esen a ion o he sys emic condi ions associa ed wi h pe iodon i is. F om le o igh :
ca dio ascula diseases, espi a o y diso de s, diabe es, Alzheime ’s disease, heuma oid a h i is, and
ad e se p egnancy ou comes.
Th ee unde lying mechanisms h ough which pe iodon i is may play a ole in gene al
heal h ha e been hypo hesised (48,49):
Me as a ic in ec ion - an in ec ious disease caused by mic oo ganisms om a dis an
pa o he body (48). Mic obes can sp ead in h ee di e en ways: 1) di ec
p opaga ion h ough con iguous spaces o enous o lympha ic d ainage, 2) aspi a ion,
o 3) bac e aemia o he access o o al bac e ia o he bloods eam.
In lamma ion and in lamma o y inju y - he indi ec damage caused o issue and
o gans by mic obes ia he dissemina ion o bac e ial exo oxins and endo oxins.
Adap a i e immuni y - he immune esponse o he hos o o al mic oo ganisms and
hei i ulence ac o s. Soluble an igens can en e he bloods eam, bond o a speci ic
ci cula ing an ibody, and o m a mac omolecula immunocomplex, wi h he la e
po en ially leading o mul iple acu e and ch onic in lamma o y eac ions a he
deposi ion si es (49).
In oduc ion
73
I.3. AETIOLOGY OF PERIODONTITIS: MICROBIOTA AND HOST RESPONSE
As explained p e iously, bo h he ini ia ion and p og ession o pe iodon i is a e ela ed o
mul iple ae iologies and isk ac o s, wi h he in e ac ion be ween local mic oo ganisms and he
hos ’s immune esponse being pa icula ly ele an . Consequen ly, he de elopmen o
e ec i e he apeu ic app oaches equi es he iden i ica ion o he main pe iodon i is-associa ed
mic obes and hos bioma ke s.
I.3.1. Mic obio a
The human body is an ecosys em o med no only by human euka yo ic cells bu also by a
emendous di e si y o bac e ia, a chaea, ungi, and i uses. Such popula ions o mic obes
colonise he gas oin es inal and geni ou ina y ac s, he o al ca i y, he nasopha ynx, he
espi a o y ac , and he skin (50). Indeed, highligh ing hei impo ance, mic oo ganisms a e
esponsible o mo e han 200 g ams o he o al body weigh o an a e age human (70
kilog ams), while app oxima ely 3.8 x 103 o he body’s cells a e con ibu ed by bac e ia and
o he mic oo ganisms (51). The o al ca i y in pa icula has a high abundance o mic obes,
exceeded only by he numbe s p esen in he gas oin es inal ac (52).
Two imp ecise e ms a e usually employed o designa e his g oup o mic oo ganisms: he
“mic obio a” o he “mic obiome”. Howe e , he e is a c i ical di e ence be ween hem in ha
he o me includes he popula ion o mic oo ganisms ha colonises a body pa , while he la e
e e s o he se ing o med by mic obes, hei genes, and hei me aboli es in an ecological
niche (53). As he ocus o his Thesis is on he de ec ion and iden i ica ion o bac e ia in
di e en o al niches, he e m mic obio a is used h oughou .
Ou knowledge o he ae iology and pa hogenesis o pe iodon al diseases has changed o e
ime o ou di e en easons: 1) echnological ad ances in he me hods used o s udy he
mic obes p esen ; 2) he cu en assump ion ha hese condi ions a e caused by bio ilms, and
no by bac e ia in a plank onic s a e, and he adop ion o ecological concep s o s udying he
o al mic obio a; 3) he disco e y o he impac o gene ic and en i onmen al ac o s on he
ini ia ion and p og ession o hese diseases; and 4) ou unde s anding o he ole played by
immune mechanisms (54). As a consequence, se e al mic obial heo ies ha e been p oposed
ALBA REGUEIRA IGLESIAS
74
o he ae iology o pe iodon i is, anging om he “speci ic plaque hypo hesis” o he
“polymic obial syne gy and dysbiosis model” (PSD model) (54,55).
The s udy o he composi ion o he o al mic obio a da es back o 1683, when An ony an
Leeuwenhoek obse ed he mic oo ganisms p esen in human den al plaque using he i s
p o o ype o a mic oscope. Almos wo cen u ies la e , Robe Koch, he a he o mode n
mic obiology, de eloped echniques o p oducing bac e ial cul u es, which allowed him o
sc u inise any changes in he bac e ia p esen o e ime (56). Since hen, as in o he
mic obiology disciplines, o al bac e ia ha e been de ec ed using cul u e-dependen me hods
(57). The i s s udies o he composi ion o den al plaque had used such echniques o iden i y
impo an o ganisms like Fusobac e ium spp., Neisse ia spp., S ep ococcus spp., and
Veillonella spp. (58). None heless, he e a e se e al issues wi h hese adi ional me hods when
i comes o cul i a ing species ha equi e igo ous g ow h condi ions. In ac , only 50% o o al
bac e ia a e cul i able (59). Addi ionally, cul u e-dependen echniques a e expensi e and
labo ious, equi ing expe ienced s a and su icien ime o hei execu ion (57).
The goal o o e coming he la e issue led o he de elopmen o se e al molecula
deoxy ibonucleic acid (DNA)-based echnologies, including DNA mic oa ays and he
polyme ase chain eac ion (PCR) es . These enabled esea che s o analyse o al-mic obio a
communi ies mo e comp ehensi ely and pe o m la ge-scale s udies (57,58). In 1998,
Soc ansky e al. (60) used checke -boa d DNA-DNA-hyb idisa ion echniques o iden i y i e
di e en bac e ial complexes ha had dis inc le els o associa ion wi h heal h and he se e i y
o pe iodon i is. This disco e y was e olu iona y because, un il hen, pe iodon i is, like o he
in ec ious diseases, was hough o be caused by a single pa hogen a he han a se ies o
o ganisms wo king wi h each o he (58). Th ee species in pa icula - P. gingi alis, Tanne ella
o sy hia, and T eponema den icola - we e closely associa ed wi h he clinical pa ame e s o
pe iodon i is and oge he cons i u e he so-called “Red Complex”. This complex has also been
ela ed o o he bac e ia, including Campylobac e g acilis, Campylobac e ec us,
Campylobac e showae, Fusobac e ium nuclea um, Fusobac e ium pe iodon icum,
Pep os ep ococcus mic os, P e o ella in e media, P e o ella nig escens, and S ep ococcus
cons ella us, which collec i ely o m he “O ange Complex”. In con as , membe s o he
“Yellow Complex” (S ep ococcus go donii, S ep ococcus in e medius, S ep ococcus mi is,
In oduc ion
75
S ep ococcus o alis, and S ep ococcus sanguis) and he “Pu ple Complex” (Ac inomyces
odon oly icus and Veillonella pa ula) a e associa ed wi h heal hy s a es.
Figu e 3. Soc ansky’s mic obial complexes in subgingi al plaque.
A PCR es is an in i o molecula echnique ha ampli ies a gene o DNA agmen
di ec ly o a ibonucleic acid (RNA) indi ec ly. A a ian o he PCR, known as a quan i a i e
PCR (qPCR) o eal- ime PCR (RT-PCR), makes i possible o ampli y, and simul aneously
quan i y, he ampli ica ion p oduc ob ained om a sample. In compa ison o adi ional
cul u es, his echnology has been ound o ha e high diagnos ic accu acy when i comes o
de ec ing A. ac inomyce emcomi ans and P. gingi alis (61). Fu he mo e, a qPCR enabled ou
esea ch g oup o ob ain eigh bac e ial clus e -based models wi h good p edic i e accu acy a
iden i ying a si e wi h pe iodon al des uc ion in a pe iodon i is pa ien (62). All o he models
used by ou eam had an a ea unde he cu e (AUC) o ≥0.760 and sensi i i y and speci ici y
sco es o ≥75.0%, wi h he bes alues o he clus e o med by A. ac inomyce emcomi ans, F.
nuclea um, Pa imonas mic a, P. in e media, T. o sy hia and T. den icola (AUC= 0.789;
sensi i i y and speci ici y= 77.5%). O e all, we concluded ha clus e s o med by species ha
had di e en e iopa hogenic oles, i.e., hose belonging o dis inc Soc ansky complexes, had
good p edic i e accu acy o diagnosing pe iodon i is (62).
ALBA REGUEIRA IGLESIAS
76
The human o al mic obe iden i ica ion mic oa ay (HOMIM) is ano he mic oa ay-based
pla o m ha has been u ilised o de ec and iden i y bo h cul i a ed and no -ye -cul i a ed o al
bac e ia (58). Employmen o his ool has enabled species like Fili ac o alocis and P. mic a
o be obse ed mo e equen ly and in highe numbe s in pe iodon i is samples han in heal hy
specimens (63). Howe e , his echnique is cu en ly no longe a ailable
(h p://homings. o sy h.o g/index2.h ml).
These DNA mic oa ay me hods (checke boa d-DNA, DNA-hyb idisa ion, and HOMIM)
a e no wi hou hei limi a ions, since only a ixed numbe o species can be de ec ed in a panel
and a speci ic quan i y o DNA is equi ed o iden i y a mic oo ganism (58). The sequence
analysis o he 16S ibosomal RNA ( RNA) bac e ial gene became he me hod o choice o
o e come hese sho comings. The ampli ica ion o his gene, which is p esen in all p oka yo ic
o ganisms, was achie ed h ough he use o uni e sal p ime s ollowed by a subsequen
sequencing s ep. This enabled he species p esen in a sample o be dis inguished, e en i hey
had no been iden i ied p e iously (58). The cha ac e is ics o his gene will be explained in
de ail in Sec ion I.4.
Ini ial esea ch on sequence analyses o he 16S RNA gene was based on he Sange
me hod, which is one o he so-called “ i s -gene a ion sequencing” echnologies (64). This
echnique used uni e sal p ime s o he 16S RNA gene o ampli y he DNA isola ed om a
specimen. The esul ing amplicons we e cloned in o Esche ichia coli, and he inse s ob ained
we e subsequen ly sequenced o de e mine he iden i ies o he species p esen (56). New
pe iodon i is-associa ed gene a we e disco e ed wi h his echnology, including Desul obulbus
spp., Eubac e ium saphenum, F. alocis, Megasphae a spp., and Pep os ep ococcus spp. (65).
The yea s ha ollowed saw he de elopmen o “second-gene a ion sequencing”
echniques, commonly known as “nex -gene a ion sequencing” (NGS). These enabled massi e
pa allelisa ion and imp o ed au oma ion and speed, and we e also less expensi e (64). I hus
became possible o comple e la ge-scale sequencing p ojec s in jus a ew days o some imes
e en hou s (57). The wo NGS echniques employed he mos - 454 py osequencing and
Illumina - a e desc ibed in dep h in Sec ion I.4.
In oduc ion
77
Ad ances in molecula echniques and he subsequen de elopmen o NGS ools led o an
en i ely new ield o esea ch: omics. Whole-genome sho gun me agenomics, commonly
known as jus me agenomics, allowed esea che s o sequence he comple e DNA (genome) o
a single mic obial cul u e o a complex mic obial popula ion, enabling he gene a ion o
e e ence genomes (57). This p o ided in o ma ion no only on phylogene ic composi ions bu
also on he gene ic po en ial o a communi y o ca y ou dis inc unc ional ac i i ies (58).
Ne e heless, his echnique does no p oduce da a on he ac ion o he me agenome being
exp essed. which can ins ead be ob ained using echniques like me a ansc ip omics,
me ap o eomics, and me abolomics ha , espec i ely, assess he syn hesis o ansc ip s,
p o eins, o he me abolic p oduc s o a speci ic se o ac i i ies (58). The human mic obiome
p ojec (HMP) (2008-2012) la e eme ged as an ini ia i e o he Uni ed S a es (US) Na ional
Ins i u es o Heal h (NIH) and used 16S RNA gene sequencing and me agenomics’ echniques
o ini ially iden i y and cha ac e ise he mic oo ganisms associa ed wi h human heal h in
di e en body pa s, including he o al ca i y (66). The esea ch ound ha mic obial p o iles
a ied signi ican ly, e en be ween heal hy subjec s, meaning ha axonomic cha ac e isa ion
alone is no enough o unco e he ela ionship be ween he mic obio a and he heal hy s a e
(67). In addi ion, me abolic pa hway econs uc ions o me agenomic da a ound ha se e al
pa hways we e ubiqui ous in subjec s and body habi a s (67). Consequen ly, he second phase
o he HMP (2013-2016), known as he In eg a i e HMP, comp ised s udies on dynamic
changes in he mic obio a and hos as a esul o physiological (p egnancy and p e e m bi h)
o pa hological (in lamma o y bowel disease and p e-diabe es) condi ions (68). This esea ch
has ecen ly comple ed i s i s phase (69-71).
Al hough each o hese in eg a i e in es iga ions e ealed new biology wi hin hei
espec i e a eas o heal h and disease, a su p ising ange o immune and ecological ea u es o
he hos mic obio a we e commonplace (72). The combina ion o sho gun me agenomics,
un a ge ed me abolomics, and immuno-p o iling measu emen s ha e e icien ly cap u ed he
hos and mic obial p ope ies linked o disease. As in mos s udies o he mic obio a, changes
ha occu ed wi hin indi iduals, popula ions, o pheno ypes we e o en much smalle han he
baseline a ia ions be ween hem. Acco dingly, i is clea om his esea ch ha heal h-
associa ed mic obio a in e ac ions in indi iduals can mani es in ex emely di e se ways (72).
ALBA REGUEIRA IGLESIAS
78
Each o he in eg a i e HMP s udies ound ha o he aspec s o hese in e ac ions a e highly
localised and subjec -speci ic. Mic obial changes and associa ed hos esponses in he h ee
condi ions (indi iduals, popula ions, o pheno ypes) we e s onges when cap u ed a he ime
he changes occu ed and, o en, wi hin he issue o o igin. I is e iden om hese and o he
in es iga ions ha hos -mic obio a in e ac ions ha e bo h localised and sys emic e ec s. The
NIH’s HMP has now come o an end bu has e ealed mul iple new a enues o esea ch and
echnologies o s udies in he u u e (72).
Figu e 4. The i s and second phases o he Human Mic obiome P ojec . The image was aken om The
In eg a i e HMP Resea ch Ne wo k Conso ium (72), an open-access a icle dis ibu ed unde a C ea i e
Commons A ibu ion 4.0 In e na ional (CC BY 4.0) license (h ps://c ea i ecommons.o g/licenses/by/4.0/).
Acco ding o he adi ional Soc ansky iewpoin , a se o Red Complex bac e ia is hough
o be he causa i e agen behind pe iodon i is (60). Now, howe e , NGS and omics’
echnologies and echniques ha e de ec ed he p esence o bac e ia like P. gingi alis in he
absence o disease (73,74). I has also been ound ha he pe iodon al mic obio a is mo e
he e ogeneous and di e se han p e iously hough , wi h new componen o ganisms iden i ied
(75,76). These esul s ha e con i med he hypo hesis ha pe iodon i is is ini ia ed by he PSD
o he en i e mic obial communi y (55). The PSD model s a es ha di e en membe s o
speci ic gene combina ions pe o m dis inc oles o shape and s abilise disease-p o oking
mic obio a. O pa icula ele ance a e he so-called “keys one pa hogens”, which impai he
In oduc ion
79
hos ’s immune esponse and ele a e he i ulence o he en i e communi y h ough in e ac i e
communica ion wi h accesso y pa hogens. This dysbio ic mic obial communi y is mainly
composed o anae obic gene a om he phyla Bac e oide es, Fi micu es, P o eobac e ia,
Spi ochae es, and Syne gis e es (77). Consequen ly, while P. gingi alis is ega ded as a
keys one pa hogen, S. go donii and T. o sy hia a e iewed as accesso ies (77).
Figu e 5. Polymic obial syne gy and dysbiosis in pe iodon i is. The image was aken om Hajishengallis (77)
wi h he pe mission o Sp inge Na u e.
I.3.2. Hos esponse
As no ed p e iously, pe iodon i is is conside ed o be an in lamma o y disease ini ia ed by
bac e ia. Howe e , despi e he ad ances made in bo h pe iodon al mic obiology and
pa hobiology, he issue o which comes i s - he in lamma o y esponse o he change o a
dysbio ic subgingi al mic obio a - is s ill a ma e o deba e (78).
ALBA REGUEIRA IGLESIAS
80
In physiological condi ions, he e is a balance be ween he local immune esponse and he
mic obio a. Bac e ia a e undoub edly he p incipal cause o gingi i is, bu i is he uncon olled
hos -in lamma o y and hos -immune esponses ha la gely d i e issue des uc ion, i.e., he
p og ession o he disease (79).
I is impo an in s udies o he pa hogenesis o pe iodon i is o conside he empo al
sequence o mic obio a changes on he way o pe iodon al in lamma ion (78). The mic obial
shi s induced by in lamma ion go beyond he o e g ow h o ce ain species. Indeed, g ow h
condi ions also p o ide an en i onmen ha changes he physiology, pa hogenici y, and
exp ession o he i ulence ac o s o he polymic obial bio ilm communi y (79). Consequen ly,
he in lamma o y esponse and he esiden mic obio a a e linked in a bi-di ec ional balance
s a e in heal h and an imbalance s a e in disease (78). I he cons an in e play be ween mic obes
and he hos in lamma o y esponse is iewed as a con inuum, i is hus e iden ha speci ic
bac e ia canno be ega ded as ini ial causal agen s in he pa hogenesis o pe iodon i is (78).
In a ecen ly published e iew, Van Dyke e al. (78) p esen ed a new model o he
pa hogenesis o pe iodon i is. Scien i ic e idence led hem o conclude ha ch onic
in lamma ion enables he de elopmen o a pe iodon al pocke ha changes he edox and
nu ien en i onmen , he eby inc easing he di e si y and species ichness o he bio ilm. This
esul s in dysbiosis, which ein o ces and exace ba es in lamma ion as a way o ini ia e bone
eso p ion. In ligh o bo h how in lamma ion media es dysbiosis and he associa ed
exace ba ion o pe iodon al damage, he “in lamma ion-media ed polymic obial-eme gence
and dysbio ic-exace ba ion” (IMPEDE) model was, he e o e, p oposed by Van Dyke’s eam
(78). This is designed o complemen he cu en classi ica ion o pe iodon al diseases (CPD)
app oach (4) and sugges s ha in lamma ion can be p esen o each classi ica ion s age as a
p incipal d i e o he clinical condi ion.
The IMPEDE model ecognises i e s ages (0–4) h ough which heal h, gingi i is, and
pe iodon i is may de elop, be con ained, o p og ess. These s ages a e as ollows: 0) pe iodon al
heal h; I) gingi i is; II) ini ia ion o o ea ly pe iodon i is; III) in lamma ion-media ed dysbiosis
and oppo unis ic in ec ion; and IV) la e-s age pe iodon i is. As se ou in igu e 6.B,
in lamma ion-media ed polymic obial dysbiosis and issue damage can be exace ba ed i no
In oduc ion
87
Al hough o he molecula ma ke s a e a ailable, he e a e se e al easons why he 16S
RNA gene has been ega ded as de ini i e (86). Fi s , i is p esen in all bac e ia. Mo eo e , i s
s uc u e and unc ion ha e emained cons an o e ime, sugges ing ha sequence al e a ions
e lec andom changes. These changes occu slowly enough ha esea che s can ob ain da a
on all he p oka yo es. Mo eo e , he a iabili y is such ha bo h dis an and close o ganisms
can be dis inguished. In addi ion, he ela i ely la ge size (1500 base pai s -bps-) o he gene
makes i sui able o in o ma ic pu poses, and he conse a ion in i s seconda y s uc u es
a ou s accu a e alignmen . Finally, he ease wi h which he gene can be sequenced means ha
ex ensi e, and cons an ly expanding, da abases a e a ailable.
None heless, he employmen o his gene as a phylogene ic ma ke has i s limi a ions. One
o he mos impo an is he p esence o a ia ions in he 16S RNA ope on copy numbe s pe
bac e ial genome, wi h alues anging om 1 o 15 (87,88) o 1 o 17 (89). A highe 16S RNA
ope on copy numbe pe genome o a speci ic axon will o e es ima e i s ela i e and absolu e
abundance alues (89). Al hough he numbe o copies appea s o be axon-speci ic, he e a e
also a ia ions among s ains o he same species (87). Fu he mo e, he 16S sequences ob ained
om he same species o wi hin he same genome a e o en di e en . I was gene ally accep ed
ha wo gene sequences di e ing by 1 o 1.3% o mo e ep esen ed wo dis inc species (90).
Ne e heless, Pei e al. (91) obse ed ha 24 o he 586 species hey analysed had an
in agenomic di e si y highe han 1-1.3%. Ano he in es iga ion e alua ed he comple e
genomes o 2013 bac e ia and a chaea and e ealed ha he e was in agenomic he e ogenei y
in 952 o hem (88). E en hough he majo i y o he di e gence was below 1%, 119 genomes
p esen ed wi h highe alues (88). As in agenomic he e ogenei y is belie ed o o e es ima e
mic obial di e si y, hese au ho s ecommended using p ime s a ge ing egions 4 and 5, which
had he ewes a ia ions (88).
I.4.2. DNA Sequencing echniques
DNA sequencing is he p ocess ha allows he nucleo ide sequence o a DNA sample o
be de e mined. Al hough he double helix s uc u e o DNA was disco e ed in 1953, i was no
un il he 1970s ha he i s sequence o he human genome was ob ained using i s -gene a ion
sequencing echniques (64). The i s wo me hods o DNA sequencing we e epo ed in 1997:
“chemical clea age sequencing”, de eloped by Maxam and Gilbe (92), and “chain e mina o
ALBA REGUEIRA IGLESIAS
88
o Sange sequencing”, which was disco e ed by Sange and colleagues (93). Due o i s
simplici y and eliabili y, he la e app oach has been he gold s anda d o e he las h ee
decades (94,95).
The Sange echnique belongs o he sequencing-by-syn hesis me hods, which means ha
i uses he DNA syn hesised by he DNA polyme ase o iden i y he ni ogenous bases p esen
in a DNA sequence. In addi ion o he ou deoxy ibonucleo ide- iphospha es (dNTPs: dATP,
dCTP, dGTP and dTTP), he sequencing eac ion employs speci ic chain- e mina o
dideoxynucleo ides (ddNTPs), i.e., nucleo ides ha lack a 3’-OH g oup (64). The inco po a ion
o a ddNTP in o a g owing DNA molecule hampe s he in eg a ion o a new nucleo ide, as no
phosphodies e bond can be o med because o he absence o he 3’-OH g oup. This means
ha he DNA syn hesis is in e up ed in ha posi ion (64,95). A e se e al epe i ions, his
echnique in ol es he p oduc s o he eac ions being loaded in an aga ose gel and subjec ed
o elec opho esis. The o de ed banding pa e n hus ob ained enables he sequence o he DNA
empla e o be de e mined.
O e ime, he Sange me hod has inco po a ed a se ies o inno a ions in ol ing he
au oma ion o he p ocess using luo escen e mina o dyes linked o he ddNTPs and he
de elopmen o so wa e o in e p e and analyse he sequences (95). Consequen ly, he me hod
is s ill aluable when high- h oughpu is no equi ed. The leade in he ield o au oma ed
Sange -sequencing is Applied Biosys ems, whose cu en comme cial sequence s can gene a e
600-1000 bps o a p ope sequence (95).
The con ibu ion o he Sange app oach o scien i ic ad ances in di e se a eas has been
in aluable. In 2001, he ield o pe iodon al mic obiology saw Pas e e al. (96) use he me hod
in he i s comp ehensi e cha ac e isa ion o he subgingi al mic obio a. The au ho s ound
ha he subgingi al niche ha bou ed 347 species, 215 o which we e no el phylo ypes. They
also es ima ed he numbe o unseen species in he popula ion and de e mined ha he e we e
68 addi ional axa, accoun ing o a o al numbe o 415 subgingi al species.
In oduc ion
89
As is al eady known, he yea s ha ollowed saw he de elopmen o second-gene a ion
echnologies, e olu ionising he s udy o mic obial di e si y. Desc ibed below a e he wo
NGS echniques used he mos o examine he human mic obio a.
I.4.2.1. 454 py osequencing
The i s NGS applica ion, known as 454, was in oduced in 2005 by he bio echnology
i m 454 Li e Sciences, which was bough by Roche wo yea s la e (58,64). The echnology
comp ises an ini ial emulsion PCR s ep, ollowed by subsequen py osequencing, which is a
me hod o DNA-sequencing-by-syn hesis based on he gene a ion o ligh a e nucleo ides a e
inco po a ed in a g owing DNA chain (64,94). The p ocess o 454 py osequencing is as ollows
(94):
The DNA is isola ed, agmen ed, liga ed o special adap e s, and sepa a ed in o single
s ands.
The DNA is ampli ied using emulsion PCR. The emulsion con ains: he PCR eagen s,
he DNA empla e o be sequenced, he cap u e beads wi h he p ime s a ached o
hem (complemen ing one o he adap o s), and ano he p ime o he PCR.
Emulsi ica ion akes place a e con olled and igo ous agi a ion o he oil-wa e
sys em. Millions o aqueous d ople s a e o med, wi h he ampli ica ion occu ing
inside hem. Op imisa ion o he p ocess gua an ees ha he e is only one empla e and
one bead in each d ople , meaning ha millions o copies o he empla e a e gene a ed
on each bead.
The DNA is dena u ed and he beads con aining single s ands a e ans e ed o he
wells o a pico i e pla e. Only one bead is deposi ed in each o he se e al hund ed
housand wells.
The DNA is sequenced h ough syn hesis. This s ep equi es: a single-s anded DNA
sample, he sequencing p ime , and he enzymes DNA-polyme ase, adenosine
iphospha e (ATP) sul u ylase, luci e ase, and apy ase. Two subs a es a e also
included in he eac ion: adenosine 5’ phosphosul a e (APS) and luci e in. Cycles a e
hen pe o med whe e each well ecei es, sequen ially, one dNTP a a ime. I he e is
complemen a i y, he DNA polyme ase ca alyses he inco po a ion in o he DNA
s and. The polyme ase in oduces a dNTP in o a DNA nascen molecule, eleasing
py ophospha e (PPi) in an amoun equi alen o he quan i y o he inco po a ed
ALBA REGUEIRA IGLESIAS
90
nucleo ide. The ATP sul u ylase con e s he PPi in o ATP in he p esence o APS.
Such an ATP is u ilised by he luci e ase o u n luci e in in o oxyluci e in. This s ep
p oduces ligh a an in ensi y p opo ional o he amoun o ATP used. The ligh is
de ec ed by a came a and egis e ed as a peak in a py og am, wi h he heigh o he
peak being p opo ional o he numbe o inco po a ed nucleo ides.
The sys em is egene a ed by he enzyme apy ase, which deg ades he ATP and he
uninco po a ed dNTPs. The nex nucleo ide is hen added. As he p ocess ad ances,
he complemen a y DNA s and g ows and he nucleo ide sequence is de e mined
acco ding o he py og am alues.
In oduc ion
91
Figu e 9. The 454-py osequencing app oach o ampli ying single-s anded DNA copies om a agmen
lib a y on aga ose beads. The image was aken om Ma dis e al. (97) wi h he pe mission o Annual Re iews,
Inc.
O e he yea s, 454 Li e Sciences has inc eased he leng h o i s sequence eads and he
numbe o bases pe un. I s ini ial ools yielded sequence eads o 100 bps and up o 60 million
bases pe un. La e on, hese sequence- ead and bases-pe - un igu es eached 400 bps and
app oxima ely 500 million, espec i ely, on he company’s well-known Genome Sequence
(GS) FLX Ti anium pla o m (94); subsequen ly, ead leng hs up o 700 bps and an ou pu o
700 mega bps (Mbps) we e a ailable wi h he GS FLX + se ies (98).
ALBA REGUEIRA IGLESIAS
92
The capaci y o ob ain a high numbe o eads in a single un is one o he main ad an ages
o he 454 echnology o e he Sange echnique, as i enables he acquisi ion o much mo e
sequence da a (94). As mo e eads a e gene a ed in a single un, he cos pe base is much lowe
han wi h he Sange me hod. Fu he mo e, as he cloning s ep is no equi ed wi h he 454
echnology, he bias inhe en in ha p ocedu e a e a oided (94). Py osequencing’s use o
“ba codes” (sequences in oduced in o he PCR p ime s) ha wo k as unique sample iden i ie s
enables sequences om di e en samples o be mixed in he same un. This inc eases e iciency
and he numbe o ou pu s and also educes cos s (94).
The high- h oughpu o he 454 echnology a ec s bo h he dep h (numbe o sequences
pe sample) and b ead h (numbe o samples e alua ed) o he sampling (94). A g ea e
sampling dep h inc eases he oppo uni ies a ailable o de ec ing low-abundance o a e
communi y membe s, while mo e b ead h allows addi ional samples o be analysed. This means
ha he esul s a e mo e obus o compa ison pu poses (94). I he goal o a s udy is o
de e mine he composi ion o a communi y a dis inc si es, such as he skin s. he o al-cheek
mucosa, mo e samples should be s udied han mo e sequences pe sample (99). In con as , i
specimens om he same si e o one close-by (i.e., he oo h su ace s. he gingi al c e ice)
a e being compa ed, deepe sequencing is equi ed o iden i y mino di e ences in he
communi y’s composi ion (100).
Py osequencing also has limi a ions. One o he mos impo an is ela ed o he de ec ion
o long homopolyme s, which can lead o sequencing bias and an a i icial inc ease in he
ichness es ima o s (94). The eagen cos is ano he no able d awback (64).
In 2013, Roche made he decision o close 454 Li e Sciences because i s echnology was
no longe compe i i e. Reagen s a e, howe e , s ill a ailable om se e al supplie s (95).
I.4.2.2. Illumina
The i s Solexa sequence , named Genome Analyze , was launched in 2006. Illumina
acqui ed he company a yea la e and, since hen, has b ough a numbe o di e en sequence s
o he ma ke , wi h da a ou pu a es mo e han doubling annually (101): he ini ial Genome
Analyze could sequence 1 giga bps (Gbps) o da a in a single un; by 2014, his igu e had
In oduc ion
93
inc eased o 1.8 e a bps (Tbps) wi h he HiSeqX Ten sequence (101) o 6 Tbps wi h he
No aSeq6000 (98).
Cu en ly, Illumina is undoub edly he NGS echnique used he mos (58,95). Like he 454
echnology, i is based on he sequencing-by-syn hesis p inciple (64,94), and esembles he
Sange me hod in ha i also elies on he inco po a ion o dye e mina o nucleo ides in o he
sequence (94). Howe e , he Illumina e mina o s a e e e sible, meaning ha he
polyme isa ion can con inue e en a e he luo opho e de ec ion. The wo k low o his
echnology is as ollows (64,101):
Lib a y p epa a ion: he DNA o cDNA sample is agmen ed andomly and hen
liga ed o wo dis inc ypes o adap o a he 5’ and 3’ ends. Al e na i ely, he
agmen a ion and liga ion eac ions can be combined in a single s ep
(“ agmen a ion”), which inc eases he e iciency o he p ocess. The nex s ages,
ampli ica ion and sequencing, ake place in a solid su ace called “Flow cell”.
Clus e gene a ion employed o ampli y DNA using b idge PCR. The agmen s o he
DNA empla e a e dena u ed and he single s ands a e deposi ed in he low cell, he
su ace o which is co e ed wi h p ime s ha complemen he adap o s. This
complemen a i y enables he c ea ion o b idges by joining he adap e s o he p ime s
(Figu e 10.B). The PCR eagen s a e hen inco po a ed (i.e., he nucleo ides and he
DNA polyme ase) and each agmen is ampli ied in o dis inc clonal clus e s ia
b idge ampli ica ion. When he second s and is o med, he DNA is dena u ed again
so ha new ampli ica ion cycles can be pe o med. I has been calcula ed ha clonal
clus e s comp ising abou 1000 copies o each DNA agmen can be ob ained;
meanwhile, each low cell can suppo millions o pa allel clus e eac ions (95).
Re e sible e mina ion sequencing: when he clus e gene a ion is comple e, empla es
a e hen eady o sequencing using e e sible e mina o nucleo ides. Each dNTP is
ma ked wi h a di e en luo escen molecule, allowing all ou o hem o be added a
he same ime. The complemen a y nucleo ides a e hen inco po a ed and hose ha
a e no a e elimina ed. A e lase exci a ion, he emi ed luo escence is eco ded by
a ou -channel luo escen channel and he i s base is iden i ied. A su ace chemical
ea men emo es he luo escen dye om he inco po a ed nucleo ides. This unlocks
he 3’ ca bon, enabling a new e sion o be used o con inue he sequencing eac ion.
ALBA REGUEIRA IGLESIAS
94
The eac ions a e epea ed o 300 o mo e ounds (95). S acking and o e lying he
images ob ained om all he cycles enables so wa e o econs uc he sequence o
he DNA empla e agmen .
Figu e 10. The Illumina sequencing p ocess. The image was aken om Ma dis e al. (97) wi h he pe mission
o Annual Re iews, Inc.
Illumina p oduces a a ie y o sequencing ools o di e en applica ions. These include
genomic sequencing, a ge ed sequencing, me agenomics, ch oma in immunop ecipi a ion
In oduc ion
95
(ChiP) sequencing, RNA sequencing, and me hyla ion sequencing (95,101). As s a ed abo e,
he dis inc pla o ms ha e a ying h oughpu le els: MiniSeq -7.5 Gbps o da a wi h 25
million eads/ un and ead leng hs o 2x150 bps; MiSeq - 15 Gbps wi h 25 million eads/ un
and ead leng hs o 2x300 bps; and Nex Seq - 120 Gbps wi h 400 million eads/ un and ead
leng hs o 2x150 bps (95).
Unlike he 454 echnology, which sequences in one di ec ion, he Illumina ools ely on
“pai ed-end sequencing”, whe e bo h ends o he DNA agmen s a e sequenced and he
o wa d and e e se eads a e aligned as ead pai s. So, using he MiSeq pla o m, a inal leng h
o 600 bps would be ob ained a e joining wo 300-bp s ands, which is ep esen ed by 2x300
bps. As well as p oducing double he numbe o eads in he same ime and o he same e o
conce ning he lib a y p epa a ion, sequences a anged as ead pai s enable mo e accu a e
alignmen and he abili y o de ec inse ion-dele ion a ian s (101). Finally, pai ed-end
sequencing also acili a es he de ec ion o genomic ea angemen s and epe i i e sequence
elemen s like gene usions and no el ansc ip s
(h ps://emea.illumina.com/science/ echnology/nex -gene a ion-sequencing/plan-
expe imen s/pai ed-end- s-single- ead.h ml?langsel=/es/).
Figu e 11. Pai ed-end sequencing and alignmen . The image was aken om Illumina Inc. (101) wi h he
pe mission o Illumina, Inc.
A u he ad an age o he Illumina echnology is ha he ou dNTPs a e p esen du ing
each sequencing cycle, meaning ha na u al compe i ion minimises inco po a ion bias and
educes aw e o a es. As a esul , i is possible o achie e highly accu a e base-by-base
sequencing ha almos elimina es sequences’ con ex -speci ic e o s, e en in epe i i e egions
and homopolyme s (101). Mo eo e , due o i s di ec a he han came a-based imaging,
luo escen eco ding imp o es he de ec ion speed (95).
ALBA REGUEIRA IGLESIAS
96
Ne e heless, issues may a ise wi h Illumina sequencing. Fi s , ex eme base composi ions,
i.e., guanine-cy osine (GC)-poo o GC- ich sequences, lead o an une en co e age o e en no
co e age o he eads ac oss he genome (102). Fu he mo e, he amoun o empla e-DNA
employed has o be quan i ied accu a ely o p e en he “o e clus e ing” o he sys em. An
analysis o he sequencing e o s gene a ed du ing he p ocess can, howe e , be pe o med o
iden i y he eal sequence a ian s and he p o ocol-induced a e ac s (95).
A common disad an age o NGS echniques is ha he leng h o he eads p oduced migh
no be as long as equi ed, hampe ing he iden i ica ion o bac e ia (94). Indeed, genomes o en
con ain nume ous epea ed sequences ha a e longe han he eads ob ained wi h he
echnology, which may lead o misassemblies and gaps (103). Howe e , al hough i is necessa y
o sequence he en i e 16S RNA gene o eliably iden i y some species and desc ibe new ones,
i is accep ed ha jus sequencing he ini ial 500-bp egion is su icien o dis inguishing a high
numbe o bac e ia (104). Wha is mo e, changes in communi y composi ion can be assessed
using gene agmen s as small as 100 bps (105). As mos o he NGS pla o ms ha a e cu en ly
employed gene a e sho eads, bac e ial iden i ica ion using hese me hods has ocused on he
hype a iable egions o he 16S gene which a e, as is al eady known, ex emely in o ma i e
(94). None heless, NGS ools like GS FLX Ti anium o GS FLX + can achie e ead leng hs o
mo e han 400 bps and up o 700 bps, espec i ely.
A inal issue wi h sho eads ela es o he de ec ion and cha ac e isa ion o la ge s uc u al
a ia ions (SVs), which can be challenging. Smalle a ian s, like single-nucleo ide a ia ions
(SNVs) and sho indels, can howe e be iden i ied wi h g ea e accu acy (103).
In conclusion, each o he NGS echniques has i s pa icula i ies, and ge ing he mos ou
o hem equi es esea che s o s ike a balance be ween a ge size, ead leng h, dep h, sequence
accu acy, usabili y, and cos (105).
I.4.3. Thi d-gene a ion sequencing
Al hough NGS me hods ha e e olu ionised biology, he e was ne e heless a need o
de elop new echniques capable o o e coming he d awbacks desc ibed abo e (103). The shi
om “long ead” (e.g., au oma ed Sange ) o “sho ead” (e.g., Illumina) echnologies has led
In oduc ion
103
An al e na i e ou h-gene a ion echnique is a spa ial ansc ip omics. This enables he
isualisa ion and quan i a i e analysis o he ansc ip ome, wi h spa ial esolu ions in
indi idual issue sec ions (113). Speci ically, his me hod combines in-si u ansc ip mapping
wi h ex-si u ansc ip iden i ica ion by way o NGS (112).
These ou h-gene a ion echnologies, al hough s ill in hei in ancy, a e now being used in
p ojec s aiming o un a el he unc ions o he b ain as well as in cance esea ch (112).
ALBA REGUEIRA IGLESIAS
104
I.5. ANALYSIS OF SEQUENCING RESULTS
The NGS pla o ms gene a e a huge amoun o genomic da a ha is unmanageable wi h an
o dina y compu e , meaning ha in o ma ics has become i al o p ocessing and analysis
pu poses (114). In pa allel wi h he use o high- h oughpu 16S RNA gene sequencing,
bioin o ma ics has eme ged as a discipline ha concep ualises biology in e ms o
mac omolecules and hen applies in o ma ic echniques (applied ma hs, compu e science, and
s a is ics) o unde s and and o ganise he huge amoun o da a associa ed wi h hese molecules
(115). In o he wo ds, i is he ool used o make sense o sequencing esul s: signals a e
con e ed o da a, da a o in e p e able in o ma ion, and in o ma ion in o ac ionable knowledge
(116).
The concep o a pipeline e e s o a se o bioin o ma ic algo i hms execu ed in a
p ede ined sequence o p ocess NGS da a. Acco dingly, he da a low is ans o med in o a
p ocess comp ised o se e al sequen ial phases whe e he inpu o each is he ou pu o he
p e ious s age. Di e en local o web-based so wa e packages ha e been de eloped o manage
he amplicon sequence da a om NGS, including he commonly used quan i a i e insigh s in o
mic obial ecology (QIIME) (117), mo hu (118), and he ibosomal da abase p ojec (RDP)
pipeline (119). QIIME 2 has ecen ly eme ged (120); he i s e sion is he e o e no longe
suppo ed, as e o s a e now ocused en i ely on i s successo (h p://qiime.o g/). This new
pipeline has he po en ial o se e no only as a ma ke -gene analysis ool, bu also as a
mul idimensional and powe ul da a-science pla o m ha can be quickly adap ed o analyse
di e se mic obiome ea u es. I also makes use o many new in e ac i e isualisa ion ools ha
acili a e explo a o y analyses and he epo ing o esul s. Fu he mo e, QIIME 2 p o ides a
so wa e-de elopmen ki ha can be used bo h o in eg a e he echnology wi h o he sys ems
and de elop in e aces a ge ed owa ds use s wi h di e en le els o compu a ional knowledge
and expe ience (120).
Rega dless o he so wa e o pla o m employed, he comple e bioin o ma ics p ocessing
o 16S RNA gene amplicon da a usually encompasses h ee s eps: 1) he p e- ea men o
quali y il e ing o aw sequence da a; 2) he cons uc ion o ope a ional axonomic uni s
(OTUs) o single-nucleo ide esolu ion able and 3) ad anced da a analysis and isualisa ion
(98,121) (Figu e 15).
In oduc ion
105
Figu e 15. Example o a low cha o a 16S RNA gene amplicon da a analysis pipeline using OTUs. The image
was aken om Ju and Zhang (121) wi h he pe mission o Sp inge Na u e.
I.5.1. P e- ea men o aw sequence da a
The sequencing p ocess gene a es a s bina y ile. This p o ides gene al in o ma ion on a
un (numbe o lows, o de o he nucleo ides in he lows…) and ollows i up wi h a
desc ip ion o each un sequence, indica ing he posi ion whe e i was gene a ed, he pipeline
used, and he o al numbe o bases. I also p o ides in o ma ion on he bases inco po a ed and
he quali y assigned o each o hem. The pipeline ans o ms he s ile in o eadable as a and
qual e sions by applying a pa icula command (121). This enables he i s s ep o begin, i.e.,
p ocessing he aw ba coded sequence da a, which is a p ocess known as demul iplexing. Once
his phase has been comple ed, all he aw sequence da a can be now demul iplexed, which is a
p ocedu e ha se s i in o indi idual subse s belonging o di e en samples based on speci ic
ba codes (121).
Raw eads a e hen quali y il e ed by applying c i e ia such as he minimum a e age
quali y sco e allowed in a ead, he maximum numbe o ambiguous bases, he minimum and
maximum sequence leng hs, and he maximum leng h o homopolyme and maximum
misma ches in he p ime o ba codes (121). Nex , he sequence-alignmen s ep de e mines
ALBA REGUEIRA IGLESIAS
106
whe e each sho DNA sequence aligns wi h he e e ence genome, i.e., he 16S RNA gene
(122). This makes i possible o disce n he loca ion o he sequenced agmen in he gene.
The PCR ampli ica ion and sequencing can in oduce bias in o he p ocess, including PCR
single-base e o s, PCR chime as, and sequencing e o s, which mus be checked and emo ed
(121). I his is no done, he ue di e si y o he bac e ial communi y would be o e es ima ed.
Pa icula a en ion should be paid o he chime as o chime ic amplicons. These a e a i icial
DNA sequences gene a ed du ing PCR ampli ica ion and consis o a combina ion o wo (o
mo e) ue unde lying sequences (84). They appea when he ex ension s ep o an amplicon is
b ough o an end, wi h he sho p oduc ob ained unc ioning as a p ime in he nex PCR
cycle. This amplicon anneals o he inco ec DNA empla e and con inues he ex ension,
syn hesising a single sequence sou ced om wo di e en empla es. These chime ic amplicons
can be o e ampli ied in he s eps ha ollow hose desc ibed, hus c ea ing un eal axa and
dis o ing he esul s.
AmpliconNoise (123) and Denoise (implemen ed in QIIME) a e wo o he mos widely
used so wa e applica ions o emo e o co ec he PCR and any sequencing e o s; meanwhile,
Chime aSlaye (124) (QIIME de aul me hod) and UCHIME (125) (mo hu de aul me hod)
a e some o he ools employed o il e he PCR chime as (121).
I.5.2. Sequence clus e ing
The second s ep in p ocessing he 16S RNA gene amplicon da a begins by clus e ing he
clean sequences in o OTUs. An OTU is a clus e o o ganisms ha a e simila a he sequence
le el beyond a pa icula h eshold, and which a e in ended o co espond o axonomic clades
(84,126). Sequence di e ences in he selec ed a iabili y adius a e assumed o be due o he
a ia ion wi hin he axonomic g oup o o andom sequence noise (127), which a oids he
p oblem o di e en ia ing biological om echnical sequence a ia ions bu a he cos o
axonomic esolu ion (128).
Se e al iden i y cu -o s ha e been used o he di e en axonomic anks. Typically,
sequences a e clus e ed a he ≥97% simila i y h eshold, which has been con en ionally
ega ded as he species-le el co esponden (98,129). Con e sely, he MEGAN pipeline
ecommends h esholds o ≥99% and ≥97% o he species and genus le els, espec i ely (121).
In oduc ion
107
None heless, he sequence-simila i y le els used a e imp ecise measu es o an imp ecise
concep o a “species”, and he sequence iden i y o a gi en egion o he 16S RNA gene does
no e lec he p ecise iden i y o he en i e gene (105).
The assignmen o sequences o OTUs is known as “binning” (84), and nume ous OTU
clus e ing algo i hms ha e been in eg a ed in o he popula sequence-analysis pipelines, such
as QIIME2 (120), mo hu (118), and USEARCH (130). O e all, hey use h ee di e en
s a egies (121):
De no o: sequences a e clus e ed wi hou a e e ence da abase.
Closed e e ence: sequences a e ma ched agains a e e ence da abase; hose
unma ched a he gi en iden i y cu -o a e disca ded.
Open e e ence: sequences a e i s picked o closed- e e ence OTUs and he
unma ched eads a e subsequen ly clus e ed o de no o OTU e sions.
Cu en ly, he e is mixed e idence on which s a egy is bes when a emp ing o de ine
OTUs and e eal he obse a ions closes o he ue communi y (131). Al hough he de no o
app oach enables he explo a ion o uncha ed e i o ies in he mic obio a (105) and has been
shown o c ea e highe quali y OTU classi ica ions (132), he e e ence-based me hod has
se e al ad an ages. Fi s , sequence da a om di e en gene egions, o gene a ed om dis inc
sequencing echnologies, can be combined using e e ence da abases (105). In hese cases, de
no o OTU-picking migh w ongly assign he same o ganisms o di e en OTUs based solely
on a ia ions in he DNA egion ampli ied o in he sequencing echnique (105). Second, he
e e ence-based app oach is inc easingly aluable as he scope o publicly a ailable da a is
expands, enabling new esea ch o be in e p e ed in he con ex o exis ing s udies (105).
Picking OTUs agains a e e ence da abase can also diminish he impac o chime as and noise
da a (105).
Howe e , a single OTU can con ain g oups o sequences ha could be indi idually
assigned o di e en , ela ed axon (98) and he h ee OTU clus e ing app oaches p oduce
di e en esul s in e ms o ob aining OTUs, e en when using he same da ase (132,133).
Mo eo e , he same me hod can yield dis inc esul s a e only a mino pa ame e change (134).
ALBA REGUEIRA IGLESIAS
108
Mo e ecen ly, dis inc e o -co ec ion o denoising app oaches ha e become a ailable,
which a e based on algo i hms ha use a single-nucleo ide esolu ion (i.e., 100% sequence
simila i y) by gene a ing amplicon sequence a ian s (ASVs), hus imp o ing he axonomic
de e mina ion (128). These me hods a emp o model he e o o he sequence and o clus e
eads in a way ha hei dis ibu ion wi hin clus e s is consis en wi h such e o (127).
Among he mos widely-known ASV-based pipelines he e a e DADA2, Deblu , and
UNOISE (135-137); and hey di e in how he abo e-men ioned co ec ion is done (128). Fo
example, DADA2 gene a es a pa ame ic e o model ha is ained on he en i e sequencing
un and hen applies ha model o co ec and collapse he sequence e o s in o ASVs (135).
Fo i s pa , Deblu aligns sequences oge he in o “sub-OTUs” and, based on an uppe e o
a e bound along wi h a cons an p obabili y o indels and he mean e o a e, emo es
p edic ed e o -de i ed eads om neighbo ing sequences (136). Also, he UNOISE3 pipeline
uses a one-pass clus e ing s a egy ha depends on wo pa ame e s wi h p e-se alues ha we e
cu a ed by i s au ho o gene a e “ze o- adius OTUs” (137). Las ly, o he algo i hms use he
100% sequence simila i y o c ea e oligo ypes, o minimum en opy decomposi ion nodes
(138). Despi e he di e en nomencla u es indica ed by he espec i e esea che s o e e o
he clus e s, hey all a e commonly known as ASVs.
Di e en in es iga ions ha e compa ed he wo sequence clus e ing app oaches o disce n
which pe o ms be e (127,128,139-142). In hese s udies, au ho s con as ed one (128,140-
142), wo (127) o h ee (139) OTU o one (140,142), wo (141) o h ee (127,128,139) ASV
clus e ing me hods, using sequences de i ed om mock (127,128,139,141), human gu
(128,139,141), sh imp gu (142) and soil (128) samples. Also, o he esea che s used 16S RNA
gene sequences om he RNA ope on copy numbe da abase ( nDB) o i s analysis
(140,143). In gene al, he ASV pipelines had demons a ed supe io sensi i i y, speci ici y, and
p ecision, and lowe spu ious sequence a es when compa ed o OTU algo i hms (127,139).
Mo eo e , hey allow o easie in e -s udy in eg a ion o biological ea u es as he ASVs ha e
in insic meaning independen o he e e ence da abase used, con a y o he s udy-speci ic
na u e o OTUs (139,144). S ill, ASV-le el pipelines a e no ee o limi a ions and can ail o
dis inguish e y closely ela ed ue biological sequences and clump hem oge he in o a single
ASV (139). Also, when analysing 16S RNA gene da a, Schloss (140) has ecen ly a i med
In oduc ion
109
ha he isk o spli ing a single genome in o sepa a e clus e s when using ASVs is o highe
impo ance han he isk o g ouping oge he ASVs om dis inc axa in o he same OTU.
Las ly, he e is no consensus ega ding he in luence o he me hod chosen on he di e si y
esul s ob ained. Meanwhile, some au ho s ob ained mino di e ences be ween pipelines using
he wo clus e ing me hods, wi h compa able alpha- and be a-di e si y p o iles (concep s ha
will be u he explained) (141,142); o he s e idenced dis inc esul s e en among hose om
he same app oach (128,139). In ac , Nea ing e al. (128) ound ha , despi e he simila gene al
communi y s uc u es, he alpha-di e si y me ics a ied conside ably among all pipelines
e alua ed, e en wi hin he ASV-based DADA2 (135) and UNOISE (137). So, hey concluded
ha he clus e ing pipeline choice will la gely impac he alpha-di e si y esul s among
samples.
In able 3 he e is a b ie desc ip ion o se e al ools a ailable o sequence clus e ing in o
OTUs o single-nucleo ide esolu ion. I should be no ed ha , as said abo e, he main pipelines
QIIME (117), QIIME2 (120), mo hu (118), and USEARCH (130) had hei own app oaches
o OTU clus e ing.
Table 3. Tools a ailable o sequence clus e ing. The able was modi ied om Zau a e al. (98), an open-
access a icle dis ibu ed unde a C ea i e Commons A ibu ion 4.0 In e na ional (CC BY 4.0) license
(h ps://c ea i ecommons.o g/licenses/by/4.0/).
Tool Desc ip ion
UPARSE (126) Implemen ed in USEARCH (130). Algo i hm o OTU clus e ing
QIIME BLAST (145) An app oach ha ma ches he eads o he closes sequence in
he da abase and g oups he eads based on he BLAST label
CD-HIT-OTU-MiSeq (146) App oach o clus e ing and anno a ion o MiSeq-based 16S
sequence da a
UNOISE (137) Implemen ed in USEARCH (130). C ea es high- esolu ion OTUs
e e ed o as zOTUs
Minimum En opy
Decomposi ion (MED) (138)
In o ma ion heo y-based clus e ing algo i hm o sensi i e
pa i ioning o sequences P o ides single-nucleo ide esolu ion
(oligo ypes o MED nodes)
DADA2 (135) Co ec s Illumina-sequenced amplicon e o s, p o iding single-
nucleo ide esolu ion as ASVs
Deblu (136) P oduces sOTU wi h single-nucleo ide esolu ion (pu a i e e o -
ee sequences)
ALBA REGUEIRA IGLESIAS
110
Once he sequences a e g ouped, a single sequence is selec ed as a ep esen a i e o each
clus e . This sequence can be andom, he longes , he mos abundan , o he i s in a clus e
(121). The ac ha each clus e is now ep esen ed by a single sequence also speeds up he
pos e io analysis.
I.5.3. Taxonomy assignmen
A e clus e ing, a axonomic iden i y has o be assigned o each o he ep esen a i e
sequences. Phylogene ic ela ionships among sequences can be in e ed ei he de no o o by
using a e e ence da abase wi h an associa ed phylogeny (105). In he la e case, he axonomic
assignmen p ocess can be pe o med ia wo di e en s a egies, he bes hi and he lowes
common ances o (LCA) (121). Bo h o hese equi e an alignmen ool o compa e he
sequences being analysed agains a e e ence da abase con aining ela ed sequences whose
axonomy is known (121). The di e ence be ween he bes hi and LCA is ha he o me
assigns a sequence based on he alignmen wi h he highes sco e, while in he la e his is
achie ed ia mul iple hi s agains a pa icula da abase (121).
The de no o app oach can be ca ied ou using ools like NAST ( o sequence alignmen )
(147) and Fas T ee ( o making phylogeny in e ences om aligned sequences) (148). RDP
(119), G eengenes (149), and SILVA (150) a e among he mos widely used da abases a he
axonomic assignmen s age and a e used in combina ion wi h pai wise alignmen ools like
BLAST (145) o USEARCH/UCLUST (130).
Some da abases, such as CORE (76) and he human o al mic obiome da abase (HOMD),
a e specialised in o al mic obio a (151). They eme ged o p o ide a comp ehensi e and
minimally edundan ep esen a ion o he bac e ia ha usually eside in he human o al ca i y,
wi h compu a ionally obus classi ica ions a he genus and species le els. In ac , al hough
la ge public da abases like GenBank (152) and RDP (119) e u n named ma ches o a sligh ly
highe ac ion o sequences iden i ied in analyses o clinical samples, CORE and HOMD a e
much mo e likely o do so accu a ely (76). None heless, he la ge da abases a e s ill impo an
supplemen s o he specialised e sions when i comes o ecognising a e species.
Pe o ming a di e si y analysis i s equi es he gene a ion o a phylogene ic ee o OTUs
o ASVs. Ini ially, he ep esen a i e axa sequences ha e o be aligned using ools like
In oduc ion
111
MUSCLE (153) o PyNAST (154). The ee can hen be cons uc ed, which allows he
ela ionships be ween he sequences o be isualised in e ms o hei e olu iona y dis ance
om a common ances o (Figu e 16). Many di e en packages ha e been de eloped o
in e ing phylogenies and building ees o mul iple sequence alignmen s, wi h MEGA (155)
being he mos popula and e sa ile (121). A he e y leas , his ype o so wa e gene a es a
able de ailing he numbe o imes ha an OTU/ASV is obse ed and which axa i ep esen s
(156).
Figu e 16. Phylogene ic ee based on 1,642 HOMD (151) e e ence sequences. The image was aken om
Edlund e al. (157), an open-access a icle dis ibu ed unde a C ea i e Commons A ibu ion 2.0 Gene ic
(CC BY 2.0) license (h ps://c ea i ecommons.o g/licenses/by/2.0/).
I.5.4. Ad anced da a analysis and isualisa ion
Unde s anding he composi ional di e ences o mic obial communi ies is essen ial in he
ield o mic obial ecology (158). In his ega d, an OTU o ASV able enables di e en
axonomic summa ies o be ob ained ha show he bac e ia p esen and hei ela i e
ALBA REGUEIRA IGLESIAS
112
abundances a all axonomic le els (156). Howe e , u he analysis is equi ed o unde s and
he quali y o he da a, he di e si y wi hin and be ween samples, and, ul ima ely, which
s a is ical compa isons a e needed o de e mine whe he he mic obio a has expe ienced lux o
dysbiosis (156).
A me ada a able is also equi ed o pe o m ad anced explo a o y and in e en ial analyses.
The e m “me ada a” e e s o he in o ma ion associa ed wi h he sequences, including he
en i onmen al condi ions and he ime and loca ion o he sample collec ion (105). Me ada a is
e y impo an , as i is equi ed i he aim is o eplica e a pa icula in es iga ion (159). As
s a ed abo e, i is also essen ial o pe o ming meaning ul compa isons be ween samples o
wi h specimens om o he s udies. Consequen ly, genomic sequence da a ha lack an
en i onmen al con ex ha e no alue (159), meaning ha aspec s like he hos ’s heal h, sex,
age, and die , as well as he me hod o sampling, he size o he sample and i s p epa a ion,
should all be eco ded (159).
I.5.4.1. Analysis ools
The e a e se e al me hods o compa ing sequencing da a, including QIIME (117), mo hu
(118), MEGAN (160), me agenomic- apid anno a ion using subsys em echnology (MG-
RAST) (161), UniF ac (162), DOTUR (163) and Me as a s (164). Mos o hese ools a e used
o conduc ing analyses o bac e ial communi ies and can de ec g oups o ela ed samples
(165). Howe e , hey do no p o ide in o ma ion on he pheno ypes o en i onmen al
condi ions associa ed wi h hese communi ies, and do no usually iden i y he biological
ea u es esponsible o bac e ial g oup ela ionships (165). In ac , only Me as a s (164)
explici ly couples a s a is ical analysis ( o assess i he me agenomes di e ) wi h he
iden i ica ion o bioma ke s ( o de ec ea u es cha ac e ising he di e ences), based on
epea ed s a is ics and Fishe 's es s on andom pe mu a ions (165).
Ne e heless, none o he a o emen ioned app oaches p oduce explana ions on biological
classes wi h which o es ablish s a is ical signi icance and biological consis ency, o es ima e
he size o he e ec s o p edic ed bioma ke s. In 2011, Sega a e al. (165) de eloped he linea
disc iminan analysis (LDA) e ec size (LE Se) me hod, which is a loga i hm o de ec ing and
explaining high-dimensional bioma ke s. This couples s anda d es s o s a is ical signi icance
In oduc ion
119
In he equa ion, Ses is he es ima ed axa ichness, Sobs is he obse ed axa ichness, 1 is
he numbe o single ons, and 2 is he numbe o double ons. This index is especially use ul o
da ase s skewed owa ds low-abundance classes, as is likely o be he posi ion in he case o
mic obes (179,182).
Rela ed o Chao1 is he abundance-based co e age es ima o (ACE) (183), which no only
conside s he a io o single ons and double ons bu also o all he axa obse ed up o an
a bi a y coun , usually se a 10 (178):
In he ACE o mula (Sace), abund is he numbe o axa abo e he abundance h eshold and
a e is he numbe below i ( a e samples) (178). I should be no ed ha he sum o hese wo
alues equa es o he o al numbe o axa obse ed (179). Addi ionally, Cace is a sample-
co e age es ima o and yace is he es ima ed coe icien o a ia ion o a e axa (178). In hei
espec i e equa ions, n a e e e s o he o al numbe o indi iduals in a e axa and i o he
numbe o axa obse ed “i” imes (178). Essen ially, his index uses he numbe o a e axa
(≤10) and he numbe o single ons ( 1) o es ima e how many mo e undisco e ed axa he e
migh be. Ne e heless, bo h Chao1 and ACE unde es ima e ue ichness in small sample sizes
(179).
Mo eo e , he e a e ichness measu es ha conside he phylogene ic di e si y (PD) o
popula ions. The ai h phylogene ic di e si y index, i s desc ibed in 1992, is a quali a i e
di e gence-based measu e ha calcula es he o al b anch leng h in a phylogene ic ee ha
ALBA REGUEIRA IGLESIAS
120
includes all he axa in a sample (175,184). Al hough i ul ils he equi emen o being a
measu e o axon ichness in a communi y, his index is highly sensi i e o he sampling e o
because i assumes ha he o al di e si y o he popula ion has been sampled (175). Mo eo e ,
he PD depends on he me hod employed o in e b anch leng hs on a ee, making i sensi i e
o e o s du ing he ee’s cons uc ion (175).
B. E enness
Along wi h ichness, i is also impo an o measu e he e enness o a sample’s dis ibu ion
(178). Take, o example, wo specimens, A and B, wi h he ollowing composi ions:
Table 4. Example explaining mic obial e enness.
Bac e ial phyla Sample A (numbe ) Sample B (numbe )
Ac inobac e ia 690 330
Fusobac e ia 200 330
P o eobac e ia 110 340
TOTAL 1000 1000
Bo h samples ha e he same ichness ( h ee ypes o bac e ia) and he same o al numbe
o bac e ia. Howe e , B is mo e e en han A, because he o al numbe o bac e ia is e enly
dis ibu ed be ween he h ee phyla. Con e sely, mos o he bac e ia p esen in sample A a e
Ac inobac e ia, wi h a ew ep esen a i es o Fusobac e ia and P o eobac e ia. Consequen ly,
specimen A is less di e se han B. As can, he e o e, be seen, e enness is a measu e o he
ela i e abundance o he di e en axa in a sample (174).
In gene al, when ichness and e enness inc ease, so does di e si y (174). Di e si y can be
iewed as a summa y o a communi y’s s uc u e since membe ship, abundance, and e enness
a e aken in o accoun (177). T adi ionally, he Shannon-Wea e (185) and Simpson (186)
indices ha e been used o es ima e di e si y (174) and, aken oge he , a e a measu e o species
ichness and e enness. Howe e , nei he o hem is ee o bias and, while he o me a aches
g ea e weigh o species ichness, he la e accoun s mo e o species e enness (174).
The Shannon-Wea e (al e na i ely: Shannon en opy o , simply, Shannon di e si y) index
(185) was o iginally p oposed as a measu e o en opy wi hin he ex and quan i ies he
In oduc ion
121
unce ain y o p edic ing co ec ly wha he nex indi idual aken om a sample will be (177)
(156). So, i a sample con ains 1000 bac e ia and 900 o hem a e Fusobac e ia, he p obabili y
ha he nex one is also Fusobac e ia is high and he Shannon index alue would be low (close
o 0). In con as , i e e y 100 bac e ia belong o 10 di e en species, he abili y o es ima e
wha he nex one will be is low and he Shannon index sco e would be high. The alue hus
inc eases along wi h he numbe o species and as he dis ibu ion o indi iduals among he
species becomes mo e e en (174). The o mula o he index is as ollows, wi h S being he
numbe o axa and pi he p opo ion o he communi y ep esen ed by a axa i:
This es ima e enables he employmen o a u he measu e: he Pielou e enness index
(187), which di ides he obse ed alue o he Shannon index by he highes possible alue,
i.e., he alue i all he species in a sample a e equally abundan (178).
The Simpson Index (186), i s desc ibed in 1949, es ima es species dominance and e lec s
he p obabili y ha wo indi iduals aken a andom om a sample will belong o he same axa
(177,178). I s alues ange om 0 o 1, wi h 0 being “in ini e di e si y” and 1 “no di e si y”.
Consequen ly, he sco e p oduced by he index inc eases as di e si y dec eases (174). This is
desc ibed ma hema ically as ollows:
He e, ep esen s he Simpson Index, S he o al numbe o axa in he communi y, and pi
he p opo ional abundance o each axa i (178). Since he alue o he index inc eases as
di e si y dec eases, i is usually ep esen ed as i s in e se, which is known as he in e se
Simpson index (1/). Acco dingly, an inc ease in di e si y is mi o ed by an inc eased in e se
Simpson alue (177), which ep esen s he p obabili y ha wo indi iduals andomly selec ed
om a specimen will belong o di e en axa.
In con as , The a (Ɵ) is an example o an alpha-di e si y measu e ha accoun s o bo h
e enness and he di e gence be ween axa (175). Simply pu , i calcula es he a e age
ALBA REGUEIRA IGLESIAS
122
di e ence be ween wo andomly chosen sequences o indi iduals in a popula ion. None heless,
The a has no been widely used o measu e mic obial di e si y (175). Meanwhile, o e ecen
yea s, Cado e e al. (188) de eloped h ee indices o PD ha also conside he ela i e
abundance o each axon in a communi y. Con e sely, o he au ho s ha e ex ended me ics like
he Shannon and Simpson indices, ans o ming hem in o phylogene ically weigh ed
equi alen s. These ha e been shown o ou pe o m he s anda d measu es when i comes o
dis inguishing heal hy om disease-associa ed human mic obio a communi ies (178).
I.5.4.2.2. Be a-di e si y
Be a-di e si y is he measu e o di e si y be ween mul iple samples (156), and desc ibes
how many axa a e sha ed be ween communi ies, including he absolu e o ela i e o e lap (84).
Thus, a be a-di e si y measu e es ima es he simila i y be ween popula ions (84).
Consequen ly, aspec s o mic obial ecology ha a e unappa en when examining he
composi ion o indi idual specimens can be e ealed by assessing he di e ences be ween
samples (189).
The e a e many di e en app oaches o e alua ing he simila i y be ween communi ies
and some o hose used he mos a e desc ibed below. Concep ually, hese cap u e di e en
aspec s o di e si y. T adi ional measu es like he Jacca d (190) o B ay-Cu is indices (191)
ocus on he axa composi ional o e lap, which is quan i ied di ec ly om he axa-coun da a
(192). Conside ed o be he ea lies be a-di e si y index, he Jacca d accoun s o he ela i e
axa o e lap be ween wo samples, i.e., he a io o sha ed axa among all he o ganisms
sampled (192). This is an incidence-based o unweigh ed (quali a i e) index: i only conside s
he p esence/absence o axa. O e he yea s, di e en abundance-based o weigh ed a ia ions
o he o iginal e sion ha e been p oposed, including he Chao weigh ed Jacca d index (193)
and he weigh ed Jacca d index (192). In addi ion, he widely employed B ay-Cu is simila i y
index desc ibes he communi y o e lap as he ac ional minimum abundance o sha ed axa
be ween samples (191). The calcula ion is pe o med using he ollowing o mula:
In oduc ion
123
S1 and S2 a e wo samples and S1i and S2i a e he abundances o phylo ype i in samples S1
and S2 (178). Al hough i is no e y sensi i e, his index is none heless app op ia e o use wi h
ce o-in la ed da ase s (178).
Unlike he adi ional measu es, he ecen ly de eloped phylogene ically-in o med indices
do no ea axa independen ly. Ins ead, hese me ics conside he phylogene ic ela ionships
be ween axa and quan i y he sha ed e olu iona y his o y be ween communi ies (192). Among
hese new measu es is he widely known unique ac ion me ic (UniF ac), o which he e a e
di e en e sions. The unweigh ed o m was he i s o be eleased and only conside s species
p esence/absence and coun s he ac ion o he b anch leng h unique o ei he communi y (162).
Con e sely, he weigh ed UniF ac uses species-abundance da a and weigh s he b anch leng h
wi h he abundance di e ence (194). In o he wo ds, i de ec s changes in he numbe o
sequences om each lineage, as well as changes in he ypes o axa ha a e p esen (175). The
unweigh ed e sion is mos e icien o de ec ing abundance changes in a e axa, while i s
weigh ed coun e pa is mos sensi i e o iden i ying di e ences in abundan o ganisms (158).
Ne e heless, nei he is pa icula ly powe ul when i comes o ecognising changes in
mode a ely abundan lineages (158). The hi d e sion eleased was he a iance-adjus ed
weigh ed (VAW) UniF ac, which mode a es he b anch p opo ion di e ence by i s a iance,
inc easing he index’s powe o e he weigh ed e sion o de ec ing he di e ences be ween
wo communi ies (195). The VAW-UniF ac was used by Chen e al. (158) o in oduce
gene alised UniF ac dis ances ha uni y he weigh ed and unweigh ed UniF ac e sions wi hin
a common amewo k. This combined me ic adjus s he weigh on he b anches o co e a
se ies o dis ances, anging om weigh ed o unweigh ed, and is designed o apply o, and
iden i y, a much wide ange o biologically ele an changes in a mic obio a’s composi ion
(158).
Mo e ecen ly, Schmid e al. (192) p oposed a no el amily o be a-di e si y indices ha
quan i y communi y simila i y in he con ex o axa-in e ac ion ne wo ks: he axa in e ac ion-
adjus ed (TINA) and he phylogene ic in e ac ion-adjus ed (PINA). The au ho s a gued ha
because he indices ake in o accoun in e ac ions be ween axa, hey a e capable o quan i ying
new aspec s o di e si y and can expand possible biological in e p e a ions o di e si y pa e ns
in new ways (192).
ALBA REGUEIRA IGLESIAS
124
The dis inc app oaches o communi y dissimila i y desc ibed, i.e., coun -based s.
phylogene ic, can highligh di e en aspec s o a popula ion and how i unc ions.
Consequen ly, combining hese di e en analyses o gain a deepe insigh in o he sys em unde
s udy may be a aluable nex s ep (178).
A. Mul i a ia e analysis
Mul i a ia e analyses a e supplan ing simple desc ip i e in es iga ions o bac e ia, and a e
widely used in mic obial ecology, whe e complex, mul idimensional da ase s abound.
Howe e , he employmen o OTUs o ASVs abundances makes i di icul o es he di ec
associa ion be ween he composi ion o he mic obio a and en i onmen al ac o s, due o he
high dimensionali y, non-no mali y, and phylogene ic s uc u e o he da a (196).
Consequen ly, mul i a ia e analyses i s equi e he esea che o selec a me hodology o
measu ing dis ance be o e conduc ing an analysis o es ima ed dis ances (196). A dis ance
measu e de ined be ween any o wo samples can be u ilised. Among he nume ous me ics ha
exis , he abo e-men ioned B ay-Cu is and UniF ac a e wo o hose employed he mos .
Many ypes o mul i a ia e s a is ical analyses ha e been used o he assessmen o high-
h oughpu da ase s, and no el app oaches o analysing la ge-scale da ase s a e also being
de eloped (197). These me hodologies can be ca ego ised based on c i e ia such as he
echnique’s goal (e.g., in e p e ela ionships, es s a is ical signi icance), he ype o
ma hema ical p oblem ( eg ession, o dina ion, calib a ion, classi ica ion), o he a iable
esponse (e.g., linea , unimodal, mix u e dis ibu ion) (197). These echniques can also be
classi ied acco ding o he p ima y esea ch objec i es, and h ee ca ego ies can be
dis inguished (197):
Explo a o y me hods: hese a e used o explo e he ela ionships among objec s (e.g.,
samples o si es) based on he alues o he a iables measu ed in hose objec s.
These echniques p o ide a aluable isualisa ion o objec simila i ies since simila
objec s a e usually posi ioned close oge he on he isualisa ion plo , while
dissimila objec s a e wide apa .
In e p e i e me hods: hese ‘cons ained’ echniques use bo h he main se o
measu ed a iables and ano he o addi ional explana o y a iables.
In oduc ion
125
Disc imina o y me hods: hese a e an ex ension o he o me echniques and a e
usually known as disc iminan analyses (DAs). The goal o DAs is o de ine
disc iminan unc ions (syn he ic a iables) o hype space planes ha maximise he
sepa a ion o objec s among di e en classes (g oups).
O he explo a o y app oaches, he p incipal componen analysis (PCA) is one o he mos
widely used and oldes (198). In he main, i is employed o calcula e new syn he ic a iables
(p incipal componen s), which a e linea combina ions o he o iginal a iables, and accoun s
o as much o he a iance in he o iginal da a as possible (199). The i s p incipal componen
(PC) ep esen s he axis in he mul idimensional da a-space ha would p oduce he la ges
dispe sion o alues. O he PCs a e calcula ed as being o hogonal o hei p edecesso s and a e
posi ioned along he la ges emaining sca e plo o he alues. Consequen ly, he PCA c ea es
a o a ion o he o iginal sys em o coo dina es, meaning ha he PCs a e o hogonal o one
ano he and co espond o he di ec ions o he g ea es a iance in he da ase (197). In his
o dina ion plo , he i s PC axis ep esen s he la ges a iabili y g adien , PC2 is he second
la ges , and so on, un il all he da ase ’s a iabili y has been assessed (197). Each objec can be
gi en a new se o coo dina es in he PC space, and i s dis ibu ion in such a space will
co espond o he simila i y o he a iables’ sco es o hose objec s (197).
A concep ual ex ension o he PCA is he p incipal coo dina e analysis (PCoA) (200).
Simila ly, his is used o o de objec s along PC axes in an a emp o explain he a iance in a
da ase (197). While a PCA o ganises objec s by analysing a co ela ion o co a iance ma ix,
he PCoA can be applied o any ype o dis ance me ic (197). The use o his me hod has
ecen ly inc eased in ecology since i can employ measu es o phylogene ic dis ance and
communi y composi ion o calcula e he simila i y among popula ions (197). As a dis ance
ma ix is an inpu ile, he PCoA canno di ec ly ela e any o he measu ed a iables o
indi idual coo dina e axes (199). Ins ead, an indi ec co ela ion o eg ession analysis o objec
alues s. objec sco es can be used o es ima e he con ibu ion o a a iable o objec dispe sion
along a pa icula PC axis (197).
ALBA REGUEIRA IGLESIAS
126
Figu e 22. G aphical ep esen a ion o (A) a p incipal componen analysis (PCA) and (B) a p incipal
coo dina e analysis (PCoA) plo . This image is adap ed om Rao e al. (201), which is an open-access a icle
dis ibu ed unde a C ea i e Commons A ibu ion 4.0 In e na ional (CC BY 4.0) licence
(h ps://c ea i ecommons.o g/licenses/by/4.0/).
Finally, non-me ic mul idimensional scaling (NMDS) is ano he explo a o y me hod in
which a numbe o o dina ion axes a e explici ly chosen in ad ance, a e which da a a e i ed
o hose dimensions (202). As in he PCoA, a ma ix o objec dissimila i ies is i s calcula ed
using a dis ance me ic. The anks o hese dis ances o all he objec s a e calcula ed and hen
he algo i hm iden i ies a con igu a ion o objec s in he N-dimensional o dina ion space ha
bes ma ches he di e ences in anks (197). In an NMDS o dina ion, he p oximi y be ween
objec s co esponds o hei simila i y, bu he o dina ion dis ances do no co espond o he
o iginal dis ances be ween he objec s (199).
In oduc ion
127
Figu e 23. G aphical ep esen a ion o a non-me ic mul idimensional scaling (NMDS) plo . The image was
aken om D ell e al. (203), an open-access a icle dis ibu ed unde a C ea i e Commons A ibu ion 4.0
In e na ional (CC BY 4.0) license (h ps://c ea i ecommons.o g/licenses/by/4.0/).
In e p e a i e me hods o analysing la ge-scale da ase s can be u he subdi ided in o
h ee ypes: symme ic, asymme ic, and s a is ical-signi icance es ing. The i s compa es wo
da ase s and does no dis inguish be ween explana o y and esponse a iables (197). Examples
a e he canonical co ela ion analysis (204) and he p oc us es analysis (205). In con as , he
asymme ic app oaches use wo dis inc se s o a iables: one explana o y o independen and
one esponse o dependen (197). The edundancy analysis (RDA) (206) and gene alised linea
models (207) a e examples o asymme ic echniques. Speci ically, he commonly used RDA
is a ype o cons ained o dina ion ha e alua es how much o he a ia ion in one se o
a iables ( esponse) can be explained by he a ia ion in ano he se (explana o y) (206). This
is a canonical e sion o he PCA and is based on simila p inciples, wi h he PCs cons ained
as linea combina ions o he explana o y a iables (197). The RDA p o ides a use ul indica ion
o , o example, how much he a ia ion in species dis ibu ion is due o di e ences in he
en i onmen al ac o s be ween si es (197).
ALBA REGUEIRA IGLESIAS
128
Figu e 24. G aphical ep esen a ion o a edundancy analysis (RDA) plo . The image was aken om Qi e
al.(208) wi h he pe mission o Else ie .
The hi d in e p e a i e me hod in ol es he s a is ical-signi icance es ing o mul i a ia e
da ase s (197). Se e al app oaches a e a ailable o analysing among-g oup di e ences in
mic obio a da a, such as he pe mu a ional mul i a ia e analysis o a iance (PERMANOVA)
(209), he analysis o simila i ies (ANOSIM) (210), he mul i- esponse pe mu a ion p ocedu e
(MRPP) (211), and he Man el es (212). O hese, he PERMANOVA and ANOSIM a e he
mos widely used in mic obio a s udies and a e gene ally employed wi h a dis ance measu e
(196). These es s make i possible o e alua e elemen s like mic obial di e gence o simila i y
in popula ions o he ac o s a ec ing such communi ies. The signi icance o he esul s can
also be con i med h ough isualisa ion me hods.
O he inal examples o disc imina o y me hods, he disc iminan unc ion analysis (DFA)
(213) and he andom o es (214) should be highligh ed. The DFA, be e known as he LDA,
is a me hod o e alua ing how well a g oup o a iables suppo s an a p io i g ouping o
objec s. He e, he measu ed a iables a e he p edic o a iables, while he a iable de ining
he objec classes is ea ed as he esponse a iable (also called he g ouping a iable) (197).
The LDA is closely ela ed o o he lineal me hods like he PCA. Howe e , unlike he PCA, i
de i es syn he ic a iables ha speci ically maximise he be ween-class g oup dispe sion (197).
As each disc iminan unc ion is a weigh ed linea combina ion o he measu ed p edic o
a iables, he weigh s (called disc iminan coe icien s) can be used o de ine he con ibu ion
o each p edic o a iable o he obse ed disc imina ion be ween classes o objec s (197). The
In oduc ion
135
he ne wo k (229). Cen alisa ion is high when a e ex has high cen ali y alues and hose o
he o he e ices a e low. Con e sely, i he cen ali y is dis ibu ed mo e e enly, he ne wo k
cen alisa ion is low.
Addi ionally, g oups o e ices may o m a module o clus e , hus ac ing as a sub-ne wo k
wi hin he main ne wo k. A module is de ined as a se o s ongly ela ed nodes ha a e, in u n,
less ela ed o hose ha do no belong o he g oup (223). A ne wo k is said o ha e high
modula i y i i p esen s dense connec ions wi hin node clus e s and spa se connec ions be ween
di e en g oups o e ices (223). All o he ne wo k measu es desc ibed abo e can be
calcula ed o he modules o clus e s.
Finally, as e e ed o ea lie , he capaci y o iden i y hubs o keys one axa, which a e
highly connec ed OTUs o ASVs in he mic obio a, is one o he mos use ul ea u es o a co-
occu ence ne wo k analysis (230). Di e en measu es ha e been adop ed o de ine hese hubs
in mic obial communi ies. Bane jee e al. (222), o example, aimed o p o ide a quan i iable
h eshold o he consis en iden i ica ion and alida ion o keys one axa. Thei indings led o
a ecommenda ion ha he high mean deg ee, high CC, and low BC sco es should be combined
o his end. Ne e heless, i should be no ed ha he iden i ica ion o highly connec ed OTUs
o ASVs in a mic obial ne wo k does no necessa ily e eal hei ole as keys one axa (231),
which a e e y closely linked species ha exe a conside able in luence on he s uc u e and
unc ioning o he mic obio a, i espec i e o i s abundance (222). Al hough u he
expe imen al e idence is equi ed be o e ne wo k hubs can be de ined as keys one axa
(231,232), iden i ying hem is none heless a aluable s ep, since his will help esea che s o
a ge key communi y membe s (231).
In conclusion, he indings om he co-occu ence ne wo k analyses desc ibed in he
li e a u e should be iewed wi h cau ion: hey may be a ec ed by me hodological di e ences
conce ning, o example, he co ela ion alues employed as cu -o poin s (233) o he use o
di e en de ini ions o keys one axa (222).
ALBA REGUEIRA IGLESIAS
136
I.5.4.2.5. P edic i e models
Machine lea ning (ML) is a compu e science discipline in which compu e s a e
p og ammed o lea n pa e ns om he da a in a mul i-dimensional da ase and p oduce
classi ica ions o p edic ions based on s a is ical associa ions (234). The ield has wo main
app oaches, supe ised and unsupe ised, and he goals o he esea ch de e mine which is he
mos app op ia e (Table 5). The la e is employed o iden i y he unde lying s uc u es o
ela ionships be ween a iables (samples) in a da ase and is well sui ed o he isualisa ion o
high-dimensional inpu da a (234,235). Indeed, he PCA (198) and PCoA (200) men ioned
ea lie a e examples o unsupe ised ML algo i hms. In con as , supe ised lea ning in ol es
he classi ica ion o an obse a ion in o one o mo e ca ego ies o ou comes (235). As a
consequence, his equi es aining da a, wi h each aining sample ha ing alues o a numbe
o independen a iables o ea u es, as well as an associa ed classi ica ion label (236).
P edic i e modelling is a se o ma hema ical p ocesses and compu a ional echniques ha
enable he p obabili y ha an e en will occu o be in e ed om a se o p e iously ob ained
da a. The e is a close ela ionship be ween p edic i e analyses and ML, since p edic i e models
ypically include an ML algo i hm. Unsupe ised models do no equi e labelled da a o he use
o e o -measu emen me ics, wi h he algo i hm ins ead sea ching o pa e ns among he inpu
o he ou pu a iables (samples) du ing he modelling p ocess. Con e sely, a supe ised model
needs such da a o gene a e a p edic i e model, as well as an e o -measu emen me ic o
imp o e i du ing he building p ocess.
In oduc ion
137
Table 5. Summa y o he supe ised and unsupe ised machine-lea ning app oaches. The able was aken
om Reel e al. (237) wi h he pe mission o Else ie .
Lea ning
app oach Goal Desc ip ion
Unsupe ised Iden i y
clus e s
Unsupe ised lea ning employs inpu a iables wi hou a a ge /ou pu
a iable o ind he unde lying pa e ns in unlabelled da a. I can be used
o clus e ing, anomaly de ec ion and dimensionali y educ ion.
Supe ised P edic
new da a
Supe ised lea ning in ol es i ing a model wi h labelled aining da a
and hen using i o p edic i e pu poses. The p oblem i add esses can
be classed in e ms o ei he eg ession ( he p edic ed a iable is
nume ic) o classi ica ion ( he p edic ed a iable is ca ego ical).
The h ee s eps o supe ised lea ning a e: 1) i ing a model om he
sample’s inpu obse a ions; 2) e alua ing he model and hen ex ensi ely
uning i s hype -pa ame e s; and 3) se ing up he model o he
p oduc ion s age and using i o make p edic ions.
When a model is accu a e in ela ion o bo h he aining and es da a,
i is said o ha e lea ned p ope ly. Howe e , a pa icula ML ou pu migh
p edic he aining da a wi h a high deg ee o accu acy, bu none heless
ails o p oduce p ecise p edic ions wi h he es da a (o e i ing); i may
e en be unable o p edic he aining da a co ec ly (unde i ing) (234).
In compa ison o he e y low numbe o samples and clinical condi ions ypically
e alua ed in his kind o wo k, he o al mic obio a high- h oughpu da a in his s udy is
cha ac e ised by a la ge quan i y o independen and p edic o a iables (OTUs o ASVs). This
o en indica es a high deg ee o mul icollinea i y and, as a esul , p oduces e y poo ly
condi ioned p oblems (238). In a supe ised amewo k, one solu ion is o educe he
dimensionali y o he da a, ei he by ea u e selec ion o in oducing a i icial a iables ha
summa ise mos o he ele an in o ma ion (238). To his end, se e al ools o supe ised
p edic i e modelling ha e been p oposed, including he a o emen ioned andom o es plo s
(214), suppo ec o machine (SVM) (239), and eg ession models like he spa se pa ial leas -
squa es disc iminan analysis (sPLS-DA) (238).
The SVM de ice is a me hod o iden i ying a decision bounda y o enable he
classi ica ion o da a. An SVM aining algo i hm is applied o a aining da ase wi h
in o ma ion abou he class o which each piece o da a belongs, es ablishing a hype plane ha
sepa a es wo classes. Nex , he SVM seeks o op imise he wid h o he gaps be ween classes,
i.e., he maximum-ma gin hype plane. The esul ing model can be used o de e mine whe he a
new da a elemen is, o is no , a membe o a pa icula class (240). Among he ad an ages o
ALBA REGUEIRA IGLESIAS
138
his me hod a e i s e iciency a lea ning complex classi ica ion unc ions and i s employmen
o powe ul egula isa ion p inciples o p e en o e i ing (241). Howe e , in he case o highly
dimensional da ase s, he esul s ob ained a e o en di icul o in e p e gi en he la ge numbe
o a iables (238). Fu he mo e, mul iclass classi ica ion p oblems equi e ei he hei
decomposi ion in o se e al bina y p oblems o he de ini ion o mul iclass objec i e unc ions
(238).
In con as , he sPLS-DA (238), which is a na u al ex ension o he PLS-DA, is based on
he assump ion ha only a small numbe o ea u es a e esponsible o d i ing a biological
e en o e ec , enabling p edic o a iables o be selec ed and classi ied in a one-s ep p ocedu e
(238,242). The p ope unc ioning o his me hod has been demons a ed p e iously (243), and
mul iple classes (e.g., clinical condi ions) can be dis inguished a he same ime. Al hough he e
is some di icul y in cons uing he esul s ob ained wi h his model compa ed o hose ha ha e
only wo classes, a g aphical ep esen a ion makes he in e p e a ion p ocess easie (238).
Figu e 27. G aphical ep esen a ion o an spa se pa ial leas -squa es disc iminan analysis (sPLS-DA). This
image is adap ed om Roha e al. (244), which is an open-access a icle dis ibu ed unde a C ea i e
Commons A ibu ion 4.0 In e na ional (CC BY 4.0) licence (h ps://c ea i ecommons.o g/licenses/by/4.0/).
The implemen a ion o an sPLS-DA (238) in he mixOmics package (244) o R-
Bioconduc o (245) enables he ollowing o be de e mined o each model (246):
In oduc ion
139
The numbe o componen s o la en a iables. The e a e as many dimensions o he
sPLS-DA model as equi ed.
A se o loading ec o s, which a e coe icien s assigned o each independen
a iable (OTU o ASV) o de ine each componen . In o he wo ds, hey indica e he
impo ance o each a iable in he sPLS-DA and each loading ec o is associa ed
wi h a pa icula componen . These ec o s a e ob ained in such a way as o
maximise he co a iance be ween a linea combina ion o independen a iables and
he classes o in e es .
A lis o designa ed a iables associa ed wi h each componen . The p ocedu e
implemen ed in he mixOmics package (244) uses a k- old c oss- alida ion echnique
o au oma ically calcula e he app op ia e numbe o dimensions o each model.
The ule o humb is ha he numbe o dimensions will be K-1, whe e K indica es he
numbe o classes (e.g., clinical condi ions) included in each model. Acco dingly, a
a iable (e.g., OTU o ASV) ha is p esen in mul iple models will be iden i ied as
impo an . I becomes c i ical o sees i s alue inc ease i i s p esence is always
associa ed wi h he same class.
Once he op imal pa ame e s ha e been chosen (numbe o componen s and a iables),
he inal model is un on he en i e da ase . The model’s classi ica ion e o a e is hen
es ima ed (244), and an addi ional accu acy e alua ion using he ecei e ope a ing
cha ac e is ic (ROC) and AUC can be pe o med (244).
The use o p edic i e modelling o iden i y o al axa ha can dis inguish be ween heal h
condi ions and a e associa ed wi h speci ic disease s a es would be ex emely aluable o
de e mining he bioma ke s o disease (236). Howe e , o da e, e y ew sequencing-based
s udies o he o al ca i y ha e conduc ed p edic i i y analyses (247-250).
ALBA REGUEIRA IGLESIAS
140
I.6. AN OWN STUDY ON THE RELATIONSHIP BETWEEN DENTAL AND PERIODONTAL HEALTH
STATUS AND THE SALIVARY MICROBIOTA
In a ecen ly published 16S RNA gene sequencing-based in es iga ion o ou in es iga ion
g oup (249), se e al o he abo e explained analysis ools we e applied o examine he bac e ial
di e si y and he co-occu ence ne wo k pa e ns o he sali a y mic obio a in pa ien s who
ha e been clinically classi ied by a sel -designed and p e iously alida ed scale o o e all o al
heal h. Mo eo e , we e alua ed he diagnos ic po en ial o he sali a y mic obio a o
disc imina e be ween di e en clinical condi ions.
The own scale o o e all o al heal h consis s o h ee den al- and h ee pe iodon al-
associa ed pa ame e s (Table 6). Taking his in o accoun , he pa icipan s’ den al and
pe iodon al g ades (DG and PG, espec i ely) co esponded o he g ades assigned o a leas
wo o he h ee a iables analysed in each o hese wo ca ego ies. I he e we e di e ences
be ween he g ades alloca ed o each o he a iables in a ca ego y, he pa ame e s o “numbe
o ca ies” and “numbe o pe iodon al pocke s ≥4 mm” ook p ecedence. I he same g ade was
alloca ed o wo a iables in a ca ego y, bu he hi d a iable’s g ade was wo le els highe ,
he alue assigned o i was one g ade highe han ha o he ma ching a iables. Las ly, he
o al heal h g ade (o al g ade, OG) was de e mined by he ca ego y (den al o pe iodon al) wi h
he highes anking, enabling pa ien s o be classi ied based on he sco e o hei den al and
pe iodon al heal h and he combina ion o bo h condi ions.
Table 6. The scale o o e all o al heal h, in ol ing g ades o den al and pe iodon al heal h. The able was
aken om Rel as e al. (249), an open-access a icle dis ibu ed unde a C ea i e Commons A ibu ion 4.0
In e na ional (CC BY 4.0) license (h ps://c ea i ecommons.o g/licenses/by/4.0/).
Ca ies se e i y, 1= a ec ing he enamel, 2= a ec ing he enamel and den ine, and 3= a ec ing he enamel,
den ine, and pulp.
G ade 0 G ade 1 G ade 2 G ade 3
G ades o den al heal h
Sup agingi al plaque (O’Lea y index) (251) 0 1–56 57–112 >112
Ca ies 0 1–4 5–8 ≥9
Se e i y o he ca ies (median) 0 1 2 3
G ades o pe iodon al heal h
Gingi al in lamma ion (Ainamo and Bay index) (252) 0 1–56 57–112 >112
Pe iodon al pocke s ≥4 mm 0 1–56 57–112 >112
Se e i y o he pocke s (mean) <4mm 4-4.9mm 5–5.9mm ≥6mm
In oduc ion
141
Uns imula ed sali a samples we e collec ed om each pa icipan . Sequencing o he 3-4
egion was pe o med in an Illumina MiSeq pla o m wi h 2 × 300 bps eads, while he aw
eads we e p ocessed acco ding o he mo hu pipeline (118). The s a is ical analysis o he 16S
RNA sequencing da a a he species le el was conduc ed using he phyloseq (166), DESeq2
(170), Mic obiome (173), SpiecEasi (226), ig aph (227), and mixOmics (238) packages.
I.6.1. Resul s and discussion
The o e all o al heal h scale was used o p oduce a con enience sample o 81 pa ien s ha
we e gi en he ollowing OGs: 0 o 17 o hem; 1 o 25; 2 o 28; and 3 o 11. In ela ion o
he subscales, 47 pa ien s had a PG o 0 and di e en DGs (17 had a DG o 0, nine a DG o 1,
11 a DG o 2, and 10 a DG o 3), and 46 had a DG o 0 and di e en PGs (17 had a PG o 0, 14
a PG o 1; 14 a PG o 2; and one a PG o 3). The ou pa ien s excluded due o a low numbe
o aw sequences ob ained we e: wo o OG1 and wo o OG2 ( wo o DG0, one o DG1, and
one o DG2; wo o PG0, one o PG1, and one o PG2).
I.6.1.1. Impac o he den al and pe iodon al subscales and he scale o o e all o al
heal h on he sali a y mic obio a: alpha di e si y indica o s and he s uc u e o he bac e ial
communi y
Wo sening den al o pe iodon al heal h e ealed a end o inc easing alpha di e si y in
bo h he den al and pe iodon al subscales; al hough signi ican di e ences in he numbe o
OTUs we e only obse ed in he o me : DG0 s. DG123 (p= 0.009), and DG0 s. DG23
(p= 0.006). The DG23 also showed a end owa ds inc eased di e si y (Shannon Index) and
e enness (Pielou Index).
On he con a y, o he au ho s had obse ed ha he sali a samples om he heal hy and
ca ies g oups gene ally had simila le els o ichness and di e si y (253-256). This was ue
whe he he diseased g oup was composed o subjec s wi h ac i e (254), inac i e (255), o
ca i a ed (256) ca ies. Howe e , i should be no ed ha he den al heal h subscale used he e
inco po a es a iables ha no only include he numbe o ca ies and hei se e i y, bu also he
le els o sup agingi al plaque, all o which could a ec he bac e ial ichness o he sali a y
communi y. In addi ion, he e is some inconsis ency be ween he alpha-di e si y esul s o
a ious s udies in he li e a u e and ou indings when compa ing pe iodon ally heal hy and
pe iodon i is subjec s. Se e al esea che s desc ibed g ea e ichness (248,257), di e si y (248),
ALBA REGUEIRA IGLESIAS
142
and e enness (257) in he sali a samples o pa ien s wi h pe iodon i is han in hose who we e
heal hy; meanwhile, o he s, as obse ed he e, only obse ed a end o inc eased alpha di e si y
wi h wo sening o pe iodon al heal h (258).
In he o e all o al heal h scale compa isons, g ade inc emen s we e linked o p og essi e
inc eases in bac e ial ichness and he Shannon Index alues, especially in OG0 s. OG23
(p= 0.013 and p= 0.026, espec i ely). The po en ial impac o he simul aneous p esence o
den al and pe iodon al disease on he ichness and di e si y o he sali a y mic obio a is in line
wi h he esul s o Takeshi a e al. (259).
Like o he s udies in which he s uc u e o he global sali a y mic obio a is simila in
pa ien s wi h good o al heal h (260-262), ou PCoA e ealed a g ouping o he sali a y samples
aken om he pa icipan s wi h DGs, PGs, and OGs o 0. This con as ed wi h he pic u e o
he o he g ades, whose composi ional dis ibu ions we e mo e di e se (Figu e 28). The isual
obse a ion was con i med by he PERMANOVA es , which p oduced signi ican esul s o
he compa ison o g ades 0 and 123 (den al subscale, p= 0.0009; pe iodon al subscale,
p= 0.0229; o al scale, p= 0.0008). These indings we e mainly a he expense o he con as
be ween g ades 0 and 23 (den al subscale, p= 0.0005; pe iodon al subscale, p= 0.0287; o al
scale, p= 0.0008). Focusing on he g oup wi h he highes g ade o o al pa hology (OG23),
PERMANOVA's es e ealed ha he s uc u e o he sali a y mic obio a was di e en
depending on he p edominance o den al pa hology (PG0_DG23) o pe iodon al pa hology
(DG0_PG23) (p= 0.027).
In oduc ion
143
Figu e 28. P incipal Coo dina e Analysis including PERMANOVA es alues in he compa ison be ween
di e en g ades o den al, pe iodon al, and o al heal h. The image was aken om Rel as e al. (249), an
open-access a icle dis ibu ed unde a C ea i e Commons A ibu ion 4.0 In e na ional (CC BY 4.0) license
(h ps://c ea i ecommons.o g/licenses/by/4.0/).
I.6.1.2. Impac o he den al and pe iodon al subscales and he scale o o e all o al
heal h on he sali a y mic obio a: composi ion o he co e mic obio a and es ing di e en ial
abundance
The e a e nume ous 16S RNA-based mic obiome s udies on sali a y mic obio a in he
li e a u e ha ha e only analysed he di e en ial abundance o he axa associa ed wi h a ious
o al condi ions (256,257,263,264). In ou s udy, we conside ed ha i was essen ial o e alua e
sali a y mic obio a om a dual pe spec i e: he p e alence o he axa de e mining he co e
mic obio a; and hei di e en ial abundance in ela ion o he di e en DGs, PGs, and OGs.
ALBA REGUEIRA IGLESIAS
144
I.6.1.2.1. Composi ion o he co e mic obio a
The co e mic obio a associa ed wi h he pa icipan s’ den al and pe iodon al heal h
con ained 57 species, ep esen ing 14.14% o he o al numbe o OTUs and 63.06% o he o al
abundance. The e we e only nine axa in DG0 and eigh in PG0 ( he speci ic co e o g ade 0),
exempli ying abundances o 7.80% and 1.34%, espec i ely. O hese speci ic co e species, i e
we e common o bo h he den al and pe iodon al heal h condi ions: Neisse ia macacae,
Bu y i ib io sp. HMT 455, Campylobac e concisus, Po phy omonas ca oniae, and
Co ynebac e ium du um.
The e we e 66 species in he co e mic obio a associa ed wi h he mos se e e den al disease
(DG23) and 73 wi h he mos se ious pe iodon al disease (PG23), ep esen ing 16.37% and
18.11% o he o al sali a y mic obio a, and 67.14% and 67.98% o he o al abundance,
espec i ely. The e we e only eigh and 10 axa p esen in DG23 and PG23 ( he speci ic co e
o g ade 23), exempli ying 2.54% and 2.46% o he abundance, espec i ely. O hese speci ic
co e species, only P. endodon alis was common o bo h pa hological condi ions.
The e we e 35 axa common o bo h he den al and pe iodon al subscales, ega dless o he
g ade (non-speci ic co e), ep esen ing abundances o 50.83% and 52.75%, espec i ely. O
hese non-speci ic co e species, 25 we e common o bo h subscales, wi h he mos abundan
(abundance > 1%) being: G anulica ella adiacens, Haemophilus pa ain luenzae, Lep o ichia
sp., Po phy omonas pas e i, P e o ella sp., P e o ella melaninogenica, P e o ella sali ae,
Ro hia mucilaginosa, S ep ococcus sp., S. o alis subsp. den isani clade 058, S ep ococcus
sali a ius, Veillonella sp., and V. pa ula.
The co e species in he li e a u e on he sali a y mic obiome ha e a ious de ini ions and,
as a consequence, any associa ed indings a e di icul o compa e (247,254,258,259). Despi e
his, ou in es iga ion demons a ed o he i s ime ha he non-speci ic co e o he sali a y
mic obio a comp ises a g ea e numbe o species in highe abundances han he speci ic-co e
associa ed wi h a pa icula den al o pe iodon al condi ion. In e es ingly, mo e han hal o he
non-speci ic co e species in he p esen se ies we e he same as hose p e iously iden i ied by
Takeshi a in ≥ 75% o Japanese adul s (259) as G. adiacens, H. pa ain luenzae, o R.
mucilaginosa, among o he s. These esul s con i m ha se e al bac e ial axa in he sali a y
Objec i e 2
247
Table 1. Selec ed p ime pai s wi h high in silico co e age pe cen ages a ge ing o al bac e ia and/o
a chaea and hose mos used in he sequencing-based s udies o he o al mic obiome.
P ime pai s we e selec ed based on he species co e age alues (numbe o species de ec ed / o al species
e alua ed) in objec i e 1 (21). They we e indi idually e alua ed h ough egula exp essions agains Esche ichia
coli J01859 o de ine hei posi ions. The U alues ep esen a misma ch on he assessmen and, he e o e, he
posi ion canno be con i med wi h a gua an ee. Gene egions we e delimi ed as desc ibed by Bake e al. (30).
*The p ime pai gene egion was 3 and **1-10 when conside ing he mode posi ions ob ained in he analysis
agains he o al-bac e ia and o al-a chaea da abases in objec i e 1 (21).
ALC= amplicon leng h ca ego y; bps= base pai s; F= o wa d; KP= Klindwo h p ime ; L= long mean amplicon
leng h ca ego y, >600 base pai s; M= medium mean amplicon leng h ca ego y, 301-600 base pai s; OP= o al
p ime ; Pos = posi ion; R= e e se; S= sho mean amplicon leng h ca ego y, 100-300 base pai s; U= unaligned
wi h Esche ichia coli; V= a iable.
ALBA REGUEIRA IGLESIAS
248
The di ec and e e se sequences o each p ime pai selec ed we e used in combina ion
wi h Py hon’s egex module (31) o ob ain, in silico, he amplicons o he 16S RNA genes
iden i ied in all o he chosen genomes. Fo each p ime pai , we de e mined: he mean size and
numbe o he 16S RNA gene amplicons; he numbe o gene a ian s; he numbe o genomes
and species de ec ed; and he pe cen age o co e age a he species le el wi h no MAs (SC-
NMA). This co e age alue was calcula ed as:
SC-NMA (%)= [(Numbe o species de ec ed - Numbe o species wi h MAs)/To al numbe
o species e alua ed] x 100
The o e es ima ion o abundance a he species le el ( he o e es ima ion ac o -OF-) was
also calcula ed. This ep esen ed o each species he combina ion o he numbe o copies o
he 16S RNA gene amplicons and he numbe o MAs. To emo e he o e es ima ion de i ed
om he in agenomic gene edundancy, he OF o each species was di ided by he numbe o
gene copies, esul ing in OF caused by he p esence o MAs (OF-MA). Species wi h alues
equal o 1.00 did no ha e amplicons ha ma ched o he species o he co esponding p ime
pai , while hose wi h es ima es g ea e han 1.00 did. Fo each p ime pai , bo h pa ame e s
we e exp essed cumula i ely and as an a e age. The bes p ime pai s selec ed i s we e hose
wi h he highes SC-NMA alue and o hese, hose wi h he lowes OF-MA alue. The wo s
p ime pai s we e hose wi h he lowes SC-NMA and he highes OF-MA.
Objec i e 2
249
2.4. RESULTS
2.4.1. Numbe o in agenomic 16S RNA genes in o al-bac e ia and o al-a chaea
genomes
Table 2 de ails he mean numbe o in agenomic 16S RNA genes in he bac e ial and
a chaeal phyla h ough se en axonomic anks. The 518 o al-bac e ia genomes examined had a
mean size o 2,933,660.68 bps and an a e age numbe o 4.55 in agenomic 16S RNA genes,
which in u n had a mean size o 1,501.32 bps and an a e age o 2.60 a ian s. Ele en o he
186 bac e ial species (5.91%) had one gene/genome, 159 species (85.49%) showed a mean
be ween wo and six genes, and 16 species (8.60%), mean alues o se en o mo e genes. The
maximum mean numbe o in agenomic 16S RNA genes obse ed was 10.83 in Bacillus
an h acis, wi h i e s ains o his species ha ing a o al o 11 genes/genome. Conce ning he
a e age numbe o in agenomic gene a ian s, 63 bac e ial species (33.87%) p esen ed one
a ian /genome, 118 species (63.44%), be ween wo and six, and i e species (2.69%), se en
o mo e.
The 191 o al-a chaea genomes had a mean size o 2,545,441.40 bps and an a e age o 1.95
in agenomic 16S RNA genes, which in u n had a mean size o 1,471.25 bps and an a e age
o 1.44 a ian s. Six y- ou ou o he 135 a chaeal species (47.41%) had a mean o one
gene/genome, 67 species (49.63%) showed an a e age be ween wo and h ee genes, and 4
species (2.96%) mean alues abo e h ee (Me hanobac e ium o micicum, Me hanococcus
annielii, Me hanosphae a s ad manae, and Me hanospi illum hunga ei). A he s ain le el,
he maximum o al numbe o genes/genome inc eased o i e in Me hanococcus ma ipaludis
(unknown s ain) and Sul olobus acidocalda ius (unknown s ain). Conce ning he a e age
numbe o in agenomic gene a ian s, 93 species (68.89%) had an a e age numbe o one
a ian /genome and 42 (31.11%) had be ween wo and h ee.
Appendices S3 and S4 con ain he sizes o he bac e ial and a chaeal genomes and genes,
he numbe o genes/genome, and he numbe o gene a ian s/genome ac oss eigh axonomic
anks.
ALBA REGUEIRA IGLESIAS
250
Table 2. In agenomic 16S RNA genes in he bac e ial and a chaeal phyla h ough se en axonomy anks.
Mean numbe o in agenomic 16S RNA genes
Taxonomy le el
Phylum Phylum Class O de Family Gene a Species S ain No.
genomes
Ac inobac e ia 3.12 3.19 – 2.00 3.41 – 1.33 4.55 – 1.10 4.55 – 1.00 5.00 – 1.00 5 - 1 91
Bac e oide es 3.68 4.75 – 3.44 4.75 – 3.44 4.75 – 2.00 4.75 – 2.00 7.00 – 2.00 7 - 2 24
C. Saccha ibac e ia 1.00 1.00 1.00 1.00 1.00 1.00 1 1
Chlamydiae 1.00 1.00 1.00 1.00 1.00 1.00 1 - 1 5
Chlo obi 2.00 2.00 2.00 2.00 2.00 2.00 2 1
Chlo o lexi 2.00 2.00 – 2.00 2.00 – 2.00 2.00 – 2.00 2.00 – 2.00 2.00 – 2.00 2 - 2 2
Fi micu es 5.43 5.52 – 3.25 6.61 – 3.25 9.85 – 2.00 10.18 – 2.00 10.83 – 2.00 11 - 2 177
Fusobac e ia 4.35 4.35 4.35 4.40 – 4.33 4.75 – 3.00 5.00 – 3.00 5 - 2 21
Igna ibac e iae 1.00 1.00 1.00 1.00 – 1.00 1.00 – 1.00 1.00 – 1.00 1 - 1 2
P o eobac e ia 5.21 6.13 – 2.17 6.98 – 2.17 7.14 – 2.00 8.00 – 2.00 8.00 – 2.00 8 - 2 170
Spi ochae es 2.00 2.00 2.00 2.00 2.00 2.00 - 2.00 2 - 2 11
Tene icu es 1.23 1.23 1.23 1.23 1.67 – 1.10 2.00 – 1.00 2 - 1 13
C. The moplasma o a 1.00 1.00 1.00 – 1.00 1.00 – 1.00 1.00 – 1.00 1.00 – 1.00 1 - 1 7
C ena chaeo a 1.10 1.10 1.25 – 1.00 1.25 – 1.00 1.29 – 1.00 2.00 – 1.00 5 - 1 43
Eu ya chaeo a 2.29 2.67 – 1.00 2.89 – 1.00 4.00 – 1.00 4.00 – 1.00 4.00 – 1.00 5 - 1 138
Thauma chaeo a 1.00 1.00 1.00 1.00 1.00 1.00 – 1.00 1 - 1 3
Mean numbe o in agenomic 16S RNA gene a ian s
Taxonomy le el
Phylum Phylum Class O de Family Gene a Species S ain No.
genomes
Ac inobac e ia 1.54 1.56 – 1.20 2.00 – 1.00 3.00 – 1.00 4.00 – 1.00 4.00 – 1.00 4 - 1 91
Bac e oide es 1.77 2.50 – 1.61 2.50 – 1.61 2.50 – 1.00 2.50 – 1.00 5.00 – 1.00 5 - 1 24
C. Saccha ibac e ia 1.00 1.00 1.00 1.00 1.00 1.00 1 1
Chlamydiae 1.00 1.00 1.00 1.00 1.00 1.00 1 - 1 5
Chlo obi 1.00 1.00 1.00 1.00 1.00 1.00 1 1
Chlo o lexi 1.50 2.00 – 1.00 2.00 – 1.00 2.00 – 1.00 2.00 – 1.00 2.00 – 1.00 2 - 1 2
Fi micu es 3.18 3.50 – 1.75 4.85 – 1.75 8.00 – 1.00 9.00 – 1.00 9.00 – 1.00 10 - 1 177
Fusobac e ia 3.55 3.55 3.55 3.73 – 3.00 3.73 – 3.00 5.00 – 1.00 5 - 1 21
Igna ibac e iae 1.00 1.00 1.00 1.00 – 1.00 1.00 – 1.00 1.00 – 1.00 1 - 1 2
P o eobac e ia 2.87 3.55 – 1.00 4.93 – 1.00 5.45 – 1.00 6.17 – 1.00 8.00 – 1.00 8 - 1 170
Spi ochae es 1.36 1.36 1.36 1.36 1.36 2.00 – 1.22 2 - 1 11
Tene icu es 1.15 1.15 1.15 1.15 1.67 – 1.00 1.67 – 1.00 2 - 1 13
C. The moplasma o a 1.00 1.00 1.00 – 1.00 1.00 – 1.00 1.00 – 1.00 1.00 – 1.00 1 - 1 7
C ena chaeo a 1.00 1.00 1.00 – 1.00 1.00 – 1.00 1.00 – 1.00 1.00 – 1.00 1 - 1 43
Eu ya chaeo a 1.61 1.86 – 1.00 2.00 – 1.00 3.00 – 1.00 3.00 – 1.00 3.00 – 1.00 3 - 1 138
Thauma chaeo a 1.00 1.00 1.00 1.00 1.00 1.00 – 1.00 1 - 1 3
Ranges a he s ain le el a e no mean alues, hey co espond o he maximum and minimum numbe s o
in agenomic genes in all s ains om a gi en phylum.
C. Saccha ibac e ia= Candida us Saccha ibac e ia; C. The moplasma o a= Candida us The moplasma o a; No.=
numbe .
Objec i e 2
251
2.4.2. E alua ion o he p ime pai s aken om ou p e ious esea ch and hose used
mos in o al mic obiome s udies
Tables 3 and 4 de ail he size and numbe o 16S RNA gene amplicons de ec ed by he
p ime pai s in he o al-bac e ia and o al-a chaea genomes. The mean numbe o 16S RNA
gene amplicons a ied om 4.84 o 4.39 o bac e ia (mean amplicon a ian s/genome= 2.69
o 1.09) and 2.43 o 1.58 o a chaea (mean amplicon a ian s/genome= 1.34 o 1.08). All he
p ime combina ions iden i ied he maximum mean numbe s o in agenomic genes o he
bac e ial and a chaeal species examined (10.83 and 4.00, espec i ely). Howe e , al hough
mos o he p ime pai s we e able o de ec he highes mean alue o he gene a ian s/genome
o he a chaeal species (i.e., 3.00), only one p ime pai de ec ed his maximum alue o
bac e ial species (i.e., 9.00).
ALBA REGUEIRA IGLESIAS
252
Table 3. Size and numbe o 16S RNA gene amplicons de ec ed by he p ime pai s in he o al-bac e ia
genomes.
Supe kingdom le el Species le el
ALC Bac e ia-speci ic
p ime pai s
Gene
egion
Amplicon
leng h
(mean, bps)
g/G
(mean)
g /G
(mean)
Amplicon leng h
(mean, ange, bps)
g/G
(mean,
ange)
g /G
(mean,
ange)
S
KP_F048-OP_R043 3 - 4 182.99 4.62 1.25 190.00 – 162.00 10.83 – 1.00 4.00 – 1.00
OP_F098-OP_R119 4 - 5 288.86 4.68 1.22 290.00 - 287.98 10.83 – 1.00 3.00 – 1.00
OP_F066-KP_R040 5 - 6 142.07 4.84 1.11 152.00 – 135.00 10.83 – 1.00 2.00 – 1.00
OP_F009-OP_R030 5 - 7 296.13 4.60 1.38 307.00 – 283.00 10.83 – 1.00 5.00 – 1.00
KP_F061-KP_R074 6 - 7 206.30 4.76 1.31 212.00 – 202.00 10.83 – 1.00 4.00 – 1.00
OP_F101-OP_R030 6 - 7 164.06 4.77 1.31 170.00 – 160.00 10.83 – 1.00 3.00 – 1.00
M
OP_F053-KP_R020 1 - 3 351.74 4.61 1.97 547.00 – 315.00 10.83 – 1.00 8.00 – 1.00
KP_F048-KP_R031 3 – 5 454.84 4.61 1.42 462.00 – 433.00 10.83 – 1.00 5.00 – 1.00
KP_F048-OP_R073 3 - 6 546.81 4.67 1.49 554.20 – 520.00 10.83 – 1.00 5.00 – 1.00
KP_F051-KP_R041 4 - 6 410.90 4.84 1.32 421.00 – 404.00 10.83 – 1.00 3.00 – 1.00
KP_F051-OP_R030 4 - 7 566.17 4.62 1.55 577.00 – 552.00 10.83 – 1.00 5.00 – 1.00
OP_F116_KP_R060 7 - 9 308.84 4.54 1.35 1012.50 – 285.00 10.83 – 1.00 4.00 – 1.00
L
KP_F048-OP_R030 3 - 7 733.00 4.61 1.71 742.56 – 707.00 10.83 – 1.00 5.00 – 1.00
KP_F048-KP_R060 3 – 9 1059.48 4.59 1.93 1070.00 – 1016.00 10.83 – 1.00 6.00 – 1.00
KP_F056-KP_R077 4 – 9 846.21 4.67 1.81 1551.50 – 821.00 10.83 – 1.00 6.00 – 1.00
Supe kingdom le el Species le el
ALC
Bac e ial and
a chaeal p ime
pai s
Gene
egion
Amplicon
leng h
(mean, bps)
g/G
(mean)
g /G
(mean)
Amplicon leng h
(mean, ange, bps)
g/G
(mean,
ange)
g /G
(mean,
ange)
S
OP_F114-KP_R002 3 - 4 188.27 4.74 1.27 194.50 – 167.00 10.83 – 1.00 4.00 – 1.00
KP_F020-KP_R032 4 - 5 283.86 4.71 1.22 285.00 – 282.98 10.83 – 1.00 3.00 – 1.00
OP_F066-OP_R073 5 - 6 110.11 4.65 1.09 120.00 – 101.00 10.83 – 1.00 2.00 – 1.00
M
OP_F114-KP_R031 3 - 5 456.84 4.60 1.42 464.00 – 435.00 10.83 – 1.00 5.00 – 1.00
OP_F114-OP_R073 3 - 6 548.82 4.67 1.49 556.20 – 522.00 10.83 – 1.00 5.00 – 1.00
KP_F020-OP_R073 4 - 6 375.93 4.72 1.29 386.00 – 366.00 10.83 – 1.00 3.00 – 1.00
L
OP_F114-OP_R121 3 - 9 1060.47 4.59 1.93 1071.00 – 1017.00 10.83 – 1.00 6.00 – 1.00
KP_F020-OP_R121 4 - 9 889.30 4.70 1.82 1594.50 – 864.00 10.83 – 1.00 6.00 – 1.00
OP_F066-OP_R121 5 - 9 623.05 4.55 1.65 1328.50 – 598.00 10.83 – 1.00 6.00 – 1.00
Supe kingdom le el Species le el
ALC Mos used p ime
pai s
Gene
egion
Amplicon
leng h
(mean, bps)
g/G
(mean)
g /G
(mean)
Amplicon leng h
(mean, ange, bps)
g/G
(mean,
ange)
g /G
(mean,
ange)
S KP_F078-OP_R010B+A 4 – 5 291.86 4.71 1.22 293.00 – 290.98 10.83 – 1.00 3.00 – 1.00
M
KP_F031-KP_R021B 1 - 4 525.59 4.39 2.03 700.00 – 467.00 10.83 – 1.00 8.00 – 1.00
KP_F047-KP_R035B 3 - 5 460.25 4.61 1.42 467.00 – 438.00 10.83 – 1.00 5.00 – 1.00
OP_F009-OP_R029B 5 - 8 409.87 4.76 1.51 417.00 – 395.00 10.83 – 1.00 5.00 – 1.00
L KP_F034-KP_R065B 1 – 9* 1505.85 4.81 2.69 1677.00 – 1429.00 10.83 – 1.00 9.00 – 1.00
The amplicon leng h ca ego y and gene egions we e de e mined in objec i e 1 acco ding o he mean size o
he amplicons gene a ed by a gi en p ime and o he mode i s posi ion o he o wa d p ime and he mode
las o he e e se p ime , espec i ely. The mos commonly used p ime pai s in he li e a u e we e de ec ed
in objec i e 1 (21). *The p ime pai gene egion was 1-10 when conside ing he mode posi ions ob ained in he
analysis agains he o al-bac e ia and o al-a chaea da abases in objec i e 1 (21).
A= a chaea; ALC= amplicon leng h ca ego y; B= bac e ia; bps= base pai s; F= o wa d; g/G= numbe o 16S RNA
gene amplicons pe genome; g /G= numbe o 16S RNA gene a ian amplicons pe genome; KP= Klindwo h
p ime ; L= long mean amplicon leng h ca ego y, >600 base pai s; M= medium mean amplicon leng h ca ego y,
301-600 base pai s; OP= o al p ime ; R= e e se; S= sho mean amplicon leng h ca ego y,100-300 base pai s.
Objec i e 2
253
Table 4. Size and numbe o 16S RNA gene amplicons de ec ed by he p ime pai s in he o al-a chaea
genomes.
Supe kingdom le el Species le el
ALC A chaea-speci ic
p ime pai s
Gene
egion
Amplicon
leng h
(mean, bps)
g/G
(mean)
g /G
(mean)
Amplicon leng h
(mean, ange, bps)
g/G
(mean,
ange)
g /G
(mean,
ange)
S KP_F018-KP_R002 4* 154.68 1.96 1.09 860.00 – 138.00 4.00 – 1.00 3.00 – 1.00
OP_F066-KP_R013 5 - 6 274.32 1.99 1.11 277.00 – 274.00 4.00 – 1.00 2.00 – 1.00
M
KP_F018-KP_R032 3 - 5 429.16 1.95 1.18 1914.00 – 407.00 4.00 – 1.00 3.00 – 1.00
KP_F018-OP_R073 3 - 5 526.11 1.98 1.22 2010.00 – 503.00 4.00 – 1.00 3.00 – 1.00
KP_F020-KP_R013 3 - 6 545.97 1.99 1.21 1325.00 – 539.00 4.00 – 1.00 3.00 – 1.00
KP_F022-KP_R063 5 - 9 586.51 2.00 1.22 670.00 – 530.00 4.00 – 1.00 3.00 – 1.00
L
OP_F114-KP_R013 3 - 6 693.70 1.99 1.26 2178.00 – 671.00 4.00 – 1.00 3.00 – 1.00
KP_F018-KP_R063 3 - 9 1131.87 1.96 1.34 1828.00 – 1056.00 4.00 – 1.00 3.00 – 1.00
OP_F066-OP_R016 5 - 9 623.27 2.01 1.22 626.33 – 620.00 4.00 – 1.00 3.00 – 1.00
Supe kingdom le el Species le el
ALC
Bac e ial and
a chaeal p ime
pai s
Gene
egion
Amplicon
leng h
(mean, bps)
g/G
(mean)
g /G
(mean)
Amplicon leng h
(mean, ange, bps)
g/G
(mean,
ange)
g /G
(mean,
ange)
S
OP_F114-KP_R002 3 - 4 162.29 1.95 1.10 868.00 – 146.00 4.00 – 1.00 3.00 – 1.00
KP_F020-KP_R032 4 - 5 289.43 1.95 1.14 1069.00 – 283.00 4.00 – 1.00 3.00 – 1.00
OP_F066-OP_R073 5 - 6 114.03 1.98 1.08 115.00 – 114.00 4.00 – 1.00 2.00 – 1.00
M
OP_F114-KP_R031 3 - 5 436.72 1.95 1.19 1922.00 – 415.00 4.00 – 1.00 3.00 – 1.00
OP_F114-OP_R073 3 - 6 533.62 1.98 1.23 2018.00 – 511.00 4.00 – 1.00 3.00 – 1.00
KP_F020-OP_R073 4 - 6 385.76 1.99 1.18 1165.00 – 379.00 4.00 – 1.00 3.00 – 1.00
L
OP_F114-OP_R121 3 - 9 1042.81 1.98 1.33 1741.00 – 1023.00 4.00 – 1.00 3.00 – 1.00
KP_F020-OP_R121 4 - 9 907.41 1.98 1.29 2279.00 – 891.00 4.00 – 1.00 3.00 - 1.00
OP_F066-OP_R121 5 - 9 635.78 1.98 1.22 1323.00 – 625.00 4.00 – 1.00 3.00 – 1.00
Supe kingdom le el Species le el
ALC Mos used p ime
pai s
Gene
egion
Amplicon
leng h
(mean, bps)
g/G
(mean)
g /G
(mean)
Amplicon leng h
(mean, ange, bps)
g/G
(mean,
ange)
g /G
(mean,
ange)
S KP_F078-OP_R010B+A 4 – 5 292.79 2.43 1.21 294.00 – 291.50 4.00 – 1.00 3.00 – 1.00
L KP_F014-KP_R011A 3 - 6 606.18 1.58 1.14 603.00 – 608.00 4.00 – 1.00 3.00 – 1.00
The amplicon leng h ca ego y and gene egions we e de e mined in objec i e 1 acco ding o he mean size o
he amplicons gene a ed by a gi en p ime and o he mode i s posi ion o he o wa d p ime and he mode
las o he e e se p ime , espec i ely. The mos commonly used p ime pai s in he li e a u e we e de ec ed
in objec i e 1 (21). *The p ime pai gene egion was 3 when conside ing he mode posi ions ob ained in he
analysis agains he o al-bac e ia and o al-a chaea da abases in objec i e 1 (21).
A= a chaea; ALC= amplicon leng h ca ego y; B= bac e ia; bps= base pai s; F= o wa d; g/G= numbe o 16S RNA
gene amplicons pe genome; g /G= numbe o 16S RNA gene a ian amplicons pe genome; KP= Klindwo h
p ime ; L= long mean amplicon leng h ca ego y, >600 base pai s; M= medium mean amplicon leng h ca ego y,
301-600 base pai s; OP= o al p ime ; R= e e se; S= sho mean amplicon leng h ca ego y,100-300 base pai s.
Tables 5 and 6 show he pe cen ages o de ec ed axa wi h and wi hou MAs and
o e abundance es ima o s ob ained by he p ime pai s es ed on he o al-bac e ia and o al-
a chaea genomes. Ou selec ed p ime pai s de ec ed 16S RNA gene amplicons in a ange om
99.46% o 88.71% o he bac e ial species and 99.26% o 90.37% o he a chaeal species;
ALBA REGUEIRA IGLESIAS
254
hese pe cen ages we e lowe o he p ime pai s used mos in he o al mic obiome li e a u e
(95.16% - 74.19% o he bac e ia, and 63.70% and 30.37% o he a chaea).
O e all, excluding he mos commonly used p ime pai s in he li e a u e, unlike he
co e age alues, he SC-NMA alues inc eased as he mean leng h o he amplicons ob ained
by he p ime pai inc eased. I we con as he pe cen ages o species de ec ed wi h hei
espec i e SC-NMA, all he sho p ime pai s analysed showed he la ges di e ences be ween
bo h pa ame e s (a e age di e ence= 21.34% o bac e ia and 23.70% o a chaea), ollowed
by hose o medium leng h (7.30% and 13.75%, espec i ely). The long p ime pai s p esen ed
he smalles di e ences be ween he co e age and SC-NMA alues (4.30% and 5.82%,
espec i ely).
Acco ding o he SC-NMA alues, he bes h ee bac e ia-speci ic p ime pai s we e:
KP_F048-OP_R030 and KP_F048-KP_R060 (L, SC-NMA= 93.55%, six MAs, OF-MA= 1.06
o bo h) and OP_F053-KP_R020 (M, 93.01%, six, 1.06). In con as , he wo s p ime pai was
OP_F066-KP_R040 (S, 47.31%, 77, 2.78). The mos commonly used p ime pai s in he
li e a u e did no s and ou o hei SC-NMA alues among hose in hei ca ego y.
Conside ing he h ee ca ego ies o amplicon leng hs, he SC-NMA alues o he a chaea-
speci ic p ime pai s anged om 89.63% o he KP_F018-KP_R063 (L, six MAs, OF-MA=
1.11), 85.93% o KP_F022-KP_R063 (M, eigh , 1.14) o 69.63% o he OP_F066-KP_R013
(S, 35, 1.99). In e es ingly, he long p ime pai KP_F014-KP_R011, which is he one used
mos in he li e a u e o de ec o al a chaea, was only able o iden i y 30.37% o he species
es ed in his s udy, esul ing in he lowes SC-NMA alue (26.67%, i e MAs, OF-MA= 1.14).
In ela ion o he bac e ial and a chaeal p ime pai s, he o e all SC-NMA alues anged
om 92.52% o OP_F114_OP_R121 (L, 12 MAs, OF-MA= 1.08), 88.79% o OP_F114-
KP_R031 (M, 29, 1.26) o 54.21% o OP_F066-OP_R073 (S, 134, 3.45). In e ms o o e all
SC-NMA, he second wo s was KP_F078-OP_R010 (S, 66.67%, 48 MAs, OF-MA= 1.68),
mainly due o i s low capaci y o de ec a chaea (63.70%), which di ec ly a ec ed he SC-NMA
alue o a chaea (48.89%) (Table 6). Howe e , his p ime pai is he mos widely used in he
li e a u e o de ec bac e ia and a chaea.
Objec i e 2
255
Table 5. De ec ed axa wi h and wi hou ma ching amplicons and o e abundance es ima o s ob ained by he
p ime pai s es ed on he o al-bac e ia genomes.
ALC Bac e ia-speci ic
p ime pai s
De ec ed
genomes
(
%
)
De ec ed
species
(
%
)
De ec ed
species wi h
MAs
(
%
)
SC-NMA
(%) OF OF-MA
S
KP_F048-OP_R043 508 (98.07) 180 (96.77) 22 (12.22) 158 (84.95) 5.82 1.30
OP_F098-OP_R119 493 (95.17) 177 (95.16) 28 (15.82) 149 (80.11) 8.28 1.73
OP_F066-KP_R040 455 (87.84) 165 (88.71) 77 (46.67) 88 (47.31) 13.16 2.78
OP_F009-OP_R030 504 (97.30) 181 (97.31) 29 (16.02) 152 (81.72) 6.01 1.32
KP_F061-KP_R074 468 (90.35) 169 (90.86) 39 (23.08) 130 (69.89) 7.48 1.61
OP_F101-OP_R030 460 (88.80) 167 (89.78) 39 (23.35) 128 (68.82) 7.44 1.61
M
OP_R053-KP_R020 506 (97.68) 179 (96.24) 6 (3.35) 173 (93.01) 4.80 1.06
KP_F048-KP_R031 507 (97.88) 180 (96.77) 9 (5.00) 171 (91.94) 5.04 1.12
KP_F048-OP_R073 498 (96.14) 178 (95.70) 6 (3.37) 172 (92.47) 4.72 1.06
KP_F051-KP_R041 456 (88.03) 166 (89.25) 20 (12.05) 146 (78.50) 7.45 1.58
KP_F051-OP_R030 508 (98.07) 184 (98.92) 19 (10.33) 165 (88.71) 5.53 1.22
OP_F116_KP_R060 516 (99.61) 185 (99.46) 31 (16.76) 154 (82.80) 6.13 1.37
L
KP_F048-OP_R030 507 (97.88) 180 (96.77) 6 (3.33) 174 (93.55) 4.72 1.06
KP_F048-KP_R060 507 (97.88) 180 (96.77) 6 (3.33) 174 (93.55) 4.72 1.06
KP_F056-KP_R077 495 (95.56) 180 (96.77) 10 (5.56) 170 (91.40) 4.89 1.10
ALC
Bac e ial and
a chaeal p ime
pai s
De ec ed
genomes
(%)
De ec ed
species
(%)
De ec ed
species wi h
MAs (%)
SC-NMA
(%) OF OF-MA
S
OP_F114-KP_R002 485 (93.63) 172 (92.47) 22 (12.79) 150 (80.65) 5.82 1.30
KP_F020-KP_R032 488 (94.21) 176 (94.62) 28 (15.91) 148 (79.57) 8.28 1.73
OP_F066-OP_R073 502 (96.91) 182 (97.85) 85 (46.70) 97 (52.15) 15.90 3.31
M
OP_F114-KP_R031 507 (97.88) 180 (96.77) 9 (5.00) 171 (91.94) 5.04 1.12
OP_F114-OP_R073 498 (96.14) 178 (95.70) 6 (3.77) 172 (92.47) 4.72 1.06
KP_F020-OP_R073 488 (94.21) 176 (94.62) 22 (12.50) 154 (82.80) 7.52 1.61
L
OP_F114-OP_R121 507 (97.88) 180 (96.77) 6 (3.33) 174 (93.55) 4.72 1.06
KP_F020-OP_R121 489 (94.40) 177 (95.16) 10 (5.65) 167 (89.79) 4.89 1.10
OP_F066-OP_R121 516 (99.61) 185 (99.46) 16 (8.65) 169 (90.86) 5.20 1.16
ALC Mos used p ime
pai s
De ec ed
genomes
(
%
)
De ec ed
species
(
%
)
De ec ed
species wi h
MAs
(
%
)
SC-NMA
(%) OF OF-MA
S KP_F078-OP_R010B+A 488 (94.21) 176 (94.62) 28 (15.91) 148 (79.57) 8.28 1.73
M
KP_F031-KP_R021B 347 (66.99) 138 (74.19) 2 (1.45) 136 (73.12) 4.50 1.02
KP_F047-KP_R035B 500 (96.53) 177 (95.16) 9 (5.09) 168 (90.32) 5.04 1.12
OP_F009-OP_R029B 469 (90.54) 164 (88.17) 24 (14.63) 140 (75.27) 5.62 1.24
L KP_F034-KP_R065B 440 (84.94) 155 (83.33) 2 (1.29) 153 (82.26) 4.50 1.02
A= a chaea; ALC= amplicon leng h ca ego y; B= bac e ia; F= o wa d; KP= Klindwo h p ime ; L= long mean
amplicon leng h ca ego y, >600 base pai s; M= medium mean amplicon leng h ca ego y, 301-600 base pai s; MAs=
ma ching amplicons; OF= o e es ima ion ac o ; OF-MA= o e es ima ion ac o associa ed wi h ma ching
amplicons; OP= o al p ime ; R= e e se; S= sho mean amplicon leng h ca ego y,100-300 base pai s; SC-NMA=
species co e age wi h no ma ching amplicons.
ALBA REGUEIRA IGLESIAS
256
Table 6. De ec ed axa wi h and wi hou ma ching amplicons and o e abundance es ima o s ob ained by he
p ime pai s es ed on he o al-a chaea genomes.
ALC A chaea-speci ic
p ime pai s
De ec ed
genomes
(
%
)
De ec ed
species
(
%
)
De ec ed
species wi h
MAs
(
%
)
SC-NMA
(%) OF OF-MA
S KP_F018-KP_R002 185 (96.86) 129 (95.56) 29 (22.48) 100 (74.07) 3.30 1.76
OP_F066-KP_R013 184 (96.34) 129 (95.56) 35 (27.13) 94 (69.63) 4.02 1.99
M
KP_F018-KP_R032 186 (97.38) 130 (96.30) 20 (15.39) 110 (81.48) 2.68 1.49
KP_F018-OP_R073 177 (92.67) 122 (90.37) 18 (14.75) 104 (77.04) 2.65 1.46
KP_F020-KP_R013 183 (95.81) 128 (94.81) 20 (15.63) 108 (80.00) 2.61 1.35
KP_F022-KP_R063 180 (94.24) 124 (91.85) 8 (6.45) 116 (85.93) 2.26 1.14
L
OP_F114-KP_R013 184 (96.34) 129 (95.56) 16 (12.40) 113 (83.70) 2.47 1.28
KP_F018-KP_R063 183 (95.81) 127 (94.07) 6 (4.72) 121 (89.63) 2.16 1.11
OP_F066-OP_R016 180 (94.24) 124 (91.85) 8 (6.45) 116 (85.93) 2.26 1.14
ALC
Bac e ial and
a chaeal p ime
pai s
De ec ed
genomes
(%)
De ec ed
species
(%)
De ec ed
species wi h
MAs (%)
SC-NMA
(%) OF OF-MA
S
OP_F114-KP_R002 190 (99.48) 134 (99.26) 29 (21.64) 105 (77.78) 3.30 1.76
KP_F020-KP_R032 190 (99.48) 134 (99.26) 30 (22.39) 104 (77.04) 3.88 1.92
OP_F066-OP_R073 181 (94.76) 126 (93.33) 49 (38.89) 77 (57.04) 8.37 3.71
M
OP_F114-KP_R031 190 (99.48) 134 (99.26) 20 (14.93) 114 (84.44) 2.68 1.49
OP_F114-OP_R073 181 (94.76) 126 (93.33) 18 (14.29) 108 (80.00) 2.65 1.46
KP_F020-OP_R073 180 (94.24) 125 (92.59) 26 (20.80) 99 (73.33) 3.74 1.85
L
OP_F114-OP_R121 185 (96.86) 129 (95.56) 6 (4.65) 123 (91.11) 2.16 1.11
KP_F020-OP_R121 185 (96.86) 129 (95.56) 6 (4.65) 123 (91.11) 2.16 1.11
OP_F066-OP_R121 186 (97.38) 130 (96.30) 8 (6.15) 122 (90.37) 2.26 1.14
ALC Mos used p ime
pai s
De ec ed
genomes
(
%
)
De ec ed
species
(
%
)
De ec ed
species wi h
MAs
(
%
)
SC-NMA
(%) OF OF-MA
S KP_F078-OP_R010B+A 123 (66.40) 86 (63.70) 20 (23.26) 66 (48.89) 3.56 1.60
L KP_F014-KP_R011A 44 (23.04) 41 (30.37) 5 (12.20) 36 (26.67) 2.00 1.14
A= a chaea; ALC= amplicon leng h ca ego y; B= bac e ia; F= o wa d; KP= Klindwo h p ime ; L= long mean
amplicon leng h ca ego y, >600 base pai s; M= medium mean amplicon leng h ca ego y, 301-600 base pai s; MAs=
ma ching amplicons; OF= o e es ima ion ac o ; OF-MA= o e es ima ion ac o associa ed wi h ma ching
amplicons; OP= o al p ime ; R= e e se; S= sho mean amplicon leng h ca ego y,100-300 base pai s; SC-NMA=
species co e age wi h no ma ching amplicons.
Appendices S5-S11 con ain mo e de ailed in o ma ion on he esul s o MA- and MA- ee
species co e age and he o e abundance pa ame e s (OF and OF-MA alues) ob ained by he
p ime pai s es ed agains he o al-bac e ia and o al-a chaea genomes. Appendices S5, S9, and
S11 also include he esul s ob ained by he bac e ial and a chaeal p ime pai s o bo h
domains.
Objec i e 2
263
2.6. CONCLUSIONS
In conclusion, nea ly all o al bac e ia and abou hal o he o al a chaea ha e mo e han
one 16S RNA gene in hei espec i e genomes. Depending on he p ime pai used, up o
almos hal o he species p esen MAs, a ec ing ele an gene a p esen in he o al
en i onmen such as Ac inomyces, Fusobac e ium, Lac obacillus, Me hanosa cina,
S aphylococcus, and S ep ococcus. The pe o mance o he p ime pai s o de ec non-MA
species inc eases as he a e age leng h o he amplicons inc eases; none o hese being he mos
widely used p ime pai s in he o al mic obiome li e a u e. The bes p ime pai s we e:
KP_F048-OP_R030 ( o bac e ia; egion 3-7; p ime pai posi ion o Esche ichia coli
J01859.1: 342-1079), KP_F018-KP_R063 ( o a chaea; 3-9; unde ined-1506), and
OP_F114_OP_R121 ( o bo h bac e ia and a chaea; 3-9; 340-1405). In addi ion o he 16S
RNA gene edundancy, he conside able p esence o MAs mus be con olled o ensu e he
accu a e in e p e a ion o mic obial di e si y da a. The SC-NMA is a mo e use ul pa ame e
han he con en ional co e age pe cen age o selec ing he bes p ime pai s. The choice o
p ime pai a ec s signi ican ly di e si y es ima es and axonomic classi ica ion, condi ioning
he compa abili y o o al mic obiome s udies using di e en p ime pai s.
ALBA REGUEIRA IGLESIAS
264
2.7. REFERENCES
(1) Rajendh an J, Gunaseka an P. Mic obial phylogeny and di e si y: small subuni ibosomal
RNA sequence analysis and beyond. Mic obiol Res. 2011 Feb;166(2):99-110.
(2) Woese CR. Bac e ial e olu ion. Mic obiol Re . 1987 Jun;51(2):221-71.
(3) del Rosa io-Rodicio M, del Ca men-Mendoza M. Bac e ial iden i ica ion by 16S RNA
sequencing: a ionale, me hodology and applica ions in clinical mic obiology. En e m In ecc
Mic obiol Clin. 2004 Ap ;22(4):238-45. Spanish.
(4) Acinas SG, Ma celino LA, Klepac-Ce aj V, Polz MF. Di e gence and edundancy o 16S
RNA sequences in genomes wi h mul iple n ope ons. J Bac e iol. 2004 May;186(9):2629-
35.
(5) Pei AY, Obe do WE, Nossa CW, Aga wal A, Chokshi P, Ge z EA, e al. Di e si y o 16S
RNA genes wi hin indi idual p oka yo ic genomes. Appl En i on Mic obiol. 2010
Jun;76(12):3886-97.
(6) Sun D, Jiang X, Wu QL, Zhou N. In agenomic he e ogenei y o 16S RNA genes causes
o e es ima ion o p oka yo ic di e si y. Appl En i on Mic obiol. 2013 Oc ;79(19):5962-9.
(7) Vě o ský T, Bald ian P. The a iabili y o he 16S RNA gene in bac e ial genomes and
i s consequences o bac e ial communi y analyses. PLoS One. 2013;8(2):e57923. doi:
10.1371/jou nal.pone.0057923.
(8) Case RJ, Bouche Y, Dahllö I, Holms öm C, Dooli le WF, Kjellebe g S. Use o 16S RNA
and poB genes as molecula ma ke s o mic obial ecology s udies. Appl En i on Mic obiol.
2007 Jan;73(1):278-88.
(9) Lee ZM, Bussema C 3 d, Schmid TM. nDB: documen ing he numbe o RNA and RNA
genes in bac e ia and a chaea. Nucleic Acids Res. 2009 Jan;37(Da abase issue):D489-93. doi:
10.1093/na /gkn689.
Objec i e 2
265
(10) Johnson JS, Spakowicz DJ, Hong BY, Pe e sen LM, Demkowicz P, Chen L, e al.
E alua ion o 16S RNA gene sequencing o species and s ain-le el mic obiome analysis. Na
Commun. 2019 No ;10(1):5029. doi: 10.1038/s41467-019-13036-1.
(11) Chen J, Miao X, Xu M, He J, Xie Y, Wu X, e al. In a-genomic he e ogenei y in 16S
RNA genes in s ic ly anae obic clinical isola es om pe iodon al abscesses. PLoS One. 2015
Jun;10(6):e0130265. doi: 10.1371/jou nal.pone.0130265.
(12) Du án-Pinedo AE, F ias-Lopez J. Beyond mic obial communi y composi ion: unc ional
ac i i ies o he o al mic obiome in heal h and disease. Mic obes In ec . 2015 Jul;17(7):505-16.
(13) Ve ma D, Ga g PK, Dubey AK. Insigh s in o he human o al mic obiome. A ch Mic obiol.
2018 May;200(4):525-40.
(14) F Escapa I, Huang Y, Chen T, Lin M, Koka as A, Dewhi s FE, e al. Cons uc ion o
habi a -speci ic aining se s o achie e species-le el assignmen in 16S RNA gene da ase s.
Mic obiome. 2020 May;8(1):65. doi: 10.1186/s40168-020-00841-w.
(15) Rel as M, Reguei a-Iglesias A, Balsa-Cas o C, Salaza F, Pacheco JJ, Cab al C, e al.
Rela ionship be ween den al and pe iodon al heal h s a us and he sali a y mic obiome:
bac e ial di e si y, co-occu ence ne wo ks and p edic i e models. Sci Rep. 2021
Jan;11(1):929. doi: 10.1038/s41598-020-79875-x.
(16) Camelo-Cas illo A, No oa L, Balsa-Cas o C, Blanco J, Mi a A, Tomas I. Rela ionship
be ween pe iodon i is-associa ed subgingi al mic obio a and clinical in lamma ion by 16S
py osequencing. J Clin Pe iodon ol. 2015 Dec;42(12):1074-82.
(17) Camelo-Cas illo AJ, Mi a A, Pico A, Nibali L, Hende son B, Donos N, e al. Subgingi al
mic obio a in heal h compa ed o pe iodon i is and he in luence o smoking. F on Mic obiol.
2015 Feb;6:119. doi: 10.3389/ micb.2015.00119.
ALBA REGUEIRA IGLESIAS
266
(18) F Escapa I, Chen T, Huang Y, Gaja e P, Dewhi s FE, Lemon KP. New insigh s in o human
nos il mic obiome om he expanded Human O al Mic obiome Da abase (eHOMD): a
esou ce o he mic obiome o he human ae odiges i e ac . mSys ems. 2018
Dec;3(6):e00187-18. doi: 10.1128/mSys ems.00187-18.
(19) Cla k K, Ka sch-Miz achi I, Lipman DJ, Os ell J, Saye s EW. GenBank. Nucleic Acids
Res. 2016 Jan;44:D67-72. doi: 10.1093/na /gk 1276.
(20) NCBI Resou ce Coo dina o s. Da abase esou ces o he Na ional Cen e o
Bio echnology In o ma ion. Nucleic Acids Res. 2016 Jan;44(D1):D7-19. doi:
10.1093/na /gk 1290.
(21) Reguei a-Iglesias A, Vázquez-González L, Balsa-Cas o C, Vila-Blanco N, Blanco-Pin os
T, Tamames J, e al. In silico e alua ion and selec ion o he bes 16S RNA gene p ime s o
use in nex -gene a ion sequencing o de ec o al bac e ia and a chaea. Accep ed o publica ion
in Mic obiome. P ep in a Resea ch Squa e. 2021. doi: 10.21203/ s.3. s-516961/ 1.
(22) Na ional Cen e o Bio echnology In o ma ion. En ez p og amming u ili ies help. 2010;
A ailable a : h ps://www.ncbi.nlm.nih.go /books/NBK25501/.
(23) Py hon So wa e Founda ion. Py hon. Ve sion 3.9.0. 2020. h p://www.py hon.o g/.
(24) Schoch CL, Ciu o S, Dom ache M, Ho on CL, Kannan S, Kho anskaya R, e al. NCBI
Taxonomy: a comp ehensi e upda e on cu a ion, esou ces and ools. Da abase (Ox o d). 2020
Jan;2020:baaa062. doi: 10.1093/da abase/baaa062.
(25) O'Lea y NA, W igh MW, B is e JR, Ciu o S, Haddad D, McVeigh R, e al. Re e ence
sequence (Re Seq) da abase a NCBI: cu en s a us, axonomic expansion, and unc ional
anno a ion. Nucleic Acids Res. 2016 Jan;44(D1):D733-45. doi: 10.1093/na /gk 1189.
(26) Lyalina S. Sea ch 16S py algo i hm. 2019; A ailable a :
h ps://gi hub.com/slyalina/sea ch_16S_py.
Objec i e 2
267
(27) Edga R. SEARCH_16S: A new algo i hm o iden i ying 16S ibosomal RNA genes in
con igs and ch omosomes. P ep in a bioRxi 2017:124131. doi: 10.1101/124131.
(28) Ha is CR, Millman KJ, an de Wal , S é an J, Gomme s R, Vi anen P, Cou napeau D,
e al. A ay p og amming wi h NumPy. Na u e. 2020 Sep;585(7825):357-62.
(29) McKinney W. Da a s uc u es o s a is ical compu ing in Py hon. In: an de Wal S,
Millman J, edi o s. P oceedings o he 9 h Py hon in Science Con e ence; 2010; Aus in. Texas:
SciPy; 2010. doi: 10.25080/Majo a-92b 1922-00a.
(30) Bake GC, Smi h JJ, Cowan DA. Re iew and e-analysis o domain-speci ic 16S p ime s.
J Mic obiol Me hods. 2003 Dec;55(3):541-55.
(31) Ba ne M. egex. 2020; A ailable a : h ps://pypi.o g/.
(32) Coenye T, Vandamme P. In agenomic he e ogenei y be ween mul iple 16S ibosomal
RNA ope ons in sequenced bac e ial genomes. FEMS Mic obiol Le . 2003 No ;228(1):45-9.
(33) Klappenbach JA, Saxman PR, Cole JR, Schmid TM. nDB: he ibosomal RNA ope on
copy numbe da abase. Nucleic Acids Res. 2001 Jan;29(1):181-4.
(34) S odda d SF, Smi h BJ, Hein R, Rolle BR, Schmid TM. nDB: imp o ed ools o
in e p e ing RNA gene abundance in bac e ia and a chaea and a new ounda ion o u u e
de elopmen . Nucleic Acids Res. 2015 Jan;43(Da abase issue):D593-8. doi:
10.1093/na /gku1201.
(35) Applied Ma hs NV. Kodon 2.0; A ailable a : h ps://www.applied-ma hs.com.
(36) Lagesen K, Hallin P, Rødland EA, S æ eld H, Rognes T, Usse y DW. RNAmme :
consis en and apid anno a ion o ibosomal RNA genes. Nucleic Acids Res. 2007;35(9):3100-
8.
ALBA REGUEIRA IGLESIAS
268
(37) Teles R, Teles F, F ias-Lopez J, Pas e B, Ha ajee A. Lessons lea ned and unlea ned in
pe iodon al mic obiology. Pe iodon ol 2000. 2013 Jun;62(1):95-162.
(38) Ab anches J, Zeng L, Kaj asz JK, Palme SR, Chak abo y B, Wen ZT, e al. Biology o
o al s ep ococci. Mic obiol Spec . 2018 Oc ;6(5):10.1128/mic obiolspec.GPP3-0042-2018.
(39) Jiang S, Gao X, Jin L, Lo EC. Sali a y mic obiome di e si y in ca ies- ee and ca ies-
a ec ed child en. In J Mol Sci. 2016 No ;17(12):1978. doi: 10.3390/ijms17121978.
(40) Mi chell J. S ep ococcus mi is: walking he line be ween commensalism and pa hogenesis.
Mol O al Mic obiol. 2011 Ap ;26(2):89-98.
(41) Thu nhee T, Belibasakis GN. S ep ococcus o alis main ains homeos asis in o al bio ilms
by an agonizing he ca iogenic pa hogen S ep ococcus mu ans. Mol O al Mic obiol. 2018
Jun;33(3):234-9.
(42) Deng ZL, Sza ański SP, Ja ek M, Bhuju S, Wagne -Döble I. Dysbiosis in ch onic
pe iodon i is: key mic obial playe s and in e ac ions wi h he human hos . Sci Rep. 2017
Jun;7(1):3703. doi: 10.1038/s41598-017-03804-8.
(43) Schloss PD. Amplicon sequence a ian s a i icially spli bac e ial genomes in o sepa a e
clus e s. mSphe e. 2021 Aug;6(4):e0019121. doi: 10.1128/mSphe e.00191-21.
(44) Zhang J, Ding X, Guan R, Zhu C, Xu C, Zhu B, e al. E alua ion o di e en 16S RNA
gene V egions o explo ing bac e ial di e si y in a eu ophic eshwa e lake. Sci To al
En i on. 2018 Ma ;618:1254-67.
(45) Capo aso JG, Laube CL, Wal e s WA, Be g-Lyons D, Lozupone CA, Tu nbaugh PJ, e
al. Global pa e ns o 16S RNA di e si y a a dep h o millions o sequences pe sample. P oc
Na l Acad Sci U S A. 2011 Ma ;108 Suppl 1(Suppl 1):4516-22.
Objec i e 2
269
(46) Illumina, Inc. 16S Me agenomic Sequencing Lib a y P epa a ion. 2013; A ailable a :
h ps://suppo .illumina.com/con en /dam/illumina-
suppo /documen s/documen a ion/chemis y_documen a ion/16s/16s-me agenomic-lib a y-
p ep-guide-15044223-b.pd .
(47) Zhang Y, Wang X, Li H, Ni C, Du Z, Yan F. Human o al mic obio a and i s modula ion
o o al heal h. Biomed Pha maco he . 2018 Ma ;99:883-93.
OBJECTIVE 3
Objec i e 3
279
The e o e, a o al o 709 comple e p oka yo ic genomes om a o al o 321 o al species
we e downloaded (mo e han one comple e genome was analysed o se e al species). Finally,
he comple e axonomic hie a chy ( om supe kingdom o s ain) o all downloaded comple e
genomes was designa ed by he axonomic iden i ie included in he anno a ed in o ma ion in
he NCBI da abase (26), all compu a ionally pe o med wi h ou sc ip abo e. The axonomy
and NCBI iden i ie s o he o al-bac e ia and a chaea genomes a e included in appendices S1
and S2, espec i ely.
3.3.2. Selec ing he p ime pai s and ob aining he in silico amplicons o he 16S RNA
gene
Thi y- h ee p ime pai s wi h he bes in silico co e age, as iden i ied in objec i e 1, we e
selec ed, along wi h he six p ime pai s used he mos in he o al mic obiome li e a u e (27).
These p ime pai s we e classi ied acco ding o he mean leng h o hei amplicons in o: sho
p ime pai s (S, 100-300 base pai s), medium p ime pai s (M, 301-600 bps), and long p ime
pai s (L, >600 bps); and he domain a ge ed (bac e ia, a chaea, o bo h) (Table 1).
ALBA REGUEIRA IGLESIAS
280
Table 1. Selec ed p ime pai s wi h high in silico co e age pe cen ages a ge ing o al bac e ia and/o
a chaea and hose mos used in he sequencing-based s udies o he o al mic obiome.
P ime pai s we e selec ed based on he species co e age alues (numbe o species de ec ed / o al species
e alua ed) in objec i e 1 (27). They we e indi idually e alua ed h ough egula exp essions agains Esche ichia
coli J01859 o de ine hei posi ions. The U alues ep esen a misma ch on he assessmen and, he e o e, he
posi ion canno be con i med wi h a gua an ee. Gene egions we e delimi ed as desc ibed by Bake e al. (32).
*The p ime pai gene egion was 3 and **1-10 when conside ing he mode posi ions ob ained in he analysis
agains he o al-bac e ia and o al-a chaea da abases in objec i e 1 (27).
ALC= amplicon leng h ca ego y; bps= base pai s; F= o wa d; KP= Klindwo h p ime ; L= long mean amplicon
leng h ca ego y, >600 base pai s; M= medium mean amplicon leng h ca ego y, 301-600 base pai s; OP= o al
p ime ; Pos = posi ion; R= e e se; S= sho mean amplicon leng h ca ego y, 100-300 base pai s; U= unaligned
wi h Esche ichia coli; V= a iable.
Objec i e 3
281
Applying ou sc ip in combina ion wi h Py hon’s egex module (33), he di ec and e e se
sequences o each p ime pai we e used o ob ain in silico sequence segmen s o he whole
genomes analysed (he ea e e e ed o as in silico amplicons). An in silico amplicon was
conside ed o subsequen analysis when he ollowing condi ions we e p esen : 1) he e is a
ze o misma ch o bo h p ime s ( o wa d and e e se) o each pai ; 2) he dis ance be ween he
s a ing posi ion o he o wa d p ime and he ending posi ion o he e e se p ime is less han
2300 and highe han 100 nucleo ides; 3) he in silico amplicon does no epea wi hin he same
species.
All in silico amplicons om he same species, e en i om di e en s ains, we e
conside ed o analysis. Fo each p ime pai , a as a ile was c ea ed whe e all in silico
amplicons ound we e s o ed. The s o ed sequences we e iden i ied wi h he same axonomic
hie a chy as he genomes om which hey we e de ec ed. As many in silico-amplicons we e
de ec ed wi hin he same species (di e ing by a leas 1 nucleo ide), he sequence a ian s we e
iden i ied wi h co ela i e numbe ing a a new hie a chical le el below he species name.
In he as a iles, all sequences included a species iden i ie (SPn) and a a ian iden i ie
(Vn) in hei heade , and hen he heade o each sequence also included he axonomic
hie a chy up o he a ian le el wi hin each species. Finally, he in silico amplicons we e
ob ained om 186 o al-bac e ial and 135 o al-a chaeal species.
3.3.3. De e mina ion o he pe cen age o simila i y be ween in silico amplicons o
di e en o al species by MegaBLAST
A sc ip wi h he Ncbiblas nCommandline w appe om Biopy hon (34) was de eloped o
manage BLAST+ 2.11 (35) in he local mode om Biopy hon. This enabled he da a
ob ained in he alignmen s o be easily ans e ed o la e analysis on Py hon (29). The
alignmen pa ame e s we e con igu ed o be he same as he de aul se ings in MegaBLAST
(36) since hese se ings we e app op ia e o he alignmen be ween sequences wi h a simila i y
≥95%.
All sequences belonging o he same as a ile o he same p ime pai we e aligned agains
hemsel es; in o de o do his, each as a ile was inse ed as subjec and que y in BLASTN
ALBA REGUEIRA IGLESIAS
282
(37) o ob aining he pe cen age o simila i y be ween in silico amplicons belonging o
di e en o al species.
F om he esul s ob ained, in silico amplicons wi h 100% alignmen co e age o he que y
sequences and wi h a simila i y alue ≥97% we e selec ed. Tha is, alignmen s wi h he
ollowing BLAST+ es ima es (35): qco s= 100%, qco hsp= 100%, qco us= 100%, and piden
≥97% we e selec ed. O he abo e alignmen s ob ained, he ollowing we e disca ded as hey
we e no o in e es : 1) in silico amplicons wi h he same unique iden i ie (SPn + Vn); 2) in
silico amplicons wi h he same species iden i ie ; and 3) duplica e alignmen s.
I wo di e en species had mo e han one in silico amplicon simila i y alue ≥97%
(ASI97) among hem, one o he alignmen s was chosen a andom. The esul s o he highly
simila species pai s, including axonomic hie a chy da a o bo h species, we e hen s o ed
using he pandas (38) and xlsxw i e (39) Py hon modules.
3.3.4. Cons uc ion o a ma ix wi h o al species showing in silico amplicon simila i y
alues ≥97% and calcula ion o desc ip i e s a is ical es ima o s
A simila i y ma ix was c ea ed o each p ime pai , whe e ows and columns had he
species iden i ie s, and cells indica ed wi h a numbe 1 he p esence o an ASI97 be ween wo
di e en species. We hen de eloped a sc ip in R ( e sion 4.0.3) (40) h ough which we
calcula ed he ollowing es ima es o each analysed p ime pai : 1) he numbe o species wi h
a leas one ASI97 wi h o he species; 2) he o al numbe o ASI97 be ween di e en species;
3) he mean and maximum numbe s o ASI97 pe species. In addi ion, we es ima ed he
pe cen age o de ec ed species (species co e age, SC) and he pe cen age o de ec ed species
wi hou ASI97 o each p ime pai (species co e age no ASI97, SC-NASI97). This las
pa ame e was hen used as a c i e ion o selec ing he p ime s associa ed wi h a smalle
numbe o o al species ha may be e oneously clus e ed. The SC-NASI97 pa ame e will be
in luenced no only by he numbe o species wi h ASI, bu also by he co e age pe cen ages
o each p ime pai .
Finally, he bac e ial and a chaeal species pai s ha showed an ASI97 we e desc ibed and
assessed whe he hey belonged o di e en gene a o highe axonomic anks.
Objec i e 3
283
3.4. RESULTS
3.4.1. E alua ion o he p ime pai s o de ec ing o al species wi h in silico amplicon
simila i y alues ≥97%
The p ime pai s ha a ge ed bac e ia had a mean o 91.88 (49.40%) bac e ial species wi h
an ASI97 and an a e age o 153.46 ASI97 con aining dis inc species. Fo hose a ge ing
a chaea, hese numbe s we e 65.60 (48.59%) and 162.26, espec i ely. I he p ime s used mos
in he o al mic obiome li e a u e we e excluded, hose wi h sho amplicon leng hs (unlike he
SC pe cen ages) had he lowes SC-NASI97 alues o bo h bac e ia (S= 39.54%) and a chaea
(S= 40.44%) compa ed o he medium leng h and long p ime s (M= 45.82% and 46.35%,
espec i ely; L= 48.39% and 44.32%, espec i ely).
Figu es 2 and 3 show he numbe o species wi h ASI97 and he numbe o ASI97 wi h
each p ime pai e alua ed agains bac e ia and a chaea, espec i ely; while igu es 4 and 5
de ail he pe cen ages o co e age and co e age conside ing he p esence o absence o ASI97
o bo h domains. Conce ning he bac e ia-speci ic p ime pai s, he numbe o bac e ial species
wi h an ASI97 and he o al numbe o ASI97 anged om 37 and 32 wi h he mos widely used
p ime KP_F031-KP_R021 (M; SC-NASI97= 54.30%), o 120 and 277 wi h OP_F066-
KP_R040 (S; SC-NASI97= 24.19%), espec i ely. This la e p ime also had he lowes SC-
NASI97 alue, while OP_F053-KP_R020 de ec ed he highes numbe o species wi h no
ASI97 (M; SC-NASI97= 65.05%). In addi ion, excep o OP_F053-KP_R020, all he bac e ia-
speci ic p ime s had a maximum numbe o ASI97/species abo e i e ( ange= 4 - 15
ASI97/species).
Conce ning he a chaea-speci ic p ime pai s, he numbe o a chaeal species wi h an
ASI97 and he o al numbe o ASI97 anged om 24 and 96 wi h he widely used KP_F014-
KP_R011 (L; SC-NASI97= 12.59%) o 89 and 240 wi h OP_F066-KP_R013 (S; SC-NASI97=
29.63%), espec i ely. The o me p ime de ec ed he lowes numbe o species wi hou an
ASI97, and KP_F018-KP_R002 he highes (S; SC-NASI97= 51.11%). Mo eo e , all he
a chaea-speci ic p ime s had a maximum numbe o ASI97/species ≥10 ( ange= 10 - 13
ASI97/species).
ALBA REGUEIRA IGLESIAS
284
Figu e 2. Numbe o bac e ial species wi h in silico amplicon simila i y alues ≥97% and numbe o in silico
amplicon simila i y alues ≥97% wi h he p ime pai s e alua ed agains he o al-bac e ia genomes. (A)
Es ima es we e ob ained by he selec ed bac e ia-speci ic p ime pai s. (B) Es ima es we e ob ained by he
selec ed bac e ial and a chaeal p ime pai s and he p ime pai s used he mos in he o al mic obiome
li e a u e.
Among he mos commonly used p ime pai s in he li e a u e, hose ma ked wi h an * a e bac e ia-speci ic and
hose wi h ** a ge bo h bac e ial and a chaea. ASI97= in silico amplicon simila i y alues ≥97%; F= o wa d; KP=
Klindwo h p ime ; No.= numbe ; OP= o al p ime ; R= e e se.
Finally, using bo h he bac e ial and a chaeal p ime pai s, he numbe o bac e ial and
a chaeal species wi h an ASI97 and he o al numbe o ASI97 anged om 84 and 60 and 118
and 126, espec i ely, wi h OP_F114-KP_R002 (S; SC-NASI≥97= 47.31% o bac e ia and
54.81% o a chaea) o 124 and 95 and 239 and 286, espec i ely, wi h OP_F066-OP_R073 (S;
SC-NASI≥97= 31.18% o bac e ia and 22.96% o a chaea). The la e p ime also de ec ed
Objec i e 3
285
he lowes numbe o species wi hou an ASI97 and OP_F114-KP_R031 he highes (M; SC-
NASI97= 51.08% o bac e ia and 53.33% o a chaea) (Figu es 2b-5b). Mos bac e ial and
a chaeal p ime combina ions had maximum numbe s o ASI97/species ≥10 ( ange= 9 - 14
ASI/species and 11 - 14 ASI/ species o bo h domains, espec i ely).
Figu e 3. Numbe o a chaeal species wi h in silico amplicon simila i y alues ≥97% and numbe o in silico
amplicon simila i y alues ≥97% wi h he p ime pai s e alua ed agains he o al-a chaea genomes. (A)
Es ima es we e ob ained by he selec ed a chaea-speci ic p ime pai s. (B) Es ima es we e ob ained by he
selec ed bac e ial and a chaeal p ime pai s and he p ime pai s used he mos in he o al mic obiome
li e a u e.
Among he mos commonly used p ime pai s in he li e a u e, hose ma ked wi h an * a e a chaea-speci ic and
hose wi h ** a ge bo h bac e ial and a chaea. ASI97= in silico amplicon simila i y alues ≥97%; F= o wa d; KP=
Klindwo h p ime ; No.= numbe ; OP= o al p ime ; R= e e se.
ALBA REGUEIRA IGLESIAS
286
Figu e 4. Pe cen ages o co e age and co e age conside ing he species wi h in silico amplicon simila i y
alues ≥97% o he p ime pai s e alua ed agains he o al-bac e ia genomes. (A) Pe cen ages we e ob ained
by he selec ed bac e ia-speci ic p ime pai s. (B) Pe cen ages we e ob ained by he selec ed bac e ial and
a chaeal p ime pai s and he p ime pai s used he mos in he o al mic obiome li e a u e.
Among he mos commonly used p ime pai s in he li e a u e, hose ma ked wi h an * a e bac e ia-speci ic and
hose wi h ** a ge bo h bac e ial and a chaea. ASI97= in silico amplicon simila i y alues ≥97%; F= o wa d; KP=
Klindwo h p ime ; Non-SC= non-co e age o species; OP= o al p ime ; R= e e se; SC= species co e age; SC-
ASI97= species co e age wi h in silico amplicon simila i y alues ≥97%; SC-NASI97= species co e age wi h no in
silico amplicon simila i y alues ≥97%.
Objec i e 3
287
Figu e 5. Pe cen ages o co e age and co e age conside ing he species wi h in silico amplicon simila i y
alues ≥97% o he p ime pai s e alua ed agains he o al-a chaea genomes. (A) Pe cen ages ob ained by
he selec ed a chaea-speci ic p ime pai s. (B) Pe cen ages ob ained by he selec ed bac e ial and a chaeal
p ime pai s and he p ime pai s used he mos in he o al mic obiome li e a u e.
Among he mos commonly used p ime pai s in he li e a u e, hose ma ked wi h an * a e a chaea-speci ic and
hose wi h ** a ge bo h bac e ial and a chaea. ASI97= in silico amplicon simila i y alues ≥97%; F= o wa d; KP=
Klindwo h p ime ; Non-SC= non-co e age o species; OP= o al p ime ; R= e e se; SC= species co e age; SC-
ASI97= species co e age wi h in silico amplicon simila i y alues ≥97%; SC-NASI97= species co e age wi h no in
silico amplicon simila i y alues ≥97%.
Figu es 6 and 7 a e ne wo ks showing he po en ial clus e s (he eina e e e ed o as
po en ial OTUs) wi h a ≥97% simila i y h eshold ob ained wi h he p ime pai s ha p esen ed
he lowes SC-NASI97 alues (F066-KP_R040 o bac e ia, OP_F066-KP_R013 o a chaea,
and OP_F066-OP_R073 o bac e ia and a chaea), as well as one o he mos used p ime pai s
in he o al mic obiome li e a u e, KP_F078-OP_R010. Thus, o example, o he p ime pai
F066-KP_R040, ocusing on he one indica ed by a dashed do ed line, 24 bac e ia o med a
ALBA REGUEIRA IGLESIAS
288
po en ial OTU, in which 10 gene a, i e amilies, and wo o de s we e in ol ed. As can be seen,
he e we e species such as Ligilac obacillus sali a ius (spp. 162) ha p esen ed high simila i y
only wi h wo o he s, Lac icaseibacillus pa acasei (spp. 196) and Lac icaseibacillus hamnosus
(spp. 243); while S aphylococcus cohnii (spp. 297) p esen ed high simila i y wi h 11 species
(among which, En e ococcus aecalis, spp. 155; S aphylococcus au eus, spp. 163;
Le ilac obacillus b e is, spp. 181; Len ilac obacillus buchne i, spp. 237) belonging o ou
gene a, h ee amilies and wo o de s. Fo he p ime pai OP_F066-KP_R013, he po en ial
OTU indica ed was o med by nine a chaea, in ol ing se en gene a and wo amilies. Thus,
Desul u ococcus amyloly icus (spp. 37) showed high simila i y only wi h Desul u ococcus
mucosus (spp. 68), while The mogladius calde a had high simila i y wi h i e species
(Hype he mus bu ylicus, spp. 24; S aphylo he mus ma inus, spp. 26; S aphylo he mus
hellenicus, spp. 57; Desul u ococcus mucosus, spp. 68; Py olobus uma ii; sp. 82) belonging o
ou gene a and wo amilies.
Objec i e 3
295
3.5. DISCUSSION
The high deg ee o simila i y be ween ull-leng h 16S RNA sequences om dis inc
species, o e en gene a, has been epo ed in he li e a u e (12,13), leading o ques ions abou
he eliabili y o di e si y es ima es de i ed om sequence clus e ing me hods based on a gi en
simila i y h eshold. Using ull-leng h genes and a ≥97% simila i y h eshold, some au ho s
ha e de ec ed ha a ound a qua e o cons uc ed OTUs con ain sequences om mul iple
species (12,13) and abou a en h om dis inc gene a (12). These es ima es we e ob iously
highe when gene egions we e assessed ins ead o ull sequences. Schloss e al. (13) ound ha ,
wi h a ≥97% simila i y h eshold and applying he Op iClus algo i hm (42), 31.7%, 34.3% and
34.8% o he OTUs assessed had 16S RNA amplicons om dis inc species in he a iable
egions 3-4, 4, and 4-5, espec i ely (13). Howe e , hese in es iga ions did no ocus on axa
inhabi ing a speci ic en i onmen , despi e he impo ance o conduc ing 16S RNA gene-based
esea ch using habi a -speci ic da abases (43). Consequen ly, we used p ime pai s a ge ing
se e al a iable egions o he 16S RNA gene (27) o de e mine he numbe o di e en o al-
bac e ial and o al-a chaeal species wi h in silico amplicon simila i y alues ≥97% (ASI97), as
well as he po en ial OTUs ha migh con ain dis inc species. Mo eo e , o he i s ime in
his kind o analysis, we desc ibed he speci ic axa o he o al ecosys em wi h highly simila
sequence segmen s, speci ying i hey belong o di e en gene a o o he highe axonomic
anks.
3.5.1. E alua ion o he p ime pai s o de ec ing o al species wi h in silico amplicon
simila i y alues ≥97%
In he p esen s udy, he p ime pai s ha a ge ed bac e ia had a mean o 91.88 (49.40%)
bac e ial species wi h an ASI97 and an a e age o 153.46 po en ial OTUs con aining dis inc
species. Fo hose a ge ing a chaea, hese numbe s we e 65.60 (48.59%) and 162.26,
espec i ely. Using he pe cen age species co e age wi h no in silico amplicons simila i y
≥97% (SC-NASI97) as a selec ion c i e ion, he op imum p ime pai o de ec ing o al bac e ia
was OP_F053-KP_R020. Al hough he p ime used mos in he o al mic obiome s udies,
KP_F031-KP_R021 iden i ied sligh ly ewe species wi h an ASI97 (37 s. 58) and numbe o
ASI97 (32 s. 46); i s SC-NASI97 was also lowe han ha o OP_F053-KP_R020 (54.30% s.
65.05%). The p ime pai p oducing he bes es ima es o de ec ing o al a chaea was KP_F018-
KP_R002. Again, he widely used p ime KP_F014-KP_R011, al hough i only de ec ed a ew
ALBA REGUEIRA IGLESIAS
296
species wi h an ASI97 (24 s. 60) and numbe o ASI97 (96 s. 125), howe e , also had a
conside ably lowe SC-NASI97 han ha o KP_F018-KP_R002 (12.59% s. 51.11%). Las ly,
we ecommend he p ime OP_F114-KP_R031 o de ec ing o al bac e ia and a chaea
simul aneously. OP_F114-KP_R002, meanwhile, iden i ied sligh ly ewe axa wi h an
ASI≥97% ( o bac e ia= 84 and o a chaea= 60 s. 85 and 62) and numbe o ASI97 (118 and
126 s. 133 and 136) bu had a lowe SC-NASI≥97% (47.31% and 54.81% s. 51.08% and
53.33%). In addi ion, as p e iously obse ed in objec i es 1 and 2 (27,44), none o he p ime
combina ions ha a e mos commonly employed in sequencing-based s udies o he o al
mic obiome we e among he bes . Speci ically, he species co e age o KP_F078-OP_R010, a
p ime desc ibed by Capo aso (45), ell om 94.62% o bac e ia and 63.70% o a chaea as
desc ibed in objec i e 2 (44) o 34.95% and 31.11%, espec i ely; when conside ing he species
wi h an ASI97, possibly gene a ing as many as 215 and 99 po en ial bac e ial and a chaeal
OTUs, espec i ely; ha con ain di e en species.
3.5.2. Desc ip ion o he dis inc pai s o o al-bac e ia species and o al-a chaea
species wi h in silico amplicon simila i y alues ≥97%
A ound 80% o he o al-bac e ia and o al-a chaea species analysed had an ASI97 wi h a
leas ano he species. The widely-known bac e ial pe iodon opa hogens F. nuclea um and T.
den icola (46-48) had simila in silico amplicons o Fusobac e ium hwasookii and T eponema
pu idum, espec i ely, which ha e also been de ec ed in pe iodon al lesions (49,50).
In e es ingly, o he bac e ia wi h high in silico amplicon simila i ies had an agonis ic oles in
o al heal h and disease. Examples a e: he heal h-associa ed C. concisus and he ini ially
pe iodon i is-associa ed C. cu us (51); he heal h- ela ed Ro hia mucilaginosa (52) and he
decay-abundan R. den oca iosa (53,54); he commensal S. mi is, o alis, and sali a ius; he
ca ies-associa ed S. mu ans (46,55,56); and he pe iodon al heal h- ela ed Tanne ella sp. o al
axon HOT-286 (57,58) and he pe iodon i is- ela ed T. o sy hia (46-48). Fu he mo e, ele an
o al-disease associa ed species, such as A. ac inomyce emcomi ans (46,59) and R. den oca iosa
(53,54), we e among hose ha had an ASI97 wi h axa om dis inc gene a. Rega ding he
a chaea, we ound ha ou Me hanosa cina species ound in heal hy and pe iodon i is pocke s,
namely ba ke i, lacus is, mazeii, and acuola a (60), we e highly simila . Mo eo e , H. ube ,
Me hano o is igneus, M. zhilinae, and N. occul us, which a e epo ed o be among he 10 mos
Objec i e 3
297
abundan species in bo h heal hy and pe iodon i is subjec s (60), had an ASI97 wi h se e al axa
om dis inc gene a.
Schloss (13) has ecen ly s a ed ha he isks o a i icially spli ing a genome in o mul iple
amplicon sequence a ian s (ASVs) a e g ea e han hose o clus e ing ASVs om di e en
species in o he same OTU when using b oad dis ance h esholds. Howe e , conside ing he
esul s ob ained in he p esen s udy, ou opinion is ha he la e app oach should be a oided
in he analysis o he o al mic obio a i he aim is o associa e species wi h speci ic clinical
condi ions. In silico amplicons om species adi ionally associa ed wi h con a y heal h
condi ions, like hose desc ibed abo e, can be g ouped wi h a ≥97% simila i y h eshold. This
would esul in bo h an o e abundance o he single species ep esen ing he OTU and an
unde es ima ion o he di e si y o he communi y, wi h o he species wi hin he OTU
o e looked. Consequen ly, i would be be e o use he lowes possible le el o esolu ion, i.e.,
he a ian le el (23), and da abases speci ically designed o axonomic iden i ica ions o axa
a his le el (43).
I has been demons a ed ha dis inc OTU clus e ing app oaches, o e en he same
me hod, can yield une en esul s o he same da ase (9-11). The e o e, we decided o analyse
he 97% simila i y ela ionships be ween o al species, wi hou conside ing he in luence o any
clus e ing algo i hm. Consequen ly, he esul s p esen ed he e a e an app oxima ion o he
di e en o al species ha could be g ouped in po en ial OTUs.
3.5.3. Limi a ions o he p esen s udy
The main limi a ion o ou s udy is ha we ha e only conside ed one, andomly selec ed,
o all possible in silico amplicons wi h ASI97 be ween wo di e en species o es ablish he
exis ence o a close ela ionship be ween he wo. Ano he conside a ion is ha we we e only
able o e alua e 25% o he o al mic oo ganism genomes lis ed on he eHOMD websi e, as he
emainde we e no ully sequenced. This absence o comple e genomes educed he numbe o
species in es iga ed o 35% o hose se ou on he si e. Al hough he analysis could ha e been
pe o med on anno a ions o he 16S RNA gene sequences om o al mic obes, we p e e ed
o use comple e genomes, he eby ensu ing he high quali y o he sequences e iewed. The
easons why we adop ed his app oach we e: 1) Edga (61) es ima ed ha he axonomy
ALBA REGUEIRA IGLESIAS
298
anno a ion e o a e o he ibosomal da abase p ojec (RDP) da abase (62) is ∼10%; on he
o he hand, he ound 249,490 iden ical sequences wi h con lic ing anno a ions in SILVA 128
(63) and G eengenes 13.5 (64) a anks up o phylum (7,804 con lic s), indica ing ha he
anno a ion e o a e in hese da abases is ∼17%; 2) we ha e e i ied in objec i e 1 ha a e y
high pe cen age o 16S RNA gene anno a ions p esen a loss o in o ma ion o up o 60 - 70
nucleo ides in egions 1 and 9 o he sequences, which in alida es hei use (27); 3) mos o he
comple e genomes e alua ed he e a e isola es ha we e sequenced wi h Sange echnology o
wi h second-gene a ion echnology (sho e sequences han Sange ). In bo h cases, con ig
sca olding algo i hms we e used o cons uc he comple e genomes om he sequences wi h
a minimum co e age o 8x o Sange sequences and 30x in he case o second-gene a ion
echnologies (65). In hese ypes o assemblies, posi ions wi hin he genome ha did no ha e
high co e age included non-speci ic nucleo ides. In he p esen s udy, we disca ded genomes
ha included mo e han 20 consecu i e unspeci ic posi ions; 4) in addi ion, many genomes we e
downloaded om he NCBI Re Se da abase (31), whe e he anno a ions o he comple e
genomes we e manually cu a ed o e-anno a ed conce ning he in o ma ion p o ided by he
o iginal au ho , including hei axonomic hie a chy. Thus, ou esul s highligh only pa o a
much mo e ex ensi e p oblem.
Objec i e 3
299
3.6. CONCLUSIONS
In conclusion, he es ed p ime pai s a ge ing bac e ia and/o a chaea de ec ed an a e age
o mo e han 150 po en ial OTUs ha migh con ain di e en species, when ≥97% simila i y
h eshold was used. Acco ding o he SC-NASI97 pa ame e , he bes p ime pai s we e:
OP_F053-KP_R020 o bac e ia ( egion 1-3; p ime pai posi ion o Esche ichia coli
J01859.1: 9-356); KP_F018-KP_R002 o a chaea (4 unde ined-532); and OP_F114-KP_R031
o bo h (3-5; 340-801). A ound 80% o he o al-bac e ia and o al-a chaea species analysed had
an ASI97 wi h a leas one o he species. These e y simila species play di e en oles in he
o al mic obio a and belong o bac e ial gene a such as Campylobac e , Ro hia, S ep ococcus,
and Tanne ella, and a chaeal gene a such as Halo i ax, Me hanosalsum,and Me hanosa cina.
Mo eo e , ~20% and ~30% o hese wo-by- wo simila i y ela ionships we e es ablished
be ween species om di e en bac e ial and a chaeal gene a, espec i ely. E en axa om
dis inc amilies, o de s, and classes could be g ouped in he same po en ial OTU.
Consequen ly, ega dless o he p ime pai used, sequence-clus e ing wi h ≥97% simila i y
p o ides an inaccu a e desc ip ion o o al-bac e ial and o al-a chaeal species, which can g ea ly
a ec mic obial di e si y pa ame e s. As a esul , OTU clus e ing condi ions he c edibili y o
associa ions be ween some o al species and ce ain heal h and disease condi ions. This
signi ican ly limi s he compa abili y o he mic obial di e si y indings epo ed in o al
mic obiome li e a u e.
ALBA REGUEIRA IGLESIAS
300
3.7. REFERENCES
(1) Midha MK, Wu M, Chiu KP. Long- ead sequencing in deciphe ing human gene ics o a
g ea e dep h. Hum Gene . 2019 Dec;138(11-12):1201-15.
(2) Da idson RM, Eppe son LE. Mic obiome sequencing me hods o s udying human
diseases. Me hods Mol Biol. 2018;1706:77-90.
(3) Zau a E, Pappala do VY, Buijs MJ, Volgenan CMC, B and BW. Op imizing he quali y
o clinical s udies on o al mic obiome: a p ac ical guide o planning, pe o ming, and epo ing.
Pe iodon ol 2000. 2021 Feb;85(1):210-36.
(4) Edga R. UPARSE: highly accu a e OTU sequences om mic obial amplicon eads. Na
Me hods. 2013 Oc ;10(10):996-8.
(5) S ackeb and E, Goebel, BM. Taxonomic no e: a place o DNA-DNA eassocia ion and
16s RNA sequence analysis in he p esen species de ini ion in bac e iology. In J Sys E ol
Mic obiol. 1994 Oc ;44(4):846-9.
(6) Bolyen E, Rideou JR, Dillon MR, Bokulich NA, Abne CC, Al-Ghali h G, e al.
Rep oducible, in e ac i e, scalable and ex ensible mic obiome da a science using QIIME 2. Na
Bio echnol. 2019 Aug;37(8):852-7.
(7) Schloss PD, Wes co SL, Ryabin T, Hall JR, Ha mann M, Hollis e EB, e al. In oducing
mo hu : open-sou ce, pla o m-independen , communi y-suppo ed so wa e o desc ibing and
compa ing mic obial communi ies. Appl En i on Mic obiol. 2009 Dec;75(23):7537-41.
(8) Edga R. Sea ch and clus e ing o de s o magni ude as e han BLAST. Bioin o ma ics.
2010 Oc ;26(19):2460-1.
(9) Wei Z, Zhang X, Cao M, Liu F, Qian Y, Zhang S. Compa ison o me hods o picking he
ope a ional axonomic uni s om amplicon sequences. F on Mic obiol. 2021 Ma ; 12:644012.
doi: 10.3389/ micb.2021.644012.
Objec i e 3
301
(10) He Y, Capo aso JG, Jiang XT, Sheng HF, Huse SM, Rideou JR, e al. S abili y o
ope a ional axonomic uni s: an impo an bu neglec ed p ope y o analyzing mic obial
di e si y. Mic obiome. 2015 May;3:20. doi: 10.1186/s40168-015-0081-x.
(11) Wes co SL, Schloss PD. De no o clus e ing me hods ou pe o m e e ence-based
me hods o assigning 16S RNA gene sequences o ope a ional axonomic uni s. Pee J. 2015
Dec;3:e1487. doi: 10.7717/pee j.1487.
(12) Vě o ský T, Bald ian P. The a iabili y o he 16S RNA gene in bac e ial genomes and
i s consequences o bac e ial communi y analyses. PLoS One. 2013;8(2):e57923. doi:
10.1371/jou nal.pone.0057923.
(13) Schloss PD. Amplicon sequence a ian s a i icially spli bac e ial genomes in o sepa a e
clus e s. mSphe e. 2021 Aug;6(4):e0019121. doi: 10.1128/mSphe e.00191-21.
(14) Edga R. UNOISE2: imp o ed e o -co ec ion o Illumina 16S and ITS amplicon
sequencing. P ep in a bioRxi . 2016. doi: 10.1101/081257.
(15) E en AM, Mo ison HG, Lescaul PJ, Re eillaud J, Vineis JH, Sogin ML. Minimum
en opy decomposi ion: unsupe ised oligo yping o sensi i e pa i ioning o high- h oughpu
ma ke gene sequences. ISME J. 2015 Ma ;9(4):968-79.
(16) Callahan BJ, McMu die PJ, Rosen MJ, Han AW, Johnson AJ, Holmes SP. DADA2: high-
esolu ion sample in e ence om Illumina amplicon da a. Na Me hods. 2016 Jul;13(7):581-3.
(17) Ami A, McDonald D, Na as-Molina JA, Kopylo a E, Mo on JT, Zech Xu Z, e al. Deblu
apidly esol es single-nucleo ide communi y sequence pa e ns. mSys ems. 2017
Ma ;2(2):e00191-16. doi: 10.1128/mSys ems.00191-16.
(18) Ca uso V, Song X, Asqui h M, Ka s ens L. Pe o mance o mic obiome sequence in e ence
me hods in en i onmen s wi h a ying biomass. mSys ems. 2019 Feb;4(1):e00163-18. doi:
10.1128/mSys ems.00163-18.
ALBA REGUEIRA IGLESIAS
302
(19) Nea ing JT, Douglas GM, Comeau AM, Langille MGI. Denoising he denoise s: an
independen e alua ion o mic obiome sequence e o -co ec ion app oaches. Pee J. 2018
Aug;6:e5364. doi: 10.7717/pee j.5364.
(20) P odan A, T ema oli V, B olin H, Zwinde man AH, Nieuwdo p M, Le in E. Compa ing
bioin o ma ic pipelines o mic obial 16S RNA amplicon sequencing. PLoS One. 2020
Jan;15(1):e0227434. doi: 10.1371/jou nal.pone.0227434.
(21) Abellan-Schneyde I, Ma chado MS, Rei meie S, Somme A, Sewald Z, Jan Baumbach J,
e al. P ime , pipelines, pa ame e s: issues in 16S RNA gene sequencing. mSphe e. 2021
Feb;6(1):e01202-20. doi: 10.1128/mSphe e.01202-20.
(22) Ga cía-López R, Co nejo-G anados F, Lopez-Za ala A, Co a-Huíza A, So elo-Mundo R,
Gómez-Gil B, e al. OTUs and ASVs p oduce compa able axonomic and di e si y om sh imp
mic obio a 16S p o iles using ailo ed abundance il e s. Genes (Basel). 2021 Ap ;12(4):564.
doi: 10.3390/genes12040564.
(23) Callahan BJ, McMu die PJ, Holmes SP. Exac sequence a ian s should eplace
ope a ional axonomic uni s in ma ke -gene da a analysis. ISME J. 2017 Dec;11(12):2639-43.
(24) F Escapa I, Chen T, Huang Y, Gaja e P, Dewhi s FE, Lemon KP. New insigh s in o human
nos il mic obiome om he expanded Human O al Mic obiome Da abase (eHOMD): a
esou ce o he mic obiome o he human ae odiges i e ac . mSys ems. 2018
Dec;3(6):e00187-18. doi: 10.1128/mSys ems.00187-18.
(25) Cla k K, Ka sch-Miz achi I, Lipman DJ, Os ell J, Saye s EW. GenBank. Nucleic Acids
Res. 2016 Jan;44:D67-72. doi: 10.1093/na /gk 1276.
(26) NCBI Resou ce Coo dina o s. Da abase esou ces o he Na ional Cen e o
Bio echnology In o ma ion. Nucleic Acids Res. 2016 Jan;44(D1):D7-19. doi:
10.1093/na /gk 1290.
Objec i e 3
303
(27) Reguei a-Iglesias A, Vázquez-González L, Balsa-Cas o C, Vila-Blanco N, Blanco-Pin os
T, Tamames J, e al. In silico e alua ion and selec ion o he bes 16S RNA gene p ime s o
use in nex -gene a ion sequencing o de ec o al bac e ia and a chaea. Accep ed o publica ion
in Mic obiome. P ep in a Resea ch Squa e. 2021. doi: 10.21203/ s.3. s-516961/ 1.
(28) Na ional Cen e o Bio echnology In o ma ion. En ez p og amming u ili ies help. 2010;
A ailable a : h ps://www.ncbi.nlm.nih.go /books/NBK25501/.
(29) Py hon So wa e Founda ion. Py hon. Ve sion 3.9.0. 2020; A ailable a :
h p://www.py hon.o g/.
(30) Schoch CL, Ciu o S, Dom ache M, Ho on CL, Kannan S, Kho anskaya R, e al. NCBI
Taxonomy: a comp ehensi e upda e on cu a ion, esou ces and ools. Da abase (Ox o d). 2020
Jan;2020:baaa062. doi: 10.1093/da abase/baaa062.
(31) O'Lea y NA, W igh MW, B is e JR, Ciu o S, Haddad D, McVeigh R, e al. Re e ence
sequence (Re Seq) da abase a NCBI: cu en s a us, axonomic expansion, and unc ional
anno a ion. Nucleic Acids Res. 2016 Jan;44(D1): D733-45. doi: 10.1093/na /gk 1189.
(32) Bake GC, Smi h JJ, Cowan DA. Re iew and e-analysis o domain-speci ic 16S p ime s.
J Mic obiol Me hods. 2003 Dec;55(3):541-55.
(33) Ba ne M. egex. 2020; A ailable a : h ps://pypi.o g/.
(34) Cock PJ, An ao T, Chang JT, Chapman BA, Cox CJ, Dalke A, e al. Biopy hon: eely
a ailable Py hon ools o compu a ional molecula biology and bioin o ma ics. Bioin o ma ics.
2009 Jun;25(11):1422-23.
(35) Camacho C, Coulou is G, A agyan V, Ma N, Papadopoulos J, Beale K, e al. BLAST+:
a chi ec u e and applica ions. BMC Bioin o ma ics. 2009 Dec;10:421. doi: 10.1186/1471-
2105-10-421.
ALBA REGUEIRA IGLESIAS
304
(36) Al schul SF, Gish W, Mille W, Mye s EW, Lipman DJ. Basic local alignmen sea ch ool.
J Mol Biol. 1990 Oc ;215(3):403-10.
(37) Chen Y, Ye W, Zhang Y, Xu Y. High speed BLASTN: an accele a ed MegaBLAST sea ch
ool. Nucleic Acids Res. 2015 Sep;43(16):7762-8.
(38) McKinney W. Da a s uc u es o s a is ical compu ing in Py hon. In: an de Wal S,
Millman J, edi o s. P oceedings o he 9 h Py hon in Science Con e ence; 2010; Aus in. Texas:
SciPy; 2010. doi: 10.25080/Majo a-92b 1922-00a.
(39) McNama a J. xlsxw i e . 2013; A ailable a : h ps://xlsxw i e . ead hedocs.io/.
(40) R Co e Team. R: a language and en i onmen o s a is ical compu ing. R package e sion
4.0.3. Vienna, Aus ia: R Founda ion o S a is ical Compu ing; 2020; A ailable a :
h ps://www.R-p ojec .o g/.
(41) Csa di G, Nepusz T. The Ig aph so wa e package o complex ne wo k esea ch.
In e Jou nal, Complex Sys ems. 2006; 1695; A ailable a : h p://ig aph.o g.
(42) Wes co SL, Schloss PD. Op iClus , an imp o ed me hod o assigning amplicon-based
sequence da a o ope a ional axonomic uni s. mSphe e. 2017 Ma ;2(2):e00073-17. doi:
10.1128/mSphe eDi ec .00073-17.
(43) F Escapa I, Huang Y, Chen T, Lin M, Koka as A, Dewhi s FE, e al. Cons uc ion o
habi a -speci ic aining se s o achie e species-le el assignmen in 16S RNA gene da ase s.
Mic obiome. 2020 May;8(1):65. doi: 10.1186/s40168-020-00841-w.
(44) Reguei a-Iglesias A, Vázquez-González L, Balsa-Cas o C, Blanco-Pin os T, Vila-Blanco
N, Ca ei a MJ, e al. Impac o 16S RNA gene edundancy and p ime pai selec ion on he
quan i ica ion and classi ica ion o o al mic obio a in nex -gene a ion sequencing. P ep in a
Resea ch Squa e. 2021. doi: 10.21203/ s.3. s-662236/ 1.
311
Objec i e 4. A la ge-scale me a-omics analysis o plaque mic obio a in
pe iodon al diseases
4.1. ABSTRACT
Aims: To analyse he sup agingi al and subgingi al plaque mic obio a a ASV le el o
di e en pe iodon al condi ions (pe iodon al heal h, gingi i is, and un ea ed and ea ed
pe iodon i is) in e ms o bac e ial di e si y, co-occu ence ne wo ks, and p edic i e models.
Ma e ial and me hods: A o al o 120 pa ien s (55 con ols, 65 pe iodon i is) we e selec ed
o subgingi al plaque collec ion. Sequencing o he 3-4 16S RNA gene egion was pe o med
in Illumina MiSeq. The ob ained sequences and me ada a we e uploaded o he sequence ead
a chi e (SRA). Sea ches we e pe o med in PubMed, Scopus, Embase, and he SRA o iden i y
p e iously published Illumina 3-4 sequencing s udies on he sup agingi al and subgingi al
plaque mic obiome in dis inc pe iodon al condi ions. Resea ch ha me he c i e ia o
sequences and me ada a we e included in he me a-omics analysis, comp ising a o al o 2045
samples. Sequences we e p ocessed unde he same bioin o ma ics p o ocol, which included
he ASV-le el classi ica ion and he use o an o al-speci ic da abase o axonomic
classi ica ion. The s a is ical analysis was conduc ed using he phyloseq, DESeq2, mic obiome,
mixOmics, egan, SpiecEasi, and ig aph packages.
Resul s and conclusions: Bac e ial ichness associa ed wi h pe iodon i is was highe han
in heal h in sup agingi al plaque and lowe in subgingi al, bu e enness was highe in disease
in bo h niches. The sup agingi al mic obio a was iche and mo e di e se han he subgingi al
o he same pe iodon al condi ion. The s uc u e o he bac e ial communi y di e ed among
condi ions in he sup a- and subgingi al plaque, as well as o he same heal h s a us be ween
he wo niches. In addi ion, he co e mic obio a o den al plaque did no allow he
cha ac e isa ion o pe iodon al heal h and disease; and he p opo ion o he bac e ial
communi y o ganised in co-occu ence ne wo ks a he ASV le el was e y small. Howe e , a
small p opo ion o sup a- and subgingi al axa had ou s anding abili y o dis inguish be ween
ALBA REGUEIRA IGLESIAS
312
pe iodon al condi ions, and a ele an pe cen age o hem we e co e membe s. Sup agingi al
plaque was a be e bac e ial bioma ke han subgingi al o disc imina ing pe iodon al heal h
om un ea ed and ea ed pe iodon i is. The main heal h-p edic o ASVs in sup agingi al and
subgingi al plaque we e: R. den oca iosa ASV2, H. pa ain luenzae ASV3, ASV78, ASV45,
and ASV46, K. o alis ASV66, S. es ibula is ASV27, and A. HMT170 ASV119. The main
p edic o ASVs o pe iodon i is in den al plaque we e: T. o sy hia ASV15, F. alocis ASV19,
T. den icola ASV38 and ASV150, F. as idiosum ASV97, P. HMT369 ASV124, S. anginosus
ASV142, and P. noda um ASV189.
4.1.1. Keywo ds
Me a-omics analysis; nex -gene a ion sequencing; 16S RNA gene; den al plaque;
sup agingi al; subgingi al; mic obio a; pe iodon al diseases.
4.1.2. Decla a ion o con lic o in e es
The doc o al candida e and he es o he au ho s o he p esen s udy decla e ha hey
ha e no con lic o in e es conce ning he objec i es p oposed in his chap e .
4.1.3. Funding
This in es iga ion was suppo ed by he Ins i u o de Salud Ca los III (Gene al Di ision o
E alua ion and Resea ch P omo ion, Mad id, Spain) and co- inanced by he FEDER (Eu opean
Regional De elopmen Fund, ERDF) (“A way o making Eu ope”) unde g an
ISCIII/PI21/00588; he Conselle ía de Cul u a, Educación e O denación Uni e si a ia de la
Xun a de Galicia (g oup wi h g ow h po en ial ED431B 2020-2022 GPC2020/27; A. Reguei a-
Iglesias suppo ED481A-2017/233) and he ERDF, which acknowledges he CiTIUS-Resea ch
Cen e in In elligen Technologies o he San iago de Compos ela Uni e si y as a Resea ch
Cen e o he Galician Uni e si y Sys em.
The unde s had no ole in s udy design, da a collec ion and analysis, decision o publish,
o p epa a ion o he manusc ip .
Objec i e 4
313
4.2. INTRODUCTION
Hund eds o a icles ha e been published in he las wo decades on he use o nex -
gene a ion sequencing (NGS) o he 16S ibosomal RNA ( RNA) gene as a way o s udy he
o al mic obiome. These ha e gene ally analysed di e en in a-o al niches like den al plaque
(1), ongue coa ings (2), he so issues (3), and sali a (4) o de e mine he mic obial di e si y
associa ed wi h dis inc condi ions, including: pe iodon al heal h (5); pe iodon al and pe i-
implan diseases (6); den al ca ies (7); and o al cance (8). The la ge amoun o such scien i ic
p oduc ion and he a ia ion in he esul s ob ained ha e caused esea che s o conduc
nume ous na a i e e iews in an a emp o achie e a consensus when de ining he mic obial
p o iles o dis inc pe iodon al heal h s a uses (9-12).
Howe e , hese published s udies on he pe iodon al mic obiome a y in e ms o he
ele an s eps unde aken wi hin a ypical 16S RNA gene sequencing wo k low. This has had
signi ican e ec s on he di e si y o he esul s ob ained, making compa isons e y di icul
(13-15). I is well known ha each sequencing echnology pe o ms di e en ly in he ade-o
be ween ead leng h, sequence h oughpu , and e o a e (13); being Illumina ha wi h
p e e able pe o mance o e Roche 454 o Ion To en (15). On he o he hand, we ha e ecen ly
demons a ed h ough he in silico analysis pe o med in objec i e 1 (16) ha , e en among
p ime pai s wi h co e age alues ≥90%, he o al species de ec ed by p ime s a ge ing a
pa icula egion ended o be no co e ed by o he s ampli ying a di e en zone and ice e sa.
Consequen ly, i can be said ha i is a he ques ionable o compa e sequences and
consequen ly mic obial di e si y da a de i ed om dis inc sequencing echnologies and gene
egions.
On he o he hand, mo e han 80% o ecen ly published s udies o he pe iodon al
mic obiome used he clus e ing o ope a ional axonomic uni s (OTUs) o pe o m hei
analyses. Howe e , he 97% simila i y h eshold ha is ypically employed means ha
communi y desc ip ions based on his app oach a e wildly inaccu a e, since 80% o o al-
bac e ial and a chaeal species ha e an amplicon sequence simila i y ≥97% o a leas one o he
o al species as desc ibed in objec i e 3 (17). I is he e o e necessa y o conduc pe iodon al
mic obio a analyses using echniques ha a e cu en ly conside ed o be mo e eliable, o
example by examining le els o amplicon sequence a ian s (ASVs) (18-20). Fu he mo e,
ALBA REGUEIRA IGLESIAS
314
high-quali y, o al-speci ic da abases a e equi ed i accu a e classi ica ions o hese ASVs a e
o be achie ed (21).
In an a emp o p oduce he s onges e idence o da e on he pe iodon al mic obio a, we
conduc ed he la ge-scale me a-omics esea ch desc ibed he ein. This had he ollowing
objec i e: 1) o analyse he sup agingi al and subgingi al plaque mic obio a a ASV le el o
di e en pe iodon al condi ions (heal hy pe iodon al, gingi i is, pe iodon i is, and ea ed
pe iodon i is) in e ms o bac e ial di e si y, co-occu ence ne wo ks, and p edic i e models.
To achie e ou objec i e, we e-analysed sequences s o ed in public eposi o ies om
p e iously published Illumina 3-4 sequencing s udies on he pe iodon al mic obiome in
sup agingi al and subgingi al plaque. Ou sample also included a biop ojec wi h in-house
sequences o he same egion, which we e aken om he subgingi al plaque o pe iodon ally
heal hy and pe iodon i is pa ien s om ou se ing. The me a-omics analysis employed a unique
bioin o ma ics p o ocol o high-quali y il e ing and sequence analysis.
Objec i e 4
315
4.3. MATERIAL AND METHODS
The comple e analysis p o ocol applied in he p esen s udy is de ailed in igu e 1.
Figu e 1. The comple e analysis p o ocol applied in he p esen me a-omics s udy.
4.3.1. Selec ion o s udy g oups and collec ing he subgingi al plaque samples
A con enience sample o 120 eligible pa icipan s, comp ising 55 pe iodon ally heal hy
con ols (con ol g oup) and 65 subjec s a ec ed by un ea ed pe iodon i is (pe iodon i is
g oup), we e ec ui ed om 350 consecu i e pa ien s in he gene al popula ion who we e
e e ed o he School o Medicine and Den is y (Uni e sidade de San iago de Compos ela,
Spain) and he Ins i u o Supe io de Ciências da Saúde No e, Coope a i a de Ensino Supe io ,
Poli écnico e Uni e si á io (CESPU, Gand a, Pa edes, Po ugal) be ween 2018 and 2019 o an
assessmen o hei o al heal h s a us.
Pa ien s we e ec ui ed i hey ul illed he ollowing inclusion c i e ia: 1) age 24 o 75; 2)
he p esence o a leas 15 na u al ee h; 3) no p e ious pe iodon al ea men ; 4) no medical
ALBA REGUEIRA IGLESIAS
316
his o y o diabe es melli us, hepa ic o enal disease, o o he se e e medical condi ions o
ansmi able diseases; 5) no in ake o sys emic an imic obials du ing he p e ious six mon hs;
6) no in ake o an i-in lamma o y medica ion in he p e ious ou mon hs; 7) no ou ine use o
o al an isep ics; 8) no his o y o alcohol o d ug abuse; 9) no p egnancy o b eas eeding; 10)
no p esence o implan s o o hodon ic appliances; 11) ha e smoked o a leas one yea ; and
12) ha e ne e smoked o s opped mo e han h ee yea s ago.
Two expe ienced den is s pe o med all he pe iodon al diagnoses. The bleeding on p obing
(BOP) and he bac e ial plaque le el (BPL) we e eco ded o he ull mou h on a bina y scale
(p esence/absence) a six si es pe oo h. We also documen ed he p obing pocke dep h (PPD)
and clinical a achmen le el (CAL) h oughou he mou h, again a six si es pe oo h, using a
PCP-UNC 15 p obe. S anda dised adiog aphs o all he ee h we e ob ained o assess he
al eola bone s a us. The diagnosis o pe iodon i is was based on he clinical and adiog aphic
in o ma ion ob ained. The con ol g oup included pe iodon ally heal hy pa ien s who had: BOP
≤20%, no loca ion wi h a PPD ≥4 mm, and no adiog aphic e idence o al eola bone loss. The
p esence o pe iodon al heal h o mode a e o se e e gene alised ch onic pe iodon i is was
es ablished acco ding o he clinical/ adiog aphic in o ma ion, applying p e iously published
c i e ia (22,23).
The "smoking habi " o he pa icipan s was e alua ed using a ques ionnai e, wi h
in o ma ion collec ed on i s ex en , i.e., non-smoke , o me smoke , cu en smoke , ime spen
as a o me o cu en smoke , and he numbe o ciga e es consumed pe day.
The esea ch was conduc ed ollowing he p inciples o he Decla a ion o Helsinki ( e ised
in 2000) on s udies in ol ing human expe imen a ion (24), and i s p o ocol was app o ed by
he Galician Clinical Resea ch E hics Commi ee ( egis a ion numbe 2018/295) and he
Ins i u o Supe io de Ciências da Saúde-No e, CESPU ( egis a ion numbe 35/CE-
IUCS/2019) (Appendix S1). All he pa icipan s p o ided hei w i en in o med consen o hei
in ol emen in he s udy.
The plaque collec ion ook place one o wo weeks a e he ini ial examina ion.
Subgingi al plaque samples om he con ols and pe iodon al pa ien s we e collec ed and
Objec i e 4
317
pooled om eigh non-adjacen p oximal si es using wo pape s ips inse ed in o he gingi al
sulcus o pe iodon al pocke o 30 seconds. In he i s case, samples we e aken om
subgingi al heal hy si es in quad an s one and h ee, and in he second case om si es wi h he
mos in-dep h PPD in each quad an . The s ips used wi h each ec ui we e inse ed in o
labelled ubes wi h 300 ml o 0.01M phospha e-bu e ed saline (PBS) (pH=7.2) and ozen a -
80ºC un il u he genomic analysis.
4.3.2. 16S RNA gene amplicon sequencing o subgingi al samples
To al DNA was ex ac ed om he subgingi al plaque samples using a comme cial ki
(Mas e Pu e Comple e DNA and RNA Pu i ica ion Ki ; Epicen e,Wisconsin, USA) acco ding
o he manu ac u e ’s ins uc ions, albei wi h mino modi ica ions, including a mechanical
dis up ion o bac e ia (Pa hogen Lysis Tube S; Qiagen, Hilden, Ge many), and he addi ion o
a lysozyme ea men (20 mg/ml a 37 ºC o 30 minu es). The isola ed DNA was elu ed in 50
µl o dis illed and apy ogenic wa e , and i s quali y and concen a ion we e assessed using a
Nanod op spec opho ome e (ND-2000 Spec opho ome e , Wilming on, USA). DNA samples
wi h spec opho ome e a ios (Abs 260/280) be ween 1.5 and 2.0 we e conside ed o be
accep able o inclusion in he s udy. Two subgingi al samples om he con ol g oup we e
excluded due o non-compliance wi h his equi emen .
A polyme ase chain eac ion (PCR) ampli ica ion o he 16S RNA gene was pe o med
wi h he KAPA HiFi Ho S a ReadyMixPCR Ki (Ca . No. KK2602, 7958935001; Kapa
Biosys ems, F. Ho mann-La Roche L d, Basel, Swi ze land). The 3-4 hype a iable egion was
ampli ied as p e iously desc ibed (25) using he ollowing p ime s in a limi ed-cycle PCR:
3-4-Fo wa d (5′-CCT ACG GGNGGC WGC AG-3).
3-4-Re e se (5′-GAC TAC HVGGG TAT CTA ATC C-3).
A se o modi ied p ime s, 3-4-F and 3-4-R, we e also used. This se con ained a 1-3 base
pai (bp) "he e ogenei y space " ha we designed o mi iga e he issues caused by low-sequence
di e si y amplicons.
ALBA REGUEIRA IGLESIAS
318
Each PCR ampli ica ion was ca ied ou on a o al olume o 10 μl, which comp ised 4 μl
o DNA, 0.2-Μm om each o wa d and e e se p ime , and a Kapa eady mix (Kapa
Biosys ems). The PCR condi ions we e modi ied by conduc ing: 1) an ini ial dena u a ion a
95°C o 3 minu es; 2) 25 h ee-s ep cycles a 95°C o 30 seconds, 55°C o 30 seconds and
72°C o 30 seconds; and 3) a inal 5-minu e ex ension a 72ºC. Wa e , up o a o al olume o
50 μl, was added a e he i s PCR s ep. The eac ions we e pu i ied using AMPu e XP beads
(Beckman Coul e , B ea, CA, USA) wi h a 0.9X (3-4 amplicon) a io, acco ding o he
manu ac u e ’s ins uc ions.
The PCR p oduc s we e elu ed om he magne ic beads wi h 32 μl o Bu e EB (Qiagen
N.V, Hilden; Ge many), wi h 30 μl o he elua e ans e ed o a esh 96-well pla e. The p ime s
desc ibed abo e con ain o e hangs ha enable he addi ion o ull-leng h Nex e a adap e s.
Ba codes a e a ailable o mul iplex sequencing in a second PCR s ep, which p oduces
sequencing- eady lib a ies. To his end, 5 μl o he i s ampli ica ion was used as a empla e
o he second PCR, wi h Nex e a XT 2 adap o p ime s added up o a inal olume o 50 μl.
The PCR mix and he mal p o ile employed o he i s PCR we e also used o he second, bu
only o eigh cycles. A e he second PCR, 25 μl o he inal p oduc was pu i ied and
no malised wi h he SequalP ep no malisa ion ki (In i ogen, Ca lsbad, CA, USA), acco ding
o he manu ac u e ’s p o ocol. Lib a ies we e elu ed in a 20 μl olume and pooled o
sequencing.
Final pools we e quan i ied wi h a quan i a i e PCR (qPCR) using he Kapa lib a y
quan i ica ion ki o Illumina Pla o ms (Kapa Biosys ems) on an ABI 7900HT eal- ime cycle
(Applied Biosys ems, Fos e Ci y, CA, USA). Sequencing using 3 chemis y wi h a loading
concen a ion o 18 pM was pe o med in Illumina MiSeq (Illumina Inc., San Diego, CA, USA)
wi h 2x300 bps eads. In all cases, 10% o he PhIX con ol lib a ies we e spiked o inc ease
he di e si y o he sequenced samples.
In pa allel, nega i e con ol es s o he sample-collec ion bu e , DNA-ex ac ion and
PCR-ampli ica ion s eps we e conduc ed ou inely unde he same condi ions and using
eagen s. One such non- empla e con ol was subjec ed o he lib a y p epa a ion and hen
Objec i e 4
319
sequenced. As expec ed, his yielded e y ew eads (1611 pe sample). This was in con as o
an a e age o 249,747 eads/lib a y in he sample-de i ed collec ions.
The bac e ial mock communi y as a posi i e con ol o he downs eam p ocedu es we e
aken om he ZymoBIOMICS Mic obial Communi y DNA S anda d (Ca alog Numbe
D6306, Zymo Resea ch, I ine, CA, USA), which is a mix o genomic DNA isola ed om pu e
cul u es o eigh bac e ial and wo ungal s ains. Mock DNAs we e ampli ied and sequenced
in he same way as all he o he samples used in he expe imen .
The sequences ob ained we e deposi ed in he sequence ead a chi e (SRA) da abase (26)
unde accession numbe PRJNA773202.
4.3.3. Cha ac e is ics o he s udies o he me a-omics analysis: inclusion and
exclusion c i e ia
S udies (c oss-sec ional, longi udinal, o in e en ional) on he mic obial di e si y in bo h
sup agingi al and subgingi al plaque in adul indi iduals wi h di e en pe iodon al condi ions
we e included in ou esea ch (pe iodon al heal h, gingi i is, pe iodon i is, ea ed pe iodon i is,
pe iimplan i is, and ea ed pe iimplan i is). We inco po a ed all he s udies in which he
di e si y o he pe iodon al mic obiome was assessed using p ime s om he 3-4 egion and
he Illumina-sequencing echnology. An associa ed biop ojec numbe indica es he eposi o y
in which he sequences a e s o ed.
S udies we e included in ou analysis i he e e ence s anda d o diagnosing a pe iodon al
condi ion was based on only clinical (PPD o CAL) o clinical and adiog aphic pa ame e s
(bone loss -BL-), i espec i e o he diagnos ic benchma ks applied. Consequen ly, in he
absence o homogeneous c i e ia, any de ini ion based on he au ho ’s epo ed s anda ds was
accep ed. S udies wi hou a e e ence o diagnosing he pe iodon al condi ion we e ineligible
o inclusion, as we e hose ha ailed o assess he pe iodon al s a us o pa ien s using a leas
one clinical pa ame e (ei he he PPD o CAL).
ALBA REGUEIRA IGLESIAS
320
4.3.4. Cha ac e is ics o he me ada a able and he s o ed sample sequences:
inclusion and exclusion c i e ia
A e applying he c i e ia desc ibed abo e o he s udies in he li e a u e, we u he
selec ed hose whe e he me ada a o in e es pe sample was p ope ly assigned in he
eposi o y.
In ela ion o he cha ac e is ics o he s o ed sequences, he inclusion and exclusion c i e ia
we e as ollows: 1) di ec and e e se sequences we e accep ed, whe he o no he p ime -pai
sequence was included; 2) con igs wi h o wi hou p ime pai s, whose minimum a e age leng h
had o be ≥350 bps; 3) he p ime sequences mus ha e been aligned wi h he comple e
Esche ichia coli J01859.1 16S RNA gene sequence using BLAST (27) o de e mine hei
ini ial and end posi ions; i hey co esponded o he egion o in e es , he biop ojec was
included in he analysis; 4) s udy samples wi hou p ime s we e accep ed o he analysis i
mul iple sequences we e selec ed and aligned wi h he ull 16S RNA gene o E. coli J01859.1
o con i m ha hey belonged o he egion o in e es ; 5) biop ojec s in which mos o he
samples had a e y low numbe o s o ed sequences (≤7000 sequences) we e ejec ed; and 6)
biop ojec s we e excluded i he samples we e mul iplexed o had di e en ba codes in each
ile.
4.3.5. Sea ch me hods o he iden i ica ion and selec ion o s udies and biop ojec s
4.3.5.1. In o ma ion sou ces and sea ch s a egy
The sea ches we e conduc ed in July 2021 using he elec onic da abases PubMed, Scopus,
and Embase. The sea ch s a egy o iden i y Illumina sequencing-based s udies o he
pe iodon al mic obiome encompassed wo se s o e ms ela ing o: 1) pe iodon al heal h
condi ions, o al niches and mic obio a; and 2) he 16S RNA gene sequencing echnology
(Appendix S2). All he sea ches in he h ee da abases we e il e ed acco ding o he publica ion
yea - 2000 o 2021 (inclusi e). The sea ches o Scopus and Embase we e also il e ed by he
ype o : documen /publica ion (Embase: a icle, a icle in he p ess; o e iew); sou ce (jou nal);
and language (English).
Addi ional sea ches o he SRA da abase (26) we e pe o med using he e ms
“pe iodon i is”, “pe iodon al heal h”, “pe iodon al disease”, “pe i-implan i is”, “gingi i is”,
Objec i e 4
327
The g oups Sub_x0GDx, Imp_x0IHx, and Imp_x0IDx we e emo ed due o hei low
sample sizes (n= <50), lea ing a o al o 2045 samples o be analysed.
An independen il e had p e iously excluded om he s a is ical analysis he ASVs wi h
an abundance o ≤10 coun s and a p esence in ≤2 samples (42), lea ing a inal o al o 8379
ASVs.
The ela ionship be ween he di e en pe iodon al heal h condi ions and he plaque
mic obio a was in es iga ed om se e al pe spec i es: 1) he alpha di e si y indica o s and he
s uc u e o he bac e ial communi y; 2) he composi ion o he co e mic obio a and he es ing
o di e en ial abundance; 3) he co‑occu ence ne wo k pa e ns; and 4) he p edic i e capaci y
o he plaque mic obio a o disc imina ing he pe iodon al heal h condi ion. In gene al, whe e
applicable, he compa a i e analyses we e i s pe o med be ween di e en clinical condi ions
wi hin he same niche (sup agingi al plaque o subgingi al plaque), and hen in he same
clinical condi ion be ween he wo di e en plaques.
4.3.12.1. Alpha di e si y indica o s and he s uc u e o he bac e ial communi y
The phyloseq and mic obiome packages we e used o ob ain he alpha di e si y da a
(39,41). As indica o s o axa ichness, we calcula ed he absolu e coun da a ("obse ed") and
he co e age index, which de ines how many o he mo e abundan ASVs a e equi ed o
achie e a pa icula p opo ion o he occupied ecosys em (95%). The Shannon and Pielou
indices we e de e mined as indica o s o di e si y and he e enness o he ASVs p esen in he
samples (43,44). The Mann-Whi ney U es ( wo- ailed) was used o conduc di e en
compa a i e analyses.
A p incipal componen analysis (PCA) was employed o isualise he clus e ing o he
plaque samples in ela ion o hei espec i e pe iodon al heal h condi ion. The mixOmics
package ( e sion 6.16.3) (45) was used o ob ain he sca e plo s o he i s wo p incipal
componen s based on he ela i e abundance o he ASVs, showing he cen oids o each
clinical g oup and he ellipses ep esen ing he 95% con idence in e al. A non-pa ame ic
pe mu a ional mul i a ia e analysis o a iance (PERMANOVA) (46) was used o measu e he
ALBA REGUEIRA IGLESIAS
328
mul i a ia e communi y-le el di e ences be ween he g oups. These analyses we e pe o med
using he egan package ( e sion 2.5-7) (47).
4.3.12.2. Composi ion o he co e plaque mic obio a and es ing he di e en ial
abundance
The mic obiome package (41) was used o iden i y he co e ASVs p esen a a p e alence
a e o ≥75% in each plaque ype and each pe iodon al clinical condi ion.
The DESeq2 package (40) was used o iden i y he ASVs wi h he mos signi ican changes
in di e en ial abundance o he di e en pe iodon al condi ions. Imp o emen s o he s abili y
and dispe sion o he coun s ( a iance) we e equi ed be o e i was possible o calcula e he
di e en ial abundances. To his end, we used he es ima e SizeFac o s unc ion in DESeq2 (40)
o ans o m he s abilisa ion o he a iance. The di e en ial abundances we e measu ed wi h
he log2 oldchange (log2FC) alue and he di e en condi ions we e compa ed using he Wald
es wi h he Benjamini–Hochbe g co ec ion (Q pa ame e = 0.1, alse disco e y a e (FDR)
<10%). The di e en ial-abundance measu emen s we e s a is ically signi ican i he adjus ed
p- alue was < 0.01 (−log10 adjus ed p- alue= 2).
4.3.12.3. Co‑occu ence ne wo ks in he plaque mic obio a
Co-occu ence ne wo k analyses we e pe o med wi h he clinical g oups wi h mo e han
100 samples, il e ing ou ASVs wi h an abundance o 0.01%. The Spa CC me hod was used
o gene a e he ne wo ks (48), as his allows esea che s o de ec wi h a high deg ee o accu acy
he linea ela ionships in bo h a se o samples and a composi ional da ase (49).
The de aul pa ame e s and he SpiecEasi package ( e sion 1.1.1) (50) we e used o un
Spa CC, and he co ela ion ma ix ob ained was il e ed using an absolu e co ela ion sco e
g ea e han o equal o 0.5. The ne wo ks we e hen isualised wi h he ig aph package ( e sion
1.2.6) (51), whe e each node ep esen s an ASV and each edge ep esen s he co ela ions
be ween he abundances o he ASVs.
A se o measu es was calcula ed o desc ibe he opology o he esul ing ne wo ks: 1) he
ne wo k co e age, de ined as he pe cen age o ASVs p esen in he co-occu ence ne wo k
Objec i e 4
329
conce ning he o al numbe o ASVs de ec ed in he co esponding g oup; 2) he numbe o
nodes and edges; 3) he numbe o sub-ne wo ks; and 4) he numbe o modules (52).
We calcula ed he be weenness cen ali y (BC) (53) o measu e he ela i e impo ance o
each ASV wi hin he ne wo k (how in luen ial a axon is wi hin a ne wo k). This de e mines
he ac ion o he sho es pa hs h ough one pa icula bac e ial axon o ano he . The BC o a
axon in a ne wo k e lec s he impo ance o he con ol exe ed by he axon o e he
in e ac ions o o he axa in he same ne wo k (53). In line wi h Bane jee e al. (54), a combined
sco e based on a high deg ee alue and a high BC alue was used as a h eshold o de ine he
hub o keys one ASVs in he mic obial communi ies.
4.3.12.4. P edic i e capaci y o he plaque mic obio a o disc imina ing he clinical
condi ion.
We conduc ed a supe ised classi ica ion in he o m o a spa se pa ial leas -squa es
disc iminan analysis (sPLS-DA) (55) o acili a e he ca ego isa ion o he di e en clinical
g oups and iden i y he ASVs ha bes dis inguished wo g oups wi hin each plaque niche
(sup agingi al and subgingi al plaques); consequen ly, he disc iminan models we e
calcula ed wo- o- wo.
The sPLS-DA was pe o med using he mixOmics package (45), which is dedica ed o he
in eg a i e examina ion o “omics” da a. The ASVs wi h a ela i e abundance o less han 0.1%
in he o al samples we e p e iously excluded om he de elopmen o p edic i e models. The
numbe o componen s in each model was de e mined by applying he ule o humb K-1, whe e
K is he numbe o classes (in ou case, wo clinical g oups). Consequen ly, all he p edic i e
models we e o one componen .
Recei e ope a ing cha ac e is ic (ROC) cu es we e cons uc ed wi h he ue posi i i y
a e (sensi i i y) as a unc ion o he alse posi i i y a e (1-speci ici y), while a ea unde he
cu e (AUC) alues we e used o dis inguish be ween each clinical g oup in he sup agingi al
and subgingi al plaque. I should be no ed ha simula ions wi h an AUC alue equal o o
highe han 0.70 a e gene ally conside ed o be accep able p edic i e models (56).
ALBA REGUEIRA IGLESIAS
330
4.4. RESULTS
4.4.1. Clinical cha ac e is ics o he s udy g oups om ou se ing
Subjec s in ou own- ec ui ed pe iodon i is g oup had a highe mean age and a highe
numbe o smoke s han hose in he heal hy g oup. Smoke s wi h pe iodon i is consumed mo e
ciga e es pe day and had been smoking o mo e mon hs. Rega ding he clinical pa ame e s
associa ed wi h he pe iodon al s a us, pa ien s in he pe iodon i is g oup had signi ican ly
highe BPL in he ull-mou h, and BOP, PPD, and CAL alues bo h in he ull mou h and
sampled si es eco ds han subjec s in he heal hy g oup (p<0.001; Table 1).
Table 1. Age, sex, smoking habi , and clinical cha ac e is ics associa ed wi h pe iodon al s a us in ou own-
ec ui ed heal hy and pe iodon i is g oups.
Clinical pa ame e s
S udy g oups
Con ol
(
n= 53
)
*
Pe iodon i is
(
n= 65
)
p alue
Age (yea s) 46.13 (12.11) 52.31 (9.78) 0.002
Sex
Female 27 38 NS
Male 26 27
Smoking habi
Non-smoke s 44 30
<0.001
Smoke s 9 35
Ciga e es/day (no.) 1.02 (2.78) 8.62 (9.89) <0.001
Mon hs o smoking (no.) 39.55 (105.66) 175.75 (185.12) <0.001
No. o ee h 26.98 (2.38) 25.22 (4.01) 0.012
Full mou h
BOP (%) 10.91 (6.27) 50.29 (20.43) <0.001
BPL (%) 22.62 (17.48) 55.02 (27.21) <0.001
PPD (mm) 2.03 (0.26) 3.61 (0.72) <0.001
CAL (mm) 2.20 (0.40) 4.40 (1.15) <0.001
Sampled si es
BOP (%) 5.92 (7.23) 66.38 (24.88) <0.001
PPD (mm) 2.20 (0.25) 5.58 (0.76) <0.001
CAL (mm) 2.29 (0.32) 6.11 (1.05) <0.001
*O he 55 ini ial con ol subjec s, wo we e excluded due o non-compliance wi h he equi emen s o he
amoun o DNA ex ac ed. Values indica e means (s anda d de ia ions) and he numbe o subjec s. A e
applying he Shapi o-Wilks es and e i ying he non-no mal dis ibu ion o almos all he clinical a iables, he
Mann-Whi ney U es ( wo- ailed) was used o compa e he quan i a i e clinical a iables be ween he con ol
and pe iodon i is g oups. The Fishe ’s exac es ( wo- ailed) was used o assess he associa ion o he quali a i e
a iables be ween he wo s udy g oups. A signi icance le el o p<0.05 was es ablished.
BOP= bleeding on p obing; BPL= bac e ial plaque le el; CAL= clinical a achmen le el; mm= milime es; n=
sample size; No.= numbe ; NS= No signi ican ; PPD= p obing pocke dep h.
4.4.2. S udies and biop ojec s ob ained in he sea ch p ocess
Figu e 2 shows he lowcha o he sea ch p ocess, including he numbe o esul s
ob ained om each s ep.
Objec i e 4
331
Figu e 2. Flowcha o he sea ch p ocess.
*The exclusion easons o he ejec ed a icles and biop ojec s a e indica ed in appendices S4, S5, and S6.
The abs ac s o 30331 a icles de i ed om he sea ches o he elec onic da abases we e
analysed compu a ionally, using se en se s o posi i e e ms o selec he candida es o
e alua ion. A o al o 1159 a icles om hese da abases and 39 biop ojec s om he SRA we e
ALBA REGUEIRA IGLESIAS
332
e alua ed. These a e lis ed in appendices S4 and S5, espec i ely; and he exclusion eason is
indica ed i applicable. Ul ima ely, 32 a icles in which he sequence da a had been deposi ed
in 32 di e en biop ojec s me he inclusion c i e ia (Appendix S6). The biop ojec con aining
ou sequences was added a his poin .
Ten au ho s we e con ac ed o ob ain o cla i y da a and h ee p o ided he in o ma ion
equi ed. Fi e a icles we e excluded in he me ada a assessmen s ep, and a u he ou a e
he samples and sequences we e e alua ed. We we e ul ima ely le wi h 23 a icles (6,57-78)
and 25 biop ojec s o inclusion in he me a-analysis, in ol ing a o al o 2045 samples
dis ibu ed in eigh pe iodon al clinical g oups ( ou g oups in sup agingi al plaque and he
emaining ou in subgingi al plaque).
4.4.3. Quali y assessmen o me ada a and sequences
4.4.3.1. Quali y o he me ada a s o ed in eposi o ies
Th ee o he 25 included biop ojec s had high-quali y me ada a ( ange= 0.95 - 0.77), ou
we e medium quali y ( ange= 0.45 - 0.34), and 18 low quali y ( ange= 0.30 - 0.15). O e all, he
hose wi h medium and low-quali y me ada a did no include in o ma ion abou he
pe iodon i is ype and se e i y, e hnici y, o clinical pe iodon al pa ame e s ( o al and sampling
si e). Mo eo e , mos o he biop ojec s wi h low-quali y me ada a did no p o ide in o ma ion
on he age o sex o he pa icipan s.
4.4.3.2. Sample size and numbe o sequences s o ed in eposi o ies
F om a sample size poin o iew, 10 biop ojec s had <50 samples (40%), 9 be ween 50
and 100 (36%), and six >100 (24%). No biop ojec s had an ASS o <0.25, as hese had been
elimina ed in p e ious s eps because o hei e y low-quan i y sequences. Fou biop ojec s
(BP20, BP21, BP22, and BP25) in ol ing a o al o 167 samples, ep esen ing 8.17% o all o
hose analysed, had ASS alues om 0.75 - 1.0. These we e he e o e o an accep able quan i y,
wi h mo e han 7500 sequences pe sample. Eigh biop ojec s (BP12, BP14, BP18, BP19, BP23,
BP27, BP44, and BP45) and 422 samples, ep esen ing 20.63% o all o hose p ocessed, had
ASS alues om 1.0 - 2.0. These we e hus deemed o be high quan i y, wi h 10,000 - 20,000
sequences pe sample. Finally, 13 biop ojec s, wi h an o e all o al o 1456 samples,
Objec i e 4
333
ep esen ing 71.20% o all o hose p ocessed, had an ASS >2.0, making hem e y high
quan i y, wi h mo e han 20,000 sequences pe sample.
Figu e 3. The me hodological quali y o selec ed s udies and biop ojec s: (A) me ada a; and (B) sample size
and sequence quan i y.
Twen y- h ee a icles and 24 biop ojec s we e included since one a icle e e ed o wo dis inc biop ojec s (+
1 biop ojec associa ed wi h ou samples).
4.4.4. Cha ac e is ics o he selec ed s udies and biop ojec s
Appendix S7 con ains a quan i a i e summa y o he main desc ip i e cha ac e is ics o he
sequencing-based s udies o he pe iodon al mic obiome ha o med pa o ou me a-omics
esea ch. Less han a hi d (7/23 a icles + 1 own unpublished biop ojec ; 29.17%) we e able o
es ablish he pe iodon al diagnosis wi h he new Classi ica ion o Pe iodon al and Pe i-implan
ALBA REGUEIRA IGLESIAS
334
Diseases and Condi ions (79), wi h mos using ea lie classi ica ions o he au ho s’ own c i e ia
(17/24; 70.83%). In 13/24 in es iga ions (54.17%), he e was a compa ison o he mic obial
p o iles in ela ion o s a es o pe iodon al heal h and disease, while 10/24 (41.66%) only
e alua ed pe iodon i is. The e was also one a icle (4.17%) whe e only i e heal hy samples
we e selec ed, as hese we e he only ones ha could be assigned o a speci ic heal h condi ion.
Subgingi al plaque was used he mos o s udy he pe iodon al mic obio a (16/24; 66.66%),
ollowed by sup agingi al plaque (4/24; 16.67%) o bo h ypes (4/24; 16.67%). Mo eo e , 4/24
s udies (16.67%) assessed he changes p oduced in he mic obio a a e non-su gical
pe iodon al he apy, including (in some cases) he adju an e ec o an ibio ics o oo hpas es.
4.4.5. Alpha-di e si y in sup agingi al and subgingi al plaque mic obio a
4.4.5.1. Sup agingi al plaque mic obio a
As shown in able 2, sup agingi al plaque ichness dec eased signi ican ly om
pe iodon al heal h o gingi i is and hen inc eased s ongly in he pe iodon i is condi ion
(median numbe o ASVs obse ed= 610.50, 474.00, and 892.00, espec i ely; 95% co e age
index= 220.00, 130.00, and 288.00, espec i ely). The e was a signi ican dec ease in bo h he
numbe o ASVs and he 95% co e age index in he pos -pe iodon al he apy samples compa ed
o hose collec ed be o e ea men (Sup_x1PDx s. Sup_x0PDx: 781.00 and 263.00 s. 892.00
and 288.00). Howe e , hese pos - ea men es ima es o ichness did no each he le els o he
heal hy g oup, wi h signi ican di e ences emaining be ween he wo clinical condi ions
(Sup_x1PDx s. Sup_x0HHx, 781.00 and 263.00 s. 610.50 and 220.00).
Con e sely, he di e si y and e enness indexes showed a con inuous upwa ds end om
heal h o disease and e en con inued o imp o e a e ea men (Shannon index ange be ween
4.75 and 4.07; Pielou index ange be ween 0.70 and 0.62). All he wo-by- wo g oup
compa isons we e signi ican ly di e en , excep ing Sup_x0HHx and Sup_x0GDx (Shannon
index) and Sup_x0GDx and Sup_x0PDx (Pielou index).
Objec i e 4
335
Table 2. Alpha di e si y indica o s in he di e en pe iodon al heal h condi ions and den al plaque ypes.
G oups (n)
No. Obse ed
ASVs
Co e age index
(
95%
)
Shannon index Pielou index
Median alues and IQR
Sup_x0HHx (210) 610.50 (458.00) 220.00 (145.00) 4.07 (0.75) 0.62 (0.13)
Sup_x0GDx (79) 474.00 (162.50) 130.00 (89.50) 4.19 (0.65) 0.68 (0.11)
Sup_x0PDx (493) 892.00 (912.00) 288.00 (165.00) 4.51 (0.65) 0.67 (0.12)
Sup_x1PDx (81) 781.00 (333.00) 263.00 (114.00) 4.75 (0.57) 0.70 (0.08)
Sub_x0HHx (155) 478.00 (1142.50) 171.00 (169.00) 4.15 (1.18) 0.65 (0.12)
Sub_x0PHx (62) 474.00 (320.50) 120.00 (93.75) 4.05 (0.94) 0.65 (0.13)
Sub_x0PDx (768) 417.50 (455.25) 142.00 (130.00) 4.17 (0.98) 0.68 (0.10)
Sub_x1PDx (197) 507.00 (461.00) 129.00 (105.00) 4.20 (0.83) 0.69 (0.10)
Compa ison o dis inc pe iodon al heal h condi ions in he sup agingi al plaque (p- alue)
Sup_x0HHx s. Sup_x0GDx 1.0227E-06 8.0438E-12 NS 0.0002
Sup_x0HHx s. Sup_x0PDx 7.0505E-14 7.7671E-13 8.5206E-24 2.7619E-08
Sup_x0HHx s. Sup_x1PDx 0.0010 0.0008 9.9932E-20 2.9953E-16
Sup_x0GDx s. Sup_x0PDx 9.6812E-21 1.2208E-29 4.3632E-08 NS
Sup_x0GDx s. Sup_x1PDx 5.4703E-15 1.7601E-17 4.5964E-11 0.0003
Sup_x0PDx s. Sup_x1PDx 0.0030 0.0466 0.0003 1.2601E-07
Compa ison o dis inc pe iodon al heal h condi ions in he subgingi al plaque (p- alue)
Sub_x0HHx s. Sub_x0PHx NS 0.0129 NS NS
Sub_x0HHx s. Sub_x0PDx 0.0005 0.0158 NS 0.0001
Sub_x0HHx s. Sub_x1PDx 0.0139 0.0384 NS 2.4036E-05
Sub_x0PHx s. Sub_x0PDx NS NS NS 0.0017
Sub_x0PHx s. Sub_x1PDx NS NS 0.0475 0.0003
Sub_x0PDx s. Sub_x1PDx NS NS NS NS
Compa ison o he same pe iodon al heal h condi ion be ween he sup agingi al and subgingi al
plaques
(
p- alue
)
Sup_x0HHx s. Sub_x0HHx 0.0363 9.2241E-06 NS 0.0050
Sup_x0PDx s. Sub_x0PDx 8.0165E-72 5.6815E-97 2.2485E-23 8.4811E-05
Sup_x1PDx s. Sub_x1PDx 6.2408E-13 3.8383E-20 1.8787E-12 0.0194
A signi icance le el o p<0.05 was es ablished.
ASVs= amplicon sequence a ian s; IQR= in e qua ile ange; n= sample size; No.= numbe ; NS= No signi ican ;
Sub_x0HHx= subgingi al plaque o pe iodon ally heal hy subjec s, heal hy si es; Sub_x0PHx= subgingi al plaque
o pe iodon i is subjec s, heal hy si es; Sub_x0PDx= subgingi al plaque o pe iodon i is subjec s, diseased si es;
Sub_x1PDx= subgingi al plaque o pe iodon i is subjec s, diseased si es a e he apy; Sup_x0GDx= sup agingi al
plaque o gingi i is subjec s, diseased si es; Sup_x0HHx= sup agingi al plaque o pe iodon ally heal hy subjec s,
heal hy si es; Sup_x0PDx= sup agingi al plaque o pe iodon i is subjec s, diseased si es; Sup_x1PDx=
sup agingi al plaque o pe iodon i is subjec s, diseased si es a e he apy.
4.4.5.2. Subgingi al plaque mic obio a
Rega ding he subgingi al mic obio a, signi ican ly lowe alues we e de ec ed in he
numbe o ASVs and he 95% co e age index in diseased si es om pe iodon i is pa ien s wi h
espec o heal hy pa ien s (417.50 and 142.00 s. 478.00 and 171.00, espec i ely). A e
pe iodon al ea men , he e was a signi ican inc ease in bac e ial ichness, su passing e en he
heal hy le els (507.00 compa ed o 478.00), al hough he 95% co e age index emained lowe
han he heal hy le els (129.00 compa ed o 171.00). The di e si y and e enness indices ended
o inc ease in he g oups o diseased oo h si es, al hough only he Pielou index compa isons
ALBA REGUEIRA IGLESIAS
336
we e signi ican (0.65 in Sub_x0HHx s. 0.68 and 0.69 in Sub_x0PDx and Sub_x1PDx,
espec i ely).
The numbe o obse ed ASVs and he di e si y and e enness indices o he subgingi al
mic obio a did no a y signi ican ly be ween Sub_x0HH and Sub_x0PHx. Simila ly, he alpha
di e si y indica o s did no show signi ican a ia ions be ween he di e en pe iodon al
g oups, excep o he Pielou index in he compa isons Sub_x0PHx s. Sub_x0PDx (0.65 s.
0.68) and Sub_x0PHx s. Sub_x1PDx (0.65 s. 0.69), and he Shannon in Sub_x0PHx s.
Sub_x1PDx (4.05 s. 4.20) (Table 2).
4.4.5.3. Sup agingi al and subgingi al plaque
When con as ing he “sup a” and “sub” plaques o he subjec s wi h he same pe iodon al
heal h s a us, we obse ed ha he numbe o ASVs, he 95% co e age index alues, and he
Shannon di e si y sco es we e signi ican ly highe in he sup agingi al niche han in he
subgingi al niche (“sup a” s. “sub”: ASV numbe ange= 892.00 - 610.50 s. 507.00 - 417.50;
95% co e age index ange= 288.00 - 220.00 s. 171.00 - 129.00; Shannon di e si y ange=
4.75 - 4.07 s. 4.20 - 4.15); he excep ion was ep esen ed by he Shannon index o he heal hy
g oups o bo h plaques. Con e sely, he e enness alues we e signi ican ly highe in he
subgingi al en i onmen , excep o he case o Sup_x1PDx (Table 2).
4.4.6. S uc u e o he bac e ial communi y in sup agingi al and subgingi al plaque
mic obio a
The PCAs e ealed a g ouping o he sup agingi al and subgingi al samples acco ding o
he pe iodon al heal h condi ion o he subjec and he sampled si e ( he la e in he case o he
Sub_x0PHx g oup) (Figu es 4 and 5). The isual obse a ions we e con i med by he
PERMANOVA, which p oduced signi ican esul s o all he wo-by- wo g oup compa isons
(Table 3).
In he compa ison be ween he di e en niches o he same pe iodon al heal h condi ion,
he PCA e ealed a clus e ing o he samples acco ding o he ype o plaque collec ed om he
subjec o he same pe iodon al heal h s a us (Figu e 6). The isual obse a ions we e
Objec i e 4
343
abundances (16.96% and 45.42% o he o al de ec ed by he wo g oups, espec i ely), while
Sup_x0HHx s. Sup_x0GDx, 945 ASVs and 198 species (15.09% and 39.52%, espec i ely).
The compa ison o Sup_x0HHx and Sup_x1PDx e ealed 926 ASVs and 210 species bo h
di e en ially abundan (13.12% and 41.02% o he de ec ed axa, espec i ely), and, again,
Sup_x0HHx s. Sup_x0PDx, a o al o 918 (12.17%) and 272 (51.52%) ASVs and species,
espec i ely. In con as , he lowes ela i e numbe s o ASVs and species wi h di e en ial
abundances we e obse ed in he analysis o Sup_x0PDx s. Sup_x1PDx ( o al= 660 ASVs,
8.95%; 145 species, 27.62%).
The pe cen ages o co e ASVs and co e species showing di e en ial abundance anged
om 6.31% - 2.87% and 14.65% - 7.35%, espec i ely (Table 5).
4.4.8.2. Subgingi al plaque mic obio a
The esul s o he subgingi al plaque demons a ed ha he highes ela i e numbe s o
ASVs and species wi h di e en ial abundances we e ob ained when compa ing he pe iodon al
heal h g oup o bo h he non- ea ed and ea ed pe iodon i is g oups. Acco dingly, he
compa ison o Sub_x0HHx s. Sub_x0PDx e ealed a o al o 1074 ASVs (12.64% o he o al
de ec ed by he wo g oups) om 273 species wi h di e en ial abundances (48.75%), while
Sub_x0HHx s. Sub_x1PDx had 1015 ASVs (14.45%) om 225 species (41.67%). Con e sely,
he lowes ela i e numbe s o ASVs and species wi h di e en ial abundances we e obse ed
in he analysis o Sub_x0PHx s. bo h Sub_x0PDx ( o al= 364 ASVs; 4.28%; 156 species;
27.81%) and Sub_x1PDx ( o al= 339 ASVs; 5.64%; 117 species; 22.20%).
The pe cen ages o co e ASVs and co e species showing di e en ial abundance anged
om 6.59% - 2.06% and 10.26% - 5.13%, espec i ely (Table 5).
ALBA REGUEIRA IGLESIAS
344
Table 5. Numbe o o al and co e axa ha p esen ed di e en ial abundances in he di e en pe iodon al
heal h condi ions and den al plaque ypes, and he ela i e abundance alues hey ep esen ed.
No. ASVs
(
% de ec ed
)
No. Species
(
% de ec ed
)
No. Co e ASVs
(
% de ec ed
)
*
No. Co e species
(
% de ec ed
)
*
Di e en ial abundances o dis inc pe iodon al heal h condi ions in he sup agingi al plaque
Sup_x0HHx s. Sup_x0GDx 945 (15.09%) 198 (39.52%) 41 (4.34%) 29 (14.65%)
Sup_x0HHx s. Sup_x0PDx 918 (12.17%) 272 (51.52%) 33 (3.59%) 20 (7.35%)
Sup_x0HHx s. Sup_x1PDx 926 (13.12%) 210 (41.02%) 33 (3.56%) 21 (10.00%)
Sup_x0GDx s. Sup_x0PDx 1290 (16.96%) 243 (45.42%) 37 (2.87%) 25 (10.29%)
Sup_x0GDx s. Sup_x1PDx 507 (10.08%) 163 (33.61%) 32 (6.31%) 16 (9.82%)
Sup_x0PDx s. Sup_x1PDx 660 (8.95%) 145 (27.62%) 19 (2.88%) 14 (9.66%)
Di e en ial abundances o dis inc pe iodon al heal h condi ions in he subgingi al plaque
Sub_x0HHx s. Sub_x0PHx 425 (6.62%) 160 (29.52%) 13 (3.06%) 12 (7.50%)
Sub_x0HHx s. Sub_x0PDx 1074 (12.64%) 273 (48.75%) 36 (3.35%) 25 (9.16%)
Sub_x0HHx s. Sub_x1PDx 1015 (14.45%) 225 (41.67%) 27 (2.66%) 18 (8.00%)
Sub_x0PHx s. Sub_x0PDx 364 (4.28%) 156 (27.81%) 24 (6.59%) 16 (10.26%)
Sub_x0PHx s. Sub_x1PDx 339 (5.64%) 117 (22.20%) 7 (2.06%) 6 (5.13%)
Sub_x0PDx s. Sub_x1PDx 604 (7.14%) 189 (33.87%) 14 (2.32%) 12 (6.35%)
Di e en ial abundances o he same pe iodon al heal h condi ion be ween sup agingi al and
subgingi al plaques
Sup_x0HHx s. Sub_x0HHx 802 (10.57%) 255 (46.88%) 36 (4.49%) 25 (9.80%)
Sup_x0PDx s. Sub_x0PDx 2367 (27.34%) 349 (62.21%) 48 (2.03%) 33 (9.46%)
Sup_x1PDx s. Sub_x1PDx 198 (3.85%) 72 (14.55%) 14 (7.07%) 4 (5.56%)
The pe cen ages o de ec ed ASVs and species a e calcula ed conce ning he o al numbe o di e en ASVs and
species de ec ed by a leas one o he g oups o be compa ed. *The pe cen ages o co e ASVs and species a e
calcula ed conce ning he o al numbe o di e en ASVs and species ha showed di e en ial abundances in he
wo g oups compa ed. The axa ha could no be classi ied a he species le el (“unclassi ied”) we e coun ed
once so he numbe o species de ec ed is he minimum ha could be ob ained.
ASVs= amplicon sequence a ian s; No.= numbe ; Sub_x0HHx= subgingi al plaque o pe iodon ally heal hy
subjec s, heal hy si es; Sub_x0PHx= subgingi al plaque o pe iodon i is subjec s, heal hy si es; Sub_x0PDx=
subgingi al plaque o pe iodon i is subjec s, diseased si es; Sub_x1PDx= subgingi al plaque o pe iodon i is
subjec s, diseased si es a e he apy; Sup_x0GDx= sup agingi al plaque o gingi i is subjec s, diseased si es;
Sup_x0HHx= sup agingi al plaque o pe iodon ally heal hy subjec s, heal hy si es; Sup_x0PDx= sup agingi al
plaque o pe iodon i is subjec s, diseased si es; Sup_x1PDx= sup agingi al plaque o pe iodon i is subjec s,
diseased si es a e he apy.
4.4.8.3. Sup agingi al and subgingi al plaque mic obio a
As shown in able 5, he compa ison o Sup_x0PDx s. Sub_x0PDx e ealed he highes
ela i e numbe s o ASVs and species wi h di e en ial abundances ( o al= 2367 ASVs, 27.34%
o he o al de ec ed by he wo g oups; 349 species, 62.21%). Con e sely, he lowes ela i e
es ima es we e obse ed in he analysis o Sup_x1PDx s. Sub_x1PDx ( o al= 198 ASVs,
3.85%; 72 species, 14.55%).
The pe cen ages o co e ASVs and co e species showing di e en ial abundance anged
om 7.07% - 2.03% and 9.80% - 5.56%, espec i ely (Table 5).
Objec i e 4
345
4.4.9. Co-occu ence ne wo ks in sup agingi al and subgingi al plaque mic obio a
Table 6 shows he opological pa ame e s o he co-occu ence ne wo ks in he wo
sup agingi al and subgingi al plaque g oups ha me he inclusion c i e ia o his analysis.
Table 6. Topological pa ame e s o he co-occu ence ne wo ks in he di e en pe iodon al heal h
condi ions and den al plaque ypes.
Sup agingi al plaque Subgingi al plaque
Sup_x0HHx
Sup_x0PDx
Sub_x0HHx
Sub_x0PDx
Sub_x1PDx
Ne wo k co e age* 2.26% 2.54% 2.75% 0.63% 1.54%
Numbe o nodes 136 187 163 53 78
Numbe o edges 290 959 387 80 111
Numbe o posi i e
co ela ions (%) 290 (100.0%) 958 (99.9%) 387 (100.0%) 80 (100.0%) 111 (100.0%)
Numbe o nega i e
co ela ions
(
%
)
0 (0.0%) 1 (0.1%) 0 (0.0%) 0 (0.0%) 0 (0.0%)
Ra io o posi i e
co ela ions and nodes 2.13% 5.12% 2.37% 1.51% 1.42%
Numbe o subne wo ks 18 12 12 10 12
Numbe o modules 25 55 25 11 13
Numbe o modules wi h
mo e han 3 nodes 12 12 11 4 6
*Pe cen age o ASVs p esen in he co-occu ence ne wo k wi h espec o he o al numbe o ASVs de ec ed in
he co esponden g oup.
Sub_x0HHx= subgingi al plaque o pe iodon ally heal hy subjec s, heal hy si es; Sub_x0PDx= subgingi al plaque
o pe iodon i is subjec s, diseased si es; Sub_x1PDx= subgingi al plaque o pe iodon i is subjec s, diseased si es
a e he apy; Sup_x0HHx= sup agingi al plaque o pe iodon ally heal hy subjec s, heal hy si es; Sup_x0PDx=
sup agingi al plaque o pe iodon i is subjec s, diseased si es.
4.4.9.1. Sup agingi al plaque mic obio a
The ne wo k co e age and he numbe o nodes in Sup_x0PDx we e sligh ly highe han
in Sup_x0HHx (2.54% and 187 s. 2.26% and 136, espec i ely). Mo eo e , he numbe o
edges was mo e han h ee imes g ea e in he diseased han in he heal hy g oup (959 s. 290,
espec i ely). P ac ically all hese co ela ions we e posi i e in bo h g oups, excep o ha o
Dialis e in isus ASV68 and S ep ococcus unclassi ied ASV4 in Sup_x0PDx (co ela ion
alue= -0.51). The diseased ne wo k had ewe subne wo ks and a highe numbe o modules
(12 and 55 s. 18 and 25 in Sup_x0HHx), bu bo h g oups had he same numbe o modules
wi h mo e han h ee nodes (Table 6).
ALBA REGUEIRA IGLESIAS
346
In he Sup_x0HHx ne wo k, he h ee main hubs o keys one ASVs we e: S ep ococcus
unclassi ied ASV90, Ro hia den oca iosa ASV2, and S ep ococcus o alis subsp. den isani
clade 058 ASV1. All we e pa o he Sup_x0HHx co e mic obio a bu , despi e ha ing an
abundance ≥0.5%, none o he h ee axa we e di e en ially abundan when compa ed o
Sup_x0PDx.
The p incipal keys one ASVs in he Sup_x0PDx ne wo k we e: S ep ococcus unclassi ied
ASV85, S ep ococcus sanguinis ASV228, and S ep ococcus unclassi ied ASV121. Only he
o me had an abundance ≥0.5% in Sup_x0PDx, bu none we e co e membe s o had di e en ial
abundance i compa ed o Sup_x0HHx.
Figu es 7 and 8 ep esen he main modules o he co-occu ence ne wo ks associa ed wi h
Sup_x0HHx and Sup_x0PDx, espec i ely.
Objec i e 4
347
Sup_x0HHx Samples= 210
ASVid Genus Species ASV Co e Rela i e
abundance
AV00001 S ep ococcus o alis_subsp.den isani _clade_058 BTASV016027 Y 11.2800
AV00085 S ep ococcus Unclassi ied unclassi ied Y 0.6454
AV00090 S ep ococcus Unclassi ied unclassi ied Y 0.5700
AV00121 S ep ococcus Unclassi ied unclassi ied Y 0.3356
AV00155 S ep ococcus Unclassi ied unclassi ied Y 0.2059
AV00181 S ep ococcus Unclassi ied unclassi ied N 0.1094
AV00220 S ep ococcus Unclassi ied unclassi ied N 0.1252
AV00228 S ep ococcus Sanguinis unclassi ied Y 0.2314
AV00282 S ep ococcus Unclassi ied unclassi ied Y 0.1702
AV00320 S ep ococcus o alis_subsp.den isani _clade_058 unclassi ied Y 0.1281
AV00355 S ep ococcus Unclassi ied unclassi ied N 0.0609
AV00392 S ep ococcus Sanguinis unclassi ied Y 0.1019
AV00425 S ep ococcus o alis_subsp.den isani _clade_058 unclassi ied N 0.0682
AV00546 S ep ococcus Unclassi ied unclassi ied N 0.0861
Figu e 7. Main module o he co-occu ence ne wo k associa ed wi h he sup agingi al plaque o
pe iodon ally heal hy subjec s.
In he g aph, he mos impo an axa a e highligh ed in g een, o ange, and yellow acco ding o he sco e
ob ained in he analysis g oup.The highes alue is shown in g een, he alues belonging o he i s qua ile in
o ange, and hose belonging o he second qua ile, i.e. up o he median, in yellow.
ASV= amplicon sequence a ian ; ASVid= amplicon sequence a ian iden i ie ; N= no; subsp.= subspecies;
Sup_x0HHx= sup agingi al plaque o pe iodon ally heal hy subjec s, heal hy si es; Y= yes.
ALBA REGUEIRA IGLESIAS
348
Sup_x0PDx Samples= 493
ASVid Genus Species ASV Co e Rela i e
abundance
AV00004 S ep ococcus unclassi ied unclassi ied Y 4.0960
AV00085 S ep ococcus unclassi ied unclassi ied N 0.5505
AV00090 S ep ococcus unclassi ied unclassi ied N 0.5082
AV00155 S ep ococcus unclassi ied unclassi ied N 0.1948
AV00228 S ep ococcus sanguinis unclassi ied N 0.1995
AV00390 S ep ococcus unclassi ied unclassi ied N 0.0686
AV00392 S ep ococcus sanguinis unclassi ied N 0.1129
AV00479 S ep ococcus unclassi ied unclassi ied N 0.0901
AV00535 S ep ococcus unclassi ied unclassi ied N 0.0837
AV00546 S ep ococcus unclassi ied unclassi ied N 0.0796
AV00613 S ep ococcus unclassi ied unclassi ied N 0.0663
AV00619 S ep ococcus sanguinis unclassi ied N 0.0534
AV00624 S ep ococcus unclassi ied unclassi ied N 0.0492
AV00741 S ep ococcus unclassi ied unclassi ied N 0.0558
AV00990 S ep ococcus unclassi ied unclassi ied N 0.0325
Figu e 8. Main module o he co-occu ence ne wo k associa ed wi h he sup agingi al plaque o
pe iodon i is subjec s in he diseased si es.
In he g aph, he mos impo an axa a e highligh ed in g een, o ange, and yellow acco ding o he sco e
ob ained in he analysis g oup.The highes alue is shown in g een, he alues belonging o he i s qua ile in
o ange, and hose belonging o he second qua ile, i.e. up o he median, in yellow.
ASV= amplicon sequence a ian ; ASVid= amplicon sequence a ian iden i ie ; N= no; subsp.= subspecies;
Sup_x0PDx= sup agingi al plaque o pe iodon i is subjec s, diseased si es; Y= yes.
Objec i e 4
349
4.4.9.2. Subgingi al plaque mic obio a
On he con a y o he sup agingi al plaque, he subgingi al ne wo k’s co e age and
numbe s o nodes and edges dec eased wi h wo sening heal h. In his sense, he Sub_x0PDx
ne wo k showed he lowes co e age and numbe o nodes and edges ollowed by Sub_x1PDx
ne wo k wi h espec o Sub_x0HHx ne wo k (ne wo k co e age= 0.63% and 1.54% s. 2.75%;
numbe o nodes= 53 and 78 s. 163; numbe o edges= 80 and 111 s. 387). All he co ela ions
in his niche we e posi i e. Al hough simila numbe s o subne wo ks we e obse ed in he
h ee clinical g oups (12 and 10), he Sub_x0PDx and Sub_x1PDx ne wo ks p esen ed lowe
numbe s o modules and modules wi h mo e han h ee nodes han he pe iodon al heal h g oup
(11 and 13 s. 25, espec i ely; 4 and 6 s. 11, espec i ely).
The main hubs o keys one axa in he Sub_x0HHx ne wo k we e: S ep ococcus
unclassi ied ASV85, Fusobac e ium unclassi ied ASV14, and S ep ococcus unclassi ied
ASV90. All we e pa o he Sub_x0HHx co e mic obio a and we e p esen in highe ela i e
abundances in his g oup han in Sub_x0PDx and Sub_x1PDx, al hough only he
Fusobac e ium was p esen in an abundance ≥0.5%.
In he Sub_x0PDx ne wo k, he main keys one ASVs we e: S ep ococcus unclassi ied
ASV121, Tanne ella o sy hia ASV15, and S ep ococcus unclassi ied ASV85. All o hem had
an abundance ≥0.5% in Sub_x0PDx and we e di e en ially abundan when compa ed o
Sub_x1PDx; bu only T. o sy hia was pa o he co e mic obio a and di e en ially abundan
when compa ed o Sub_x0HHx.
Las ly, he main hubs o keys one axa in he Sub_x1PDx ne wo k we e: T. o sy hia
ASV15, Fusobac e ium nuclea um subsp. incen ii ASV10, and S. o alis subsp. den isani clade
058 ASV1. The wo la e axa belonged o he Sub_x1PDx co e bu , despi e all o hem had an
abundance ≥0.5% in Sub_x1PDx, none had signi ican ly g ea e abundance in his g oup s.
Sub_x0HHx o Sub_x0PDx.
Figu es 9, 10, and 11 ep esen he main modules o he co-occu ence ne wo ks associa ed
wi h Sub_x0HHx, Sub_x0PDx, and Sub_x1PDx, espec i ely.
ALBA REGUEIRA IGLESIAS
350
Sub_x0HHx Samples= 155
ASVid Genus Species ASV Co e Rela i e
abundance
AV00001 S ep ococcus o alis_subsp.den isani clade_058 BTASV016027 Y 7.2773
AV00004 S ep ococcus unclassi ied unclassi ied Y 1.5538
AV00013 G anulica ella adiacens unclassi ied Y 1.1744
AV00085 S ep ococcus unclassi ied unclassi ied Y 0.1300
AV00090 S ep ococcus unclassi ied unclassi ied Y 0.1240
AV00121 S ep ococcus unclassi ied unclassi ied Y 0.0817
AV00155 S ep ococcus unclassi ied unclassi ied N 0.1341
AV00181 S ep ococcus unclassi ied unclassi ied N 0.0635
AV00220 S ep ococcus unclassi ied unclassi ied N 0.0343
AV00228 S ep ococcus sanguinis unclassi ied N 0.0344
AV00320 S ep ococcus o alis_subsp.den isani clade_058 unclassi ied Y 0.0271
AV00543 S ep ococcus unclassi ied unclassi ied N 0.0227
Figu e 9. Main module o he co-occu ence ne wo k associa ed wi h he subgingi al plaque o pe iodon ally
heal hy subjec s.
In he g aph, he mos impo an axa a e highligh ed in g een, o ange, and yellow acco ding o he sco e
ob ained in he analysis g oup.The highes alue is shown in g een, he alues belonging o he i s qua ile in
o ange, and hose belonging o he second qua ile, i.e. up o he median, in yellow.
ASV= amplicon sequence a ian ; ASVid= amplicon sequence a ian iden i ie ; N= no; subsp.= subspecies;
Sub_x0HHx= subgingi al plaque o pe iodon ally heal hy subjec s, heal hy si es; Y= yes.
Objec i e 4
351
Sub_x0PDx Samples= 768
ASVid Genus Species ASV Co e Rela i e
abundance
AV00010 Fusobac e ium nuclea um_subsp. incen ii unclassi ied Y 1.8295
AV00015 Tanne ella o sy hia BTASV153103 Y 1.8566
AV00051 Pep os ep ococcaceae [XI][G-9] b achy BTASV129419 Y 0.6348
AV00097 F e ibac e ium as idiosum unclassi ied Y 0.4676
AV00124 Pep os ep ococcaceae [XI][G-4] bac e ium_HMT369 BTASV096563 Y 0.3447
Figu e 10. Main module o he co-occu ence ne wo k associa ed wi h he subgingi al plaque o pe iodon i is
subjec s in he diseased si es.
In he g aph, he mos impo an axa a e highligh ed in g een, o ange, and yellow acco ding o he sco e
ob ained in he analysis g oup.The highes alue is shown in g een, he alues belonging o he i s qua ile in
o ange, and hose belonging o he second qua ile, i.e. up o he median, in yellow.
ASV= amplicon sequence a ian ; ASVid= amplicon sequence a ian iden i ie ; subsp.= subspecies; Sub_x0PDx=
subagingi al plaque o pe iodon i is subjec s, diseased si es; Y= yes.
ALBA REGUEIRA IGLESIAS
352
Sub_x1PDx Samples= 197
ASVid Genus Species ASV Co e Rela i e
abundance
AV00010 Fusobac e ium nuclea um_subsp . incen ii unclassi ied Y 1.7567
AV00015 Tanne ella o sy hia BTASV153103 N 1.0663
AV00019 Fili ac o alocis BTASV124203 N 0.7452
AV00038 T eponema den icola BTASV138814 N 0.5607
AV00097 F e ibac e ium as idiosum unclassi ied N 0.3035
AV00113 F e ibac e ium unclassi ied unclassi ied N 0.2714
AV00124 Pep os ep ococcaceae [XI][G-4] bac e ium_HMT369 BTASV096563 N 0.2289
AV00132 T eponema leci hinoly icum BTASV162382 N 0.2025
Figu e 11. Main module o he co-occu ence ne wo k associa ed wi h he subgingi al plaque o pe iodon i is
subjec s in he diseased si es a e he apy.
In he g aph, he mos impo an axa a e highligh ed in g een, o ange, and yellow acco ding o he sco e
ob ained in he analysis g oup.The highes alue is shown in g een, he alues belonging o he i s qua ile in
o ange, and hose belonging o he second qua ile, i.e. up o he median, in yellow.
ASV= amplicon sequence a ian ; ASVid= amplicon sequence a ian iden i ie ; N= no; subsp.= subspecies;
Sub_x1PDx= subagingi al plaque o pe iodon i is subjec s, diseased si es a e he apy; Y= yes.
Objec i e 4
359
Table 10. Main axa p edic i e o pe iodon al heal h and diseases in sup agingi al plaque.
ASVid Genus Species ASV
Sup_x0HHx_ s_Sup_x0GDx
Sup_x0HHx_ s_Sup_x0PDx
Sup_x0HHx_ s_Sup_x1PDx
Sup_x0GDx_ s_Sup_x0PDx
Sup_x0GDx_ s_Sup_x1PDx
Sup_x0PDx_ s_Sup_x1PDx
Sub_x0HHx_ s_Sub_x0PHx
Sub_x0HHx_ s_Sub_x0PDx
Sub_x0HHx_ s_Sub_x1PDx
Sub_x0PHx_ s_Sub_x0PDx
Sub_x0PHx_ s_Sub_x1PDx
Sub_x0PDx_ s_Sub_x1PDx
ASV0123 Co ynebac e ium ma ucho ii BTASV165891
ASV0177 Co ynebac e ium ma ucho ii Unclassi ied
ASV0262 Co ynebac e ium ma ucho ii Unclassi ied
ASV0287 Co ynebac e ium ma ucho ii Unclassi ied
ASV0381 Co ynebac e ium ma ucho ii Unclassi ied
ASV0803 Co ynebac e ium ma ucho ii Unclassi ied
ASV0851 Co ynebac e ium ma ucho ii Unclassi ied
ASV0870 Co ynebac e ium ma ucho ii Unclassi ied
ASV1347 Co ynebac e ium ma ucho ii Unclassi ied
ASV2602 Co ynebac e ium ma ucho ii Unclassi ied
ASV0361 Eikenella co odens Unclassi ied C C
ASV0472 Eikenella co odens BTASV138315
ASV0548 Eikenella co odens BTASV138321
ASV0001 S ep ococcus o alis_subsp.den isani_clade_058 BTASV016027 C
C C C
ASV0114 S ep ococcus o alis_subsp.den isani_clade_058 Unclassi ied
ASV0320 S ep ococcus o alis_subsp.den isani_clade_058 Unclassi ied C C
C
ASV0356 S ep ococcus o alis_subsp.den isani_clade_058 Unclassi ied
ASV0425 S ep ococcus o alis_subsp.den isani
_
clade_058 Unclassi ied
ASV0560 S ep ococcus o alis_subsp.den isani_clade_058 Unclassi ied C
C
ASV0674 S ep ococcus o alis_subsp.den isani_clade_058 Unclassi ied
ASV0877 S ep ococcus o alis
_
subsp.den isani_clade_058 Unclassi ied
C
ASV0962 S ep ococcus o alis_subsp.den isani_clade_058 Unclassi ied C
ASV1534 S ep ococcus o alis_subsp.den isani_clade_058 Unclassi ied C
ASV0228 S ep ococcus sanguinis Unclassi ied C C C
ASV0392 S ep ococcus sanguinis Unclassi ied C C
ASV0619 S ep ococcus sanguinis Unclassi ied
ASV0005 Veillonella dispa BTASV053366 C
C
C C C
ASV0016 Veillonella dispa BTASV053367
C
ASV0089 Veillonella dispa unclassi ied
C C C
ASV0131 Veillonella dispa unclassi ied
C
C
Cells a e colou ed acco ding o he pe iodon al heal h condi ion p edic ed by he axon in ques ion. The g een
colou was associa ed wi h pe iodon ally heal hy subjec s, heal hy si es; yellow wi h gingi i is, diseased si es;
pink wi h pe iodon i is, heal hy si es; ed wi h pe iodon i is, diseased si es; and o ange wi h pe iodon i is,
diseased si es a e he apy.
ASV= amplicon sequence a ian ; ASVid= amplicon sequence a ian iden i ie ; C= co e membe ; Sub_x0HHx=
subgingi al plaque o pe iodon ally heal hy subjec s, heal hy si es; Sub_x0PHx= subgingi al plaque o
pe iodon i is subjec s, heal hy si es; Sub_x0PDx= subgingi al plaque o pe iodon i is subjec s, diseased si es;
Sub_x1PDx= subgingi al plaque o pe iodon i is subjec s, diseased si es a e he apy; Sup_x0GDx= sup agingi al
plaque o gingi i is subjec s, diseased si es; Sup_x0HHx= sup agingi al plaque o pe iodon ally heal hy subjec s,
heal hy si es; Sup_x0PDx= sup agingi al plaque o pe iodon i is subjec s, diseased si es; Sup_x1PDx=
sup agingi al plaque o pe iodon i is subjec s, diseased si es a e he apy.
ALBA REGUEIRA IGLESIAS
360
4.4.10.2. Subgingi al plaque mic obio a
The p edic i e models o he subgingi al mic obio a had AUC alues anging om 0.796
o 0.902, ep esen ing, a mos , 2.85% and 21.67% ASVs and species, espec i ely. In ela ion
o hei p edic i e po en ial, he models equi ing lowe numbe s o ASVs we e Sub_x0PHx s.
Sub_x0PDx (20 ASVs) and Sub_x0HHx s. Sub_x0PHx (50 ASVs), wi h AUC alues o 0.885
and 0.902, espec i ely. The emaining models iden i ied highe numbe s o p edic o ASVs,
wi h he ange being om 80 o dis inguishing be ween Sub_x0PDx s. Sub_x1PDx (AUC=
0.796) o 200 o Sub_x0HHx s. Sub_x1PDx (AUC= 0.888) (Table 11). Appendix S12
con ains a lis o all axa ha we e pa o hese models and he g oup hey p edic ed.
Table 11. Numbe o axa ha composed he p edic i e models o dis inguish he pe iodon al heal h
condi ions in he subgingi al plaque, and he de i ed AUC alues.
No. ASVs
(% de ec ed)
No. Species
(% de ec ed)
No. Co e ASVs
(% de ec ed)*
No. Co e species
(% de ec ed)* AUC
P edic i e models o dis inguish pe iodon al heal h condi ions in he subgingi al plaque
Sub_x0HHx s. Sub_x0PHx 50 (0.78%) 42 (7.75%) 16 (32.00%) 12 (28.57%) 0.9024
Sub_x0HHx s. Sub_x0PDx 140 (1.65%) 87 (15.54%) 28 (20.00%) 21 (24.14%) 0.8698
Sub_x0HHx s. Sub_x1PDx 200 (2.85%) 117 (21.67%) 21 (10.50%) 14 (11.97%) 0.8883
Sub_x0PHx s. Sub_x0PDx 20 (0.24%) 15 (2.67%) 10 (50.00%) 7 (46.67%) 0.8850
Sub_x0PHx s. Sub_x1PDx 90 (1.50%) 62 (11.76%) 18 (20.00%) 11 (17.74%) 0.8803
Sub_x0PDx s. Sub_x1PDx 80 (0.95%) 52 (9.32%) 7 (8.75%) 6 (11.54%) 0.7966
The pe cen ages o de ec ed ASVs and species a e calcula ed wi h espec o he o al numbe o di e en ASVs
and species de ec ed by a leas one o he g oups o be compa ed. *The pe cen ages o co e ASVs and species
a e calcula ed wi h espec o he o al numbe o di e en ASVs and species ha showed p edic i i y in he wo
g oups compa ed. The axa ha could no be classi ied a he species le el (“unclassi ied”) we e coun ed once
so he numbe o species de ec ed is he minimum ha could be ob ained.
ASVs= amplicon sequence a ian s; AUC= a ea unde he cu e; No.= numbe ; Sub_x0HHx= subgingi al plaque o
pe iodon ally heal hy subjec s, heal hy si es; Sub_x0PHx= subgingi al plaque o pe iodon i is subjec s, heal hy
si es; Sub_x0PDx= subgingi al plaque o pe iodon i is subjec s, diseased si es; Sub_x1PDx= subgingi al plaque o
pe iodon i is subjec s, diseased si es a e he apy.
The ROC cu es o he p edic i e models in subgingi al plaque and hei de i ed AUC
alues a e ep esen ed in igu es 14 and 15.
Objec i e 4
361
Figu e 14. Po en ial o he subgingi al plaque mic obio a o disc imina e pe iodon al heal h om he
di e en pe iodon i is g oups: ROC cu es and AUC alues.
AUC= a ea unde he cu e; Sub_x0HHx= subgingi al plaque o pe iodon ally heal hy subjec s, heal hy si es;
Sub_x0PHx= subgingi al plaque o pe iodon i is subjec s, heal hy si es; Sub_x0PDx= subgingi al plaque o
pe iodon i is subjec s, diseased si es; Sub_x1PDx= subgingi al plaque o pe iodon i is subjec s, diseased si es
a e he apy.
ALBA REGUEIRA IGLESIAS
362
Figu e 15. Po en ial o he subgingi al plaque mic obio a o disc imina e he di e en pe iodon i is g oups:
ROC cu es and AUC alues.
AUC= a ea unde he cu e; Sub_x0PHx= subgingi al plaque o pe iodon i is subjec s, heal hy si es; Sub_x0PDx=
subgingi al plaque o pe iodon i is subjec s, diseased si es; Sub_x1PDx= subgingi al plaque o pe iodon i is
subjec s, diseased si es a e he apy.
Objec i e 4
363
The subgingi al plaque ASVs o he gene a Agg ega ibac e , Capnocy ophaga,
Cup ia idus, Gemella, G anulica ella, Lachnospi aceae [G-3], Lep o ichia, O ibac e ium,
Po phy omonas, P e o ella, Pseudomonas, Pseudop opionibac e ium, Sphingomonas, and
Veillonella ac ed as p edic o s o pe iodon al heal h. O hese, he mos impo an in o de o
ela i e abundance we e G anulica ella adiacens ASV13 (co e, 0.52%), Gemella haemolysans
ASV26 (co e, 0.36%), Capnocy ophaga leadbe e i ASV126 (0.30%), Agg ega ibac e
HMT458 ASV145 (0.18%), and P e o ella melaninogenica ASV7 (co e, 0.16%). Bo h G.
adiacens ASV13 and C. leadbe e i ASV126 also had a p edic i e capaci y in he Sub_x0PHx
and Sub_x1PDx g oups, espec i ely (Table 12).
ALBA REGUEIRA IGLESIAS
364
Table 12. Main axa p edic i e o pe iodon al heal h in subgingi al plaque.
ASVid Genus Species ASV
Sup_x0HHx_ s_Sup_x0GDx
Sup_x0HHx_ s_Sup_x0PDx
Sup_x0HHx_ s_Sup_x1PDx
Sup_x0GDx_ s_Sup_x0PDx
Sup_x0GDx_ s_Sup_x1PDx
Sup_x0PDx_ s_Sup_x1PDx
Sub_x0HHx_ s_Sub_x0PHx
Sub_x0HHx_ s_Sub_x0PDx
Sub_x0HHx_ s_Sub_x1PDx
Sub_x0PHx_ s_Sub_x0PDx
Sub_x0PHx_ s_Sub_x1PDx
Sub_x0PDx_ s_Sub_x1PDx
ASV0145 Agg ega ibac e sp.HMT458 unclassi ied
ASV0331 Agg ega ibac e sp.HMT458 unclassi ied
ASV0126 Capnocy ophaga leadbe e i unclassi ied
ASV0140 Capnocy ophaga leadbe e i unclassi ied
ASV0133 Cup ia idus gila dii unclassi ied
ASV1234 Cup ia idus gila dii unclassi ied
ASV2179 Cup ia idus gila dii unclassi ied
ASV0026 Gemella haemolysans unclassi ied
C C C
ASV0724 Gemella haemolysans unclassi ied
ASV0013 G anulica ella adiacens unclassi ied C
C C C
ASV0898 G anulica ella adiacens unclassi ied
ASV0476 Lachnospi aceae [G-3] bac e ium_HMT100 unclassi ied
ASV0512 Lachnospi aceae [G-3] bac e ium_HMT100 unclassi ied
ASV0389 Lep o ichia good ellowii BTASV213085
ASV0533 Lep o ichia sp.HMT212 unclassi ied
ASV0526 Lep o ichia sp.HMT392 unclassi ied
ASV0117 O ibac e ium sinus BTASV107685
ASV0218 Po phy omonas sp.HMT275 BTASV079830
ASV0007 P e o ella melaninogenica BTASV111236
C
ASV0514 P e o ella melaninogenica BTASV111262
ASV0588 P e o ella sp.HMT472 unclassi ied
ASV0717 P e o ella sp.HMT472 unclassi ied
ASV0829 P e o ella sp.HMT472 unclassi ied
ASV0108 Pseudomonas luo escens unclassi ied
ASV0610 Pseudomonas luo escens unclassi ied
ASV0429 Pseudop opionibac e ium p opionicum unclassi ied
ASV0961 Pseudop opionibac e ium p opionicum unclassi ied
ASV1055 Sphingomonas echinoides unclassi ied
ASV0072 Veillonella ogosae unclassi ied
ASV0084 Veillonella ogosae unclassi ied
ASV0485 Veillonella sp.HMT780 unclassi ied
Cells a e colou ed acco ding o he pe iodon al heal h condi ion p edic ed by he axon in ques ion. The g een
colou was associa ed wi h pe iodon ally heal hy subjec s, heal hy si es; pink wi h pe iodon i is, heal hy si es;
and o ange wi h pe iodon i is, diseased si es a e he apy.
ASV= amplicon sequence a ian ; ASVid= amplicon sequence a ian iden i ie ; C= co e membe ; Sub_x0HHx=
subgingi al plaque o pe iodon ally heal hy subjec s, heal hy si es; Sub_x0PHx= subgingi al plaque o
pe iodon i is subjec s, heal hy si es; Sub_x0PDx= subgingi al plaque o pe iodon i is subjec s, diseased si es;
Sub_x1PDx= subgingi al plaque o pe iodon i is subjec s, diseased si es a e he apy; Sup_x0GDx= sup agingi al
plaque o gingi i is subjec s, diseased si es; Sup_x0HHx= sup agingi al plaque o pe iodon ally heal hy subjec s,
heal hy si es; Sup_x0PDx= sup agingi al plaque o pe iodon i is subjec s, diseased si es; Sup_x1PDx=
sup agingi al plaque o pe iodon i is subjec s, diseased si es a e he apy.
The subgingi al plaque ASVs o he gene a Ac inomyces, Anae olineae [G-1],
Bac e oidaceae [G-1], Bac e oide es [G-3], Ca onella, Desul obulbus, Dialis e ,
F e ibac e ium, Mogibac e ium, Mycoplasma, Olsenella, Pep os ep ococcaceae [XI][G-2],
Pep os ep ococcaceae [XI][G-5], Pep os ep ococcaceae [XI][G-6], Po phy omonas,
P e o ella, Pseudo amibac e , S oma obaculum, T eponema, and Veillonellaceae [G-1] ac ed
as p edic o s o pe iodon i is. A ocus on he ela i e abundance alues obse ed in Sub_x0PDx
[Document text truncated for crawler view.]