scieee Science in your language
[en] (orig)

Evaluating methods to correct for population stratification when estimating paternity indexes

Author: Toscanini, Ulises; García Magariños, Manuel; Berardi, Gabriela; Egeland, Thore; Raimondi, Eduardo; Salas Ellacuriaga, Antonio
Publisher: PLOS
Year: 2012
DOI: 10.1371/journal.pone.0049832
Source: https://minerva.usc.es/bitstreams/45f878a6-436b-4c56-b0bd-7216f561fba6/download
E alua ing Me hods o Co ec o Popula ion
S a i ica ion when Es ima ing Pa e ni y Indexes
Ulises Toscanini
1
*
.
, Manuel Ga cia-Maga in
˜os
2
, Gab iela Be a di
1
, Tho e Egeland
3
, Edua do Raimondi
1
,
An onio Salas
2
*
.
1P icai-Fundacio
´n Fa alo o, Ciudad Au o
´noma de Buenos Ai es, Buenos Ai es, A gen ina, 2Unidade de Xene
´ ica, Ins i u o de Medicina Legal, Facul ad de Medicina,
Uni e sidad de San iago de Compos ela, Galicia, Spain, 3No wegian Uni e si y o Li e Sciences, IKBM, Aas, No way
Abs ac
The s a is ical in e p e a ion o he o ensic gene ic e idence equi es he use o allelic equency es ima es in he e e ence
popula ion o he s udied ma ke s. Di e ences in he gene ic make up o he popula ions can be e lec ed in s a is ically
di e en allelic equency dis ibu ions. One can easily igu e ou ha collec ing such in o ma ion o any gi en popula ion
is no always possible. The e o e, al e na i e app oaches a e needed in hese cases in o de o compensa e o he lack o
in o ma ion. A numbe o s a is ics ha e been p oposed o con ol o popula ion s a i ica ion in pa e ni y es ing and
o ensic casewo k, Fs co ec ion being he only one ecommended by he o ensic communi y. In his s udy we aimed o
e alua e he pe o mance o Fs o co ec o popula ion s a i ica ion in o ensics. By way o simula ions, we i s es ed he
dependence o Fs on he ela i e sizes o he sub-popula ions, and second, we measu ed he e ec o he Fs co ec ions on
he Pa e ni y Index (PI) alues compa ed o he ones ob ained when using he local e e ence da abase. The esul s p o ide
clea -cu e idence ha (i) Fs alues a e s ongly dependen on he sampling scheme, and he e o e, o mos si ua ions i
would be almos impossible o es ima e eal alues o Fs ; and (ii) Fs co ec ions migh un ai ly co ec PI alues o
s a i ica ion, sugges ing he use o local da abases whene e possible o es ima e he equencies o gene ic p o iles and PI
alues.
Ci a ion: Toscanini U, Ga cia-Maga in
˜os M, Be a di G, Egeland T, Raimondi E, e al. (2012) E alua ing Me hods o Co ec o Popula ion S a i ica ion when
Es ima ing Pa e ni y Indexes. PLoS ONE 7(11): e49832. doi:10.1371/jou nal.pone.0049832
Edi o : Yong-Gang Yao, Kunming Ins i u e o Zoology, Chinese Academy o Sciences, China
Recei ed July 4, 2012; Accep ed Oc obe 12, 2012; Published No embe 30, 2012
Copy igh : ß2012 Toscanini e al. This is an open-access a icle dis ibu ed unde he e ms o he C ea i e Commons A ibu ion License, which pe mi s
un es ic ed use, dis ibu ion, and ep oduc ion in any medium, p o ided he o iginal au ho and sou ce a e c edi ed.
Funding: This wo k was unded by a g an om Minis e io de Ciencia e Inno acio
´n (SAF2011-26983) gi en o AS. The unde had no ole in s udy design, da a
collec ion and analysis, decision o publish, o p epa a ion o he manusc ip .
Compe ing In e es s: The au ho s ha e decla ed ha no compe ing in e es s exis .
* E-mail: u oscani[email p o ec ed] (UT); [email p o ec ed]s (AS)
.These au ho s con ibu ed equally o his wo k.
In oduc ion
Acco ding o cu en ecommenda ions [1] he s a is ical
in e p e a ion o he gene ic e idence in o ensic gene ics (i.e.
pa e ni y es ing, o ensic casewo k) should be based on he
calcula ion o likelihood a ios (LR) be ween he p obabili ies o
wo con as ing hypo heses. Usually, hypo heses a e o mula ed as
i he e idence comes om a gi en suspec (e.g. in o ensic
casewo k) e sus he e idence o igina ing om some andomly
selec ed indi idual om he ele an popula ion. Calcula ion o
he p obabili y o he la e hypo hesis equi es an es ima ion o
allele equencies in he e e ence popula ion, e.g. he popula ion
whe e a c ime was commi ed. Es ima ion o he p obabili y o a
gi en gene ic p o ile equi es p e ious knowledge o allele
equency dis ibu ions, linkage equilib ium and no depa u e
om Ha dy-Weinbe g equilib ium o he gene ic ma ke s used in
o ensic cases. These da a a e usually ob ained by geno yping a
ep esen a i e sample o indi iduals om he e e ence popula ion
o in e es . Howe e , due o di e en demog aphic his o ies, he
gene ic make up o he popula ions can a y signi ican ly, e en
be ween neighbo ing popula ions. Thus, equency es ima es
ob ained o a gi en popula ion may no ai ly ep esen hose o
ano he popula ion, e en when hey may be conside ed geo-
g aphically o his o ically closely ela ed, o pa o a bigge
popula ion. One would expec ha he p obabili y o obse ing a
speci ic p o ile can be mo e p ecisely es ima ed using he
equency dis ibu ion o he popula ion o whom i belongs –i.e.
ideally ep esen ed in he e e ence popula ion– han using a
equency da abase om ano he popula ion. Howe e , i can
hen be easily igu ed ou ha collec ing he ele an in o ma ion
o each exis ing popula ion wo ldwide would be un easible.
Besides, e en i local allele equency da abases can be buil o
al eady exis , he issue o popula ion s a i ica ion is some imes
ob ia ed by he o ensic gene icis . The simple app oach o using a
single (onwa ds e e ed as global) da abase o a coun y o egion
is e y o en conside ed.
Popula ion subs uc u e has been subjec o ex ensi e deba e in
o ensic gene ics o many yea s (e.g. [2–5]). In p ac ice his issue is
o en igno ed by a numbe o o ensic gene icis s and some au ho s
ha e in pa conside ed i o be a mino issue [6] unde he
assump ion ha human popula ions a e no s ongly s a i ied.
Di e en s a is ical models ha e been de eloped and scien is s
ha e p oposed se e al p ac ical app oaches o add ess his issue
(e.g. [3,7–11]). While in c iminal cases, applica ion o hese
me hods o co ec o he subpopula ion e ec a e hough o be
conse a i e in weighing he e idence– i.e. a o ing he de en-
dan – his has no been p ope ly e alua ed. Fu he mo e, he
concep o ‘‘conse a i eness’’, al hough widely accep ed, migh be
PLOS ONE | www.plosone.o g 1 No embe 2012 | Volume 7 | Issue 11 | e49832
also a guable: i could be un easonable o unde s a e he weigh o
he gene ic e idence when he e is no need o do so. Mo eo e , he
e m ‘‘conse a i eness’’ is also p oblema ic in ci il (e.g. pa e ni y)
cases; i may no be easonable o gi e one o he pa s he
ad an age o he unce ain y. This p ac ice could also ha e a
d ama ic impac in incomple e pa e ni y cases, o when only
pa ial p o iles can be yped [12]. Finally, he isk o e oneous
conclusions in DNA- es ing o immig a ion cases is also connec -
ed wi h his issue and has been al eady discussed [13].
Mos ecommenda ions o o e come hese p oblems a e based
on he use o W igh ’s Fs –o h–.The Fs was i s desc ibed by
W igh [14] o es ima e he le el o inb eeding in a popula ion.
Se e al s a is ics ha e been used o desc ibe he pa i ioning o
gene ic di e si y wi hin and among popula ions. W igh showed
ha he amoun o gene ic di e en ia ion be ween popula ions
could also be measu ed using Fs [14,15]. Since hem, Fs and
ela ed s a is ics a e among he mos widely used desc ip i e
s a is ics in popula ion and e olu iona y gene ics [16].
Co ec ions by means o Fs ha e been b oadly employed by
o ensic labo a o ies and ecommended by he In e na ional
Socie y o Fo ensic Gene ics [1]. Balding and Nichols [8]
in oduced a o mula o calcula e he ma ching p obabili ies in
o ensic gene ics inco po a ing h. Some o mulas ha e been
p o ided in he li e a u e o co ec Pa e ni y Index (PI) alues
using Fs (e.g. [17]), and Balding e al. [18] p esen ed es ima es o
Fs based on da a om UK and o he Eu opean popula ions.
Ne e heless, de ails abou i s ou ine use in o ensics a e sca ce
and somehow ague. This can be p oblema ic because o ensic
labo a o ies may adop hese p inciples wi hou solid ounda ion.
In ac , he es ima ion o Fs is i sel a ec ed by some ac o s ha
a e no always aken in o accoun , e.g. he ela i e sizes o he
popula ion samples [19]. The e ec o sample size on he
es ima ion o he gene ic a ia ion in he popula ion has also
been add essed by o he au ho s (e.g. [20]). Ano he p oblem is
ha i is usually assumed ha all subpopula ions conside ed in he
global popula ion sha e a common h alue, and ha he alue is
he same ac oss all loci. Simila conce ns ha e been p e iously
conside ed by Ma chini e al. [21] and also add essed by Xu e al.
[22] using a simula ion app oach applied o single nucleo ide
polymo phisms (SNP). The ecen e iew by Mei mans and
Hed ick [23] p o ides de ailed analyses o he p oblems o using
Fs and ela ed measu es o assess popula ion s uc u e. Howe e ,
all hese s udies we e ocused on gene ic associa ion s udies a he
han o ensic applica ions.
On he o he hand, compu a ion o co ec alues o PI may be
impo an in a numbe o pa e ni y cases. In se e al coun ies high
alues o he p obabili y o pa e ni y W, de ined as W=PI/(1+PI),
say abo e 0.999, a e equi ed in immig a ion cases and hen e en
mino di e ences ma e s. Essen-Mo¨lle sugges ed 0.9973 [24].
In A gen ina, some le el o popula ion subs uc u e ac oss he
coun y has been obse ed h ough he analyses o commonly used
o ensic STR (Sho Tandem Repea ) ma ke s [25,26]. Ne e he-
less, in e p e a ion o esul s emains con o e sial. In p e ious
a icles [27,28] we ha e demons a ed he impac o popula ion
subs uc u e in he s a is ical in e p e a ion o pa e ni y es ing in
A gen ina by analyzing i s e ec on he LR es ima es in ios and
duos cases. Howe e , we did no add ess he abili y o Fs (o any
o he s a is ic measu e) o co ec o popula ion s uc u e in
o ensic gene ics.
The main goal o he p esen s udy was o quan i y he eal
e ec o Fs co ec ions [16] on PI alues in A gen inean
popula ions and e alua e o wha ex en he ‘co ec ed’PI alues
coincide wi h hose ob ained when using he local e e ence
da abase. In addi ion, we also aimed o e alua e he consequences
o using di e en sampling schemes o he es ima ion o Fs alues.
To he bes o ou knowledge his is he i s ime whe e he e ec
o Fs in o ensic gene ics is conside ed by way o simula ing
di e en scena ios ha use da a om eal popula ion samples.
These simula ions allow he e o e he es ima ion o he impac o
using Fs in eal o ensics.
Ma e ials and Me hods
Popula ion samples and geno yping da a
A o al o 1,906 gene ic p o iles o he 15 Sho Tandem
Repea s (STRs) included in he Powe plexH16 Sys em ki
(P omega, Madison, WI) we e used in his s udy, namely
D3S1358, HUMTH01, D21S11, D18S51, PENTA E, D5S818,
D13S317, D7S820, D16S539, CSF1PO, PENTA D, HUM WA,
D8S1179, HUMTPOX and FGA. Mo e in o ma ion abou he
da a is p o ided in Toscanini e al. [28].
Six u ban popula ions and wo Na i e Ame ican popula ions
we e sampled. The geog aphical sou ces o he p o iles and sample
sizes a e indica ed in Table 1, as well as hei espec i e o icial
census popula ion size [29–31]. Fo mos o he analyses
pe o med below we g ouped he samples as u ban (Buenos Ai es,
Neuque´n, La Pampa, San Luis, San a C uz, Tucuma´n) and
Na i e Ame ican (Toba and Colla).
In luence o sampling p ocedu e on he es ima ion o Fs
A simula ion-based expe imen was designed o measu e he
in luence o sampling on he es ima ion o Fs alues. Fo his
expe imen , we jus conside ed wo main popula ion g oups, i.e.
u ban and Na i e Ame icans (see abo e). Fi s , we buil a sub-
sample om each g oup by andomly e ie ing 86 gene ic
p o iles; his sampling was ca ied ou en imes (which would
allow accoun ing o sampling a iabili y). Second, we compu ed
Fs o e e y pai o sub-samples. Thi d, new sub-samples we e
ob ained and Fs es ima ions we e compu ed bu his ime
inc easing he size o he u ban sub-samples by a ac o o 10%
in consecu i e s eps ( o a maximum sample size o 1719) and
keeping he numbe o p o iles in he Na i e Ame ican sub-
samples cons an (N= 86). Han e al. [19] ha e employed a simila
app oach o e alua e he e ec o unbalanced sample size in
genome-wide popula ion di e en ia ion s udies.
Compu a ion o PI om ios
The s anda d io pedig ees used in Toscanini e al. [28] we e
conside ed in his s udy. B ie ly, o each o he 1,906 eal p o iles
in he da abase, a se o new p o iles was c ea ed by a compu e –
assis ed p ocedu e ou ine. Fi s , allele equencies we e ob ained
o all he o iginal da ase s. Second, compa ible p o iles o bo h
pa en s o each indi idual we e buil as ollows: each o he wo
alleles was andomly assigned o each pa en ; hen, he o he allele
o each pa en was andomly aken om a ec o o allele
popula ion equencies o each STR locus.
Th ee di e en panels o allele equencies we e buil o PIs
calcula ion: (a) he e e ence (local) da abase; (b) a global da abase
o u ban p o iles; and (c) a global da abase o u ban plus Na i e
Ame ican p o iles. Addi ionally, Fs alues we e es ima ed o he
la e wo da abases (u ban and u ban+na i e). Nex , PIs we e
calcula ed o each io conside ing he da abases desc ibed in (a),
(b) and (c), and also co ec ing he PI alues using he Fs es ima es
ob ained o da abases (b) and (c) and using he o mulas e iewed
by E e and Wei (p. 179) [17].
Ca ea s abou he Use o Fs in Pa e ni y Tes ing
PLOS ONE | www.plosone.o g 2 No embe 2012 | Volume 7 | Issue 11 | e49832
S a is ical analyses
The main aim o he s a is ical analysis was o e alua e he
di e ences be ween PI alues ob ained in he scena ios desc ibed
abo e. In o al, we had i e di e en se s o PI alues: (i) PIs using
he e e ence da abases in each case (Buenos Ai es, Tucuma´n,
e c.), (ii) PIs using u ban allele equencies ( hen ep esen ing a
global na ional u ban da abase), (iii) PIs using u ban plus Na i e
Ame ican allele equencies ( hen ep esen ing a global na ional
da abase), (i ) PIs conside ing u ban allele equencies and i s
co esponding Fs alue, and ( ) PIs conside ing u ban plus Na i e
Ame ican allele equencies and he co esponding Fs alue.
S a is ical analyses we e ca ied ou as desc ibed in Toscanini e
al. [28] wi h he necessa y modi ica ions. Thus, o each indi idual
(N= 1,906), i e se s o 50 PI alues we e ob ained om he i e
scena ios desc ibed abo e. Se e al goodness-o - i es s we e
employed in o de o examine i each se o 50 PI alues i wi h
no mali y (see Toscanini e al. [28] o mo e de ails); as expec ed
he no mali y assump ion was ejec ed in mos o he cases. All he
PI alues we e con e ed in o na u al loga i hms and he
no mali y was checked again using he same goodness-o - i es s.
The no mali y assump ion ( equi ed o p ope ly ca y ou he
s a is ical es s below) could hen be accep ed o he loga i hm o
he PI alues (logPI).
Nex , o each indi idual an ANOVA analysis was ca ied ou
be ween he i e se s o 50 logPI alues. ANOVA allowed es ing
signi ican di e ences be ween he logPI alues ob ained when
using he di e en da ase s. Due o he ac ha he null hypo hesis
o equali y be ween se s o expec ed logPI alues was always
ejec ed (wi h he only excep ion o a single indi idual ou o
1,906), we nex used he Tukey es in o de o explo e s a is ical
di e ences be ween all pai wise compa isons in ol ing he 1,905
emaining p o iles. We did no conside o apply o he es s as
done in Toscanini e al. [28], because he Tukey’s one yielded he
mos conse a i e es ima es as shown empi ically by he esul s in
Toscanini e al. [28]; see also Mon gome y 2001 [32]. Tukey’s es
accoun s o mul iple es co ec ion be ween all possible pai wise
compa isons (gi en he i e sample se s used in his s udy).
Howe e , ano he sou ce o mul iple es s is he ac ha hese
compa isons a e based on 1,905 p o iles. The e o e, we addi ion-
ally implemen ed a Bon e oni’s adjus men based on a nominal
signi icance alue ao 0.01.
Addi ionally, as done in Toscanini e al. [28], o each p o ile we
compu ed he weigh ed mean di e ence (WMD) be ween pai s o
popula ions. This index quan i ies he magni ude o he di e ences
be ween pai s o PI alues: o each pai o popula ion g oups (see
abo e) i,j,
WMD~
D
PIPIi{P
IIjD
max 
PIPIi,P
IIj

whe e 
PIPI indica es he mean alue o he se o 50 PIs ob ained o
each indi idual in each da ase . In some coun ies Essen-Mo¨lle s
W(which co esponds o he pos e io p obabili y o pa e ni y o
a la p io ) is used. Since
PI~
W
1{W,
WMD may be exp essed al e na i ely in e ms o W as
WMDij~
Wi{Wj
Wi(1{Wj)
when
PIiwPIj
and simila ly, when
PIiƒPIj:
The ad an age o his o mula ion is ha i may be easie o
ela e o he scale o W, which is in e p e ed as a p obabili y. A
change in W om 0.999 (co esponding o PI = 999) o 0.950
(co esponding o PI = 19) implies a shi o wo ca ego ies ( om
‘Pa e ni y p ac ically p o en’ o ‘ e y likely’) in Hummel’s able
[33] (al hough he e appea s o be no in e na ional consensus on
he use o Hummel’s ca ego ies in he o ensic communi y). This
change co esponds o WMD = 0.981.
Resul s and Discussion
Dependence o Fs on sampling
Figu e 1 ep esen s he esul s ob ained om he simula ion
p ocedu e o es he in luence o he sampling p ocedu e on he
Fs es ima es. The ed line in his igu e shows he loess eg ession
o he Fs alues aking as explana o y a iable he a iable sample
sizes, while he yellow shadow indica es sampling a iabili y in
Table 1. Census o he A gen inean popula ion in he p o inces and popula ion g oups used in he p esen s udy.
Popula ion Type Sample size
Census
popula ion size % Re .
Buenos Ai es U ban 879 15,653,341 0.01 [29,30]
Neuquen U ban 355 474,155 0.07 [29]
La Pampa U ban 232 299,294 0.08 [29]
San a C uz U ban 132 196,958 0.07 [29]
Tucuma
´n U ban 75 1,338,523 0.01 [29]
San Luis U ban 61 367,933 0.02 [29]
Colla Na i e Ame ican 43 53,106 0.08 [31]
Toba Na i e Ame ican 129 47,591 0.27 [31]
Buenos Ai es includes Buenos Ai es ci y and Buenos Ai es p o ince. In he mos igh column, he pe cen age o sample size ela i e o he census popula ion size is
shown.
doi:10.1371/jou nal.pone.0049832. 001
Ca ea s abou he Use o Fs in Pa e ni y Tes ing
PLOS ONE | www.plosone.o g 3 No embe 2012 | Volume 7 | Issue 11 | e49832
each i e a ion s ep. As expec ed, he Fs alues dec ease as he
u ban sample size inc ease wi h an appa en end o 0. This is
ob iously due o he ac ha he p opo ion o Na i e Ame icans
is p og essi ely dilu ed as mo e u ban samples a e added o he
compu a ion o he Fs . The Fs alues a y in his expe imen
abou one o de o magni ude. This simula ion p o ides an idea o
how di e en sampling schemes a ec he magni ude o Fs alues
in eal popula ion scena ios (see below o u he discussion).
E alua ing he abili y o Fs o adjus PI alues
PI alues in ios we e ob ained o he di e en scena ios
desc ibed in Ma e ial and Me hods. In b ie , we conside ed
di e en panels o allele equencies, he ones de i ed om local
( e e ence) da abases, u ban and u ban+Na i e Ame ican popu-
la ions, and also, he PI co ec ed alues using wo di e en Fs
alues, 0.00167 (u ban samples) and 0.01022 (u ban plus Na i e
Ame ican samples).
In ui i ely, one could assume ha he local da abase is he ideal
e e ence da abase o compu e PI alues. The e o e, he PI alues
compu ed using local da abases can be conside ed o be he gold
s anda d ha bes app oxima es he expec ed PI alues.
The esul s indica e ha he e exis impo an di e ences
be ween PI alues compu ed using he p ope local e e ence
da abases and compu ed using o he da abase scena ios: (i) global
allele equencies (u ban o u ban+Na i e Ame icans), and (ii)
global allele equencies coupled wi h Fs co ec ions (Table 2).
Fo ins ance, he mos a o able scena io in compa ison o he
e e ence da abase ( ha is, PI alues compu ed using he e e ence
da abase e sus PI alues using global u ban allele equencies wi h
Fs co ec ions), indica es ha abou ,55% o he imes, he
di e ence be ween PI alues is s a is ically signi ican acco ding o
he Tukey es and using Bon e oni’s co ec ions (Table 2).
The esul s also indica e ha in ,21% o he cases, he WMD
alues a e abo e 0.8; in o he wo ds, ,21% o he imes he
di e ence in PI alues is highe han 80% o he maximum PI
alues.
Ra ionale o popula ion sampling and compu a ion o Fs
Fs is commonly used as a measu e o popula ion s uc u e. I s
compu a ion en ails a p e ious knowledge abou he sub-popula-
ions o be conside ed and hei sample sizes. Ideally, sampling
should ai ly ep esen he gene al popula ion unde s udy.
Howe e , he selec ion o he sub-popula ions ha should be
sampled could in ol e p ac ical di icul ies and/o heo e ical
dilemmas. Fo ins ance, in a coun y like A gen ina, he e a e
se e al Na i e Ame ican popula ions; some o hem a e geo-
g aphically isola ed om u ban egions, while o he s a e admixed
o di e en ex en wi h o he popula ions o ecen e.g. Eu opean
ances y. The e o e, he e a e popula ions ha s ill emain
unsampled jus due o logis ic di icul ies o sampling collec ion.
Mo eo e , he decision abou he p opo ion o indi iduals ha
should be sampled in each egion can be also p oblema ic. A
c i e ion o sol e he la e issue could be o collec samples in a
p opo ion simila o he o icial census o hese popula ions. This
po en ial solu ion howe e would lead o sampling and geno yping
e o s ha a e un ealis ic in common popula ion gene ic s udies.
Fo ins ance, i we conside a minimum sample size o 43 Colla
indi iduals (as ca ied ou in he p esen s udy), his ep esen s
0.08% o i s o icial popula ion census (Table 1); he same
p opo ion applied o Buenos Ai es would equi e o sample and
geno ype .12,500 indi iduals. Rep esen ing 0.08% o he
popula ions a ge ed in he p esen s udy would he e o e equi e
o geno ype a leas .14,000 indi iduals.
Final ema ks
In his s udy, he Fs alues compu ed conside ing only he
u ban samples was 0.00167, while he addi ion o he Na i e
Ame ican p o iles lead o an inc ease o his alue o 0.01022. A
sampling scheme conside ing an equal numbe o he Na i e
Ame ican popula ions and u ban ones would ce ainly lead o an
inc ease o he Fs alues. Howe e , i is no possible o specula e
abou he alues aken by Fs unde di e en sampling schemes
because he Fs alues can only be measu ed empi ically.
Fu he mo e, o a gi en se o sub-popula ions, one alue o Fs
is gene ally assumed bu es ima es could be di e en o dis inc
loci [22].
The p ocedu e ecommended by he gene al o ensic commu-
ni y o deal wi h popula ion s a i ica ion is he compu a ion o PI
using a panel o global allele equencies (e.g. u ban o
u ban+Na i e Ame ican popula ions) coupled wi h a co ec ion
based on he ‘app op ia e’ Fs alue. No e howe e ha , in
gene al, Fs co ec ions do no ha e an impo an impac on he PI
alues compu ed using he co esponding pooled da abase, as can
be seen by compa ing he alues o columns 1 and 2, and he
alues in columns 3 and 4 in he i s ow o Table 2. In addi ion,
Figu e 1. Values o
Fs
unde di e en sampling schemes and
conside ing o iginal STR p o iles ob ained om di e en
A gen inean popula ion samples (Na i e Ame ican and U ban)
as desc ibed in he ex .
doi:10.1371/jou nal.pone.0049832.g001
Table 2. Di e ences be ween popula ion g oups.
UU
+
NU(
Fs
)U
+
N(
Fs
)
Local s. … 72.2/59.5 73.8/60.7 68.6/54.7 76.7/64.5
Local s. … 22.8 23.1 20.6 22.1
Values in he i s ow indica e he pe cen ages o indi iduals ha show
signi ican di e ences in pai wise compa isons unde he es o Tukey o ios
( he i s e m is o a= 0.01, while he second e m is o he Bon e oni’s
co ec ion assuming 1,906 compa isons). Values in he second ow show he
pe cen ages o cases whe e WMD alues we e abo e 0.8. ‘Local’ = indica es he
local ( e e ence) da abase; U = u ban; U+N = u ban plus Na i e Ame ican,
U(Fs ) = u ban wi h Fs co ec ions, U+N(Fs ) = u ban plus Na i e Ame ican wi h
Fs co ec ions.
doi:10.1371/jou nal.pone.0049832. 002
Ca ea s abou he Use o Fs in Pa e ni y Tes ing
PLOS ONE | www.plosone.o g 4 No embe 2012 | Volume 7 | Issue 11 | e49832
as displayed in he his og ams o Figu e 2(a), al hough he e is an
inc ease in he numbe o cases wi h lowe WMD alues when
applying he Fs co ec ion, he numbe o s a is ically signi ican
di e ences be ween he PIs ob ained wi h he local e e ence
da abase and he ones ob ained using he o he da abases
conside ed a e s ill e y impo an ( alues on he igh side o
he e ical yellow line in each panel o Figu e 2(b)). In o he
wo ds, F
ST
co ec ions do no p ope ly app oxima e he esul s
ob ained unde he ideal scena io ep esen ed by he local
e e ence da abase.
I is also no ewo hy ha applying he Fs co ec ion, PI alues
a e no always lowe han he ones ob ained using he p ope
e e ence da abase (Table 3). Columns wo, ou and six in his
Table 3 indica e ha he e is a ema kable numbe o PIs ha a e
one, wo o h ee o de s o magni ude g ea e using he Fs
co ec ion han he e e ence alues (i.e. using he local da abase),
which is simila o he numbe o Fs -co ec ed PI alues ha a e
lowe han he e e ence ones. This e lec s ha he assump ion
ha he unknown subpopula ions a e being ai ly ep esen ed by
he global popula ion da abase migh no be ue, and ha he use
o Fs o his pu pose is no always conse a i e.
One could also a gue ha he Fs alues a e usually ‘‘low’’ o
mos human popula ions, and e en ha he di e ences be ween
he e e ence PI alues and he Fs -co ec ed ones migh no be
ele an o decisions in cou . This could howe e gi e ise o
Figu e 2.
WMD
and Tukey es
P
- alues dis ibu ions o he 1,906 p o iles ob ained o he compa ison be ween he local e e ence
da abase and he ou emaining scena ios conside ed. (a) Each his og am ep esen s he impac on WMD o a gi en pai o equency
da ase s o e he 1,906. (b) he cu e ep esen s he minus log10(P- alues) (Tukey es ) ob ained o he di e ence be ween he PI alues o each
case. The ho izon al lines ep esen om bo om o op he log10 alues o a= 0.05, a= 0.01, and he espec i e alues o Bon e oni co ec ions.
Cases on he igh hand side o he e ical yellow line co espond o he cases whe e he di e ences whe e s a is ically signi ican o a= 0.01 a e
Bon e oni co ec ion.
doi:10.1371/jou nal.pone.0049832.g002
Table 3. Numbe s o pai wise compa isons exhibi ing a
di e ence o a gi en o de o magni ude using Fs co ec ions
e sus he local da abase.
[1] [2] [3] [4] [5] [6]
U ban 2 (0.1) 103 (5.9) 0 (0.0) 1 (0.1) 0 (0.0) 0 (0.0)
Na i e Ame ican 70 (40.7) 5 (2.9) 26 (15.1) 2 (1.2) 3 (1.7) 0 (0.0)
To al 72 (3.8) 108 (5.7) 26 (1.4) 3 (0.2) 3 (0.2) 0 (0.0)
Fo he compu a ion, he U ban+Na i e Ame ican equency da abase wi h he
co esponding Fs co ec ions was employed. The alues indica e he numbe
o U ban o Na i e ios ha exhibi ed a PI alue highe han 1, 2 and 3 o de s o
magni ude (Columns 2, 4 & 6) and lowe han 1, 2 and 3 o de s o magni ude
(Columns 1, 3 & 5) using he U ban+Na i e Ame ican da abase wi h he
co esponding Fs co ec ions ela i e o he PI alues ob ained wi h he
e e ence da abase. [1]: PI(Local)(6100).PI(Fs ).PI(Local)(610); [2]:
PI(Local)(60.01),PI(Fs ),PI(Local) (60.1); [3]:
PI(Local)(61000).PI(Fs ).PI(Local)(6100); [4]:
PI(Local)(60.001),PI(Fs ),PI(Local) (60.01); [5]: PI(Fs ).PI(Local) (61000); [6]:
PI(Fs ),PI(Local) (60.001). ‘PI(Local)’ indica es he PI o he local ( e e ence)
da abase. ‘PI(Fs )’ indica es he Fs -co ec ed PI o he U ban+Na i e Ame ican
da abase. In b acke s a e he co esponding pe cen ages.
doi:10.1371/jou nal.pone.0049832. 003
Ca ea s abou he Use o Fs in Pa e ni y Tes ing
PLOS ONE | www.plosone.o g 5 No embe 2012 | Volume 7 | Issue 11 | e49832

some ho ny ques ions: wha is a ‘‘low’’ Fs alue?; o when is he
decision p ocess be ween pa e ni y/non-pa e ni y comp omised?
The e may be no simple answe o mos o hese ques ions.
In spi e o hei magni udes, di e ences do exis when applying
Fs co ec ion, hus ex ending he issue beyond any academic
discussion since he e is a eal impac on ou ine casewo k.
The p esen s udy has a emp ed o e alua e he sui abili y o Fs
co ec ions o deal wi h popula ions sub-s uc u e in he compu-
a ion o PI alues in pa e ni y io cases, using o he i s ime a
simula ions based on eal da ase s and he e o e mi o ing cases
ha could be occu ing in eal casewo k. The esul s indica e ha :
(i) he e is no an ob ious and objec i e way o measu e eal
Fs alues om a gi en popula ion since he compu a ion o
Fs is s ongly dependen on sampling s a egy. Fu he -
mo e, we no iced ha low Fs alues ( he ange e alua ed
in he p esen s udy was 0.00167 o 0.0102) coupled wi h
he way hese Fs alues a e implemen ed in he
compu a ion o PI, can signi ican ly in luence he inal PI
alues; in Eu ope, Fs alues a e p obably no signi ican ly
lowe han 0.0102 and, as al eady ad anced in 1996 by
Balding e al.: ‘‘ alues o Fs app op ia e o o ensic
applica ions in Eu ope a e oo la ge o be igno ed’’ [18];
(ii) he common p ac ice in o ensic pa e ni y cases o using
global da abases e en when hese PI alues a e co ec ed
using Fs , migh be inapp op ia e in a numbe o cases,
(iii) global da abases migh no p ope ly ep esen he gene ic
cha ac e is ics o any subpopula ion, and
(i ) he, some imes ligh ly accep ed, hough ha he use o Fs
is conse a i e does no always hold.
In summa y, he esul s indica e ha he ole o local e e ence
da abases canno easily be subs i u ed by o he sample schemes
and me hods o co ec o s a i ica ion. When possible, he
popula ion o in e es should be p ope ly sampled in o de o
ep esen as much as possible o i s gene ic he e ogenei y.
Au ho Con ibu ions
Concei ed and designed he expe imen s: AS UFT. Pe o med he
expe imen s: AS UFT. Analyzed he da a: AS UFT MGM TE.
Con ibu ed eagen s/ma e ials/analysis ools: AS UFT ER. W o e he
pape : AS UFT. Designed he so wa e o simula ions: AS UFT.
Geno yped he samples: GB.
Re e ences
1. Gje son DW, B enne CH, Bau MP, Ca acedo A, Guide F, e al. (2007)
ISFG: Recommenda ions on bios a is ics in pa e ni y es ing. Fo ensic Sci In
Gene 1: 223–231.
2. K ane DE, Allen RW, Sawye SA, Pe o DA, Ha l DL (1992) Gene ic
di e ences a ou DNA yping loci in Finnish, I alian, and mixed Caucasian
popula ions. P oc Na l Acad Sci 89: 10583–10587.
3. Mo on NE (1992) Gene ic s uc u e o o ensic popula ions. P oc Na l Acad Sci
89: 2556–2560.
4. Budowle B, Monson KL, Gius i AM (1994) A eassessmen o equency
es ima es o P uII-gene a ed VNTR p o iles in a Finnish, an I alian, and a
gene al U.S. Caucasian da abase: no e idence o e hnic subg oups a ec ing
o ensic es ima es. Am J Hum Gene 55: 533–539.
5. Cu an JM, Buckle on JS, T iggs CM (2003) Wha is he magni ude o he
subpopula ion e ec ? Fo ensic Sci In 135: 1–8.
6. Chak abo y R, Kidd KK (1991) The u ili y o DNA yping in o ensic wo k.
Science 254: 1735–1739.
7. Na ional Resea ch Council (1992) DNA Technology in Fo ensic Science. Na l
Acad P ess, Washing on.
8. Balding DJ, Nichols RA (1994) DNA p o ile ma ch p obabili y calcula ion: how
o allow o popula ion s a i ica ion, ela edness, da abase selec ion and single
bands. Fo ensic Sci In 64: 125–140.
9. Balding DJ, Nichols RA (1995) A me hod o quan i ying di e en ia ion be ween
popula ions a mul i-allelic loci and i s implica ions o in es iga ing iden i y and
pa e ni y. Gene ica 96: 3–12.
10. O e all ADJ, Nichols RA (2001) A Me hod o Dis inguishing Consanguini y
and Popula ion Subs uc u e Using Mul ilocus Geno ype Da a. Mol Biol
E ol18: 2048–2056.
11. Buckle on JS, Cu an JM, Walsh SJ (2006) How eliable is he sub-popula ion
model in DNA es imony? Fo ensic Sci In 157: 144–148.
12. Buckle on JS, T iggs CM, Walsh SJ (2004) DNA E idence. CRC P ess, Boca
Ra on, Flo ida.
13. Ka lsson A, Holmlund G, Egeland T, Mos ad P (2007) DNA- es ing o
immig a ion cases: The isk o e oneous conclusions. Fo ensic Sci In 172: 144–
149.
14. W igh S (1943) Isola ion by dis ance. Gene ics 28: 114–138.
15. W igh S (1931) E olu ion in Mendelian Popula ions. Gene ics 16: 97–159.
16. Holsinge KE, Wei BS (2009) Gene ics in geog aphically s uc u ed
popula ions: de ining, es ima ing and in e p e ing F(ST). Na Re Gene 10:
639–650.
17. E e I, Wei B (1998) In e p e ing DNA e idence. S a is ical gene ics o
o ensic scien is s. Sudde land, Massachuse s
18. Balding DJ, G eenhalgh M, Nichols RA (1996) Popula ion gene ics o STR loci
in Caucasians. In J Legal Med 108: 300–305.
19. Han K, Kim K, Pa k T (2010) Unbalanced sample size e ec on he genome-
wide popula ion di e en ia ion s udies. IEEE In e na ional Con e ence on
Bioin o ma ics and Biomedicine Wo kshops 347–352.
20. Lebe g PL (2002) Es ima ing allelic ichness: E ec s o sample size and
bo lenecks. Molecula Ecology 11: 2445–2449.
21. Ma chini J, Ca don L, Phillips M, Donnelly P (2004) The e ec s o human
popula ion s uc u e on la ge gene ic associa ion s udies. Na u e Gene ics 36:
512–517.
22. Xu H, Sa ka B, Geo ge V (2009) A new measu e o popula ion s uc u e using
mul iple single nucleo ide polymo phisms and i s ela ionship wi h FST. BMC
Res No es 2: 21.
23. Mei mans P, Hed ick P (2011) Assessing popula ion s uc u e: Fs and ela ed
measu es. Molecula Ecology Resou ces 11: 5–18.
24. Egeland T, Kulle B, And eassen R (2006) Essen-Mo¨lle and Iden i ica ion based
on DNA. Chance 19: 27–31.
25. Toscanini U, Gusma˜o L, Be a di G, Amo im A, Ca acedo A
´, e al. (2007)
Tes ing o gene ic s uc u e in di e en u ban A gen inian popula ions.
Fo ensic Sci In 165: 35–40.
26. Ma ino M, Sala A, Bobillo C, Co ach D (2008) In e ing gene ic subs uc u e in
he popula ion o A gen ina using i een mic osa elli e loci. Fo ensic Sci In
Gene 1: 350–352.
27. Toscanini U, Salas A, Ca acedo A
´, Be a di G, Amo im A, e al. (2008) A
simula ion-based app oach o e alua e popula ion s a i ica ion in A gen ina.
Fo ensic Sci In Gene SS 1: 662–663.
28. Toscanini U, Salas A, Ga cı
´a-Maga in˜os M, Gusma˜o L, Raimondi E (2009)
Popula ion s a i ica ion in A gen ina s ongly in luences likelihood a io
es ima es in pa e ni y es ing as e ealed by a simula ion-based app oach.
In J Legal Med 124: 63–9.
29. A gen inean go e nmen . A ailable: h p://www.a gen ina.go .a /a gen ina/
po al/paginas.dh ml?pagina = 425. Accessed 2010 Jan 05.
30. Buenos Ai es ciudad. A ailable: h p://www.buenosai es.go .a /a eas/
hacienda/sis_es adis ico/poblacion.php?menu_id = 18715. Accessed 2010 Jan
05.
31. Encues a Complemen a ia de Pueblos Indı
´genas. A ailable: h p://www.indec.
go .a /webcenso/ECPI/index_ecpi.asp. Accessed 2010 Jan 05.
32. Mon gome y DC (2001) Design and analysis o expe imen s. John Wiley & Sons,
New Yo k.
33. Fo ensic Ma hema ics. A ailable: h p://www.dna- iew.com/hummel.h m.
Accessed 2010 Jan 05.
Ca ea s abou he Use o Fs in Pa e ni y Tes ing
PLOS ONE | www.plosone.o g 6 No embe 2012 | Volume 7 | Issue 11 | e49832