scieee AI-readable full text Open interactive document viewer

O příbuznosti lingvistiky a biologie

Owsianková, Hana,Kučera, Ondřej,Faltýnek, Dan

Abstract

79

Full text

Opříbuznosti lingvistiky abiologie Hana Owsianková — Ondřej Kučera — Dan Faltýnek1 ABSTRACT: In this paper, we discuss the history and current state of research where linguistics and biology meet on the base of interdisciplinary approach. We would like to introduce the use of quantitative text features (entropy, vocabulary richness, etc.) and quantitative text laws (Zipf’s law, MenzerathAltman’s law) in the analysis of genetic text. We point out research in which similar text features of natural languages are observed on the genetic text. In particular, we focus on the field of molecular phylogenetics, the subject of which is to investigate the relationship of species and the reconstruction of the evolutionary tree of organisms. In the conclusion, we present step-by-step genetic analysis of interspecific relationships of selected crops of the Brassicaceae family using the Bag-ofwords model. Our aim is to stress that linguistic methods can be agood tool for gaining new knowledge about genetic texts, and we want to introduce amethod for mapping evolutional relationships. KEYWORDS: Bag-of-words, biology, genetics, linguistics, molecular phylogenetics ABSTRAKT: Vtomto článku se zabýváme historií asoučasným stavem výzkumu, vněmž se potkávají biologie aling vistika. Poukazujeme na výzkumy, při nichž jsou na genetickém textu pozorovány podobné vlastnosti jako na textech přirozených jazyků. Konkrétně se zaměřujeme na oblast molekulární fylogenetiky, jejímž předmětem zkoumání je rekonstrukce stromu příbuznosti organismů. Vzávěru vjednotlivých krocích prezentujeme genetickou analýzu mezidruhových vztahů vybraných kulturních plodin čeledi Brassicaceae (brukvovité) pomocí metody Bag-of-words. Našim cílem je ukázat, že lingvistické metody mohou být vhodným nástrojem kzískání nových poznatků také ogenetických textech, nově pak chceme představit metodu Bag-of-words využitelnou kmapování příbuzenských vztahů. KLÍČOVÁ SLOVA: Bag-of-words, biologie, genetika, lingvistika, molekulární fylogenetika ÚVOD Od přelomu osmnáctého adevatenáctého století, kdy byla vymezena jako vědní disciplína, se lingvistika ocitla hned několikrát vtěsném vztahu kbiologii, ato vsouvislosti sanalogizováním jazyka aživého ataké zdůvodu podobnosti metodologie obou disciplín, např.při popisu původu jazyků adruhů. Vzájemná inspirace obou disciplín byla vprůběhu času obousměrná, historickosrovnávací lingvistika se např.inspirovala teoretickým rámcem evoluční teorie, genetika využila analogie stextem při popisu DNA. Vtomto článku chceme shrnout vývoj kontaktu obou disciplín aupozornit na výhledy jejich dalšího setkávání. 1 Článek vznikl v rámci projektu Sinophone Borderlands Reg. no. CZ.02.1.01/0.0/0.0/16_0 19/0000791, Excellent research. OPEN ACCESS 80 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 Na vztah biologie alingvistiky bylo vlingvistice mnohokrát poukázáno. Na začátku připomeňme práci Augusta Schleichera (1869), který ovlivněn darwinismem považoval jazyk za vyvíjející se živý organismus. Schleicher ukázal, že darwinistický výklad evoluce založený na náhodné mutaci apřirozeném výběru se vztahuje nejen na organismy, ale také na jazyky. Tímto způsobem postavil na roveň přístup evoluční biologie ahistorickosrovnávací lingvistiky. Ovlivu darwinismu na lingvistiku, přijetí prací Schleichera dobovými biology ataké o„ztotožňování řeči spřírodninou“ později referuje Emanuel Rádl (2006, s.170–172; německý originál 1909). Rádl vztahy lingvistiky abiologie ovšem reflektuje zpozice dobové kritiky darwinismu aanalogie předmětu studia biologie ajazykovědy pojímá vkontextu vitalistické teorie, která je vzhledem kdnešnímu všeobecnému akceptování Darwinovy teorie neakceptovatelná (vyjmeme-li zdiskuse kreacionismus adnes známou paletu evolučních mechanismů doplňující koncept přirozeného výběru). Ovlivu darwinismu na českou lingvistiku píše Jan Petr (1982, 1988), všímá si především Jana Gebauera, který se sdarwinismem setkal prostřednictvím svého učitele Martina Hattaly— stejně jako on pojetí jazyka jako organismu odmítá, anaopak považuje jazyk za historický společenský jev, unějž je třeba zkoumat především jeho vnitřní psychickou stránku (ktomu viz Syllaba, 1983, s.25–27). Další výraznou inspiraci biologií můžeme nalézt uPražského lingvistického kroužku (PLK). Vjeho Tezích (Vachek, 1972, s.37) nacházíme vliv nomogenetického pojetí vývoje jazyka. Kroužek se vtomto směru nechává inspirovat antidarwinistickou koncepcí zákonem řízené evoluce ruského teoretického biologa aichtyologa L.S.Berga (1926)— teleologické pojetí jazyka se výrazně promítá do profilu pražského strukturalismu, který usiluje ostrukturní (tzn.systémový) popis nejen synchronních, ale také diachronních jevů, čímž se odlišuje od ostatních strukturalismů, především ženevského (viz Kořenský, 2008; Leška, 1986; Němec, 1989; Savický, 1991; Šoltys, 1991; Vachek, 1968). Teleologický výklad se týká především vysvětlení hláskových změn (Vachek, 1968; pro ilustraci viz vysvětlení vzniku hlásek ť aď vlivem fonologické pozice hlásky ň vHistorické mluvnici češtiny, Lamprecht— Šlosar— Bauer, 1986, s.88). Jedna znejvýraznějších osobností PLK, Roman Jakobson, znovu promlouvá ovztahu obou věd později, když analogizuje strukturu přirozeného jazyka astrukturu DNA (1971; ktomu viz Katz, 2008). Jakobson upozorňuje např.na dvojí artikulaci obou kódů— stejně jako jsou vpřirozeném jazyce věty členěny do slov, aty dále do morfémů/fonémů, které jakožto jednotky druhé artikulace nenesou význam, ale rozlišují jej, tak lze sekvence DNA členit na triplety aty pak na jednotlivé nukleotidy, přičemž tripletům je přisouzen význam vpodobě aminokyseliny anukleotidy význam nemají, jejich funkcí je rozlišovat triplety. Jakobson dále připodobňuje řetězce DNA ktextu zhlediska jejich linearity/sekvencionality. Svou teorii binárních opozic, aplikovanou např.na morfologický systém ruštiny (viz Jakobson, 1932), převedl na vztah protilehlých bází vDNA: cytosin— guanin, adenin— thymin (Jakobson, 1971, s.678–681). Dokonce mluví opružné stabilitě jazyka DNA (ibid., s.681). Analogii DNA ve vztahu kjazyku ajeho projevech vtextu dále rozvíjí např.Searles (2002) nebo Raible (2001). Soustavně se historickým souvislostem vztahů biologie alingvistiky věnoval Simeon Romportl (1989, 1994)— jazyk agenetický kód srovnává zhlediska komplexOPEN ACCESS HANA OWSIANKOVá — ONDŘEJ KUČErA — DAN FALTÝNEK 81 nosti jejich struktury, upozorňuje na jejich hierarchičnost (jazykové plány, struktura genetického kódu) adiskrétnost veličin reprezentovaných vtextu (ve smyslu jazykových jednotek ade Saussurovy diskrétnosti jakožto vlastnosti jazykového znaku) (1989, s.261). Romportl ukazuje na podobnosti aodlišnosti vevoluci jazyka aživého— podobnosti např.zhlediska mutace jakožto prostředku vývoje nových forem (Romportl mluví otransformacích jazykových agenetických prvků), odlišností např.zhlediska niterného charakteru genetického textu oproti komunikační funkci jazyka. Vsouvislosti staxonomizací jazyků adruhů informuje okladistice (viz níže) aukazuje způsoby rekonstrukce genealogického stromu (1997, 1999). Na druhou stranu čeští biologové vyhledávají kontakt slingvistikou, např.voblasti sémiotického popisu procesů vživých organismech kolem sebe ustavil celou školu Anton Markoš (2003; Markoš & Švorcová, 2009). Podle Markoše je textům přirozených jazyků agenetickým textům společné to, že se jedná olineární záznam znaků (prvků) nesoucích informaci. Nezdůrazňuje ovšem samotnou povahu informace, ale především způsob, jakým je přečtena— hovoří oprocesech interpretace vbuňce, které formují výsledný fenotyp. Voblasti zoosémiotiky, při popisu systémů zvířecí komunikace, kriticky navazuje na Hockettův výčet charakteristických vlastností jazyka (1982, „language design features“) Lucie Čadková (2015)— na základě moderních poznatků okomunikaci zvířat upozorňuje především na to, že fyziologické vlastnosti organismu nelze pokládat za konstitutivní rysy jazyka aže kuniverzáliím lidského jazyka nemůžeme přistupovat jako kuniverzáliím jazyka obecně. Signalizační systémy mnohobuněčných bakteriálních konsorcií sloužící kvýstavbě kolonií popisují Jaroslav Čepl et al. (2010). Genetické predispozice jazyka (např.tzv.„jazykový gen“ FOXP2), jeho vznik aevoluci zkoumá biolingvistika, která má sčeským prostředím také kontakt (Augustyn, 2013; Berwick & Chomsky, 2011; Kosta & Krivochen, 2012). Programem biolingvistiky je především nalezení genetických dispozic člověka, vysvětlení jejich vztahu ke kognitivnímu zpracování řeči, rekonstrukce vývoje schopnosti řeči učlověka apopis odlišnosti zvířecí komunikace oproti lidské (Berwick & Chomsky 2016). TAXONOMIE Zhlediska dnešních vztahů biologie alingvistiky se nejdříve zastavíme umetod rekonstrukce vývoje organismů. Zkoumání příbuzenských vztahů je vsoučasné biologii úkolem nejen morfologie, ale také molekulární fylogenetiky, která rekonstruuje genetický strom na základě analýzy dlouhých řetězců genetického zápisu organismů. Původní taxonomizace (Linnæi, 1758) je založena na srovnávání morfologických znaků, tzn.celkové vnější stavby organismu— urostlin se jedná např.otvar, velikost abarvu plodu, květu nebo listu, velikost atvar semen, trichomů („chloupků“, výčnělků na pokožce rostlin) apod. Ktaxonomizaci jsou využívány také anatomické znaky, jako je stavba pletiv, např.typ cévních svazků, jejich počet apod. Zvažovány jsou také znaky chemické— obsah určité sloučeniny vorganismu. Proti taxonomizaci organismů na základě podobnosti výše zmíněných znaků (dále tělních ve smyslu fenotypických) se od padesátých let 20.stol. staví kladistika, která taxonomizaci OPEN ACCESS 82 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 provádí prostřednictvím rekonstrukce evolučních linií podobnosti (příbuznosti) znaků, na základě takového srovnání se pak evoluční biologové pokouší rekonstruovat průběh evoluce. To znamená, že kladistika rekonstruuje příbuznost linií na základě přítomnosti určitých znaků, které vyznačují evoluční oddělování skupin organismů (ktomu viz Hennig, 1966, 1975; Dupuis, 1984; Brinkman, 2001; ke kritice fylogenetické taxonomie viz Mayr, 1974; Wheeler, 2004). Taxonomizace fenotypická je postupně doplňována imetodami molekulární fylogenetiky (mezi něž patří ikladistika), která příbuznost druhů ajejich taxonomické zařazení zkoumá pomocí molekulárních znaků, tj.úseků DNA, RNA aproteinů. Určování příbuznosti druhů na základě molekulárních znaků— podobnosti řetězců DNA, RNA aproteinů— přináší oproti určování příbuznosti na základě morfologických adalších tělních znaků určité výhody. Tělní znaky se totiž vzájemně podmiňují (např.tvar semene, jeho chemické složení atvar kořene (např.Stace, 1989)). Tělních znaků je oproti tomu, co lze získat zlineární posloupnosti genetických textů, omezené množství. Oproti morfologickým znakům zde mluvíme otzv.genetických markerech— ty lze vymezit jako oblast genetické informace, kterou srovnávané organismy sdílí, ato isdiferencemi získanými vevoluci. Markery jsou oproti fenotypickým znakům proměnlivé spíše zhlediska toho, zda jsou brány zoblastí kódujících částí DNA, kde je jejich variabilita vázána na funkci řetězce, nebo zčástí nekódujících— ivtomto případě je ale míra jejich proměnlivosti různá, vzhledem ktomu, že inekódující části DNA mohou mít určitou funkci, např.vpodobě regulace genové exprese. Molekulární fylogenetika (nikoliv pouze kladistika) umožňuje porovnávat evolučně velmi vzdálené organismy, jejichž tělní znaky nevykazují dostatečnou podobnost kvzájemnému srovnávání sostatními, ale struktura jejich molekulárních znaků ano, nebo takové organismy, které mají velmi rozdílnou morfologii, ale jsou příbuzensky blízké (Flegr, 2005, s.439–442; podrobněji Page & Holmes, 1998). LINGVISTICKÉ METODY VANALÝZE GENETICKÉHO TEXTU Analýzou posloupnosti bází DNA či aminokyselin vproteinech neboli „genetických textů“ se zabývá bioinformatika, jejíž metody srozumitelně ipro laického čtenáře přibližuje F.Cvrčková (2006). Vzhledem ktomu, že centrální úlohu vanalýze genetických markerů hrají textualizované, tzn.jako texty zapsané, řetězce biopolymerů (proteinů, nukleových kyselin), se zároveň stává molekulární fylogenetika zájmem lingvistiky, která má sanalýzou textu zkušenosti. Výzkumné metody biologie alingvistiky jsou vzájemně přejímány. Např.kladistika jako molekulárně fylogenetická metoda je včetně dílčích postupů (např.Maximum parsimony, Maximum likelihood) postupně aplikována na analýzy slovesné kultury (Ross et al., 2013) ajazyka (Gray &Atkinson, 2003; Rexová et al., 2003, 2006; Forster & Renfrew, 2006; Grollemund &Hombert, 2012; Fangerau et al., 2013; Rabinovich et al., 2017). Naopak metody využívané současnou bioinformatikou často pocházejí zlingvistiky, jedná se např.oDamerau-Levenshteinovu vzdálenost (Damerau, 1964; Levenshtein, 1966). Obecně je Damerau-Levenshteinova vzdálenost definována jako minimální počet transformací jednoho řetězce (textu) na druhý. Transformací se rozumí vložení, OPEN ACCESS HANA OWSIANKOVá — ONDŘEJ KUČErA — DAN FALTÝNEK 83 odstranění anahrazení části textu nebo změna její pozice vtextu. Čím méně je třeba transformací od výchozího textu ksrovnávanému, tím jsou si texty podobnější (Damerau, 1964; Levenshtein, 1966). Tato metoda byla navržena jako editační vzdálenost mezi texty— vyjadřovala množství ortografických změn, jimiž se dva texty odlišují. Použita byla také voblasti lexikostatistiky (glottochronologie) vsouvislosti srekonstrukcí genetického stromu jazyků na základě analýzy výpůjček, kčemuž je využíván tzv.Swadeshův seznam (Swadesh, 1952, 1955; Embleton, 2000)— obsahuje slova, která jsou odolná vůči jazykovým výpůjčkám: osobní zájmena, části těla, zvířata, slovesa základních činností, barvy, číslovky „jedna“ a„dvě“, nebeská tělesa atd. Množství rozdílů mezi slovy určuje vzdálenost mezi jazyky ve stromu (metodu představuje např.Skalička, 1967; Králík, 1976; Serva & Petroni, 2007). Voblasti biologie jsou tímto způsobem srovnávány konkrétní sekvence DNA ana základě jejich míry shody je vyjadřována příbuznost jednotlivých druhů ajimi zastupovaných skupin organismů. Částmi řetězce jsou vpřípadě analýzy genetických textů nukleové báze DNA nebo aminokyseliny proteinového řetězce. Dodejme, že kromě lingvistiky abiologie byla Damerau-Levenshteinova vzdálenost využita např.vmedicíně pro výzkum evoluční trajektorie chronické lymfocytární leukémie (Sutton et al., 2014). Další metodou, která je využívána pro analýzu podobnosti textů, je tzv.Bag-of- -words model. Tato metoda je využívána voblasti zpracování přirozeného jazyka (natural language processing), vyhledávání informací (information retrieval), počítačovém vidění (computer vision) aklasifikaci dokumentů (Toldo et al., 2009; Zhang et al., 2010). Pro analýzu genetických textů je převzata nověji (Bolshoy et al., 2010; Lovato, 2015). Metoda Bag-of-words spočívá vreprezentaci textu jeho slovy, bez ohledu na jejich pořadí vtextu, ale se zohledněním jejich frekvence. Umožňuje vyhodnocovat podobnost lexika textů azní vyvozovat podobnost tematickou, obsahovou, stylovou či autorskou. Vpřípadě našeho zájmu se jedná opodobnost textů genetických, znichž můžeme usuzovat na blízkost fylogenetickou (vývojovou, příbuzenskou). Vpřípadě textů genetických však nemáme přirozeně dány hranice slov, proto je kreprezentaci slova vgenetickém textu vhodné využít n-gramovou analýzu. Při ní jsou genetické texty segmentovány na stejně dlouhé části (substringy): dvoj-kombinace bází nebo aminokyselin (2-gram), troj-kombinace bází nebo aminokyselin (3-gram) atd. Tento nepřirozený zásah do struktury genetického textu můžeme podpořit zkušeností stím, že n-gramová analýza je citlivá na přirozené hranice jednotek (např.slov) apři vhodném užití velikosti n-gramu kopíruje výsledky analýzy přirozeně segmentovaného textu— dokládá to např.využití n-gramové analýzy při určování autorství, kdy tato technika dosahuje podobných výsledků jako určování autorství založené na přirozeně segmentovaném textu (Peng akol., 2003; viz také Faltýnek, 2017, s.72, kde jsou ukázány výsledky n-gramové analýzy textů srovnatelné svýsledky analýzy využívající dělení na slova). Každý organismus je vanalýze reprezentován řadou hodnot vyjadřujících přítomnost či nepřítomnost určitého slova (substringu) vjeho genetické sekvenci, nebo rozdílem ve frekvenci daného slova oproti dalším sekvencím. Takto reprezentované sekvence DNA jsou následně použity ve shlukové analýze, která podobnosti textů zobrazuje vgrafu hierarchického shlukování (dendrogramu). Vnávaznosti na Damerau-Levenshteinovu vzdálenost dodejme, že Bag-of-words model byl využit ke klasifikaci dat biomedicínského inženýrství, jako jsou výsledky OPEN ACCESS 84 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 vyšetření EEG nebo EKG (Wang et al., 2013). Jeho další aplikace slouží kdetekci infekce vorganismu na základě zastoupení různých tříd molekul T-receptorů (Lovato, 2015). VYUŽITÍ KVANTITATIVNÍCH VLASTNOSTÍ TEXTU VPOPISU GENETICKÉHO TEXTU Lingvistické metody jsou vanalýze genetických textů využívány vsouvislosti sřadou dalších výzkumů, nejen pro účely taxonomické. Dlouhou tradici mají např.výzkumy Zipfova zákona (Zipf, 1949), který formuluje vztah mezi počtem výskytů slova ajeho distribucí vtextu (obecněji vjazyce). Příkladem je jeho využití pro predikci funkce nekódující DNA (Niyogi & Berwick, 1995; Tsonis et al., 1997; Havlin et al., 1995; Mantegna et al., 1995) nebo kpopisu hierarchie genetického kódu (ve smyslu skladby rovin jako je fonetická, lexikální avětná, viz Matlach & Faltýnek, 2016, Faltýnek et al., 2019). Oprojevech tohoto zákona vtextu se dlouhodobě vedou diskuse, protože každý text, který je produktem libovolného systematického procesu, zákon projevuje: může se jednat ošifru, tzv.monkey typing— text vzniklý náhodnými úhozy do klávesnice, zápis činnosti nějakého technického zařízení (ktomu viz např.otázku projevů zákona vnáhodném textu Ferrer-i-Cancho & Elvevåg, 2010; shrnutí současného stavu výzkumu Zipfova zákona ajeho výhledy předkládá Piantadosi, 2014). Novější lingvistickou paralelu vsouvislosti sDNA představuje analýza projevů Menzerath-Altmannova zákona vgenetickém textu (Altmann, 1980). Verbální formulace zákona zní takto: čím větší je jazykový konstrukt, tím větší jsou jeho konstituenty ve své průměrné délce; jedná se např.ovelikost věty ve vztahu ke slovům, slova ke slabikám apod. To ukazují např.Ferrer-i-Cancho et al. (2013); Hřebíček (2002, 2007) ukazuje, že Zipfův zákon je variantou Menzerath-Altmannova zákona. Studie se zaměřují především na vztah velikosti apočtu chromozomů vgenomu (Baixeries et al., 2013; Hernández-Fernández et al., 2011), velikosti exonů ajejich počtu vgenu (Li, 2012; Nikolaou, 2014), další výzkumy studují vztah velikosti proteinových domén avelikosti proteinu (Shahzad et al., 2015). Vliv segmentace textu na výsledky analýzy projevů Menzerath-Altmannova zákona ukazují Benešová, Faltýnek aZámečník (2015) aBenešová (2014), voblasti výzkumu genetického textu stímto souvisí výběr srovnávaných jednotek (exon—intron, sekundární struktury apod.) avelikost n-gramů vstupujících do analýzy. Projevy těchto zákonů jsou většinou vykládány jako ekonomizační ve smyslu zákona nejmenšího úsilí (způsoby vysvětlení viz Piantadosi, 2014). Jako příklad lingvistické analýzy DNA slouží další výzkumy: komplexitu genetického textu (pravděpodobnost výskytu za sebou jdoucích částí řetězce) zkoumá Popovová, Segal aTrifonov (1996). Trifonov také upozorňuje na možnosti zkoumání raných stádií vzniku genetického kódu (Trifonov et al. 2001), za pozornost stojí též jeho práce sBerezovským zaměřená na popis struktury proteinů analogicky ke struktuře jazykové (Trifonov & Berezovski, 2002). Zemková zkoumá využití lingvistických metod vgenomice vširokém rozsahu např.na genetických textech parazitů (Zemková, 2016; Zemková et al., 2014). Ukazuje, že tyto texty mají vyšší míru opakuOPEN ACCESS HANA OWSIANKOVá — ONDŘEJ KUČErA — DAN FALTÝNEK 85 jících se struktur. Systematický přehled použití lingvistických metod vmolekulární biologii předkládá Bolshoy (2003, 2010). Kvalitativní strukturou genomů aproteomů, např.přítomností textových motivů vrozsáhlých vzorcích proteinů, se zabýval Ohno (1992). Analogii mezi přirozenými jazyky agenetickým kódem, nikoliv ale na základě analýzy textu, popisuje také Ji (1997, 1999), Pattee aKull (2009), Barbieri (2006, 2008, 2015), Favareau (2009) aSharov (2010). Vsouvislosti sčeskou lingvistikou stojí za zmínku, že analogii přirozeného jazyka agenetického kódu představil Jakobson (1971), oněmž píšeme výše. Hovoří obázích DNA jako ofonémech, otripletech jako slovech agenech jako větách, mluví ale také osynonymii tripletů, fonologických opozicích bází, pružné stabilitě genetického kódu atd., což působilo vdiskusi sbiology určité rozpaky (Jacob et al., 1968). Na problémy spojené sanalogizováním jazyka agenetického kódu upozorňuje Markoš aFaltýnek (2011)— viz tradiční pojetí bází jako písmen, genů jako vět. Na základě experimentu založeném na mapování Zipfova zákona na mRNA diskutuje Matlach aFaltýnek (2016), základní předpoklady znakových vlastností genetického kódu ukazují Lacková, Faltýnek aMatlach (2017). MODELOVÁ ANALÝZA PŘÍBUZNOSTI DRUHŮ RODU BRASSICA ZA VYUŽITÍ METODY BAG-OF-WORDS Vzávěrečné části textu chceme představit modelovou analýzu fylogenetických vztahů pomocí lingvistické metody Bag-of-words popsané výše. Naším předpokladem je, že podobnost (atedy blízkost) mezi texty přirozeného jazyka nebo mezi texty DNA (sekvencemi) lze srovnávat na podobném principu, tj.na základě složek (slov, bází) obsažených vjednotce (věta/text, sekvence). Věnovat se budeme taxonomizaci čeledi Brassicaceae (brukvovité). Současná taxonomie zahrnuje 3700 rostlin, dále hovoří o338 rodech a25 tribech (tribus je novodobý taxon zařazený mezi čeleď arod) této čeledi (Al-Shehbaz et al., 2006; Bailey et al., 2006). Čeleď Brassicaceae, jmenovitě rostliny rodu Brassica, zahrnují řadu kulturně využívaných plodin, které jsou také vsouvislosti sjejich dlouhodobým šlechtěním morfologicky velmi odlišné. Jsou pěstovány pro list (B. oleracea), otevřený atvořící hlávky, kořen (B. rapa), isemena (B. napus). Vsouvislosti sodlišnými způsoby taxonomizace (morfologický/fenotypický × molekulární; viz výše) se tak čeleď Brassicaceae jeví být jako vhodný reprezentativní materiál kdemonstrování metod molekulární fylogenetiky, tzn.metod zohledňujících podobnost genetických markerů, anikoliv morfologických znaků. Pro analýzu jsme vybrali významné kulturní plodiny rodu Brassica— B. oleracea (brukev zelná), B. oleracea var. capitata (hlávkové zelí), B. oleracea var. alboglabra (čínská brokolice), B. oleracea var. botrytis (květák), B. rapa (brukev řepák vodnice), B. rapa var. chinensis (čínské zelí), B. rapa var. pekinensis (pekingské zelí), B. rapa var. oleifera (brukev řepák olejný), B. juncea (brukev sítinovitá), B. nigra (brukev černá), B. carinata (hořčice habešská), B. napus (brukev řepka). Pro vybrané druhy avariety jsme našli vzorky (viz Tabulku 1) vgenetické bance NCBI (National Center for Biotechnology Information)— jednalo se oITS marker (konkrétně nekódující úsek OPEN ACCESS 86 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2020 ribozomální RNA ITS1 5.8S ITS2), který je pro fylogenetické studie využíván pro svou variabilitu imezi blízce příbuznými druhy. Brukve patří mezi tzv.allopolyloidní rostliny (dochází unich ke znásobení chromozomových sad, které pochází od více druhů), proto je každý vybraný zástupce reprezentován několika vzorky. Druh/Vzorek 1 2 3 4 5 Brassica carinata DQ003688.1 DQ003689.1 DQ003690.1 DQ003691.1 DQ003692.1 Brassica juncea MG923961.1 MG923962.1 MG923963.1 MG923964.1 MG923965.1 Brassica napus DQ003657.1 DQ003658.1 DQ003659.1 DQ003660.1 DQ003661.1 Brassica nigra DQ003644.1 DQ003645.1 DQ003646.1 DQ003647.1 DQ003648.1 Brassica ol. alboglabra GQ891870.1 GQ891871.1 Brassica ol. botrytis AF128099.1 GQ891875.1 GQ891876.1 Brassica ol. capitata DQ003650.1 DQ003651.1 DQ003652.1 DQ003653.1 DQ003654.1 Brassica oleracea MG923981.1 MG923982.1 MG923983.1 MG923984.1 Brassica ra. chinensis AF128095.1 GQ202246.1 GQ202249.1 GQ202250.1 Brassica ra. oleifera GQ268061.1 GQ891873.1 GQ891874.1 Brassica ra. pekinensis GQ891872.1 GQ891880.1 GQ202251.1 AF128096.1 Brassica rapa MG923985.1 MG923986.1 MG923987.1 MG923988.1 MG923989.1 Tabulka 1:Seznam použitých vzorků pro jednotlivé druhy avariety rodu Brassica. Pro srovnání azhodnocení vhodnosti metody Bag-of-words pro fylogenetické studie jsme plodiny rodu Brassica nejprve podrobili standardizované bioinformatické metodě Multiple Sequence Alignment, která porovnává genetické sekvence na základě delecí, insercí, substitucí atransformací nukleotidů/aminokyselin. Použili jsme program webPRANK (https://www.ebi.ac.uk/goldman-srv/webprank/), který ke zhodnocení genetické podobnosti hledá vsekvencích fylogenetické vzory. Výsledky (viz Graf 1) jsou zobrazeny pomocí kladogramu adále graficky rozlišeny vzhledem ke genetickým vztahům hlavních druhových skupin rodu Brassica— Brassica olerace, Brassica rapa, Brassica nigra akřížením vzniklé Brassica napus (B. oleracea + B. rapa), Brassica carinata (B. oleracea + B. nigra) aBrassica juncea (B. rapa + B. nigra). Samotnou analýzu Bag-of-words jsme provedli následovně: Sekvence jsme rozdělili na 3-gramy, tedy subsekvence odélce tří nukleotidů (vbioinformatice užíván pojem k-mer). Subsekvence tripletů jsme dále použili jako „slova“ vBag-of-words analýze. Na základě zastoupení těchto „slov“ ajejich frekvence vjednotlivých sekvencích jsme pak měřili podobnost sekvencí. Jejich srovnání spočívá ve sloučení seznamů „slov“ srovnávaných „genetických textů“ areprezentací jednotlivých „textů“ číselnou řadou odpovídající zastoupení jednotlivých „slov“ vtzv.globálním slovníku (0— vtextu se slovo nevyskytuje, 1— vtextu se slovo vyskytuje jednou atd). Výsledné číselné řady představují vlastnosti textů vstupující do hierarchického shlukování. Rozdíly mezi jednotlivými vlastnostmi srovnávaných textů/objektů jsou reprezentovány jako vzdálenosti objektů, které jsou vgrafu vyznačeny pomocí počtu větvení adélky větví, na nichž se objekty nachází. Ksrovnání sekvencí jsme využili shlukovací metodu ward.D2 apro clustering eukleidovskou vzdálenost. OPEN ACCESS HANA OWSIANKOVá — ONDŘEJ KUČErA — DAN FALTÝNEK 87 Graf 1:Multiple Sequence Alingment vybraných zástupců rodu Brassica pomocí programu webPRANK. Ve výše uvedeném grafu (viz Graf 2) můžeme pozorovat, že Bag-of-words model 3-gramů ITS markeru velmi dobře vyjadřuje příbuzenské vztahy druhů, jejich variet ahybridů rodu Brassica. Stejně jako při Multiple Sequence Alignment pozorujeme oddělení zástupců B. oleracea od zástupců B. rapa na samostatných větvích. Zdějin agrikultury zjišťujeme (viz Sadowski & Kole, 2011), že hlávkové zelí, květák ačínská brokolice mají společného předka, divokou brukev zelnou, kterou nacházíme na OPEN ACCESS