Báze nejsou písmena1 Vladimír Matlach — Dan Faltýnek ABSTRACT: The Bases Are Not the Letters. In this paper we show some interpretation of the genetic code design. We proceed from the discovery of DNA structure to current stage of the molecular biology. Generally we introduce the basic semiotic assumptions of molecular biology in the description of the structure of DNA, proteins and genetic code. We focus on interpretations of Francis Crick, another molecular biologists, biosemioticians and linguists. For the aims of the paper we describe some fundaments of molecular biology. Core of our text is quantitative analysis (n-gram structure, Zipf’slaw) of mRNA strings and natural language text. We take into consideration representative quantitative analysis of DNA, RNA and proteins too. Our analysis of mRNA confirms the assumption that the design of the genetic code cannot analogize DNA bases and letters. KLÍČOVÁ SLOVA / KEY WORDS: biosémiotika, DNA, genetický kód, jazyková metafora, n-gram, protein, Zipfův zákon biosemiotics, DNA, genetic code, language metaphor, n-gram, protein, Zipf’slaw GENETICKÝ KÓD Počínaje popsáním struktury DNA mluví biologie, nově vznikající molekulární biologie aobecně věda aspolečnost ogenetickém kódu (viz ktomu Watson— Berry, 2003). Dnes je genetický kód všeobecně intuitivně potvrzovaným vědeckým poznatkem. Spředpokladem existence genetického kódu dnes bezprostředně vnímáme živé bytosti abiosféru. Na tento kód se pohlíželo sjistými předpoklady: byly formulovány některé jeho základní vlastnosti apostupem času se pevně ustavilo nahlížení na to, jaký design tento kód má. Výše jsme odkázali kpublikaci ozřejmující okolnosti objevu struktury DNA, jejímž autorem je J. Watson. Vlastnosti DNA agenetického kódu ve svých publikacích apřednáškách představoval, vysvětloval apopularizoval Francis Crick. Využijeme jeho textů jako reprezentativních pro představení dnes běžného pohledu na genetický kód. Vlastnosti genetického kódu Crick formuluje následovně. Genetický kód ksobě vztahuje aminokyseliny (znichž se skládají proteiny) abáze, které obsahuje DNA (Crick, 1962, s.11–12; Crick, 1968, s.367). Vprocesu výstavby pro1 Vladimír Matlach byl podpořen projektem Lingvistická alexikostatistická analýza ve spolupráci lingvistiky, matematiky, biologie apsychologie, CZ.1.07/2.3.00/20.0161, který je spolufinancován Evropským sociálním fondem astátním rozpočtem České republiky. Danu Faltýnkovi bylo zpracování avydání textu umožněno díky finanční podpoře Filozofické fakulty Univerzity Palackého vrámci Fondu pro podporu vědecké činnostiFF UP.
VLADIMÍR MATLAcH — DAN FALTÝNEK 21 teinu se ksobě vztahuje 20 aminokyselin a64 trojkombinací bází, tzv. tripletů (Crick, 1968, s.368). Tento kód je univerzální aaž na výjimky, které ale nevybočují zprincipu vztahu bází aaminokyselin, je společný všem živým organismům (Crick, 1962, s.8; Crick, 1968, s.369). Báze jsou vgenetickém kódu spojeny saminokyselinami arbitrárním vztahem. Ze všech možných aminokyselin je použito jen konkrétních dvacet, které se vztahují kbázím na základě zprostředkování jistými molekulárními prostředky (tzv. adaptorem— tRNA; Crick, 1967, s.342–343), přičemž mezi aminokyselinami abázemi není přímá chemická afinita, mluví se zde ozmrzlé náhodě (Crick, 1968, s.369). Genetický kód je redundantní, ato vtom smyslu, že více tripletů odpovídá jedné aminokyselině. Některé triplety naopak vztah kaminokyselinám nemají aslouží pouze jako signály vymezující hranici začátku akonce využitelné genetické informace. Relevantní roli vtripletech hrají především první dvě báze. Třetí pozice vtripletu často umožňuje variovat báze, aniž by došlo kzáměně aminokyseliny. Umístění bází vtripletu tedy není náhodné. Crick (1968, s.369) tuto systematičnost detailně popisuje. Zápis bází je lineární, čte se vjednom směru abez možnosti přeskakování bází (Crick, 1966, s.332–333; Crick, 1964, s.9). Má pevný čtecí rámec, vněmž zachovává hranice tripletu. Zároveň se nepřekrývá (zangl. overlapping), to znamená, že nenese více informací současně (např. Trifonov ale kód chápe jako překrývající se, důvody popisuje sdalšími spoluautory vpráci Popov— Segal— Trifonov, 1996, s.66; viz ktomu především Trifonov, 1988, s.508–510). Proces výstavby proteinu, tzv. proteosyntéza, probíhá (informačně aenergeticky) směrem od bází kproteinům. Tento princip je nazván centrální dogma. Uvedený popis genetického kódu byl dále precizován objevy molekulární biologie. Proces proteosyntézy byl popsán smnoha dalšími proměnami původního řetězce DNA (do hnRNA, mRNA, vsouvislosti sinterakcemi ssnRNA atd.) aprocesy směřujícími kfinálním produktům proteosyntézy ajejich funkcím. Byly popsány procesy sestřihu, jejich variace mezi organismy ačástmi organismů, konformační procesy proteinů, metylace řetězců DNA, chromatinové interakce atd. Genetický kód je vnímán jako lineární zápis bází vztahující se ktvaru afunkci proteinu. Báze jsou vpraxi charakterizovány jako písmena (Crick, 1967, s.331; Crick, 1962, s.16). Tato písmena tvoří triplety (trojice bází), které jsou pojímány jako slova, tzv. kodony— kódová slova. Tato slova mají kódem zprostředkovaný vztah ke konkrétní aminokyselině. Soubor tripletů (kódových slov) tvoří gen, jednotku, která má vztah kcelému proteinu, jeho tvaru azněj plynoucí funkci vorganismu (Crick, 1962, s.8; Crick, 1964, s.2). Obázích jakožto písmenech atripletech jako slovech se hovoří např. vnásledujících publikacích (vybíráme reprezentativní doklady pouze pro ilustraci): Stanford (1975, s.74) ve svých Základech biofyziky hovoří otripletech jakožto otřípísmenných slovech, Weaver (2002, s.569) ve své Molekulární biologii říká, že kodony jsou kódová slova askládají se ze tří písmen, Twyman (1998, s.205) ve své syntéze molekulární biologie označuje báze jako písmena, triplety jako slova ageny jako věty astejně tak se vyjadřují iHartl aRuvolová (2013, s.10). OPEN ACCESS
22 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2016 GENETICKÝ KÓD APŘIROZENÝ JAZYK Ogenetickém kódu se vždy uvažovalo ve vztahu kpřirozenému jazyku. Vědní obor molekulární biologie je pevně svázán spojetím DNA aproteosyntézy jakožto analogie přirozeného jazyka. Analogie molekulárněgenetických procesů sjazykem jsou vmolekulární biologii do jisté míry instrumentální, představují tradiční přístup kterminologii. Částečně ale analogie sjazykem molekulární biologii zprostředkovává přístup ke genetickému kódu, jeho struktuře afunkci. Užívání jazykové metafory vmolekulární biologii názorně ukázal Raible (2001). Ten provedl korpusové šetření na desítkách tisíc molekulárněgenetických textů, zněhož jasně vyplývá, že termíny analogické kpopisu přirozeného jazyka (písmeno, slovo, čtení, zápis, překlad atd.) jsou široce používány vběžné praxi této vědy. Searls (2002) ukázal, že molekulárněgenetický výzkum nesdílí slingvistikou jen terminologii, ale ivýzkumné metody. Jakobson (1971, s.655–696) dokonce potvrdil molekulární biologii korektnost využívání analogie genetického kódu ajazyka ahovořil přímo ostruktuře genetického kódu, který se dle něj skládá zpísmen (bází), slov (tripletů) avět (genů). Dále poukazuje na to, že vgenetickém kódu nacházíme vlastnosti, jako je synonymie, suprasegmentální nebo syntaktická delimitace, systém distinktivních rysů či pružná stabilita. Jakobsonův jazykový výklad genetického kódu je pak přejímán dál (např. Katz, 2008). Ojazykové metafoře vbiologii referují Markoš aFaltýnek (2011). Vtomto textu chceme ukázat, že běžně přijímaný design genetického kódu, jak jsme jej představili výše, je možné zpochybnit. Domníváme se, že pojetí struktury genetického kódu, ato především vjazykové analogii, je od prvopočátku chybné. Chceme jej odmítnout, ato na základě popření analogie bází apísmen. Ze sémiotického hlediska jsme to již udělali (viz Faltýnek, 2012). Ktomuto účelu využijeme metodu kvantitativní analýzy textu, kterou představíme níže. Nejdříve ale čtenáře seznámíme se základním instrumentáriem molekulární biologie, které je nutné kvyložení našich závěrů. INSTRUMENTÁRIUM MOLEKULÁRNÍ BIOLOGIE Dědičná informace, obsahující instrukce kvýstavbě organismu ařízení jeho biologických pochodů, je fyzicky zapsána vkaždé buňce ve formě deoxyribonukleové kyseliny mající podobu dvoušroubovice aznámé pod zkratkou DNA. Způsob, jakým DNA uchovává informace, je založen na principu variací čtyř specifických makromolekul nukleových kyselin, konkrétně thyminu (T), guaninu (G), adeninu (A) acytosinu (C). Střídáním těchto tzv. bází dochází kzáznamu informace obdobně, jako když Morseova abeceda zaznamenává informace střídáním teček ačárek. Každá zbází má svůj chemicky afinitní (vzájemně vázaný vodíkovými vazbami) protějšek, thymin stojí vDNA vždy proti adeninu aguanin proti cytosinu. Lineární zápis bází DNA nám dovoluje celou DNA přečíst apřepsat formou textu, tj. zapsat zleva doprava, písmeno za písmenem (viz např. Cvrčková, 2006, s.17). Takový přepis je kopií řetězce bází zkoumané DNA. Tento postup je vpraxi nazýván OPEN ACCESS
VLADIMÍR MATLAcH — DAN FALTÝNEK 23 jako sekvenování (detailněji Berg— Tymoczko— Stryer, 2012, s.140–148). Sekvenováním je řetězec DNA zprostředkován ke zkoumání nejrůznějšími nástroji. Proces, kterým se zlineární sekvence DNA (tedy zurčitého textu) stane protein— reálný fyzický nástroj využitelný vorganismu—, označujeme jako proteosyntézu. Celý tento proces můžeme popsat vněkolika krocích (viz např. Alberts et al., 2008, s.329; Weaver, 2002, s.39): 1. Transkripce. Po naplnění specifi ckých podmínek uvnitř buňky se na začátek sekvence DNA (tzv. genu) připne protein RNA-polymeráza, který se po této sekvenci pohybuje vzadaném směru anukleotid po nukleotidu tuto sekvenci přepisuje. Výsledkem je tzv. transkript— samostatná „pracovní kopie“ DNA ve formě ribonukleové kyseliny RNA, která je určena kzamýšlenému použití vproteosyntéze. obrázek 1:Dvoušroubovice DNA sjejími dvěma rameny nesoucí jednotlivé báze. Aznačí adenin, Tthymin, G guanin, C cytosin. Dvoušroubovice DNA zaujímá strukturu vtzv. chromozomu (viz: <http://www. genome.gov/dmd/img.cfm?node=Photos/Graphics&id=85259>). obrázek 2:Transkripce. Přepis sekvence DNA na komplementární protějšky jejích bází RNA polymerázou, thymin je přepisován na uracil, zbylé báze na své komplementární protějšky (viz: <http://commons. wikimedia.org/wiki/File:DNA_transcription.svg>). OPEN ACCESS
24 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2016 2. Úprava transkriptu. Transkript může být dále upraven (například vystřihnutím částí, které jsou vsekvencích vloženy aslouží jiným účelům). Finální verze transkriptu, tzv. mRNA, je pak přemístěna kribozomu, kde je konstruován protein. 3. Translace. Ribozom čte mRNA lineárně po trojicích nukleotidů (tripletech). Každému tripletu mRNA je donesena pro něj specifi cká aminokyselina, která je připojena kpředchozí. Takto vytvořený aminokyselinový řetězec se při výstupu zribozomu začne na základě fyzikálních vlastností jednotlivých konstituentů afyzikálních vlastností molekul vprostředí (tedy na základě určitého kontextu) formovat, dokud nevytvoří stabilní konformaci (tvar) proteinu. Funkce avlastnosti proteinu jsou determinovány fyzikálními vlastnostmi jeho makromolekulární konformace (Twyman, 2004, s.103). obrázek 3:Translace. Proces vzniku aminokyselinového řetězce proteinu. Tripletům mRNA je na ribozomu přiřazována tRNA skomplementárním tripletem, která nese aminokyselinu. Takto přiřazené aminokyseliny tvoří řetězec budoucího proteinu (viz: <Boumphreyfr/Wikipedia>). Tripletům je aminokyselina přiřazena pomocí zprostředkujícího elementu — tzv.adaptorové molekuly tRNA. Adaptor tRNA získává svůj tvar při transkripci zDNA (Weaver, 2002, s.51). Funkcí této adaptorové molekuly je vázat na jedno ze svých vazebných míst specifi cký triplet ana své druhé vazebné místo konkrétní aminokyselinu. Vztah aminokyselin anukleotidů je tak zapsán přímo vDNA. Popsaný vztah byl nazván jako genetický kód (Weaver, 2002, s.12). Genetický kód je tvořen variacemi čtyř různých nukleotidů vkaždé pozici tripletu. Triplet může nabývat 43 (64) možných unikátních kombinací, které tak mohou kódovat 64 různých aminokyselin. Všemi šedesáti čtyřmi realizovanými triplety je kódováno dvacet různých aminokyselin (Alberts et al., 2008, s.367), mnoho tripletů kóduje stejnou aminokyselinu (kód je tzv. degenerovaný; viz obrázek 4). Některé triplety mají využití jako označení počátku akonce kódující sekvence. OPEN ACCESS
VLADIMÍR MATLAcH — DAN FALTÝNEK 25 obrázek 4:Genetický kód. Umístění bází vprvní, druhé atřetí pozici tripletu. Zkratky (Phe, Leu atd.) označují aminokyselinu kódovanou daným tripletem (viz: <www.genome.gov>). Pojmenování vztahu bází řazených vmRNA aaminokyselin jakožto genetického kódu se vztahuje kjednomu zklasických pojmů lingvistiky. Pojem kód vyjadřuje vztah dvou veličin daný určitým územ (Monod, 1970, s.159–160). Od pojmenování genetický kód se konzistentně odvíjí idalší názvosloví— kromě samotného kódování aminokyseliny tripletem (kodonem) je celý proces tvorby aminokyselinového řetězce podle nukleotidového vzoru při proteosyntéze pojmenován jako translace. Ta se staví do opozice vůči jednoduchému přepisu vzájemně chemicky afi nitních molekul při transkripci. LINGVISTICKÁ PARALELA Vinstrumentáriu jsme popsali strukturu DNA aproces proteosyntézy. Vsouvislosti stím jsme představili také tradiční molekulárněbiologickou terminologii. Tato terminologie často využívá lingvistických termínů (transkripce, translace, kód, text) nebo termínů založených na jazykové metafoře (zápis, čtení, zpráva, informace (neterminologicky)). Jakobson (1971) potvrzuje, že využití jazykové metafory vmolekulární biologii je korektní aže genetický kód má vlastnosti přirozeného jazyka. Analogizuje báze spísmeny (respektive fonémy), triplety se slovy ageny světami. Nachází OPEN ACCESS
26 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2016 imnohé další společné vlastnosti genetického kódu apřirozeného jazyka. Ji (1999, s.412) postupuje dále aanalogizuje širokou škálu vlastností genetického kódu apřirozeného jazyka: písmena snukleotidy aaminokyselinami, slova sgeny, řetězce slov se souborem společně exprimovaných genů. Dále ksobě vztahuje gramatiku afyzikální achemické zákony, fonetiku ařízení energetického toku, sémantiku agenově řízené procesy vbuňce. Vpřípadě obou kódů explicitně hovoří odvojí artikulaci. Ji vnalézání protějšků procesů vbuňce akonceptů popisujících přirozený jazyk představuje extrémní případ. Jeho přístup sugeruje, že libovolnému lingvistickému konceptu lze nalézt odpovídající proces či strukturu vbuňce. Trifonov (1988) popisuje soustavy kódů zajišťujících interakci DNA, RNA aproteinů, ujiných autorů můžeme nalézt další obdobné metafory (viz např. Barbieri, 2002; Collado-Vides, 1992; 1993; Markoš, 1997; 2002). Diskurz těchto znakových popisů procesů vbuňce je rozvíjen biosémiotikou, mladou vědní disciplínou. Problém současné biosémiotiky spočívá vtom, že výše zmíněné amnohé další znakové přístupy kbuňce jsou vzájemně nekonzistentní. Každý autor rozvíjí specifický přístup aneexistuje jednotná metoda, která by platnost těchto přístupů ověřovala. Na Jiho příkladu lze vidět, že analogizovat přirozený jazyk agenetický kód lze libovolně, přičemž posouzení korektnosti takových analogií není snadné. MOTIVACE Metafory aanalogie nám mohou poskytnout nadhled nad určitou problematikou. To je ale vkontextu jazykových metafor aanalogií DNA problematické. Nevíme, které ztěchto metafor jsou relevantní aužitečné akteré nikoliv. Popis procesů vbuňce využívá jazykovou metaforu aanalogii. Uvažování genetiků, bioinformatiků, makromolekulárních biologů, biochemiků adalších tak může být ovlivněno zavádějící metaforou. Zepistemologického hlediska by korekce těchto metafor měla pro jejich uživatele velký význam. Cílem tohoto článku je představit experimentální metodu, která by mohla ověření některých ze zmíněných metafor umožnit azároveň poskytnout vhled do struktury genetického kódu. METODIKA KVANTITATIVNÍ ANALÝZY DNA Pro analýzu nukleotidových sekvencí reprezentovaných zápisem vtextu jsou užívány různé lingvistické metody akvantitativní analytické přístupy. Představíme některé znich aukážeme, jak se vztahují knaší metodě analýzy struktury genetického kódu. Pokusíme se ovyužití těchto metod pro podložení nového designu genetického kódu. Mantegna et al. (1995; viz též Havlin et al., 1995) analyzovali projevy Zipfova zákona na kódující anekódující DNA. Kódující DNA dle Mantegni et al. Zipfův zákon vykazuje. Nekódující DNA projevy Zipfova zákona vykazuje také, ale pouze do určité míry. Mantegnova analýza byla motivována poznatkem, že pouze malá část (pro OPEN ACCESS
VLADIMÍR MATLAcH — DAN FALTÝNEK 27 homo sapiens uvažováno 5,33 %; Mantegna et al., 1995, s.2940) genomu je kódující, atedy nese informaci kvýstavbě proteinu (viz naše instrumentárium výše). Zbylá část genomu nemá takovou jasně zadanou funkci aod šedesátých let se pro ni zažil termín junk DNA. Nekódující DNA měla být vgenomu historicky neseným reliktem bez využití vorganismu (viz např. Watson— Berry, 2003, s.253; Palazzo — Gregory, 2014). Mantegna et al. (1995) ojunk DNA píše jako osilent DNA. Mantegna et al. (1995, s.2949) dále tvrdí, že se nekódující DNA podobá vněkterých vlastnostech přirozenému jazyku (viz též Niyogi— Berwick, 1995). Mantegna et al. (1995) mluví otom, že nekódující DNA nese určitý jazyk, zhlediska jeho redundance oproti kódující DNA dokonce bližší přirozeným jazykům (tím Mantegna et al. rozšířili analogie DNA apřirozeného jazyka, onichž hovoříme níže, aopět uplatnili jazykovou metaforu DNA). Tato zjištění Mantegnu et al. vedou khypotéze, že nekódující DNA má také funkci, kterou prozatím neregistrujeme anepopisujeme, atedy že nekódující DNA je nějakým způsobem použita pro uchování informací „biologických struktur“ (Mantegna et al., 1995, s.2949). Pozdější rozvoj molekulární biologie dal Mantegnově domněnce za pravdu (viz Alberts et al., 2008, s.31–42; The ENCODE Project Consortium, 2012, s.57). Potvrzení výskytu Zipfova zákona ukódující DNA odpovídalo tomu, že kódující řetězec nese informaci kvýstavbě funkčního tvaru proteinu, tj. určité struktury surčitou funkcí vorganismu. Analogicky ktomu se vtextech vpřirozeném jazyce projevuje Zipfův zákon zdůvodů naplňování určité funkce textu (to se můžeme pokusit vysvětlit např. vsouvislosti sinformační strukturou textu zajišťující přenos signálu prostředím avýrazovou aobsahovou strukturou asoudržností textu; viz Zipf, 1949, s.19–47). KMantegnově et al. analýze je ale nutné poznamenat následující: Ve své analýze Mantegna et al. využívají dlouhé řetězce nekódující DNA (delší než 50 tisíc bází). Nekódující DNA sice informaci nese, ale nese také množství reliktních řetězců bez využití (nekódují protein ani se nepodílejí na regulaci proteosyntézy). Projekt ENCODE (2012) odhaduje, že až 80 % nekódující DNA má funkční využití. Zbylých 20 % muselo Mantegnovu et al. analýzu ovlivnit, ato proto, že vjeho analyzované nekódující DNA musely být obsaženy složky regulace proteosyntézy ataké reliktní DNA (pro niž můžeme stále používat termín junk DNA akterá obsahuje mnoho repetitivních azinformačního hlediska redundantních sekvencí). Tato kontaminace by pak posilovala hodnocení nekódující DNA jako podobné přirozenému jazyku zhlediska redundance. Mantegna et al. byli při zacházení snekódující DNA postaveni před následující problém: koncept genetického kódu přisuzuje kódující DNA strukturní roli tripletů (viz vztah tripletů aaminokyselin popsaný výše). Nekódující DNA však takové striktní ohraničení apriori přisuzovat nelze, funkční roli zde mohou zastávat sekvence orůzné délce. Proto se pro kvantitativní analýzu kódující inekódující DNA rozhodli využít techniku tzv. n-gramů (tuto techniku využívají např. také Bolshoy et al., 2010, s.26). Představíme ji na ilustračním příkladu. Mějme následující řetězec ABCDEFGH. Tento řetězec segmentujeme na 3-gramy, jimiž jsou: ABC, BCD, CDE, DEF, EFG, FGH; 4-gramy mají podobu: ABCD, BCDE, CDEF, DEFG, EFGH. N-gramová analýza tedy segmentuje řetězec tak, že postupuje lineárně jednotku po jednotce adelimituje vždy vřetězci následující n-tici (n-gram). Vanalýze přirozených textů n-gramová segmentace postupuje bez registrace hranic slov či vět. OPEN ACCESS
28 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2016 Sekvence „Zipfův zákon“ je rozdělena na tyto 5-gramy hlásek: zipfů, ipfův, pfůvz, fůvzá, ůvzák atd. Při analýze kódující inekódující DNA jsou podobně zanedbány jakékoliv dříve stanovené hranice. N-gramový přístup tak dovoluje analyzovat řetězec nezávisle na jeho vnitřní strukturaci tím, že registruje jednotlivé sousedící prvky. Jednotlivé n-gramy představují vanalýze analogie slov, která nejsou vydělena mezerou, ale hranicí délky n-gramu (zipfů, ipfův, pfůvz atd. představují slova vstupující do analýzy). Tento přístup zvolili koběma typům DNA Mantegna et al. My tímto způsobem postupujeme také, ato ztoho důvodu, abychom se vyhnuli apriornímu určení hranic kódovaných složek řetězce (viz dále). Jednotky delimitované n-gramovou technikou budeme stejně jako Mantegna et al. analyzovat zhlediska projevů Zipfova zákona. Výsledky analýzy nás mají vést kpotvrzení aktuálního designu genetického kódu, nebo případně kjeho odmítnutí anásledné reformulaci. Je však nutné poznamenat, že využití Zipfova zákona vnaší analýze může být sporné. Kvantitativní charakteristiky textu, jako jsou projevy Zipfova zákona nebo n-gramové analýzy, mohou být jako důkaz ourčité vlastnosti či povaze tohoto textu (je kódující / nese informaci / nese instrukci; znaková funkce vgenetickém kódu) chápány jako nepřímé. Např. Konopka (1995) referuje ozávěrech Mantegnova týmu adoplňuje poznámky, které mohou být analogicky vztaženy iknašim závěrům. Vprvním případě vyvstává problém stím, že projevy Zipfova zákona jsou identifikovány na mnoha jevech, jako je trh, velikost měst nebo biologických populací atd. Zipfův zákon se pak jeví jako epifenomén jakéhokoliv systémového chování fyzikálních, sociálních, biologických apod. soustav. Zipfův zákon se tedy nemusí vztahovat ke kódujícím funkcím řetězce, ale naopak kjiným jevům jeho konstrukce. Vpřípadě řetězce bází by to mohla být jejich kombinatorika daná termostabilitou jednotlivých bází. Vpřípadě přirozených textů by se mohlo jednat např. ofonetické důvody kombinovatelnosti hlásek, které představují typ systematizace. Zipfův zákon byl dokonce napadán vobecném rozměru, ato na základě jeho projevů vnáhodných anenáhodných textech (Li, 1992). Diskuse vtéto oblasti zahrnuje problém generování náhodného vzorku ato, že mechanismus tvorby náhodného vzorku může produkovat projevy, které se zdůvodu ne zcela náhodného generování textu přiblíží Zipfovu zákonu— to by opět potvrzovalo domněnku, že Zipfův zákon je projevem libovolného systémového, auto/regulovaného chování. Stále je ale vnímán jako projev znakovosti, kódovosti či jazykovosti. Na základě něj se hodnotí např. dorozumívání zvířat nebo struktura textu pacientů spostižením způsobujícím jazykový deficit (Ferrer-i-Cancho, 2006; Ferrer-i-Cancho— McCowan, 2009; Ferrer-i-Cancho— Elvevåg, 2010). Ipřes veškeré zmíněné výhrady použijeme vnaší analýze Zipfův zákon, navážeme tak na kvantitativnělingvistický diskurz ověřování kódové povahy DNA, jako je tomu uMantegni et al. adalších. Ktématu Zipfova zákona aDNA viz Tsonis, Elsner aPanagiotis (1997). ZIPFŮV ZÁKON NA PŘIROZENÝCH TEXTECH Zipfův zákon formuluje následující vztah: vezmeme-li určitý text aseřadíme-li počty výskytů (neboli frekvence) jeho entit (např. slov) od nejvyšší po nejnižší, pak poOPEN ACCESS
VLADIMÍR MATLAcH — DAN FALTÝNEK 35 průběhů grafů roli písmen, sedmice bází (tedy více než 2 triplety) již tvoří obdobný typ konstituentu jako čtveřice až pětice písmen— tj. tvoří obdobu slov. Vezměme první implikaci, která říká, že báze jsou jednotkou konstitučně nižší než písmena. Ztéto implikace vyplývá otázka, jakou roli hrají báze vgenetickém kódu, analogizujeme-li jej spřirozeným jazykem apředpokládáme-li obdobný design obou kódů. Písmena zcela intuitivně vnímáme jako nedělitelná. Tvořena jsou ovšem na základě vzájemných vztahů, které diferencují jedno písmeno od druhého. Každé písmeno je pak tvořeno souborem vlastností, který jej charakterizuje azároveň odlišuje od ostatních. Lingvistika tyto vlastnosti nazývá distinktivními rysy. Písmena textu tak můžeme chápat jako soubory distinktivních rysů. Stouto rovinou jsme při analýze přirozeného jazyka prozatím nepracovali. Pro zavedení roviny distinktivních rysů do analýzy postupujeme následujícím způsobem: každé zpísmen charakterizujeme jeho vlastnostmi (distinktivními rysy), které jej odlišují od ostatních. Neužili jsme tradičně lingvistikou popisované distinktivní rysy ve smyslu akustických vlastností hlásek, kterých je ve fonologických popisech více než deset. Použili jsme nejmenší možný počet kpísmenům arbitrárně přiřazených distinktivních rysů schopných odlišovat písmena češtiny. Pro českou abecedu je takových opozic nutných pouze šest. Vtextu je každé písmeno reprezentováno unikátním řetězcem šesti pozic obsazených jedničkou nebo nulou (tedy přítomných nebo nepřítomných vlastností arbitrárních distinktivních rysů). Takto nově reprezentovaný text zmapujeme aporovnáme svýsledky mapování mRNA. Výsledek mapování distinktivních rysů českého textu (viz obrázek 12) nám odhaluje typy průběhů, které se projevily u1-gramů a2-gramů bází DNA (obrázek 11). Umapování písmen podobné průběhy nenacházíme. Průběhům 1-gramů až 5-gramů distinktivních rysů písmen českého textu ovšem odpovídají průběhy grafů 1-gramů a2-gramů bází. Udistinktivních rysů je zdůvodu jejich počtu mezi průběhy pozvolnější přechod. Průběhu grafu 6-gramů distinktivních rysů odpovídá průběh 3-gramů obrázek 12:Mapování distinktivních rysů českého textu. 0 200000 400000 600000 800000 1000000 1200000 1400000 1600000 1800000 2000000 1 10 100 1000 Rank*Frekvence=k Rank 1g 2g 3g 4g 5g 6g 7g 8g OPEN ACCESS
36 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2016 bází. Ztoho můžeme usuzovat, že báze mají vdesignu genetického kódu obdobnou roli jako distinktivní rysy písmen vdesignu přirozeného jazyka. ZÁVĚR Na základě aplikace Zipfova zákona na n-gramy bází DNA, písmena textu přirozeného jazyka ana distinktivní rysy písmen textu přirozeného jazyka můžeme usuzovat, že nukleotidové báze DNA plní vdesignu genetického kódu roli analogickou distinktivním rysům písmen textu přirozeného jazyka. Triplety bází jsou dále analogické písmenům. Kombinace tripletů jsou následně analogií slov. Naším cílem bylo ověření analogie DNA apřirozeného jazyka. Jakobson formuloval analogii bází DNA apísmen, tripletů aslov, genů avět. Naše analýzy tento design genetického kódu zpochybňují aukazují analogii bází DNA sdistinktivními rysy, tripletů spísmeny akombinací tripletů se slovy. Všeobecně užívaná analogie bází jakožto písmen genetického textu se tak jeví jako chybná. Reprezentace genetického zápisu sledem písmen odpovídajících bázím (A, C, G, T) zřejmě zapříčinila pevné ukotvení této analogie ve vědecké praxi avlaickém pojímání genetického kódu. Naše výsledky však jasně ukazují, že tato analogie je vzhledem kdesignu přirozeného jazyka nesprávná aže „báze nejsou písmena“. LITERATURA: Alberts, Bruce— Johnson, Alexander— Lewis, Julian— Raff, Martin— Keith, Roberts— Walter, Peter (2008): Molecular Biology of the Cell [5. vydání]. New York, NY: Garland Science. Barbieri, Marcello (2002): The Organic Codes: An Introduction to Semantic Biology. Cambridge: Cambridge University Press. Berg, Jeremy M.— Tymoczko, John L.— Stryer, Lubert (2012): Biochemistry. New York, NY: W. H. Freeman. Bolshoy, Alexander— Volkovich, Zeev (Vladimir)— Kirzhner, Valery— Barzily, Zeev (2010): Genome Clustering from Linguistic Models to Classification of Genetic Texts. Berlin— Heidelberg: Springer. Collado-Vides, Julio (1992): Grammatical model of the regulation of gene expression. Proceedings of the National Academy of Sciences of the United States of America, 89(20), s.9405–9409. Collado-Vides, Julio (1993): Alinguistic representation of the regulation of transcription initiation. I. An ordered array of complex symbols with distinctive features. BioSystems, 29(2–3), s.87–104. Crick, Francis H. C. (1962): Towards the genetic code. Discovery, 22, s.8–16. Crick, Francis H. C. (1964): On the genetic code: Nobel lecture, December 11, 1962. In: Nobel Lectures: Physiology or Medicine: 1942–1962. Singapore— New Jersey, NJ— London— Hongkong: World Scientific, s.811–821. Crick, Francis H. C. (1967): The Croonian Lecture, 1966: the genetic code. Proceedings of the Royal Society of London B: Biological Sciences, 167(1009), s.331–347. Crick, Francis H. C. (1968): The origin of the genetic code. Journal of Molecular Biology, 38, s.367–379. Cvrčková, Fatima (2006): Úvod do praktické bioinformatiky. Praha: Academia. Faltýnek, Dan (2012): Sémiotické primitivy vkonstrukci gramatik: Testování gramatik jazyka aDNA. Olomouc: Univerzita Palackého vOlomouci. OPEN ACCESS
VLADIMÍR MATLAcH — DAN FALTÝNEK 37 Ferrer-i-Cancho, Ramon (2006): When language breaks into pieces: aconflict between communication through isolated signals and language. BioSystems, 84(3), s.242–253. Ferrer-i-Cancho, Ramon— Elvevåg, Brita (2010): Random texts do not exhibit the real Zipf’slaw-like rank distribution. PLoS ONE [online], 5(3). Cit. 8. 1. 2016. Dostupné zWWW: <http://journals.plos.org/plosone/ article?id=10.1371/journal.pone.0009411>. Ferrer-i-Cancho, Ramon— McCowan, Brenda (2009): Alaw of word meaning in dolphin whistle types. Entropy [online], 11(4), s.688–701. Cit. 8. 1. 2016. Dostupné zWWW: <http://www.mdpi.com/10994300/11/4/688>. Hartl, Daniel L.— Ruvolo, Maryellen (2013): Genetics: Analysis of Genes and Genomes [8.vydání]. Burlington, MA: Jones and Bartlett Learning. Havlin, Shlomo— Buldyrev, Sergey V.— Goldberger, Ary L.— Mantegna, Rosario N.— Peng, Chung-Kang— Simons, Michael— Stanley, H. Eugene (1995): Statistical and linguistic features of DNA sequences. Fractals, 3(2), s.269–284. Jakobson, Roman (1971): Linguistics in relation to other sciences. In: Roman Jakobson, Selected Writings: Vol. 2: Word and Language. The Hague— Paris: Mouton, s.655–696. Ji, Sungchul (1997): Isomorphism between cell and human languages: molecular biological, bioinformatic and linguistic implications. BioSystems, 44(1), s.17–39. Ji, Sungchul (1999): The linguistics of DNA: words, sentences, grammar, phonetics, and semantics. Annals of the New York Academy of Science, 870, s.411–417. Ji, Sungchul (2006): The proteome as an autonomous molecular language: “proteinese”; APoster accepted for presentation at the DIMACS Workshop on Sequences, Structure and Systems Approaches to Predict Protein Function, Rutgers University, Piscataway, NJ. Katz, Gregory (2008): The hypothesis of agenetic protolanguage: an epistemological investigation. Biosemiotics, 1(1), s.57–73. Konopka, Andrzej K. (1995): Noncoding DNA, Zipf’slaw, and language. Science, 268(5212), s.789. Li, Wentian (1992): Random texts exhibit Zipf’slaw-like word frequency distribution. IEEE Transactions on Information Theory, 38(6), s.1842–1845. Mantegna, Rosario N.— Buldyrev, Sergey V.— Goldberger, Ary L.— Havlin, Shlomo— Peng, Chung-Kang— Simons, Michael— Stanley, H. Eugene (1994): Linguistic features of noncoding sequences. Physical Review Letters, 73(23), s.3169–3172. Mantegna, Rosario N.— Buldyrev, SergeyV.— Goldberger, Ary L.— Havlin, Shlomo— Peng, Chung-Kang— Simons, Michael— Stanley, H. Eugene (1995): Systematic analysis of coding and noncoding DNA sequences using methods of statistical linguistics. Physical Review: E,Statistical Physics, Plasmas, Fluids, and Related Interdisciplinary Topics, 52(3), s.2939–2950. Markoš, Anton (1997): Povstání živého tvaru. Praha: Vesmír. Markoš, Anton (2002): Readers of the Book of Life: Contextualizing Developmental Evolutionary Biology. New York, NY: Oxford University Press. Markoš, Anton— Faltýnek, Dan (2011): Language metaphors of life. Biosemiotics, 4(2), s.171–200. Monod, Jacques (1970): Le hasard et la nécessité: Essai sur la philosophie naturelle de la biologie moderne. Paris: Éditions du Seuil. Niyogi, Partha— Berwick, Robert C. (1995): Anote on Zipf’slaw, natural languages, and noncoding DNA regions [online]. A. I. Memo, (1530) / C.B.C.L. Paper, (118). Cit. 8. 1. 2016. Dostupné zWWW: <ftp://publications.ai.mit. edu/ai-publications/pdf/AIM-1530.pdf>. Palazzo, Alexander F.— Gregory, T. Ryan (2014): The case for junk DNA. PLoS Genetics, 10(5). Popov, O. S.— Segal, Daniel M.— Trifonov, Edward N. (1996): Linguistic complexity of protein sequences as compared to texts of human languages. BioSystems, 38(1), s.65–74. OPEN ACCESS
38 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2016 Raible, Wolfgang (2001): Linguistics and genetics: systematic parallels. In: Martin Haspelmath— Ekkehard König— Wulf Oesterreicher— Wolfgang Raible (eds.), Language Typology and Language Universals: An International Handbook / Sprachtypologie und sprachliche Universalien: Ein internationales Handbuch / La typologie des langues et les universaux linguistiques: Manuel international. Berlin— New York, NY: Walter De Gruyter, s.103–123. Searls, David B. (2002): The language of genes. Nature, 420, s.211–217. Stanford, Augustus L. (1975): Foundations of Biophysics. New York, NY: Academic Press. The ENCODE Project Consortium (2012). An integrated encyclopedia of DNA elements in the human genome. Nature, 489, s.57–74. The european bioinformatics institute (EMBL-EBI) (2014). Cit. 19. 10. 2014. Dostupné zWWW: <http://www.ebi.ac.uk/ ena/data/warehouse/search?query=tax_ eq(9606)&domain=coding&result=coding_ release&display=fasta&download=zip>. Trifonov, Edward N. (1988): Codes of nucleotide sequences. Mathematical Biosciences, 90(1–2), s.507–517. Tsonis, Anastasios A.— Elsner, James B.— Panagiotis, A. Tsonis (1997): Is DNA alanguage? Journal of Theoretical Biology, 184(1), s.25–29. Twyman, Richard M. (1998): Advanced Molecular Biology: AConcise Reference. New York, NY— Abingdon: Taylor and Francis. Twyman, Richard M. (2004): Principles of Proteomics. Abingdon— New York, NY: Garland Science / BIOS Scientific Publishers. Watson, James D.— Berry, Andrew (2003): DNA: The Secret of Life. New York, NY: Alfred A. Knopf. Weaver, Robert F. (2002): Molecular Biology. Boston, MA: McGraw-Hill. Zipf, George Kingsley (1949): Human Behavior and the Principle of Least Effort: An Introduction to Human Ecology. Cambridge, MA: Addison- -Wesley Press. Vladimír Matlach | Katedra obecné lingvistiky FF UP <
[email protected]> Dan Faltýnek | Katedra obecné lingvistiky FF UP <
[email protected]> OPEN ACCESS