Výzkum falšování hlasové identity na FFUK v rámci projektu START
Abstract
109
Full text
VÝZKUM FALŠOVÁNÍ HLASOVÉ IDENTITY NAFFUK VRÁMCI PROJEKTU START Tomáš Nechanský — Alžběta růžičková Program START je programem, jenž si dal za cíl podpořit vědeckou činnost doktorandů studujících na Univerzitě Karlově. Patří do operačního programu Výzkum, vývoj avzdělávání, projekty jsou realizovány od začátku dubna roku 2021 do konce března 2023. Z274 podaných žádostí bylo podpořeno 97 týmů celkovou částkou téměř čtvrt miliardy korun. Upřednostňovány byly týmy skládající se zvíce řešitelů, respektive zjednoho hlavního řešitele adalších vedlejších řešitelů. Zaměření projektu se nesmělo překrývat stématem disertační práce žádného zčlenů projektového týmu. Aby informace osložení byly kompletní, je třeba dodat, že nad každým týmem stojí takzvaný mentor, jehož úlohou je poskytovat jednotlivým členům podporu nejen voblasti výzkumu. Kromě řešení hlavního tématu celého projektu se studenti zavázali kplnění takzvaných vzdělávacích cílů, které se dělí na dva typy— formální aneformální. Mezi neformální řadíme zlepšení měkkých dovedností jako například jazykové či manažerské dovednosti. Splnění formálního cíle přísluší zejména hlavnímu řešiteli aspočívá vzahraniční stáži trvající alespoň tří měsíce avabsolvování kurzu zaměřeného například na rozvoj profesních dovedností. Hlavním řešitelem projektu, oněmž bude řeč níže, je Tomáš Nechanský. Vedlejšími řešiteli jsou Alžběta Růžičková aVojtěch Skořepa. Mentorem celého týmu je ředitel Fonetického ústavu Filozofické fakulty Univerzity Karlovy, Radek Skarnitzl. Jelikož všichni řešitelé studují na zmíněném pracovišti ajejich hlavním zájmem je forenzní fonetika, vtématu projektu se jejich zaměření odrazilo. Název projektu zní Falšování hlasové identity: fonetická analýza aidentifikace mluvčích. Nicméně ještě než přistoupíme kdetailnějšímu popisu zmíněného projektu, věnujeme pár odstavců tomu, co vůbec falšování hlasové identity apotažmo forenzní fonetika je. Forenzní fonetika je relativně mladá disciplína, jejíž oficiální počátek je datován na začátek 90.let minulého století, ikdyž do jisté míry bychom úkony forenzního fonetika mohli spatřit vprocesech důkazních šetření iodesetiletí dříve. Jedním zhlavních cílů fonetického experta je vyjádřit poměr pravděpodobností (zangl. likelihood ratio, LR) mezi následujícími hypotézami: „jak pravděpodobné je, že podobnosti aodlišnosti pozorované ve sporné nahrávce (získané například ztelefonního odposlechu) ave srovnávací nahrávce (např.zvýslechu policie) mohou pocházet od téhož mluvčího“ a„jak pravděpodobné je, že bychom tyto podobnosti aodlišnosti pozorovali ujiného mluvčího ze stejné populace“. Při dnešních technických možnostech by se to mohlo jevit jako jednoduchý úkol, avšak analýza lidského hlasu neprobíhá stejně jako analýza otisku prstu nebo DNA, ukterých se jedná buď oshodu, či neshodu. Hlas nemůžeme považovat za biometrický údaj srovnatelný spapilárními liniemi či strukturou DNA. Pachatel také svou DNA nebo otisk prstu těžko zfalšuje. Ačkoliv falšování hlasové identity, jinak také maskování hlasu, uosob páchajících trestnou činnost není obecně příliš častým jevem— vrámci všech případů zahrnujících identifikaci mluvčího jde OPEN ACCESS
110 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2021 ojednotky až nižší desítky procent (Masthoff, 1996; Braun, 2006)— uurčitých typů trestné činnosti se tento jev vyskytuje poměrně hojně, zejména vpřípadech únosů, vydírání, sexuálního obtěžování afalešných telefonických oznámení (Künzel, 2000). Vpřípadech, kdy pachatel během páchání trestného činu promlouvá azároveň může předpokládat, že je jeho projev nahráván, je výskyt maskování hlasu velmi častý: mezi případy, jimiž se zabýval německý Spolkový kriminální úřad vletech 1988–1995, dosáhl jeho poměr 52 %, vůbec nejvyššího podílu pak dosáhl výskyt maskování hlasu vpřípadech vydírání, ato 69 % (Masthoff, 1996). Jedná se tedy ojev, který není pouze okrajový akterému je zapotřebí věnovat pozornost. Za nejefektivnější způsob falšování hlasové identity lze považovat automatické maskování hlasu, které může identifikaci mluvčího izcela znemožnit (Künzel, 2000; Clark & Foulkes, 2007) ajehož četnost vposlední době narůstá společně se zvyšující se kvalitou idostupností nástrojů, které kněmu lze využít (Amino et al., 2017). Zcelkového množství případů maskování hlasu ve forenzní praxi však elektronické maskování představuje menšinu (Gfroerer, 1994, citováno vEriksson, 2010; Masthoff, 1996; novější údaje bohužel nejsou kdispozici). Ačkoliv se výjimečně můžou objevit ipoměrně sofistikované maskovací strategie, většina mluvčích přistupuje ke změně pouze jednoho, případně dvou parametrů (Masthoff, 1996). Nejčastěji se při maskování hlasu mluvčí uchylují ke změnám základní frekvence, prostřednictvím kterých lze poměrně jednoduše dosáhnout percepčně velmi výrazné modifikace hlasu. Výrazné změny základní frekvence mohou být spojeny ise změnou typu fonace: při jejím zvyšování lze přejít až do falzetu, naopak při jejím snižování lze dosáhnout třepené fonace (Künzel, 2000). Mimo modifikace hlasivkového nastavení se mezi maskovacími strategiemi objevují také změny rezonančních charakteristik vokálního traktu, ato jednak prostřednictvím změn artikulačního nastavení, např.palatalizace, labializace, faryngalizace či změny nazality (Laver, 1980; Skarnitzl, 2016), ajednak pomocí umístění cizího předmětu do úst nebo před ústa (Figueiredo & Britto, 1996; Künzel, 2000). Vedle modifikací jednotlivých parametrů se mezi strategie maskování hlasu řadí také imitace regionálního dialektu (Markham, 1999) či cizineckého přízvuku ( Neuhauser & Simpson, 2007; Neuhauser, 2008), případně iřečových charakteristik určitého mluvčího (Růžičková & Skarnitzl, 2017). Tyto strategie obvykle zahrnují změny více parametrů zároveň, např.základní frekvence, artikulačního nastavení, temporálních charakteristik atd. Napodobení dialektu zpravidla působí přirozenějším dojmem než např.maskování hlasu pomocí cizího předmětu vústech, proto může vtakových případech být obtížné rozpoznat, že se jedná omaskovaný projev (Markham, 1999)— irozeznání, že daný mluvčí nehovoří svým přirozeným hlasem, je přitom zásadní pro jeho fonetickou identifikaci. Iimitace cizineckého přízvuku zní mnohdy velmi autenticky aidentifikaci mluvčího tedy může výrazně zkomplikovat (Neuhauser & Simpson, 2007). Mapování strategií maskování hlasu se věnovala také studie provedená učeských mluvčích (Růžičková & Skarnitzl, 2017). 100 mluvčích obecné češtiny mužského pohlaví bylo instruováno, aby libovolným způsobem maskovali svůj řečový projev tak, aby znemožnili svou identifikaci podle hlasu. Následná podrobná poslechová analýza ukázala, že většina znich uplatnila změnu výšky hlasu, ato nejčastěji zvýšení (41 %), OPEN ACCESS
TOMáš NECHANSKý — ALžBěTA růžIČKOVá 111 unižšího počtu mluvčích se pak objevilo její snížení (29 %), 4 mluvčí zvolili šepot, při němž je základní hlasová frekvence nepřítomná avýšku hlasu proto nelze posuzovat. Pouze u26 mluvčích ze 100 při maskování hlasu nedošlo ke slyšitelným změnám výšky hlasu. Druhým nejčastěji měněným parametrem byla změna typu fonace, jednalo se zejména otřepenou atlačenou fonaci (obojí u13 % mluvčích), vjednom případě se dokonce objevila ingresivní tvorba hlasu. Vyskytly se také změny nazality: 11 mluvčích hovořilo hypernazalizovaně, zatímco 2 si ucpali nos ajejich hlas tak byl naopak denazalizovaný. V10 případech se objevil posun artikulace vokálů. 6 mluvčích napodobovalo řečové vady a3 mluvčí imitovali cizinecký přízvuk (ve zkoumaném materiálu se naopak neobjevila imitace regionálního dialektu), jeden mluvčí přikročil kimitaci řečového projevu jiné osoby, konkrétně Miloše Zemana. Vpoměrně málo případech došlo ke změně tempa řeči; u11 mluvčích se objevilo jeho snížení, u3 naopak zvýšení. Ve většině případů docházelo ke kombinacím modifikací více parametrů, 31 mluvčích však zvolilo modifikaci pouze jednoho znich (většinou výšky hlasu) a3 mluvčí dokonce nedosáhli žádné slyšitelné změny svého řečového projevu. Ať už se daný jedinec rozhodne pro jakoukoliv strategii, ukazuje se, že maskování hlasu má tendenci kpostupné deklinaci, ato zejména vpřípadě, že mluvčí uskuteční více maskovaných projevů vprůběhu času. Vněkterých případech může nakonec maskování hlasu izcela vymizet (Künzel, 2000). Hlavním cílem projektu Falšování hlasové identity: fonetická analýza aidentifikace mluvčích je poskytnout komplexní pohled na možné způsoby, jak mluvčí záměrně modifikují svůj hlas, anásledně vyhodnotit, jaké to má dopady na fonetickou identifikaci mluvčího. Zkoumat budeme tři hlavní oblasti— cizinecký přízvuk, individuální strategie maskování hlasu aprofesionální imitaci mluvčího. Pro tyto účely nám poslouží pět různorodých databází. První znich je databáze obecné češtiny, ve které 100 mluvčích nejdříve produkovalo spontánní řeč, apoté četlo text „svým“ hlasem ahlasem modifikovaným dle svého uvážení (srov.Růžičková & Skarnitzl, 2017); druhou je česko-anglická databáze, vníž opět 100 mluvčích četlo český aanglický text; třetí znich je česko-ruská databáze, jejímž cílem bylo nahrát české mluvčí imitující ruský přízvuk aporovnat jejich imitaci sruskými mluvčími češtiny; čtvrtá databáze obsahuje profesionální hlasové imitátory (vtuto chvíli je zaznamenaný hlas Petra Jablonského, který imituje například Miloše Zemana); akonečně poslední databáze sestává znahrávek českých fonetiků, kteří opakovaně čtou jeden text srůzným hlasovým nastavením (například palatalizovaně či se zavřenou čelistí). Jelikož naším cílem je poskytnout komplexní pohled na falšování hlasové identity, je potřeba nasbíraný materiál taktéž komplexně zkoumat. Při fonetické identifikaci mluvčího expert využívá dvou hlavních přístupů kanalýze řečových vzorků— poslechový (kdy percepčně, tedy za pomoci svého sluchu, analyticky porovnává určité složky hlasu, jakými jsou například výška abarva hlasu či řečové vady, azaměřuje se na celkový, holistický dojem) aakustický (kdy vpočítačových fonetických programech analyzuje řečové parametry, tedy akustické koreláty zmíněných percepčních charakteristik, jako například základní frekvence, formanty či trvání). Trochu stranou stojí automatické rozpoznávání mluvčího (angl. automatic speaker recognition, ASR), což je ve své podstatě taktéž akustický přístup, který využívá složitých algoritmů aještě donedávna navozoval dojem „magické skříňky“. Nicméně OPEN ACCESS
112 STUDIE ZAPLIKOVANÉ LINGVISTIKY 2/2021 srozvíjejícími se technologiemi apřibývajícími studiemi je zřejmé, že právě ASR je budoucností videntifikaci mluvčího. Na vstupu stojí sporné asrovnávací nahrávky, na výstupu (pokud je kdispozici populace pro srovnání) poměr pravděpodobností (LR, viz výše). Tyto tři hlavní přístupy odráží metody, které jsme zvolili pro analýzu našeho materiálu, atak jednotlivé nahrávky budeme porovnávat akusticky, percepčně iautomaticky. Co se týče manuálních akustických metod, analyzovat budeme zejména základní frekvenci adlouhodobé formantové distribuce (průměr formantových hodnot zcelé nahrávky nehledě na segment, ze kterého pocházejí). Automatický přístup zastane program VOCALISE (Oxford Wave Research, 2019), který využívá takzvaných i-vektorů afaktorových analýz. Konečně percepční přístup bude spočívat ve vytvoření pěti percepčních testů (každý bude náplní odpovídat jedné zdatabází), jež budou distribuovány vždy mezi 50 respondentů. Abychom imitovali poslechový přístup jak zhlediska expertů (například soudních znalců), tak zhlediska laiků (například obětí či svědků), posluchače plánujeme najímat zřad fonetiků imimo ně. Celkem tedy cílíme na 250 administrovaných testů. Jen pro úplnost dodáme, že respondentům bude jejich účast kompenzována finanční odměnou. Jak vyplývá zvýše zmíněného, porovnáme, jak úspěšné videntifikaci mluvčího budou jednotlivé přístupy. Předčí percepční holistický přístup ten automatický či manuálně-akustický? Jsou určité strategie maskování hlasu efektivnější než jiné? Bude pro posluchače obtížné identifikovat ty hlasové vzorky, které byly problematické ipro akustické metody? Závěrem zmíníme čtyři plánované projektové výstupy. Prvním výstupem, ke kterému jsme se zavázali, je příspěvek na forenzně-fonetické konferenci IAFPA (International Association for Forensic Phonetics and Acoustics), která proběhne vPraze vlétě roku 2022. Vzhledem kčasové posloupnosti plnění jednotlivých projektových aktivit předpokládáme, že na této konferenci budeme prezentovat pouze předběžné výsledky. Hlavními výstupy jsou potom tři články, které budou nabídnuty odborným, převážně impaktovaným periodikům vtuzemsku izahraničí. Jednotlivé články budou odrážet oblasti zmíněné výše. První bude informovat, zdali jsou vybrané metody schopny identifikovat mluvčího, pokud imituje či produkuje cizinecký přízvuk; druhý se zaměří na to, zdali jsou akustické aposlechové metody schopny od sebe odlišit záměrně maskované hlasy od nemaskovaných, či zdali se vůbec ofalšování hlasu jedná (ado jaké míry je přirozené); atřetí se zaměří na to, jestli jsou naše metody schopné od sebe odlišit skutečné hlasy známých osobností od imitací nahraných profesionálními hlasovými imitátory. Na závěr chceme podotknout, že vzhledem kšíři pojímaného tématu bychom rádi naše poznatky využili ipo skončení projektového období. Ipřestože se nejedná ooficiální výstup projektu, je naším záměrem vydat monografii shrnující celou problematiku do jednoho celku avnávaznosti na náš výzkum podporovat studenty bakalářských amagisterských programů vdalším výzkumu falšování hlasové identity. OPEN ACCESS
TOMáš NECHANSKý — ALžBěTA růžIČKOVá 113 BIBLIOGRAFIE Amino, K., Makinae, H., & Kamada, T. (2018). Auditory discrimination of natural speech and synthetic speech used as voice disguise. Acoustical Science and Technology, 39(1), 48–50. https://doi.org/10.1250/ast.39.48 Braun, A. (2006). Stimmverstellung und Stimmenimitation in der forensischen Sprechererkennung. In T.Kopfermann (Ed.), Das Phänomen Stimme: Imitation und Identität (pp. 177–181). St.Ingbert. Clark, J., & Foulkes, P. (2007). Identification of voices in electronically disguised speech. Speech, Language and the Law, 14, 195–221. https://doi.org/10.1558/ijsll.v14i2.195 Eriksson, A. (2010). The disguised voice: Imitating accents or speech styles and impersonating individuals. In C.Llamas & D.Watt (Eds.), Language and Identities (pp.86–96). Edinburgh University Press. Figueiredo, R.M., & Britto, H.S. (1996). Areport on the acoustic effects of one type of disguise. International Journal of Speech, Language and the Law, 3(1), 168–175. https://doi.org/10.1558/ ijsll.v3i1.168 Künzel, H.J. (2000). Effects of voice disguise on speaking fundamental frequency. International Journal of Speech, Language and the Law, 7(2), 149–179. https://doi.org/10.1558/ sll.2000.7.2.149 Laver, J. (1980). The Phonetic Description of Voice Quality. Cambridge University Press. Masthoff, H. (1996). Areport on avoice disguise experiment. International Journal of Speech Language and the Law, 3(1), 160–167. https:// doi.org/10.1558/ijsll.v3i1.160 Markham, D. (1999). Listeners and disguised voices: The imitation and perception of dialectal accent. International Journal of Speech, Language and the Law, 6(2), 289–299. https:// doi.org/10.1558/sll.1999.6.2.289 Neuhauser, S. (2008). Voice disguise using aforeign accent: Phonetic and linguistic variation. The International Journal of Speech, Language and the Law, 15(2), 131–159. https:// doi.org/10.1558/ijsll.v15i2.131 Neuhauser, S., & Simpson, A.P. (2007). Phonetic correlates of accent authenticity in voice disguise. Proceedings of IAFPA 2007. Oxford Wave Research (2019). iVOCALISE 2019A. Available from https://oxfordwaveresearch. com/products/vocalise/. Růžičková, A., & Skarnitzl, R. (2017). Voice disguise strategies in Czech male speakers. AUC PHILOLOGICA, 2017(3), 19–34. https://doi. org/10.14712/24646830.2017.30 Skarnitzl, R. (2016). Co dokáže náš hlas? Foneticky pohled na variabilitu řečové produkce. Slovo asmysl, 26, 95–113. Tomáš Nechanský | Fonetický ústav FF UK <[email protected]> Alžběta Růžičková | Fonetický ústav FF UK <[email protected]> OPEN ACCESS