This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
Preparing document pages…
Page 1
NATALIIA DARCHUK
Národní univerzita Tarase Ševčenka v Kyjevě
ORCID id: orcid.org/0000-0001-8932-9301
Oblasti výzkumu: počítačová lingvistika, korpusová lingvistika, kvantitativní lingvistika, gramatika a sémantika ukrajinského jazyka.
OKSANA ZUBAN
Národní univerzita Tarase Ševčenka v Kyjevě
ORCID id: orcid.org/0000-0002-2644-3892
Oblasti výzkumu: počítačová lingvistika, lingvistická expertiza, kvantitativní lingvistika, gramatika a sémantika ukrajinského jazyka.
VALENTYNA ROBEIKO
Národní univerzita Tarase Ševčenka v Kyjevě
ORCID id: orcid.org/0000-0003-2266-7650
Oblasti výzkumu: analýza, rozpoznávání a syntéza řeči, fonetika, zpracování přirozeného jazyka.
YULIIA TSYHVINTSEVA
Národní univerzita Tarase Ševčenka v Kyjevě, Ústav ukrajinského jazyka Národní akademie věd Ukrajiny
ORCID id: orcid.org/0000-0002-9684-3840
Oblasti výzkumu: ukrajinská neologie, lexikologie a lexikografie.
VICTOR SOROKIN
Národní univerzita Tarase Ševčenka v Kyjevě
ORCID id: orcid.org/0000-0002-3637-0535
Oblasti výzkumu: automatická syntaktická analýza, automatická sémantická analýza, zpracování přirozeného jazyka.
Tento článek představuje strukturu, algoritmy, implementaci a experimentální výsledky automatického systému TextAttributor, který autoři článku vyvinuli pro statistickou parametrizaci textů v ukrajinském jazyce pomocí multiparametrické soustavy statistických indexů charakterizujících autorův textový styl a využitelných při úlohách atribuce autorství. Na základě vytvořených lingvistických zdrojů a softwaru systém generuje lingvistickou analýzu založenou na vypočtených statistických indexech a provádí srovnávací analýzu dvou textů. Dalším kritériem statistického indexování je index toxicity textu, vypočítávaný metodou verbální identifikace toxického sentimentu. Úlohy detekce autorství a toxicity se řeší dvěma metodami: statistickými výpočty založenými na slovníku a pravidlech a strojovým učením. Aktuální zjištění implementovaná v beta verzi systému TextAttributor jsou podrobně zkoumána.
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
A N O T A C I J A
Tento článek představuje strukturu, algoritmy, implementaci a experimentální výsledky automatického systému „TextAttributor“, který autoři článku vytvořili pro statistickou parametrizaci textů v ukrajinském jazyce pomocí multiparametrické soustavy statistických ukazatelů charakterizujících autorův textový styl a využitelných při úlohách atribuce autorství. Na základě vytvořených lingvistických zdrojů a softwaru systém generuje lingvistickou analýzu podle vypočtených statistických indexů a provádí srovnávací analýzu dvou textů. Dalším kritériem statistického indexování je index toxicity textu, vypočítávaný metodou verbální identifikace toxického sentimentu. Úlohy určování autorství a toxicity se řeší dvěma metodami: statistickými výpočty založenými na slovníku a pravidlech a strojovým učením. Aktuální výsledky získané pomocí beta verze systému „TextAttributor“ jsou podrobně zkoumány.
Textologický výzkum získal nový vědecký význam s rozvojem metod počítačové lingvistiky, které přispěly ke vzniku nového směru, jenž lze označit jako digitální textologie. V rámci této vznikající disciplíny chápeme digitální textologii jako využití automatizovaných technik korpusové lingvistiky ve spojení s matematickými modely pro kvantitativní analýzu textu. Na základě aktuálních úkolů moderní kvantitativní lingvistiky a zpracování přirozeného jazyka náš tým vyvinul systém pro automatickou lingvisticko-statistickou analýzu mediálních textů, který byl implementován jako webová aplikace s názvem TextAttributor (TextAttributor 1.0 2024). Systém plní čtyři úkoly: 1) statistickou parametrizaci textu; 2) stylometrii: určování lingvisticko-statistických rysů idiolektu; 3) atribuci: určování míry podobnosti mezi texty; a 4) analýzu sentimentu: identifikaci lexika negativního sentimentu v textech. Kromě toho systém automaticky generuje dva lingvistické odborné posudky založené na výsledcích druhého a čtvrtého úkolu. Multifunkčnost systému TextAttributor vyžaduje, aby se uživatelé seznámili s jeho provozními principy. Cílem tohoto článku je seznámit akademickou a vzdělávací filologickou obec s metodikou tvorby systému, jeho architekturou a výsledky jeho fungování, aby bylo zajištěno jasné pochopení jeho funkcí a analytických možností, které jsou mimořádně relevantní. Tento přístup je zvláště relevantní pro analýzu velkých objemů internetové komunikace a
zlepšování strategií informační obrany během probíhající rusko-ukrajinské války. Koncepce vytvoření automatického systému atribuce textů v ukrajinském jazyce vznikla na základě analýzy výzkumu v oblasti ukrajinské korpusové lingvistiky (Darčuk 2013) a statistických studií autorova stylu (Darčuk et al. 2021; Darchuk, Sorokin 2022; Zuban 2019), které autoři projektu prováděli pomocí nástrojů Korpusu ukrajinského jazyka (KUM).
Při vývoji systému TextAttributor byly použity tyto metody: komponentová analýza, distribuční analýza a obsahová analýza. Obsahová analýza, kvantitativní a kvalitativní metoda získávání informací z textu, využívala zpracování přirozeného jazyka a statistické techniky. Byly použity také kvantizace a analýza sentimentu. Analýza sentimentu automaticky identifikuje tonalitu textu na základě jeho emočního zabarvení i autorova hodnocení událostí nebo objektů, čehož bylo dosaženo pomocí statistických výpočtů založených na slovníku a pravidlech.
Kromě toho byly začleněny metody strojového učení včetně hlubokého učení. Statistická struktura textu chápaná jako jeho kvantitativní model umožňuje identifikovat jeho funkční styl, autorství a dobu vzniku. V této práci byly složky statistické struktury získány analýzou lexikálních a gramatických statistických rysů pomocí indexačních technik a metrik eukleidovské vzdálenosti. Eukleidovská vzdálenost, která měří vzdálenost mezi dvěma body v n-rozměrném eukleidovském prostoru, je jednou z nejčastěji používaných metrik v lingvostatistice pro shlukovou analýzu ve stylometrii a atribuci autorství.
Novost výsledků spočívá v první implementaci automatizovaného morfosyntakticko-sémantického stylometrického modelu pro analýzu textu v počítačové lingvistice, založeného na 15 statistických indexech, které primárně parametrizují morfologickou, jakož i syntaktickou a sémantickou strukturu textu. Stylometrický model je soubor statistických parametrů textu (lexikálních, morfologických, syntaktických aj.), na jejichž základě se provádí srovnávací analýza tohoto textu se stylometrickým modelem funkčního stylu. Podle našeho názoru je při použití statických metod při konstrukci stylometrického modelu možné získat přísný, deterministický a vědecky podložený systém společných a odlišných rysů stylů, žánrů apod. Stylometrický model poprvé zavádí parametr indexu toxicity, který charakteristicky vymezuje mediální texty během rusko-ukrajinské války. Tento model je implementován nejen ve funkci statistické parametrizace textů, která je pro systémy tohoto typu typická, ale také ve funkci porovnávání analyzovaného textu s mediálním stylem ukrajinského jazyka a pro stylometrické a atribuční úlohy zahrnující dva nebo více textů. Teoretický význam spočívá v ověření dvou metod určování toxicity textu a
226
Acta Linguistica Lithuanica XCI
Page 5
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
autorství v ukrajinštině: 1) prostřednictvím přístupů založených na slovníku a pravidlech a 2) pomocí strojového učení včetně hlubokého učení.
2. SOUVISEJÍCÍ PRÁCE
V moderní ukrajinské lingvistice byly provedeny významné lingvisticko-statistické studie idiolektů ukrajinských spisovatelů a básníků, včetně Tarase Ševčenka, Lesji Ukrajinky, Vasyla Stuse (Zuban’ 2019), Ivana Franka (Buk 2021), Romana Ivanyčuka (Lototska 2022), Valerije Ševčuka (Volos, Levchenko 2023), Marii Matios, Jurije Andruchovyče, Oksany Zabužko (Karasov, Levchenko 2024), Ivana Drače, Mykoly Vingranovského (Darchuk et al. 2024), Liny Kostenkové (Zuban’ 2019; Darchuk et al. 2024) a dalších. Tyto studie byly provedeny na reprezentativních vzorcích textů (dlouhých textech) s využitím převážně jednoho nebo několika (nejvýše pěti) statistických parametrů, často bez použití stylometrického srovnání. Vzhledem k pracnosti provádění lingvisticko-statistických experimentů ukrajinská lingvistika navíc do značné míry opomíjela komplexní statistickou parametrizaci, porovnávání analyzovaných textů se standardními statistickými parametry funkčních stylů, určování míry podobnosti textů i stylometrickou a atribuční analýzu krátkých textů. Použití systému TextAttributor v lingvisticko-statistickém výzkumu zaměřeném na automatické provádění těchto úkolů poskytne nejen frekvenční charakteristiky jazykových jevů, ale umožní také efektivní stylometrickou analýzu vedoucí k odbornému posudku.
Systém TextAttributor má ve srovnání se svými protějšky ve světové vědě řadu výhod. Většina existujících systémů a modelů se rovněž zaměřuje na využití jednotlivých lingvisticko-statistických modulů k identifikaci jednoho nebo několika, většinou formálních (n-gramy, nejfrekventovanější slova, písmena), textových parametrů (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). Naproti tomu TextAttributor 1.0 nabízí komplexní přístup zahrnující interaktivní statistickou analýzu lexikální, morfologické, syntaktické a sémantické struktury textu v reálném čase v rámci 15 parametrů.
Atribuce textů se v zahraniční textologii aktivně rozvíjí, zejména Burrowsova metoda (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014), jejíž účinnost je ověřována v mnoha studiích velkých objemů textových dat různých stylů, například: anglické prózy z počátku 20th. století (Hoover 2004); moderní anglické poezie (Hoover 2005); básnických děl v latině (Rybicki, Eder 2011); prozaických děl hlavních žánrů v angličtině, francouzštině, italštině, němčině, polštině, maďarštině, jakož i v latině a arabštině (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015); politických textů v angličtině, včetně
atribuce projevů amerických prezidentů (Savoy 2015). Další automatizovaná metoda lingvistické analýzy nazvaná „Linguistic Inquiry and Word Count“ (LIWC) je implementována jako komerční aplikace a adaptována pro několik jazyků (Meier et al. 2019; LIWC-22).
V posledních letech se při úlohách automatické atribuce textu používají převážně buď stylometrické metody založené na pravidlech, nebo metody hlubokého učení (Eder 2015; Canhasi et al. 2022). Obě metody byly implementovány v systému TextAttributor; fungují efektivně, avšak poskytují odlišné výsledky: 1) Metoda založená na pravidlech umožňuje automatizovat tvorbu lingvistických závěrů o idiolektu a toxicitě textu; 2) Metoda strojového učení určuje pouze míru toxicity a podobnosti textů a lze ji použít při klasifikačních úlohách monitorování textového obsahu.
Současné metody strojového učení pro analýzu sentimentu a identifikaci autorství textu jsou založeny na statistických přístupech (TF-IDF, Latent Dirichlet Allocation) a technikách hlubokého učení s různými architekturami (CNN, LSTM, BERT) v kombinaci se stylometrickými metodami (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). Uváděné výsledky jsou silně závislé na počtu tříd (typech toxicity, autorech), žánru, délce textu a především na objemu řádně anotovaného textového korpusu použitého pro trénování. V úlohách detekce toxicity a nenávistných projevů tak vysoká míra přesnosti přesahuje 90% při použití korpusu obsahujícího desítky tisíc dokumentů (Alkomah, Ma 2022). Například u atribuce autorství anglickojazyčných literárních děl napříč 1000 autory bylo dosaženo přesnosti vyšší než 90% při použití korpusu 6000 dokumentů pro 15 autorů. U korpusů obsahujících méně než 1500 dokumentů je naopak uváděná přesnost přibližně 70% (Khan et al. 2023). Pro ukrajinský jazyk jsou identifikace autorství textu a analýza sentimentu/toxicity nedostatečně prozkoumanými problémy (Lupei et al. 2020); navíc takové systémy nevytvářejí lingvistickou expertizu a nelze je použít jako nástroje lingvistického výzkumu.
3. OBECNÉ CHARAKTERISTIKY PROVOZU SYSTÉMU TEXTATTRIBUTOR
Během vývoje systému TextAttributor byly splněny tyto úkoly: 1) teoretická lingvistika: byla vypracována metodika formalizované morfologické, statistické, stylometrické, atribuční a sentimentové analýzy; 2) softwarové inženýrství: byla vytvořena struktura lingvistických databází a software pro uvedené automatické analýzy; 3) experimentální lingvistika: systém byl testován na ukrajinských mediálních textech a
228
Acta Linguistica Lithuanica XCI
Page 7
Systém pro automatickou stylometrickou analýzu ukrajinských mediálních textů TextAttributor 1.0 (metody, prostředky, funkcionalita)
byl implementován analytický modul pro automatické stylometrické zkoumání. Automatizovaný lingvistický systém implementovaný jako webová aplikace zpracovává uživatelem zadané texty mediálního stylu a generuje číselné hodnoty statistických parametrů charakterizujících vlastnosti textu. Systém postupuje podle strukturované sekvence operací:
1. Tokenizace textu: Rozdělení textu na věty a slova pro účely analýzy.
2. Morfologické označování: Přiřazování značek slovům na základě jejich gramatických tvarů.
3. Kontextová analýza: Aktualizace morfologických značek s ohledem na kontext.
4. Syntaktická analýza: Stanovení binárních vztahů mezi slovy ve větách za účelem porozumění jejich gramatické struktuře.
5. Stanovení syntaktických vztahů: Určení syntaktických vazeb na základě předem definovaných pravidel.
6. Vyhledávání emocionálně negativní slovní zásoby: Identifikace slov z předem definované množiny negativní slovní zásoby.
7. Vyhodnocení statistických parametrů: Posouzení statistických parametrů vstupního textu pomocí automaticky sestavených frekvenčních slovníků.
8. Vizualizace výsledků: Grafické znázornění výsledků statistické parametrizace s empirickými hodnotami a intervaly spolehlivosti.
9. Srovnání výsledků: Vizualizace výsledků statistické parametrizace dvou textů mediálního stylu, která usnadňuje jejich porovnání.
10. Vyhodnocení eukleidovské vzdálenosti: Kvantifikace odlišnosti dvou textů mediálního stylu.
11. Generování odborného posudku: Vytvoření dvou odborných posudků: jednoho o atribuci textu a druhého o toxicitě textu na základě lingvistického zkoumání.
12. Detekce toxicity a identifikace autorství: Využití technik strojového učení, zejména modelů neuronových sítí, k detekci toxicity a identifikaci autorů.
Výsledky systému jsou uspořádány do následujících oddílů: Skupina indexů atribuce textu, Odborný posudek atribuce textu, Srovnání atribuce textu, Lingvistická expertiza toxicity textu a Posudky neuronové sítě.
V Skupině indexů atribuce textu (obr. 1) jsou statistické parametry uspořádány podle vstupního textu: sloupec 1 zobrazuje název indexu, sloupec 2 uvádí empirickou číselnou hodnotu a sloupec 3 poskytuje vizuální referenci porovnáním empirické hodnoty indexu s intervalem spolehlivosti
prahovými hodnotami (dolní a horní), odvozenými z textů ukrajinského mediálního stylu. Empirická číselná hodnota je na stupnici znázorněna vyplněným obráceným trojúhelníkem.
OBRÁZEK 1: Ukázka výsledku atribuce textu
V Odborném posudku atribuce textu (obr. 2) uvádíme závěry týkající se typických nebo individuálních lingvisticko-statistických rysů získaných z analyzovaného textu pro každý odhadovaný index. Tyto závěry vycházejí z odpovědí na otázku: Spadá číselná hodnota indexu do intervalu spolehlivosti mediálního stylu ukrajinského jazyka? Na základě porovnání číselných hodnot s prahovými hodnotami intervalu spolehlivosti systém generuje tři možné odpovědi (typické znaky mediálního stylu, znaky idiostylu nižší než běžný mediální styl a znaky idiostylu vyšší než běžný mediální styl).
V Srovnání atribuce textu (obr. 4, pododdíl 4.2) se po výběru možnosti „Vypočítat vektorovou vzdálenost“ tabulková data okamžitě aktualizují takto: Sloupec 1 uvádí uživatelem zadané texty spolu s dříve analyzovaným textem; sloupec 2 zobrazuje počet vět v každém textu; sloupec 3 uvádí počet slov; sloupec 4 zobrazuje eukleidovskou vzdálenost mezi analyzovaným textem a každým textem v tabulce; sloupec 5 označený „Porovnat“ spouští automatické porovnání statistických indexů mezi analyzovaným textem a vybraným textem. Po aktivaci příslušného prvku „Porovnat“ se ve skupině „Indexy atribuce textu“ (obr. 3) zobrazí komplexní informace o statistickém srovnání dvou textů.
230
Acta Linguistica Lithuanica XCI
Page 9
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
V Lingvistické expertize toxicity textu (pododdíl 4.3) je uvedena lexikálně-sémantická interpretace vypočteného indexu toxicity (obr. 6).
V Posudcích neuronové sítě uvádíme výstup našeho modelu hlubokého učení, který kvantifikuje toxicitu textu na stupnici od 0 (netoxický) do 1 (vysoká toxicita). Posuzujeme také podobnost textu se známými autory, přičemž hodnoty se pohybují od 0 (žádná podobnost) do 1 (vysoká podobnost) na základě autorů, na jejichž textech byl model natrénován. Výsledky se zobrazují pouze u testů s mírou podobnosti vyšší než 0,1. Náš současný systém pracuje v demonstračním režimu a k posouzení podobnosti s textem zadaným uživatelem využívá omezený korpus autorských textů.
4. ATRIBUCE TEXTŮ V UKRAJINSKÉM JAZYCE: EXPERIMENTY, VÝSLEDKY A DISKUSE
4.1. Indexy statistické parametrizace
Vyvinutý stylometrický model řeší dva úkoly: 1) identifikaci individuálních rysů autorova stylu (stylometrii); 2) posouzení podobnosti dvou textů na základě lingvistických a statistických parametrů (atribuci).
Ke statistické analýze textu zadaného uživatelem se využívá 19 parametrů (viz obr. 1, Skupina indexů atribuce textu). První čtyři parametry zahrnují základní kvantitativní údaje: počet slov, nezpracovaná slova, velikost slovníku a počet vět. Počet slov nezahrnuje slovní zásobu, kterou systém nezpracoval, například dialektismy, moskovitismy, okazionalismy apod. Zbývajících 15 parametrů tvoří vypočitatelné indexy poskytující skalární hodnoty.
Pro stylometrickou analýzu ověříme hypotézu 1. Tato hypotéza tvrdí, že analýzou empirických údajů zahrnujících statistické parametry uvnitř i mimo interval spolehlivosti ukrajinského mediálního stylu lze v daném mediálním textu rozpoznat jedinečné autorské rysy. Pro každý lingvistický parametr byly na základě vzorků ukrajinských mediálních textů vypočteny dva soubory intervalů spolehlivosti: jeden pro texty delší než 1000 slov (velikost vzorku: 124,576 slov) a druhý pro texty do 1000 slov (velikost vzorku: 15,635 slov).
Interval spolehlivosti pro každý statistický parametr byl stanoven pomocí směrodatné odchylky, σ, průměrné číselné hodnoty indexu (ANVI) ve vzorku textů, vyjádřené jako ANVI ± σ. Směrodatná odchylka odhaduje, do jaké míry se empirické číselné hodnoty statistických indexů mohou odchylovat od průměrné číselné hodnoty indexu v rámci mediálního stylu. Pro zajištění přesnosti byl interval spolehlivosti pro σ určen lingvisticko-statistickým experimentem. Systém proto při testování hypotézy 1 nabízí tři možné závěry: 1) číselná hodnota indexu spadá do intervalu spolehlivosti; 2) číselná hodnota indexu je pod dolní hranicí intervalu; nebo 3) číselná hodnota indexu přesahuje horní hranici intervalu.
Uvažujme výsledky získané parametrizací textu 1, jehož autorem je bloger Oleksii Honcharenko (viz obr. 1). Tato analýza vychází ze statistických parametrů a jejich následné interpretace zachycené ve vygenerovaném odborném posudku, jak je znázorněno na obr. 2.
Statistické ukazatele týkající se slovní zásoby a objemu textu odhalují kvantitativní vztah. V textu 1 se všechny tyto ukazatele nacházejí v typickém rozmezí mediálního stylu:
1) Index rozmanitosti (IB) představuje poměr jedinečných slov k celkovému rozsahu textu a slouží jako měřítko lexikální bohatosti. Hodnota IB 0.54 spadá do rozmezí 30%–60%, což ukazuje na střední úroveň lexikální rozmanitosti;
2) Index výlučnosti textu (IVT) vyjadřuje poměr počtu hapax legomenon vyskytujících se v textu jednou k objemu textu. Hodnota IVT 0.36 spadá do rozmezí 20%–40%, což ukazuje na nízkou lexikální výlučnost);
232
Acta Linguistica Lithuanica XCI
Page 11
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
3) Index výlučnosti slovní zásoby (IVL) vyjadřuje poměr počtu hapax legomenon vyskytujících se v textu pouze jednou k celkovému rozsahu slovní zásoby. Hodnota IVL 0.66 spadá do rozmezí 60%–76%, což ukazuje na vysoký stupeň lexikální výlučnosti.
Dále zvažme statistické parametry kvantitativní korelace lexikálních a gramatických slovních tříd v textu 1:
1) Index nominálních atributů neboli epithetizace (IIO) vyjadřuje poměr počtu podstatných jmen k počtu přídavných jmen. IIO 1,07 je vyšší než norma mediálního stylu 1,0, což ukazuje na převahu podstatných jmen nad přídavnými jmény a vede k menšímu počtu epitet v textu;
2) Index slovesných atributů (IDO) vyjadřuje poměr počtu příslovcí k počtu sloves. IDO 0,57 je vyšší než norma mediálního stylu 0,56. Tento poměr příslovcí ukazuje na nízký stupeň slovesných atributů v textu;
3) Stupeň nominalizace (STN) vyjadřuje poměr počtu podstatných jmen k počtu sloves. STN 1,76 je nižší než norma mediálního stylu 3,00. Pokles tohoto indexu ukazuje na převahu sloves nad podstatnými jmény a nízký stupeň nominalizace textu;
4) Index pronominalizace (IPRO) vyjadřuje poměr počtu osobních zájmen k objemu použitých slov v textu. IPRO 0,09 je vyšší než norma mediálního stylu a je znakem idiostylu. Osobní zájmena tvoří více než 7% textu, což ukazuje na míru jeho koherence;
5) Index modality (MOD) vyjadřuje poměr počtu částic k počtu slov v textu. IMOD 0,07 je vyšší než norma mediálního stylu 4% a je znakem idiostylu. Částice tvoří více než 4% textu, což určuje míru, v níž autor v textu vyjadřuje různá hodnocení jevů a situací;
6) Index substantivnosti (ISUB) vyjadřuje poměr počtu podstatných jmen k objemu použitých slov v textu. ISUB 0,26 je nižší než norma mediálního stylu. Podstatná jména tvoří méně než 30% textu, což určuje nízký stupeň statičnosti textu.
Vysvětleme statistické parametry kvantitativního poměru frází a vět v Textu 1:
1) Index dynamismu (IDYN) vyjadřuje poměr počtu slovesných frází k počtu jmenných frází. IDYN 0,74 je vyšší než norma mediálního stylu 0,6 a je znakem idiostylu. Převaha slovesných frází nad jmennými frázemi (IDYN větší než 1,0) určuje dynamické a rychlé rozvíjení událostí ve významu textu;
2) Index koherence (IZV) vyjadřuje poměr počtu předložek a spojek k počtu vět v textu. IZV 0,66 spadá do typického rozmezí 0,45 až 0,90 pro mediální styl, což ukazuje na převahu počtu vět nad počtem předložek a spojek. To určuje průměrnou míru koherence mezi skutečnostmi, jevy a situacemi popsanými v Textu 1.
Zvláštní pozornost bude věnována psycholingvistickým statistickým parametrům (Chuhunov 2009) v Textu 1:
1) Tragerův koeficient (KT) vyjadřuje poměr počtu sloves k počtu přídavných jmen v textu a ukazuje emoční stabilitu/nestabilitu mluvčího. KT 0,61 je vyšší než norma mediálního stylu 0,5 a je znakem idiostylu. Podle psychologické interpretace to ukazuje na nízkou emocionalitu autora/mluvčího, nerozhodnost při přijímání aktivních praktických opatření a úzkost. Hodnota v rozmezí 1,35 ± 0,05 určuje normální emoční stabilitu a regulaci u autora;
2) Koeficient jistoty jednání (KOD) vyjadřuje poměr počtu sloves k počtu podstatných jmen v textu. Tento poměr ukazuje míru socializace autora a syntaktickou úplnost výpovědi. KOD 0,57 spadá do typického rozmezí 0,30 až 0,60 pro mediální styl, což ukazuje na nízký stupeň koeficientu objektivizovaného jednání. Podle psychologické interpretace to naznačuje nízkou emocionalitu autora/mluvčího, nerozhodnost ohledně aktivního praktického jednání a úzkost. Hodnota v rozmezí 1,35 ± 0,05 určuje normální emoční stabilitu a regulaci emocí autorem, což na základě jazykových rysů ukazuje na normální stupeň syntaktické úplnosti vět a správnou syntaktickou strukturu;
3) Koeficient agresivity (KA) vyjadřuje poměr počtu sloves a užití sloves k celkovému počtu slov v textu, což v psycholingvistickém aspektu označuje agresivitu jazyka. KA 0,15 je vyšší než norma mediálního stylu 13% a je znakem idiostylu. Podle psychologické interpretace hodnoty pod 60% ukazují na nízký stupeň agresivity, potlačené emoce autora a jeho nerozhodnost. Přiblížení k 60% určuje normální stupeň agresivity a emoční stabilitu autora, zatímco hodnoty nad 60% ukazují na vysokou agresivitu autora a emoční vzrušení.
Nakonec zvažme sémantický statistický parametr Textu 1: Index toxicity textu (ITOX) se vypočítává z frekvence negativní slovní zásoby v textu (podrobněji viz oddíl 4.3). Hodnota ITOX 0,36 spadá do typického rozmezí 0,1 až 0,7 pro mediální styl. ITOX formuje kognitivní a pragmatické postoje k negativním emocím.
234
Acta Linguistica Lithuanica XCI
Page 13
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
4.2. Porovnávání textů podle statistických parametrů
Úloha posouzení míry podobnosti mezi dvěma texty zahrnovala testování Hypotézy 2. Tato hypotéza tvrdí, že pokud empirická data získaná statistickou parametrizací dvou textů vykazují pouze malý rozdíl v číselných hodnotách indexů, pak tyto texty náležejí témuž autorovi. Tato hypotéza se v systému testuje dvěma způsoby: 1) porovnáním číselných hodnot jednotlivých indexů ve dvou textech; 2) určením vektorové vzdálenosti mezi dvěma texty. Tyto úlohy jsou implementovány v části Porovnání atribuce textů. První úloha zahrnuje porovnání empirických údajů textů pomocí indexů na škále intervalu spolehlivosti mediálního stylu (Fig. 3). Jak je znázorněno na Fig. 3, kvantitativní charakteristiky parametrů obou textů jsou pro pohodlí uživatele zobrazeny různými barvami. Vizualizace porovnává empirické hodnoty indexů obou textů s prahy intervalu spolehlivosti (dolním a horním) odvozenými z textů ukrajinského mediálního stylu.
FIGURE 3: Porovnání vektorové vzdálenosti textů
Druhou úlohou je výpočet vektorové vzdálenosti mezi dvěma texty pomocí vzorce pro Eukleidovskou vzdálenost. To zahrnuje sečtení druhých mocnin rozdílů mezi číselnými hodnotami 15 statistických parametrů obou textů. Poté se vypočítá druhá odmocnina tohoto součtu. Číselné hodnoty
vektorové vzdálenosti ukazují míru statistické odlišnosti mezi texty a poskytují míru vzdálenosti mezi nimi. Ačkoli kolísání hodnoty vektorové vzdálenosti u mediálních textů není dobře známo, při porovnání totožných textů může být vzdálenost 0. To znamená, že texty jsou odlišné, pokud je vektorová vzdálenost větší než 0. Čím vyšší je číselná hodnota vektorové vzdálenosti, tím větší jsou lingvistické a statistické rozdíly mezi texty. Porovnání Eukleidovské vzdálenosti je prezentováno v tabulkové podobě. Ve sloupci 4 Fig. 4 představují číselné hodnoty Eukleidovské vzdálenosti. Fig. 4 zobrazuje porovnání analyzovaného textu Oleksije Hončarenka (Text 1) se třemi dalšími texty téhož autora: řádek 1 pro Text 2 (vzdálenost 0,44); řádek 2 pro Text 3 (vzdálenost 0,56); řádek 3 pro Text 4 (vzdálenost 0,77). Empirická data ukazují, že podobnost textů jediného autora zůstává v rozmezí 1, zatímco texty jiných autorů (řádky 4–10) vykazují vzdálenosti větší než 1.
FIGURE 4. Systematizace Eukleidovské vzdálenosti mezi texty
Porovnání statistických parametrů textů nás přesvědčuje, že navržená metodika atribuce odhaluje stylometrický model ukrajinskojazyčných textů. Tento model lze také použít k určení autorství textu. Potvrdíme to vizuální prezentací atribuce 7 textů tří různých autorů podle 15 statistických parametrů pomocí metody Uniform Manifold Approximation and Projection (McInnes et al. 2020), jejíž algoritmus je rovněž implementován v systému TextAttributor. To
236
Acta Linguistica Lithuanica XCI
Page 15
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
metoda umožňuje snížit dimenzionalitu prostoru příznaků projekcí 15rozměrného prostoru do roviny. Na Fig. 5 odpovídají body různých tvarů (P1–P7 pro autora 1, F1–F7 pro autora 2, M1–M7 pro autora 3) 7 náhodně vybraným textům různých autorů.
Jak vidíme, po snížení dimenzionality lze zobrazení bodů textů tří autorů viditelně oddělit do odlišných oblastí. Tento příklad potvrzuje, že parametry definované systémem TextAttributor jsou důležité pro popis stylistických rysů textů a určování autorství textu (dokonce i v redukované podobě).
FIGURE 5: Grafické znázornění atribuce textu pomocí metody UMAP
4.3. Indexování negativního sentimentu textu
Při vývoji systému statistických parametrů k určování stylu a autorství textu jsme rozpoznali, že toxicita textu může sloužit jako atribuční index. Proto jsme v TextAttributoru vytvořili samostatný modul k automatickému určování indexu toxicity.
Dnes se informační složka stala obzvláště důležitou v hybridní válce. Materiálem našeho výzkumu proto byl výzkumný korpus online mediálních textů politického diskurzu o rozsahu 10 milionů slov. Termín „toxický text“ používáme v širokém smyslu. Tyto texty se vyznačují obtěžováním, hrozbami, obscénností, kyberšikanou, trollingem a nenávistnými texty založenými na identitě a obsahují emotikony, tedy jevy a objekty, které v člověku vyvolávají negativní emoce (např. válka, letecký poplach, korupce).
Cílem tohoto projektu bylo určit potenciál realizace negativního sentimentu v ukrajinských textech a vyvinout automatizovaný systém pro identifikaci toxického obsahu. Tato úloha zahrnovala dva po sobě jdoucí dílčí úkoly: nejprve vytvoření systému lingvistického zkoumání toxických textů s určením indexů toxicity pomocí slovníkové analýzy a metod založených na pravidlech; dále vytvoření trénovací datové sady pro účely strojového učení a vývoj neuronové sítě pro predikci indexů toxicity textu.
Podívejme se na splnění prvního úkolu. Ten zahrnoval vytvoření lexikografické databáze obsahující tři různé slovníky:
1) Slovník emotiogenů: Soubor 5000 slov (podle významů lexikálně-sémantických variant) s tóny negativního sentimentu, hodnocenými na škále −2. Příklady zahrnují nemorální, beztrestnost, úplatkářství a krást;
2) Slovník nenávistných projevů: Obsahuje 3000 slov, včetně názvů osob (1620), obscénních výrazů (613) a urážlivého jazyka (787). Příklady zahrnují zápaďák (западенець: hanlivé označení lidí ze západních oblastí Ukrajiny) a podvodník;
3) Toxické fráze: Soubor 1500 idiomatických výrazů vyjadřujících negativní emoce. Příklady zahrnují šklebí se jako opice, líbá si zadek a otevírá ústa.
Každá položka v těchto seznamech byla anotována sémantickými rysy, přičemž Slovník nenávistných projevů měl 18 rysů a seznam toxických frází 26. Například slova ve Slovníku nenávistných projevů byla označena charakteristikami jako „s“ pro sexismus, „r“ pro rasismus a „e“ pro ageismus. Tato lexikografická databáze, multiparametrický systém, přiřazuje jednotkám (slovům nebo frázím) sémantické rysy, které v kombinaci s frekvenčními údaji z analyzovaného textu umožňují analýzu toxicity.
Index toxicity textu se vypočítává podle vzorce:
Itox = (e + |K| (m + t)) / n * 10,
Zde n označuje objem textu; e je počet emočních slov; m je počet slov nenávistných projevů; t je počet toxických frází; K je koeficient roven −2, který zdůrazňuje slova nenávistných projevů a toxické fráze, jež na škále
238
Acta Linguistica Lithuanica XCI
Page 17
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
pěti číslic (+2, +1, 0, −1, −2) odpovídají −2. Hodnoty indexu se pohybují od 0 do +1.
Například index toxicity textu „Lidé s červeným perem (Люди з червоною ручкою)“ (12 vět, 129 slov) činí 1,01, což ukazuje na jeho vysokou toxicitu, protože prahová hodnota pro takto krátké texty se pohybuje od 0,1 do 0,7. Systém současně generuje výsledky automatizovaného lingvistického zkoumání toxicity textu (viz Fig. 6), které zahrnuje: 1) statistickou mapu sémantických tříd negativní slovní zásoby podle klasifikačních markerů lexikografických seznamů (emotiogeny – 5, vulgarismy – 2, sexismus – 2); 2) text s konkrétními slovy negativního sentimentu, která verbalizují kategorie statistické mapy. Podívejme se na úryvek analyzovaného skutečného textu (Fig. 6):
ti lidé, kteří chodí s červeným perem a opravují chyby v cizích příspěvcích: kdo vůbec jste? Máte ponětí, jak otravní jste? Schválně studuji vaše profily, zajímá mě svět, ve kterém existujete. Tento svět děsí mě velmi. Upřímně doufám, že se v reálném životě za žádných okolností nepotkáme. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересічемося ні за яких обставин).
Zde systém automaticky tučně zvýrazňuje následující slova s negativní složkou: chyby (помилки), cizích (чужих), otravní (бісите), děsí (лякає).
FIGURE 6: Fragment automatizovaného lingvistického zkoumání toxicity textu
5. PŘÍSTUPY STROJOVÉHO UČENÍ: EXPERIMENTY, VÝSLEDKY A DISKUSE
Zaměřme se na druhý provozní režim systému TextAttributor věnovaný technikám strojového učení. Na vstupu pro trénování modelu máme textové korpusy označené podle cíle každého dílčího úkolu: (a) textové informace pro detekci toxicity a (b) identifikaci autorství. Každý korpus je rozdělen na trénovací a kontrolní soubory a u dostatečně velkého korpusu také na validační soubor. Parametry zvoleného modelu řešení problému se odhadují na trénovací množině. Hyperparametry modelu se upravují pomocí validační množiny. Konečné ukazatele výkonnosti modelu se měří na kontrolní množině s ohledem na dostupnost výpočetních zdrojů nezbytných pro provoz modelu. Korpus pro každý dílčí úkol byl vytvořen souběžně s komponentou strojového učení TextAttributoru, takže současné modely byly natrénovány na relativně malých datech zahrnujících krátké internetové texty ukrajinskojazyčných blogů, komentářů, článků atd.
5.1. Detekce toxicity
Na základě série experimentálních studií byla zvolena výpočetně efektivní architektura založená na metodě fastText a jejích nástrojích (Joulin et al. 2016). Tato metoda poskytuje vektory slov a odhaduje rozdělení pravděpodobnosti dokumentů podle předem definovaných tříd. Slova jsou reprezentována vektorovou formou na základě automatického rozdělení slov na části (subslova), což simuluje otevřenost slovníku. Reprezentace subslovy je důležitá, protože ukrajinština je vysoce flektivní a je třeba pokrýt velké množství neznámých slov i slov s pravopisnými chybami. Účinnost použitého přístupu je rovněž určena technickými podmínkami provozu systému a dostupnými textovými zdroji pro trénování modelu.
Pro binární klasifikaci k detekci toxického obsahu byl použit připravený korpus přibližně 12 000 textových dokumentů. Nejlepšího výsledku podle zobecněné metriky (F1 = 79,4%) bylo dosaženo s následujícím nastavením hyperparametrů: dimenze vektoru slov 56, počáteční rychlost učení 0,15, 500 trénovacích epoch, lexikální kontext reprezentovaný bigramy, délky subslov v rozmezí 2 až 5 znaků a rozhodovací práh 0,4. Model navíc prokázal senzitivitu 85% při dosažení přesnosti přibližně 70%.
240
Acta Linguistica Lithuanica XCI
Page 19
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
5.2. Identifikace autorství
Experimentální výzkum modelů pro identifikaci autorství textů byl proveden s využitím části korpusu veřejně dostupných sociálně-politických textů, u nichž lze identifikovat osobu autora dokumentu. Celkem bylo vybráno 702 textů od čtyř autorů, kteří publikovali největší počet dokumentů o délce 60 až 1000 znaků. Největší počet publikací autora činí 304 (115 tisíc znaků) a nejmenší 109 (49 tisíc znaků). Pro testování bylo náhodně vybráno 25 textů pro každého zvoleného autora. Zbývající dokumenty tvořily trénovací množinu.
Nejlepšího výsledku podle zobecněné metriky (F1 = 81%) bylo dosaženo s následujícími hodnotami hyperparametrů: dimenze prostoru vkládání slov 50, počáteční rychlost učení 0,1, 50 trénovacích epoch, lexikální kontext reprezentovaný bigramy, délky subslov v rozmezí 2 až 5 znaků a rozhodovací práh 0,5. Pozoruhodné je, že u některých konfigurací modelu dosáhla senzitivita vůči autorovi s největším počtem dokumentů v datové sadě 100% při přesnosti přesahující 90%. Tyto výsledky ukazují proveditelnost vývoje účinného systému schopného přesně pokrýt texty autorů, kteří jsou v trénovací množině dostatečně zastoupeni.
Natrénované modely neuronových sítí byly integrovány do systému TextAttributor v architektuře „klient-server“, kde jsou prezentovány výsledky dvou úloh: (a) určení toxicity a (b) detekce autorství. Výsledek práce systému s textem „Zákon Ukrajiny o vysokém školství“: Index toxicity (odhad ve formě pravděpodobnosti: jak toxický text je) – 0,04, podobnost s autory (odhady ve formě pravděpodobnosti autorství u autorů známých systému): 0,49 pro I. Farion, 0,30 pro Oleksii Honcharenko a 0,22 pro Mariana Bezugla.
6. ZÁVĚRY
Systém TextAttributor v současnosti prochází testovacími fázemi s cílem řešit otázky atribuce a určování toxicity v ukrajinských textech. Tento systém je pohodlný a účinný pro různé technologické studie. Během 5 měsíců webová aplikace TextAttributor automaticky analyzovala 784 ukrajinských textů od 226 uživatelů.
Naše zjištění dokazují účinnost naší metody, která kvantifikuje verbální prvky na základě formálních gramatických a sémantických parametrů, zejména pokud jde o negativní emocionalitu. Toho je dosaženo kombinací slovníkových přístupů a přístupů založených na pravidlech, doplněných strojovým učením
technikami. Experimentální výzkum strojového učení pro detekci toxicity a identifikaci autorství podle textu nám umožnil získat výsledky srovnatelné s výsledky experimentů s podobnými charakteristikami modelu (počtem dokumentů a autorů) uváděnými pro jiné jazyky. Modely subslov prokázaly zvýšenou robustnost vůči lexikální otevřenosti a textovým chybám.
Provedený výzkum otevírá cestu k řešení takových úloh pro ukrajinštinu, jako je detekce a monitorování toxického obsahu, nenávistných projevů a dezinformací, ověřování autorství a deobfuskace, profilování autorů a diarizace, psycholingvistické profilování, modelování stylu a sledování zdroje falešného obsahu atd. Vyvinuté schéma analýzy a atribuce textu lze rovněž použít pro jiné jazyky.
Do budoucna plánujeme integrovat nástroj pro automatickou atribuci textu a detekci toxicity se sémantickou, syntaktickou, psycholingvistickou a sociolingvistickou analýzou. Tato integrace nám poskytne hlubší porozumění dopadu na čtenáře. Pomocí sémantické analýzy lexikální taxonomie chceme identifikovat narativní prvky vlastní textu, a tím zvýšit spolehlivost atribuce textu v postupech identifikace autorství. Kromě toho plánujeme rozšířit naše textové korpusy a využít vícejazyčné velké jazykové modely k dalšímu rozšíření schopností našeho systému a také implementovat nástroje pro statistické porovnávání textů pro všechny styly ukrajinského jazyka.
Poděkování
Systém byl vytvořen v rámci projektu podporovaného Britským velvyslanectvím v Kyjevě, který realizoval tým pedagogů a výzkumných pracovníků Katedry ukrajinského jazyka a aplikované lingvistiky Národní univerzity Tarase Ševčenka v Kyjevě.
Rádi bychom vyjádřili upřímné poděkování Britskému velvyslanectví v Kyjevě za finanční podporu tohoto výzkumného projektu. Jsme vděčni Svitlaně Javorské a Iryne Bezkorovayně za vedení a pomoc v průběhu projektu. Zvláštní poděkování patří Kosťantynu Gončarenkovi za organizační a dokumentační podporu projektu. Dále jsme vděčni studentům vzdělávacího programu „Aplikovaná (počítačová) lingvistika a anglický jazyk“ Národní univerzity Tarase Ševčenka v Kyjevě. Přispěli svým časem, odbornými znalostmi a úsilím k vytváření korpusu ukrajinských toxických textů. Jsme vděčni Oksaně Toločkové, absolventce našeho bakalářského programu, za vytvoření tónového slovníku ukrajinského jazyka, který jsme použili k sestavení lexikografického seznamu negativních emotikonů. Kromě toho hluboce oceňujeme úsilí Mykoly Kostikova při shromažďování dat. Rádi bychom vyjádřili upřímnou vděčnost všem členům výzkumné komunity, kteří k této studii přispěli svými radami a konzultacemi.
242
Acta Linguistica Lithuanica XCI
Page 21
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
REFERENCES
ALIAS – Automated Linguistic Identification & Assessment System. Available at: https://aliastechnology.com/alias-overview/.
Alkomah Fatimah, Ma Xiaogang 2022: A Literature Review of Textual Hate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/info13060273.
Argamon Shlomo 2007: Interpreting Burrows’s Delta: Geometric and Probabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/fqn003.
Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023: Comparison between Machine Learning and Deep Learning Approaches for the Detection of Toxic Comments on Social Networks. – Applied Sciences 13(10), 6038. DOI: 10.3390/app13106038.
Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts, LNU imeni Ivana Franka [Ivan Franko National University of Lviv].
Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to Likely Authorship. – Literary and Linguistic Computing 17(3), 267–287. DOI: 10.1093/llc/17.3.267.
Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparing techniques for authorship attribution of source code. – Software: Practice and Experience 44(1), 1–32. DOI: 10.1002/spe.2146.
Canhasi Ercan, Kadriu Arbana, Misini Arta 2022: A Survey on Authorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/seeur-2022-0100.
Chuhunov Vadym 2009: Diahnostyka v psyk hoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv: Nauka.
Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and Intelligent Systems (COLINS-2022) 1: Main Conference, eds. V. Lytvyn, N. Sharonova, I. Jonek-Kowalska, A. Kowalska-Styczen, V. Vysotska, Ye. Kuprianov, O. Kanischeva, O. Cherednichenko, Th. Hamon, N. Grabar, Poland, 12–13 May, 2022, 256–265.
Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of
sentences. – Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies 1(35), 5–10. DOI: 10.17721/1728-2659.2024.35.01.
Eder Maciej 2015: Does size matter? Authorship attribution, small samples, big problem. – Digital Scholarship in the Humanities 30(2), 167–182. DOI: 10.1093/llc/fqt066.
Eder Maciej, Rybicki Jan 2013: Do birds of a feather really flock together, or how to choose training samples for authorship attribution. – Literary and Linguistic Computing 28(2), 229–236. DOI: 10.1093/llc/fqs036.
Evert Stefan, Proisl Thomas, Schöch Christof, Jannidis Fotis, Pielström Steffen, Vitt Thorsten 2015: Explaining Delta, or: How do distance measures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom, 21 July 2015, eds. F. Formato, A. Hardie, Lancaster: UCREL. Available at: https://zenodo.org/records/18308.
Gupta Shriya T. P., Sahoo Jajati K., Roul Rajendra K. 2019: Authorship identification using recurrent neural networks. – ICISDM’19: Proceedings of the 2019 3rd International Conference on Information System and Data Mining, United States, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935.
Hoover David 2004: Testing Burrows’s delta. – Literary and Linguistic Computing 19(4), 453–475. DOI: 10.1093/llc/19.4.453.
Hoover David 2005: Delta, Delta Prime, and Modern American Poetry: Authorship Attribution Theory and Method. – ACH/ALIC 2005: Proceedings of the 17th Joint International Conference of the Association for Computers and the Humanities (ACH) and the Association for Literary and Linguistic Computing, Canada, 15–18 June 2005, University of Victoria: Humanities Computing and Media Centre, 79–80.
Jannidis Fotis, Pielström Steffen, Schöch Christof, Vitt Thorsten 2015: Improving Burrows’ Delta – An empirical evaluation of text distance measures. – DH 2015: Digital Humanities, Abstracts of the Global Digital Humanities Conference 11, Australia, 29 June – 3 July 2015, Sydney. DOI: https://zenodo.org/records/1321296.
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
Karasov Vitalii, Levchenko Olena 2024: Statistical profile of O. Zabuzhko’s idio style. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems, Lviv, April 12–13, 2024, 251–264.
Khan Talha F., Anwar Waheed, Arshad Humera, Abbas Syed N. 2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ACCESS.2023.3299565.
Khomytska Iryna, Teslyuk Vasyl, Bazylevych Iryna, Karamysheva Iryna 2023: Automated Identification of Authorial Styles. – CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol–3396/paper26.pdf.
KUM – Korpus ukrajins’koji movy: Linhvistyčnyj portal Mova.info. Available at: http://www.mova.info/corpus.aspx.
LIWC–22 – Linguistic Inquiry and Word Count. Available at: https://www.liwc.app.
Lototska Nataliia 2022: Statistical Characteristics of Roman Ivanychuk’s Idiolect (Based on Writer’s Text Corpus). – CEUR Workshop Proceedings 3171, 487–500.
Lupei Maksym, Mitsa Aleksander, Reparіuk Volodymyr, Sharkan Vasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style using neural networks. – Eastern-European Journal of Enterprise Technologies 1/2(103), 30–36. DOI: 10.15587/1729–4061.2020.195041.
McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction. – ArXiv e-prints 1802.03426. DOI: 10.48550/arXiv.1802.03426.
Meier Tabea, Boyd Ryan, Pennebaker James, Meh Matthiasl, Martin Mike, Wolf Markus, Horn Andrea 2019: “LIWC auf Deutsch”: The development, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt.
Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: Do We Really Need the Most Frequent Words? – Literary and Linguistic Computing 26(3), 315–321. DOI: 10.1093/llc/fqr031.
Savoy Jacques 2015: Comparative evaluation of term selection functions for authorship attribution. – Digital Scholarship in the Humanities 30(2), 246–261. DOI: 10.1093/llc/fqt047.
Zuban’ Oksana 2019: The Morphemic System Stylometric Analysis of the Ukrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistychni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15.
Ukrainos žiniasklaidos tekstų automatinės stilometrinės analizės sistema „TextAttributor 1.0“ (metodai, priemonės, funkcionalumas)
SANTRAUKA
Sistema „TextAttributor“ statistiškai parametrizuoja ukrainiečių kalbos tekstus autorystės atpažinimo ir nuotaikų analizės aspektais. Naudodama daugiaparametrinį 15 statistinių indeksų rinkinį, „TextAttributor“ apibūdina autorines stilistines ypatybes. Ji integruoja tokius metodus kaip komponentinė analizė, paskirstymo analizė, kvantavimas ir nuotaikų analizė panaudojant žodynus ir mašininio mokymosi metodus, skirtus nemandag aus teksto ir autorystės išaiškinimui. Sistema apdoroja tekstus taikydama tokenizavimą, morfologinį žymėjimą, kontekstinę ir sintaksinę analizę ir emociškai neigiamo žodyno atitikimą, leidžiantį išsamiai vizualizuoti ir ekspertiškai įvertinti teksto priskyrimą ir neigiamą turinį. Eksperimentai patvirtina sistemos gebėjimą nustatyti unikalius autoriaus bruožus ir įvertinti teksto panašumą, ypač politinio diskurso ir nemandagios komunikacijos žiniasklaidos kontekste Rusijos ir Ukrainos karo metu. Straipsnyje pabrėžiama praktinė ir teorinė „TextAttributor“ reikšmė, demonstruojant jos efektyvumą didelėms teksto apimtims ir tikslioms analitinėms galimybėms. Sėkmingas žodynais, taisyklėmis pagrįstų ir mašininio mokymosi metodų taikymas pabrėžia sistemos tvirtumą ir universalumą. Beta versija ir tebevykdomų tyrimų rezultatai yra nuodugniai išnagrinėti, o būsimos jų kryptys nustatomos siekiant išplėsti kalbinį korpusą ir tobulinti mašininio mokymosi modelius, siekiant pagerinti tikslumą ir pritaikomumą.
246
Acta Linguistica Lithuanica XCI
Page 25
The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)
Įteikta 2024 m. lapkričio 25 d.
NATALIIA DARCHIUK Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
OKSANA ZUBAN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
VALENTYNA ROBEIKO Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
YULIIA TSYHYVINTSEVA Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine Institute of the Ukrainian Language of the National Academy of Sciences of Ukraine 4 Mykhailo Hrushevskyi Street Kyiv, 01001, Ukraine [email protected]
VICTOR SOROKIN Taras Shevchenko National University of Kyiv 60 Volodymyrska Street Kyiv, 01033, Ukraine [email protected]
MYKOLA SAZHOK Institute for information technologies and systems of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine [email protected]