Straipsniai / Articles 223 NATALIIADARCHUK TarasShevchenkoNationalUniversityofKyiv ORCIDid:orcid.org/0000-0001-8932-9301 Domenii de cercetare: lingvistică computațională, lingvistică de corpus, lingvistică cantitativă, gramatica și semantica limbii ucrainene. OKSANA ZUBAN Universitatea Națională „Taras Șevcenko” din Kiev ORCID id: orcid.org/0000-0002-2644-3892 Domenii de cercetare: lingvistică computațională, expertiză lingvistică, lingvistică cantitativă, gramatica și semantica limbii ucrainene. VALENTYNA ROBEIKO Universitatea Națională „Taras Șevcenko” din Kiev ORCID id: orcid.org/0000-0003-2266-7650 Domenii de cercetare: analiza, recunoașterea și sinteza vorbirii, fonetică, procesarea limbajului natural. YULIIA TSYHVINTSEVA Universitatea Națională „Taras Șevcenko” din Kiev, Institutul Limbii Ucrainene al Academiei Naționale de Științe a Ucrainei ORCID id: orcid.org/0000-0002-9684-3840 Domenii de cercetare: neologia ucraineană, lexicologia și lexicografia. VICTOR SOROKIN Universitatea Națională „Taras Șevcenko” din Kiev ORCIDid:orcid.org/0000-0002-3637-0535 Fieldsofresearch:automaticsyntaxanalysis,automatic analiza semantică, procesarea limbajului natural.
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 224 Acta Linguistica Lithuanica XCI MYKOLA SAZHOK Institutul pentru tehnologii informaționale și sisteme al Academiei Naționale de Științe a Ucrainei ORCID id: orcid.org/0000-0003-1169-6851 Domenii de cercetare: analiza, recunoașterea și sinteza vorbirii, procesarea limbajului natural. DOI: doi.org/10.35321/all91-09 THESYSTEMFORAUTOMATIC STYLOMETRICANALYSIS OFUKRAINIANMEDIA TEXTSTEXTATTRIBUTOR1.0 (TEHNICI, MIJLOACE, FUNCȚIONALITATE) Sistemul de analiză stilometrică automată a textelor din mass-media ucraineană „TextAttributor 1.0“ (metode, instrumente, funcționalitate) REZUMAT Această lucrare prezintă structura, algoritmii, implementarea și rezultatele experimentale ale sistemului automat TextAttributor, dezvoltat de autorii lucrării pentru parametrizarea statistică a textelor în limba ucraineană, utilizând un set multiparametric de indici statistici care caracterizează stilul textual al autorului și sunt aplicabili sarcinilor de atribuire a autorului. Pe baza resurselor lingvistice și a software-ului create, sistemul generează o analiză lingvistică bazată pe indicii statistici calculați și efectuează un studiu comparativ al două texte. Un criteriu suplimentar pentru indexarea statistică este indicele de toxicitate a textului, calculat prin metoda identificării verbale a sentimentului toxic. Sarcinile de detectare a autorului și a toxicității sunt abordate utilizând două metode: calcule statistice bazate pe dicționar și reguli și învățare automată. Rezultatele actuale implementate în versiunea beta a TextAttributor sunt examinate în detaliu. CUVINTE-CHEIE: Lingvistică computațională, limba ucraineană, analiza sentimentului, atribuirea autorului, stilometrie, clasificarea textului. nouă direcție care poate fi considerată textologie
Articole / Articles 225 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) ANOTACIJA Šiame straipsnyje pristatoma straipsnio autorių sukurtos automatinės sistemos Structura, algoritmii, implementarea și rezultatele experimentale ale sistemului „TextAttributor“, destinat parametrizării statistice a textelor în limba ucraineană prin utilizarea unui set multiparametric de indicatori statistici care descrie stilul textului autorului și este aplicat sarcinilor de atribuire a autorului. Pe baza resurselor lingvistice și a software-ului create, sistemul generează o analiză lingvistică în funcție de indicii statistici calculați și efectuează o analiză comparativă a două texte. Un criteriu suplimentar de indexare statistică este indicele textului care provoacă stări de spirit negative, calculat prin aplicarea unei metode lexicale de identificare a stărilor de spirit negative. Sarcinile de determinare a autorului și a maliției sunt soluționate prin două metode: calcule statistice bazate pe dicționare și reguli și învățare automată. Atribuirea actuală a autorului, stilometria, clasificarea textului. rezultatai,gautinaudojantis„TextAttributor“betaversija,išsamiaiišnagrinėti. ESMINIAIŽODŽIAI:kompiuterinėlingvistika,ukrainiečiųkalba,jausmingumoanalizė, 1. INTRODUCERE Textologicalresearchgainednewscientificimportancewiththeadvancement ofcomputationallinguisticsmethods,whichcontributedtotheformationofa digitală. În cadrul acestei discipline emergente, conceptualizăm textologia digitală ca valorificarea tehnicilor automatizate ale lingvisticii corpusului, cuplate cu modele matematice pentru analiza cantitativă a textului. Orientată de sarcinile actuale ale lingvisticii cantitative moderne și ale procesării limbajului natural, echipa noastră a dezvoltat un sistem pentru analiza lingvistică-statistică automată a textelor mediatice, implementat ca o aplicație web denumită TextAttributor (TextAttributor 1.0 2024). Sistemul operează în cadrul a patru sarcini: 1) parametrizarea statistică a textului; 2) stilometria: determinarea caracteristicilor lingvistice-statistice ale idiolectului; 3) atribuirea: determinarea gradului de similitudine dintre texte; și 4) analiza sentimentului: identificarea lexicului sentimentului negativ în texte. În plus, în cadrul sistemului, pe baza rezultatelor celei de-a doua și celei de-a patra sarcini sunt generate automat două concluzii ale expertizei lingvistice. Multifuncționalitatea sistemului TextAttributor impune utilizatorilor să se familiarizeze cu principiile sale de funcționare. Scopul acestui articol este de a familiariza comunitatea academică și educațională filologică cu metodologia de creare a sistemului, arhitectura și rezultatele funcționării sale, pentru a oferi o înțelegere clară a funcțiilor și capacităților sale analitice, care sunt deosebit de relevante. Această abordare este deosebit de relevantă pentru analiza unor volume mari de comunicări pe internet și
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 226 ActaLinguisticaLithuanicaXCI enhancinginformationdefencestrategiesduringtheongoingRussian-Ukrainian război. Conceptul elaborării unui sistem automat de instrumente în limba ucraineană al textattributionarosefromtheanalysisofresearchinthefieldofUkrainian corpuslinguistics(Darčuk 2013)andstatisticalstudiesoftheauthor’s style (Darčuket al.2021;Darchuk,Sorokin2022;Zuban’2019)conductedusingthe Corpusului Limbii Ucrainene (KUM) de către autorii proiectului. informații din text, utilizând During the development of the TextAttributor system, the following methodswereemployed:componentanalysis,distributiveanalysis,andcontent analysis.Contentanalysis,aquantitativeandqualitativemethodforextracting procesarea limbajului natural și tehnici statistice. De asemenea, au fost aplicate cuantificarea și analiza sentimentelor. Analiza sentimentelor identifică automat tonalitatea textului pe baza atât a coloraturii emoționale, cât și a evaluării evenimentelor sau obiectelor de către autor, realizată prin utilizarea calculelor statistice bazate pe dicționare și reguli. În plus, au fost incorporate metode de învățare automată, inclusiv învățarea profundă. Structura statistică a unui text, înțeleasă ca model cantitativ al acestuia, permite identificarea stilului său funcțional, a autorului și a perioadei de creație. În această lucrare, componentele structurii statistice au fost extrase prin analizarea caracteristicilor statistice lexicale și gramaticale, utilizând tehnici de indexare și metrici ale distanței euclidiene. Distanța euclidiană, care măsoară distanța dintre două puncte într-un spațiu euclidian n-dimensional, este una dintre cele mai utilizate metrici în lingvostatistică pentru analiza clusterelor în stilometrie și atribuirea autorului. The novelty of the results is the first implementation in computational linguistics of an automated morpho-syntactic-semantic stylometric model pentru analiza textului, bazat pe 15 indici statistici care parametrizează în principal structura morfologică, precum și structura sintactică și semantică a textului. Un model stilometric reprezintă un ansamblu de parametri statistici ai unui text (lexicali, morfologici, sintactici etc.), pe baza cărora se realizează o analiză comparativă a acestui text cu modelul stilometric al stilului funcțional. În opinia noastră, prin utilizarea metodelor statistice în construirea unui model stilometric, este posibilă obținerea unui sistem strict, determinist și fundamentat științific de trăsături comune și distinctive ale stilurilor, genurilor etc. Pentru prima dată, modelul stilometric introduce parametrul indicelui de toxicitate, care definește caracteristic textele mediatice din timpul războiului ruso-ucrainean. Acest model este implementat nu doar în funcția de parametrizare statistică a textelor, caracteristică sistemelor de acest tip, ci și în funcția de comparare a textului analizat cu stilul mediatic al limbii ucrainene, precum și pentru sarcini stilometrice și de atribuire care implică două sau mai multe texte. Semnificația teoretică se extinde la validarea a două metode de determinare a toxicității textului și
Статті / Articles 227 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) authorshipinUkrainian:1)throughdictionaryandrule-basedapproaches,and 2)viamachinelearning,includingdeeplearning. 2. LUCRĂRI CONEXE În lingvistica ucraineană modernă, au fost realizate studii lingvostatistice substanțiale asupra idiolectelor scriitorilor și poeților ucraineni, inclusiv Taras Șevcenko, Lesia Ukrainka, Vasîl Stus (Zuban’ 2019), Ivan Franko (Buk 2021), Roman Ivanyciuk (Lototska 2022), Valerii Șevciuk (Volos, Levchenko 2023), Mariia Matios, Iurii Andruhovîci, Oksana Zabujko (Karasov, Levchenko 2024), Ivan Drah, Mikola Vingranovski (Darchuk et al. 2024), Lina Kostenko (Zuban’ 2019; Darchuk et al. 2024), printre alții. Aceste studii au fost realizate pe eșantioane reprezentative de texte (texte lungi), utilizând predominant unul sau câțiva (nu mai mult de cinci) parametri statistici, adesea fără aplicarea comparației stilometrice. În plus, din cauza caracterului laborios al desfășurării experimentelor lingvostatistice, lingvistica ucraineană a trecut în mare măsură cu vederea parametrizarea statistică cuprinzătoare, compararea textelor analizate cu parametrii statistici standard ai stilurilor funcționale, determinarea gradului de similaritate a textelor, precum și analiza stilometrică și de atribuire a textelor scurte. Utilizarea sistemului TextAttributor în cercetarea lingvostatistică, având ca scop realizarea automată a acestor sarcini, nu va oferi doar caracteristici de frecvență ale fenomenelor lingvistice, ci va permite și o analiză stilometrică eficientă, care va conduce la formularea unei opinii de specialitate. Sistemul TextAttributor prezintă avantaje în comparație cu echivalentele sale din știința mondială. Majoritatea sistemelor și modelelor existente se concentrează, de asemenea, pe utilizarea unor module lingvostatistice individuale pentru identificarea unuia sau a câtorva parametri ai textului, în principal formali (n-grame, cele mai frecvente cuvinte, litere) (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). În schimb, TextAttributor 1.0 oferă o abordare cuprinzătoare, incluzând analiza statistică interactivă a structurii lexicale, morfologice, sintactice și semantice a textului în timp real, pe baza a 15 parametri. Atribuirea textelor este dezvoltată activ în studiile textuale străine, în special, eficiența metodei lui Burrows (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) este testată în numeroase studii asupra unor volume mari de date textuale de diverse stiluri, precum: proza engleză de la începutul secolului al XX-lea (Hoover 2004); poezia engleză modernă (Hoover 2005); opere poetice în limba latină (Rybicki, Eder 2011); opere de proză aparținând principalelor genuri în limbile engleză, franceză, italiană, germană, polonă, maghiară, precum și în latină și arabă (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015); texte politice în limba engleză, inclusiv
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 228 ActaLinguisticaLithuanicaXCI theattributionofspeechesofAmericanpresidents(Savoy2015).Onemore metoda de analiză lingvistică automatizată numită „Linguistic Inquiry and Word Count” (LIWC) este implementată ca aplicație comercială și adaptată pentru mai multe limbi (Meier et al. 2019; LIWC-22). În ultimii ani, sarcinile de atribuire automată a textelor au utilizat predominant fie metode stilometrice bazate pe reguli, fie metode de învățare profundă (Eder 2015; Canhasi et al. 2022). Ambele metode au fost implementate în sistemul TextAttributor, funcționând eficient, dar producând rezultate diferite: 1) Metoda bazată pe reguli permite automatizarea generării concluziilor lingvistice despre idiolect și toxicitatea textului; 2) Metoda de învățare automată determină doar gradul de toxicitate și similaritatea textelor și poate fi utilizată în sarcini de clasificare pentru monitorizarea conținutului textual. Metodele recente de învățare automată pentru analiza sentimentului și identificarea autorului textului se bazează pe abordări statistice (TF-IDF, Latent Dirichlet Allocation) și tehnici de învățare profundă cu diverse arhitecturi (CNN, LSTM, BERT), în combinație cu metode stilometrice (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). Rezultatele raportate depind extrem de mult de numărul de clase (tipuri de toxicitate, autori), de gen, de lungimea textului și, cel mai important, de volumul corpusului de texte adnotat corespunzător, utilizat pentru procedura de antrenare. Astfel, ratele ridicate de acuratețe în sarcinile de detectare a toxicității și a discursului instigator la ură depășesc 90% atunci când se utilizează un corpus care conține zeci de mii de documente (Alkomah, Ma 2022). De exemplu, se obține o acuratețe de peste 90% în atribuirea autorului pentru opere literare în limba engleză din corpusul a 1000 de autori, utilizând un corpus de 6000 de documente pentru 15 autori. Identificarea și analiza sentimentului/toxicității sunt probleme insuficient studiate 3. CARACTERISTICI GENERALE ALE FUNCȚIONĂRII SISTEMULUI TEXTATTRIBUTOR turn,forcorporacontaininglessthan1500documentsthereportedaccuracy isabout70%(Khanet al.2023).FortheUkrainianlanguage,textauthorship În timpul dezvoltării TextAttributor, au fost îndeplinite următoarele sarcini: 1) Lingvistică (Lupeiet al.2020),moreover,suchsystemsdonotproducelinguisticexpertise andcannotbeusedastoolsforlinguisticresearch. teoretică: A fost elaborată o metodologie pentru analize morfologice, statistice, stilometrice, atribuționale și de sentiment formalizate; 2) Inginerie software: Au fost dezvoltate structura bazelor de date lingvistice și software-ul pentru analizele automate menționate anterior; 3) Lingvistică experimentală: Sistemul a fost testat pe texte media ucrainene și a fost implementat un modul analitic pentru examinarea stilometrică automată. Sistemul lingvistic automatizat, implementat ca aplicație web, procesează texte de stil mediatic introduse de utilizator, generând valori numerice pentru parametrii statistici care caracterizează atributele textului. Sistemul urmează o secvență structurată de operare:
Straipsniai / Articles 229 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 1. Tokenizarea textului: Descompunerea textului în propoziții și cuvinte pentru analiză. 2. Etichetarea morfologică: Atribuirea de etichete cuvintelor pe baza formelor lor gramaticale. 3. Analiza contextuală: Actualizarea etichetelor morfologice în funcție de context. 4. Analiza sintactică: Stabilirea relațiilor binare dintre cuvintele din propoziții pentru înțelegerea structurii lor gramaticale. 5. Stabilirea relațiilor sintactice: Determinarea conexiunilor sintactice pe baza unor reguli predefinite. 6. Potrivirea vocabularului cu încărcătură emoțională negativă: Identificarea cuvintelor dintr-un set predefinit de vocabular negativ. 7. Evaluarea parametrilor statistici: Evaluarea parametrilor statistici pentru textul de intrare utilizând vocabulare de frecvență compilate automat. 8. Vizualizarea rezultatelor: Prezentarea rezultatelor parametrizării statistice graphically,withempiricalvaluesandconfidenceintervals. 9.Comparison of Results:Visualizingstatisticalparameterizationoutcomes fortwomedia-styletexts,facilitatingcomparison. 10.Euclidean Distance Evaluation:Quantifyingthedissimilaritybetween twomedia-styletexts. 11. Generarea opiniei experților: Generarea a două opinii ale experților: una privind atribuirea textului și alta privind toxicitatea textului prin examinare lingvistică. 12. Detectarea toxicității și identificarea autorului: Utilizarea tehnicilor de învățare automată, în special a modelelor de rețele neuronale, pentru detectarea toxicității și identificarea autorilor. Rezultatele sistemului sunt organizate în următoarele secțiuni: Grupul indicelui de atribuire a textului, Opinia experților privind atribuirea textului, Compararea atribuirii textului, Expertiza lingvistică a toxicității textului și Rețeaua neuronală Opinii. In Text Attribution Index Group (Fig. 1), statistical parameters are organizedbasedontheinputtext:column1displaystheIndextitle,column 2 prezintă valoarea numerică empirică, iar coloana 3 oferă o referință vizuală prin compararea valorii empirice a indicelui cu intervalul de încredere
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 230 Acta Linguistica Lithuanica XCI pragurile (inferior și superior) derivate din texte de stil mediatic ucrainean. Valoarea numerică empirică este reprezentată pe scală printr-un triunghi inversat umplut. FIGURA 1: Un fragment al rezultatului atribuirii textului În Expert Opinion privind atribuirea textului (Fig. 2), prezentăm concluzii referitoare la caracteristicile lingvistice statistice tipice sau individuale extrase din textul analizat pentru fiecare indice estimat. Aceste concluzii sunt derivate din răspunsurile la întrebarea: Se încadrează valoarea numerică a indicelui în intervalul de încredere al stilului mediatic al limbii ucrainene? Pe baza comparării valorilor numerice cu valorile pragului intervalului de încredere, sistemul generează trei răspunsuri posibile (semne tipice ale stilului mediatic, semne ale idios stilului mai scăzute decât stilul mediatic normal și semne ale idios stilului mai ridicate decât stilul mediatic normal). În Compararea atribuirii textelor (Fig. 4, subsecțiunea 4.2), la selectarea opțiunii „Calculate Vector Distance”, datele tabelare sunt actualizate prompt după cum urmează: Coloana 1 enumeră textele introduse de utilizator împreună cu textul analizat anterior; Coloana 2 afișează numărul de propoziții din fiecare text; Coloana 3 indică numărul de cuvinte; Coloana 4 prezintă distanța euclidiană dintre textul analizat și fiecare text din tabel; Coloana 5, intitulată „Compare”, initiatesanautomaticcomparisonofstatisticalindicesbetweentheanalyzedtext andtheselectedtext.Uponactivatingthecorresponding“Compare”element, comprehensiveinformationonthestatisticalcomparisonbetweentwotextsis providedinthe“TextAttributionIndices”group(Fig.3).
Articole / Articles 231 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) FIGURA 2: Un exemplu de model de opinie expert generat, care cuantifică toxicitatea textului In Linguistic Expertise of Text Toxicity (subsection 4.3), a lexicalsemanticinterpretationofthecalculatedtoxicityindexispresented(Fig.6). InNeural Network Opinionswepresenttheoutputofourdeeplearning pe o scală de la 0 (netoxic) la 1 (toxicitate ridicată). De asemenea, evaluăm similaritatea textului cu autori cunoscuți, cu valori cuprinse între 0 (fără similaritate) și 1 (similaritate ridicată), pe baza autorilor pe ale căror texte a fost antrenat modelul. Rezultatele sunt afișate doar pentru testele cu o măsură a similarității mai mare de 0,1. Sistemul nostru actual funcționează în modul demo, utilizând un corpus limitat de texte ale autorilor pentru a evalua similaritatea cu textul introdus de utilizator. 4. ATRIBUIREA TEXTELOR ÎN LIMBA UCRAINEANĂ: EXPERIMENTE, REZULTATE ȘI DISCUȚII 4.1. Indicii de parametrizare statistică Modelul stilometric dezvoltat rezolvă două sarcini: 1) Identificarea caracteristicilor individuale ale stilului unui autor (stilometrie); 2) Evaluarea similarității dintre două texte pe baza parametrilor lingvistici și statistici (atribuire).
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 238 Acta Linguistica Lithuanica XCI Astăzi, componenta informațională a devenit deosebit de importantă în războiul hibrid. Prin urmare, materialul studiului nostru l-a constituit un corpus de cercetare alcătuit din texte ale presei online aparținând discursului politic, cu un volum de 10 milioane de cuvinte. Folosim termenul „text toxic” în sens larg. Aceste texte se caracterizează prin hărțuire, amenințări, obscenitate, hărțuire cibernetică, trolling și texte care exprimă ură bazată pe identitate și conțin emotogeni, adică fenomene și obiecte care provoacă emoții negative unei persoane (de exemplu, războiul, raidul aerian, corupția). Acest proiect a urmărit să determine potențialul de realizare a sentimentului negativ în textele ucrainene și să dezvolte un sistem automatizat pentru identificarea conținutului toxic. Această sarcină a cuprins două subsarcini consecutive: mai întâi, dezvoltarea unui sistem de examinare lingvistică a textelor toxice, cu determinarea indicilor de toxicitate prin analiză dicționaristică și metode bazate pe reguli; în al doilea rând, construirea unui set de date de antrenare în scopuri de învățare automată și dezvoltarea unei rețele neuronale pentru predicția indicilor de toxicitate a textului. Să analizăm realizarea primei sarcini. Aceasta a implicat construirea indivizilor (1620), a termenilor obsceni (613) și a limbajului abuziv (787). Exemplele includ westerner (западенець: denumire depreciativă pentru persoanele din regiunile ofalexicographicdatabasehousingthreedistinctdictionaries: 1)Emotiogendictionary:Acompilationof5000words(accordingtothe meaningsoflexical-semanticvariants)withnegativesentimenttones,ratedon ascaleof–2.Examplesincludeimmoral,impunity,briberyandsteal; 2) Hate Speech Dictionary: Comprising 3000 words, including names of vestice ale Ucrainei) și huckster; 3) Fraze toxice: O colecție de 1500 de expresii idiomatice care transmit emoții negative. Exemplele includ grimaces like a monkey, kisses his arse și opens his mouth. Fiecare intrare din aceste liste a fost adnotată cu trăsături semantice, Dicționarul discursului instigator la ură având 18 trăsături, iar lista Frazelor toxice având 26. De exemplu, cuvintele din Dicționarul discursului instigator la ură au fost etichetate cu caracteristici precum ‘s’ pentru sexism, ‘r’ pentru rasism și ‘e’ pentru ageism. Această bază de date lexicografică, un sistem multiparametric, atribuie trăsături semantice unităților (cuvinte sau fraze) care, combinate cu datele de frecvență din textul analizat, permit analiza toxicității. Indicele de toxicitate al textului este calculat folosind formula: Itox = (e + |K| (m + t)) / n * 10, Aici, n este volumul textului; e este numărul cuvintelor emoționale; m este numărul cuvintelor care țin de discursul instigator la ură; t este numărul frazelor toxice; K este un coeficient egal cu –2, acesta accentuând cuvintele care țin de discursul instigator la ură și frazele toxice, care pe o scală de
Straipsniai / Articles 239 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) cinci cifre (+2, +1, 0, –1, –2) corespunde lui –2. Valorile indicelui variază de la 0 la +1. De exemplu, indicele de toxicitate al textului „People with a red pen (Люди з червоною ручкою)” (12 propoziții, 129 de cuvinte) este 1.01, indicând toxicitatea sa ridicată, întrucât pragul pentru astfel de texte variază între 0.1 și 0.7. Simultan, sistemul generează rezultatele unei examinări lingvistice automate a toxicității textului (a se vedea Fig. 6), care cuprinde: 1) o hartă statistică a claselor semantice ale vocabularului negativ conform markerilor de clasificare ai listelor lexicografice (emotiogeni – 5, vulgarisme – 2, sexism – 2); 2) un text cu anumite cuvinte cu sentiment negativ, care verbalizează categoriile hărții statistice. Să analizăm un fragment al textului real analizat (Fig. 6): acei oameni care umblă cu un pix roșu și corectează greșelile din postările altora: voi cine mai sunteți? Aveți idee cât de enervanți sunteți? Vă studiez intenționat profilurile, sunt curios în privința lumii în care existați. Lumea aceasta mă sperie foarte mult. Sper sincer că, în viața reală, nu ne vom intersecta în nicio circumstanță. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляеєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересічемося ні за яких обставин). Aici, sistemul evidențiază automat cu caractere aldine următoarele cuvinte cu o componentă negativă: greșeli (помилки), ale altora (чужих), enervanți (бісите), sperie (лякає). FIGURA 6: Un fragment al examinării lingvistice automate a toxicității textului
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 240 Acta Linguistica Lithuanica XCI 5. MACHINELEARNINGAPPROACHES: EXPERIMENTS,RESULTSAND DISCUȚII Să ne concentrăm asupra celui de-al doilea mod de operare al sistemului TextAttributor, dedicat tehnicilor de învățare automată. La intrarea pentru antrenarea modelului, avem corpusuri de texte etichetate în funcție de obiectivul fiecărei sub-sarcini: (a) informații textuale pentru detectarea toxicității și (b) identificarea autorului. Fiecare corpus este împărțit în seturi de antrenare și de control, precum și, în cazul unui corpus suficient de mare, într-un set de validare. Parametrii modelului ales pentru rezolvarea problemei sunt estimați pe setul de antrenare. Hiperparametrii modelului sunt ajustați prin modelele actuale validationset.Thefinalperformanceindicatorsofthemodelaremeasuredona controlset,takingintoaccounttheavailabilityofcomputingresources,which arenecessaryforthemodel’soperability.Acorpusforeachsubtaskhasbeen developedinparallelwiththeTextAttributormachinelearningcomponent,so au fost antrenate pe date relativ puține, incluzând texte scurte de pe internet provenite din bloguri, comentarii, articole etc. în limba ucraineană. 5.1. Detectarea toxicității Ca rezultat al unei serii de studii experimentale, a fost aleasă o arhitectură eficientă din punct de vedere computațional, bazată pe metoda fastText și instrumentele sale (Joulin et al. 2016). Această metodă furnizează reprezentări vectoriale ale cuvintelor și estimează distribuția probabilităților documentelor conform unor clase predefinite. Cuvintele sunt reprezentate sub formă de vectori pe baza împărțirii automate a cuvintelor în părți (subcuvinte), ceea ce simulează deschiderea dicționarului. Reprezentarea subcuvintelor este importantă deoarece limba ucraineană este foarte flexionară, iar numeroase cuvinte inexistente în datele de antrenare, precum și cuvintele cu erori de ortografie, trebuie acoperite. Eficiența abordării utilizate este determinată și de condițiile tehnice de operare a sistemului și de resursele textuale disponibile pentru antrenarea modelului. Un corpus pregătit, alcătuit din aproximativ 12.000 de documente textuale, a fost utilizat pentru clasificarea binară în vederea detectării conținutului toxic. Cel mai bun rezultat, bazat pe metrica generalizată (F1 = 79.4%), a fost obținut cu următoarele setări ale hiperparametrilor: o dimensionalitate a vectorului cuvântului de 56, o rată inițială de învățare de 0.15, 500 de epoci de antrenare, context lexical reprezentat prin bigrame, lungimi ale subcuvintelor cuprinse între 2 și 5 caractere și un prag de decizie de 0.4. În plus, modelul a demonstrat o sensibilitate de 85%, obținând totodată o acuratețe de aproximativ 70%.
Straipsniai / Articles 241 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 5.2. Identificarea autorului Cercetarea experimentală a modelelor pentru identificarea autorului unui text a fost realizată utilizând o parte a corpusului de texte sociopolitice disponibile public, în care este posibilă identificarea persoanei care este autorul documentului. Au fost selectate în total 702 texte de la patru autori care au publicat cel mai mare număr de documente cuprinse între 60 și 1000 de caractere. Cel mai mare număr de publicații al unui autor este de 304 (115 mii de caractere), iar cel mai mic este de 109 (49 de mii de caractere). Pentru testare, au fost eșantionate aleatoriu câte 25 de texte pentru fiecare autor selectat. Restul documentelor au constituit setul de antrenare. din 50, o rată inițială de învățare de 0,1, 50 de epoci de Thebestresult,accordingtothegeneralizedmetric(F1=81%),wasachieved withthefollowinghyperparametervalues:awordembeddingspacedimension antrenare, context lexical reprezentat prin bigrame, lungimi ale subcuvintelor cuprinse între 2 și 5 caractere și a atins 100%, cu o acuratețe de peste 90%. Aceste rezultate demonstrează adecision-makingthresholdof0.5.Notably,forcertainmodelconfigurations, thesensitivitytotheauthorwiththelargestnumberofdocumentsinthedataset fezabilitatea dezvoltării unui sistem eficient, capabil să acopere cu acuratețe textele autorilor care sunt reprezentați suficient în setul de antrenare. Modelele de rețele neuronale antrenate au fost integrate în sistemul TextAttributor în arhitectura „client-server”, în care sunt prezentate rezultatele a două sarcini: (a) determinarea toxicității și (b) detectarea autorului. Rezultatul funcționării sistemului asupra textului „Legii Ucrainei privind învățământul superior”: indicele de toxicitate (estimare sub forma unei probabilități: cât de toxic este textul) – 0,04, similaritatea cu autorii (estimări sub forma probabilității paternității pentru autorii cunoscuți de sistem): 0,49 pentru I. Farion, 0,30 pentru Oleksii Honcharenko și 0,22 pentru Mariana Bezuhla. 6. CONCLUZII În prezent, sistemul TextAttributor se află în faza de testare pentru soluționarea problemelor de atribuire și determinare a toxicității în textele în limba ucraineană. Acest sistem este atât convenabil, cât și eficient pentru diverse studii tehnologice. În decurs de 5 luni, aplicația web TextAttributor a analizat automat 784 de texte ucrainene aparținând unui număr de 226 de utilizatori. Constatările noastre demonstrează eficiența metodei noastre, care implică cuantificarea elementelor verbale pe baza unor parametri gramaticali formali și semantici, particularlyfornegativeemotionality.Thisisachievedthroughacombination ofdictionaryandrule-basedapproaches,complementedbymachinelearning
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 242 Acta Linguistica Lithuanica XCI și autorii) raportate pentru alte limbi. Modelele techniques.Experimentalmachinelearningresearchfortoxicitydetectionand authorship identification bytext allowed us toobtainresults comparable to resultsofexperimentswithsimilarmodelcharacteristics(numberofdocuments bazate pe subcuvinte au demonstrat îmbunătățiri în verificarea și deofuscarea robustnessagainstlexicalopennessandtextualerrors. TheconductedresearchpavesthewayforsolvingsuchproblemsforUkrainian as detectingand monitoringtoxic content,hate speechandmisinformation, autorului, profilarea și diarizarea autorilor, profilarea psiholingvistică, modelarea stilului și urmărirea sursei conținutului fals etc. Schema dezvoltată de analiză și atribuire a textului poate fi aplicată și altor limbi. În perspectivă, intenționăm să integrăm instrumentul nostru automat de atribuire a textului și de detectare a toxicității cu analiza semantică, sintactică, psiholingvistică și sociolingvistică. Această integrare ne va oferi o înțelegere mai profundă a impactului asupra cititorului. Utilizând analiza semantică a taxonomiei lexicale, urmărim să identificăm elementele narative inerente textului, sporind astfel fiabilitatea atribuirii textului în procedurile de identificare a autorului. În plus, intenționăm să ne extindem corpusurile de texte și să utilizăm modele lingvistice mari multilingve pentru a extinde în continuare capacitățile sistemului nostru, precum și să implementăm instrumente pentru compararea statistică a textelor pentru toate stilurile limbii ucrainene. Mulțumiri The system has been created within a project supported by the British EmbassyinKyivandcarriedoutbyateamofeducatorsandresearchersofthe Catedra de Limba ucraineană și lingvistică aplicată, Universitatea Națională Taras Șevcenko Universitatea din Kiev. Dorim să ne exprimăm sincera apreciere față de Ambasada Britanică din Kiev pentru sprijinul financiar acordat acestui proiect de cercetare. Le suntem recunoscători Svetlanei Yavorska și Irinei Bezkorovayna pentru îndrumarea și asistența oferite pe parcursul proiectului. Mulțumiri speciale lui Kostiantyn Goncharenko pentru organizarea și sprijinul documentar al proiectului. În plus, le suntem recunoscători studenților programului educațional „Lingvistică aplicată (computatională) și limba engleză” al Universității Naționale „Taras Șevcenko” din Kiev. Aceștia și-au oferit timpul, expertiza și eforturile pentru constituirea corpusului de texte toxice ucrainene. Îi suntem recunoscători Oksanei Tolochko, absolventă a programului nostru de licență, pentru crearea unui dicționar tonal al limbii ucrainene, pe care l-am folosit pentru alcătuirea unei liste lexicografice de emotogeni negativi. În plus, apreciem profund eforturile depuse de Mykola Kostikov în procesul de colectare a datelor. Dorim să ne exprimăm sincera recunoștință tuturor membrilor comunității de cercetare care au contribuit la thisstudywiththeiradviceandconsultations.
Straipsniai / Articles 243 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) REFERENCES ALIAS–Automated Linguistic Identification & Assessment System.Availableat:https:// aliastechnology.com/alias-overview/. Alkomah Fatimah, Ma Xiaogang 2022:ALiteratureReviewofTextualHate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/ info13060273. ArgamonShlomo2007:InterpretingBurrows’sDelta:GeometricandProbabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/ fqn003. Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023:ComparisonbetweenMachine LearningandDeepLearningApproachesfortheDetectionofToxicCommentson SocialNetworks.–Applied Sciences13(10),6038.DOI:10.3390/app13106038. Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts,LNUimeniIvanaFranka[IvanFranko NationalUniversityofLviv]. Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to LikelyAuthorship.–Literary and Linguistic Computing17(3),267–287.DOI:10.1093/ llc/17.3.267. Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparingtechniquesforauthorshipattributionofsourcecode.–Software: Practice and Experience44(1),1–32.DOI:10.1002/spe.2146. CanhasiErcan,KadriuArbana,MisiniArta2022:ASurveyonAuthorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/ seeur-2022-0100. ChuhunovVadym2009:Diahnostyka v psykhoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv:Nauka. Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and IntelligentSystems(COLINS-2022)1:Main Conference,eds.V.Lytvyn,N.Sharonova, I.Jonek-Kowalska,A.Kowalska-Styczen,V.Vysotska,Ye.Kupriianov,O.Kanishcheva, O.Cherednichenko,Th.Hamon,N.Grabar,Poland,12–13May,2022,256–265. Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 244 ActaLinguisticaLithuanicaXCI sentences.–Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies1(35),5–10.DOI:10.17721/1728-2659.2024.35.01. Darčuk Natalija 2013: Kompjuterne anotuvannja ukrajins’koho tekstu: rezul’taty i perspektyvy,Kyiv:OsvitaUkrajiny. DarčukNatalija,Vasyl’jevaIryna,Vasyl’jevOleksij2021:Vektornamodel’ analizustylistykytekstiv.–Ukrajins’kyj fizyčnyj žurnal66(5),373–378. Eder Maciej 2015:Doessizematter?Authorshipattribution,smallsamples,big problem.–Digital Scholarship in the Humanities30(2),167–182.DOI:10.1093/llc/ fqt066. Eder Maciej, Rybicki Jan 2013:Dobirdsofafeatherreallyflocktogether,or howtochoosetrainingsamplesforauthorship attribution.–Literary and Linguistic Computing28(2),229–236.DOI:10.1093/llc/fqs036. EvertStefan,ProislThomas,SchöchChristof,JannidisFotis,Pielström Steffen, Vitt Thorsten 2015:ExplainingDelta,or:Howdodistancemeasures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom,21July2015,eds.F.Formato,A.Hardie,Lancaster:UCREL.Availableat: https://zenodo.org/records/18308. GuptaShriyaT.P.,SahooJajatiK.,RoulRajendraK.2019:Authorship identificationusingrecurrentneuralnetworks.–ICISDM’19:Proceedingsofthe2019 3rdInternationalConferenceonInformationSystemandDataMining,UnitedStates, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935. Hoover David 2004:TestingBurrows’sdelta.–Literary and Linguistic Computing 19(4),453–475.DOI:10.1093/llc/19.4.453. HooverDavid2005:Delta,DeltaPrime,andModernAmericanPoetry:Authorship AttributionTheoryandMethod.–ACH/ALLC 2005:Proceedingsofthe17thJoint InternationalConferenceoftheAssociationforComputersandtheHumanities(ACH) andtheAssociationforLiteraryandLinguisticComputing,Canada,15–18June2005, UniversityofVictoria:HumanitiesComputingandMediaCentre,79–80. JannidisFotis,PielströmSteffen,SchöchChristof,VittThorsten2015: ImprovingBurrows’Delta–Anempiricalevaluationoftextdistancemeasures.–DH 2015:DigitalHumanities,AbstractsoftheGlobalDigitalHumanitiesConference11, Australia,29June–3July2015,Sydney.DOI:https://zenodo.org/records/1321296. Joulin Armand, Grave Edouard, Bojanowski Piotr, Douze Matthijs, JégouHérve,MikolovTomas2016:FastText.zip:Compressingtextclassification models.–ArXiv e-prints 1612.03651.DOI:10.48550/arXiv.1612.03651.
Straipsniai / Articles 245 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Karasov Vitalii, Levchenko Olena 2024:StatisticalprofileofO.Zabuzhko’s idiostyle. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems,Lviv,April12–13,2024, 251–264. KhanTalhaF.,AnwarWaheed,ArshadHumera,AbbasSyedN.2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ ACCESS.2023.3299565. KhomytskaIryna,TeslyukVasyl,BazylevychIryna,KaramyshevaIryna 2023:AutomatedIdentificationofAuthorialStyles.–CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol3396/paper26.pdf. KUM–Korpus ukrajins’koji movy:LinhvistyčnyjportalMova.info.Availableat:http:// www.mova.info/corpus.aspx. LIWC-22–Linguistic Inquiry and Word Count.Availableat:https://www.liwc.app. Lototska Nataliia 2022:StatisticalCharacteristicsofRomanIvanychuk’sIdiolect (BasedonWriter’sTextCorpus).–CEUR Workshop Proceedings3171,487–500. LupeiMaksym,MitsaAlexander,RepariukVolodymyr,SharkanVasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style usingneuralnetworks.–Eastern-European Journal of Enterprise Technologies1/2(103), 30–36.DOI:10.15587/1729-4061.2020.195041. McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform ManifoldApproximationandProjectionforDimensionReduction.–ArXiv e-prints 1802.03426.DOI:10.48550/arXiv.1802.03426. MeierTabea,BoydRyan,PennebakerJames,MehMatthiasl,Martin Mike,WolfMarkus,HornAndrea2019:“LIWCaufDeutsch”:Thedevelopment, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt. Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: DoWeReallyNeedtheMostFrequentWords?–Literary and Linguistic Computing 26(3),315–321.DOI:10.1093/llc/fqr031. Savoy Jacques 2015: Comparative evaluation of term selection functions for authorshipattribution.–Digital Scholarship in the Humanities30(2),246–261.DOI: 10.1093/llc/fqt047.
NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 246 ActaLinguisticaLithuanicaXCI TextAttributor 1.0 2024: TextAttributor 1.0: The system for automatic stylometric analysis of Ukrainian media texts.Availableat:ta.mova.info. Volos Yana, Levchenko Olena 2023:StatisticalprofileofValerieShevchuk’s idiostyle(morphologicallevel).–Slobozhan Scientific Bulletin, Ser. Philology,3,32–36. DOI:10.32782/philspu/2023.3.6. Zuban’Oksana2019:TheMorphemicSystemStylometricAnalysisoftheUkrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistyčni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15. Sistemul de analiză stilometrică automată a textelor din mass-media ucraineană „TextAttributor 1.0“ (metode, instrumente, funcționalitate) REZUMAT Sistemul „TextAttributor“ parametrizează statistic textele în limba ucraineană din perspectiva recunoașterii autorului și a analizei stărilor de spirit. Utilizând un set multiparametric de 15 indici statistici, „TextAttributor“ descrie particularitățile stilistice ale autorului. Acesta integrează metode precum analiza componentelor, analiza distribuției, cuantificarea și analiza stărilor de spirit, folosind dicționare și metode de învățare automată destinate identificării textului nepoliticos și a autorului. Sistemul procesează textele prin tokenizare, etichetare morfologică, analiză contextuală și sintactică și potrivirea cu un dicționar de cuvinte cu încărcătură emoțională negativă, permițând vizualizarea detaliată și evaluarea de către experți a atribuirii textului și a conținutului negativ. Experimentele confirmă capacitatea sistemului de a identifica trăsături unice ale autorului; aplicarea irįvertintitekstopanašumą,ypačpolitiniodiskursoirnemandagioskomunikacijosžiniasklaidoskonteksteRusijosirUkrainoskarometu.Straipsnyjepabrėžiamapraktinėirteorinė„TextAttributor“reikšmė,demonstruojantjosefektyvumądidelėmstekstoapimtimsir tiksliomsanalitinėmsgalimybėms.Sėkmingasžodynais,taisyklėmispagrįstųirmašininio metodelor de învățare evidențiază robustețea și universalitatea sistemului. Versiunea beta și tebevykdomųtyrimųrezultataiyranuodugniaiišnagrinėti,obūsimosjųkryptysnustatomos siekiantišplėstikalbinįkorpusąirtobulintimašininiomokymosimodelius,siekiantpagerintitikslumąirpritaikomumą.
Articole / Articles 247 Primit la The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 25 noiembrie 2024 NATALIIA DARCHUK Universitatea Națională Taras Șevcenko din Kiev Strada Volodymyrska nr. 60 Kyiv, 01033, Ucraina
[email protected] OKSANA ZUBAN Universitatea Națională Taras Șevcenko din Kyiv Strada Volodymyrska nr. 60 Kyiv, 01033, Ucraina
[email protected] VALENTYNA ROBEIKO Universitatea Națională Taras Șevcenko din Kyiv Strada Volodymyrska nr. 60 Kyiv, 01033, Ukraine valentyna.robeik[email protected] YULIIA TSYHVINTSEVA Universitatea Națională „Taras Șevcenko” din Kyiv Strada Volodymyrska nr. 60 Kyiv, 01033, Ucraina Institutul Limbii Ucrainene al Academiei Naționale de Științe a Ucrainei Strada Mykhailo Hrushevskyi nr. 4 Kyiv, 01001, Ucraina julivo[email protected] VICTOR SOROKIN Universitatea Națională Taras Șevcenko din Kyiv Strada Volodymyrska nr. 60 Kyiv, 01033, Ucraina victor.sorok[email protected] MYKOLA SAZHOK Institutul pentru tehnologii și sisteme informaționale of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine s[email protected]om