scieee AI-readable full text Open interactive document viewer

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

Nataliia Darchuk; Oksana Zuban; Valentyna Robeiko; Yuliia Tsyhvintseva; Victor Sorokin; Mykola Sazhok

Abstract

This paper presents the structure, algorithms, implementation, and experimental results of the automatic TextAttributor system developed by the authors of the paper for statistical Ukrainian-language text parameterisation using a multiparametric set of statistical indices, characterising the author’s text style and applicable to authorship attribution tasks. Based on the created linguistic resources and software, the system generates a linguistic analysis based on the calculated statistical indices and performs a comparative study of two texts. An additional criterion for statistical indexing is the text toxicity index, calculated through the method of verbal identification of toxic sentiment. Authorship and toxicity detection tasks are addressed using two methods: dictionary- and rule-based statistical calculations and machine learning. The current findings implemented in the beta version of TextAttributor are thoroughly examined.

Full text

 Straipsniai / Articles 223 NATALIIADARCHUK TarasShevchenkoNationalUniversityofKyiv ORCIDid:orcid.org/0000-0001-8932-9301 Obszary badań: lingwistyka komputerowa, lingwistyka korpusowa, lingwistyka kwantytatywna, gramatyka i semantyka języka ukraińskiego. OKSANA ZUBAN Taras Shevchenko National University of Kyiv ORCID id: orcid.org/0000-0002-2644-3892 Obszary badań: lingwistyka komputerowa, ekspertyza lingwistyczna, lingwistyka kwantytatywna, gramatyka i semantyka języka ukraińskiego. VALENTYNA ROBEIKO Taras Shevchenko National University of Kyiv ORCID id: orcid.org/0000-0003-2266-7650 Obszary badań: analiza, rozpoznawanie i synteza mowy, fonetyka, przetwarzanie języka naturalnego. YULIIA TSYHVINTSEVA Kijowski Narodowy Uniwersytet im. Tarasa Szewczenki, Instytut Języka Ukraińskiego Narodowej Akademii Nauk Ukrainy ORCID id: orcid.org/0000-0002-9684-3840 Obszary badań: neologia ukraińska, leksykologia i leksykografia. WIKTOR SOROKIN Kijowski Narodowy Uniwersytet im. Tarasa ORCIDid:orcid.org/0000-0002-3637-0535 Fieldsofresearch:automaticsyntaxanalysis,automatic Szewczenki analiza semantyczna, przetwarzanie języka naturalnego. NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 224 Acta Linguistica Lithuanica XCI MYKOŁA SAŻOK Instytut Technologii Informacyjnych i Systemów Narodowej Akademii Nauk Ukrainy ORCID id: orcid.org/0000-0003-1169-6851 Obszary badań: analiza, rozpoznawanie i synteza mowy, przetwarzanie języka naturalnego. DOI: doi.org/10.35321/all91-09 THESYSTEMFORAUTOMATIC STYLOMETRICANALYSIS OFUKRAINIANMEDIA TEXTSTEXTATTRIBUTOR1.0 (TECHNIKI, ŚRODKI, FUNKCJONALNOŚĆ) System automatycznej analizy stylometrycznej tekstów ukraińskich mediów „TextAttributor 1.0” (metody, narzędzia, funkcjonalność) ADNOTACJA W artykule przedstawiono strukturę, algorytmy, implementację oraz wyniki eksperymentalne automatycznego systemu TextAttributor, opracowanego przez autorów artykułu do statystycznej parametryzacji tekstów w języku ukraińskim za pomocą wieloparametrycznego zestawu wskaźników statystycznych charakteryzujących styl tekstu autora i mających zastosowanie w zadaniach atrybucji autorstwa. Na podstawie utworzonych zasobów lingwistycznych i oprogramowania system generuje analizę lingwistyczną opartą na obliczonych wskaźnikach statystycznych oraz przeprowadza badanie porównawcze dwóch tekstów. Dodatkowym kryterium indeksowania statystycznego jest wskaźnik toksyczności tekstu, obliczany metodą werbalnej identyfikacji sentymentu toksycznego. Zadania wykrywania autorstwa i toksyczności są realizowane za pomocą dwóch metod: obliczeń statystycznych opartych na słownikach i regułach oraz uczenia maszynowego. Aktualne wyniki zaimplementowane w wersji beta systemu TextAttributor zostały szczegółowo przeanalizowane. SŁOWA KLUCZOWE: lingwistyka komputerowa, język ukraiński, analiza sentymentu, atrybucja autorstwa, stylometria, klasyfikacja tekstu. nowy kierunek, który można określić mianem Artykuły / Articles 225 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) ANOTACIJA Šiame straipsnyje pristatoma straipsnio autorių sukurtos automatinės sistemos Struktura, algorytmy, implementacja i wyniki eksperymentalne systemu „TextAttributor”, przeznaczonego do statystycznej parametryzacji tekstów w języku ukraińskim z wykorzystaniem wieloparametrowego zestawu wskaźników statystycznych opisujących styl tekstu autora i stosowanych do zadań atrybucji autorstwa. Na podstawie opracowanych zasobów lingwistycznych i oprogramowania system generuje analizę lingwistyczną według obliczonych indeksów statystycznych oraz przeprowadza analizę porównawczą dwóch tekstów. Dodatkowym kryterium indeksowania statystycznego jest indeks tekstu wywołującego negatywne nastroje, obliczany z zastosowaniem metody werbalnej identyfikacji negatywnych nastrojów. Zadania ustalania autorstwa i złośliwości rozwiązywane są dwiema metodami: obliczeniami statystycznymi opartymi na słowniku i regułach oraz rezultatai,gautinaudojantis„TextAttributor“betaversija,išsamiaiišnagrinėti.  ESMINIAIŽODŽIAI:kompiuterinėlingvistika,ukrainiečiųkalba,jausmingumoanalizė, uczeniem maszynowym. Współczesne przypisywanie autorstwa, stylometria, klasyfikacja tekstu. 1. WPROWADZENIE Textologicalresearchgainednewscientificimportancewiththeadvancement ofcomputationallinguisticsmethods,whichcontributedtotheformationofa tekstologii cyfrowej. W ramach tej rozwijającej się dyscypliny konceptualizujemy tekstologię cyfrową jako wykorzystanie zautomatyzowanych technik lingwistyki korpusowej w połączeniu z modelami matematycznymi do ilościowej analizy tekstu. Kierując się aktualnymi zadaniami współczesnej lingwistyki kwantytatywnej i przetwarzania języka naturalnego, nasz zespół opracował system automatycznej analizy lingwistyczno-statystycznej tekstów medialnych, który został wdrożony jako aplikacja internetowa o nazwie TextAttributor (TextAttributor 1.0 2024). System realizuje cztery zadania: 1) statystyczną parametryzację tekstu; 2) stylometrię: określanie lingwistyczno-statystycznych cech idiolektu; 3) atrybucję: określanie stopnia podobieństwa między tekstami; oraz 4) analizę sentymentu: identyfikowanie leksyki negatywnego sentymentu w tekstach. Ponadto w systemie automatycznie generowane są dwa wnioski lingwistyczno-eksperckie na podstawie wyników drugiego i czwartego zadania. Wielofunkcyjność systemu TextAttributor wymaga od użytkowników zapoznania się z zasadami jego działania. Celem niniejszego artykułu jest zapoznanie akademickiej i edukacyjnej społeczności filologicznej z metodologią tworzenia systemu, jego architekturą oraz wynikami działania, aby zapewnić jasne zrozumienie jego funkcji i możliwości analitycznych, które mają szczególne znaczenie. Podejście to jest szczególnie istotne w analizie dużych zbiorów komunikacji internetowej i NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 226 ActaLinguisticaLithuanicaXCI enhancinginformationdefencestrategiesduringtheongoingRussian-Ukrainian wojny. Koncepcja opracowania przez autorów projektu automatycznego systemu textattributionarosefromtheanalysisofresearchinthefieldofUkrainian corpuslinguistics(Darčuk 2013)andstatisticalstudiesoftheauthor’s style (Darčuket al.2021;Darchuk,Sorokin2022;Zuban’2019)conductedusingthe ukraińskojęzycznych narzędzi Ukraińskiego Korpusu Językowego (KUM). informacje z tekstu, During the development of the TextAttributor system, the following methodswereemployed:componentanalysis,distributiveanalysis,andcontent analysis.Contentanalysis,aquantitativeandqualitativemethodforextracting wykorzystano przetwarzanie języka naturalnego oraz techniki statystyczne. Zastosowano również kwantyzację i analizę sentymentu. Analiza sentymentu automatycznie identyfikuje tonację tekstu na podstawie zarówno zabarwienia emocjonalnego, jak i oceny wydarzeń lub obiektów dokonanej przez autora, co osiągnięto dzięki wykorzystaniu obliczeń statystycznych opartych na słownikach i regułach. Ponadto uwzględniono metody uczenia maszynowego, w tym uczenie głębokie. Struktura statystyczna tekstu, rozumiana jako jego model ilościowy, umożliwia identyfikację jego stylu funkcjonalnego, autorstwa i okresu powstania. W niniejszej pracy komponenty struktury statystycznej wyodrębniono poprzez analizę leksykalnych i gramatycznych cech statystycznych z wykorzystaniem technik indeksowania i metryk odległości euklidesowej. Odległość euklidesowa, która mierzy odległość między dwoma punktami w n-wymiarowej przestrzeni euklidesowej, jest jedną z najczęściej stosowanych metryk w lingwistyce statystycznej do analizy skupień w stylometrii i atrybucji autorstwa. The novelty of the results is the first implementation in computational linguistics of an automated morpho-syntactic-semantic stylometric model do analizy tekstu, oparty na 15 indeksach statystycznych, które przede wszystkim parametryzują morfologiczną, a także syntaktyczną i semantyczną strukturę tekstu. Model stylometryczny to zbiór parametrów statystycznych tekstu (leksykalnych, morfologicznych, syntaktycznych itd.), na podstawie których przeprowadza się analizę porównawczą tego tekstu z modelem stylometrycznym stylu funkcjonalnego. W naszej opinii możliwe jest uzyskanie ścisłego, deterministycznego i naukowo uzasadnionego systemu wspólnych i odrębnych cech stylów, gatunków itd. poprzez zastosowanie metod statycznych przy konstruowaniu modelu stylometrycznego. Po raz pierwszy w modelu stylometrycznym wprowadzono parametr indeksu toksyczności, który charakterystycznie definiuje teksty medialne podczas wojny rosyjsko-ukraińskiej. Model ten jest realizowany nie tylko w funkcji statystycznej parametryzacji tekstów, co jest typowe dla systemów tego rodzaju, lecz także w funkcji porównywania analizowanego tekstu ze stylem medialnym języka ukraińskiego oraz w zadaniach stylometrycznych i atrybucyjnych obejmujących dwa lub więcej tekstów. Znaczenie teoretyczne obejmuje walidację dwóch metod określania toksyczności tekstu i Straipsniai / Artykuły 227 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) authorshipinUkrainian:1)throughdictionaryandrule-basedapproaches,and 2)viamachinelearning,includingdeeplearning. 2. PRACE POWIĄZANE We współczesnym językoznawstwie ukraińskim przeprowadzono znaczące badania lingwistyczno-statystyczne idiolektów ukraińskich pisarzy i poetów, w tym Tarasa Szewczenki, Łesi Ukrainki, Wasyla Stusa (Zuban’ 2019), Iwana Franki (Buk 2021), Romana Iwanyczuka (Lototska 2022), Walerija Szewczuka (Volos, Levchenko 2023), Marii Matios, Jurija Andruchowycza, Oksany Zabużko (Karasov, Levchenko 2024), Iwana Drača, Mykoły Winhra­nowskiego (Darchuk et al. 2024), Liny Kostenko (Zuban’ 2019; Darchuk et al. 2024) i innych. Badania te przeprowadzono na reprezentatywnych próbach tekstów (długich tekstach), wykorzystując głównie jeden lub kilka (nie więcej niż pięć) parametrów statystycznych, często bez stosowania porównań stylometrycznych. Ponadto, ze względu na pracochłonny charakter prowadzenia eksperymentów lingwistyczno-statystycznych, ukraińskie językoznawstwo w dużej mierze pomijało kompleksową parametryzację statystyczną, porównywanie analizowanych tekstów ze standardowymi parametrami statystycznymi stylów funkcjonalnych, określanie stopnia podobieństwa tekstów, a także analizę stylometryczną i atrybucyjną krótkich tekstów. Zastosowanie systemu TextAttributor w badaniach lingwistyczno-statystycznych, ukierunkowane na automatyczne wykonywanie tych zadań, nie tylko dostarczy charakterystyk frekwencyjnych zjawisk językowych, lecz także umożliwi efektywną analizę stylometryczną, której wynikiem będzie ekspertyza. System TextAttributor ma przewagę nad swoimi odpowiednikami w nauce światowej. Większość istniejących systemów i modeli koncentruje się również na wykorzystaniu pojedynczych modułów lingwistyczno-statystycznych do identyfikacji jednego lub kilku, głównie formalnych (n-gramów, najczęściej występujących słów, liter), parametrów tekstu (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). Natomiast TextAttributor 1.0 oferuje kompleksowe podejście, obejmujące interaktywną analizę statystyczną leksykalnej, morfologicznej, syntaktycznej i semantycznej struktury tekstu w czasie rzeczywistym w odniesieniu do 15 parametrów. Atrybucja tekstów jest aktywnie rozwijana w zagranicznych badaniach tekstologicznych; w szczególności skuteczność metody Burrowsa (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) jest testowana w wielu badaniach na dużych zbiorach danych tekstowych reprezentujących różne style, takich jak: proza angielska z początku XX wieku (Hoover 2004); współczesna poezja angielska (Hoover 2005); utwory poetyckie w języku łacińskim (Rybicki, Eder 2011); utwory prozatorskie głównych gatunków w języku angielskim, francuskim, włoskim, niemieckim, polskim, węgierskim, a także łacińskim i arabskim (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015); teksty polityczne w języku angielskim, w tym NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 228 ActaLinguisticaLithuanicaXCI theattributionofspeechesofAmericanpresidents(Savoy2015).Onemore zautomatyzowana metoda analizy lingwistycznej o nazwie „Linguistic Inquiry and Word Count” (LIWC) jest wdrażana jako aplikacja komercyjna i dostosowywana do kilku języków (Meier et al. 2019; LIWC-22). W ostatnich latach w zadaniach automatycznej atrybucji tekstów stosowano głównie albo regułowe metody stylometryczne, albo metody głębokiego uczenia (Eder 2015; Canhasi et al. 2022). Obie metody wdrożono w systemie TextAttributor; działają one skutecznie, lecz dają różne wyniki: 1) metoda regułowa umożliwia automatyzację generowania wniosków lingwistycznych dotyczących idiolektu i toksyczności tekstu; 2) metoda uczenia maszynowego określa jedynie stopień toksyczności i podobieństwo tekstów oraz może być stosowana w zadaniach klasyfikacyjnych do monitorowania treści tekstowych. Najnowsze metody uczenia maszynowego stosowane w analizie sentymentu i identyfikacji autorstwa tekstów opierają się na podejściach statystycznych (TF-IDF, Latent Dirichlet Allocation) oraz technikach głębokiego uczenia o różnych architekturach (CNN, LSTM, BERT) w połączeniu z metodami stylometrycznymi (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). Raportowane wyniki są w dużym stopniu zależne od liczby klas (typów toksyczności, autorów), gatunku, długości tekstu, a przede wszystkim od objętości prawidłowo anotowanego korpusu tekstowego wykorzystanego w procedurze treningowej. Tym samym wysokie wskaźniki dokładności w zadaniach wykrywania toksyczności i mowy nienawiści przekraczają 90% przy użyciu korpusu zawierającego dziesiątki tysięcy dokumentów (Alkomah, Ma 2022). Na przykład ponad 90% dokładności w atrybucji autorstwa osiąga się dla anglojęzycznych utworów literackich 1000 autorów, przy użyciu korpusu 6000 dokumentów dla 15 autorów. Identyfikacja oraz analiza sentymentu/toksyczności są słabo zbadanymi problemami 3. OGÓLNA CHARAKTERYSTYKA DZIAŁANIA turn,forcorporacontaininglessthan1500documentsthereportedaccuracy isabout70%(Khanet al.2023).FortheUkrainianlanguage,textauthorship SYSTEMU TEXTATTRIBUTOR Podczas opracowywania systemu TextAttributor zrealizowano (Lupeiet al.2020),moreover,suchsystemsdonotproducelinguisticexpertise andcannotbeusedastoolsforlinguisticresearch. następujące zadania: 1) Lingwistyka teoretyczna: opracowano metodologię sformalizowanych analiz morfologicznych, statystycznych, stylometrycznych, atrybucyjnych i sentymentu; 2) Inżynieria oprogramowania: opracowano strukturę lingwistycznych baz danych oraz oprogramowanie do wspomnianych zautomatyzowanych analiz; 3) Lingwistyka eksperymentalna: system przetestowano na ukraińskich tekstach medialnych i wdrożono moduł analityczny do automatycznego badania stylometrycznego. Zautomatyzowany system lingwistyczny, wdrożony jako aplikacja internetowa, przetwarza wprowadzone przez użytkownika teksty w stylu medialnym, generując wartości liczbowe parametrów statystycznych charakteryzujących  Straipsniai / Articles 229 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) atrybuty tekstu. System działa według ustrukturyzowanej sekwencji operacji: 1. Tokenizacja tekstu: Podział tekstu na zdania i słowa w celu przeprowadzenia analizy. 2. Etykietowanie morfologiczne: Przypisywanie słowom etykiet na podstawie ich form gramatycznych. 3. Analiza kontekstowa: Aktualizowanie etykiet morfologicznych z uwzględnieniem kontekstu. 4. Analiza składniowa: Ustalanie relacji binarnych między słowami w zdaniach w celu zrozumienia ich struktury gramatycznej. 5. Ustalanie relacji składniowych: Określanie powiązań składniowych na podstawie wcześniej zdefiniowanych reguł. 6. Dopasowywanie emocjonalnie negatywnego słownictwa: Identyfikowanie słów ze wstępnie zdefiniowanego zbioru negatywnego słownictwa. 7. Ocena parametrów statystycznych: Ocena parametrów statystycznych tekstu wejściowego z wykorzystaniem automatycznie kompilowanych słowników częstości. 8. Wizualizacja wyników: Przedstawianie rezultatów parametryzacji statystycznej graphically,withempiricalvaluesandconfidenceintervals. 9.Comparison of Results:Visualizingstatisticalparameterizationoutcomes fortwomedia-styletexts,facilitatingcomparison. 10.Euclidean Distance Evaluation:Quantifyingthedissimilaritybetween twomedia-styletexts. 11. Generowanie opinii eksperckiej: Generowanie dwóch opinii eksperckich: jednej dotyczącej atrybucji tekstu, a drugiej dotyczącej toksyczności tekstu poprzez analizę lingwistyczną. 12. Wykrywanie toksyczności i identyfikacja autorstwa: Wykorzystanie technik uczenia maszynowego, w szczególności modeli sieci neuronowych, do wykrywania toksyczności i identyfikowania autorów. Wyniki działania systemu są uporządkowane w następujących sekcjach: Grupa wskaźników atrybucji tekstu, Opinia ekspercka dotycząca atrybucji tekstu, Porównanie atrybucji tekstu, Ekspertyza lingwistyczna dotycząca toksyczności tekstu oraz Sieć neuronowa Opinie. In Text Attribution Index Group (Fig. 1), statistical parameters are organizedbasedontheinputtext:column1displaystheIndextitle,column 2 przedstawia empiryczną wartość liczbową, a kolumna 3 zapewnia wizualne odniesienie poprzez porównanie wartości empirycznej wskaźnika z przedziałem ufności NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 230 Acta Linguistica Lithuanica XCI wartości progowe (dolna i górna) wyprowadzone z ukraińskich tekstów o stylu medialnym. Empiryczna wartość liczbowa jest przedstawiona na skali za pomocą wypełnionego odwróconego trójkąta. RYSUNEK 1: Fragment wyniku atrybucji tekstu W części Opinia eksperta (rys. 2) przedstawiamy wnioski dotyczące typowych lub indywidualnych lingwistycznych cech statystycznych wyodrębnionych z analizowanego tekstu dla każdego oszacowanego wskaźnika. Wnioski te wynikają z odpowiedzi na pytanie: Czy wartość liczbowa wskaźnika mieści się w przedziale ufności stylu medialnego języka ukraińskiego? Na podstawie porównania wartości liczbowych z wartościami progowymi przedziału ufności system generuje trzy możliwe odpowiedzi (typowe oznaki stylu medialnego, oznaki idiostylu niższe niż normalny styl medialny oraz oznaki idiostylu wyższe niż normalny styl medialny). W części Porównanie atrybucji tekstu (rys. 4, podrozdział 4.2), po wybraniu opcji „Oblicz odległość wektorową” dane tabelaryczne są niezwłocznie aktualizowane w następujący sposób: Kolumna 1 zawiera teksty wprowadzone przez użytkownika wraz z wcześniej analizowanym tekstem; Kolumna 2 wyświetla liczbę zdań w każdym tekście; Kolumna 3 pokazuje liczbę słów; Kolumna 4 przedstawia odległość euklidesową między analizowanym tekstem a każdym tekstem w tabeli; Kolumna 5, zatytułowana „Porównaj”, initiatesanautomaticcomparisonofstatisticalindicesbetweentheanalyzedtext andtheselectedtext.Uponactivatingthecorresponding“Compare”element, comprehensiveinformationonthestatisticalcomparisonbetweentwotextsis providedinthe“TextAttributionIndices”group(Fig.3). Straipsniai / Artykuły 231 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) RYSUNEK 2: Przykład wygenerowanego modelu opinii eksperta, który określa ilościowo In Linguistic Expertise of Text Toxicity (subsection 4.3), a lexicalsemanticinterpretationofthecalculatedtoxicityindexispresented(Fig.6). InNeural Network Opinionswepresenttheoutputofourdeeplearning toksyczność tekstu w skali od 0 (nietoksyczny) do 1 (wysoka toksyczność). Oceniamy również podobieństwo tekstu do znanych autorów, przy czym wartości mieszczą się w zakresie od 0 (brak podobieństwa) do 1 (wysokie podobieństwo), na podstawie autorów, na których tekstach wytrenowano model. Wyniki są wyświetlane wyłącznie dla testów, w których miara podobieństwa przekracza 0,1. Nasz obecny system działa w trybie demonstracyjnym, wykorzystując ograniczony korpus tekstów autorów do oceny podobieństwa z tekstem wprowadzonym przez użytkownika. 4. ATRYBUCJA TEKSTÓW UKRAIŃSKOJĘZYCZNYCH: EKSPERYMENTY, WYNIKI I DYSKUSJA 4.1. Wskaźniki parametryzacji statystycznej Opracowany model stylometryczny realizuje dwa zadania: 1) Identyfikowanie indywidualnych cech stylu autora (stylometria); 2) Ocenianie podobieństwa między dwoma tekstami na podstawie parametrów lingwistycznych i statystycznych (atrybucja). NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 238 Acta Linguistica Lithuanica XCI Obecnie komponent informacyjny stał się szczególnie ważny w wojnie hybrydowej. Dlatego materiałem naszego badania był korpus badawczy internetowych tekstów medialnych dyskursu politycznego o objętości 10 milionów słów. Terminu „tekst toksyczny” używamy w szerokim znaczeniu. Teksty te charakteryzują się nękaniem, groźbami, obscenicznością, cyberprzemocą, trollingiem i tekstami nienawiści opartymi na tożsamości, a także zawierają emotiogeny, czyli zjawiska i obiekty wywołujące u człowieka negatywne emocje (np. wojna, nalot, korupcja). Celem projektu było określenie potencjału realizacji negatywnego sentymentu w tekstach ukraińskich oraz opracowanie zautomatyzowanego systemu identyfikacji treści toksycznych. Zadanie to obejmowało dwa następujące po sobie podzadania: po pierwsze, opracowanie systemu lingwistycznego badania tekstów toksycznych z określeniem wskaźników toksyczności za pomocą analizy słownikowej i metod opartych na regułach; po drugie, skonstruowanie zbioru danych treningowych do celów uczenia maszynowego oraz opracowanie sieci neuronowej przewidującej wskaźniki toksyczności tekstu. Przyjrzyjmy się realizacji pierwszego zadania. Obejmowało ono konstrukcję osób (1620), terminów obscenicznych (613) i obraźliwego języka (787). Przykłady obejmują westerner (западенець: obraźliwa nazwa osób z zachodnich regionów Ukrainy) oraz ofalexicographicdatabasehousingthreedistinctdictionaries: 1)Emotiogendictionary:Acompilationof5000words(accordingtothe meaningsoflexical-semanticvariants)withnegativesentimenttones,ratedon ascaleof–2.Examplesincludeimmoral,impunity,briberyandsteal; 2) Hate Speech Dictionary: Comprising 3000 words, including names of huckster; 3) Toksyczne frazy: Zbiór 1500 wyrażeń idiomatycznych wyrażających negatywne emocje. Przykłady obejmują grymasy jak małpa, całuje swój tyłek i otwiera usta. Każdy wpis na tych listach opatrzono adnotacją dotyczącą cech semantycznych; Słownik mowy nienawiści zawierał 18 cech, a lista Toksycznych fraz — 26. Na przykład słowa w Słowniku mowy nienawiści oznaczano charakterystykami takimi jak ‘s’ w przypadku seksizmu, ‘r’ w przypadku rasizmu i ‘e’ w przypadku ageizmu. Ta baza leksykograficzna, będąca systemem multiparametrycznym, przypisuje jednostkom (słowom lub frazom) cechy semantyczne, co w połączeniu z danymi frekwencyjnymi z analizowanego tekstu umożliwia analizę toksyczności. Wskaźnik toksyczności tekstu oblicza się według wzoru: Itox = (e + |K| (m + t)) / n * 10, Tutaj n oznacza objętość tekstu; e to liczba słów nacechowanych emocjonalnie; m to liczba słów mowy nienawiści; t to liczba toksycznych fraz; K to współczynnik równy –2, podkreśla on słowa mowy nienawiści i toksyczne frazy, które w skali  Straipsniai / Articles 239 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) pięciu cyfr (+2, +1, 0, –1, –2) odpowiadają wartości –2. Wartości wskaźnika wahają się od 0 do +1. Na przykład wskaźnik toksyczności tekstu „People with a red pen (Люди з червоною ручкою)” (12 zdań, 129 słów) wynosi 1.01, co wskazuje na jego wysoką toksyczność, ponieważ próg dla tak krótkich tekstów mieści się w zakresie od 0.1 do 0.7. Jednocześnie system generuje wyniki automatycznej lingwistycznej ekspertyzy toksyczności tekstu (zob. rys. 6), obejmujące: 1) statystyczną mapę klas semantycznych słownictwa negatywnego zgodnie z markerami klasyfikacyjnymi list leksykograficznych (emotiogeny – 5, wulgaryzmy – 2, seksizm – 2); 2) tekst zawierający konkretne słowa o negatywnym nacechowaniu, werbalizujące kategorie mapy statystycznej. Przyjrzyjmy się fragmentowi analizowanego tekstu z życia codziennego (rys. 6): those people who walk around with a red pen and correct mistakes in other people’s posts: who even are you? Do you have any idea how annoying you are? I study your profiles on purpose, I’m curious about the world you exist in. This world scares me a lot. I sincerely hope that in real life we will not cross paths under any circumstances. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляеєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересічемося ні за яких обставин). Tutaj system automatycznie wyróżnia pogrubieniem następujące słowa zawierające komponent negatywny: mistakes (помилки), other people’s (чужих), annoying (бісите), scares (лякає). RYSUNEK 6: Fragment automatycznej lingwistycznej ekspertyzy toksyczności tekstu NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 240 Acta Linguistica Lithuanica XCI 5. MACHINELEARNINGAPPROACHES: EXPERIMENTS,RESULTSAND DYSKUSJE Skupmy się na drugim trybie działania systemu TextAttributor, poświęconym technikom uczenia maszynowego. Na wejściu do trenowania modelu mamy korpusy tekstów oznaczone zgodnie z celem każdego podzadania: (a) wykrywanie toksyczności w informacjach tekstowych oraz (b) identyfikacja autorstwa. Każdy korpus jest dzielony na zbiory treningowy i kontrolny, a także — w przypadku korpusu o wystarczająco dużych rozmiarach — na zbiór walidacyjny. Parametry wybranego modelu rozwiązywania problemu są szacowane na zbiorze treningowym. Hiperparametry modelu są dostrajane przez the the current models were trained on validationset.Thefinalperformanceindicatorsofthemodelaremeasuredona controlset,takingintoaccounttheavailabilityofcomputingresources,which arenecessaryforthemodel’soperability.Acorpusforeachsubtaskhasbeen developedinparallelwiththeTextAttributormachinelearningcomponent,so relatively small data including short Internet texts of Ukrainian-language blogs, comments, articles, etc. 5.1. Wykrywanie toksyczności W wyniku serii badań eksperymentalnych wybrano wydajną obliczeniowo architekturę opartą na metodzie fastText i jej narzędziach (Joulin et al. 2016). Metoda ta zapewnia osadzenia słów i szacuje rozkład prawdopodobieństwa dokumentów według wcześniej zdefiniowanych klas. Słowa są przedstawiane w postaci wektorowej na podstawie automatycznego dzielenia słów na części (podwyrazy), co symuluje otwartość słownika. Reprezentacja podwyrazowa jest istotna, ponieważ język ukraiński jest wysoko fleksyjny, a ponadto należy uwzględnić wiele niewystępujących wcześniej słów oraz słów z błędami ortograficznymi. Skuteczność zastosowanego podejścia zależy również od technicznych warunków działania systemu i dostępnych zasobów tekstowych wykorzystywanych do trenowania modelu. Przygotowany korpus obejmujący około 12 000 dokumentów tekstowych wykorzystano do klasyfikacji binarnej w celu wykrywania treści toksycznych. Najlepszy wynik, oparty na uogólnionej metryce (F1 = 79,4%), osiągnięto przy następujących ustawieniach hiperparametrów: wymiarowości wektora słowa równej 56, początkowym współczynniku uczenia wynoszącym 0,15, 500 epokach treningu, kontekście leksykalnym reprezentowanym przez bigramy, długościach podwyrazów od 2 do 5 znaków oraz progu decyzyjnym wynoszącym 0,4. Ponadto model wykazał czułość na poziomie 85%, osiągając dokładność około 70%.  Straipsniai / Articles 241 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 5.2. Identyfikacja autorstwa Badania eksperymentalne modeli identyfikacji autorstwa tekstów przeprowadzono z wykorzystaniem części korpusu publicznie dostępnych tekstów społeczno-politycznych, w których możliwe jest ustalenie osoby będącej autorem dokumentu. Wybrano łącznie 702 teksty czterech autorów, którzy opublikowali największą liczbę dokumentów o długości od 60 do 1000 znaków. Największa liczba publikacji autora wynosi 304 (115 tysięcy znaków), a najmniejsza 109 (49 tysięcy znaków). Do testów losowo wybrano po 25 tekstów każdego z wybranych autorów. Pozostałe dokumenty utworzyły zbiór treningowy. spośród 50, początkowego współczynnika uczenia 0,1, 50 epok treningowych, kontekstu leksykalnego Thebestresult,accordingtothegeneralizedmetric(F1=81%),wasachieved withthefollowinghyperparametervalues:awordembeddingspacedimension reprezentowanego przez bigramy, długości podwyrazów wynoszących od 2 do 5 znaków, i osiągnęły 100%, przy dokładności przekraczającej 90%. Wyniki te dowodzą wykonalności adecision-makingthresholdof0.5.Notably,forcertainmodelconfigurations, thesensitivitytotheauthorwiththelargestnumberofdocumentsinthedataset opracowania skutecznego systemu zdolnego do dokładnego przypisywania tekstów autorom wystarczająco reprezentowanym w zbiorze treningowym. Wytrenowane modele sieci neuronowych zintegrowano z systemem TextAttributor w architekturze „klient-serwer”, w której przedstawiane są wyniki dwóch zadań: (a) określania toksyczności oraz (b) wykrywania autorstwa. Wynik działania systemu na tekście „Ustawy Ukrainy o szkolnictwie wyższym”: indeks toksyczności (ocena w postaci prawdopodobieństwa: na ile tekst jest toksyczny) – 0,04, podobieństwo do autorów (oceny w postaci prawdopodobieństwa autorstwa dla autorów znanych systemowi): 0,49 dla I. Farion, 0,30 dla Oleksii Honcharenko oraz 0,22 dla Mariana Bezuhla. 6. WNIOSKI System TextAttributor jest obecnie na etapie testów mających na celu rozwiązanie problemów przypisywania autorstwa i określania toksyczności w tekstach w języku ukraińskim. System ten jest zarówno wygodny, jak i skuteczny w różnorodnych badaniach technologicznych. W ciągu 5 miesięcy aplikacja internetowa TextAttributor automatycznie przeanalizowała 784 teksty ukraińskie 226 użytkowników. Nasze ustalenia dowodzą skuteczności naszej metody, która polega na kwantyzacji elementów werbalnych na podstawie formalnych parametrów gramatycznych i semantycznych, particularlyfornegativeemotionality.Thisisachievedthroughacombination ofdictionaryandrule-basedapproaches,complementedbymachinelearning NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 242 Acta Linguistica Lithuanica XCI oraz autorów) odnotowane dla innych języków. techniques.Experimentalmachinelearningresearchfortoxicitydetectionand authorship identification bytext allowed us toobtainresults comparable to resultsofexperimentswithsimilarmodelcharacteristics(numberofdocuments Modele podwyrazowe wykazały zwiększoną skuteczność weryfikacji autorstwa i robustnessagainstlexicalopennessandtextualerrors. TheconductedresearchpavesthewayforsolvingsuchproblemsforUkrainian as detectingand monitoringtoxic content,hate speechandmisinformation, deszyfryzacji, profilowania autorów i diarizacji, profilowania psycholingwistycznego, modelowania stylu oraz śledzenia źródła fałszywych treści itd. Opracowany schemat analizy i przypisywania tekstów można również zastosować do innych języków. W przyszłości planujemy zintegrować nasze narzędzie do automatycznego przypisywania autorstwa tekstów i wykrywania toksyczności z analizą semantyczną, syntaktyczną, psycholingwistyczną i socjolingwistyczną. Integracja ta pozwoli nam lepiej zrozumieć wpływ na czytelnika. Wykorzystując analizę semantyczną taksonomii leksykalnej, zamierzamy identyfikować elementy narracyjne właściwe dla tekstu, zwiększając tym samym wiarygodność przypisywania tekstu w procedurach identyfikacji autorstwa. Ponadto planujemy rozszerzyć nasze korpusy tekstów i wykorzystać wielojęzyczne duże modele językowe, aby jeszcze bardziej zwiększyć możliwości naszego systemu, a także wdrożyć narzędzia do statystycznego porównywania tekstów dla wszystkich stylów języka ukraińskiego. Podziękowania The system has been created within a project supported by the British EmbassyinKyivandcarriedoutbyateamofeducatorsandresearchersofthe Katedra Języka Ukraińskiego i Lingwistyki Stosowanej, Narodowy Uniwersytet im. Tarasa Szewczenki Uniwersytet Kijowski. Pragniemy wyrazić naszą szczerą wdzięczność Ambasadzie Brytyjskiej w Kijowie za finansowe wsparcie tego projektu badawczego. Jesteśmy wdzięczni Switłanie Jaworskiej i Irynie Bezkorowajnej za wskazówki i pomoc na wszystkich etapach projektu. Szczególne podziękowania kierujemy do Kostiantyna Honczarenki za organizacyjne i dokumentacyjne wsparcie projektu. Ponadto jesteśmy wdzięczni studentom programu edukacyjnego „Lingwistyka stosowana (komputerowa) i język angielski” Narodowego Uniwersytetu im. Tarasa Szewczenki w Kijowie. Wnieśli oni swój czas, wiedzę specjalistyczną i wysiłek w tworzenie korpusu ukraińskich tekstów toksycznych. Jesteśmy wdzięczni Oksanie Tołoczko, absolwentce naszego programu studiów licencjackich, za stworzenie słownika tonalnego języka ukraińskiego, którego użyliśmy do opracowania listy leksykograficznej negatywnych emotiogenów. Ponadto jesteśmy głęboko wdzięczni Mykole Kostikowowi za wysiłek włożony w proces gromadzenia danych. Pragniemy wyrazić naszą szczerą wdzięczność wszystkim członkom środowiska badawczego, którzy przyczynili się do thisstudywiththeiradviceandconsultations.  Straipsniai / Articles 243 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) REFERENCES ALIAS–Automated Linguistic Identification & Assessment System.Availableat:https:// aliastechnology.com/alias-overview/. Alkomah Fatimah, Ma Xiaogang 2022:ALiteratureReviewofTextualHate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/ info13060273. ArgamonShlomo2007:InterpretingBurrows’sDelta:GeometricandProbabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/ fqn003. Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023:ComparisonbetweenMachine LearningandDeepLearningApproachesfortheDetectionofToxicCommentson SocialNetworks.–Applied Sciences13(10),6038.DOI:10.3390/app13106038. Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts,LNUimeniIvanaFranka[IvanFranko NationalUniversityofLviv]. Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to LikelyAuthorship.–Literary and Linguistic Computing17(3),267–287.DOI:10.1093/ llc/17.3.267. Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparingtechniquesforauthorshipattributionofsourcecode.–Software: Practice and Experience44(1),1–32.DOI:10.1002/spe.2146. CanhasiErcan,KadriuArbana,MisiniArta2022:ASurveyonAuthorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/ seeur-2022-0100. ChuhunovVadym2009:Diahnostyka v psykhoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv:Nauka. Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and IntelligentSystems(COLINS-2022)1:Main Conference,eds.V.Lytvyn,N.Sharonova, I.Jonek-Kowalska,A.Kowalska-Styczen,V.Vysotska,Ye.Kupriianov,O.Kanishcheva, O.Cherednichenko,Th.Hamon,N.Grabar,Poland,12–13May,2022,256–265. Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 244 ActaLinguisticaLithuanicaXCI sentences.–Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies1(35),5–10.DOI:10.17721/1728-2659.2024.35.01. Darčuk Natalija 2013: Kompjuterne anotuvannja ukrajins’koho tekstu: rezul’taty i perspektyvy,Kyiv:OsvitaUkrajiny. DarčukNatalija,Vasyl’jevaIryna,Vasyl’jevOleksij2021:Vektornamodel’ analizustylistykytekstiv.–Ukrajins’kyj fizyčnyj žurnal66(5),373–378. Eder Maciej 2015:Doessizematter?Authorshipattribution,smallsamples,big problem.–Digital Scholarship in the Humanities30(2),167–182.DOI:10.1093/llc/ fqt066. Eder Maciej, Rybicki Jan 2013:Dobirdsofafeatherreallyflocktogether,or howtochoosetrainingsamplesforauthorship attribution.–Literary and Linguistic Computing28(2),229–236.DOI:10.1093/llc/fqs036. EvertStefan,ProislThomas,SchöchChristof,JannidisFotis,Pielström Steffen, Vitt Thorsten 2015:ExplainingDelta,or:Howdodistancemeasures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom,21July2015,eds.F.Formato,A.Hardie,Lancaster:UCREL.Availableat: https://zenodo.org/records/18308. GuptaShriyaT.P.,SahooJajatiK.,RoulRajendraK.2019:Authorship identificationusingrecurrentneuralnetworks.–ICISDM’19:Proceedingsofthe2019 3rdInternationalConferenceonInformationSystemandDataMining,UnitedStates, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935. Hoover David 2004:TestingBurrows’sdelta.–Literary and Linguistic Computing 19(4),453–475.DOI:10.1093/llc/19.4.453. HooverDavid2005:Delta,DeltaPrime,andModernAmericanPoetry:Authorship AttributionTheoryandMethod.–ACH/ALLC 2005:Proceedingsofthe17thJoint InternationalConferenceoftheAssociationforComputersandtheHumanities(ACH) andtheAssociationforLiteraryandLinguisticComputing,Canada,15–18June2005, UniversityofVictoria:HumanitiesComputingandMediaCentre,79–80. JannidisFotis,PielströmSteffen,SchöchChristof,VittThorsten2015: ImprovingBurrows’Delta–Anempiricalevaluationoftextdistancemeasures.–DH 2015:DigitalHumanities,AbstractsoftheGlobalDigitalHumanitiesConference11, Australia,29June–3July2015,Sydney.DOI:https://zenodo.org/records/1321296. Joulin Armand, Grave Edouard, Bojanowski Piotr, Douze Matthijs, JégouHérve,MikolovTomas2016:FastText.zip:Compressingtextclassification models.–ArXiv e-prints 1612.03651.DOI:10.48550/arXiv.1612.03651.  Straipsniai / Articles 245 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Karasov Vitalii, Levchenko Olena 2024:StatisticalprofileofO.Zabuzhko’s idiostyle. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems,Lviv,April12–13,2024, 251–264. KhanTalhaF.,AnwarWaheed,ArshadHumera,AbbasSyedN.2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ ACCESS.2023.3299565. KhomytskaIryna,TeslyukVasyl,BazylevychIryna,KaramyshevaIryna 2023:AutomatedIdentificationofAuthorialStyles.–CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol3396/paper26.pdf. KUM–Korpus ukrajins’koji movy:LinhvistyčnyjportalMova.info.Availableat:http:// www.mova.info/corpus.aspx. LIWC-22–Linguistic Inquiry and Word Count.Availableat:https://www.liwc.app. Lototska Nataliia 2022:StatisticalCharacteristicsofRomanIvanychuk’sIdiolect (BasedonWriter’sTextCorpus).–CEUR Workshop Proceedings3171,487–500. LupeiMaksym,MitsaAlexander,RepariukVolodymyr,SharkanVasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style usingneuralnetworks.–Eastern-European Journal of Enterprise Technologies1/2(103), 30–36.DOI:10.15587/1729-4061.2020.195041. McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform ManifoldApproximationandProjectionforDimensionReduction.–ArXiv e-prints 1802.03426.DOI:10.48550/arXiv.1802.03426. MeierTabea,BoydRyan,PennebakerJames,MehMatthiasl,Martin Mike,WolfMarkus,HornAndrea2019:“LIWCaufDeutsch”:Thedevelopment, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt. Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: DoWeReallyNeedtheMostFrequentWords?–Literary and Linguistic Computing 26(3),315–321.DOI:10.1093/llc/fqr031. Savoy Jacques 2015: Comparative evaluation of term selection functions for authorshipattribution.–Digital Scholarship in the Humanities30(2),246–261.DOI: 10.1093/llc/fqt047. NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 246 ActaLinguisticaLithuanicaXCI TextAttributor 1.0 2024: TextAttributor 1.0: The system for automatic stylometric analysis of Ukrainian media texts.Availableat:ta.mova.info. Volos Yana, Levchenko Olena 2023:StatisticalprofileofValerieShevchuk’s idiostyle(morphologicallevel).–Slobozhan Scientific Bulletin, Ser. Philology,3,32–36. DOI:10.32782/philspu/2023.3.6. Zuban’Oksana2019:TheMorphemicSystemStylometricAnalysisoftheUkrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistyčni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15. System automatycznej analizy stylometrycznej tekstów ukraińskich mediów „TextAttributor 1.0“ (metody, narzędzia, funkcjonalność) STRESZCZENIE System „TextAttributor” dokonuje statystycznej parametryzacji tekstów w języku ukraińskim w aspekcie rozpoznawania autorstwa i analizy nastrojów. Wykorzystując wieloparametrowy zestaw 15 indeksów statystycznych, „TextAttributor” opisuje autorskie cechy stylistyczne. Integruje takie metody jak analiza komponentowa, analiza dystrybucyjna, kwantyzacja i analiza nastrojów z wykorzystaniem słowników oraz metod uczenia maszynowego, przeznaczonych do wykrywania nieuprzejmego tekstu i autorstwa. System przetwarza teksty, stosując tokenizację, znakowanie morfologiczne, analizę kontekstową i składniową oraz dopasowanie do słownika emocjonalnie negatywnego, co pozwala na szczegółową wizualizację i ekspercką ocenę przypisania tekstu oraz jego negatywnej treści. Eksperymenty potwierdzają zdolność systemu do ustalania unikalnych cech irįvertintitekstopanašumą,ypačpolitiniodiskursoirnemandagioskomunikacijosžiniasklaidoskonteksteRusijosirUkrainoskarometu.Straipsnyjepabrėžiamapraktinėirteorinė„TextAttributor“reikšmė,demonstruojantjosefektyvumądidelėmstekstoapimtimsir tiksliomsanalitinėmsgalimybėms.Sėkmingasžodynais,taisyklėmispagrįstųirmašininio autora zastosowanie metod uczenia podkreśla solidność i uniwersalność systemu. Wersja beta i tebevykdomųtyrimųrezultataiyranuodugniaiišnagrinėti,obūsimosjųkryptysnustatomos siekiantišplėstikalbinįkorpusąirtobulintimašininiomokymosimodelius,siekiantpagerintitikslumąirpritaikomumą. Artykuły / Articles 247 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Nadesłano 25 listopada 2024 r. NATALIIA DARCHUK Narodowy Uniwersytet im. Tarasa Szewczenki w Kijowie ul. Wołodymyrska 60 Kijów, 01033, Ukraina [email protected] OKSANA ZUBAN Kijowski Narodowy Uniwersytet im. Tarasa Szewczenki ul. Wołodymyrska 60 Kijów, 01033, Ukraina [email protected] VALENTYNA ROBEIKO Kijowski Narodowy Uniwersytet im. Tarasa Szewczenki ul. Wołodymyrska 60 Kyiv, 01033, Ukraine valentyna.robeik[email protected] YULIIA TSYHVINTSEVA Kijowski Narodowy Uniwersytet im. Tarasa Szewczenki ul. Wołodymyrska 60 Kijów, 01033, Ukraina Instytut Języka Ukraińskiego Narodowej Akademii Nauk Ukrainy ul. Mychajła Hruszewskiego 4 Kijów, 01001, Ukraina julivo[email protected] VICTOR SOROKIN Kijowski Narodowy Uniwersytet im. Tarasa Szewczenki ul. Wołodymyrska 60 Kijów, 01033, Ukraina victor.sorok[email protected] MYKOŁA SAŻOK Instytut technologii informacyjnych i systemów of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine s[email protected]om