scieee AI-readable full text Open interactive document viewer

The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality)

Nataliia Darchuk; Oksana Zuban; Valentyna Robeiko; Yuliia Tsyhvintseva; Victor Sorokin; Mykola Sazhok

Abstract

This paper presents the structure, algorithms, implementation, and experimental results of the automatic TextAttributor system developed by the authors of the paper for statistical Ukrainian-language text parameterisation using a multiparametric set of statistical indices, characterising the author’s text style and applicable to authorship attribution tasks. Based on the created linguistic resources and software, the system generates a linguistic analysis based on the calculated statistical indices and performs a comparative study of two texts. An additional criterion for statistical indexing is the text toxicity index, calculated through the method of verbal identification of toxic sentiment. Authorship and toxicity detection tasks are addressed using two methods: dictionary- and rule-based statistical calculations and machine learning. The current findings implemented in the beta version of TextAttributor are thoroughly examined.

Full text

 Straipsniai / Articles 223 NATALIIADARCHUK TarasShevchenkoNationalUniversityofKyiv ORCIDid:orcid.org/0000-0001-8932-9301 Kutatási területek: számítógépes nyelvészet, korpusznyelvészet, kvantitatív nyelvészet, a ukrán nyelv grammatikája és szemantikája. OKSANA ZUBAN Tarasz Sevcsenko Kijevi Nemzeti Egyetem ORCID-azonosító: orcid.org/0000-0002-2644-3892 Kutatási területek: számítógépes nyelvészet, nyelvészeti szakértői vizsgálat, kvantitatív nyelvészet, a ukrán nyelv grammatikája és szemantikája. VALENTYNA ROBEIKO Tarasz Sevcsenko Kijevi Nemzeti Egyetem ORCID-azonosító: orcid.org/0000-0003-2266-7650 Kutatási területek: beszédelemzés, beszédfelismerés és beszédszintézis, fonetika, természetesnyelv-feldolgozás. YULIIA TSYHVINTSEVA A Kijevi Tarasz Sevcsenko Nemzeti Egyetem, az Ukrán Nemzeti Tudományos Akadémia Ukrán Nyelvi Intézete ORCID-azonosító: orcid.org/0000-0002-9684-3840 Kutatási területek: ukrán neológia, lexikológia és lexikográfia. VICTOR SOROKIN A Kijevi Tarasz Sevcsenko Nemzeti Egyetem ORCIDid:orcid.org/0000-0002-3637-0535 Fieldsofresearch:automaticsyntaxanalysis,automatic szemantikai elemzés, természetesnyelv-feldolgozás. NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 224 Acta Linguistica Lithuanica XCI MYKOLA SAZHOK Az Ukrán Nemzeti Tudományos Akadémia Információtechnológiai és Rendszerintézete ORCID-azonosító: orcid.org/0000-0003-1169-6851 Kutatási területek: beszédelemzés, beszédfelismerés és beszédszintézis, természetesnyelv-feldolgozás. DOI: doi.org/10.35321/all91-09 THESYSTEMFORAUTOMATIC STYLOMETRICANALYSIS OFUKRAINIANMEDIA TEXTSTEXTATTRIBUTOR1.0 (TECHNIKÁK, ESZKÖZÖK, FUNKCIONALITÁS) Az ukrán médiában megjelenő szövegek automatikus stilometriai elemzésének rendszere „TextAttributor 1.0” (módszerek, eszközök, funkcionalitás) ANNOTÁCIÓ A tanulmány bemutatja a cikk szerzői által kidolgozott, TextAttributor nevű automatikus rendszer felépítését, algoritmusait, megvalósítását és kísérleti eredményeit. A rendszer az ukrán nyelvű szövegek multiparametrikus statisztikai indexkészlettel végzett statisztikai paraméterezésére szolgál; ezek az indexek a szerző szövegstílusát jellemzik, és alkalmazhatók a szerzőség-meghatározási feladatokban. A létrehozott nyelvészeti erőforrások és szoftver alapján a rendszer a kiszámított statisztikai indexekre támaszkodó nyelvészeti elemzést készít, valamint két szöveg összehasonlító vizsgálatát végzi el. A statisztikai indexelés további kritériuma a szövegtoxicitási index, amelyet a toxikus érzelmi töltet verbális azonosításának módszerével számítanak ki. A szerzőség és a toxicitás felismerésének feladatait két módszerrel oldják meg: szótárés szabályalapú statisztikai számításokkal, valamint gépi tanulással. A TextAttributor béta-verziójában megvalósított aktuális eredményeket részletesen megvizsgáljuk. KULCSSZAVAK: számítógépes nyelvészet, ukrán nyelv, érzelemelemzés, szerzőség-meghatározás, stilometria, szövegosztályozás. új irányzat, amely digitális Tanulmányok / Articles 225 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) ANOTACIJA Šiame straipsnyje pristatoma straipsnio autorių sukurtos automatinės sistemos A „TextAttributor” felépítése, algoritmusai, megvalósítása és kísérleti eredményei, amelyet az ukrán nyelvű szövegek statisztikai parametrizálására szolgáló, a szerző szövegstílusát jellemző, többparaméteres statisztikai mutatókészlet segítségével, valamint szerzőség-hozzárendelési feladatokra alkalmaznak. A létrehozott nyelvészeti erőforrások és szoftver alapján a rendszer a kiszámított statisztikai indexek szerint nyelvészeti elemzést generál, és két szöveg összehasonlító elemzését végzi el. A statisztikai indexelés kiegészítő kritériuma a negatív hangulatot kiváltó szöveg indexe, amelyet a negatív hangulat szövegbeli azonosításának módszerével számítanak ki. A szerzőség és a gyűlölet meghatározásának feladatait két módszerrel oldják meg: szótáron és szabályokon alapuló statisztikai számításokkal, valamint gépi tanulással. Jelenlegi szerzőség-hozzárendelés, stilometria, rezultatai,gautinaudojantis„TextAttributor“betaversija,išsamiaiišnagrinėti.  ESMINIAIŽODŽIAI:kompiuterinėlingvistika,ukrainiečiųkalba,jausmingumoanalizė, szövegosztályozás. 1. BEVEZETÉS Textologicalresearchgainednewscientificimportancewiththeadvancement ofcomputationallinguisticsmethods,whichcontributedtotheformationofa szövegtanként értelmezhető. E kialakuló tudományterületen a digitális szövegtant úgy határozzuk meg, mint az automatizált korpusznyelvészeti technikák matematikai modellekkel együtt történő alkalmazását a szövegek kvantitatív elemzésére. A modern kvantitatív nyelvészet és a természetesnyelv-feldolgozás aktuális feladatait követve csapatunk kidolgozott egy médiatextusok automatikus nyelvészeti-statisztikai elemzésére szolgáló rendszert, amelyet TextAttributor (TextAttributor 1.0 2024) néven webalkalmazásként valósítottunk meg. A rendszer négy feladatot lát el: 1) statisztikai szövegparaméterezés; 2) stilometria: az idiolektus nyelvészeti-statisztikai jellemzőinek meghatározása; 3) attribúció: a szövegek közötti hasonlóság fokának meghatározása; és 4) érzelemelemzés: a negatív érzelmi töltetű lexika azonosítása a szövegekben. Ezenkívül a rendszerben automatikusan két nyelvészeti szakértői következtetés készül a második és a negyedik feladat eredményei alapján. A TextAttributor rendszer többfunkciós jellege szükségessé teszi, hogy a felhasználók megismerkedjenek működési elveivel. E cikk célja, hogy megismertesse a tudományos és oktatási filológiai közösséget a rendszer létrehozásának módszertanával, architektúrájával és működési eredményeivel, ezáltal világos képet nyújtson funkcióiról és elemzési lehetőségeiről, amelyek különösen relevánsak. Ez a megközelítés különösen fontos az internetes kommunikáció nagy mennyiségű adatának elemzéséhez, valamint NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 226 ActaLinguisticaLithuanicaXCI enhancinginformationdefencestrategiesduringtheongoingRussian-Ukrainian háború. A projekt szerzőinek elképzelése az Ukrán Nyelvi Korpusz (KUM) ukrán nyelvű textattributionarosefromtheanalysisofresearchinthefieldofUkrainian corpuslinguistics(Darčuk 2013)andstatisticalstudiesoftheauthor’s style (Darčuket al.2021;Darchuk,Sorokin2022;Zuban’2019)conductedusingthe eszközeinek automatikus rendszerének kifejlesztéséről. szövegből származó információkat, During the development of the TextAttributor system, the following methodswereemployed:componentanalysis,distributiveanalysis,andcontent analysis.Contentanalysis,aquantitativeandqualitativemethodforextracting természetesnyelv-feldolgozást és statisztikai módszereket alkalmazott. Kvantálást és szentimentelemzést is alkalmaztak. A szentimentelemzés automatikusan azonosítja a szöveg tonalitását mind az érzelmi színezet, mind pedig a szerző eseményekre vagy tárgyakra vonatkozó értékelése alapján; ezt szótárés szabályalapú statisztikai számítások alkalmazásával érték el. Ezenkívül gépi tanulási módszereket, köztük mélytanulást is beépítettek. A szöveg statisztikai szerkezete, amelyet mennyiségi modelljeként értelmezünk, lehetővé teszi funkcionális stílusának, szerzőségének és keletkezési időszakának azonosítását. Ebben a munkában a statisztikai szerkezet komponenseit lexikai és grammatikai statisztikai jellemzők indexelési technikákkal és euklideszi távolságmérőkkel végzett elemzésével nyerték ki. Az euklideszi távolság, amely két pont távolságát méri egy n-dimenziós euklideszi térben, a klaszterelemzéshez használt egyik legszélesebb körben alkalmazott metrika a stilometriában és a szerzőazonosításban. The novelty of the results is the first implementation in computational linguistics of an automated morpho-syntactic-semantic stylometric model szövegelemzéshez, amely 15 statisztikai indexen alapul, amelyek elsősorban a szöveg morfológiai, valamint szintaktikai és szemantikai szerkezetét parametrizálják. A stilometriai modell egy szöveg statisztikai paramétereinek (lexikai, morfológiai, szintaktikai stb.) összessége, amely alapján e szöveg összehasonlító elemzését elvégzik a funkcionális stílus stilometriai modelljével. Véleményünk szerint statikus módszerek alkalmazásával a stilometriai modell felépítésében szigorú, determinisztikus, tudományosan megalapozott rendszert lehet létrehozni a stílusokban, műfajokban stb. előforduló közös és megkülönböztető jegyekből. A stilometriai modell első alkalommal vezeti be a toxicitási index paraméterét, amely jellegzetesen meghatározza a médiában megjelenő szövegeket az orosz–ukrán háború idején. Ez a modell nemcsak az ilyen típusú rendszerekre jellemző szövegstatisztikai parametrizálás funkciójában valósul meg, hanem az elemzett szövegnek az ukrán nyelv médiaszövegeinek stílusával való összehasonlításában, valamint a két vagy több szöveget érintő stilometriai és szerzőazonosítási feladatokban is. Az elméleti jelentőség kiterjed a szöveg toxicitásának meghatározására szolgáló két módszer validálására és Straipsniai / Cikkek 227 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) authorshipinUkrainian:1)throughdictionaryandrule-basedapproaches,and 2)viamachinelearning,includingdeeplearning. 2. KAPCSOLÓDÓ MUNKÁK A modern ukrán nyelvészetben jelentős nyelvészeti-statisztikai kutatásokat végeztek ukrán írók és költők, köztük Tarasz Sevcsenko, Leszja Ukrajinka, Vaszil Sztusz (Zuban’ 2019), Ivan Franko (Buk 2021), Roman Ivanycsuk (Lototska 2022), Valerij Sevcsuk (Volos, Levchenko 2023), Marija Matiosz, Jurij Andruhovics, Okszana Zabuzsko (Karasov, Levchenko 2024), Ivan Drach, Mikola Vingranovszkij (Darchuk et al. 2024), Lina Kostenko (Zuban’ 2019; Darchuk et al. 2024) és mások idiolektusáról. Ezeket a vizsgálatokat reprezentatív szövegmintákon (hosszú szövegeken) végezték, elsősorban egy vagy néhány (legfeljebb öt) statisztikai paraméter alkalmazásával, gyakran stilometriai összehasonlítás nélkül. Továbbá, a nyelvészeti-statisztikai kísérletek elvégzésének munkaigényes volta miatt az ukrán nyelvészet nagyrészt figyelmen kívül hagyta az átfogó statisztikai parametrizálást, az elemzett szövegek funkcionális stílusok standard statisztikai paramétereivel való összehasonlítását, a szöveghasonlóság mértékének meghatározását, valamint a rövid szövegek stilometriai és szerzőazonosítási elemzését. A TextAttributor rendszer alkalmazása a nyelvészeti-statisztikai kutatásokban, e feladatok automatikus végrehajtására irányulva, nemcsak a nyelvi jelenségek gyakorisági jellemzőit biztosítja, hanem hatékony stilometriai elemzést is lehetővé tesz, amely szakértői véleményhez vezet. A TextAttributor rendszer előnyökkel rendelkezik a globális tudományban alkalmazott megfelelő rendszerekhez képest. A legtöbb meglévő rendszer és modell szintén egyedi nyelvészeti-statisztikai modulok alkalmazására összpontosít egy vagy néhány, többnyire formai (n-gramok, leggyakoribb szavak, betűk) szövegparaméter azonosítására (Eder 2015; Canhasi et al. 2022; LIWC-22; Khomytska et al. 2023; ALIAS). Ezzel szemben a TextAttributor 1.0 átfogó megközelítést kínál, amely magában foglalja a szöveg lexikai, morfológiai, szintaktikai és szemantikai szerkezetének interaktív statisztikai elemzését valós időben, 15 paraméter alapján. A szövegek szerzőségének meghatározása aktívan fejlődik a külföldi szövegtudományban; különösen Burrows módszerének (Burrows 2002; Argamon 2007; Eder, Rybicki 2013; Burrows et al. 2014) hatékonyságát vizsgálják számos, különböző stílusú szöveges adatok nagy mennyiségén végzett tanulmányban, például: a 20. század eleji angol prózában (Hoover 2004); a modern angol költészetben (Hoover 2005); latin nyelvű költői művekben (Rybicki, Eder 2011); angol, francia, olasz, német, lengyel és magyar nyelvű, valamint latin és arab nyelvű fő műfajok prózai alkotásaiban (Rybicki, Eder 2011; Evert et al. 2015; Jannidis et al. 2015); angol nyelvű politikai szövegekben, beleértve NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 228 ActaLinguisticaLithuanicaXCI theattributionofspeechesofAmericanpresidents(Savoy2015).Onemore a „Linguistic Inquiry and Word Count” (LIWC) elnevezésű automatizált nyelvészeti elemzési módszert kereskedelmi alkalmazásként valósították meg, és több nyelvre adaptálták (Meier et al. 2019; LIWC-22). Az utóbbi években az automatikus szövegszerzőség-meghatározási feladatokban túlnyomórészt vagy szabályalapú stilometriai módszereket, vagy mélytanulási módszereket alkalmaztak (Eder 2015; Canhasi et al. 2022). Mindkét módszert megvalósították a TextAttributor rendszerben; ezek hatékonyan működnek, de eltérő eredményeket adnak: 1) A szabályalapú módszer lehetővé teszi az idiolekttel és a szöveg toxicitásával kapcsolatos nyelvészeti következtetések generálásának automatizálását; 2) A gépi tanulási módszer csak a toxicitás mértékét és a szövegek hasonlóságát határozza meg, és szöveges tartalmak monitorozására szolgáló osztályozási feladatokban alkalmazható. A hangulatelemzés és a szövegek szerzőségének azonosítására szolgáló legújabb gépi tanulási módszerek statisztikai megközelítéseken (TF-IDF, Latent Dirichlet Allocation) és különböző architektúrájú mélytanulási technikákon (CNN, LSTM, BERT) alapulnak, stilometriai módszerekkel kombinálva (Gupta et al. 2019; Canhasi et al. 2022; Bonetti et al. 2023). A közölt eredmények rendkívül erősen függnek az osztályok számától (a toxicitás típusai, a szerzők), a műfajtól, a szöveg hosszától és – mindenekelőtt – a tanítási eljárásban felhasznált, megfelelően annotált szövegkorpusz terjedelmétől. Így a toxicitás és a gyűlöletbeszéd felismerésének feladataiban a nagy pontossági arányok meghaladják a 90%-ot, ha a korpusz több tízezer dokumentumot tartalmaz (Alkomah, Ma 2022). Például a szerzőségmeghatározásban 1000 szerző angol nyelvű irodalmi művei esetében 90%-ot meghaladó pontosság érhető el, 15 szerző 6000 dokumentumot tartalmazó korpuszának felhasználásával. Az azonosítási, valamint a hangulat-/toxicitáselemzési feladatok kevéssé kutatott problémák 3. A TEXTATTRIBUTOR RENDSZER MŰKÖDÉSÉNEK ÁLTALÁNOS turn,forcorporacontaininglessthan1500documentsthereportedaccuracy isabout70%(Khanet al.2023).FortheUkrainianlanguage,textauthorship JELLEMZŐI A TextAttributor fejlesztése során a következő feladatokat hajtották végre: 1) (Lupeiet al.2020),moreover,suchsystemsdonotproducelinguisticexpertise andcannotbeusedastoolsforlinguisticresearch. Elméleti nyelvészet: Módszertant dolgoztak ki a formalizált morfológiai, statisztikai, stilometriai, szerzőségmeghatározási és hangulatelemzésekhez; 2) Szoftverfejlesztés: Kidolgozták a nyelvészeti adatbázisok struktúráját, valamint a fent említett automatikus elemzésekhez szükséges szoftvert; 3) Kísérleti nyelvészet: A rendszert ukrán médiából származó szövegeken tesztelték, és megvalósítottak egy automatikus stilometriai vizsgálatra szolgáló elemzőmodult. A webalkalmazásként megvalósított automatizált nyelvészeti rendszer felhasználó által bevitt, médiaszöveg-stílusú szövegeket dolgoz fel, és a szöveg attribútumait jellemző statisztikai paraméterek numerikus értékeit generálja. A rendszer strukturált műveletsort követ:  Straipsniai / Articles 229 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 1. Szöveg tokenizálása: A szöveg mondatokra és szavakra bontása elemzés céljából. 2. Morfológiai címkézés: A szavak nyelvtani formájuk alapján történő címkézése. 3. Kontextuális elemzés: A morfológiai címkék frissítése a kontextus figyelembevételével. 4. Szintaktikai elemzés: A mondatok szavai közötti bináris kapcsolatok megállapítása nyelvtani szerkezetük megértése céljából. 5. Szintaktikai viszonyok megállapítása: A szintaktikai kapcsolatok meghatározása előre definiált szabályok alapján. 6. Érzelmileg negatív szókincs egyeztetése: Előre meghatározott negatív szókincskészletből származó szavak azonosítása. 7. Statisztikai paraméterek értékelése: A bemeneti szöveg statisztikai paramétereinek értékelése automatikusan összeállított gyakorisági szókincsek felhasználásával. 8. Az eredmények vizualizációja: A statisztikai paraméterezés eredményeinek bemutatása graphically,withempiricalvaluesandconfidenceintervals. 9.Comparison of Results:Visualizingstatisticalparameterizationoutcomes fortwomedia-styletexts,facilitatingcomparison. 10.Euclidean Distance Evaluation:Quantifyingthedissimilaritybetween twomedia-styletexts. 11. Szakértői vélemény generálása: Két szakértői vélemény generálása: az egyik a szöveg attribúciójáról, a másik pedig a szöveg toxicitásáról nyelvészeti vizsgálat révén. 12. Toxicitásészlelés és szerzőazonosítás: Gépi tanulási technikák, különösen neurális hálózati modellek alkalmazása a toxicitás észlelésére és a szerzők azonosítására. A rendszer eredményei a következő részekbe vannak rendezve: Szövegattribúciós indexcsoport, Szövegattribúciós szakértői vélemény, Szövegattribúció összehasonlítása, A szöveg toxicitásának nyelvészeti szakértői értékelése, valamint Neurális hálózat Vélemények. In Text Attribution Index Group (Fig. 1), statistical parameters are organizedbasedontheinputtext:column1displaystheIndextitle,column A 2. oszlop az empirikus numerikus értéket mutatja be, a 3. oszlop pedig vizuális hivatkozást biztosít az index empirikus értékének a konfidenciaintervallummal való összehasonlításával NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 230 Acta Linguistica Lithuanica XCI az ukrán médiastílus szövegeiből levezetett küszöbértékek (alsó és felső). Az empirikus numerikus értéket a skálán egy kitöltött fordított háromszög jelöli. 1. ÁBRA: A szövegattribúciós eredmény egy részlete A Szövegattribúciós szakértői véleményben (2. ábra) az egyes becsült indexek esetében az elemzett szövegből kinyert tipikus vagy egyedi nyelvi statisztikai jellemzőkre vonatkozó következtetéseket mutatjuk be. E következtetések a következő kérdésre adott válaszokból származnak: Az index numerikus értéke az ukrán nyelv médiastílusának konfidenciaintervallumába esik-e? A numerikus értékek és a konfidenciaintervallum küszöbértékeinek összehasonlítása alapján a rendszer három lehetséges választ generál (a médiastílus tipikus jegyei, a normál médiastílusnál gyengébb idiostílus jegyei, valamint a normál médiastílusnál erősebb idiostílus jegyei). A Szövegattribúció összehasonlításában (4. ábra, 4.2. alfejezet) a „Vektortávolság kiszámítása” kiválasztásakor a táblázatos adatok azonnal frissülnek a következőképpen: az 1. oszlop a felhasználó által bevitt szövegeket és a korábban elemzett szöveget tartalmazza; a 2. oszlop az egyes szövegek mondatainak számát jeleníti meg; a 3. oszlop a szavak számát mutatja; a 4. oszlop az elemzett szöveg és a táblázatban szereplő egyes szövegek közötti euklideszi távolságot adja meg; az 5. oszlop, amelynek címkéje „Összehasonlítás”, initiatesanautomaticcomparisonofstatisticalindicesbetweentheanalyzedtext andtheselectedtext.Uponactivatingthecorresponding“Compare”element, comprehensiveinformationonthestatisticalcomparisonbetweentwotextsis providedinthe“TextAttributionIndices”group(Fig.3). Tanulmányok / Cikkek 231 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 2. ÁBRA: Egy generált szakértői véleménymodell példája, amely a szöveg toxicitását 0-tól (nem In Linguistic Expertise of Text Toxicity (subsection 4.3), a lexicalsemanticinterpretationofthecalculatedtoxicityindexispresented(Fig.6). InNeural Network Opinionswepresenttheoutputofourdeeplearning toxikus) 1-ig (magas toxicitás) terjedő skálán számszerűsíti. A szöveg ismert szerzőkhöz való hasonlóságát is felmérjük; az értékek 0-tól (nincs hasonlóság) 1-ig (nagyfokú hasonlóság) terjednek, azon szerzők alapján, akiknek a szövegein a modellt betanították. Az eredmények csak a 0,1-nél nagyobb hasonlósági mértékű tesztek esetében jelennek meg. Jelenlegi rendszerünk demó módban működik, és a szerzői szövegek korlátozott korpuszát használja a hasonlóság felmérésére a felhasználó által bevitt szöveggel. 4. UKRÁN NYELVŰ SZÖVEGEK SZERZŐSÉGÉNEK MEGHATÁROZÁSA: KÍSÉRLETEK, EREDMÉNYEK ÉS MEGVITATÁSUK 4.1. Statisztikai paraméterezési indexek A kifejlesztett stilometriai modell két feladatot old meg: 1) A szerzői stílus egyedi jellemzőinek azonosítása (stilometria); 2) Két szöveg közötti hasonlóság értékelése nyelvi és statisztikai paraméterek alapján (attribúció). NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 238 Acta Linguistica Lithuanica XCI Ma az információs komponens különösen fontossá vált a hibrid hadviselésben. Ezért kutatásunk anyaga a politikai diskurzus online médiában megjelenő szövegeinek 10 millió szavas kutatási korpusza volt. A „toxikus szöveg” kifejezést tág értelemben használjuk. Ezeket a szövegeket zaklatás, fenyegetések, obszcenitás, kiberzaklatás, trollkodás és identitáson alapuló gyűlöletkeltő szövegek jellemzik, továbbá emotiogéneket tartalmaznak, amelyek olyan jelenségek és tárgyak, amelyek negatív érzelmeket váltanak ki az emberben (pl. háború, légiriadó, korrupció). A projekt célja az ukrán szövegekben megvalósuló negatív szentiment lehetőségeinek meghatározása, valamint a toxikus tartalom azonosítására szolgáló automatizált rendszer kidolgozása volt. Ez a feladat két egymást követő részfeladatból állt: először egy toxikus szövegek nyelvészeti vizsgálatára szolgáló rendszer kidolgozásából, amely a toxicitási indexeket szótári elemzéssel és szabályalapú módszerekkel határozza meg; másodszor pedig egy gépi tanulási célokra szolgáló tanítóadatbázis létrehozásából és a szöveg toxicitási indexeit előrejelző neurális hálózat kidolgozásából. Tekintsük az első feladat végrehajtását. Ennek része volt az egyének (1620), obszcén kifejezések (613) és sértő nyelvi elemek (787) összeállítása. Példaként említhető a nyugati (западенець: Ukrajna nyugati régióiból származó emberekre használt pejoratív ofalexicographicdatabasehousingthreedistinctdictionaries: 1)Emotiogendictionary:Acompilationof5000words(accordingtothe meaningsoflexical-semanticvariants)withnegativesentimenttones,ratedon ascaleof–2.Examplesincludeimmoral,impunity,briberyandsteal; 2) Hate Speech Dictionary: Comprising 3000 words, including names of elnevezés) és a kufár; 3) Toxikus kifejezések: 1500, negatív érzelmeket kifejező idiomatikus fordulat gyűjteménye. Példaként említhetők az olyan fintorok, mint egy majom, megcsókolja a seggét és kinyitja a száját. E listák minden egyes bejegyzését szemantikai jegyekkel láttuk el; a Gyűlöletbeszéd-szótár 18, a Toxikus kifejezések listája pedig 26 jegyet tartalmazott. A Gyűlöletbeszéd-szótár szavait például olyan jellemzőkkel címkéztük, mint az ‘s’ a szexizmus, az ‘r’ a rasszizmus és az ‘e’ az ageizmus jelölésére. Ez a lexikográfiai adatbázis, egy multiparametrikus rendszer, szemantikai jegyeket rendel az egységekhez (szavakhoz vagy kifejezésekhez), ami az elemzett szövegből származó gyakorisági adatokkal kombinálva lehetővé teszi a toxicitás elemzését. A szöveg toxicitási indexét a következő képlettel számítjuk ki: Itox = (e + |K| (m + t)) / n * 10, Itt n a szöveg terjedelme; e az érzelmi szavak száma; m a gyűlöletbeszédhez tartozó szavak száma; t a toxikus kifejezések száma; K egy –2-vel egyenlő együttható, amely kiemeli a gyűlöletbeszédhez tartozó szavakat és a toxikus kifejezéseket, amelyek egy  Straipsniai / Articles 239 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) öt számjegyből (+2, +1, 0, –1, –2) álló skálán a –2-nek felelnek meg. Az indexértékek 0-tól +1. Például a „People with a red pen (Люди з червоною ручкою)” című szöveg toxicitási indexe (12 mondat, 129 szó) 1,01, ami magas toxicitását jelzi, mivel az ilyen rövid szövegek küszöbértéke 0,1 és 0,7 között van. Ezzel egyidejűleg a rendszer automatikus nyelvészeti vizsgálat eredményeit generálja a szöveg toxicitásáról (lásd a 6. ábrát), amelyek a következőket tartalmazzák: 1) a lexikográfiai listák osztályozási jegyei szerinti negatív szókincs szemantikai osztályainak statisztikai térképe (emotívumok – 5, vulgarizmusok – 2, szexizmus – 2); 2) a negatív érzelmi töltetű konkrét szavakat tartalmazó szöveg, amely a statisztikai térkép kategóriáit verbalizálja. Tekintsük meg az elemzett valós szöveg egy részletét (6. ábra): azok az emberek, akik piros tollal járkálnak, és kijavítják mások bejegyzéseiben a hibákat: mégis kik vagytok ti? Van fogalmatok arról, mennyire idegesítőek vagytok? Szándékosan tanulmányozom a profiljaitokat, kíváncsi vagyok arra a világra, amelyben léteztek. Ez a világ nagyon megrémít. Őszintén remélem, hogy a való életben semmilyen körülmények között nem fogunk összetalálkozni. (оці люди, які ходять з червоною ручкою і виправляють помилки в чужих постах: ви хто взагалі такі? Ви хоч уявляеєте, як ви бісите? Я спеціально вивчаю ваші профілі, мені цікаво в якому світі ви існуєте. Мене цей світ дуже лякає. Щиро сподіваюся, що в реальному житті ми з вами не пересічемося ні за яких обставин). A rendszer itt automatikusan félkövérrel kiemeli a következő negatív komponenst tartalmazó szavakat: mistakes (помилки), other people’s (чужих), annoying (бісите), scares (лякає). 6. ÁBRA: A szöveg toxicitása automatizált nyelvészeti vizsgálatának egy részlete NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 240 Acta Linguistica Lithuanica XCI 5. MACHINELEARNINGAPPROACHES: EXPERIMENTS,RESULTSAND VITÁK Összpontosítsunk a TextAttributor rendszer gépi tanulási technikáknak szentelt második működési módjára. A modell betanításához bemenetként olyan szövegkorpuszokkal rendelkezünk, amelyek az egyes részfeladatok célja szerint vannak címkézve: (a) toxicitásészlelési szöveges információk és (b) szerzőazonosítás. Mindegyik korpusz betanítóés kontrollhalmazra, valamint kellően nagy korpusz esetén validációs halmazra oszlik. A kiválasztott problémamegoldó modell paramétereit a betanítóhalmazon becsüljük meg. A modell hiperparamétereit a a jelenlegi modelleket viszonylag kis adathalmazon tanították be, validationset.Thefinalperformanceindicatorsofthemodelaremeasuredona controlset,takingintoaccounttheavailabilityofcomputingresources,which arenecessaryforthemodel’soperability.Acorpusforeachsubtaskhasbeen developedinparallelwiththeTextAttributormachinelearningcomponent,so amely ukrán nyelvű blogok rövid internetes szövegeit, hozzászólásait, cikkeit stb. tartalmazta. 5.1. Toxicitásészlelés Kísérleti vizsgálatok sorozatának eredményeként a fastText módszeren és annak eszközein (Joulin et al. 2016) alapuló, számításigény szempontjából hatékony architektúrát választottunk. Ez a módszer szóbeágyazásokat biztosít, és előre meghatározott osztályok szerint becsüli a dokumentumok valószínűségi eloszlását. A szavakat vektoros formában jeleníti meg, a szavak részekre (alszavakra) történő automatikus felbontása alapján, ami a szótár nyitottságát szimulálja. Az alszavas megjelenítés fontos, mivel az ukrán nyelv erősen flektáló, és számos, korábban nem látott szót, valamint helyesírási hibákat tartalmazó szót is le kell fedni. Az alkalmazott megközelítés hatékonyságát továbbá a rendszer működésének technikai feltételei és a modell betanításához rendelkezésre álló szöveges erőforrások is meghatározzák. A toxikus tartalom észlelésére szolgáló bináris osztályozáshoz egy körülbelül 12 000 szöveges dokumentumból álló előkészített korpuszt használtunk. Az általánosított metrikán alapuló legjobb eredményt (F1 = 79.4%) a következő hiperparaméter-beállításokkal értük el: 56 dimenziós szóvektor, 0.15-ös kezdeti tanulási ráta, 500 betanítási korszak, bigramokkal reprezentált lexikai kontextus, 2 és 5 karakter közötti alszómhossz, valamint 0.4-es döntési küszöb. Emellett a modell 85%-os érzékenységet mutatott, miközben megközelítőleg 70%.  Straipsniai / Articles 241 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) 5.2. Szerzőazonosítás A szövegszerzők azonosítására szolgáló modellek kísérleti vizsgálatát nyilvánosan hozzáférhető társadalmi-politikai szövegek korpuszának egy részén végeztük, amelyben azonosítható a dokumentum szerzője. Összesen 702, négy olyan szerző által közzétett szöveget választottunk ki, akik 60 és 1000 karakter közötti dokumentumokból a legtöbbet publikálták. A szerzőnkénti legtöbb publikáció száma 304 (115 ezer karakter), a legkevesebb pedig 109 (49 ezer karakter). A teszteléshez minden kiválasztott szerzőtől véletlenszerűen 25 szöveget vettünk. A többi dokumentum alkotta a betanítóhalmazt. 50, 0,1-es kezdeti tanulási rátával, 50 tanítási epochával, bigramokkal reprezentált lexikai kontextussal, 2–5 karakter Thebestresult,accordingtothegeneralizedmetric(F1=81%),wasachieved withthefollowinghyperparametervalues:awordembeddingspacedimension közötti részszóhosszakkal, és elérte a 100%-ot, 90%-ot meghaladó pontossággal. Ezek az eredmények bizonyítják egy olyan hatékony rendszer kifejlesztésének adecision-makingthresholdof0.5.Notably,forcertainmodelconfigurations, thesensitivitytotheauthorwiththelargestnumberofdocumentsinthedataset megvalósíthatóságát, amely képes pontosan lefedni azoknak a szerzőknek a szövegeit, akik kellően reprezentálva vannak a tanítóhalmazban. A betanított neurális hálózati modelleket kliens–szerver architektúrában integrálták a TextAttributor rendszerbe, amelyben két feladat eredményeit mutatják be: (a) a toxicitás meghatározását és (b) a szerzőség detektálását. A rendszer „Ukrajna felsőoktatásról szóló törvényének” szövegén végzett munkájának eredménye: toxicitási index (becslés valószínűség formájában: mennyire toxikus a szöveg) – 0,04; hasonlóság a szerzőkkel (a rendszer által ismert szerzők szerzőségének valószínűségeként megadott becslések): 0,49 I. Farion, 0,30 Oleksii Honcharenko és 0,22 Mariana Bezuhla esetében. 6. KÖVETKEZTETÉSEK A TextAttributor rendszer jelenleg tesztelési fázisokon megy keresztül az ukrán nyelvű szövegeken belüli attribúciós és toxicitásmeghatározási problémák kezelése érdekében. Ez a rendszer kényelmes és hatékony különféle technológiai vizsgálatokhoz. A TextAttributor webalkalmazás 5 hónap alatt automatikusan elemzett 226 felhasználó 784 ukrán szövegét. Eredményeink bizonyítják módszerünk hatékonyságát, amely a verbális elemek formális grammatikai és szemantikai paraméterek alapján történő kvantálását foglalja magában, particularlyfornegativeemotionality.Thisisachievedthroughacombination ofdictionaryandrule-basedapproaches,complementedbymachinelearning NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 242 Acta Linguistica Lithuanica XCI és szerzők) által más nyelvek esetében közölt techniques.Experimentalmachinelearningresearchfortoxicitydetectionand authorship identification bytext allowed us toobtainresults comparable to resultsofexperimentswithsimilarmodelcharacteristics(numberofdocuments eredmények. A részszómodellek javították a szerzőség-ellenőrzést és a robustnessagainstlexicalopennessandtextualerrors. TheconductedresearchpavesthewayforsolvingsuchproblemsforUkrainian as detectingand monitoringtoxic content,hate speechandmisinformation, deobfuszkációt, a szerzői profilalkotást és a diarizálást, a pszicholingvisztikai profilalkotást, a stílusmodellezést, valamint az álhírtartalmak forrásának nyomon követését stb. A kidolgozott szövegelemzési és attribúciós séma más nyelvekre is alkalmazható. A jövőben automatikus szövegattribúciós és toxicitásdetektáló eszközünket szemantikai, szintaktikai, pszicholingvisztikai és szociolingvisztikai elemzéssel tervezzük integrálni. Ez az integráció mélyebb betekintést nyújt majd az olvasóra gyakorolt hatásba. A lexikai taxonómia szemantikai elemzésének alkalmazásával célunk a szövegben rejlő narratív elemek azonosítása, ezáltal növelve a szövegattribúció megbízhatóságát a szerzőazonosítási eljárásokban. Emellett tervezzük szövegkorpuszaink bővítését és többnyelvű nagy nyelvi modellek alkalmazását, hogy tovább kiterjesszük rendszerünk képességeit, valamint hogy eszközöket valósítsunk meg az ukrán nyelv valamennyi stílusához tartozó szövegek statisztikai összehasonlítására. Köszönetnyilvánítás The system has been created within a project supported by the British EmbassyinKyivandcarriedoutbyateamofeducatorsandresearchersofthe Az Ukrán Nyelvi és Alkalmazott Nyelvészeti Tanszék, Tarasz Sevcsenko Kijevi Nemzeti Egyetem. Őszinte köszönetünket szeretnénk kifejezni a Kijevi Brit Nagykövetségnek a kutatási projekt pénzügyi támogatásáért. Hálásak vagyunk Szvitlana Javorszkának és Irina Bezkorovajnának a projekt során nyújtott útmutatásukért és segítségükért. Külön köszönet illeti Kosztyantin Honcsarenkót a projekt megszervezéséért és dokumentációs támogatásáért. Továbbá hálásak vagyunk a Tarasz Sevcsenko Kijevi Nemzeti Egyetem „Alkalmazott (számítógépes) nyelvészet és angol nyelv” képzési programja hallgatóinak. Idejükkel, szakértelmükkel és erőfeszítéseikkel hozzájárultak az ukrán toxikus szövegek korpuszának létrehozásához. Hálásak vagyunk Okszana Tolocskónak, alapképzési programunk végzett hallgatójának, amiért létrehozta az ukrán nyelv tónusszótárát, amelyet a negatív emotogének lexikográfiai jegyzékének összeállításához használtunk. Ezenkívül mély hálánkat fejezzük ki Mikola Kosztikovnak az adatgyűjtési folyamatban tett erőfeszítéseiért. Őszinte köszönetünket szeretnénk kifejezni a kutatói közösség minden tagjának, akik hozzájárultak thisstudywiththeiradviceandconsultations.  Straipsniai / Articles 243 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) REFERENCES ALIAS–Automated Linguistic Identification & Assessment System.Availableat:https:// aliastechnology.com/alias-overview/. Alkomah Fatimah, Ma Xiaogang 2022:ALiteratureReviewofTextualHate Speech Detection Methods and Datasets. – Information 13(6), 273. DOI: 10.3390/ info13060273. ArgamonShlomo2007:InterpretingBurrows’sDelta:GeometricandProbabilistic Foundations. – Literary and Linguistic Computing 23, 131–147. DOI: 10.1093/llc/ fqn003. Bonetti Andrea, Martínez-Sober Marcelino, Torres Julio, Vega Jose, Pellerin Sebastien, Vila-Francés Joan 2023:ComparisonbetweenMachine LearningandDeepLearningApproachesfortheDetectionofToxicCommentson SocialNetworks.–Applied Sciences13(10),6038.DOI:10.3390/app13106038. Buk Solomija 2021: Long prose fiction by I. Franko: electronic corpus, frequency dictionaries and other interdisciplinary contexts,LNUimeniIvanaFranka[IvanFranko NationalUniversityofLviv]. Burrows John 2002: “Delta”: a Measure of Stylistic Difference and a Guide to LikelyAuthorship.–Literary and Linguistic Computing17(3),267–287.DOI:10.1093/ llc/17.3.267. Burrows Steven, Uitdenbogerd Alexandra, Turpin Andrew 2014: Comparingtechniquesforauthorshipattributionofsourcecode.–Software: Practice and Experience44(1),1–32.DOI:10.1002/spe.2146. CanhasiErcan,KadriuArbana,MisiniArta2022:ASurveyonAuthorship Analysis Tasks and Techniques. – SEEU Review 17(2), 153–167. DOI: 10.2478/ seeur-2022-0100. ChuhunovVadym2009:Diahnostyka v psykhoterapii ta psykhoterapevtychnyi diahnoz, Kharkiv:Nauka. Darchuk Natalia, Sorokin Viktor 2022: Parameterization of the Ukrainian Text Corpus based on parsing. – Computational Linguistics and Intelligent Systems, Proceedings of the 6th International Conference on Computational Linguistics and IntelligentSystems(COLINS-2022)1:Main Conference,eds.V.Lytvyn,N.Sharonova, I.Jonek-Kowalska,A.Kowalska-Styczen,V.Vysotska,Ye.Kupriianov,O.Kanishcheva, O.Cherednichenko,Th.Hamon,N.Grabar,Poland,12–13May,2022,256–265. Darchuk Natalia, Zuban’ Oksana, Sorokin Viktor 2024: On stylistic differentiation in Ukrainian poetic speech based on the syntactic structure of NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 244 ActaLinguisticaLithuanicaXCI sentences.–Bulletin of Taras Shevchenko National University of Kyiv. Literary Studies. Linguistics. Folklore Studies1(35),5–10.DOI:10.17721/1728-2659.2024.35.01. Darčuk Natalija 2013: Kompjuterne anotuvannja ukrajins’koho tekstu: rezul’taty i perspektyvy,Kyiv:OsvitaUkrajiny. DarčukNatalija,Vasyl’jevaIryna,Vasyl’jevOleksij2021:Vektornamodel’ analizustylistykytekstiv.–Ukrajins’kyj fizyčnyj žurnal66(5),373–378. Eder Maciej 2015:Doessizematter?Authorshipattribution,smallsamples,big problem.–Digital Scholarship in the Humanities30(2),167–182.DOI:10.1093/llc/ fqt066. Eder Maciej, Rybicki Jan 2013:Dobirdsofafeatherreallyflocktogether,or howtochoosetrainingsamplesforauthorship attribution.–Literary and Linguistic Computing28(2),229–236.DOI:10.1093/llc/fqs036. EvertStefan,ProislThomas,SchöchChristof,JannidisFotis,Pielström Steffen, Vitt Thorsten 2015:ExplainingDelta,or:Howdodistancemeasures for authorship attribution work? – Corpus Linguistics 2015: Abstract Book, United Kingdom,21July2015,eds.F.Formato,A.Hardie,Lancaster:UCREL.Availableat: https://zenodo.org/records/18308. GuptaShriyaT.P.,SahooJajatiK.,RoulRajendraK.2019:Authorship identificationusingrecurrentneuralnetworks.–ICISDM’19:Proceedingsofthe2019 3rdInternationalConferenceonInformationSystemandDataMining,UnitedStates, 06 April 2019, New York: Association for Computing Machinery, 133–137. DOI: 10.1145/3325917.3325935. Hoover David 2004:TestingBurrows’sdelta.–Literary and Linguistic Computing 19(4),453–475.DOI:10.1093/llc/19.4.453. HooverDavid2005:Delta,DeltaPrime,andModernAmericanPoetry:Authorship AttributionTheoryandMethod.–ACH/ALLC 2005:Proceedingsofthe17thJoint InternationalConferenceoftheAssociationforComputersandtheHumanities(ACH) andtheAssociationforLiteraryandLinguisticComputing,Canada,15–18June2005, UniversityofVictoria:HumanitiesComputingandMediaCentre,79–80. JannidisFotis,PielströmSteffen,SchöchChristof,VittThorsten2015: ImprovingBurrows’Delta–Anempiricalevaluationoftextdistancemeasures.–DH 2015:DigitalHumanities,AbstractsoftheGlobalDigitalHumanitiesConference11, Australia,29June–3July2015,Sydney.DOI:https://zenodo.org/records/1321296. Joulin Armand, Grave Edouard, Bojanowski Piotr, Douze Matthijs, JégouHérve,MikolovTomas2016:FastText.zip:Compressingtextclassification models.–ArXiv e-prints 1612.03651.DOI:10.48550/arXiv.1612.03651.  Straipsniai / Articles 245 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Karasov Vitalii, Levchenko Olena 2024:StatisticalprofileofO.Zabuzhko’s idiostyle. – CEUR Workshop Proceedings 3722: Proceedings of the 8th International Conference on Computational Linguistics and Intelligent Systems,Lviv,April12–13,2024, 251–264. KhanTalhaF.,AnwarWaheed,ArshadHumera,AbbasSyedN.2023: An Empirical Study on Authorship Verification for Low Resource Language Using Hyper-Tuned CNN Approach. – IEEE Access 11, 80403–80415. DOI: 10.1109/ ACCESS.2023.3299565. KhomytskaIryna,TeslyukVasyl,BazylevychIryna,KaramyshevaIryna 2023:AutomatedIdentificationofAuthorialStyles.–CEUR Workshop Proceedings: Proceedings of the 7th International Conference on Computational Linguistics and Intelligent Systems, 3396, Kharkiv, April 20–21, 2023. Available at: https://ceur-ws.org/Vol3396/paper26.pdf. KUM–Korpus ukrajins’koji movy:LinhvistyčnyjportalMova.info.Availableat:http:// www.mova.info/corpus.aspx. LIWC-22–Linguistic Inquiry and Word Count.Availableat:https://www.liwc.app. Lototska Nataliia 2022:StatisticalCharacteristicsofRomanIvanychuk’sIdiolect (BasedonWriter’sTextCorpus).–CEUR Workshop Proceedings3171,487–500. LupeiMaksym,MitsaAlexander,RepariukVolodymyr,SharkanVasyl 2020: Identification of authorship of Ukrainian-language texts of journalistic style usingneuralnetworks.–Eastern-European Journal of Enterprise Technologies1/2(103), 30–36.DOI:10.15587/1729-4061.2020.195041. McInnes Leland, Healy John, Melville James 2020: UMAP: Uniform ManifoldApproximationandProjectionforDimensionReduction.–ArXiv e-prints 1802.03426.DOI:10.48550/arXiv.1802.03426. MeierTabea,BoydRyan,PennebakerJames,MehMatthiasl,Martin Mike,WolfMarkus,HornAndrea2019:“LIWCaufDeutsch”:Thedevelopment, psychometrics, and introduction of DE-LIWC2015. – PsyArXiv Preprints. DOI: 10.31234/osf.io/uq8zt. Rybicki Jan, Eder Maciej 2011: Deeper Delta across Genres and Languages: DoWeReallyNeedtheMostFrequentWords?–Literary and Linguistic Computing 26(3),315–321.DOI:10.1093/llc/fqr031. Savoy Jacques 2015: Comparative evaluation of term selection functions for authorshipattribution.–Digital Scholarship in the Humanities30(2),246–261.DOI: 10.1093/llc/fqt047. NATALIIA DARCHUK, OKSANA ZUBAN, VALENTYNA ROBEIKO, YULIIA TSYHVINTSEVA, VICTOR SOROKIN, MYKOLA SAZHOK 246 ActaLinguisticaLithuanicaXCI TextAttributor 1.0 2024: TextAttributor 1.0: The system for automatic stylometric analysis of Ukrainian media texts.Availableat:ta.mova.info. Volos Yana, Levchenko Olena 2023:StatisticalprofileofValerieShevchuk’s idiostyle(morphologicallevel).–Slobozhan Scientific Bulletin, Ser. Philology,3,32–36. DOI:10.32782/philspu/2023.3.6. Zuban’Oksana2019:TheMorphemicSystemStylometricAnalysisoftheUkrainian Poets’ Idiostyles: Corpus Based Approach. – Linhvistyčni studiji 38, 96–104. DOI: 10.31558/1815-3070.2019.38.15. Az ukrán médiában megjelenő szövegek automatikus stilometriai elemzésének rendszere „TextAttributor 1.0“ (módszerek, eszközök, funkcionalitás) ÖSSZEFOGLALÓ A „TextAttributor” rendszer statisztikailag parametrizálja az ukrán nyelvű szövegeket a szerzőség felismerése és a hangulatelemzés szempontjából. A 15 statisztikai indexből álló többparaméteres mutatókészletet használva a „TextAttributor” jellemzi a szerzői stilisztikai sajátosságokat. Olyan módszereket integrál, mint a komponenselemzés, az eloszlásvizsgálat, a kvantálás és a hangulatelemzés, szótárak és gépi tanulási módszerek alkalmazásával, amelyek a durva szöveg és a szerzőség feltárására szolgálnak. A rendszer tokenizálással, morfológiai címkézéssel, kontextuális és szintaktikai elemzéssel, valamint az érzelmileg negatív szótár egyezéseinek keresésével dolgozza fel a szövegeket, lehetővé téve a szöveg-hozzárendelés és a negatív tartalom átfogó vizualizációját és szakértői értékelését. A kísérletek megerősítik a rendszer azon képességét, hogy azonosítsa a irįvertintitekstopanašumą,ypačpolitiniodiskursoirnemandagioskomunikacijosžiniasklaidoskonteksteRusijosirUkrainoskarometu.Straipsnyjepabrėžiamapraktinėirteorinė„TextAttributor“reikšmė,demonstruojantjosefektyvumądidelėmstekstoapimtimsir tiksliomsanalitinėmsgalimybėms.Sėkmingasžodynais,taisyklėmispagrįstųirmašininio szerző egyedi jellemzőit a tanulási módszerek alkalmazása kiemeli a rendszer robusztusságát és univerzalitását. Béta verzió és tebevykdomųtyrimųrezultataiyranuodugniaiišnagrinėti,obūsimosjųkryptysnustatomos siekiantišplėstikalbinįkorpusąirtobulintimašininiomokymosimodelius,siekiantpagerintitikslumąirpritaikomumą. Cikkek / Articles 247 The System for Automatic Stylometric Analysis of Ukrainian Media Texts TextAttributor 1.0 (Techniques, Means, Functionality) Beérkezett 2024. november 25-én NATALIIA DARCHUK Tarasz Sevcsenko Kijevi Nemzeti Egyetem Volodimirszka utca 60. Kijev, 01033, Ukrajna [email protected] OKSZANA ZUBAN Tarasz Sevcsenko Kijevi Nemzeti Egyetem Volodimirszka utca 60. Kijev, 01033, Ukrajna [email protected] VALENTYNA ROBEIKO Tarasz Sevcsenko Kijevi Nemzeti Egyetem Volodimirszka utca 60. Kyiv, 01033, Ukraine valentyna.robeik[email protected] JULIIA TSYHVINTSEVA A Kijevi Tarasz Sevcsenko Nemzeti Egyetem Volodimirszka utca 60. Kijev, 01033, Ukrajna Az Ukrajna Nemzeti Tudományos Akadémiájának Ukrán Nyelvi Intézete Mihajlo Hruszevszkij utca 4. Kijev, 01001, Ukrajna julivo[email protected] VICTOR SOROKIN Tarasz Sevcsenko Kijevi Nemzeti Egyetem Volodimirszka utca 60. Kijev, 01033, Ukrajna victor.sorok[email protected] MIKOLA SAZOK Információs technológiák és rendszerek intézete of the National Academy of Sciences of Ukraine 40 Akademika Hlushkova Avenue Kyiv, 03187, Ukraine s[email protected]om