scieee AI-readable full text Open interactive document viewer

O'ZBEK TILIDAGI TOKSIK XABARLAR UCHUN MAXSUS MINI-KORPUS YARATISH VA UNING ASOSIDA KLASSIFIKATSIYA MODELI QURISH

Babomurodov Ozod Jurayevich; Qo'yliyeva Feruzaxon Alisher qizi

Full text

104 O‘ZBEK TILIDAGI TOKSIK XABARLAR UCHUN MAXSUS MINIKORPUS YARATISH VA UNING ASOSIDA KLASSIFIKATSIYA MODELI QURISH Babomurodov Ozod Jurayevich Jizzax shahridagi Kazan Federal Universiteti filiali Ijrochi direktori, Doctor of Science (DSc), E-mail: [email protected] Qo‘yliyeva Feruzaxon Alisher qizi Toshkent Davlat Agrar Universitet assisenti, E-mail: [email protected] DOI: https://doi.org/10.5281/zenodo.17665191 Annotatsiya. Ushbu tadqiqot o‘zbek tilida yozilgan ijtimoiy tarmoq xabarlaridagi toksiklikni aniqlash uchun maxsus mini-korpus yaratish va uning asosida avtomatik klassifikatsiya modelini qurishga bag‘ishlangan. O‘zbek tili agglutinativ xususiyatga ega bo‘lgani sababli, bitta so‘zning turli morfologik shakllari ma’no jihatidan sezilarli farq qilishi mumkin. Shu bois, toksiklikni aniqlovchi modellar uchun tilga mos ma’lumotlar bazasini shakllantirish muhim ahamiyat kasb etadi. Tadqiqot davomida 6000 dan ortiq Telegram xabarlaridan iborat matnlar to‘plami yig‘ilib, tozalandi va qo‘lda “toksik” hamda “normal” toifalarga ajratildi. Mini-korpus asosida turli klassifikatsiya modellari sinovdan o‘tkazildi, jumladan TF-IDF + SVM, CNN, BiLSTM va BERTbek. Natijalarga ko‘ra, BERTbek modeli eng yuqori aniqlikka (F1-score = 0.91) erishdi. Ish natijalari shuni ko‘rsatadiki, kichik hajmdagi balansli korpus yordamida ham o‘zbek tili uchun toksiklikni aniqlovchi yuqori sifatli modelni yaratish mumkin. Ushbu yondashuv o‘zbek tilida ijtimoiy xavfli kontentni aniqlash va filtrlash tizimlarini shakllantirish uchun muhim bosqich hisoblanadi. Kalit so‘zlar: toksik xabarlar, mini-korpus, BERTbek, klassifikatsiya modeli, o‘zbek tili, Telegram, mashinaviy o‘rganish, chuqur o‘rganish. Zamonaviy axborot makonida ijtimoiy tarmoqlar va messenjerlar orqali foydalanuvchilar tomonidan yaratilayotgan matnli kontent hajmi keskin ortib bormoqda. Ayniqsa, Telegram, Facebook, Instagram, X (Twitter) kabi platformalarda qisqa, hissiy va norasmiy yozilgan xabarlar tez tarqaladi hamda ularning tarkibida toksik yoki zararli mazmunli iboralar ko‘paymoqda. Toksik xabarlar - bu nafrat, tahdid, haqorat, kamsitish yoki manipulyativ ruhdagi ifodalarni o‘z ichiga oluvchi, shaxs yoki ijtimoiy guruhga zarar yetkazuvchi matn shaklidir. Bunday kontentni aniqlash va avtomatik tarzda filtrlash tizimlari nafaqat foydalanuvchi xavfsizligini ta’minlaydi, balki ijtimoiy tarmoqlarda sog‘lom muloqot muhitini yaratishga ham xizmat qiladi. Ushbu tadqiqotda o‘zbek tilidagi toksik xabarlar uchun maxsus minikorpus yaratilishi va uning asosida avtomatik klassifikatsiya modeli qurilishi masalasi yoritiladi. 105 Tadqiqotning asosiy maqsadi - o‘zbek tilidagi qisqa ijtimoiy tarmoq xabarlarini toksik va no-toksik toifalarga ajrata oladigan mashinaviy o‘rganish modelini tayyorlashdir. Ushbu jarayonni amalga oshirish uchun birinchi navbatda ishonchli, balansli va sifatli korpusga ehtiyoj tug‘iladi. Afsuski, o‘zbek tili uchun toksiklikka oid tayyor ma’lumotlar to‘plami (dataset) mavjud emas. Shu sababli ushbu ishda noldan (scratch) mini-korpus yaratish yo‘li tanlandi. Korpus yaratish jarayoni bir necha bosqichdan iborat. Avvalo, 2023–2025yillar oralig‘ida faol bo‘lgan 10 dan ortiq Telegram kanallari va ochiq chatlardan jami 6000 dan ortiq xabar yig‘ib olindi. Ushbu xabarlar orasidan takrorlar, havolalar, emoji, reklama va bot javoblari avtomatik tarzda tozalandi. Tozalangan matnlar ustida qo‘lda etiketlash (manual labeling) ishlari olib borildi. Har bir xabar “toksik” yoki “normal” (no-toksik) sifatida belgilandi. Belgilash jarayonida quyidagi lingvistik mezonlardan foydalanildi: haqorat so‘zlari mavjudligi, salbiy emotsional ton, agressiv fe’llar, tahdid yoki kamsitish ifodasi, salbiy emodjilar (😡💣 ) ishlatilganligi, va yuqori darajadagi sub’ektivlik. Natijada 4000 ta xabar aniq etiketlangan mini-korpus shakllantirildi. Ma’lumotlar nisbati 50% toksik va 50% normal tarzda balanslashtirildi. Shuningdek, tokenlash va lemmatizatsiya bosqichida o‘zbek tilining agglutinativ xususiyatini hisobga oluvchi segmentatsiya moduli ishlab chiqildi. Bu modul so‘zlarni ildiz va affikslarga ajratib, modelga morfologik jihatdan boy xususiyatlarni o‘rganish imkonini berdi. Masalan, “uraman”, “uray”, “urib tashlayman” kabi so‘zlar yagona semantik ildiz “ur-” asosida birlashtirildi. Korpus tayyorlangach, turli mashinaviy o‘rganish modellari sinovdan o‘tkazildi. Dastlab, TF-IDF asosidagi klassik modellar - Logistic Regression, Naive Bayes va Support Vector Machine (SVM) - qo‘llanildi. Ushbu modellar tez o‘qitiladi, ammo matnning semantik ma’nosini to‘liq anglay olmaydi. Keyinchalik chuqur o‘rganish (deep learning) arxitekturalari sinovdan o‘tkazildi: Convolutional Neural Network (CNN), Bidirectional LSTM va transformer oilasiga mansub BERTbek, mBERT, XLM-R modellari. Har bir model uchun aniqlik (accuracy), aniqlovchanlik (precision), eslab qolish (recall) va F1 ko‘rsatkichlari hisoblandi. Tajriba natijalariga ko‘ra, TF-IDF + SVM modeli 78% aniqlik, CNN modeli 84% aniqlik, BiLSTM esa 86% aniqlik ko‘rsatdi. Eng yuqori natija transformer asosidagi BERTbek modelida kuzatildi - F1-score 0.91 ga teng bo‘ldi. BERTbek o‘zbek tili uchun maxsus o‘qitilgan model bo‘lgani sababli u morfologik va semantik kontekstni chuqurroq tahlil qila oldi. Shu bilan birga, kichik hajmli mini-korpusda modelni qayta o‘qitish (fine-tuning) uchun 4–5 ming namunaviy xabar yetarli bo‘ldi. 106 Bu esa o‘zbek tilida kichik ma’lumot to‘plamlari bilan ham sifatli toksiklik tahlilini amalga oshirish mumkinligini ko‘rsatadi. Tajriba davomida korpusning tarkibiy va statistik xususiyatlari ham tahlil qilindi. Eng ko‘p uchraydigan toksik so‘zlar “ahmoq”, “yo‘qol”, “uraman”, “nafrat”, “o‘ldiraman”, “bexabar” kabi agressiv fe’l va salbiy sifat so‘zlaridir. Shuningdek, emotsional yuklama bildiruvchi “nahotki”, “chindanmi”, “baribir” kabi so‘zlar toksiklik bilan qisman bog‘liqligi aniqlangan. Shu sababli modelning keyingi versiyalarida sentiment tahlil moduli ham qo‘shilishi rejalashtirilmoqda. O‘tkazilgan tajribalar shuni ko‘rsatdiki, toksiklikni aniqlashda nafaqat so‘zlar to‘g‘ridan - to‘g‘ri ishlatilishi, balki ularning morfologik o‘zgarishlari ham katta ahamiyatga ega. Shu sababli keyingi bosqichlarda morfologik xabardor embedding (morphological-aware embeddings) asosida yengil transformer modeli ishlab chiqilishi rejalashtirilgan. Bundan tashqari, yaratilgan mini-korpus ochiq manba sifatida kengaytirilib, o‘zbek tili uchun toksiklik aniqlash bo‘yicha birinchi milliy benchmark sifatida taqdim etilishi mumkin. Xulosa qilib aytganda, ushbu tadqiqot o‘zbek tili uchun toksik xabarlarni aniqlashga mo‘ljallangan dastlabki amaliy asosni yaratdi. Maxsus mini-korpus tuzildi, u asosida turli klassifikatsiya modellari sinovdan o‘tkazildi va ularning samaradorligi tahlil qilindi. Natijalar o‘zbek tilida tabiiy tilni qayta ishlash (NLP) yo‘nalishidagi lokal tadqiqotlar uchun muhim poydevor yaratadi. Kelgusida ushbu korpus asosida toksiklik intensivligini ball ko‘rinishida baholovchi risk-skoring tizimi va onlayn monitoring platformasi ishlab chiqilishi mumkin. Foydalanilgan adabiyotlar: 1. Devlin J., Chang M.-W., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. - NAACL-HLT, 2019. 2. Bojanowski P., Grave E., Joulin A., Mikolov T. Enriching Word Vectors with Subword Information. - Transactions of ACL, 2017. 3. Koto F., Rahman A. Multilingual Toxicity Detection in Low-Resource Languages. - SocialNLP Workshop, 2021. 4. Abdurahmonov D., Yusupova G. O‘zbek tili uchun toksiklikni aniqlash korpusi yaratish muammolari. - O‘zbekiston NLP konferensiyasi, 2024. 5. Vaswani A., Shazeer N., Parmar N. va boshqalar. Attention Is All You Need. - NIPS, 2017. 6. Rahimi A., Baldwin T. Low-resource Toxic Language Detection via Morphological Decomposition. - arXiv preprint, 2021.