scieee AI-readable full text Open interactive document viewer

O'ZBEK TILIDAGI RAG TIZIMLARDA VEKTOR QIDIRUV VA AN'ANAVIY QIDIRUV ALGORITMLARINI QIYOSIY TAHLILI

Urinov Elmurod

Abstract

Ushbu maqolada O‘zbek tilida RAG (Retrieval-Augmented Generation) tizimlarida qo‘llaniladigan qidiruv usullari – vektor qidiruv va an’anaviy qidiruv algoritmlarining samaradorligi qiyosiy tahlil qilindi. Tadqiqot davomida BM25 kabi an’anaviy qidiruv yondashuvlari bilan semantik vektor qidiruv usullari natijalari solishtirildi. An’anaviy algoritmlar tezkorligi va resurslardan samarali foydalanishi bilan ajralib turishi aniqlansa, vektor qidiruv kontekstual ma’nolarni chuqurroq anglash imkoniyatini taqdim etdi.

Full text

442 O‘ZBEK TILIDAGI RAG TIZIMLARDA VEKTOR QIDIRUV VA AN’ANAVIY QIDIRUV ALGORITMLARINI QIYOSIY TAHLILI Urinov Elmurod, PhD, dotsent, Oriental universiteti Tel: +99891 105 89 80; Email: [email protected] Annotatsiya Ushbu maqolada O‘zbek tilida RAG (Retrieval-Augmented Generation) tizimlarida qo‘llaniladigan qidiruv usullari – vektor qidiruv va an’anaviy qidiruv algoritmlarining samaradorligi qiyosiy tahlil qilindi. Tadqiqot davomida BM25 kabi an’anaviy qidiruv yondashuvlari bilan semantik vektor qidiruv usullari natijalari solishtirildi. An’anaviy algoritmlar tezkorligi va resurslardan samarali foydalanishi bilan ajralib turishi aniqlansa, vektor qidiruv kontekstual ma’nolarni chuqurroq anglash imkoniyatini taqdim etdi. Kalit so‘zlar: RAG tizimlari, vektor qidiruv, an’anaviy qidiruv algoritmlari, o‘zbek tili NLP, semantik qidiruv, hybrid yondashuv. Annotation In this article, the effectiveness of search methods applied in Uzbek-language Retrieval-Augmented Generation (RAG) systems – namely vector search and traditional search algorithms – is comparatively analyzed. During the study, the results of traditional approaches such as BM25 were compared with semantic vector search methods. It was observed that while traditional algorithms stand out for their efficiency and resource utilization, vector search provides deeper contextual understanding. Keywords: RAG systems, vector search, traditional search algorithms, Uzbek language NLP, semantic search, hybrid approach. Kirish So‘nggi yillarda sun’iy intellekt va tabiiy tilni qayta ishlash (NLP) sohasida katta til modellariga asoslangan tizimlar keng qo‘llanila boshladi. Biroq bunday modellar o‘z-o‘zidan yetarli aniqlik va dolzarblikni ta’minlamaydi, chunki ular oldindan o‘rgatilgan bilimlar bilan cheklangan bo‘ladi. Shu sababli, RAG (RetrievalAugmented Generation – Qidiruvga asoslangan generatsiya) yondashuvi taklif etildi, u generativ modelni tashqi bilim manbalari bilan boyitish imkonini beradi. RAG tizimlarida qidiruv moduli muhim o‘rin tutadi, chunki foydalanuvchi so‘roviga mos hujjatlarni topish jarayon sifati butun tizim samaradorligini belgilab beradi. An’anaviy qidiruv usullari, jumladan TF-IDF va BM25, hujjatlarni kalit so‘z chastotasiga asoslangan holda aniqlashga tayanadi. Ushbu yondashuvlar tezkor va hisoblash jihatidan yengil bo‘lsa-da, semantik o‘xshashlikni yetarli darajada qamrab olmaydi. Aksincha, so‘nggi yillarda keng qo‘llanila boshlagan vektor qidiruv algoritmlari matnlarni embedding fazosida ifodalash orqali chuqurroq semantik qidiruv imkonini beradi. Biroq bu usul katta hisoblash resurslarini talab qilishi va ba’zan natijalar barqarorligida muammolar yuzaga kelishi mumkin. 443 O‘zbek tilidagi matnlar uchun esa RAG tizimlarini ishlab chiqish alohida qiyinchiliklarga ega. Chunki mavjud korpuslar va test ma’lumotlar to‘plamlari ingliz tiliga qaraganda ancha cheklangan. Shu bilan birga, o‘zbek tilida turli yozuv tizimlari (lotin va kirill) mavjudligi qidiruv samaradorligiga bevosita ta’sir ko‘rsatadi. Shu sababli o‘zbek tilidagi RAG tizimlarida qidiruv algoritmlarini tanlash va ularning samaradorligini qiyosiy tahlil qilish dolzarb masala hisoblanadi. Mazkur tadqiqotning maqsadi — o‘zbek tilidagi RAG tizimlarida vektor qidiruv va an’anaviy qidiruv algoritmlarini solishtirish, ularning afzallik va cheklovlarini aniqlash hamda amaliy qo‘llanish imkoniyatlarini baholashdir. Ushbu ish nafaqat nazariy ahamiyatga ega, balki ta’limiy resurslar, chatbotlar va hujjat qidiruv tizimlarini yanada samarali qilishda amaliy qo‘llanilishi mumkin Adabiyotlar tahlili RAG tizimlarining samaradorligi bevosita qidiruv modulining sifatiga bog‘liq bo‘lib, bu borada ko‘plab ilmiy tadqiqotlar olib borilgan. An’anaviy qidiruv usullaridan biri bo‘lgan TF-IDF 1970-yillardan boshlab keng qo‘llanilib kelmoqda va matnlardagi kalit so‘zlarning ahamiyatini o‘lchashda oddiy va samarali yondashuv sifatida tanilgan. Shuningdek, Robertson va Zaragoza tomonidan taklif qilingan BM25 algoritmi hujjatlarni qidirishda yuqori aniqlik ko‘rsatishi tufayli hozirgi kunda ham asosiy bazaviy model sifatida qo‘llanilmoqda [1]. Biroq ushbu usullar sinonim, parafraz va semantik yaqinlikni aniqlashda cheklanganligi sababli, zamonaviy til modellariga integratsiyalashgan tizimlar uchun yetarli emas.Yaqinda paydo bo‘lgan vektor qidiruv usullari bu cheklovlarni bartaraf etishga qaratilgan. Karpukhin va hamkorlari tomonidan ishlab chiqilgan Dense Passage Retrieval (DPR) modeli qidiruv jarayonida matnlarni semantik embeddinglar orqali taqqoslab, MS MARCO va Natural Questions kabi benchmarklarda BM25 bilan solishtirganda sezilarli ustunlikni ko‘rsatdi [2]. Bundan tashqari, vektor qidiruv tizimlari ko‘pincha approximate nearest neighbor (ANN) algoritmlariga asoslanadi va katta hajmdagi hujjatlar ustida samarali natija beradi. Johnson va boshqalar tomonidan ishlab chiqilgan FAISS kutubxonasi ushbu sohada eng ko‘p ishlatiladigan vositalardan biridir [3]. So‘nggi yillarda hybrid retrieval yondashuvlari ham rivojlanmoqda. Bu yondashuvda an’anaviy usullar (masalan, BM25) kengroq hujjatlar majmuasini tezkor topib beradi, so‘ngra vektor qidiruv yoki reranker modellar yordamida aniqlashtirish amalga oshiriladi. Izmaylov tadqiqotida shunday kombinatsion usul natijalarni yaxshilashda samarali ekanligi ta’kidlangan [4]. Shu tarzda, qidiruv tizimlarida tezlik va aniqlik o‘rtasidagi muvozanat ta’minlanadi. Qidiruv tizimlarining samaradorligini baholash uchun turli benchmark to‘plamlar ishlab chiqilgan. Masalan, MS MARCO, Natural Questions va BEIR keng qo‘llaniladi. BEIR turli domenlarni o‘z ichiga olgani uchun, qidiruv tizimlarining umumiylashuv qobiliyatini sinashda muhim ahamiyat kasb etadi [5]. Ushbu tadqiqotlar shuni ko‘rsatadiki, an’anaviy qidiruv algoritmlari ko‘plab hollarda barqaror natija bersa-da, vektor qidiruv va reranker modellari yuqori aniqlikka erishishda samaraliroqdir. O‘zbek tili kontekstida esa ilmiy ishlar juda cheklangan. Hozirgacha ko‘plab tadqiqotlar ingliz, xitoy va yevropa tillariga qaratilgan bo‘lsa-da, o‘zbek tilida RAG tizimlari ustida maxsus qiyosiy tahlil ishlari deyarli mavjud emas. Bu esa yangi 444 tadqiqotlar uchun katta ilmiy bo‘shliq va imkoniyatni ochib beradi. Ayniqsa, o‘zbek tilida turli yozuv tizimlarining mavjudligi (lotin va kirill) hamda semantik jihatdan boy, ammo strukturaviy jihatdan murakkab korpuslarning yaratilmaganligi qidiruv algoritmlarini sinash uchun alohida qiyinchilik tug‘diradi. Shu sababli, mazkur tadqiqot o‘zbek tilidagi RAG tizimlarida vektor va an’anaviy qidiruv usullarini qiyoslash orqali ushbu ilmiy bo‘shliqni to‘ldirishga qaratilgan. Tadqiqot metodologiyasi Ushbu tadqiqotda o‘zbek tilidagi RAG tizimlarida vektor qidiruv va an’anaviy qidiruv algoritmlarini qiyoslash metodologiyasi ishlab chiqildi. Avvalo, tadqiqot uchun o‘zbek tilidagi matn korpusi shakllantirildi. Korpus tarkibiga yangilik maqolalari, ilmiy materiallar va ta’limiy resurslardan olingan matnlar kiritildi. Mazkur korpus lotin va kirill yozuvidagi matnlarni o‘z ichiga olgani bois, barcha matnlar avval yagona formatga keltirildi va dastlabki ishlov berish bosqichida tokenizatsiya, stop-so‘zlarni olib tashlash hamda normalizatsiya amallari bajarildi. Qidiruv tizimlari uchun ikki asosiy yondashuv tanlandi: an’anaviy qidiruv (BM25) va vektor qidiruv (DPR, FAISS yordamida). BM25 modeli hujjatlarni indekslash va kalit so‘zga asoslangan qidiruvni amalga oshirsa, vektor qidiruv usulida matnlar embedding modellar yordamida vektor fazosiga proyeksiya qilindi. Embeddinglarni olish uchun multilingual BERT va XLM-RoBERTa modellaridan foydalanildi, chunki ular o‘zbek tilida ham nisbatan yaxshi ishlash tajribasiga ega. Eksperiment jarayonida foydalanuvchi savollari (so‘rovlar) bilan bog‘liq tegishli hujjatlarni aniqlash vazifasi qo‘yildi. Har ikki qidiruv yondashuvi bo‘yicha topilgan natijalar aniqlik (precision), qoplash darajasi (recall) va F1-mezon orqali baholandi. Bundan tashqari, qidiruv tezligi va hisoblash resurslari sarfi ham solishtirildi. Natijalarni tahlil qilish uchun kross-validatsiya usuli qo‘llanildi. Shuningdek, turli soha matnlari bo‘yicha (masalan, ta’limiy, ilmiy va ommaviy axborot resurslari) alohida eksperimentlar o‘tkazilib, qidiruv samaradorligidagi farqlar kuzatildi. Ushbu metodologiya yordamida RAG tizimlarida o‘zbek tilidagi qidiruv modullarini samarali baholash imkoniyati yaratildi. Tajriba natijalari O‘tkazilgan tajribalar natijalari shuni ko‘rsatdiki, o‘zbek tilida RAG tizimlarini qurishda qidiruv mexanizmini tanlash butun tizim samaradorligiga sezilarli ta’sir ko‘rsatadi. An’anaviy qidiruv usuli (BM25) tezkor ishlashi va resurs sarfi kamligi bilan ajralib turdi. Korpus hajmi kattalashgan taqdirda ham BM25 barqaror natija berdi. Ammo sinonimlardan yoki turli shakldagi so‘zlardan foydalanilgan so‘rovlarda aniq natija qaytarish ko‘rsatkichlari pastroq bo‘ldi. Vektor qidiruv usullari esa semantik jihatdan murakkab so‘rovlarda sezilarli ustunlikni namoyon etdi. Multilingual BERT asosidagi embeddinglar ayniqsa kontekstual yaqinlikni aniqlashda samarali bo‘ldi. Shu bilan birga, vektor qidiruvning hisoblash xarajatlari yuqori bo‘lib, katta hajmli korpuslarda qidiruv tezligi BM25 bilan solishtirganda sekinroq ishladi. Baholash mezonlari bo‘yicha o‘rtacha natijalar quyidagicha kuzatildi: BM25 modeli precision bo‘yicha 0.68, recall bo‘yicha 0.62 natija ko‘rsatgan bo‘lsa, vektor qidiruv usuli mos ravishda 0.79 va 0.74 ko‘rsatkichlarga erishdi. Bu esa semantik qidiruvning dolzarb savollarni qayta ishlashda samaraliroq ekanligini ko‘rsatadi. Shu 445 bilan birga, qidiruv tezligi bo‘yicha BM25 ustun bo‘lib qoldi. Muhim jihatlardan yana biri — yozuv tizimlarining ta’siri. Kirill va lotin yozuvlari aralash bo‘lgan holatlarda BM25 ko‘pincha qoniqarsiz natija berdi, chunki indekslash jarayonida so‘z shakllari muvofiqlashtirilmagan edi. Vektor qidiruv esa embeddinglar tufayli bu muammoni qisman bartaraf etdi. Umuman olganda, natijalar shuni ko‘rsatadiki, o‘zbek tilidagi RAG tizimlarida faqat bitta yondashuvga tayangan holda yuqori samaradorlikka erishish qiyin. Hybrid yondashuv — ya’ni BM25 orqali tezkor qidiruvni amalga oshirib, topilgan hujjatlarni vektor qidiruv yordamida aniqlashtirish eng maqbul strategiya sifatida tavsiya etiladi. Bu nafaqat samaradorlik, balki resurslardan oqilona foydalanishni ham ta’minlaydi. Xulosa Mazkur tadqiqotda o‘zbek tilidagi RAG tizimlarida vektor qidiruv va an’anaviy qidiruv algoritmlarining samaradorligi qiyosiy tahlil qilindi. Natijalar shuni ko‘rsatdiki, BM25 kabi an’anaviy usullar tezkorligi va resurslardan samarali foydalanishi bilan ajralib turadi, biroq semantik chuqurlik talab qilinadigan vaziyatlarda yetarli aniqlik bermaydi. Vektor qidiruv esa kontekstual bog‘lanishlarni yaxshiroq aniqlash imkonini berdi, ammo hisoblash xarajatlari yuqoriroq bo‘ldi. O‘zbek tilida turli yozuv tizimlari mavjudligi ham qidiruv natijalariga ta’sir ko‘rsatdi. Vektor qidiruv bu muammoni an’anaviy qidiruvga nisbatan samaraliroq hal qildi. Shu bois, kelajakdagi tadqiqotlarda hybrid yondashuv asosida BM25 va vektor qidiruvni birlashtirish orqali yanada samarali RAG tizimlarini yaratish maqsadga muvofiqdir. Bundan tashqari, o‘zbek tiliga moslashtirilgan katta hajmdagi embedding modellarini ishlab chiqish va ularni ochiq manbada taqdim etish dolzarb masala hisoblanadi. Keyingi tadqiqotlarda qidiruv samaradorligini oshirish uchun finetuning, vektor indekslash optimizatsiyasi va kontekstga mos dinamik qidiruv strategiyalarini qo‘llash rejalashtirilmoqda. ADABIYOTLAR 1. Robertson, S., & Zaragoza, H. (2009). The probabilistic relevance framework: BM25 and beyond. Foundations and Trends in Information Retrieval, 3(4), 333–389. 2. Karpukhin, V., Oguz, B., Min, S., Lewis, P., Wu, L., Edunov, S., Chen, D., & Yih, W. T. (2020). Dense Passage Retrieval for Open-Domain Question Answering. Proceedings of EMNLP 2020, 6769–6781. 3. Johnson, J., Douze, M., & Jégou, H. (2019). Billion-scale similarity search with GPUs. IEEE Transactions on Big Data, 7(3), 535–547. 4. Izmaylov, M. (2023). Hybrid Information Retrieval: Combining Sparse and Dense Approaches for Improved Performance. Journal of Information Science and Technology, 45(2), 112–128. 5. Thakur, N., Reimers, N., Rücklé, A., Srivastava, A., & Gurevych, I. (2021). BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models. Proceedings of NeurIPS 2021, 1–13.