scieee AI-readable full text Open interactive document viewer

MAPREDUCE PARADIGMASI VA BIG DATA BILAN ISHLASH TEXNOLOGIYALARI

Madaminov Uktamjon Ataxanovich

Abstract

Ushbu maqolada katta hajmli maʼlumotlarga taʼrif berilgan. Katta hajmli maʼlumotlarga misollar keltirilgan va ularni qayta ishlash texnologiyalarining bir nechtasi tahlil qilingan. Katta hajmli maʼlumotlarni qayta ishlovchi texnologiyalardan parallel qayta ishlash metodi, qayta taqdim etilgan tanlov metodi va modellar kombinatsiyasi metodlarining afzalliklari va kamchiliklari koʻrib chiqilgan. Ushbu metodlar maʼlumotlarni qayta ishlovchi taqsimlangan texnologiyalar bilan solishtirilgan. Ushbu maqolada yana katta hajmli maʼlumotlarni qayta ishlash prinsiplaridan bir qanchasi koʻrib chiqilgan. Ulardan gorizontal oʻlchovlar prinsipi, teskari barqarorlik prinsipi, maʼlumotlarning joylashuvi prinsiplari koʻrib chiqilgan va tahlil qilingan. MapReduce modeli ham yuqoridagi uchta prinsipga asoslanib ish olib boradi. Bu ham kompyuter klasteridagi katta hajmdagi maʼlumotlarni qayta ishlash uchun taqsimlangan maʼlumotlarni qayta ishlash modeli hisoblanadi. Ushbu maqolada bir nechta metod va modellar tahlil qilinib afzalliklari va kamchiliklari koʻrib chiqilgan.

Full text

9 https://www.asr-conference.com/ II SHO‘BA: Sun'iy intellekt va insoniy munosabatlar transformatsiyasi: shaxsdagi muvaffaqiyatlar va rivojlanish istiqbollari MAPREDUCE PARADIGMASI VA BIG DATA BILAN ISHLASH TEXNOLOGIYALARI Muallif: Madaminov Uktamjon Ataxanovich 1 Affiliyatsiya: Abu Rayhon Beruniy nomidagi Urganch davlat universiteti dotsenti, p.f.f.d. (PhD) 1 DOI: https://doi.org/10.5281/zenodo.17350555 ANNOTATSIYA Ushbu maqolada katta hajmli maʼlumotlarga taʼrif berilgan. Katta hajmli maʼlumotlarga misollar keltirilgan va ularni qayta ishlash texnologiyalarining bir nechtasi tahlil qilingan. Katta hajmli maʼlumotlarni qayta ishlovchi texnologiyalardan parallel qayta ishlash metodi, qayta taqdim etilgan tanlov metodi va modellar kombinatsiyasi metodlarining afzalliklari va kamchiliklari koʻrib chiqilgan. Ushbu metodlar maʼlumotlarni qayta ishlovchi taqsimlangan texnologiyalar bilan solishtirilgan. Ushbu maqolada yana katta hajmli maʼlumotlarni qayta ishlash prinsiplaridan bir qanchasi koʻrib chiqilgan. Ulardan gorizontal oʻlchovlar prinsipi, teskari barqarorlik prinsipi, maʼlumotlarning joylashuvi prinsiplari koʻrib chiqilgan va tahlil qilingan. MapReduce modeli ham yuqoridagi uchta prinsipga asoslanib ish olib boradi. Bu ham kompyuter klasteridagi katta hajmdagi maʼlumotlarni qayta ishlash uchun taqsimlangan maʼlumotlarni qayta ishlash modeli hisoblanadi. Ushbu maqolada bir nechta metod va modellar tahlil qilinib afzalliklari va kamchiliklari koʻrib chiqilgan. Kalit soʻzlar: Big Data, MapReduce paradigmasi, gorizontal oʻlchovlar, maʼlumotlarning joylashuvi, teskari barqarorlik. KIRISH MapReduce paradigmasi: - Big Datamaʼlumotlar 100 Gb dan ortiq boʻlsa; - Big Databu Excelda qayta ishlab boʻlmaydigan maʼlumotlar; - Big Data bitta kompyuterda qayta ishlanmaydigan maʼlumotlar. Katta hajmli maʼlumotlar bu turli xil strukturalangan va strukturalanmagan maʼlumotlarni qayta ishlash metodlari, usullari va yechimlarining uzluksiz oʻsib borishidir. Katta hajmli maʼlumotlar deganda maʼlumotlar miqdori emas balki, ularni qayta ishlash metodlari tushiniladi. Quyidagi baʼzi bir maʼlumotlar manbai katta hajmli maʼlumotlar manbasiga misol boʻla oladi:  internetda foydalanuvchi harakatlarining qaydlari;  transport kompaniyalari uchun avtomobillardan kelayotgan GPS signallar oqimi;  barcha bank mijozlarining tranzaksiyalari;  katta chakana savdo tarmogʻida barcha xaridlar haqida maʼlumot va h.k. “RAQAMLI TRANSFORMATSIYA DAVRIDA PEDAGOGIK TA’LIMNI RIVOJLANTIRISH ISTIQBOLLARI” 10 https://www.asr-conference.com/ II SHO‘BA: Sun'iy intellekt va insoniy munosabatlar transformatsiyasi: shaxsdagi muvaffaqiyatlar va rivojlanish istiqbollari METODOLOGIYA Katta hajmli maʼlumot manbalarining soni jadal oʻsib bormoqda, yaʼni ularni qayta ishlash texnologiyalari tobora ommalashib bormoqda. Katta hajmli maʼlumotlarni qayta ishlash prinsiplari. Big Data taʼrifiga asoslanib, bunday maʼlumotlarni qayta ishlashning asosiy prinsiplarini shakllantirish mumkin. Bular: Gorizontal oʻlchovlar . Katta maʼlumotlarni qayta ishlash uchun imkon qadar katta maʼlumotlarni qayta ishlashni qamrab oluvchi har qanday tizim kengaytirilishi mumkin. Bunda maʼlumotlar hajmi ikki barobar ortadi, klasterdagi komponentalar soni ham ikki marta oshadi va jarayon davom etadi. Teskari barqarorlik . Gorizontal oʻlchovlar prinsipida klasterdagi komponentalar soni koʻp boʻladi. Misol uchun, Yahooning Hadoop klasterida 42 000 dan ortiq mashinalar mavjud (turli tashkilotlarning klaster oʻlchamiga qarash uchun foydalanish mumkin). Bu shuni anglatadiki, ushbu mashinalarning baʼzilari muvaffaqiyatsizlikka uchraydi. Katta maʼlumot bilan ishlash usullari bu kabi xatolarning mavjudligini hisobga olishi va hech qanday jiddiy oqibatlarsiz ishlashi kerak. Maʼlumotlarning joylashuvi . Katta taqsimlangan tizimlarda maʼlumotlar koʻp sonli mashinalarga tarqatiladi. Maʼlumotlar bir xil serverda joylashgan boʻlsa va boshqasida qayta ishlansa  maʼlumotlar uzatish qiymati uni qayta ishlash narxidan oshib ketishi mumkin. Shuning uchun, BigData yechimlari uchun eng muhim prinsip tamoyillaridan biri axborotni joylashish tamoyili boʻlib, iloji boʻlsa, ularni saqlaydigan bir mashinaning oʻzida maʼlumotlarni qayta ishlash mumkin [3]. TAHLILLAR Katta maʼlumot bilan ishlashning barcha zamonaviy usuli bu uchta printsipga amal qiladi. Bu prinsiplar bilan ishlaydigan modellarni koʻrib chiqamiz. MapReduce. MapReduce  Google tomonidan kompyuter klasterlarida katta hajmdagi maʼlumotlarni qayta ishlash uchun taklif qilingan taqsimlangan maʼlumotlarni qayta ishlash modeli. MapReduce quyidagi 1-rasmda aniq tasvirlangan: 1-rasm. MapReduce modelida maʼlumotlar uch bosqichda amalga oshiriladi Map bosqichi . Ushbu bosqichda maʼlumotlar foydalanuvchi tomonidan belgilaydigan map() funksiyasidan foydalaniladi. Ushbu bosqichning vazifasi maʼlumotlarni qayta ishlash va filtrlashdir. Bunda har bir kirish yozuviga maxsus 11 https://www.asr-conference.com/ II SHO‘BA: Sun'iy intellekt va insoniy munosabatlar transformatsiyasi: shaxsdagi muvaffaqiyatlar va rivojlanish istiqbollari funksiya qoʻllaniladi. Map () funktsiyasi bitta kirish yozuviga qoʻllaniladi va bir qator kalitqiymat juftlarini hosil qiladi. Shuffle bosqichi . Bu bosqich foydalanuvchiga sezilmaydi. Bu bosqichda map() funksiyasining chiqishlari “savatcha”larga boʻlinadi. Keyinchalik bu “savatcha” lar Reduce() bosqichi uchun kirish maʼlumotlari hisoblanadi. Reduce() bosqichi . Shuffle bosqichida hosil boʻlgan qiymatga ega boʻlgan har bir "savat" reduce() bosqichiga oʻtadi. Reduce() bosqichi foydalanuvchi tomonidan belgilanadi va bitta “savat” uchun yakuniy natijani hisoblaydi. Reduce () funktsiyasi tomonidan qaytarilgan barcha qiymatlarning toʻplami MapReduce vazifasining yakuniy natijasidir. NATIJALAR MapReduce haqida baʼzi qoʻshimcha maʼlumotlar: funksiyaning ishlashi mustaqil ravishda boshlanadi va parallel ravishda turli xil klientli mashinalarda ishlashi mumkin. Shuffle parallel saralashni ifodalaydi, shuning uchun u turli xil klientli qurilmalarda ishlashi mumkin. 13bandlar gorizontal oʻlchovli printsipini bajarishga imkon beradi. MapReducebu hamma vaqt maʼlumotlarni koʻchirib oladi va qachonki murojaat boʻlsa, zudlik bilan javob qaytaradi [6]. Katta hajmli maʼlumotlar aslida ilmiytadqiqotga aloqador sohalarda avvaldan ham mavjud boʻlgan boʻlsada, lekin soʻnggi yillardagina ushbu fenomen koʻproq tilga olinadigan boʻldi. Bunga sabab bugungi kunda yangi texnologiyalar, qurilmalar va aloqa vositalarining tezkor rivojlanishi, ijtimoiy tarmoqlarning keng miqyosda yoyilishi taʼsirida insoniyat tomonidan ishlab chiqilayotgan maʼlumotlar miqdori keskin tarzda ortib borishidir. Hozirgi kunda insoniyat tomonidan maʼlumot har 10 daqiqada yaratilmoqda. Bu turdagi katta hajmli maʼlumotlar bilan ishlashda yangidanyangi algoritm va texnologiyalar ishlab chiqilmoqda va amaliyotda keng qoʻllanilyapti. Katta hajmli maʼlumot tushunchasi katta oʻlchamdagi ishlarni bajara oladigan operatorlarga nisbatan ishlatiladi. Misol uchun, «Facebook» kompaniyasi soatiga 10 milliondan ortiq yangi rasmlar joylashi bilan faxrlanishi mumkin. Katta miqdordagi maʼlumotlarni tahlil qilish inson his etish imkoniyatidan tashqarida boʻlgan qonuniyatlarni aniqlashda yordam beradi. Bu esa kundalik hayotimizdagi barcha sohalar – hukumatni boshqarish, tibbiyot, telekommunikatsiya, moliya, transport, ishlab chiqarish va boshqa sohalarni yanada yaxshilash, ularning imkoniyatlarini oshirish, muammolarga muqobil yechimlar izlab topish imkonini yaratadi. Salmoqli maʼlumotlardan foydalanish axborot mutaxasissi uchun qoʻshimcha vazifalar va talablar yaratishdan tashqari, yangi maʼlumotlarni topish (Data mining) va maʼlumot boʻyicha mutaxassis (Data scientist) kabi kasblarning paydo boʻlishiga olib keladi. “Data mining” – biron qonuniyatni topish maqsadida maʼlumotlarni tahlil qilishga aytiladi [8]. “Data science” tushunchasiga maʼlumotlar omborini loyihalash va raqamlangan maʼlumotlarni qayta ishlashning barcha metodlari kiradi. “Data science” salmoqli maʼlumotning biznes nuqtai nazaridan hozirgi zamonaviy oʻrindoshi hisoblanadi. Bugungi kunda elektron hukumat tizimi butun dunyoda, shu jumladan, Oʻzbekistonda keng rivojlanayotgan tizim hisoblanadi. Bu tizim fuqarolar, tadbirkorlik subʼyektlari va davlat hokimiyati organlariga avvaldan shakllangan davlat xizmatlarini koʻrsatishda zamonaviy axborotkommunikatsiya texnologiyalaridan foydalanishni koʻzda tutadi [5]. 12 https://www.asr-conference.com/ II SHO‘BA: Sun'iy intellekt va insoniy munosabatlar transformatsiyasi: shaxsdagi muvaffaqiyatlar va rivojlanish istiqbollari XULOSA Xulosa qilib shuni aytish mumkinki, bu uchta prinspga hozirgi zamonaviy barcha modellar amal qiladi. Bu prinsplar asosida ishlaydigan MapReduce modeli taqsimlangan tarzda ishlaydi. Bu modelda asosan axborotning joylashuv prinsipi asosiy rol oʻynaydi. Agarda axborot joylashuvi prinspi ishlamasa bunday vaziyatda maʼlumotni uzatish maʼlumotni qayta ishlashdan koʻra qimmatroq boʻladi. Ushbu ilmiy tadqiqot ishidakatta hajmli maʼlumotlarga misollar orqali aniq nazariy va amaliy yondashuvlar keltirib oʻtildi. Big datani qayta ishlovchi texnologiyalardan parallel qayta ishlash usullari, tanlov metodlari va modellar kombinatsiyasi metodlarining afzalliklari hamda kamchiliklari keltirib oʻtildi. Ushbu metodlar maʼlumotlarni qayta ishlovchi taqsimlangan texnologiyalar bilan solishtirilgan. Ulardan gorizontal oʻlchovlar prinspi, teskari barqarorlik prinspi, maʼlumotlarning joylashuvi prinsplari ilmiy-amaliy jihatdan tahlil qilindi. FOYDALANILGAN ADABIYOTLAR ROʻYXATI 1. Franks, B. Taming the Big Data Tidal Wave Finding Opportunities in Huge Data Streams with Advanced Analytics / Bill Franks, 2012. – 45 p. 2. Gantz, J. The digital universe in 2020: Big Data, Bigger Digital Shadows, and Biggest Growth in the Far East  United States / J. Gantz, D. Rainsel // IDC Country brief, 2013. – 16 p. 3. Hadoop and Big Data [Электронный ресурс] – Режим доступа: http://www.cloudera.com/content/cloudera/en/about/hadoopandbigdata.ht ml. 4. Golnar Assadat Afzali, Shahriar Mohammadi. Privacy Preserving Big Data Mining: Association Rule Hiding. 2016. – 10 p. http://www.jist.ir/Article/ 139504261512112857 5. Качалов Д.Л., Мишустин А.В., Фархадов М.П. Институт проблем управления РАН имени В.А. Трапезникова. Современные методы обработки больших данных в крупномасштабных системах. // Труды ИСП РАН. 2012. – 143-156 с. 6. Cuzzocrea, A., Song, I., Davis, K.C.: Analytics over LargeScale Multidimensional Data: The Big Data Revolution! In: Proceedings of the ACM International Workshop on Data Warehousing and OLAP, 2011. – 101–104 pp. 7. Economist Intelligence Unit: The Deciding Factor: Big Data & Decision Making. In: Capgemini Reports, 2012. – 1–24 pp. 8. Oʻrazmatov T.Q. Nurmetova B.B. Katta hajmli maʼlumot bilan ishlash prinsiplari. “Iqtisodiyotning tаrmoqlаrini innovаtsion rivojlаnishidа аxborotkommunikаtsiya texnologiyalаrining аhаmiyati” respublikа ilmiy-аmаliy аnjumаni. – Fargʻona, 2019. – 52-54 b.