بازسازی داده های بارندگی روزانه دارای دوره های مفقودی، با استفاده از روش های محاسبه چندگانه با تطبیق میانگین پیش بینی و جنگل تصادفی
تاریخ دفاع
مقطع تحصیلی
كارشناسی ارشد
گروه آموزشی
مهندسی آب
استاد
سیدسعید اسلامیان
بارش از عوامل اصلی هوا و اقلیمشناسی میباشد. برآورد دقیق دادههای بارش روزانه ازدسترفته کاری دشوار است. در اختیار داشتن دوره آماری طولانیمدت و کامل از نظر علم آمار اولین نیاز تحلیلهای قابلاعتماد در آبوهواشناسی است. تحلیل سری دادههای ناقص، اریب هستند. بنابراین نیاز به برآورد دادههای گمشده است. طیف گستردهای از روشها برای تکمیل مقادیر مفقوده وجود دارد، اما درصد خلأهای آماری یکی از عوامل اصلی محدودکننده کاربرد آنها است. منطقه موردمطالعه دشت مشهد-چناران، با مساحت 9909 کیلومترمربع، بخشی از غرب حوضه آبریز قرهقوم واقع در شمال شرقی ایران می¬باشد. بهطورکلی از 34 ایستگاه بارانسنجی موجود در دشت مشهد-چناران، تعداد 30 ایستگاه بارانسنجی پس از انجام آزمون کفایت داده مورداستفاده قرار گرفت. هدف این پژوهش بازسازی و تکمیل دادههای مفقوده این ایستگاهها بادقت بالا و ارائه سری آماری تکمیلشده (حداقل 30 سال) میباشد. در مطالعه حاضر دو روش برای بازسازی و تکمیل مقادیر دادههای بارش ازدسترفته استفاده میشود؛ محاسبات چندگانه توسط معادلات زنجیرهای از طریق تطبیق میانگین پیشبینیکننده (PMM) و الگوریتم یادگیری ماشین جنگل تصادفی (RF)موجود در نرمافزار برنامهنویسی R. برای افزایش دقت، کاهش خطا و بهبود تفسیر دادهها در فرایند بازسازی با روشهای مذکور، بر روی ایستگاههای حاضر در این طرح، تحلیل خوشهای توسط روش سلسلهمراتبی Ward صورتگرفت؛ الگوریتم Ward.D2 بر اساس معیار ضریب همبستگی کوفنتیک (0.73) بهعنوان بهترین الگوریتم در میان الگوریتمهای موجود در این روش انتخابشد. تعداد خوشههای بهدستآمده در این روش، در بهینهترین حالت، بر اساس معیار میانگین عرض سیلهوت (0.26)، تعداد 8 خوشه انتخاب شد و 30 ایستگاه بارانسنجی حاضر در این پژوهش براساس میانگین و انحرافمعیار عمق بارندگی فصلی، موقعیت جغرافیایی (طول و عرض جغرافیایی) و ارتفاع از سطح دریا در این 8 خوشه دستهبندی شدند. طول دوره آماری در هر خوشه براساس سال پایه مشترک ایستگاههای آن خوشه، تعیین گردید. در ادامهیک سری کامل از دادههای روزانه در بازه زمانی محدودتر (از سال 1395 تا 1397) به صورت مصنوعی و کاملا تصادفی در 6 سطح (5%، 10%، 15%، 20%، 30% و 40%) توسط نرمافزار Rمفقود گردید تا ارزیابی دقیقتری از مدلهای موردنظر در حین بازسازی و اعتبارسنجی مدل و مقایسه مدلها با یکدیگر صورتگیرد، برای این کار از 8 ایستگاه بارانسنجی که در بازهزمانی ذکر شده دارای سری کاملی از دادهای بارش روزانه بودند، استفاده گردید. سپس سری ناقص شده، توسط دو روش PMM و RF تمکیل شده و توسط معیارهای عملکرد dr و R2 و همچنین معیارهای خطاسنجی RMSE, NRMSE, GSD, CRM, MBE, MAE و RLE در مقیاس روزانه و ماهانه مورد ارزیابی قرارگرفتند. بر این اساس تعداد سریهای کامل در روش PMM، 5 (m=5) و تعداد تکرار 50 (maxit=50) به عنوان مقادیر بهینه پارامترهای تابع این مدل انتخاب شده و مبنای بازسازی با روش PMM قرارگرفتند. در روش RF نیز تعداد درختان محاسبه 500 (n_est=500) و تعداد تکرار 100 (max_iter=100) به عنوان پارامترهای بهینه مدل انتخاب شدند. همچنین براساس معیارهای عملکرد و خطای مدلها، روش RF در اکثر سطوح مفقودی عملکرد بهتری را از خود نشانداد و دادههای بازسازیشده به مقادیر واقعی خود نزدیکتر بودند. در انتها عملیات بازسازی برروی دادههای اصلی (دادههای مفقوده طولانی مدت) ایستگاههای بارانسنجی در خوشههای موردنظر توسط دو روش PMM و RF صورت پذیرفت، نتایج ارزیابی مدل نشانداد که روش RF در اکثر خوشهها از عملکرد بهتری نسبت به روش PMM برخورداراست و تنها در مواردی که ایستگاهها دارای خلا آماری شدیدی بوده و یا داده صفر زیادی در سری آماری خود دارند، دچار افت عملکرد میشوند و دادهها را بیشاز مقدار واقعی خود بازسازی میکند، به نظر میرسد به طول دوره آماری نیز مربوط میباشد.
کلمات کلیدی: بازسازی دادهها - جنگل تصادفی- تطبیق میانگین پیشبینیکننده – بارندگی روزانه – یادگیری ماشین

