این یک مقاله دسترسی آزاد تحت CC توسط مجوز است (http://creativeecommons. org/licenses/by/4. 0/).
داده های مرتبط
فاز اولیه با برد کوتاه COVID-19 پیش بینی R-Project و داده ها (داده های اصلی) (داده های مندلی).
خلاصه
بیماری Coronavirus 2019 (COVID-19) از زمان حضور در دسامبر 2019 به سرعت در سراسر جهان گسترش یافت. این مجموعه داده ها پیش بینی های یک ، سه و هفت روزه از پرونده های تجمعی Covid-19 را ایجاد می کند. سطح جغرافیایی منطقه و ایالتی برای ایالت ویرجینیا. پیش بینی ها در طول 46 روز اول موارد COVID-19 گزارش شده با استفاده از داده های شمارش مورد تجمعی ارائه شده توسط نیویورک تایمز تا 22 آوریل 2020 ایجاد می شود. از این داده های تاریخی ، یک ، سه ، هفت و همه روزهاقبل از تاریخ شروع پیش بینی برای تولید پیش بینی ها استفاده می شود. پیش بینی ها با استفاده از: (1) یک رویکرد ساده لوحانه ایجاد می شوند.(2) هموار سازی نمایی هولت-بردار (HW) ؛(3) نرخ رشد (رشد) ؛(4) میانگین متحرک (MA) ؛(5) اتورگرایی (AR) ؛(6) میانگین متحرک خودکار (ARMA) ؛و (7) میانگین متحرک یکپارچه خودجوش (ARIMA). معیارهای خطای مطلق (MDAE) و میانگین درصد خطای مطلق (MDAPE) با هر پیش بینی برای ارزیابی پیش بینی با توجه به داده های تاریخی موجود ایجاد می شوند. این معیارهای خطا برای ارائه وسیله ای برای ارزیابی کدام ترکیب از روش پیش بینی ، طول پیش بینی و طول بازگشت به بهترین وجه مناسب است ، بر اساس کمترین خطای جمع شده در هر سطح جغرافیایی.
مجموعه داده ها از یک پرونده R-Project ، چهار پرونده کد منبع R ، همه 1،329،404 پیش بینی های کوتاه با برد کوتاه ، داده های متریک MDAE و MDAPE برای هر پیش بینی ، کپی از پرونده های ورودی و جداول مقایسه ای تولید شده تشکیل شده است. کلیه پرونده ها و پرونده های داده برای ارائه شفافیت و تسهیل تکرارپذیری و تکرارپذیری ارائه شده است. این بسته مستقیماً در RSTUDIO از طریق پرونده پروژه R باز می شود. پرونده R Project نیاز به تنظیم مکان های مسیر برای پوشه های موجود در مجموعه داده ها را برای ساده کردن الزامات تنظیم حذف می کند. این مجموعه داده دو راه برای تولید مثل نتایج را فراهم می کند: 1) از کد ارائه شده برای تولید پیش بینی ها از ابتدا استفاده کنید و سپس تجزیه و تحلیل ها را اجرا کنید. یا 2) داده های پیش بینی ذخیره شده را بارگیری کرده و تجزیه و تحلیل را روی داده های ذخیره شده اجرا کنید. حاشیه نویسی کد دستورالعمل های لازم برای انجام هر دو مسیر را ارائه می دهد.
این داده ها می توانند برای تولید همان مجموعه پیش بینی ها و معیارهای خطا برای هر حالت ایالات متحده با تغییر پارامتر حالت در کد منبع استفاده شوند. کاربران همچنین می توانند با ارائه پرونده ای که هر ایالت را در یک ایالت به منطقه بهداشتی مربوطه می پردازد ، پیش بینی های منطقه بهداشتی را برای هر ایالت دیگر ایجاد کند. کد منبع را می توان به روزترین نسخه از مجموعه داده های New York Times COVID-19 وصل کرد و باعث می شود پیش بینی ها تا بیشترین داده های گزارش شده برای تسهیل پیش بینی نزدیک به زمان واقعی باشد.
واژه های کلیدی: Coronavirus Covid-19 ، بیماری های عفونی ، مدل سازی اپیدمی ، مدل ARIMA (P ، D ، Q) ، مدل ARMA ، مدل هموار سازی نمایی هولت ، تجزیه و تحلیل آماری ، پیش بینی سری کوتاه مدت
جدول مشخصات
| موضوع | بیماری های عفونی |
| حوزه موضوعی | روشهای پیش بینی برداشت کوتاه برای ارزیابی ویژگی های پیش بینی در شروع اولیه گسترش مورد COVID-19 اعمال می شود |
| نوع داده | نمودار RDS (R Data Object) (PDF ، JPEG ، EPS) RProject (نرم افزار) |
| چگونه داده ها به دست آمدند | داده های ورودی از طریق "us-counties. csv" به دست آمده از https://github. com/nytimes/covid-19-data در 23 آوریل 2020 به دست آمد [1]. این داده های موردی تجمعی COVID-19 را تا 22 آوریل 2020 فراهم می کند. پیش بینی ها با استفاده از ساده ، رشد ، HW ، MA (1) ، AR (1) ، ARMA (1،1) و ARIMA (P ، D ، Q) ایجاد شده است.) روشهای پیش بینی. مقادیر P و Q از 1 تا 3 و D از 1 تا 2 متغیر است. RSTUDIO نسخه 1. 2. 5033 و نسخه 3. 6. 3 برای ایجاد کد و انجام تجزیه و تحلیل استفاده شد. علاوه بر این ، آمار R-Packages [2] ، بسته پایه R [2] ، پیش بینی [3] ، GGPLOT2 [4] و Tidyverse [5] برای اجرای کد منبع لازم است. |
| قالب داده ها | داده ها خام ، فیلتر و تجزیه و تحلیل هستند. پرونده پروژه R و پرونده های اسکریپت R (کد) برای اجرای در RSTUDIO. |
| پارامترهای جمع آوری داده ها | پیش بینی های سطح ویرجینیا ، منطقه بهداشت و سطح ایالتی با استفاده از داده های شمارش تجمعی COVID-19 نیویورک تایمز با استفاده از: ساده لوح ایجاد می شود. رشد ؛HW ؛MA (1) ؛AR (1) ؛آرما (1،1) ؛ARIMA (P ، D ، Q). طول پیش بینی شامل یک ، سه و هفت روز به جلو است. طول بازپرداخت یک ، سه ، هفت و تمام روزهای قبل. معیارهای خطا با استفاده از MDAE و MDAPE محاسبه شده و در واحدهای مورد تجمعی Covid-19 قرار دارند. |
| شرح جمع آوری داده ها | با استفاده از داده های جمع آوری شده Covid-19 از New York Times ، ما برای "ویرجینیا" فیلتر می کنیم و نقشه برداری از ایالت های VA را به مناطق بهداشتی آنها ارائه می دهیم. برای هر یک از 46 روز حاوی تعداد موارد غیر صفر ، حداکثر 12 پیش بینی برای هر روز با استفاده از ترکیب های یک ، سه و هفت روز به جلو و یک ، سه ، هفت و تمام روزهای قبل تولید می شود. این تکرار برای هر 7 روش پیش بینی برای تولید 1329404 پیش بینی. MDAE و MDAPE از هر پیش بینی با نوع پیش بینی محاسبه و جمع می شوند تا عملکرد هر روش را در پیش بینی تعداد مورد تجمعی ارزیابی کند. |
| محل منبع داده | دانشگاه Old Dominion - مرکز مدل سازی ، تجزیه و تحلیل و شبیه سازی ویرجینیا Suffolk ، VA ، ایالات متحده آمریکا. |
| قابلیت دسترسی به داده ها | این داده ها در یک مخزن عمومی برگزار می شود و تحت عنوان: "فاز اولیه با برد کوتاه COVID-19 پیش بینی R-Project و داده ها" [6] و تحت مجوز MIT در دسترس قرار می گیرد. نام مخزن: شماره شناسایی داده های مندلی شماره شماره شناسایی: 10. 17632/cytrb8p42g. 2 [6] URL مستقیم به داده ها: https://data. mendeley. com/datasets/cytrb8p42g/2 دستورالعمل های دسترسی به این داده ها: دسترسی ، بارگیری ، بارگیری و استخراج. بسته داده از URL ارائه شده. با استفاده از RSTUDIO ، پرونده RProject "برد کوتاه-اوایل-Covid-19-forecasting. rproj" را باز کنید. این به طور خودکار فهرست کار Rstudio را به محل پوشه استخراج شده شما تنظیم می کند. کلیه پرونده های داده مورد نیاز در این بسته گنجانده شده است و مسیرهای پرونده نسبت به محل مکان RProject است. برای شروع کار هیچ تغییری (به عنوان مثال به روزرسانی های نام مسیر) لازم نیست. در RSTUDIO ، "FORECASTING_ARTICLE_CODE. R" را باز کنید. این پرونده پرونده اصلی این داده ها است. این پرونده حاوی حاشیه نویسی برای هدایت کاربر از طریق کد است. این شامل آنچه پیش بینی می شود ، نحوه تولید پیش بینی ها و تمام مراحل تحلیلی انجام می شود. اجرای هر خط کد در این پرونده مجموعه داده ها را بازآفرینی می کند. این کد تمام مراحل انجام شده برای تولید ارقام موجود در بسته را ارائه می دهد. کپی های پرونده های ایجاد شده توسط کد در بسته بندی گنجانده شده و مستقیماً در کد بارگذاری می شوند. این امر نیاز به اجرای پیش بینی ها را برطرف می کند ، زیرا این امر می تواند وقت گیر و پر مصرف باشد. این به کاربر اجازه می دهد تا مستقیماً به بخش تجزیه و تحلیل کد منتقل شود. حاشیه نویسی در کد جهت چگونگی حرکت صحیح در این فرآیند را فراهم می کند. |
| مقاله تحقیق مرتبط | C. J. Lynch ، R. Gore ، پیش بینی برد کوتاه از بیماری Coronavirus 2019 (COVID-19) در هنگام شروع زود هنگام در سطح شهرستان ، منطقه سلامت و سطح جغرافیایی ایالتی: رویکرد پیش بینی مقایسه ای با استفاده از هفت روش پیش بینی ، J. Med. اینترنت Res. در مطبوعات.[7] |
مقدار داده ها
این داده ها مفید هستند زیرا آنها پیش بینی های کوتاه مدت از شمارش مورد تجمعی COVID-19 را در هنگام شروع زودرس برای گسترش پایه دانش بیماری Covid-19 در سه سطح مختلف دانه بندی ارائه می دهند: دولت ، منطقه ، منطقه و شهرستان. از معیارهای خطای MDAE و MDAPE برای ارزیابی پیش بینی ها با توجه به داده های تاریخی برای اطلاع رسانی اعتبار سنجی و انتخاب روش استفاده می شود.
محققان ، مؤسسات و مقامات بهداشتی درگیر در جلوگیری از گسترش COVID-19 می توانند با شناسایی کدام روش کوچکترین خطا برای یک منطقه و استفاده از آن روش برای تولید پیش بینی های کوتاه مدت آینده برای آن منطقه از این داده ها بهره مند شوند. این داده ها قابل استفاده مجدد است و کد منبع را می توان در ایالت های مختلف ، مناطق بهداشتی و مناطق یا هر سطح دیگری از دانه بندی جغرافیایی گسترش داد.
این داده ها را می توان با تغییر یا حذف فیلتر "ویرجینیا" در حالت های دیگر ایجاد کرد.(2) با دسترسی به داده های به روز از نیویورک تایمز ، پیش بینی تاریخ های فعلی را ایجاد کنید. و (3) استفاده از این روشهای پیش بینی و معیارهای خطا در سایر سطوح جغرافیایی و/یا مکان با ارائه داده های مربوط به سری زمانی مربوطه در مورد تعداد موارد.
این داده ها می توانند به سیاست گذاران و محققان در پرداختن به سؤالات انتخاب پارامترهای بهینه P ، D و Q برای تکنیک های پیش بینی AR ، MA ، ARMA و ARIMA با ارائه معیارهایی برای عملکرد هر یک از این تکنیک ها برای یک مکان جغرافیایی کمک کنند.
اعضای عمومی می توانند از این پیش بینی های کوتاه مدت برای به دست آوردن بینش در مورد پرونده های مورد انتظار منطقه محلی Covid-19 در هفته آینده استفاده کنند. این یک منبع اطلاعات اضافی برای اطلاع رسانی به افراد در تصمیم گیری یا ایجاد برنامه هایی برای شرکت در فعالیت ها یا تعامل در جوامع خود طی چند روز آینده فراهم می کند.
سیاست گذاران مناطقی که صرفاً در سطح ایالت یا سطح ایالتی جای نمی گیرند می توانند بر اساس حوزه های نفوذ خود پیش بینی هایی را برای به دست آوردن نمایندگی مستقیم از تعداد مورد انتظار همراه با پشتیبانی آماری قابل توجهی ایجاد کنند که در آن روش های پیش بینی کوچکترین خطای در آن منطقه را تولید می کنند. بشر
1. شرح داده ها
1. 1پوشه بسته بندی داده Coronavirus Mendeley
این بسته ریشه شامل تمام داده های مربوط به این پروژه است. سطح بالای این بسته شامل یک سند اطلاعات مجوز (مطابق با مجوز موجود در این مقاله) ، یک فایل Readme توضیحی از مجموعه داده ها و پوشه ای حاوی کلیه کد ، داده ها و ارقام تحت عنوان مرحله کوتاه برد اولیه استپیش بینی Covid-19 پیش بینی R.
1. 2پرونده RPROJ با برد کوتاه-اوایل-COVID-19-FORCASTING
This is the starting point for this dataset. Within RStudio, select “File >پروژه را در جلسه جدید باز کنید ... "برای باز کردن این پرونده RPROJ. این پروژه را باز می کند و فهرست کار Rstudio را به محل فعلی پرونده RPROJ تنظیم می کند. تمام مسیرهای فایل کدگذاری شده نسبت به پوشه حاوی پرونده RProject است. این امر با فعال کردن کد بدون اصلاح ، تکثیر را تسهیل می کند. پرونده های زیر به ترتیب مورد استفاده در پروژه ارائه می شود.
1. 3FORECASTING_ARTICLE_CODE R
این به عنوان پرونده پایه برای این مجموعه داده است. این پرونده با نظرات در کد منبع به شدت حاشیه نویسی شده است تا به کاربران در مورد فرآیند تولید پیش بینی ها ، بارگیری داده ها از پوشه داده و انجام تجزیه و تحلیل کمک کند. پیش بینی های ساده ، رشد ، HW ، MA (1) ، AR (1) ، ARMA (1،1) و ARIMA (P ، D ، Q) در این پرونده رخ می دهد. با این حال ، توابع برای تولید این پیش بینی ها در پرونده های زیر ظاهر می شوند.
1. 4import_county_hd_state_cum_case_counts r پرونده
این کد از 23 آوریل 2020 کپی ذخیره شده از داده های جمع آوری شده در نیویورک تایمز [5] را بارگیری می کند. داده ها سپس برای ویرجینیا فیلتر می شوند. نقشه برداری از نام های VA County به مناطق بهداشتی مربوطه نیز در اشیاء داده های سری زمانی بارگیری و قالب بندی می شود.
1. 5filecasting_article_functions r پرونده
این پرونده حاوی اکثریت کارکردهای مورد نیاز برای تولید پیش بینی سطح شهرستان است. اشیاء سری زمانی سطح شهرستان با استفاده از داده های شمارش مورد وارد شده تولید می شوند. پیش بینی های Naïve ، HW ، MA (1) ، AR (1) ، ARMA (1،1) و ARIMA (P ، D ، Q) در این پرونده تولید می شوند. مقادیر Arima برای P از 1 تا 3 ، D از 1 تا 2 متغیر است و Q از 1 تا 3 متغیر است. اطلاعات مربوط به پرونده های تجمعی برای سطح شهرستان ، منطقه بهداشت و سطح ایالتی. کد برای تولید P-P -Dalues که نتایج آماری قابل توجهی را منعکس می کند نیز در این پرونده موجود است.
از طرف دیگر ، پیش بینی های ارائه شده می توانند مستقیماً از پوشه داده بارگیری شوند. حاشیه نویسی در کد دستورالعمل نحوه اجرای صحیح پیش بینی ها یا بارگیری پیش بینی های موجود را ارائه می دهد. این گزینه به عنوان تولید پیش بینی ها زمان بر و منابع فشرده ارائه شده است.
1. 6FORECASTING_ARTICLE_Functions_State_and_District R پرونده
این پرونده شامل کارکردهای مورد نیاز برای تولید پیش بینی های سطح بهداشت و سطح ایالت است. اشیاء سری زمانی سطح حالت با استفاده از داده های شمارش مورد وارد شده تولید می شوند. پیش بینی های Naïve ، HW ، Ma (1) ، AR (1) ، ARMA (1،1) و ARIMA (P ، D ، Q) برای مناطق بهداشتی و ایالت تولید می شوند. مقادیر Arima برای P از 1 تا 3 متغیر است ، D از 1 تا 2 متغیر است و Q از 1 تا 3 متغیر است. به دلیل زمان زیاد و نیاز منابع ، پیش بینی های ارائه شده می توانند مستقیماً در این مرحله بارگیری شوند.
1. 7پرونده Rction-version-extrapolate-هفت روز برای هر یک
پیش بینی های رشد را در سطح شهرستان ، منطقه بهداشت و سطح ایالتی ایجاد می کند. این میزان رشد فعلی منطقه را براساس تعداد موارد جدید در 24 ساعت گذشته در منطقه جغرافیایی مربوطه و تعداد موارد جدید در ایالت تعیین می کند. سپس پیش بینی با استفاده از این میزان رشد برای منطقه جغرافیایی و طول پیش بینی مورد نظر (یک ، سه و هفت روز) تولید می شود.
1. 8محاسبه عفونت ها-در هر بخش R
توابع توابع لازم برای ایجاد پیش بینی های رشد را فراهم می کند. این پرونده توسط تابع- version-extrapolate- هفت روزه برای هر یک از همه تهیه شده است.
1. 9پوشه داده ها
این پوشه شامل سه پوشه اضافی از داده ها است: (1) داده های تولید شده با جدول.(2) داده های سری زمان تولید شده. و (3) داده های ورودی. پرونده های موجود در این پوشه امکان تکرارپذیری و شفافیت در داده های تولید شده را فراهم می کند.
جدول تولید شده شامل 31 پرونده داده است که شامل جداول MDAE ، جداول MDAPE ، جداول اعتبار سنجی جمع شده و یک پرونده ReadMe است. هر جدول در یک سطح جغرافیایی واحد (شهرستان ، منطقه بهداشت یا ایالت) وجود دارد که در عنوان آن نشان داده شده است. این پرونده های داده فیلتر شده هستند که تجزیه و تحلیل را تسهیل می کنند. این پرونده ها می توانند به طور مستقیم در کد وارد شوند تا از اجرای کد برای تولید مستقیم این جداول جلوگیری شود ، زیرا این می تواند منجر به زمان طولانی مدت شود و خواسته های منبع بالایی داشته باشد. معیارهای MDAE و MDAPE محاسبه شده از ترکیب های جمع شده روش پیش بینی ، طول بازگشت و طول پیش بینی شامل موارد زیر است: نمرات متوسط مقادیر درجه یک بالا و پایین. میانگین مقادیر متوسط جمع شده ؛نمرات متوسط سوت های فوقانی و تحتانی. نمرات متوسط دامنه های کوارتیل فوقانی و تحتانی. و تعداد مشاهدات داده.
داده های سری زمان تولید شده شامل 75 پرونده داده است که پیش بینی های تولید شده 1329،404 RAW را ارائه می دهد. اینها با سطح جغرافیایی و روش پیش بینی همانطور که در عناوین آنها نشان داده شده است ، از هم جدا می شوند.
داده های ورودی شامل دو پرونده داده است: (1) stounties. csv ؛و (2) بهداشت و درمان-منطقه-Info. rds. عکس فوری از مجموعه داده های New York Times COVID-19 [5] در 23 آوریل 2020 در ایالات متحده-COWNTIES. CSV ارائه شده است. این اطلاعات مربوط به تعداد تجمعی در سطح شهرستان را تا 22 آوریل 2020 فراهم می کند. این پرونده برای اطمینان از تکرارپذیری داده های ایجاد شده ارائه شده است. پرونده بهداشت و درمان-county-Info. rds نقشه برداری از نام های شهرستان VA را به مناطق بهداشتی مربوطه ارائه می دهد تا جمع آوری داده های شهرستان به سطح منطقه بهداشت امکان پیش بینی را فراهم کند.
هفت روش پیش بینی در فرضیات اساسی آنها در مورد روابط آنها با وسایل یا روند در مشاهدات قبلی و تاریخ های پیش بینی شده متفاوت است. در جدول 1 توضیحاتی از هر روش پیش بینی ، فرضیات اصلی مرتبط با هر روش ارائه شده است و بسته های R را که در اجرای کد آنها استفاده شده است ، مشخص می کند.
میز 1
توضیحات و فرضیات اصلی هر یک از روشهای پیش بینی استفاده شده به همراه بسته های R استفاده شده برای اجرای.
| شرح | فرضیات اصلی | بسته های R استفاده شده است |
| آدم ساده | مقدار پیش بینی شده برای پیش بینی هر روز برابر با ارزش روز جاری است. این روش پیش بینی از دانش قبلی برای اطلاع رسانی به ارزشهای آینده استفاده نمی کند و به عنوان معیار مقایسه است. | از آنجا که داده ها مربوط به شمارش موارد تجمعی است ، این پیش بینی هیچ تغییری برای هر روز پیش بینی شده از مقدار فعلی فرض نمی کند [8]. | آمار [2] |
| هموار سازی نمایی Holt-Winters (HW) | هموار سازی نمایی هولت ، فرض می کند وزن های نمایی را نسبت به مشاهدات K قبلی کاهش می دهد. | وزن بالاتری را نسبت به گذشته اخیر با کاهش وزن به صورت نمایی به هر مشاهدات K پی در پی K انجام می دهد [9،10]. | آمار [2] |
| نرخ رشد (رشد) | نرخ رشد پیش بینی به شرح زیر محاسبه می شود: (1) نرخ رشد اولیه در هر شهرستان براساس افزایش تعداد موارد تا روز قبل تاریخ شروع پیش بینی است.(2) نرخ رشد سطح دولت افزایش تجمعی در موارد از روز قبل برای کل ایالت است.(3) پیش بینی N با نمونه گیری یکنواخت بین N بین نرخ رشد اولیه شهرستان و نرخ رشد سطح دولت تولید می شود. و (4) پیش بینی نهایی میانگین پیش بینی N است [11]. | یک رابطه خطی بین تاریخ های پیش بینی و شمارش تاریخ قبلی فرض می کند. تمام وزنه برداری به تاریخ قبل از تاریخ شروع پیش بینی داده می شود. | بسته بندی پایه [2] |
| میانگین متحرک (MA) | برای سری زمانی یک متغیره ، مدل های ساده MA به طور خطی به مقدار فعلی و مشاهدات K گذشته بستگی دارند [8]. | یک میانگین ثابت همراه با وزن برابر برای همه مشاهدات قبلی K فرض می کند. | پیش بینی [3] |
| خودجوش (AR) | مدل های AR وابستگی خطی بین مقادیر پیش بینی شده و مشاهدات K و قبلی K را به همراه یک مؤلفه تصادفی برای پاسخگویی به رفتار فرض می کنند. | فرض می کند که مقادیر پیش بینی شده بر اساس ترکیبی خطی از مقادیر قبلی است [8]. فرض نمی کند که مشاهدات به دلیل تصادفی بودن ثابت هستند. | آمار [2] |
| میانگین متحرک خودکار (ARMA) | مدل های ARMA ترکیبی از اجزای MA و AR است. مؤلفه AR شامل رگرسیون متغیرها بر اساس مقادیر عقب مانده خود است [12]. MA خطا را به عنوان ترکیبی خطی از اصطلاحات خطا در نقاط مختلف در گذشته مدل می کند. | فرض می کند که مشاهدات حداقل ضعیف ثابت هستند. | آمار [2] |
| میانگین متحرک یکپارچه خودکار (ARIMA) | مدل های ARIMA برای داده های غیر ثابت اعمال می شود و از ترکیبی از اجزای MA و AR به همراه یک اندازه گیری تفاوت برای ایجاد داده های ثابت تشکیل شده است [8]. | فرض می کند که مشاهدات غیر ثابت هستند. | آمار [2] |
1. 10پوشه ارقام
این پوشه حاوی ارقام تولید شده در طول اجرای پرونده Forecasting_article_code است. ارقام در سه قالب غیر تعاملی (گرافیک بردار و غیر بردار) و همچنین یک قالب HTML تعاملی برای کل 28 پرونده تصویری ایجاد می شود. این پرونده ها مقایسه طرح های جعبه اطلاعات MDAE را برای هفت روش پیش بینی در شهرستان (پیش بینی های شهرستان MDAE) ، منطقه بهداشتی (پیش بینی های منطقه بهداشت MDAE) و سطح (دولت پیش بینی MDAE) ارائه می دهند که اطلاعات را بر اساس طول پیش بینی جدا می کنند (از آنها جدا می شود). یک ، سه و هفت روز) و طول نگاه (یک ، سه ، هفت و تمام روزهای قبل). مقایسه طرح جعبه داده های MDAPE در شکل MDAPE پیش بینی های کل ارائه شده است. این شکل داده ها را با روش پیش بینی گروه بندی می کند و مقادیر جمع شده را در هر سطح جغرافیایی برای کل 21 قطعه جعبه تقسیم شده به 7 گروه ترسیم می کند. از همین فرآیند برای تولید ارقام برای مقایسه نتایج ARIMA (P ، D ، Q) استفاده می شود و از یک کنوانسیون نامگذاری سطح شهرستان Arima (P ، D ، Q) استفاده می کند.
2. طراحی آزمایشی ، مواد و روشها
ما پیش بینی های یک، سه و هفت روزه تعداد تجمعی موارد COVID-19 را در سطح شهرستان، ناحیه بهداشتی و ایالتی با استفاده از Naïve، Growth، HW، MA(1)، AR(1)، ARMA(1) ایجاد می کنیم., 1) و روش های پیش بینی ARIMA(p, d, q). سپس، معیارهای خطای MdAE و MdAPE را برای اعتبارسنجی پیش بینی ها در برابر داده های تاریخی ایجاد می کنیم. این بخش طراحی آزمایشی، روش های پیش بینی، داده های تاریخی به دست آمده در سطح شهرستان، معیارهای اعتبارسنجی و داده های اعتبارسنجی تولید شده را شرح می دهد. برای توضیح داده ها به بخش قبل مراجعه کنید. ارائه و بحث در مورد یافته ها بر اساس این داده ها خارج از حوصله این مقاله است. شکل 1 نقش این مقاله را از نقش داده های ذخیره شده در مخزن و انتشارات آینده متمایز می کند.

نمای کلی سطح بالا که توضیح می دهد چگونه این مقاله در زمینه طراحی آزمایشی، داده های تاریخی، مکان ذخیره سازی مخزن داده و کار آینده قرار می گیرد.
طرح آزمایشی به چهار دسته اصلی تقسیم می شود: آماده سازی داده ها. تولید پیش بینی؛آماده سازی داده های اعتبارسنجی؛و تولید داده های اعتبار سنجیآماده سازی داده ها چگونگی به دست آمدن داده های تاریخی و نحوه جمع آوری آن داده ها در ناحیه بهداشتی و سطوح جغرافیایی ایالت را توصیف می کند. تولید پیش بینی مفروضات مربوط به هر یک از روش های پیش بینی انتخاب شده را توصیف می کند. آماده سازی داده های اعتبارسنجی، معیارهای خطای انتخاب شده را توصیف می کند تا میزان عملکرد هر پیش بینی را در مقایسه با داده های تاریخی اندازه گیری کند و چگونه تعداد موارد تجمعی پیش بینی شده COVID-19 برای تسهیل اعتبار سنجی جمع آوری می شود. تولید داده های اعتبارسنجی روش شناسی اعتبارسنجی و فرآیند انجام مقایسه ها را توصیف می کند. شکل 2 یک تفکیک از طرح آزمایشی را ارائه می دهد.

طراحی آزمایشی برای تهیه داده های تاریخی، تولید پیش بینی ها و تهیه و تولید داده ها برای استفاده برای اعتبار سنجی.*هرجا قابل اجرا باشد نشان می دهد که پیش بینی ها فقط زمانی ایجاد می شوند که تاریخ های تحت پوشش هر دو دوره بازبینی و پیش بینی وجود داشته باشند.
در مرحله اول، ما آماده سازی داده ها را با استفاده از داده های تعداد موارد تجمعی COVID-19 نیویورک تایمز انجام می دهیم [1]. این داده های سطح شهرستان فیلتر می شوند تا فقط ۱۳۳ شهرستان و شهر مستقل در ایالت VA را شامل شود. تعداد موارد تجمعی هر شهرستان در روز به عنوان اشیاء سری زمانی ذخیره می شود. با استفاده از نگاشت منطقه بهداشتی اختصاص داده شده به ازای هر شهرستان از وزارت بهداشت VA [13]، تعداد موارد تجمعی هر شهرستان را در هر یک از 35 ناحیه بهداشتی جمع آوری می کنیم و آنها را به عنوان اشیاء سری زمانی ذخیره می کنیم. در نهایت، تعداد موارد تجمعی از هر شهرستان را هر روز جمع می کنیم تا یک شی سری زمانی برای کل حالت VA تشکیل دهیم.
در مرحله دوم، پیش بینی هایی را با استفاده از ترکیبی از هفت روش پیش بینی، چهار طول بازگشت و سه طول پیش بینی تولید می کنیم. طول مدت بازبینی از اطلاعات یک، سه، هفت و همه روزهای قبل تا تاریخ اولین مورد گزارش شده در هر موقعیت جغرافیایی استفاده می کند. طول های پیش بینی یک، سه و هفت روز آینده است. برای تحقق معیارهای اعتبارسنجی در مرحله بعد، پیش بینی ها فقط در دوره هایی ایجاد می شوند که داده های تاریخی وجود دارد. به این ترتیب، برای این مجموعه داده، 15، 19، و 21 آوریل 2020، به ترتیب تاریخ های نهایی برای ایجاد پیش بینی های هفت، سه و یک روزه است. برای ایجاد پیش بینی برای هر شهرستان، ناحیه بهداشتی و ایالت، از اشیاء سری زمانی از مرحله اول استفاده می کنیم.
برای هر ترکیبی از طول بازگشت (x) و طول پیش بینی (y)، هر تاریخ در هر سری زمانی بررسی می شود تا مشخص شود آیا داده های تاریخی لازم در هر دو جهت وجود دارد یا خیر.
اگر بله، پیش بینی طول y ایجاد و ذخیره می شود. اگر نه، پیش بینی نادیده گرفته می شود.
فرآیند مورد استفاده برای تولید پیش بینی با استفاده از هر روش پیش بینی به شرح زیر است. استفاده از k روز قبل و j روز پیش بینی شده نشان داده شده است.
آدم ساده
برای هر شهرستان، ارزش روز قبلی، مقدار پیش بینی شده برای هر یک از j روز بعدی است.
برای هر ناحیه بهداشتی، مجموع مجموع تعداد موارد تجمعی روز قبلی هر یک از شهرستان های آن به مقدار پیش بینی برای هر یک از j روز بعدی تبدیل می شود.
برای VA، مجموع کل شمارش موارد انباشته از روز منفرد قبلی، به مقدار پیش بینی برای هر یک از روزهای j بعدی تبدیل می شود.
برای هر شهرستان، هموارسازی نمایی Holt-Winters مقادیر k روز قبل برای پیش بینی مقادیر برای روزهای j بعدی استفاده می شود.
برای هر منطقه بهداشتی ، مبلغ جمع شده از پرونده های تجمعی ایالت های آن برای هر یک از روزهای قبل از K برای پیش بینی مقادیر برای روزهای بعد از J استفاده می شود.
برای VA ، مبلغ جمع شده کلیه پرونده های تجمعی در مناطق VA در طی روزهای قبل از K برای پیش بینی روزهای بعدی J استفاده می شود.
رشد
برای هر شهرستان ، از ارزش یک روزه قبلی برای محاسبه نرخ رشد فعلی برای استان در روزهای J استفاده می شود. سپس از مقادیر روز قبل برای همه شهرستانها برای محاسبه نرخ رشد برای VA برای همان روزهای J استفاده می شود. گروهی از پیش بینی های N با نمونه گیری یکنواخت نرخ رشد بین نرخ شهرستان و VA برای این شهرستان ایجاد می شوند. از میانگین پیش بینی های N به عنوان پیش بینی نهایی برای استان استفاده می شود.
پیش بینی های هر ولسوالی های بهداشتی با استفاده از همین روش برای هر یک از ایالت های آن و سپس جمع آوری مقادیر برای هر یک از روزهای پیش بینی شده J ایجاد می شود.
پیش بینی های VA با پیش بینی مقادیر هر شهرستان با استفاده از همین روش و سپس جمع آوری تمام مقادیر ایالت ها برای دولت برای هر یک از روزهای پیش بینی شده J ایجاد می شود.
MA ، AR ، ARMA و ARIMA
برای هر شهرستان ، از وزن مساوی از شمارش مورد تجمعی روز K روز برای پیش بینی روزهای بعدی استفاده می شود.
برای هر منطقه بهداشتی ، مبلغ جمع شده از موارد تجمعی شهرستان های آن برای هر یک از روزهای K قبل برای پیش بینی روزهای بعدی استفاده می شود.
برای VA ، مبلغ جمع شده کلیه موارد موجود در مناطق VA برای روزهای قبل از K برای پیش بینی روزهای بعدی استفاده می شود.
ما از یک مدل MA (1) مرتبه اول برای همه پیش بینی های MA استفاده می کنیم ، یک مدل AR (1) مرتبه اول برای همه پیش بینی های AR ، اجزای مرتبه اول AR و MA برای مدل ARMA (1،1) برای همه پیش بینی های ARMA ، و یکمدل ARIMA (P ، D ، Q). مقادیر Arima برای P از 1 تا 3 ، D از 1 تا 2 متغیر است و Q برای کل 18 مدل پیش بینی ARIMA از 1 تا 3 متغیر است.
در مرحله سوم ، ما با تولید معیارهای خطای مورد نیاز برای اعتبارسنجی پیش بینی ها در برابر داده های تاریخی ، اعتبار سنجی را آماده می کنیم. برای این منظور ، ما از MDAE و MDAPE به عنوان معیارهای تعیین شده برای ارزیابی خطای پیش بینی استفاده کردیم [14] ، [15] ، [16] ، [17]. معیارهای مبتنی بر میانه به عنوان پیش بینی ها حاوی Outliers هستند [14،15]. MDAE وابسته به مقیاس است [16] و برای مقایسه بین پیش بینی های همان مقیاس مناسب است [17]. MDAPE برای مقایسه پیش بینی های مقیاس های مختلف استفاده می شود [16]. ما از MDAE برای آزمایش تفاوت های معنی داری بین پیش بینی ها در همان سطح جغرافیایی بر اساس عملکرد آنها با توجه به مقادیر تاریخی ثبت شده استفاده می کنیم. ما از MDAPE برای اندازه گیری درصد اختلاف پیش بینی ها از مقادیر تاریخی مشاهده شده آنها در سطوح جغرافیایی استفاده می کنیم تا در هنگام جمع آوری داده های سطح شهرستان به بخش های بهداشتی و نمایش های جغرافیایی سطح کشور ، به اندازه های مختلف مورد تجمعی در نظر بگیرند.
فرایندی که برای تهیه داده های اعتبار سنجی در هر سطح جغرافیایی انجام شده است:
برای هر پیش بینی ، با مقایسه مجموعه مقادیر پیش بینی شده با همتایان تاریخی ثبت شده خود ، نمرات MDAE و MDAPE پایه را محاسبه کنید
راهنمای تجارت فارکس...
ما را در سایت راهنمای تجارت فارکس دنبال می کنید
برچسب :
نویسنده : نسیم خاکسار
بازدید : <-PostHit->
تاريخ : چهارشنبه
4 مرداد
1402 ساعت: 22:45