ترجمه فارسی مقاله الگوریتم‌های سریع‌تر یادگیری Q برای راهزنان بی‌قرار

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Faster Q-Learning Algorithms for Restless Bandits
عنوان مقاله به فارسی الگوریتم‌های سریع‌تر یادگیری Q برای راهزنان بی‌قرار
نویسندگان Parvish Kakarapalli, Devendra Kayande, Rahul Meshram
فرمت مقاله انگلیسی PDF
تعداد صفحات 7
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Systems and Control,یادگیری ماشین , سیستم ها و کنترل ,
توضیحات Submitted 6 September, 2024; originally announced September 2024. , Comments: 7 pages, 3 figures, conference. arXiv admin note: substantial text overlap with arXiv:2409.04605
توضیحات به فارسی ارسال شده در 6 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد ، نظرات: 7 صفحه ، 3 رقم ، کنفرانس.Arxiv Admin توجه: متن قابل توجهی با ARXIV همپوشانی دارد: 2409.04605
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

We study the Whittle index learning algorithm for restless multi-armed bandits (RMAB). We first present Q-learning algorithm and its variants -- speedy Q-learning (SQL), generalized speedy Q-learning (GSQL) and phase Q-learning (PhaseQL). We also discuss exploration policies -- $ε$-greedy and Upper confidence bound (UCB). We extend the study of Q-learning and its variants with UCB policy. We illustrate using numerical example that Q-learning with UCB exploration policy has faster convergence and PhaseQL with UCB have fastest convergence rate. We next extend the study of Q-learning variants for index learning to RMAB. The algorithm of index learning is two-timescale variant of stochastic approximation, on slower timescale we update index learning scheme and on faster timescale we update Q-learning assuming fixed index value. We study constant stepsizes two timescale stochastic approximation algorithm. We describe the performance of our algorithms using numerical example. It illustrate that index learning with Q learning with UCB has faster convergence that $ε$ greedy. Further, PhaseQL (with UCB and $ε$ greedy) has the best convergence than other Q-learning algorithms.

چکیده به فارسی (ترجمه ماشینی)

ما الگوریتم یادگیری شاخص Whittle را برای راهزنان چند مسلح بی قرار (RMAB) مطالعه می کنیم.ما ابتدا الگوریتم یادگیری Q و انواع آن را ارائه می دهیم-یادگیری سریع Q (SQL) ، یادگیری سریع Q (GSQL) و یادگیری فاز Q (PHASEQL).ما همچنین در مورد سیاست های اکتشافی بحث می کنیم-$ ε $-greedy و اعتماد به نفس فوقانی (UCB).ما مطالعه یادگیری Q و انواع آن را با سیاست UCB گسترش می دهیم.ما با استفاده از مثال عددی نشان می دهیم که یادگیری Q با سیاست اکتشاف UCB دارای همگرایی سریعتر است و PhaseQL با UCB سریعترین میزان همگرایی را دارد.ما بعد مطالعه انواع یادگیری Q را برای یادگیری شاخص به RMAB گسترش می دهیم.الگوریتم یادگیری شاخص نوع دو زمانه از تقریب تصادفی است ، در بازه زمانی کندتر ما طرح یادگیری شاخص را به روز می کنیم و در بازه زمانی سریعتر با فرض ارزش شاخص ثابت ، Q-Learning را به روز می کنیم.ما پله های ثابت دو الگوریتم تقریب تصادفی بازه زمانی را مطالعه می کنیم.ما عملکرد الگوریتم های خود را با استفاده از مثال عددی توصیف می کنیم.این نشان می دهد که یادگیری شاخص با یادگیری Q با UCB همگرایی سریعتر دارد که ε $ حریص است.علاوه بر این ، PhaseQL (با UCB و $ ε $ حریص) بهترین همگرایی نسبت به سایر الگوریتم های یادگیری Q دارد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.