ترجمه فارسی مقاله تقریب تصادفی ناهمزمان و یادگیری تقویتی متوسط-پاداش

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Asynchronous Stochastic Approximation and Average-Reward Reinforcement Learning
عنوان مقاله به فارسی تقریب تصادفی ناهمزمان و یادگیری تقویتی متوسط-پاداش
نویسندگان Huizhen Yu, Yi Wan, Richard S. Sutton
فرمت مقاله انگلیسی PDF
تعداد صفحات 33
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Optimization and Control,یادگیری ماشین , بهینه سازی و کنترل ,
توضیحات Submitted 5 September, 2024; originally announced September 2024. , Comments: The materials in this paper extend the authors' results from 2023, reported in arXiv:2408.16262 and arXiv:2312.15091. This paper incorporates and subsumes the results of arXiv:2312.15091 and serves as Part II of arXiv:2408.16262 , MSC Class: 93E20; 62L20; 90C40
توضیحات به فارسی ارسال شده در 5 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد ، نظرات: مطالب موجود در این مقاله نتایج نویسندگان را از سال 2023 گسترش می دهد ، در Arxiv گزارش شده است: 2408.16262 و ARXIV: 2312.15091.این مقاله نتایج ARXIV را شامل می شود و شامل می شود: 2312.15091 و به عنوان قسمت دوم ARXIV: 2408.16262 ، کلاس MSC: 93E20 ؛62L20 ؛90C40
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

This paper studies asynchronous stochastic approximation (SA) algorithms and their application to reinforcement learning in semi-Markov decision processes (SMDPs) with an average-reward criterion. We first extend Borkar and Meyn's stability proof method to accommodate more general noise conditions, leading to broader convergence guarantees for asynchronous SA algorithms. Leveraging these results, we establish the convergence of an asynchronous SA analogue of Schweitzer's classical relative value iteration algorithm, RVI Q-learning, for finite-space, weakly communicating SMDPs. Furthermore, to fully utilize the SA results in this application, we introduce new monotonicity conditions for estimating the optimal reward rate in RVI Q-learning. These conditions substantially expand the previously considered algorithmic framework, and we address them with novel proof arguments in the stability and convergence analysis of RVI Q-learning.

چکیده به فارسی (ترجمه ماشینی)

این مقاله به بررسی الگوریتم های تقریبی تصادفی ناهمزمان (SA) و کاربرد آنها برای یادگیری تقویت در فرآیندهای تصمیم گیری نیمه مارکف (SMDP) با معیار متوسط ​​پرداخت می شود.ما ابتدا روش اثبات پایداری Borkar و Meyn را گسترش می دهیم تا شرایط نویز عمومی تری داشته باشیم و منجر به تضمین همگرایی گسترده تر برای الگوریتم های SA ناهمزمان شود.با استفاده از این نتایج ، ما همگرایی یک آنالوگ ناهمزمان SA از الگوریتم تکرار ارزش نسبی Schweitzer ، RVI Q-Learning ، برای فضای محدود ، با سرعت و ارتباط با SMDP را ایجاد می کنیم.علاوه بر این ، برای استفاده کامل از نتایج SA در این برنامه ، ما شرایط جدید یکنواختی را برای برآورد نرخ پاداش بهینه در یادگیری RVI Q معرفی می کنیم.این شرایط به طور قابل ملاحظه ای چارچوب الگوریتمی قبلاً در نظر گرفته شده را گسترش می دهد ، و ما آنها را با استدلال های اثبات جدید در ثبات و تجزیه و تحلیل همگرایی یادگیری RVI Q می پردازیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.