ترجمه فارسی مقاله یادگیری تقویتی بدون نرخ یادگیری: موردی برای انتخاب مدل با اهداف غیر ایستا

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Learning Rate-Free Reinforcement Learning: A Case for Model Selection with Non-Stationary Objectives
عنوان مقاله به فارسی یادگیری تقویتی بدون نرخ یادگیری: موردی برای انتخاب مدل با اهداف غیر ایستا
نویسندگان Aida Afshar, Aldo Pacchiano
فرمت مقاله انگلیسی PDF
تعداد صفحات 12
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 7 August, 2024; originally announced August 2024. , Comments: RLC 2024 Workshop on Failure Modes of Sequential Decision-Making in Practice
توضیحات به فارسی ارسال شده در 7 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: کارگاه RLC 2024 در مورد حالت های شکست تصمیم گیری متوالی در عمل

قیمت: 19,000 تومان

سفارش

با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی، را نیز سفارش می‌دهید.

قیمت: 480,000 تومان

زمان تحویل: 2 تا 3 روز کاری


📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

The performance of reinforcement learning (RL) algorithms is sensitive to the choice of hyperparameters, with the learning rate being particularly influential. RL algorithms fail to reach convergence or demand an extensive number of samples when the learning rate is not optimally set. In this work, we show that model selection can help to improve the failure modes of RL that are due to suboptimal choices of learning rate. We present a model selection framework for Learning Rate-Free Reinforcement Learning that employs model selection methods to select the optimal learning rate on the fly. This approach of adaptive learning rate tuning neither depends on the underlying RL algorithm nor the optimizer and solely uses the reward feedback to select the learning rate; hence, the framework can input any RL algorithm and produce a learning rate-free version of it. We conduct experiments for policy optimization methods and evaluate various model selection strategies within our framework. Our results indicate that data-driven model selection algorithms are better alternatives to standard bandit algorithms when the optimal choice of hyperparameter is time-dependent and non-stationary.

چکیده به فارسی (ترجمه ماشینی)

عملکرد الگوریتم های یادگیری تقویت (RL) به انتخاب هایپرپارامترها حساس است ، با این که میزان یادگیری به ویژه تأثیرگذار است.الگوریتم های RL قادر به دستیابی به همگرایی نیستند یا تعداد گسترده ای از نمونه ها را تقاضا می کنند وقتی که نرخ یادگیری بهینه تنظیم نشده باشد.در این کار ، ما نشان می دهیم که انتخاب مدل می تواند به بهبود حالت های خرابی RL کمک کند که به دلیل انتخاب زیر حد متوسط ​​نرخ یادگیری است.ما یک چارچوب انتخاب مدل برای یادگیری تقویت عاری از نرخ یادگیری ارائه می دهیم که از روش های انتخاب مدل برای انتخاب نرخ یادگیری بهینه در پرواز استفاده می کند.این رویکرد تنظیم نرخ یادگیری تطبیقی ​​نه به الگوریتم RL اساسی و نه بهینه ساز بستگی ندارد و فقط از بازخورد پاداش برای انتخاب نرخ یادگیری استفاده می کند.از این رو ، چارچوب می تواند هر الگوریتم RL را وارد کرده و یک نسخه بدون نرخ یادگیری از آن تولید کند.ما آزمایشاتی را برای روشهای بهینه سازی سیاست انجام می دهیم و استراتژی های مختلف انتخاب مدل را در چارچوب خود ارزیابی می کنیم.نتایج ما نشان می دهد که الگوریتم های انتخاب مدل داده محور گزینه های بهتری برای الگوریتم های راهزن استاندارد هستند که انتخاب بهینه HyperParameter وابسته به زمان و غیر ثابت باشد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.