ترجمه فارسی مقاله بازیگر نرم‌افزار منتقد با خط‌مشی بتا از طریق گرادیان‌های پارامترسازی مجدد ضمنی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Soft Actor-Critic with Beta Policy via Implicit Reparameterization Gradients
عنوان مقاله به فارسی بازیگر نرم‌افزار منتقد با خط‌مشی بتا از طریق گرادیان‌های پارامترسازی مجدد ضمنی
نویسندگان Luca Della Libera
فرمت مقاله انگلیسی PDF
تعداد صفحات 10
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 8 September, 2024; originally announced September 2024. , Comments: 10 pages , MSC Class: 62M45 ACM Class: I.2.8; I.2.6; I.5.1
توضیحات به فارسی ارسال شده در 8 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد. ، نظرات: 10 صفحه ، کلاس MSC: 62M45 ACM کلاس: I.2.8 ؛I.2.6 ؛I.5.1
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Recent advances in deep reinforcement learning have achieved impressive results in a wide range of complex tasks, but poor sample efficiency remains a major obstacle to real-world deployment. Soft actor-critic (SAC) mitigates this problem by combining stochastic policy optimization and off-policy learning, but its applicability is restricted to distributions whose gradients can be computed through the reparameterization trick. This limitation excludes several important examples such as the beta distribution, which was shown to improve the convergence rate of actor-critic algorithms in high-dimensional continuous control problems thanks to its bounded support. To address this issue, we investigate the use of implicit reparameterization, a powerful technique that extends the class of reparameterizable distributions. In particular, we use implicit reparameterization gradients to train SAC with the beta policy on simulated robot locomotion environments and compare its performance with common baselines. Experimental results show that the beta policy is a viable alternative, as it outperforms the normal policy and is on par with the squashed normal policy, which is the go-to choice for SAC. The code is available at https://github.com/lucadellalib/sac-beta.

چکیده به فارسی (ترجمه ماشینی)

پیشرفت های اخیر در یادگیری تقویت عمیق در طیف گسترده ای از کارهای پیچیده به نتایج چشمگیر رسیده است ، اما بهره وری نمونه ضعیف همچنان یک مانع اساسی برای استقرار در دنیای واقعی است.بازیگر نرم-انتقادی (SAC) با ترکیب بهینه سازی سیاست تصادفی و یادگیری خارج از سیاست ، این مشکل را کاهش می دهد ، اما کاربرد آن محدود به توزیع هایی است که شیب آنها را می توان از طریق ترفند reparameterization محاسبه کرد.این محدودیت چندین نمونه مهم مانند توزیع بتا را حذف می کند ، که نشان داده شده است که میزان همگرایی الگوریتم های بازیگر-انتقادی را در مشکلات کنترل مداوم مداوم به لطف پشتیبانی محدود خود بهبود می بخشد.برای پرداختن به این مسئله ، ما در مورد استفاده از reparameterization ضمنی ، یک تکنیک قدرتمند که کلاس توزیع های قابل جبران را گسترش می دهد ، بررسی می کنیم.به طور خاص ، ما از شیب های بازپرداخت ضمنی برای آموزش SAC با خط مشی بتا در محیط های شبیه سازی شده روبات استفاده می کنیم و عملکرد آن را با خطوط مشترک مقایسه می کنیم.نتایج تجربی نشان می دهد که سیاست بتا یک جایگزین مناسب است ، زیرا از سیاست عادی بهتر است و با سیاست عادی خرد شده ، که انتخابی برای SAC است ، همزمان است.این کد در https://github.com/lucadellalib/sac-beta در دسترس است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.