ترجمه فارسی مقاله شکل‌دهی پاداش خود-تطبیقی ​​بسیار کارآمد برای یادگیری تقویتی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning
عنوان مقاله به فارسی شکل‌دهی پاداش خود-تطبیقی ​​بسیار کارآمد برای یادگیری تقویتی
نویسندگان Haozhe Ma, Zhengding Luo, Thanh Vinh Vo, Kuankuan Sima, Tze-Yun Leong
فرمت مقاله انگلیسی PDF
تعداد صفحات 22
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 7 August, 2024; v1 submitted 6 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 7 اوت 2024 ؛V1 ارسال شده در 6 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.

قیمت: 19,000 تومان

سفارش

با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی، را نیز سفارش می‌دهید.

قیمت: 880,000 تومان

زمان تحویل: 2 تا 3 روز کاری


📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Reward shaping addresses the challenge of sparse rewards in reinforcement learning by constructing denser and more informative reward signals. To achieve self-adaptive and highly efficient reward shaping, we propose a novel method that incorporates success rates derived from historical experiences into shaped rewards. Our approach utilizes success rates sampled from Beta distributions, which dynamically evolve from uncertain to reliable values as more data is collected. Initially, the self-adaptive success rates exhibit more randomness to encourage exploration. Over time, they become more certain to enhance exploitation, thus achieving a better balance between exploration and exploitation. We employ Kernel Density Estimation (KDE) combined with Random Fourier Features (RFF) to derive the Beta distributions, resulting in a computationally efficient implementation in high-dimensional continuous state spaces. This method provides a non-parametric and learning-free approach. The proposed method is evaluated on a wide range of continuous control tasks with sparse and delayed rewards, demonstrating significant improvements in sample efficiency and convergence stability compared to relevant baselines.

چکیده به فارسی (ترجمه ماشینی)

شکل دهی پاداش با ایجاد سیگنال های متراکم تر و آموزنده تر پاداش ، به چالش پاداش های پراکنده در یادگیری تقویت می پردازد.برای دستیابی به شکل گیری پاداش خود سازگار و بسیار کارآمد ، ما یک روش جدید را پیشنهاد می کنیم که میزان موفقیت حاصل از تجربیات تاریخی را به پاداش های شکل می رساند.رویکرد ما از نرخ موفقیت نمونه برداری از توزیع بتا استفاده می کند ، که با جمع آوری داده های بیشتر ، به صورت پویا از نامشخص به مقادیر قابل اعتماد تکامل می یابد.در ابتدا ، نرخ موفقیت خود سازگار برای تشویق اکتشاف ، تصادفی بیشتری را نشان می دهد.با گذشت زمان ، آنها برای تقویت بهره برداری مطمئن تر می شوند ، بنابراین به تعادل بهتر بین اکتشاف و بهره برداری می رسند.ما از برآورد چگالی هسته (KDE) همراه با ویژگی های تصادفی فوریه (RFF) استفاده می کنیم تا توزیع بتا را بدست آوریم ، و در نتیجه اجرای محاسباتی کارآمد در فضاهای حالت مداوم با ابعاد بالا انجام می شود.این روش یک رویکرد غیر پارامتری و بدون یادگیری را ارائه می دهد.روش پیشنهادی در طیف گسترده ای از کارهای کنترل مداوم با پاداش های پراکنده و تأخیر ارزیابی می شود و نشان دهنده پیشرفت های قابل توجهی در راندمان نمونه و ثبات همگرایی در مقایسه با پایه های مربوطه است.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.