ترجمه فارسی مقاله پاداش‌های ذاتی فرایادگیری جعبه سیاه برای محیط‌های با پاداش پراکنده

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Black box meta-learning intrinsic rewards for sparse-reward environments
عنوان مقاله به فارسی پاداش‌های ذاتی فرایادگیری جعبه سیاه برای محیط‌های با پاداش پراکنده
نویسندگان Octavio Pappalardo, Rodrigo Ramele, Juan Miguel Santos
فرمت مقاله انگلیسی PDF
تعداد صفحات 14
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 31 July, 2024; originally announced July 2024. , Comments: This work is part of OP Bachelor's Degree Thesis
توضیحات به فارسی ارسال 31 ژوئیه 2024 ؛در ابتدا ژوئیه 2024 اعلام شد. ، نظرات: این کار بخشی از پایان نامه مدرک لیسانس OP است

قیمت: 19,000 تومان

دانلود مقاله اصل انگلیسی + خلاصه دو صفحه ای مقاله + پادکست صوتی فارسی خلاصه مقاله

با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی، یک خلاصه دو صفحه‌ای فارسی و پادکست صوتی فارسی خلاصه مقاله را نیز دریافت خواهید کرد.

قیمت: 99,000 تومان

سفارش + خلاصه دو صفحه ای مقاله + پادکست صوتی فارسی خلاصه مقاله

با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی و ترجمه کامل آن، یک خلاصه دو صفحه‌ای فارسی و پادکست صوتی فارسی خلاصه مقاله را نیز دریافت خواهید کرد.

قیمت: 560,000 تومان

زمان تحویل: 2 تا 3 روز کاری


📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Despite the successes and progress of deep reinforcement learning over the last decade, several challenges remain that hinder its broader application. Some fundamental aspects to improve include data efficiency, generalization capability, and ability to learn in sparse-reward environments, which often require human-designed dense rewards. Meta-learning has emerged as a promising approach to address these issues by optimizing components of the learning algorithm to meet desired characteristics. Additionally, a different line of work has extensively studied the use of intrinsic rewards to enhance the exploration capabilities of algorithms. This work investigates how meta-learning can improve the training signal received by RL agents. The focus is on meta-learning intrinsic rewards under a framework that doesn't rely on the use of meta-gradients. We analyze and compare this approach to the use of extrinsic rewards and a meta-learned advantage function. The developed algorithms are evaluated on distributions of continuous control tasks with both parametric and non-parametric variations, and with only sparse rewards accessible for the evaluation tasks.

چکیده به فارسی (ترجمه ماشینی)

با وجود موفقیت ها و پیشرفت یادگیری عمیق در طی یک دهه گذشته ، چندین چالش باقی مانده است که مانع کاربرد گسترده تر آن می شود.برخی از جنبه های اساسی برای بهبود شامل راندمان داده ها ، توانایی تعمیم و توانایی یادگیری در محیط های پراکنده پاداش ، که اغلب به پاداش های متراکم با طراحی انسان نیاز دارند.یادگیری متا به عنوان یک رویکرد امیدوارکننده برای رسیدگی به این موضوعات با بهینه سازی مؤلفه های الگوریتم یادگیری برای برآورده کردن ویژگی های مورد نظر ظاهر شده است.علاوه بر این ، یک خط متفاوت از کار به طور گسترده استفاده از پاداش های ذاتی را برای تقویت قابلیت های اکتشاف الگوریتم ها مورد مطالعه قرار داده است.این کار بررسی می کند که چگونه یادگیری متا می تواند سیگنال آموزشی دریافت شده توسط نمایندگان RL را بهبود بخشد.تمرکز بر روی پاداش های ذاتی متا یادگیری در زیر چارچوبی است که به استفاده از دانش آموزان متا تکیه نمی کند.ما این روش را با استفاده از پاداش های بیرونی و یک عملکرد مزیت یاد گرفته شده تجزیه و تحلیل و مقایسه می کنیم.الگوریتم های توسعه یافته بر روی توزیع وظایف کنترل مداوم با تغییرات پارامتری و غیر پارامتری ، و تنها با پاداش های پراکنده برای کارهای ارزیابی قابل دسترسی هستند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.