ترجمه فارسی مقاله تداوم اقدام هدایت شده با وضعیت جدید در یادگیری تقویتی عمیق

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی State-Novelty Guided Action Persistence in Deep Reinforcement Learning
عنوان مقاله به فارسی تداوم اقدام هدایت شده با وضعیت جدید در یادگیری تقویتی عمیق
نویسندگان Jianshu Hu, Paul Weng, Yutong Ban
فرمت مقاله انگلیسی PDF
تعداد صفحات 21
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 9 September, 2024; originally announced September 2024. , Comments: Under review
توضیحات به فارسی ارسال شده در 9 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد. ، نظرات: تحت بررسی
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

While a powerful and promising approach, deep reinforcement learning (DRL) still suffers from sample inefficiency, which can be notably improved by resorting to more sophisticated techniques to address the exploration-exploitation dilemma. One such technique relies on action persistence (i.e., repeating an action over multiple steps). However, previous work exploiting action persistence either applies a fixed strategy or learns additional value functions (or policy) for selecting the repetition number. In this paper, we propose a novel method to dynamically adjust the action persistence based on the current exploration status of the state space. In such a way, our method does not require training of additional value functions or policy. Moreover, the use of a smooth scheduling of the repeat probability allows a more effective balance between exploration and exploitation. Furthermore, our method can be seamlessly integrated into various basic exploration strategies to incorporate temporal persistence. Finally, extensive experiments on different DMControl tasks demonstrate that our state-novelty guided action persistence method significantly improves the sample efficiency.

چکیده به فارسی (ترجمه ماشینی)

در حالی که یک رویکرد قدرتمند و امیدوار کننده ، یادگیری تقویت عمیق (DRL) هنوز از ناکارآمدی نمونه رنج می برد ، که می تواند با استفاده از تکنیک های پیچیده تر برای پرداختن به معضل اکتشاف-بهره برداری ، به ویژه بهبود یابد.یکی از این تکنیک ها به تداوم عمل متکی است (یعنی تکرار یک عمل در طی چندین مرحله).با این حال ، کار قبلی با بهره برداری از عمل از عمل یا یک استراتژی ثابت استفاده می کند یا توابع ارزش اضافی (یا خط مشی) را برای انتخاب شماره تکرار می آموزد.در این مقاله ، ما یک روش جدید برای تنظیم پویا ماندگاری عمل بر اساس وضعیت اکتشاف فعلی فضای دولت پیشنهاد می کنیم.به گونه ای ، روش ما نیازی به آموزش توابع یا سیاست های ارزش اضافی ندارد.علاوه بر این ، استفاده از یک برنامه ریزی صاف از احتمال تکرار امکان تعادل مؤثرتر بین اکتشاف و بهره برداری را فراهم می کند.علاوه بر این ، روش ما می تواند یکپارچه در استراتژی های مختلف اکتشافی اساسی برای ترکیب پایداری زمانی ادغام شود.سرانجام ، آزمایش های گسترده در مورد وظایف مختلف DMControl نشان می دهد که روش تداوم اقدامات هدایت شده از دولت-نهم ما به طور قابل توجهی کارایی نمونه را بهبود می بخشد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.