ترجمه فارسی مقاله بهبود یادگیری تقویتی عمیق با کاهش اثر زنجیره ای ارزش و ریزش خط مشی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Improving Deep Reinforcement Learning by Reducing the Chain Effect of Value and Policy Churn
عنوان مقاله به فارسی بهبود یادگیری تقویتی عمیق با کاهش اثر زنجیره ای ارزش و ریزش خط مشی
نویسندگان Hongyao Tang, Glen Berseth
فرمت مقاله انگلیسی PDF
تعداد صفحات 28
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 7 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال 7 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Deep neural networks provide Reinforcement Learning (RL) powerful function approximators to address large-scale decision-making problems. However, these approximators introduce challenges due to the non-stationary nature of RL training. One source of the challenges in RL is that output predictions can churn, leading to uncontrolled changes after each batch update for states not included in the batch. Although such a churn phenomenon exists in each step of network training, how churn occurs and impacts RL remains under-explored. In this work, we start by characterizing churn in a view of Generalized Policy Iteration with function approximation, and we discover a chain effect of churn that leads to a cycle where the churns in value estimation and policy improvement compound and bias the learning dynamics throughout the iteration. Further, we concretize the study and focus on the learning issues caused by the chain effect in different settings, including greedy action deviation in value-based methods, trust region violation in proximal policy optimization, and dual bias of policy value in actor-critic methods. We then propose a method to reduce the chain effect across different settings, called Churn Approximated ReductIoN (CHAIN), which can be easily plugged into most existing DRL algorithms. Our experiments demonstrate the effectiveness of our method in both reducing churn and improving learning performance across online and offline, value-based and policy-based RL settings, as well as a scaling setting.

چکیده به فارسی (ترجمه ماشینی)

شبکه های عصبی عمیق برای رفع مشکلات تصمیم گیری در مقیاس بزرگ ، تقریب عملکرد قدرتمند یادگیری (RL) را فراهم می کنند.با این حال ، این تقریب ها به دلیل ماهیت غیر ثابت آموزش RL ، چالش هایی را ایجاد می کنند.یکی از منابع چالش های RL این است که پیش بینی های خروجی می توانند باعث ایجاد چروک شوند و منجر به تغییرات کنترل نشده پس از بروزرسانی دسته ای برای حالت هایی که در دسته قرار نمی گیرند ، منجر می شود.اگرچه چنین پدیده ای در هر مرحله از آموزش شبکه وجود دارد ، اما چگونه Churn رخ می دهد و RL را تحت تأثیر قرار می دهد ، تحت تأثیر قرار می گیرد.در این کار ، ما با توصیف خفگی در دیدگاه تکرار سیاست تعمیم یافته با تقریب عملکرد شروع می کنیم ، و یک اثر زنجیره ای از خفگی را کشف می کنیم که منجر به چرخه ای می شود که در آن خفه کننده در برآورد ارزش و ترکیب بهبود سیاست قرار می گیرد و دینامیک یادگیری را در کل تعصب می کند.تکرارعلاوه بر این ، ما مطالعه را مشخص می کنیم و بر موضوعات یادگیری ناشی از تأثیر زنجیره ای در تنظیمات مختلف ، از جمله انحراف عمل حریص در روشهای مبتنی بر ارزش ، نقض منطقه اعتماد در بهینه سازی سیاست پروگزیمال و تعصب دوگانه ارزش سیاست در روشهای بازیگر-انتقادی تمرکز می کنیم.بشرسپس ما روشی را برای کاهش اثر زنجیره ای در تنظیمات مختلف ، به نام کاهش تقریب (زنجیره ای) پیشنهاد می کنیم ، که به راحتی می توان به اکثر الگوریتم های DRL موجود وصل شد.آزمایشات ما اثربخشی روش ما را در کاهش چرند و بهبود عملکرد یادگیری در تنظیمات RL آنلاین و آفلاین ، مبتنی بر ارزش و سیاست و همچنین یک تنظیم مقیاس نشان می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.