ترجمه فارسی مقاله شکل دهی BAMDP: یک چارچوب نظری یکپارچه برای انگیزش درونی و شکل دادن به پاداش

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی BAMDP Shaping: a Unified Theoretical Framework for Intrinsic Motivation and Reward Shaping
عنوان مقاله به فارسی شکل دهی BAMDP: یک چارچوب نظری یکپارچه برای انگیزش درونی و شکل دادن به پاداش
نویسندگان Aly Lidayan, Michael Dennis, Stuart Russell
فرمت مقاله انگلیسی PDF
تعداد صفحات 20
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 9 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 9 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Intrinsic motivation (IM) and reward shaping are common methods for guiding the exploration of reinforcement learning (RL) agents by adding pseudo-rewards. Designing these rewards is challenging, however, and they can counter-intuitively harm performance. To address this, we characterize them as reward shaping in Bayes-Adaptive Markov Decision Processes (BAMDPs), which formalizes the value of exploration by formulating the RL process as updating a prior over possible MDPs through experience. RL algorithms can be viewed as BAMDP policies; instead of attempting to find optimal algorithms by solving BAMDPs directly, we use it at a theoretical framework for understanding how pseudo-rewards guide suboptimal algorithms. By decomposing BAMDP state value into the value of the information collected plus the prior value of the physical state, we show how psuedo-rewards can help by compensating for RL algorithms' misestimation of these two terms, yielding a new typology of IM and reward shaping approaches. We carefully extend the potential-based shaping theorem to BAMDPs to prove that when pseudo-rewards are BAMDP Potential-based shaping Functions (BAMPFs), they preserve optimal, or approximately optimal, behavior of RL algorithms; otherwise, they can corrupt even optimal learners. We finally give guidance on how to design or convert existing pseudo-rewards to BAMPFs by expressing assumptions about the environment as potential functions on BAMDP states.

چکیده به فارسی (ترجمه ماشینی)

انگیزه ذاتی (IM) و شکل دادن به پاداش روشهای متداول برای هدایت اکتشاف عوامل یادگیری تقویت (RL) با اضافه کردن شبه پاداش ها هستند.با این حال ، طراحی این پاداش ها چالش برانگیز است و آنها می توانند به طور جدی به عملکرد آسیب برسانند.برای پرداختن به این موضوع ، ما آنها را به عنوان شکل دهی پاداش در فرآیندهای تصمیم گیری مارکوف سازگار با Bayes (BAMDPS) توصیف می کنیم ، که با تدوین فرآیند RL به عنوان به روزرسانی یک MDP های قبلی از طریق تجربه ، ارزش اکتشاف را رسمیت می بخشد.الگوریتم های RL را می توان به عنوان سیاست های BAMDP مشاهده کرد.ما به جای تلاش برای یافتن الگوریتم های بهینه با حل مستقیم BAMDP ها ، ما از آن در یک چارچوب نظری برای درک چگونگی راهنمایی شبه-شرکت های الگوریتم های زیر قطبی استفاده می کنیم.با تجزیه ارزش حالت BAMDP به ارزش اطلاعات جمع آوری شده به علاوه ارزش قبلی وضعیت فیزیکی ، ما نشان می دهیم که چگونه می توان Psuedo-Rewards با جبران نادرست الگوریتم های RL از این دو اصطلاح ، به دست آوردن یک نوع شناسی جدید از IM و پاداش شکل دادنرویکردما با دقت قضیه شکل دهی مبتنی بر بالقوه را به BAMDP ها گسترش می دهیم تا ثابت کنیم که وقتی شبه شرکت های عملکردی مبتنی بر پتانسیل BAMDP (BAMPFS) هستند ، آنها رفتار بهینه یا تقریباً بهینه از الگوریتم های RL را حفظ می کنند.در غیر این صورت ، آنها می توانند زبان آموزان حتی بهینه را فاسد کنند.ما سرانجام با بیان فرضیات در مورد محیط به عنوان کارکردهای بالقوه در حالتهای BAMDP ، در مورد چگونگی طراحی یا تبدیل شبه پاداش های موجود به BAMPF ها راهنمایی می کنیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.