ترجمه فارسی مقاله شناسایی خط مشی تقریباً بهینه در فرآیندهای تصمیم گیری مارکوف با محدودیت قوی از طریق فرم Epigraph

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form
عنوان مقاله به فارسی شناسایی خط مشی تقریباً بهینه در فرآیندهای تصمیم گیری مارکوف با محدودیت قوی از طریق فرم Epigraph
نویسندگان Toshinori Kitamura, Tadashi Kozuno, Wataru Kumagai, Kenta Hoshino, Yohei Hosoe, Kazumi Kasaura, Masashi Hamaya, Paavo Parmas, Yutaka Matsuo
فرمت مقاله انگلیسی PDF
تعداد صفحات 32
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Optimization and Control,یادگیری ماشین , بهینه سازی و کنترل ,
توضیحات Submitted 2 September, 2024; v1 submitted 29 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 2 سپتامبر 2024 ؛V1 ارسال شده 29 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Designing a safe policy for uncertain environments is crucial in real-world control applications. However, this challenge remains inadequately addressed within the Markov decision process (MDP) framework. This paper presents the first algorithm capable of identifying a near-optimal policy in a robust constrained MDP (RCMDP), where an optimal policy minimizes cumulative cost while satisfying constraints in the worst-case scenario across a set of environments. We first prove that the conventional Lagrangian max-min formulation with policy gradient methods can become trapped in suboptimal solutions by encountering a sum of conflicting gradients from the objective and constraint functions during its inner minimization problem. To address this, we leverage the epigraph form of the RCMDP problem, which resolves the conflict by selecting a single gradient from either the objective or the constraints. Building on the epigraph form, we propose a binary search algorithm with a policy gradient subroutine and prove that it identifies an $\varepsilon$-optimal policy in an RCMDP with $\tilde{\mathcal{O}}(\varepsilon^{-4})$ policy evaluations.

چکیده به فارسی (ترجمه ماشینی)

طراحی یک سیاست ایمن برای محیط های نامشخص در برنامه های کنترل در دنیای واقعی بسیار مهم است.با این حال ، این چالش به طور ناکافی در چارچوب فرآیند تصمیم گیری مارکوف (MDP) مورد بررسی قرار می گیرد.در این مقاله اولین الگوریتم قادر به شناسایی یک سیاست تقریباً بهینه در یک MDP محدود (RCMDP) ، که در آن یک سیاست بهینه هزینه تجمعی را به حداقل می رساند ضمن اینکه محدودیت ها را در سناریوی بدترین حالت در مجموعه ای از محیط ها به حداقل می رساند.ما ابتدا ثابت می کنیم که فرمولاسیون حداکثر ماین لاگرانژی با روشهای شیب سیاست می تواند با مواجهه با مجموع شیب های متناقض از توابع هدف و محدودیت در طول مشکل به حداقل رساندن درونی ، در راه حل های زیر حد متوسط ​​به دام بیفتد.برای پرداختن به این موضوع ، ما از شکل Epigraph مشکل RCMDP استفاده می کنیم ، که با انتخاب یک شیب واحد از هدف یا محدودیت ها ، درگیری را برطرف می کند.با تکیه بر فرم Epigraph ، ما یک الگوریتم جستجوی باینری را با یک زیرروال شیب خط مشی پیشنهاد می کنیم و ثابت می کنیم که یک خط مشی $ \ varepsilon $ -optimal را در یک rcmdp با $ \ tilde {\ mathcal {o}}} (\ varepsilon^{--مشخص می کند.4}) $ ارزیابی سیاست.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.