ترجمه فارسی مقاله مرزهای اصلاح شده در سیاست های پنجره محدود بهینه در POMDP و یادگیری تقویتی آنها

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Refined Bounds on Near Optimality Finite Window Policies in POMDPs and Their Reinforcement Learning
عنوان مقاله به فارسی مرزهای اصلاح شده در سیاست های پنجره محدود بهینه در POMDP و یادگیری تقویتی آنها
نویسندگان Yunus Emre Demirci, Ali Devran Kara, Serdar Yüksel
فرمت مقاله انگلیسی PDF
تعداد صفحات 26
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Optimization and Control,بهینه سازی و کنترل ,
توضیحات Submitted 6 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 6 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Finding optimal policies for Partially Observable Markov Decision Processes (POMDPs) is challenging due to their uncountable state spaces when transformed into fully observable Markov Decision Processes (MDPs) using belief states. Traditional methods such as dynamic programming or policy iteration are difficult to apply in this context, necessitating the use of approximation methods on belief states or other techniques. Recently, in (Journal of Machine Learning Research, vol. 23, pp. 1-46, 2022) and (Mathematics of Operations Research, vol. 48, pp. 2066-2093, Nov. 2023), it was shown that sliding finite window based policies are near-optimal for POMDPs with standard Borel valued hidden state spaces, and can be learned via reinforcement learning, with error bounds explicitly dependent on a uniform filter stability term involving total variation in expectation and sample path-wise, respectively. In this paper, we refine these performance bounds and (i) extend them to bounds via uniform filter stability in expected Wasserstein distance leading to an error bound in expectation, and (ii) complementary conditions bounds via uniform filter stability in sample path-wise total variation distance leading to a uniform error bound. We present explicit examples. Our approach thus provides complementary and more refined bounds on the error terms in both total variation and Wasserstein metrics, offering more relaxed and stronger bounds over the approximation error in POMDP solutions on the performance and near optimality of sliding finite window control policies.

چکیده به فارسی (ترجمه ماشینی)

یافتن سیاست های بهینه برای فرآیندهای تصمیم گیری جزئی قابل مشاهده مارکوف (POMDP) ​​به دلیل فضاهای حالت غیرقابل تحمل آنها هنگام تبدیل شدن به فرآیندهای تصمیم گیری کاملاً قابل مشاهده مارکوف (MDP) با استفاده از حالت های اعتقادی ، چالش برانگیز است.روشهای سنتی مانند برنامه نویسی پویا یا تکرار سیاست در این زمینه دشوار است ، که نیاز به استفاده از روش های تقریب بر حالت های اعتقاد یا سایر تکنیک ها دارد.اخیراً ، در (مجله تحقیقات یادگیری ماشین ، جلد 23 ، صص 1-46 ، 2022) و (ریاضیات تحقیقات عملیات ، جلد 48 ، صص 2066-2093 ، نوامبر 2023) ، نشان داده شد که کشویی محدود محدود استسیاستهای مبتنی بر پنجره برای POMDP ها با فضاهای حالت پنهان با ارزش استاندارد بسیار بهینه است و می توان از طریق یادگیری تقویت ، با مرزهای خطا به صراحت به یک اصطلاح پایداری فیلتر یکنواخت وابسته بود که شامل تغییر کل در انتظار و نمونه مسیر عاقلانه است.در این مقاله ، ما این مرزهای عملکرد را اصلاح می کنیم و (i) آنها را از طریق پایداری فیلتر یکنواخت در فاصله مورد انتظار Wasserstein که منجر به خطایی در انتظار می شود ، و (ب) شرایط مکمل از طریق پایداری فیلتر یکنواخت در کل مسیر ، کلیدها را گسترش می دهیم.فاصله تنوع منجر به یک خطای یکنواخت می شود.ما نمونه های صریح را ارائه می دهیم.رویکرد ما بنابراین مرزهای مکمل و تصفیه شده تری را در مورد شرایط خطا در هر دو تغییر در کل و معیارهای Wasserstein فراهم می کند ، و مرزهای آرام تر و قوی تری نسبت به خطای تقریب در راه حل های POMDP در عملکرد و تقریباً بهینه بودن کشویی سیاست های کنترل پنجره محدود ارائه می دهد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.