ترجمه فارسی مقاله بدبینی ریسک را برآورده می کند: یادگیری تقویت آفلاین حساس به ریسک

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Pessimism Meets Risk: Risk-Sensitive Offline Reinforcement Learning
عنوان مقاله به فارسی بدبینی ریسک را برآورده می کند: یادگیری تقویت آفلاین حساس به ریسک
نویسندگان Dake Zhang, Boxiang Lyu, Shuang Qiu, Mladen Kolar, Tong Zhang
فرمت مقاله انگلیسی PDF
تعداد صفحات 31
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Optimization and Control,Statistics Theory,Machine Learning,یادگیری ماشین , بهینه سازی و کنترل , نظریه آمار , یادگیری ماشین ,
توضیحات Submitted 10 July, 2024; originally announced July 2024. , Comments: ICML 2024
توضیحات به فارسی 10 ژوئیه 2024 ارسال شد.در ابتدا ژوئیه 2024 اعلام شد ، نظرات: ICML 2024
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

We study risk-sensitive reinforcement learning (RL), a crucial field due to its ability to enhance decision-making in scenarios where it is essential to manage uncertainty and minimize potential adverse outcomes. Particularly, our work focuses on applying the entropic risk measure to RL problems. While existing literature primarily investigates the online setting, there remains a large gap in understanding how to efficiently derive a near-optimal policy based on this risk measure using only a pre-collected dataset. We center on the linear Markov Decision Process (MDP) setting, a well-regarded theoretical framework that has yet to be examined from a risk-sensitive standpoint. In response, we introduce two provably sample-efficient algorithms. We begin by presenting a risk-sensitive pessimistic value iteration algorithm, offering a tight analysis by leveraging the structure of the risk-sensitive performance measure. To further improve the obtained bounds, we propose another pessimistic algorithm that utilizes variance information and reference-advantage decomposition, effectively improving both the dependence on the space dimension $d$ and the risk-sensitivity factor. To the best of our knowledge, we obtain the first provably efficient risk-sensitive offline RL algorithms.

چکیده به فارسی (ترجمه ماشینی)

ما یادگیری تقویت کننده حساس به ریسک (RL) را مطالعه می کنیم ، یک زمینه مهم به دلیل توانایی آن در افزایش تصمیم گیری در سناریوها که در آن مدیریت عدم اطمینان و به حداقل رساندن نتایج جانبی احتمالی ضروری است.به ویژه ، کار ما بر استفاده از اندازه گیری خطر آنتروپیک برای مشکلات RL متمرکز است.در حالی که ادبیات موجود در درجه اول به بررسی تنظیمات آنلاین می پردازد ، شکاف بزرگی در درک چگونگی استخراج کارآمد یک سیاست تقریباً بهینه بر اساس این اندازه گیری خطر با استفاده از تنها یک مجموعه داده از پیش جمع آوری شده وجود دارد.ما در تنظیمات تصمیم گیری خطی مارکوف (MDP) متمرکز هستیم ، یک چارچوب نظری به خوبی مورد توجه که هنوز از دیدگاه حساس به ریسک مورد بررسی قرار نگرفته است.در پاسخ ، ما دو الگوریتم با کارآمد نمونه را معرفی می کنیم.ما با ارائه یک الگوریتم تکرار ارزش بدبینانه حساس به ریسک شروع می کنیم و با استفاده از ساختار اندازه گیری عملکرد حساس به ریسک ، یک تجزیه و تحلیل محکم ارائه می دهیم.برای بهبود بیشتر مرزهای به دست آمده ، ما الگوریتم بدبینانه دیگری را پیشنهاد می کنیم که از اطلاعات واریانس و تجزیه با نقص مرجع استفاده می کند ، به طور موثری هم وابستگی به بعد فضا $ D $ و عامل حساسیت را بهبود می بخشد.به بهترین دانش ما ، ما اولین الگوریتم های RL آفلاین حساس به ریسک را به دست می آوریم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.