ترجمه فارسی مقاله SUMO: برآورد عدم اطمینان مبتنی بر جستجو برای یادگیری تقویتی آفلاین مبتنی بر مدل

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی SUMO: Search-Based Uncertainty Estimation for Model-Based Offline Reinforcement Learning
عنوان مقاله به فارسی SUMO: برآورد عدم اطمینان مبتنی بر جستجو برای یادگیری تقویتی آفلاین مبتنی بر مدل
نویسندگان Zhongjian Qiao, Jiafei Lyu, Kechen Jiao, Qi Liu, Xiu Li
فرمت مقاله انگلیسی PDF
تعداد صفحات 17
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 23 August, 2024; originally announced August 2024. , Comments: Submitted to AAAI2025
توضیحات به فارسی ارسال شده 23 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: ارسال شده به AAAI2025
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

The performance of offline reinforcement learning (RL) suffers from the limited size and quality of static datasets. Model-based offline RL addresses this issue by generating synthetic samples through a dynamics model to enhance overall performance. To evaluate the reliability of the generated samples, uncertainty estimation methods are often employed. However, model ensemble, the most commonly used uncertainty estimation method, is not always the best choice. In this paper, we propose a \textbf{S}earch-based \textbf{U}ncertainty estimation method for \textbf{M}odel-based \textbf{O}ffline RL (SUMO) as an alternative. SUMO characterizes the uncertainty of synthetic samples by measuring their cross entropy against the in-distribution dataset samples, and uses an efficient search-based method for implementation. In this way, SUMO can achieve trustworthy uncertainty estimation. We integrate SUMO into several model-based offline RL algorithms including MOPO and Adapted MOReL (AMOReL), and provide theoretical analysis for them. Extensive experimental results on D4RL datasets demonstrate that SUMO can provide more accurate uncertainty estimation and boost the performance of base algorithms. These indicate that SUMO could be a better uncertainty estimator for model-based offline RL when used in either reward penalty or trajectory truncation. Our code is available and will be open-source for further research and development.

چکیده به فارسی (ترجمه ماشینی)

عملکرد یادگیری تقویت آفلاین (RL) از اندازه محدود و کیفیت مجموعه داده های استاتیک رنج می برد.RL آفلاین مبتنی بر مدل با تولید نمونه های مصنوعی از طریق یک مدل دینامیک برای افزایش عملکرد کلی ، این مسئله را مورد بررسی قرار می دهد.برای ارزیابی قابلیت اطمینان نمونه های تولید شده ، اغلب از روش های تخمین عدم اطمینان استفاده می شود.با این حال ، گروه مدل ، متداول ترین روش تخمین عدم اطمینان ، همیشه بهترین انتخاب نیست.در این مقاله ، ما \ textbf {s} مبتنی بر \ textbf {u} روش تخمین ncectionty را برای \ textbf {m} مبتنی بر بو \ textbf {o} ffline rl (sumo) به عنوان جایگزین پیشنهاد می کنیم.SUMO با اندازه گیری آنتروپی متقاطع خود در برابر نمونه های مجموعه داده های توزیع ، عدم اطمینان از نمونه های مصنوعی را مشخص می کند و از یک روش مبتنی بر جستجوی کارآمد برای اجرای استفاده می کند.به این ترتیب ، سومو می تواند به برآورد عدم اطمینان قابل اعتماد دست یابد.ما SUMO را در چندین الگوریتم RL آفلاین مبتنی بر مدل از جمله MOPO و مورل اقتباس شده (Amorel) ادغام می کنیم و تجزیه و تحلیل نظری را برای آنها ارائه می دهیم.نتایج تجربی گسترده در مجموعه داده های D4RL نشان می دهد که SUMO می تواند برآورد عدم اطمینان دقیق تری را ارائه دهد و عملکرد الگوریتم های پایه را تقویت کند.اینها نشان می دهد که SUMO می تواند یک برآوردگر عدم اطمینان بهتر برای RL آفلاین مبتنی بر مدل باشد که در مجازات پاداش یا کوتاه شدن مسیر استفاده می شود.کد ما در دسترس است و برای تحقیق و توسعه بیشتر منبع باز خواهد بود.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.