ترجمه فارسی مقاله ماژول: باز کردن قفل تعمیم اولویت از طریق مدل‌های انتشار برای یادگیری تقویتی چندهدفه آفلاین

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
عنوان مقاله به فارسی ماژول: باز کردن قفل تعمیم اولویت از طریق مدل‌های انتشار برای یادگیری تقویتی چندهدفه آفلاین
نویسندگان Yifu Yuan, Zhenrui Zheng, Zibin Dong, Jianye Hao
فرمت مقاله انگلیسی PDF
تعداد صفحات 23
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 27 August, 2024; originally announced August 2024. , Comments: 23 pages, 7 figures
توضیحات به فارسی ارسال شده در 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد ، نظرات: 23 صفحه ، 7 شکل
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Multi-objective Reinforcement Learning (MORL) seeks to develop policies that simultaneously optimize multiple conflicting objectives, but it requires extensive online interactions. Offline MORL provides a promising solution by training on pre-collected datasets to generalize to any preference upon deployment. However, real-world offline datasets are often conservatively and narrowly distributed, failing to comprehensively cover preferences, leading to the emergence of out-of-distribution (OOD) preference areas. Existing offline MORL algorithms exhibit poor generalization to OOD preferences, resulting in policies that do not align with preferences. Leveraging the excellent expressive and generalization capabilities of diffusion models, we propose MODULI (Multi-objective Diffusion Planner with Sliding Guidance), which employs a preference-conditioned diffusion model as a planner to generate trajectories that align with various preferences and derive action for decision-making. To achieve accurate generation, MODULI introduces two return normalization methods under diverse preferences for refining guidance. To further enhance generalization to OOD preferences, MODULI proposes a novel sliding guidance mechanism, which involves training an additional slider adapter to capture the direction of preference changes. Incorporating the slider, it transitions from in-distribution (ID) preferences to generating OOD preferences, patching, and extending the incomplete Pareto front. Extensive experiments on the D4MORL benchmark demonstrate that our algorithm outperforms state-of-the-art Offline MORL baselines, exhibiting excellent generalization to OOD preferences.

چکیده به فارسی (ترجمه ماشینی)

یادگیری تقویت کننده چند هدف (MORL) به دنبال تدوین سیاست هایی است که همزمان چندین هدف متناقض را بهینه می کند ، اما به تعامل گسترده آنلاین نیاز دارد.آفلاین MORL با آموزش در مجموعه داده های از پیش جمع آوری شده ، یک راه حل امیدوارکننده را ارائه می دهد تا به هرگونه اولویت در هنگام استقرار تعمیم یابد.با این حال ، مجموعه داده های آفلاین در دنیای واقعی اغلب به صورت محافظه کارانه و باریک توزیع می شوند ، و نتوانند ترجیحات جامع را پوشش دهند و منجر به ظهور مناطق اولویت خارج از توزیع (OOD) شوند.الگوریتم های MORL آفلاین موجود ، تعمیم ضعیفی از ترجیحات OOD نشان می دهند ، در نتیجه سیاست هایی که با ترجیحات هماهنگ نیستند.با استفاده از قابلیت های عالی و عمومی سازی عالی از مدل های انتشار ، ما ماژول ها را پیشنهاد می کنیم (برنامه ریز انتشار چند منظوره با راهنمایی کشویی) ، که از یک مدل انتشار با شرایط ترجیحی به عنوان یک برنامه ریز برای تولید مسیرهایی استفاده می کند که با ترجیحات مختلف مطابقت داردساختبرای دستیابی به نسل دقیق ، ماژول ها دو روش عادی سازی بازگشت را تحت ترجیحات متنوع برای پالایش راهنمایی معرفی می کند.برای افزایش بیشتر تعمیم در ترجیحات OOD ، ماژول یک مکانیسم راهنمایی کشویی جدید را پیشنهاد می کند ، که شامل آموزش یک آداپتور کشویی اضافی برای گرفتن جهت تغییرات اولویت است.با در نظر گرفتن کشویی ، از ترجیحات توزیع (ID) به تولید ترجیحات OOD ، پچ زدن و گسترش جلوی ناقص پارتو منتقل می شود.آزمایش های گسترده ای در مورد معیار D4Morl نشان می دهد که الگوریتم ما از خطوط اصلی آفلاین MORL بهتر عمل می کند و تعمیم عالی در ترجیحات OOD دارد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.