کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs
چکیده
Multi-objective Reinforcement Learning (MORL) seeks to develop policies that simultaneously optimize multiple conflicting objectives, but it requires extensive online interactions. Offline MORL provides a promising solution by training on pre-collected datasets to generalize to any preference upon deployment. However, real-world offline datasets are often conservatively and narrowly distributed, failing to comprehensively cover preferences, leading to the emergence of out-of-distribution (OOD) preference areas. Existing offline MORL algorithms exhibit poor generalization to OOD preferences, resulting in policies that do not align with preferences. Leveraging the excellent expressive and generalization capabilities of diffusion models, we propose MODULI (Multi-objective Diffusion Planner with Sliding Guidance), which employs a preference-conditioned diffusion model as a planner to generate trajectories that align with various preferences and derive action for decision-making. To achieve accurate generation, MODULI introduces two return normalization methods under diverse preferences for refining guidance. To further enhance generalization to OOD preferences, MODULI proposes a novel sliding guidance mechanism, which involves training an additional slider adapter to capture the direction of preference changes. Incorporating the slider, it transitions from in-distribution (ID) preferences to generating OOD preferences, patching, and extending the incomplete Pareto front. Extensive experiments on the D4MORL benchmark demonstrate that our algorithm outperforms state-of-the-art Offline MORL baselines, exhibiting excellent generalization to OOD preferences.
چکیده به فارسی (ترجمه ماشینی)
یادگیری تقویت کننده چند هدف (MORL) به دنبال تدوین سیاست هایی است که همزمان چندین هدف متناقض را بهینه می کند ، اما به تعامل گسترده آنلاین نیاز دارد.آفلاین MORL با آموزش در مجموعه داده های از پیش جمع آوری شده ، یک راه حل امیدوارکننده را ارائه می دهد تا به هرگونه اولویت در هنگام استقرار تعمیم یابد.با این حال ، مجموعه داده های آفلاین در دنیای واقعی اغلب به صورت محافظه کارانه و باریک توزیع می شوند ، و نتوانند ترجیحات جامع را پوشش دهند و منجر به ظهور مناطق اولویت خارج از توزیع (OOD) شوند.الگوریتم های MORL آفلاین موجود ، تعمیم ضعیفی از ترجیحات OOD نشان می دهند ، در نتیجه سیاست هایی که با ترجیحات هماهنگ نیستند.با استفاده از قابلیت های عالی و عمومی سازی عالی از مدل های انتشار ، ما ماژول ها را پیشنهاد می کنیم (برنامه ریز انتشار چند منظوره با راهنمایی کشویی) ، که از یک مدل انتشار با شرایط ترجیحی به عنوان یک برنامه ریز برای تولید مسیرهایی استفاده می کند که با ترجیحات مختلف مطابقت داردساختبرای دستیابی به نسل دقیق ، ماژول ها دو روش عادی سازی بازگشت را تحت ترجیحات متنوع برای پالایش راهنمایی معرفی می کند.برای افزایش بیشتر تعمیم در ترجیحات OOD ، ماژول یک مکانیسم راهنمایی کشویی جدید را پیشنهاد می کند ، که شامل آموزش یک آداپتور کشویی اضافی برای گرفتن جهت تغییرات اولویت است.با در نظر گرفتن کشویی ، از ترجیحات توزیع (ID) به تولید ترجیحات OOD ، پچ زدن و گسترش جلوی ناقص پارتو منتقل می شود.آزمایش های گسترده ای در مورد معیار D4Morl نشان می دهد که الگوریتم ما از خطوط اصلی آفلاین MORL بهتر عمل می کند و تعمیم عالی در ترجیحات OOD دارد.
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
این محصول به صورت فایل دانلودی کامل ارائه میشود.
توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا
لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی: واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248 تلگرام: @ma_limbs