ترجمه فارسی مقاله آموزش تقویت معکوس پارتو برای تولید خط مشی کارشناسان مختلف

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Pareto Inverse Reinforcement Learning for Diverse Expert Policy Generation
عنوان مقاله به فارسی آموزش تقویت معکوس پارتو برای تولید خط مشی کارشناسان مختلف
نویسندگان Woo Kyung Kim, Minjong Yoo, Honguk Woo
فرمت مقاله انگلیسی PDF
تعداد صفحات 14
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 21 August, 2024; originally announced August 2024. , Comments: 13 pages, 7 figures; Accepted for International Joint Conference on Artificial Intelligence (IJCAI) 2024; Published version
توضیحات به فارسی ارائه شده 21 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد. ، نظرات: 13 صفحه ، 7 شکل ؛پذیرفته شده برای کنفرانس مشترک بین المللی اطلاعات مصنوعی (IJCAI) 2024 ؛نسخه منتشر شده
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Data-driven offline reinforcement learning and imitation learning approaches have been gaining popularity in addressing sequential decision-making problems. Yet, these approaches rarely consider learning Pareto-optimal policies from a limited pool of expert datasets. This becomes particularly marked due to practical limitations in obtaining comprehensive datasets for all preferences, where multiple conflicting objectives exist and each expert might hold a unique optimization preference for these objectives. In this paper, we adapt inverse reinforcement learning (IRL) by using reward distance estimates for regularizing the discriminator. This enables progressive generation of a set of policies that accommodate diverse preferences on the multiple objectives, while using only two distinct datasets, each associated with a different expert preference. In doing so, we present a Pareto IRL framework (ParIRL) that establishes a Pareto policy set from these limited datasets. In the framework, the Pareto policy set is then distilled into a single, preference-conditioned diffusion model, thus allowing users to immediately specify which expert's patterns they prefer. Through experiments, we show that ParIRL outperforms other IRL algorithms for various multi-objective control tasks, achieving the dense approximation of the Pareto frontier. We also demonstrate the applicability of ParIRL with autonomous driving in CARLA.

چکیده به فارسی (ترجمه ماشینی)

رویکردهای یادگیری تقویت کننده آفلاین داده های ناشی از داده ها در پرداختن به مشکلات تصمیم گیری پی در پی محبوبیت پیدا کرده است.با این حال ، این رویکردها به ندرت یادگیری سیاست های پارتو بهینه را از مجموعه محدودی از مجموعه داده های متخصص در نظر می گیرند.این امر به ویژه به دلیل محدودیت های عملی در به دست آوردن مجموعه داده های جامع برای همه ترجیحات مشخص می شود ، جایی که چندین هدف متناقض وجود دارد و هر متخصص ممکن است ترجیح بهینه سازی منحصر به فرد برای این اهداف داشته باشد.در این مقاله ، ما با استفاده از برآورد فاصله پاداش برای تنظیم مجدد تبعیض آمیز ، یادگیری تقویت معکوس (IRL) را تطبیق می دهیم.این امر باعث می شود تا تولید مترقی مجموعه ای از سیاست ها را در اختیار داشته باشد که ترجیحات متنوعی را در اهداف متعدد در خود جای می دهد ، در حالی که فقط از دو مجموعه داده مجزا استفاده می کند ، هر کدام با یک ترجیح متخصص متفاوت همراه هستند.با انجام این کار ، ما یک چارچوب Pareto IRL (Parirl) ارائه می دهیم که یک خط مشی پارتو را از این مجموعه داده های محدود تعیین می کند.در چارچوب ، مجموعه خط مشی Pareto سپس به یک مدل انتشار واحد و ترجیحی تقطیر می شود ، بنابراین به کاربران امکان می دهد فوراً مشخص کنند که کدام الگوهای متخصص را ترجیح می دهند.از طریق آزمایشات ، ما نشان می دهیم که Parirl از سایر الگوریتم های IRL برای کارهای مختلف کنترل چند هدف ، دستیابی به تقریب متراکم از مرز پارتو استفاده می کند.ما همچنین کاربرد Parirl را با رانندگی خودمختار در کارلا نشان می دهیم.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.