ترجمه فارسی مقاله یادگیری اولویت چند نوع: توانمندسازی یادگیری تقویت مبتنی بر ترجیح با ترجیحات برابر

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Multi-Type Preference Learning: Empowering Preference-Based Reinforcement Learning with Equal Preferences
عنوان مقاله به فارسی یادگیری اولویت چند نوع: توانمندسازی یادگیری تقویت مبتنی بر ترجیح با ترجیحات برابر
نویسندگان Ziang Liu, Junjie Xu, Xingjiao Wu, Jing Yang, Liang He
فرمت مقاله انگلیسی PDF
تعداد صفحات 7
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 11 September, 2024; originally announced September 2024. , Comments: 7 pages, 6 figures
توضیحات به فارسی ارسال شده در 11 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد ، نظرات: 7 صفحه ، 6 شکل
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Preference-Based reinforcement learning (PBRL) learns directly from the preferences of human teachers regarding agent behaviors without needing meticulously designed reward functions. However, existing PBRL methods often learn primarily from explicit preferences, neglecting the possibility that teachers may choose equal preferences. This neglect may hinder the understanding of the agent regarding the task perspective of the teacher, leading to the loss of important information. To address this issue, we introduce the Equal Preference Learning Task, which optimizes the neural network by promoting similar reward predictions when the behaviors of two agents are labeled as equal preferences. Building on this task, we propose a novel PBRL method, Multi-Type Preference Learning (MTPL), which allows simultaneous learning from equal preferences while leveraging existing methods for learning from explicit preferences. To validate our approach, we design experiments applying MTPL to four existing state-of-the-art baselines across ten locomotion and robotic manipulation tasks in the DeepMind Control Suite. The experimental results indicate that simultaneous learning from both equal and explicit preferences enables the PBRL method to more comprehensively understand the feedback from teachers, thereby enhancing feedback efficiency.

چکیده به فارسی (ترجمه ماشینی)

یادگیری تقویت مبتنی بر ترجیح (PBRL) مستقیماً از ترجیحات معلمان انسانی در مورد رفتارهای عامل بدون نیاز به توابع پاداش با طراحی دقیق یاد می گیرد.با این حال ، روشهای PBRL موجود اغلب در درجه اول از ترجیحات صریح یاد می گیرند ، و این احتمال را که معلمان ممکن است ترجیحات برابر را انتخاب کنند ، غفلت می کنند.این غفلت ممکن است مانع درک نماینده در مورد دیدگاه وظیفه معلم شود و منجر به از دست دادن اطلاعات مهم شود.برای پرداختن به این مسئله ، ما وظیفه یادگیری اولویت را معرفی می کنیم ، که شبکه عصبی را با ترویج پیش بینی های پاداش مشابه بهینه می کند وقتی رفتارهای دو عامل به عنوان ترجیحات برابر شناخته می شوند.با تکیه بر این کار ، ما یک روش جدید PBRL ، یادگیری اولویت چند نوع (MTPL) را پیشنهاد می کنیم ، که امکان یادگیری همزمان از ترجیحات برابر را فراهم می کند در حالی که از روشهای موجود برای یادگیری از ترجیحات صریح استفاده می کند.برای اعتبارسنجی رویکرد خود ، ما آزمایشاتی را با استفاده از MTPL در چهار خط مقدم پیشرفته موجود در ده کار حرکتی و دستکاری روباتیک در مجموعه کنترل DeepMind طراحی می کنیم.نتایج تجربی نشان می دهد که یادگیری همزمان از ترجیحات برابر و صریح ، روش PBRL را قادر می سازد تا بازخورد معلمان را به طور جامع درک کند ، در نتیجه باعث افزایش کارایی بازخورد می شود.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.