ترجمه فارسی مقاله تخمین پاداش Listwise برای یادگیری تقویتی مبتنی بر ترجیحات آفلاین

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
عنوان مقاله به فارسی تخمین پاداش Listwise برای یادگیری تقویتی مبتنی بر ترجیحات آفلاین
نویسندگان Heewoong Choi, Sangwon Jung, Hongjoon Ahn, Taesup Moon
فرمت مقاله انگلیسی PDF
تعداد صفحات 21
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 7 August, 2024; originally announced August 2024. , Comments: 21 pages, ICML 2024
توضیحات به فارسی ارسال شده در 7 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد ، نظرات: 21 صفحه ، ICML 2024

قیمت: 19,000 تومان

سفارش

با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی، را نیز سفارش می‌دهید.

قیمت: 840,000 تومان

زمان تحویل: 2 تا 3 روز کاری


📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

In Reinforcement Learning (RL), designing precise reward functions remains to be a challenge, particularly when aligning with human intent. Preference-based RL (PbRL) was introduced to address this problem by learning reward models from human feedback. However, existing PbRL methods have limitations as they often overlook the second-order preference that indicates the relative strength of preference. In this paper, we propose Listwise Reward Estimation (LiRE), a novel approach for offline PbRL that leverages second-order preference information by constructing a Ranked List of Trajectories (RLT), which can be efficiently built by using the same ternary feedback type as traditional methods. To validate the effectiveness of LiRE, we propose a new offline PbRL dataset that objectively reflects the effect of the estimated rewards. Our extensive experiments on the dataset demonstrate the superiority of LiRE, i.e., outperforming state-of-the-art baselines even with modest feedback budgets and enjoying robustness with respect to the number of feedbacks and feedback noise. Our code is available at https://github.com/chwoong/LiRE

چکیده به فارسی (ترجمه ماشینی)

در یادگیری تقویت (RL) ، طراحی توابع پاداش دقیق همچنان یک چالش است ، به ویژه هنگام هماهنگی با هدف انسان.RL مبتنی بر ترجیح (PBRL) برای رفع این مشکل با یادگیری مدل های پاداش از بازخورد انسانی معرفی شد.با این حال ، روشهای PBRL موجود محدودیت هایی دارند زیرا اغلب از اولویت مرتبه دوم غافل می شوند که نشان دهنده قدرت نسبی اولویت است.در این مقاله ، ما تخمین پاداش لیست (LIRE) را پیشنهاد می کنیم ، یک رویکرد جدید برای PBRL آفلاین که با ساختن یک لیست رتبه بندی شده از مسیرها (RLT) ، اطلاعات ترجیح مرتبه دوم را افزایش می دهد ، که می تواند با استفاده از همان نوع بازخورد سه گانه ساخته شود.روشهای سنتیبرای اعتبارسنجی اثربخشی LIRE ، ما یک مجموعه داده PBRL جدید آفلاین را پیشنهاد می کنیم که به طور عینی منعکس کننده تأثیر پاداش های تخمین زده شده است.آزمایش های گسترده ما در مورد مجموعه داده ها ، برتری لیر را نشان می دهد ، یعنی از خط مقدماتی پیشرفته حتی با بودجه بازخورد متوسط ​​و لذت بردن از استحکام با توجه به تعداد بازخورد و سر و صدای بازخورد.کد ما در https://github.com/chwoong/lire در دسترس است

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.