ترجمه فارسی مقاله تطبیق دامنه برای یادگیری تقویتی آفلاین با نمونه های محدود

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Domain Adaptation for Offline Reinforcement Learning with Limited Samples
عنوان مقاله به فارسی تطبیق دامنه برای یادگیری تقویتی آفلاین با نمونه های محدود
نویسندگان Weiqin Chen, Sandipan Mishra, Santiago Paternain
فرمت مقاله انگلیسی PDF
تعداد صفحات 18
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Machine Learning,یادگیری ماشین , یادگیری ماشین ,
توضیحات Submitted 22 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 22 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Offline reinforcement learning (RL) learns effective policies from a static target dataset. Despite state-of-the-art (SOTA) offline RL algorithms being promising, they highly rely on the quality of the target dataset. The performance of SOTA algorithms can degrade in scenarios with limited samples in the target dataset, which is often the case in real-world applications. To address this issue, domain adaptation that leverages auxiliary samples from related source datasets (such as simulators) can be beneficial. In this context, determining the optimal way to trade off the source and target datasets remains a critical challenge in offline RL. To the best of our knowledge, this paper proposes the first framework that theoretically and experimentally explores how the weight assigned to each dataset affects the performance of offline RL. We establish the performance bounds and convergence neighborhood of our framework, both of which depend on the selection of the weight. Furthermore, we identify the existence of an optimal weight for balancing the two datasets. All theoretical guarantees and optimal weight depend on the quality of the source dataset and the size of the target dataset. Our empirical results on the well-known Procgen Benchmark substantiate our theoretical contributions.

چکیده به فارسی (ترجمه ماشینی)

یادگیری تقویت آفلاین (RL) سیاست های مؤثر را از یک مجموعه داده هدف استاتیک می آموزد.علیرغم الگوریتم های RL فوق العاده برتر (SOTA) که امیدوار کننده هستند ، آنها بسیار به کیفیت مجموعه داده های هدف اعتماد می کنند.عملکرد الگوریتم های SOTA می تواند در سناریوها با نمونه های محدود در مجموعه داده های هدف ، که اغلب در برنامه های دنیای واقعی اتفاق می افتد ، تخریب شود.برای پرداختن به این مسئله ، سازگاری دامنه که از نمونه های کمکی از مجموعه داده های منبع مرتبط استفاده می کند (مانند شبیه ساز) می تواند مفید باشد.در این زمینه ، تعیین راه بهینه برای تجارت از منبع و مجموعه داده های هدف یک چالش مهم در RL آفلاین است.به بهترین دانش ما ، این مقاله اولین چارچوبی را ارائه می دهد که از لحاظ نظری و تجربی بررسی می کند که چگونه وزن اختصاص داده شده به هر مجموعه داده بر عملکرد RL آفلاین تأثیر می گذارد.ما مرزهای عملکرد و محله همگرایی چارچوب خود را تعیین می کنیم ، که هر دو به انتخاب وزن بستگی دارند.علاوه بر این ، ما وجود یک وزن بهینه را برای متعادل کردن دو مجموعه داده شناسایی می کنیم.تمام تضمین های نظری و وزن بهینه به کیفیت مجموعه داده منبع و اندازه مجموعه داده های هدف بستگی دارد.نتایج تجربی ما در معیار مشهور Procgen سهم نظری ما را اثبات می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.