ترجمه فارسی مقاله آموزش تقویتی بدون نظارت به آنلاین

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Unsupervised-to-Online Reinforcement Learning
عنوان مقاله به فارسی آموزش تقویتی بدون نظارت به آنلاین
نویسندگان Junsu Kim, Seohong Park, Sergey Levine
فرمت مقاله انگلیسی PDF
تعداد صفحات 20
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 27 August, 2024; originally announced August 2024.
توضیحات به فارسی ارسال شده در 27 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Offline-to-online reinforcement learning (RL), a framework that trains a policy with offline RL and then further fine-tunes it with online RL, has been considered a promising recipe for data-driven decision-making. While sensible, this framework has drawbacks: it requires domain-specific offline RL pre-training for each task, and is often brittle in practice. In this work, we propose unsupervised-to-online RL (U2O RL), which replaces domain-specific supervised offline RL with unsupervised offline RL, as a better alternative to offline-to-online RL. U2O RL not only enables reusing a single pre-trained model for multiple downstream tasks, but also learns better representations, which often result in even better performance and stability than supervised offline-to-online RL. To instantiate U2O RL in practice, we propose a general recipe for U2O RL to bridge task-agnostic unsupervised offline skill-based policy pre-training and supervised online fine-tuning. Throughout our experiments in nine state-based and pixel-based environments, we empirically demonstrate that U2O RL achieves strong performance that matches or even outperforms previous offline-to-online RL approaches, while being able to reuse a single pre-trained model for a number of different downstream tasks.

چکیده به فارسی (ترجمه ماشینی)

یادگیری تقویت کننده آفلاین به یک خط (RL) ، چارچوبی که یک خط مشی را با RL آفلاین آموزش می دهد و سپس آن را با RL آنلاین تنظیم می کند ، یک دستور العمل امیدوارکننده برای تصمیم گیری مبتنی بر داده در نظر گرفته شده است.در حالی که معقول است ، این چارچوب دارای اشکالاتی است: نیاز به پیش زمینه RL آفلاین خاص دامنه برای هر کار دارد و اغلب در عمل شکننده است.در این کار ، ما RL بدون نظارت به یک خط (U2O RL) را پیشنهاد می کنیم ، که جایگزین RL با نظارت خاص دامنه با RL غیر قابل نظارت RL ، به عنوان یک جایگزین بهتر برای RL آفلاین به خط است.U2O RL نه تنها استفاده مجدد از یک مدل از پیش آموزش داده شده را برای چندین کار پایین دست امکان پذیر می کند ، بلکه بازنمایی های بهتری را نیز می آموزد ، که اغلب منجر به عملکرد و ثبات حتی بهتر از RL تحت نظارت RL به خط می شود.برای فوری U2O RL در عمل ، ما یک دستور العمل کلی برای U2O RL پیشنهاد می کنیم تا خط مشی مبتنی بر مهارت مبتنی بر مهارت های غیر قابل نظارت را انجام دهد و از قبل ترفند و تنظیم آنلاین را تحت نظارت قرار دهد.در طول آزمایشات ما در نه محیط مبتنی بر دولت و پیکسل ، ما به طور تجربی نشان می دهیم که U2O RL به عملکرد قوی که مطابقت دارد یا حتی از رویکردهای قبلی RL آفلاین به یک خط استفاده می کند ، دست می یابد ، در حالی که قادر به استفاده مجدد از یک مدل از پیش آموزش داده شده برای یکتعداد کارهای مختلف پایین دست.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.