ترجمه فارسی مقاله پخش کننده مستمر (CoD): تسلط بر یادگیری تقویتی مداوم آفلاین با تمرین تجربه

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal
عنوان مقاله به فارسی پخش کننده مستمر (CoD): تسلط بر یادگیری تقویتی مداوم آفلاین با تمرین تجربه
نویسندگان Jifeng Hu, Li Shen, Sili Huang, Zhejian Yang, Hechang Chen, Lichao Sun, Yi Chang, Dacheng Tao
فرمت مقاله انگلیسی PDF
تعداد صفحات 37
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Artificial Intelligence,یادگیری ماشین , هوش مصنوعی ,
توضیحات Submitted 4 September, 2024; originally announced September 2024.
توضیحات به فارسی ارسال شده در 4 سپتامبر 2024 ؛در ابتدا سپتامبر 2024 اعلام شد.
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Artificial neural networks, especially recent diffusion-based models, have shown remarkable superiority in gaming, control, and QA systems, where the training tasks' datasets are usually static. However, in real-world applications, such as robotic control of reinforcement learning (RL), the tasks are changing, and new tasks arise in a sequential order. This situation poses the new challenge of plasticity-stability trade-off for training an agent who can adapt to task changes and retain acquired knowledge. In view of this, we propose a rehearsal-based continual diffusion model, called Continual Diffuser (CoD), to endow the diffuser with the capabilities of quick adaptation (plasticity) and lasting retention (stability). Specifically, we first construct an offline benchmark that contains 90 tasks from multiple domains. Then, we train the CoD on each task with sequential modeling and conditional generation for making decisions. Next, we preserve a small portion of previous datasets as the rehearsal buffer and replay it to retain the acquired knowledge. Extensive experiments on a series of tasks show CoD can achieve a promising plasticity-stability trade-off and outperform existing diffusion-based methods and other representative baselines on most tasks.

چکیده به فارسی (ترجمه ماشینی)

شبکه های عصبی مصنوعی ، به ویژه مدلهای اخیر مبتنی بر انتشار ، برتری قابل توجهی در سیستم های بازی ، کنترل و QA نشان داده اند ، جایی که مجموعه داده های وظایف آموزش معمولاً استاتیک هستند.با این حال ، در برنامه های دنیای واقعی ، مانند کنترل روباتیک یادگیری تقویت (RL) ، وظایف در حال تغییر هستند و کارهای جدید به ترتیب پی در پی بوجود می آیند.این وضعیت چالش جدید تجارت-ثبات را برای آموزش یک عامل که می تواند با تغییرات کار سازگار باشد و دانش اکتسابی را حفظ کند ، ایجاد می کند.با توجه به این ، ما یک مدل انتشار مداوم مبتنی بر تمرین ، به نام دیفیوزر مداوم (COD) را پیشنهاد می کنیم تا با قابلیت سازگاری سریع (انعطاف پذیری) و حفظ ماندگار (پایداری) ، دیفیوزر را وقف کنیم.به طور خاص ، ما ابتدا یک معیار آفلاین می سازیم که شامل 90 کار از چندین حوزه است.سپس ، ما COD را بر روی هر کار با مدل سازی متوالی و تولید مشروط برای تصمیم گیری آموزش می دهیم.در مرحله بعد ، ما بخش کوچکی از مجموعه داده های قبلی را به عنوان بافر تمرین حفظ می کنیم و برای حفظ دانش اکتسابی آن را دوباره پخش می کنیم.آزمایش های گسترده در مورد یک سری از کارها نشان می دهد که COD می تواند به یک امیدوار کننده امیدوار کننده پتانسیل و روشهای مبتنی بر انتشار موجود و سایر خطوط نماینده در بیشتر کارها بهتر عمل کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.