ترجمه فارسی مقاله اپیزودهای مبتنی بر انتشار برای یادگیری تقویت کننده چند عامل آفلاین

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning
عنوان مقاله به فارسی اپیزودهای مبتنی بر انتشار برای یادگیری تقویت کننده چند عامل آفلاین
نویسندگان Jihwan Oh, Sungnyun Kim, Gahee Kim, Sunghwan Kim, Se-Young Yun
فرمت مقاله انگلیسی PDF
تعداد صفحات 9
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,یادگیری ماشین ,
توضیحات Submitted 23 August, 2024; originally announced August 2024. , Comments: Accepted by SPIGM Workshop at ICML 2024 (Structured Probabilistic Inference & Generative Modeling)
توضیحات به فارسی ارسال شده 23 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد ، نظرات: پذیرفته شده توسط کارگاه SPIGM در ICML 2024 (استنتاج احتمالی ساختاری و مدل سازی تولیدی)
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Offline multi-agent reinforcement learning (MARL) is increasingly recognized as crucial for effectively deploying RL algorithms in environments where real-time interaction is impractical, risky, or costly. In the offline setting, learning from a static dataset of past interactions allows for the development of robust and safe policies without the need for live data collection, which can be fraught with challenges. Building on this foundational importance, we present EAQ, Episodes Augmentation guided by Q-total loss, a novel approach for offline MARL framework utilizing diffusion models. EAQ integrates the Q-total function directly into the diffusion model as a guidance to maximize the global returns in an episode, eliminating the need for separate training. Our focus primarily lies on cooperative scenarios, where agents are required to act collectively towards achieving a shared goal-essentially, maximizing global returns. Consequently, we demonstrate that our episodes augmentation in a collaborative manner significantly boosts offline MARL algorithm compared to the original dataset, improving the normalized return by +17.3% and +12.9% for medium and poor behavioral policies in SMAC simulator, respectively.

چکیده به فارسی (ترجمه ماشینی)

یادگیری تقویت کننده چند عامل آفلاین (MARL) به طور فزاینده ای برای استقرار مؤثر الگوریتم های RL در محیط هایی که تعامل در زمان واقعی غیر عملی ، خطرناک یا پرهزینه است ، بسیار مهم است.در تنظیمات آفلاین ، یادگیری از یک مجموعه داده استاتیک از تعامل های گذشته امکان توسعه سیاست های قوی و ایمن را بدون نیاز به جمع آوری داده های زنده فراهم می کند ، که می تواند مملو از چالش ها باشد.با تکیه بر این اهمیت اساسی ، ما EAQ ، قسمتهای تقویت شده با هدایت Q-Total را ارائه می دهیم ، یک رویکرد جدید برای چارچوب آفلاین MARL با استفاده از مدل های انتشار.EAQ عملکرد Q-Total را مستقیماً در مدل انتشار به عنوان راهنمایی برای به حداکثر رساندن بازده جهانی در یک قسمت ادغام می کند و نیاز به آموزش جداگانه را از بین می برد.تمرکز ما در درجه اول بر سناریوهای تعاونی نهفته است ، جایی که مأمورین موظفند به طور جمعی برای دستیابی به یک هدف مشترک به طور کلی عمل کنند و بازده های جهانی را به حداکثر برسانند.در نتیجه ، ما نشان می دهیم که تقویت قسمت های ما به صورت مشترک الگوریتم مارل آفلاین را در مقایسه با مجموعه داده اصلی افزایش می دهد و به ترتیب بازده عادی شده را با 17.3 ٪ و 12.9 ٪ برای سیاست های رفتاری متوسط ​​و ضعیف در شبیه ساز SMAC بهبود می بخشد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.