ترجمه فارسی مقاله تخصیص اعتبار با جداسازی پاداش جزئی در بهینه‌سازی سیاست مجاورتی چندعاملی

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
عنوان مقاله به فارسی تخصیص اعتبار با جداسازی پاداش جزئی در بهینه‌سازی سیاست مجاورتی چندعاملی
نویسندگان Aditya Kapoor, Benjamin Freed, Howie Choset, Jeff Schneider
فرمت مقاله انگلیسی PDF
تعداد صفحات 20
دسته بندی موضوعات Multiagent Systems,Artificial Intelligence,Machine Learning,Robotics,سیستم های چند منظوره , هوش مصنوعی , یادگیری ماشین , روباتیک ,
توضیحات Submitted 8 August, 2024; originally announced August 2024. , Comments: 20 pages, 5 figures, 12 tables, Reinforcement Learning Journal and Reinforcement Learning Conference 2024
توضیحات به فارسی ارسال شده در 8 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد ، نظرات: 20 صفحه ، 5 شکل ، 12 جدول ، مجله یادگیری تقویت و کنفرانس یادگیری تقویت شده 2024

قیمت: 19,000 تومان

سفارش

با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی، را نیز سفارش می‌دهید.

قیمت: 800,000 تومان

زمان تحویل: 2 تا 3 روز کاری


📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

Multi-agent proximal policy optimization (MAPPO) has recently demonstrated state-of-the-art performance on challenging multi-agent reinforcement learning tasks. However, MAPPO still struggles with the credit assignment problem, wherein the sheer difficulty in ascribing credit to individual agents' actions scales poorly with team size. In this paper, we propose a multi-agent reinforcement learning algorithm that adapts recent developments in credit assignment to improve upon MAPPO. Our approach leverages partial reward decoupling (PRD), which uses a learned attention mechanism to estimate which of a particular agent's teammates are relevant to its learning updates. We use this estimate to dynamically decompose large groups of agents into smaller, more manageable subgroups. We empirically demonstrate that our approach, PRD-MAPPO, decouples agents from teammates that do not influence their expected future reward, thereby streamlining credit assignment. We additionally show that PRD-MAPPO yields significantly higher data efficiency and asymptotic performance compared to both MAPPO and other state-of-the-art methods across several multi-agent tasks, including StarCraft II. Finally, we propose a version of PRD-MAPPO that is applicable to textit{shared} reward settings, where PRD was previously not applicable, and empirically show that this also leads to performance improvements over MAPPO.

چکیده به فارسی (ترجمه ماشینی)

بهینه سازی سیاست پروگزیمال چند عامل (MAPPO) اخیراً عملکرد پیشرفته ای را در مورد کارهای یادگیری تقویت کننده چند عامل به چالش کشیده است.با این حال ، ماپو هنوز هم با مشکل واگذاری اعتباری تلاش می کند ، که در آن دشواری شدید در تعیین اعتبار به اقدامات عوامل فردی با اندازه تیم ضعیف است.در این مقاله ، ما یک الگوریتم یادگیری تقویت کننده چند عامل را پیشنهاد می کنیم که تحولات اخیر در تکالیف اعتباری را برای بهبود در ماپو تطبیق می دهد.رویکرد ما از بین بردن پاداش جزئی (PRD) استفاده می کند ، که از یک مکانیسم توجه آموخته شده برای تخمین اینکه کدام یک از هم تیمی های یک عامل خاص مربوط به به روزرسانی های یادگیری آن هستند ، استفاده می کند.ما از این تخمین برای تجزیه پویا گروه های بزرگی از عوامل در زیر گروه های کوچکتر و قابل کنترل تر استفاده می کنیم.ما از نظر تجربی نشان می دهیم که رویکرد ما ، PRD-Mappo ، نمایندگان هم تیمی ها را که بر پاداش آینده مورد انتظار آنها تأثیر نمی گذارد ، جدا می کند و از این طریق تکلیف اعتباری را ساده تر می کند.علاوه بر این ، ما نشان می دهیم که PRD-MAPPO بازده داده های قابل توجهی بالاتر و عملکرد بدون علامت در مقایسه با MAPPO و سایر روش های پیشرفته در چندین کار چند عامل ، از جمله StarCraft II است.سرانجام ، ما نسخه ای از PRD-MAPPO را پیشنهاد می کنیم که برای تنظیمات پاداش textit {مشترک قابل استفاده باشد ، جایی که PRD قبلاً قابل استفاده نبود ، و به صورت تجربی نشان می دهد که این امر منجر به بهبود عملکرد نسبت به ماپو می شود.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.