ترجمه فارسی مقاله تخصیص اعتبار با جداسازی پاداش جزئی در بهینهسازی سیاست مجاورتی چندعاملی
| عنوان مقاله به انگلیسی | Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization |
| عنوان مقاله به فارسی | تخصیص اعتبار با جداسازی پاداش جزئی در بهینهسازی سیاست مجاورتی چندعاملی |
| نویسندگان | Aditya Kapoor, Benjamin Freed, Howie Choset, Jeff Schneider |
| فرمت مقاله انگلیسی | |
| تعداد صفحات | 20 |
| دسته بندی موضوعات | Multiagent Systems,Artificial Intelligence,Machine Learning,Robotics,سیستم های چند منظوره , هوش مصنوعی , یادگیری ماشین , روباتیک , |
| توضیحات | Submitted 8 August, 2024; originally announced August 2024. , Comments: 20 pages, 5 figures, 12 tables, Reinforcement Learning Journal and Reinforcement Learning Conference 2024 |
| توضیحات به فارسی | ارسال شده در 8 اوت 2024 ؛در ابتدا اوت 2024 اعلام شد ، نظرات: 20 صفحه ، 5 شکل ، 12 جدول ، مجله یادگیری تقویت و کنفرانس یادگیری تقویت شده 2024 |
قیمت: 19,000 تومان
سفارش
با انتخاب این گزینه، علاوه بر دریافت مقاله اصلی، را نیز سفارش میدهید.
قیمت: 800,000 تومان
زمان تحویل: 2 تا 3 روز کاری
📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
-
کتاب صدها نکته فارسی (خودمونی) – نسخه PDF — زبان ساده و کاربردی
مشاهده نمونه نسخه نکات ساده -
کتاب صدها نکته رسمی فارسی – نسخه PDF — نگارش استاندارد و علمی
مشاهده نمونه نسخه نکات رسمی -
کتاب صدها پرسش و پاسخ تشریحی – نسخه PDF
— هر سؤال همراه با پاسخ کامل برای درک عمیق مفاهیم
مشاهده نمونه نسخه پرسش و پاسخ -
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع -
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
- این محصول به صورت فایل دانلودی کامل ارائه میشود.
- توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
- دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
- برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
- اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی:
واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248
تلگرام: @ma_limbs
چکیده
Multi-agent proximal policy optimization (MAPPO) has recently demonstrated state-of-the-art performance on challenging multi-agent reinforcement learning tasks. However, MAPPO still struggles with the credit assignment problem, wherein the sheer difficulty in ascribing credit to individual agents' actions scales poorly with team size. In this paper, we propose a multi-agent reinforcement learning algorithm that adapts recent developments in credit assignment to improve upon MAPPO. Our approach leverages partial reward decoupling (PRD), which uses a learned attention mechanism to estimate which of a particular agent's teammates are relevant to its learning updates. We use this estimate to dynamically decompose large groups of agents into smaller, more manageable subgroups. We empirically demonstrate that our approach, PRD-MAPPO, decouples agents from teammates that do not influence their expected future reward, thereby streamlining credit assignment. We additionally show that PRD-MAPPO yields significantly higher data efficiency and asymptotic performance compared to both MAPPO and other state-of-the-art methods across several multi-agent tasks, including StarCraft II. Finally, we propose a version of PRD-MAPPO that is applicable to textit{shared} reward settings, where PRD was previously not applicable, and empirically show that this also leads to performance improvements over MAPPO.
چکیده به فارسی (ترجمه ماشینی)
بهینه سازی سیاست پروگزیمال چند عامل (MAPPO) اخیراً عملکرد پیشرفته ای را در مورد کارهای یادگیری تقویت کننده چند عامل به چالش کشیده است.با این حال ، ماپو هنوز هم با مشکل واگذاری اعتباری تلاش می کند ، که در آن دشواری شدید در تعیین اعتبار به اقدامات عوامل فردی با اندازه تیم ضعیف است.در این مقاله ، ما یک الگوریتم یادگیری تقویت کننده چند عامل را پیشنهاد می کنیم که تحولات اخیر در تکالیف اعتباری را برای بهبود در ماپو تطبیق می دهد.رویکرد ما از بین بردن پاداش جزئی (PRD) استفاده می کند ، که از یک مکانیسم توجه آموخته شده برای تخمین اینکه کدام یک از هم تیمی های یک عامل خاص مربوط به به روزرسانی های یادگیری آن هستند ، استفاده می کند.ما از این تخمین برای تجزیه پویا گروه های بزرگی از عوامل در زیر گروه های کوچکتر و قابل کنترل تر استفاده می کنیم.ما از نظر تجربی نشان می دهیم که رویکرد ما ، PRD-Mappo ، نمایندگان هم تیمی ها را که بر پاداش آینده مورد انتظار آنها تأثیر نمی گذارد ، جدا می کند و از این طریق تکلیف اعتباری را ساده تر می کند.علاوه بر این ، ما نشان می دهیم که PRD-MAPPO بازده داده های قابل توجهی بالاتر و عملکرد بدون علامت در مقایسه با MAPPO و سایر روش های پیشرفته در چندین کار چند عامل ، از جمله StarCraft II است.سرانجام ، ما نسخه ای از PRD-MAPPO را پیشنهاد می کنیم که برای تنظیمات پاداش textit {مشترک قابل استفاده باشد ، جایی که PRD قبلاً قابل استفاده نبود ، و به صورت تجربی نشان می دهد که این امر منجر به بهبود عملکرد نسبت به ماپو می شود.📚 محتوای این محصول آموزشی (پکیج کامل)
علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیقتر و تسلط کامل بر مباحث مجموعهای از کتابهای آموزشی نیز ارائه میشود.
-
کتاب صدها نکته فارسی (خودمونی) – نسخه PDF — زبان ساده و کاربردی
مشاهده نمونه نسخه نکات ساده -
کتاب صدها نکته رسمی فارسی – نسخه PDF — نگارش استاندارد و علمی
مشاهده نمونه نسخه نکات رسمی -
کتاب صدها پرسش و پاسخ تشریحی – نسخه PDF
— هر سؤال همراه با پاسخ کامل برای درک عمیق مفاهیم
مشاهده نمونه نسخه پرسش و پاسخ -
کتاب پرسش و پاسخ چهارگزینهای – نسخه یادگیری سریع
— پاسخها بلافاصله بعد از سؤال برای مرور سریع
مشاهده نمونه نسخه کوییز سریع -
کتاب پرسش و پاسخ چهارگزینهای – نسخه خودآزمایی
— پاسخها در انتهای بخشها برای سنجش واقعی یادگیری
مشاهده نمونه نسخه آزمونی
🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتابها، تمرینها و خودآزمایی.
ℹ️ نکات مهم هنگام خرید
- این محصول به صورت فایل دانلودی کامل ارائه میشود.
- توجه: لینکهای اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال میشوند.
- دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
- برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
- اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینکها را دریافت نکردهاید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینکها دوباره ارسال شوند.
💬 راههای ارتباطی پشتیبانی:
واتساپ یا هر پیام رسان داخلی یا پیامک:
09395106248
تلگرام: @ma_limbs
نظرات
هنوز نظری ثبت نشده است.
وارد شوید تا نظر ثبت کنید.