کتاب یادگیری تقویتی چندعامله: کاوشی عمیق در ناظر مرکزی عامل مستقل

انتخاب پلن

افزودنی‌های اختیاری

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 62,488 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

🎓 دوره آموزشی جامع

📚 اطلاعات دوره

عنوان دوره: دوره یادگیری تقویتی چندعامله: کاوشی عمیق در ناظر مرکزی عامل مستقل

موضوع کلی: یادگیری تقویتی چندعامله (MARL)

موضوع میانی: روش‌های مبتنی بر ناظر مرکزی/عامل مستقل (Centralized Critic/Independent Actor)

📋 سرفصل‌های دوره

  • 1. مبانی یادگیری تقویتی چندعامله
  • 2. ساختار عامل، محیط و تعاملات چندعامله
  • 3. تفاوت یادگیری تقویتی تک‌عامله و چندعامله
  • 4. مسئله غیرایستایی در محیط‌های چندعامله
  • 5. همکاری، رقابت و تعامل ترکیبی میان عامل‌ها
  • 6. مشاهده‌پذیری جزئی و تصمیم‌گیری محلی
  • 7. فضای حالت و عمل در سیستم‌های چندعامله
  • 8. فرآیند تصمیم‌گیری مارکوف چندعامله
  • 9. مفهوم سیاست مستقل برای هر عامل
  • 10. مفهوم ناظر مرکزی و نقش آن در MARL
  • 11. معماری Centralized Critic / Independent Actor
  • 12. منطق تفکیک آموزش مرکزی و اجرای مستقل
  • 13. مقایسه Independent Learners با Centralized Critic
  • 14. تعریف ورودی‌های ناظر مرکزی
  • 15. طراحی خروجی و تابع ارزش ناظر مرکزی
  • 16. استفاده از اطلاعات محلی در Actor
  • 17. استفاده از اطلاعات مشترک در Critic
  • 18. نحوه محاسبه ارزش مشترک در محیط چندعامله
  • 19. طراحی تابع ارزش برای عامل‌های مستقل
  • 20. مزیت‌های آموزش مرکزی در کاهش ناپایداری
  • 21. مسئله تغییر توزیع داده در حین یادگیری
  • 22. اثر سیاست سایر عامل‌ها بر فرایند یادگیری
  • 23. Non-Stationarity و راهکارهای مقابله با آن
  • 24. تخصیص اعتبار پاداش در سیستم‌های چندعامله
  • 25. پاداش مشترک و پاداش فردی
  • 26. طراحی تابع پاداش برای همکاری چندعامله
  • 27. Reward Shaping در محیط‌های چندعامله
  • 28. Credit Assignment با استفاده از Critic مرکزی
  • 29. مزیت اطلاعات جهانی برای آموزش Critic
  • 30. محدودیت اطلاعات جهانی هنگام اجرای Actor
  • 31. Centralized Training with Decentralized Execution
  • 32. طراحی معماری CTDE
  • 33. مقایسه CTDE با Fully Centralized Learning
  • 34. مقایسه CTDE با Fully Decentralized Learning
  • 35. پیاده‌سازی Actor مستقل
  • 36. پیاده‌سازی Critic مرکزی
  • 37. اشتراک‌گذاری پارامترها میان Actorها
  • 38. Critic مشترک و Criticهای مجزا
  • 39. Critic مبتنی بر حالت و اقدامات همه عامل‌ها
  • 40. Centralized State-Action Value Function
  • 41. Centralized Value Function
  • 42. Policy Gradient در محیط چندعامله
  • 43. Multi-Agent Policy Gradient
  • 44. محاسبه گرادیان سیاست برای Actorهای مستقل
  • 45. اثر Critic مرکزی بر کاهش واریانس گرادیان
  • 46. Advantage Function در معماری چندعامله
  • 47. Generalized Advantage Estimation در MARL
  • 48. تنظیم نرخ یادگیری Actor و Critic
  • 49. بهینه‌سازی همزمان Actor و Critic
  • 50. پایداری آموزش در Centralized Critic
  • 51. Experience Replay در یادگیری چندعامله
  • 52. مشکل Correlated Samples در MARL
  • 53. ذخیره تجربه‌های مشترک عامل‌ها
  • 54. طراحی Batch برای آموزش Critic مرکزی
  • 55. نحوه مدیریت داده‌های قدیمی پس از تغییر سیاست‌ها
  • 56. On-Policy و Off-Policy در معماری Centralized Critic
  • 57. اکتشاف مستقل عامل‌ها
  • 58. هماهنگی رفتارهای اکتشافی میان عامل‌ها
  • 59. Exploration در محیط‌های همکاری‌محور
  • 60. تأثیر اکتشاف عامل‌ها بر یادگیری Critic
  • 61. ارتباط میان عامل‌ها و تأثیر آن بر Critic
  • 62. آموزش با مشاهده تاریخچه اقدامات عامل‌ها
  • 63. مدیریت عامل‌های ناهمگن
  • 64. مقیاس‌پذیری Centralized Critic با افزایش تعداد عامل‌ها
  • 65. مشکل ابعاد بالای ورودی Critic
  • 66. روش‌های کاهش پیچیدگی Critic مرکزی
  • 67. اشتراک پارامترها در سیستم‌های چندعامله بزرگ
  • 68. پیاده‌سازی شبکه‌های عصبی چندعامله
  • 69. معماری MLP برای Actor و Critic
  • 70. استفاده از RNN برای محیط‌های دارای حافظه
  • 71. مدیریت مشاهدات با طول متغیر
  • 72. Masking برای عامل‌های غیرفعال
  • 73. آموزش با محیط‌های همکاری‌محور
  • 74. آموزش با محیط‌های رقابتی
  • 75. آموزش در محیط‌های Mixed-Motive
  • 76. ارزیابی عملکرد عامل‌ها در سناریوهای چندعامله
  • 77. معیارهای سنجش همکاری و هماهنگی
  • 78. مقایسه پاداش فردی و پاداش تیمی
  • 79. تحلیل نرخ همگرایی الگوریتم
  • 80. تحلیل پایداری سیاست‌های یادگرفته‌شده
  • 81. آزمایش حساسیت نسبت به تعداد عامل‌ها
  • 82. آزمایش حساسیت نسبت به اندازه Critic
  • 83. آزمایش حساسیت نسبت به نوع تابع پاداش
  • 84. مقایسه Centralized Critic با Independent Actor-Critic
  • 85. مقایسه روش با الگوریتم‌های Multi-Agent Actor-Critic
  • 86. بررسی محدودیت‌های معماری Centralized Critic
  • 87. طراحی آزمایش کنترل‌شده برای MARL
  • 88. ساخت محیط چندعامله آزمایشی
  • 89. تعریف Observation و Action Space
  • 90. طراحی Reward برای یک مسئله همکاری
  • 91. پیاده‌سازی چرخه آموزش Actor و Critic
  • 92. ثبت و تحلیل معیارهای آموزشی
  • 93. رفع ناپایداری و شکست در فرایند آموزش
  • 94. ذخیره و بازیابی مدل‌های چندعامله
  • 95. اجرای سیاست‌های مستقل پس از آموزش
  • 96. اعتبارسنجی رفتار عامل‌ها در حالت اجرای مستقل
  • 97. مطالعه موردی همکاری چند ربات با Centralized Critic
  • 98. مطالعه موردی تخصیص منابع میان چند عامل
  • 99. مطالعه موردی رقابت چندعامل در یک محیط مشترک
  • 100. طراحی پروژه نهایی Centralized Critic / Independent Actor

📚 محتوای این محصول آموزشی (پکیج کامل)

💡 این محصول یک نسخهٔ کامل و جامع است

تمامی محتوای آموزشی این کتاب در قالب یک بسته‌ی کامل و یکپارچه ارائه می‌شود و شامل تمام نسخه‌ها و فایل‌های موردنیاز برای یادگیری است.

🎁 محتویات کامل بسته دانلودی

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل کتاب‌ها، تمرین‌ها و خودآزمایی .


ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود و نسخهٔ چاپی ندارد.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های کتاب همانجا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.