ترجمه فارسی مقاله به سوی نرخ های سریع برای یادگیری تقویتی فدرال و چند وظیفه ای

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Towards Fast Rates for Federated and Multi-Task Reinforcement Learning
عنوان مقاله به فارسی به سوی نرخ های سریع برای یادگیری تقویتی فدرال و چند وظیفه ای
نویسندگان Feng Zhu, Robert W. Heath Jr., Aritra Mitra
فرمت مقاله انگلیسی PDF
تعداد صفحات 18
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Systems and Control,Optimization and Control,یادگیری ماشین , سیستم ها و کنترل , بهینه سازی و کنترل ,
توضیحات Submitted 8 September, 2024; originally announced September 2024. , Comments: Accepted to the Decision and Control Conference (CDC), 2024
توضیحات به فارسی ارسال شده در 8 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد. ، نظرات: در کنفرانس تصمیم و کنترل (CDC) ، 2024 پذیرفته شده است
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

We consider a setting involving $N$ agents, where each agent interacts with an environment modeled as a Markov Decision Process (MDP). The agents' MDPs differ in their reward functions, capturing heterogeneous objectives/tasks. The collective goal of the agents is to communicate intermittently via a central server to find a policy that maximizes the average of long-term cumulative rewards across environments. The limited existing work on this topic either only provide asymptotic rates, or generate biased policies, or fail to establish any benefits of collaboration. In response, we propose Fast-FedPG - a novel federated policy gradient algorithm with a carefully designed bias-correction mechanism. Under a gradient-domination condition, we prove that our algorithm guarantees (i) fast linear convergence with exact gradients, and (ii) sub-linear rates that enjoy a linear speedup w.r.t. the number of agents with noisy, truncated policy gradients. Notably, in each case, the convergence is to a globally optimal policy with no heterogeneity-induced bias. In the absence of gradient-domination, we establish convergence to a first-order stationary point at a rate that continues to benefit from collaboration.

چکیده به فارسی (ترجمه ماشینی)

ما مجموعه ای را در نظر می گیریم که شامل نمایندگان $ N $ است ، جایی که هر نماینده با محیطی که به عنوان یک فرآیند تصمیم گیری مارکوف (MDP) مدل شده است ، در تعامل است.MDP های عوامل در کارکردهای پاداش خود متفاوت هستند و اهداف/وظایف ناهمگن را ضبط می کنند.هدف جمعی نمایندگان ارتباط متناوب از طریق یک سرور مرکزی برای یافتن سیاستی است که به حداکثر رساندن میانگین پاداش های تجمعی طولانی مدت در محیط ها باشد.کار محدود موجود در مورد این موضوع یا فقط نرخ های بدون علامت را ارائه می دهد ، یا سیاست های مغرضانه ای ایجاد می کند ، یا در ایجاد مزایای همکاری ناکام است.در پاسخ ، ما Fast-FEDPG را پیشنهاد می کنیم-یک الگوریتم شیب سیاست فدراسیون جدید با مکانیسم تصحیح تعصب با دقت طراحی شده.تحت یک شرایط گرایش شیب ، ما ثابت می کنیم که الگوریتم ما (i) همگرایی خطی سریع با شیب های دقیق ، و (ب) نرخ زیر خطی را که از سرعت خطی W.R.T برخوردار هستند ، تضمین می کند.تعداد نمایندگان دارای شیب سیاست های پر سر و صدا و کوتاه.نکته قابل توجه ، در هر حالت ، همگرایی به یک سیاست بهینه در سطح جهانی و بدون تعصب ناشی از ناهمگونی است.در صورت عدم تحقیر شیب ، ما همگرایی را به یک نقطه ثابت مرتبه اول با نرخی تبدیل می کنیم که همچنان از همکاری سود می برد.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.