ترجمه فارسی مقاله آخرین تکرار همگرایی یادگیری مستقل مبتنی بر بازده در بازی‌های تصادفی با مجموع صفر

انتخاب پلن

انتخاب پلن برای ادامه خرید الزامی است.

پرداخت اقساطی
در صورت خرید اقساطی هر قسط: 37,500 تومان
۴ قسط ماهانه. بدون سود، چک و ضامن.
پرداخت اقساطی با دیجی‌پی پرداخت اقساطی با ترب‌پی
عنوان مقاله به انگلیسی Last-Iterate Convergence of Payoff-Based Independent Learning in Zero-Sum Stochastic Games
عنوان مقاله به فارسی آخرین تکرار همگرایی یادگیری مستقل مبتنی بر بازده در بازی‌های تصادفی با مجموع صفر
نویسندگان Zaiwei Chen, Kaiqing Zhang, Eric Mazumdar, Asuman Ozdaglar, Adam Wierman
فرمت مقاله انگلیسی PDF
تعداد صفحات 83
لینک دانلود رایگان مقاله انگلیسی دانلود مقاله
دسته بندی موضوعات Machine Learning,Computer Science and Game Theory,یادگیری ماشین , علوم کامپیوتر و نظریه بازی ,
توضیحات Submitted 4 September, 2024; v1 submitted 2 September, 2024; originally announced September 2024. , Comments: A preliminary version [arXiv:2303.03100] of this paper, with a subset of the results that are presented here, was presented at NeurIPS 2023
توضیحات به فارسی ارسال شده در 4 سپتامبر 2024 ؛V1 ارسال شده در 2 سپتامبر 2024 ؛در ابتدا در سپتامبر 2024 اعلام شد ، نظرات: نسخه اولیه [ARXIV: 2303.03100] از این مقاله ، با زیر مجموعه ای از نتایج ارائه شده در اینجا ، در Neurips 2023 ارائه شده است
اطلاعات بیشتر از این مقاله در پایگاه های علمی INSPIRE HEP
NASA ADS
Google Scholar
Semantic Scholar

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

چکیده

In this paper, we consider two-player zero-sum matrix and stochastic games and develop learning dynamics that are payoff-based, convergent, rational, and symmetric between the two players. Specifically, the learning dynamics for matrix games are based on the smoothed best-response dynamics, while the learning dynamics for stochastic games build upon those for matrix games, with additional incorporation of the minimax value iteration. To our knowledge, our theoretical results present the first finite-sample analysis of such learning dynamics with last-iterate guarantees. In the matrix game setting, the results imply a sample complexity of $O(ε^{-1})$ to find the Nash distribution and a sample complexity of $O(ε^{-8})$ to find a Nash equilibrium. In the stochastic game setting, the results also imply a sample complexity of $O(ε^{-8})$ to find a Nash equilibrium. To establish these results, the main challenge is to handle stochastic approximation algorithms with multiple sets of coupled and stochastic iterates that evolve on (possibly) different time scales. To overcome this challenge, we developed a coupled Lyapunov-based approach, which may be of independent interest to the broader community studying the convergence behavior of stochastic approximation algorithms.

چکیده به فارسی (ترجمه ماشینی)

در این مقاله ، ما ماتریس دو نفره صفر و بازی های تصادفی را در نظر می گیریم و پویایی یادگیری را توسعه می دهیم که مبتنی بر بازپرداخت ، همگرا ، منطقی و متقارن بین این دو بازیکن است.به طور خاص ، دینامیک یادگیری برای بازی های ماتریس مبتنی بر پویایی بهترین پاسخ است ، در حالی که دینامیک یادگیری برای بازی های تصادفی بر روی بازی های ماتریس ساخته شده است ، با ترکیب اضافی تکرار ارزش حداقل.به دانش ما ، نتایج نظری ما اولین تجزیه و تحلیل نمونه محدود از چنین پویایی یادگیری با ضمانت های سواد آخر را ارائه می دهد.در تنظیم بازی ماتریس ، نتایج حاکی از پیچیدگی نمونه $ O (ε^{-1}) $ برای یافتن توزیع NASH و پیچیدگی نمونه $ O (ε^{-8}) برای یافتن یک تعادل Nashبشردر تنظیم بازی تصادفی ، نتایج همچنین حاکی از پیچیدگی نمونه ای از $ O (ε^{-8}) $ برای یافتن تعادل NASH است.برای تعیین این نتایج ، چالش اصلی رسیدگی به الگوریتم های تقریبی تصادفی با مجموعه های متعدد تکرارهای همراه و تصادفی است که در مقیاس های زمانی مختلف (احتمالاً) تکامل می یابند.برای غلبه بر این چالش ، ما یک رویکرد مبتنی بر لیاپونوف را توسعه دادیم ، که ممکن است مورد توجه مستقل جامعه وسیع تری باشد که رفتار همگرایی الگوریتم های تقریبی تصادفی را مطالعه می کند.

📚 محتوای این محصول آموزشی (پکیج کامل)

علاوه بر مقاله اصلی انگلیسی که دریافت می کنید، برای یادگیری عمیق‌تر و تسلط کامل بر مباحث مجموعه‌ای از کتاب‌های آموزشی نیز ارائه می‌شود.

🎯 این بسته یک دورهٔ آموزشی کامل و چندلایه است؛ شامل ویدیوهای آموزشی، کتاب‌ها، تمرین‌ها و خودآزمایی.

ℹ️ نکات مهم هنگام خرید

  • این محصول به صورت فایل دانلودی کامل ارائه می‌شود.
  • توجه: لینک‌های اختصاصی دوره طی حداکثر 24 ساعت پس از ثبت سفارش ارسال می‌شوند.
  • دقت کنید لینک ها به شماره موبایل شما ارسال می شوند. پس در ارائه شماره موبایل صحیح دقت کنید.
  • برای راهنمایی در مورد نحوه دانلود به شماره 09395106248 پیامک دهید یا تماس بگیرید. (ایده آل ترین گزینه ارسال پیام در یکی از پیام رسان ها به همین شماره است تا سریعا لینک های محصول همان جا برای شما ارسال گردد.)
  • اگر پرداخت انجام شده ولی بعد از 24 ساعت هنوز لینک‌ها را دریافت نکرده‌اید، نام و نام خانوادگی و نام محصول را پیامک کنید تا لینک‌ها دوباره ارسال شوند.

💬 راه‌های ارتباطی پشتیبانی:
واتس‌اپ یا هر پیام رسان داخلی یا پیامک: 09395106248
تلگرام: @ma_limbs

نظرات

هنوز نظری ثبت نشده است.

وارد شوید تا نظر ثبت کنید.